Vienetas 3 / 10

„Omics“ duomenų analizė: transkriptomika, proteomika ir daugiafunkcinis integravimas

Pelnas:

  • Daugkartinė testavimo korekcija (pataisyta p reikšmė) diferencinės išraiškos analizėje ir galimybė teisingai interpretuoti kartos pokyčius ir išvengti klaidingų teigiamų rezultatų
  • Paketinio efekto aptikimas ir pridėjimas prie modelio naudojant PCA ir techninio triukšmo atskyrimas nuo biologinio skirtumo
  • Gebėjimas susieti kiekvieną kelio tapatybę su šaltiniu ir valdyti jį biologiniu nuoseklumu praturtinant kelią ir integruojant daugiafunkcinius elementus

Ląstelė nėra vienas skaičius; Tai sistema, kurioje vienu metu šoka tūkstančiai genų, baltymų ir metabolitų. Omics (bendrinis metodų, matuojančių visą biologinį sluoksnį, pavadinimas) bando užfiksuoti visą šį šokį: genomika (DNR), transkriptomika (RNR – kurie genai veikia ir kiek), proteomika (baltymai), metabolomika (mažos molekulės). Kiekvienas omikos sluoksnis sukuria tūkstančius matmenų, triukšmingų ir brangių duomenų. Dirbtinis intelektas yra galingas nuskaitydamas šiuos didelio masto duomenis ir žymėdamas šablonus; Bet jūs esate tas, kuris nusprendžia, kuris modelis yra biologinė tiesa, o kuris - techninis triukšmas.

Šiame skyriuje mes tęsime transkriptomiką, dažniausiai naudojamą omikos analizę; Principai galioja ir kitiems sluoksniams. Tipiška darbo eiga: ekspresijos matrica iš neapdorotų duomenų (eilutės – genai, stulpeliai – mėginiai, ląstelės – ekspresijos lygiai), normalizavimas (techninių skirtumų pašalinimas), diferencinės ekspresijos analizė (genų, kurie reikšmingai kinta tarp dviejų sąlygų), kelio praturtinimas (rasti, kuriuose biologiniuose keliuose susitelkę pakeisti genai) ir interpretacija.

Diferencinė išraiška: lenkimo pokytis ir pataisyta p reikšmė

Norint nustatyti, ar genas „pasikeitė“, apžvelgiami du skaičiai: kartojimo pokytis – kiek kartų ekspresija padidėja/sumažėja, paprastai log2 skalėje – ir pakoreguota p reikšmė (padj – statistika, kuri kontroliuoja klaidingus teigiamus rezultatus, kai atliekami keli tyrimai). Kodėl taisyti? Nes vienu metu tikrinate 20 000 genų; Netgi atsitiktinai šimtai genų gali pasirodyti „reikšmingi“. Neatlikus kelių bandymų pataisų – apribojant klaidingų atradimų dažnį tokiais metodais kaip Benjamini-Hochberg – sąrašas yra klaidinantis. AI gali parašyti scenarijų, kuris apskaičiuoja šią statistiką, bet jei jis nepataisys, jūsų rezultatas yra moksliškai nepateisinamas.

Atsargiai: AI gali pasakyti „500 genų labai pasikeitė“, remdamasis neapdorota p verte. Žvelgiant į pataisytą p reikšmę, skaičius gali sumažėti iki 30. Visada patikrinkite kelių testų pataisą patys; Tai yra skirtumas tarp leidinio priėmimo ir atmetimo.

Partijos efektas: patys klastingiausi spąstai

Paketinis efektas (techninis skirtumas, atsirandantis dėl skirtingų dienų, įrenginių ar žmonių mėginių apdorojimo) yra didžiausias omikos analizės klaidų šaltinis. Jei jūsų dvi sąlygos buvo apdorotos dviem skirtingomis dienomis, matomas „biologinis skirtumas“ iš tikrųjų gali būti dienos skirtumas. AI gali pasiūlyti prie modelio pridėti partijos kintamąjį (pvz., ~ partija + sąlyga), tačiau jūs esate atsakingi už tai, kad jis būtų tinkamai nustatytas ir nepamaišytų eksperimentiniame projekte.

Patarimas: Prieš pradėdami analizę, nubraižykite PCA (pagrindinių komponentų analizė – metodas, apibendrinantis ir vizualizuojantis kelių ašių didelio masto duomenis) diagramą. Jei mėginiai suskirstyti pagal partiją, o ne pagal biologinę būklę, partijos poveikis yra dominuojantis ir pirmiausia jį reikia pataisyti.

Multi-omics integracija

Tikras supratimas dažnai ateina sujungus sluoksnius: jei genas dirba sunkiau, bet jo baltymai nedidėja, reguliavimas vyksta transliacijos lygmeniu. Daugiafunkcinis integravimas – skirtingų omikos sluoksnių sujungimas į vieną modelį – AI sustiprėja, bet ir labiausiai klaidina; nes skiriasi sluoksnių masteliai, triukšmas ir mėginių atitikmenys. AI siūlo integravimo darbo eigą, bet jūs kontroliuojate biologinį rezultatų nuoseklumą.

trys mini dėklai

1 atvejis – sodrinimas pagreitintas. Vėžio projekto metu buvo rasta 1240 skirtingų genų. AI paruošė jas kelio praturtinimui, išryškindamas ląstelių ciklo ir DNR atkūrimo kelius; Komanda sukūrė hipotezės žemėlapį per 2 valandas. Tačiau jie iš naujo išbandė kiekvieną kelią naudodami nepriklausomą įrankį (g:Profiler) ir nustatė, kad vienas kelias buvo klaidingai suplanuotas AI.

2 atvejis – partijos gaudyklė. Viena laboratorija nustatė „stulbinantį“ 900 genų skirtumą tarp dviejų gydymo grupių. Kai jie atliko PCA, jie pamatė, kad mėginiai buvo atskirti sekvenuojant partiją. Po partijos korekcijos tikrasis skirtumas sumažėjo iki 60 genų. Pirmojoje analizėje AI netyčia praleido partijos kintamąjį.

3 atvejis – Sugalvotas kelio pavadinimas. Studentas davė genų sąrašą AI ir paklausė: „Koks KEGG kelias? AI pateikė kelio ID ir pavadinimą, tarsi jis būtų tikras. Kai studentas ieškojo KEGG, jis pamatė, kad to ID neegzistuoja; patikrinimas neleido gauti išgalvoto rezultato.

Keturi kopijuojami šablonai

1) DESeq2 darbo eigos metmenys:

Jūsų vaidmuo: skaičiavimo biologas. Parašykite žingsnis po žingsnio scenarijų RNR-seq diferencinės išraiškos analizei su R/DESeq2: skaičiavimo matricos skaitymas, projektavimo formulė (~ partija + sąlyga), normalizavimas, rezultatų lentelė. AIŠKIAI taikykite kelių bandymų pataisą (BH) ir naudokite padjcolum. Komentarų eilutėje paaiškinkite, ką daro kiekvienas veiksmas.

2) Kokybės / partijos kontrolė:

Duokite man RNA-seq QC kontrolinį sąrašą: partijos kontrolė naudojant PCA, bibliotekos dydis, genų aptikimų skaičius, pašalinių parametrų aptikimas. Kiekvienai metrikai nurodykite slenkstį „tai, ką matau, man kelia nerimą“. Paaiškinkite, ką turėčiau daryti, jei partijos ir biologinės būklės yra sumaišytos.

3) Sodrinimo rezultatų patikrinimas:

Pateiksiu jums praturtintą kelių sąrašą (takų skaičius, padj, genai). Užrašykite kiekvieno kelio tapatybę (KEGG/GO ID) pažodžiui ir nesugalvokite. Filtruoti rezultatus, kai padj < 0,05. Nurodykite, kurie keliai biologiškai palaiko vienas kitą, bet pažymėkite kiekvieną tapatybę kaip „būtina patikrinti duomenų bazėje“.

4) Multi-omics nuoseklumo patikrinimas:

Transkriptominė ir proteominė duoda prieštaringas genų / baltymų poros ekspresijos kryptis. Išvardykite galimas biologines (redagavimas po vertimo) ir technines (matavimo triukšmas, pavyzdžių atitikimas) priežastis ir nurodykite, kaip kiekvieną iš jų patikrinti.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Įvardykite svarbius kelius šiame genų sąraše.

Jokių šaltinių, jokios statistikos, didelė išgalvotų kelių rizika.

Galingas raginimas:

Jūsų vaidmuo: skaičiavimo biologas. Prisegtoje diferencialo genų lentelėje (genas, log2FC, padj) paimkite tik genus, kurių padj < 0,05. Pasakykite man GO sodrinimo analizės veiksmus, kuriuos reikia atlikti naudojant šiuos genus ir įrankį (g:Profiler), kurį naudosiu. Kelio pavadinimas yra FAKE; Aš paleisiu įrankį ir atliksiu analizę, jūs tiesiog apibūdinsite teisingą metodiką ir daugkartinio testavimo korekciją.

Skirtumas: aiškus filtras, metodikos dėmesys, gamybos draudimas ir patikros palikimas vartotojui.

Omics analizės žingsniai

žingsnis

Tikslas

dažna klaida

AI vaidmuo

normalizavimas

Pašalinkite techninius skirtumus

Neteisingas metodo pasirinkimas

Scenarijus + pagrindimas

PCA/QC

Paketų ir pašalinių rodiklių aptikimas

praleisk mano žingsnį

Vaizdas + komentaras

diferencinė išraiška

Kintančių genų radimas

Netaisytas p

Scenarijaus juodraštis

praturtinimas

rasti kelią

pagamintas kelias

metodika

integracija

sujungti sluoksnius

Mastelio / atitikties klaida

Darbo eigos rekomendacija

Vienos ląstelės omika: nauja skalė

Pastaraisiais metais vienos ląstelės sekos nustatymas – atskirai matuojant kiekvienos iš tūkstančių ląstelių ekspresijos profilį – omiką perkėlė į naują dimensiją. Dabar vietoj „vidutinės audinio išraiškos“ galime matyti kiekvieną ląstelių tipą tame audinyje atskirai. Ši galia įveda naujų spąstų: duomenų yra labai nedaug (daugumoje genų daugumoje ląstelių nuskaitoma nulis – iškrenta), dydis yra dešimtys tūkstančių ląstelių × dvidešimt tūkstančių genų, o ląstelių tipai dažniausiai atskiriami klasterizuojant. Dirbtinis intelektas yra galingas kuriant grupavimo ir ląstelių tipų žymėjimo kontūrus pagal vienos ląstelės duomenis; bet jūs patikrinate žinomais žymenų genais, ar kiekvienas klasteris yra tikro tipo ląstelės, ar techninis artefaktas (pvz., negyvos ląstelės, dvi ląstelės, sugautos kartu). Nepriimkite AI siūlomos ląstelės tipo etiketės, nepatvirtinus šios klasterio žymenų genų tikrojoje literatūroje.

Patarimas: jei atlikdami vienos ląstelės analizę AI pasiūlo klasteriui „T ląstelių“ etiketę, patys patikrinkite, ar T ląstelių žymenys (pvz., CD3) iš tiesų yra labai išreikšti tame klasteryje. Jei etiketė nepalaikoma žetonu, tai yra hipotezė, o ne išvada.

Dažnos klaidos

  • Praleidžiamas kelių bandymų taisymas. Sąrašas išsipučia nuo neapdorotos p vertės; reikia naudoti padj.
  • Paketinio efekto klaidinimas su biologija. Pirmiausia jį reikia patikrinti naudojant PCA.
  • Vienintelis kriterijus yra grindų keitimas. Didelis kartos pokytis gali būti klaidinantis žemos ekspresijos, triukšminguose genuose.
  • Sukurto kelio / GO tapatybės priėmimas. Kiekviena tapatybė turi būti patikrinta duomenų bazėje.
  • Nepakankamas imties dydžio įvertinimas. Statistinė galia yra maža naudojant 2 x 2 dizainą; Rezultatai turėtų būti interpretuojami atsargiai.

Apibendrinant

„Omics“ analizė veikia su didelių matmenų, triukšmingais duomenimis, o AI pagreitina šiuos duomenis juos nuskaitydamas, rašydamas scenarijus ir žymėdamas šablonus. Tačiau daugkartinė diferencinės išraiškos bandymų korekcija, partijos kontrolė naudojant PCA ir šaltinio patikrinimas sodrinant yra būtini. Daugiafunkcinė integracija yra galinga, bet klaidinanti; Patikrinkite kiekvieną rezultatą su biologiniu nuoseklumu, atsižvelgdami į sluoksnių mastelio ir triukšmo skirtumus.

Taikymo užduotis

Raskite viešai prieinamą RNR sekų skaičiavimo matricą (pvz., iš GEO). Paprašykite dirbtinio intelekto parašyti analizės scenarijų su „DESeq2 darbo eigos“ šablonu ir patikrinti kodą, ar iš tikrųjų buvo pritaikyta kelių bandymų pataisa. Tada paprašykite AI pateikti praturtinimo komentarą ir po vieną patikrinkite visus kelio ID, kuriuos jis pateikia pagal KEGG arba GO duomenų bazę; Atkreipkite dėmesį, kiek jų yra tikrų.

kontrolinis sąrašas

  • [ ] Diferencialinėje analizėje naudojau padj (pataisytą), o ne neapdorotą p reikšmę.
  • [ ] Patikrinau partijos efektą su PCA ir prireikus pridėjau prie modelio.
  • [ ] Atsargiai interpretavau genus, turinčius didelį kartotinį pokytį, bet mažą ekspresiją.
  • [ ] Patikrinau kiekvieną kelią / GO ID pagal tikrąją duomenų bazę.
  • [ ] Įvertinau imties dydžio statistinę galią.
  • [ ] Multiomikos prieštaravimus suskirstiau į biologines ir technines priežastis.