Enota 3 / 10

Analiza podatkov Omics: Transkriptomika, Proteomika in integracija Multi-Omics

Dobički:

  • Popravek večkratnega testiranja (popravljena p-vrednost) pri analizi diferencialne ekspresije in sposobnost pravilne interpretacije spremembe gube in izogibanja lažno pozitivnim rezultatom
  • Zaznavanje šaržnega učinka in njegovo dodajanje modelu s PCA ter ločevanje tehničnega šuma od biološke razlike
  • Sposobnost povezovanja vsake identitete poti z virom in nadzora nad njo z biološko doslednostjo pri obogatitvi poti in integraciji multiomike

Celica ni eno samo število; Gre za sistem, kjer na tisoče genov, proteinov in metabolitov pleše hkrati. Omika (skupno ime za pristope, ki merijo biološko plast kot celoto) poskuša zajeti ta celoten ples: genomika (DNK), transkriptomika (RNA – kateri geni delujejo in koliko), proteomika (proteini), metabolomika (majhne molekule). Vsaka omična plast proizvede na tisoče dimenzionalnih, šumnih in dragih podatkov. AI je močan pri skeniranju teh visokodimenzionalnih podatkov in označevanju vzorcev; Toda vi ste tisti, ki odločate, kateri vzorec je biološka resnica in kateri tehnični šum.

V tej enoti bomo nadaljevali skozi transkriptomiko, najpogostejšo analizo omike; Načela veljajo tudi za druge plasti. Tipičen potek dela: ekspresijska matrika iz neobdelanih podatkov (vrstice so geni, stolpci so vzorci, celice so nivoji ekspresije), normalizacija (odstranitev tehničnih razlik), analiza diferencialne ekspresije (iskanje genov, ki se bistveno spreminjajo med dvema pogojema), obogatitev poti (iskanje bioloških poti, v katerih so spremenjeni geni združeni) in interpretacija.

Diferencialni izraz: pregibna sprememba in popravljena p-vrednost

Da bi ugotovili, ali se je gen "spremenil", se upoštevata dve številki: sprememba krat - kolikokrat se izražanje poveča/zmanjša, običajno na lestvici log2 - in prilagojena p-vrednost (padj - statistika, ki nadzoruje lažno pozitivne rezultate pri večkratnem testiranju). Zakaj popraviti? Ker testirate 20.000 genov hkrati; Tudi po naključju se lahko na stotine genov izkaže za "pomembnih". Brez večkratnega popravka testiranja – omejevanja stopnje lažnih odkritij z metodami, kot je Benjamini-Hochberg – je seznam zavajajoč. AI lahko napiše skript, ki izračuna to statistiko, a če izpusti popravek, je vaš rezultat znanstveno neupravičljiv.

Pozor: umetna inteligenca bi lahko na podlagi surove p-vrednosti rekla "500 genov se je bistveno spremenilo". Če pogledamo popravljeno p-vrednost, bi lahko število padlo na 30. Vedno sami preverite popravek z več testi; To je razlika med sprejemom in zavrnitvijo objave.

Učinek serije: najbolj zahrbtna past

Učinek serije (tehnična razlika, ki izhaja iz obdelave vzorcev z različnimi dnevi, napravami ali ljudmi) je največji vir napak pri analizi omics. Če sta bili vaši dve bolezni obdelani na dva različna dneva, je lahko "biološka razlika", ki jo vidite, dejansko razlika v dnevu. Umetna inteligenca lahko predlaga dodajanje paketne spremenljivke modelu (npr. ~ serija + pogoj), vendar je vaša odgovornost, da jo pravilno nastavite in je ne mešate v eksperimentalni načrt.

Nasvet: Pred začetkom analize narišite PCA (analiza glavnih komponent – ​​metoda, ki povzema in vizualizira visokodimenzionalne podatke na več oseh). Če so vzorci razvrščeni po serijah in ne po bioloških pogojih, prevladuje učinek serije in ga je treba najprej popraviti.

Multi-omics integracija

Pravo razumevanje pogosto pride s sestavljanjem plasti skupaj: če gen deluje težje, vendar se njegova beljakovina ne povečuje, je regulacija na translacijski ravni. Integracija več omike – združevanje različnih plasti omike v en sam model – je tisto, kjer AI postane močnejši, a tudi tam, kjer najbolj zavaja; ker so lestvice, hrup in vzorčna ujemanja plasti različni. AI predlaga potek dela integracije, vendar vi nadzirate biološko doslednost rezultatov.

trije mini kovčki

Primer 1 – Pospešena obogatitev. V projektu raka so našli 1240 diferencialnih genov. Umetna inteligenca jih je pripravila za obogatitev poti, poudarjanje celičnega cikla in poti popravljanja DNK; Ekipa je v 2 urah ustvarila zemljevid hipotez. Toda ponovno so preizkusili vsako pot z neodvisnim orodjem (g:Profiler) in ugotovili, da je umetna inteligenca eno pot napačno preslikala.

Primer 2 – Paketna past. En laboratorij je odkril "osupljivo" 900-gensko razliko med dvema zdravljenima skupinama. Ko so izvedli PCA, so videli, da so bili vzorci ločeni s serijo sekvenciranja. Po korekciji serije se je dejanska razlika zmanjšala na 60 genov. AI je v prvi analizi nenamerno izpustil šaržno spremenljivko.

Primer 3 – Izmišljeno ime poti. Študent je dal seznam genov AI in vprašal: "Katera pot KEGG?" AI je zagotovil ID poti in ime, kot da bi bilo resnično. Ko je študent iskal KEGG, je videl, da ta ID ne obstaja; preverjanje je preprečilo izmišljen rezultat.

Štiri predloge za kopiranje

1) Oris poteka dela DESeq2:

Vaša vloga: računalniški biolog. Napišite skript po korakih za analizo diferencialne ekspresije RNA-seq z R/DESeq2: branje matrike štetja, formula za načrtovanje (~ serija + stanje), normalizacija, tabela rezultatov. IZRECNO uporabite popravek večkratnega testiranja (BH) in uporabite padjcolumn. V vrstici za komentar razložite, kaj počne vsak korak.

2) Kontrola kakovosti/serije:

Daj mi kontrolni seznam za RNA-seq QC: nadzor serije s PCA, velikost knjižnice, število zaznav genov, zaznavanje odstopanj. Za vsako meritev določite prag »kar vidim, me skrbi«. Pojasnite, kaj naj storim, če sta serija in biološko stanje mešana.

3) Preverjanje rezultatov obogatitve:

Dal vam bom obogaten seznam poti (število poti, padj, geni). Zapišite identiteto vsake poti (KEGG/GO ID) dobesedno in si je ne izmišljujte. Filtriraj rezultate s padj < 0,05. Določite, katere poti biološko podpirajo druga drugo, vendar vsako identiteto označite kot "mora biti preverjena v bazi podatkov."

4) Preverjanje skladnosti Multi-omics:

Transkriptomski in proteomski dajeta nasprotujoče si smeri izražanja za par gen/protein. Navedite možne biološke (urejanje po prevodu) in tehnične (šum pri meritvah, ujemanje vzorcev) razloge za to in mi povejte, kako preizkusiti vsakega.

Šibek poziv/močan poziv

Šibek poziv:

Poimenujte pomembne poti na tem seznamu genov.

Brez virov, brez statistike, visoko tveganje izmišljenih poti.

Močan poziv:

Vaša vloga: računalniški biolog. V priloženo razpredelnico genov (gen, log2FC, padj) vzemite le gene s padj < 0,05. Povejte mi korake obogatitvene analize GO, ki jo je treba izvesti s temi geni, in orodje (g:Profiler), ki ga bom uporabil. Ime poti je FAKE; Jaz bom zagnal orodje in naredil analizo, vi samo opišite pravilno metodologijo in popravek večkratnega testiranja.

Razlika: čisti filter, osredotočenost na metodologijo, prepoved izdelave in prepuščanje preverjanja uporabniku.

Koraki analize Omics

korak

Namen

pogosta napaka

vloga AI

normalizacija

Odpravite tehnične razlike

Napačna izbira metode

Scenarij + utemeljitev

PCA/QC

Odkrivanje serij in odstopanj

preskoči moj korak

Slika + komentar

diferencialni izraz

Iskanje spreminjajočih se genov

Nepopravljen str

Osnutek scenarija

obogatitev

najti pot

izdelana pot

metodologija

integracija

združiti plasti

Napaka lestvice/ujemanja

Priporočilo za potek dela

Enocelična omika: nova lestvica

V zadnjih letih je sekvenciranje ene celice - merjenje ekspresijskega profila vsake od tisočih celic posebej - popeljalo omike v novo dimenzijo. Zdaj lahko namesto "povprečnega izražanja tkiva" vidimo vsako vrsto celice v tem tkivu posebej. Ta moč uvaja nove pasti: podatki so izjemno redki (večina genov ima nič branja v večini celic – osip), velikost je na desettisoče celic × dvajset tisoč genov, ločevanje tipov celic pa se večinoma izvaja z združevanjem v gruče. Umetna inteligenca je zmogljiva pri izdelavi gručenja in orisov označevanja tipov celic na podatkih posamezne celice; vendar z znanimi označevalnimi geni preverite, ali je vsak grozd resnična vrsta celice ali tehnični artefakt (npr. mrtve celice, dve ujeti celici). Ne sprejmite oznake tipa celice, ki jo predlaga AI, ne da bi potrdili markerske gene te skupine v dejanski literaturi.

Namig: če AI pri analizi ene celice grozdu predlaga oznako »celica T«, sami preverite, ali so označevalci celic T (npr. CD3) res močno izraženi v tem grozdu. Če oznaka ni podprta z žetonom, je to hipoteza, ne sklep.

Pogoste napake

  • Preskok popravka večkratnega testiranja. Seznam nabrekne s surovo p-vrednostjo; padj je treba uporabiti.
  • Zamenjajte serijski učinek za biologijo. Najprej ga je treba preveriti s PCA.
  • Sprememba tal naj bo edino merilo. Visoka sprememba gub je lahko zavajajoča pri nizko izraženih, hrupnih genih.
  • Sprejemanje izmišljene poti/GO identitete. Vsaka identiteta mora biti preverjena v bazi podatkov.
  • Podcenjevanje velikosti vzorca. Statistična moč je nizka pri zasnovi 2 krat 2; Rezultate je treba razlagati previdno.

Če povzamem

Analiza Omics deluje z visokodimenzionalnimi podatki s hrupom, AI pa te podatke pospeši tako, da jih skenira, piše skripte in označuje vzorce. Nepogrešljivi pa so večkratni testni popravki v diferencialnem izražanju, nadzor serije s PCA in verifikacija vira pri obogatitvi. Multi-omics integracija je močna, vendar zavajajoča; Vsak rezultat preverite z biološko konsistenco, pri čemer upoštevajte razlike v lestvici in hrupu plasti.

Aplikacijska naloga

Poiščite javno dostopno matriko za štetje RNA-seq (npr. iz GEO). Naj AI napiše skript za analizo s predlogo »potek dela DESeq2« in v kodi preveri, ali je bil popravek večkratnega testiranja dejansko uporabljen. Nato prosite AI za komentar obogatitve in preverite vse ID-je poti, ki jih enega za drugim vrne, glede na bazo podatkov KEGG ali GO; Upoštevajte, koliko jih je resničnih.

kontrolni seznam

  • [ ] V diferencialni analizi sem uporabil padj (popravljeno) in ne neobdelane p-vrednosti.
  • [ ] Preveril sem paketni učinek s PCA in ga po potrebi dodal v model.
  • [ ] Previdno sem interpretiral gene z visoko kratno spremembo, vendar z nizko izraženostjo.
  • [ ] Vsako pot/GO ID sem preveril glede na pravo bazo podatkov.
  • [ ] Ocenil sem statistično moč velikosti vzorca.
  • [ ] Protislovja multiomike sem razdelil na biološke in tehnične vzroke.