Yksikkö 6 / 11

Omics Data Analysis: RNA-seq, Expression, Statistics ja Pathway Enrichment

Voitot:

  • Kyky ymmärtää RNA-seq-työnkulkua, differentiaalista ilmentymisanalyysiä ja usean testauksen korjausta (FDR) ja saada tekoäly tuottamaan todennettavissa olevaa analyysikoodia
  • Kyky tulkita kriittisesti reitin rikastamisen tuloksia tilastollisesti ja biologisesti
  • Kyky tarkastaa tilastolliset olettamukset ja useat testauksen sudenkuopat ja todentaa itsenäisesti biologinen merkitys.

"Omics" on yhteisnimi lähestymistavoille, jotka mittaavat kaikkia solun tai kudoksen molekyylejä yhdessä: genomiikka (kaikki DNA), transkriptomiikka (kaikki RNA/ekspressio), proteomiikka (kaikki proteiinit), metabolomiikka (kaikki metaboliitit). Nämä tiedot ovat valtavat - RNA-seq-kokeessa mitataan kymmeniä tuhansia geenejä. Tässä osiossa opit käyttämään tekoälyä (AI) avustajana omiikka-analyysissä, joka kirjoittaa koodia, valitsee tilastoja ja luonnostelee biologisia tulkintoja. mutta opit, miksi sinun on tarkistettava tilastollinen ja biologinen tulos.

Kriittinen varoitus: Omicsissa vaarallisimmat virheet ovat tilastollisia ja näkymättömiä. Tekoäly voi kirjoittaa koodia, joka ohittaa usean vertailun korjauksen (alla), valitsee väärän testin tai tuottaa "vääriä positiivisia" geeniluetteloita. Lisäksi tekoäly voi esittää biologisia väitteitä, kuten "tämä geeni lisääntyy kyseisessä taudissa" ilman lähdettä. Oikea tapa: tehdä analyysi suoritettavalla, auditoitavalla koodilla ja vahvistaa jokainen biologinen väite kirjallisuudesta.

Peruskäsitteet

  • Ilmentyminen: Kuinka paljon geeni transloituu RNA:ksi; "toiminnan" mitta.
  • Differentiaalinen ilmentyminen (DE): Geenit, joiden ilmentyminen muuttuu merkittävästi kahden ryhmän välillä (esim. potilas/terve).
  • p-arvo: Todennäköisyys, että ero on sattuma; jos se on pieni, eroa pidetään "merkittävänä".
  • Moninkertainen vertailukorjaus: Kun kymmeniä tuhansia geenejä tarkastellaan samanaikaisesti, sattumalta löytyy joitain "merkittäviä". Tämän korjaamiseksi käytetään menetelmiä, kuten FDR (false discovery rate) / Benjamini-Hochberg. Jos tämä korjaus jätetään pois, syntyy satoja vääriä löydöksiä.
  • log2-kertainen muutos (log2FC): Kahden ryhmän välisen geenin ilmentymissuhteen logaritmi emäkseen 2; +1 tarkoittaa kaksinkertaista kasvua, −1 tarkoittaa kaksinkertaista laskua.
  • Reitin rikastaminen: Selvitetään, mihin biologisiin reitteihin (esim. solunjakautuminen, immuniteetti) muuttuneet geenit ovat keskittyneet; Tietokantoja, kuten GO ja KEGG, käytetään.
  • Erävaikutus: Ei-biologinen väärä ero, joka johtuu näytteiden käsittelystä eri päivinä/laitteina.

Askel askeleelta: AI-käyttöinen omics-analyysi

1. Selvitä kokeen suunnittelu ja kysymys. Kuinka monta näytettä, kuinka monta ryhmää, kuinka monta toistoa? Riittääkö tilastollinen teho? Selitä suunnittelu tekoälylle.

2. Valitse sopiva työkalu/menetelmä tekoälyllä. Valitse RNA-seq:lle vakiomenetelmät, kuten DESeq2/edgeR (tilastopaketit, jotka on suunniteltu laskentatiedoille); Käytä todistettuja menetelmiä mieluummin kuin tekoälyn "keksimää" tilastoa.

3. Suorita koodi ja tarkista välilähdöt. Älä jatka DE-analyysiä ilman normalisointia, erävaikutuksen valvontaa, laatukäyriä (PCA).

4. Käytä usean vertailun korjausta. Suodata tulokset korjatun arvon (padj/FDR), ei raaka-p-arvon mukaan.

5. Vahvista biologinen tulkinta kirjallisuudessa. Tulkitse polun rikastustuloste tekoälyllä, mutta tarkista jokainen väite lähteellä.

Vinkki: DE-analyysissä katso ensin laatu- ja kokonaisvaikutuskaavioita. Jos näytteet on ryhmitelty käsittelypäivän mukaan eikä biologisten ryhmien mukaan, useimmat löytämistäsi "merkittävistä" geeneistä ovat kumulatiivisia vaikutuksia, eivät todellista biologiaa.

kolme minilaukkua

Tapaus 1 – Korjaamaton p-arvo. Opiskelija testasi 20 000 geeniä tekoälyn kirjoittamalla koodilla ja löysi "540 merkittävää geeniä". Kun hän tutki koodia, hän huomasi, että tekoäly oli ohittanut useita vertailukorjauksia. Kun FDR-korjaus lisättiin, merkittävien geenien määrä laski 32:een. Ilman korjausta tarinaan perustuisi yli 500 väärää geeniä.

Tapaus 2 – Teostettu biologinen väite. DE-luettelossa olevan geenin osalta tutkija kysyi AI:lta "mitä tämä geeni tekee tässä taudissa?" hän kysyi; Tekoäly selitti vakuuttavan mekanismin ja artikkelin. Kun hän etsi PubMedistä, hän huomasi, ettei kyseistä mekanismia tai artikkelia ollut olemassa. Väite poistettiin raportista.

Tapaus 3 – Vahvistus saatu. Tohtori-opiskelija huomasi, että näytteet erosivat toisistaan ​​kaksi päivää PCA-kuvaajassa. Pyysi tekoälyä lisäämään erätehostemuuttujan koodiin; Korjauksen jälkeen geenilista muuttui täysin ja siitä tuli biologisesti merkittävä. Ilman laadunvalvontataulukkoa olisi voitu julkaista väärennetty tulos.

Esimerkki: suodatus korjatulla p-arvolla

tuo pandat pd#-muodossa anna taulukon 'de' olla DE-työkalun tuloksia (DESeq2/edgeR): # sarakkeita: gene, log2FC, pvalue, padj (FDR-korjattu)de = pd.read_csv("de_results.csv")significant = de[(de["padj")] &FC)[0"slog2)[0]. 1)]print("Raaka p<0.05:", (de["parvo"] < 0.05).summa())print("FDR-korjattu padj<0.05 & |log2FC|>=1:", len(merkittävä))

Raaka- ja korjatun luvun välinen ero osoittaa, miksi useat vertailut ovat kriittisiä.

Neljä kopioitavaa mallia

1) Analyysisuunnitelma ja menetelmän valinta:

Tehtäväsi: bioinformatiikan assistentti. Määritä analyysisuunnitelma seuraavaa RNA-seq-kokeilua varten: [ryhmien lukumäärä, näytteiden/replikaattien määrä, kysymys]. Mikä vakiotyökalu (DESeq2/edgeR) minun pitäisi valita ja miksi, mitä laadunvalvontavaiheita (PCA, erävaikutus) vaaditaan, miten käytän usean vertailun korjausta? Kirjoita askel askeleelta.

2) Koodi + pakolliset tarkistukset:

Kirjoita suoritettava koodi, joka suorittaa seuraavan DE-analyysin: [yksityiskohta]. Koodin TÄYTYY sisältää normalisointi, PCA-laatukaavio, erätehosteen ohjaus ja FDR (Benjamini-Hochberg) -korjaus. Kommentoi jokaista vaihetta. Suodata korjatulla p-arvolla, ei raaka-p-arvolla.

3) Reitin rikastuskommentti:

Auta tulkitsemaan tämän merkittävien geenien luettelon polun rikastustuloksia: [luettelo/tulostus]. Selitä, mitkä reitit ovat näkyviä, mutta kerro minulle, mistä lähteestä (GO, KEGG, vertaisarvioitu artikkeli) vahvistaaksesi kunkin biologisen väitteen. Mekanismi/tuote ASENNUS.

4) Tilastotarkastus:

Tarkista tilastovirheiden varalta seuraava analyysikoodi: [koodi]. Erityisesti: virheellinen testin valinta, usean vertailun korjauksen puuttuminen, erävaikutuksen huomioimatta jättäminen, riittämätön replikointi. Listaa jokainen löytämäsi ongelma ja sen korjaus.

Heikko kehote / Vahva kehote

Heikko: "Etsi merkittäviä geenejä tästä RNA-seq-tiedosta."

Ongelma: Menetelmää, laadunvalvontaa ja useita vertailuja ei ole määritetty; Tekoäly voi antaa luettelon täynnä vääriä positiivisia tuloksia ilman korjausta.

Vahva: "Kirjoita koodi, joka suorittaa DE-analyysin tälle RNA-seq-laskentatiedolle DESeq2-logiikalla, sisältää laadunvalvonnan ja bulkkitehosteen hallinnan PCA:lla ja suodattimia FDR-korjauksella; kommentoi jokaista vaihetta ja selitä, miksi valitsit tämän menetelmän."

Miksi se on tehokas: Menetelmä on vakio, laatu ja korjaus ovat pakollisia, tulos on auditoitavissa.

Riski

oire

varotoimenpide

väärä positiivinen

Liikaa "merkittäviä" geenejä

FDR / usean vertailun korjaus

kollektiivinen vaikutus

Näytteet on ryhmitelty päiväkohtaisesti

PCA + erämuuttuja

väärä testi

Normaali testi tietojen laskemiseksi

Sopiva menetelmä, kuten DESeq2/edgeR

keksitty biologia

Hitsattu mekanismi

Kirjallisuuden vahvistus

riittämätön teho

1-2 toistoa

Suunnittelussa riittää toistoa

Yleisiä virheitä

  • Ohitetaan usean vertailun korjaus. Yleisin ja haitallisin tilastovirhe.
  • Yhteisen vaikutuksen huomioimatta jättäminen. Se tuottaa väärän biologisen eron.
  • Väärän testin soveltaminen tietojen laskemiseen. RNA-seq vaatii erikoismenetelmiä.
  • Biologisten väitteiden hyväksyminen ilman lähdettä. Tekoäly voi muodostaa mekanismeja ja artikkeleita.
  • Yleistäminen riittämättömällä toistolla. Ilman tilastollista tehoa tulos on epäluotettava.
Varoitus: "Tilastollisesti merkittävä" ei ole sama asia kuin "biologisesti merkittävä". Hyvin pieni mutta teknisesti merkittävä kertamuutos voi olla biologisesti merkityksetön; Suurissa näytteissä kaikki voi osoittautua "merkittäväksi". Arvioi log2FC ja p-arvo yhdessä.

Syvyys: tausta ja kaksoislaskennan sudenkuopat reitin rikastamisessa

Reitin rikastamisen tulokset perustuvat kahteen piilotettuun olettamukseen, joita useimmat ihmiset eivät ymmärrä, ja tekoäly voi ohittaa ne äänettömästi. Ensimmäinen on taustan/universumin valinta: rikastaminen vertaa joukkoa "muuttuneita geenejä" joukkoon "mitä geenejä tarkasteltiin". Jos tausta on otettu koko genomista, mutta kokeilusi mittaa vain tiettyä kudospaneelia, tulokset näyttävät keinotekoisesti "rikastetuilta". Oikea tausta ovat geenejä, joita voidaan todella ilmaista/mittaa kokeessa. Eräs ryhmä havaitsi "erittäin merkittävän immuunireitin rikastamisen" taustalla vahingossa koko genomin; Kun analyysi toistettiin oikealla taustalla (mitatut geenit), rikastuminen katosi - löydös oli menetelmän artefaktti.

Toiseksi geenijoukon koko ja kaksoislaskenta: erittäin suuret ja yleiset reitit (esim. "aineenvaihduntaprosessit", tuhannet geenit) näyttävät "merkittäviltä" melkein jokaisessa luettelossa; pienet, tietyt reitit ovat informatiivisempia. Lisäksi, koska sama geeni löytyy useista reiteistä, on harhaanjohtavaa käsitellä päällekkäisiä reittejä itsenäisinä todisteina. Kolmas kohta: se ei osoita rikastumisen suuntaa; Reitti voi rikastua, mutta puolet sen sisällä olevista geeneistä voidaan lisätä ja toista puolta vähentää. Tämän näkemiseksi on tarpeen tarkastella erikseen suuntatietoja (kuten GSEA).

ansa

oire

varotoimenpide

väärä tausta

Kaikki näyttää rikastuneelta

Hanki mitattu geenitausta

Hyvin yleinen reitti

"Metabolia" tulee aina esiin

Keskity pieniin, erityisiin reitteihin

kaksinkertainen laskeminen

päällekkäisiä polkuja

Älä ota sitä itsenäisenä todisteena

ohittaa suunta

sekoitettu nouseva/laskeva

Suuntaohjaus GSEA:lla

Yhteenvetona

  • AI omics-analyysissä; on avustaja, joka valitsee menetelmiä, kirjoittaa koodia ja luonnostelee kommentteja; tilasto- ja biologiapäätökset on perusteltava.
  • On käytettävä vakiintuneita, todistettuja menetelmiä (DESeq2/edgeR); Laadunvalvontaa ja kollektiivista vaikutusten auditointia ei pidä jättää väliin.
  • Multiple vertailukorjaus (FDR) on pakollinen; tulokset suodatetaan korjatulla arvolla.
  • Jokainen biologinen väite on vahvistettava kirjallisuudessa; "merkittävä" tulisi erottaa "tärkeästä".

Sovellustehtävä

Ota näyte DE-tulostaulukosta (tai avoimesta RNA-seq-tietojoukosta). Vertaa merkittäviä geenimääriä raa'an p-arvon ja korjattujen padj-kynnysten perusteella yllä olevaan katkelmaan. Kommentoi eroa yhdellä lauseella. Pyydä sitten biologista tulkintaa mallin 3 avulla esitellylle geenille ja tarkista väite itse PubMedistä.

tarkistuslista

  • [ ] Arvioin kokeellisen suunnittelun ja tilastollisen tehon.
  • [ ] Valitsin tavallisen, kätevän menetelmän.
  • [ ] Tein PCA:n ja eräefektin laadunvalvonnan.
  • [ ] Käytin usean vertailun (FDR) korjausta.
  • [ ] Suodatin tulokset korjatulla p-arvolla.
  • [ ] Vahvistin kirjallisuuden biologiset väitteet.