Üksus 6 / 11

Omicsi andmete analüüs: RNA-seq, ekspressioon, statistika ja raja rikastamine

Kasu:

  • Võimalus mõista RNA-seq töövoogu, diferentsiaalekspressiooni analüüsi ja mitmekordse testimise korrigeerimist (FDR) ning lasta tehisintellektil toota kontrollitavat analüüsikoodi
  • Võimalus kriitiliselt tõlgendada raja rikastamise tulemusi statistiliselt ja bioloogiliselt
  • Oskus teostada distsipliini, et kontrollida statistilisi eeldusi ja mitut testimise lõkse ning iseseisvalt kontrollida bioloogilist olulisust.

"Omics" on koondnimetus lähenemisviisidele, mis mõõdavad kõiki raku või koe molekule koos: genoomika (kõik DNA), transkriptoomika (kõik RNA/ekspressioon), proteoomika (kõik valgud), metaboloomika (kõik metaboliidid). Need andmed on tohutud - RNA-seq eksperiment hõlmab kümnete tuhandete geenide mõõtmist. Selles õppetükis saate teada, kuidas kasutada tehisintellekti (AI) oomika analüüsi abilisena, mis kirjutab koodi, valib statistikat ja koostab bioloogilise tõlgenduse; kuid saate teada, miks peate statistilist ja bioloogilist tulemust kontrollima.

Kriitiline hoiatus: Omicsis on kõige ohtlikumad vead statistilised ja nähtamatud. Tehisintellekt võib kirjutada koodi, mis läheb mööda mitmekordsest võrdlusparandusest (allpool), valib vale testi või toodab "valepositiivsete" geenide loendeid. Lisaks võib tehisintellekt ilma allikata esitada bioloogilisi väiteid, nagu "see geen suureneb selle haiguse korral". Õige viis: teha analüüs käivitatava, auditeeritava koodiga ja kinnitada iga kirjanduses leiduv bioloogiline väide.

Põhimõisted

  • Ekspressioon: kui palju geeni transleeritakse RNA-ks; "aktiivsuse" mõõt.
  • Diferentsiaalne ekspressioon (DE): geenid, mille ekspressioon muutub oluliselt kahe rühma vahel (nt patsient/terve).
  • p-väärtus: tõenäosus, et erinevus on kokkusattumus; kui see on väike, peetakse erinevust "oluliseks".
  • Mitmekordne võrdluskorrektsioon: kui vaadata korraga kümneid tuhandeid geene, on juhuslikult mõned, mis on "olulised". Selle parandamiseks kasutatakse selliseid meetodeid nagu FDR (valetuvastuskiirus) / Benjamini-Hochberg. Kui see parandus ära jätta, tekib sadu valeleidu.
  • log2 kordne muutus (log2FC): geeni ekspressioonisuhte logaritm kahe rühma ja aluse 2 vahel; +1 tähendab kahekordset suurenemist, −1 tähendab kahekordset vähenemist.
  • Raja rikastamine: leidmine, millistele bioloogilistele radadele (nt rakkude jagunemine, immuunsus) muutunud geenid on koondunud; Kasutatakse selliseid andmebaase nagu GO ja KEGG.
  • Partiiefekt: mittebioloogiline eksitav erinevus, mis tuleneb proovide töötlemisest erinevatel päevadel/seadmetel.

Samm-sammult: AI-toega omika analüüs

1. Selgitage katse ülesehitus ja küsimus. Mitu näidist, mitu rühma, kui palju kordusi? Kas statistiline võimsus on piisav? Selgitage AI-le disaini.

2. Valige tehisintellektiga sobiv tööriist/meetod. RNA-seq jaoks valige standardmeetodid, nagu DESeq2/edgeR (statistikapaketid, mis on loodud loendusandmete jaoks); Kasutage tõestatud meetodeid, mitte statistikat, mille AI koostas.

3. Käivitage kood ja kontrollige vaheväljundeid. Ärge jätkake DE-analüüsi ilma normaliseerimiseta, partiiefekti kontrolli, kvaliteedidiagrammide (PCA)ta.

4. Jõustage mitme võrdluse parandus. Filtreerige tulemused parandatud väärtuse (padj/FDR), mitte töötlemata p-väärtuse järgi.

5. Kinnitage kirjanduses esitatud bioloogiline tõlgendus. Tõlgendage raja rikastamise väljundit tehisintellektiga, kuid kontrollige iga väidet allika juures.

Näpunäide: DE analüüsis vaadake esmalt kvaliteedi ja mõju koondgraafikuid. Kui proovid on rühmitatud nende töötlemise päeva, mitte bioloogilise rühma järgi, on enamik leitud "olulisi" geene kumulatiivsed, mitte tegelik bioloogia.

kolm minikarpi

Juhtum 1 – korrigeerimata p-väärtus. Üliõpilane testis AI kirjutatud koodiga 20 000 geeni ja leidis "540 olulist geeni". Kui ta koodi uuris, nägi ta, et AI oli mitme võrdlusparanduse vahele jätnud. FDR-i korrektsiooni lisamisel vähenes oluliste geenide arv 32-ni. Ilma paranduseta põhineks lool üle 500 valegeeni.

Juhtum 2 – väljamõeldud bioloogiline väide. DE nimekirjas oleva geeni kohta küsis teadlane AI-lt "mida see geen selle haigusega teeb?" ta küsis; AI selgitas veenvat mehhanismi ja artiklit. Kui ta PubMedist otsis, nägi ta, et seda mehhanismi ega artiklit pole olemas. Nõue eemaldati aruandest.

Juhtum 3 – kinnitus saadud. Doktorant märkas, et PCA proovitükil eraldati proovid kahe päeva võrra. Palus AI-l lisada koodile partiiefekti muutuja; Pärast korrigeerimist muudeti geeninimekirja täielikult ja muutus bioloogiliselt oluliseks. Ilma kvaliteedikontrollitabelita oleks võinud avaldada võltsitud tulemuse.

Näide: filtreerimine parandatud p-väärtusega

importida pandad pd#-na, olgu tabel 'de' DE-tööriista (DESeq2/edgeR) tulemused: # veerud: gene, log2FC, pvalue, padj (FDR-korrigeeritud)de = pd.read_csv("de_results.csv")significant = de[(de["padj")] & FC)[0"slog2) < 0. 1)]print("Toores p<0,05:", (de["pvalue"] < 0,05).summa())print("FDR-iga korrigeeritud padj<0,05 & |log2FC|>=1:", len(märkimisväärne))

Toor- ja parandatud arvu erinevus näitab, miks mitu võrdlust on kriitilise tähtsusega.

Neli kopeeritavat malli

1) Analüüsikava ja meetodi valik:

Sinu roll: bioinformaatika assistent. Koostage analüüsiplaan järgmise RNA-seq katse jaoks: [rühmade arv, proovide/korduste arv, küsimus]. Millise standardtööriista (DESeq2/edgeR) peaksin valima ja miks, milliseid kvaliteedikontrolli samme (PCA, partiiefekt) on vaja, kuidas rakendada mitmekordset võrdlusparandust? Kirjutage samm-sammult.

2) Kood + kohustuslikud kontrollid:

Kirjutage käivitatav kood, mis teostab järgmise DE analüüsi: [detail]. Kood PEAB sisaldama normaliseerimist, PCA kvaliteedigraafikut, partiiefekti juhtimist ja FDR (Benjamini-Hochberg) parandust. Kommenteerige iga sammu. Filtreerige parandatud p-väärtusega, mitte töötlemata p-väärtusega.

3) Raja rikastamise kommentaar:

Aidake tõlgendada selle oluliste geenide loendi radade rikastamise tulemusi: [loend/väljund]. Selgitage, millised teed on silmapaistvad, kuid öelge mulle, millises allikas (GO, KEGG, eelretsenseeritud artikkel) iga bioloogilise väite kinnitamiseks. Mehhanism/artikkel PAIGALDAMINE.

4) Statistika audit:

Kontrollige statistiliste vigade suhtes järgmist analüüsikoodi: [kood]. Täpsemalt: vale testivalik, mitme võrdlusparanduse väljajätmine, partii efekti ignoreerimine, ebapiisav replikatsioon. Loetlege kõik leitud probleemid ja nende lahendused.

Nõrk viip / Tugev viip

Nõrk: "Leidke nendest RNA-seq andmetest olulisi geene."

Probleem: meetod, kvaliteedikontroll ja mitmekordsed võrdlused pole täpsustatud; AI võib anda valepositiivsete testide loendi ilma parandusteta.

Tugev: "Kirjutage kood, mis teostab nende RNA-seq loendusandmete jaoks DE-analüüsi DESeq2 loogikaga, sisaldab kvaliteedikontrolli ja hulgiefektide juhtimist PCA-ga ning filtreid FDR-i korrigeerimisega; kommenteerige iga sammu ja selgitage, miks valisite selle meetodi."

Miks see on võimas: Meetod on standardne, kvaliteet ja korrektsioon on kohustuslikud, tulemus on auditeeritav.

Risk

sümptom

ettevaatusabinõu

valepositiivne

Liiga palju "tähenduslikke" geene

FDR/mitme võrdluse parandus

kollektiivne mõju

Proovid on rühmitatud päevade kaupa

PCA + partii muutuja

vale test

Tavaline test andmete loendamiseks

Sobiv meetod nagu DESeq2/edgeR

väljamõeldud bioloogia

Keevituseta mehhanism

Kirjanduse kinnitus

ebapiisav võimsus

1-2 kordust

Piisavalt kordamist disainis

Levinud vead

  • Mitme võrdluse paranduse vahelejätmine. Kõige tavalisem ja kahjulikum statistiline viga.
  • Kollektiivse mõju ignoreerimine. See tekitab vale bioloogilise erinevuse.
  • Andmete loendamiseks vale testimise rakendamine. RNA-seq nõuab spetsiaalseid meetodeid.
  • Bioloogiliste väidete aktsepteerimine ilma allikata. AI võib koostada mehhanisme ja artikleid.
  • Üldistamine ebapiisava kordusega. Ilma statistilise võimsuseta on tulemus ebausaldusväärne.
Ettevaatust: "statistiliselt oluline" ei ole sama mis "bioloogiliselt oluline". Väga väike, kuid tehniliselt oluline murdemuutus võib olla bioloogiliselt ebaoluline; Suurtes proovides võib kõik osutuda "oluliseks". Hinnake log2FC ja p-väärtust koos.

Sügavus: taust ja topeltloendamise lõksud raja rikastamisel

Raja rikastamise tulemused põhinevad kahel varjatud eeldusel, mida enamik inimesi ei mõista, ja tehisintellekt võib neist vaikselt mööda minna. Esimene on tausta/universumi valik: rikastamine võrdleb "muutunud geenide" komplekti komplektiga "milliseid geene vaadati". Kui taust on võetud kogu genoomist, kuid teie katse mõõdab ainult konkreetset koepaneeli, näivad tulemused kunstlikult "rikastatud". Õige taust on geenid, mida saab katses tegelikult väljendada/mõõta. Üks töörühm leidis "immuunraja väga olulise rikastumise" kogu genoomi ekslikult taustal; Kui analüüsi korrati õige taustaga (mõõdetud geenidega), kadus rikastumine – leid oli meetodi artefakt.

Teiseks, geenikomplekti suurus ja topeltloendamine: väga suured ja üldised rajad (nt “ainevahetusprotsessid”, tuhanded geenid) on peaaegu igas loendis “olulised”; väikesed spetsiifilised rajad on informatiivsemad. Lisaks, kuna sama geeni leidub mitmes rajas, on eksitav käsitleda kattuvaid radu sõltumatute tõenditena. Kolmas punkt: see ei näita rikastamise suunda; Rada võib olla rikastatud, kuid pooled selles sisalduvad geenid võivad suureneda ja teine ​​​​pool väheneda. Selle nägemiseks on vaja eraldi uurida suunateavet (nt GSEA).

lõks

sümptom

ettevaatusabinõu

vale taust

Kõik näib olevat rikastatud

Hankige mõõdetud geenide taust

Väga üldine rada

"Ainevahetus" tuleb alati üles

Keskenduge väikestele spetsiifilistele radadele

topeltarvestus

kattuvad rajad

Ärge võtke seda kui sõltumatut tõendit

suuna vahele jätta

segatud tõusev/kahanev

Suunajuhtimine GSEA-ga

Kokkuvõttes

  • AI omika analüüsis; on assistent, kes valib meetodeid, kirjutab koodi ja koostab kommentaare; statistika ja bioloogia otsused peavad olema põhjendatud.
  • Kasutada tuleks standardseid tõestatud meetodeid (DESeq2/edgeR); Kvaliteedikontrolli ja kollektiivset mõjuauditit ei tohiks vahele jätta.
  • Mitme võrdluse parandus (FDR) on kohustuslik; tulemused filtreeritakse korrigeeritud väärtusega.
  • Iga bioloogiline väide peab olema kirjanduses kinnitatud; "olulist" tuleks eristada "olulisest".

Rakenduse ülesanne

Võtke näidis DE tulemuste tabel (või avatud RNA-seq andmestik). Võrrelge olulisi geenide arvu, mis põhinevad töötlemata p-väärtusel ja korrigeeritud padj-lävedel, ülaltoodud fragmendiga. Kommenteerige erinevust ühe lausega. Seejärel küsige esiletoodud geeni jaoks bioloogilist tõlgendust malliga 3 ja kontrollige väidet PubMedis ise.

kontrollnimekiri

  • [ ] Hindasin katseplaani ja statistilist võimsust.
  • [ ] Valisin standardse, mugava meetodi.
  • [ ] Tegin PCA ja partiiefekti kvaliteedikontrolli.
  • [ ] Rakendasin mitmekordse võrdluse (FDR) korrektsiooni.
  • [ ] Filtreerisin tulemused parandatud p-väärtusega.
  • [ ] Kinnitasin kirjanduses toodud bioloogilisi väiteid.