Üksus 4 / 11

Omicsi andmed ja kõrgmõõtmeline analüüs

Kasu:

  • Võimalus mõista mitmekordse võrdluse probleemi ja kaasata analüüsi FDR-i (false discovery rate) parandus
  • Võimalus eristada statistilist ja bioloogilist olulisust, hinnates koos p-väärtust ja efekti suurust (log2-kordne muutus)
  • Võimalus ära tunda ja vältida suuremõõtmelisi andmelõksu, nagu pakettefekt ja põhjusliku seose hüpe

Sõna "oomika" kirjeldab lähenemisviise, mis mõõdavad tervet klassi molekule rakus: genoomika (kõik DNA), transkriptoomika (kõik RNA / geeniekspressioon), proteoomika (kõik valgud), metaboomika (kõik väikesed molekulid). Nende mõõtmiste ühiseks tunnuseks on nende suur dimensioonilisus: ühes proovis mõõdetakse samaaegselt tuhandeid või isegi kümneid tuhandeid muutujaid (geene, valke), kuid proovide arv on tavaliselt väike (nt 20 patsienti). See olukord "palju muutujaid, vähe proove" on bioloogiale ainulaadsete väljakutsete allikas ja valdkondades, kus tehisintellekt võib olla kõige kasulikum.

Selles üksuses käsitleme transkriptoomika (RNA-seq) näitel diferentsiaalset ekspressioonianalüüsi (geenide leidmine, mille ekspressioon muutub kahe rühma vahel oluliselt) ja tehisintellekti rolli selles töövoos.

Suuremõõtmeliste andmete peamine probleem

Kui testite korraga tuhandeid geene, leiate juhuslikult geene, mis tunduvad "olulised", isegi kui tegelikke erinevusi pole. Kui testida 20 000 geeni 5% veamääraga, võib ~1000 geeni juhuslikult "oluliseks" osutuda. Seda nimetatakse mitmekordse võrdluse probleemiks ja see on omika analüüsi kõige kriitilisem lõks. Lahenduseks on p-väärtuste korrigeerimine (nt arvutage FDR - valede avastamise määr Benjamini-Hochbergi meetodiga). AI on selle kontseptsiooni selgitamisel ja õige koodi kirjutamisel väga abiks; kuid teie kohustus on meeles pidada paranduse rakendamist.

Näpunäide. Kui näete omicsi tulemuses sellist arvu nagu "3000 geeni on oluliselt muudetud", olge mures. Tavaliselt on see märk sellest, et mitmekordset võrdlusparandust pole tehtud. Realistlik nimekiri oleks hästi kavandatud katses kümneid kuni mitusada geeni.

RNA-seq diferentsiaalne ekspressioon: samm-sammult

  1. Toores loendused: tabel, mis sisaldab iga geeni iga proovi iga lugemi arvu.
  2. Kvaliteet ja filtreerimine: visake ära väga madala ekspressiooniga geenid.
  3. Normaliseerimine: õige teegi suuruse erinevus proovide vahel (toores arvus pole võrreldav).
  4. Statistiline mudel: Testirühma erinevus Pythonis DESeq2 või edgeR-iga (R teegid) või pyDESeq2-ga.
  5. Mitme võrdluse parandus: arvutage FDR; tavaliselt FDR-i lävi <0,05.
  6. Efekti suurus: hinnake log2-kordse muutusega: mitu korda avaldis suureneb/väheneb.
  7. Kommentaar: seostage olulised geenid bioloogiliste radadega.

Tehisintellekt 3-6. See kodeerib samme, selgitab mõisteid ja aitab teil väljundit tõlgendada. Mudel ei saa aga öelda "milline geen muutus" ilma teie algandmeid nägemata; Kood ja statistika ütlevad teile seda.

Kopeeritavad viipade mallid

Roll: olete transkriptoomilise analüüsi assistent. Kontekst: mul on RNA-seq toorloenduse tabel (CSV) 12 kontrollproovist, 12 raviproovist. Ülesanne: Loetlege pyDESeq2 abil diferentsiaalekspressiooni analüüsi etapid, selgitage, miks iga samm on vajalik. Plaan kõigepealt, kood teiseks. Lisage kindlasti mitu võrdlusparandust.

Minu analüüsiväljund näitas 4200 geeni kui "p<0,05". Miks see võib kahtlane olla? Selgitage mitmekordse võrdluse korrigeerimist (Benjamini-Hochberg FDR) ja andke Pythoni kood, mis teeb õige filtreerimise.

Kirjutage kood, mis joonistab minu diferentsiaalavaldise tulemuste tabelist vulkaani graafiku (geen, log2FC, padj veerud). Värvige geenid FDR<0,05 ja |log2FC|>1, märgistage 10 parimat.

Kuidas analüüsida seda olulist geenide nimekirja raja rikastamiseks? Selgitage gseapy või g:Profiler samme. Ära väida kommentaaris absoluutset põhjuslikkust, kasuta korrelatsioonikeelt. Geeniloend: [loend]

Nõrk viip / Tugev viip

Nõrk: "Öelge mulle, millised geenid on RNA-seq saagises olulised."

Tugev: "Mul on pyDESeq2 väljund 12 kontrollist, 12 raviproovi: tabel geeniga, log2FoldChange, padj veerud. Andke kood, mis filtreerib olulised geenid lävedega FDR<0,05 ja |log2FC|>1, teatab nende arvud ja järjestab 20 tugevaimat geeni.

Erinevus: võimsal viibal on tegelikud väljundi veerud, läved ja valideerimispäring. Mudel töötleb teie andmeid väljamõeldud geeninime genereerimise asemel.

kolm minikarpi

Juhtum 1 – katastroof ilma paranduseta: rühm leidis 3800 "olulist" geeni p<0,05 ilma paranduseta ja esitas selle avaldamisele. Kui kohtunik palus FDR-i korrigeerimist, langes nimekiri 47 geenini. Kui tehisintellekt oleks algusest peale Benjamini-Hochbergi koodi lisanud, poleks seda piinlikkust tulnud. Õppetund: parandus ei ole läbiräägitav.

Juhtum 2 – partiiefekt: ühes uuringus töödeldi proove kahel erineval päeval. See, mida nad arvasid, oli "patsient vs. kontroll" erinevus, oli tegelikult erinevus "1. päev vs. 2. päev" (partii efekt: tehniline erinevus proovivõtu osapoolest). AI aitas võltssignaali välja rookida, soovitades mudelile lisada partii muutuja (~ partii + tingimus mudeli valemis).

Juhtum 3 – voltide muutuse ignoreerimine: üliõpilane kuulutas "kõige olulisemaks" geeni, mille ekspressioon muutus 2%, kuid mõõdeti väga stabiilseks, lihtsalt p-väärtust vaadates. arvestades, et efekti suurus (log2FC) oli peaaegu null; statistiline olulisus ei ole bioloogiline olulisus. Mudel selgitas seda eristust ja soovitas seda visualiseerida vulkaanigraafikuga.

Võrdlustabel: mõiste selgus

kontseptsioon

Tähendus

Miks see oluline on?

p-väärtus

Tõenäosus, et erinevus on kokkusattumus

üksi võib olla eksitav

FDR (padj)

Korrigeeritud veamäär mitmel testimisel

Piirab valepositiivseid tulemusi

log2 kordne muutus

Efekti suurus

Näitab bioloogilist tähtsust

partii efekt

Tehniline partii erinevus

Loob võltssignaali

normaliseerimine

Proovidevaheline skaala korrigeerimine

Teeb võrdluse õiglaseks

Levinud vead

  • Mitme võrdlusparanduse vahelejätmine: kõige levinum ja kõige tõsisem viga.
  • Lihtsalt p-väärtust vaadates: arvestage kindlasti efekti suurust (log2FC) koos.
  • Partiiefekti arvestamata jätmine mudelisse: Tehnilise erinevuse segamine bioloogilise erinevusega.
  • Normaliseerimise unustamine: töötlemata arvude otsene võrdlemine.
  • Põhjuslik keel: Öeldes "See geen põhjustab haigusi"; Omika andmed näitavad korrelatsiooni, põhjuslik seos nõuab täiendavat katsetamist.
Ettevaatust. Kõrgmõõtmeliste andmete puhul on "statistiliselt oluline" ja "bioloogiliselt oluline" kaks erinevat asja. Tehisintellekti toodetud geeniloend on esialgne hüpotees; Iga kandidaatgeeni ei tohiks pidada lõplikuks ilma sõltumatu meetodiga (qPCR, valgu mõõtmine) kontrollimiseta.

Suuruse vähendamine ja kvaliteedikontroll

Esimene asi, mida teha suuremõõtmeliste andmete puhul, on näha proovide üldist struktuuri. PCA (põhikomponentide analüüs: tuhandete muutujate redutseerimine mõneks kokkuvõtlikuks teljeks ja nende kuvamine kahes mõõtmes) on selleks standardtööriist. Kui oodatavad rühmad (kontroll/ravi) on PCA graafikus eraldatud, on see hea; aga kui proovid on rühmitatud pigem "töötlemispäeva" kui rühma järgi, on see partiiefekti hoiatus. Samal diagrammil on kohe näha ka üks kõrvalekalduv (ebaõnnestunud) näide.

Joonistage PCA minu normaliseeritud ekspressioonitabelist (rea geen, veeruproov). Värviproovid rühmade kaupa (kontroll/töötlus), kuju töötlemispartiide kaupa. Kommenteerige, kas graafikul on näha partiiefekti või kõrvalekaldeid.

See heuristiline samm juhib ülejäänud analüüsi: parem on varakult tabada kõrvalekaldeid, kui raisata kuid vale tulemuse peale.

Ühe lahtri andmed: uus mõõde

Viimastel aastatel on laialt levinud üherakuline RNA sekveneerimine (single-cell RNA-seq: tuhandete üksikute rakkude ekspressiooniprofiili mõõtmine). Siin muutuvad andmed veelgi suuremaks: kümneid tuhandeid rakke, igaühes tuhandeid geene. Sellised tööriistad nagu Scanpy (Python) töötlevad neid andmeid; rühmitab rakud ja tuvastab rakutüübid. Tehisintellekt kirjutab selle töövoo jaoks koodi, kuid rakutüüpide bioloogiline nomenklatuur (olenemata sellest, kas klaster on "T-rakk" või "makrofaag") tugineb markergeenidele ja ekspertteadmistele. Kinnitage kindlasti lahtritüübi silt, mille mudel määrab tuntud markeritega klastrile; See on üksiku raku analüüsi kõige sagedamini valesti mõistetud etapp.

Avaandmed ja reprodutseeritavus

Enamik omikauuringuid laadib oma andmed üles avalikesse hoidlatesse: GEO (Gene Expression Omnibus) ja ArrayExpress geeniekspressiooni jaoks, SRA (Sequence Read Archive) toorjärjestuste jaoks, PRIDE proteoomika jaoks. See on ülioluline, et teised saaksid teie tulemusi kontrollida ja et saaksite teiste uuringute andmeid uuesti analüüsida. Tehisintellekt võib kirjutada koodi (näiteks GEOparse vahenditega), mis laadib alla ja korraldab andmeid GEO registreerimisnumbrist (nt GSE number); Kuid lugege kindlasti läbi ja kinnitage allalaaditud andmete kujundus (mitu gruppi, mitu kordamist, milline protsess) algsest kirjest. Kui mudel väidab, et "mäletab" uuringu ülesehitust, on see peaaegu alati oletus, mida tuleb kontrollida.

Kokkuvõttes

Omicsi andmed mõõdavad tuhandeid muutujaid väikeses valimi suuruses; See loob mitme võrdluse, partiiefektide ja ületõlgendamise lõksud. Tehisintellekt; See kirjutab diferentsiaalavaldiste analüüsi koodi, selgitab mõisteid ja aitab teil tulemusi tõlgendada. Kuid teie kohustus on rakendada FDR-i parandus, hinnata efekti suurust ja vältida põhjuslikku seost. Kandidaatgeenid on hüpoteesid kuni sõltumatu meetodiga kontrollimiseni.

Rakenduse ülesanne

Hankige või looge diferentsiaalavaldiste tulemuste tabel (gen, log2FC, padj). Laske AI kirjutamiskoodil, mis filtreerib FDR<0,05 ja |log2FC|>1 järgi, teatab oluliste geenide arvu ja koostab vulkaanigraafiku. Käivitage kood. Seejärel laske mudelil arvutada, kui palju geene näib olevat "oluline", kui parandust poleks tehtud, ja tõlgendada erinevust.

kontrollnimekiri

  • [ ] Rakendasin mitmekordse võrdluse korrektsiooni (FDR).
  • Hindasin efekti suurust (log2FC) ja [ ] p-väärtust.
  • [ ] Kontrollisin partii/tehnilisi muutujaid.
  • [ ] Ma ei jätnud normaliseerimisetappi vahele.
  • [ ] Kasutasin pigem korrelatsiooni kui põhjuslikkuse keelt.
  • [ ] Märkisin kandidaatgeenid hüpoteesideks, mis vajavad kinnitamist.