Kasu:
- Mitmekordne testimise parandus (parandatud p-väärtus) diferentsiaalekspressioonianalüüsis ja võime õigesti tõlgendada voltide muutust ja vältida valepositiivseid tulemusi
- Partiiefekti tuvastamine ja mudelile lisamine PCA-ga ning tehnilise müra eraldamine bioloogilisest erinevusest
- Võimalus siduda iga raja identiteet allikaga ja kontrollida seda raja rikastamise ja multi-oomika integreerimise bioloogilise järjepidevusega
Lahter ei ole üks arv; See on süsteem, kus tuhanded geenid, valgud ja metaboliidid tantsivad samaaegselt. Omics (kogunimetus lähenemisviisidele, mis mõõdavad bioloogilist kihti kui tervikut) püüab tabada kogu seda tantsu: genoomika (DNA), transkriptoomika (RNA – millised geenid töötavad ja kui palju), proteoomika (valgud), metaboloomika (väikesed molekulid). Iga omikakiht toodab tuhandeid mõõtmetega, mürarikkaid ja kulukaid andmeid. AI on nende suuremõõtmeliste andmete skannimisel ja mustrite märgistamisel võimas; Kuid sina oled see, kes otsustab, milline muster on bioloogiline tõde ja milline tehniline müra.
Selles üksuses käsitleme transkriptoomikat, kõige levinumat oomika analüüsi; Põhimõtted kehtivad ka teiste kihtide puhul. Tüüpiline töövoog: ekspressioonimaatriks algandmetest (read on geenid, veerud proovid, rakud ekspressioonitasemed), normaliseerimine (tehniliste erinevuste eemaldamine), diferentsiaalekspressioonianalüüs (kahe tingimuse vahel oluliselt muutuvate geenide leidmine), raja rikastamine (leidmine, millistesse bioloogilistesse radadesse muudetud geenid on koondunud) ja interpretatsioon.
Diferentsiaalavaldis: kordne muutus ja parandatud p-väärtus
Et teada saada, kas geen on "muutunud", vaadeldakse kahte numbrit: kordne muutus – mitu korda ekspressioon suureneb/väheneb, tavaliselt log2 skaalal – ja kohandatud p-väärtus (padj – statistika, mis kontrollib valepositiivseid tulemusi mitme testimise korral). Miks parandada? Sest sa testid korraga 20 000 geeni; Isegi juhuslikult võivad sajad geenid osutuda "olulisteks". Ilma mitmekordse testimiseta korrigeerimiseta – piirates valede avastamise määra selliste meetoditega nagu Benjamini-Hochberg – on nimekiri eksitav. Tehisintellekt võib kirjutada selle statistika arvutava skripti, kuid kui see paranduse välja jätab, on teie tulemus teaduslikult põhjendamatu.
Ettevaatust: tehisintellekt võib toores p-väärtuse põhjal öelda "500 geeni on oluliselt muutunud". Vaadates parandatud p-väärtust, võib see arv langeda 30-ni. Kontrollige alati mitmetestilist parandust ise; See on erinevus väljaande aktsepteerimise ja tagasilükkamise vahel.
Partiiefekt: kõige salakavalam lõks
Partiiefekt (tehniline erinevus, mis tuleneb proovide töötlemisest erinevate päevade, seadmete või inimeste poolt) on suurim veaallikas oomika analüüsis. Kui teie kahte haigusseisundit töödeldi kahel erineval päeval, võib "bioloogiline erinevus", mida näete, tegelikult päevade erinevus. Tehisintellekt võib soovitada lisada mudelile partii muutuja (nt ~ partii + tingimus), kuid teie vastutate selle õigesti seadistamise eest ja mitte segada seda eksperimentaalses plaanis.
Näpunäide: Enne analüüsi alustamist koostage PCA (Principal Component Analysis – meetod, mis võtab kokku ja visualiseerib kõrgmõõtmelisi andmeid mitmel teljel) diagramm. Kui proovid on rühmitatud pigem partiide kui bioloogiliste seisundite järgi, on partii efekt domineeriv ja seda tuleb kõigepealt korrigeerida.
Multi-oomika integreerimine
Tõeline arusaam tuleb sageli kihtide kokkupanemisest: kui geen töötab rohkem, kuid selle valk ei suurene, on regulatsioon translatsiooni tasemel. Multi-oomika integreerimine – erinevate oomikakihtide ühendamine üheks mudeliks – on koht, kus tehisintellekt muutub tugevamaks, kuid ka see, kus see eksitab kõige rohkem; sest kihtide mastaabid, müra ja proovide vasted on erinevad. AI soovitab integreerimise töövoogu, kuid teie kontrollite tulemuste bioloogilist järjepidevust.
kolm minikarpi
Juhtum 1 – rikastamine kiirendatud. Vähiprojektis leiti 1240 diferentsiaalset geeni. AI valmistas need raja rikastamiseks, tõstes esile rakutsükli ja DNA parandamise teed; Meeskond koostas hüpoteesikaardi 2 tunniga. Kuid nad testisid iga rada uuesti sõltumatu tööriistaga (g:Profiler) ja leidsid, et AI kaardistas ühe raja valesti.
Juhtum 2 – partii lõks. Üks labor avastas kahe ravirühma vahel "rabava" 900 geeni erinevuse. PCA läbiviimisel nägid nad, et proovid eraldati partii sekveneerimisega. Pärast partii korrigeerimist vähenes tegelik erinevus 60 geenini. AI oli esimeses analüüsis tahtmatult partii muutuja välja jätnud.
Juhtum 3 – väljamõeldud raja nimi. Üks õpilane andis geeniloendi AI-le ja küsis: "Milline KEGG rada?" AI andis raja ID ja nime, nagu oleks see tõeline. Kui õpilane KEGG-st otsis, nägi ta, et seda ID-d pole olemas; kontrollimine takistas väljamõeldud tulemust.
Neli kopeeritavat malli
1) DESeq2 töövoo ülevaade:
Sinu roll: arvutusbioloog. Kirjutage samm-sammult skript RNA-seq diferentsiaalekspressiooni analüüsiks R/DESeq2-ga: loendusmaatriksi lugemine, disainivalem (~ partii + tingimus), normaliseerimine, tulemuste tabel. Rakendage selgesõnaliselt mitme testimise parandus (BH) ja kasutage padjtulpa. Selgitage kommentaarireal, mida iga samm teeb.
2) Kvaliteedi/partii kontroll:
Andke mulle RNA-seq QC kontrollnimekiri: partii kontroll PCA-ga, raamatukogu suurus, geenituvastuste arv, kõrvalekallete tuvastamine. Määrake iga mõõdiku jaoks lävi, mida näen, teeb mind murelikuks. Selgitage, mida peaksin tegema, kui partii ja bioloogiline seisund on segunenud.
3) Rikastamise tulemuste kontrollimine:
Annan teile rikastatud radade loendi (radade arv, padj, geenid). Kirjutage iga raja identiteet (KEGG/GO ID) sõna-sõnalt üles ja ärge tehke seda välja. Filtreeri tulemused padj < 0,05. Määrake, millised rajad üksteist bioloogiliselt toetavad, kuid märkige iga identiteet kui "peab olema andmebaasis kinnitatud".
4) Multi-oomika järjepidevuse kontroll:
Transkriptoomilised ja proteoomilised annavad geeni / valgu paari jaoks vastuolulisi ekspressioonisuundi. Loetlege selle võimalikud bioloogilised (tõlkejärgne toimetamine) ja tehnilised (mõõtmismüra, proovide sobitamine) põhjused ja öelge, kuidas neid kõiki testida.
Nõrk viip / Tugev viip
Nõrk viip:
Nimetage selles geeniloendis olevad olulised rajad.
Puuduvad allikad, pole statistikat, suur oht fabritseeritud radadele.
Võimas viip:
Sinu roll: arvutusbioloog. Lisatud diferentsiaalgeenitabelis (geen, log2FC, padj) võetakse ainult geenid, mille padj on < 0,05. Rääkige mulle nende geenidega tehtava GO rikastamisanalüüsi etapid ja tööriist (g:Profiler), mida ma kasutan. Tee nimi on FAKE; Käitan tööriista ja teen analüüsi, teie lihtsalt kirjeldate õiget metoodikat ja mitmekordse testimise parandust.
Erinevus: selge filter, metoodika fookus, valmistamise keeld ja kontrollimise jätmine kasutaja hooleks.
Omika analüüsi sammud
samm
Eesmärk
levinud viga
AI roll
normaliseerimine
Likvideerida tehniline erinevus
Vale meetodi valik
Stsenaarium + põhjendus
PCA/QC
Partii ja kõrvalekallete tuvastamine
jäta mu samm vahele
Pilt + kommentaar
diferentsiaalne väljendus
Muutuvate geenide leidmine
Parandamata lk
Skripti mustand
rikastamine
leida tee
valmistatud rada
metoodika
integratsiooni
liita kihid
Skaala/vastavuse viga
Töövoo soovitus
Ühe raku omika: uus skaala
Viimastel aastatel on üherakuline sekveneerimine – tuhandete rakkude ekspressiooniprofiili eraldi mõõtmine – viinud oomika uude dimensiooni. Nüüd näeme "koe keskmise ekspressiooni" asemel iga rakutüüpi selles koes eraldi. See võim toob kaasa uusi lõkse: andmed on äärmiselt hõredad (enamik geene on enamikus rakkudes nulli - väljalangemine), suurus on kümneid tuhandeid rakke × kakskümmend tuhat geeni ja rakutüüpide eraldamine toimub enamasti klastrite moodustamise teel. Tehisintellekt on võimas ühe lahtri andmetele rühmitamise ja rakutüübi märgistamise piirjoonte loomisel; kuid te kontrollite teadaolevate markergeenidega, kas iga klaster on tõeline rakutüüp või tehniline artefakt (nt surnud rakud, kaks rakku kokku püütud). Ärge aktsepteerige AI soovitatud rakutüübi märgistust ilma selle klastri markergeenide kinnitamiseta tegelikus kirjanduses.
Näpunäide: kui AI soovitab üherakulises analüüsis klastris märgistada T-raku, kontrollige ise, kas T-raku markerid (nt CD3) on selles klastris tõepoolest tugevalt ekspresseeritud. Kui märgist märk ei toeta, on see hüpotees, mitte järeldus.
Levinud vead
- Mitme testimise paranduse vahelejätmine. Loend paisub töötlemata p-väärtusega; padj tuleks kasutada.
- Partiiefekti eksitamine bioloogiaga. Seda tuleks esmalt PCA-ga kontrollida.
- Põranda muutmine ainsaks kriteeriumiks. Madala ekspressiooniga, mürarikaste geenide puhul võib kõrge voldimuutus olla eksitav.
- Väljamõeldud raja/GO identiteedi aktsepteerimine. Iga identiteet tuleb andmebaasis kontrollida.
- Valimi suuruse alahindamine. Statistiline võimsus on 2 x 2 kujunduses madal; Tulemusi tuleks tõlgendada ettevaatusega.
Kokkuvõttes
Omicsi analüüs töötab suuremõõtmeliste mürarikaste andmetega ning tehisintellekt kiirendab neid andmeid skaneerides, kirjutades skripte ja märgistades mustreid. Kuid mitmekordne testi korrigeerimine diferentsiaalekspressioonis, partii kontroll PCA-ga ja allika kontrollimine rikastamisel on hädavajalikud. Multi-oomika integreerimine on võimas, kuid eksitav; Kontrollige iga tulemust bioloogilise järjepidevusega, võttes arvesse kihtide ulatust ja müraerinevusi.
Rakenduse ülesanne
Leidke avalikult kättesaadav RNA-seq loendusmaatriks (nt GEO-st). Laske tehisintellektil kirjutada analüüsiskript malliga "DESeq2 workflow" ja kontrollige koodi, kas mitme testimise parandus on tegelikult rakendatud. Seejärel küsige tehisintellektilt rikastamiskommentaari ja kontrollige ükshaaval kõiki selle tagastatud raja ID-sid KEGG või GO andmebaasi põhjal; Pange tähele, kui paljud neist on tõelised.
kontrollnimekiri
- [ ] Diferentsiaalanalüüsis kasutasin padj-d (parandatud), mitte töötlemata p-väärtust.
- [ ] Kontrollisin PCA-ga partiiefekti ja lisasin selle vajadusel mudelile.
- [ ] Tõlgendasin ettevaatlikult geene, millel on suur kordne muutus, kuid madal ekspressioon.
- [ ] Kontrollisin iga rada/GO ID-d tegeliku andmebaasiga.
- [ ] Hindasin valimi suuruse statistilist võimsust.
- [ ] Jagasin multi-oomika vastuolud bioloogilisteks ja tehnilisteks põhjusteks.