Üksus 3 / 10

Omicsi andmete analüüs: transkriptoomika, proteoomika ja multiomika integreerimine

Kasu:

  • Mitmekordne testimise parandus (parandatud p-väärtus) diferentsiaalekspressioonianalüüsis ja võime õigesti tõlgendada voltide muutust ja vältida valepositiivseid tulemusi
  • Partiiefekti tuvastamine ja mudelile lisamine PCA-ga ning tehnilise müra eraldamine bioloogilisest erinevusest
  • Võimalus siduda iga raja identiteet allikaga ja kontrollida seda raja rikastamise ja multi-oomika integreerimise bioloogilise järjepidevusega

Lahter ei ole üks arv; See on süsteem, kus tuhanded geenid, valgud ja metaboliidid tantsivad samaaegselt. Omics (kogunimetus lähenemisviisidele, mis mõõdavad bioloogilist kihti kui tervikut) püüab tabada kogu seda tantsu: genoomika (DNA), transkriptoomika (RNA – millised geenid töötavad ja kui palju), proteoomika (valgud), metaboloomika (väikesed molekulid). Iga omikakiht toodab tuhandeid mõõtmetega, mürarikkaid ja kulukaid andmeid. AI on nende suuremõõtmeliste andmete skannimisel ja mustrite märgistamisel võimas; Kuid sina oled see, kes otsustab, milline muster on bioloogiline tõde ja milline tehniline müra.

Selles üksuses käsitleme transkriptoomikat, kõige levinumat oomika analüüsi; Põhimõtted kehtivad ka teiste kihtide puhul. Tüüpiline töövoog: ekspressioonimaatriks algandmetest (read on geenid, veerud proovid, rakud ekspressioonitasemed), normaliseerimine (tehniliste erinevuste eemaldamine), diferentsiaalekspressioonianalüüs (kahe tingimuse vahel oluliselt muutuvate geenide leidmine), raja rikastamine (leidmine, millistesse bioloogilistesse radadesse muudetud geenid on koondunud) ja interpretatsioon.

Diferentsiaalavaldis: kordne muutus ja parandatud p-väärtus

Et teada saada, kas geen on "muutunud", vaadeldakse kahte numbrit: kordne muutus – mitu korda ekspressioon suureneb/väheneb, tavaliselt log2 skaalal – ja kohandatud p-väärtus (padj – statistika, mis kontrollib valepositiivseid tulemusi mitme testimise korral). Miks parandada? Sest sa testid korraga 20 000 geeni; Isegi juhuslikult võivad sajad geenid osutuda "olulisteks". Ilma mitmekordse testimiseta korrigeerimiseta – piirates valede avastamise määra selliste meetoditega nagu Benjamini-Hochberg – on nimekiri eksitav. Tehisintellekt võib kirjutada selle statistika arvutava skripti, kuid kui see paranduse välja jätab, on teie tulemus teaduslikult põhjendamatu.

Ettevaatust: tehisintellekt võib toores p-väärtuse põhjal öelda "500 geeni on oluliselt muutunud". Vaadates parandatud p-väärtust, võib see arv langeda 30-ni. Kontrollige alati mitmetestilist parandust ise; See on erinevus väljaande aktsepteerimise ja tagasilükkamise vahel.

Partiiefekt: kõige salakavalam lõks

Partiiefekt (tehniline erinevus, mis tuleneb proovide töötlemisest erinevate päevade, seadmete või inimeste poolt) on suurim veaallikas oomika analüüsis. Kui teie kahte haigusseisundit töödeldi kahel erineval päeval, võib "bioloogiline erinevus", mida näete, tegelikult päevade erinevus. Tehisintellekt võib soovitada lisada mudelile partii muutuja (nt ~ partii + tingimus), kuid teie vastutate selle õigesti seadistamise eest ja mitte segada seda eksperimentaalses plaanis.

Näpunäide: Enne analüüsi alustamist koostage PCA (Principal Component Analysis – meetod, mis võtab kokku ja visualiseerib kõrgmõõtmelisi andmeid mitmel teljel) diagramm. Kui proovid on rühmitatud pigem partiide kui bioloogiliste seisundite järgi, on partii efekt domineeriv ja seda tuleb kõigepealt korrigeerida.

Multi-oomika integreerimine

Tõeline arusaam tuleb sageli kihtide kokkupanemisest: kui geen töötab rohkem, kuid selle valk ei suurene, on regulatsioon translatsiooni tasemel. Multi-oomika integreerimine – erinevate oomikakihtide ühendamine üheks mudeliks – on koht, kus tehisintellekt muutub tugevamaks, kuid ka see, kus see eksitab kõige rohkem; sest kihtide mastaabid, müra ja proovide vasted on erinevad. AI soovitab integreerimise töövoogu, kuid teie kontrollite tulemuste bioloogilist järjepidevust.

kolm minikarpi

Juhtum 1 – rikastamine kiirendatud. Vähiprojektis leiti 1240 diferentsiaalset geeni. AI valmistas need raja rikastamiseks, tõstes esile rakutsükli ja DNA parandamise teed; Meeskond koostas hüpoteesikaardi 2 tunniga. Kuid nad testisid iga rada uuesti sõltumatu tööriistaga (g:Profiler) ja leidsid, et AI kaardistas ühe raja valesti.

Juhtum 2 – partii lõks. Üks labor avastas kahe ravirühma vahel "rabava" 900 geeni erinevuse. PCA läbiviimisel nägid nad, et proovid eraldati partii sekveneerimisega. Pärast partii korrigeerimist vähenes tegelik erinevus 60 geenini. AI oli esimeses analüüsis tahtmatult partii muutuja välja jätnud.

Juhtum 3 – väljamõeldud raja nimi. Üks õpilane andis geeniloendi AI-le ja küsis: "Milline KEGG rada?" AI andis raja ID ja nime, nagu oleks see tõeline. Kui õpilane KEGG-st otsis, nägi ta, et seda ID-d pole olemas; kontrollimine takistas väljamõeldud tulemust.

Neli kopeeritavat malli

1) DESeq2 töövoo ülevaade:

Sinu roll: arvutusbioloog. Kirjutage samm-sammult skript RNA-seq diferentsiaalekspressiooni analüüsiks R/DESeq2-ga: loendusmaatriksi lugemine, disainivalem (~ partii + tingimus), normaliseerimine, tulemuste tabel. Rakendage selgesõnaliselt mitme testimise parandus (BH) ja kasutage padjtulpa. Selgitage kommentaarireal, mida iga samm teeb.

2) Kvaliteedi/partii kontroll:

Andke mulle RNA-seq QC kontrollnimekiri: partii kontroll PCA-ga, raamatukogu suurus, geenituvastuste arv, kõrvalekallete tuvastamine. Määrake iga mõõdiku jaoks lävi, mida näen, teeb mind murelikuks. Selgitage, mida peaksin tegema, kui partii ja bioloogiline seisund on segunenud.

3) Rikastamise tulemuste kontrollimine:

Annan teile rikastatud radade loendi (radade arv, padj, geenid). Kirjutage iga raja identiteet (KEGG/GO ID) sõna-sõnalt üles ja ärge tehke seda välja. Filtreeri tulemused padj < 0,05. Määrake, millised rajad üksteist bioloogiliselt toetavad, kuid märkige iga identiteet kui "peab olema andmebaasis kinnitatud".

4) Multi-oomika järjepidevuse kontroll:

Transkriptoomilised ja proteoomilised annavad geeni / valgu paari jaoks vastuolulisi ekspressioonisuundi. Loetlege selle võimalikud bioloogilised (tõlkejärgne toimetamine) ja tehnilised (mõõtmismüra, proovide sobitamine) põhjused ja öelge, kuidas neid kõiki testida.

Nõrk viip / Tugev viip

Nõrk viip:

Nimetage selles geeniloendis olevad olulised rajad.

Puuduvad allikad, pole statistikat, suur oht fabritseeritud radadele.

Võimas viip:

Sinu roll: arvutusbioloog. Lisatud diferentsiaalgeenitabelis (geen, log2FC, padj) võetakse ainult geenid, mille padj on < 0,05. Rääkige mulle nende geenidega tehtava GO rikastamisanalüüsi etapid ja tööriist (g:Profiler), mida ma kasutan. Tee nimi on FAKE; Käitan tööriista ja teen analüüsi, teie lihtsalt kirjeldate õiget metoodikat ja mitmekordse testimise parandust.

Erinevus: selge filter, metoodika fookus, valmistamise keeld ja kontrollimise jätmine kasutaja hooleks.

Omika analüüsi sammud

samm

Eesmärk

levinud viga

AI roll

normaliseerimine

Likvideerida tehniline erinevus

Vale meetodi valik

Stsenaarium + põhjendus

PCA/QC

Partii ja kõrvalekallete tuvastamine

jäta mu samm vahele

Pilt + kommentaar

diferentsiaalne väljendus

Muutuvate geenide leidmine

Parandamata lk

Skripti mustand

rikastamine

leida tee

valmistatud rada

metoodika

integratsiooni

liita kihid

Skaala/vastavuse viga

Töövoo soovitus

Ühe raku omika: uus skaala

Viimastel aastatel on üherakuline sekveneerimine – tuhandete rakkude ekspressiooniprofiili eraldi mõõtmine – viinud oomika uude dimensiooni. Nüüd näeme "koe keskmise ekspressiooni" asemel iga rakutüüpi selles koes eraldi. See võim toob kaasa uusi lõkse: andmed on äärmiselt hõredad (enamik geene on enamikus rakkudes nulli - väljalangemine), suurus on kümneid tuhandeid rakke × kakskümmend tuhat geeni ja rakutüüpide eraldamine toimub enamasti klastrite moodustamise teel. Tehisintellekt on võimas ühe lahtri andmetele rühmitamise ja rakutüübi märgistamise piirjoonte loomisel; kuid te kontrollite teadaolevate markergeenidega, kas iga klaster on tõeline rakutüüp või tehniline artefakt (nt surnud rakud, kaks rakku kokku püütud). Ärge aktsepteerige AI soovitatud rakutüübi märgistust ilma selle klastri markergeenide kinnitamiseta tegelikus kirjanduses.

Näpunäide: kui AI soovitab üherakulises analüüsis klastris märgistada T-raku, kontrollige ise, kas T-raku markerid (nt CD3) on selles klastris tõepoolest tugevalt ekspresseeritud. Kui märgist märk ei toeta, on see hüpotees, mitte järeldus.

Levinud vead

  • Mitme testimise paranduse vahelejätmine. Loend paisub töötlemata p-väärtusega; padj tuleks kasutada.
  • Partiiefekti eksitamine bioloogiaga. Seda tuleks esmalt PCA-ga kontrollida.
  • Põranda muutmine ainsaks kriteeriumiks. Madala ekspressiooniga, mürarikaste geenide puhul võib kõrge voldimuutus olla eksitav.
  • Väljamõeldud raja/GO identiteedi aktsepteerimine. Iga identiteet tuleb andmebaasis kontrollida.
  • Valimi suuruse alahindamine. Statistiline võimsus on 2 x 2 kujunduses madal; Tulemusi tuleks tõlgendada ettevaatusega.

Kokkuvõttes

Omicsi analüüs töötab suuremõõtmeliste mürarikaste andmetega ning tehisintellekt kiirendab neid andmeid skaneerides, kirjutades skripte ja märgistades mustreid. Kuid mitmekordne testi korrigeerimine diferentsiaalekspressioonis, partii kontroll PCA-ga ja allika kontrollimine rikastamisel on hädavajalikud. Multi-oomika integreerimine on võimas, kuid eksitav; Kontrollige iga tulemust bioloogilise järjepidevusega, võttes arvesse kihtide ulatust ja müraerinevusi.

Rakenduse ülesanne

Leidke avalikult kättesaadav RNA-seq loendusmaatriks (nt GEO-st). Laske tehisintellektil kirjutada analüüsiskript malliga "DESeq2 workflow" ja kontrollige koodi, kas mitme testimise parandus on tegelikult rakendatud. Seejärel küsige tehisintellektilt rikastamiskommentaari ja kontrollige ükshaaval kõiki selle tagastatud raja ID-sid KEGG või GO andmebaasi põhjal; Pange tähele, kui paljud neist on tõelised.

kontrollnimekiri

  • [ ] Diferentsiaalanalüüsis kasutasin padj-d (parandatud), mitte töötlemata p-väärtust.
  • [ ] Kontrollisin PCA-ga partiiefekti ja lisasin selle vajadusel mudelile.
  • [ ] Tõlgendasin ettevaatlikult geene, millel on suur kordne muutus, kuid madal ekspressioon.
  • [ ] Kontrollisin iga rada/GO ID-d tegeliku andmebaasiga.
  • [ ] Hindasin valimi suuruse statistilist võimsust.
  • [ ] Jagasin multi-oomika vastuolud bioloogilisteks ja tehnilisteks põhjusteks.