Vienība 3 / 10

Omics datu analīze: transkriptomika, proteomika un multi-omikas integrācija

Ieguvumi:

  • Vairāku testu korekcija (labota p vērtība) diferenciālās izteiksmes analīzē un spēja pareizi interpretēt locījuma izmaiņas un izvairīties no viltus pozitīvajiem rezultātiem
  • Partijas efekta noteikšana un pievienošana modelim ar PCA un tehniskā trokšņa atdalīšana no bioloģiskās atšķirības
  • Spēja saistīt katru ceļa identitāti ar avotu un kontrolēt to ar bioloģisko konsekvenci ceļa bagātināšanā un multi-omikas integrācijā

Šūna nav viens skaitlis; Tā ir sistēma, kurā vienlaikus dejo tūkstošiem gēnu, olbaltumvielu un metabolītu. Omics (kolektīvs nosaukums pieejām, kas mēra bioloģisko slāni kopumā) mēģina uztvert visu šo deju: genomika (DNS), transkriptomika (RNS — kuri gēni darbojas un cik daudz), proteomika (olbaltumvielas), metabolomika (mazas molekulas). Katrs omikas slānis rada tūkstošiem izmēru, trokšņainu un dārgu datu. AI ir spēcīgs, lai skenētu šos augstas dimensijas datus un iezīmētu modeļus; Bet jūs esat tas, kurš izlemj, kurš modelis ir bioloģiskā patiesība un kurš ir tehniskais troksnis.

Šajā nodaļā mēs turpināsim transkriptomiku, kas ir visizplatītākā omikas analīze; Principi attiecas arī uz citiem slāņiem. Tipiska darbplūsma: ekspresijas matrica no neapstrādātiem datiem (rindas ir gēni, kolonnas ir paraugi, šūnas ir ekspresijas līmeņi), normalizēšana (tehnisko atšķirību noņemšana), diferenciālā ekspresijas analīze (gēnu atrašana, kas būtiski mainās starp diviem nosacījumiem), ceļa bagātināšana (noskaidrošana, kuros bioloģiskajos ceļos ir grupēti mainītie gēni) un interpretācija.

Diferenciālā izteiksme: locījuma maiņa un labota p vērtība

Lai noteiktu, vai gēns ir “mainījies”, tiek aplūkoti divi skaitļi: kārtu maiņa — cik reižu izteiksme palielinās/samazinās, parasti log2 skalā, un koriģētā p vērtība (padj — statistika, kas kontrolē kļūdaini pozitīvus rezultātus, veicot vairākas pārbaudes). Kāpēc labot? Jo jūs vienlaikus pārbaudāt 20 000 gēnu; Pat nejauši simtiem gēnu var izrādīties "nozīmīgi". Bez vairākkārtējas pārbaudes korekcijas — viltus atklāšanas ātruma ierobežošana ar tādām metodēm kā Benjamini-Hochberg — saraksts ir maldinošs. AI var uzrakstīt skriptu, kas aprēķina šo statistiku, bet, ja tas izlaiž labojumu, jūsu rezultāts ir zinātniski nepamatots.

Uzmanību! Pamatojoties uz neapstrādāto p-vērtību, mākslīgais intelekts var teikt, ka 500 gēnu ir būtiski mainījušies. Aplūkojot laboto p vērtību, skaitlis varētu samazināties līdz 30. Vienmēr pārbaudiet vairāku testu korekciju pats; Šī ir atšķirība starp publikācijas pieņemšanu un noraidīšanu.

Partijas efekts: vismānīgākais slazds

Partijas efekts (tehniskā atšķirība, kas rodas, apstrādājot paraugus dažādās dienās, ierīcēs vai cilvēkos) ir lielākais kļūdu avots omikas analīzē. Ja jūsu divi nosacījumi tika apstrādāti divās dažādās dienās, redzamā "bioloģiskā atšķirība" faktiski var būt dienas atšķirība. AI var ieteikt modelim pievienot partijas mainīgo (piemēram, ~ partija + nosacījums), taču jūs esat atbildīgs par tā pareizu iestatīšanu un nesajaukšanu eksperimentālajā dizainā.

Padoms. Pirms analīzes sākšanas uzzīmējiet PCA (Principal Component Analysis — metode, kas apkopo un vizualizē augstas dimensijas datus uz vairākām asīm) diagrammu. Ja paraugi ir grupēti pēc partijas, nevis pēc bioloģiskā stāvokļa, partijas efekts ir dominējošs un vispirms ir jākoriģē.

Multi-omics integrācija

Īsta izpratne bieži rodas, apvienojot slāņus: ja gēns strādā vairāk, bet tā proteīns nepalielinās, regulēšana notiek translācijas līmenī. Multi-omics integrācija — dažādu omikas slāņu apvienošana vienā modelī — AI kļūst spēcīgāka, taču arī visvairāk maldina; jo slāņu mērogi, trokšņi un paraugu atbilstības atšķiras. AI iesaka integrācijas darbplūsmu, taču jūs kontrolējat rezultātu bioloģisko konsekvenci.

trīs mini futrāļi

1. gadījums — bagātināšana paātrināta. Vēža projektā tika atrasti 1240 diferenciāli gēni. AI sagatavoja tos ceļa bagātināšanai, izceļot šūnu ciklu un DNS remonta ceļus; Komanda izveidoja hipotēzes karti 2 stundu laikā. Taču viņi atkārtoti pārbaudīja katru ceļu ar neatkarīgu rīku (g:Profiler) un atklāja, ka AI ir nepareizi kartējis vienu ceļu.

2. gadījums — partijas slazds. Viena laboratorija atklāja "pārsteidzošu" 900 gēnu atšķirību starp divām ārstēšanas grupām. Kad viņi veica PCA, viņi redzēja, ka paraugi tika atdalīti ar sekvencēšanas partiju. Pēc partijas korekcijas faktiskā atšķirība samazinājās līdz 60 gēniem. AI pirmajā analīzē netīši bija izlaidis partijas mainīgo.

3. gadījums — izdomāts ceļa nosaukums. Kāds students iedeva AI gēnu sarakstu un jautāja: "Kurš KEGG ceļš?" AI sniedza ceļa ID un nosaukumu tā, it kā tas būtu īsts. Kad students meklēja KEGG, viņš redzēja, ka šī ID nepastāv; pārbaude neļāva iegūt safabricētu rezultātu.

Četras kopējamas veidnes

1) DESeq2 darbplūsmas izklāsts:

Jūsu loma: skaitļošanas biologs. Uzrakstiet soli pa solim skriptu RNS-seq diferenciālās izteiksmes analīzei ar R/DESeq2: skaitīšanas matricas nolasīšana, dizaina formula (~ partija + nosacījums), normalizācija, rezultātu tabula. TIEŠI pielietojiet vairāku testēšanas korekciju (BH) un izmantojiet kolonnu padj. Komentāra rindiņā paskaidrojiet, ko dara katrs solis.

2) Kvalitātes/partijas kontrole:

Sniedziet man RNA-seq QC kontrolsarakstu: partijas kontrole ar PCA, bibliotēkas lielums, gēnu noteikšanas skaits, izņēmuma noteikšana. Katrai metrikai norādiet slieksni “tas, ko es redzu, liek man uztraukties”. Paskaidrojiet, kas man jādara, ja partija un bioloģiskais stāvoklis ir sajaukti.

3) Bagātināšanas rezultātu pārbaude:

Es jums iedošu bagātinātu ceļu sarakstu (ceļu skaits, padj, gēni). Pierakstiet katra ceļa identitāti (KEGG/GO ID) burtiski un neizdomājiet to. Filtrēt rezultātus ar padj < 0,05. Norādiet, kuri ceļi bioloģiski atbalsta viens otru, bet atzīmējiet katru identitāti kā "jāpārbauda datu bāzē".

4) Multi-omics konsekvences pārbaude:

Transkriptomiskais un proteomiskais rada pretrunīgus ekspresijas virzienus gēnu / olbaltumvielu pārim. Uzskaitiet iespējamos bioloģiskos (pēctulkošanas rediģēšanas) un tehniskos (mērījumu troksnis, paraugu saskaņošana) iemeslus un pastāstiet man, kā tos pārbaudīt.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Nosauciet svarīgos ceļus šajā gēnu sarakstā.

Nav avotu, nav statistikas, augsts safabricētu ceļu risks.

Spēcīga uzvedne:

Jūsu loma: skaitļošanas biologs. Pievienotajā diferenciālo gēnu tabulā (gēns, log2FC, padj) ņem tikai gēnus, kuru padj < 0,05. Pastāstiet man GO bagātināšanas analīzes darbības, kas jāveic ar šiem gēniem un rīku (g:Profiler), ko es izmantošu. Ceļa nosaukums ir FAKE; Es palaidīšu rīku un veicu analīzi, jūs vienkārši aprakstiet pareizo metodiku un vairāku testu korekciju.

Atšķirība: skaidrs filtrs, metodoloģijas fokuss, izgatavošanas aizliegums un verifikācijas atstāšana lietotāja ziņā.

Omics analīzes soļi

solis

Mērķis

izplatīta kļūda

AI loma

normalizācija

Novērst tehniskās atšķirības

Nepareiza metodes izvēle

Skripts + pamatojums

PCA/QC

Partijas un nobīdes noteikšana

izlaid manu soli

Attēls + komentārs

diferenciālā izteiksme

Mainīgu gēnu atrašana

Nelabots lpp

Skripta melnraksts

bagātināšana

atrast ceļu

izgatavots ceļš

metodoloģija

integrācija

apvienot slāņus

Mēroga/atbilstības kļūda

Darbplūsmas ieteikums

Vienas šūnas omika: jauna skala

Pēdējos gados vienšūnu sekvencēšana — katras tūkstošiem šūnu ekspresijas profila mērīšana atsevišķi — ir pārņēmusi omiku jaunā dimensijā. Tagad "vidējās audu izpausmes" vietā mēs varam redzēt katru šūnu tipu šajā audā atsevišķi. Šī jauda rada jaunas nepilnības: dati ir ārkārtīgi reti (lielākajai daļai gēnu vairumā šūnu ir nulle nolasījumu — atbirums), lielums ir desmitiem tūkstošu šūnu × divdesmit tūkstoši gēnu, un šūnu tipu atdalīšana galvenokārt tiek veikta, veidojot klasterus. AI spēj izveidot klasterizācijas un šūnu tipu marķēšanas kontūras uz vienas šūnas datiem; bet jūs ar zināmiem marķieru gēniem pārbaudiet, vai katra klastera ir īsts šūnu tips vai tehnisks artefakts (piemēram, atmirušās šūnas, divas kopā noķertas šūnas). Nepieņemiet AI ieteikto šūnu tipa marķējumu, ja faktiskajā literatūrā nav apstiprināti šīs kopas marķieru gēni.

Padoms. Ja vienas šūnas analīzē mākslīgais intelekts klasterim iesaka "T šūnu" marķējumu, pārbaudiet pats, vai T šūnu marķieri (piemēram, CD3) patiešām ir ļoti izteikti šajā klasterī. Ja marķējums netiek atbalstīts ar marķieri, tā ir hipotēze, nevis secinājums.

Biežas kļūdas

  • Vairāku testu korekcijas izlaišana. Saraksts uzbriest ar neapstrādātu p-vērtību; padj jālieto.
  • Bioloģijas partijas efekta kļūda. Vispirms tas jāpārbauda ar PCA.
  • Vienīgais kritērijs ir grīdas maiņa. Augstas locījuma izmaiņas var būt maldinošas gēnos ar zemu ekspresiju, trokšņainiem gēniem.
  • Izstrādātā ceļa/GO identitātes pieņemšana. Katra identitāte ir jāpārbauda datu bāzē.
  • Parauga lieluma nenovērtēšana. Statistiskā jauda ir zema 2 x 2 dizainā; Rezultāti jāinterpretē piesardzīgi.

Rezumējot

Omics analīze darbojas ar augstas dimensijas, trokšņainiem datiem, un AI paātrina šos datus, skenējot tos, rakstot skriptus un iezīmējot modeļus. Taču ir nepieciešama daudzkārtēja testa korekcija diferenciālajā izteiksmē, partijas kontrole ar PCA un avota pārbaude bagātināšanā. Multi-omics integrācija ir spēcīga, taču maldinoša; Pārbaudiet katru rezultātu ar bioloģisko konsekvenci, ņemot vērā slāņu mēroga un trokšņu atšķirības.

Lietojumprogrammas uzdevums

Atrodiet publiski pieejamu RNS-seq skaitīšanas matricu (piemēram, no GEO). Lūdziet AI uzrakstīt analīzes skriptu ar veidni "DESeq2 darbplūsma" un pārbaudiet kodu, vai tiešām ir piemērota vairāku testu korekcija. Pēc tam palūdziet AI sniegt bagātināšanas komentāru un pēc kārtas pārbaudiet visus ceļu ID, ko tas atgriež, salīdzinot ar KEGG vai GO datubāzi; Ņemiet vērā, cik daudz ir reālu.

kontrolsaraksts

  • [ ] Diferenciālajā analīzē izmantoju padj (labotu), nevis neapstrādāto p vērtību.
  • [ ] Es pārbaudīju partijas efektu ar PCA un, ja nepieciešams, pievienoju to modelim.
  • [ ] Es piesardzīgi interpretēju gēnus ar lielām locījuma izmaiņām, bet zemu ekspresiju.
  • [ ] Es pārbaudīju katru ceļu/GO ID, salīdzinot ar reālo datu bāzi.
  • [ ] Es novērtēju izlases lieluma statistisko jaudu.
  • [ ] Multiomikas pretrunas sadalīju bioloģiskajos un tehniskajos cēloņos.