Yunit 3 / 10

Pagsusuri ng Data ng Omics: Transcriptomics, Proteomics at Multi-Omics Integration

Mga nadagdag:

  • Pagwawasto ng maramihang pagsubok (naitama ang p-value) sa pagsusuri ng differential expression at ang kakayahang wastong bigyang-kahulugan ang pagbabago ng fold at maiwasan ang mga maling positibo
  • Pag-detect ng batch effect at pagdaragdag nito sa modelo na may PCA at paghihiwalay ng teknikal na ingay mula sa biological na pagkakaiba
  • Kakayahang iugnay ang bawat pathway identity sa pinagmulan at kontrolin ito nang may biological consistency sa pathway enrichment at multi-omics integration

Ang isang cell ay hindi isang solong numero; Ito ay isang sistema kung saan ang libu-libong mga gene, protina at metabolite ay sumasayaw nang sabay-sabay. Ang Omics (ang kolektibong pangalan para sa mga diskarte na sumusukat sa isang biological layer sa kabuuan) ay sinusubukang makuha ang buong sayaw na ito: genomics (DNA), transcriptomics (RNA — kung aling mga gene ang gumagana at kung magkano), proteomics (protina), metabolomics (maliit na molekula). Ang bawat layer ng omics ay gumagawa ng libu-libong dimensional, maingay at magastos na data. Makapangyarihan ang AI sa pag-scan sa high-dimensional na data na ito at sa mga pattern ng pagmamarka; Ngunit ikaw ang magpapasya kung aling pattern ang biological truth at alin ang teknikal na ingay.

Sa yunit na ito, magpapatuloy tayo sa pamamagitan ng transcriptomics, ang pinakakaraniwang pagsusuri ng omics; Nalalapat din ang mga prinsipyo sa iba pang mga layer. Karaniwang daloy ng trabaho: expression matrix mula sa raw data (mga row ay mga gene, mga column ay mga sample, ang mga cell ay mga antas ng expression), normalisasyon (pag-aalis ng mga teknikal na pagkakaiba), differential expression analysis (paghahanap ng mga gene na makabuluhang nagbabago sa pagitan ng dalawang kundisyon), pathway enrichment (paghanap kung aling mga biological pathway ang pinagsama-samang mga gene) at interpretasyon.

Differential expression: fold change at naitama ang p-value

Para malaman kung “nagbago” ang isang gene, dalawang numero ang tinitingnan: fold change — kung ilang beses tumataas/bumababa ang expression, kadalasan sa log2 scale — at inayos ang p-value (padj — ang istatistikang kumokontrol para sa mga maling positibo kapag maraming pagsubok ang ginawa). Bakit ayusin? Dahil sinusubok mo ang 20,000 genes sa parehong oras; Kahit na nagkataon, daan-daang mga gene ang maaaring maging "makabuluhan". Kung walang maraming pagsubok na pagwawasto—paglilimita sa maling rate ng pagtuklas sa mga pamamaraan tulad ng Benjamini-Hochberg—ang listahan ay nakaliligaw. Maaaring isulat ng AI ang script na kinakalkula ang istatistikang ito, ngunit kung aalisin nito ang pagwawasto, ang iyong resulta ay hindi maipagtatanggol sa siyensya.

Babala: Maaaring sabihin ng AI na "500 genes ang nagbago nang malaki" batay sa raw p-value. Sa pagtingin sa itinamang p-value, ang numero ay maaaring bumaba sa 30. Palaging suriin ang multi-test correction sa iyong sarili; Ito ang pagkakaiba sa pagitan ng pagtanggap at pagtanggi sa publikasyon.

Batch effect: ang pinaka mapanlinlang na bitag

Ang batch effect (teknikal na pagkakaiba na nagmumula sa pagpoproseso ng mga sample ng iba't ibang araw, device o tao) ay ang pinakamalaking pinagmumulan ng error sa pagsusuri ng omics. Kung ang iyong dalawang kundisyon ay naproseso sa dalawang magkaibang araw, ang "biological difference" na nakikita mo ay maaaring aktwal na ang pagkakaiba sa araw. Maaaring magmungkahi ang AI na idagdag ang batch variable sa modelo (hal. ~ batch + condition), ngunit responsibilidad mong i-set up ito nang tama at huwag ihalo ito sa pang-eksperimentong disenyo.

Tip: Bago simulan ang pagsusuri, gumuhit ng PCA (Principal Component Analysis - isang paraan na nagbubuod at nagvi-visualize ng high-dimensional na data sa ilang axes) na tsart. Kung ang mga sample ay pinagsama ayon sa batch sa halip na sa pamamagitan ng biological na kondisyon, ang epekto ng batch ay nangingibabaw at dapat na itama muna.

Multi-omics integration

Ang tunay na pag-unawa ay kadalasang nagmumula sa pagsasama-sama ng mga layer: kung ang isang gene ay nagtatrabaho nang mas mahirap ngunit ang protina nito ay hindi tumataas, ang regulasyon ay nasa antas ng pagsasalin. Multi-omics integration—pagsasama-sama ng iba't ibang layer ng omics sa isang solong modelo—ay kung saan lumalakas ang AI ngunit kung saan ito ang pinakamalilinlang; dahil ang mga kaliskis, ingay at mga sample na tugma ng mga layer ay iba. Ang AI ay nagmumungkahi ng isang integration workflow, ngunit kinokontrol mo ang biological consistency ng mga resulta.

tatlong mini case

Case 1 — Pinabilis ang pagpapayaman. 1,240 differential genes ang natagpuan sa isang proyekto ng kanser. Pinangunahan sila ng AI para sa pagpapayaman ng pathway, pag-highlight ng cell cycle at mga pathway sa pag-aayos ng DNA; Gumawa ang team ng hypothesis map sa loob ng 2 oras. Ngunit sinubukan nilang muli ang bawat pathway gamit ang isang independiyenteng tool (g:Profiler) at nalaman nilang ang isang pathway ay na-mismapped ng AI.

Kaso 2 — Batch trap. Nakita ng isang laboratoryo ang isang "kapansin-pansin" na 900-gene na pagkakaiba sa pagitan ng dalawang grupo ng paggamot. Nang magsagawa sila ng PCA, nakita nila na ang mga sample ay pinaghiwalay sa pamamagitan ng sequencing batch. Pagkatapos ng batch correction, ang aktwal na pagkakaiba ay bumaba sa 60 genes. Hindi sinasadyang tinanggal ng AI ang batch variable sa unang pagsusuri.

Case 3 — Made-up na pangalan ng pathway. Ibinigay ng isang estudyante ang listahan ng gene sa AI at nagtanong, "Aling landas ng KEGG?" Nagbigay ang AI ng pathway ID at pangalan na parang ito ay totoo. Nang maghanap ang estudyante sa KEGG, nakita niyang wala ang ID na iyon; napigilan ng pag-verify ang isang gawa-gawang resulta.

Apat na maaaring kopyahin na mga template

1) Outline ng daloy ng trabaho ng DESeq2:

Ang iyong tungkulin: computational biologist. Sumulat ng step-by-step na script para sa RNA-seq differential expression analysis na may R/DESeq2: count matrix reading, design formula (~ batch + condition), normalization, result table. TAHASANG ilapat ang maramihang pagwawasto sa pagsubok (BH) at gamitin ang padjcolumn. Ipaliwanag kung ano ang ginagawa ng bawat hakbang sa isang linya ng komento.

2) Kontrol sa kalidad/batch:

Bigyan mo ako ng RNA-seq QC checklist: batch control na may PCA, laki ng library, bilang ng mga gene detection, outlier detection. Para sa bawat sukatan, tumukoy ng threshold na "nakakabahala sa akin ang nakikita ko." Ipaliwanag kung ano ang dapat kong gawin kung magkakahalo ang batch at biological na kondisyon.

3) Pag-verify ng resulta ng pagpapayaman:

Bibigyan kita ng enriched pathway list (bilang ng mga pathway, padj, genes). Isulat ang pagkakakilanlan ng bawat pathway (KEGG/GO ID) verbatim at huwag gawin ito. I-filter ang mga resulta gamit ang padj < 0.05. Tukuyin kung aling mga pathway ang biologically na sumusuporta sa isa't isa, ngunit markahan ang bawat pagkakakilanlan bilang "dapat ma-verify sa database."

4) Multi-omics consistency check:

Ang transcriptomic at proteomic ay nagbubunga ng magkasalungat na direksyon ng expression para sa isang pares ng gene/protein. Ilista ang mga posibleng biyolohikal (pag-edit pagkatapos ng pagsasalin) at teknikal (ingay sa pagsukat, pagtutugma ng sample) para dito at sabihin sa akin kung paano subukan ang bawat isa.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Pangalanan ang mahahalagang landas sa listahan ng gene na ito.

Walang mga mapagkukunan, walang istatistika, mataas na panganib ng mga gawa-gawang landas.

Napakahusay na prompt:

Ang iyong tungkulin: computational biologist. Sa nakalakip na differential gene table(gene, log2FC, padj) ay kumuha lamang ng mga gene na may padj <0.05. Sabihin sa akin ang mga hakbang ng pagsusuri sa pagpapayaman ng GO na isasagawa gamit ang mga gene na ito at ang tool (g:Profiler) na gagamitin ko. Ang pangalan ng pathway ay PEKE; Tatakbuhin ko ang tool at gagawin ang pagsusuri, ilalarawan mo lamang ang tamang pamamaraan at pagwawasto ng maraming pagsubok.

Pagkakaiba: malinaw na filter, focus sa pamamaraan, pagbabawal sa paggawa at pag-iwan ng pag-verify sa user.

Mga hakbang sa pagsusuri ng Omics

hakbang

Layunin

karaniwang pagkakamali

tungkulin ng AI

normalisasyon

Tanggalin ang teknikal na pagkakaiba

Maling paraan ng pagpili

Script + katwiran

PCA/QC

Batch at outlier detection

laktawan ang aking hakbang

Larawan + komento

pagkakaiba ng pagpapahayag

Paghahanap ng mga nagbabagong gene

Hindi naitama p

draft ng script

pagpapayaman

humanap ng landas

gawa-gawang landas

metodolohiya

pagsasama

pagsamahin ang mga layer

Error sa sukat/tugma

Rekomendasyon sa daloy ng trabaho

Single cell omics: isang bagong sukat

Sa mga nakalipas na taon, ang single-cell sequencing — pagsukat ng expression profile ng bawat libu-libong cell nang hiwalay — ay nagdala ng omics sa isang bagong dimensyon. Ngayon, sa halip na "ang average na pagpapahayag ng isang tissue," maaari nating makita ang bawat uri ng cell sa loob ng tissue na iyon nang hiwalay. Ang kapangyarihang ito ay nagpapakilala ng mga bagong pitfalls: ang data ay lubhang kalat-kalat (karamihan sa mga gene ay may zero reads sa karamihan ng mga cell—dropout), ang laki ay sampu-sampung libong mga cell × dalawampu't-libong mga gene, at ang paghihiwalay ng mga uri ng cell ay kadalasang ginagawa sa pamamagitan ng clustering. Ang AI ay makapangyarihan sa paggawa ng clustering at cell type labelling outlines sa solong data ng cell; ngunit ibe-verify mo gamit ang mga kilalang marker gene kung ang bawat cluster ay isang tunay na uri ng cell o isang teknikal na artifact (hal. mga patay na cell, dalawang cell na pinagsama-sama). Huwag tanggapin ang label ng uri ng cell na iminungkahi ng AI nang hindi kinukumpirma ang mga marker gene ng cluster na iyon sa aktwal na literatura.

Tip: Sa isang solong-cell na pagsusuri, kung ang AI ​​ay nagmumungkahi ng isang "T cell" na label sa isang cluster, suriin para sa iyong sarili kung ang mga T cell marker (hal. CD3) ay talagang mataas na ipinahayag sa cluster na iyon. Kung ang label ay hindi sinusuportahan ng token, ito ay isang hypothesis, hindi isang konklusyon.

Mga karaniwang pagkakamali

  • Nilaktawan ang maramihang pagwawasto sa pagsubok. Ang listahan swells na may raw p-value; padj dapat gamitin.
  • Napagkamalan ang batch effect para sa biology. Dapat itong suriin muna sa PCA.
  • Ang pagpapalit ng sahig ang tanging pamantayan. Ang pagbabago sa mataas na fold ay maaaring mapanlinlang sa mababang expression, maingay na mga gene.
  • Pagtanggap sa ginawang pathway/GO identity. Ang bawat pagkakakilanlan ay dapat na ma-verify sa database.
  • Minamaliit ang laki ng sample. Mababa ang statistic power sa isang 2 by 2 na disenyo; Ang mga resulta ay dapat bigyang-kahulugan nang may pag-iingat.

Sa buod

Gumagana ang Omics analysis sa high-dimensional, maingay na data, at pinapabilis ng AI ang data na ito sa pamamagitan ng pag-scan dito, pagsulat ng mga script, at pagmamarka ng mga pattern. Ngunit ang maramihang pagwawasto ng pagsubok sa differential expression, kontrol ng batch na may PCA at pag-verify ng pinagmulan sa pagpapayaman ay kailangang-kailangan. Ang multi-omics integration ay malakas ngunit nakaliligaw; Suriin ang bawat resulta nang may biological consistency, na isinasaalang-alang ang laki at pagkakaiba ng ingay ng mga layer.

Gawain ng aplikasyon

Maghanap ng pampublikong available na RNA-seq count matrix (hal. mula sa GEO). Hayaang magsulat ang AI ng isang script ng pagsusuri na may template na "DESeq2 workflow" at suriin sa code na ang maramihang pagwawasto sa pagsubok ay aktwal na nailapat. Pagkatapos ay humingi ng komento sa pagpapayaman sa AI at i-verify ang lahat ng pathway ID na ibinabalik nito nang paisa-isa laban sa database ng KEGG o GO; Pansinin kung ilan ang totoo.

checklist

  • [ ] Gumamit ako ng padj (corrected) sa differential analysis, hindi ang raw p-value.
  • [ ] Sinuri ko ang batch effect sa PCA at idinagdag ito sa modelo kung kinakailangan.
  • [ ] Ininterpret ko ang mga gene na may mataas na fold change ngunit mababa ang expression nang may pag-iingat.
  • [ ] Na-verify ko ang bawat pathway/GO ID laban sa totoong database.
  • [ ] Sinuri ko ang statistical power ng sample size.
  • [ ] Hinati ko ang mga kontradiksyon ng multi-omics sa biyolohikal at teknikal na mga dahilan.