Yunit 6 / 11

Pagsusuri ng Data ng Omics: RNA-seq, Expression, Statistics at Pathway Enrichment

Mga nadagdag:

  • Kakayahang maunawaan ang RNA-seq workflow, differential expression analysis at multiple testing correction (FDR) at magkaroon ng artificial intelligence na makagawa ng verifiable analysis code
  • Kakayahang kritikal na bigyang-kahulugan ang mga resulta ng pagpapayaman ng pathway ayon sa istatistika at biyolohikal
  • Kakayahang gamitin ang disiplina ng pagsuri sa mga istatistikal na pagpapalagay at maramihang pagsubok na mga pitfalls at independiyenteng pag-verify ng biological na kahalagahan.

Ang "Omics" ay ang kolektibong pangalan para sa mga diskarte na sumusukat sa lahat ng molekula ng isang cell o tissue nang magkasama: genomics (lahat ng DNA), transcriptomics (lahat ng RNA/expression), proteomics (lahat ng mga protina), metabolomics (lahat ng metabolites). Napakalaki ng data na ito — ang isang RNA-seq na eksperimento ay nagsasangkot ng mga sukat ng sampu-sampung libong mga gene. Sa unit na ito, matututunan mo kung paano gamitin ang artificial intelligence (AI) bilang isang katulong sa pagsusuri ng omics na nagsusulat ng code, pumipili ng mga istatistika, at nag-draft ng biological na interpretasyon; ngunit malalaman mo kung bakit kailangan mong i-verify ang istatistika at biyolohikal na resulta.

Kritikal na babala: Sa Omics, ang pinakamapanganib na mga error ay istatistika at hindi nakikita. Ang AI ​​ay maaaring magsulat ng code na lumalampas sa maramihang pagwawasto ng paghahambing (sa ibaba), pumili ng maling pagsubok, o gumagawa ng mga listahan ng gene na "false positive". Bilang karagdagan, ang AI ay maaaring gumawa ng mga biological na claim tulad ng "ang gene na ito ay tumataas sa sakit na iyon" nang walang anumang pinagmulan. Ang tamang paraan: gawin ang pagsusuri gamit ang executable, auditable code at kumpirmahin ang bawat biological claim sa literatura.

Pangunahing konsepto

  • Expression: Gaano karami ang isang gene na isinalin sa RNA; sukatan ng "aktibidad".
  • Differential expression (DE): Mga gene na malaki ang pagbabago sa expression sa pagitan ng dalawang grupo (hal., pasyente/malusog).
  • p-value: Ang posibilidad na ang pagkakaiba ay isang pagkakataon; kung ito ay maliit, ang pagkakaiba ay itinuturing na "makabuluhan".
  • Pagwawasto ng maramihang paghahambing: Kapag ang sampu-sampung libong mga gene ay tiningnan nang sabay, kung nagkataon ay magkakaroon ng ilan na "makabuluhan". Upang ayusin ito, ginagamit ang mga pamamaraan tulad ng FDR (false discovery rate) / Benjamini-Hochberg. Kung aalisin ang pagwawasto na ito, daan-daang maling natuklasan ang lalabas.
  • log2 fold change (log2FC): Ang logarithm ng expression ratio ng isang gene sa pagitan ng dalawang grupo hanggang sa base 2; Ang +1 ay nangangahulugan ng dalawang beses na pagtaas, −1 ay nangangahulugan ng dalawang beses na pagbaba.
  • Pathway enrichment: Paghanap kung aling mga biological pathways (e.g. cell division, immunity) ang mga binagong gene ay puro; Ginagamit ang mga database tulad ng GO at KEGG.
  • Batch effect: Non-biological spurious difference na nagmumula sa pagpoproseso ng mga sample sa iba't ibang araw/device.

Hakbang-hakbang: Pagsusuri ng omics na pinapagana ng AI

1. Linawin ang eksperimental na disenyo at tanong. Ilang sample, ilang grupo, ilang repetitions? Sapat ba ang statistical power? Ipaliwanag ang disenyo sa AI.

2. Piliin ang naaangkop na tool/paraan na may AI. Para sa RNA-seq, pumili ng mga karaniwang pamamaraan tulad ng DESeq2/edgeR (mga pakete ng istatistika na idinisenyo para sa data ng pagbibilang); Gumamit ng mga napatunayang pamamaraan sa halip na isang istatistika na "binuo" ng AI.

3. Patakbuhin ang code at suriin ang mga intermediate na output. Huwag magpatuloy sa pagsusuri ng DE nang walang normalisasyon, kontrol sa epekto ng batch, mga plot ng kalidad (PCA).

4. Ipatupad ang maramihang pagwawasto ng paghahambing. I-filter ang mga resulta ayon sa corrected value (padj/FDR), hindi raw p-value.

5. Kumpirmahin ang biyolohikal na interpretasyon sa panitikan. I-interpret ang output ng pathway enrichment gamit ang AI, ngunit i-verify ang bawat claim sa pinagmulan.

Tip: Sa isang pagsusuri sa DE, tingnan muna ang kalidad at pinagsama-samang mga graph ng epekto. Kung ang mga sample ay pinagsama-sama sa araw na naproseso ang mga ito sa halip na sa pamamagitan ng biological na grupo, karamihan sa mga "makabuluhang" genes na makikita mo ay pinagsama-samang mga epekto, hindi tunay na biology.

tatlong mini case

Case 1 — Hindi naitama ang p-value. Sinubukan ng isang estudyante ang 20,000 gene na may code na isinulat ng AI at natagpuan ang "540 makabuluhang genes." Nang suriin niya ang code, nakita niya na ang AI ay nilaktawan ang maraming pagwawasto ng paghahambing. Noong idinagdag ang FDR correction, bumaba ang bilang ng mga makabuluhang gene sa 32. Kung wala ang pagwawasto, higit sa 500 false genes ang ibabatay sa kuwento.

Case 2 — Fabricated biological claim. Para sa isang gene sa listahan ng DE, tinanong ng isang mananaliksik ang AI "ano ang ginagawa ng gene na ito sa sakit na ito?" tanong niya; Ipinaliwanag ng AI ang isang nakakumbinsi na mekanismo at ang artikulo. Nang maghanap siya sa PubMed, nakita niyang wala ang mekanismong iyon o ang artikulo. Inalis ang claim sa ulat.

Case 3 — Nakuha ang kumpirmasyon. Napansin ng isang PhD na mag-aaral na ang mga sample ay pinaghiwalay ng dalawang araw sa PCA plot. Hiniling sa AI na magdagdag ng batch effect variable sa code; Pagkatapos ng pagwawasto, ang listahan ng gene ay ganap na nabago at naging biologically makabuluhan. Kung wala ang quality control chart, maaaring na-publish ang isang pekeng resulta.

Halimbawa: pag-filter gamit ang itinamang p-value

mag-import ng mga pandas bilang pd# hayaan ang table 'de' na maging mga resulta mula sa isang DE tool (DESeq2/edgeR):# column: gene, log2FC, pvalue, padj (FDR-corrected)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0.05") &"(de["padj"] < 0.05) 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR-corrected padj<0.05 & |log2FC|>=1:", len(significant))

Ang pagkakaiba sa pagitan ng raw at naitama na numero ay naglalarawan kung bakit kritikal ang maraming paghahambing.

Apat na maaaring kopyahin na mga template

1) Plano ng pagsusuri at pagpili ng paraan:

Ang iyong tungkulin: bioinformatics assistant. I-set up ang plano ng pagsusuri para sa sumusunod na RNA-seq na eksperimento:[bilang ng mga pangkat, bilang ng mga sample/replicates, tanong]. Aling karaniwang tool (DESeq2/edgeR) ang dapat kong piliin at bakit, anong mga hakbang sa pagkontrol sa kalidad (PCA, batch effect) ang kailangan, paano ako maglalapat ng maramihang pagwawasto ng paghahambing? Sumulat ng hakbang-hakbang.

2) Code + mandatoryong pagsusuri:

Sumulat ng executable code na nagsasagawa ng sumusunod na pagsusuri sa DE: [detalye]. DAPAT kasama sa code ang normalization, PCA quality plot, batch effect control, at FDR (Benjamini-Hochberg) correction. Magkomento sa bawat hakbang. I-filter na may itinamang p-value, hindi raw p-value.

3) Pathway enrichment comment:

Tumulong na bigyang-kahulugan ang mga resulta ng pagpapayaman ng pathway para sa listahang ito ng mahahalagang gene: [listahan/output]. Ipaliwanag kung aling mga pathway ang kitang-kita, ngunit sabihin sa akin kung saang pinagmulan (GO, KEGG, peer-reviewed na artikulo) upang kumpirmahin ang bawat biological na claim. Mechanism/article FITTING.

4) Pag-audit ng istatistika:

Suriin ang sumusunod na code ng pagsusuri para sa mga error sa istatistika: [code]. Partikular: hindi tamang pagpili ng pagsubok, pagtanggal ng maramihang pagwawasto ng paghahambing, hindi papansin ang epekto ng batch, hindi sapat na pagtitiklop. Ilista ang bawat problemang nahanap mo at ang pag-aayos nito.

Mahinang prompt / Malakas na prompt

Mahina: "Maghanap ng mga makabuluhang gene sa RNA-seq data na ito."

Problema: Ang pamamaraan, kontrol sa kalidad, at maraming paghahambing ay hindi tinukoy; Ang AI ay maaaring magbigay ng isang listahan na puno ng mga maling positibo nang walang pagwawasto.

Strong: "Sumulat ng code na nagsasagawa ng DE analysis para sa RNA-seq count data na ito na may DESeq2 logic, kasama ang quality control at bulk effect control sa PCA, at mga filter na may FDR correction; magkomento sa bawat hakbang at ipaliwanag kung bakit mo pinili ang paraang ito."

Bakit ito makapangyarihan: Ang pamamaraan ay pamantayan, ang kalidad at pagwawasto ay sapilitan, ang resulta ay naa-audit.

Panganib

sintomas

pag-iingat

maling positibo

Masyadong maraming "makabuluhang" gene

Pagwawasto ng FDR/maramihang paghahambing

kolektibong epekto

Ang mga sample ay tinitipon sa araw

PCA + batch variable

maling pagsubok

Normal na pagsubok upang mabilang ang data

Angkop na paraan tulad ng DESeq2/edgeR

binubuo ng biology

Weldless na mekanismo

Pagkumpirma ng panitikan

hindi sapat na kapangyarihan

1-2 reps

Sapat na pag-uulit sa disenyo

Mga karaniwang pagkakamali

  • Nilaktawan ang maramihang pagwawasto ng paghahambing. Ang pinakakaraniwan at pinakanakakapinsalang istatistikal na error.
  • Hindi pinapansin ang kolektibong epekto. Ito ay gumagawa ng maling biological na pagkakaiba.
  • Paglalapat ng maling pagsubok upang mabilang ang data. Ang RNA-seq ay nangangailangan ng mga espesyal na pamamaraan.
  • Pagtanggap ng mga biyolohikal na claim nang walang pinagmulan. Ang AI ay maaaring gumawa ng mga mekanismo at artikulo.
  • Paglalahat na may hindi sapat na pag-uulit. Kung walang istatistikal na kapangyarihan, ang resulta ay hindi maaasahan.
Mag-ingat: Ang "makabuluhang istatistika" ay hindi katulad ng "makabuluhang biyolohikal." Ang isang napakaliit ngunit teknikal na makabuluhang pagbabago sa fold ay maaaring biologically hindi gaanong mahalaga; Sa malalaking sample ang lahat ay maaaring maging "makabuluhan". Magkasamang suriin ang log2FC at p-value.

Depth: background at double-counting pitfalls sa pathway enrichment

Ang mga resulta ng pagpapayaman ng pathway ay umaasa sa dalawang nakatagong pagpapalagay na hindi napagtanto ng karamihan ng mga tao, at maaaring tahimik na lampasan ng AI ang mga ito. Ang una ay ang pagpili sa background/uniberso: inihahambing ng pagpapayaman ang hanay ng "mga gene na nagbago" sa hanay ng "kung aling mga gene ang tinitingnan". Kung ang background ay kinuha mula sa buong genome ngunit ang iyong eksperimento ay sumusukat lamang ng isang partikular na tissue panel, ang mga resulta ay lalabas na artipisyal na "pinayaman." Ang tamang background ay mga gene na maaaring aktwal na ipahayag/sukat sa eksperimento. Natuklasan ng isang team ang "highly significant enrichment of the immune pathway" sa pamamagitan ng maling pag-background sa buong genome; Kapag inulit ang pagsusuri na may tamang background (mga sinukat na gene), nawala ang pagpapayaman—ang paghahanap ay isang artifact ng pamamaraan.

Pangalawa, ang laki ng hanay ng gene at dobleng pagbibilang: napakalaki at pangkalahatang mga landas (hal. "mga proseso ng metabolismo", libu-libong mga gene) ay lumilitaw na "mahalaga" sa halos bawat listahan; ang maliliit, tiyak na mga landas ay mas nagbibigay-kaalaman. Bukod pa rito, dahil ang parehong gene ay matatagpuan sa maraming pathway, nakakapanlinlang na ituring ang mga overlapping na pathway bilang independiyenteng ebidensya. Ikatlong punto: hindi ito nagpapakita ng direksyon ng pagpapayaman; Ang isang landas ay maaaring pagyamanin, ngunit ang kalahati ng mga gene sa loob nito ay maaaring tumaas at ang iba pang kalahati ay maaaring mabawasan. Upang makita ito, kinakailangan na hiwalay na suriin ang direksyong impormasyon (tulad ng GSEA).

bitag

sintomas

pag-iingat

maling background

Parang pinayaman ang lahat

Kumuha ng nasusukat na background ng mga gene

Napaka pangkalahatang landas

Palaging lumalabas ang "metabolismo".

Tumutok sa maliit, tiyak na mga landas

dobleng pagbibilang

magkakapatong na mga landas

Huwag itong kunin bilang independiyenteng ebidensya

laktawan ang direksyon

pinaghalong pataas/pababa

Direksyon na kontrol sa GSEA

Sa buod

  • AI sa pagsusuri ng omics; ay isang katulong na pumipili ng mga pamamaraan, nagsusulat ng code, at nag-draft ng mga komento; ang mga istatistika at mga desisyon sa biology ay dapat na makatwiran.
  • Dapat gamitin ang mga pamantayan, napatunayang pamamaraan (DESeq2/edgeR); Ang kontrol sa kalidad at pag-audit ng kolektibong epekto ay hindi dapat laktawan.
  • Ang pagwawasto ng maramihang paghahambing (FDR) ay sapilitan; ang mga resulta ay sinasala gamit ang naitama na halaga.
  • Ang bawat biyolohikal na paghahabol ay dapat kumpirmahin sa panitikan; Ang "makabuluhan" ay dapat na makilala mula sa "mahalaga".

Gawain ng aplikasyon

Kumuha ng sample na talahanayan ng mga resulta ng DE (o isang bukas na dataset ng RNA-seq). Ikumpara ang makabuluhang bilang ng gene batay sa raw p-value at itinamang padj threshold sa snippet sa itaas. Puna sa pagkakaiba sa isang pangungusap. Pagkatapos ay humingi ng biological na interpretasyon na may template 3 para sa isang itinatampok na gene at suriin ang claim sa iyong sarili sa PubMed.

checklist

  • [ ] Sinuri ko ang eksperimental na disenyo at istatistikal na kapangyarihan.
  • [ ] Pumili ako ng karaniwang, maginhawang paraan.
  • [ ] Ginawa ko ang kontrol sa kalidad ng PCA at batch effect.
  • [ ] Nag-apply ako ng multiple comparison (FDR) correction.
  • [ ] Na-filter ko ang mga resulta gamit ang itinamang p-value.
  • [ ] Kinumpirma ko ang mga biyolohikal na pag-aangkin sa panitikan.