Kitengo 4 / 11

Data ya Omics na Uchambuzi wa Dimensional ya Juu

Faida:

  • Uwezo wa kuelewa tatizo la kulinganisha nyingi na kujumuisha marekebisho ya FDR (kiwango cha ugunduzi wa uwongo) katika uchanganuzi
  • Uwezo wa kutofautisha umuhimu wa takwimu na kibaolojia kwa kutathmini thamani ya p na saizi ya athari (mabadiliko ya logi2) pamoja.
  • Uwezo wa kutambua na kuepuka mitego ya data ya hali ya juu kama vile athari ya kundi na kuruka kwa sababu

Neno "omics" linaelezea mikabala inayopima darasa zima la molekuli katika seli: genomics (DNA zote), transcriptomics (zote za RNA / usemi wa jeni), proteomics (protini zote), metabolomics (molekuli zote ndogo). Kipengele cha kawaida cha vipimo hivi ni mwelekeo wao wa juu: maelfu au hata makumi ya maelfu ya vigezo (jeni, protini) hupimwa wakati huo huo katika sampuli moja, lakini idadi ya sampuli kawaida ni ndogo (k.m. wagonjwa 20). Hali hii ya "vigeu vingi, sampuli chache" ndio chanzo cha changamoto za kipekee kwa biolojia na maeneo ambayo AI inaweza kusaidia zaidi.

Katika kitengo hiki, tutajadili uchanganuzi wa usemi tofauti (kutafuta jeni ambazo usemi wake hubadilika sana kati ya vikundi viwili) na jukumu la akili bandia katika mtiririko huu wa kazi kupitia mfano wa nakala (RNA-seq).

Shida kuu ya data ya hali ya juu

Ukijaribu maelfu ya jeni mara moja, utapata jeni zinazoonekana kuwa "muhimu" kwa bahati, hata kama hakuna tofauti za kweli. Ukijaribu jeni 20,000 kwa ukingo wa 5% wa makosa, ~ jeni 1,000 zinaweza kugeuka kuwa "muhimu" kwa bahati. Hili huitwa tatizo la ulinganishi mwingi na ndio mtego muhimu zaidi wa uchanganuzi wa omics. Suluhisho ni kusahihisha thamani za p (k.m. kukokotoa FDR - kiwango cha ugunduzi wa uwongo kwa kutumia mbinu ya Benjamini-Hochberg). AI inasaidia sana katika kuelezea dhana hii na kuandika kanuni sahihi; lakini ni wajibu wako kukumbuka kutumia masahihisho.

Kidokezo: Ukiona nambari kama "jeni 3,000 zimebadilishwa kwa kiasi kikubwa" katika tokeo la omics, usiogope. Kawaida hii ni ishara kwamba marekebisho mengi ya kulinganisha hayajafanywa. Orodha ya kweli inaweza kuwa makumi kwa jeni mia kadhaa katika jaribio lililoundwa vizuri.

Usemi tofauti wa RNA-seq: hatua kwa hatua

  1. Hesabu ghafi: Jedwali lililo na idadi ya usomaji ulioanguka katika kila sampuli kwa kila jeni.
  2. Ubora na uchujaji: Tupa jeni zenye mwonekano mdogo sana.
  3. Urekebishaji: Sahihi tofauti ya ukubwa wa maktaba kati ya sampuli (nambari ya kinyama haiwezi kulinganishwa).
  4. Muundo wa takwimu: Tofauti ya kikundi cha majaribio na DESeq2 au edgeR (maktaba za R) au pyDESeq2 kwenye Python.
  5. Marekebisho mengi ya kulinganisha: Kokotoa FDR; kawaida kizingiti cha FDR <0.05.
  6. Ukubwa wa madoido: Tathmini kwa kubadilisha log2: mara ngapi usemi huongezeka/hupungua.
  7. Maoni: Husisha jeni muhimu na njia za kibayolojia.

Akili ya bandia 3-6. Inaweka hatua, inaelezea dhana, na inakusaidia kutafsiri matokeo. Walakini, mfano hauwezi kusema "ni jeni gani iliyobadilika" bila kuona data yako mbichi; Nambari na takwimu zinakuambia hivi.

Violezo vya haraka vinavyoweza kunakiliwa

Jukumu: Wewe ndiye msaidizi wa uchanganuzi wa maandishi. Muktadha: Nina jedwali la kuhesabu ghafi la RNA-seq (CSV) kutoka kwa udhibiti 12, sampuli 12 za matibabu. Kazi: Orodhesha hatua za uchanganuzi wa usemi tofauti na pyDESeq2, eleza kwa nini kila hatua ni muhimu. Panga kwanza, msimbo wa pili. Hakikisha umejumuisha masahihisho mengi ya kulinganisha.

Matokeo yangu ya uchanganuzi yalionyesha jeni 4,200 kama "p <0.05". Kwa nini hii inaweza kutiliwa shaka? Eleza marekebisho mengi ya kulinganisha (Benjamini-Hochberg FDR) na upe nambari ya Python ambayo hufanya uchujaji sahihi.

Andika nambari inayochora njama ya volkano kutoka kwa jedwali langu la matokeo ya usemi tofauti (gene, log2FC, safu wima za padj). Rangi jeni kwa FDR<0.05 na |log2FC|>1, weka alama 10 bora.

Je, ninawezaje kuchambua orodha hii muhimu ya jeni kwa uboreshaji wa njia? Eleza hatua za gseapy au g:Profiler. Usidai sababu kamili katika maoni, tumia lugha ya uunganisho. Orodha ya jeni: [orodha]

Mwongozo dhaifu / Mwongozo thabiti

Dhaifu: "Niambie ni jeni gani ni muhimu katika mavuno ya RNA-seq."

Imara: "Nina pyDESeq2 pato kutoka kwa vidhibiti 12, sampuli 12 za matibabu: jedwali lenye jeni, log2FoldChange, safu wima za padj. Toa msimbo unaochuja jeni muhimu zilizo na vizingiti vya FDR<0.05 na |log2FC|>1, huripoti nambari zao, na kuorodhesha jeni 20 zenye nguvu zaidi kulingana na viwango vinavyoweza kutekelezwa.

Tofauti: Kidokezo chenye nguvu kina safu wima halisi za matokeo, vizingiti na ombi la uthibitishaji. Muundo huu huchakata data yako badala ya kutoa jina la jeni iliyoundwa.

kesi tatu ndogo

Kesi ya 1 - Maafa bila marekebisho: Kundi lilipata jeni "muhimu" 3,800 zenye p<0.05 bila kusahihishwa na kuiwasilisha kwa chapisho. Mwamuzi alipoomba marekebisho ya FDR, orodha ilishuka hadi kufikia jeni 47. Ikiwa akili ya bandia ingeongeza msimbo wa Benjamini-Hochberg tangu mwanzo, aibu hii isingetokea. Somo: marekebisho hayawezi kujadiliwa.

Kesi ya 2 - Athari ya kundi: Katika utafiti mmoja, sampuli zilichakatwa kwa siku mbili tofauti. Walichofikiri ni tofauti ya "mgonjwa dhidi ya udhibiti" kwa kweli ilikuwa tofauti ya "siku ya 1 dhidi ya siku ya 2" (athari ya kundi: tofauti ya kiufundi kutokana na chama cha sampuli). AI ilisaidia kupalilia ishara ya uwongo kwa kupendekeza kuongeza kigeu cha bechi kwenye modeli (~ batch + hali katika fomula ya kielelezo).

Kesi ya 3 - Kupuuza mabadiliko ya mkunjo: Mwanafunzi alitangaza "muhimu zaidi" jeni ambalo usemi wake ulibadilika kwa 2% lakini ulipimwa kuwa thabiti sana, kwa kuangalia tu thamani ya p. Ingawa saizi ya athari (log2FC) ilikuwa karibu sifuri; umuhimu wa takwimu sio umuhimu wa kibayolojia. Mtindo alielezea tofauti hii na akapendekeza kuibua kwa grafu ya volkano.

Jedwali la kulinganisha: uwazi wa dhana

dhana

Maana

Kwa nini ni muhimu?

p-thamani

Uwezekano wa tofauti kuwa bahati mbaya

peke yake inaweza kupotosha

FDR (padj)

Kiwango cha makosa kilichorekebishwa katika majaribio mengi

Mipaka chanya chanya

log2 mabadiliko ya mara

Ukubwa wa athari

Inaonyesha umuhimu wa kibiolojia

athari ya kundi

Tofauti ya kundi la kiufundi

Inaunda ishara bandia

kuhalalisha

Marekebisho ya mizani ya sampuli

Hufanya ulinganifu kuwa sawa

Makosa ya kawaida

  • Kuruka urekebishaji mwingiliano wa kulinganisha: Kosa la kawaida na kubwa zaidi.
  • Kuangalia tu thamani ya p: Hakikisha kuzingatia saizi ya athari (log2FC) pamoja.
  • Bila kujumuisha athari ya bechi katika modeli: Kukosea tofauti ya kiufundi kwa tofauti ya kibaolojia.
  • Kusahau kuhalalisha: Kulinganisha nambari mbichi moja kwa moja.
  • Lugha ya sababu: Kusema "Jini hili husababisha ugonjwa"; Data ya Omics inaonyesha uwiano, sababu inahitaji majaribio ya ziada.
Tahadhari: Katika data ya hali ya juu, "muhimu kitakwimu" na "muhimu kibayolojia" ni vitu viwili tofauti. Orodha ya jeni inayozalishwa na akili ya bandia ni hypothesis ya awali; Kila jeni ya mtahiniwa haipaswi kuchukuliwa kuwa bainifu bila uthibitishaji kwa mbinu huru (qPCR, kipimo cha protini).

Kupunguza ukubwa na udhibiti wa ubora

Jambo la kwanza la kufanya katika data ya hali ya juu ni kuona muundo wa jumla wa sampuli. PCA (uchambuzi wa sehemu kuu: kupunguza maelfu ya viambajengo kuwa mihimili michache ya muhtasari na kuzionyesha katika vipimo 2) ndio zana ya kawaida ya hii. Ikiwa vikundi unavyotarajia (udhibiti/matibabu) vimetenganishwa katika chati ya PCA, ni vizuri; lakini ikiwa sampuli zimeunganishwa na "siku iliyochakatwa" badala ya kikundi, hili ni onyo la athari ya bechi. Chati sawa pia inaonyesha mara moja mfano mmoja wa nje (ulioshindwa).

Chora PCA kutoka kwa jedwali langu la kawaida la kujieleza (jeni la safu mlalo, sampuli ya safu wima). Sampuli za rangi kwa kikundi (udhibiti/matibabu), umbo kwa kundi la usindikaji. Toa maoni yako ikiwa athari ya kundi au muundo wa nje unaonekana kwenye grafu.

Hatua hii ya kiheuristic inasababisha uchanganuzi uliobaki: ni bora kukamata mtu wa nje mapema kuliko kupoteza miezi kwa matokeo ya uwongo.

Data ya seli moja: mwelekeo mpya

Katika miaka ya hivi karibuni, mpangilio wa RNA wa seli moja (seli moja ya RNA-seq: kupima maelezo mafupi ya maelfu ya seli mahususi) umeenea. Hapa data inakuwa kubwa zaidi: makumi ya maelfu ya seli, maelfu ya jeni kila moja. Zana kama vile Scanpy (Python) huchakata data hii; hukusanya seli na kubainisha aina za seli. AI huandika msimbo wa mtiririko huu wa kazi, lakini muundo wa majina wa kibayolojia wa aina za seli (iwe nguzo ni "seli T" au "macrophage") hutegemea jeni za kialama na ujuzi wa kitaalamu. Hakikisha kuwa umethibitisha lebo ya aina ya seli ambayo modeli hukabidhi kwa kikundi chenye vialamisho vinavyojulikana; Hii ndiyo hatua isiyoeleweka zaidi katika uchanganuzi wa seli moja.

Fungua data na reproducibility

Tafiti nyingi za omics hupakia data zao kwenye hazina za umma: GEO (Gene Expression Omnibus) na ArrayExpress kwa usemi wa jeni, SRA (Kumbukumbu ya Kusomwa kwa Mfuatano) kwa mfuatano ghafi, PRIDE kwa proteomics. Hili ni muhimu ili watu wengine waweze kuthibitisha matokeo yako na ili uweze kuchanganua upya data kutoka kwa masomo mengine. AI inaweza kuandika msimbo (kwa zana kama vile GEOparse) ambayo inapakua na kupanga data kutoka kwa nambari ya usajili ya GEO (k.m. nambari ya GSE); Lakini hakikisha kusoma na kuthibitisha muundo wa data uliyopakua (ni vikundi vingapi, marudio mangapi, ambayo mchakato) kutoka kwa rekodi asili. Ikiwa mtindo anadai "kukumbuka" muundo wa utafiti, hii ni karibu kila mara nadhani ambayo inahitaji kuthibitishwa.

Kwa muhtasari

Data ya Omics hupima maelfu ya vigeu katika saizi ndogo ya sampuli; Hii inaunda mitego ya kulinganisha nyingi, athari za kundi, na tafsiri nyingi. Akili ya bandia; Huandika msimbo wa uchanganuzi wa usemi tofauti, hufafanua dhana, na hukusaidia kutafsiri matokeo. Hata hivyo, ni wajibu wako kutumia marekebisho ya FDR, kutathmini ukubwa wa athari, na kuepuka lugha ya sababu. Jeni za mtahiniwa ni dhahania hadi zithibitishwe kwa mbinu huru.

Jukumu la maombi

Pata au unda sampuli ya jedwali la matokeo ya usemi tofauti (gen, log2FC, padj). Kuwa na msimbo wa kuandika wa AI ambao huchuja kwa FDR<0.05 na |log2FC|>1, huripoti idadi ya jeni muhimu, na kupanga grafu ya volcano. Endesha msimbo. Kisha fanya mfano uhesabu ni jeni ngapi zingeonekana "muhimu" ikiwa marekebisho hayangefanywa, na utafsiri tofauti.

orodha ya ukaguzi

  • [ ] Nilitumia masahihisho ya ulinganishi mwingi (FDR).
  • Nilitathmini saizi ya athari (log2FC) na [ ] thamani ya p.
  • [ ] Niliangalia bechi/vigeu vya kiufundi.
  • [ ] Sikuruka hatua ya kuhalalisha.
  • [ ] Nilitumia lugha ya uwiano badala ya sababu.
  • [ ] Nilitia alama jeni za mgombea kama dhahania zinazohitaji kuthibitishwa.