Fitimet:
- Aftësia për të kuptuar problemin e krahasimit të shumëfishtë dhe për të përfshirë korrigjimin FDR (shkalla e zbulimit të rremë) në analizë
- Aftësia për të dalluar rëndësinë statistikore dhe biologjike duke vlerësuar së bashku vlerën p dhe madhësinë e efektit (ndryshim log2 fish)
- Aftësia për të njohur dhe shmangur kurthe të të dhënave me dimensione të larta si efekti i grupit dhe kërcimi i shkakësisë
Fjala "omikë" përshkruan qasjet që matin një klasë të tërë molekulash në një qelizë: gjenomikë (e gjithë ADN-në), transkriptomika (e gjithë shprehja e ARN / gjenit), proteomika (të gjitha proteinat), metabolomika (të gjitha molekulat e vogla). Karakteristika e përbashkët e këtyre matjeve është dimensionaliteti i tyre i lartë: mijëra apo edhe dhjetëra mijëra variabla (gjene, proteina) maten njëkohësisht në një kampion të vetëm, por numri i mostrave është zakonisht i vogël (p.sh. 20 pacientë). Kjo situatë "shumë variabla, pak mostra" është burimi i sfidave unike për biologjinë dhe fushat ku AI mund të jetë më e dobishme.
Në këtë njësi, ne do të diskutojmë analizën e shprehjes diferenciale (gjetjen e gjeneve, shprehja e të cilëve ndryshon ndjeshëm midis dy grupeve) dhe rolin e inteligjencës artificiale në këtë rrjedhë pune përmes shembullit të transkriptomikës (ARN-seq).
Problemi kryesor i të dhënave me dimensione të larta
Nëse testoni mijëra gjene në të njëjtën kohë, do të gjeni gjene që duken "të rëndësishme" rastësisht, edhe nëse nuk ka dallime reale. Nëse testoni 20,000 gjene me një diferencë gabimi 5%, ~ 1,000 gjene mund të rezultojnë të jenë "të rëndësishme" rastësisht. Ky quhet problemi i krahasimit të shumëfishtë dhe është kurthi më kritik i analizës omike. Zgjidhja është të korrigjoni vlerat p (p.sh. llogaritni FDR - shkallën e zbulimit të rremë me metodën Benjamini-Hochberg). Inteligjenca artificiale është shumë e dobishme për të shpjeguar këtë koncept dhe për të shkruar kodin e duhur; por është përgjegjësia juaj të mbani mend të zbatoni korrigjimin.
Këshillë: Nëse shihni një numër si "3000 gjene të ndryshuara ndjeshëm" në një rezultat omics, alarmohuni. Kjo zakonisht është një shenjë se korrigjimi i krahasimit të shumëfishtë nuk është bërë. Një listë realiste do të ishte dhjetëra deri në disa qindra gjene në një eksperiment të projektuar mirë.
Shprehja diferenciale e ARN-seq: hap pas hapi
- Numërimi i papërpunuar: Tabela që përmban sa lexime ranë në çdo mostër për secilin gjen.
- Cilësia dhe filtrimi: Hidhni gjenet me shprehje shumë të ulët.
- Normalizimi: Diferenca e saktë e madhësisë së bibliotekës midis mostrave (numri brutal nuk është i krahasueshëm).
- Modeli statistikor: Testi i ndryshimit të grupit me DESeq2 ose edgeR (bibliotekat R) ose pyDESeq2 në Python.
- Korrigjimi i krahasimit të shumëfishtë: Llogarit FDR; zakonisht një prag i FDR < 0.05.
- Madhësia e efektit: Vlerësoni me ndryshimin e palosjes log2: sa herë rritet/zvogëlohet shprehja.
- Koment: Lidhni gjenet e rëndësishme me rrugët biologjike.
Inteligjenca artificiale 3-6. Ai kodon hapat, shpjegon konceptet dhe ju ndihmon të interpretoni rezultatet. Megjithatë, modeli nuk mund të thotë "cili gjen ka ndryshuar" pa parë të dhënat tuaja të papërpunuara; Kodi dhe statistikat ju tregojnë këtë.
Modele të shpejtë të kopjueshëm
Roli: Ju jeni asistenti i analizës transkriptomike. Konteksti: Unë kam një tabelë të numërimit të papërpunuar të ARN-seq (CSV) nga 12 kontrolle, 12 mostra trajtimi. Detyrë: Rendisni hapat e analizës së shprehjeve diferenciale me pyDESeq2, shpjegoni pse është i nevojshëm secili hap. Plani i parë, kodi i dytë. Sigurohuni që të përfshini korrigjimin e shumëfishtë të krahasimit.
Rezultati im i analizës tregoi 4200 gjene si "p<0.05". Pse kjo mund të jetë e dyshimtë? Shpjegoni korrigjimin e krahasimit të shumëfishtë (Benjamini-Hochberg FDR) dhe jepni kodin Python që bën filtrimin e duhur.
Shkruani kodin që vizaton një grafik vullkani nga tabela ime e rezultateve të shprehjes diferenciale (gjeni, log2FC, kolonat padj). Ngjyrosni gjenet me FDR<0.05 dhe |log2FC|>1, etiketoni 10 të parët.
Si mund ta analizoj këtë listë të rëndësishme të gjeneve për pasurimin e rrugës? Shpjegoni hapat e gseapy ose g:Profiler. Mos pretendoni shkakësi absolute në koment, përdorni gjuhën e korrelacionit. Lista e gjeneve: [lista]
Prompt i dobët / Prompt i fortë
I dobët: "Më tregoni se cilat gjene janë të rëndësishme në prodhimin e ARN-seq."
I fortë: "Kam dalje pyDESeq2 nga 12 kontrolle, 12 mostra trajtimi: tabela me gjen, log2FoldChange, kolonat padj. Jep kodin që filtron gjene të rëndësishme me pragjet e FDR<0.05 dhe |log2FC|>1, raporton numrat e tyre dhe i rendit 20-at me efekte më të forta."
Dallimi: Prompti i fuqishëm ka kolonat aktuale të daljes, pragjet dhe kërkesën e vlefshmërisë. Modeli përpunon të dhënat tuaja në vend që të gjenerojë një emër gjeni të krijuar.
tre mini kuti
Rasti 1 - Fatkeqësi pa korrigjim: Një grup gjeti 3,800 gjene "të rëndësishme" me p<0.05 pa korrigjim dhe e dërgoi atë në një botim. Kur arbitri kërkoi korrigjim FDR, lista ra në 47 gjene. Nëse inteligjenca artificiale do të kishte shtuar kodin Benjamini-Hochberg që në fillim, ky siklet nuk do të kishte ndodhur. Mësimi: korrigjimi është i panegociueshëm.
Rasti 2 — Efekti i grupit: Në një studim, mostrat u përpunuan në dy ditë të ndryshme. Ajo që ata mendonin se ishte një ndryshim "pacienti kundër kontrollit" ishte në fakt një ndryshim "dita e 1-rë kundër ditës së dytë" (efekti i grupit: ndryshimi teknik për shkak të palës së kampionimit). Inteligjenca artificiale ndihmoi në eliminimin e sinjalit të rremë duke sugjeruar shtimin e ndryshores së grupit në model (~ batch + kusht në formulën e modelit).
Rasti 3 - Injorimi i ndryshimit të palosjes: Një student shpalli "më të rëndësishëm" një gjen, shprehja e të cilit ndryshoi me 2%, por u mat si shumë e qëndrueshme, vetëm duke parë vlerën p. Ndërsa madhësia e efektit (log2FC) ishte pothuajse zero; rëndësia statistikore nuk është rëndësi biologjike. Modeli shpjegoi këtë dallim dhe sugjeroi vizualizimin e tij me një grafik vullkani.
Tabela e krahasimit: qartësia e konceptit
koncept
Kuptimi
Pse është e rëndësishme?
p-vlera
Probabiliteti i ndryshimit të jetë një rastësi
vetëm mund të jetë mashtruese
FDR (padj)
Shkalla e korrigjuar e gabimit në testimin e shumëfishtë
Kufizon rezultatet false
ndryshimi i palosjes log2
Madhësia e efektit
Tregon rëndësinë biologjike
efekt grupi
Dallimi teknik i grupeve
Krijon sinjal të rremë
normalizimi
Korrigjimi i shkallës ndërmjet mostrës
E bën krahasimin të drejtë
Gabimet e zakonshme
- Kapërcimi i korrigjimit të krahasimit të shumëfishtë: Gabimi më i zakonshëm dhe më serioz.
- Vetëm duke parë vlerën p: Sigurohuni që të merrni parasysh madhësinë e efektit (log2FC) së bashku.
- Duke mos përfshirë efektin e grupit në model: Gabimi i një ndryshimi teknik me një ndryshim biologjik.
- Harrimi i normalizimit: Krahasimi direkt i numrave të papërpunuar.
- Gjuha shkakësore: Thënia "Ky gjen shkakton sëmundje"; Të dhënat e Omics tregojnë korrelacion, shkakësia kërkon eksperimentim shtesë.
Kujdes: Në të dhënat me dimensione të larta, "statistikisht domethënëse" dhe "biologjikisht domethënëse" janë dy gjëra të ndryshme. Lista e gjeneve e prodhuar nga inteligjenca artificiale është një hipotezë fillestare; Çdo gjen kandidat nuk duhet të konsiderohet përfundimtar pa verifikim me metodë të pavarur (qPCR, matja e proteinave).
Zvogëlimi i madhësisë dhe kontrolli i cilësisë
Gjëja e parë që duhet bërë në të dhënat me dimensione të larta është të shikoni strukturën e përgjithshme të mostrave. PCA (analiza e komponentit kryesor: reduktimi i mijëra variablave në disa boshte përmbledhëse dhe shfaqja e tyre në 2 dimensione) është mjeti standard për këtë. Nëse grupet që prisni (kontrolli/trajtimi) janë të ndara në grafikun PCA, është mirë; por nëse mostrat grumbullohen sipas "ditës së përpunuar" dhe jo sipas grupit, ky është një paralajmërim për efektin e grupit. I njëjti grafik gjithashtu tregon menjëherë një shembull të vetëm të jashtëm (të dështuar).
Vizatoni PCA nga tabela ime e normalizuar e shprehjes (gjeni i rreshtit, mostra e kolonës). Ngjyrosja e mostrave sipas grupit (kontrolli/trajtimi), forma sipas grupit të përpunimit. Komentoni nëse një efekt grupi ose model i jashtëm shihet në grafik.
Ky hap heuristik drejton pjesën tjetër të analizës: është më mirë të kapësh herët një më të jashtëzakonshëm sesa të harxhosh muaj për një rezultat të rremë.
Të dhënat me një qelizë të vetme: një dimension i ri
Vitet e fundit, sekuenca e ARN-së me një qelizë (ARN-seq me një qelizë: matja e profilit të shprehjes së mijëra qelizave individuale) është bërë e përhapur. Këtu të dhënat bëhen edhe më të mëdha: dhjetëra mijëra qeliza, mijëra gjene secila. Mjete të tilla si Scanpy (Python) përpunojnë këto të dhëna; grumbullon qelizat dhe identifikon llojet e qelizave. AI shkruan kodin për këtë rrjedhë pune, por nomenklatura biologjike e llojeve të qelizave (nëse një grup është një "qelizë T" ose një "makrofag") mbështetet në gjenet e shënuesve dhe njohuritë e ekspertëve. Sigurohuni që të konfirmoni etiketën e llojit të qelizës që modeli i cakton një grupi me shënues të njohur; Ky është hapi më i keqkuptuar në analizën e një qelize të vetme.
Të dhëna të hapura dhe riprodhueshmëri
Shumica e studimeve të omics ngarkojnë të dhënat e tyre në depo publike: GEO (Gene Expression Omnibus) dhe ArrayExpress për shprehjen e gjeneve, SRA (Sequence Read Archive) për sekuencat e papërpunuara, PRIDE për proteomics. Kjo është kritike në mënyrë që të tjerët të mund të verifikojnë rezultatet tuaja dhe në mënyrë që ju të mund të rianalizoni të dhënat nga studimet e tjera. AI mund të shkruajë kodin (me mjete si GEOparse) që shkarkon dhe organizon të dhënat nga një numër regjistrimi GEO (p.sh. numri GSE); Por sigurohuni që të lexoni dhe konfirmoni dizajnin e të dhënave që keni shkarkuar (sa grupe, sa përsëritje, cili proces) nga regjistrimi origjinal. Nëse modeli pretendon se "kujton" dizajnin e një studimi, ky është pothuajse gjithmonë një supozim që duhet verifikuar.
Në përmbledhje
Të dhënat Omics matin mijëra variabla në një madhësi të vogël kampioni; Kjo krijon kurthe të krahasimeve të shumta, efekteve të grupit dhe mbiinterpretimit. Inteligjenca artificiale; Ai shkruan kodin për analizën e shprehjeve diferenciale, shpjegon konceptet dhe ju ndihmon të interpretoni rezultatet. Megjithatë, është përgjegjësia juaj të aplikoni korrigjimin FDR, të vlerësoni madhësinë e efektit dhe të shmangni gjuhën e shkakësisë. Gjenet kandidate janë hipoteza derisa të verifikohen me metodë të pavarur.
Detyra e aplikimit
Merrni ose krijoni një mostër të tabelës së rezultateve të shprehjeve diferenciale (gen, log2FC, padj). Keni kodin e AI të shkruar që filtron sipas FDR<0.05 dhe |log2FC|>1, raporton numrin e gjeneve të rëndësishme dhe vizaton një grafik vullkani. Ekzekutoni kodin. Më pas, bëni modelin të llogarisë se sa gjene do të dukeshin "të rëndësishëm" nëse korrigjimi nuk do të ishte bërë dhe interpretoni ndryshimin.
listë kontrolli
- [ ] Kam aplikuar korrigjimin e krahasimit të shumëfishtë (FDR).
- Vlerësova madhësinë e efektit (log2FC) si dhe vlerën p [ ].
- [ ] Kontrollova grupin/ndryshoret teknike.
- [ ] Nuk e kapërceva hapin e normalizimit.
- [ ] Kam përdorur gjuhën e korrelacionit dhe jo të shkakësisë.
- [ ] Kam shënuar gjenet kandidate si hipoteza që duhen konfirmuar.