Jedinica 6 / 11

Omics analiza podataka: RNA-seq, ekspresija, statistika i obogaćivanje putanja

Dobici:

  • Sposobnost razumijevanja toka rada RNA-seq, analize diferencijalne ekspresije i korekcije višestrukog testiranja (FDR) i posjedovanja umjetne inteligencije koja proizvodi provjerljiv kod analize
  • Sposobnost kritičke interpretacije rezultata obogaćivanja puteva statistički i biološki
  • Sposobnost vježbanja discipline provjere statističkih pretpostavki i višestrukih zamki testiranja i neovisne provjere biološke važnosti.

“Omics” je zajednički naziv za pristupe koji zajedno mjere sve molekule ćelije ili tkiva: genomika (sva DNK), transkriptomika (sva RNK/ekspresija), proteomika (svi proteini), metabolomika (svi metaboliti). Ovi podaci su ogromni - RNA-seq eksperiment uključuje mjerenja desetina hiljada gena. U ovoj cjelini naučit ćete kako koristiti umjetnu inteligenciju (AI) kao pomoćnika u analizi omike koji piše kod, bira statistiku i pravi biološke interpretacije; ali ćete naučiti zašto morate provjeriti statistički i biološki rezultat.

Kritično upozorenje: U Omicsu najopasnije greške su statističke i nevidljive. AI može napisati kod koji zaobilazi višestruku korekciju poređenja (ispod), bira pogrešan test ili proizvodi "lažno pozitivne" liste gena. Osim toga, AI može izmisliti biološke tvrdnje kao što je "ovaj gen se povećava u toj bolesti" bez ikakvog izvora. Pravi način: izvršiti analizu pomoću izvršnog koda koji se može revidirati i potvrditi svaku biološku tvrdnju u literaturi.

Osnovni koncepti

  • Ekspresija: Koliko je gen preveden u RNK; mjera "aktivnosti".
  • Diferencijalna ekspresija (DE): geni čija se ekspresija značajno mijenja između dvije grupe (npr. pacijent/zdrav).
  • p-vrijednost: Vjerovatnoća da je razlika slučajnost; ako je mala, razlika se smatra "značajnom".
  • Višestruka korekcija poređenja: Kada se istovremeno gledaju desetine hiljada gena, slučajno će se naći neki koji su "značajni". Da bi se to popravilo, koriste se metode kao što su FDR (stopa lažnog otkrivanja) / Benjamini-Hochberg. Ako se ova ispravka izostavi, pojavit će se stotine lažnih nalaza.
  • log2 puta promjena (log2FC): logaritam omjera ekspresije gena između dvije grupe prema bazi 2; +1 znači dvostruko povećanje, −1 znači dvostruko smanjenje.
  • Obogaćivanje puteva: Pronalaženje u kojim biološkim putevima (npr. dioba ćelija, imunitet) su koncentrirani promijenjeni geni; Koriste se baze podataka kao što su GO i KEGG.
  • Efekt serije: Nebiološka lažna razlika koja proizlazi iz obrade uzoraka u različitim danima/uređajima.

Korak po korak: omika analiza pomoću AI

1. Pojasnite eksperimentalni dizajn i pitanje. Koliko uzoraka, koliko grupa, koliko ponavljanja? Da li je statistička moć dovoljna? Objasnite dizajn AI.

2. Odaberite odgovarajući alat/metod sa AI. Za RNA-seq, izaberite standardne metode kao što su DESeq2/edgeR (statistički paketi dizajnirani za podatke o brojanju); Koristite dokazane metode, a ne statistiku koju je AI "izmislio".

3. Pokrenite kod i provjerite srednje izlaze. Ne prelazite na DE analizu bez normalizacije, kontrole efekta serije, grafikona kvaliteta (PCA).

4. Nametnite korekciju višestrukog poređenja. Filtrirajte rezultate prema ispravljenoj vrijednosti (padj/FDR), a ne prema sirovoj p-vrijednosti.

5. Potvrdite biološko tumačenje u literaturi. Interpretirajte izlaz obogaćivanja puta pomoću AI, ali provjerite svaku tvrdnju na izvoru.

Savjet: U DE analizi prvo pogledajte grafove kvaliteta i ukupnog uticaja. Ako su uzorci grupirani prema danu kada su obrađeni, a ne prema biološkoj grupi, većina "značajnih" gena koje ćete pronaći su kumulativni efekti, a ne prava biologija.

tri mini kofera

Slučaj 1 — Nekorigirana p-vrijednost. Student je testirao 20.000 gena sa kodom koji je napisao AI i pronašao "540 značajnih gena". Kada je pregledao kod, vidio je da je AI preskočio višestruku korekciju poređenja. Kada je dodana korekcija FDR-a, broj značajnih gena se smanjio na 32. Bez korekcije, više od 500 lažnih gena bi se zasnivalo na priči.

Slučaj 2 — Izmišljena biološka tvrdnja. Za gen na DE listi, istraživač je upitao AI "šta ovaj gen radi u ovoj bolesti?" upitao je; AI je objasnio uvjerljiv mehanizam i članak. Kada je pretražio na PubMedu, vidio je da ni taj mehanizam ni članak ne postoje. Tužba je uklonjena iz izvještaja.

Slučaj 3 — Potvrda dobijena. Student doktorskih studija je primetio da su uzorci bili razdvojeni za dva dana na PCA ploci. Zamolio AI da doda varijablu batch efekta u kod; Nakon korekcije, lista gena je potpuno promijenjena i postala biološki značajna. Bez tabele kontrole kvaliteta mogao bi biti objavljen lažni rezultat.

Primjer: filtriranje s ispravljenom p-vrijednošću

import pandas kao pd# neka tabela 'de' bude rezultat DE alata (DESeq2/edgeR):# kolone: gen, log2FC, pvalue, padj (ispravljeno FDR-om)de = pd.read_csv("de_results.csv")significant = de[(de["padj") & (>bs=FC") < 0.05"]. 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR-ispravljen padj<0.05 & |log2FC|>=1:", len(značajno))

Razlika između neobrađenog i ispravljenog broja ilustruje zašto su višestruka poređenja kritična.

Četiri šablona za kopiranje

1) Plan analize i odabir metode:

Vaša uloga: asistent za bioinformatiku. Postavite plan analize za sljedeći eksperiment RNA-seq: [broj grupa, broj uzoraka/replikacija, pitanje]. Koji standardni alat (DESeq2/edgeR) da odaberem i zašto, koji koraci kontrole kvaliteta (PCA, batch efekat) su potrebni, kako da primenim višestruku korekciju poređenja? Pišite korak po korak.

2) Šifra + obavezne provjere:

Napišite izvršni kod koji izvodi sljedeću DE analizu: [detalj]. Kôd MORA uključivati ​​normalizaciju, grafiku kvaliteta PCA, kontrolu efekta serije i FDR (Benjamini-Hochberg) korekciju. Komentirajte svaki korak. Filtrirajte s ispravljenom p-vrijednošću, a ne sirovom p-vrijednošću.

3) Komentar o obogaćivanju puta:

Pomozite u tumačenju rezultata obogaćivanja puteva za ovu listu značajnih gena: [list/output]. Objasnite koji su putevi istaknuti, ali recite mi iz kojeg izvora (GO, KEGG, recenzirani članak) da potvrdim svaku biološku tvrdnju. Mehanizam/artikal FITING.

4) Statistička revizija:

Provjerite sljedeći kod analize za statističke greške: [kod]. Konkretno: pogrešna selekcija testa, izostavljanje korekcije višestrukog poređenja, ignorisanje efekta serije, nedovoljna replikacija. Navedite svaki problem koji ste pronašli i njegovo rješenje.

Slaba prompt / Jaka prompt

Slabo: "Pronađite značajne gene u ovim RNA-seq podacima."

Problem: Metoda, kontrola kvaliteta i višestruka poređenja nisu specificirani; AI može dati listu punu lažnih pozitivnih rezultata bez ispravke.

Snažan: "Napišite kod koji izvodi DE analizu za ove podatke brojanja RNA-seq pomoću DESeq2 logike, uključuje kontrolu kvaliteta i kontrolu masovnog efekta pomoću PCA, i filtere s FDR korekcijom; komentirajte svaki korak i objasnite zašto ste odabrali ovu metodu."

Zašto je moćan: Metoda je standardna, kvalitet i korekcija su obavezni, rezultat je podložan reviziji.

Rizik

simptom

mjera opreza

lažno pozitivan

Previše "smislenih" gena

FDR/ispravka višestrukog poređenja

kolektivni uticaj

Uzorci su grupirani po danu

PCA + serijska varijabla

pogrešan test

Normalan test za brojanje podataka

Odgovarajuća metoda poput DESeq2/edgeR

izmišljena biologija

Mehanizam bez zavarivanja

Potvrda literature

nedovoljna snaga

1-2 ponavljanja

Dosta ponavljanja u dizajnu

Uobičajene greške

  • Preskakanje višestruke korekcije poređenja. Najčešća i najštetnija statistička greška.
  • Zanemarivanje kolektivnog uticaja. To proizvodi lažnu biološku razliku.
  • Primjena pogrešnog testiranja na podatke o brojanju. RNA-seq zahtijeva posebne metode.
  • Prihvatanje bioloških tvrdnji bez izvora. AI može izrađivati ​​mehanizme i članke.
  • Uopštavanje sa nedovoljnim ponavljanjem. Bez statističke snage, rezultat je nepouzdan.
Oprez: “Statistički značajan” nije isto što i “biološki značajan”. Vrlo mala, ali tehnički značajna promjena nabora može biti biološki beznačajna; U velikim uzorcima sve može ispasti "značajno". Zajedno procijenite log2FC i p-vrijednost.

Dubina: pozadina i zamke dvostrukog brojanja u obogaćivanju puta

Rezultati obogaćivanja putanje oslanjaju se na dvije skrivene pretpostavke koje većina ljudi ne shvaća, a AI ih može tiho zaobići. Prvi je odabir pozadine/univerzuma: obogaćivanje upoređuje skup "gena koji su se promijenili" sa skupom "koji su geni posmatrani". Ako je pozadina uzeta iz cijelog genoma, ali vaš eksperiment mjeri samo određeni panel tkiva, rezultati izgledaju umjetno "obogaćeni". Ispravna pozadina su geni koji se zapravo mogu izraziti/izmjeriti u eksperimentu. Jedan tim je otkrio “veoma značajno obogaćivanje imunološkog puta” greškom u pozadini čitavog genoma; Kada je analiza ponovljena sa ispravnom pozadinom (izmereni geni), obogaćenje je nestalo - nalaz je bio artefakt metode.

Drugo, veličina skupa gena i dvostruko brojanje: veoma veliki i opšti putevi (npr. „metabolički procesi”, hiljade gena) pojavljuju se „značajni” na skoro svakoj listi; mali, specifični putevi su informativniji. Osim toga, budući da se isti gen nalazi u više puteva, pogrešno je tretirati preklapajuće puteve kao nezavisan dokaz. Treća tačka: ne pokazuje pravac obogaćivanja; Put može biti obogaćen, ali polovina gena unutar njega može biti povećana, a druga polovina smanjena. Da biste to vidjeli, potrebno je zasebno ispitati informacije o smjeru (kao što je GSEA).

trap

simptom

mjera opreza

pogrešna pozadina

Sve izgleda obogaćeno

Dobijte izmjerenu pozadinu gena

Veoma opšti put

"Metabolizam" se uvijek pojavi

Fokusirajte se na male, specifične puteve

dvostruko računanje

putevi koji se preklapaju

Nemojte to shvatiti kao nezavisan dokaz

preskočiti smjer

mješovito uzlazno/silazno

Smjerno upravljanje sa GSEA

Ukratko

  • AI u omics analizi; je asistent koji bira metode, piše kod i piše komentare; statistike i biološke odluke moraju biti opravdane.
  • Treba koristiti standardne, dokazane metode (DESeq2/edgeR); Ne treba preskočiti kontrolu kvaliteta i kolektivnu reviziju uticaja.
  • Korekcija višestrukog poređenja (FDR) je obavezna; rezultati se filtriraju sa ispravljenom vrednošću.
  • Svaka biološka tvrdnja mora biti potvrđena u literaturi; "značajno" treba razlikovati od "važnog".

Zadatak aplikacije

Uzmite uzorak DE rezultata tabele (ili otvoreni RNA-seq skup podataka). Uporedite značajan broj gena na osnovu sirove p-vrednosti i ispravljenih padj pragova sa gornjim isječkom. Komentirajte razliku u jednoj rečenici. Zatim zatražite biološku interpretaciju sa šablonom 3 za istaknuti gen i provjerite tvrdnju sami u PubMedu.

kontrolna lista

  • [ ] Procijenio sam eksperimentalni dizajn i statističku moć.
  • [ ] Izabrao sam standardnu, pogodnu metodu.
  • [ ] Uradio sam PCA i kontrolu kvaliteta batch efekta.
  • [ ] Primijenio sam korekciju višestrukog poređenja (FDR).
  • [ ] Filtrirao sam rezultate s ispravljenom p-vrijednošću.
  • [ ] Potvrdio sam biološke tvrdnje u literaturi.