Jedinica 4 / 11

Omics podaci i analiza visokih dimenzija

Dobici:

  • Sposobnost razumijevanja problema višestruke usporedbe i uključivanja FDR (stope lažnog otkrivanja) korekcije u analizu
  • Sposobnost razlikovanja statističke i biološke važnosti procjenom p-vrijednosti i veličine učinka (log2 puta promjena) zajedno
  • Sposobnost prepoznavanja i izbjegavanja visokodimenzionalnih podatkovnih zamki kao što su skupni učinak i skok uzročnosti

Riječ "omika" opisuje pristupe koji mjere cijelu klasu molekula u stanici: genomika (sva DNK), transkriptomika (sva ekspresija RNK / gena), proteomika (svi proteini), metabolomika (sve male molekule). Zajedničko obilježje ovih mjerenja je njihova velika dimenzionalnost: tisuće ili čak deseci tisuća varijabli (geni, proteini) mjere se istovremeno u jednom uzorku, ali je broj uzoraka obično mali (npr. 20 pacijenata). Ova situacija "mnogo varijabli, malo uzoraka" izvor je izazova jedinstvenih za biologiju i područja u kojima AI može biti od najveće pomoći.

U ovoj cjelini raspravljat ćemo o diferencijalnoj analizi ekspresije (pronalaženje gena čija se ekspresija značajno mijenja između dvije skupine) i ulozi umjetne inteligencije u ovom tijeku rada kroz primjer transkriptomike (RNA-seq).

Glavni problem visokodimenzionalnih podataka

Ako testirate tisuće gena odjednom, slučajno ćete pronaći gene koji se čine "značajnima", čak i ako nema stvarnih razlika. Ako testirate 20 000 gena s 5% marginom pogreške, oko 1000 gena može se slučajno pokazati "značajnim". Ovo se zove problem višestruke usporedbe i najkritičnija je zamka omics analize. Rješenje je ispraviti p-vrijednosti (npr. izračunati FDR — stopu lažnog otkrivanja Benjamini-Hochbergovom metodom). AI je od velike pomoći u objašnjavanju ovog koncepta i pisanju pravog koda; ali vaša je odgovornost zapamtiti primijeniti ispravak.

Savjet: ako vidite broj poput "3000 gena značajno promijenjeno" u omics rezultatu, uznemirite se. To je obično znak da višestruka usporedna korekcija nije napravljena. Realan popis bio bi desetci do nekoliko stotina gena u dobro osmišljenom eksperimentu.

RNA-seq diferencijalna ekspresija: korak po korak

  1. Neobrađeni brojevi: Tablica koja sadrži koliko je očitanja palo u svakom uzorku za svaki gen.
  2. Kvaliteta i filtriranje: Odbacite gene s vrlo niskom ekspresijom.
  3. Normalizacija: ispravna razlika u veličini knjižnice između uzoraka (grubi broj nije usporediv).
  4. Statistički model: Testirajte grupnu razliku s DESeq2 ili edgeR (R biblioteke) ili pyDESeq2 u Pythonu.
  5. Ispravak višestruke usporedbe: Izračunajte FDR; obično je prag FDR < 0,05.
  6. Veličina učinka: Procijenite s log2 fold change: koliko puta se izraz povećava/smanjuje.
  7. Komentar: Povežite značajne gene s biološkim putovima.

Umjetna inteligencija 3-6. Kodira korake, objašnjava koncepte i pomaže vam u tumačenju rezultata. Međutim, model ne može reći "koji se gen promijenio" bez da vidi vaše neobrađene podatke; Kod i statistika vam to govore.

Predlošci upita koji se mogu kopirati

Uloga: Vi ste asistent za transkriptomsku analizu. Kontekst: Imam RNA-seq raw count table (CSV) iz 12 kontrolnih, 12 uzoraka za liječenje. Zadatak: Navedite korake diferencijalne ekspresijske analize s pyDESeq2, objasnite zašto je svaki korak neophodan. Prvi plan, drugi kod. Obavezno uključite ispravak višestruke usporedbe.

Izlaz moje analize pokazao je 4200 gena kao "p<0,05". Zašto bi ovo moglo biti sumnjivo? Objasnite korekciju višestruke usporedbe (Benjamini-Hochberg FDR) i dajte Python kod koji radi ispravno filtriranje.

Napišite kod koji crta grafikon vulkana iz moje tablice rezultata diferencijalnog izraza (stupci gen, log2FC, padj). Obojite gene s FDR<0,05 i |log2FC|>1, označite prvih 10.

Kako mogu analizirati ovaj značajan popis gena za obogaćivanje puta? Objasnite korake gseapy ili g:Profiler. U komentaru ne tvrdite da postoji apsolutna uzročnost, koristite jezik korelacije. Popis gena: [popis]

Slab upit / Jak upit

Slab: "Reci mi koji su geni važni u prinosu RNA-seq."

Strong: "Imam pyDESeq2 izlaz iz 12 kontrolnih, 12 uzoraka tretmana: tablica s stupcima gena, log2FoldChange, padj. Dajte kod koji filtrira značajne gene s pragovima FDR<0,05 i |log2FC|>1, prijavljuje njihov broj i rangira 20 najjačih gena prema veličini učinka. Zatim objasnite zašto su ti pragovi razumni."

Razlika: Snažni upit ima stvarne izlazne stupce, pragove i zahtjev za provjeru valjanosti. Model obrađuje vaše podatke umjesto da generira izmišljeno ime gena.

tri mini kućišta

Slučaj 1 — Katastrofa bez ispravka: Grupa je pronašla 3800 "značajnih" gena s p<0,05 bez ispravka i predala to publikaciji. Kad je sudac zatražio ispravak FDR-a, popis je pao na 47 gena. Da je umjetna inteligencija od početka dodala Benjamini-Hochbergov kod, ove blamaže ne bi bilo. Pouka: o ispravku se ne može pregovarati.

Slučaj 2 — Učinak serije: U jednoj studiji uzorci su obrađeni dva različita dana. Ono što su mislili da je razlika "pacijent naspram kontrole" bila je zapravo razlika "1. dan naspram 2. dan" (učinak serije: tehnička razlika zbog osobe koja uzima uzorke). AI je pomogao ukloniti lažni signal tako što je predložio dodavanje varijable serije u model (~ serija + uvjet u formuli modela).

Slučaj 3 — Ignoriranje promjene nabora: Student je proglasio "najvažnijim" gen čija se ekspresija promijenila za 2%, ali je izmjereno kao vrlo stabilna, samo gledajući p-vrijednost. Dok je veličina učinka (log2FC) bila gotovo nula; statistički značaj nije biološki značaj. Model je objasnio ovu razliku i predložio vizualizaciju pomoću grafikona vulkana.

Tablica za usporedbu: jasnoća koncepta

koncept

Značenje

Zašto je to važno?

p-vrijednost

Vjerojatnost da je razlika slučajnost

sama po sebi može dovesti u zabludu

FDR (padj)

Ispravljena stopa pogreške u višestrukom testiranju

Ograničava lažno pozitivne rezultate

log2 fold promjena

Veličina efekta

Označava biološki značaj

batch efekt

Tehnička šaržna razlika

Stvara lažni signal

normalizacija

Korekcija ljestvice između uzoraka

Čini usporedbu poštenom

Uobičajene greške

  • Preskakanje korekcije višestruke usporedbe: Najčešća i najozbiljnija pogreška.
  • Samo gledajući p-vrijednost: svakako uzmite u obzir veličinu učinka (log2FC) zajedno.
  • Ne uključujući skupni učinak u modelu: Zamjena tehničke razlike s biološkom razlikom.
  • Zaboravljanje normalizacije: Izravna usporedba sirovih brojeva.
  • Uzročni jezik: Reći "Ovaj gen uzrokuje bolest"; Omics podaci pokazuju korelaciju, uzročnost zahtijeva dodatno eksperimentiranje.
Oprez: u visokodimenzionalnim podacima, "statistički značajno" i "biološki značajno" dvije su različite stvari. Popis gena koji je proizvela umjetna inteligencija početna je hipoteza; Svaki gen kandidata ne bi se trebao smatrati konačnim bez provjere neovisnom metodom (qPCR, mjerenje proteina).

Smanjenje veličine i kontrola kvalitete

Prvo što treba učiniti u visokodimenzionalnim podacima je vidjeti opću strukturu uzoraka. PCA (analiza glavnih komponenti: reduciranje tisuća varijabli u nekoliko sumarnih osi i njihovo prikazivanje u 2 dimenzije) standardni je alat za to. Ako su skupine koje očekujete (kontrola/tretman) odvojene u PCA tablici, to je dobro; ali ako su uzorci grupirani prema "danu obrade", a ne prema grupi, ovo je upozorenje o skupnom učinku. Isti grafikon također odmah prikazuje jedan izvanredni (neuspjeli) primjer.

Nacrtajte PCA iz moje normalizirane tablice ekspresije (red gena, uzorak stupca). Uzorci u boji po skupini (kontrola/tretman), oblik po šarži obrade. Komentirajte vidi li se na grafikonu skupni učinak ili uzorak odstupanja.

Ovaj heuristički korak pokreće ostatak analize: bolje je rano uhvatiti outlier nego gubiti mjesece na lažni rezultat.

Podaci jedne ćelije: nova dimenzija

U posljednjih nekoliko godina jednostanično RNA sekvenciranje (single-cell RNA-seq: mjerenje profila ekspresije tisuća pojedinačnih stanica) postalo je široko rasprostranjeno. Ovdje podaci postaju još veći: deseci tisuća stanica, tisuće gena svaka. Alati kao što je Scanpy (Python) obrađuju te podatke; grupira stanice i identificira tipove stanica. AI piše kod za ovaj tijek rada, ali biološka nomenklatura tipova stanica (bez obzira je li klaster "T stanica" ili "makrofag") oslanja se na markerske gene i stručno znanje. Svakako potvrdite oznaku vrste ćelije koju model dodjeljuje klasteru s poznatim oznakama; Ovo je najčešće krivo shvaćen korak u analizi jedne ćelije.

Otvoreni podaci i ponovljivost

Većina omics studija postavlja svoje podatke u javne repozitorije: GEO (Gene Expression Omnibus) i ArrayExpress za gensku ekspresiju, SRA (Sequence Read Archive) za neobrađene sekvence, PRIDE za proteomiku. Ovo je ključno kako bi drugi mogli provjeriti vaše rezultate i kako biste mogli ponovno analizirati podatke iz drugih studija. AI može napisati kod (s alatima kao što je GEOparse) koji preuzima i organizira podatke s GEO registracijskog broja (npr. GSE broj); Ali svakako pročitajte i potvrdite dizajn podataka koje ste preuzeli (koliko grupa, koliko ponavljanja, koji proces) iz izvornog zapisa. Ako model tvrdi da se "sjeća" dizajna studije, to je gotovo uvijek nagađanje koje treba provjeriti.

Ukratko

Omics podaci mjere tisuće varijabli u malom uzorku; To stvara zamke višestrukih usporedbi, skupnih učinaka i prekomjernog tumačenja. Umjetna inteligencija; Piše kod za analizu diferencijalnog izraza, objašnjava koncepte i pomaže vam u interpretaciji rezultata. Međutim, vaša je odgovornost primijeniti FDR korekciju, procijeniti veličinu učinka i izbjeći jezik uzročnosti. Geni kandidati su hipoteze dok se ne potvrde neovisnom metodom.

Zadatak aplikacije

Nabavite ili izradite tablicu rezultata uzorka diferencijalnog izraza (gen, log2FC, padj). Neka AI napiše kod koji filtrira prema FDR<0,05 i |log2FC|>1, prijavljuje broj značajnih gena i iscrtava grafikon vulkana. Pokrenite kod. Zatim neka model izračuna koliko bi se gena činilo "značajnim" da nije učinjena korekcija i protumačite razliku.

popis za provjeru

  • [ ] Primijenio sam korekciju višestruke usporedbe (FDR).
  • Procijenio sam veličinu učinka (log2FC) kao i [ ] p-vrijednost.
  • [ ] Provjerio sam serije/tehničke varijable.
  • [ ] Nisam preskočio korak normalizacije.
  • [ ] Koristio sam jezik korelacije, a ne uzročnosti.
  • [ ] Označio sam gene kandidate kao hipoteze koje treba potvrditi.