Jedinica 3 / 10

Omics analiza podataka: transkriptomika, proteomika i multi-omic integracija

Dobici:

  • Korekcija višestrukog testiranja (ispravljena p-vrijednost) u analizi diferencijalne ekspresije i sposobnost ispravnog tumačenja promjene nabora i izbjegavanja lažnih pozitivnih rezultata
  • Detekcija efekta serije i dodavanje u model sa PCA i odvajanje tehničke buke od biološke razlike
  • Sposobnost povezivanja svakog identiteta puta sa izvorom i kontrole sa biološkom dosljednošću u obogaćivanju puteva i multi-omic integraciji

Ćelija nije jedan broj; To je sistem u kojem hiljade gena, proteina i metabolita plešu istovremeno. Omics (zbirni naziv za pristupe koji mjere biološki sloj u cjelini) pokušava obuhvatiti cijeli ovaj ples: genomiku (DNK), transkriptomiku (RNA — koji geni rade i koliko), proteomiku (proteini), metabolomiku (male molekule). Svaki omics sloj proizvodi hiljade dimenzionalnih, bučnih i skupih podataka. AI je moćan u skeniranju ovih visokodimenzionalnih podataka i označavanju obrazaca; Ali vi ste taj koji odlučuje koji obrazac je biološka istina, a koji tehnička buka.

U ovoj cjelini nastavit ćemo kroz transkriptomiku, najobičniju omičku analizu; Principi se primjenjuju i na druge slojeve. Tipičan tok rada: matrica ekspresije iz sirovih podataka (redovi su geni, kolone su uzorci, ćelije su nivoi ekspresije), normalizacija (uklanjanje tehničkih razlika), analiza diferencijalne ekspresije (pronalaženje gena koji se značajno mijenjaju između dva stanja), obogaćivanje puta (pronalaženje na kojim biološkim putevima su promijenjeni geni grupirani) i interpretacija.

Diferencijalni izraz: fold promjena i korigirana p-vrijednost

Da bi se utvrdilo da li se gen „promijenio“, gledaju se dva broja: promjena puta — koliko puta se ekspresija povećava/smanjuje, obično na skali log2 — i prilagođena p-vrijednost (padj — statistika koja kontrolira lažno pozitivne rezultate kada se radi višestruko testiranje). Zašto popraviti? Zato što testirate 20.000 gena u isto vreme; Čak i slučajno, stotine gena mogu se pokazati kao "značajne". Bez višestruke korekcije testiranja – ograničavanja stope lažnog otkrivanja metodama kao što je Benjamini-Hochberg – lista je pogrešna. AI može napisati skriptu koja izračunava ovu statistiku, ali ako izostavi ispravku, vaš rezultat je znanstveno neodbranjiv.

Oprez: AI bi mogao reći "500 gena se značajno promijenilo" na osnovu sirove p-vrijednosti. Gledajući ispravljenu p-vrijednost, broj bi mogao pasti na 30. Uvijek sami provjerite ispravku višestrukog testa; Ovo je razlika između prihvatanja i odbijanja publikacije.

Batch efekat: najpodmuklija zamka

Efekt serije (tehnička razlika koja proizlazi iz obrade uzoraka po različitim danima, uređajima ili ljudima) je najveći izvor greške u omics analizi. Ako su vaša dva stanja obrađena dva različita dana, "biološka razlika" koju vidite može zapravo biti razlika u danu. AI može predložiti dodavanje varijable serije modelu (npr. ~ batch + uslov), ali vaša je odgovornost da je ispravno postavite i da je ne miješate u eksperimentalnom dizajnu.

Savjet: Prije početka analize nacrtajte PCA (analiza glavnih komponenti – metoda koja sumira i vizualizira visokodimenzionalne podatke na nekoliko osa). Ako su uzorci grupirani po serijama, a ne prema biološkom stanju, učinak serije je dominantan i prvo se mora ispraviti.

Multi-omics integracija

Pravo razumijevanje često dolazi od spajanja slojeva: ako gen radi jače, ali njegov protein se ne povećava, regulacija je na translacijskom nivou. Multi-omics integracija—kombinovanje različitih slojeva omike u jedan model—je mjesto gdje AI postaje jači, ali i gdje najviše obmanjuje; jer su skale, šum i podudaranje uzoraka slojeva različiti. AI predlaže radni tok integracije, ali vi kontrolirate biološku konzistentnost rezultata.

tri mini kofera

Slučaj 1 — Obogaćivanje ubrzano. 1.240 diferencijalnih gena pronađeno je u projektu raka. AI ih je pripremio za obogaćivanje puteva, naglašavajući ćelijski ciklus i puteve popravke DNK; Tim je napravio mapu hipoteza za 2 sata. Ali oni su ponovo testirali svaki put pomoću nezavisnog alata (g:Profiler) i otkrili da je jedan put pogrešno mapiran od strane AI.

Slučaj 2 — Zamka serije. Jedna laboratorija je otkrila "upečatljivu" razliku od 900 gena između dvije tretirane grupe. Kada su izvršili PCA, vidjeli su da su uzorci odvojeni serijama sekvenciranja. Nakon korekcije serije, stvarna razlika se smanjila na 60 gena. AI je nenamjerno izostavio varijablu serije u prvoj analizi.

Slučaj 3 — Izmišljeno ime putanje. Student je dao listu gena AI i upitao: "Koji KEGG put?" AI je dao ID putanje i ime kao da je stvarna. Kada je student tražio KEGG, vidio je da ta ID ne postoji; verifikacija je sprečila izmišljeni rezultat.

Četiri šablona za kopiranje

1) DESeq2 pregled toka posla:

Vaša uloga: računski biolog. Napišite korak po korak skriptu za analizu diferencijalne ekspresije RNA-seq pomoću R/DESeq2: očitavanje matrice brojanja, formula dizajna (~ serija + uvjet), normalizacija, tabela rezultata. IZRIČITO primijeniti korekciju višestrukog testiranja (BH) i koristiti padjcolumn. Objasnite šta svaki korak radi u redu za komentare.

2) Kontrola kvaliteta/serije:

Dajte mi RNA-seq QC kontrolnu listu: kontrola serije sa PCA, veličina biblioteke, broj detekcija gena, detekcija odstupanja. Za svaku metriku navedite prag "ono što vidim čini me zabrinutim". Objasnite šta trebam učiniti ako se miješaju serija i biološko stanje.

3) Provjera rezultata obogaćivanja:

Daću vam obogaćenu listu puteva (broj puteva, padj, geni). Zapišite identitet svakog puta (KEGG/GO ID) doslovno i nemojte ga izmišljati. Filtrirajte rezultate sa padj < 0,05. Navedite koji putevi biološki podržavaju jedni druge, ali označite svaki identitet kao "mora biti potvrđen u bazi podataka".

4) Multi-omics provjera konzistentnosti:

Transkriptomski i proteomski daju konfliktne smjerove ekspresije za par gen/protein. Navedite moguće biološke (uređivanje nakon prijevoda) i tehničke (šum mjerenja, podudaranje uzorka) razloge za to i recite mi kako da testiram svaki.

Slaba prompt / Jaka prompt

Slab upit:

Navedite važne puteve na ovoj listi gena.

Bez izvora, bez statistike, visok rizik od fabrikovanih puteva.

Snažan upit:

Vaša uloga: računski biolog. U priloženoj tabeli diferencijalnih gena (gen, log2FC, padj) uzmite samo gene sa padj < 0,05. Recite mi korake GO analize obogaćivanja koje treba izvršiti sa ovim genima i alatom (g:Profiler) koji ću koristiti. Ime putanje je FAKE; Ja ću pokrenuti alat i napraviti analizu, vi samo opišite ispravnu metodologiju i višestruku korekciju testiranja.

Razlika: jasan filter, fokus metodologije, zabrana izrade i prepuštanje verifikacije korisniku.

Koraci omike analize

korak

Svrha

uobičajena greška

AI uloga

normalizacija

Uklonite tehničku razliku

Pogrešan izbor metode

Skripta + obrazloženje

PCA/QC

Detekcija serije i odstupanja

preskoči moj korak

Slika + komentar

diferencijalni izraz

Pronalaženje gena koji se mijenjaju

Neispravljena str

Nacrt skripte

obogaćivanje

nađi put

izmišljen put

metodologija

integracija

spajanje slojeva

Greška u mjerilu/podudarnosti

Preporuka za radni tok

Jednoćelijska omika: nova skala

Poslednjih godina, jednoćelijsko sekvenciranje – merenje profila ekspresije svake od hiljada ćelija zasebno – odvelo je omiku u novu dimenziju. Sada, umjesto "prosječne ekspresije tkiva", možemo vidjeti svaki tip ćelije unutar tog tkiva posebno. Ova moć uvodi nove zamke: podaci su izuzetno rijetki (većina gena ima nula čitanja u većini ćelija – ispadanje), veličina je desetine hiljada ćelija × dvadeset hiljada gena, a razdvajanje tipova ćelija se uglavnom vrši grupiranjem. AI je moćan u stvaranju grupa i obrisa označavanja tipova ćelija na podacima jedne ćelije; ali s poznatim markerskim genima provjeravate da li je svaki klaster pravi tip ćelije ili tehnički artefakt (npr. mrtve ćelije, dvije ćelije uhvaćene zajedno). Nemojte prihvatiti oznaku tipa ćelije koju je predložio AI bez potvrde markerskih gena tog klastera u stvarnoj literaturi.

Savjet: U analizi jedne ćelije, ako AI predloži oznaku "T ćelija" grupi, provjerite sami da li su markeri T stanica (npr. CD3) zaista visoko izraženi u tom klasteru. Ako oznaka nije podržana tokenom, to je hipoteza, a ne zaključak.

Uobičajene greške

  • Preskakanje korekcije višestrukog testiranja. Lista se povećava sa sirovom p-vrednošću; padj treba koristiti.
  • Pogrešili smo efekat serije za biologiju. To treba prvo provjeriti sa PCA.
  • Jedini kriterij da promjena poda. Velika promjena nagiba može dovesti u zabludu kod gena sa niskom ekspresijom i bukom.
  • Prihvatanje izmišljenog puta/GO identiteta. Svaki identitet mora biti verifikovan u bazi podataka.
  • Potcjenjivanje veličine uzorka. Statistička snaga je niska u 2x2 dizajnu; Rezultate treba tumačiti s oprezom.

Ukratko

Omics analiza radi s visokodimenzionalnim, bučnim podacima, a AI ubrzava ove podatke skeniranjem, pisanjem skripti i označavanjem obrazaca. Ali višestruka korekcija testa u diferencijalnoj ekspresiji, kontrola serije sa PCA i verifikacija izvora u obogaćivanju su neophodni. Multi-omics integracija je moćna, ali obmanjujuća; Provjerite svaki rezultat s biološkom konzistencijom, uzimajući u obzir skalu i razlike u buci slojeva.

Zadatak aplikacije

Pronađite javno dostupnu matricu broja RNA-seq (npr. od GEO). Neka AI napiše skriptu za analizu sa šablonom "DESeq2 workflow" i provjeri u kodu da li je korekcija višestrukog testiranja stvarno primijenjena. Zatim zatražite od AI komentar o obogaćivanju i provjerite sve ID-ove putanja koje vraća jedan po jedan u bazi podataka KEGG ili GO; Obratite pažnju koliko ih je stvarnih.

kontrolna lista

  • [ ] Koristio sam padj (ispravljen) u diferencijalnoj analizi, a ne sirovu p-vrijednost.
  • [ ] Provjerio sam batch efekat sa PCA i dodao ga u model ako je potrebno.
  • [ ] Sa oprezom sam tumačio gene sa velikom promenom nabora, ali niskom ekspresijom.
  • [ ] Provjerio sam svaki ID putanje/GO u odnosu na pravu bazu podataka.
  • [ ] Procijenio sam statističku snagu veličine uzorka.
  • [ ] Podijelio sam multi-omične kontradikcije na biološke i tehničke uzroke.