Jednotka 6 / 11

Analýza údajov Omics: RNA-seq, expresia, štatistika a obohacovanie dráhy

zisky:

  • Schopnosť porozumieť pracovnému postupu RNA-seq, analýze diferenciálnej expresie a korekcii viacnásobného testovania (FDR) a nechať umelú inteligenciu vytvárať overiteľný analytický kód
  • Schopnosť kriticky interpretovať výsledky obohatenia dráhy štatisticky a biologicky
  • Schopnosť vykonávať disciplínu kontroly štatistických predpokladov a viacerých úskalí testovania a nezávislého overovania biologickej významnosti.

„Omika“ je súhrnný názov pre prístupy, ktoré merajú všetky molekuly bunky alebo tkaniva spolu: genomika (všetky DNA), transkriptomika (všetky RNA/expresia), proteomika (všetky proteíny), metabolomika (všetky metabolity). Tieto údaje sú obrovské - experiment RNA-seq zahŕňa merania desiatok tisíc génov. V tejto lekcii sa naučíte, ako používať umelú inteligenciu (AI) ako asistenta pri omickej analýze, ktorá píše kód, vyberá štatistiky a navrhuje biologickú interpretáciu; ale dozviete sa, prečo si štatistický a biologický výsledok musíte overovať.

Kritické varovanie: V Omics sú najnebezpečnejšie chyby štatistické a neviditeľné. AI ​​môže napísať kód, ktorý obíde viacnásobnú korekciu porovnávania (nižšie), vyberie nesprávny test alebo vytvorí „falošne pozitívne“ zoznamy génov. Okrem toho môže AI vytvárať biologické tvrdenia, ako napríklad „tento gén sa pri tejto chorobe zvyšuje“ bez akéhokoľvek zdroja. Správna cesta: urobiť analýzu pomocou spustiteľného, ​​auditovateľného kódu a potvrdiť každé biologické tvrdenie v literatúre.

Základné pojmy

  • Expresia: Koľko je gén preložený do RNA; miera „aktivity“.
  • Diferenciálna expresia (DE): Gény, ktorých expresia sa výrazne mení medzi dvoma skupinami (napr. pacient/zdravý).
  • p-hodnota: pravdepodobnosť, že rozdiel je náhoda; ak je malý, rozdiel sa považuje za „významný“.
  • Oprava viacnásobného porovnania: Keď sa súčasne pozerajú na desaťtisíce génov, náhodou sa nájdu také, ktoré sú „významné“. Na nápravu sa používajú metódy ako FDR (false discovery rate) / Benjamini-Hochberg. Ak sa táto oprava vynechá, vzniknú stovky falošných zistení.
  • log2 násobná zmena (log2FC): Logaritmus pomeru expresie génu medzi dvoma skupinami k báze 2; +1 znamená dvojnásobné zvýšenie, −1 znamená dvojnásobné zníženie.
  • Obohatenie dráhy: Zistenie, v ktorých biologických dráhach (napr. bunkové delenie, imunita) sú sústredené zmenené gény; Používajú sa databázy ako GO a KEGG.
  • Dávkový efekt: Nebiologický falošný rozdiel vznikajúci pri spracovaní vzoriek v rôznych dňoch/zariadeniach.

Krok za krokom: omická analýza založená na AI

1. Objasnite experimentálny dizajn a otázku. Koľko vzoriek, koľko skupín, koľko opakovaní? Je štatistická sila dostatočná? Vysvetlite dizajn AI.

2. Pomocou AI vyberte vhodný nástroj/metódu. Pre RNA-seq zvoľte štandardné metódy, ako napríklad DESeq2/edgeR (štatistické balíky určené pre údaje o počte); Použite skôr overené metódy ako štatistiku, ktorú AI „vymyslela“.

3. Spustite kód a skontrolujte medzivýstupy. Nepokračujte v DE analýze bez normalizácie, kontroly dávkového účinku a grafov kvality (PCA).

4. Vynútiť korekciu viacnásobného porovnania. Filtrujte výsledky podľa opravenej hodnoty (padj/FDR), nie podľa surovej hodnoty p.

5. Potvrďte biologickú interpretáciu v literatúre. Interpretujte výstup obohatenia cesty pomocou AI, ale overte každé tvrdenie pri zdroji.

Tip: Pri analýze DE sa najprv pozrite na grafy kvality a súhrnného vplyvu. Ak sú vzorky zoskupené podľa dňa, kedy boli spracované, a nie podľa biologickej skupiny, väčšina „významných“ génov, ktoré nájdete, sú kumulatívne účinky, nie skutočná biológia.

tri mini prípady

Prípad 1 – Neopravená p-hodnota. Študent testoval 20 000 génov pomocou kódu napísaného AI a našiel „540 významných génov“. Keď skúmal kód, videl, že AI preskočila viacnásobnú opravu porovnania. Keď sa pridala korekcia FDR, počet významných génov sa znížil na 32. Bez korekcie by na príbehu bolo založených viac ako 500 falošných génov.

Prípad 2 – Vymyslené biologické tvrdenie. V prípade génu na zozname DE sa výskumník spýtal AI ​​„Čo tento gén robí pri tejto chorobe? spýtal sa; AI vysvetlila presvedčivý mechanizmus a článok. Keď hľadal na PubMed, zistil, že ani tento mechanizmus, ani článok neexistujú. Nárok bol z prehľadu odstránený.

Prípad 3 – Získané potvrdenie. Doktorand si všimol, že na pozemku PCA boli vzorky od seba vzdialené dva dni. Požiadal AI, aby do kódu pridala premennú dávkového efektu; Po korekcii sa génový zoznam úplne zmenil a stal sa biologicky významným. Bez tabuľky kontroly kvality by mohol byť zverejnený falošný výsledok.

Príklad: filtrovanie s upravenou hodnotou p

import pandy ako pd# nech tabuľka 'de' sú výsledky z nástroja DE (DESeq2/edgeR):# stĺpcov: gén, log2FC, pvalue, padj (opravené FDR)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] & (de)"log >2.05) 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR-opravený padj<0.05 & |log2FC|>=1:", len(významné))

Rozdiel medzi nespracovaným a opraveným číslom ilustruje, prečo sú viaceré porovnania kritické.

Štyri kopírovateľné šablóny

1) Výber plánu analýzy a metódy:

Vaša úloha: asistent bioinformatiky. Nastavte plán analýzy pre nasledujúci experiment RNA-seq: [počet skupín, počet vzoriek/replikácií, otázka]. Ktorý štandardný nástroj (DESeq2/edgeR) by som si mal vybrať a prečo, aké kroky kontroly kvality (PCA, dávkový efekt) sú potrebné, ako použijem korekciu viacnásobného porovnania? Píšte krok za krokom.

2) Kód + povinné kontroly:

Napíšte spustiteľný kód, ktorý vykoná nasledujúcu analýzu DE: [detail]. Kód MUSÍ zahŕňať normalizáciu, graf kvality PCA, kontrolu dávkového účinku a korekciu FDR (Benjamini-Hochberg). Komentujte každý krok. Filtrujte s upravenou hodnotou p, nie s surovou hodnotou p.

3) Komentár k obohateniu cesty:

Pomôžte interpretovať výsledky obohatenia dráhy pre tento zoznam významných génov: [zoznam/výstup]. Vysvetlite, ktoré cesty sú významné, ale povedzte mi, v ktorom zdroji (GO, KEGG, recenzovaný článok), aby som potvrdil každé biologické tvrdenie. MONTÁŽ mechanizmu/článku.

4) Štatistický audit:

Skontrolujte štatistické chyby v nasledujúcom kóde analýzy: [kód]. Konkrétne: nesprávny výber testu, vynechanie korekcie viacnásobného porovnania, ignorovanie dávkového efektu, nedostatočná replikácia. Uveďte každý problém, ktorý ste našli, a jeho opravu.

Slabá výzva / Silná výzva

Slabé: "Nájdite významné gény v týchto údajoch RNA-seq."

Problém: Metóda, kontrola kvality a viacnásobné porovnania nie sú špecifikované; AI môže poskytnúť zoznam plný falošných poplachov bez opravy.

Strong: "Napíšte kód, ktorý vykoná analýzu DE pre tieto údaje o počte RNA-seq s logikou DESeq2, zahŕňa kontrolu kvality a kontrolu hromadného efektu pomocou PCA a filtre s korekciou FDR; komentujte každý krok a vysvetlite, prečo ste si vybrali túto metódu."

Prečo je účinný: Metóda je štandardná, kvalita a korekcia sú povinné, výsledok je overiteľný.

Riziko

symptóm

preventívne opatrenie

falošne pozitívny

Príliš veľa „zmysluplných“ génov

Korekcia FDR/viacnásobného porovnania

kolektívny vplyv

Vzorky sú zoskupené podľa dňa

PCA + premenná šarže

nesprávny test

Normálny test na počítanie údajov

Vhodná metóda ako DESeq2/edgeR

vymyslená biológia

Bezzvárací mechanizmus

Potvrdenie literatúry

nedostatočný výkon

1-2 opakovania

Dosť opakovania v dizajne

Časté chyby

  • Preskočenie opravy viacerých porovnaní. Najčastejšia a najškodlivejšia štatistická chyba.
  • Ignorovanie kolektívneho dopadu. Vytvára falošné biologické rozdiely.
  • Použitie nesprávneho testovania na počítanie údajov. RNA-seq vyžaduje špeciálne metódy.
  • Prijímanie biologických tvrdení bez zdroja. AI môže vytvárať mechanizmy a články.
  • Zovšeobecňovanie s nedostatočným opakovaním. Bez štatistickej sily je výsledok nespoľahlivý.
Pozor: „Štatisticky významné“ nie je to isté ako „biologicky významné“. Veľmi malá, ale technicky významná násobná zmena môže byť biologicky nevýznamná; Vo veľkých vzorkách sa všetko môže ukázať ako "významné". Spolu vyhodnoťte log2FC a p-hodnotu.

Hĺbka: pozadie a úskalia dvojitého počítania pri obohacovaní cesty

Výsledky obohatenia cesty sa spoliehajú na dva skryté predpoklady, ktoré si väčšina ľudí neuvedomuje, a AI ich môže v tichosti obísť. Prvým je výber pozadia/vesmíru: obohatenie porovnáva súbor „génov, ktoré sa zmenili“ so súborom „ktoré gény sa skúmali“. Ak je pozadie prevzaté z celého genómu, ale váš experiment meria iba špecifický tkanivový panel, výsledky sa zdajú byť umelo „obohatené“. Správne pozadie sú gény, ktoré môžu byť skutočne exprimované/merané v experimente. Jeden tím zistil „veľmi významné obohatenie imunitnej dráhy“ omylom na pozadí celého genómu; Keď sa analýza zopakovala so správnym pozadím (namerané gény), obohatenie zmizlo - nález bol artefaktom metódy.

Po druhé, veľkosť súboru génov a dvojité počítanie: veľmi veľké a všeobecné dráhy (napr. „metabolické procesy“, tisíce génov) sa javia ako „významné“ takmer v každom zozname; malé, špecifické cesty sú informatívnejšie. Navyše, pretože rovnaký gén sa nachádza vo viacerých dráhach, je zavádzajúce považovať prekrývajúce sa dráhy za nezávislý dôkaz. Tretí bod: neukazuje smer obohacovania; Dráha môže byť obohatená, ale polovica génov v nej môže byť zvýšená a druhá polovica môže byť znížená. Aby ste to videli, je potrebné samostatne preskúmať smerové informácie (napríklad GSEA).

pasca

symptóm

preventívne opatrenie

zlé pozadie

Všetko sa zdá obohatené

Získajte namerané génové pozadie

Veľmi všeobecná cesta

Vždy príde na rad „metabolizmus“.

Zamerajte sa na malé, špecifické cesty

dvojité započítanie

prekrývajúce sa cesty

Neberte to ako nezávislý dôkaz

preskočiť smer

zmiešané stúpanie/klesanie

Smerové ovládanie s GSEA

V súhrne

  • AI v omickej analýze; je asistent, ktorý vyberá metódy, píše kód a pripravuje komentáre; štatistické a biologické rozhodnutia musia byť odôvodnené.
  • Mali by sa použiť štandardné osvedčené metódy (DESeq2/edgeR); Kontrola kvality a kolektívny audit dopadu by sa nemali vynechávať.
  • Oprava viacnásobného porovnania (FDR) je povinná; výsledky sa filtrujú s opravenou hodnotou.
  • Každé biologické tvrdenie musí byť potvrdené v literatúre; „významné“ treba odlíšiť od „dôležité“.

Aplikačná úloha

Vezmite vzorovú tabuľku výsledkov DE (alebo otvorený súbor údajov RNA-seq). Porovnajte významné počty génov na základe surovej hodnoty p a opravených prahových hodnôt padj s úryvkom vyššie. Okomentujte rozdiel jednou vetou. Potom požiadajte o biologickú interpretáciu pomocou šablóny 3 pre charakteristický gén a overte si tvrdenie v PubMed.

kontrolný zoznam

  • [ ] Vyhodnotil som experimentálny dizajn a štatistickú silu.
  • [ ] Zvolil som štandardný, pohodlný spôsob.
  • [ ] Urobil som kontrolu kvality PCA a dávkového efektu.
  • [ ] Použil som korekciu viacnásobného porovnania (FDR).
  • [ ] Filtroval som výsledky s opravenou hodnotou p.
  • [ ] Potvrdil som biologické tvrdenia v literatúre.