Jednotka 6 / 11

Analýza dat Omics: RNA-seq, exprese, statistika a obohacování cest

zisky:

  • Schopnost porozumět pracovnímu postupu RNA-seq, diferenciální expresní analýze a opravě vícenásobného testování (FDR) a nechat umělou inteligenci produkovat ověřitelný analytický kód
  • Schopnost kriticky interpretovat výsledky obohacení dráhy statisticky a biologicky
  • Schopnost uplatnit disciplínu kontroly statistických předpokladů a četných testovacích úskalí a nezávislého ověřování biologické významnosti.

„Omika“ je souhrnný název pro přístupy, které měří všechny molekuly buňky nebo tkáně společně: genomika (všechna DNA), transkriptomika (všechna RNA/exprese), proteomika (všechny proteiny), metabolomika (všechny metabolity). Tato data jsou obrovská – experiment RNA-seq zahrnuje měření desítek tisíc genů. V této lekci se naučíte používat umělou inteligenci (AI) jako asistenta při omické analýze, která píše kód, vybírá statistiky a navrhuje biologickou interpretaci; ale dozvíte se, proč musíte statistický a biologický výsledek ověřit.

Kritické varování: V Omics jsou nejnebezpečnější chyby statistické a neviditelné. Umělá inteligence může napsat kód, který obejde vícenásobnou korekci srovnání (níže), vybere špatný test nebo vytvoří „falešně pozitivní“ seznamy genů. Kromě toho může umělá inteligence vymýšlet biologická tvrzení jako „tento gen se u této nemoci zvyšuje“ bez jakéhokoli zdroje. Správná cesta: provést analýzu pomocí spustitelného, ​​auditovatelného kódu a potvrdit každé biologické tvrzení v literatuře.

Základní pojmy

  • Exprese: Jak moc je gen přeložen do RNA; měřítko „aktivity“.
  • Diferenciální exprese (DE): Geny, jejichž exprese se významně mění mezi dvěma skupinami (např. pacient/zdravý).
  • p-hodnota: pravděpodobnost, že rozdíl je náhoda; pokud je malý, považuje se rozdíl za „významný“.
  • Oprava vícenásobného srovnání: Když se současně podíváme na desítky tisíc genů, náhodou se najdou některé, které jsou „významné“. K nápravě se používají metody jako FDR (false discovery rate) / Benjamini-Hochberg. Pokud se tato oprava vynechá, vzniknou stovky falešných zjištění.
  • log2násobná změna (log2FC): Logaritmus poměru exprese genu mezi dvěma skupinami k bázi 2; +1 znamená dvojnásobné zvýšení, −1 znamená dvojnásobné snížení.
  • Obohacení dráhy: Zjištění, ve kterých biologických drahách (např. buněčné dělení, imunita) jsou změněné geny soustředěny; Používají se databáze jako GO a KEGG.
  • Dávkový efekt: Nebiologický falešný rozdíl vznikající při zpracování vzorků v různých dnech/zařízeních.

Krok za krokem: omická analýza založená na AI

1. Vyjasněte experimentální design a otázku. Kolik vzorků, kolik skupin, kolik opakování? Je statistická síla dostatečná? Vysvětlete design AI.

2. Pomocí AI vyberte vhodný nástroj/metodu. Pro RNA-seq zvolte standardní metody, jako je DESeq2/edgeR (statistické balíčky určené pro početní data); Používejte raději osvědčené metody než statistiku, kterou AI „vymyslela“.

3. Spusťte kód a zkontrolujte mezivýstupy. Nepokračujte v DE analýze bez normalizace, kontroly dávkového efektu, grafů kvality (PCA).

4. Vynutit opravu vícenásobného porovnání. Filtrujte výsledky podle opravené hodnoty (padj/FDR), nikoli podle nezpracované hodnoty p.

5. Ověřte biologickou interpretaci v literatuře. Interpretujte výstup obohacení cesty pomocí AI, ale ověřte každý požadavek u zdroje.

Tip: Při analýze DE se nejprve podívejte na grafy kvality a souhrnného dopadu. Pokud jsou vzorky seskupeny podle dne, kdy byly zpracovány, spíše než podle biologické skupiny, většina „významných“ genů, které najdete, jsou kumulativní účinky, nikoli skutečná biologie.

tři mini pouzdra

Případ 1 – Neopravená p-hodnota. Student testoval 20 000 genů pomocí kódu napsaného AI a našel „540 významných genů“. Když prozkoumal kód, viděl, že AI přeskočila vícenásobnou korekci srovnání. Když byla přidána korekce FDR, počet významných genů se snížil na 32. Bez opravy by na příběhu vycházelo více než 500 falešných genů.

Případ 2 – Vymyšlené biologické tvrzení. U genu na seznamu DE se výzkumník zeptal AI ​​„co tento gen dělá v této nemoci?“ zeptal se; AI vysvětlila přesvědčivý mechanismus a článek. Když hledal na PubMed, viděl, že ani tento mechanismus, ani článek neexistují. Nárok byl z přehledu odstraněn.

Případ 3 – Získané potvrzení. Doktorand si všiml, že vzorky byly v PCA grafu odděleny dvěma dny. Požádal AI, aby do kódu přidala proměnnou dávkového efektu; Po korekci byl seznam genů zcela změněn a stal se biologicky významným. Bez tabulky kontroly kvality by mohl být zveřejněn falešný výsledek.

Příklad: filtrování s opravenou p-hodnotou

importovat pandy jako pd# nechat tabulku 'de' být výsledky z nástroje DE (DESeq2/edgeR):# sloupce: gen, log2FC, pvalue, padj (opraveno FDR)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] & (de)"log>2. 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR-opravený padj<0.05 & |log2FC|>=1:", len(významné))

Rozdíl mezi nezpracovaným a opraveným číslem ilustruje, proč jsou vícenásobná srovnání kritická.

Čtyři kopírovatelné šablony

1) Výběr plánu analýzy a metody:

Vaše role: asistent bioinformatiky. Nastavte plán analýzy pro následující experiment RNA-seq: [počet skupin, počet vzorků/replikátů, otázka]. Který standardní nástroj (DESeq2/edgeR) bych si měl vybrat a proč, jaké kroky kontroly kvality (PCA, dávkový efekt) jsou vyžadovány, jak mohu použít korekci vícenásobného srovnání? Pište krok za krokem.

2) Kód + povinné kontroly:

Napište spustitelný kód, který provede následující analýzu DE: [detail]. Kód MUSÍ zahrnovat normalizaci, graf kvality PCA, kontrolu dávkového účinku a korekci FDR (Benjamini-Hochberg). Každý krok komentujte. Filtrujte s opravenou p-hodnotou, nikoli s nezpracovanou p-hodnotou.

3) Komentář k obohacení cesty:

Pomozte interpretovat výsledky obohacení dráhy pro tento seznam významných genů: [seznam/výstup]. Vysvětlete, které cesty jsou významné, ale řekněte mi, ve kterém zdroji (GO, KEGG, recenzovaný článek), abych potvrdil každé biologické tvrzení. MONTÁŽ mechanismu/předmětu.

4) Statistický audit:

Zkontrolujte následující kód analýzy, zda neobsahuje statistické chyby: [kód]. Konkrétně: nesprávný výběr testu, vynechání opravy vícenásobného srovnání, ignorování dávkového efektu, nedostatečná replikace. Uveďte každý problém, který jste našli, a jeho opravu.

Slabá výzva / Silná výzva

Slabý: "Najděte významné geny v těchto datech RNA-seq."

Problém: Metoda, kontrola kvality a vícenásobná srovnání nejsou specifikovány; AI může poskytnout seznam plný falešných poplachů bez opravy.

Strong: "Napište kód, který provede DE analýzu pro tato data počtu RNA-seq s logikou DESeq2, zahrnuje kontrolu kvality a kontrolu hromadného efektu pomocí PCA a filtry s korekcí FDR; komentujte každý krok a vysvětlete, proč jste zvolili tuto metodu."

Proč je výkonná: Metoda je standardní, kvalita a korekce jsou povinné, výsledek je auditovatelný.

Riziko

symptom

preventivní opatření

falešně pozitivní

Příliš mnoho „smysluplných“ genů

Korekce FDR/vícenásobného srovnání

kolektivní dopad

Vzorky jsou seskupeny po dnech

PCA + proměnná šarže

špatný test

Normální test pro počítání dat

Vhodná metoda jako DESeq2/edgeR

vymyšlená biologie

Bezsvařovací mechanismus

Potvrzení literatury

nedostatečný výkon

1-2 opakování

Dostatek opakování v designu

Časté chyby

  • Vynechání opravy vícenásobného srovnání. Nejčastější a nejškodlivější statistická chyba.
  • Ignorování kolektivního dopadu. Vytváří falešné biologické rozdíly.
  • Použití nesprávného testování na počítání dat. RNA-seq vyžaduje speciální metody.
  • Přijímání biologických tvrzení bez zdroje. AI může tvořit mechanismy a články.
  • Zobecňování s nedostatečným opakováním. Bez statistické síly je výsledek nespolehlivý.
Pozor: „Statisticky významný“ není totéž jako „biologicky významný“. Velmi malá, ale technicky významná násobná změna může být biologicky nevýznamná; Ve velkých vzorcích se vše může ukázat jako "významné". Vyhodnoťte log2FC a p-hodnotu společně.

Hloubka: úskalí pozadí a dvojího počítání při obohacování cesty

Výsledky obohacení cesty spoléhají na dva skryté předpoklady, které si většina lidí neuvědomuje, a umělá inteligence je může tiše obejít. Prvním je výběr pozadí/vesmíru: obohacení porovnává soubor „genů, které se změnily“ se souborem „které geny byly zkoumány“. Pokud je pozadí odebráno z celého genomu, ale váš experiment měří pouze konkrétní tkáňový panel, výsledky se zdají uměle „obohacené“. Správné pozadí jsou geny, které mohou být skutečně exprimovány/měřeny v experimentu. Jeden tým zjistil „velmi významné obohacení imunitní dráhy“ omylem v pozadí celého genomu; Když byla analýza opakována se správným pozadím (naměřené geny), obohacení zmizelo – nález byl artefakt metody.

Za druhé, velikost genové sady a dvojí počítání: velmi rozsáhlé a obecné dráhy (např. „metabolické procesy“, tisíce genů) se objevují jako „významné“ téměř v každém seznamu; malé, specifické cesty jsou informativnější. Navíc, protože stejný gen se nachází ve více drahách, je zavádějící považovat překrývající se dráhy za nezávislý důkaz. Třetí bod: neukazuje směr obohacování; Dráha může být obohacena, ale polovina genů v ní může být zvýšena a druhá polovina může být snížena. Abychom to viděli, je nutné samostatně prozkoumat směrové informace (jako je GSEA).

past

symptom

preventivní opatření

špatné pozadí

Všechno se zdá obohacené

Získejte změřené pozadí genů

Velmi obecná cesta

Vždy se objeví "metabolismus".

Zaměřte se na malé, specifické cesty

dvojité počítání

překrývající se cesty

Neberte to jako nezávislý důkaz

přeskočit směr

smíšené vzestupně/sestupně

Směrové ovládání s GSEA

V souhrnu

  • AI v omické analýze; je asistent, který vybírá metody, píše kód a navrhuje komentáře; statistická a biologická rozhodnutí musí být odůvodněná.
  • Měly by být použity standardní osvědčené metody (DESeq2/edgeR); Kontrola kvality a kolektivní audit dopadu by neměly být přeskočeny.
  • Oprava vícenásobného porovnání (FDR) je povinná; výsledky jsou filtrovány s opravenou hodnotou.
  • Každé biologické tvrzení musí být potvrzeno v literatuře; „významný“ je třeba odlišit od „důležitého“.

Aplikační úkol

Vezměte vzorovou tabulku výsledků DE (nebo otevřený soubor dat RNA-seq). Porovnejte významné počty genů na základě nezpracované hodnoty p a opravených prahových hodnot padj s úryvkem výše. Okomentujte rozdíl jednou větou. Poté požádejte o biologickou interpretaci pomocí šablony 3 pro uváděný gen a sami si tvrzení ověřte v PubMed.

kontrolní seznam

  • [ ] Vyhodnotil jsem experimentální design a statistickou sílu.
  • [ ] Zvolil jsem standardní, pohodlnou metodu.
  • [ ] Provedl jsem kontrolu kvality PCA a dávkového efektu.
  • [ ] Použil jsem korekci vícenásobného porovnání (FDR).
  • [ ] Filtroval jsem výsledky s opravenou p-hodnotou.
  • [ ] Potvrdil jsem biologická tvrzení v literatuře.