Jednotka 3 / 10

Analýza dat Omics: Integrace transkriptomiky, proteomiky a multi-omiky

zisky:

  • Vícenásobná korekce testování (opravená p-hodnota) v diferenciální expresní analýze a schopnost správně interpretovat změnu násobku a vyhnout se falešným pozitivům
  • Detekce efektu dávky a jeho přidání do modelu pomocí PCA a oddělení technického šumu od biologického rozdílu
  • Schopnost propojit identitu každé dráhy se zdrojem a řídit ji s biologickou konzistencí při obohacování dráhy a integraci multi-omics

Buňka není jedno číslo; Je to systém, kde tisíce genů, proteinů a metabolitů tančí současně. Omika (souhrnný název pro přístupy, které měří biologickou vrstvu jako celek) se snaží zachytit celý tento tanec: genomika (DNA), transkriptomika (RNA – které geny fungují a jak moc), proteomika (proteiny), metabolomika (malé molekuly). Každá omická vrstva produkuje tisíce rozměrových, hlučných a nákladných dat. Umělá inteligence je výkonná při skenování těchto velkorozměrných dat a značkovacích vzorech; Ale vy jste ten, kdo rozhoduje, který vzorec je biologická pravda a který technický šum.

V této jednotce projdeme transkriptomikou, nejběžnější omickou analýzou; Zásady platí i pro další vrstvy. Typický pracovní postup: expresní matice z nezpracovaných dat (řádky jsou geny, sloupce jsou vzorky, buňky jsou úrovně exprese), normalizace (odstranění technických rozdílů), diferenciální analýza exprese (nalézání genů, které se významně mění mezi dvěma podmínkami), obohacení dráhy (zjištění, ve kterých biologických drahách jsou změněné geny shluky) a interpretace.

Diferenciální vyjádření: násobná změna a korigovaná p-hodnota

Abychom zjistili, zda se gen „změnil“, sledují se dvě čísla: násobná změna – kolikrát se exprese zvýší/sníží, obvykle na stupnici log2 – a upravená hodnota p (padj – statistika, která kontroluje falešně pozitivní výsledky při provádění více testů). Proč opravit? Protože testujete 20 000 genů současně; I náhodou se stovky genů mohou ukázat jako „významné“. Bez oprav vícenásobného testování – omezení míry falešných objevů pomocí metod, jako je Benjamini-Hochberg – je seznam zavádějící. AI ​​může napsat skript, který tuto statistiku vypočítá, ale pokud vynechá opravu, váš výsledek je vědecky neobhajitelný.

Upozornění: AI může na základě hrubé p-hodnoty říci „500 genů se významně změnilo“. Při pohledu na opravenou p-hodnotu by číslo mohlo klesnout na 30. Vždy si sami zkontrolujte vícetestovou korekci; To je rozdíl mezi přijetím a odmítnutím publikace.

Dávkový efekt: nejzákeřnější past

Dávkový efekt (technický rozdíl vznikající při zpracování vzorků různými dny, zařízeními nebo lidmi) je největším zdrojem chyb v omické analýze. Pokud byly vaše dvě podmínky zpracovány ve dvou různých dnech, „biologický rozdíl“, který vidíte, může být ve skutečnosti rozdílem dne. Umělá inteligence může navrhnout přidání proměnné dávky do modelu (např. ~ dávka + podmínka), ale je vaší odpovědností ji správně nastavit a nezamíchat ji v experimentálním návrhu.

Tip: Před zahájením analýzy nakreslete graf PCA (Principal Component Analysis – metoda, která shrnuje a vizualizuje vysokorozměrná data na několika osách). Pokud jsou vzorky seskupeny spíše podle šarže než podle biologického stavu, je účinek šarže dominantní a musí být nejprve opraven.

Multi-omická integrace

Skutečné pochopení často pochází ze skládání vrstev dohromady: pokud gen pracuje usilovněji, ale jeho protein se nezvyšuje, regulace je na translační úrovni. Multi-omická integrace – kombinování různých omických vrstev do jediného modelu – je místo, kde AI sílí, ale také nejvíce zavádí; protože měřítka, šum a shody vzorků vrstev jsou různé. AI navrhuje pracovní postup integrace, ale vy řídíte biologickou konzistenci výsledků.

tři mini pouzdra

Případ 1 – Zrychlené obohacování. V projektu rakoviny bylo nalezeno 1 240 diferenciálních genů. AI je připravila pro obohacení dráhy, zvýraznění buněčného cyklu a dráhy opravy DNA; Tým vytvořil mapu hypotéz za 2 hodiny. Každou cestu však znovu otestovali pomocí nezávislého nástroje (g:Profiler) a zjistili, že jedna cesta byla AI špatně zmapována.

Případ 2 – Dávková past. Jedna laboratoř zjistila „nápadný“ rozdíl 900 genů mezi dvěma léčebnými skupinami. Když provedli PCA, viděli, že vzorky byly odděleny sekvenační dávkou. Po korekci šarže se skutečný rozdíl snížil na 60 genů. AI neúmyslně vynechala proměnnou šarže v první analýze.

Případ 3 – Vymyšlený název cesty. Student dal seznam genů AI a zeptal se: "Jaká cesta KEGG?" AI ​​poskytla ID a jméno cesty, jako by to bylo skutečné. Když student hledal na KEGG, viděl, že toto ID neexistuje; ověření zabránilo vymyšlenému výsledku.

Čtyři kopírovatelné šablony

1) Náčrt pracovního postupu DESeq2:

Vaše role: počítačový biolog. Napište krok za krokem skript pro analýzu diferenciální exprese RNA-seq pomocí R/DESeq2: čtení matice počtu, návrhový vzorec (~ šarže + podmínka), normalizace, tabulka výsledků. VÝSLOVNĚ použijte korekci vícenásobného testování (BH) a použijte padjcolumn. V řádku komentáře vysvětlete, co každý krok dělá.

2) Kontrola kvality/šarže:

Dejte mi kontrolní seznam kontroly kvality RNA-seq: kontrola šarže pomocí PCA, velikost knihovny, počet detekcí genů, detekce odlehlých hodnot. Pro každou metriku zadejte práh „to, co vidím, mě znepokojuje“. Vysvětlete, co mám dělat, pokud se šarže a biologický stav mísí.

3) Ověření výsledku obohacení:

Dám vám obohacený seznam cest (počet drah, padj, geny). Zapište si doslovně identitu každé cesty (KEGG/GO ID) a nevymýšlejte si ji. Filtrujte výsledky s padj < 0,05. Určete, které dráhy se vzájemně biologicky podporují, ale každou identitu označte jako „musí být ověřena v databázi“.

4) Kontrola konzistence multi-omics:

Transkriptomický a proteomický výtěžek protichůdné směry exprese pro pár gen/protein. Uveďte možné biologické (úpravy po překladu) a technické (šum měření, párování vzorků) pro to a řekněte mi, jak je otestovat.

Slabá výzva / Silná výzva

Slabá výzva:

Pojmenujte důležité cesty v tomto seznamu genů.

Žádné zdroje, žádné statistiky, vysoké riziko vykonstruovaných cest.

Výkonná výzva:

Vaše role: počítačový biolog. V přiložené tabulce diferenciálních genů (gen, log2FC, padj) vezměte pouze geny s padj < 0,05. Řekněte mi kroky analýzy obohacení GO, která má být provedena s těmito geny, a nástroj (g:Profiler), který použiji. Název cesty je FAKE; Spustím nástroj a udělám analýzu, vy jen popíšete správnou metodiku a vícenásobnou opravu testování.

Rozdíl: jasný filtr, zaměření metodiky, zákaz výroby a ověření ponechání na uživateli.

Kroky analýzy omiky

krok

Účel

běžná chyba

Role AI

normalizace

Odstraňte technický rozdíl

Špatná volba metody

Scénář + zdůvodnění

PCA/QC

Dávková a odlehlá detekce

přeskoč můj krok

Obrázek + komentář

diferenciální výraz

Hledání měnících se genů

Neopravený p

Návrh scénáře

obohacení

najít cestu

vymyšlená cesta

metodologie

integrace

sloučit vrstvy

Chyba měřítka/shody

Doporučení pracovního postupu

Jednobuněčné omiky: nové měřítko

V posledních letech jednobuněčné sekvenování – měření expresního profilu každé z tisíců buněk samostatně – posunulo omiku do nové dimenze. Nyní namísto „průměrné exprese tkáně“ můžeme vidět každý typ buňky v této tkáni samostatně. Tato síla přináší nová úskalí: data jsou extrémně řídká (většina genů má ve většině buněk nulové čtení – vypadávání), velikost je desetitisíce buněk × dvacet tisíc genů a oddělování typů buněk se většinou provádí shlukováním. Umělá inteligence je výkonná při vytváření obrysů shlukování a označování typů buněk na datech jedné buňky; ale pomocí známých markerových genů ověříte, zda je každý shluk skutečným buněčným typem nebo technickým artefaktem (např. mrtvé buňky, dvě buňky zachycené dohromady). Nepřijímejte označení typu buňky navržené AI, aniž byste potvrdili markerové geny tohoto klastru ve skutečné literatuře.

Tip: Pokud při jednobuněčné analýze AI ​​navrhne klastru označení „T lymfocyt“, zkontrolujte sami, že markery T lymfocytů (např. CD3) jsou v tomto klastru skutečně vysoce exprimovány. Pokud označení není podporováno tokenem, jedná se o hypotézu, nikoli o závěr.

Časté chyby

  • Přeskakování oprav více testů. Seznam nabobtná hrubou p-hodnotou; měl by se použít padj.
  • Záměna dávkového efektu za biologii. Nejprve je třeba zkontrolovat pomocí PCA.
  • Jediným kritériem je změna podlahy. Vysoká násobná změna může být zavádějící u nízkoexpresních, hlučných genů.
  • Přijetí vytvořené identity cesty/GO. Každá identita musí být ověřena v databázi.
  • Podcenění velikosti vzorku. Statistická síla je nízká v designu 2x2; Výsledky je třeba interpretovat opatrně.

V souhrnu

Omics analýza pracuje s vysokorozměrnými, hlučnými daty a AI tato data urychluje jejich skenováním, psaním skriptů a označováním vzorů. Nepostradatelné jsou však vícenásobné korekce testu v diferenciálním vyjádření, dávkové řízení pomocí PCA a ověření zdroje při obohacování. Integrace multi-omics je výkonná, ale zavádějící; Zkontrolujte každý výsledek s biologickou konzistencí, přičemž vezměte v úvahu rozdíly v měřítku a šumu vrstev.

Aplikační úkol

Najděte veřejně dostupnou matici počtu RNA-seq (např. od GEO). Nechte AI napsat analytický skript se šablonou „DESeq2 workflow“ a zkontrolujte v kódu, že oprava vícenásobného testování byla skutečně použita. Poté požádejte AI ​​o komentář k obohacení a ověřte všechna ID cest, která vrací, jeden po druhém v databázi KEGG nebo GO; Všimněte si, kolik je skutečných.

kontrolní seznam

  • [ ] V diferenciální analýze jsem použil padj (opravený), nikoli hrubou hodnotu p.
  • [ ] Zkontroloval jsem dávkový efekt pomocí PCA a v případě potřeby jej přidal do modelu.
  • [ ] Geny s vysokou násobnou změnou, ale nízkou expresí jsem interpretoval opatrně.
  • [ ] Ověřil jsem každou cestu/GO ID proti skutečné databázi.
  • [ ] Hodnotil jsem statistickou sílu velikosti vzorku.
  • [ ] Multiomické rozpory jsem rozdělil na biologické a technické příčiny.