Egység 4 / 11

Omics adatok és nagy dimenziós elemzés

Nyereség:

  • Képes a többszörös összehasonlítás problémájának megértésére és az FDR (false discovery rate) korrekciójának bevonására az elemzésbe
  • Képes a statisztikai és biológiai szignifikancia megkülönböztetésére a p-érték és a hatás méretének (log2-szeres változás) együttes értékelésével
  • Képes felismerni és elkerülni a nagy dimenziós adatcsapdákat, például a kötegelt hatást és az oksági ugrást

Az „omika” szó olyan megközelítéseket ír le, amelyek egy sejtben lévő molekulák egész osztályát mérik: genomika (minden DNS), transzkriptomika (minden RNS / génexpresszió), proteomika (minden fehérje), metabolomika (minden kis molekula). Ezeknek a méréseknek a közös jellemzője a nagy dimenziósság: több ezer vagy akár tízezer változó (gén, fehérje) mérése történik egyidejűleg egyetlen mintában, de a minták száma általában kicsi (pl. 20 beteg). Ez a „sok változó, kevés minta” helyzet olyan kihívások forrása, amelyek egyedülállóak a biológiában és azon területeken, ahol a mesterséges intelligencia a leghasznosabb lehet.

Ebben az egységben a transzkriptomika (RNS-seq) példáján keresztül tárgyaljuk a differenciális expressziós elemzést (olyan gének megtalálását, amelyek expressziója jelentősen változik két csoport között) és a mesterséges intelligencia szerepét ebben a munkafolyamatban.

A nagy dimenziós adatok fő problémája

Ha több ezer gént tesztelsz egyszerre, véletlenül "szignifikánsnak" tűnő géneket találsz, még akkor is, ha nincsenek valódi különbségek. Ha 20 000 gént tesztel 5%-os hibahatárral, akkor ~1000 gén véletlenül „szignifikánsnak” bizonyulhat. Ezt többszörös összehasonlítási problémának nevezik, és ez az omikaelemzés legkritikusabb buktatója. A megoldás a p-értékek kijavítása (pl. FDR kiszámítása - hamis felfedezési arány a Benjamini-Hochberg módszerrel). Az AI nagyon hasznos ennek a fogalomnak a magyarázatában és a megfelelő kód megírásában; de az Ön felelőssége, hogy ne felejtse el alkalmazni a korrekciót.

Tipp: Ha olyan számot lát, mint „3000 gén jelentősen megváltozott” az omics eredményében, ijedjen meg. Ez általában annak a jele, hogy nem történt többszörös összehasonlításkorrekció. Egy reális lista tíz-több száz gént tartalmazna egy jól megtervezett kísérletben.

RNS-seq differenciális expresszió: lépésről lépésre

  1. Nyers számok: táblázat, amely tartalmazza, hogy hány leolvasás esett az egyes mintákban az egyes géneknél.
  2. Minőség és szűrés: Dobja el a nagyon alacsony expressziójú géneket.
  3. Normalizálás: Helyes könyvtárméret-különbség a minták között (a nyers szám nem összehasonlítható).
  4. Statisztikai modell: Tesztcsoport-különbség a DESeq2-vel vagy az edgeR-rel (R könyvtárak) vagy a pyDESeq2-vel Pythonban.
  5. Többszörös összehasonlítás korrekciója: FDR kiszámítása; általában az FDR küszöbértéke < 0,05.
  6. Hatás mérete: Értékelés log2-szeres változással: hányszor nő/csökken a kifejezés.
  7. Megjegyzés: Társítsa össze a jelentős géneket a biológiai útvonalakkal.

Mesterséges intelligencia 3-6. Kódolja a lépéseket, elmagyarázza a fogalmakat, és segít értelmezni a kimenetet. A modell azonban nem tudja megmondani, hogy "melyik gén változott meg" anélkül, hogy látná a nyers adatokat; A kód és a statisztikák ezt mondják.

Másolható prompt sablonok

Szerep: Ön a transzkriptomikai elemzési asszisztens. Kontextus: Van egy RNS-seq nyers számlálási táblázatom (CSV) 12 kontroll, 12 kezelési mintából. Feladat: Sorolja fel a differenciális kifejezés analízis lépéseit a pyDESeq2-vel, magyarázza el, miért van szükség az egyes lépésekre. Először a terv, a második a kód. Ügyeljen arra, hogy többszörös összehasonlításkorrekciót is tartalmazzon.

Az elemzés eredménye 4200 gént mutatott "p<0,05"-ként. Miért lehet ez gyanús? Magyarázza el a többszörös összehasonlítás korrekcióját (Benjamini-Hochberg FDR), és adjon meg Python-kódot, amely elvégzi a megfelelő szűrést.

Írjon kódot, amely egy vulkán diagramot rajzol a differenciális kifejezés eredménytáblázatából (gén, log2FC, padj oszlopok). Színezd ki a géneket FDR<0,05 és |log2FC|>1 értékkel, és jelöld meg a 10 legfelsőt.

Hogyan elemzem ezt a jelentős génlistát az útvonal-dúsítás szempontjából? Magyarázza el a gseapy vagy g:Profiler lépéseit. Ne állítson abszolút ok-okozati összefüggést a megjegyzésben, használja a korrelációs nyelvezetet. Génlista: [lista]

Gyenge felszólítás / Erős felszólítás

Gyenge: "Mondd meg, mely gének fontosak az RNS-seq hozamban."

Erős: "PyDESeq2 kimenetem van 12 kontrollból, 12 kezelési mintám: táblázat génnel, log2FoldChange, padj oszlopok. Adja meg a kódot, amely kiszűri a jelentős géneket FDR<0,05 és |log2FC|>1 küszöbértékekkel, jelenti a számukat, és rangsorolja a 20 legerősebb gént a hatás méretével."

Különbség: A hatékony prompt tényleges kimeneti oszlopokat, küszöbértékeket és érvényesítési kérelmet tartalmaz. A modell feldolgozza az Ön adatait ahelyett, hogy kitalált génnevet generálna.

három mini tok

1. eset – Katasztrófa javítás nélkül: Egy csoport 3800 „szignifikáns” gént talált p<0,05 korrekció nélkül, és benyújtotta egy publikációnak. Amikor a játékvezető FDR korrekciót kért, a lista 47 génre csökkent. Ha a mesterséges intelligencia kezdettől fogva hozzáadta volna a Benjamini-Hochberg kódot, ez a zavar nem történt volna. Tanulság: a javítás nem alku tárgya.

2. eset – Batch hatás: Egy vizsgálatban a mintákat két különböző napon dolgozták fel. Amit úgy gondoltak, hogy "beteg vs. kontroll" különbség volt, az valójában egy "1. nap vs. 2. nap" különbség volt (kötegelt hatás: technikai különbség a mintavételi fél miatt). Az AI segített kiszűrni a hamis jelet azáltal, hogy azt javasolta, hogy adjuk hozzá a batch változót a modellhez (~ batch + feltétel a modell képletében).

3. eset – A hajtás változásának figyelmen kívül hagyása: Egy tanuló a „legfontosabbnak” egy gént nyilvánított, amelynek expressziója 2%-kal megváltozott, de nagyon stabilnak mértük, pusztán a p-érték alapján. mivel a hatás mérete (log2FC) majdnem nulla volt; a statisztikai szignifikancia nem biológiai szignifikancia. A modell elmagyarázta ezt a különbséget, és azt javasolta, hogy vulkángrafikonnal jelenítsék meg.

Összehasonlító táblázat: koncepció egyértelműsége

koncepció

Jelentése

Miért fontos?

p-érték

Annak a valószínűsége, hogy a különbség véletlen egybeesés

önmagában félrevezető lehet

FDR (padj)

Korrigált hibaarány többszörös tesztelés során

Korlátozza a hamis pozitív eredményeket

log2 szeres változás

Hatás mérete

Biológiai jelentőségét jelzi

kötegelt hatás

Technikai tétel különbség

Hamis jelet hoz létre

normalizálás

Mintaközi skálakorrekció

Igazságossá teszi az összehasonlítást

Gyakori hibák

  • A többszörös összehasonlítás javításának kihagyása: A leggyakoribb és legsúlyosabb hiba.
  • Csak nézzük a p-értéket: Ügyeljen arra, hogy vegye figyelembe az effektus méretét (log2FC) együtt.
  • A köteghatás figyelmen kívül hagyása a modellben: Technikai különbség összetévesztése biológiai különbséggel.
  • A normalizálás elfelejtése: A nyers számok közvetlen összehasonlítása.
  • Ok-okozati nyelv: „Ez a gén betegséget okoz”; Az omikai adatok összefüggést mutatnak, az ok-okozati összefüggés további kísérletezést igényel.
Figyelem: A nagy dimenziós adatokban a „statisztikailag jelentős” és a „biológiailag jelentős” két különböző dolog. A mesterséges intelligencia által előállított génlista egy kezdeti hipotézis; Egyik jelölt gén sem tekinthető véglegesnek független módszerrel (qPCR, fehérjemérés) végzett ellenőrzés nélkül.

Méretcsökkentés és minőségellenőrzés

A nagydimenziós adatoknál az első dolog, amit meg kell tenni, a minták általános szerkezetének megtekintése. A PCA (főkomponens-elemzés: változók ezrei redukálása néhány összefoglaló tengelyre és 2 dimenzióban való megjelenítése) a standard eszköz ehhez. Ha a várt csoportok (kontroll/kezelés) el vannak választva a PCA diagramon, az jó; de ha a minták a "feldolgozási nap" szerint vannak csoportosítva, nem pedig csoportok szerint, ez kötegelt hatásra figyelmeztet. Ugyanez a diagram azonnal egyetlen kiugró (sikertelen) példát is mutat.

Rajzolja le a PCA-t a normalizált expressziós táblázatomból (sorgén, oszlopminta). Színminták csoportonként (kontroll/kezelés), forma feldolgozási tételenként. Kommentározza, hogy köteghatás vagy kiugró minta látható-e a grafikonon.

Ez a heurisztikus lépés vezérli az elemzés további részét: jobb korán elkapni egy kiugró értéket, mint hónapokat vesztegetni egy hamis eredményre.

Egycellás adatok: új dimenzió

Az utóbbi években széles körben elterjedt az egysejtű RNS szekvenálás (single-cell RNA-seq: több ezer egyedi sejt expressziós profiljának mérése). Itt az adatok még nagyobbak lesznek: több tízezer sejt, egyenként több ezer gén. Az olyan eszközök, mint a Scanpy (Python) dolgozzák fel ezeket az adatokat; sejteket csoportosít, és sejttípusokat azonosít. Az AI írja a kódot ehhez a munkafolyamathoz, de a sejttípusok biológiai nómenklatúrája (függetlenül attól, hogy a klaszter „T-sejt” vagy „makrofág”) markergénekre és szakértői tudásra támaszkodik. Ügyeljen arra, hogy ellenőrizze a cellatípus-címkét, amelyet a modell egy ismert markerekkel rendelkező fürthöz rendel; Ez a leggyakrabban félreértett lépés az egysejtelemzésben.

Nyílt adatok és reprodukálhatóság

A legtöbb omics tanulmány nyilvános adattárakba tölti fel adatait: GEO (Gene Expression Omnibus) és ArrayExpress a génexpresszióhoz, SRA (Sequence Read Archive) a nyers szekvenciákhoz, PRIDE a proteomikához. Ez kritikus fontosságú, hogy mások ellenőrizhessék az Ön eredményeit, és hogy Ön újra elemezhesse más tanulmányokból származó adatokat. A mesterséges intelligencia kódot tud írni (olyan eszközökkel, mint a GEOparse), amely letölti és rendszerezi az adatokat egy GEO regisztrációs számból (pl. GSE-szám); De mindenképpen olvassa el és erősítse meg a letöltött adatok tervét (hány csoport, hány ismétlés, melyik folyamat) az eredeti rekordból. Ha a modell azt állítja, hogy „emlékezik” egy tanulmány tervére, akkor ez szinte mindig egy feltételezés, amelyet ellenőrizni kell.

Összefoglalva

Az Omics adatok több ezer változót mérnek kis mintaméretben; Ez több összehasonlítás, kötegelt hatások és túlértelmezés csapdáit hozza létre. Mesterséges intelligencia; Megírja a differenciális kifejezéselemzés kódját, elmagyarázza a fogalmakat, és segít értelmezni az eredményeket. Az Ön felelőssége azonban az FDR-korrekció alkalmazása, a hatás méretének értékelése és az ok-okozati összefüggések nyelvezetének elkerülése. A jelölt gének hipotézisek, amíg független módszerrel nem igazolják.

Pályázati feladat

Szerezzen be vagy hozzon létre egy minta differenciális kifejezési eredménytáblázatot (gen, log2FC, padj). Legyen az AI írási kódja, amely FDR<0,05 és |log2FC|>1 szerint szűr, jelenti a jelentős gének számát, és ábrázol egy vulkángrafikont. Futtassa a kódot. Ezután számítsa ki a modellt, hogy hány gén tűnne „szignifikánsnak”, ha nem történt volna meg a korrekció, és értelmezze a különbséget.

ellenőrző lista

  • [ ] Többszörös összehasonlításkorrekciót (FDR) alkalmaztam.
  • Kiértékeltem az effektus méretét (log2FC), valamint a [ ] p-értéket.
  • [ ] Ellenőriztem a kötegelt/technikai változókat.
  • [ ] Nem hagytam ki a normalizálási lépést.
  • [ ] Inkább a korreláció nyelvét használtam, mint az ok-okozati összefüggést.
  • [ ] A jelölt géneket hipotézisként jelöltem meg, amelyeket meg kell erősíteni.