Enhed 6 / 11

Omics dataanalyse: RNA-seq, ekspression, statistik og pathway berigelse

Gevinster:

  • Evne til at forstå RNA-seq workflow, differentiel ekspressionsanalyse og multiple test correction (FDR) og have kunstig intelligens til at producere verificerbar analysekode
  • Evne til kritisk at fortolke resultaterne af pathway berigelse statistisk og biologisk
  • Evne til at udøve disciplinen at kontrollere statistiske antagelser og flere testfælder og selvstændigt at verificere biologisk signifikans.

"Omics" er den fælles betegnelse for tilgange, der måler alle molekyler i en celle eller et væv sammen: genomik (alt DNA), transkriptomik (alt RNA/ekspression), proteomik (alle proteiner), metabolomik (alle metabolitter). Disse data er enorme - et RNA-seq-eksperiment involverer målinger af titusindvis af gener. I denne enhed lærer du, hvordan du bruger kunstig intelligens (AI) som assistent i omics-analyse, der skriver kode, udvælger statistik og udarbejder biologisk fortolkning; men du vil lære, hvorfor du skal verificere det statistiske og biologiske resultat.

Kritisk advarsel: I Omics er de farligste fejl statistiske og usynlige. AI kan skrive kode, der omgår multiple sammenligningskorrektion (nedenfor), vælger den forkerte test eller producerer "falsk positive" genlister. Derudover kan AI opfinde biologiske påstande såsom "dette gen stiger i den sygdom" uden nogen kilde. Den rigtige måde: at lave analysen med eksekverbar, auditerbar kode og bekræfte hver biologisk påstand i litteraturen.

Grundlæggende begreber

  • Udtryk: Hvor meget et gen er oversat til RNA; mål for "aktivitet".
  • Differentiel ekspression (DE): Gener, hvis ekspression ændres signifikant mellem to grupper (f.eks. patient/rask).
  • p-værdi: Sandsynligheden for, at en forskel er en tilfældighed; hvis den er lille, betragtes forskellen som "betydelig".
  • Multipel sammenligningskorrektion: Når titusindvis af gener ses på samme tid, vil der tilfældigt være nogle, der er "signifikante". For at rette op på dette, bruges metoder som FDR (false discovery rate) / Benjamini-Hochberg. Hvis denne korrektion udelades, vil der opstå hundredvis af falske fund.
  • log2 fold ændring (log2FC): Logaritmen af ​​ekspressionsforholdet af et gen mellem to grupper og base 2; +1 betyder en fordobling, −1 betyder en fordobling.
  • Pathway berigelse: Finde i hvilke biologiske veje (f.eks. celledeling, immunitet) de ændrede gener er koncentreret; Der anvendes databaser som GO og KEGG.
  • Batcheffekt: Ikke-biologisk falsk forskel som følge af behandling af prøver på forskellige dage/enheder.

Trin for trin: AI-drevet omics-analyse

1. Afklar det eksperimentelle design og spørgsmål. Hvor mange prøver, hvor mange grupper, hvor mange gentagelser? Er statistisk magt tilstrækkelig? Forklar designet til AI.

2. Vælg det relevante værktøj/metode med AI. For RNA-seq skal du vælge standardmetoder såsom DESeq2/edgeR (statistiske pakker designet til tælledata); Brug gennemprøvede metoder i stedet for en statistik, som AI'en "opgjorde".

3. Kør koden og kontroller mellemudgangene. Fortsæt ikke til DE-analyse uden normalisering, batcheffektkontrol, kvalitetsplot (PCA).

4. Gennemtving korrektion af flere sammenligninger. Filtrer resultater efter korrigeret værdi (padj/FDR), ikke rå p-værdi.

5. Bekræft den biologiske fortolkning i litteraturen. Fortolk pathway berigelse output med AI, men verificer hver påstand ved kilden.

Tip: I en DE-analyse skal du først se på graferne for kvalitet og samlet effekt. Hvis prøver er grupperet efter den dag, de blev behandlet i stedet for efter biologisk gruppe, er de fleste af de "signifikante" gener, du finder, kumulative effekter, ikke ægte biologi.

tre minisager

Tilfælde 1 — Ukorrigeret p-værdi. En studerende testede 20.000 gener med koden skrevet af AI og fandt "540 signifikante gener." Da han undersøgte koden, så han, at AI'en havde sprunget flere sammenligningskorrektion over. Da FDR-korrektion blev tilføjet, faldt antallet af signifikante gener til 32. Uden korrektionen ville mere end 500 falske gener være baseret på historien.

Sag 2 — Fremstillet biologisk påstand. For et gen på DE-listen spurgte en forsker AI "hvad gør dette gen ved denne sygdom?" spurgte han; AI forklarede en overbevisende mekanisme og artiklen. Da han søgte på PubMed, så han, at hverken den mekanisme eller artiklen eksisterede. Påstanden blev fjernet fra rapporten.

Sag 3 — Bekræftelse opnået. En ph.d.-studerende bemærkede, at prøverne var adskilt med to dage i PCA-plottet. Bedt AI om at tilføje en batch-effektvariabel til koden; Efter rettelsen blev genlisten fuldstændig ændret og blev biologisk signifikant. Uden kvalitetskontrolskemaet kunne et falsk resultat være blevet offentliggjort.

Eksempel: filtrering med korrigeret p-værdi

importer pandaer som pd# lad tabellen 'de' være resultater fra et DE-værktøj (DESeq2/edgeR):# kolonner: gen, log2FC, pvalue, padj (FDR-korrigeret)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0.05)(FC) & (de["ablogs2) &"][. 1)]print("Rå p<0,05:", (de["pvalue"] < 0,05).sum())print("FDR-korrigeret padj<0,05 & |log2FC|>=1:", len(signifikant))

Forskellen mellem det rå og korrigerede tal illustrerer, hvorfor flere sammenligninger er kritiske.

Fire kopierbare skabeloner

1) Analyseplan og metodevalg:

Din rolle: bioinformatikassistent. Opstil analyseplan for følgende RNA-seq eksperiment: [antal grupper, antal prøver/replikater, spørgsmål]. Hvilket standardværktøj (DESeq2/edgeR) skal jeg vælge, og hvorfor, hvilke kvalitetskontroltrin (PCA, batcheffekt) er nødvendige, hvordan anvender jeg multiple sammenligningskorrektion? Skriv trin for trin.

2) Kode + obligatoriske kontroller:

Skriv eksekverbar kode, der udfører følgende DE-analyse: [detalje]. Koden SKAL omfatte normalisering, PCA-kvalitetsplot, batcheffektkontrol og FDR (Benjamini-Hochberg) korrektion. Kommenter hvert trin. Filter med korrigeret p-værdi, ikke rå p-værdi.

3) Kommentar til stiberigelse:

Hjælp med at fortolke pathway-berigelsesresultater for denne liste over signifikante gener: [liste/output]. Forklar hvilke veje der er fremtrædende, men fortæl mig i hvilken kilde (GO, KEGG, peer-reviewed artikel) for at bekræfte hver biologisk påstand. Mekanisme/artikel MONTERING.

4) Statistikrevision:

Kontroller følgende analysekode for statistiske fejl: [kode]. Specifikt: forkert testvalg, udeladelse af multiple sammenligningskorrektion, ignorering af batcheffekt, utilstrækkelig replikering. Liste hvert problem, du fandt, og dets løsning.

Svag prompt / Stærk prompt

Svag: "Find signifikante gener i disse RNA-seq-data."

Problem: Metode, kvalitetskontrol og flere sammenligninger er ikke specificeret; AI kan give en liste fuld af falske positiver uden korrektion.

Stærk: "Skriv en kode, der udfører DE-analyse for disse RNA-seq-tællingsdata med DESeq2-logik, inkluderer kvalitetskontrol og bulkeffektkontrol med PCA og filtre med FDR-korrektion; kommenter hvert trin og forklar, hvorfor du valgte denne metode."

Hvorfor det er kraftfuldt: Metoden er standard, kvalitet og korrektion er obligatorisk, resultatet kan auditeres.

Risiko

symptom

forholdsregler

falsk positiv

For mange "meningsfulde" gener

FDR/multiple sammenligning korrektion

kollektiv indflydelse

Prøver er grupperet efter dag

PCA + batchvariabel

forkert test

Normal test til at tælle data

Passende metode som DESeq2/edgeR

opbygget biologi

Svejseløs mekanisme

Litteratur bekræftelse

utilstrækkelig kraft

1-2 gentagelser

Nok gentagelse i design

Almindelige fejl

  • Springer flere sammenligningskorrektion over. Den mest almindelige og mest skadelige statistiske fejl.
  • Ignorerer den kollektive påvirkning. Det giver falsk biologisk forskel.
  • Anvender forkert test til at tælle data. RNA-seq kræver specielle metoder.
  • Accept af biologiske påstande uden kilde. AI kan udgøre mekanismer og artikler.
  • Generalisering med utilstrækkelig gentagelse. Uden statistisk styrke er resultatet upålideligt.
Forsigtig: "Statistisk signifikant" er ikke det samme som "biologisk signifikant." En meget lille, men teknisk signifikant foldændring kan være biologisk ubetydelig; I store prøver kan alt vise sig at være "betydeligt". Evaluer log2FC og p-værdi sammen.

Dybde: baggrund og dobbelttælling faldgruber i vejberigelse

Pathway berigelse resultater er afhængige af to skjulte antagelser, som de fleste mennesker ikke er klar over, og AI kan stille og roligt omgå dem. Den første er baggrund/univers selektion: berigelse sammenligner sættet af "gener, der ændrede sig" med sættet af "hvilke gener blev set på". Hvis baggrunden er taget fra hele genomet, men dit eksperiment kun måler et specifikt vævspanel, fremstår resultaterne kunstigt "beriget." Korrekt baggrund er gener, der faktisk kan udtrykkes/måles i forsøget. Et hold fandt "meget signifikant berigelse af immunsystemet" ved en fejlagtig baggrund af hele genomet; Da analysen blev gentaget med den korrekte baggrund (målte gener), forsvandt berigelsen – fundet var en metodeartefakt.

For det andet gensætstørrelse og dobbelttælling: meget store og generelle veje (f.eks. "metaboliske processer", tusindvis af gener) forekommer "signifikante" i næsten hver liste; små, specifikke veje er mere informative. Fordi det samme gen findes i flere veje, er det desuden vildledende at behandle overlappende veje som uafhængig evidens. Tredje punkt: det viser ikke berigelsens retning; En pathway kan være beriget, men halvdelen af ​​generne i den kan øges, og den anden halvdel kan reduceres. For at se dette er det nødvendigt at undersøge retningsbestemt information separat (såsom GSEA).

fælde

symptom

forholdsregler

forkert baggrund

Alt virker beriget

Få målt gener baggrund

Meget generel vej

"Stofskifte" kommer altid op

Fokuser på små, specifikke veje

dobbelttælling

overlappende veje

Tag det ikke som et uafhængigt bevis

spring retning

blandet stigende/faldende

Retningsstyring med GSEA

Sammenfattende

  • AI i omics-analyse; er en assistent, der udvælger metoder, skriver kode og udarbejder kommentarer; statistik og biologiske beslutninger skal begrundes.
  • Standard, gennemprøvede metoder (DESeq2/edgeR) bør anvendes; Kvalitetskontrol og kollektiv konsekvensrevision bør ikke springes over.
  • Multiple comparison correction (FDR) er obligatorisk; resultaterne filtreres med den korrigerede værdi.
  • Enhver biologisk påstand skal bekræftes i litteraturen; "betydelig" bør skelnes fra "vigtig".

Ansøgningsopgave

Tag en prøve DE-resultattabel (eller et åbent RNA-seq-datasæt). Sammenlign signifikante genantal baseret på rå p-værdi og korrigerede padj-tærskler med uddraget ovenfor. Kommenter forskellen i én sætning. Bed derefter om biologisk fortolkning med skabelon 3 for et fremhævet gen og tjek selv påstanden i PubMed.

tjekliste

  • [ ] Jeg evaluerede det eksperimentelle design og den statistiske kraft.
  • [ ] Jeg valgte en standard, bekvem metode.
  • [ ] Jeg udførte PCA og batch effekt kvalitetskontrol.
  • [ ] Jeg anvendte multiple comparison (FDR) korrektion.
  • [ ] Jeg filtrerede resultaterne med korrigeret p-værdi.
  • [ ] Jeg bekræftede de biologiske påstande i litteraturen.