Enhed 4 / 11

Omics-data og højdimensionel analyse

Gevinster:

  • Evne til at forstå problemet med flere sammenligninger og inkludere FDR-korrektion (false discovery rate) i analysen
  • Evne til at skelne statistisk og biologisk signifikans ved at evaluere p-værdi og effektstørrelse (log2 fold ændring) sammen
  • Evne til at genkende og undgå højdimensionelle datafælder såsom batcheffekt og kausalitetsspring

Ordet "omics" beskriver tilgange, der måler en hel klasse af molekyler i en celle: genomik (alt DNA), transkriptomik (alt RNA / genekspression), proteomik (alle proteiner), metabolomik (alle små molekyler). Det fælles træk ved disse målinger er deres høje dimensionalitet: tusinder eller endda titusindvis af variabler (gener, proteiner) måles samtidigt i en enkelt prøve, men antallet af prøver er normalt lille (f.eks. 20 patienter). Denne situation med "mange variabler, få prøver" er kilden til udfordringer, der er unikke for biologi og de områder, hvor AI kan være mest nyttig.

I denne enhed vil vi diskutere differentiel ekspressionsanalyse (finde gener, hvis ekspression ændres væsentligt mellem to grupper) og kunstig intelligenss rolle i denne arbejdsgang gennem eksemplet med transkriptomik (RNA-seq).

Hovedproblemet med højdimensionelle data

Tester man tusindvis af gener på én gang, vil man tilfældigt finde gener, der virker "betydelige", selvom der ikke er reelle forskelle. Hvis du tester 20.000 gener med en fejlmargin på 5 %, kan ~1.000 gener ved et tilfælde vise sig at være "signifikante". Dette kaldes det multiple sammenligningsproblem og er den mest kritiske faldgrube ved omics-analyse. Løsningen er at korrigere p-værdierne (beregn f.eks. FDR - falsk opdagelsesrate med Benjamini-Hochberg-metoden). AI er meget hjælpsom med at forklare dette koncept og skrive den rigtige kode; men det er dit ansvar at huske at anvende rettelsen.

Tip: Hvis du ser et tal som "3.000 gener væsentligt ændret" i et omics-resultat, skal du blive forskrækket. Dette er normalt et tegn på, at der ikke er foretaget korrektion af flere sammenligninger. En realistisk liste ville være ti til flere hundrede gener i et veldesignet eksperiment.

RNA-seq differentiel ekspression: trin for trin

  1. Råtal: Tabel, der viser, hvor mange aflæsninger der faldt i hver prøve for hvert gen.
  2. Kvalitet og filtrering: Kassér gener med meget lav ekspression.
  3. Normalisering: Korrekt biblioteksstørrelsesforskel mellem prøver (brute antal ikke sammenligneligt).
  4. Statistisk model: Test gruppeforskel med DESeq2 eller edgeR (R-biblioteker) eller pyDESeq2 i Python.
  5. Korrektion af flere sammenligninger: Beregn FDR; normalt en tærskel på FDR < 0,05.
  6. Effektstørrelse: Evaluer med log2 fold ændring: hvor mange gange udtrykket stiger/mindsker.
  7. Kommentar: Forbind signifikante gener med biologiske veje.

Kunstig intelligens 3-6. Den koder trinene, forklarer begreberne og hjælper dig med at fortolke outputtet. Modellen kan dog ikke sige "hvilket gen ændrede sig" uden at se dine rådata; Koden og statistikken fortæller dig dette.

Kopierbare promptskabeloner

Rolle: Du er transkriptomisk analyseassistent. Kontekst: Jeg har en RNA-seq råtællingstabel (CSV) fra 12 kontrolprøver, 12 behandlingsprøver. Opgave: Angiv trinene i differentiel udtryksanalyse med pyDESeq2, forklar hvorfor hvert trin er nødvendigt. Planlæg først, kode derefter. Sørg for at inkludere flere sammenligningskorrektion.

Mit analyseoutput viste 4.200 gener som "p<0,05". Hvorfor kan dette være mistænkeligt? Forklar multiple comparison correction (Benjamini-Hochberg FDR) og giv Python-kode, der udfører den korrekte filtrering.

Skriv kode, der tegner et vulkanplot fra min resultattabel for differentielle udtryk (gen, log2FC, padj-kolonner). Farv generne med FDR<0,05 og |log2FC|>1, mærk top 10.

Hvordan analyserer jeg denne betydningsfulde genliste for pathway berigelse? Forklar gseapy- eller g:Profiler-trinene. Påstå ikke absolut kausalitet i kommentaren, brug korrelationssprog. Genliste: [liste]

Svag prompt / Stærk prompt

Svag: "Fortæl mig, hvilke gener der er vigtige i RNA-seq-udbyttet."

Stærk: "Jeg har pyDESeq2-output fra 12 kontrolprøver, 12 behandlingsprøver: tabel med gen, log2FoldChange, padj-kolonner. Giv kode, der filtrerer signifikante gener med tærskler på FDR<0,05 og |log2FC|>1, rapporterer deres antal og rangerer de 20 stærkeste gener efter årsagen til disse tærskelværdier.

Forskel: Den kraftfulde prompt har faktiske outputkolonner, tærskler og valideringsanmodning. Modellen behandler dine data i stedet for at generere et opdigtet gennavn.

tre minisager

Case 1 - Katastrofe uden korrektion: En gruppe fandt 3.800 "signifikante" gener med p<0,05 uden korrektion og sendte det til en publikation. Da dommeren bad om FDR-korrektion, faldt listen til 47 gener. Hvis den kunstige intelligens havde tilføjet Benjamini-Hochberg-koden fra begyndelsen, ville denne forlegenhed ikke være opstået. Lektion: rettelse er ikke til forhandling.

Case 2 — Batch-effekt: I en undersøgelse blev prøver behandlet på to forskellige dage. Hvad de troede var en "patient vs. kontrol" forskel var faktisk en "1. dag vs. 2. dag" forskel (batch effekt: teknisk forskel på grund af prøveudtagning part). AI hjalp med at luge det falske signal ud ved at foreslå at tilføje batchvariablen til modellen (~ batch + tilstand i modelformlen).

Case 3 — Ignorerer foldændring: En elev erklærede "vigtigst" et gen, hvis ekspression ændrede sig med 2 %, men blev målt til at være meget stabil, blot ved at se på p-værdien. der henviser til, at effektstørrelsen (log2FC) var næsten nul; statistisk signifikans er ikke biologisk signifikans. Modellen forklarede denne sondring og foreslog at visualisere den med en vulkangraf.

Sammenligningstabel: begrebsklarhed

koncept

Betydning

Hvorfor er det vigtigt?

p-værdi

Sandsynligheden for, at forskellen er en tilfældighed

alene kan være vildledende

FDR (padj)

Korrigeret fejlrate ved flere test

Begrænser falske positiver

log2 fold skift

Effekt størrelse

Angiver biologisk betydning

batch effekt

Teknisk batch forskel

Skaber falske signaler

normalisering

Korrektion af skala mellem prøver

Gør sammenligning fair

Almindelige fejl

  • Spring over flere sammenligningskorrektion: Den mest almindelige og mest alvorlige fejl.
  • Bare se på p-værdien: Sørg for at overveje effektstørrelsen (log2FC) sammen.
  • Ikke inklusiv batch-effekten i modellen: Forveksler en teknisk forskel med en biologisk forskel.
  • At glemme normalisering: Sammenligning af rå tal direkte.
  • Årsagssprog: At sige "Dette gen forårsager sygdom"; Omics-data viser korrelation, kausalitet kræver yderligere eksperimenter.
Forsigtig: I højdimensionelle data er "statistisk signifikant" og "biologisk signifikant" to forskellige ting. Genlisten produceret af kunstig intelligens er en indledende hypotese; Hvert kandidatgen bør ikke betragtes som endeligt uden verifikation ved uafhængig metode (qPCR, proteinmåling).

Størrelsesreduktion og kvalitetskontrol

Den første ting at gøre i højdimensionelle data er at se den generelle struktur af prøverne. PCA (principal component analysis: reduktion af tusindvis af variabler til nogle få opsummerende akser og visning af dem i 2 dimensioner) er standardværktøjet til dette. Hvis de grupper du forventer (kontrol/behandling) er adskilt i PCA-skemaet, er det godt; men hvis prøverne er grupperet efter "behandlet dag" snarere end efter gruppe, er dette en batcheffektadvarsel. Det samme diagram viser også straks et enkelt outlier (mislykket) eksempel.

Tegn PCA fra min normaliserede ekspressionstabel (rækkegen, søjleprøve). Farveprøver efter gruppe (kontrol/behandling), form efter behandlingsbatch. Kommenter om der ses en batch-effekt eller afvigende mønster i grafen.

Dette heuristiske trin driver resten af ​​analysen: det er bedre at fange en outlier tidligt end at spilde måneder på et falsk resultat.

Enkeltcelledata: en ny dimension

I de senere år er enkeltcellet RNA-sekventering (enkeltcellet RNA-seq: måling af ekspressionsprofilen for tusindvis af individuelle celler) blevet udbredt. Her bliver dataene endnu større: Titusindvis af celler, tusindvis af gener hver. Værktøjer såsom Scanpy (Python) behandler disse data; grupperer celler og identificerer celletyper. AI skriver koden for denne arbejdsgang, men den biologiske nomenklatur af celletyper (uanset om en klynge er en "T-celle" eller en "makrofage") er afhængig af markørgener og ekspertviden. Sørg for at bekræfte celletypemærket, som modellen tildeler en klynge med kendte markører; Dette er det mest almindeligt misforståede trin i enkeltcelleanalyse.

Åbne data og reproducerbarhed

De fleste omics-studier uploader deres data til offentlige depoter: GEO (Gene Expression Omnibus) og ArrayExpress til genekspression, SRA (Sequence Read Archive) for rå sekvenser, PRIDE til proteomics. Dette er afgørende, så andre kan verificere dine resultater, og så du kan genanalysere data fra andre undersøgelser. AI kan skrive kode (med værktøjer som GEOparse), der downloader og organiserer data fra et GEO-registreringsnummer (f.eks. GSE-nummer); Men sørg for at læse og bekræfte designet af de data, du downloadede (hvor mange grupper, hvor mange gentagelser, hvilken proces) fra den originale post. Hvis modellen hævder at "huske" designet af en undersøgelse, er dette næsten altid et gæt, der skal verificeres.

Sammenfattende

Omics-data måler tusindvis af variabler i en lille stikprøvestørrelse; Dette skaber fælder af flere sammenligninger, batch-effekter og overfortolkning. Kunstig intelligens; Den skriver koden til differentiel udtryksanalyse, forklarer begreberne og hjælper dig med at fortolke resultaterne. Det er dog dit ansvar at anvende FDR-korrektionen, evaluere effektstørrelsen og undgå kausalitetssproget. Kandidatgener er hypoteser, indtil de er verificeret ved uafhængig metode.

Ansøgningsopgave

Hent eller opret en prøveresultattabel for differentielle udtryk (gen, log2FC, padj). Få AI til at skrive kode, der filtrerer efter FDR<0,05 og |log2FC|>1, rapporterer antallet af signifikante gener og plotter en vulkangraf. Kør koden. Lad derefter modellen beregne, hvor mange gener der ville virke "signifikante", hvis korrektionen ikke var foretaget, og fortolk forskellen.

tjekliste

  • [ ] Jeg anvendte multiple comparison correction (FDR).
  • Jeg evaluerede effektstørrelsen (log2FC) samt [ ] p-værdien.
  • [ ] Jeg tjekkede batch/tekniske variabler.
  • [ ] Jeg sprang ikke normaliseringstrinnet over.
  • [ ] Jeg brugte korrelationssproget frem for kausalitet.
  • [ ] Jeg markerede kandidatgener som hypoteser, der skal bekræftes.