Enhet 6 / 11

Omics dataanalys: rna-seq, uttryck, statistik och vägberikning

Vinster:

  • Förmåga att förstå RNA-seq arbetsflöde, differentiell uttrycksanalys och multiple testing correction (FDR) och ha artificiell intelligens producera verifierbar analyskod
  • Förmåga att kritiskt tolka resultat av anrikning av vägar statistiskt och biologiskt
  • Förmåga att utöva disciplinen att kontrollera statistiska antaganden och flera testfallgropar och självständigt verifiera biologisk signifikans.

"Omics" är samlingsnamnet för metoder som mäter alla molekyler i en cell eller vävnad tillsammans: genomik (allt DNA), transkriptomik (allt RNA/expression), proteomik (alla proteiner), metabolomik (alla metaboliter). Dessa data är enorma - ett RNA-seq-experiment involverar mätningar av tiotusentals gener. I den här enheten får du lära dig hur du använder artificiell intelligens (AI) som assistent i omics-analys som skriver kod, väljer statistik och utarbetar biologisk tolkning; men du kommer att lära dig varför du måste verifiera det statistiska och biologiska resultatet.

Kritisk varning: I Omics är de farligaste felen statistiska och osynliga. AI kan skriva kod som kringgår multipla jämförelsekorrigeringar (nedan), väljer fel test eller producerar "falskt positiva" genlistor. Dessutom kan AI göra upp biologiska påståenden som "den här genen ökar i den sjukdomen" utan någon källa. Rätt sätt: att göra analysen med exekverbar, auditerbar kod och bekräfta varje biologiskt påstående i litteraturen.

Grundläggande begrepp

  • Uttryck: Hur mycket en gen översätts till RNA; mått på "aktivitet".
  • Differentiellt uttryck (DE): Gener vars uttryck förändras signifikant mellan två grupper (t.ex. patient/frisk).
  • p-värde: Sannolikheten att en skillnad är en slump; om den är liten anses skillnaden vara "betydande".
  • Multipel jämförelsekorrigering: När tiotusentals gener tittas på samtidigt, kommer det av en slump att finnas några som är "signifikanta". För att fixa detta används metoder som FDR (false discovery rate) / Benjamini-Hochberg. Om denna korrigering utelämnas kommer hundratals falska fynd att uppstå.
  • log2-faldig förändring (log2FC): Logaritmen för uttrycksförhållandet för en gen mellan två grupper till basen 2; +1 betyder en tvåfaldig ökning, −1 betyder en tvåfaldig minskning.
  • Bananrikning: Att hitta i vilka biologiska vägar (t.ex. celldelning, immunitet) de förändrade generna är koncentrerade; Databaser som GO och KEGG används.
  • Batcheffekt: Icke-biologisk falsk skillnad som härrör från bearbetning av prover på olika dagar/enheter.

Steg för steg: AI-driven omics-analys

1. Förtydliga den experimentella designen och frågan. Hur många prover, hur många grupper, hur många repetitioner? Är statistisk styrka tillräcklig? Förklara designen för AI:n.

2. Välj lämpligt verktyg/metod med AI. För RNA-seq, välj standardmetoder som DESeq2/edgeR (statistiska paket utformade för räkningsdata); Använd beprövade metoder snarare än en statistik som AI:n "hittat på".

3. Kör koden och kontrollera mellanutgångarna. Fortsätt inte till DE-analys utan normalisering, batcheffektkontroll, kvalitetsplott (PCA).

4. Framtvinga korrigering av flera jämförelser. Filtrera resultat efter korrigerat värde (padj/FDR), inte rå p-värde.

5. Bekräfta den biologiska tolkningen i litteraturen. Tolka utdata för anrikning av vägen med AI, men verifiera varje påstående vid källan.

Tips: I en DE-analys, titta först på graferna för kvalitet och sammanlagd effekt. Om prover grupperas efter den dag de bearbetades snarare än efter biologisk grupp, är de flesta av de "signifikanta" generna du hittar kumulativa effekter, inte verklig biologi.

tre minifodral

Fall 1 — Okorrigerat p-värde. En student testade 20 000 gener med koden skriven av AI och hittade "540 signifikanta gener." När han undersökte koden såg han att AI:n hade hoppat över flera jämförelsekorrigeringar. När FDR-korrigering lades till minskade antalet signifikanta gener till 32. Utan korrigeringen skulle mer än 500 falska gener baseras på historien.

Fall 2 — Tillverkat biologiskt påstående. För en gen på DE-listan frågade en forskare AI "vad gör den här genen vid denna sjukdom?" frågade han; AI förklarade en övertygande mekanism och artikeln. När han sökte på PubMed såg han att varken den mekanismen eller artikeln fanns. Påståendet togs bort från rapporten.

Fall 3 — Bekräftelse erhållen. En doktorand märkte att proverna separerades med två dagar i PCA-området. Bad AI att lägga till en batcheffektvariabel till koden; Efter korrigeringen ändrades genlistan helt och blev biologiskt signifikant. Utan kvalitetskontrolldiagrammet hade ett falskt resultat kunnat publiceras.

Exempel: filtrering med korrigerat p-värde

importera pandor som pd# låt tabellen 'de' vara resultat från ett DE-verktyg (DESeq2/edgeR):# kolumner: gen, log2FC, pvalue, padj (FDR-korrigerad)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0.05)(FC) & (de["ablogs2) & (>]="ablogs) 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR-korrigerad padj<0.05 & |log2FC|>=1:", len(signifikant))

Skillnaden mellan det råa och det korrigerade talet illustrerar varför flera jämförelser är kritiska.

Fyra kopierbara mallar

1) Analysplan och metodval:

Din roll: bioinformatikassistent. Sätt upp analysplan för följande RNA-seq-experiment: [antal grupper, antal prover/replikat, fråga]. Vilket standardverktyg (DESeq2/edgeR) ska jag välja och varför, vilka kvalitetskontrollsteg (PCA, batcheffekt) krävs, hur tillämpar jag multipel jämförelsekorrigering? Skriv steg för steg.

2) Kod + obligatoriska kontroller:

Skriv körbar kod som utför följande DE-analys: [detalj]. Koden MÅSTE inkludera normalisering, PCA-kvalitetsplott, batcheffektkontroll och FDR-korrigering (Benjamini-Hochberg). Kommentera varje steg. Filtrera med korrigerat p-värde, inte rå p-värde.

3) Kommentar om banberikning:

Hjälp till att tolka resultat för anrikning av vägen för denna lista över signifikanta gener: [lista/utgång]. Förklara vilka vägar som är framträdande, men säg till mig i vilken källa (GO, KEGG, peer-reviewed artikel) för att bekräfta varje biologiskt påstående. Mekanism/artikel MONTERING.

4) Statistikrevision:

Kontrollera följande analyskod för statistiska fel: [kod]. Specifikt: felaktigt testval, utelämnande av korrigering av flera jämförelser, ignorering av batcheffekt, otillräcklig replikering. Lista varje problem du hittade och dess åtgärd.

Svag prompt / Stark prompt

Svag: "Hitta signifikanta gener i denna RNA-sekv-data."

Problem: Metod, kvalitetskontroll och flera jämförelser är inte specificerade; AI kan ge en lista full av falska positiva resultat utan korrigering.

Stark: "Skriv en kod som utför DE-analys för denna RNA-seq-räkningsdata med DESeq2-logik, inkluderar kvalitetskontroll och bulkeffektkontroll med PCA, och filter med FDR-korrigering; kommentera varje steg och förklara varför du valde den här metoden."

Varför det är kraftfullt: Metoden är standard, kvalitet och korrigering är obligatoriska, resultatet är granskningsbart.

Risk

symptom

försiktighetsåtgärd

falskt positivt

För många "meningsfulla" gener

FDR/multipel jämförelse korrigering

kollektiv påverkan

Proverna grupperas efter dag

PCA + batchvariabel

fel test

Normalt test för att räkna data

Lämplig metod som DESeq2/edgeR

påhittad biologi

Svetslös mekanism

Litteraturbekräftelse

otillräcklig kraft

1-2 reps

Tillräckligt med upprepningar i design

Vanliga misstag

  • Hoppa över korrigering av flera jämförelser. Det vanligaste och mest skadliga statistiska felet.
  • Ignorera den kollektiva påverkan. Det ger falska biologiska skillnader.
  • Använder felaktig testning för att räkna data. RNA-seq kräver speciella metoder.
  • Accepterar biologiska påståenden utan källa. AI kan utgöra mekanismer och artiklar.
  • Generalisering med otillräcklig upprepning. Utan statistisk styrka är resultatet opålitligt.
Varning: "Statistiskt signifikant" är inte detsamma som "biologiskt signifikant." En mycket liten men tekniskt signifikant veckförändring kan vara biologiskt obetydlig; I stora urval kan allt visa sig vara "signifikant". Utvärdera log2FC och p-värde tillsammans.

Djup: bakgrund och dubbelräknande fallgropar vid anrikning av vägar

Resultat för anrikning av banor bygger på två dolda antaganden som de flesta inte inser, och AI kan tyst kringgå dem. Den första är urval av bakgrund/universum: berikning jämför uppsättningen av "gener som förändrades" med uppsättningen "vilka gener sågs på". Om bakgrunden är hämtad från hela genomet men ditt experiment bara mäter en specifik vävnadspanel, verkar resultaten artificiellt "berikade". Korrekt bakgrund är gener som faktiskt kan uttryckas/mätas i experimentet. Ett team fann "mycket betydande berikning av immunsystemet" genom att felaktigt bakgrundsbilda hela genomet; När analysen upprepades med rätt bakgrund (uppmätta gener) försvann anrikningen – fyndet var en metodartefakt.

För det andra, genuppsättningsstorlek och dubbelräkning: mycket stora och allmänna vägar (t.ex. "metaboliska processer", tusentals gener) visas "signifikanta" i nästan varje lista; små, specifika vägar är mer informativa. Dessutom, eftersom samma gen finns i flera vägar, är det missvisande att behandla överlappande vägar som oberoende bevis. Tredje punkten: den visar inte riktningen för anrikningen; En väg kan anrikas, men hälften av generna i den kan ökas och den andra hälften kan minskas. För att se detta är det nödvändigt att separat undersöka riktningsinformation (som GSEA).

fälla

symptom

försiktighetsåtgärd

fel bakgrund

Allt verkar berikat

Få uppmätt gener bakgrund

Mycket allmän väg

"Metabolism" kommer alltid upp

Fokusera på små, specifika vägar

dubbelräkning

överlappande vägar

Ta det inte som oberoende bevis

hoppa över riktning

blandat stigande/fallande

Riktningsstyrning med GSEA

Sammanfattningsvis

  • AI i omics analys; är en assistent som väljer metoder, skriver kod och utkast till kommentarer; statistik och biologibeslut måste motiveras.
  • Beprövade standardmetoder (DESeq2/edgeR) bör användas; Kvalitetskontroll och kollektiv konsekvensrevision bör inte hoppas över.
  • Multipel jämförelsekorrigering (FDR) är obligatorisk; resultaten filtreras med det korrigerade värdet.
  • Varje biologiskt påstående måste bekräftas i litteraturen; "betydande" bör särskiljas från "viktigt".

Applikationsuppgift

Ta ett exempel på DE-resultattabell (eller en öppen RNA-seq-datauppsättning). Jämför signifikanta genantal baserat på rått p-värde och korrigerade padj-trösklar med kodavsnittet ovan. Kommentera skillnaden i en mening. Be sedan om biologisk tolkning med mall 3 för en utvald gen och kontrollera påståendet själv i PubMed.

checklista

  • [ ] Jag utvärderade den experimentella designen och den statistiska kraften.
  • [ ] Jag valde en vanlig, bekväm metod.
  • [ ] Jag gjorde PCA och kvalitetskontroll för batcheffekter.
  • [ ] Jag tillämpade multiple comparison (FDR) korrigering.
  • [ ] Jag filtrerade resultaten med korrigerat p-värde.
  • [ ] Jag bekräftade de biologiska påståendena i litteraturen.