Vienība 6 / 11

Omics datu analīze: RNS-seq, izteiksme, statistika un ceļa bagātināšana

Ieguvumi:

  • Spēja izprast RNA-seq darbplūsmu, diferenciālās izteiksmes analīzi un vairāku testu korekciju (FDR), un mākslīgais intelekts rada pārbaudāmu analīzes kodu
  • Spēja kritiski interpretēt ceļa bagātināšanas rezultātus statistiski un bioloģiski
  • Spēja īstenot disciplīnu, pārbaudot statistiskos pieņēmumus un vairākas pārbaudes nepilnības un neatkarīgi pārbaudot bioloģisko nozīmīgumu.

“Omics” ir kopējais nosaukums pieejām, kas mēra visas šūnas vai audu molekulas kopā: genomika (visa DNS), transkriptomika (visa RNS/ekspresija), proteomika (visi proteīni), metabolomika (visi metabolīti). Šie dati ir milzīgi - RNS-seq eksperiments ietver desmitiem tūkstošu gēnu mērījumus. Šajā nodaļā jūs uzzināsiet, kā izmantot mākslīgo intelektu (AI) kā palīgu omikas analīzē, kas raksta kodu, atlasa statistiku un izstrādā bioloģiskās interpretācijas; bet jūs uzzināsiet, kāpēc jums ir jāpārbauda statistiskais un bioloģiskais rezultāts.

Kritisks brīdinājums: Omics visbīstamākās kļūdas ir statistiskas un neredzamas. AI var rakstīt kodu, kas apiet vairāku salīdzināšanas korekciju (zemāk), izvēlas nepareizu testu vai rada “viltus pozitīvus” gēnu sarakstus. Turklāt mākslīgais intelekts var radīt bioloģiskus apgalvojumus, piemēram, "šis gēns palielinās šajā slimībā" bez jebkāda avota. Pareizais veids: veikt analīzi ar izpildāmu, auditējamu kodu un apstiprināt katru bioloģisko apgalvojumu literatūrā.

Pamatjēdzieni

  • Izpausme: cik daudz gēns tiek pārvērsts RNS; "aktivitātes" mērs.
  • Diferenciālā izteiksme (DE): gēni, kuru izpausme būtiski mainās starp divām grupām (piemēram, pacients/vesels).
  • p-vērtība: varbūtība, ka atšķirība ir sakritība; ja tā ir maza, atšķirība tiek uzskatīta par "būtisku".
  • Vairāku salīdzināšanas korekcija: ja vienlaikus aplūko desmitiem tūkstošu gēnu, nejauši būs daži, kas ir "nozīmīgi". Lai to novērstu, tiek izmantotas tādas metodes kā FDR (viltus atklāšanas ātrums) / Benjamini-Hochberg. Ja šī korekcija tiek izlaista, radīsies simtiem nepatiesu atradumu.
  • log2 reizes izmaiņas (log2FC): gēna ekspresijas attiecības logaritms starp divām grupām pret bāzi 2; +1 nozīmē divkāršu pieaugumu, −1 nozīmē divkāršu samazinājumu.
  • Ceļu bagātināšana: Noskaidrot, kuros bioloģiskajos ceļos (piemēram, šūnu dalīšanās, imunitāte) ir koncentrēti mainītie gēni; Tiek izmantotas tādas datu bāzes kā GO un KEGG.
  • Partijas efekts: nebioloģiska nepatiesa atšķirība, kas rodas, apstrādājot paraugus dažādās dienās/ierīcēs.

Soli pa solim: ar AI darbināma omikas analīze

1. Precizējiet eksperimenta plānu un jautājumu. Cik paraugu, cik grupu, cik atkārtojumu? Vai pietiek ar statistikas jaudu? Izskaidrojiet dizainu AI.

2. Ar AI atlasiet atbilstošo rīku/metodi. RNA-seq izvēlieties standarta metodes, piemēram, DESeq2/edgeR (statistikas pakotnes, kas paredzētas skaitīšanas datiem); Izmantojiet pārbaudītas metodes, nevis statistiku, ko AI “izveidoja”.

3. Palaidiet kodu un pārbaudiet starpizejas. Nepāriet uz DE analīzi bez normalizācijas, partijas efekta kontroles, kvalitātes diagrammām (PCA).

4. Ieviesiet vairāku salīdzināšanas korekciju. Filtrējiet rezultātus pēc koriģētās vērtības (padj/FDR), nevis pēc neapstrādātas p vērtības.

5. Apstipriniet bioloģisko interpretāciju literatūrā. Interpretējiet ceļa bagātināšanas rezultātus, izmantojot AI, bet pārbaudiet katru apgalvojumu avotā.

Padoms. DE analīzē vispirms apskatiet kvalitātes un kopējās ietekmes diagrammas. Ja paraugi ir sagrupēti pēc apstrādes dienas, nevis pēc bioloģiskajām grupām, lielākā daļa "nozīmīgo" atrasto gēnu ir kumulatīvi efekti, nevis īsta bioloģija.

trīs mini futrāļi

1. gadījums — nekoriģēta p-vērtība. Kāds students pārbaudīja 20 000 gēnu ar AI uzrakstīto kodu un atrada "540 nozīmīgus gēnus". Kad viņš pārbaudīja kodu, viņš redzēja, ka AI ir izlaidusi vairākus salīdzināšanas labojumus. Kad tika pievienota FDR korekcija, nozīmīgo gēnu skaits samazinājās līdz 32. Bez korekcijas stāsta pamatā būtu vairāk nekā 500 viltus gēnu.

2. gadījums — izdomāta bioloģiskā norāde. Par DE sarakstā iekļauto gēnu pētnieks jautāja AI "ko šis gēns dara šajā slimībā?" viņš jautāja; AI izskaidroja pārliecinošu mehānismu un rakstu. Kad viņš meklēja PubMed, viņš redzēja, ka ne šis mehānisms, ne raksts nepastāv. Pretenzija tika noņemta no ziņojuma.

3. gadījums — saņemts apstiprinājums. Kāds doktorants pamanīja, ka PCA paraugā paraugus atdala divas dienas. Lūdza AI kodam pievienot partijas efekta mainīgo; Pēc korekcijas gēnu saraksts tika pilnībā mainīts un kļuva bioloģiski nozīmīgs. Bez kvalitātes kontroles tabulas varēja tikt publicēts viltots rezultāts.

Piemērs: filtrēšana ar koriģētu p-vērtību

importēt pandas kā pd# ļaujiet tabulai 'de' būt DE rīka (DESeq2/edgeR) rezultātiem: # kolonnas: gene, log2FC, pvalue, padj (FDR-corrected)de = pd.read_csv("de_results.csv")significant = de[(de["padj")] &FC)[0"slog2) <0. 1)]print("Neapstrādāts p<0,05:", (de["pvērtība"] < 0,05).sum())print("FDR koriģēts padj<0,05 & |log2FC|>=1:", len(nozīmīgs))

Atšķirība starp neapstrādātu un laboto skaitli parāda, kāpēc vairāki salīdzinājumi ir ļoti svarīgi.

Četras kopējamas veidnes

1) Analīzes plāna un metodes izvēle:

Jūsu loma: bioinformātikas asistents. Izveidojiet analīzes plānu šādam RNS-seq eksperimentam: [grupu skaits, paraugu/atkārtojumu skaits, jautājums]. Kuru standarta rīku (DESeq2/edgeR) izvēlēties un kāpēc, kādi kvalitātes kontroles soļi (PCA, pakešu efekts) ir nepieciešami, kā piemērot vairāku salīdzināšanas korekciju? Rakstiet soli pa solim.

2) Kods + obligātās pārbaudes:

Uzrakstiet izpildāmo kodu, kas veic šādu DE analīzi: [detaļas]. Kodā OBLIGĀTI jāietver normalizācija, PCA kvalitātes diagramma, partijas efekta kontrole un FDR (Benjamini-Hochberg) korekcija. Komentējiet katru soli. Filtrēt ar koriģētu p-vērtību, nevis neapstrādātu p-vērtību.

3) Ceļa bagātināšanas komentārs:

Palīdziet interpretēt ceļa bagātināšanas rezultātus šim nozīmīgo gēnu sarakstam: [saraksts/izvade]. Paskaidrojiet, kuri ceļi ir pamanāmi, bet pastāstiet man, kurā avotā (GO, KEGG, recenzēts raksts), lai apstiprinātu katru bioloģisko apgalvojumu. Mehānisms/izstrādājums MONTĀŽA.

4) Statistikas audits:

Pārbaudiet, vai šajā analīzes kodā nav statistikas kļūdu: [kods]. Konkrēti: nepareiza testa atlase, vairākkārtējas salīdzināšanas korekcijas izlaišana, partijas efekta ignorēšana, nepietiekama replikācija. Uzskaitiet katru atrasto problēmu un tās labojumu.

Vāja uzvedne / spēcīga uzvedne

Vāji: "Šajos RNS-seq datos atrodiet nozīmīgus gēnus."

Problēma: nav norādīta metode, kvalitātes kontrole un vairāki salīdzinājumi; AI var sniegt sarakstu ar viltus pozitīviem rezultātiem bez labojumiem.

Strong: "Uzrakstiet kodu, kas veic DE analīzi šiem RNS-seq skaitīšanas datiem ar DESeq2 loģiku, ietver kvalitātes kontroli un lielapjoma efektu kontroli ar PCA un filtrus ar FDR korekciju; komentējiet katru soli un paskaidrojiet, kāpēc izvēlējāties šo metodi."

Kāpēc tas ir spēcīgs: metode ir standarta, kvalitāte un korekcija ir obligāta, rezultāts ir auditējams.

Risks

simptoms

piesardzība

viltus pozitīvs

Pārāk daudz "jēgpilnu" gēnu

FDR/vairāku salīdzināšanas korekcija

kolektīvā ietekme

Paraugi ir sagrupēti pa dienām

PCA + partijas mainīgais

nepareizs tests

Parasta pārbaude datu skaitīšanai

Piemērota metode, piemēram, DESeq2/edgeR

izdomāta bioloģija

Bezmetināts mehānisms

Literatūras apstiprinājums

nepietiekama jauda

1-2 atkārtojumi

Pietiekami daudz atkārtojumu dizainā

Biežas kļūdas

  • Vairāku salīdzināšanas labojumu izlaišana. Visizplatītākā un kaitīgākā statistikas kļūda.
  • Ignorējot kolektīvo ietekmi. Tas rada viltus bioloģiskas atšķirības.
  • Datu skaitīšanai tiek piemērota nepareiza pārbaude. RNS-seq nepieciešamas īpašas metodes.
  • Bioloģisko apgalvojumu pieņemšana bez avota. AI var izveidot mehānismus un izstrādājumus.
  • Vispārināšana ar nepietiekamu atkārtojumu. Bez statistikas jaudas rezultāts ir neuzticams.
Uzmanību: “statistiski nozīmīgs” nav tas pats, kas “bioloģiski nozīmīgs”. Ļoti neliela, bet tehniski nozīmīga krokas maiņa var būt bioloģiski nenozīmīga; Lielos izlasēs viss var izrādīties "nozīmīgs". Novērtējiet log2FC un p-vērtību kopā.

Dziļums: fona un dubultās uzskaites nepilnības ceļa bagātināšanā

Ceļa bagātināšanas rezultāti balstās uz diviem slēptiem pieņēmumiem, kurus lielākā daļa cilvēku neapzinās, un AI var klusi tos apiet. Pirmais ir fona/visuma atlase: bagātināšana salīdzina "gēnu, kas mainījās" kopu ar kopu, "kuri gēni tika apskatīti". Ja fons tiek ņemts no visa genoma, bet jūsu eksperiments mēra tikai noteiktu audu paneli, rezultāti šķiet mākslīgi “bagātināti”. Pareizais fons ir gēni, kurus faktiski var izteikt/izmērīt eksperimentā. Viena komanda atklāja "ļoti nozīmīgu imūnsistēmas ceļa bagātināšanu", kļūdaini veidojot visu genomu fonu; Kad analīze tika atkārtota ar pareizo fonu (izmērītajiem gēniem), bagātināšana pazuda - atradums bija metodes artefakts.

Otrkārt, gēnu kopas lielums un dubultā skaitīšana: ļoti lieli un vispārīgi ceļi (piemēram, “vielmaiņas procesi”, tūkstošiem gēnu) parādās “nozīmīgi” gandrīz katrā sarakstā; mazi, specifiski ceļi ir informatīvāki. Turklāt, tā kā viens un tas pats gēns ir atrodams vairākos ceļos, ir maldinoši uzskatīt ceļus, kas pārklājas, kā neatkarīgu pierādījumu. Trešais punkts: tas neuzrāda bagātināšanas virzienu; Ceļš var būt bagātināts, bet puse no tajā esošajiem gēniem var tikt palielināta, bet otra puse var tikt samazināta. Lai to redzētu, ir atsevišķi jāpārbauda virziena informācija (piemēram, GSEA).

slazds

simptoms

piesardzība

nepareizs fons

Viss šķiet bagātināts

Iegūstiet izmērītu gēnu fonu

Ļoti vispārīgs ceļš

"Vielmaiņa" vienmēr parādās

Koncentrējieties uz maziem, specifiskiem ceļiem

dubultā skaitīšana

ceļi, kas pārklājas

Neuztveriet to kā neatkarīgu pierādījumu

izlaist virzienu

jaukts augošs/dilstošs

Virziena vadība ar GSEA

Rezumējot

  • AI omikas analīzē; ir palīgs, kurš izvēlas metodes, raksta kodu un izstrādā komentāru melnrakstus; statistikas un bioloģijas lēmumiem jābūt pamatotiem.
  • Jāizmanto standarta, pārbaudītas metodes (DESeq2/edgeR); Kvalitātes kontroli un kolektīvo ietekmes auditu nevajadzētu izlaist.
  • Vairākkārtēja salīdzināšanas korekcija (FDR) ir obligāta; rezultāti tiek filtrēti ar laboto vērtību.
  • Katra bioloģiska norāde jāapstiprina literatūrā; "nozīmīgs" ir jānošķir no "svarīga".

Lietojumprogrammas uzdevums

Paņemiet DE rezultātu tabulas paraugu (vai atvērtu RNA-seq datu kopu). Salīdziniet nozīmīgus gēnu skaitu, pamatojoties uz neapstrādātu p-vērtību un koriģētajiem padj sliekšņiem, ar iepriekš minēto fragmentu. Komentējiet atšķirību vienā teikumā. Pēc tam pieprasiet piedāvātā gēna bioloģisko interpretāciju, izmantojot 3. veidni, un pats pārbaudiet pretenziju pakalpojumā PubMed.

kontrolsaraksts

  • [ ] Es novērtēju eksperimentālo plānu un statistisko jaudu.
  • [ ] Es izvēlējos standarta, ērtu metodi.
  • [ ] Es veicu PCA un partijas efektu kvalitātes kontroli.
  • [ ] Es piemēroju vairākkārtēja salīdzināšanas (FDR) korekciju.
  • [ ] Es filtrēju rezultātus ar koriģētu p-vērtību.
  • [ ] Literatūrā es apstiprināju bioloģiskās norādes.