Ieguvumi:
- Spēja izprast RNA-seq darbplūsmu, diferenciālās izteiksmes analīzi un vairāku testu korekciju (FDR), un mākslīgais intelekts rada pārbaudāmu analīzes kodu
- Spēja kritiski interpretēt ceļa bagātināšanas rezultātus statistiski un bioloģiski
- Spēja īstenot disciplīnu, pārbaudot statistiskos pieņēmumus un vairākas pārbaudes nepilnības un neatkarīgi pārbaudot bioloģisko nozīmīgumu.
“Omics” ir kopējais nosaukums pieejām, kas mēra visas šūnas vai audu molekulas kopā: genomika (visa DNS), transkriptomika (visa RNS/ekspresija), proteomika (visi proteīni), metabolomika (visi metabolīti). Šie dati ir milzīgi - RNS-seq eksperiments ietver desmitiem tūkstošu gēnu mērījumus. Šajā nodaļā jūs uzzināsiet, kā izmantot mākslīgo intelektu (AI) kā palīgu omikas analīzē, kas raksta kodu, atlasa statistiku un izstrādā bioloģiskās interpretācijas; bet jūs uzzināsiet, kāpēc jums ir jāpārbauda statistiskais un bioloģiskais rezultāts.
Kritisks brīdinājums: Omics visbīstamākās kļūdas ir statistiskas un neredzamas. AI var rakstīt kodu, kas apiet vairāku salīdzināšanas korekciju (zemāk), izvēlas nepareizu testu vai rada “viltus pozitīvus” gēnu sarakstus. Turklāt mākslīgais intelekts var radīt bioloģiskus apgalvojumus, piemēram, "šis gēns palielinās šajā slimībā" bez jebkāda avota. Pareizais veids: veikt analīzi ar izpildāmu, auditējamu kodu un apstiprināt katru bioloģisko apgalvojumu literatūrā.
Pamatjēdzieni
- Izpausme: cik daudz gēns tiek pārvērsts RNS; "aktivitātes" mērs.
- Diferenciālā izteiksme (DE): gēni, kuru izpausme būtiski mainās starp divām grupām (piemēram, pacients/vesels).
- p-vērtība: varbūtība, ka atšķirība ir sakritība; ja tā ir maza, atšķirība tiek uzskatīta par "būtisku".
- Vairāku salīdzināšanas korekcija: ja vienlaikus aplūko desmitiem tūkstošu gēnu, nejauši būs daži, kas ir "nozīmīgi". Lai to novērstu, tiek izmantotas tādas metodes kā FDR (viltus atklāšanas ātrums) / Benjamini-Hochberg. Ja šī korekcija tiek izlaista, radīsies simtiem nepatiesu atradumu.
- log2 reizes izmaiņas (log2FC): gēna ekspresijas attiecības logaritms starp divām grupām pret bāzi 2; +1 nozīmē divkāršu pieaugumu, −1 nozīmē divkāršu samazinājumu.
- Ceļu bagātināšana: Noskaidrot, kuros bioloģiskajos ceļos (piemēram, šūnu dalīšanās, imunitāte) ir koncentrēti mainītie gēni; Tiek izmantotas tādas datu bāzes kā GO un KEGG.
- Partijas efekts: nebioloģiska nepatiesa atšķirība, kas rodas, apstrādājot paraugus dažādās dienās/ierīcēs.
Soli pa solim: ar AI darbināma omikas analīze
1. Precizējiet eksperimenta plānu un jautājumu. Cik paraugu, cik grupu, cik atkārtojumu? Vai pietiek ar statistikas jaudu? Izskaidrojiet dizainu AI.
2. Ar AI atlasiet atbilstošo rīku/metodi. RNA-seq izvēlieties standarta metodes, piemēram, DESeq2/edgeR (statistikas pakotnes, kas paredzētas skaitīšanas datiem); Izmantojiet pārbaudītas metodes, nevis statistiku, ko AI “izveidoja”.
3. Palaidiet kodu un pārbaudiet starpizejas. Nepāriet uz DE analīzi bez normalizācijas, partijas efekta kontroles, kvalitātes diagrammām (PCA).
4. Ieviesiet vairāku salīdzināšanas korekciju. Filtrējiet rezultātus pēc koriģētās vērtības (padj/FDR), nevis pēc neapstrādātas p vērtības.
5. Apstipriniet bioloģisko interpretāciju literatūrā. Interpretējiet ceļa bagātināšanas rezultātus, izmantojot AI, bet pārbaudiet katru apgalvojumu avotā.
Padoms. DE analīzē vispirms apskatiet kvalitātes un kopējās ietekmes diagrammas. Ja paraugi ir sagrupēti pēc apstrādes dienas, nevis pēc bioloģiskajām grupām, lielākā daļa "nozīmīgo" atrasto gēnu ir kumulatīvi efekti, nevis īsta bioloģija.
trīs mini futrāļi
1. gadījums — nekoriģēta p-vērtība. Kāds students pārbaudīja 20 000 gēnu ar AI uzrakstīto kodu un atrada "540 nozīmīgus gēnus". Kad viņš pārbaudīja kodu, viņš redzēja, ka AI ir izlaidusi vairākus salīdzināšanas labojumus. Kad tika pievienota FDR korekcija, nozīmīgo gēnu skaits samazinājās līdz 32. Bez korekcijas stāsta pamatā būtu vairāk nekā 500 viltus gēnu.
2. gadījums — izdomāta bioloģiskā norāde. Par DE sarakstā iekļauto gēnu pētnieks jautāja AI "ko šis gēns dara šajā slimībā?" viņš jautāja; AI izskaidroja pārliecinošu mehānismu un rakstu. Kad viņš meklēja PubMed, viņš redzēja, ka ne šis mehānisms, ne raksts nepastāv. Pretenzija tika noņemta no ziņojuma.
3. gadījums — saņemts apstiprinājums. Kāds doktorants pamanīja, ka PCA paraugā paraugus atdala divas dienas. Lūdza AI kodam pievienot partijas efekta mainīgo; Pēc korekcijas gēnu saraksts tika pilnībā mainīts un kļuva bioloģiski nozīmīgs. Bez kvalitātes kontroles tabulas varēja tikt publicēts viltots rezultāts.
Piemērs: filtrēšana ar koriģētu p-vērtību
importēt pandas kā pd# ļaujiet tabulai 'de' būt DE rīka (DESeq2/edgeR) rezultātiem: # kolonnas: gene, log2FC, pvalue, padj (FDR-corrected)de = pd.read_csv("de_results.csv")significant = de[(de["padj")] &FC)[0"slog2) <0. 1)]print("Neapstrādāts p<0,05:", (de["pvērtība"] < 0,05).sum())print("FDR koriģēts padj<0,05 & |log2FC|>=1:", len(nozīmīgs))
Atšķirība starp neapstrādātu un laboto skaitli parāda, kāpēc vairāki salīdzinājumi ir ļoti svarīgi.
Četras kopējamas veidnes
1) Analīzes plāna un metodes izvēle:
Jūsu loma: bioinformātikas asistents. Izveidojiet analīzes plānu šādam RNS-seq eksperimentam: [grupu skaits, paraugu/atkārtojumu skaits, jautājums]. Kuru standarta rīku (DESeq2/edgeR) izvēlēties un kāpēc, kādi kvalitātes kontroles soļi (PCA, pakešu efekts) ir nepieciešami, kā piemērot vairāku salīdzināšanas korekciju? Rakstiet soli pa solim.
2) Kods + obligātās pārbaudes:
Uzrakstiet izpildāmo kodu, kas veic šādu DE analīzi: [detaļas]. Kodā OBLIGĀTI jāietver normalizācija, PCA kvalitātes diagramma, partijas efekta kontrole un FDR (Benjamini-Hochberg) korekcija. Komentējiet katru soli. Filtrēt ar koriģētu p-vērtību, nevis neapstrādātu p-vērtību.
3) Ceļa bagātināšanas komentārs:
Palīdziet interpretēt ceļa bagātināšanas rezultātus šim nozīmīgo gēnu sarakstam: [saraksts/izvade]. Paskaidrojiet, kuri ceļi ir pamanāmi, bet pastāstiet man, kurā avotā (GO, KEGG, recenzēts raksts), lai apstiprinātu katru bioloģisko apgalvojumu. Mehānisms/izstrādājums MONTĀŽA.
4) Statistikas audits:
Pārbaudiet, vai šajā analīzes kodā nav statistikas kļūdu: [kods]. Konkrēti: nepareiza testa atlase, vairākkārtējas salīdzināšanas korekcijas izlaišana, partijas efekta ignorēšana, nepietiekama replikācija. Uzskaitiet katru atrasto problēmu un tās labojumu.
Vāja uzvedne / spēcīga uzvedne
Vāji: "Šajos RNS-seq datos atrodiet nozīmīgus gēnus."
Problēma: nav norādīta metode, kvalitātes kontrole un vairāki salīdzinājumi; AI var sniegt sarakstu ar viltus pozitīviem rezultātiem bez labojumiem.
Strong: "Uzrakstiet kodu, kas veic DE analīzi šiem RNS-seq skaitīšanas datiem ar DESeq2 loģiku, ietver kvalitātes kontroli un lielapjoma efektu kontroli ar PCA un filtrus ar FDR korekciju; komentējiet katru soli un paskaidrojiet, kāpēc izvēlējāties šo metodi."
Kāpēc tas ir spēcīgs: metode ir standarta, kvalitāte un korekcija ir obligāta, rezultāts ir auditējams.
Risks
simptoms
piesardzība
viltus pozitīvs
Pārāk daudz "jēgpilnu" gēnu
FDR/vairāku salīdzināšanas korekcija
kolektīvā ietekme
Paraugi ir sagrupēti pa dienām
PCA + partijas mainīgais
nepareizs tests
Parasta pārbaude datu skaitīšanai
Piemērota metode, piemēram, DESeq2/edgeR
izdomāta bioloģija
Bezmetināts mehānisms
Literatūras apstiprinājums
nepietiekama jauda
1-2 atkārtojumi
Pietiekami daudz atkārtojumu dizainā
Biežas kļūdas
- Vairāku salīdzināšanas labojumu izlaišana. Visizplatītākā un kaitīgākā statistikas kļūda.
- Ignorējot kolektīvo ietekmi. Tas rada viltus bioloģiskas atšķirības.
- Datu skaitīšanai tiek piemērota nepareiza pārbaude. RNS-seq nepieciešamas īpašas metodes.
- Bioloģisko apgalvojumu pieņemšana bez avota. AI var izveidot mehānismus un izstrādājumus.
- Vispārināšana ar nepietiekamu atkārtojumu. Bez statistikas jaudas rezultāts ir neuzticams.
Uzmanību: “statistiski nozīmīgs” nav tas pats, kas “bioloģiski nozīmīgs”. Ļoti neliela, bet tehniski nozīmīga krokas maiņa var būt bioloģiski nenozīmīga; Lielos izlasēs viss var izrādīties "nozīmīgs". Novērtējiet log2FC un p-vērtību kopā.
Dziļums: fona un dubultās uzskaites nepilnības ceļa bagātināšanā
Ceļa bagātināšanas rezultāti balstās uz diviem slēptiem pieņēmumiem, kurus lielākā daļa cilvēku neapzinās, un AI var klusi tos apiet. Pirmais ir fona/visuma atlase: bagātināšana salīdzina "gēnu, kas mainījās" kopu ar kopu, "kuri gēni tika apskatīti". Ja fons tiek ņemts no visa genoma, bet jūsu eksperiments mēra tikai noteiktu audu paneli, rezultāti šķiet mākslīgi “bagātināti”. Pareizais fons ir gēni, kurus faktiski var izteikt/izmērīt eksperimentā. Viena komanda atklāja "ļoti nozīmīgu imūnsistēmas ceļa bagātināšanu", kļūdaini veidojot visu genomu fonu; Kad analīze tika atkārtota ar pareizo fonu (izmērītajiem gēniem), bagātināšana pazuda - atradums bija metodes artefakts.
Otrkārt, gēnu kopas lielums un dubultā skaitīšana: ļoti lieli un vispārīgi ceļi (piemēram, “vielmaiņas procesi”, tūkstošiem gēnu) parādās “nozīmīgi” gandrīz katrā sarakstā; mazi, specifiski ceļi ir informatīvāki. Turklāt, tā kā viens un tas pats gēns ir atrodams vairākos ceļos, ir maldinoši uzskatīt ceļus, kas pārklājas, kā neatkarīgu pierādījumu. Trešais punkts: tas neuzrāda bagātināšanas virzienu; Ceļš var būt bagātināts, bet puse no tajā esošajiem gēniem var tikt palielināta, bet otra puse var tikt samazināta. Lai to redzētu, ir atsevišķi jāpārbauda virziena informācija (piemēram, GSEA).
slazds
simptoms
piesardzība
nepareizs fons
Viss šķiet bagātināts
Iegūstiet izmērītu gēnu fonu
Ļoti vispārīgs ceļš
"Vielmaiņa" vienmēr parādās
Koncentrējieties uz maziem, specifiskiem ceļiem
dubultā skaitīšana
ceļi, kas pārklājas
Neuztveriet to kā neatkarīgu pierādījumu
izlaist virzienu
jaukts augošs/dilstošs
Virziena vadība ar GSEA
Rezumējot
- AI omikas analīzē; ir palīgs, kurš izvēlas metodes, raksta kodu un izstrādā komentāru melnrakstus; statistikas un bioloģijas lēmumiem jābūt pamatotiem.
- Jāizmanto standarta, pārbaudītas metodes (DESeq2/edgeR); Kvalitātes kontroli un kolektīvo ietekmes auditu nevajadzētu izlaist.
- Vairākkārtēja salīdzināšanas korekcija (FDR) ir obligāta; rezultāti tiek filtrēti ar laboto vērtību.
- Katra bioloģiska norāde jāapstiprina literatūrā; "nozīmīgs" ir jānošķir no "svarīga".
Lietojumprogrammas uzdevums
Paņemiet DE rezultātu tabulas paraugu (vai atvērtu RNA-seq datu kopu). Salīdziniet nozīmīgus gēnu skaitu, pamatojoties uz neapstrādātu p-vērtību un koriģētajiem padj sliekšņiem, ar iepriekš minēto fragmentu. Komentējiet atšķirību vienā teikumā. Pēc tam pieprasiet piedāvātā gēna bioloģisko interpretāciju, izmantojot 3. veidni, un pats pārbaudiet pretenziju pakalpojumā PubMed.
kontrolsaraksts
- [ ] Es novērtēju eksperimentālo plānu un statistisko jaudu.
- [ ] Es izvēlējos standarta, ērtu metodi.
- [ ] Es veicu PCA un partijas efektu kvalitātes kontroli.
- [ ] Es piemēroju vairākkārtēja salīdzināšanas (FDR) korekciju.
- [ ] Es filtrēju rezultātus ar koriģētu p-vērtību.
- [ ] Literatūrā es apstiprināju bioloģiskās norādes.