Vienetas 4 / 11

„Omics“ duomenys ir didelės apimties analizė

Pelnas:

  • Gebėjimas suprasti daugkartinio palyginimo problemą ir į analizę įtraukti FDR (klaidingo aptikimo greičio) korekciją
  • Gebėjimas atskirti statistinį ir biologinį reikšmingumą, kartu įvertinant p reikšmę ir poveikio dydį (log2 karto pokytis)
  • Gebėjimas atpažinti ir išvengti didelio masto duomenų spąstų, tokių kaip paketo efektas ir priežastingumo šuolis

Žodis „omika“ apibūdina metodus, kuriais matuojama visa molekulių klasė ląstelėje: genomika (visa DNR), transkriptomika (visa RNR / genų ekspresija), proteomika (visi baltymai), metabolomika (visos mažos molekulės). Šių matavimų bendras bruožas yra didelis jų dimensiškumas: viename mėginyje vienu metu matuojama tūkstančiai ar net dešimtys tūkstančių kintamųjų (genų, baltymų), tačiau mėginių skaičius dažniausiai yra nedidelis (pvz., 20 pacientų). Ši situacija „daug kintamųjų, mažai pavyzdžių“ yra iššūkių, būdingų tik biologijai ir sritims, kuriose dirbtinis intelektas gali būti naudingiausias, šaltinis.

Šiame skyriuje aptarsime diferencinės raiškos analizę (genų, kurių ekspresija labai kinta tarp dviejų grupių) ir dirbtinio intelekto vaidmenį šioje darbo eigoje per transkriptomikos (RNA-seq) pavyzdį.

Pagrindinė didelių matmenų duomenų problema

Jei vienu metu išbandysite tūkstančius genų, atsitiktinai aptiksite genų, kurie atrodo „reikšmingi“, net jei ir nėra realių skirtumų. Jei išbandysite 20 000 genų su 5% paklaida, ~1000 genų atsitiktinai gali pasirodyti „reikšmingi“. Tai vadinama daugialypio palyginimo problema ir yra svarbiausias omikos analizės spąstas. Sprendimas yra pataisyti p reikšmes (pvz., apskaičiuoti FDR - klaidingą aptikimo greitį naudojant Benjamini-Hochberg metodą). AI labai padeda paaiškinti šią sąvoką ir parašyti tinkamą kodą; bet jūs privalote nepamiršti pritaikyti pataisos.

Patarimas: jei omikos rezultate matote tokį skaičių kaip „3000 genų labai pasikeitė“, sunerimkite. Paprastai tai yra ženklas, kad nebuvo atlikta daugkartinio palyginimo pataisa. Realus sąrašas būtų nuo dešimčių iki kelių šimtų genų gerai suplanuotame eksperimente.

RNR-seq diferencinė išraiška: žingsnis po žingsnio

  1. Neapdoroti skaičiai: lentelė, kurioje nurodyta, kiek nuskaitymų sumažėjo kiekviename kiekvieno geno mėginyje.
  2. Kokybė ir filtravimas: išmeskite genus, kurių ekspresija labai maža.
  3. Normalizavimas: teisingas bibliotekos dydžio skirtumas tarp mėginių (šiurkštus skaičius nepalyginamas).
  4. Statistinis modelis: Bandymo grupės skirtumas su DESeq2 arba edgeR (R bibliotekos) arba pyDESeq2 programoje Python.
  5. Daugkartinė palyginimo korekcija: Apskaičiuokite FDR; paprastai FDR riba < 0,05.
  6. Efekto dydis: Įvertinkite su log2 kartojimo pokyčiu: kiek kartų išraiška padidėja/sumažėja.
  7. Komentaras: reikšmingus genus susiekite su biologiniais keliais.

Dirbtinis intelektas 3-6. Jis koduoja veiksmus, paaiškina sąvokas ir padeda interpretuoti išvestį. Tačiau modelis negali pasakyti „kuris genas pasikeitė“, nematydamas jūsų neapdorotų duomenų; Kodas ir statistika jums tai sako.

Kopijuojami raginimo šablonai

Vaidmuo: esate transkriptinės analizės asistentas. Kontekstas: turiu RNA-seq neapdorotų skaičių lentelę (CSV) iš 12 kontrolinių, 12 gydymo mėginių. Užduotis: Išvardykite diferencinės išraiškos analizės su pyDESeq2 žingsnius, paaiškinkite, kodėl kiekvienas žingsnis yra būtinas. Pirmas planas, antras kodas. Būtinai įtraukite kelis palyginimo pataisymus.

Mano analizės rezultatai parodė 4200 genų kaip "p<0,05". Kodėl tai gali būti įtartina? Paaiškinkite daugkartinio palyginimo taisymą (Benjamini-Hochberg FDR) ir pateikite Python kodą, kuris atlieka tinkamą filtravimą.

Parašykite kodą, kuris nubrėžia ugnikalnio diagramą iš mano diferencinės išraiškos rezultatų lentelės (genas, log2FC, padj stulpeliai). Nuspalvinkite genus FDR<0,05 ir |log2FC|>1, pažymėkite 10 geriausių.

Kaip išanalizuoti šį reikšmingą genų sąrašą, kad būtų praturtintas kelias? Paaiškinkite gseapy arba g:Profiler veiksmus. Neteigti absoliutaus priežastingumo komentare, vartokite koreliacijos kalbą. Genų sąrašas: [sąrašas]

Silpnas raginimas / Stiprus raginimas

Silpnas: „Pasakyk man, kurie genai yra svarbūs RNR-seq derliui“.

Stiprus: "Turiu pyDESeq2 išvestį iš 12 kontrolinių, 12 gydymo mėginių: lentelė su genu, log2FoldChange, padj stulpeliai. Pateikite kodą, kuris filtruoja reikšmingus genus, kurių slenksčiai yra FDR<0,05 ir |log2FC|>1, praneša jų skaičių ir išrikiuoja 20 stipriausių genų pagal poveikį.

Skirtumas: galingas raginimas turi faktinius išvesties stulpelius, slenksčius ir patvirtinimo užklausą. Modelis apdoroja jūsų duomenis, o ne generuoja sugalvotą geno pavadinimą.

trys mini dėklai

1 atvejis – nelaimė be korekcijos: grupė rado 3800 „reikšmingų“ genų, kurių p<0,05 be pataisų, ir pateikė tai publikacijai. Kai teisėjas paprašė FDR pataisymo, sąrašas sumažėjo iki 47 genų. Jei dirbtinis intelektas nuo pat pradžių būtų pridėjęs Benjamini-Hochberg kodą, ši gėda nebūtų įvykusi. Pamoka: taisymas yra nediskutuotinas.

2 atvejis – partijos efektas: vieno tyrimo metu mėginiai buvo apdoroti dvi skirtingas dienas. Tai, kas, jų manymu, buvo „paciento ir kontrolės“ skirtumas, iš tikrųjų buvo „1-osios dienos ir 2-osios dienos“ skirtumas (partijos efektas: techninis skirtumas dėl mėginių ėmimo šalies). AI padėjo pašalinti klaidingą signalą, pasiūlydama modelio pridėti partijos kintamąjį (~ partija + sąlyga modelio formulėje).

3 atvejis – raukšlių pasikeitimo nepaisymas: studentas paskelbė „svarbiausiu“ geną, kurio ekspresija pasikeitė 2%, bet buvo išmatuota kaip labai stabili, vien pažvelgus į p reikšmę. kadangi efekto dydis (log2FC) buvo beveik lygus nuliui; statistinis reikšmingumas nėra biologinis reikšmingumas. Modelis paaiškino šį skirtumą ir pasiūlė vizualizuoti jį ugnikalnio grafiku.

Palyginimo lentelė: sąvokos aiškumas

koncepcija

Reikšmė

Kodėl tai svarbu?

p-reikšmė

Tikimybė, kad skirtumas yra sutapimas

vien tik gali klaidinti

FDR (padj)

Ištaisytas klaidų lygis atliekant kelis bandymus

Apriboja klaidingus teigiamus rezultatus

log2 karto pokytis

Efekto dydis

Nurodo biologinę reikšmę

partijos efektas

Techninis partijos skirtumas

Sukuria netikrą signalą

normalizavimas

Tarpimtinė skalės korekcija

Kad palyginimas būtų teisingas

Dažnos klaidos

  • Daugkartinio palyginimo taisymo praleidimas: dažniausia ir rimčiausia klaida.
  • Tiesiog žiūrint į p reikšmę: būtinai kartu atsižvelkite į efekto dydį (log2FC).
  • Neįtraukus partijos efekto į modelį: techninio skirtumo painiojimas su biologiniu skirtumu.
  • Normalizavimo pamiršimas: tiesioginis neapdorotų skaičių palyginimas.
  • Priežastinė kalba: posakis „Šis genas sukelia ligą“; Omikos duomenys rodo koreliaciją, priežastinis ryšys reikalauja papildomų eksperimentų.
Atsargiai: didelės apimties duomenyse „statistiškai reikšmingas“ ir „biologiškai reikšmingas“ yra du skirtingi dalykai. Dirbtinio intelekto sukurtas genų sąrašas yra pradinė hipotezė; Kiekvienas kandidatas genas neturėtų būti laikomas galutiniu be patikrinimo nepriklausomu metodu (qPCR, baltymų matavimas).

Dydžio mažinimas ir kokybės kontrolė

Pirmas dalykas, kurį reikia padaryti naudojant didelės apimties duomenis, yra pamatyti bendrą pavyzdžių struktūrą. PCA (pagrindinio komponento analizė: tūkstančių kintamųjų suskirstymas į kelias suvestinės ašis ir jų atvaizdavimas 2 matmenimis) yra standartinė priemonė tam. Jei grupės, kurių tikitės (kontrolė/gydymas), yra atskirtos PCA diagramoje, tai gerai; bet jei mėginiai suskirstyti pagal „apdorotą dieną“, o ne pagal grupę, tai yra paketinio efekto įspėjimas. Toje pačioje diagramoje taip pat iš karto rodomas atskiras (nepavyko) pavyzdys.

Nubrėžkite PCA iš mano normalizuotos išraiškos lentelės (eilutės genas, stulpelio pavyzdys). Spalvų pavyzdžiai pagal grupes (kontrolė/gydymas), forma pagal apdorojimo partiją. Pakomentuokite, ar diagramoje matomas paketinis efektas arba išskirtinis modelis.

Šis euristinis žingsnis lemia likusią analizės dalį: geriau anksti pastebėti nuokrypį, nei gaišti mėnesius dėl klaidingo rezultato.

Vieno langelio duomenys: naujas aspektas

Pastaraisiais metais plačiai paplito vienos ląstelės RNR sekos nustatymas (vienaląstė RNR seka: matuojamas tūkstančių atskirų ląstelių ekspresijos profilis). Čia duomenys tampa dar didesni: dešimtys tūkstančių ląstelių, tūkstančiai genų. Tokie įrankiai kaip Scanpy (Python) apdoroja šiuos duomenis; sugrupuoja ląsteles ir nustato ląstelių tipus. AI rašo šios darbo eigos kodą, tačiau ląstelių tipų biologinė nomenklatūra (nesvarbu, ar klasteris yra „T ląstelė“, ar „makrofagas“) priklauso nuo žymenų genų ir ekspertų žinių. Būtinai patvirtinkite langelio tipo etiketę, kurią modelis priskiria klasteriui su žinomais žymenimis; Tai dažniausiai klaidingai suprantamas vienos ląstelės analizės žingsnis.

Atviri duomenys ir atkuriamumas

Dauguma omikos tyrimų įkelia savo duomenis į viešas saugyklas: GEO („Gene Expression Omnibus“) ir „ArrayExpress“ – genų ekspresijai, SRA („Sequence Read Archive“) – neapdorotoms sekoms, PRIDE – proteomikai. Tai labai svarbu, kad kiti galėtų patikrinti jūsų rezultatus ir kad galėtumėte iš naujo išanalizuoti kitų tyrimų duomenis. AI gali rašyti kodą (su įrankiais, tokiais kaip GEOparse), kuris atsisiunčia ir tvarko duomenis iš GEO registracijos numerio (pvz., GSE numerio); Tačiau būtinai perskaitykite ir patvirtinkite atsisiųstų duomenų dizainą (kiek grupių, kiek pakartojimų, kuris procesas) iš pradinio įrašo. Jei modelis teigia, kad „prisimena“ tyrimo planą, tai beveik visada yra spėjimas, kurį reikia patikrinti.

Apibendrinant

„Omics“ duomenys matuoja tūkstančius kintamųjų mažoje imtyje; Taip sukuriami daugybės palyginimų, paketinių efektų ir pernelyg didelio interpretavimo spąstai. Dirbtinis intelektas; Jis parašo diferencinės išraiškos analizės kodą, paaiškina sąvokas ir padeda interpretuoti rezultatus. Tačiau jūs privalote taikyti FDR pataisą, įvertinti efekto dydį ir vengti priežastingumo kalbos. Kandidatų genai yra hipotezės, kol nepatvirtinama nepriklausomu metodu.

Taikymo užduotis

Gaukite arba sukurkite diferencinės išraiškos rezultatų lentelės pavyzdį (gen, log2FC, padj). Turėkite AI rašymo kodą, kuris filtruoja pagal FDR<0,05 ir |log2FC|>1, praneša reikšmingų genų skaičių ir nubraižo ugnikalnio grafiką. Paleiskite kodą. Tada paprašykite modelio apskaičiuoti, kiek genų atrodytų „reikšmingi“, jei nebūtų atlikta korekcija, ir interpretuoti skirtumą.

kontrolinis sąrašas

  • [ ] Pritaikiau daugkartinę palyginimo korekciją (FDR).
  • Įvertinau efekto dydį (log2FC), taip pat [ ] p reikšmę.
  • [ ] Patikrinau paketinius / techninius kintamuosius.
  • [ ] Normalizavimo žingsnio nepraleidau.
  • [ ] Aš vartojau koreliacijos, o ne priežastingumo kalbą.
  • [ ] Genus kandidatus pažymėjau kaip hipotezes, kurias reikia patvirtinti.