Unitate 3 / 10

Analiza datelor Omics: Transcriptomics, Proteomics and Multi-Omics Integration

Câștiguri:

  • Corecția testării multiple (valoarea p corectată) în analiza expresiei diferențiale și capacitatea de a interpreta corect schimbarea pliului și de a evita fals pozitive
  • Detectarea efectului de lot și adăugarea acestuia la model cu PCA și separarea zgomotului tehnic de diferența biologică
  • Capacitatea de a lega fiecare identitate a căii de sursă și de a o controla cu consistență biologică în îmbogățirea căii și integrarea multi-omică

O celulă nu este un singur număr; Este un sistem în care mii de gene, proteine ​​și metaboliți dansează simultan. Omics (denumirea colectivă pentru abordările care măsoară un strat biologic în ansamblu) încearcă să surprindă acest dans întreg: genomica (ADN), transcriptomica (ARN - ce gene funcționează și cât de mult), proteomică (proteine), metabolomică (molecule mici). Fiecare strat omic produce mii de date dimensionale, zgomotoase și costisitoare. AI este puternică în scanarea acestor date cu dimensiuni mari și în marcarea tiparelor; Dar tu ești cel care decide care tipar este adevărul biologic și care este zgomotul tehnic.

În această unitate, vom proceda prin transcriptomică, cea mai comună analiză omică; Principiile se aplică și altor straturi. Flux de lucru tipic: matrice de expresie din date brute (rândurile sunt gene, coloanele sunt mostre, celulele sunt niveluri de expresie), normalizare (eliminarea diferențelor tehnice), analiza expresiei diferențiale (găsirea genelor care se schimbă semnificativ între două condiții), îmbogățirea căilor (găsirea în care căi biologice sunt grupate genele modificate) și interpretare.

Expresie diferențială: modificarea pliului și valoarea p corectată

Pentru a spune dacă o genă s-a „schimbat”, sunt analizate două numere: schimbarea ori - de câte ori crește/descrește expresia, de obicei pe o scară log2 - și valoarea p ajustată (padj - statistica care controlează fals pozitivi atunci când se fac teste multiple). De ce repara? Pentru că testezi 20.000 de gene în același timp; Chiar și întâmplător, sute de gene se pot dovedi a fi „semnificative”. Fără corectarea testelor multiple – limitând rata de descoperire falsă cu metode precum Benjamini-Hochberg – lista este înșelătoare. AI poate scrie scriptul care calculează această statistică, dar dacă omite corecția, rezultatul tău este de nedefendat științific.

Atenție: O IA ar putea spune „500 de gene s-au schimbat semnificativ” pe baza valorii p brute. Privind valoarea p corectată, numărul ar putea scădea la 30. Verificați întotdeauna corectarea multitest; Aceasta este diferența dintre acceptarea și respingerea publicației.

Efect de lot: cea mai insidioasă capcană

Efectul lotului (diferența tehnică care decurge din prelucrarea probelor pe diferite zile, dispozitive sau persoane) este cea mai mare sursă de eroare în analiza omică. Dacă cele două afecțiuni ale tale au fost procesate în două zile diferite, „diferența biologică” pe care o vezi poate fi de fapt diferența de zi. AI poate sugera adăugarea variabilei lot la model (de exemplu, ~ lot + condiție), dar este responsabilitatea dvs. să o configurați corect și să nu o amestecați în designul experimental.

Sfat: Înainte de a începe analiza, desenați o diagramă PCA (Analiza componentelor principale - o metodă care rezumă și vizualizează datele cu dimensiuni mari pe mai multe axe). Dacă eșantioanele sunt grupate pe lot, mai degrabă decât după starea biologică, efectul lotului este dominant și trebuie corectat mai întâi.

Integrare multi-omică

Înțelegerea reală vine adesea din punerea laolaltă a straturilor: dacă o genă lucrează mai mult, dar proteina ei nu crește, reglarea este la nivel de translație. Integrarea multi-omică - combinând diferite straturi omice într-un singur model - este locul în care AI devine mai puternică, dar și locul unde induce în eroare cel mai mult; deoarece scara, zgomotul și potrivirile de probă ale straturilor sunt diferite. AI sugerează un flux de lucru de integrare, dar tu controlezi consistența biologică a rezultatelor.

trei mini cutii

Cazul 1 — Îmbogățirea accelerată. 1.240 de gene diferențiale au fost găsite într-un proiect de cancer. AI le-a pregătit pentru îmbogățirea căilor, evidențiind ciclul celular și căile de reparare a ADN-ului; Echipa a creat o hartă de ipoteză în 2 ore. Dar au retestat fiecare cale cu un instrument independent (g:Profiler) și au descoperit că o cale a fost greșită de AI.

Cazul 2 — Capcană de lot. Un laborator a descoperit o diferență „uimitoare” de 900 de gene între două grupuri de tratament. Când au efectuat PCA, au văzut că probele au fost separate prin lot de secvențiere. După corectarea lotului, diferența reală a scăzut la 60 de gene. AI a omis în mod neintenționat variabila lot în prima analiză.

Cazul 3 — Numele traseului inventat. Un student a dat lista de gene AI și a întrebat: „Care cale KEGG?” AI a furnizat un ID și un nume de cale ca și cum ar fi reale. Când studentul a căutat pe KEGG, a văzut că acel act de identitate nu există; verificarea a prevenit un rezultat fabricat.

Patru șabloane copiabile

1) Schema fluxului de lucru DESeq2:

Rolul tău: biolog computațional. Scrieți un script pas cu pas pentru analiza expresiei diferențiale ARN-seq cu R/DESeq2: citirea matricei de numărare, formula de proiectare (~ lot + condiție), normalizare, tabel cu rezultate. Aplicați în mod expres corecția testării multiple (BH) și utilizați padjcolumn. Explicați ce face fiecare pas într-o linie de comentarii.

2) Controlul calității/lotului:

Dă-mi o listă de verificare QC ARN-seq: controlul lotului cu PCA, dimensiunea bibliotecii, numărul de detectări de gene, detectarea valorii aberante. Pentru fiecare valoare, specificați un prag „ceea ce văd mă îngrijorează”. Explicați ce ar trebui să fac dacă lotul și starea biologică sunt amestecate.

3) Verificarea rezultatului îmbogățirii:

Vă voi oferi o listă de căi îmbogățită (număr de căi, padj, gene). Notați identitatea fiecărei căi (KEGG/GO ID) textual și nu o inventați. Filtrați rezultatele cu padj < 0,05. Specificați care căi se sprijină biologic reciproc, dar marcați fiecare identitate ca „trebuie verificată în baza de date”.

4) Verificarea consistenței multi-omice:

Transcriptomic și proteomic produc direcții de expresie contradictorii pentru o pereche genă/proteină. Enumerați posibilele motive biologice (editare post-traducere) și tehnice (zgomot de măsurare, potrivire a probelor) pentru aceasta și spuneți-mi cum să le testez pe fiecare.

Prompt slab / Prompt puternic

Prompt slab:

Numiți căile importante din această listă de gene.

Fără surse, fără statistici, risc ridicat de căi fabricate.

Solicitare puternică:

Rolul tău: biolog computațional. În tabelul de gene diferențiale atașat (genă, log2FC, padj) luați numai gene cu padj < 0,05. Spuneți-mi pașii unei analize de îmbogățire GO care trebuie efectuate cu aceste gene și instrumentul (g:Profiler) pe care îl voi folosi. Numele căii este FAKE; Voi rula instrumentul și voi face analiza, descrieți doar metodologia corectă și corectarea testelor multiple.

Diferență: filtru clar, concentrare pe metodologie, interzicerea fabricării și lăsarea verificării în seama utilizatorului.

Etapele analizei Omics

pas

Scop

greseala comuna

Rolul AI

normalizare

Eliminați diferența tehnică

Alegerea greșită a metodei

Script + argumentare

PCA/QC

Detectarea loturilor și a valorii aberante

sari peste pasul meu

Imagine + comentariu

expresie diferentiala

Găsirea genelor în schimbare

p. necorectat

Ciornă de scenariu

îmbogățire

găsi o cale

cale fabricată

metodologie

integrare

îmbina straturi

Eroare de scară/potrivire

Recomandare flux de lucru

Omică cu o singură celulă: o nouă scară

În ultimii ani, secvențierea cu o singură celulă - măsurarea profilului de expresie al fiecăreia dintre miile de celule separat - a dus omicul la o nouă dimensiune. Acum, în loc de „expresia medie a unui țesut”, putem vedea fiecare tip de celulă din acel țesut separat. Această putere introduce noi capcane: datele sunt extrem de rare (majoritatea genelor au zero citiri în majoritatea celulelor - abandon), dimensiunea este de zeci de mii de celule × douăzeci și mii de gene, iar separarea tipurilor de celule se face în mare parte prin grupare. AI este puternică în producerea de contururi de grupare și etichetare a tipurilor de celule pe date cu o singură celulă; dar verificați cu gene marker cunoscute dacă fiecare grup este un tip de celulă real sau un artefact tehnic (de exemplu, celule moarte, două celule prinse împreună). Nu acceptați eticheta tipului de celulă sugerată de AI fără a confirma genele marker ale acelui grup în literatura de specialitate.

Sfat: Într-o analiză cu o singură celulă, dacă AI sugerează o etichetă „celulă T” unui cluster, verificați singuri dacă markerii celulelor T (de exemplu, CD3) sunt într-adevăr foarte exprimați în acel cluster. Dacă eticheta nu este susținută de simbol, este o ipoteză, nu o concluzie.

Greșeli comune

  • Omiterea corectării testelor multiple. Lista se umflă cu valoarea p brută; ar trebui folosit padj.
  • Confundarea efectului lotului cu biologie. Ar trebui verificat mai întâi cu PCA.
  • A face schimbarea podelei singurul criteriu. Schimbarea înaltă a pliului poate induce în eroare în cazul genelor zgomotoase și cu expresie scăzută.
  • Acceptarea traseului inventat/identității GO. Fiecare identitate trebuie verificată în baza de date.
  • Subestimarea dimensiunii eșantionului. Puterea statistică este scăzută într-un design 2 pe 2; Rezultatele trebuie interpretate cu prudență.

În concluzie

Analiza Omics funcționează cu date de dimensiuni mari, zgomotoase, iar AI accelerează aceste date prin scanarea lor, scrierea de scripturi și marcarea modelelor. Dar corecția testelor multiple în expresia diferențială, controlul lotului cu PCA și verificarea sursei în îmbogățire sunt indispensabile. Integrarea multi-omică este puternică, dar înșelătoare; Verificați fiecare rezultat cu consistență biologică, ținând cont de diferențele de scară și de zgomot ale straturilor.

Sarcina de aplicare

Găsiți o matrice de numărare ARN-seq disponibilă public (de exemplu, de la GEO). Solicitați AI să scrie un script de analiză cu șablonul „flux de lucru DESeq2” și să verifice în cod dacă corectarea testării multiple a fost aplicată efectiv. Apoi cereți AI un comentariu de îmbogățire și verificați toate ID-urile căii pe care le returnează unul câte unul față de baza de date KEGG sau GO; Observați câte sunt reale.

lista de verificare

  • [ ] Am folosit padj (corectat) în analiza diferenţială, nu valoarea p brută.
  • [ ] Am verificat efectul lotului cu PCA și l-am adăugat la model dacă este necesar.
  • [ ] Am interpretat cu prudență genele cu schimbare mare de ori, dar cu expresie scăzută.
  • [ ] Am verificat fiecare cale/ID GO în baza de date reală.
  • [ ] Am evaluat puterea statistică a mărimii eșantionului.
  • [ ] Am împărțit contradicțiile multi-omice în cauze biologice și tehnice.