Unit 4 / 11

Data Omics dan Analisis Dimensi Tinggi

Keuntungan:

  • Keupayaan untuk memahami masalah perbandingan berganda dan memasukkan pembetulan FDR (kadar penemuan palsu) dalam analisis
  • Keupayaan untuk membezakan kepentingan statistik dan biologi dengan menilai nilai p dan saiz kesan (perubahan log2 kali ganda) bersama-sama
  • Keupayaan untuk mengenali dan mengelakkan perangkap data berdimensi tinggi seperti kesan kelompok dan lompatan sebab akibat

Perkataan "omik" menerangkan pendekatan yang mengukur keseluruhan kelas molekul dalam sel: genomik (semua DNA), transkriptomi (semua ekspresi RNA / gen), proteomik (semua protein), metabolomik (semua molekul kecil). Ciri umum pengukuran ini ialah dimensinya yang tinggi: beribu-ribu malah berpuluh-puluh ribu pembolehubah (gen, protein) diukur secara serentak dalam satu sampel, tetapi bilangan sampel biasanya kecil (cth. 20 pesakit). Situasi "banyak pembolehubah, beberapa sampel" ini merupakan sumber cabaran unik untuk biologi dan bidang yang AI boleh membantu.

Dalam unit ini, kita akan membincangkan analisis ekspresi pembezaan (mencari gen yang ekspresinya berubah dengan ketara antara dua kumpulan) dan peranan kecerdasan buatan dalam aliran kerja ini melalui contoh transkriptomi (RNA-seq).

Masalah utama data berdimensi tinggi

Jika anda menguji beribu-ribu gen sekaligus, anda akan menemui gen yang kelihatan "ketara" secara kebetulan, walaupun tidak ada perbezaan yang nyata. Jika anda menguji 20,000 gen dengan margin ralat 5%, ~1,000 gen mungkin menjadi "ketara" secara kebetulan. Ini dipanggil masalah perbandingan berganda dan merupakan perangkap paling kritikal dalam analisis omik. Penyelesaiannya adalah untuk membetulkan nilai-p (cth. mengira FDR — kadar penemuan palsu dengan kaedah Benjamini-Hochberg). AI sangat membantu dalam menerangkan konsep ini dan menulis kod yang betul; tetapi menjadi tanggungjawab anda untuk ingat untuk menggunakan pembetulan.

Petua: Jika anda melihat nombor seperti "3,000 gen berubah dengan ketara" dalam hasil omics, bimbang. Ini biasanya merupakan tanda bahawa pembetulan berbilang perbandingan belum dibuat. Senarai yang realistik ialah berpuluh hingga beberapa ratus gen dalam eksperimen yang direka dengan baik.

Ekspresi pembezaan RNA-seq: langkah demi langkah

  1. Kiraan mentah: Jadual yang mengandungi bilangan bacaan yang jatuh dalam setiap sampel untuk setiap gen.
  2. Kualiti dan penapisan: Buang gen dengan ekspresi yang sangat rendah.
  3. Normalisasi: Betulkan perbezaan saiz perpustakaan antara sampel (nombor kasar tidak setanding).
  4. Model statistik: Uji perbezaan kumpulan dengan DESeq2 atau edgeR (pustaka R) atau pyDESeq2 dalam Python.
  5. Pembetulan perbandingan berbilang: Kira FDR; biasanya ambang FDR < 0.05.
  6. Saiz kesan: Nilaikan dengan perubahan lipatan log2: berapa kali ungkapan bertambah/berkurang.
  7. Ulasan: Kaitkan gen penting dengan laluan biologi.

Kecerdasan buatan 3-6. Ia mengekodkan langkah, menerangkan konsep dan membantu anda mentafsir output. Walau bagaimanapun, model tidak boleh mengatakan "gen mana yang berubah" tanpa melihat data mentah anda; Kod dan statistik memberitahu anda perkara ini.

Templat gesaan yang boleh disalin

Peranan: Anda ialah pembantu analisis transkriptomi. Konteks: Saya mempunyai jadual kiraan mentah (CSV) RNA-seq daripada 12 kawalan, 12 sampel rawatan. Tugas: Senaraikan langkah-langkah analisis ungkapan pembezaan dengan pyDESeq2, terangkan sebab setiap langkah perlu. Rancang dahulu, kod kedua. Pastikan anda memasukkan berbilang pembetulan perbandingan.

Output analisis saya menunjukkan 4,200 gen sebagai "p<0.05". Mengapa ini boleh mencurigakan? Terangkan pembetulan perbandingan berbilang (Benjamini-Hochberg FDR) dan berikan kod Python yang melakukan penapisan yang betul.

Tulis kod yang melukis plot gunung berapi daripada jadual hasil ekspresi pembezaan saya (gen, log2FC, lajur padj). Warnakan gen dengan FDR<0.05 dan |log2FC|>1, labelkan 10 teratas.

Bagaimanakah saya menganalisis senarai gen penting ini untuk pengayaan laluan? Terangkan langkah gseapy atau g:Profiler. Jangan dakwa kausalitas mutlak dalam ulasan, gunakan bahasa korelasi. Senarai gen: [senarai]

Gesaan lemah / Gesaan kuat

Lemah: "Beritahu saya gen mana yang penting dalam hasil RNA-seq."

Kuat: "Saya mempunyai output pyDESeq2 daripada 12 kawalan, 12 sampel rawatan: jadual dengan gen, log2FoldChange, lajur padj. Berikan kod yang menapis gen penting dengan ambang FDR<0.05 dan |log2FC|>1, laporkan bilangannya dan letakkan 20 gen terkuat mengikut saiz ambang yang munasabah ini."

Perbezaan: Gesaan berkuasa mempunyai lajur output sebenar, ambang dan permintaan pengesahan. Model memproses data anda dan bukannya menjana nama gen yang dibuat-buat.

tiga kes mini

Kes 1 — Bencana tanpa pembetulan: Satu kumpulan menemui 3,800 gen "ketara" dengan p<0.05 tanpa pembetulan dan menyerahkannya kepada penerbitan. Apabila pengadil meminta pembetulan FDR, senarai itu turun kepada 47 gen. Sekiranya kecerdasan buatan telah menambah kod Benjamini-Hochberg dari awal, rasa malu ini tidak akan berlaku. Pengajaran: pembetulan tidak boleh dirunding.

Kes 2 — Kesan kelompok: Dalam satu kajian, sampel diproses pada dua hari berbeza. Apa yang mereka fikirkan sebagai perbezaan "pesakit lwn. kawalan" sebenarnya adalah perbezaan "hari pertama lwn. hari ke-2" (kesan kelompok: perbezaan teknikal disebabkan pihak pensampelan). AI membantu menyingkirkan isyarat palsu dengan mencadangkan penambahan pembolehubah kelompok pada model (~ kelompok + keadaan dalam formula model).

Kes 3 — Mengabaikan perubahan lipatan: Seorang pelajar mengisytiharkan "paling penting" gen yang ekspresinya berubah sebanyak 2% tetapi diukur sebagai sangat stabil, hanya dengan melihat nilai-p. Manakala saiz kesan (log2FC) adalah hampir sifar; kepentingan statistik bukan kepentingan biologi. Model menjelaskan perbezaan ini dan mencadangkan untuk menggambarkannya dengan graf gunung berapi.

Jadual perbandingan: kejelasan konsep

konsep

Maknanya

Mengapa ia penting?

nilai-p

Kebarangkalian perbezaan itu adalah kebetulan

sahaja boleh mengelirukan

FDR (padj)

Kadar ralat yang diperbetulkan dalam berbilang ujian

Hadkan positif palsu

perubahan log2 kali ganda

Saiz kesan

Menunjukkan kepentingan biologi

kesan kelompok

Perbezaan kumpulan teknikal

Mencipta isyarat palsu

normalisasi

Pembetulan skala antara sampel

Menjadikan perbandingan adil

Kesilapan biasa

  • Melangkau pembetulan perbandingan berbilang: Kesilapan yang paling biasa dan paling serius.
  • Hanya melihat p-value: Pastikan anda mempertimbangkan saiz kesan (log2FC) bersama-sama.
  • Tidak termasuk kesan kelompok dalam model: Tersilap perbezaan teknikal untuk perbezaan biologi.
  • Melupakan penormalan: Membandingkan nombor mentah secara langsung.
  • Bahasa sebab: Sebut "Gen ini menyebabkan penyakit"; Data Omics menunjukkan korelasi, kausaliti memerlukan eksperimen tambahan.
Awas: Dalam data berdimensi tinggi, "signifikan secara statistik" dan "signifikan biologi" ialah dua perkara yang berbeza. Senarai gen yang dihasilkan oleh kecerdasan buatan adalah hipotesis awal; Setiap gen calon tidak boleh dianggap muktamad tanpa pengesahan melalui kaedah bebas (qPCR, pengukuran protein).

Pengurangan saiz dan kawalan kualiti

Perkara pertama yang perlu dilakukan dalam data berdimensi tinggi ialah melihat struktur umum sampel. PCA (analisis komponen utama: mengurangkan beribu-ribu pembolehubah menjadi beberapa paksi ringkasan dan memaparkannya dalam 2 dimensi) ialah alat standard untuk ini. Jika kumpulan yang anda jangkakan (kawalan/rawatan) diasingkan dalam carta PCA, adalah bagus; tetapi jika sampel dikelompokkan mengikut "hari diproses" dan bukannya mengikut kumpulan, ini ialah amaran kesan kelompok. Carta yang sama juga menunjukkan contoh outlier tunggal (gagal).

Lukis PCA daripada jadual ekspresi ternormal saya (gen baris, sampel lajur). Warnakan sampel mengikut kumpulan (kawalan/rawatan), bentuk mengikut kumpulan pemprosesan. Ulas sama ada kesan kelompok atau corak terpencil dilihat dalam graf.

Langkah heuristik ini memacu analisis yang lain: adalah lebih baik untuk menangkap lebih awal daripada membuang bulan pada keputusan palsu.

Data sel tunggal: dimensi baharu

Dalam tahun-tahun kebelakangan ini, penjujukan RNA sel tunggal (RNA-seq sel tunggal: mengukur profil ekspresi beribu-ribu sel individu) telah meluas. Di sini data menjadi lebih besar: puluhan ribu sel, ribuan gen setiap satu. Alat seperti Scanpy (Python) memproses data ini; mengelompokkan sel dan mengenal pasti jenis sel. AI menulis kod untuk aliran kerja ini, tetapi tatanama biologi jenis sel (sama ada kelompok ialah "sel T" atau "makrofaj") bergantung pada gen penanda dan pengetahuan pakar. Pastikan anda mengesahkan label jenis sel yang diberikan model kepada kluster dengan penanda yang diketahui; Ini adalah langkah yang paling kerap disalahfahamkan dalam analisis sel tunggal.

Data terbuka dan kebolehulangan

Kebanyakan kajian omics memuat naik data mereka ke repositori awam: GEO (Gene Expression Omnibus) dan ArrayExpress untuk ekspresi gen, SRA (Sequence Read Archive) untuk jujukan mentah, PRIDE untuk proteomik. Ini penting supaya orang lain boleh mengesahkan keputusan anda dan supaya anda boleh menganalisis semula data daripada kajian lain. AI boleh menulis kod (dengan alatan seperti GEOparse) yang memuat turun dan mengatur data daripada nombor pendaftaran GEO (cth. nombor GSE); Tetapi pastikan anda membaca dan mengesahkan reka bentuk data yang anda muat turun (berapa banyak kumpulan, berapa banyak ulangan, proses yang mana) daripada rekod asal. Jika model mendakwa "mengingat" reka bentuk kajian, ini hampir selalu merupakan tekaan yang perlu disahkan.

Secara ringkasnya

Data Omics mengukur beribu-ribu pembolehubah dalam saiz sampel yang kecil; Ini mewujudkan perangkap berbilang perbandingan, kesan kelompok dan tafsiran berlebihan. Kecerdasan buatan; Ia menulis kod untuk analisis ungkapan pembezaan, menerangkan konsep dan membantu anda mentafsir keputusan. Walau bagaimanapun, adalah menjadi tanggungjawab anda untuk menggunakan pembetulan FDR, menilai saiz kesan dan mengelakkan bahasa kausaliti. Gen calon adalah hipotesis sehingga disahkan dengan kaedah bebas.

Tugasan permohonan

Dapatkan atau cipta jadual hasil ungkapan pembezaan sampel (gen, log2FC, padj). Minta AI ​​menulis kod yang menapis mengikut FDR<0.05 dan |log2FC|>1, melaporkan bilangan gen penting dan memplotkan graf gunung berapi. Jalankan kod. Kemudian minta model mengira berapa banyak gen yang akan kelihatan "ketara" jika pembetulan tidak dibuat, dan tafsirkan perbezaannya.

senarai semak

  • [ ] Saya menggunakan pembetulan perbandingan berbilang (FDR).
  • Saya menilai saiz kesan (log2FC) serta nilai-p [ ].
  • [ ] Saya menyemak pembolehubah kelompok/teknikal.
  • [ ] Saya tidak melangkau langkah normalisasi.
  • [ ] Saya menggunakan bahasa korelasi dan bukannya sebab akibat.
  • [ ] Saya menanda gen calon sebagai hipotesis yang perlu disahkan.