Ünite 3 / 10

Omics Veri Analizi: Transkriptomik, Proteomik ve Çok-Omics Entegrasyonu

Kazanimlar:

  • Diferansiyel ifade analizinde çoklu test düzeltmesi (düzeltilmiş p-değeri) ve kat değişimini doğru yorumlayıp yanlış pozitiflerden kaçınabilme
  • PCA ile batch etkisini tespit edip modele katma ve teknik gürültüyü biyolojik farktan ayırabilme
  • Yol zenginleştirme ve çok-omics entegrasyonunda her yolak kimliğini kaynağa bağlayıp biyolojik tutarlılıkla denetleyebilme

Bir hücre, tek bir sayı değil; binlerce genin, proteinin ve metabolitin aynı anda dans ettiği bir sistemdir. Omics (bir biyolojik katmanı bütün olarak ölçen yaklaşımların ortak adı), bu dansın tamamını yakalamaya çalışır: genomik (DNA), transkriptomik (RNA — hangi genlerin ne kadar çalıştığı), proteomik (proteinler), metabolomik (küçük moleküller). Her omics katmanı binlerce boyutlu, gürültülü ve maliyetli veri üretir. YZ, bu yüksek boyutlu veriyi tarayıp örüntü işaretlemede güçlüdür; ama hangi örüntünün biyolojik gerçek, hangisinin teknik gürültü olduğuna karar veren sizsiniz.

Bu ünitede en yaygın omics analizi olan transkriptomik üzerinden ilerleyeceğiz; ilkeler diğer katmanlara da uyar. Tipik iş akışı: ham veriden ifade matrisi (expression matrix — satırlar genler, sütunlar örnekler, hücreler ifade düzeyleri), normalizasyon (teknik farkları giderme), diferansiyel ifade analizi (differential expression — iki koşul arasında anlamlı değişen genleri bulma), yol zenginleştirme (pathway enrichment — değişen genlerin hangi biyolojik yolaklarda toplandığını bulma) ve yorum.

Diferansiyel ifade: kat değişimi ve düzeltilmiş p-değeri

Bir genin "değiştiğini" söylemek için iki sayıya bakılır: kat değişimi (fold change — ifadenin kaç kat arttığı/azaldığı, genelde log2 ölçeğinde) ve düzeltilmiş p-değeri (adjusted p-value / padj — çoklu test yapıldığında yanlış pozitifleri kontrol eden istatistik). Neden düzeltme? Çünkü aynı anda 20.000 gen test edersiniz; şans eseri bile yüzlerce gen "anlamlı" çıkabilir. Çoklu test düzeltmesi (multiple testing correction — Benjamini-Hochberg gibi yöntemlerle yanlış keşif oranını sınırlama) olmadan liste yanıltıcıdır. YZ bu istatistiği hesaplayan betiği yazabilir, ama düzeltmeyi atlarsa sonucunuz bilimsel olarak savunulamaz.

Dikkat: Bir YZ, ham p-değerine göre "500 gen anlamlı değişti" diyebilir. Düzeltilmiş p-değerine bakınca sayı 30'a düşebilir. Çoklu test düzeltmesini her zaman kendiniz kontrol edin; bu, yayının kabul edilip reddedilmesi arasındaki farktır.

Batch etkisi: en sinsi tuzak

Batch etkisi (batch effect — örneklerin farklı gün, cihaz veya kişi tarafından işlenmesinden doğan teknik fark), omics analizinin en büyük yanılgı kaynağıdır. İki koşulunuz iki farklı günde işlendiyse, gördüğünüz "biyolojik fark" aslında gün farkı olabilir. YZ, batch değişkenini modele katmayı önerebilir (örneğin ~ batch + condition), ama bunu doğru kurgulamak ve deney tasarımında baştan karıştırmamak sizin sorumluluğunuzdur.

İpucu: Analize başlamadan bir PCA (Principal Component Analysis — yüksek boyutlu veriyi birkaç eksende özetleyip görselleştiren yöntem) grafiği çizdirin. Örnekler biyolojik koşula göre değil de batch'e göre kümeleniyorsa, batch etkisi baskındır ve önce düzeltilmelidir.

Çok-omics entegrasyonu

Gerçek anlayış çoğu zaman katmanları birleştirmekten gelir: bir gen daha çok çalışıyor ama proteini artmıyorsa, düzenleme çeviri düzeyindedir. Çok-omics entegrasyonu (multi-omics integration — farklı omics katmanlarını tek bir modelde birleştirme), YZ'nin güçlendiği ama aynı zamanda en çok yanılttığı alandır; çünkü katmanların ölçekleri, gürültüleri ve örneklem eşleşmeleri farklıdır. YZ bir entegrasyon iş akışı önerir, ama sonuçların biyolojik tutarlılığını siz denetlersiniz.

Üç mini vaka

Vaka 1 — Zenginleştirme hızlandı. Bir kanser projesinde 1.240 diferansiyel gen bulundu. YZ, bunları yol zenginleştirme için hazırlayıp hücre döngüsü ve DNA onarımı yolaklarını öne çıkardı; ekip 2 saatte bir hipotez haritası çıkardı. Ama her yolağı bağımsız bir araçla (g:Profiler) yeniden test ettiler ve bir yolağın YZ tarafından yanlış eşlendiğini gördüler.

Vaka 2 — Batch tuzağı. Bir laboratuvar, iki tedavi grubu arasında "çarpıcı" 900 genlik fark buldu. PCA çizince örneklerin dizileme partisine göre ayrıldığını gördüler. Batch düzeltmesi sonrası gerçek fark 60 gene indi. YZ ilk analizde batch değişkenini istemeden atlamıştı.

Vaka 3 — Uydurma yolak adı. Bir öğrenci, YZ'ye gen listesini verip "hangi KEGG yolağı" diye sordu. YZ, gerçekmiş gibi bir yolak kimliği (ID) ve adı verdi. Öğrenci KEGG'de arayınca o kimliğin var olmadığını gördü; doğrulama, uydurma bir sonucu engelledi.

Dört kopyalanabilir şablon

1) DESeq2 iş akışı taslağı:

Rolün: hesaplamalı biyolog. R/DESeq2 ile RNA-seq diferansiyelifade analizi için adım adım betik yaz: count matrisi okuma,tasarım formülü (~ batch + condition), normalizasyon, sonuçtablosu. Çoklu test düzeltmesini (BH) AÇIKÇA uygula ve padjsütununu kullan. Her adımın ne yaptığını yorum satırıyla açıkla.

2) Kalite/batch kontrolü:

Bana bir RNA-seq QC kontrol listesi ver: PCA ile batch kontrolü,kütüphane boyutu, gen tespit sayısı, aykırı örnek tespiti.Her metrik için "ne görürsem endişelenirim" eşiğini belirt.Batch ve biyolojik koşul karışmışsa ne yapmam gerektiğini açıkla.

3) Zenginleştirme sonucu doğrulama:

Sana zenginleştirilmiş yolak listesi vereceğim (yolak, padj,gen sayısı). Her yolağın kimliğini (KEGG/GO ID) aynen yaz veuydurma. Sonuçları padj < 0,05 ile filtrele. Hangi yolaklarınbiyolojik olarak birbirini desteklediğini belirt ama herkimliği "veri tabanında doğrulanmalı" olarak işaretle.

4) Çok-omics tutarlılık kontrolü:

Transkriptomik ve proteomik verimde bir gen/protein çifti içinifade yönleri çelişiyor. Bunun olası biyolojik (çeviri sonrasıdüzenleme) ve teknik (ölçüm gürültüsü, örnek eşleşmesi)nedenlerini ayrı ayrı listele ve her birini nasıl testedeceğimi söyle.

Zayıf prompt / Güçlü prompt

Zayıf prompt:

Bu gen listesindeki önemli yolakları söyle.

Kaynak yok, istatistik yok, uydurma yolak riski yüksek.

Güçlü prompt:

Rolün: hesaplamalı biyolog. Ekteki diferansiyel gen tablosunda(gen, log2FC, padj) sadece padj < 0,05 olan genleri al. Bugenlerle yapılacak bir GO zenginleştirme analizinin adımlarınıve kullanacağım aracı (g:Profiler) söyle. Yolak adı UYDURMA;analizi ben aracı çalıştırıp yapacağım, sen sadece doğrumetodolojiyi ve çoklu test düzeltmesini tarif et.

Fark: net filtre, metodoloji odağı, uydurma yasağı ve doğrulamayı kullanıcıya bırakma.

Omics analiz adımları

Adım

Amaç

Yaygın hata

YZ rolü

Normalizasyon

Teknik farkı gidermek

Yanlış yöntem seçimi

Betik + gerekçe

PCA/QC

Batch ve aykırı tespit

Adımı atlamak

Görsel + yorum

Diferansiyel ifade

Değişen genleri bulmak

Düzeltmesiz p

Betik taslağı

Zenginleştirme

Yolak bulmak

Uydurma yolak

Metodoloji

Entegrasyon

Katmanları birleştirmek

Ölçek/eşleşme hatası

İş akışı önerisi

Tek hücre omics: yeni bir ölçek

Son yıllarda tek hücre dizileme (single-cell sequencing — binlerce hücrenin her birinin ifade profilini ayrı ayrı ölçme) omics'i yeni bir boyuta taşıdı. Artık "bir dokunun ortalama ifadesi" yerine, o doku içindeki her hücre tipini ayrı görebiliyoruz. Bu güç, yeni tuzaklar getirir: veri son derece seyrektir (çoğu gen çoğu hücrede sıfır okunur — dropout), boyut on binlerce hücre × yirmi binlerce gendir ve hücre tiplerini ayırmak çoğunlukla kümeleme ile yapılır. YZ, tek hücre verisinde kümeleme ve hücre tipi etiketleme taslağı üretmede güçlüdür; ama her kümenin gerçek bir hücre tipi mi yoksa teknik bir artefakt mı (örneğin ölü hücreler, iki hücrenin birlikte yakalanması) olduğunu bilinen belirteç genlerle siz doğrularsınız. YZ'nin önerdiği hücre tipi etiketini, o kümenin belirteç genlerini asıl literatürde teyit etmeden kabul etmeyin.

İpucu: Tek hücre analizinde YZ bir kümeye "T hücresi" etiketi önerirse, o kümede gerçekten T hücresi belirteçlerinin (örneğin CD3) yüksek ifade edildiğini kendiniz kontrol edin. Etiket, belirteçle desteklenmiyorsa bir hipotezdir, sonuç değil.

Sık yapılan hatalar

  • Çoklu test düzeltmesini atlamak. Ham p-değeriyle liste şişer; padj kullanılmalı.
  • Batch etkisini biyoloji sanmak. PCA ile önce kontrol edilmeli.
  • Kat değişimini tek ölçüt yapmak. Yüksek kat değişimi düşük ifadeli, gürültülü genlerde yanıltıcı olabilir.
  • Uydurma yolak/GO kimliği kabul etmek. Her kimlik veri tabanında doğrulanmalı.
  • Örneklem büyüklüğünü küçümsemek. 2'ye 2 tasarımda istatistiksel güç düşüktür; sonuçlar temkinli yorumlanmalı.

Özetle

Omics analizi yüksek boyutlu, gürültülü veriyle çalışır ve YZ bu veriyi tarayıp betik yazarak, örüntü işaretleyerek hızlandırır. Ama diferansiyel ifadede çoklu test düzeltmesi, PCA ile batch kontrolü ve zenginleştirmede kaynak doğrulaması vazgeçilmezdir. Çok-omics entegrasyonu güçlü ama yanıltıcıdır; katmanların ölçek ve gürültü farklarını gözeterek her sonucu biyolojik tutarlılıkla denetleyin.

Uygulama görevi

Halka açık bir RNA-seq sayım matrisi (örneğin GEO'dan) bulun. YZ'ye "DESeq2 iş akışı" şablonuyla bir analiz betiği yazdırın ve çoklu test düzeltmesinin gerçekten uygulandığını kod içinde kontrol edin. Ardından YZ'den bir zenginleştirme yorumu isteyin ve verdiği tüm yolak kimliklerini KEGG ya da GO veri tabanında tek tek doğrulayın; kaç tanesinin gerçek olduğunu not edin.

Kontrol listesi

  • [ ] Diferansiyel analizde padj (düzeltilmiş) kullandım, ham p-değeri değil.
  • [ ] PCA ile batch etkisini kontrol edip gerekiyorsa modele kattım.
  • [ ] Kat değişimi yüksek ama düşük ifadeli genleri temkinle yorumladım.
  • [ ] Her yolak/GO kimliğini gerçek veri tabanında doğruladım.
  • [ ] Örneklem büyüklüğünün istatistiksel gücünü değerlendirdim.
  • [ ] Çok-omics çelişkilerini biyolojik ve teknik nedenlerine ayırdım.