Ünite 3 / 11

Dizi Analizi ve Biyoinformatik: DNA, RNA ve Proteinler

Kazanimlar:

  • FASTA okuma, çeviri, hizalama ve BLAST gibi temel dizi analizi işlemlerinin kodunu yazdırıp sonuçlarını yorumlayabilme
  • E-değeri, kapsama oranı ve okuma çerçevesi gibi kavramları doğru yorumlayarak yanlış sonuçlardan kaçınabilme
  • Bir dizinin işlev iddiasını resmi veri tabanlarıyla (NCBI, UniProt, Ensembl) teyit etmenin zorunluluğunu kavrayabilme

Biyolojinin en temel verisi dizidir: DNA'nın A, T, G, C harflerinden oluşan sıralaması; RNA'nın A, U, G, C dizisi; proteinin 20 amino asit harfinden oluşan zinciri. Bir genin ne olduğunu, iki türün ne kadar akraba olduğunu, bir mutasyonun (mutasyon: dizideki değişiklik) hastalıkla ilişkisini hep bu diziler üzerinden anlarız. Bu ünitede yapay zekayı dizi analizinin kod ve yorum asistanı olarak kullanmayı öğreneceğiz: FASTA dosyalarını okumak, dizileri çevirmek, hizalamak (alignment: iki diziyi harf harf karşılaştırıp benzerliklerini görmek) ve BLAST gibi araçları anlamak.

Kritik uyarı en baştan: yapay zeka bir dizinin gerçek işlevini "bilmez"; bunu ancak resmi veri tabanları (NCBI, UniProt, Ensembl) ve deneysel kanıt söyler.

Temel kavramlar ve araçlar

  • FASTA: Dizileri saklayan metin biçimi; her dizi > ile başlayan bir başlık satırı ve altındaki dizi satırlarından oluşur.
  • BLAST (Basic Local Alignment Search Tool): Elinizdeki bir diziyi dev bir veri tabanındaki milyonlarca diziyle karşılaştırıp en benzerlerini bulan araç. "Bu dizi neye benziyor?" sorusunun standart yanıtı.
  • Hizalama (alignment): İki veya daha fazla diziyi, benzer bölgeleri alt alta gelecek şekilde dizme. İkili (pairwise) veya çoklu (multiple sequence alignment, MSA) olabilir.
  • Çeviri (translation): DNA/RNA kodlayan dizisini, üçlü harf grupları (kodon) üzerinden amino asit dizisine dönüştürme.
  • Motif: Dizide tekrarlayan, işlevsel anlamı olan kısa örüntü (örneğin bir bağlanma bölgesi).
İpucu: Yapay zekaya "şu diziyi BLAST'la" diyemezsiniz; model BLAST veri tabanına erişemez. Ama "BLAST sonucumu nasıl yorumlarım, e-değeri (E-value) ne anlama gelir?" diye sorabilir, hatta Biopython ile BLAST'ı programlı çağıran kod yazdırabilirsiniz.

Adım adım: bir dizinin kimliğini araştırmak

  1. Diziyi elde edin: FASTA olarak dosyaya kaydedin.
  2. Temel kontrol: Uzunluk, harf içeriği (yalnızca A/T/G/C mi, yoksa bilinmeyen "N" var mı), GC oranı (guanin-sitozin yüzdesi: türe ve bölgeye göre değişir).
  3. BLAST: NCBI web arayüzünde veya programlı olarak arama yapın.
  4. Yorum: En iyi eşleşmenin e-değerine (ne kadar küçükse rastlantı olma olasılığı o kadar düşük) ve kapsama oranına (query coverage) bakın.
  5. Teyit: Eşleşen gen/proteini UniProt veya NCBI'da açıp gerçekten aradığınız işlevle uyuştuğunu doğrulayın.

Yapay zeka 2. adımdaki kodu ve 4. adımdaki yorumu yapmanıza yardım eder; ama 3. ve 5. adımdaki gerçek veriyi araçların kendisi ve siz sağlarsınız.

Kopyalanabilir prompt şablonları

Rol: Biyoinformatik asistanısın.Görev: Biopython ile bir FASTA dosyasını oku (sequences.fasta).İstediğim: her dizi için ad, uzunluk ve GC oranını bir tabloya yaz;sonucu CSV olarak kaydet. Yorumlu, çalışan Python kodu ver.

Elimdeki DNA dizisini protein dizisine çevir.Biopython Seq.translate kullan; durdurma kodonunu (*) göster;okuma çerçevesini (reading frame) belirt. Kod ver, açıkla.Dizi: [FASTA]

BLAST sonucumu yorumla. Aşağıda ilk 5 eşleşmenine-değeri, kimlik yüzdesi ve kapsama oranı var.Bana hangi eşleşmenin güvenilir olduğunu ve neden olduğunu açıkla,kesin işlev iddiası yapma, doğrulamam gereken adımları söyle.Tablo: [veri]

İki protein dizisini ikili hizala (pairwise) ve benzerlik yüzdesini bul.Biopython pairwise2 veya Bio.Align kullan; hizalamayı okunur biçimde yazdır.Kodu ver ve skorlama şemasını açıkla.

Zayıf prompt / Güçlü prompt

Zayıf: "Bu dizi hangi gen?"

Güçlü: "Elimde insan kaynaklı, 1.140 baz çiftlik bir DNA dizisi var (FASTA aşağıda). Bu diziyi kendim BLAST'ladım; en iyi eşleşme TP53, e-değeri 0.0, kimlik %99.8, kapsama %100. Bu sonucun neden güçlü bir kanıt olduğunu açıkla; yine de işlevini kesinleştirmeden önce hangi 2 doğrulamayı yapmam gerektiğini söyle."

Fark: Güçlü promptta gerçek veri (uzunluk, BLAST sonucu) modele sağlanmış; modelden "hatırlamasını" değil, sağladığınız kanıtı yorumlamasını istiyorsunuz. Zayıf promptta model uydurmaya zorlanır.

Üç mini vaka

Vaka 1 — Yanlış okuma çerçevesi: Bir öğrenci DNA dizisini proteine çevirdi ama baştan itibaren, doğru başlangıç kodonunu (ATG) bulmadan. Sonuçta anlamsız, erken duran bir protein çıktı. Model, üç okuma çerçevesini de deneyip ATG ile başlayan en uzun açık okuma çerçevesini (ORF) bulan kod yazınca doğru 380 amino asitlik protein ortaya çıktı.

Vaka 2 — E-değeri yanılgısı: Bir teknisyen, e-değeri 2.0 olan bir BLAST eşleşmesini "bulunmuş" sayıp rapora yazdı. Oysa 1'den büyük e-değeri, eşleşmenin büyük olasılıkla rastlantı olduğunu gösterir. Model bunu açıklayıp güvenilir eşik olarak genellikle e < 1e-5 kullanıldığını hatırlattı.

Vaka 3 — Kontaminasyon: Bir laboratuvarda bir bakteri dizisinin BLAST'ında en iyi eşleşme insan DNA'sı çıktı. Bu, örnek kontaminasyonunun (bulaşma) işaretiydi. Yapay zeka, "beklenmedik türde eşleşme kontaminasyon göstergesi olabilir" diyerek doğru şüpheyi uyandırdı; teknisyen örneği tekrarladı.

Karşılaştırma: yapay zekanın rolü

Görev

Yapay zeka

Araç/veri tabanı

İnsan

FASTA okuma, GC/uzunluk

Kod yazar

Çıktıyı kontrol eder

Çeviri, ORF bulma

Kod yazar

Biopython çalıştırır

Çerçeveyi doğrular

Dizi kimliği

Yorumlar

BLAST/NCBI bulur

Teyit eder

İşlev iddiası

Öneri sunar

UniProt kanıt verir

Karar verir

Sık yapılan hatalar

  • Modelden dizi kimliği "hatırlamasını" istemek: Model dizileri ezberlemez; BLAST kullanın.
  • E-değerini yanlış yorumlamak: Küçük iyi, büyük kötü; eşiği unutmayın.
  • Okuma çerçevesini kontrol etmemek: Yanlış çerçeve anlamsız protein üretir.
  • Kapsama oranını göz ardı etmek: Yüksek kimlik ama düşük kapsama, kısmi eşleşme demektir.
  • Kontaminasyonu atlamak: Beklenmedik tür eşleşmesi ciddi bir uyarıdır.
Dikkat: Bir dizinin "TP53'e %99 benzemesi", o dizinin TP53 işlevini taşıdığını kanıtlamaz; güçlü bir hipotezdir. İşlev, deneysel kanıt ve veri tabanı açıklamalarıyla desteklenmelidir. Yapay zekanın "bu bir tümör baskılayıcıdır" demesi tek başına yeterli değildir.

Çoklu dizi hizalaması ve filogeni temeli

İki dizi yerine onlarca diziyi birlikte hizalamaya çoklu dizi hizalaması (MSA) denir ve pek çok analizin temelidir: korunmuş bölgeleri (evrimde değişmeden kalan, dolayısıyla işlevsel olarak önemli kısımlar) bulmak, filogenetik ağaç kurmak, protein ailelerini tanımlamak. MAFFT, MUSCLE ve Clustal gibi araçlar bu işi yapar. Yapay zeka, bu araçları Python'dan (örneğin Biopython üzerinden) çağıran kodu yazar ve çıktıyı yorumlamanıza yardım eder; ama hizalamanın kendisini araç yapar, model "ezberden" değil.

Bir MSA'yı yorumlarken korunmuş sütunlara dikkat edin: tüm dizilerde aynı kalan bir amino asit, büyük olasılıkla proteinin işlevi için kritiktir (örneğin bir enzimin aktif bölgesi). Bu, bir mutasyonun neden zararlı olabileceğine dair güçlü bir ipucu verir. Ancak "korunmuş = önemli" bir hipotezdir; deneysel doğrulama ister.

MAFFT çıktısı olan çoklu hizalama dosyamı (aligned.fasta) Biopython ile oku.Her sütun için korunma oranını hesapla; %90'ın üzerinde korunmuşpozisyonları listele. Bu pozisyonların neden işlevsel önemtaşıyabileceğini açıkla, kesin işlev iddiası yapma.

Mutasyon ve varyant yorumlama tuzağı

Bir dizide bir harf değişikliği (varyant) gördüğünüzde, bunun "zararlı" olduğunu söylemek büyük bir sıçramadır. Çoğu varyant nötrdür (etkisizdir). Bir varyantın etkisini yorumlarken, yapay zekanın sözüne değil, özel varyant veri tabanlarına (ClinVar gibi) ve popülasyon frekansı verilerine (gnomAD gibi) bakmak gerekir. Model bir varyantın "patojenik" olduğunu iddia ederse, bunu bu kaynaklarla teyit etmeden asla klinik veya araştırma sonucuna yazmayın.

Doğrulama için temel veri tabanları

Dizi analizinde her iddiayı teyit edeceğiniz resmi kaynakları tanımak, yapay zekanın uydurmalarına karşı en güçlü kalkanınızdır. En sık kullanılanlar:

Veri tabanı

Ne için

Tipik teyit

NCBI GenBank / RefSeq

DNA/RNA dizileri, gen kayıtları

Dizi kimliği, uzunluk

UniProt

Protein dizileri ve işlevleri

İşlev, amino asit sayısı

Ensembl

Genom açıklaması, gen konumları

Gen-kromozom eşlemesi

ClinVar

Varyantların klinik anlamı

Patojenik/nötr kararı

gnomAD

Popülasyonda varyant frekansı

Nadir/yaygın varyant

Yapay zeka size bu tabanlardan hangisine bakmanız gerektiğini önerebilir; ama sorguyu siz yapar, sonucu siz okursunuz. "Model UniProt'ta böyle yazıyor dedi" bir teyit değildir; teyit, UniProt sayfasını kendinizin açmasıdır.

Özetle

Dizi analizi biyoinformatiğin kalbidir; FASTA, BLAST, hizalama ve çeviri temel işlemlerdir. Yapay zeka bu işlemlerin kodunu yazar ve sonuçlarını yorumlamanıza yardım eder, ama gerçek dizi kimliğini araçlar (BLAST) ve veri tabanları (NCBI, UniProt) sağlar. E-değeri, kapsama ve okuma çerçevesi gibi kavramları doğru anlamak, yanlış sonuçtan korunmanın anahtarıdır. İşlev iddiası her zaman bağımsız kanıt ister.

Uygulama görevi

Bir örnek DNA dizisi (veya NCBI'dan indirdiğiniz bir gen) alın. Yapay zekaya Biopython ile uzunluk ve GC oranını hesaplatın, ardından üç okuma çerçevesinde de çevirip en uzun ORF'yi bulduran kod yazdırın. Sonucu çalıştırın. Sonra bu diziyi kendiniz NCBI BLAST'ta aratın ve en iyi eşleşmenin e-değeri ile kapsama oranını modele yorumlatın. Modelin işlev iddiasını UniProt'ta teyit edin.

Kontrol listesi

  • [ ] Diziyi işlemeden önce uzunluk ve harf içeriğini kontrol ettim.
  • [ ] Çeviride doğru okuma çerçevesini kullandım.
  • [ ] BLAST'ı kendim çalıştırdım, modele "hatırlatmadım".
  • [ ] E-değeri ve kapsama oranını doğru yorumladım.
  • [ ] Beklenmedik tür eşleşmesini kontaminasyon açısından değerlendirdim.
  • [ ] İşlev iddiasını resmi veri tabanıyla teyit ettim.