Ünite 4 / 11

Protein Yapısı ve AlphaFold: Yapı Tahminini Okuma, Güven Skorları ve Doğrulama

Kazanimlar:

  • AlphaFold'un yaptığı işi, pLDDT ve PAE gibi güven skorlarını ve bir yapının 'tahmin' olduğunu kavrayıp yapay zekayla yapıyı doğru yorumlayabilme
  • Düşük güven skorlu (esnek/düzensiz) bölgeleri tanıyıp aşırı yorumdan kaçınma ve deneysel kanıtla karşılaştırabilme
  • Yapı tahminini bir hipotez olarak ele alma ve işlevsel iddiaları deneysel doğrulamaya bağlama disiplinini uygulayabilme

Bir proteinin ne yaptığını anlamak için çoğu zaman onun üç boyutlu katlanmış yapısını bilmek gerekir; çünkü işlev, yapıdan doğar. On yıllarca protein yapısını belirlemek deneysel olarak (X-ışını kristalografisi, kriyo-elektron mikroskopisi) aylar-yıllar alırdı. AlphaFold (DeepMind'in geliştirdiği, amino asit dizisinden protein yapısını tahmin eden yapay zeka sistemi) bunu dakikalara indirdi ve yüz milyonlarca proteinin tahmini yapısını halka açtı. Bu ünitede AlphaFold çıktısını nasıl okuyacağınızı, güven skorlarını nasıl yorumlayacağınızı ve bir LLM'i bu yorumlamada nasıl güvenli biçimde kullanacağınızı öğreneceksiniz.

Kritik ayrım: AlphaFold bir yapı tahmin aracıdır ve çıktısı bir tahmindir, deneysel gerçek değildir. LLM (ChatGPT gibi bir sohbet modeli) ise AlphaFold'un kendisi değildir; bir proteinin koordinatlarını "hatırlayıp" veremez. LLM'i, AlphaFold çıktısını yorumlamaya ve açıklamaya kullanın; yapının kendisini AlphaFold veri tabanından ya da aracından alın.

Temel kavramlar

  • Birincil yapı: Amino asit dizisi (proteinin harf zinciri).
  • İkincil/üçüncül yapı: Zincirin sarmal (alfa-heliks), yaprak (beta-tabaka) ve üç boyutlu katlanışı.
  • pLDDT: AlphaFold'un her amino asit için verdiği, 0-100 arası yerel güven skoru. 90+ çok yüksek, 70-90 iyi, 50-70 düşük, 50 altı çok düşük güven anlamına gelir. Düşük pLDDT bölgeleri genellikle "düzensiz" (belirli bir katlanışı olmayan) bölgelerdir.
  • PAE (Predicted Aligned Error): İki bölgenin birbirine göre konumundaki tahmini hata; alanların (domain) birbirine göre yerleşiminin ne kadar güvenilir olduğunu gösterir.
  • PDB: Deneysel protein yapılarının saklandığı veri tabanı ve dosya biçimi.

AlphaFold çıktısını okuma: adım adım

1. Doğru proteini ve diziyi seçin. UniProt (protein bilgisi veri tabanı) numarasıyla proteini sabitleyin; AlphaFold veri tabanında bu numarayla yapıyı bulun.

2. pLDDT haritasına bakın. Yapının hangi bölgeleri yüksek güvenle (mavi), hangileri düşük güvenle (turuncu/sarı) tahmin edilmiş, görün. Düşük güvenli bölgelerdeki yorumları temkinli yapın.

3. PAE grafiğini okuyun. Çok alanlı bir proteinde alanların birbirine göre yerleşimi güvenilir mi, PAE gösterir. Yüksek PAE, alanların göreli konumunun belirsiz olduğu anlamına gelir.

4. Deneysel yapıyla karşılaştırın. Varsa PDB'deki deneysel yapıyla örtüştürün. AlphaFold tahmini deneysele yakınsa güveniniz artar.

5. Varyant etkisini yorumlayın. Bir amino asit değişiminin yapıya etkisini yorumlarken, o bölgenin pLDDT'sini ve işlevsel önemini (aktif bölge, bağlanma cebi) birlikte değerlendirin.

İpucu: Düşük pLDDT her zaman "yanlış tahmin" demek değildir; çoğu zaman o bölgenin gerçekte düzensiz (intrinsically disordered) olduğunun işaretidir. Yani düşük güven, bazen doğru bir biyolojik gerçeği yansıtır. Bunu ayırt etmek için diziyi düzensizlik tahmin araçlarıyla da kontrol edin.

Üç mini vaka

Vaka 1 — Düşük güvenli bölgeyi aşırı yorumlama. Bir öğrenci, AlphaFold yapısında bir "ilmeğin" belirli bir cebe girdiğini iddia etti ve YZ bunu onayladı. Ancak öğrenci pLDDT'ye bakınca o ilmeğin skorunun 42 (çok düşük) olduğunu gördü; yani konumu güvenilmezdi. İddia geri çekildi. Ders: yorumdan önce her zaman yerel güven skoruna bakın.

Vaka 2 — Uydurma koordinat. Bir araştırmacı, LLM'e bir proteinin belirli bir amino asidinin 3B koordinatını sordu; LLM üç ondalıklı, ikna edici sayılar verdi. Araştırmacı bunları AlphaFold PDB dosyasındaki gerçek koordinatlarla karşılaştırınca tümüyle uydurma olduklarını gördü. LLM koordinat "hatırlayamaz"; koordinatlar dosyadan okunmalıdır.

Vaka 3 — Doğrulama kazandırdı. Bir doktora öğrencisi, bir varyantın (p.Gly12Val) proteinin aktif bölgesine yakın olup olmadığını merak etti. YZ, aktif bölge kalıntılarının UniProt'ta belirtildiğini hatırlattı; öğrenci UniProt'u açıp aktif bölgeyi buldu, sonra AlphaFold yapısında Gly12'nin bu bölgeye 8 angström mesafede olduğunu bir yapı görüntüleyici (PyMOL) ile ölçtü. Sayısal ölçüm, "yakın" iddiasını somutlaştırdı.

Örnek: pLDDT'yi bir yapı dosyasından okuma

# AlphaFold PDB dosyasında pLDDT, B-faktör sütununda saklanır.from Bio.PDB import PDBParserimport numpy as npyapi = PDBParser(QUIET=True).get_structure("AF", "AF-P04637-F1.pdb")plddt = [atom.bfactor for atom in yapi.get_atoms() if atom.name == "CA"]print("Ortalama pLDDT:", round(np.mean(plddt), 1))print("Dusuk guvenli (<70) kalinti orani (%):", round(100 * np.mean(np.array(plddt) < 70), 1))

Bu, yorum yapmadan önce yapının genel güvenilirliğini sayısal olarak görmenizi sağlar.

Dört kopyalanabilir şablon

1) Yapı yorumu (güven skoruyla):

Rolün: yapısal biyoloji asistanı. UniProt [numara] proteininin AlphaFoldyapısını yorumlamama yardım et. Şu soruları yanıtla ama koordinat/skor UYDURMA:hangi bölgeler yüksek/düşük pLDDT bekleriz, PAE neyi gösterir, deneysel yapı(PDB) var mı, nasıl karşılaştırırım? Değerleri ben dosyadan okuyacağım.

2) Varyant-yapı etkisi:

Şu varyantın protein yapısına olası etkisini yorumlamama yardım et: [p.XxxNYyy].Bu kalıntının bulunduğu bölgenin pLDDT'sine, işlevsel öneminden (aktif bölge,bağlanma cebi, disülfür köprüsü) ve UniProt açıklamalarına bakmam gerektiğiniadım adım söyle. Kesin "yapıyı bozar" iddiası yerine hangi kanıta bakacağımı ver.

3) pLDDT/PAE açıklama:

pLDDT ve PAE arasındaki farkı, bir varyant analizinde hangisine ne zamanbakmam gerektiğini örnekle açıkla. Tek alanlı ve çok alanlı protein durumlarınıayrı ayrı ele al.

4) Yapı karşılaştırma planı:

AlphaFold tahminini deneysel PDB yapısıyla karşılaştırmak istiyorum.RMSD (yapılar arası ortalama sapma) nasıl hesaplanır, hangi araçla (PyMOL,Biopython) yaparım, hangi eşik "iyi örtüşme" sayılır? Adım adım plan ver.

Zayıf prompt / Güçlü prompt

Zayıf: "Bu proteinin yapısını çiz ve p.Arg273His'in etkisini söyle."

Sorun: LLM yapı çizemez/koordinat uyduramaz; güven skoru dikkate alınmaz; kesin etki iddiası temelsiz olur.

Güçlü: "UniProt P04637 için AlphaFold yapısını kendim indirdim. p.Arg273His kalıntısının pLDDT'sine ve UniProt'taki işlevsel açıklamasına bakarak etkisini nasıl yorumlamam gerektiğini adım adım söyle; kesin iddia yerine hangi kanıta bakacağımı ver."

Neden güçlü: Yapı kaynaktan alınır, güven skoru merkeze konur, iddia kanıta bağlanır.

Soru

AlphaFold verir mi?

Nereden/nasıl teyit

3B katlanış tahmini

Evet

AlphaFold DB / dosya

Yerel güven

Evet (pLDDT)

B-faktör sütunu

Alanlar arası konum

Evet (PAE)

PAE grafiği

Deneysel gerçek yapı

Hayır

PDB (deneysel)

Varyantın kesin işlev etkisi

Hayır

İşlevsel çalışma + uzman

Sık yapılan hatalar

  • Güven skorunu atlamak. Düşük pLDDT bölgesindeki yorum güvenilmezdir.
  • Tahmini deneysel gerçek sanmak. AlphaFold çıktısı bir tahmindir; kritik kararlarda deneysel kanıt gerekir.
  • LLM'den koordinat istemek. Koordinatlar dosyadan okunur, ezberden alınmaz.
  • PAE'yi göz ardı etmek. Çok alanlı proteinlerde alanların göreli konumu belirsiz olabilir.
  • Düşük güveni hemen "hata" saymak. Bazen o bölge gerçekten düzensizdir.
Dikkat: AlphaFold yapıları "statik" bir görüntü sunar; proteinlerin gerçekte hareketli, birden çok konformasyona (biçime) girebilen moleküller olduğunu unutmayın. Tek bir yapı, dinamik davranışı tam yansıtmaz.

Derinlik: AlphaFold'un yapısal olarak sessiz kaldığı yerler

AlphaFold güçlüdür ama neyi yapamadığını bilmek, onu güvenli kullanmanın yarısıdır. Birincisi, standart AlphaFold tek bir proteini boşlukta katlar; ligandları, iyonları, kofaktörleri ve ilaç moleküllerini modellemez. Bir enzimin aktif bölgesindeki çinko iyonu ya da bir substrat, yapıda görünmez; bu yüzden "bu cep boş, işlevsiz" gibi bir yorum yanıltıcı olabilir. İkincisi, mutasyonun etkisini doğrudan modellemez: aynı diziye yakın iki varyantı verseniz de AlphaFold genellikle neredeyse aynı yapıyı üretir; "bu varyant yapıyı bozar" iddiasını AlphaFold'un iki tahminini karşılaştırarak kanıtlayamazsınız. Üçüncüsü, post-translasyonel modifikasyonları (fosforilasyon, glikozilasyon gibi) ve zar proteinlerinin zar içindeki gerçek ortamını hesaba katmaz.

Somut vaka: bir ekip, bir kinaz enziminde ATP bağlanma cebine yakın bir varyantın "cebi kapattığını" AlphaFold görüntüsüne bakarak iddia etti; yapay zeka da onayladı. Deneysel bir kristal yapı (PDB) açıldığında, o bölgede AlphaFold'un modellemediği bir kofaktörün cebi zaten şekillendirdiği görüldü — varyantın etkisi tümüyle farklı bir mekanizmadandı. İkinci vaka: bir araştırmacı iki alan arasındaki "ilmeğin" iki alanı birbirine bağladığını varsaydı; PAE haritası o iki alan arasında yüksek hata (belirsiz göreli konum) gösteriyordu, yani bağlantı iddiası temelsizdi. PAE'yi okumak, hatalı bir mekanizma hikâyesini önledi.

5) AlphaFold sınırları kontrol şablonu:

Şu yapısal iddiayı değerlendirmeden önce, AlphaFold'un bu soruda hangisınırlarının devreye girdiğini listele: [iddia].Özellikle ligand/iyon/kofaktör eksikliği, mutasyon modellenmemesi ve PAEbelirsizliği açısından hangi ek kanıta (deneysel yapı, işlevsel çalışma)ihtiyacım olduğunu söyle.

Özetle

  • AlphaFold, dizi'den yapı tahmin eden güçlü bir araçtır ama çıktısı bir tahmindir; güven skorlarıyla birlikte okunmalıdır.
  • pLDDT yerel güveni, PAE alanlar arası konum güvenini gösterir; yorumdan önce ikisine de bakın.
  • LLM koordinat ya da yapı "hatırlayamaz"; yapıyı AlphaFold/PDB'den alın, LLM'i yorumda kullanın.
  • Kritik kararlarda deneysel kanıt ve uzman muhakemesi vazgeçilmezdir.

Uygulama görevi

Bir proteinin (örneğin iyi çalışılmış bir tümör baskılayıcı) AlphaFold yapısını UniProt numarasıyla indirin. Yukarıdaki kod parçasıyla ortalama pLDDT'yi ve düşük güvenli kalıntı oranını hesaplayın. Ardından bir varyant seçip 2. şablonla YZ'den yorum planı isteyin; o kalıntının pLDDT'sini ve UniProt işlevsel açıklamasını bizzat kontrol edin. İddianızı sayısal bir güven değerine bağlayın.

Kontrol listesi

  • [ ] Yapıyı UniProt numarasıyla AlphaFold/PDB'den aldım.
  • [ ] pLDDT ve PAE'yi yorumdan önce okudum.
  • [ ] LLM'den koordinat/skor uydurmasını istemedim.
  • [ ] Varyant yorumunu ilgili kalıntının güven skoruna bağladım.
  • [ ] Varsa deneysel yapıyla karşılaştırdım.
  • [ ] Kritik kararı uzman muhakemesi ve deneysel kanıtla destekledim.