Kazanimlar:
- Deterministik hesaplanan özellikler ile istatistiksel tahmin edilen özellikleri ayırt edip güven düzeylerini belirleyebilme
- Uygulanabilirlik alanı kavramını kullanarak modelin güvenilir olduğu bölgeyi değerlendirebilme
- Özellik tahminlerini adayları sıralamak için kullanıp nihai kararı deneyle vermesi gerektiğini kavrayabilme
Bir molekülü sentezlemeden önce çoğu zaman sorarız: "Suda çözünür mü? Ne kadar asidik? Hücre zarından geçer mi? İlaç adayı olarak makul mü?" Bu soruların cevaplarını deneyden önce tahmin etmek büyük zaman kazandırır. YZ ve ona bağlı özel modeller (özellikle QSAR — Nicel Yapı-Etki İlişkisi, yani molekülün yapısal tanımlayıcılarından bir özelliği tahmin eden istatistiksel model) bu tahminlerde güçlüdür. Ama bu tahminler bir olasılık öngörüsüdür, ölçüm değildir. Bu ünitede özellik tahminini, güçlü yanlarını ve en kritik kavramı olan uygulanabilirlik alanı (modelin güvenilir olduğu bölge) ile öğreneceğiz.
Hangi özellikler tahmin edilir?
- logP: Molekülün yağ/su dağılım katsayısı; lipofilikliği (yağı sevme) gösterir. İlaç emiliminde kritik.
- Çözünürlük (logS): Suda ne kadar çözündüğü.
- pKa: Asitlik/bazlık; bir grubun hangi pH'ta iyonlaştığı.
- TPSA: Topolojik polar yüzey alanı; geçirgenlik tahmininde kullanılır.
- Lipinski "beşli kural": Ağızdan alınan ilaç adaylarının molekül ağırlığı, logP, H-bağı verici/alıcı sayısı için pratik eşikler.
Bu değerlerin bir kısmı RDKit gibi araçlarla deterministik hesaplanır (örneğin TPSA, H-bağı sayıları); bir kısmı ise istatistiksel tahmindir (logS, biyolojik aktivite). Bu ayrımı bilmek, ne kadar güveneceğinizi belirler.
İpucu: Bir özelliğin "hesaplanan" mı (kural tabanlı, tekrarlanabilir) yoksa "tahmin edilen" mi (modelden, belirsizlikli) olduğunu ayırt edin. Hesaplananlara yüksek, tahmin edilenlere temkinli güvenin ve tahminleri deneyle doğrulayın.
Uygulanabilirlik alanı: en önemli kavram
Bir QSAR modeli, eğitildiği moleküllere benzeyen moleküllerde iyi çalışır. Eğitim verisinden çok farklı bir molekül verirseniz (örneğin çok büyük, alışılmadık bir iskelet), model yine bir sayı üretir ama bu sayı güvenilmezdir. Buna "uygulanabilirlik alanı dışında olmak" denir. Model her zaman bir cevap verir; cevabın güvenilir olup olmadığını söylemek sizin işinizdir.
Dil modeli bir özellik değeri verdiğinde durum daha da riskli: sayıyı "olası görünen" bir değer olarak üretir, altında hesap yoktur. Bu yüzden özellik değerlerini mümkünse deterministik araçtan (RDKit) veya belirsizlik veren bir QSAR modelinden alın, dil modelinden değil.
Adım adım: güvenli özellik tahmini
- Molekülü doğrula: SMILES'i RDKit ile ayrıştır (2. ünite).
- Deterministik olanları hesapla: MA, logP (hesaplanmış), TPSA, H-bağı sayıları RDKit'ten.
- Tahminleri ayrı işaretle: logS, aktivite gibi model tahminlerini "tahmin" etiketiyle tut.
- Uygulanabilirlik alanını kontrol et: Molekül eğitim verisine benziyor mu? Aşırı büyük/olağandışı mı?
- Sıralama için kullan, karar için değil: Tahminleri adayları sıralamak için kullanın; nihai seçim deneyle.
- Deneyle kapat: Kritik özellikleri (çözünürlük, pKa) ölçümle doğrulayın.
Dört kopyalanabilir şablon
1) RDKit ile deterministik özellikler:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (hesaplanan):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bağı verici:", rdMolDescriptors.CalcNumHBD(mol))print("H-bağı alıcı:", rdMolDescriptors.CalcNumHBA(mol))
2) Lipinski kuralı değerlendirmesi:
Molekül (SMILES): [SMILES]Görev: RDKit'ten hesaplanacak MA, logP, HBD, HBA değerleriyleLipinski beşli kuralına uygunluğu değerlendir.Her kriteri ayrı ayrı geç/kaldı olarak işaretle.Kural: Sen sayıları UYDURMA; ben RDKit'ten alacağım, sen yorumla.
3) Özellik tahmini + belirsizlik talebi:
Molekül (SMILES): [SMILES]Görev: Suda çözünürlük (logS) hakkında niteliksel bir tahmin ver(yüksek/orta/düşük) ve gerekçesini yapısal özelliklerle açıkla.Kesin bir sayı verme; bunun bir TAHMİN olduğunu ve deneyledoğrulanması gerektiğini belirt. Molekülün olağandışı bir yapısıvarsa (uygulanabilirlik alanı riski) uyar.
4) Aday sıralama (tahminle önceliklendirme):
Aşağıda 5 molekülün SMILES'i var.Görev: Yapısal özelliklere (polar grup sayısı, halka, lipofillik)dayanarak suda çözünürlük açısından bunları sırala (en çözünürden aza).Her sıralama kararının gerekçesini yaz.Not: Bu bir ÖN sıralamadır; nihai seçim ölçümle yapılacak.
Zayıf prompt / Güçlü prompt
Zayıf:
Bu molekülün çözünürlüğü kaç?
YZ altında hesap olmayan bir sayı (örn. "12 mg/mL") uydurur; güven verir ama yanlış olabilir.
Güçlü:
Molekül (SMILES): [SMILES].Görev: 1) RDKit ile hesaplanacak logP, TPSA, HBD/HBA'yı ben vereceğim: [değerler].2) Bu değerlere dayanarak çözünürlüğün yüksek/orta/düşük olmasını yorumla.3) Kesin sayı verme; tahmin olduğunu ve deney gerektiğini belirt.
Fark: deterministik değerleri araçtan alıp YZ'ye sadece yorum yaptırdık; belirsizliği ve deney ihtiyacını açıkça istedik.
Özellik türleri ve güven düzeyi
Özellik
Nasıl elde edilir
Güven
Not
Molekül ağırlığı
RDKit (deterministik)
Çok yüksek
Formülden kesin
TPSA, HBD/HBA
RDKit (deterministik)
Yüksek
Kural tabanlı
logP (hesaplanan)
RDKit modeli
Orta-yüksek
Deneyselden sapabilir
logS (çözünürlük)
QSAR tahmini
Orta
Uygulanabilirlik alanına bağlı
pKa
Özel model
Orta
Karmaşık yapıda düşer
Biyolojik aktivite
QSAR/ML
Değişken
Mutlaka deneyle doğrula
Mini vakalar
Vaka 1 — Uydurulan çözünürlük sayısı. Bir öğrenci YZ'ye bir bileşiğin çözünürlüğünü sordu; "25 mg/mL" cevabını aldı ve deney tasarımını buna göre kurdu. Ölçümde gerçek değer ~2 mg/mL çıktı, 10 kat fark. YZ sayıyı uydurmuştu. Ders: çözünürlük gibi özellikleri sayı olarak dil modelinden almayın; niteliksel tahmin + ölçüm.
Vaka 2 — Uygulanabilirlik alanı dışında. Bir QSAR modeli, eğitim setinden çok farklı büyük bir makro-molekül için "aktivite yüksek" dedi. Kullanıcı molekülün eğitim verisine benzemediğini fark edip tahmini güvenilmez saydı; deney gerçekten düşük aktivite verdi. Ders: model her zaman cevap verir; alan dışıysa cevap değersizdir.
Vaka 3 — Lipinski doğru kullanımı. Bir aday molekülde YZ, RDKit'ten alınan değerlerle Lipinski'yi değerlendirdi: MA 512 (>500, sınırda kaldı), logP 4,8 (uygun), HBD 2, HBA 7. Kullanıcı "bir kriter kaldı ama kural mutlak değil" yorumunu doğru yaptı ve molekülü tümden elemedi. Ders: kurallar eşik değil rehberdir; bağlamla yorumlayın.
Sık yapılan hatalar
- Özellik sayısını dil modelinden almak. Altında hesap olmayan değerler uydurmadır; deterministik araç veya belirsizlikli model kullanın.
- Uygulanabilirlik alanını görmezden gelmek. Model her molekül için sayı üretir; alan dışında güvenilmez.
- Tahmini ölçüm sanmak. logS bir tahmindir; deneysel çözünürlük yerine geçmez.
- Lipinski'yi mutlak kural saymak. Sınırda kalan aday otomatik elenmez; birçok ilaç kuralı ihlal eder.
- "Hesaplanan" ile "tahmin edilen"i karıştırmak. TPSA hesaplanır (güvenilir), aktivite tahmin edilir (belirsiz).
Dikkat: Özellik tahminleri adayları sıralamak ve önceliklendirmek için mükemmeldir; ama bir kararı tek başına belirlemek için değil. "Model çözünür dedi" bir hipotezdir; "ölçtüm, çözünür" bir sonuçtur.
Özetle
- Molekül özellikleri deneyden önce tahmin edilebilir ve büyük zaman kazandırır.
- Bazı özellikler deterministik hesaplanır (MA, TPSA, HBD/HBA), bazıları istatistiksel tahmindir (logS, aktivite).
- Uygulanabilirlik alanı en kritik kavramdır: model her zaman cevap verir, ama alan dışında güvenilmez.
- Özellik sayılarını RDKit veya belirsizlik veren modelden alın, dil modelinden değil.
- Tahminleri adayları sıralamak için kullanın; nihai kararı deneyle verin.
Uygulama görevi
Beş molekül seçin (örn. bir ilaç serisi). Her biri için RDKit ile MA, logP, TPSA, HBD, HBA hesaplayın ve Lipinski'yi değerlendirin. Ayrı olarak YZ'den her molekülün çözünürlüğü hakkında niteliksel tahmin (sayı değil) ve uygulanabilirlik alanı uyarısı isteyin. Deterministik değerler ile YZ tahminlerini bir tabloda toplayın. Hangi molekül en ilaç-benzeri profili verdi? Nerede belirsizlik en yüksek?
Kontrol listesi
- [ ] Deterministik hesaplanan ile tahmin edilen özellikleri ayırt ediyorum.
- [ ] Özellik değerlerini RDKit/model'den alıyorum, dil modelinden değil.
- [ ] Uygulanabilirlik alanı dışı molekülleri fark ediyorum.
- [ ] Lipinski'yi mutlak kural değil rehber olarak kullanıyorum.
- [ ] Tahminleri sıralama için, kararı deney için kullanıyorum.
- [ ] Kritik özellikleri ölçümle doğrulama planım var.