Keuntungan:
- Kemampuan untuk membedakan antara fitur yang dihitung secara deterministik dan fitur yang diperkirakan secara statistik serta menentukan tingkat kepercayaan
- Kemampuan untuk mengevaluasi wilayah di mana model dapat diandalkan dengan menggunakan konsep domain penerapan
- Kemampuan untuk memahami bahwa seseorang harus menggunakan prediksi sifat untuk menentukan peringkat kandidat dan membuat keputusan akhir melalui eksperimen.
Sebelum mensintesis suatu molekul, kita sering bertanya: "Apakah molekul tersebut larut dalam air? Seberapa asamkah molekul tersebut? Apakah molekul tersebut dapat menembus membran sel? Apakah masuk akal sebagai kandidat obat?" Memprediksi jawaban atas pertanyaan-pertanyaan ini sebelum eksperimen menghemat banyak waktu. AI dan model khususnya (terutama QSAR — Hubungan Struktur-Aktivitas Kuantitatif, yaitu model statistik yang memprediksi properti dari deskriptor struktural molekul) sangat berguna dalam prediksi ini. Namun prediksi ini hanyalah prediksi probabilitas, bukan pengukuran. Pada unit ini, kita akan mempelajari tentang prediksi fitur, kelebihannya dan konsep paling penting, zona penerapan (wilayah di mana model dapat diandalkan).
Fitur apa saja yang diprediksi?
- logP: Koefisien partisi minyak/air suatu molekul; Ini menunjukkan lipofilisitas (menyukai lemak). Penting dalam penyerapan obat.
- Kelarutan (logS): Seberapa larutnya dalam air.
- pKa: Keasaman/kebasaan; PH di mana suatu gugus terionisasi.
- TPSA: Luas permukaan kutub topologi; Ini digunakan dalam estimasi permeabilitas.
- Lipinski “aturan lima”: Ambang batas praktis untuk berat molekul, logP, jumlah donor/akseptor ikatan H dari kandidat obat oral.
Beberapa dari nilai ini dihitung secara deterministik (misalnya TPSA, angka ikatan-H) dengan alat seperti RDKit; Beberapa di antaranya merupakan perkiraan statistik (logS, aktivitas biologis). Mengetahui perbedaan ini menentukan seberapa besar Anda percaya.
Tip: Bedakan apakah suatu fitur “dihitung” (berbasis aturan, dapat diulang) atau “diprediksi” (dari model, tidak pasti). Memiliki keyakinan yang tinggi terhadap perhitungan, keyakinan yang hati-hati terhadap prediksi, dan memverifikasi prediksi melalui eksperimen.
Lingkup penerapan: konsep yang paling penting
Model QSAR bekerja dengan baik pada molekul yang mirip dengan molekul yang dilatihnya. Jika Anda memberikan molekul yang sangat berbeda dari data pelatihan (misalnya, kerangka yang sangat besar dan tidak biasa), model akan tetap menghasilkan angka, namun angka tersebut tidak dapat diandalkan. Hal ini disebut "berada di luar cakupan penerapan". Model selalu memberikan jawaban; Tugas Anda adalah mengetahui apakah jawabannya dapat diandalkan atau tidak.
Lebih berisiko lagi bila model bahasa memberikan nilai atribut: model tersebut menghasilkan angka sebagai nilai yang "tampaknya mungkin", tanpa perhitungan mendasar. Jadi jika memungkinkan, dapatkan nilai fitur dari alat deterministik (RDKit) atau model QSAR yang memberikan ketidakpastian, bukan dari model bahasa.
Langkah demi langkah: prediksi fitur aman
- Verifikasi molekul: Parsing SMILES dengan RDKit (unit 2).
- Hitung bilangan deterministik: MA, logP (dihitung), TPSA, bilangan ikatan-H dari RDKit.
- Tandai prediksi secara terpisah: Simpan prediksi model seperti logS, aktivitas, dll. dengan tag "prediksi".
- Periksa domain penerapannya: Apakah molekulnya terlihat seperti data pelatihan? Apakah ukurannya sangat besar/tidak biasa?
- Gunakan untuk menentukan peringkat, bukan untuk mengambil keputusan: Gunakan prediksi untuk menentukan peringkat kandidat; Pilihan terakhir adalah eksperimen.
- Eksperimen terdekat: Verifikasi sifat kritis (kelarutan, pKa) dengan pengukuran.
Empat templat yang dapat disalin
1) Fitur deterministik dengan RDKit:
dari rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (dihitung):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donor ikatan H:", rdMolDescriptors.CalcNumHBD(mol))print("Akseptor ikatan H:", rdMolDescriptors.CalcNumHBA(mol))
2) Evaluasi aturan Lipinski:
Molekul (SMILES): [SMILES]Tugas: Mengevaluasi kepatuhan terhadap aturan lima Lipinski dengan nilai MA, logP, HBD, HBA yang akan dihitung dari RDKit. Tandai setiap kriteria secara terpisah sebagai lulus/gagal. Aturan: JANGAN mengarang angka; Saya akan mendapatkannya dari RDKit, komentar Anda.
3) Estimasi fitur + permintaan ketidakpastian:
Molekul (SMILES): [SMILES]Tugas: Memberikan perkiraan kualitatif kelarutan dalam air (logS) (tinggi/sedang/rendah) dan menjelaskan alasannya dengan fitur struktural. Jangan berikan angka pastinya; Nyatakan bahwa ini adalah PREDIKSI dan perlu dikonfirmasi dengan eksperimen. Peringatkan jika molekul memiliki struktur yang tidak biasa (risiko penerapan).
4) Peringkat kandidat (prioritas berdasarkan prediksi):
Di bawah ini adalah SMILE dari 5 molekul. Tugas: Urutkan berdasarkan kelarutan dalam air (yang paling larut hingga yang paling sedikit) berdasarkan fitur struktural (jumlah gugus polar, cincin, lipofilisitas). Tuliskan justifikasi untuk setiap keputusan pemeringkatan. Catatan: Ini adalah pengurutan AWAL; Seleksi akhir akan dilakukan melalui pengukuran.
Perintah lemah / Perintah kuat
Lemah:
Berapa kelarutan molekul ini?
AI membuat angka yang tidak ada dalam perhitungan (misalnya "12 mg/mL"); Ini memberi keyakinan tetapi mungkin salah.
Kuat:
Molekul (SMILES): [SMILES].Tugas: 1) Saya akan memberikan logP, TPSA, HBD/HBA untuk dihitung dengan RDKit: [nilai].2) Berdasarkan nilai-nilai ini, tafsirkan apakah resolusinya tinggi/sedang/rendah.3) Memberikan angka pastinya; Nyatakan bahwa ini hanyalah tebakan dan diperlukan eksperimen.
Perbedaannya: kami mengambil nilai deterministik dari kendaraan dan membuat AI hanya menafsirkannya; Kami secara eksplisit meminta ketidakpastian dan perlunya eksperimen.
Jenis fitur dan tingkat kepercayaan
fitur
Bagaimana cara mendapatkan
kepercayaan
catatan
berat molekul
RDKit (deterministik)
sangat tinggi
Potong dari rumusnya
TPSA, HBD/HBA
RDKit (deterministik)
tinggi
berdasarkan aturan
logP (dihitung)
model RDKit
sedang-tinggi
Mungkin menyimpang dari eksperimental
logS (resolusi)
perkiraan QSAR
sedang
Tergantung pada area penerapannya
pKa
model khusus
sedang
Itu berada dalam struktur yang kompleks
aktivitas biologis
QSAR/ML
Variabel
Pastikan untuk menguji dan memverifikasi
kasus kecil
Kasus 1 — Jumlah resolusi yang dipasang. Seorang siswa bertanya kepada AI tentang kelarutan suatu senyawa; Dia menerima jawaban "25 mg/mL" dan menyiapkan desain eksperimen yang sesuai. Nilai sebenarnya dalam pengukuran adalah ~2 mg/mL, perbedaan 10 kali lipat. AI telah membuat nomornya. Pelajaran: jangan menganggap properti seperti resolusi sebagai angka dari model bahasa; prediksi kualitatif + pengukuran.
Kasus 2 — Di luar cakupan penerapan. Model QSAR mengatakan "aktivitasnya tinggi" untuk makromolekul besar yang sangat berbeda dari set pelatihan. Pengguna memperhatikan bahwa molekul tersebut tidak menyerupai data pelatihan dan menganggap prediksi tersebut tidak dapat diandalkan; Eksperimen tersebut memberikan aktivitas yang sangat rendah. Pelajaran: model selalu merespons; Jika di luar jangkauan, jawabannya tidak ada gunanya.
Kasus 3 — Penggunaan Lipinski yang benar. Pada satu kandidat molekul, AI mengevaluasi Lipinski dengan nilai dari RDKit: MA 512 (>500, garis batas), logP 4.8 (menguntungkan), HBD 2, HBA 7. Pengguna dengan benar menafsirkan "satu kriteria tetap ada tetapi aturannya tidak mutlak" dan tidak menghilangkan molekul tersebut sama sekali. Pelajaran: peraturan adalah pedoman, bukan ambang batas; Tafsirkan dengan konteks.
Kesalahan umum
- Mendapatkan jumlah fitur dari model bahasa. Nilai-nilai yang tidak diperhitungkan adalah dibuat-buat; Gunakan alat atau model deterministik dengan ketidakpastian.
- Mengabaikan bidang penerapan. Model tersebut menghasilkan angka untuk setiap molekul; tidak dapat diandalkan di luar lapangan.
- Mempertimbangkan perkiraan pengukuran. logS adalah perkiraan; Ini bukan pengganti resolusi eksperimental.
- Mengingat Lipinski sebagai aturan mutlak. Calon yang berada di perbatasan tidak serta merta tersingkir; Banyak obat yang melanggar aturan.
- Membingungkan “dihitung” dengan “diperkirakan.” TPSA dihitung (dapat diandalkan), aktivitas diperkirakan (tidak pasti).
Perhatian: Prediksi fitur sangat bagus untuk menentukan peringkat dan memprioritaskan kandidat; namun tidak untuk menentukan suatu keputusan sendirian. "Model tersebut dikatakan dapat dipecahkan" adalah sebuah hipotesis; “Saya ukur, larut” adalah hasilnya.
Singkatnya
- Sifat molekul dapat diprediksi sebelum percobaan dan menghemat banyak waktu.
- Beberapa fitur dihitung secara deterministik (MA, TPSA, HBD/HBA), ada pula yang merupakan perkiraan statistik (logS, aktivitas).
- Domain penerapan adalah konsep yang paling penting: model selalu menjawab, namun tidak dapat diandalkan di luar domain.
- Dapatkan jumlah fitur dari RDKit atau model ambiguitas, bukan model bahasa.
- Gunakan prediksi untuk menentukan peringkat kandidat; Buat keputusan akhir dengan bereksperimen.
Tugas aplikasi
Pilih lima molekul (misalnya rangkaian obat). Hitung MA, logP, TPSA, HBD, HBA untuk masing-masing dengan RDKit dan evaluasi Lipinski. Secara terpisah, tanyakan kepada AI perkiraan kualitatif (bukan angka) kelarutan setiap molekul dan bidang peringatan penerapan. Kumpulkan nilai deterministik dan prediksi AI dalam sebuah tabel. Molekul manakah yang memberikan profil paling mirip obat? Di manakah ketidakpastian tertinggi?
daftar periksa
- [ ] Saya membedakan antara properti perhitungan deterministik dan properti prediksi.
- [ ] Saya mendapatkan nilai properti dari RDKit/model, bukan model bahasa.
- [ ] Saya memperhatikan molekul di luar cakupan penerapannya.
- [ ] Saya menggunakan Lipinski sebagai panduan, bukan aturan mutlak.
- [ ] Saya menggunakan prediksi untuk pemeringkatan dan keputusan untuk eksperimen.
- [ ] Saya punya rencana untuk memverifikasi fitur penting dengan pengukuran.