المكاسب:
- القدرة على التمييز بين السمات المحسوبة حتمية والسمات المقدرة إحصائيا وتحديد مستويات الثقة
- القدرة على تقييم المنطقة التي يمكن الاعتماد على النموذج فيها باستخدام مفهوم مجال التطبيق
- القدرة على فهم أنه يجب على المرء استخدام تنبؤات السمات لتصنيف المرشحين واتخاذ القرار النهائي من خلال التجربة.
قبل تصنيع الجزيء، غالبًا ما نسأل: "هل هو قابل للذوبان في الماء؟ ما مدى حمضيته؟ هل يعبر غشاء الخلية؟ هل يمكن اعتباره عقارًا مرشحًا؟" إن توقع الإجابات على هذه الأسئلة قبل التجربة يوفر الكثير من الوقت. يعد الذكاء الاصطناعي ونماذجه المتخصصة (خاصة QSAR — العلاقة الكمية بين البنية والنشاط، أي النموذج الإحصائي الذي يتنبأ بخاصية من الواصفات الهيكلية للجزيء) قوية في هذه التنبؤات. لكن هذه التوقعات هي تنبؤات بالاحتمالات، وليست قياسات. في هذه الوحدة، سوف نتعرف على التنبؤ بالميزات ونقاط قوتها والمفهوم الأكثر أهمية، وهي منطقة قابلية التطبيق (المنطقة التي يمكن الاعتماد على النموذج فيها).
ما هي الميزات المتوقعة؟
- logP: معامل تقسيم الزيت/الماء للجزيء؛ يظهر محبة الدهون (حب الدهون). حاسم في امتصاص الدواء.
- الذوبان (logS): مدى ذوبانه في الماء.
- pKa: الحموضة/القلوية؛ الرقم الهيدروجيني الذي تتأين عنده المجموعة.
- TPSA: مساحة السطح القطبية الطوبولوجية؛ يتم استخدامه في تقدير النفاذية.
- ليبينسكي "قاعدة الخمسة": العتبات العملية للوزن الجزيئي، logP، عدد المانحين/المتقبلين لـ H-bond لمرشحي الأدوية عن طريق الفم.
يتم حساب بعض هذه القيم بشكل حتمي (مثل أرقام TPSA وH-bond) باستخدام أدوات مثل RDKit؛ بعضها عبارة عن تقديرات إحصائية (سجلات النشاط البيولوجي). معرفة هذا التمييز يحدد مدى ثقتك.
نصيحة: ميز ما إذا كانت الميزة "محسوبة" (معتمدة على قواعد، قابلة للتكرار) أو "متوقعة" (من النموذج، غير مؤكدة). يتمتع بثقة عالية في الحسابات، وثقة حذرة في التنبؤات، ويتحقق من التنبؤات عن طريق التجربة.
نطاق التطبيق: المفهوم الأكثر أهمية
يعمل نموذج QSAR بشكل جيد على الجزيئات المشابهة للجزيئات التي تم تدريبه عليها. إذا أعطيت جزيئًا مختلفًا تمامًا عن بيانات التدريب (على سبيل المثال، هيكل عظمي كبير جدًا وغير عادي)، فسيظل النموذج ينتج رقمًا، لكن هذا الرقم لن يكون موثوقًا به. وهذا ما يسمى "أن تكون خارج نطاق التطبيق." النموذج يعطي دائما إجابة؛ إنها وظيفتك معرفة ما إذا كانت الإجابة موثوقة أم لا.
يكون الأمر أكثر خطورة عندما يعطي نموذج اللغة قيمة سمة: فهو ينتج الرقم كقيمة "محتملة المظهر"، بدون حساب أساسي. لذلك، إن أمكن، احصل على قيم الميزات من أداة حتمية (RDKit) أو نموذج QSAR الذي يعطي عدم اليقين، وليس من نموذج اللغة.
خطوة بخطوة: التنبؤ بالميزات الآمنة
- التحقق من الجزيء: تحليل الابتسامات باستخدام RDKit (الوحدة 2).
- حساب تلك الحتمية: MA، logP (محسوب)، TPSA، أرقام H-bond من RDKit.
- وضع علامة على التنبؤات بشكل منفصل: احتفظ بتنبؤات النموذج مثل السجل والنشاط وما إلى ذلك باستخدام علامة "التنبؤ".
- تحقق من مجال التطبيق: هل يبدو الجزيء مثل بيانات التدريب؟ هل هي كبيرة جدًا/غير عادية؟
- الاستخدام للتصنيف، وليس القرار: استخدم التنبؤات لتصنيف المرشحين؛ الخيار النهائي هو التجربة.
- بالقرب من التجربة: التحقق من الخصائص الحرجة (الذوبان، pKa) عن طريق القياس.
أربعة قوالب قابلة للنسخ
1) الميزات الحتمية مع RDKit:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("المانحة للرابطة H:"، rdMolDescriptors.CalcNumHBD(mol))print("متقبل الرابطة H:"، rdMolDescriptors.CalcNumHBA(mol))
2) تقييم قاعدة ليبنسكي:
الجزيء (SMILES): [SMILES] المهمة: تقييم الامتثال لقاعدة Lipinski الخمسة مع قيم MA وlogP وHBD وHBA التي سيتم حسابها من RDKit. ضع علامة على كل معيار على حدة على أنه ناجح/راسب. القاعدة: لا تقم بتكوين الأرقام؛ سأحصل عليه من RDKit، تعليقك.
3) تقدير الميزة + طلب عدم اليقين:
الجزيء (SMILES): [SMILES]المهمة: تقديم تقدير نوعي لقابلية الذوبان في الماء (logS) (عالية/متوسطة/منخفضة) وشرح الأساس المنطقي مع السمات الهيكلية. لا تعطي رقمًا محددًا؛ اذكر أن هذا تنبؤ ويجب تأكيده بالتجربة. تحذير إذا كان للجزيء بنية غير عادية (خطر قابلية التطبيق).
4) ترتيب المرشحين (تحديد الأولويات حسب التنبؤ):
فيما يلي جزيئات مكونة من 5 جزيئات. المهمة: رتبها من حيث قابلية الذوبان في الماء (الأكثر ذوبانًا إلى الأقل) بناءً على السمات الهيكلية (عدد المجموعات القطبية، الحلقات، محبة الدهون). اكتب مبررًا لكل قرار تصنيف. ملاحظة: هذا فرز أولي؛ سيتم الاختيار النهائي عن طريق القياس.
موجه ضعيف / موجه قوي
ضعيف:
ما هي قابلية ذوبان هذا الجزيء؟
يقوم الذكاء الاصطناعي بتكوين رقم غير موجود ضمن الحساب (على سبيل المثال "12 مجم/مل")؛ إنه يمنح الثقة ولكنه قد يكون مخطئًا.
قوي:
الجزيء (SMILES): [SMILES].المهمة: 1) سأعطي logP وTPSA وHBD/HBA ليتم حسابه باستخدام RDKit: [القيم].2) بناءً على هذه القيم، قم بتفسير ما إذا كانت الدقة عالية/متوسطة/منخفضة.3) إعطاء الرقم الدقيق؛ اذكر أنه تخمين وأن التجارب مطلوبة.
الفرق: أخذنا القيم الحتمية من السيارة وجعلنا الذكاء الاصطناعي يفسرها فقط؛ لقد طلبنا صراحة عدم اليقين والحاجة إلى التجريب.
أنواع الميزات ومستوى الثقة
ميزة
كيفية الحصول على
الثقة
ملاحظة
الوزن الجزيئي
RDKit (حتمية)
عالية جدا
قطع من الصيغة
تبسا، HBD/HBA
RDKit (حتمية)
عالية
على أساس القاعدة
سجل P (محسوب)
نموذج آر دي كيت
متوسطة عالية
قد تحيد عن التجريبية
سجل (القرار)
تقدير QSAR
متوسطة
يعتمد على مجال التطبيق
pKa
نموذج خاص
متوسطة
يقع في هيكل معقد
النشاط البيولوجي
قصر/مل
متغير
تأكد من الاختبار والتحقق
حالات صغيرة
الحالة 1 - عدد القرارات المجهزة. سأل أحد الطلاب الذكاء الاصطناعي عن قابلية ذوبان المركب؛ حصل على الإجابة "25 ملجم/مل" وقام بإعداد التصميم التجريبي وفقًا لذلك. وكانت القيمة الفعلية في القياس ~2 ملغم/مل، أي بفارق 10 أضعاف. لقد قام الذكاء الاصطناعي بتكوين الرقم. الدرس المستفاد: لا تأخذ خصائص مثل الدقة كأرقام من نموذج اللغة؛ التنبؤ النوعي + القياس.
الحالة 2 - خارج نطاق التطبيق. قال نموذج QSAR إن "النشاط مرتفع" بالنسبة لجزيء كبير كان مختلفًا تمامًا عن مجموعة التدريب. لاحظ المستخدم أن الجزيء لا يشبه بيانات التدريب واعتبر التنبؤ غير موثوق؛ أعطت التجربة نشاطًا منخفضًا حقًا. الدرس المستفاد: النموذج يستجيب دائمًا؛ إذا كان خارج النطاق، فإن الجواب لا قيمة له.
الحالة 3 - الاستخدام الصحيح لليبينسكي. في أحد الجزيئات المرشحة، قام الذكاء الاصطناعي بتقييم Lipinski بقيم من RDKit: MA 512 (> 500، الحد الحدودي)، logP 4.8 (مفيد)، HBD 2، HBA 7. فسر المستخدم بشكل صحيح "يبقى معيار واحد ولكن القاعدة ليست مطلقة" ولم يقم بإزالة الجزيء تمامًا. الدرس المستفاد: القواعد هي مبادئ توجيهية، وليست عتبات؛ تفسير مع السياق.
الأخطاء الشائعة
- الحصول على عدد الميزات من نموذج اللغة. القيم التي لم يتم حسابها ملفقة؛ استخدام أداة حتمية أو نموذج مع عدم اليقين.
- إهمال مجال التطبيق. يقوم النموذج بإنشاء أرقام لكل جزيء؛ لا يمكن الاعتماد عليها خارج الميدان.
- باعتبار القياس المقدر. logS هو تقدير. إنه ليس بديلاً عن القرار التجريبي.
- باعتبار ليبينسكي القاعدة المطلقة. لا يتم استبعاد المرشح الموجود على الحدود تلقائيًا؛ العديد من الأدوية تنتهك القاعدة.
- الخلط بين "المحسوب" و"المقدر". يتم حساب TPSA (موثوق)، ويتم تقدير النشاط (غير مؤكد).
تحذير: تعتبر تنبؤات الميزات رائعة لتصنيف المرشحين وتحديد أولوياتهم؛ ولكن ليس لتحديد القرار وحده. "النموذج المذكور قابل للذوبان" هو فرضية؛ "لقد قمت بقياسه، فهو يذوب" هي نتيجة.
باختصار
- يمكن التنبؤ بالخصائص الجزيئية قبل التجربة وتوفير الكثير من الوقت.
- يتم حساب بعض الميزات بشكل حتمي (MA، TPSA، HBD/HBA)، وبعضها عبارة عن تقديرات إحصائية (logS، النشاط).
- مجال التطبيق هو المفهوم الأكثر أهمية: النموذج يجيب دائمًا، لكنه غير موثوق به خارج المجال.
- احصل على عدد الميزات من RDKit أو نموذج الغموض، وليس نموذج اللغة.
- استخدم التنبؤات لتصنيف المرشحين؛ اتخاذ القرار النهائي عن طريق التجربة.
مهمة التطبيق
حدد خمسة جزيئات (مثل سلسلة الأدوية). حساب MA، logP، TPSA، HBD، HBA لكل منها باستخدام RDKit وتقييم Lipinski. بشكل منفصل، اطلب من الذكاء الاصطناعي الحصول على تقدير نوعي (وليس رقمًا) لقابلية ذوبان كل جزيء ومجال تحذير قابلية التطبيق. اجمع القيم الحتمية وتوقعات الذكاء الاصطناعي في جدول. ما هو الجزيء الذي أعطى الشكل الأكثر شبهًا بالمخدرات؟ أين هو أعلى مستوى من عدم اليقين؟
قائمة مرجعية
- [ ] أميز بين الخصائص الحتمية المحسوبة والمتنبأ بها.
- [ ] أحصل على قيم الخاصية من RDKit/model، وليس من نموذج اللغة.
- [ ] ألاحظ وجود جزيئات خارج نطاق التطبيق.
- [ ] أستخدم ليبينسكي كدليل، وليس كقاعدة مطلقة.
- [ ] أستخدم التنبؤات للتصنيف واتخاذ القرار للتجريب.
- [ ] لدي خطة للتحقق من الميزات الهامة عن طريق القياس.