יחידה 7 / 11

חיזוי תכונה מולקולרית ו-QSAR: רזולוציה, pKa וגבולות מודל

רווחים:

  • יכולת להבחין בין מאפיינים המחושבים באופן דטרמיניסטי לבין מאפיינים מוערכים סטטיסטית ולקבוע רמות ביטחון
  • יכולת להעריך את האזור בו המודל אמין על ידי שימוש בקונספט של תחום הישימות
  • יכולת להבין שצריך להשתמש בתחזיות תכונות כדי לדרג מועמדים ולקבל את ההחלטה הסופית באמצעות ניסויים.

לפני סינתזה של מולקולה, אנו שואלים לעתים קרובות: "האם היא מסיסה במים? עד כמה היא חומצית? האם היא חוצה את קרום התא? האם היא סבירה כמועמדת לתרופה?" חיזוי התשובות לשאלות אלו לפני הניסוי חוסך זמן רב. AI והמודלים המיוחדים שלו (במיוחד QSAR - Quantitative Structure-Activity Relationship, כלומר מודל סטטיסטי המחזה תכונה מהמתארים המבניים של המולקולה) הם בעלי עוצמה בתחזיות אלו. אבל התחזיות האלה הן תחזיות של הסתברות, לא מדידות. ביחידה זו נלמד על חיזוי תכונה, נקודות החוזק שלה והמושג הקריטי ביותר, אזור היישום (האזור בו המודל אמין).

אילו תכונות צפויות?

  • logP: מקדם חלוקת שמן/מים של המולקולה; זה מראה ליפופיליות (אהבת שומן). קריטי בספיגת תרופות.
  • מסיסות (logS): עד כמה הוא מסיס במים.
  • pKa: חומציות/בסיסיות; ה-pH שבו קבוצה מיוננת.
  • TPSA: שטח פנים קוטבי טופולוגי; הוא משמש להערכת חדירות.
  • ליפינסקי "כלל החמישה": סף מעשי למשקל מולקולרי, logP, מספר תורמי/מקבלי H-bond של מועמדים לתרופות דרך הפה.

חלק מהערכים הללו מחושבים באופן דטרמיניסטי (למשל TPSA, מספרי H-bond) עם כלים כגון RDKit; חלקם הם אומדנים סטטיסטיים (logS, פעילות ביולוגית). הכרת ההבחנה הזו קובעת כמה אתה סומך.

טיפ: הבדיל אם תכונה היא "מחושבת" (מבוססת כללים, ניתנת לחזרה) או "חזויה" (ממודל, לא בטוח). יש אמון גבוה בחישובים, אמון זהיר בתחזיות, ואמת תחזיות באמצעות ניסוי.

היקף היישום: המושג החשוב ביותר

מודל QSAR עובד היטב על מולקולות הדומות למולקולות שהוא אומן עליהן. אם אתה נותן מולקולה שהיא מאוד שונה מנתוני האימון (לדוגמה, שלד גדול מאוד ויוצא דופן), המודל עדיין יפיק מספר, אבל המספר הזה יהיה לא אמין. זה נקרא "להיות מחוץ לתחום התחולה". הדגם תמיד נותן מענה; תפקידך לדעת אם התשובה אמינה או לא.

זה אפילו מסוכן יותר כאשר מודל השפה נותן ערך תכונה: הוא מייצר את המספר כערך "סביר למראה", ללא חישוב בסיסי. אז אם אפשר, קבל ערכי תכונה מכלי דטרמיניסטי (RDKit) או מודל QSAR שנותן אי ודאות, לא ממודל השפה.

צעד אחר צעד: חיזוי תכונה בטוחה

  1. אמת מולקולה: נתח SMILES עם RDKit (יחידה 2).
  2. חשבו דטרמיניסטים: MA, logP (מחושב), TPSA, מספרי H-bond מ-RDKit.
  3. סמן תחזיות בנפרד: שמור תחזיות מודל כגון logS, פעילות וכו' עם תגית "חיזוי".
  4. בדוק את תחום הישימות: האם המולקולה נראית כמו נתוני האימון? האם הוא גדול במיוחד/יוצא דופן?
  5. השתמש לדירוג, לא להחלטה: השתמש בתחזיות כדי לדרג מועמדים; הבחירה האולטימטיבית היא ניסוי.
  6. קרוב לניסוי: ודא תכונות קריטיות (מסיסות, pKa) על ידי מדידה.

ארבע תבניות הניתנות להעתקה

1) תכונות דטרמיניסטיות עם RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (מחושב):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdMolDescriptors.CalcNumHBA(mol)

2) הערכת כלל ליפינסקי:

מולקולה (SMILES): [SMILES]משימה: הערכת תאימות לכלל Lipinski של חמישה עם ערכי MA, logP, HBD, HBA שיחושבו מ-RDKit. סמן כל קריטריון בנפרד כעבור/נכשל. כלל: אל תמציא את המספרים; אני אקבל את זה מ-RDKit, תגיב.

3) אומדן תכונה + בקשת אי ודאות:

מולקולה (SMILES): [SMILES]משימה: תן הערכה איכותית של מסיסות המים (logS) (גבוה/בינונית/נמוכה) והסביר את הרציונל עם תכונות מבניות. אל תיתן מספר מדויק; ציינו שזו תחזית ויש לאשר אותה בניסוי. התריעו אם למולקולה יש מבנה חריג (סיכון ישימות).

4) דירוג מועמדים (תעדוף לפי תחזית):

להלן SMILES של 5 מולקולות. משימה: דרג אותם במונחים של מסיסות מים (הכי מסיסים לפחות) בהתבסס על מאפיינים מבניים (מספר קבוצות קוטביות, טבעות, ליפופיליות). כתוב נימוק לכל החלטת דירוג. הערה: זהו מיון ראשוני; הבחירה הסופית תיעשה על ידי מדידה.

הנחיה חלשה / הנחיה חזקה

חלש:

מהי המסיסות של מולקולה זו?

ה-AI מרכיב מספר שלא קיים בחישוב (למשל "12 מ"ג/מ"ל"); זה נותן ביטחון אבל יכול להיות שגוי.

חזק:

מולקולה (SMILES): [SMILES].משימה: 1) אני אתן את ה-logP, TPSA, HBD/HBA לחישוב עם RDKit: [ערכים].2) על סמך ערכים אלו, לפרש האם הרזולוציה גבוהה/בינונית/נמוכה.3) מתן המספר המדויק; ציינו שזהו ניחוש ונדרשים ניסויים.

ההבדל: לקחנו את הערכים הדטרמיניסטיים מהרכב וגרמנו ל-AI רק לפרש אותם; ביקשנו במפורש חוסר ודאות וצורך בניסוי.

סוגי תכונות ורמת אמון

תכונה

איך להשיג

אמון

הערה

משקל מולקולרי

RDKit (דטרמיניסטי)

גבוה מאוד

חותכים מהנוסחה

TPSA, HBD/HBA

RDKit (דטרמיניסטי)

גבוה

מבוסס על כללים

logP (מחושב)

דגם RDKit

בינוני-גבוה

עשוי לסטות מהניסוי

logS (רזולוציה)

אומדן QSAR

בינוני

תלוי בתחום היישום

pKa

דגם מיוחד

בינוני

זה נופל במבנה מורכב

פעילות ביולוגית

QSAR/ML

משתנה

הקפד לבדוק ולאמת

מיני תיקים

מקרה 1 - מספר הרזולוציות שהותאמו. סטודנט שאל את ה-AI על מסיסות התרכובת; הוא קיבל את התשובה "25 מ"ג/מ"ל" והגדיר את התכנון הניסוי בהתאם. הערך בפועל במדידה היה ~2 מ"ג/מ"ל, הבדל של פי 10. ה-AI הרכיב את המספר. לקח: אל תיקח מאפיינים כמו רזולוציה כמספרים ממודל השפה; חיזוי איכותני + מדידה.

מקרה 2 - מחוץ לתחום התחולה. מודל QSAR אמר ש"הפעילות גבוהה" עבור מקרומולקולה גדולה שהייתה שונה מאוד ממערך האימונים. המשתמש שם לב שהמולקולה לא דומה לנתוני האימון וראה שהתחזית לא אמינה; הניסוי נתן פעילות ממש נמוכה. לקח: המודל תמיד מגיב; אם זה מחוץ לתחום, התשובה חסרת ערך.

מקרה 3 - שימוש נכון בליפינסקי. על מולקולה מועמדת אחת, AI העריך את Lipinski עם ערכים מ-RDKit: MA 512 (>500, גבולי), logP 4.8 (חיובי), HBD 2, HBA 7. המשתמש פירש נכון "נשאר קריטריון אחד אבל הכלל אינו מוחלט" ולא ביטל את המולקולה לחלוטין. שיעור: כללים הם קווים מנחים, לא סף; פרש עם הקשר.

טעויות נפוצות

  • קבלת ספירת התכונות ממודל השפה. ערכים שאינם מחושבים מפוברקים; השתמש בכלי או מודל דטרמיניסטי עם אי ודאות.
  • התעלמות מתחום הישימות. המודל יוצר מספרים עבור כל מולקולה; לא אמין מחוץ לתחום.
  • בהתחשב במדידה משוערת. logS הוא אומדן; זה לא תחליף לרזולוציה ניסיונית.
  • בהתחשב בליפינסקי הכלל המוחלט. המועמד שנמצא על הגבול אינו מודח אוטומטית; סמים רבים מפרים את הכלל.
  • מבלבל בין "מחושב" ל"משוער". TPSA מחושב (אמין), פעילות מוערכת (לא ודאית).
זהירות: תחזיות תכונה נהדרות לדירוג ולתעדוף מועמדים; אך לא לקבוע החלטה לבד. "המודל אמר מסיס" היא השערה; "מדדתי, זה מתמוסס" זו תוצאה.

לסיכום

  • ניתן לחזות תכונות מולקולריות לפני הניסוי וחוסך זמן רב.
  • חלק מהמאפיינים מחושבים באופן דטרמיניסטי (MA, TPSA, HBD/HBA), חלקם אומדנים סטטיסטיים (logS, activity).
  • תחום הישימות הוא המושג הקריטי ביותר: המודל תמיד עונה, אך אינו אמין מחוץ לתחום.
  • קבל את ספירת התכונות מ-RDKit או ממודל העמימות, לא ממודל השפה.
  • השתמש בתחזיות כדי לדרג מועמדים; קבל את ההחלטה הסופית על ידי ניסוי.

משימת יישום

בחר חמש מולקולות (למשל סדרת תרופות). חשב MA, logP, TPSA, HBD, HBA עבור כל אחד עם RDKit והעריך את Lipinski. בנפרד, בקש מה-AI הערכה איכותית (לא מספר) של המסיסות של כל מולקולה ואזהרת תחום ישימות. אסוף ערכים דטרמיניסטיים ותחזיות AI בטבלה. איזו מולקולה נתנה את הפרופיל הכי דומה לתרופה? איפה חוסר הוודאות הכי גבוה?

רשימת בדיקה

  • [ ] אני מבחין בין מאפיינים מחושבים דטרמיניסטיים וחזויים.
  • [ ] אני מקבל את ערכי המאפיינים מה-RDKit/מודל, לא ממודל השפה.
  • [ ] אני מבחין במולקולות מחוץ לתחום היישום.
  • [ ] אני משתמש בליפינסקי כמדריך, לא ככלל מוחלט.
  • [ ] אני משתמש בתחזיות לדירוג והחלטה לניסוי.
  • [ ] יש לי תוכנית לאמת תכונות קריטיות על ידי מדידה.