واحد 7 / 11

پیش‌بینی خواص مولکولی و QSAR: وضوح، pKa و محدودیت‌های مدل

سود:

  • توانایی تمایز بین ویژگی های محاسبه شده قطعی و ویژگی های آماری برآورد شده و تعیین سطوح اطمینان
  • توانایی ارزیابی منطقه ای که مدل در آن قابل اعتماد است با استفاده از مفهوم دامنه کاربردی
  • توانایی درک اینکه باید از پیش بینی های صفت برای رتبه بندی نامزدها استفاده کرد و از طریق آزمایش تصمیم نهایی را گرفت.

قبل از سنتز یک مولکول، اغلب می‌پرسیم: "آیا محلول در آب است؟ چقدر اسیدی است؟ آیا از غشای سلولی عبور می‌کند؟ آیا به عنوان کاندیدای دارویی قابل قبول است؟" پیش بینی پاسخ به این سوالات قبل از آزمایش باعث صرفه جویی زیادی در زمان می شود. هوش مصنوعی و مدل‌های تخصصی آن (به‌ویژه QSAR - رابطه کمی ساختار-فعالیت، یعنی مدل آماری که یک ویژگی را از توصیف‌گرهای ساختاری مولکول پیش‌بینی می‌کند) در این پیش‌بینی‌ها قدرتمند هستند. اما این پیش‌بینی‌ها پیش‌بینی احتمال هستند، نه اندازه‌گیری. در این بخش، با پیش بینی ویژگی، نقاط قوت آن و حیاتی ترین مفهوم، منطقه کاربردی (منطقه ای که مدل قابل اعتماد است) آشنا می شویم.

چه ویژگی هایی پیش بینی می شود؟

  • logP: ضریب تقسیم روغن/آب مولکول. چربی دوستی (چربی دوستی) را نشان می دهد. در جذب دارو بسیار مهم است.
  • حلالیت (logS): چقدر در آب محلول است.
  • pKa: اسیدیته/قلیایی؛ pH که در آن یک گروه یونیزه می شود.
  • TPSA: مساحت سطح قطبی توپولوژیکی. در تخمین نفوذپذیری استفاده می شود.
  • "قانون پنج" لیپینسکی: آستانه های عملی برای وزن مولکولی، logP، تعداد اهداکنندگان/پذیرنده های پیوند H برای کاندیدای داروهای خوراکی.

برخی از این مقادیر به طور قطعی محاسبه می شوند (به عنوان مثال TPSA، اعداد پیوند H) با ابزارهایی مانند RDKit. برخی از آنها برآوردهای آماری هستند (logS، فعالیت بیولوژیکی). دانستن این تمایز تعیین می کند که چقدر اعتماد دارید.

نکته: مشخص کنید که آیا یک ویژگی "محاسبه شده" (مبتنی بر قانون، قابل تکرار) است یا "پیش بینی" (از مدل، نامشخص). در محاسبات اطمینان بالایی داشته باشید، در پیش‌بینی‌ها اطمینان محتاطانه داشته باشید و پیش‌بینی‌ها را با آزمایش تأیید کنید.

دامنه کاربرد: مهمترین مفهوم

یک مدل QSAR روی مولکول‌هایی که شبیه مولکول‌هایی هستند که روی آن‌ها آموزش دیده است، به خوبی کار می‌کند. اگر مولکولی را بدهید که بسیار متفاوت از داده های آموزشی است (مثلاً یک اسکلت بسیار بزرگ و غیرعادی)، مدل همچنان یک عدد تولید می کند، اما آن عدد غیر قابل اعتماد خواهد بود. به این می گویند «خارج از محدوده کاربرد بودن». مدل همیشه جواب می دهد. این وظیفه شماست که بگویید آیا پاسخ قابل اعتماد است یا خیر.

زمانی که مدل زبان یک مقدار مشخصه می‌دهد، حتی خطرناک‌تر است: عدد را به‌عنوان یک مقدار "محتمل ظاهری" تولید می‌کند، بدون محاسبه اساسی. بنابراین در صورت امکان، مقادیر ویژگی را از یک ابزار قطعی (RDKit) یا یک مدل QSAR که عدم قطعیت می دهد، دریافت کنید، نه از مدل زبان.

گام به گام: پیش بینی ویژگی ایمن

  1. بررسی مولکول: SMILES را با RDKit (واحد 2) تجزیه کنید.
  2. اعداد قطعی را محاسبه کنید: MA، logP (محاسبه شده)، TPSA، اعداد پیوند H از RDKit.
  3. پیش‌بینی‌ها را جداگانه علامت‌گذاری کنید: پیش‌بینی‌های مدل مانند logS، فعالیت و غیره را با برچسب «پیش‌بینی» نگه دارید.
  4. دامنه کاربرد را بررسی کنید: آیا مولکول شبیه داده های آموزشی است؟ آیا بسیار بزرگ/غیر معمول است؟
  5. استفاده برای رتبه بندی، نه تصمیم گیری: از پیش بینی ها برای رتبه بندی نامزدها استفاده کنید. انتخاب نهایی آزمایش است.
  6. نزدیک به آزمایش: بررسی خواص بحرانی (حلالیت، pKa) با اندازه گیری.

چهار قالب قابل کپی

1) ویژگی های قطعی با RDKit:

از rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))printated("log,P round(Descriptors.MolLogP(mol),2))print("TPSA:"، round(Descriptors.TPSA(mol),1))print("H-bond donator:"، rdMolDescriptors.CalcNumHBD(mol))print("پذیرنده پیوند H:"، rdMolDescriptors.CalcNum)H

2) ارزیابی قانون لیپینسکی:

مولکول (SMILES): [SMILES] وظیفه: انطباق با قانون پنج لیپینسکی را با مقادیر MA، logP، HBD، HBA که از RDKit محاسبه می شود، ارزیابی کنید. هر معیار را جداگانه به عنوان قبولی/شکست علامت گذاری کنید. قانون: اعداد را نسازید. من آن را از RDKit می گیرم، شما نظر دهید.

3) برآورد ویژگی + درخواست عدم قطعیت:

مولکول (SMILES): [SMILES]وظیفه: یک تخمین کیفی از حلالیت آب (logS) (بالا/متوسط/کم) ارائه دهید و دلیل منطقی را با ویژگی‌های ساختاری توضیح دهید. عدد دقیقی ندهید؛ بیان کنید که این یک پیش بینی است و باید با آزمایش تایید شود. اگر مولکول دارای ساختار غیرعادی است (خطر کاربردپذیری) هشدار دهید.

4) رتبه بندی نامزدها (اولویت بندی بر اساس پیش بینی):

در زیر SMILES از 5 مولکول آورده شده است. وظیفه: آنها را بر اساس ویژگی های ساختاری (تعداد گروه های قطبی، حلقه ها، چربی دوستی) از نظر حلالیت در آب رتبه بندی کنید. توجه: این یک مرتب سازی اولیه است. انتخاب نهایی با اندازه گیری انجام می شود.

اعلان ضعیف / اعلان قوی

ضعیف:

حلالیت این مولکول چقدر است؟

AI عددی را تشکیل می دهد که در محاسبه وجود ندارد (به عنوان مثال "12 میلی گرم در میلی لیتر"). اعتماد به نفس می دهد اما ممکن است اشتباه باشد.

قوی:

مولکول (SMILES): [SMILES]. وظیفه: 1) من logP، TPSA، HBD/HBA را می‌دهم تا با RDKit محاسبه شود: [مقادیر]. 2) بر اساس این مقادیر، بالا/متوسط/پایین بودن وضوح را تفسیر کنید. 3) عدد دقیق را می‌دهم. بیان کنید که حدس است و آزمایش لازم است.

تفاوت: ما مقادیر قطعی را از وسیله نقلیه گرفتیم و هوش مصنوعی را مجبور کردیم فقط آنها را تفسیر کند. ما به صراحت خواستار عدم قطعیت و نیاز به آزمایش شدیم.

انواع ویژگی ها و سطح اعتماد

ویژگی

چگونه به دست آوریم

اعتماد

توجه داشته باشید

وزن مولکولی

RDKit (قطری)

بسیار بالا

از فرمول برش دهید

TPSA، HBD/HBA

RDKit (قطری)

بالا

مبتنی بر قانون

logP (محاسبه شده)

مدل RDKit

متوسط به بالا

ممکن است از تجربی منحرف شود

logS (رزولوشن)

تخمین QSAR

متوسط

بستگی به حوزه کاربرد دارد

pKa

مدل خاص

متوسط

در یک ساختار پیچیده قرار می گیرد

فعالیت بیولوژیکی

QSAR/ML

متغیر

حتما تست کنید و تایید کنید

موارد کوچک

مورد 1 - تعداد قطعنامه های نصب شده. دانشجویی از هوش مصنوعی در مورد حلالیت یک ترکیب پرسید. او پاسخ "25 میلی گرم در میلی لیتر" را دریافت کرد و طرح آزمایشی را بر اساس آن تنظیم کرد. مقدار واقعی در اندازه گیری ~ 2 میلی گرم در میلی لیتر بود، یک تفاوت 10 برابری. هوش مصنوعی این عدد را ساخته بود. درس: ویژگی هایی مانند وضوح را به عنوان اعداد از مدل زبان در نظر نگیرید. پیش بینی کیفی + اندازه گیری

مورد 2 - خارج از محدوده کاربرد. یک مدل QSAR گفت: «فعالیت زیاد است» برای یک ماکرومولکول بزرگ که بسیار متفاوت از مجموعه آموزشی بود. کاربر متوجه شد که مولکول شبیه داده های آموزشی نیست و پیش بینی را غیر قابل اعتماد می دانست. آزمایش واقعاً فعالیت کمی داشت. درس: مدل همیشه پاسخ می دهد. اگر خارج از محدوده باشد، جواب بی ارزش است.

مورد 3 - استفاده صحیح از Lipinski. در یک مولکول کاندید، هوش مصنوعی Lipinski را با مقادیر RDKit ارزیابی کرد: MA 512 (> 500، مرزی)، logP 4.8 (مطلوب)، HBD 2، HBA 7. کاربر به درستی تفسیر کرد "یک معیار باقی می ماند اما قانون مطلق نیست" و مولکول را به طور کلی حذف نکرد. درس: قوانین دستورالعمل هستند، نه آستانه. با زمینه تفسیر کنید.

اشتباهات رایج

  • دریافت تعداد ویژگی از مدل زبان. مقادیری که محاسبه نمی شوند ساخته می شوند. از ابزار یا مدل قطعی با عدم قطعیت استفاده کنید.
  • نادیده گرفتن زمینه کاربرد. مدل برای هر مولکول اعداد تولید می کند. خارج از میدان غیر قابل اعتماد
  • در نظر گرفتن یک اندازه گیری تخمینی logS یک تخمین است. جایگزینی برای وضوح تجربی نیست.
  • لیپینسکی را قاعده مطلق در نظر می گیریم. نامزدی که در مرز است به طور خودکار حذف نمی شود. بسیاری از داروها این قانون را نقض می کنند.
  • اشتباه گرفتن "محاسبه شده" با "تخمین زده". TPSA محاسبه می شود (قابل اعتماد)، فعالیت تخمین زده می شود (نامشخص).
احتیاط: پیش بینی ویژگی ها برای رتبه بندی و اولویت بندی نامزدها عالی است. اما نه برای تعیین یک تصمیم به تنهایی. "مدل گفت محلول" یک فرضیه است. "من اندازه گرفتم، حل می شود" یک نتیجه است.

به طور خلاصه

  • خواص مولکولی را می توان قبل از آزمایش پیش بینی کرد و باعث صرفه جویی در زمان می شود.
  • برخی از ویژگی ها به صورت قطعی محاسبه می شوند (MA، TPSA، HBD/HBA)، برخی برآوردهای آماری هستند (logS، فعالیت).
  • حوزه کاربردی حیاتی ترین مفهوم است: مدل همیشه پاسخ می دهد، اما در خارج از حوزه غیرقابل اعتماد است.
  • تعداد ویژگی ها را از RDKit یا مدل ابهام دریافت کنید، نه مدل زبان.
  • از پیش بینی ها برای رتبه بندی نامزدها استفاده کنید. با آزمایش تصمیم نهایی را بگیرید.

وظیفه کاربردی

پنج مولکول (به عنوان مثال یک سری دارو) را انتخاب کنید. MA، logP، TPSA، HBD، HBA را برای هر کدام با RDKit محاسبه کنید و Lipinski را ارزیابی کنید. به طور جداگانه، از هوش مصنوعی یک تخمین کیفی (نه عددی) از حلالیت هر مولکول و یک زمینه هشدار کاربردی بخواهید. مقادیر قطعی و پیش بینی های هوش مصنوعی را در یک جدول جمع آوری کنید. کدام مولکول بیشتر مشخصات دارویی را نشان داد؟ کجا عدم اطمینان بالاترین میزان است؟

چک لیست

  • [ ] من بین خواص محاسبه شده و پیش بینی قطعی تمایز قائل می شوم.
  • [ ] من مقادیر ویژگی را از RDKit/model دریافت می کنم، نه از مدل زبان.
  • [ ] من متوجه مولکول هایی خارج از محدوده کاربرد هستم.
  • [ ] من از Lipinski به عنوان یک راهنما استفاده می کنم، نه یک قانون مطلق.
  • [ ] من از پیش بینی برای رتبه بندی و تصمیم گیری برای آزمایش استفاده می کنم.
  • [ ] من برنامه ای برای تأیید ویژگی های حیاتی با اندازه گیری دارم.