سود:
- توانایی تمایز بین ویژگی های محاسبه شده قطعی و ویژگی های آماری برآورد شده و تعیین سطوح اطمینان
- توانایی ارزیابی منطقه ای که مدل در آن قابل اعتماد است با استفاده از مفهوم دامنه کاربردی
- توانایی درک اینکه باید از پیش بینی های صفت برای رتبه بندی نامزدها استفاده کرد و از طریق آزمایش تصمیم نهایی را گرفت.
قبل از سنتز یک مولکول، اغلب میپرسیم: "آیا محلول در آب است؟ چقدر اسیدی است؟ آیا از غشای سلولی عبور میکند؟ آیا به عنوان کاندیدای دارویی قابل قبول است؟" پیش بینی پاسخ به این سوالات قبل از آزمایش باعث صرفه جویی زیادی در زمان می شود. هوش مصنوعی و مدلهای تخصصی آن (بهویژه QSAR - رابطه کمی ساختار-فعالیت، یعنی مدل آماری که یک ویژگی را از توصیفگرهای ساختاری مولکول پیشبینی میکند) در این پیشبینیها قدرتمند هستند. اما این پیشبینیها پیشبینی احتمال هستند، نه اندازهگیری. در این بخش، با پیش بینی ویژگی، نقاط قوت آن و حیاتی ترین مفهوم، منطقه کاربردی (منطقه ای که مدل قابل اعتماد است) آشنا می شویم.
چه ویژگی هایی پیش بینی می شود؟
- logP: ضریب تقسیم روغن/آب مولکول. چربی دوستی (چربی دوستی) را نشان می دهد. در جذب دارو بسیار مهم است.
- حلالیت (logS): چقدر در آب محلول است.
- pKa: اسیدیته/قلیایی؛ pH که در آن یک گروه یونیزه می شود.
- TPSA: مساحت سطح قطبی توپولوژیکی. در تخمین نفوذپذیری استفاده می شود.
- "قانون پنج" لیپینسکی: آستانه های عملی برای وزن مولکولی، logP، تعداد اهداکنندگان/پذیرنده های پیوند H برای کاندیدای داروهای خوراکی.
برخی از این مقادیر به طور قطعی محاسبه می شوند (به عنوان مثال TPSA، اعداد پیوند H) با ابزارهایی مانند RDKit. برخی از آنها برآوردهای آماری هستند (logS، فعالیت بیولوژیکی). دانستن این تمایز تعیین می کند که چقدر اعتماد دارید.
نکته: مشخص کنید که آیا یک ویژگی "محاسبه شده" (مبتنی بر قانون، قابل تکرار) است یا "پیش بینی" (از مدل، نامشخص). در محاسبات اطمینان بالایی داشته باشید، در پیشبینیها اطمینان محتاطانه داشته باشید و پیشبینیها را با آزمایش تأیید کنید.
دامنه کاربرد: مهمترین مفهوم
یک مدل QSAR روی مولکولهایی که شبیه مولکولهایی هستند که روی آنها آموزش دیده است، به خوبی کار میکند. اگر مولکولی را بدهید که بسیار متفاوت از داده های آموزشی است (مثلاً یک اسکلت بسیار بزرگ و غیرعادی)، مدل همچنان یک عدد تولید می کند، اما آن عدد غیر قابل اعتماد خواهد بود. به این می گویند «خارج از محدوده کاربرد بودن». مدل همیشه جواب می دهد. این وظیفه شماست که بگویید آیا پاسخ قابل اعتماد است یا خیر.
زمانی که مدل زبان یک مقدار مشخصه میدهد، حتی خطرناکتر است: عدد را بهعنوان یک مقدار "محتمل ظاهری" تولید میکند، بدون محاسبه اساسی. بنابراین در صورت امکان، مقادیر ویژگی را از یک ابزار قطعی (RDKit) یا یک مدل QSAR که عدم قطعیت می دهد، دریافت کنید، نه از مدل زبان.
گام به گام: پیش بینی ویژگی ایمن
- بررسی مولکول: SMILES را با RDKit (واحد 2) تجزیه کنید.
- اعداد قطعی را محاسبه کنید: MA، logP (محاسبه شده)، TPSA، اعداد پیوند H از RDKit.
- پیشبینیها را جداگانه علامتگذاری کنید: پیشبینیهای مدل مانند logS، فعالیت و غیره را با برچسب «پیشبینی» نگه دارید.
- دامنه کاربرد را بررسی کنید: آیا مولکول شبیه داده های آموزشی است؟ آیا بسیار بزرگ/غیر معمول است؟
- استفاده برای رتبه بندی، نه تصمیم گیری: از پیش بینی ها برای رتبه بندی نامزدها استفاده کنید. انتخاب نهایی آزمایش است.
- نزدیک به آزمایش: بررسی خواص بحرانی (حلالیت، pKa) با اندازه گیری.
چهار قالب قابل کپی
1) ویژگی های قطعی با RDKit:
از rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))printated("log,P round(Descriptors.MolLogP(mol),2))print("TPSA:"، round(Descriptors.TPSA(mol),1))print("H-bond donator:"، rdMolDescriptors.CalcNumHBD(mol))print("پذیرنده پیوند H:"، rdMolDescriptors.CalcNum)H
2) ارزیابی قانون لیپینسکی:
مولکول (SMILES): [SMILES] وظیفه: انطباق با قانون پنج لیپینسکی را با مقادیر MA، logP، HBD، HBA که از RDKit محاسبه می شود، ارزیابی کنید. هر معیار را جداگانه به عنوان قبولی/شکست علامت گذاری کنید. قانون: اعداد را نسازید. من آن را از RDKit می گیرم، شما نظر دهید.
3) برآورد ویژگی + درخواست عدم قطعیت:
مولکول (SMILES): [SMILES]وظیفه: یک تخمین کیفی از حلالیت آب (logS) (بالا/متوسط/کم) ارائه دهید و دلیل منطقی را با ویژگیهای ساختاری توضیح دهید. عدد دقیقی ندهید؛ بیان کنید که این یک پیش بینی است و باید با آزمایش تایید شود. اگر مولکول دارای ساختار غیرعادی است (خطر کاربردپذیری) هشدار دهید.
4) رتبه بندی نامزدها (اولویت بندی بر اساس پیش بینی):
در زیر SMILES از 5 مولکول آورده شده است. وظیفه: آنها را بر اساس ویژگی های ساختاری (تعداد گروه های قطبی، حلقه ها، چربی دوستی) از نظر حلالیت در آب رتبه بندی کنید. توجه: این یک مرتب سازی اولیه است. انتخاب نهایی با اندازه گیری انجام می شود.
اعلان ضعیف / اعلان قوی
ضعیف:
حلالیت این مولکول چقدر است؟
AI عددی را تشکیل می دهد که در محاسبه وجود ندارد (به عنوان مثال "12 میلی گرم در میلی لیتر"). اعتماد به نفس می دهد اما ممکن است اشتباه باشد.
قوی:
مولکول (SMILES): [SMILES]. وظیفه: 1) من logP، TPSA، HBD/HBA را میدهم تا با RDKit محاسبه شود: [مقادیر]. 2) بر اساس این مقادیر، بالا/متوسط/پایین بودن وضوح را تفسیر کنید. 3) عدد دقیق را میدهم. بیان کنید که حدس است و آزمایش لازم است.
تفاوت: ما مقادیر قطعی را از وسیله نقلیه گرفتیم و هوش مصنوعی را مجبور کردیم فقط آنها را تفسیر کند. ما به صراحت خواستار عدم قطعیت و نیاز به آزمایش شدیم.
انواع ویژگی ها و سطح اعتماد
ویژگی
چگونه به دست آوریم
اعتماد
توجه داشته باشید
وزن مولکولی
RDKit (قطری)
بسیار بالا
از فرمول برش دهید
TPSA، HBD/HBA
RDKit (قطری)
بالا
مبتنی بر قانون
logP (محاسبه شده)
مدل RDKit
متوسط به بالا
ممکن است از تجربی منحرف شود
logS (رزولوشن)
تخمین QSAR
متوسط
بستگی به حوزه کاربرد دارد
pKa
مدل خاص
متوسط
در یک ساختار پیچیده قرار می گیرد
فعالیت بیولوژیکی
QSAR/ML
متغیر
حتما تست کنید و تایید کنید
موارد کوچک
مورد 1 - تعداد قطعنامه های نصب شده. دانشجویی از هوش مصنوعی در مورد حلالیت یک ترکیب پرسید. او پاسخ "25 میلی گرم در میلی لیتر" را دریافت کرد و طرح آزمایشی را بر اساس آن تنظیم کرد. مقدار واقعی در اندازه گیری ~ 2 میلی گرم در میلی لیتر بود، یک تفاوت 10 برابری. هوش مصنوعی این عدد را ساخته بود. درس: ویژگی هایی مانند وضوح را به عنوان اعداد از مدل زبان در نظر نگیرید. پیش بینی کیفی + اندازه گیری
مورد 2 - خارج از محدوده کاربرد. یک مدل QSAR گفت: «فعالیت زیاد است» برای یک ماکرومولکول بزرگ که بسیار متفاوت از مجموعه آموزشی بود. کاربر متوجه شد که مولکول شبیه داده های آموزشی نیست و پیش بینی را غیر قابل اعتماد می دانست. آزمایش واقعاً فعالیت کمی داشت. درس: مدل همیشه پاسخ می دهد. اگر خارج از محدوده باشد، جواب بی ارزش است.
مورد 3 - استفاده صحیح از Lipinski. در یک مولکول کاندید، هوش مصنوعی Lipinski را با مقادیر RDKit ارزیابی کرد: MA 512 (> 500، مرزی)، logP 4.8 (مطلوب)، HBD 2، HBA 7. کاربر به درستی تفسیر کرد "یک معیار باقی می ماند اما قانون مطلق نیست" و مولکول را به طور کلی حذف نکرد. درس: قوانین دستورالعمل هستند، نه آستانه. با زمینه تفسیر کنید.
اشتباهات رایج
- دریافت تعداد ویژگی از مدل زبان. مقادیری که محاسبه نمی شوند ساخته می شوند. از ابزار یا مدل قطعی با عدم قطعیت استفاده کنید.
- نادیده گرفتن زمینه کاربرد. مدل برای هر مولکول اعداد تولید می کند. خارج از میدان غیر قابل اعتماد
- در نظر گرفتن یک اندازه گیری تخمینی logS یک تخمین است. جایگزینی برای وضوح تجربی نیست.
- لیپینسکی را قاعده مطلق در نظر می گیریم. نامزدی که در مرز است به طور خودکار حذف نمی شود. بسیاری از داروها این قانون را نقض می کنند.
- اشتباه گرفتن "محاسبه شده" با "تخمین زده". TPSA محاسبه می شود (قابل اعتماد)، فعالیت تخمین زده می شود (نامشخص).
احتیاط: پیش بینی ویژگی ها برای رتبه بندی و اولویت بندی نامزدها عالی است. اما نه برای تعیین یک تصمیم به تنهایی. "مدل گفت محلول" یک فرضیه است. "من اندازه گرفتم، حل می شود" یک نتیجه است.
به طور خلاصه
- خواص مولکولی را می توان قبل از آزمایش پیش بینی کرد و باعث صرفه جویی در زمان می شود.
- برخی از ویژگی ها به صورت قطعی محاسبه می شوند (MA، TPSA، HBD/HBA)، برخی برآوردهای آماری هستند (logS، فعالیت).
- حوزه کاربردی حیاتی ترین مفهوم است: مدل همیشه پاسخ می دهد، اما در خارج از حوزه غیرقابل اعتماد است.
- تعداد ویژگی ها را از RDKit یا مدل ابهام دریافت کنید، نه مدل زبان.
- از پیش بینی ها برای رتبه بندی نامزدها استفاده کنید. با آزمایش تصمیم نهایی را بگیرید.
وظیفه کاربردی
پنج مولکول (به عنوان مثال یک سری دارو) را انتخاب کنید. MA، logP، TPSA، HBD، HBA را برای هر کدام با RDKit محاسبه کنید و Lipinski را ارزیابی کنید. به طور جداگانه، از هوش مصنوعی یک تخمین کیفی (نه عددی) از حلالیت هر مولکول و یک زمینه هشدار کاربردی بخواهید. مقادیر قطعی و پیش بینی های هوش مصنوعی را در یک جدول جمع آوری کنید. کدام مولکول بیشتر مشخصات دارویی را نشان داد؟ کجا عدم اطمینان بالاترین میزان است؟
چک لیست
- [ ] من بین خواص محاسبه شده و پیش بینی قطعی تمایز قائل می شوم.
- [ ] من مقادیر ویژگی را از RDKit/model دریافت می کنم، نه از مدل زبان.
- [ ] من متوجه مولکول هایی خارج از محدوده کاربرد هستم.
- [ ] من از Lipinski به عنوان یک راهنما استفاده می کنم، نه یک قانون مطلق.
- [ ] من از پیش بینی برای رتبه بندی و تصمیم گیری برای آزمایش استفاده می کنم.
- [ ] من برنامه ای برای تأیید ویژگی های حیاتی با اندازه گیری دارم.