লাভ:
- নির্ধারকভাবে গণনা করা বৈশিষ্ট্য এবং পরিসংখ্যানগতভাবে আনুমানিক বৈশিষ্ট্যগুলির মধ্যে পার্থক্য করার এবং আত্মবিশ্বাসের মাত্রা নির্ধারণ করার ক্ষমতা
- প্রযোজ্য ডোমেনের ধারণা ব্যবহার করে মডেলটি যে অঞ্চলে নির্ভরযোগ্য তা মূল্যায়ন করার ক্ষমতা
- বোঝার ক্ষমতা যে একজন প্রার্থীদের র্যাঙ্ক করতে এবং পরীক্ষার মাধ্যমে চূড়ান্ত সিদ্ধান্ত নেওয়ার জন্য বৈশিষ্ট্যের পূর্বাভাস ব্যবহার করা উচিত।
একটি অণু সংশ্লেষণ করার আগে, আমরা প্রায়শই জিজ্ঞাসা করি: "এটি কি জলে দ্রবণীয়? এটি কতটা অম্লীয়? এটি কি কোষের ঝিল্লি অতিক্রম করে? এটি কি ড্রাগ প্রার্থী হিসাবে বিশ্বাসযোগ্য?" পরীক্ষার আগে এই প্রশ্নের উত্তরগুলি ভবিষ্যদ্বাণী করা অনেক সময় বাঁচায়। AI এবং এর বিশেষ মডেলগুলি (বিশেষত QSAR — পরিমাণগত কাঠামো-ক্রিয়াকলাপের সম্পর্ক, অর্থাৎ পরিসংখ্যানগত মডেল যা অণুর কাঠামোগত বর্ণনাকারী থেকে একটি সম্পত্তির ভবিষ্যদ্বাণী করে) এই ভবিষ্যদ্বাণীগুলিতে শক্তিশালী। কিন্তু এই ভবিষ্যদ্বাণীগুলি সম্ভাব্যতার পূর্বাভাস, পরিমাপ নয়। এই ইউনিটে, আমরা বৈশিষ্ট্য ভবিষ্যদ্বাণী, এর শক্তি এবং সবচেয়ে সমালোচনামূলক ধারণা, প্রয়োগযোগ্যতা অঞ্চল (যে অঞ্চলে মডেলটি নির্ভরযোগ্য) সম্পর্কে শিখব।
কি বৈশিষ্ট্য ভবিষ্যদ্বাণী করা হয়?
- logP: অণুর তেল/জল বিভাজন সহগ; এটি লিপোফিলিসিটি (চর্বি পছন্দ) দেখায়। ড্রাগ শোষণে সমালোচনামূলক।
- দ্রবণীয়তা (logS): এটি পানিতে কতটা দ্রবণীয়।
- pKa: অম্লতা/ক্ষারত্ব; যে pH এ একটি গ্রুপ আয়নিত হয়।
- TPSA: টপোলজিক্যাল মেরু পৃষ্ঠ এলাকা; এটি ব্যাপ্তিযোগ্যতা অনুমানে ব্যবহৃত হয়।
- লিপিনস্কি "পাঁচের নিয়ম": আণবিক ওজন, লগপি, মৌখিক ওষুধ প্রার্থীদের এইচ-বন্ড দাতা/গ্রহণকারীদের সংখ্যার জন্য ব্যবহারিক থ্রেশহোল্ড।
এর মধ্যে কিছু মান নির্ধারকভাবে গণনা করা হয় (যেমন TPSA, এইচ-বন্ড সংখ্যা) যেমন RDKit; তাদের মধ্যে কিছু পরিসংখ্যানগত অনুমান (logS, জৈবিক কার্যকলাপ)। এই পার্থক্যটি জেনে আপনি কতটা বিশ্বাস করেন তা নির্ধারণ করে।
টিপ: একটি বৈশিষ্ট্য "গণনা করা" (নিয়ম-ভিত্তিক, পুনরাবৃত্তিযোগ্য) বা "ভবিষ্যদ্বাণী করা" (মডেল থেকে, অনিশ্চিত) কিনা তা পার্থক্য করুন। গণনায় উচ্চ আস্থা রাখুন, ভবিষ্যদ্বাণীতে সতর্ক আস্থা রাখুন এবং পরীক্ষার মাধ্যমে ভবিষ্যদ্বাণী যাচাই করুন।
প্রযোজ্যতার সুযোগ: সবচেয়ে গুরুত্বপূর্ণ ধারণা
একটি QSAR মডেল অণুগুলির উপর ভাল কাজ করে যা অণুগুলির অনুরূপ যেগুলির উপর এটি প্রশিক্ষিত হয়েছিল৷ আপনি যদি এমন একটি অণু দেন যা প্রশিক্ষণের ডেটা থেকে খুব আলাদা (উদাহরণস্বরূপ, একটি খুব বড়, অস্বাভাবিক কঙ্কাল), মডেলটি এখনও একটি সংখ্যা তৈরি করবে, তবে সেই সংখ্যাটি অবিশ্বস্ত হবে। একে বলা হয় "প্রযোজ্যতার সুযোগের বাইরে থাকা।" মডেল সবসময় একটি উত্তর দেয়; উত্তরটি নির্ভরযোগ্য কিনা তা বলা আপনার কাজ।
এটি আরও ঝুঁকিপূর্ণ যখন ভাষা মডেল একটি বৈশিষ্ট্য মান দেয়: এটি একটি "সম্ভাব্য-সুদর্শন" মান হিসাবে সংখ্যা তৈরি করে, কোন অন্তর্নিহিত গণনা ছাড়াই। তাই যদি সম্ভব হয়, একটি ডিটারমিনিস্টিক টুল (RDKit) বা একটি QSAR মডেল থেকে বৈশিষ্ট্যের মানগুলি পান যা ভাষা মডেল থেকে নয়, অনিশ্চয়তা দেয়।
ধাপে ধাপে: নিরাপদ বৈশিষ্ট্য পূর্বাভাস
- অণু যাচাই করুন: RDKit (ইউনিট 2) দিয়ে SMILES পার্স করুন।
- নির্ধারক গণনা করুন: MA, logP (গণনা করা), TPSA, RDKit থেকে H-বন্ড নম্বর।
- ভবিষ্যদ্বাণীগুলিকে আলাদাভাবে চিহ্নিত করুন: "ভবিষ্যদ্বাণী" ট্যাগের সাথে মডেল ভবিষ্যদ্বাণী যেমন লগএস, কার্যকলাপ ইত্যাদি রাখুন৷
- প্রযোজ্যতা ডোমেন পরীক্ষা করুন: অণু প্রশিক্ষণ তথ্য মত দেখায়? এটা কি খুব বড়/অস্বাভাবিক?
- র্যাঙ্কিংয়ের জন্য ব্যবহার করুন, সিদ্ধান্ত নয়: প্রার্থীদের র্যাঙ্ক করতে ভবিষ্যদ্বাণী ব্যবহার করুন; চূড়ান্ত পছন্দ হল পরীক্ষা।
- পরীক্ষা দ্বারা বন্ধ করুন: পরিমাপ দ্বারা সমালোচনামূলক বৈশিষ্ট্য (দ্রবণীয়তা, pKa) যাচাই করুন।
চারটি অনুলিপিযোগ্য টেমপ্লেট
1) RDKit এর সাথে নির্ধারক বৈশিষ্ট্য:
rdkit import Chem থেকে rdkit.Chem ইম্পোর্ট বর্ণনাকারী, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # অ্যাসপিরিনপ্রিন্ট("MA:", round(descriptors.MolWt(mol),"2", calculated(Print)) round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))প্রিন্ট("H-বন্ড দাতা:", rdMolDescriptors.CalcNumHBD(mol))মুদ্রণ("H-বন্ড গ্রহণকারী:", rdMolDescriptors())
2) লিপিনস্কি নিয়ম মূল্যায়ন:
অণু (স্মাইল): [স্মাইল] টাস্ক: RDKit থেকে গণনা করা MA, logP, HBD, HBA মানগুলির সাথে পাঁচটির লিপিনস্কি নিয়ম মেনে চলার মূল্যায়ন করুন। প্রতিটি মানদণ্ডকে পাস/ফেল হিসেবে আলাদাভাবে চিহ্নিত করুন। নিয়ম: সংখ্যা তৈরি করবেন না; আমি RDKit থেকে এটি পাব, আপনি মন্তব্য করুন.
3) বৈশিষ্ট্য অনুমান + অনিশ্চয়তা অনুরোধ:
অণু (স্মাইল): [স্মাইল] টাস্ক: জলের দ্রবণীয়তা (লগএস) (উচ্চ/মাঝারি/নিম্ন) এর একটি গুণগত অনুমান দিন এবং কাঠামোগত বৈশিষ্ট্য সহ যুক্তি ব্যাখ্যা করুন। সঠিক সংখ্যা দেবেন না; বলুন যে এটি একটি ভবিষ্যদ্বাণী এবং পরীক্ষা দ্বারা নিশ্চিত করা প্রয়োজন৷ অণুর একটি অস্বাভাবিক গঠন (প্রযোজ্য ঝুঁকি) থাকলে সতর্ক করুন।
4) প্রার্থীর র্যাঙ্কিং (পূর্বাভাস অনুসারে অগ্রাধিকার):
নীচে 5টি অণুর SMILES রয়েছে৷ টাস্ক: কাঠামোগত বৈশিষ্ট্যগুলির (পোলার গোষ্ঠীর সংখ্যা, রিং, লাইপোফিলিসিটি) উপর ভিত্তি করে জল দ্রবণীয়তার পরিপ্রেক্ষিতে তাদের র্যাঙ্ক করুন৷ প্রতিটি র্যাঙ্কিংয়ের সিদ্ধান্তের জন্য ন্যায্যতা লিখুন৷ নোট: এটি একটি প্রাথমিক বাছাই; চূড়ান্ত নির্বাচন পরিমাপ দ্বারা করা হবে.
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল:
এই অণুর দ্রবণীয়তা কি?
AI এমন একটি সংখ্যা তৈরি করে যা গণনার অধীনে বিদ্যমান নেই (যেমন "12 mg/mL"); এটা আত্মবিশ্বাস দেয় কিন্তু ভুল হতে পারে।
শক্তিশালী:
অণু (স্মাইল): [স্মাইলস]। টাস্ক: 1) আমি RDKit দিয়ে গণনা করার জন্য logP, TPSA, HBD/HBA দেব: [মান]। বলুন যে এটি একটি অনুমান এবং পরীক্ষা-নিরীক্ষা প্রয়োজন।
পার্থক্য: আমরা গাড়ি থেকে নির্ধারক মানগুলি নিয়েছি এবং এআইকে কেবল তাদের ব্যাখ্যা করেছি; আমরা স্পষ্টভাবে অনিশ্চয়তা এবং পরীক্ষা-নিরীক্ষার প্রয়োজনীয়তার জন্য জিজ্ঞাসা করেছি।
বৈশিষ্ট্যের ধরন এবং বিশ্বাসের স্তর
বৈশিষ্ট্য
কিভাবে পেতে হয়
বিশ্বাস
নোট
আণবিক ওজন
RDKit (নির্ণয়বাদী)
খুব উচ্চ
সূত্র থেকে কাটা
TPSA, HBD/HBA
RDKit (নির্ণয়বাদী)
উচ্চ
নিয়ম ভিত্তিক
logP (গণনা করা)
RDKit মডেল
মাঝারি উচ্চ
পরীক্ষামূলক থেকে বিচ্যুত হতে পারে
logS (রেজোলিউশন)
QSAR অনুমান
মাঝারি
প্রযোজ্য ক্ষেত্রের উপর নির্ভর করে
pKa
বিশেষ মডেল
মাঝারি
এটি একটি জটিল কাঠামোর মধ্যে পড়ে
জৈবিক কার্যকলাপ
QSAR/ML
পরিবর্তনশীল
পরীক্ষা এবং যাচাই করতে ভুলবেন না
মিনি কেস
কেস 1 - লাগানো রেজোলিউশনের সংখ্যা। একজন ছাত্র এআইকে একটি যৌগের দ্রবণীয়তা সম্পর্কে জিজ্ঞাসা করেছিল; তিনি "25 mg/mL" উত্তর পেয়েছিলেন এবং সেই অনুযায়ী পরীক্ষামূলক নকশা সেট আপ করেছিলেন। পরিমাপের প্রকৃত মান ছিল ~2 mg/mL, একটি 10-গুণ পার্থক্য। এআই নম্বরটি তৈরি করেছিল। পাঠ: ভাষা মডেল থেকে সংখ্যা হিসাবে রেজোলিউশনের মত বৈশিষ্ট্য গ্রহণ করবেন না; গুণগত ভবিষ্যদ্বাণী + পরিমাপ।
কেস 2 — প্রযোজ্যতার সুযোগের বাইরে। একটি QSAR মডেল বলেছে যে একটি বৃহৎ ম্যাক্রোমোলিকিউলের জন্য "ক্রিয়াকলাপ বেশি" যা প্রশিক্ষণ সেট থেকে খুব আলাদা ছিল। ব্যবহারকারী লক্ষ্য করেছেন যে অণু প্রশিক্ষণ ডেটার সাথে সাদৃশ্যপূর্ণ নয় এবং ভবিষ্যদ্বাণীটিকে অবিশ্বস্ত বলে মনে করেছে; পরীক্ষা সত্যিই কম কার্যকলাপ দিয়েছে. পাঠ: মডেল সবসময় সাড়া দেয়; যদি এটি সুযোগের বাইরে হয় তবে উত্তরটি মূল্যহীন।
কেস 3 - লিপিনস্কির সঠিক ব্যবহার। একজন প্রার্থীর অণুতে, AI RDKit থেকে মান দিয়ে Lipinski মূল্যায়ন করেছে: MA 512 (>500, বর্ডারলাইন), logP 4.8 (অনুকূল), HBD 2, HBA 7। ব্যবহারকারী সঠিকভাবে ব্যাখ্যা করেছেন "একটি মাপকাঠি রয়ে গেছে কিন্তু নিয়মটি পরম নয়" এবং অণুটি নির্মূল করেনি। পাঠ: নিয়ম হল নির্দেশিকা, থ্রেশহোল্ড নয়; প্রসঙ্গ দিয়ে ব্যাখ্যা করুন।
সাধারণ ভুল
- ভাষা মডেল থেকে বৈশিষ্ট্য গণনা পাওয়া. যে মানগুলি গণনা করা হয় না সেগুলি বানোয়াট; অনিশ্চয়তার সাথে নির্ধারক টুল বা মডেল ব্যবহার করুন।
- প্রযোজ্য ক্ষেত্র উপেক্ষা করা. মডেল প্রতিটি অণুর জন্য সংখ্যা তৈরি করে; মাঠের বাইরে অবিশ্বাস্য।
- একটি আনুমানিক পরিমাপ বিবেচনা. logS একটি অনুমান; এটি পরীক্ষামূলক রেজোলিউশনের বিকল্প নয়।
- Lipinski পরম নিয়ম বিবেচনা. বর্ডারে থাকা প্রার্থীকে স্বয়ংক্রিয়ভাবে বাদ দেওয়া হয় না; অনেক ওষুধ নিয়ম লঙ্ঘন করে।
- "আনুমানিক" এর সাথে "গণনা করা" বিভ্রান্তিকর। TPSA গণনা করা হয় (নির্ভরযোগ্য), কার্যকলাপ অনুমান করা হয় (অনিশ্চিত)।
সতর্কতা: বৈশিষ্ট্য ভবিষ্যদ্বাণী র্যাঙ্কিং এবং প্রার্থীদের অগ্রাধিকার দেওয়ার জন্য দুর্দান্ত; তবে একা সিদ্ধান্ত নেওয়ার জন্য নয়। "মডেল বলেছেন দ্রবণীয়" একটি অনুমান; "আমি পরিমাপ করেছি, এটি দ্রবীভূত হয়" একটি ফলাফল।
সংক্ষেপে
- আণবিক বৈশিষ্ট্য পরীক্ষার আগে ভবিষ্যদ্বাণী করা যেতে পারে এবং অনেক সময় বাঁচায়।
- কিছু বৈশিষ্ট্য নির্ধারকভাবে গণনা করা হয় (MA, TPSA, HBD/HBA), কিছু পরিসংখ্যানগত অনুমান (লগএস, কার্যকলাপ)।
- প্রযোজ্যতার ডোমেন হল সবচেয়ে সমালোচনামূলক ধারণা: মডেলটি সর্বদা উত্তর দেয়, কিন্তু ডোমেনের বাইরে অবিশ্বস্ত।
- RDKit বা অস্পষ্টতা মডেল থেকে বৈশিষ্ট্য গণনা পান, ভাষা মডেল নয়।
- প্রার্থীদের র্যাঙ্ক করতে ভবিষ্যদ্বাণী ব্যবহার করুন; পরীক্ষা করে চূড়ান্ত সিদ্ধান্ত নিন।
আবেদন টাস্ক
পাঁচটি অণু নির্বাচন করুন (যেমন একটি ড্রাগ সিরিজ)। RDKit দিয়ে প্রতিটির জন্য MA, logP, TPSA, HBD, HBA গণনা করুন এবং Lipinski মূল্যায়ন করুন। আলাদাভাবে, AI-কে প্রতিটি অণুর দ্রবণীয়তার গুণগত অনুমান (সংখ্যা নয়) এবং প্রযোজ্য সতর্কতার একটি ক্ষেত্র জিজ্ঞাসা করুন। একটি টেবিলে নির্ধারক মান এবং এআই পূর্বাভাস সংগ্রহ করুন। কোন অণু সবচেয়ে মাদকের মত প্রোফাইল দিয়েছে? কোথায় অনিশ্চয়তা সবচেয়ে বেশি?
চেকলিস্ট
- [ ] আমি নির্ধারক গণনা করা এবং পূর্বাভাসিত বৈশিষ্ট্যগুলির মধ্যে পার্থক্য করি৷
- [] আমি RDKit/মডেল থেকে সম্পত্তির মান পাচ্ছি, ভাষার মডেল নয়।
- [ ] আমি প্রযোজ্যতার সুযোগের বাইরে অণুগুলি লক্ষ্য করি৷
- [ ] আমি লিপিনস্কিকে একটি গাইড হিসাবে ব্যবহার করি, একটি পরম নিয়ম নয়।
- [ ] আমি র্যাঙ্কিংয়ের জন্য ভবিষ্যদ্বাণী এবং পরীক্ষার জন্য সিদ্ধান্ত ব্যবহার করি।
- [ ] আমার পরিমাপ দ্বারা সমালোচনামূলক বৈশিষ্ট্য যাচাই করার একটি পরিকল্পনা আছে৷