ইউনিট
1. রসায়নে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র 2. আণবিক প্রতিনিধিত্ব এবং রাসায়নিক কাঠামো: SMILES, InChI এবং RDKit এর সাথে বৈধতা 3. প্রতিক্রিয়া পূর্বাভাস এবং প্রক্রিয়া: পণ্য, অবস্থা এবং প্রতিকূল প্রতিক্রিয়া পূর্বাভাস 4. স্পেকট্রাম ব্যাখ্যা সমর্থন: NMR, IR এবং ভর স্পেকট্রোমেট্রি 5. সাহিত্য পর্যালোচনা এবং সংশ্লেষণ পরিকল্পনা: উত্স, পদ্ধতি এবং রোডম্যাপ 6. রাসায়নিক ডেটা বিশ্লেষণ এবং পাইথন: পান্ডা, স্টোইচিওমেট্রি এবং ক্রমাঙ্কন 7. আণবিক সম্পত্তি পূর্বাভাস এবং QSAR: রেজোলিউশন, pKa এবং মডেল সীমা 8. ল্যাবরেটরি ডকুমেন্টেশন: এক্সপেরিমেন্ট নোটবুক, ইএলএন এবং প্রজননযোগ্যতা 9. নিরাপত্তা এবং বিপদ মূল্যায়ন: GHS, SDS এবং কৃত্রিম বুদ্ধিমত্তার সীমা 10. নিশ্চিতকরণ, হ্যালুসিনেশন এবং বৈজ্ঞানিক সততা 11. পরীক্ষায় মানুষ: নৈতিকতা, গোপনীয়তা, দায়িত্ব এবং এন্ড-টু-এন্ড ওয়ার্কফ্লো
ইউনিট 7 / 11

আণবিক সম্পত্তি পূর্বাভাস এবং QSAR: রেজোলিউশন, pKa এবং মডেল সীমা

লাভ:

  • নির্ধারকভাবে গণনা করা বৈশিষ্ট্য এবং পরিসংখ্যানগতভাবে আনুমানিক বৈশিষ্ট্যগুলির মধ্যে পার্থক্য করার এবং আত্মবিশ্বাসের মাত্রা নির্ধারণ করার ক্ষমতা
  • প্রযোজ্য ডোমেনের ধারণা ব্যবহার করে মডেলটি যে অঞ্চলে নির্ভরযোগ্য তা মূল্যায়ন করার ক্ষমতা
  • বোঝার ক্ষমতা যে একজন প্রার্থীদের র‌্যাঙ্ক করতে এবং পরীক্ষার মাধ্যমে চূড়ান্ত সিদ্ধান্ত নেওয়ার জন্য বৈশিষ্ট্যের পূর্বাভাস ব্যবহার করা উচিত।

একটি অণু সংশ্লেষণ করার আগে, আমরা প্রায়শই জিজ্ঞাসা করি: "এটি কি জলে দ্রবণীয়? এটি কতটা অম্লীয়? এটি কি কোষের ঝিল্লি অতিক্রম করে? এটি কি ড্রাগ প্রার্থী হিসাবে বিশ্বাসযোগ্য?" পরীক্ষার আগে এই প্রশ্নের উত্তরগুলি ভবিষ্যদ্বাণী করা অনেক সময় বাঁচায়। AI এবং এর বিশেষ মডেলগুলি (বিশেষত QSAR — পরিমাণগত কাঠামো-ক্রিয়াকলাপের সম্পর্ক, অর্থাৎ পরিসংখ্যানগত মডেল যা অণুর কাঠামোগত বর্ণনাকারী থেকে একটি সম্পত্তির ভবিষ্যদ্বাণী করে) এই ভবিষ্যদ্বাণীগুলিতে শক্তিশালী। কিন্তু এই ভবিষ্যদ্বাণীগুলি সম্ভাব্যতার পূর্বাভাস, পরিমাপ নয়। এই ইউনিটে, আমরা বৈশিষ্ট্য ভবিষ্যদ্বাণী, এর শক্তি এবং সবচেয়ে সমালোচনামূলক ধারণা, প্রয়োগযোগ্যতা অঞ্চল (যে অঞ্চলে মডেলটি নির্ভরযোগ্য) সম্পর্কে শিখব।

কি বৈশিষ্ট্য ভবিষ্যদ্বাণী করা হয়?

  • logP: অণুর তেল/জল বিভাজন সহগ; এটি লিপোফিলিসিটি (চর্বি পছন্দ) দেখায়। ড্রাগ শোষণে সমালোচনামূলক।
  • দ্রবণীয়তা (logS): এটি পানিতে কতটা দ্রবণীয়।
  • pKa: অম্লতা/ক্ষারত্ব; যে pH এ একটি গ্রুপ আয়নিত হয়।
  • TPSA: টপোলজিক্যাল মেরু পৃষ্ঠ এলাকা; এটি ব্যাপ্তিযোগ্যতা অনুমানে ব্যবহৃত হয়।
  • লিপিনস্কি "পাঁচের নিয়ম": আণবিক ওজন, লগপি, মৌখিক ওষুধ প্রার্থীদের এইচ-বন্ড দাতা/গ্রহণকারীদের সংখ্যার জন্য ব্যবহারিক থ্রেশহোল্ড।

এর মধ্যে কিছু মান নির্ধারকভাবে গণনা করা হয় (যেমন TPSA, এইচ-বন্ড সংখ্যা) যেমন RDKit; তাদের মধ্যে কিছু পরিসংখ্যানগত অনুমান (logS, জৈবিক কার্যকলাপ)। এই পার্থক্যটি জেনে আপনি কতটা বিশ্বাস করেন তা নির্ধারণ করে।

টিপ: একটি বৈশিষ্ট্য "গণনা করা" (নিয়ম-ভিত্তিক, পুনরাবৃত্তিযোগ্য) বা "ভবিষ্যদ্বাণী করা" (মডেল থেকে, অনিশ্চিত) কিনা তা পার্থক্য করুন। গণনায় উচ্চ আস্থা রাখুন, ভবিষ্যদ্বাণীতে সতর্ক আস্থা রাখুন এবং পরীক্ষার মাধ্যমে ভবিষ্যদ্বাণী যাচাই করুন।

প্রযোজ্যতার সুযোগ: সবচেয়ে গুরুত্বপূর্ণ ধারণা

একটি QSAR মডেল অণুগুলির উপর ভাল কাজ করে যা অণুগুলির অনুরূপ যেগুলির উপর এটি প্রশিক্ষিত হয়েছিল৷ আপনি যদি এমন একটি অণু দেন যা প্রশিক্ষণের ডেটা থেকে খুব আলাদা (উদাহরণস্বরূপ, একটি খুব বড়, অস্বাভাবিক কঙ্কাল), মডেলটি এখনও একটি সংখ্যা তৈরি করবে, তবে সেই সংখ্যাটি অবিশ্বস্ত হবে। একে বলা হয় "প্রযোজ্যতার সুযোগের বাইরে থাকা।" মডেল সবসময় একটি উত্তর দেয়; উত্তরটি নির্ভরযোগ্য কিনা তা বলা আপনার কাজ।

এটি আরও ঝুঁকিপূর্ণ যখন ভাষা মডেল একটি বৈশিষ্ট্য মান দেয়: এটি একটি "সম্ভাব্য-সুদর্শন" মান হিসাবে সংখ্যা তৈরি করে, কোন অন্তর্নিহিত গণনা ছাড়াই। তাই যদি সম্ভব হয়, একটি ডিটারমিনিস্টিক টুল (RDKit) বা একটি QSAR মডেল থেকে বৈশিষ্ট্যের মানগুলি পান যা ভাষা মডেল থেকে নয়, অনিশ্চয়তা দেয়।

ধাপে ধাপে: নিরাপদ বৈশিষ্ট্য পূর্বাভাস

  1. অণু যাচাই করুন: RDKit (ইউনিট 2) দিয়ে SMILES পার্স করুন।
  2. নির্ধারক গণনা করুন: MA, logP (গণনা করা), TPSA, RDKit থেকে H-বন্ড নম্বর।
  3. ভবিষ্যদ্বাণীগুলিকে আলাদাভাবে চিহ্নিত করুন: "ভবিষ্যদ্বাণী" ট্যাগের সাথে মডেল ভবিষ্যদ্বাণী যেমন লগএস, কার্যকলাপ ইত্যাদি রাখুন৷
  4. প্রযোজ্যতা ডোমেন পরীক্ষা করুন: অণু প্রশিক্ষণ তথ্য মত দেখায়? এটা কি খুব বড়/অস্বাভাবিক?
  5. র‌্যাঙ্কিংয়ের জন্য ব্যবহার করুন, সিদ্ধান্ত নয়: প্রার্থীদের র‌্যাঙ্ক করতে ভবিষ্যদ্বাণী ব্যবহার করুন; চূড়ান্ত পছন্দ হল পরীক্ষা।
  6. পরীক্ষা দ্বারা বন্ধ করুন: পরিমাপ দ্বারা সমালোচনামূলক বৈশিষ্ট্য (দ্রবণীয়তা, pKa) যাচাই করুন।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) RDKit এর সাথে নির্ধারক বৈশিষ্ট্য:

rdkit import Chem থেকে rdkit.Chem ইম্পোর্ট বর্ণনাকারী, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # অ্যাসপিরিনপ্রিন্ট("MA:", round(descriptors.MolWt(mol),"2", calculated(Print)) round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))প্রিন্ট("H-বন্ড দাতা:", rdMolDescriptors.CalcNumHBD(mol))মুদ্রণ("H-বন্ড গ্রহণকারী:", rdMolDescriptors())

2) লিপিনস্কি নিয়ম মূল্যায়ন:

অণু (স্মাইল): [স্মাইল] টাস্ক: RDKit থেকে গণনা করা MA, logP, HBD, HBA মানগুলির সাথে পাঁচটির লিপিনস্কি নিয়ম মেনে চলার মূল্যায়ন করুন। প্রতিটি মানদণ্ডকে পাস/ফেল হিসেবে আলাদাভাবে চিহ্নিত করুন। নিয়ম: সংখ্যা তৈরি করবেন না; আমি RDKit থেকে এটি পাব, আপনি মন্তব্য করুন.

3) বৈশিষ্ট্য অনুমান + অনিশ্চয়তা অনুরোধ:

অণু (স্মাইল): [স্মাইল] টাস্ক: জলের দ্রবণীয়তা (লগএস) (উচ্চ/মাঝারি/নিম্ন) এর একটি গুণগত অনুমান দিন এবং কাঠামোগত বৈশিষ্ট্য সহ যুক্তি ব্যাখ্যা করুন। সঠিক সংখ্যা দেবেন না; বলুন যে এটি একটি ভবিষ্যদ্বাণী এবং পরীক্ষা দ্বারা নিশ্চিত করা প্রয়োজন৷ অণুর একটি অস্বাভাবিক গঠন (প্রযোজ্য ঝুঁকি) থাকলে সতর্ক করুন।

4) প্রার্থীর র‍্যাঙ্কিং (পূর্বাভাস অনুসারে অগ্রাধিকার):

নীচে 5টি অণুর SMILES রয়েছে৷ টাস্ক: কাঠামোগত বৈশিষ্ট্যগুলির (পোলার গোষ্ঠীর সংখ্যা, রিং, লাইপোফিলিসিটি) উপর ভিত্তি করে জল দ্রবণীয়তার পরিপ্রেক্ষিতে তাদের র‍্যাঙ্ক করুন৷ প্রতিটি র্যাঙ্কিংয়ের সিদ্ধান্তের জন্য ন্যায্যতা লিখুন৷ নোট: এটি একটি প্রাথমিক বাছাই; চূড়ান্ত নির্বাচন পরিমাপ দ্বারা করা হবে.

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল:

এই অণুর দ্রবণীয়তা কি?

AI এমন একটি সংখ্যা তৈরি করে যা গণনার অধীনে বিদ্যমান নেই (যেমন "12 mg/mL"); এটা আত্মবিশ্বাস দেয় কিন্তু ভুল হতে পারে।

শক্তিশালী:

অণু (স্মাইল): [স্মাইলস]। টাস্ক: 1) আমি RDKit দিয়ে গণনা করার জন্য logP, TPSA, HBD/HBA দেব: [মান]। বলুন যে এটি একটি অনুমান এবং পরীক্ষা-নিরীক্ষা প্রয়োজন।

পার্থক্য: আমরা গাড়ি থেকে নির্ধারক মানগুলি নিয়েছি এবং এআইকে কেবল তাদের ব্যাখ্যা করেছি; আমরা স্পষ্টভাবে অনিশ্চয়তা এবং পরীক্ষা-নিরীক্ষার প্রয়োজনীয়তার জন্য জিজ্ঞাসা করেছি।

বৈশিষ্ট্যের ধরন এবং বিশ্বাসের স্তর

বৈশিষ্ট্য

কিভাবে পেতে হয়

বিশ্বাস

নোট

আণবিক ওজন

RDKit (নির্ণয়বাদী)

খুব উচ্চ

সূত্র থেকে কাটা

TPSA, HBD/HBA

RDKit (নির্ণয়বাদী)

উচ্চ

নিয়ম ভিত্তিক

logP (গণনা করা)

RDKit মডেল

মাঝারি উচ্চ

পরীক্ষামূলক থেকে বিচ্যুত হতে পারে

logS (রেজোলিউশন)

QSAR অনুমান

মাঝারি

প্রযোজ্য ক্ষেত্রের উপর নির্ভর করে

pKa

বিশেষ মডেল

মাঝারি

এটি একটি জটিল কাঠামোর মধ্যে পড়ে

জৈবিক কার্যকলাপ

QSAR/ML

পরিবর্তনশীল

পরীক্ষা এবং যাচাই করতে ভুলবেন না

মিনি কেস

কেস 1 - লাগানো রেজোলিউশনের সংখ্যা। একজন ছাত্র এআইকে একটি যৌগের দ্রবণীয়তা সম্পর্কে জিজ্ঞাসা করেছিল; তিনি "25 mg/mL" উত্তর পেয়েছিলেন এবং সেই অনুযায়ী পরীক্ষামূলক নকশা সেট আপ করেছিলেন। পরিমাপের প্রকৃত মান ছিল ~2 mg/mL, একটি 10-গুণ পার্থক্য। এআই নম্বরটি তৈরি করেছিল। পাঠ: ভাষা মডেল থেকে সংখ্যা হিসাবে রেজোলিউশনের মত বৈশিষ্ট্য গ্রহণ করবেন না; গুণগত ভবিষ্যদ্বাণী + পরিমাপ।

কেস 2 — প্রযোজ্যতার সুযোগের বাইরে। একটি QSAR মডেল বলেছে যে একটি বৃহৎ ম্যাক্রোমোলিকিউলের জন্য "ক্রিয়াকলাপ বেশি" যা প্রশিক্ষণ সেট থেকে খুব আলাদা ছিল। ব্যবহারকারী লক্ষ্য করেছেন যে অণু প্রশিক্ষণ ডেটার সাথে সাদৃশ্যপূর্ণ নয় এবং ভবিষ্যদ্বাণীটিকে অবিশ্বস্ত বলে মনে করেছে; পরীক্ষা সত্যিই কম কার্যকলাপ দিয়েছে. পাঠ: মডেল সবসময় সাড়া দেয়; যদি এটি সুযোগের বাইরে হয় তবে উত্তরটি মূল্যহীন।

কেস 3 - লিপিনস্কির সঠিক ব্যবহার। একজন প্রার্থীর অণুতে, AI RDKit থেকে মান দিয়ে Lipinski মূল্যায়ন করেছে: MA 512 (>500, বর্ডারলাইন), logP 4.8 (অনুকূল), HBD 2, HBA 7। ব্যবহারকারী সঠিকভাবে ব্যাখ্যা করেছেন "একটি মাপকাঠি রয়ে গেছে কিন্তু নিয়মটি পরম নয়" এবং অণুটি নির্মূল করেনি। পাঠ: নিয়ম হল নির্দেশিকা, থ্রেশহোল্ড নয়; প্রসঙ্গ দিয়ে ব্যাখ্যা করুন।

সাধারণ ভুল

  • ভাষা মডেল থেকে বৈশিষ্ট্য গণনা পাওয়া. যে মানগুলি গণনা করা হয় না সেগুলি বানোয়াট; অনিশ্চয়তার সাথে নির্ধারক টুল বা মডেল ব্যবহার করুন।
  • প্রযোজ্য ক্ষেত্র উপেক্ষা করা. মডেল প্রতিটি অণুর জন্য সংখ্যা তৈরি করে; মাঠের বাইরে অবিশ্বাস্য।
  • একটি আনুমানিক পরিমাপ বিবেচনা. logS একটি অনুমান; এটি পরীক্ষামূলক রেজোলিউশনের বিকল্প নয়।
  • Lipinski পরম নিয়ম বিবেচনা. বর্ডারে থাকা প্রার্থীকে স্বয়ংক্রিয়ভাবে বাদ দেওয়া হয় না; অনেক ওষুধ নিয়ম লঙ্ঘন করে।
  • "আনুমানিক" এর সাথে "গণনা করা" বিভ্রান্তিকর। TPSA গণনা করা হয় (নির্ভরযোগ্য), কার্যকলাপ অনুমান করা হয় (অনিশ্চিত)।
সতর্কতা: বৈশিষ্ট্য ভবিষ্যদ্বাণী র‌্যাঙ্কিং এবং প্রার্থীদের অগ্রাধিকার দেওয়ার জন্য দুর্দান্ত; তবে একা সিদ্ধান্ত নেওয়ার জন্য নয়। "মডেল বলেছেন দ্রবণীয়" একটি অনুমান; "আমি পরিমাপ করেছি, এটি দ্রবীভূত হয়" একটি ফলাফল।

সংক্ষেপে

  • আণবিক বৈশিষ্ট্য পরীক্ষার আগে ভবিষ্যদ্বাণী করা যেতে পারে এবং অনেক সময় বাঁচায়।
  • কিছু বৈশিষ্ট্য নির্ধারকভাবে গণনা করা হয় (MA, TPSA, HBD/HBA), কিছু পরিসংখ্যানগত অনুমান (লগএস, কার্যকলাপ)।
  • প্রযোজ্যতার ডোমেন হল সবচেয়ে সমালোচনামূলক ধারণা: মডেলটি সর্বদা উত্তর দেয়, কিন্তু ডোমেনের বাইরে অবিশ্বস্ত।
  • RDKit বা অস্পষ্টতা মডেল থেকে বৈশিষ্ট্য গণনা পান, ভাষা মডেল নয়।
  • প্রার্থীদের র‌্যাঙ্ক করতে ভবিষ্যদ্বাণী ব্যবহার করুন; পরীক্ষা করে চূড়ান্ত সিদ্ধান্ত নিন।

আবেদন টাস্ক

পাঁচটি অণু নির্বাচন করুন (যেমন একটি ড্রাগ সিরিজ)। RDKit দিয়ে প্রতিটির জন্য MA, logP, TPSA, HBD, HBA গণনা করুন এবং Lipinski মূল্যায়ন করুন। আলাদাভাবে, AI-কে প্রতিটি অণুর দ্রবণীয়তার গুণগত অনুমান (সংখ্যা নয়) এবং প্রযোজ্য সতর্কতার একটি ক্ষেত্র জিজ্ঞাসা করুন। একটি টেবিলে নির্ধারক মান এবং এআই পূর্বাভাস সংগ্রহ করুন। কোন অণু সবচেয়ে মাদকের মত প্রোফাইল দিয়েছে? কোথায় অনিশ্চয়তা সবচেয়ে বেশি?

চেকলিস্ট

  • [ ] আমি নির্ধারক গণনা করা এবং পূর্বাভাসিত বৈশিষ্ট্যগুলির মধ্যে পার্থক্য করি৷
  • [] আমি RDKit/মডেল থেকে সম্পত্তির মান পাচ্ছি, ভাষার মডেল নয়।
  • [ ] আমি প্রযোজ্যতার সুযোগের বাইরে অণুগুলি লক্ষ্য করি৷
  • [ ] আমি লিপিনস্কিকে একটি গাইড হিসাবে ব্যবহার করি, একটি পরম নিয়ম নয়।
  • [ ] আমি র‌্যাঙ্কিংয়ের জন্য ভবিষ্যদ্বাণী এবং পরীক্ষার জন্য সিদ্ধান্ত ব্যবহার করি।
  • [ ] আমার পরিমাপ দ্বারা সমালোচনামূলক বৈশিষ্ট্য যাচাই করার একটি পরিকল্পনা আছে৷