इकाइयाँ
1. रसायन विज्ञान में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, मान्यता और नैतिकता 2. आणविक प्रतिनिधित्व और रासायनिक संरचना: SMILES, InChI और RDKit के साथ सत्यापन 3. प्रतिक्रिया भविष्यवाणी और तंत्र: उत्पाद, स्थिति और प्रतिकूल प्रतिक्रिया भविष्यवाणी 4. स्पेक्ट्रम व्याख्या समर्थन: एनएमआर, आईआर और मास स्पेक्ट्रोमेट्री 5. साहित्य समीक्षा और संश्लेषण योजना: स्रोत, प्रक्रिया और रोडमैप 6. रासायनिक डेटा विश्लेषण और पायथन: पांडा, स्टोइकोमेट्री और कैलिब्रेशन 7. आणविक संपत्ति भविष्यवाणी और QSAR: संकल्प, पीकेए और मॉडल सीमाएं 8. प्रयोगशाला दस्तावेज़ीकरण: प्रयोग नोटबुक, ईएलएन और प्रतिलिपि प्रस्तुत करने योग्यता 9. सुरक्षा और ख़तरे का आकलन: जीएचएस, एसडीएस और कृत्रिम बुद्धिमत्ता की सीमाएँ 10. पुष्टिकरण, मतिभ्रम, और वैज्ञानिक अखंडता 11. प्रयोग में मानव: नैतिकता, गोपनीयता, जिम्मेदारी और शुरू से अंत तक कार्यप्रवाह
इकाई 7 / 11

आणविक संपत्ति भविष्यवाणी और QSAR: संकल्प, पीकेए और मॉडल सीमाएं

लाभ:

  • नियतात्मक रूप से गणना की गई सुविधाओं और सांख्यिकीय रूप से अनुमानित सुविधाओं के बीच अंतर करने और आत्मविश्वास के स्तर को निर्धारित करने की क्षमता
  • प्रयोज्यता डोमेन की अवधारणा का उपयोग करके उस क्षेत्र का मूल्यांकन करने की क्षमता जिसमें मॉडल विश्वसनीय है
  • यह समझने की क्षमता कि किसी को उम्मीदवारों को रैंक करने और प्रयोग के माध्यम से अंतिम निर्णय लेने के लिए विशेषता पूर्वानुमानों का उपयोग करना चाहिए।

किसी अणु को संश्लेषित करने से पहले, हम अक्सर पूछते हैं: "क्या यह पानी में घुलनशील है? यह कितना अम्लीय है? क्या यह कोशिका झिल्ली को पार करता है? क्या यह दवा के उम्मीदवार के रूप में उपयुक्त है?" प्रयोग से पहले इन प्रश्नों के उत्तर की भविष्यवाणी करने से बहुत समय बचता है। एआई और इसके विशेष मॉडल (विशेष रूप से क्यूएसएआर - मात्रात्मक संरचना-गतिविधि संबंध, यानी सांख्यिकीय मॉडल जो अणु के संरचनात्मक विवरणकों से एक संपत्ति की भविष्यवाणी करता है) इन भविष्यवाणियों में शक्तिशाली हैं। लेकिन ये भविष्यवाणियाँ संभाव्यता की भविष्यवाणियाँ हैं, माप नहीं। इस इकाई में, हम फीचर भविष्यवाणी, इसकी ताकत और सबसे महत्वपूर्ण अवधारणा, प्रयोज्यता क्षेत्र (वह क्षेत्र जहां मॉडल विश्वसनीय है) के बारे में जानेंगे।

किन विशेषताओं की भविष्यवाणी की गई है?

  • लॉगपी: अणु का तेल/जल विभाजन गुणांक; यह लिपोफिलिसिटी (वसा पसंद करना) दर्शाता है। दवा अवशोषण में महत्वपूर्ण.
  • घुलनशीलता (लॉगएस): यह पानी में कितना घुलनशील है।
  • पीकेए: अम्लता/क्षारीयता; वह pH जिस पर कोई समूह आयनित होता है।
  • टीपीएसए: टोपोलॉजिकल ध्रुवीय सतह क्षेत्र; इसका उपयोग पारगम्यता आकलन में किया जाता है।
  • लिपिंस्की "पांच का नियम": आणविक भार, लॉगपी, एच-बॉन्ड दाताओं की संख्या/मौखिक दवा उम्मीदवारों के स्वीकर्ता के लिए व्यावहारिक सीमाएं।

इनमें से कुछ मानों की गणना आरडीकिट जैसे उपकरणों के साथ नियतात्मक रूप से की जाती है (उदाहरण के लिए टीपीएसए, एच-बॉन्ड नंबर); उनमें से कुछ सांख्यिकीय अनुमान (लॉगएस, जैविक गतिविधि) हैं। इस अंतर को जानने से यह तय होता है कि आप कितना भरोसा करते हैं।

युक्ति: अंतर करें कि क्या कोई सुविधा "गणना की गई" (नियम-आधारित, दोहराने योग्य) है या "पूर्वानुमानित" (मॉडल से, अनिश्चित) है। गणनाओं में उच्च विश्वास रखें, भविष्यवाणियों में सतर्क विश्वास रखें और प्रयोग द्वारा भविष्यवाणियों को सत्यापित करें।

प्रयोज्यता का दायरा: सबसे महत्वपूर्ण अवधारणा

QSAR मॉडल उन अणुओं पर अच्छा काम करता है जो उन अणुओं के समान होते हैं जिन पर इसे प्रशिक्षित किया गया था। यदि आप एक अणु देते हैं जो प्रशिक्षण डेटा से बहुत अलग है (उदाहरण के लिए, एक बहुत बड़ा, असामान्य कंकाल), तो मॉडल अभी भी एक संख्या उत्पन्न करेगा, लेकिन वह संख्या अविश्वसनीय होगी। इसे "प्रयोज्यता के दायरे से बाहर होना" कहा जाता है। मॉडल हमेशा उत्तर देता है; यह बताना आपका काम है कि उत्तर विश्वसनीय है या नहीं।

यह तब और भी जोखिम भरा होता है जब भाषा मॉडल एक विशेषता मान देता है: यह बिना किसी अंतर्निहित गणना के संख्या को "संभावित दिखने वाले" मान के रूप में उत्पन्न करता है। इसलिए यदि संभव हो, तो सुविधा मान एक नियतात्मक उपकरण (RDKit) या QSAR मॉडल से प्राप्त करें जो अनिश्चितता देता है, भाषा मॉडल से नहीं।

चरण दर चरण: सुरक्षित सुविधा पूर्वानुमान

  1. अणु सत्यापित करें: RDKit (इकाई 2) के साथ पार्स स्माइल्स।
  2. नियतात्मक गणना करें: आरडीकिट से एमए, लॉगपी (गणना), टीपीएसए, एच-बॉन्ड संख्याएं।
  3. भविष्यवाणियों को अलग से चिह्नित करें: मॉडल पूर्वानुमान जैसे लॉगएस, गतिविधि इत्यादि को "भविष्यवाणी" टैग के साथ रखें।
  4. प्रयोज्यता डोमेन की जाँच करें: क्या अणु प्रशिक्षण डेटा जैसा दिखता है? क्या यह अत्यंत बड़ा/असामान्य है?
  5. रैंकिंग के लिए उपयोग करें, निर्णय के लिए नहीं: उम्मीदवारों को रैंक करने के लिए भविष्यवाणियों का उपयोग करें; अंतिम विकल्प प्रयोग है.
  6. प्रयोग द्वारा बंद करें: माप द्वारा महत्वपूर्ण गुणों (घुलनशीलता, पीकेए) को सत्यापित करें।

चार प्रतिलिपि योग्य टेम्पलेट

1) आरडीकिट के साथ नियतात्मक विशेषताएं:

rdkit आयात से Chemfrom rdkit.Chem आयात डिस्क्रिप्टर, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # एस्पिरिनप्रिंट("MA:", राउंड(डिस्क्रिप्टर.MolWt(mol),2))प्रिंट("logP (गणना):", राउंड(डिस्क्रिप्टर्स.मोललॉगपी(मोल),2))प्रिंट("टीपीएसए:", राउंड(डिस्क्रिप्टर्स.टीपीएसए(मोल),1))प्रिंट("एच-बॉन्ड डोनर:", आरडीमोलडिस्क्रिप्टर्स.कैल्कनमएचबीडी(मोल))प्रिंट("एच-बॉन्ड स्वीकर्ता:", आरडीमोलडिस्क्रिप्टर्स.कैल्कनमएचबीए(मोल))

2) लिपिंस्की नियम मूल्यांकन:

अणु (मुस्कान): [मुस्कान] कार्य: आरडीकिट से गणना की जाने वाली एमए, लॉगपी, एचबीडी, एचबीए मानों के साथ पांच के लिपिंस्की नियम के अनुपालन का मूल्यांकन करें। प्रत्येक मानदंड को अलग-अलग उत्तीर्ण/असफल के रूप में चिह्नित करें। नियम: संख्याएँ न बनाएँ; मैं इसे RDKit से प्राप्त करूंगा, आप टिप्पणी करें।

3) फ़ीचर अनुमान + अनिश्चितता अनुरोध:

अणु (मुस्कान): [मुस्कान]कार्य: पानी में घुलनशीलता (लॉगएस) (उच्च/मध्यम/निम्न) का गुणात्मक अनुमान दें और संरचनात्मक विशेषताओं के साथ तर्क समझाएं। सटीक संख्या न बताएं; बताएं कि यह एक भविष्यवाणी है और प्रयोग द्वारा इसकी पुष्टि की जानी चाहिए। यदि अणु में असामान्य संरचना (प्रयोज्यता जोखिम) हो तो चेतावनी दें।

4) उम्मीदवार रैंकिंग (भविष्यवाणी द्वारा प्राथमिकता):

नीचे 5 अणुओं की मुस्कुराहट दी गई है। कार्य: संरचनात्मक विशेषताओं (ध्रुवीय समूहों, रिंगों, लिपोफिलिसिटी की संख्या) के आधार पर उन्हें पानी में घुलनशीलता (सबसे कम से कम घुलनशील) के आधार पर रैंक करें। प्रत्येक रैंकिंग निर्णय के लिए औचित्य लिखें। नोट: यह एक प्रारंभिक प्रकार है; अंतिम चयन माप द्वारा किया जाएगा.

कमजोर संकेत/मजबूत संकेत

कमज़ोर:

इस अणु की घुलनशीलता क्या है?

एआई एक संख्या बनाता है जो गणना के तहत मौजूद नहीं है (उदाहरण के लिए "12 मिलीग्राम/एमएल"); यह आत्मविश्वास तो देता है लेकिन गलत भी हो सकता है।

मजबूत:

अणु (मुस्कान): [मुस्कान]। कार्य: 1) मैं आरडीकिट के साथ गणना करने के लिए लॉगपी, टीपीएसए, एचबीडी/एचबीए दूंगा: [मूल्य]। 2) इन मूल्यों के आधार पर, व्याख्या करें कि क्या रिज़ॉल्यूशन उच्च/मध्यम/निम्न है।3) सटीक संख्या देना; बताएं कि यह एक अनुमान है और प्रयोग की आवश्यकता है।

अंतर: हमने वाहन से नियतिवादी मान लिया और एआई को केवल उनकी व्याख्या करने के लिए कहा; हमने स्पष्ट रूप से अनिश्चितता और प्रयोग की आवश्यकता के बारे में पूछा।

फ़ीचर प्रकार और विश्वास स्तर

सुविधा

कैसे प्राप्त करें

विश्वास

नोट

आणविक भार

आरडीकिट (नियतात्मक)

बहुत ऊँचा

सूत्र से काटें

टीपीएसए, एचबीडी/एचबीए

आरडीकिट (नियतात्मक)

उच्च

नियम आधारित

लॉगपी (गणना)

आरडीकिट मॉडल

मध्यम-उच्च

प्रयोगात्मकता से भटक सकते हैं

लॉगएस (रिज़ॉल्यूशन)

QSAR अनुमान

मध्यम

प्रयोज्यता के क्षेत्र पर निर्भर करता है

पीकेए

विशेष मॉडल

मध्यम

यह एक जटिल संरचना में पड़ता है

जैविक गतिविधि

क्यूएसएआर/एमएल

परिवर्तनीय

परीक्षण एवं सत्यापन अवश्य करें

छोटे मामले

केस 1 - फिट किए गए रिज़ॉल्यूशन की संख्या। एक छात्र ने एआई से एक यौगिक की घुलनशीलता के बारे में पूछा; उन्हें उत्तर "25 मिलीग्राम/एमएल" मिला और उन्होंने तदनुसार प्रयोगात्मक डिज़ाइन स्थापित किया। माप में वास्तविक मान ~2 मिलीग्राम/एमएल था, जो 10 गुना अंतर था। एआई ने नंबर बनाया था. पाठ: रिज़ॉल्यूशन जैसे गुणों को भाषा मॉडल से संख्याओं के रूप में न लें; गुणात्मक भविष्यवाणी + माप।

केस 2 - प्रयोज्यता के दायरे से बाहर। एक QSAR मॉडल ने कहा कि एक बड़े मैक्रोमोलेक्यूल के लिए "गतिविधि उच्च है" जो प्रशिक्षण सेट से बहुत अलग थी। उपयोगकर्ता ने देखा कि अणु प्रशिक्षण डेटा जैसा नहीं था और भविष्यवाणी को अविश्वसनीय माना; प्रयोग ने वास्तव में कम गतिविधि दी। पाठ: मॉडल हमेशा प्रतिक्रिया देता है; यदि यह दायरे से बाहर है, तो उत्तर बेकार है।

केस 3 - लिपिंस्की का सही उपयोग। एक उम्मीदवार अणु पर, एआई ने आरडीकिट के मूल्यों के साथ लिपिंस्की का मूल्यांकन किया: एमए 512 (>500, सीमा रेखा), लॉगपी 4.8 (अनुकूल), एचबीडी 2, एचबीए 7। उपयोगकर्ता ने सही ढंग से व्याख्या की "एक मानदंड बना हुआ है लेकिन नियम पूर्ण नहीं है" और अणु को पूरी तरह से समाप्त नहीं किया। पाठ: नियम दिशानिर्देश हैं, सीमाएं नहीं; सन्दर्भ सहित व्याख्या करें।

सामान्य गलतियाँ

  • भाषा मॉडल से फीचर गणना प्राप्त करना। जिन मूल्यों की गणना नहीं की जाती है वे मनगढ़ंत हैं; अनिश्चितता के साथ नियतिवादी उपकरण या मॉडल का उपयोग करें।
  • प्रयोज्यता के क्षेत्र की अनदेखी. मॉडल प्रत्येक अणु के लिए संख्याएँ उत्पन्न करता है; मैदान के बाहर अविश्वसनीय.
  • एक अनुमानित माप पर विचार करते हुए. लॉगएस एक अनुमान है; यह प्रायोगिक समाधान का विकल्प नहीं है।
  • लिपिंस्की को पूर्ण नियम मानते हुए। जो उम्मीदवार सीमा पर है उसे स्वतः समाप्त नहीं किया जाता है; कई दवाएं नियम का उल्लंघन करती हैं।
  • "गणना" को "अनुमानित" के साथ भ्रमित करना। टीपीएसए की गणना (विश्वसनीय) की जाती है, गतिविधि का अनुमान लगाया जाता है (अनिश्चित)।
सावधानी: फ़ीचर पूर्वानुमान उम्मीदवारों की रैंकिंग और प्राथमिकता तय करने के लिए बहुत अच्छे हैं; लेकिन अकेले कोई निर्णय निर्धारित नहीं करना चाहिए। "मॉडल ने कहा घुलनशील" एक परिकल्पना है; "मैंने मापा, यह घुल गया" एक परिणाम है।

संक्षेप में

  • प्रयोग से पहले आणविक गुणों की भविष्यवाणी की जा सकती है और बहुत समय बचाया जा सकता है।
  • कुछ विशेषताओं की गणना नियतात्मक रूप से की जाती है (एमए, टीपीएसए, एचबीडी/एचबीए), कुछ सांख्यिकीय अनुमान (लॉगएस, गतिविधि) हैं।
  • प्रयोज्यता का क्षेत्र सबसे महत्वपूर्ण अवधारणा है: मॉडल हमेशा उत्तर देता है, लेकिन डोमेन के बाहर अविश्वसनीय है।
  • फ़ीचर संख्याएँ RDKit या अस्पष्टता मॉडल से प्राप्त करें, भाषा मॉडल से नहीं।
  • उम्मीदवारों को रैंक देने के लिए पूर्वानुमानों का उपयोग करें; प्रयोग करके अंतिम निर्णय लें.

आवेदन कार्य

पांच अणुओं का चयन करें (उदाहरण के लिए एक दवा श्रृंखला)। आरडीकिट के साथ प्रत्येक के लिए एमए, लॉगपी, टीपीएसए, एचबीडी, एचबीए की गणना करें और लिपिंस्की का मूल्यांकन करें। अलग से, एआई से प्रत्येक अणु की घुलनशीलता का गुणात्मक अनुमान (संख्या नहीं) और प्रयोज्यता चेतावनी के क्षेत्र के लिए पूछें। एक तालिका में नियतात्मक मान और AI भविष्यवाणियाँ एकत्रित करें। कौन सा अणु सबसे अधिक दवा जैसी प्रोफ़ाइल देता है? अनिश्चितता सबसे अधिक कहाँ है?

जांच सूची

  • [ ] मैं नियतात्मक गणना और अनुमानित गुणों के बीच अंतर करता हूं।
  • [ ] मुझे संपत्ति मूल्य आरडीकिट/मॉडल से मिल रहे हैं, भाषा मॉडल से नहीं।
  • [ ] मैं अणुओं को प्रयोज्यता के दायरे से बाहर देखता हूं।
  • [ ] मैं लिपिंस्की को एक मार्गदर्शक के रूप में उपयोग करता हूं, पूर्ण नियम के रूप में नहीं।
  • [ ] मैं रैंकिंग के लिए भविष्यवाणियों और प्रयोग के लिए निर्णय का उपयोग करता हूं।
  • [ ] मेरे पास माप द्वारा महत्वपूर्ण विशेषताओं को सत्यापित करने की योजना है।