इकाइयाँ
1. रसायन विज्ञान में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, मान्यता और नैतिकता 2. आणविक प्रतिनिधित्व और रासायनिक संरचना: SMILES, InChI और RDKit के साथ सत्यापन 3. प्रतिक्रिया भविष्यवाणी और तंत्र: उत्पाद, स्थिति और प्रतिकूल प्रतिक्रिया भविष्यवाणी 4. स्पेक्ट्रम व्याख्या समर्थन: एनएमआर, आईआर और मास स्पेक्ट्रोमेट्री 5. साहित्य समीक्षा और संश्लेषण योजना: स्रोत, प्रक्रिया और रोडमैप 6. रासायनिक डेटा विश्लेषण और पायथन: पांडा, स्टोइकोमेट्री और कैलिब्रेशन 7. आणविक संपत्ति भविष्यवाणी और QSAR: संकल्प, पीकेए और मॉडल सीमाएं 8. प्रयोगशाला दस्तावेज़ीकरण: प्रयोग नोटबुक, ईएलएन और प्रतिलिपि प्रस्तुत करने योग्यता 9. सुरक्षा और ख़तरे का आकलन: जीएचएस, एसडीएस और कृत्रिम बुद्धिमत्ता की सीमाएँ 10. पुष्टिकरण, मतिभ्रम, और वैज्ञानिक अखंडता 11. प्रयोग में मानव: नैतिकता, गोपनीयता, जिम्मेदारी और शुरू से अंत तक कार्यप्रवाह
इकाई 2 / 11

आणविक प्रतिनिधित्व और रासायनिक संरचना: SMILES, InChI और RDKit के साथ सत्यापन

लाभ:

  • अणुओं को नाम से नहीं बल्कि संरचना प्रतिनिधित्व के आधार पर पहचानने की क्षमता (मनुष्यों के साथ मुस्कुराहट, डेटाबेस के साथ InChI/InChIKey)
  • आरडीकिट के साथ कृत्रिम बुद्धिमत्ता द्वारा दी गई प्रत्येक मुस्कान को पार्सिंग, सत्यापन और कैनोनिकलाइज़ करके अमान्य या गलत संरचनाओं का पता लगाने की क्षमता
  • यह समझने में सक्षम होना कि आणविक भार और सूत्र जैसी नियतात्मक मात्राएँ नियम-आधारित उपकरण से प्राप्त की जानी चाहिए, भाषा मॉडल से नहीं।

रसायन विज्ञान में एआई को सुरक्षित रूप से उपयोग करने की पहली शर्त अणु को ऐसी भाषा में लिखना है जिसे मशीन और मानव दोनों समझ सकें। आप कहते हैं "फिनोल", एआई इसे सही मानता है; लेकिन जब आप "एसिड" कहते हैं तो हजारों संभावनाएं होती हैं। नाम अस्पष्ट हैं; संरचना निरूपण सटीक हैं। इस इकाई में, हम दो बुनियादी संकेतन सीखेंगे जो अणु को पाठ में अनुवादित करते हैं (SMILES और InChI) और वह उपकरण जो उन्हें नियतात्मक रूप से सत्यापित करता है (RDKit)। हमारा लक्ष्य: एआई को अणु इस तरह से देना कि वह कभी गलत न समझे, और एक उपकरण के साथ एआई द्वारा निर्मित संरचना की पुष्टि करना।

मुस्कान क्या है?

स्माइल्स (सरलीकृत आणविक-इनपुट लाइन-एंट्री सिस्टम) पाठ की एक पंक्ति में एक अणु लिखने का एक प्रारूप है। परमाणुओं को अक्षरों द्वारा, बंधों को प्रतीकों द्वारा और वलय को संख्याओं द्वारा दर्शाया जाता है। उदाहरण:

  • इथेनॉल: CCO (कार्बन-कार्बन-ऑक्सीजन; हाइड्रोजन अंतर्निहित)।
  • बेंजीन: c1cccccc1 (लोअरकेस "सी" सुगंधित कार्बन को इंगित करता है; 1 रिंग को बंद करता है)।
  • एस्पिरिन: CC(=O)Oc1cccccc1C(=O)O.
  • कैफीन: Cn1cnc2c1c(=O)n(C)c(=O)n2C।

SMILES की शक्ति यह है कि यह संपूर्ण लिंक संरचना को एक ही पंक्ति में ले जाती है; इसकी कमजोरी यह है कि एक ही अणु में कई वैध मुस्कान हो सकती हैं (इसे गैर-विहितता कहा जाता है)। हम इसे RDKit के साथ एक पल में हल कर देंगे।

संकेत: किसी अणु के लिए "कैनोनिकल स्माइल्स" उस अणु के लिए एकल, मानक वर्तनी है। यह देखने के लिए कि क्या दो मुस्कान एक ही अणु हैं, उन्हें विहित करें और उनकी तुलना करें; उन्हें पाठ्य रूप से समान नहीं होना चाहिए, बल्कि उन्हें समान अणु होना चाहिए।

InChI क्या है?

InChI (इंटरनेशनल केमिकल आइडेंटिफ़ायर) IUPAC द्वारा विकसित एक मानक पहचानकर्ता है। SMILES से अंतर यह है कि एक ही अणु हमेशा एक ही InChI देता है; अर्थात्, यह प्रकृति में विहित है। यह लंबा है और पढ़ने में कठिन है, लेकिन डेटाबेस मिलान के लिए आदर्श है। खोज के लिए संक्षिप्त रूप से "InChIKey" (27-वर्ण डाइजेस्ट) का उपयोग किया जाता है।

  • एस्पिरिन InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-एन।

नियम: लोग SMILES बोलते हैं (पढ़ते हैं), मशीनें और डेटाबेस InChI/InChIKey (सटीक) से मेल खाते हैं। एआई को मुस्कान दें; InChIKey के साथ डेटाबेस में पुष्टि करें।

आरडीकिट: नियतात्मक सत्यापन इंजन

आरडीकिट एक खुला स्रोत रसायन सूचना विज्ञान पुस्तकालय है। भाषा मॉडल के विपरीत, यह नियम-आधारित है: मुस्कुराहट को पार्स करता है, आणविक भार की गणना करता है, विहित मुस्कुराहट उत्पन्न करता है, InChI/InChIKey लौटाता है, अणु खींचता है। तो RDKit "गणना" करता है कि AI क्या "भविष्यवाणी" करता है। यह वर्कफ़्लो का हृदय है: AI उत्पन्न करता है, RDKit सत्यापित करता है।

एक बुनियादी सत्यापन प्रवाह:

rdkit आयात से Chemfrom rdkit.Chem आयात डिस्क्रिप्टर, ड्रॉस्माइल्स = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) प्रिंट("आणविक सूत्र:", Chem.rdMolDescriptors.calcMolFormula(mol)) प्रिंट("आणविक भार:", राउंड(Descriptors.MolWt(mol), 2), "g/mol") प्रिंट करें ("InChIKey:", Chem.MolToInchiKey(mol))

यदि MolFromSmiles कोई नहीं लौटाता है, तो AI ने आपको एक अमान्य अणु दिया है; यह अकेली एक बहुत मूल्यवान चेतावनी है। यदि मान्य है, तो अब आपको आणविक भार के लिए भाषा मॉडल से पूछने की आवश्यकता नहीं है; यह निश्चित रूप से आपके हाथ में है।

चरण दर चरण: AI + RDKit इंटरऑपरेशन

  1. अणु को पहचानें: एआई को नाम दें, मुस्कुराहट के लिए पूछें। उदाहरण के लिए, "पेरासिटामोल के लिए विहित मुस्कान सत्यापित करें।"
  2. सत्यापित करें: MolFromSmiles के साथ आने वाली मुस्कुराहट को पार्स करें। यदि कोई नहीं, तो अस्वीकार करें।
  3. Canonicalize: MolToSmiles के साथ विहित वर्तनी पुनर्प्राप्त करें; अब से हमेशा इसका प्रयोग करें.
  4. संख्याओं की गणना करें: आणविक भार, सूत्र, छल्लों की संख्या, हाइड्रोजन बांड दाताओं/स्वीकर्ता की संख्या आदि आरडीकिट से प्राप्त करें, एआई से नहीं।
  5. आईडी ठीक करें: InChIKey जेनरेट करें, डेटाबेस (PubChem) में खोजें, पुष्टि करें कि अणु वास्तव में वही यौगिक है जो आप चाहते हैं।

चार प्रतिलिपि योग्य टेम्पलेट

1) मुस्कुराहट का अनुरोध (संज्ञा से संरचना तक):

कार्य: निम्नलिखित यौगिक के लिए विहित मुस्कान दें। यौगिक: पेरासिटामोल (एसिटामिनोफेन)। नियम: केवल SMILES स्ट्रिंग और InChIKey दें, कोई और स्पष्टीकरण न जोड़ें। यदि आप निश्चित नहीं हैं, तो "अनिश्चित" लिखें, मनमुटाव न करें।

2) स्माइल्स सत्यापन अनुरोध (संरचना से नियंत्रण तक):

नीचे दी गई मुस्कान की जांच करें: CC(=O)Nc1ccc(O)cc1प्रश्न:1) क्या यह वैध मुस्कान है?2) यह किस यौगिक से मेल खाता है (सामान्य नाम)?3) आणविक सूत्र क्या है?नोट: मैं RDKit के साथ सटीक आणविक भार की गणना करूंगा; आप बस अपनी संरचना व्याख्या दीजिए।

3) दो अभ्यावेदन की तुलना करना:

मेरे पास दो मुस्कान हैं:ए) ओसीसीबी) सीसीओकार्य: क्या ये एक ही अणु हैं या अलग-अलग हैं? अपना तर्क लिखें। नोट: मैं आपके उत्तर को आरडीकिट में कैनोनिकलाइज़ करके क्रॉस-चेक करूंगा।

4) संरचना स्पष्टीकरण (सीखने के उद्देश्यों के लिए):

मुस्कान: Cn1cnc2c1c(=O)n(C)c(=O)n2CTकार्य: इस मुस्कान को टुकड़े-टुकड़े करके पढ़ें और स्पष्ट करें कि सादे तुर्की में प्रत्येक प्रतीक का क्या अर्थ है (परमाणु, बंधन, अंगूठी, सुगंध)। यह भी बताइये कि यह कौन सा यौगिक है।

कमजोर संकेत/मजबूत संकेत

कमज़ोर:

एसिटामिनोफेन के गुण बताइये।

"फ़ीचर" अस्पष्ट है; एआई आणविक भार से लेकर गलनांक तक यादृच्छिक संख्याएं उत्पन्न करता है, जिनमें से कुछ गलत होंगी।

मजबूत:

यौगिक: एसिटामिनोफेन.1) कैनोनिकल स्माइल्स और इनचिकी वर्.2) आणविक सूत्र दें। नियम: आणविक भार, गलनांक आदि जैसे संख्यात्मक मान न दें; मैं उन्हें RDKit/PubChem के साथ प्राप्त करूंगा। बस बिल्ड आईडी दीजिए.

अंतर: हमने एआई को उस ओर निर्देशित किया जिसमें वह (संरचना पहचान) मजबूत है और जहां वह कमजोर है (प्रयोगात्मक संख्याएं) उससे दूर।

छापों की तुलना

सुविधा

मुस्कान

InChI / InChIKey

पठनीयता

उच्च (लोगों के अनुकूल)

निम्न (मशीन अनुकूल)

विहितता

परिवर्तन के अधीन (विमुद्रीकरण की आवश्यकता है)

स्वाभाविक रूप से एकल

उपयोग

मानव संचार, ड्राइंग, इनपुट

डेटाबेस मिलान, पहचान

स्टीरियोकैमिस्ट्री

समर्थन (@ प्रतीक)

समर्थन (स्तरित)

एआई को देने के लिए

आदर्श

पुष्टि के लिए आदर्श

छोटे मामले

केस 1 - दो नाम, एक अणु। एक छात्र ने सोचा कि "एन-एसिटाइल-पैरा-एमिनोफेनोल" और "पैरासिटामोल" अलग-अलग यौगिक थे और उन्होंने दो अलग-अलग प्रयोगों की योजना बनाई। जब RDKit में उनकी मुस्कान को विहित किया गया, तो वे दोनों CC(=O)Nc1ccc(O)cc1 निकले; यह वही अणु था. खोया: योजना का आधा दिन; लाभ: 2 मिनट की कैनोनिकलाइज़ेशन जांच से बचा जा सकता था।

केस 2 - अमान्य मुस्कान कैप्चर। AI ने एक प्रकार के लिए CC(=O)Nc1ccc(O)cc1C( लौटाया (ब्रैकेट बंद नहीं हैं)। छात्र ने MolFromSmiles चलाया, इसने कोई नहीं लौटाया, तुरंत त्रुटि देखी और सही SMILES का अनुरोध किया। सत्यापन के बिना, दोषपूर्ण संरचना सभी खातों में फैल गई होती।

केस 3 - गलत आणविक भार। YZ ने इबुप्रोफेन (C13H18O2) के लिए "आणविक भार 214.3 g/mol" कहा। RDKit गणना ने 206.28 g/mol दिया। 0.1 मोल के लिए अंतर: YZ के साथ 21.43 ग्राम, वास्तव में 20.63 ग्राम। 3.9% का यह अंतर स्टोइकोमेट्री और उपज गणना को बाधित करेगा। यह नियतिवादी कलन लेकर आया।

सामान्य गलतियाँ

  • अणु को नाम से देना. समानार्थक शब्द/व्यापार नाम भ्रमित हैं। हमेशा मुस्कुराहट या InChI शामिल करें।
  • मुस्कान को विहित किये बिना उसकी तुलना करना। OCC और CCO पाठ में भिन्न हैं लेकिन अणुओं में समान हैं।
  • जीभ मॉडल से आणविक भार पूछना। यह एक नियतिवादी गणना है; यह RDKit से या मैन्युअल रूप से सूत्र से किया जाता है।
  • अमान्य मुस्कान पर ध्यान नहीं दिया जा रहा। MolFromSmiles None के रिटर्न की जाँच नहीं करना और गलत संरचना जारी रखना।
  • स्टीरियोकैमिस्ट्री की उपेक्षा करना। दो एनैन्टीओमर्स (मिरर इमेज आइसोमर्स) अलग-अलग जैविक प्रभाव प्रदर्शित कर सकते हैं; SMILES में @/@@ चिह्नों को छोड़ना।
ध्यान दें: एक ही आणविक सूत्र का मतलब अलग-अलग अणु नहीं है। C2H6O इथेनॉल (CCO) और डाइमिथाइल ईथर (COC) दोनों है। सूत्र की समानता पहचान की समानता नहीं है; पहचान के लिए InChIKey का उपयोग करें.

संक्षेप में

  • अणुओं को नाम से नहीं, बल्कि संरचना संकेतन से पहचानें: मानव के साथ मुस्कान, डेटाबेस के साथ InChI/InChIKey।
  • आरडीकिट नियतिवादी है; एआई भविष्यवाणी करता है, आरडीकिट गणना और सत्यापन करता है।
  • प्रत्येक AI SMILES को MolFromSmiles के साथ पार्स करें और कोई नहीं के लिए जाँच करें, फिर कैनोनिकलाइज़ करें।
  • आणविक भार और सूत्र जैसी संख्याएँ RDKit से प्राप्त करें, भाषा मॉडल से नहीं।
  • सूत्र समानता का अर्थ आणविक पहचान नहीं है; पहचान के लिए InChIKey का उपयोग करें.

आवेदन कार्य

तीन यौगिक चुनें (जैसे कैफीन, इबुप्रोफेन, ग्लाइसीन)। प्रत्येक के लिए विहित मुस्कान के लिए AI से पूछें। फिर एक RDKit स्क्रिप्ट लिखें (उपरोक्त टेम्पलेट का उपयोग करें) और उत्पन्न करें: विहित मुस्कान, आणविक सूत्र, आणविक भार, InChIKey। AI द्वारा दी गई कितनी मुस्कान वैध थीं? यदि YZ ने आणविक भार भी दिया है, तो RDKit मान के साथ प्रतिशत के रूप में अंतर की गणना करें। अपने निष्कर्षों को एक छोटी तालिका में आलेखित करें।

चेकलिस्ट

  • [ ] मुझे पता है कि SMILES और InChI/InChIKey क्या हैं और उनका उपयोग कब करना है।
  • [ ] मैं AI द्वारा दी गई प्रत्येक मुस्कान को MolFromSmiles से सत्यापित करता हूं।
  • [ ] मैं तुलना करने से पहले मुस्कुराहट को प्रामाणिक बनाता हूं।
  • [ ] मुझे आणविक भार और सूत्र आरडीकिट से मिल रहा है, भाषा मॉडल से नहीं।
  • [ ] मैं InChIKey के साथ डेटाबेस में अणु पहचान की पुष्टि करता हूं।
  • [ ] मैं उन स्थितियों को जानता हूं जहां स्टीरियोकेमिस्ट्री महत्वपूर्ण है।