एकाइहरू
1. रसायन विज्ञानमा कृत्रिम बुद्धिमत्ताको परिचय: भूमिका, सीमा, प्रमाणीकरण र नैतिकता 2. आणविक प्रतिनिधित्व र रासायनिक संरचना: SMILES, InChI र RDKit सँग प्रमाणीकरण 3. प्रतिक्रिया भविष्यवाणी र संयन्त्र: उत्पादन, अवस्था र प्रतिकूल प्रतिक्रिया भविष्यवाणी 4. स्पेक्ट्रम व्याख्या समर्थन: NMR, IR र मास स्पेक्ट्रोमेट्री 5. साहित्य समीक्षा र संश्लेषण योजना: स्रोत, प्रक्रिया र मार्गचित्र 6. रासायनिक डाटा विश्लेषण र पाइथन: पाण्डा, स्टोइचियोमेट्री र क्यालिब्रेसन 7. आणविक सम्पत्ति भविष्यवाणी र QSAR: संकल्प, pKa र मोडेल सीमा 8. प्रयोगशाला कागजात: प्रयोग नोटबुक, ELN र पुन: उत्पादन क्षमता 9. सुरक्षा र जोखिम मूल्याङ्कन: GHS, SDS र कृत्रिम बुद्धिमत्ताको सीमाहरू 10. पुष्टिकरण, भ्रम, र वैज्ञानिक अखण्डता 11. प्रयोगमा मानव: नैतिकता, गोपनीयता, जिम्मेवारी र अन्त-देखि-अन्त कार्यप्रवाह
एकाइ 2 / 11

आणविक प्रतिनिधित्व र रासायनिक संरचना: SMILES, InChI र RDKit सँग प्रमाणीकरण

लाभ:

  • नामबाट होइन तर संरचना प्रतिनिधित्वद्वारा अणुहरू पहिचान गर्ने क्षमता (मानिसहरूसँग मुस्कान, डाटाबेसको साथ InChI/InChIKey)
  • RDKit सँग आर्टिफिसियल इन्टेलिजेन्सद्वारा दिइएको प्रत्येक मुस्कानलाई पार्स, प्रमाणीकरण र प्रमाणीकरण गरेर अवैध वा गलत संरचनाहरू पत्ता लगाउने क्षमता।
  • आणविक तौल र सूत्र जस्ता निर्धारणात्मक मात्राहरू भाषा मोडेलबाट होइन, नियम-आधारित उपकरणबाट प्राप्त गरिनुपर्छ भन्ने कुरा बुझ्न सक्षम हुनु।

रसायनशास्त्रमा AI सुरक्षित रूपमा प्रयोग गर्नको लागि पहिलो सर्त भनेको अणुलाई मेसिन र मानव दुवैले बुझ्न सक्ने भाषामा लेख्नु हो। तपाइँ "फिनोल" भन्नुहुन्छ, AI ले यो सही हुन्छ; तर जब तपाइँ "एसिड" भन्नुहुन्छ त्यहाँ हजारौं सम्भावनाहरू छन्। नामहरू अस्पष्ट छन्; संरचना प्रतिनिधित्व सटीक छन्। यस एकाइमा, हामी दुई आधारभूत नोटेशनहरू सिक्नेछौं जसले अणुलाई पाठ (SMILES र InChI) मा अनुवाद गर्दछ र तिनीहरूलाई निश्चित रूपमा प्रमाणित गर्ने उपकरण (RDKit)। हाम्रो लक्ष्य: अणुलाई AI लाई कहिल्यै गलत नबुझ्ने तरिकामा दिनु, र उपकरणको साथ AI द्वारा उत्पादित संरचना पुष्टि गर्न।

मुस्कान भनेको के हो?

SMILES (सरलीकृत आणविक-इनपुट लाइन-प्रविष्टि प्रणाली) पाठको एकल लाइनमा अणु लेख्ने ढाँचा हो। परमाणुहरू अक्षरहरू, बन्डहरू प्रतीकहरू, र अंकहरूद्वारा औंठीहरूद्वारा प्रतिनिधित्व गरिन्छ। उदाहरणहरू:

  • इथानोल: CCO (कार्बन–कार्बन–अक्सिजन; हाइड्रोजन निहित)।
  • बेन्जिन: c1cccc1 (लोअरकेस "c" ले सुगन्धित कार्बनलाई संकेत गर्छ; 1 को घण्टी बन्द गर्नुहोस्)।
  • एस्पिरिन: CC(=O)Oc1cccc1C(=O)O।
  • क्याफिन: Cn1cnc2c1c(=O)n(C)c(=O)n2C।

SMILES को शक्ति यो हो कि यसले सम्पूर्ण लिङ्क संरचनालाई एकल रेखामा बोक्छ; यसको कमजोरी यो हो कि एउटै अणुमा धेरै मान्य SMILES हुन सक्छ (यसलाई गैर-प्रामाणिकता भनिन्छ)। हामी यसलाई एक क्षणमा RDKit मार्फत समाधान गर्नेछौं।

संकेत: एक अणुको लागि "प्रामाणिक SMILES" त्यो अणुको लागि एकल, मानक हिज्जे हो। दुई मुस्कान एउटै अणु हो कि भनेर हेर्न, तिनीहरूलाई क्यानोनिकलाइज गर्नुहोस् र तुलना गर्नुहोस्; तिनीहरू पाठ्य रूपमा बराबर हुनु हुँदैन, तर तिनीहरू बराबर अणुहरू हुनुपर्छ।

InChI के हो?

InChI (अन्तर्राष्ट्रिय केमिकल आइडेन्टिफायर) IUPAC द्वारा विकसित एक मानक पहिचानकर्ता हो। SMILES बाट फरक यो हो कि एउटै अणुले सधैं उही InChI दिन्छ; अर्थात्, यो प्रकृतिमा प्रामाणिक छ। यो लामो र पढ्न गाह्रो छ, तर डाटाबेस मिलानको लागि आदर्श हो। संक्षिप्त "InChIKey" (27-अक्षर डाइजेस्ट) खोजी गर्न प्रयोग गरिन्छ।

  • एस्पिरिन InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N।

नियम: मानिसहरू SMILES बोल्छन् (पढ्छन्), मेसिन र डाटाबेसहरू InChI/InChIKey (ठ्याक्कै) मिल्छन्। AI लाई मुस्कान दिनुहोस्; InChIKey को साथ डेटाबेसमा पुष्टि गर्नुहोस्।

RDKit: deterministic प्रमाणिकरण इन्जिन

RDKit एक खुला स्रोत रसायनशास्त्र पुस्तकालय हो। भाषा मोडेलको विपरीत, यो नियम-आधारित छ: SMILES पार्स गर्दछ, आणविक वजन गणना गर्दछ, क्यानोनिकल SMILES उत्पन्न गर्दछ, InChI/InChIKey फर्काउँछ, अणु कोर्छ। त्यसोभए RDKit ले एआईले "भविष्यवाणी" गरेको कुरा "गणना" गर्छ। यो कार्यप्रवाहको मुटु हो: AI उत्पन्न गर्दछ, RDKit प्रमाणित गर्दछ।

आधारभूत प्रमाणीकरण प्रवाह:

rdkit import Chemfrom rdkit.Chem आयात वर्णनकर्ताहरू, Drawsmiles = "CC(=O)Oc1cccc1C(=O)O" Chem.MolToSmiles(mol)) प्रिन्ट("आणविक सूत्र:", Chem.rdMolDescriptors.CalcMolFormula:"वजन:"मोल) राउन्ड(Desscriptors.MolWt(mol), 2), "g/mol") प्रिन्ट("InChIKey:", Chem.MolToInchiKey(mol))

यदि MolFromSmiles ले कुनै पनि फिर्ता गर्दैन भने, AI ले तपाईंलाई अवैध अणु दिएको छ; यो एक्लै एक धेरै मूल्यवान चेतावनी हो। यदि मान्य छ भने, तपाईंले अब आणविक वजनको लागि भाषा मोडेल सोध्नु पर्दैन; यो तपाईंको हातमा निश्चित रूपमा छ।

चरणबद्ध रूपमा: AI + RDKit अन्तरक्रिया

  1. अणु पहिचान गर्नुहोस्: AI लाई नाम दिनुहोस्, SMILES सोध्नुहोस्। उदाहरणका लागि, "पारासिटामोलको लागि क्यानोनिकल SMILES प्रमाणित गर्नुहोस्।"
  2. पुष्टि गर्नुहोस्: MolFromSmiles सँग आगमन SMILES पार्स गर्नुहोस्। यदि छैन भने, अस्वीकार गर्नुहोस्।
  3. Canonicalize: MolToSmiles को साथ क्यानोनिकल हिज्जे पुन: प्राप्त गर्नुहोस्; अब देखि सधैं यो प्रयोग गर्नुहोस्।
  4. संख्याहरू गणना गर्नुहोस्: AI बाट होइन, RDKit बाट आणविक वजन, सूत्र, औंठीहरूको संख्या, हाइड्रोजन बन्ड दाता/स्वीकारकर्ताहरूको संख्या आदि प्राप्त गर्नुहोस्।
  5. फिक्स ID: InChIKey उत्पन्न गर्नुहोस्, डाटाबेस (PubChem) मा खोज्नुहोस्, पुष्टि गर्नुहोस् कि अणु वास्तवमै तपाईले चाहानु भएको कम्पाउन्ड हो।

चार प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

1) मुस्कान अनुरोध गर्दै (संज्ञा देखि संरचना सम्म):

कार्य: निम्न कम्पाउन्डको लागि प्रामाणिक मुस्कान दिनुहोस्। यौगिक: प्यारासिटामोल (एसिटामिनोफेन)। नियम: SMILES स्ट्रिङ र InChIKey मात्र दिनुहोस्, थप व्याख्या थप नगर्नुहोस्। यदि तपाइँ निश्चित हुनुहुन्न भने, "UNSURE" लेख्नुहोस्, मेकअप नगर्नुहोस्।

2) SMILES प्रमाणीकरण अनुरोध (संरचना देखि नियन्त्रण सम्म):

तलको मुस्कानहरू जाँच गर्नुहोस्: CC(=O)Nc1ccc(O)cc1 प्रश्नहरू:1) के यो मान्य SMILES हो? 2) यो कुन कम्पाउन्डसँग मेल खान्छ (सामान्य नाम)? 3) आणविक सूत्र के हो? नोट: म RDKit मार्फत सही आणविक वजन गणना गर्नेछु; तपाईले आफ्नो संरचनाको व्याख्या मात्र दिनुहोस्।

3) दुई प्रतिनिधित्व तुलना:

मसँग दुई मुस्कानहरू छन्: A) OCCB) CCOTask: यी एउटै अणु वा फरक छन्? तपाईंको तर्क लेख्नुहोस्।नोट: म तपाईंको जवाफलाई RDKit मा क्यानोनिकलाइज गरेर क्रस-चेक गर्नेछु।

4) संरचना स्पष्टीकरण (सिक्ने उद्देश्यका लागि):

मुस्कान: Cn1cnc2c1c(=O)n(C)c(=O)n2CTask: यो SMILES टुक्रा टुक्रा टुक्रा पढ्नुहोस् र स्पष्ट टर्कीमा प्रत्येक प्रतीकको अर्थ (परमाणु, बन्धन, घण्टी, सुगन्ध) के हो भनेर व्याख्या गर्नुहोस्। यो कुन कम्पाउन्ड हो भनेर पनि बताउनुहोस्।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर:

एसिटामिनोफेन को गुण दिनुहोस्।

"सुविधा" अस्पष्ट छ; AI ले आणविक वजन देखि पिघलने बिन्दु सम्म अनियमित संख्या उत्पन्न गर्दछ, जस मध्ये केहि गलत हुनेछ।

बलियो:

यौगिक: acetaminophen.1) क्यानोनिकल SMILES र InChIKey ver.2) आणविक सूत्र दिनुहोस्। नियम: आणविक वजन, पग्लने बिन्दु, आदि जस्ता संख्यात्मक मानहरू नदिनुहोस्; म तिनीहरूलाई RDKit/PubChem मार्फत प्राप्त गर्नेछु। केवल निर्माण आईडी दिनुहोस्।

भिन्नता: हामीले AI लाई यो कुन कुरामा बलियो छ (संरचना पहिचान) तर्फ निर्देशित गर्‍यौं र कुन कुरामा कमजोर छ (प्रयोगात्मक संख्याहरू) बाट टाढा।

छापहरूको तुलना

सुविधा

मुस्कान

InChI / InChIKey

पठनीयता

उच्च (जन मैत्री)

कम (मेसिन अनुकूल)

प्रामाणिकता

परिवर्तनको विषय (क्यानोनाइजेशन आवश्यक छ)

स्वाभाविक रूपमा एकल

प्रयोग

मानव संचार, रेखाचित्र, इनपुट

डाटाबेस मिलान, पहिचान

स्टिरियोकेमिस्ट्री

समर्थन गर्दछ (@ प्रतीकहरू)

समर्थन (स्तरित)

AI लाई दिन

आदर्श

पुष्टिकरणको लागि आदर्श

मिनी केसहरू

केस 1 - दुई नाम, एक अणु। एक विद्यार्थीले "N-acetyl-para-aminophenol" र "paracetamol" फरक यौगिकहरू हुन् भनी सोचे र दुई अलग-अलग प्रयोगको योजना बनाए। जब तिनीहरूको मुस्कानलाई RDKit मा प्रमाणीकरण गरियो, तिनीहरू दुवै CC(=O)Nc1ccc(O)cc1; त्यो एउटै अणु थियो। हराएको: योजनाको आधा दिन; लाभ: २ मिनेटको क्यानोनिकलाइजेशन जाँचबाट बच्न सकिन्छ।

केस २ - अवैध SMILES क्याप्चर। AI ले CC(=O)Nc1ccc(O)cc1C( एक संस्करणको लागि (कोष्ठक बन्द गरिएको छैन) फिर्ता गर्यो। विद्यार्थीले MolFromSmiles चलायो, यसले कुनै पनि होइन, तुरुन्तै त्रुटि देख्यो र SMILES सच्याउन अनुरोध गर्यो। प्रमाणीकरण बिना, त्रुटिपूर्ण संरचना सबै खाताहरूमा फैलिने थियो।

केस 3 - गलत आणविक वजन। YZ ले ibuprofen (C13H18O2) को लागि "आणविक वजन 214.3 g/mol" भन्यो। RDKit गणनाले 206.28 g/mol दिएको छ। 0.1 mol को लागि भिन्नता: YZ सँग 21.43 g, वास्तवमा 20.63 g। 3.9% को यो भिन्नताले स्टोइचियोमेट्री र उपज गणनामा बाधा पुर्‍याउँछ। यसले निर्धारणात्मक क्याल्कुलस ल्यायो।

सामान्य गल्तीहरू

  • नामद्वारा अणु दिँदै। समानार्थी/व्यापार नामहरू भ्रमित छन्। सधैं SMILES वा InChI समावेश गर्नुहोस्।
  • SMILES लाई प्रामाणिककरण नगरीकन तुलना गर्दै। OCC र CCO पाठमा फरक छन् तर अणुहरूमा उस्तै छन्।
  • जिब्रो मोडेलमा आणविक वजन सोध्दै। यो एक निर्धारणात्मक गणना हो; यो RDKit बाट वा म्यानुअल रूपमा सूत्रबाट गरिन्छ।
  • अवैध SMILES हेर्दै छैन। MolFromSmiles None को फिर्ता जाँच नगर्ने र गलत संरचनाको साथ जारी राख्दै।
  • स्टेरियोकेमिस्ट्रीलाई बेवास्ता गर्दै। दुई enantiomers (मिरर छवि isomers) विभिन्न जैविक प्रभाव प्रदर्शन गर्न सक्छन्; SMILES मा @/@@ चिन्हहरू छोड्दै।
ध्यान दिनुहोस्: एउटै आणविक सूत्रको अर्थ फरक अणुहरू होइन। C2H6O दुबै इथेनॉल (CCO) र डाइमिथाइल ईथर (COC) हो। सूत्रको समानता पहिचानको समानता होइन; पहिचानको लागि InChIKey प्रयोग गर्नुहोस्।

संक्षेपमा

  • संरचना नोटेशन द्वारा अणुहरू पहिचान गर्नुहोस्, नाम द्वारा होइन: मानवसँग SMILES, डाटाबेसको साथ InChI/InChIKey।
  • RDKit नियतात्मक छ; AI भविष्यवाणी गर्दछ, RDKit गणना र प्रमाणित गर्दछ।
  • MolFromSmiles सँग प्रत्येक AI SMILES पार्स गर्नुहोस् र None को लागि जाँच गर्नुहोस्, त्यसपछि canonicalize गर्नुहोस्।
  • RDKit बाट आणविक वजन र सूत्र जस्ता संख्याहरू प्राप्त गर्नुहोस्, भाषा मोडेलबाट होइन।
  • सूत्र समानता भनेको आणविक पहिचान होइन; पहिचानको लागि InChIKey प्रयोग गर्नुहोस्।

आवेदन कार्य

तीन यौगिकहरू छनौट गर्नुहोस् (जस्तै क्याफिन, आइबुप्रोफेन, ग्लाइसिन)। AI लाई प्रत्येकको लागि क्यानोनिकल SMILES सोध्नुहोस्। त्यसपछि RDKit स्क्रिप्ट लेख्नुहोस् (माथिको टेम्प्लेट प्रयोग गर्नुहोस्) र उत्पन्न गर्नुहोस्: क्यानोनिकल SMILES, आणविक सूत्र, आणविक वजन, InChIKey। AI ले दिएको SMILE मध्ये कति वटा मान्य थिए? यदि YZ ले आणविक वजन पनि दियो भने, RDKit मानसँग प्रतिशतको रूपमा भिन्नता गणना गर्नुहोस्। एउटा सानो तालिकामा आफ्नो खोजहरू प्लट गर्नुहोस्।

चेकलिस्ट

  • [ ] मलाई थाहा छ स्माइल र InChI/InChIKey के हो र कहिले प्रयोग गर्ने।
  • [ ] म MolFromSmiles मार्फत AI द्वारा दिइएको हरेक SMILES प्रमाणित गर्छु।
  • [ ] म तिनीहरूलाई तुलना गर्नु अघि SMILES लाई प्रामाणिक बनाउँछु।
  • [ ] मैले RDKit बाट आणविक वजन र सूत्र प्राप्त गर्दैछु, भाषा मोडेलबाट होइन।
  • [ ] म InChIKey सँग डाटाबेसमा अणु पहिचान पुष्टि गर्छु।
  • [ ] मलाई अवस्थाहरू थाहा छ जहाँ स्टेरियोकेमिस्ट्री महत्त्वपूर्ण छ।