നേട്ടങ്ങൾ:
- തന്മാത്രകളെ പേരുകൊണ്ടല്ല, ഘടനാപരമായ പ്രാതിനിധ്യം വഴി തിരിച്ചറിയാനുള്ള കഴിവ് (മനുഷ്യരുമായുള്ള പുഞ്ചിരി, ഡാറ്റാബേസിനൊപ്പം InChI/InChIKey)
- ആർഡികിറ്റ് ഉപയോഗിച്ച് ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നൽകുന്ന ഓരോ സ്മൈലുകളും പാഴ്സ് ചെയ്യുന്നതിലൂടെയും സാധൂകരിക്കുന്നതിലൂടെയും കാനോനിക്കലൈസ് ചെയ്തും അസാധുവായതോ തെറ്റായതോ ആയ ഘടനകൾ കണ്ടെത്താനുള്ള കഴിവ്
- തന്മാത്രാ ഭാരം, സൂത്രവാക്യം തുടങ്ങിയ നിർണ്ണായക അളവുകൾ ഭാഷാ മാതൃകയിൽ നിന്നല്ല, റൂൾ അടിസ്ഥാനമാക്കിയുള്ള ഉപകരണത്തിൽ നിന്നാണ് ലഭിക്കേണ്ടതെന്ന് മനസ്സിലാക്കാൻ കഴിയും.
രസതന്ത്രത്തിൽ AI സുരക്ഷിതമായി ഉപയോഗിക്കുന്നതിനുള്ള ആദ്യ വ്യവസ്ഥ യന്ത്രത്തിനും മനുഷ്യനും മനസ്സിലാകുന്ന ഭാഷയിൽ തന്മാത്ര എഴുതുക എന്നതാണ്. നിങ്ങൾ "ഫിനോൾ" എന്ന് പറയുന്നു, AI അത് ശരിയാക്കുന്നു; എന്നാൽ നിങ്ങൾ "ആസിഡ്" എന്ന് പറയുമ്പോൾ ആയിരക്കണക്കിന് സാധ്യതകളുണ്ട്. പേരുകൾ അവ്യക്തമാണ്; ഘടനാപരമായ പ്രതിനിധാനങ്ങൾ കൃത്യമാണ്. ഈ യൂണിറ്റിൽ, തന്മാത്രയെ ടെക്സ്റ്റിലേക്ക് (SMILES, InChI) വിവർത്തനം ചെയ്യുന്ന രണ്ട് അടിസ്ഥാന നൊട്ടേഷനുകളും അവയെ നിർണ്ണായകമായി പരിശോധിക്കുന്ന ഉപകരണവും (RDKit) ഞങ്ങൾ പഠിക്കും. ഞങ്ങളുടെ ലക്ഷ്യം: AI-യ്ക്ക് ഒരിക്കലും തെറ്റിദ്ധരിക്കാത്ത തരത്തിൽ തന്മാത്ര നൽകുകയും ഒരു ഉപകരണം ഉപയോഗിച്ച് AI നിർമ്മിച്ച ഘടന സ്ഥിരീകരിക്കുകയും ചെയ്യുക.
എന്താണ് SMILES?
സ്മൈൽസ് (ലളിതമാക്കിയ മോളിക്യുലാർ-ഇൻപുട്ട് ലൈൻ-എൻട്രി സിസ്റ്റം) ഒരു തന്മാത്രയെ ഒരു വരി ടെക്സ്റ്റിൽ എഴുതുന്നതിനുള്ള ഒരു ഫോർമാറ്റാണ്. ആറ്റങ്ങളെ അക്ഷരങ്ങളാലും ബന്ധനങ്ങളെ ചിഹ്നങ്ങളാലും വളയങ്ങളെ അക്കങ്ങളാലും പ്രതിനിധീകരിക്കുന്നു. ഉദാഹരണങ്ങൾ:
- എത്തനോൾ: CCO (കാർബൺ-കാർബൺ-ഓക്സിജൻ; ഹൈഡ്രജൻ).
- ബെൻസീൻ: c1ccccc1 (ചെറിയ അക്ഷരം "c" ആരോമാറ്റിക് കാർബണിനെ സൂചിപ്പിക്കുന്നു; 1 ൻ്റെ മോതിരം അടയ്ക്കുക).
- ആസ്പിരിൻ: CC(=O)Oc1ccccc1C(=O)O.
- കഫീൻ: Cn1cnc2c1c(=O)n(C)c(=O)n2C.
SMILES-ൻ്റെ ശക്തി അത് ഒരൊറ്റ വരിയിൽ മുഴുവൻ ലിങ്ക് ഘടനയും വഹിക്കുന്നു എന്നതാണ്; ഒരേ തന്മാത്രയ്ക്ക് ഒന്നിലധികം സാധുതയുള്ള സ്മൈലുകൾ ഉണ്ടാകാം എന്നതാണ് ഇതിൻ്റെ ദൗർബല്യം (ഇതിനെ നോൺ-കാനോനികലിറ്റി എന്ന് വിളിക്കുന്നു). RDKit ഉപയോഗിച്ച് ഞങ്ങൾ ഇത് ഒരു നിമിഷത്തിനുള്ളിൽ പരിഹരിക്കും.
സൂചന: ഒരു തന്മാത്രയുടെ "കാനോനിക്കൽ സ്മൈലുകൾ" എന്നത് ആ തന്മാത്രയുടെ ഏക, സാധാരണ അക്ഷരവിന്യാസമാണ്. രണ്ട് പുഞ്ചിരികൾ ഒരേ തന്മാത്രയാണോ എന്ന് കാണാൻ, അവയെ കാനോനിക്കലൈസ് ചെയ്ത് താരതമ്യം ചെയ്യുക; അവ വാചകപരമായി തുല്യമാകരുത്, പക്ഷേ അവ തുല്യ തന്മാത്രകളായിരിക്കണം.
എന്താണ് InChI?
IUPAC വികസിപ്പിച്ചെടുത്ത ഒരു സ്റ്റാൻഡേർഡ് ഐഡൻ്റിഫയറാണ് InChI (ഇൻ്റർനാഷണൽ കെമിക്കൽ ഐഡൻ്റിഫയർ). SMILES-ൽ നിന്നുള്ള വ്യത്യാസം, ഒരേ തന്മാത്ര എപ്പോഴും ഒരേ InChI നൽകുന്നു എന്നതാണ്; അതായത്, അത് കാനോനിക്കൽ സ്വഭാവമാണ്. ഇത് ദൈർഘ്യമേറിയതും വായിക്കാൻ ബുദ്ധിമുട്ടുള്ളതുമാണ്, പക്ഷേ ഡാറ്റാബേസ് പൊരുത്തപ്പെടുത്തലിന് അനുയോജ്യമാണ്. ചുരുക്കത്തിൽ "InChIKey" (27-അക്ഷരങ്ങൾ ഉള്ള ഡൈജസ്റ്റ്) തിരയലിനായി ഉപയോഗിക്കുന്നു.
- ആസ്പിരിൻ InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N.
നിയമം: ആളുകൾ സ്മൈലുകൾ സംസാരിക്കുന്നു (വായിക്കുക), മെഷീനുകളും ഡാറ്റാബേസുകളും InChI/InChIKey (കൃത്യമായി) പൊരുത്തപ്പെടുന്നു. AI-ന് പുഞ്ചിരി നൽകുക; InChIKey ഉപയോഗിച്ച് ഡാറ്റാബേസിൽ സ്ഥിരീകരിക്കുക.
RDKit: ഡിറ്റർമിനിസ്റ്റിക് വെരിഫിക്കേഷൻ എഞ്ചിൻ
RDKit ഒരു ഓപ്പൺ സോഴ്സ് കെമിൻഫോർമാറ്റിക്സ് ലൈബ്രറിയാണ്. ഭാഷാ മാതൃകയിൽ നിന്ന് വ്യത്യസ്തമായി, ഇത് റൂൾ അടിസ്ഥാനമാക്കിയുള്ളതാണ്: സ്മൈലുകൾ പാഴ്സ് ചെയ്യുന്നു, തന്മാത്രാ ഭാരം കണക്കാക്കുന്നു, കാനോനിക്കൽ സ്മൈലുകൾ സൃഷ്ടിക്കുന്നു, InChI/InChIKey നൽകുന്നു, തന്മാത്ര വരയ്ക്കുന്നു. അതിനാൽ AI "പ്രവചിക്കുന്നത്" RDKit "കണക്കുകൂട്ടുന്നു". ഇതാണ് വർക്ക്ഫ്ലോയുടെ ഹൃദയം: AI സൃഷ്ടിക്കുന്നു, RDKit പരിശോധിക്കുന്നു.
ഒരു അടിസ്ഥാന സ്ഥിരീകരണ ഫ്ലോ:
rdkit ഇറക്കുമതി Chemfrom rdkit.Chem ഇറക്കുമതി വിവരണങ്ങൾ, Drawsmiles = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) പ്രിൻ്റ്("തന്മാത്രാ സൂത്രവാക്യം:", Chem.rdMolDescriptors.CalcMol)) വെയ്റ്റ്"(മോൾ)ഫോർമുല" റൗണ്ട്(Descriptors.MolWt(mol), 2), "g/mol") പ്രിൻ്റ്("InChIKey:", Chem.MolToInchiKey(mol))
MolFromSmiles None എന്ന് നൽകുകയാണെങ്കിൽ, AI നിങ്ങൾക്ക് ഒരു അസാധുവായ തന്മാത്ര നൽകിയിട്ടുണ്ട്; ഇത് വളരെ വിലപ്പെട്ട ഒരു മുന്നറിയിപ്പ് മാത്രമാണ്. സാധുതയുണ്ടെങ്കിൽ, തന്മാത്രാ ഭാരത്തിൻ്റെ ഭാഷാ മാതൃക നിങ്ങൾ ഇനി ചോദിക്കേണ്ടതില്ല; അത് നിർണായകമായി നിങ്ങളുടെ കൈകളിലാണ്.
ഘട്ടം ഘട്ടമായി: AI + RDKit ഇൻ്റർഓപ്പറേഷൻ
- തന്മാത്ര തിരിച്ചറിയുക: AI-ക്ക് പേര് നൽകുക, സ്മൈലുകൾ ആവശ്യപ്പെടുക. ഉദാഹരണത്തിന്, "പാരസെറ്റമോളിനുള്ള കാനോനിക്കൽ സ്മൈലുകൾ പരിശോധിക്കുക."
- സ്ഥിരീകരിക്കുക: MolFromSmiles ഉപയോഗിച്ച് ഇൻകമിംഗ് സ്മൈലുകൾ പാഴ്സ് ചെയ്യുക. ഒന്നുമില്ലെങ്കിൽ നിരസിക്കുക.
- കാനോനികലൈസ് ചെയ്യുക: മോൾടോസ്മൈൽസ് ഉപയോഗിച്ച് കാനോനിക്കൽ സ്പെല്ലിംഗ് വീണ്ടെടുക്കുക; ഇനി മുതൽ എപ്പോഴും ഇത് ഉപയോഗിക്കുക.
- സംഖ്യകൾ കണക്കാക്കുക: തന്മാത്രാ ഭാരം, ഫോർമുല, വളയങ്ങളുടെ എണ്ണം, ഹൈഡ്രജൻ ബോണ്ട് ദാതാക്കളുടെ/അംഗീകരിക്കുന്നവരുടെ എണ്ണം മുതലായവ RDKit-ൽ നിന്ന് നേടുക, AI-ൽ നിന്നല്ല.
- ഫിക്സ് ഐഡി: InChIKey ജനറേറ്റ് ചെയ്യുക, ഡാറ്റാബേസിൽ തിരയുക (PubChem), നിങ്ങൾ ആഗ്രഹിക്കുന്ന സംയുക്തമാണ് തന്മാത്രയെന്ന് സ്ഥിരീകരിക്കുക.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) സ്മൈലുകൾ അഭ്യർത്ഥിക്കുന്നു (നാമത്തിൽ നിന്ന് ഘടനയിലേക്ക്):
ടാസ്ക്: ഇനിപ്പറയുന്ന സംയുക്തത്തിന് കാനോനിക്കൽ സ്മൈലുകൾ നൽകുക. സംയുക്തം: പാരസെറ്റമോൾ (അസെറ്റാമിനോഫെൻ). നിയമം: SMILES സ്ട്രിംഗും InChIKey ഉം മാത്രം നൽകുക, കൂടുതൽ വിശദീകരണങ്ങളൊന്നും ചേർക്കരുത്. നിങ്ങൾക്ക് ഉറപ്പില്ലെങ്കിൽ, "UNSURE" എന്ന് എഴുതുക, ഉണ്ടാക്കരുത്.
2) SMILES മൂല്യനിർണ്ണയ അഭ്യർത്ഥന (ഘടനയിൽ നിന്ന് നിയന്ത്രണത്തിലേക്ക്):
ചുവടെയുള്ള സ്മൈലുകൾ പരിശോധിക്കുക: CC(=O)Nc1ccc(O)cc1ചോദ്യങ്ങൾ:1) ഇതൊരു സാധുവായ പുഞ്ചിരിയാണോ?2) ഏത് സംയുക്തവുമായി ഇത് യോജിക്കുന്നു (പൊതുനാമം)?3) എന്താണ് തന്മാത്രാ സൂത്രവാക്യം?ശ്രദ്ധിക്കുക: RDKit ഉപയോഗിച്ച് ഞാൻ കൃത്യമായ തന്മാത്രാ ഭാരം കണക്കാക്കും; നിങ്ങൾ നിങ്ങളുടെ ഘടന വ്യാഖ്യാനം നൽകുക.
3) രണ്ട് പ്രതിനിധാനങ്ങൾ താരതമ്യം ചെയ്യുക:
എനിക്ക് രണ്ട് പുഞ്ചിരികളുണ്ട്:A) OCCB) CCOTask: ഇവ ഒരേ തന്മാത്രയാണോ അതോ വ്യത്യസ്തമാണോ? നിങ്ങളുടെ ന്യായവാദം എഴുതുക.ശ്രദ്ധിക്കുക: ഞാൻ നിങ്ങളുടെ ഉത്തരം RDKit-ൽ കാനോനിക്കലൈസ് ചെയ്തുകൊണ്ട് ക്രോസ്-ചെക്ക് ചെയ്യും.
4) ഘടന വിശദീകരണം (പഠന ആവശ്യങ്ങൾക്കായി):
പുഞ്ചിരി: Cn1cnc2c1c(=O)n(C)c(=O)n2CTask: ഈ SMILES ഓരോന്നായി വായിച്ച് ഓരോ ചിഹ്നവും എന്താണ് അർത്ഥമാക്കുന്നത് (ആറ്റം, ബോണ്ട്, മോതിരം, സൌരഭ്യവാസന) പ്ലെയിൻ ടർക്കിഷ് ഭാഷയിൽ വിശദീകരിക്കുക. ഇത് ഏത് സംയുക്തമാണെന്ന് കൂടി പറയുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബല:
അസറ്റാമിനോഫെൻ്റെ ഗുണങ്ങൾ നൽകുക.
"സവിശേഷത" അവ്യക്തമാണ്; AI തന്മാത്രാ ഭാരം മുതൽ ദ്രവണാങ്കം വരെ ക്രമരഹിതമായ സംഖ്യകൾ സൃഷ്ടിക്കുന്നു, അവയിൽ ചിലത് തെറ്റായിരിക്കും.
ശക്തമായ:
സംയുക്തം: അസെറ്റാമിനോഫെൻ.1) കാനോനിക്കൽ സ്മൈലുകളും InChIKey ver.2) തന്മാത്രാ സൂത്രവാക്യം നൽകുക.നിയമം: തന്മാത്രാ ഭാരം, ദ്രവണാങ്കം മുതലായവ പോലുള്ള ന്യൂമെറിക് മൂല്യങ്ങൾ നൽകരുത്. ഞാൻ അവ RDKit/PubChem-നൊപ്പം ലഭിക്കും. ബിൽഡ് ഐഡി നൽകിയാൽ മതി.
വ്യത്യാസം: ഞങ്ങൾ AI-യെ അത് ശക്തിയുള്ളതിലേക്കും (ഘടനാപരമായ ഐഡൻ്റിറ്റി) ദുർബലമായതിൽ നിന്ന് (പരീക്ഷണ സംഖ്യകളിൽ) നിന്നും അകറ്റിനിർത്തി.
ഇംപ്രഷനുകളുടെ താരതമ്യം
സവിശേഷത
പുഞ്ചിരി
InChI / InChIKey
വായനാക്ഷമത
ഉയർന്നത് (ജന സൗഹൃദം)
താഴ്ന്ന (മെഷീൻ ഫ്രണ്ട്ലി)
കാനോനിസിറ്റി
മാറ്റത്തിന് വിധേയമാണ് (കാനോനൈസേഷൻ ആവശ്യമാണ്)
സ്വാഭാവികമായും ഏകാകി
ഉപയോഗം
മനുഷ്യ ആശയവിനിമയം, ഡ്രോയിംഗ്, ഇൻപുട്ട്
ഡാറ്റാബേസ് പൊരുത്തം, ഐഡൻ്റിറ്റി
സ്റ്റീരിയോകെമിസ്ട്രി
പിന്തുണകൾ (@ ചിഹ്നങ്ങൾ)
പിന്തുണകൾ (ലേയേർഡ്)
AI-ക്ക് നൽകാൻ
അനുയോജ്യമായ
സ്ഥിരീകരണത്തിന് അനുയോജ്യം
മിനി കേസുകൾ
കേസ് 1 - രണ്ട് പേരുകൾ, ഒരു തന്മാത്ര. "എൻ-അസെറ്റൈൽ-പാരാ-അമിനോഫെനോൾ", "പാരസെറ്റമോൾ" എന്നിവ വ്യത്യസ്ത സംയുക്തങ്ങളാണെന്ന് ഒരു വിദ്യാർത്ഥി കരുതി, രണ്ട് വ്യത്യസ്ത പരീക്ഷണങ്ങൾ ആസൂത്രണം ചെയ്തു. RDKit-ൽ അവരുടെ പുഞ്ചിരി കാനോനിക്കലൈസ് ചെയ്തപ്പോൾ, അവ രണ്ടും CC(=O)Nc1ccc(O)cc1 ആയി മാറി; അത് ഒരേ തന്മാത്രയായിരുന്നു. നഷ്ടപ്പെട്ടു: ആസൂത്രണത്തിൻ്റെ പകുതി ദിവസം; നേട്ടം: 2 മിനിറ്റ് കാനോനിക്കലൈസേഷൻ പരിശോധനയിലൂടെ ഒഴിവാക്കാമായിരുന്നു.
കേസ് 2 - അസാധുവായ SMILES ക്യാപ്ചർ. AI, ഒരു വേരിയൻ്റിനായി CC(=O)Nc1ccc(O)cc1C(ബ്രാക്കറ്റുകൾ അടച്ചിട്ടില്ല) തിരികെ നൽകി. വിദ്യാർത്ഥി MolFromSmiles ഓടിച്ചു, അത് ഒന്നുമില്ല, ഉടൻ തന്നെ പിശക് കാണുകയും തിരുത്തിയ SMILES അഭ്യർത്ഥിക്കുകയും ചെയ്തു. പരിശോധിച്ചില്ലെങ്കിൽ, തെറ്റായ ഘടന എല്ലാ അക്കൗണ്ടുകളിലേക്കും വ്യാപിക്കുമായിരുന്നു.
കേസ് 3 - തെറ്റായ തന്മാത്രാ ഭാരം. YZ ഇബുപ്രോഫിന് (C13H18O2) "തന്മാത്രാ ഭാരം 214.3 g/mol" എന്ന് പറഞ്ഞു. RDKit കണക്കുകൂട്ടൽ 206.28 g/mol നൽകി. 0.1 മോളിനുള്ള വ്യത്യാസം: YZ-നൊപ്പം 21.43 ഗ്രാം, യഥാർത്ഥത്തിൽ 20.63 ഗ്രാം. ഈ 3.9% വ്യത്യാസം സ്റ്റോയിക്യോമെട്രിയെയും വിളവ് കണക്കുകൂട്ടലിനെയും തടസ്സപ്പെടുത്തും. അത് നിർണ്ണായക കാൽക്കുലസ് കൊണ്ടുവന്നു.
സാധാരണ തെറ്റുകൾ
- തന്മാത്രയുടെ പേര് നൽകുന്നു. പര്യായങ്ങൾ/വ്യാപാര നാമങ്ങൾ ആശയക്കുഴപ്പത്തിലാണ്. എപ്പോഴും SMILES അല്ലെങ്കിൽ InChI ഉൾപ്പെടുത്തുക.
- കാനോനിക്കലൈസ് ചെയ്യാതെ സ്മൈലുകൾ താരതമ്യം ചെയ്യുന്നു. OCC, CCO എന്നിവ വാചകത്തിൽ വ്യത്യസ്തമാണ്, എന്നാൽ തന്മാത്രകളിൽ സമാനമാണ്.
- നാവ് മോഡലിനോട് തന്മാത്രാ ഭാരം ചോദിക്കുന്നു. ഇതൊരു നിർണായക കണക്കുകൂട്ടലാണ്; ഇത് RDKit-ൽ നിന്നോ സ്വമേധയാ ഫോർമുലയിൽ നിന്നോ ആണ് ചെയ്യുന്നത്.
- അസാധുവായ സ്മൈലുകൾ ശ്രദ്ധിക്കുന്നില്ല. MolFromSmiles None-ൻ്റെ റിട്ടേൺ പരിശോധിക്കുന്നില്ല, തെറ്റായ ഘടനയിൽ തുടരുന്നു.
- സ്റ്റീരിയോകെമിസ്ട്രിയെ അവഗണിക്കുന്നു. രണ്ട് എൻ്റിയോമറുകൾ (മിറർ ഇമേജ് ഐസോമറുകൾ) വ്യത്യസ്ത ജൈവ ഫലങ്ങൾ പ്രദർശിപ്പിച്ചേക്കാം; SMILES-ൽ @/@@ അടയാളങ്ങൾ ഒഴിവാക്കുന്നു.
ശ്രദ്ധിക്കുക: ഒരേ തന്മാത്രാ സൂത്രവാക്യം വ്യത്യസ്ത തന്മാത്രകളെ അർത്ഥമാക്കുന്നില്ല. C2H6O എന്നത് എത്തനോൾ (CCO), ഡൈമെഥൈൽ ഈഥർ (COC) ആണ്. സമവാക്യത്തിൻ്റെ സമത്വം സ്വത്വത്തിൻ്റെ സമത്വമല്ല; തിരിച്ചറിയാൻ InChIKey ഉപയോഗിക്കുക.
ചുരുക്കത്തിൽ
- തന്മാത്രകളെ ഘടന നൊട്ടേഷൻ വഴി തിരിച്ചറിയുക, പേരുകൊണ്ടല്ല: മനുഷ്യനുമായുള്ള പുഞ്ചിരി, ഡാറ്റാബേസിനൊപ്പം InChI/InChIKey.
- RDKit നിർണ്ണായകമാണ്; AI പ്രവചിക്കുന്നു, RDKit കണക്കാക്കുകയും സ്ഥിരീകരിക്കുകയും ചെയ്യുന്നു.
- ഓരോ AI സ്മൈലുകളും MolFromSmiles ഉപയോഗിച്ച് പാഴ്സ് ചെയ്ത് ഒന്നുമില്ല എന്ന് പരിശോധിക്കുക, തുടർന്ന് കാനോനിക്കലൈസ് ചെയ്യുക.
- RDKit-ൽ നിന്ന് തന്മാത്രാഭാരവും ഫോർമുലയും പോലുള്ള സംഖ്യകൾ നേടുക, ഭാഷാ മാതൃകയിൽ നിന്നല്ല.
- ഫോർമുല സമത്വം തന്മാത്രാ സ്വത്വം അർത്ഥമാക്കുന്നില്ല; തിരിച്ചറിയാൻ InChIKey ഉപയോഗിക്കുക.
ആപ്ലിക്കേഷൻ ടാസ്ക്
മൂന്ന് സംയുക്തങ്ങൾ തിരഞ്ഞെടുക്കുക (ഉദാ. കഫീൻ, ഇബുപ്രോഫെൻ, ഗ്ലൈസിൻ). ഓരോന്നിനും കാനോനിക്കൽ സ്മൈലുകൾക്കായി AI-യോട് ആവശ്യപ്പെടുക. തുടർന്ന് ഒരു RDKit സ്ക്രിപ്റ്റ് എഴുതുക (മുകളിലുള്ള ടെംപ്ലേറ്റ് ഉപയോഗിക്കുക) സൃഷ്ടിക്കുക: കാനോനിക്കൽ SMILES, തന്മാത്രാ സൂത്രവാക്യം, തന്മാത്രാ ഭാരം, InChIKey. AI നൽകിയ സ്മൈലുകളിൽ എത്രയെണ്ണം സാധുവായിരുന്നു? YZ തന്മാത്രാഭാരവും നൽകിയിട്ടുണ്ടെങ്കിൽ, RDKit മൂല്യം ഉപയോഗിച്ച് വ്യത്യാസം ഒരു ശതമാനമായി കണക്കാക്കുക. നിങ്ങളുടെ കണ്ടെത്തലുകൾ ഒരു ചെറിയ പട്ടികയിൽ പ്ലോട്ട് ചെയ്യുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] സ്മൈൽസും InChI/InChIKey എന്താണെന്നും അവ എപ്പോൾ ഉപയോഗിക്കണമെന്നും എനിക്കറിയാം.
- [ ] AI നൽകുന്ന ഓരോ സ്മൈലുകളും ഞാൻ MolFromSmiles ഉപയോഗിച്ച് പരിശോധിച്ചുറപ്പിക്കുന്നു.
- [ ] സ്മൈലുകൾ താരതമ്യം ചെയ്യുന്നതിനുമുമ്പ് ഞാൻ അവയെ കാനോനിക്കലൈസ് ചെയ്യുന്നു.
- [ ] എനിക്ക് തന്മാത്രാ ഭാരവും ഫോർമുലയും ലഭിക്കുന്നത് RDKit-ൽ നിന്നാണ്, ഭാഷാ മാതൃകയിൽ നിന്നല്ല.
- [ ] InChIKey ഉപയോഗിച്ച് ഡാറ്റാബേസിലെ മോളിക്യൂൾ ഐഡൻ്റിറ്റി ഞാൻ സ്ഥിരീകരിക്കുന്നു.
- സ്റ്റീരിയോകെമിസ്ട്രി പ്രധാനമായ സാഹചര്യങ്ങൾ എനിക്കറിയാം.