లాభాలు:
- పేరు ద్వారా కాకుండా నిర్మాణ ప్రాతినిధ్యం ద్వారా అణువులను గుర్తించగల సామర్థ్యం (మానవులతో SMILES, డేటాబేస్తో InChI/InChIKey)
- RDKitతో కృత్రిమ మేధస్సు ద్వారా అందించబడిన ప్రతి స్మైల్లను అన్వయించడం, ధృవీకరించడం మరియు నియమబద్ధంగా చేయడం ద్వారా చెల్లని లేదా తప్పు నిర్మాణాలను గుర్తించగల సామర్థ్యం
- పరమాణు బరువు మరియు ఫార్ములా వంటి నిర్ణయాత్మక పరిమాణాలను భాష నమూనా నుండి కాకుండా నియమ-ఆధారిత సాధనం నుండి పొందాలని అర్థం చేసుకోవడం.
రసాయన శాస్త్రంలో AIని సురక్షితంగా ఉపయోగించడం కోసం మొదటి షరతు ఏమిటంటే, యంత్రం మరియు మానవుడు ఇద్దరూ అర్థం చేసుకోగలిగే భాషలో అణువును వ్రాయడం. మీరు "ఫినాల్" అని చెప్తారు, AI సరిగ్గా అర్థం చేసుకుంటుంది; కానీ మీరు "యాసిడ్" అని చెప్పినప్పుడు వేలకొద్దీ అవకాశాలు ఉన్నాయి. పేర్లు అస్పష్టంగా ఉన్నాయి; నిర్మాణ ప్రాతినిధ్యాలు ఖచ్చితమైనవి. ఈ యూనిట్లో, అణువును టెక్స్ట్ (SMILES మరియు InChI)లోకి అనువదించే రెండు ప్రాథమిక సంకేతాలను మరియు వాటిని నిర్ణయాత్మకంగా ధృవీకరించే సాధనాన్ని (RDKit) నేర్చుకుంటాము. మా లక్ష్యం: AI ఎప్పటికీ అపార్థం చేసుకోని విధంగా అణువును అందించడం మరియు AI ద్వారా ఉత్పత్తి చేయబడిన నిర్మాణాన్ని ఒక సాధనంతో నిర్ధారించడం.
SMILES అంటే ఏమిటి?
SMILES (సింప్లిఫైడ్ మాలిక్యులర్-ఇన్పుట్ లైన్-ఎంట్రీ సిస్టమ్) అనేది ఒక అణువును ఒకే పంక్తిలో వ్రాసే ఆకృతి. పరమాణువులు అక్షరాల ద్వారా, బంధాలు చిహ్నాల ద్వారా మరియు వలయాలు సంఖ్యల ద్వారా సూచించబడతాయి. ఉదాహరణలు:
- ఇథనాల్: CCO (కార్బన్-కార్బన్-ఆక్సిజన్; హైడ్రోజన్లు అంతర్లీనంగా).
- బెంజీన్: c1ccccc1 (చిన్న అక్షరం "c" సుగంధ కార్బన్ను సూచిస్తుంది; 1 రింగ్ను మూసివేయండి).
- ఆస్పిరిన్: CC(=O)Oc1ccccc1C(=O)O.
- కెఫిన్: Cn1cnc2c1c(=O)n(C)c(=O)n2C.
SMILES యొక్క శక్తి ఏమిటంటే ఇది మొత్తం లింక్ నిర్మాణాన్ని ఒకే లైన్లో కలిగి ఉంటుంది; దీని బలహీనత ఏమిటంటే, ఒకే అణువు బహుళ చెల్లుబాటు అయ్యే స్మైల్స్ కలిగి ఉంటుంది (దీనిని నాన్-కానానికాలిటీ అంటారు). మేము దీన్ని RDKitతో క్షణంలో పరిష్కరిస్తాము.
సూచన: అణువు కోసం "కానానికల్ స్మైల్స్" అనేది ఆ అణువు యొక్క ఏకైక, ప్రామాణిక స్పెల్లింగ్. రెండు స్మైల్స్ ఒకే మాలిక్యూల్ కాదా అని చూడటానికి, వాటిని కానానికలైజ్ చేసి సరిపోల్చండి; అవి వచనపరంగా సమానంగా ఉండకూడదు, కానీ అవి సమానమైన అణువులుగా ఉండాలి.
InChI అంటే ఏమిటి?
InChI (ఇంటర్నేషనల్ కెమికల్ ఐడెంటిఫైయర్) అనేది IUPAC చే అభివృద్ధి చేయబడిన ఒక ప్రామాణిక ఐడెంటిఫైయర్. SMILES నుండి వ్యత్యాసం ఏమిటంటే, అదే అణువు ఎల్లప్పుడూ ఒకే InChIని ఇస్తుంది; అంటే, ఇది కానానికల్ స్వభావం. ఇది చాలా పొడవుగా మరియు చదవడానికి కష్టంగా ఉంది, కానీ డేటాబేస్ సరిపోలికకు అనువైనది. సంక్షిప్తంగా "InChIKey" (27-అక్షరాల డైజెస్ట్) శోధన కోసం ఉపయోగించబడుతుంది.
- ఆస్పిరిన్ InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N.
నియమం: వ్యక్తులు స్మైల్స్ మాట్లాడతారు (చదవండి), యంత్రాలు మరియు డేటాబేస్లు InChI/InChIKey (ఖచ్చితమైన)తో సరిపోలుతాయి. AIకి స్మైల్స్ ఇవ్వండి; InChIKeyతో డేటాబేస్లో నిర్ధారించండి.
RDKit: నిర్ణయాత్మక ధృవీకరణ ఇంజిన్
RDKit అనేది ఓపెన్ సోర్స్ కెమిన్ఫార్మాటిక్స్ లైబ్రరీ. భాషా నమూనా వలె కాకుండా, ఇది నియమ-ఆధారితమైనది: స్మైల్స్ను అన్వయిస్తుంది, పరమాణు బరువును గణిస్తుంది, కానానికల్ స్మైల్స్ ఉత్పత్తి చేస్తుంది, InChI/InChIKeyని తిరిగి ఇస్తుంది, అణువును గీస్తుంది. కాబట్టి RDKit AI "అంచనా" ఏమి "లెక్కిస్తుంది". ఇది వర్క్ఫ్లో యొక్క గుండె: AI ఉత్పత్తి చేస్తుంది, RDKit ధృవీకరిస్తుంది.
ప్రాథమిక ధృవీకరణ విధానం:
rdkit దిగుమతి నుండి Chemfrom rdkit.Chem దిగుమతి వివరణలు, డ్రాస్మైల్స్ = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) ప్రింట్("మాలిక్యులర్ ఫార్ములా:", Chem.rdMolDescriptors.CalcMol)) వెయిట్"(మోల్) ఫార్ములా" రౌండ్(Descriptors.MolWt(mol), 2), "g/mol") ప్రింట్("InChIKey:", Chem.MolToInchiKey(mol))
MolFromSmiles ఏదీ ఇవ్వనట్లయితే, AI మీకు చెల్లని మాలిక్యూల్ను అందించింది; ఇది ఒక్కటే చాలా విలువైన హెచ్చరిక. చెల్లుబాటు అయితే, మీరు ఇకపై పరమాణు బరువు కోసం భాష నమూనాను అడగవలసిన అవసరం లేదు; ఇది నిర్ణయాత్మకంగా మీ చేతుల్లో ఉంది.
దశల వారీగా: AI + RDKit ఇంటర్ఆపరేషన్
- అణువును గుర్తించండి: AIకి పేరు ఇవ్వండి, స్మైల్స్ కోసం అడగండి. ఉదాహరణకు, "పారాసెటమాల్ కోసం కానానికల్ స్మైల్స్ ధృవీకరించండి."
- ధృవీకరించండి: MolFromSmilesతో ఇన్కమింగ్ స్మైల్స్ అన్వయించండి. ఏదీ లేకుంటే, తిరస్కరించండి.
- Canonicalize: MolToSmilesతో కానానికల్ స్పెల్లింగ్ని తిరిగి పొందండి; ఇప్పటి నుండి ఎల్లప్పుడూ దీన్ని ఉపయోగించండి.
- సంఖ్యలను లెక్కించండి: AI నుండి కాకుండా RDKit నుండి పరమాణు బరువు, ఫార్ములా, రింగ్ల సంఖ్య, హైడ్రోజన్ బాండ్ డోనర్స్/యాక్సెప్టర్ల సంఖ్య మొదలైనవాటిని పొందండి.
- ఫిక్స్ ID: InChIKeyని రూపొందించండి, డేటాబేస్ (PubChem)లో శోధించండి, పరమాణువు మీకు కావలసిన సమ్మేళనమేనని నిర్ధారించండి.
నాలుగు కాపీ చేయగల టెంప్లేట్లు
1) SMILESని అభ్యర్థిస్తోంది (నామవాచకం నుండి నిర్మాణం వరకు):
టాస్క్: కింది సమ్మేళనం కోసం కానానికల్ స్మైల్స్ ఇవ్వండి. సమ్మేళనం: పారాసెటమాల్ (ఎసిటమైనోఫెన్). నియమం: SMILES స్ట్రింగ్ మరియు InChIKey మాత్రమే ఇవ్వండి, తదుపరి వివరణను జోడించవద్దు. మీకు ఖచ్చితంగా తెలియకపోతే, "UNSURE" అని వ్రాయండి, తయారు చేయవద్దు.
2) SMILES ధ్రువీకరణ అభ్యర్థన (నిర్మాణం నుండి నియంత్రణ వరకు):
దిగువన ఉన్న స్మైల్లను పరిశీలించండి: CC(=O)Nc1ccc(O)cc1ప్రశ్నలు:1) ఇది చెల్లుబాటు అయ్యే SMILES?2) ఇది ఏ సమ్మేళనానికి అనుగుణంగా ఉంటుంది (సాధారణ పేరు)?3) పరమాణు సూత్రం ఏమిటి?గమనిక: నేను RDKitతో ఖచ్చితమైన పరమాణు బరువును గణిస్తాను; మీరు మీ నిర్మాణ వివరణను మాత్రమే ఇస్తారు.
3) రెండు ప్రాతినిధ్యాలను పోల్చడం:
నాకు రెండు చిరునవ్వులు ఉన్నాయి:A) OCCB) CCOTask: ఇవి ఒకే అణువునా లేదా భిన్నమైనవా? మీ తార్కికతను వ్రాయండి.గమనిక: నేను మీ సమాధానాన్ని RDKitలో కానానికలైజ్ చేయడం ద్వారా క్రాస్ చెక్ చేస్తాను.
4) నిర్మాణ వివరణ (అభ్యాస ప్రయోజనాల కోసం):
చిరునవ్వులు: Cn1cnc2c1c(=O)n(C)c(=O)n2CTask: ఈ స్మైల్స్ ముక్కల వారీగా చదవండి మరియు ప్రతి గుర్తు అంటే ఏమిటో (అణువు, బంధం, ఉంగరం, సుగంధం) సాదా టర్కిష్లో వివరించండి. అది ఏ సమ్మేళనమో కూడా చెప్పండి.
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనం:
ఎసిటమైనోఫెన్ యొక్క లక్షణాలను ఇవ్వండి.
"లక్షణం" అస్పష్టంగా ఉంది; AI పరమాణు బరువు నుండి ద్రవీభవన స్థానం వరకు యాదృచ్ఛిక సంఖ్యలను ఉత్పత్తి చేస్తుంది, వాటిలో కొన్ని తప్పుగా ఉంటాయి.
బలమైన:
సమ్మేళనం: acetaminophen.1) కానానికల్ స్మైల్స్ మరియు InChIKey ver.2) పరమాణు సూత్రాన్ని ఇవ్వండి.నియమం: పరమాణు బరువు, ద్రవీభవన స్థానం మొదలైన సంఖ్యా విలువలను ఇవ్వవద్దు; నేను వాటిని RDKit/PubChemతో పొందుతాను. బిల్డ్ ID ఇవ్వండి.
తేడా: మేము AIని బలంగా ఉన్న దాని వైపు (నిర్మాణ గుర్తింపు) మరియు బలహీనంగా ఉన్న దాని నుండి (ప్రయోగాత్మక సంఖ్యలు) వైపు మళ్లించాము.
ముద్రల పోలిక
లక్షణం
చిరునవ్వులు
InChI / InChIKey
చదవదగినది
అధిక (ప్రజలకు అనుకూలమైన)
తక్కువ (మెషిన్ ఫ్రెండ్లీ)
నియమబద్ధత
మార్పుకు లోబడి (కాననైజేషన్ అవసరం)
సహజంగా ఒంటరి
వాడుక
మానవ కమ్యూనికేషన్, డ్రాయింగ్, ఇన్పుట్
డేటాబేస్ సరిపోలిక, గుర్తింపు
స్టీరియోకెమిస్ట్రీ
మద్దతు (@ చిహ్నాలు)
మద్దతు (లేయర్డ్)
AIకి ఇవ్వడానికి
ఆదర్శవంతమైనది
నిర్ధారణకు అనువైనది
చిన్న కేసులు
కేసు 1 - రెండు పేర్లు, ఒక అణువు. ఒక విద్యార్థి "N-ఎసిటైల్-పారా-అమినోఫెనాల్" మరియు "పారాసెటమాల్" వేర్వేరు సమ్మేళనాలు అని భావించాడు మరియు రెండు వేర్వేరు ప్రయోగాలను ప్లాన్ చేశాడు. RDKitలో వారి స్మైల్లను కానానికలైజ్ చేసినప్పుడు, వారిద్దరూ CC(=O)Nc1ccc(O)cc1గా మారారు; ఇది అదే అణువు. లాస్ట్: సగం రోజు ప్రణాళిక; లాభం: 2-నిమిషాల కానానికలైజేషన్ చెక్తో నివారించవచ్చు.
కేస్ 2 — చెల్లని SMILES క్యాప్చర్. AI వేరియంట్ కోసం CC(=O)Nc1ccc(O)cc1C(బ్రాకెట్లు మూసివేయబడలేదు)ని అందించింది. విద్యార్థి MolFromSmilesని పరిగెత్తాడు, అది ఏదీ లేదు, వెంటనే లోపాన్ని చూసి సరిదిద్దబడిన SMILESని అభ్యర్థించింది. ధృవీకరణ లేకుండా, తప్పు నిర్మాణం అన్ని ఖాతాలకు వ్యాపిస్తుంది.
కేస్ 3 - సరికాని పరమాణు బరువు. ఇబుప్రోఫెన్ (C13H18O2) కోసం YZ "మాలిక్యులర్ బరువు 214.3 గ్రా/మోల్" అని చెప్పింది. RDKit లెక్కింపు 206.28 గ్రా/మోల్ ఇచ్చింది. 0.1 మోల్కు తేడా: YZతో 21.43 గ్రా, వాస్తవానికి 20.63 గ్రా. ఈ 3.9% వ్యత్యాసం స్టోయికియోమెట్రీ మరియు దిగుబడి గణనకు అంతరాయం కలిగిస్తుంది. ఇది నిర్ణయాత్మక కాలిక్యులస్ని తీసుకువచ్చింది.
సాధారణ తప్పులు
- పేరు ద్వారా అణువు ఇవ్వడం. పర్యాయపదాలు/వాణిజ్య పేర్లు గందరగోళంగా ఉన్నాయి. ఎల్లప్పుడూ SMILES లేదా InChIని చేర్చండి.
- స్మైల్స్ను కానానికలైజ్ చేయకుండా పోల్చడం. OCC మరియు CCO వచనంలో వేర్వేరుగా ఉంటాయి కానీ అణువులలో ఒకే విధంగా ఉంటాయి.
- నాలుక నమూనాకు పరమాణు భారాన్ని అడుగుతోంది. ఇది నిర్ణయాత్మక గణన; ఇది RDKit నుండి లేదా ఫార్ములా నుండి మాన్యువల్గా చేయబడుతుంది.
- చెల్లని స్మైల్స్ను గమనించడం లేదు. MolFromSmiles None యొక్క వాపసును తనిఖీ చేయడం లేదు మరియు తప్పు నిర్మాణంతో కొనసాగుతోంది.
- స్టీరియోకెమిస్ట్రీని నిర్లక్ష్యం చేయడం. రెండు ఎన్యాంటియోమర్లు (మిర్రర్ ఇమేజ్ ఐసోమర్లు) విభిన్న జీవ ప్రభావాలను ప్రదర్శించవచ్చు; SMILESలో @/@@ గుర్తులను దాటవేయడం.
శ్రద్ధ: ఒకే మాలిక్యులర్ ఫార్ములా అంటే భిన్నమైన అణువులు కాదు. C2H6O ఇథనాల్ (CCO) మరియు డైమిథైల్ ఈథర్ (COC) రెండూ. సూత్రం యొక్క సమానత్వం గుర్తింపు సమానత్వం కాదు; గుర్తింపు కోసం InChIKeyని ఉపయోగించండి.
సారాంశంలో
- పేరు ద్వారా కాకుండా నిర్మాణ సంజ్ఞామానం ద్వారా అణువులను గుర్తించండి: మానవునితో SMILES, డేటాబేస్తో InChI/InChIKey.
- RDKit నిర్ణయాత్మకమైనది; AI అంచనా వేస్తుంది, RDKit లెక్కిస్తుంది మరియు ధృవీకరిస్తుంది.
- ప్రతి AI స్మైల్స్ను MolFromSmilesతో అన్వయించండి మరియు ఏదీ లేదు కోసం తనిఖీ చేయండి, ఆపై నియమానుగుణంగా చేయండి.
- RDKit నుండి మాలిక్యులర్ బరువు మరియు ఫార్ములా వంటి సంఖ్యలను పొందండి, భాష మోడల్ నుండి కాదు.
- ఫార్ములా సమానత్వం అంటే పరమాణు గుర్తింపు కాదు; గుర్తింపు కోసం InChIKeyని ఉపయోగించండి.
అప్లికేషన్ టాస్క్
మూడు సమ్మేళనాలను ఎంచుకోండి (ఉదా. కెఫిన్, ఇబుప్రోఫెన్, గ్లైసిన్). ప్రతిదానికి కానానికల్ స్మైల్స్ కోసం AIని అడగండి. ఆపై RDKit స్క్రిప్ట్ను వ్రాసి (పైన ఉన్న టెంప్లేట్ని ఉపయోగించండి) మరియు రూపొందించండి: కానానికల్ స్మైల్స్, మాలిక్యులర్ ఫార్ములా, మాలిక్యులర్ వెయిట్, InChIKey. AI ఇచ్చిన స్మైల్స్లో ఎన్ని చెల్లుబాటు అయ్యాయి? YZ పరమాణు బరువును కూడా ఇచ్చినట్లయితే, వ్యత్యాసాన్ని RDKit విలువతో శాతంగా లెక్కించండి. మీ అన్వేషణలను చిన్న పట్టికలో ఉంచండి.
చెక్లిస్ట్
- [ ] SMILES మరియు InChI/InChIKey అంటే ఏమిటో మరియు వాటిని ఎప్పుడు ఉపయోగించాలో నాకు తెలుసు.
- [ ] నేను AI అందించిన ప్రతి స్మైల్స్ను MolFromSmilesతో ధృవీకరిస్తాను.
- [ ] నేను స్మైల్లను పోల్చడానికి ముందు వాటిని నియమానుగుణంగా మారుస్తాను.
- [ ] నేను మాలిక్యులర్ బరువు మరియు ఫార్ములాను RDKit నుండి పొందుతున్నాను, భాష మోడల్ నుండి కాదు.
- [ ] నేను InChIKeyతో డేటాబేస్లోని మాలిక్యూల్ గుర్తింపును ధృవీకరిస్తాను.
- [ ] స్టీరియోకెమిస్ట్రీ ముఖ్యమైన సందర్భాలు నాకు తెలుసు.