Fitimet:
- Aftësia për të identifikuar molekulat jo me emër, por nga përfaqësimi i strukturës (BUZËQESHJE me njerëzit, InChI/InChIKey me bazën e të dhënave)
- Aftësia për të zbuluar struktura të pavlefshme ose të pasakta duke analizuar, vërtetuar dhe kanonikizuar çdo SMILES të dhënë nga inteligjenca artificiale me RDKit
- Të jesh në gjendje të kuptojmë se sasitë përcaktuese si pesha molekulare dhe formula duhet të merren nga mjeti i bazuar në rregulla, jo nga modeli gjuhësor.
Kushti i parë për përdorimin e sigurt të AI në kimi është shkrimi i molekulës në një gjuhë që mund ta kuptojnë si makina ashtu edhe njeriu. Ju thoni "fenol", AI e kupton mirë; por kur thua "acid" ka mijëra mundësi. Emrat janë të paqartë; përfaqësimet e strukturës janë të sakta. Në këtë njësi do të mësojmë dy shënimet bazë që e përkthejnë molekulën në tekst (SMILES dhe InChI) dhe mjetin që i verifikon ato në mënyrë deterministike (RDKit). Qëllimi ynë: t'i japim molekulën AI në një mënyrë që ajo kurrë të mos keqkuptohet dhe të konfirmojmë strukturën e prodhuar nga AI me një mjet.
Çfarë është SMILES?
SMILES (Sistemi i thjeshtuar i hyrjes në linjë molekulare) është një format i shkrimit të një molekule në një rresht të vetëm teksti. Atomet përfaqësohen me shkronja, lidhjet me simbole dhe unazat me numra. Shembuj:
- Etanoli: CCO (karbon-karbon-oksigjen; hidrogjenet e nënkuptuar).
- Benzeni: c1cccccc1 (shkronja e vogël "c" tregon karbon aromatik; 1 mbyll unazën).
- Aspirina: CC(=O)Oc1ccccc1C(=O)O.
- Kafeina: Cn1cnc2c1c(=O)n(C)c(=O)n2C.
Fuqia e SMILES është se ajo mbart të gjithë strukturën e lidhjes në një linjë të vetme; Dobësia e saj është se e njëjta molekulë mund të ketë BUZËQESHJE të shumëfishta të vlefshme (kjo quhet jokanonike). Ne do ta zgjidhim këtë me RDKit në një moment.
Këshillë: "BUZËQESHJE kanonike" për një molekulë është drejtshkrimi i vetëm, standard për atë molekulë. Për të parë nëse dy BUZËQESHJE janë e njëjta molekulë, kanonizoni dhe krahasoni ato; Ato nuk duhet të jenë të barabarta tekstualisht, por duhet të jenë molekula të barabarta.
Çfarë është InChI?
InChI (International Chemical Identifier) është një identifikues standard i zhvilluar nga IUPAC. Dallimi nga SMILES është se e njëjta molekulë jep gjithmonë të njëjtin InChI; pra ka natyrë kanonike. Është e gjatë dhe e vështirë për t'u lexuar, por është ideale për përputhjen e bazës së të dhënave. Shkurtuar "InChIKey" (përmbledhje me 27 karaktere) përdoret për kërkim.
- Aspirina InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N.
Rregulli: Njerëzit flasin BUZËQESHJE (lexuar), makinat dhe bazat e të dhënave përputhen me InChI/InChIKey (saktësisht). Jepini BUZËQESHJE UA; Konfirmo në bazën e të dhënave me InChIKey.
RDKit: motor verifikimi përcaktues
RDKit është një bibliotekë kimiformatike me burim të hapur. Ndryshe nga modeli i gjuhës, ai bazohet në rregulla: analizon SMILES, llogarit peshën molekulare, gjeneron SMILES kanonike, kthen InChI/InChIKey, tërheq molekulën. Pra, RDKit "llogarit" atë që "parashikon" AI. Ky është thelbi i rrjedhës së punës: AI gjeneron, RDKit verifikon.
Një rrjedhë bazë verifikimi:
nga rdkit import Chemfrom rdkit.Chem përshkruesit e importit, Drawsmiles = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) print("Formula molekulare:", Chem.rdMolPërshkruesit.CalcMolFormula(mol)Descriptors pesha:mol)" 2), "g/mol") print("InChIKey:", Chem.MolToInchiKey(mol))
Nëse MolFromSmiles kthen Asnjë, AI ju ka dhënë një molekulë të pavlefshme; Vetëm ky është një paralajmërim shumë i vlefshëm. Nëse është e vlefshme, nuk keni më nevojë të kërkoni modelin gjuhësor për peshën molekulare; Është në dorën tuaj në mënyrë deterministe.
Hap pas hapi: Ndërveprimi AI + RDKit
- Identifikoni molekulën: Jepini AI emrin, kërkoni SMILES. Për shembull, "verifikoni BUZËQESHJET kanonike për paracetamol".
- Verifiko: Analizoni BUZËQESHJET hyrëse me MolFromSmiles. Nëse Asnjë, refuzoni.
- Canonicalize: Merrni drejtshkrimin kanonik me MolToSmiles; Përdoreni gjithmonë këtë nga tani e tutje.
- Llogaritni numrat: Merrni peshën molekulare, formulën, numrin e unazave, numrin e dhuruesve/pranuesve të lidhjeve hidrogjenore etj. nga RDKit, jo nga AI.
- Fix ID: Gjeneroni InChIKey, kërkoni në bazën e të dhënave (PubChem), konfirmoni që molekula është me të vërtetë përbërësi që dëshironi.
Katër shabllone të kopjueshëm
1) Kërkimi i BUZËQESHJEVE (nga emri në strukturë):
Detyrë: Jepni buzëqeshjet kanonike për përbërjen e mëposhtme. Përbërja: paracetamol (acetaminophen). Rregulli: Jepni vetëm vargun SMILES dhe InChIKey, mos shtoni ndonjë shpjegim të mëtejshëm. Nëse nuk jeni të sigurt, shkruani "PASIGURT", mos u bëni deri.
2) Kërkesa e vërtetimit SMILES (nga struktura në kontroll):
Shqyrtoni BUZËQESHJET më poshtë: CC(=O)Nc1ccc(O)cc1Pyetje:1) A është kjo një BUZËQESHJE e vlefshme?2) Me çfarë komponimi korrespondon (emri i zakonshëm)?3) Cila është formula molekulare?Shënim: Do të llogaris peshën e saktë molekulare me RDKit; Ju thjesht jepni interpretimin tuaj të strukturës.
3) Krahasimi i dy paraqitjeve:
Unë kam dy BUZËQESHJE:A) OCCB) CCOTDetyrë: A janë këto e njëjta molekulë apo të ndryshme? Shkruani arsyetimin tuaj. Shënim: Unë do të kontrolloj përgjigjen tuaj duke e kanonizuar në RDKit.
4) Shpjegimi i strukturës (për qëllime mësimore):
BUZËQESHJE: Cn1cnc2c1c(=O)n(C)c(=O)n2CTDetyrë: Lexoni këtë BUZËQESHJE pjesë-pjesë dhe shpjegoni se çfarë do të thotë çdo simbol (atom, lidhje, unazë, aromatik) në turqisht të thjeshtë. Tregoni gjithashtu se për cilin përbërës është.
Prompt i dobët / Prompt i fortë
I dobët:
Jepni vetitë e acetaminofenit.
"Veçori" është e paqartë; AI gjeneron numra të rastësishëm nga pesha molekulare deri në pikën e shkrirjes, disa prej të cilave do të jenë të gabuara.
E fortë:
Komponimi: acetaminophen.1) SMILES Canonical dhe InChIKey ver.2) Jepni formulen molekulare.Rregulli: MOS JEP vlerat NUMERIKE si pesha molekulare, pika e shkrirjes etj.; Unë do t'i marr ato me RDKit/PubChem. Thjesht jepni ID-në e ndërtimit.
Dallimi: Ne e drejtuam AI-në drejt asaj që është e fortë (identiteti i strukturës) dhe larg asaj në të cilën është e dobët (numrat eksperimentalë).
Krahasimi i përshtypjeve
veçori
BUZËQESHJE
InChI / InChIKey
Lexueshmëria
E lartë (miqësore me njerëzit)
I ulët (i përshtatshëm për makinën)
kanonikiteti
I nënshtrohet ndryshimit (ka nevojë për kanonizim)
natyrisht beqare
Përdorimi
komunikimi njerëzor, vizatimi, inputi
Përputhja e bazës së të dhënave, identiteti
stereokimia
Mbështet (simbolet @)
Mbështet (me shtresa)
për t'i dhënë AI
ideale
Ideale për konfirmim
mini raste
Rasti 1 - Dy emra, një molekulë. Një student mendoi se "N-acetil-para-aminofenol" dhe "paracetamol" ishin komponime të ndryshme dhe planifikoi dy eksperimente të veçanta. Kur u kanonizuan BUZËQESHJET e tyre në RDKit, ata të dy rezultuan të ishin CC(=O)Nc1ccc(O)cc1; Ishte e njëjta molekulë. Humbur: gjysmë dite planifikimi; fitimi: mund të ishte shmangur me një kontroll kanonializimi 2-minutësh.
Rasti 2 - Regjistrim i pavlefshëm SMILES. AI ktheu CC(=O)Nc1ccc(O)cc1C( për një variant (kllapat jo të mbyllura). Studenti ekzekutoi MolFromSmiles, ai ktheu Asnjë, pa menjëherë gabimin dhe kërkoi BUZËQESHJE të korrigjuara. Pa verifikim, struktura e gabuar do të ishte përhapur në të gjitha llogaritë.
Rasti 3 - Pesha molekulare e pasaktë. YZ tha "pesha molekulare 214.3 g/mol" për ibuprofenin (C13H18O2). Llogaritja e RDKit dha 206.28 g/mol. Diferenca për 0,1 mol: 21,43 g me YZ, në fakt 20,63 g. Kjo diferencë prej 3.9% do të prishte stekiometrinë dhe llogaritjen e rendimentit. Ai solli llogaritje përcaktuese.
Gabimet e zakonshme
- Dhënia e molekulës me emër. Sinonimet/emrat tregtarë janë të ngatërruar. Gjithmonë përfshini SMILES ose InChI.
- Krahasimi i buzeqeshjeve pa e kanonizuar. OCC dhe CCO janë të ndryshme në tekst, por të njëjta në molekula.
- Pyetja e peshës molekulare në modelin e gjuhës. Kjo është një llogaritje deterministe; Bëhet nga RDKit ose manualisht nga formula.
- Duke mos vënë re BUZËQESHJE të pavlefshme. Mos kontrollimi i kthimit të MolFromSmiles None dhe vazhdimi me strukturën e gabuar.
- Neglizhimi i stereokimisë. Dy enantiomeret (izomerë të imazhit të pasqyrës) mund të shfaqin efekte të ndryshme biologjike; Kapërcimi i shenjave @/@@ në SMILES.
Kujdes: E njëjta formulë molekulare nuk nënkupton molekula të ndryshme. C2H6O është edhe etanol (CCO) edhe dimetil eter (COC). Barazia e formulës nuk është barazi identiteti; Përdorni InChIKey për identifikim.
Në përmbledhje
- Identifikoni molekulat sipas shënimit të strukturës, jo sipas emrit: SMILES me njeriun, InChI/InChIKey me bazën e të dhënave.
- RDKit është përcaktues; AI parashikon, RDKit llogarit dhe verifikon.
- Analizoni çdo AI SMILES me MolFromSmiles dhe kontrolloni për Asnjë, më pas kanonizoni.
- Merrni numra si pesha molekulare dhe formula nga RDKit, jo nga modeli i gjuhës.
- Barazia e formulës nuk do të thotë identitet molekular; Përdorni InChIKey për identifikim.
Detyra e aplikimit
Zgjidhni tre përbërës (p.sh. kafeinë, ibuprofen, glicinë). Kërkoni nga AI BUZËQESHJE kanonike për secilën. Më pas shkruani një skript RDKit (përdorni shabllonin e mësipërm) dhe gjeneroni: BUZËQESHJE kanonike, formulë molekulare, peshë molekulare, InChIKey. Sa nga buzeqeshjet e dhëna nga AI ishin të vlefshme? Nëse YZ ka dhënë edhe peshën molekulare, llogaritni ndryshimin si përqindje me vlerën RDKit. Vendosni gjetjet tuaja në një tryezë të vogël.
listë kontrolli
- [ ] Unë e di se çfarë janë SMILES dhe InChI/InChIKey dhe kur t'i përdor ato.
- [ ] Unë verifikoj çdo BUZËQESHJE të dhënë nga AI me MolFromSmiles.
- [ ] Unë i kanonikizoj BUZËQESHJET përpara se t'i krahasoj ato.
- [ ] Unë jam duke marrë peshën molekulare dhe formulën nga RDKit, jo nga modeli i gjuhës.
- [ ] Unë konfirmoj identitetin e molekulës në bazën e të dhënave me InChIKey.
- [ ] Unë njoh situata ku stereokimia është e rëndësishme.