Njësia 2 / 11

Përfaqësimi molekular dhe struktura kimike: Vërtetimi me SMILES, InChI dhe RDKit

Fitimet:

  • Aftësia për të identifikuar molekulat jo me emër, por nga përfaqësimi i strukturës (BUZËQESHJE me njerëzit, InChI/InChIKey me bazën e të dhënave)
  • Aftësia për të zbuluar struktura të pavlefshme ose të pasakta duke analizuar, vërtetuar dhe kanonikizuar çdo SMILES të dhënë nga inteligjenca artificiale me RDKit
  • Të jesh në gjendje të kuptojmë se sasitë përcaktuese si pesha molekulare dhe formula duhet të merren nga mjeti i bazuar në rregulla, jo nga modeli gjuhësor.

Kushti i parë për përdorimin e sigurt të AI në kimi është shkrimi i molekulës në një gjuhë që mund ta kuptojnë si makina ashtu edhe njeriu. Ju thoni "fenol", AI e kupton mirë; por kur thua "acid" ka mijëra mundësi. Emrat janë të paqartë; përfaqësimet e strukturës janë të sakta. Në këtë njësi do të mësojmë dy shënimet bazë që e përkthejnë molekulën në tekst (SMILES dhe InChI) dhe mjetin që i verifikon ato në mënyrë deterministike (RDKit). Qëllimi ynë: t'i japim molekulën AI në një mënyrë që ajo kurrë të mos keqkuptohet dhe të konfirmojmë strukturën e prodhuar nga AI me një mjet.

Çfarë është SMILES?

SMILES (Sistemi i thjeshtuar i hyrjes në linjë molekulare) është një format i shkrimit të një molekule në një rresht të vetëm teksti. Atomet përfaqësohen me shkronja, lidhjet me simbole dhe unazat me numra. Shembuj:

  • Etanoli: CCO (karbon-karbon-oksigjen; hidrogjenet e nënkuptuar).
  • Benzeni: c1cccccc1 (shkronja e vogël "c" tregon karbon aromatik; 1 mbyll unazën).
  • Aspirina: CC(=O)Oc1ccccc1C(=O)O.
  • Kafeina: Cn1cnc2c1c(=O)n(C)c(=O)n2C.

Fuqia e SMILES është se ajo mbart të gjithë strukturën e lidhjes në një linjë të vetme; Dobësia e saj është se e njëjta molekulë mund të ketë BUZËQESHJE të shumëfishta të vlefshme (kjo quhet jokanonike). Ne do ta zgjidhim këtë me RDKit në një moment.

Këshillë: "BUZËQESHJE kanonike" për një molekulë është drejtshkrimi i vetëm, standard për atë molekulë. Për të parë nëse dy BUZËQESHJE janë e njëjta molekulë, kanonizoni dhe krahasoni ato; Ato nuk duhet të jenë të barabarta tekstualisht, por duhet të jenë molekula të barabarta.

Çfarë është InChI?

InChI (International Chemical Identifier) ​​është një identifikues standard i zhvilluar nga IUPAC. Dallimi nga SMILES është se e njëjta molekulë jep gjithmonë të njëjtin InChI; pra ka natyrë kanonike. Është e gjatë dhe e vështirë për t'u lexuar, por është ideale për përputhjen e bazës së të dhënave. Shkurtuar "InChIKey" (përmbledhje me 27 karaktere) përdoret për kërkim.

  • Aspirina InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N.

Rregulli: Njerëzit flasin BUZËQESHJE (lexuar), makinat dhe bazat e të dhënave përputhen me InChI/InChIKey (saktësisht). Jepini BUZËQESHJE UA; Konfirmo në bazën e të dhënave me InChIKey.

RDKit: motor verifikimi përcaktues

RDKit është një bibliotekë kimiformatike me burim të hapur. Ndryshe nga modeli i gjuhës, ai bazohet në rregulla: analizon SMILES, llogarit peshën molekulare, gjeneron SMILES kanonike, kthen InChI/InChIKey, tërheq molekulën. Pra, RDKit "llogarit" atë që "parashikon" AI. Ky është thelbi i rrjedhës së punës: AI gjeneron, RDKit verifikon.

Një rrjedhë bazë verifikimi:

nga rdkit import Chemfrom rdkit.Chem përshkruesit e importit, Drawsmiles = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) print("Formula molekulare:", Chem.rdMolPërshkruesit.CalcMolFormula(mol)Descriptors pesha:mol)" 2), "g/mol") print("InChIKey:", Chem.MolToInchiKey(mol))

Nëse MolFromSmiles kthen Asnjë, AI ju ka dhënë një molekulë të pavlefshme; Vetëm ky është një paralajmërim shumë i vlefshëm. Nëse është e vlefshme, nuk keni më nevojë të kërkoni modelin gjuhësor për peshën molekulare; Është në dorën tuaj në mënyrë deterministe.

Hap pas hapi: Ndërveprimi AI + RDKit

  1. Identifikoni molekulën: Jepini AI emrin, kërkoni SMILES. Për shembull, "verifikoni BUZËQESHJET kanonike për paracetamol".
  2. Verifiko: Analizoni BUZËQESHJET hyrëse me MolFromSmiles. Nëse Asnjë, refuzoni.
  3. Canonicalize: Merrni drejtshkrimin kanonik me MolToSmiles; Përdoreni gjithmonë këtë nga tani e tutje.
  4. Llogaritni numrat: Merrni peshën molekulare, formulën, numrin e unazave, numrin e dhuruesve/pranuesve të lidhjeve hidrogjenore etj. nga RDKit, jo nga AI.
  5. Fix ID: Gjeneroni InChIKey, kërkoni në bazën e të dhënave (PubChem), konfirmoni që molekula është me të vërtetë përbërësi që dëshironi.

Katër shabllone të kopjueshëm

1) Kërkimi i BUZËQESHJEVE (nga emri në strukturë):

Detyrë: Jepni buzëqeshjet kanonike për përbërjen e mëposhtme. Përbërja: paracetamol (acetaminophen). Rregulli: Jepni vetëm vargun SMILES dhe InChIKey, mos shtoni ndonjë shpjegim të mëtejshëm. Nëse nuk jeni të sigurt, shkruani "PASIGURT", mos u bëni deri.

2) Kërkesa e vërtetimit SMILES (nga struktura në kontroll):

Shqyrtoni BUZËQESHJET më poshtë: CC(=O)Nc1ccc(O)cc1Pyetje:1) A është kjo një BUZËQESHJE e vlefshme?2) Me çfarë komponimi korrespondon (emri i zakonshëm)?3) Cila është formula molekulare?Shënim: Do të llogaris peshën e saktë molekulare me RDKit; Ju thjesht jepni interpretimin tuaj të strukturës.

3) Krahasimi i dy paraqitjeve:

Unë kam dy BUZËQESHJE:A) OCCB) CCOTDetyrë: A janë këto e njëjta molekulë apo të ndryshme? Shkruani arsyetimin tuaj. Shënim: Unë do të kontrolloj përgjigjen tuaj duke e kanonizuar në RDKit.

4) Shpjegimi i strukturës (për qëllime mësimore):

BUZËQESHJE: Cn1cnc2c1c(=O)n(C)c(=O)n2CTDetyrë: Lexoni këtë BUZËQESHJE pjesë-pjesë dhe shpjegoni se çfarë do të thotë çdo simbol (atom, lidhje, unazë, aromatik) në turqisht të thjeshtë. Tregoni gjithashtu se për cilin përbërës është.

Prompt i dobët / Prompt i fortë

I dobët:

Jepni vetitë e acetaminofenit.

"Veçori" është e paqartë; AI gjeneron numra të rastësishëm nga pesha molekulare deri në pikën e shkrirjes, disa prej të cilave do të jenë të gabuara.

E fortë:

Komponimi: acetaminophen.1) SMILES Canonical dhe InChIKey ver.2) Jepni formulen molekulare.Rregulli: MOS JEP vlerat NUMERIKE si pesha molekulare, pika e shkrirjes etj.; Unë do t'i marr ato me RDKit/PubChem. Thjesht jepni ID-në e ndërtimit.

Dallimi: Ne e drejtuam AI-në drejt asaj që është e fortë (identiteti i strukturës) dhe larg asaj në të cilën është e dobët (numrat eksperimentalë).

Krahasimi i përshtypjeve

veçori

BUZËQESHJE

InChI / InChIKey

Lexueshmëria

E lartë (miqësore me njerëzit)

I ulët (i përshtatshëm për makinën)

kanonikiteti

I nënshtrohet ndryshimit (ka nevojë për kanonizim)

natyrisht beqare

Përdorimi

komunikimi njerëzor, vizatimi, inputi

Përputhja e bazës së të dhënave, identiteti

stereokimia

Mbështet (simbolet @)

Mbështet (me shtresa)

për t'i dhënë AI

ideale

Ideale për konfirmim

mini raste

Rasti 1 - Dy emra, një molekulë. Një student mendoi se "N-acetil-para-aminofenol" dhe "paracetamol" ishin komponime të ndryshme dhe planifikoi dy eksperimente të veçanta. Kur u kanonizuan BUZËQESHJET e tyre në RDKit, ata të dy rezultuan të ishin CC(=O)Nc1ccc(O)cc1; Ishte e njëjta molekulë. Humbur: gjysmë dite planifikimi; fitimi: mund të ishte shmangur me një kontroll kanonializimi 2-minutësh.

Rasti 2 - Regjistrim i pavlefshëm SMILES. AI ktheu CC(=O)Nc1ccc(O)cc1C( për një variant (kllapat jo të mbyllura). Studenti ekzekutoi MolFromSmiles, ai ktheu Asnjë, pa menjëherë gabimin dhe kërkoi BUZËQESHJE të korrigjuara. Pa verifikim, struktura e gabuar do të ishte përhapur në të gjitha llogaritë.

Rasti 3 - Pesha molekulare e pasaktë. YZ tha "pesha molekulare 214.3 g/mol" për ibuprofenin (C13H18O2). Llogaritja e RDKit dha 206.28 g/mol. Diferenca për 0,1 mol: 21,43 g me YZ, në fakt 20,63 g. Kjo diferencë prej 3.9% do të prishte stekiometrinë dhe llogaritjen e rendimentit. Ai solli llogaritje përcaktuese.

Gabimet e zakonshme

  • Dhënia e molekulës me emër. Sinonimet/emrat tregtarë janë të ngatërruar. Gjithmonë përfshini SMILES ose InChI.
  • Krahasimi i buzeqeshjeve pa e kanonizuar. OCC dhe CCO janë të ndryshme në tekst, por të njëjta në molekula.
  • Pyetja e peshës molekulare në modelin e gjuhës. Kjo është një llogaritje deterministe; Bëhet nga RDKit ose manualisht nga formula.
  • Duke mos vënë re BUZËQESHJE të pavlefshme. Mos kontrollimi i kthimit të MolFromSmiles None dhe vazhdimi me strukturën e gabuar.
  • Neglizhimi i stereokimisë. Dy enantiomeret (izomerë të imazhit të pasqyrës) mund të shfaqin efekte të ndryshme biologjike; Kapërcimi i shenjave @/@@ në SMILES.
Kujdes: E njëjta formulë molekulare nuk nënkupton molekula të ndryshme. C2H6O është edhe etanol (CCO) edhe dimetil eter (COC). Barazia e formulës nuk është barazi identiteti; Përdorni InChIKey për identifikim.

Në përmbledhje

  • Identifikoni molekulat sipas shënimit të strukturës, jo sipas emrit: SMILES me njeriun, InChI/InChIKey me bazën e të dhënave.
  • RDKit është përcaktues; AI parashikon, RDKit llogarit dhe verifikon.
  • Analizoni çdo AI SMILES me MolFromSmiles dhe kontrolloni për Asnjë, më pas kanonizoni.
  • Merrni numra si pesha molekulare dhe formula nga RDKit, jo nga modeli i gjuhës.
  • Barazia e formulës nuk do të thotë identitet molekular; Përdorni InChIKey për identifikim.

Detyra e aplikimit

Zgjidhni tre përbërës (p.sh. kafeinë, ibuprofen, glicinë). Kërkoni nga AI BUZËQESHJE kanonike për secilën. Më pas shkruani një skript RDKit (përdorni shabllonin e mësipërm) dhe gjeneroni: BUZËQESHJE kanonike, formulë molekulare, peshë molekulare, InChIKey. Sa nga buzeqeshjet e dhëna nga AI ishin të vlefshme? Nëse YZ ka dhënë edhe peshën molekulare, llogaritni ndryshimin si përqindje me vlerën RDKit. Vendosni gjetjet tuaja në një tryezë të vogël.

listë kontrolli

  • [ ] Unë e di se çfarë janë SMILES dhe InChI/InChIKey dhe kur t'i përdor ato.
  • [ ] Unë verifikoj çdo BUZËQESHJE të dhënë nga AI me MolFromSmiles.
  • [ ] Unë i kanonikizoj BUZËQESHJET përpara se t'i krahasoj ato.
  • [ ] Unë jam duke marrë peshën molekulare dhe formulën nga RDKit, jo nga modeli i gjuhës.
  • [ ] Unë konfirmoj identitetin e molekulës në bazën e të dhënave me InChIKey.
  • [ ] Unë njoh situata ku stereokimia është e rëndësishme.