Üksus 7 / 11

Molekulaarsete omaduste ennustamine ja QSAR: eraldusvõime, pKa ja mudeli piirangud

Kasu:

  • Oskus eristada deterministlikult arvutatud tunnuseid statistiliselt hinnatud tunnustest ning määrata usaldusnivood
  • Võimalus hinnata piirkonda, kus mudel on usaldusväärne, kasutades rakendusala kontseptsiooni
  • Oskus mõista, et kandidaatide järjestamiseks ja lõpliku otsuse langetamiseks tuleks kasutada omaduste ennustusi.

Enne molekuli sünteesimist küsime sageli: "Kas see on vees lahustuv? Kui happeline see on? Kas see läbib rakumembraani? Kas see on usutav ravimikandidaadina?" Nendele küsimustele vastuste ennustamine enne katset säästab palju aega. Tehisintellekt ja selle spetsialiseeritud mudelid (eriti QSAR — kvantitatiivne struktuuri ja aktiivsuse suhe, st statistiline mudel, mis ennustab omadust molekuli struktuursete deskriptorite põhjal) on nendes ennustustes võimsad. Kuid need ennustused on tõenäosuse ennustused, mitte mõõtmised. Selles üksuses õpime tundma funktsioonide ennustamist, selle tugevusi ja kõige kriitilisemat kontseptsiooni, rakendatavustsooni (piirkonda, kus mudel on usaldusväärne).

Milliseid funktsioone ennustatakse?

  • logP: molekuli õli/vee jaotuskoefitsient; See näitab lipofiilsust (rasva meeldivus). Kriitiline ravimi imendumisel.
  • Lahustuvus (logS): kui lahustuv see vees on.
  • pKa: happesus/aluselisus; pH, mille juures rühm ioniseerub.
  • TPSA: topoloogiline polaarpind; Seda kasutatakse läbilaskvuse hindamisel.
  • Lipinski "viie reegel": molekulmassi, logP, suukaudsete ravimite kandidaatide H-sideme doonorite/aktseptorite arvu praktilised läved.

Mõned neist väärtustest arvutatakse deterministlikult (nt TPSA, H-sidemete arvud) selliste tööriistadega nagu RDKit; Mõned neist on statistilised hinnangud (logS, bioloogiline aktiivsus). Selle eristuse tundmine määrab, kui palju te usaldate.

Näpunäide: eristage, kas funktsioon on „arvutatud” (reeglipõhine, korratav) või „ennustatud” (mudelist, ebakindel). Usaldage arvutusi väga, usaldage ennustusi ettevaatlikult ja kontrollige ennustusi katse abil.

Kohaldatavus: kõige olulisem mõiste

QSAR-mudel töötab hästi molekulidel, mis on sarnased molekulidega, mille peal seda treeniti. Kui annate koolitusandmetest väga erineva molekuli (näiteks väga suur ebatavaline skelett), annab mudel ikkagi numbri, kuid see arv on ebausaldusväärne. Seda nimetatakse kohaldamisalast välja jäämiseks. Modell annab alati vastuse; Teie ülesanne on öelda, kas vastus on usaldusväärne või mitte.

See on veelgi riskantsem, kui keelemudel annab atribuudi väärtuse: see loob arvu "tõenäolise välimusega" väärtusena, ilma aluseks oleva arvutuseta. Nii et võimalusel hankige funktsioonide väärtused deterministlikust tööriistast (RDKit) või QSAR-mudelist, mis annab ebakindluse, mitte keelemudelist.

Samm-sammult: ohutu funktsiooni ennustamine

  1. Molekuli kontrollimine: parsige SMILES RDKitiga (üksus 2).
  2. Arvutage deterministlikud: MA, logP (arvutatud), TPSA, H-sideme arvud RDKitist.
  3. Märkige ennustused eraldi: säilitage mudeli ennustused, nagu logS, tegevus jne, sildiga "ennustus".
  4. Kontrollige rakendusala: kas molekul näeb välja nagu treeningandmed? Kas see on väga suur/ebatavaline?
  5. Kasutage järjestamiseks, mitte otsustamiseks: kasutage ennustusi kandidaatide järjestamiseks; Lõplik valik on eksperiment.
  6. Katse abil sulgemine: kontrollige mõõtmise teel kriitilisi omadusi (lahustuvus, pKa).

Neli kopeeritavat malli

1) RDKiti deterministlikud omadused:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))prinditud("logP (arvutatud):" round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-sideme doonor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond aktseptor:", rdMolDescriptors.CalcNum)HBA(molDescriptors.

2) Lipinski reegli hindamine:

Molekul (SMILES): [SMILES] Ülesanne: hinnake vastavust Lipinski viie reegliga MA, logP, HBD, HBA väärtustele, mis arvutatakse RDKitist. Märgi iga kriteerium eraldi kui läbitud/mittearvestatud. Reegel: ÄRGE mõtlege numbreid välja; Ma saan selle RDKitist, kommenteerite.

3) Funktsiooni hinnang + määramatuse taotlus:

Molekul (NAERATUS): [SMILES]Ülesanne: andke kvalitatiivne hinnang vees lahustuvusele (logS) (kõrge/keskmine/madal) ja selgitage selle põhjendust struktuursete tunnustega. Ärge andke täpset arvu; Öelge, et see on ENNUSTUS ja seda tuleb katsega kinnitada. Hoiatage, kui molekulil on ebatavaline struktuur (rakendatavuse risk).

4) Kandidaatide paremusjärjestus (prognooside järgi järjestamine):

Allpool on 5 molekulist koosnevad SMILES.Ülesanne: järjestage need vees lahustuvuse järgi (kõige lahustuvam kuni kõige vähem) struktuuriomaduste (polaarsete rühmade arv, rõngaste arv, lipofiilsus) alusel.Kirjutage iga järjestusotsuse põhjendus. Märkus: see on EEALNE sortimine; Lõplik valik tehakse mõõtmise teel.

Nõrk viip / Tugev viip

Nõrk:

Mis on selle molekuli lahustuvus?

Tehisintellekt moodustab arvu, mida arvutuses ei eksisteeri (nt "12 mg/mL"); See annab enesekindlust, kuid võib olla vale.

Tugev:

Molekul (NAERATAS): [NAERATAS].Ülesanne: 1) Annan RDKitiga arvutatava logP, TPSA, HBD/HBA: [väärtused].2) Nende väärtuste põhjal tõlgendage, kas eraldusvõime on kõrge/keskmine/madal.3) Täpse arvu andmine; Öelge, et see on oletus ja katsed on vajalikud.

Erinevus: võtsime sõidukist deterministlikud väärtused ja panime tehisintellekti neid lihtsalt tõlgendama; Me palusime selgesõnaliselt ebakindlust ja eksperimenteerimise vajadust.

Funktsioonide tüübid ja usaldustase

funktsiooni

Kuidas saada

usaldada

märkus

molekulmass

RDKit (deterministlik)

väga kõrge

Lõika valemist

TPSA, HBD/HBA

RDKit (deterministlik)

kõrge

reeglipõhine

logP (arvutatud)

RDKiti mudel

keskmine-kõrge

Võib eksperimentaalsest kõrvale kalduda

logS (eraldusvõime)

QSAR-i hinnang

keskmine

Oleneb rakendusalast

pKa

erimudel

keskmine

See langeb keerukasse struktuuri

bioloogiline aktiivsus

QSAR/ML

Muutuv

Kindlasti testige ja kontrollige

mini korpused

Juhtum 1 – paigaldatud resolutsioonide arv. Õpilane küsis AI-lt ühendi lahustuvuse kohta; Ta sai vastuseks "25 mg/mL" ja koostas selle järgi katseplaani. Mõõtmise tegelik väärtus oli ~2 mg/ml, 10-kordne erinevus. AI oli selle numbri välja mõelnud. Õppetund: ärge võtke keelemudelist selliseid omadusi nagu eraldusvõime numbritena; kvalitatiivne ennustus + mõõtmine.

Juhtum 2 – väljaspool kohaldamisala. QSAR-i mudel ütles, et suure makromolekuli puhul, mis oli treeningkomplektist väga erinev, on "aktiivsus kõrge". Kasutaja märkas, et molekul ei sarnane koolitusandmetega ja pidas ennustust ebausaldusväärseks; Katse andis tõesti madala aktiivsuse. Õppetund: modell vastab alati; Kui see on väljaspool ulatust, on vastus väärtusetu.

Juhtum 3 – Lipinski õige kasutamine. Ühel kandidaatmolekulil hindas AI Lipinskit RDKiti väärtustega: MA 512 (>500, piiripealne), logP 4,8 (soodne), HBD 2, HBA 7. Kasutaja tõlgendas õigesti "üks kriteerium jääb alles, kuid reegel pole absoluutne" ega kõrvaldanud molekuli täielikult. Õppetund: reeglid on juhised, mitte künnised; Tõlgendamine kontekstiga.

Levinud vead

  • Funktsioonide arvu hankimine keelemudelist. Väärtused, mida ei arvutata, on valmistatud; Kasutage deterministlikku tööriista või mudelit määramatusega.
  • Rakendusvaldkonna ignoreerimine. Mudel genereerib numbrid iga molekuli jaoks; väljaspool valdkonda ebausaldusväärne.
  • Arvestades hinnangulist mõõtmist. logS on hinnang; See ei asenda eksperimentaalset eraldusvõimet.
  • Pidades Lipinskit absoluutseks reegliks. Piiril viibivat kandidaati automaatselt ei kõrvaldata; Paljud ravimid rikuvad reeglit.
  • Segi ajamine "arvutatud" ja "hinnanguline". TPSA on arvutatud (usaldusväärne), aktiivsus on hinnanguline (ebakindel).
Ettevaatust! Funktsioonide prognoosid sobivad suurepäraselt kandidaatide järjestamiseks ja tähtsuse järjekorda seadmiseks; kuid mitte otsustada üksi. "Mudel ütles, et lahustuv" on hüpotees; "Ma mõõtsin, see lahustub" on tulemus.

Kokkuvõttes

  • Molekulaarseid omadusi saab enne katset ennustada ja see säästab palju aega.
  • Mõned tunnused arvutatakse deterministlikult (MA, TPSA, HBD/HBA), mõned on statistilised hinnangud (logS, aktiivsus).
  • Rakendatavuse valdkond on kõige kriitilisem mõiste: mudel vastab alati, kuid väljaspool domeeni on ebausaldusväärne.
  • Hankige funktsioonide arv RDKitilt või mitmetähenduslikkuse mudelist, mitte keelemudelist.
  • Kasutage ennustusi kandidaatide järjestamiseks; Lõplik otsus langetage katsetades.

Rakenduse ülesanne

Valige viis molekuli (nt ravimiseeria). Arvutage RDKitiga igaühe jaoks MA, logP, TPSA, HBD, HBA ja hinnake Lipinskit. Eraldi küsige tehisintellektilt kvalitatiivset hinnangut (mitte arvu) iga molekuli lahustuvuse kohta ja kohaldamisala hoiatust. Koguge tabelisse deterministlikud väärtused ja AI ennustused. Milline molekul andis kõige ravimisarnase profiili? Kus on ebakindlus kõige suurem?

kontrollnimekiri

  • [ ] Eristan deterministlikke arvutatud ja ennustatud omadusi.
  • [ ] Ma saan atribuutide väärtused RDKit-i/mudelist, mitte keelemudelist.
  • [ ] Märkan molekule, mis jäävad kohaldamisalast välja.
  • [ ] Lipinskit kasutan juhisena, mitte absoluutse reeglina.
  • [ ] Kasutan ennustusi järjestamisel ja otsust katsetamiseks.
  • [ ] Mul on plaan kontrollida kriitilisi tunnuseid mõõtmise teel.