Kasu:
- Oskus eristada deterministlikult arvutatud tunnuseid statistiliselt hinnatud tunnustest ning määrata usaldusnivood
- Võimalus hinnata piirkonda, kus mudel on usaldusväärne, kasutades rakendusala kontseptsiooni
- Oskus mõista, et kandidaatide järjestamiseks ja lõpliku otsuse langetamiseks tuleks kasutada omaduste ennustusi.
Enne molekuli sünteesimist küsime sageli: "Kas see on vees lahustuv? Kui happeline see on? Kas see läbib rakumembraani? Kas see on usutav ravimikandidaadina?" Nendele küsimustele vastuste ennustamine enne katset säästab palju aega. Tehisintellekt ja selle spetsialiseeritud mudelid (eriti QSAR — kvantitatiivne struktuuri ja aktiivsuse suhe, st statistiline mudel, mis ennustab omadust molekuli struktuursete deskriptorite põhjal) on nendes ennustustes võimsad. Kuid need ennustused on tõenäosuse ennustused, mitte mõõtmised. Selles üksuses õpime tundma funktsioonide ennustamist, selle tugevusi ja kõige kriitilisemat kontseptsiooni, rakendatavustsooni (piirkonda, kus mudel on usaldusväärne).
Milliseid funktsioone ennustatakse?
- logP: molekuli õli/vee jaotuskoefitsient; See näitab lipofiilsust (rasva meeldivus). Kriitiline ravimi imendumisel.
- Lahustuvus (logS): kui lahustuv see vees on.
- pKa: happesus/aluselisus; pH, mille juures rühm ioniseerub.
- TPSA: topoloogiline polaarpind; Seda kasutatakse läbilaskvuse hindamisel.
- Lipinski "viie reegel": molekulmassi, logP, suukaudsete ravimite kandidaatide H-sideme doonorite/aktseptorite arvu praktilised läved.
Mõned neist väärtustest arvutatakse deterministlikult (nt TPSA, H-sidemete arvud) selliste tööriistadega nagu RDKit; Mõned neist on statistilised hinnangud (logS, bioloogiline aktiivsus). Selle eristuse tundmine määrab, kui palju te usaldate.
Näpunäide: eristage, kas funktsioon on „arvutatud” (reeglipõhine, korratav) või „ennustatud” (mudelist, ebakindel). Usaldage arvutusi väga, usaldage ennustusi ettevaatlikult ja kontrollige ennustusi katse abil.
Kohaldatavus: kõige olulisem mõiste
QSAR-mudel töötab hästi molekulidel, mis on sarnased molekulidega, mille peal seda treeniti. Kui annate koolitusandmetest väga erineva molekuli (näiteks väga suur ebatavaline skelett), annab mudel ikkagi numbri, kuid see arv on ebausaldusväärne. Seda nimetatakse kohaldamisalast välja jäämiseks. Modell annab alati vastuse; Teie ülesanne on öelda, kas vastus on usaldusväärne või mitte.
See on veelgi riskantsem, kui keelemudel annab atribuudi väärtuse: see loob arvu "tõenäolise välimusega" väärtusena, ilma aluseks oleva arvutuseta. Nii et võimalusel hankige funktsioonide väärtused deterministlikust tööriistast (RDKit) või QSAR-mudelist, mis annab ebakindluse, mitte keelemudelist.
Samm-sammult: ohutu funktsiooni ennustamine
- Molekuli kontrollimine: parsige SMILES RDKitiga (üksus 2).
- Arvutage deterministlikud: MA, logP (arvutatud), TPSA, H-sideme arvud RDKitist.
- Märkige ennustused eraldi: säilitage mudeli ennustused, nagu logS, tegevus jne, sildiga "ennustus".
- Kontrollige rakendusala: kas molekul näeb välja nagu treeningandmed? Kas see on väga suur/ebatavaline?
- Kasutage järjestamiseks, mitte otsustamiseks: kasutage ennustusi kandidaatide järjestamiseks; Lõplik valik on eksperiment.
- Katse abil sulgemine: kontrollige mõõtmise teel kriitilisi omadusi (lahustuvus, pKa).
Neli kopeeritavat malli
1) RDKiti deterministlikud omadused:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))prinditud("logP (arvutatud):" round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-sideme doonor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond aktseptor:", rdMolDescriptors.CalcNum)HBA(molDescriptors.
2) Lipinski reegli hindamine:
Molekul (SMILES): [SMILES] Ülesanne: hinnake vastavust Lipinski viie reegliga MA, logP, HBD, HBA väärtustele, mis arvutatakse RDKitist. Märgi iga kriteerium eraldi kui läbitud/mittearvestatud. Reegel: ÄRGE mõtlege numbreid välja; Ma saan selle RDKitist, kommenteerite.
3) Funktsiooni hinnang + määramatuse taotlus:
Molekul (NAERATUS): [SMILES]Ülesanne: andke kvalitatiivne hinnang vees lahustuvusele (logS) (kõrge/keskmine/madal) ja selgitage selle põhjendust struktuursete tunnustega. Ärge andke täpset arvu; Öelge, et see on ENNUSTUS ja seda tuleb katsega kinnitada. Hoiatage, kui molekulil on ebatavaline struktuur (rakendatavuse risk).
4) Kandidaatide paremusjärjestus (prognooside järgi järjestamine):
Allpool on 5 molekulist koosnevad SMILES.Ülesanne: järjestage need vees lahustuvuse järgi (kõige lahustuvam kuni kõige vähem) struktuuriomaduste (polaarsete rühmade arv, rõngaste arv, lipofiilsus) alusel.Kirjutage iga järjestusotsuse põhjendus. Märkus: see on EEALNE sortimine; Lõplik valik tehakse mõõtmise teel.
Nõrk viip / Tugev viip
Nõrk:
Mis on selle molekuli lahustuvus?
Tehisintellekt moodustab arvu, mida arvutuses ei eksisteeri (nt "12 mg/mL"); See annab enesekindlust, kuid võib olla vale.
Tugev:
Molekul (NAERATAS): [NAERATAS].Ülesanne: 1) Annan RDKitiga arvutatava logP, TPSA, HBD/HBA: [väärtused].2) Nende väärtuste põhjal tõlgendage, kas eraldusvõime on kõrge/keskmine/madal.3) Täpse arvu andmine; Öelge, et see on oletus ja katsed on vajalikud.
Erinevus: võtsime sõidukist deterministlikud väärtused ja panime tehisintellekti neid lihtsalt tõlgendama; Me palusime selgesõnaliselt ebakindlust ja eksperimenteerimise vajadust.
Funktsioonide tüübid ja usaldustase
funktsiooni
Kuidas saada
usaldada
märkus
molekulmass
RDKit (deterministlik)
väga kõrge
Lõika valemist
TPSA, HBD/HBA
RDKit (deterministlik)
kõrge
reeglipõhine
logP (arvutatud)
RDKiti mudel
keskmine-kõrge
Võib eksperimentaalsest kõrvale kalduda
logS (eraldusvõime)
QSAR-i hinnang
keskmine
Oleneb rakendusalast
pKa
erimudel
keskmine
See langeb keerukasse struktuuri
bioloogiline aktiivsus
QSAR/ML
Muutuv
Kindlasti testige ja kontrollige
mini korpused
Juhtum 1 – paigaldatud resolutsioonide arv. Õpilane küsis AI-lt ühendi lahustuvuse kohta; Ta sai vastuseks "25 mg/mL" ja koostas selle järgi katseplaani. Mõõtmise tegelik väärtus oli ~2 mg/ml, 10-kordne erinevus. AI oli selle numbri välja mõelnud. Õppetund: ärge võtke keelemudelist selliseid omadusi nagu eraldusvõime numbritena; kvalitatiivne ennustus + mõõtmine.
Juhtum 2 – väljaspool kohaldamisala. QSAR-i mudel ütles, et suure makromolekuli puhul, mis oli treeningkomplektist väga erinev, on "aktiivsus kõrge". Kasutaja märkas, et molekul ei sarnane koolitusandmetega ja pidas ennustust ebausaldusväärseks; Katse andis tõesti madala aktiivsuse. Õppetund: modell vastab alati; Kui see on väljaspool ulatust, on vastus väärtusetu.
Juhtum 3 – Lipinski õige kasutamine. Ühel kandidaatmolekulil hindas AI Lipinskit RDKiti väärtustega: MA 512 (>500, piiripealne), logP 4,8 (soodne), HBD 2, HBA 7. Kasutaja tõlgendas õigesti "üks kriteerium jääb alles, kuid reegel pole absoluutne" ega kõrvaldanud molekuli täielikult. Õppetund: reeglid on juhised, mitte künnised; Tõlgendamine kontekstiga.
Levinud vead
- Funktsioonide arvu hankimine keelemudelist. Väärtused, mida ei arvutata, on valmistatud; Kasutage deterministlikku tööriista või mudelit määramatusega.
- Rakendusvaldkonna ignoreerimine. Mudel genereerib numbrid iga molekuli jaoks; väljaspool valdkonda ebausaldusväärne.
- Arvestades hinnangulist mõõtmist. logS on hinnang; See ei asenda eksperimentaalset eraldusvõimet.
- Pidades Lipinskit absoluutseks reegliks. Piiril viibivat kandidaati automaatselt ei kõrvaldata; Paljud ravimid rikuvad reeglit.
- Segi ajamine "arvutatud" ja "hinnanguline". TPSA on arvutatud (usaldusväärne), aktiivsus on hinnanguline (ebakindel).
Ettevaatust! Funktsioonide prognoosid sobivad suurepäraselt kandidaatide järjestamiseks ja tähtsuse järjekorda seadmiseks; kuid mitte otsustada üksi. "Mudel ütles, et lahustuv" on hüpotees; "Ma mõõtsin, see lahustub" on tulemus.
Kokkuvõttes
- Molekulaarseid omadusi saab enne katset ennustada ja see säästab palju aega.
- Mõned tunnused arvutatakse deterministlikult (MA, TPSA, HBD/HBA), mõned on statistilised hinnangud (logS, aktiivsus).
- Rakendatavuse valdkond on kõige kriitilisem mõiste: mudel vastab alati, kuid väljaspool domeeni on ebausaldusväärne.
- Hankige funktsioonide arv RDKitilt või mitmetähenduslikkuse mudelist, mitte keelemudelist.
- Kasutage ennustusi kandidaatide järjestamiseks; Lõplik otsus langetage katsetades.
Rakenduse ülesanne
Valige viis molekuli (nt ravimiseeria). Arvutage RDKitiga igaühe jaoks MA, logP, TPSA, HBD, HBA ja hinnake Lipinskit. Eraldi küsige tehisintellektilt kvalitatiivset hinnangut (mitte arvu) iga molekuli lahustuvuse kohta ja kohaldamisala hoiatust. Koguge tabelisse deterministlikud väärtused ja AI ennustused. Milline molekul andis kõige ravimisarnase profiili? Kus on ebakindlus kõige suurem?
kontrollnimekiri
- [ ] Eristan deterministlikke arvutatud ja ennustatud omadusi.
- [ ] Ma saan atribuutide väärtused RDKit-i/mudelist, mitte keelemudelist.
- [ ] Märkan molekule, mis jäävad kohaldamisalast välja.
- [ ] Lipinskit kasutan juhisena, mitte absoluutse reeglina.
- [ ] Kasutan ennustusi järjestamisel ja otsust katsetamiseks.
- [ ] Mul on plaan kontrollida kriitilisi tunnuseid mõõtmise teel.