Enota 7 / 11

Napovedovanje molekularnih lastnosti in QSAR: ločljivost, pKa in meje modela

Dobički:

  • Sposobnost razlikovanja med deterministično izračunanimi značilnostmi in statistično ocenjenimi značilnostmi ter določanje stopenj zaupanja
  • Sposobnost ovrednotenja regije, v kateri je model zanesljiv, z uporabo koncepta domene uporabnosti
  • Sposobnost razumevanja, da je treba za razvrščanje kandidatov uporabiti napovedi lastnosti in s preizkušanjem sprejeti končno odločitev.

Preden sintetiziramo molekulo, se pogosto vprašamo: "Ali je topna v vodi? Kako kisla je? Ali prehaja celično membrano? Ali je verjetna kot kandidat za zdravilo?" Napovedovanje odgovorov na ta vprašanja pred poskusom prihrani veliko časa. Umetna inteligenca in njeni specializirani modeli (zlasti QSAR – kvantitativno razmerje med strukturo in aktivnostjo, tj. statistični model, ki napove lastnost iz strukturnih deskriptorjev molekule) so močni pri teh napovedih. Toda te napovedi so napovedi verjetnosti, ne meritve. V tej enoti se bomo seznanili z napovedjo funkcij, njenimi prednostmi in najbolj kritičnim konceptom, območjem uporabnosti (območje, kjer je model zanesljiv).

Katere lastnosti so predvidene?

  • logP: Porazdelitveni koeficient molekule olje/voda; Kaže lipofilnost (naklonjenost maščobam). Kritičen pri absorpciji zdravil.
  • Topnost (logS): Kako topen je v vodi.
  • pKa: Kislost/alkalnost; pH, pri katerem skupina ionizira.
  • TPSA: Topološka polarna površina; Uporablja se pri oceni prepustnosti.
  • Lipinskijevo »pravilo petih«: Praktični pragovi za molekulsko maso, logP, število donorjev/akceptorjev H-vezi kandidatov za peroralna zdravila.

Nekatere od teh vrednosti se izračunajo deterministično (npr. TPSA, števila H-vezi) z orodji, kot je RDKit; Nekatere od njih so statistične ocene (logS, biološka aktivnost). Poznavanje te razlike določa, koliko zaupate.

Namig: ločite, ali je funkcija »izračunana« (na podlagi pravil, ponovljiva) ali »predvidena« (iz modela, negotova). Imejte visoko zaupanje v izračune, previdno zaupanje v napovedi in preverite napovedi s poskusom.

Področje uporabnosti: najpomembnejši koncept

Model QSAR dobro deluje na molekulah, ki so podobne molekulam, na katerih je bil učen. Če navedete molekulo, ki se zelo razlikuje od podatkov o usposabljanju (na primer zelo veliko, nenavadno okostje), bo model še vedno ustvaril številko, vendar bo ta številka nezanesljiva. Temu se reče »biti zunaj obsega uporabnosti«. Model vedno daje odgovor; Vaša naloga je, da ugotovite, ali je odgovor zanesljiv ali ne.

Še bolj tvegano je, ko jezikovni model poda vrednost atributa: ustvari število kot "verjetno" vrednost brez osnovnega izračuna. Torej, če je mogoče, pridobite vrednosti funkcij iz determinističnega orodja (RDKit) ali modela QSAR, ki daje negotovost, ne iz jezikovnega modela.

Korak za korakom: varna napoved funkcij

  1. Preverite molekulo: Razčlenite SMILES z RDKit (enota 2).
  2. Izračunajte deterministične: MA, logP (izračunano), TPSA, števila H-vezi iz RDKit.
  3. Ločeno označi napovedi: hranite napovedi modela, kot so logS, dejavnost itd., z oznako »prediction«.
  4. Preverite domeno uporabnosti: Ali je molekula podobna učnim podatkom? Ali je izjemno velik/nenavaden?
  5. Uporaba za razvrščanje, ne odločitev: Uporabite napovedi za razvrščanje kandidatov; Končna izbira je eksperiment.
  6. Bližnji poskus: Preverite kritične lastnosti (topnost, pKa) z meritvijo.

Štiri predloge za kopiranje

1) Deterministične funkcije z RDKit:

from rdkit import Chemfrom rdkit.Chem import Deskriptorji, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (izračunano):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donor H-vezi:", rdMolDescriptors.CalcNumHBD(mol))print("Akceptor H-vezi:", rdMolDescriptors.CalcNumHBA(mol))

2) Ocena Lipinskega pravila:

Molekula (SMILES): [SMILE] Naloga: Ocenite skladnost z Lipinijevim pravilom petih z vrednostmi MA, logP, HBD, HBA, ki jih je treba izračunati iz RDKit. Vsak kriterij posebej označite kot opravil/neuspešno. Pravilo: NE izmišljujte številk; Dobil bom iz RDKit, vi komentirajte.

3) Ocena značilnosti + zahteva po negotovosti:

Molekula (NASMEH): [NASMEH]Naloga: Podajte kvalitativno oceno topnosti v vodi (logS) (visoka/srednja/nizka) in pojasnite utemeljitev s strukturnimi značilnostmi. Ne navedite točne številke; Navedite, da je to NAPOVED in jo je treba potrditi s poskusom. Opozori, če ima molekula neobičajno strukturo (tveganje uporabnosti).

4) Razvrstitev kandidatov (razporeditev prednosti glede na napoved):

Spodaj so SMILES 5 molekul. Naloga: Razvrstite jih glede na topnost v vodi (od najbolj topnih do najmanj) na podlagi strukturnih značilnosti (število polarnih skupin, obročev, lipofilnost). Napišite utemeljitev za vsako odločitev o razvrstitvi. Opomba: To je PRELIMINARNO razvrščanje; Končni izbor bo narejen z meritvami.

Šibek poziv/močan poziv

Šibko:

Kakšna je topnost te molekule?

AI sestavlja številko, ki v izračunu ne obstaja (npr. "12 mg/mL"); Daje samozavest, vendar je lahko napačno.

Močno:

Molekula (SMILES): [SMILES].Naloga: 1) Podal bom logP, TPSA, HBD/HBA, ki jih je treba izračunati z RDKit: [vrednosti].2) Na podlagi teh vrednosti razloži, ali je ločljivost visoka/srednja/nizka.3) Navedba natančnega števila; Navedite, da gre za ugibanje in da so potrebni poskusi.

Razlika: vzeli smo deterministične vrednosti iz vozila in naredili, da jih AI samo interpretira; Izrecno smo zahtevali negotovost in potrebo po eksperimentiranju.

Vrste funkcij in stopnja zaupanja

funkcija

Kako do

zaupanje

opomba

molekulska masa

RDKit (determinističen)

zelo visoko

Izrežite iz formule

TPSA, HBD/HBA

RDKit (determinističen)

visoka

temelji na pravilih

logP (izračunano)

Model RDKit

srednje visoka

Lahko odstopa od eksperimentalnega

logS (ločljivost)

Ocena QSAR

srednje

Odvisno od področja uporabe

pKa

poseben model

srednje

Spada v kompleksno strukturo

biološka aktivnost

QSAR/ML

Spremenljivka

Bodite prepričani, da preizkusite in preverite

mini etuiji

Primer 1 – Število nameščenih ločljivosti. Študent je AI vprašal o topnosti spojine; Prejel je odgovor "25 mg/mL" in temu primerno postavil zasnovo eksperimenta. Dejanska vrednost pri meritvi je bila ~2 mg/mL, kar je 10-kratna razlika. AI je sestavil številko. Lekcija: lastnosti, kot je ločljivost, ne jemljite kot številke iz jezikovnega modela; kvalitativna napoved + meritev.

Primer 2 – Zunaj obsega uporabe. Model QSAR je rekel, da je "aktivnost visoka" za veliko makromolekulo, ki se je zelo razlikovala od učnega niza. Uporabnik je opazil, da molekula ni podobna podatkom o usposabljanju, in menil, da je napoved nezanesljiva; Poskus je pokazal res nizko aktivnost. Nauk: model se vedno odzove; Če je izven obsega, je odgovor brez vrednosti.

Primer 3 – Pravilna uporaba Lipinskega. Na eni kandidatni molekuli je AI ocenil Lipinski z vrednostmi iz RDKit: MA 512 (>500, meja), logP 4,8 (ugodno), HBD 2, HBA 7. Uporabnik je pravilno razložil, da "eno merilo ostaja, vendar pravilo ni absolutno" in molekule ni v celoti izločil. Lekcija: pravila so smernice, ne pragovi; Razlagajte s kontekstom.

Pogoste napake

  • Pridobivanje števila funkcij iz jezikovnega modela. Vrednosti, ki niso izračunane, so izmišljene; Uporabite deterministično orodje ali model z negotovostjo.
  • Ignoriranje področja uporabnosti. Model ustvari številke za vsako molekulo; nezanesljiv zunaj polja.
  • Ob upoštevanju ocenjene meritve. logS je ocena; Ni nadomestek za eksperimentalno ločljivost.
  • Glede na Lipinskega absolutno pravilo. Kandidat, ki je na meji, ni samodejno izločen; Veliko zdravil krši pravilo.
  • Zamenjati »izračunano« z »ocenjeno«. TPSA je izračunan (zanesljivo), aktivnost je ocenjena (negotovo).
Pozor: napovedi funkcij so odlične za razvrščanje in dajanje prednosti kandidatom; ne pa samo za določitev odločitve. "Model je rekel, da je topen" je hipoteza; "Izmeril sem, raztopi se" je rezultat.

Če povzamem

  • Molekularne lastnosti je mogoče predvideti pred poskusom in prihrani veliko časa.
  • Nekatere značilnosti so izračunane deterministično (MA, TPSA, HBD/HBA), nekatere so statistične ocene (logS, aktivnost).
  • Domena uporabnosti je najbolj kritičen koncept: model vedno odgovori, vendar je zunaj domene nezanesljiv.
  • Pridobite število funkcij iz RDKit ali modela dvoumnosti, ne iz jezikovnega modela.
  • Uporabite napovedi za razvrščanje kandidatov; Končno odločitev sprejmete z eksperimentiranjem.

Aplikacijska naloga

Izberite pet molekul (npr. niz zdravil). Izračunajte MA, logP, TPSA, HBD, HBA za vsakega z RDKit in ocenite Lipinski. Ločeno prosite AI za kvalitativno oceno (ne številko) topnosti vsake molekule in opozorilo o področju uporabnosti. Zberite deterministične vrednosti in napovedi AI v tabeli. Katera molekula je dala profil, ki je najbolj podoben zdravilu? Kje je največja negotovost?

kontrolni seznam

  • [ ] Razlikujem med deterministično izračunanimi in predvidenimi lastnostmi.
  • [ ] Vrednosti lastnosti dobivam iz RDKit/modela, ne iz jezikovnega modela.
  • [ ] Opazim molekule izven obsega uporabnosti.
  • [ ] Lipinskega uporabljam kot vodilo, ne kot absolutno pravilo.
  • [ ] Napovedi uporabljam za razvrstitev in odločitev za eksperimentiranje.
  • [ ] Imam načrt za preverjanje kritičnih lastnosti z merjenjem.