Jedinica 7 / 11

Predviđanje molekularnih svojstava i QSAR: Rezolucija, pKa i granice modela

Dobici:

  • Sposobnost razlikovanja između deterministički izračunatih karakteristika i statistički procijenjenih karakteristika i određivanja nivoa pouzdanosti
  • Sposobnost da se proceni region u kome je model pouzdan korišćenjem koncepta domena primenljivosti
  • Sposobnost razumijevanja da treba koristiti predviđanja osobina za rangiranje kandidata i donošenje konačne odluke kroz eksperimentiranje.

Prije sintetiziranja molekula, često se pitamo: "Da li je topiv u vodi? Koliko je kisel? Da li prolazi kroz ćelijsku membranu? Da li je vjerojatan kao kandidat za lijek?" Predviđanje odgovora na ova pitanja prije eksperimenta štedi mnogo vremena. AI i njegovi specijalizovani modeli (posebno QSAR — Kvantitativni odnos strukture i aktivnosti, tj. statistički model koji predviđa osobinu iz strukturnih deskriptora molekula) moćni su u ovim predviđanjima. Ali ova predviđanja su predviđanja vjerovatnoće, a ne mjerenja. U ovoj cjelini ćemo naučiti o predviđanju karakteristika, njegovim prednostima i najkritičnijem konceptu, zoni primjenjivosti (regija u kojoj je model pouzdan).

Koje karakteristike se predviđaju?

  • logP: Koeficijent raspodjele molekula ulje/voda; Pokazuje lipofilnost (sviđanje masti). Kritičan u apsorpciji lijeka.
  • Rastvorljivost (logS): Koliko je rastvorljiv u vodi.
  • pKa: Kiselost/alkalnost; pH pri kojem grupa jonizuje.
  • TPSA: Topološka polarna površina; Koristi se za procjenu propusnosti.
  • Lipinski “pravilo pet”: Praktični pragovi za molekularnu težinu, logP, broj donora/prihvatača H-veze kandidata za oralne lijekove.

Neke od ovih vrijednosti se izračunavaju deterministički (npr. TPSA, brojevi H-veze) pomoću alata kao što je RDKit; Neke od njih su statističke procjene (logS, biološka aktivnost). Poznavanje ove razlike određuje koliko imate povjerenja.

Savjet: Različite da li je karakteristika "izračunata" (zasnovana na pravilu, ponovljiva) ili "predviđena" (iz modela, neizvjesno). Imajte visoko povjerenje u proračune, oprezno povjerenje u predviđanja i provjerite predviđanja eksperimentom.

Opseg primjenjivosti: najvažniji koncept

QSAR model dobro radi na molekulima koji su slični molekulima na kojima je obučen. Ako date molekul koji se jako razlikuje od podataka za obuku (na primjer, vrlo veliki, neobičan skelet), model će i dalje proizvesti broj, ali taj broj će biti nepouzdan. To se zove "biti izvan opsega primjenjivosti". Model uvijek daje odgovor; Vaš je posao da kažete da li je odgovor pouzdan ili ne.

Još je rizičnije kada jezički model daje vrijednost atributa: proizvodi broj kao vrijednost koja izgleda "vjerovatno", bez temeljne kalkulacije. Dakle, ako je moguće, uzmite vrijednosti karakteristika iz determinističkog alata (RDKit) ili QSAR modela koji daje nesigurnost, a ne iz jezičkog modela.

Korak po korak: sigurno predviđanje funkcija

  1. Potvrdite molekul: Parsirajte SMILES sa RDKit-om (jedinica 2).
  2. Izračunajte determinističke: MA, logP (izračunati), TPSA, brojeve H-veze iz RDKit-a.
  3. Označite predviđanja odvojeno: Zadržite predviđanja modela kao što su logS, aktivnost, itd. s oznakom "prediction".
  4. Provjerite domen primjenjivosti: Da li molekul izgleda kao podaci za obuku? Da li je izuzetno velik/neobičan?
  5. Koristite za rangiranje, a ne za odluku: Koristite predviđanja za rangiranje kandidata; Krajnji izbor je eksperiment.
  6. Zatvori eksperimentom: Provjeriti kritična svojstva (rastvorljivost, pKa) mjerenjem.

Četiri šablona za kopiranje

1) Determinističke karakteristike sa RDKit-om:

from rdkit import Chemfrom rdkit.Chem import Deskriptori, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("log): round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donator H-veze:", rdMolDescriptors.CalcNumHBD(mol))print("Prihvatač H-veze:", rdMolDescriptors.Calcmol)

2) Procjena pravila Lipinskog:

Molekul (SMILES): [SMILES]Zadatak: Procijenite usklađenost s Lipinskim pravilom pet sa vrijednostima MA, logP, HBD, HBA koje treba izračunati iz RDKit-a. Označite svaki kriterijum posebno kao prošao/nije prošao. Pravilo: NE izmišljajte brojeve; Ja ću to dobiti od RDKit-a, vi komentarišete.

3) Procjena karakteristika + zahtjev za nesigurnost:

Molekul (SMILES): [SMILES] Zadatak: Dajte kvalitativnu procenu rastvorljivosti u vodi (logS) (visoka/srednja/niska) i objasnite obrazloženje sa strukturnim karakteristikama. Nemojte davati tačan broj; Navedite da je ovo PREDVIĐANJE i da ga treba potvrditi eksperimentom. Upozorite ako molekula ima neobičnu strukturu (rizik primjene).

4) Rangiranje kandidata (određivanje prioriteta prema predviđanju):

Ispod su SMILES od 5 molekula. Zadatak: rangirajte ih u smislu rastvorljivosti u vodi (od najviše rastvorljivih do najmanje) na osnovu strukturnih karakteristika (broj polarnih grupa, prstenova, lipofilnost). Napišite obrazloženje za svaku odluku o rangiranju. Napomena: Ovo je PRELIMINARNA sorta; Konačan odabir će se izvršiti mjerenjem.

Slaba prompt / Jaka prompt

slaba:

Koja je rastvorljivost ovog molekula?

AI čini broj koji ne postoji u proračunu (npr. "12 mg/mL"); To daje samopouzdanje, ali može biti pogrešno.

Jaka:

Molekul (SMILES): [SMILES]. Zadatak: 1) Dat ću logP, TPSA, HBD/HBA za izračunavanje pomoću RDKit-a: [vrijednosti].2) Na osnovu ovih vrijednosti protumačiti da li je rezolucija visoka/srednja/niska.3) Dati tačan broj; Navedite da je to nagađanje i da su potrebni eksperimenti.

Razlika: uzeli smo determinističke vrijednosti iz vozila i natjerali AI da ih samo interpretira; Eksplicitno smo tražili nesigurnost i potrebu za eksperimentiranjem.

Vrste karakteristika i nivo povjerenja

karakteristika

Kako doći

povjerenje

napomena

molekularne težine

RDKit (deterministički)

veoma visoko

Izrežite iz formule

TPSA, HBD/HBA

RDKit (deterministički)

visoko

na osnovu pravila

logP (izračunati)

RDKit model

srednje visok

Može odstupiti od eksperimentalnog

logS (rezolucija)

QSAR procjena

srednje

Zavisi od područja primjene

pKa

poseban model

srednje

Spada u složenu strukturu

biološka aktivnost

QSAR/ML

Varijabilna

Obavezno testirajte i provjerite

mini koferi

Slučaj 1 — Broj ugrađenih rezolucija. Student je pitao AI o rastvorljivosti jedinjenja; Dobio je odgovor "25 mg/mL" i prema tome postavio eksperimentalni dizajn. Stvarna vrijednost u mjerenju bila je ~2 mg/mL, 10-struka razlika. AI je izmislio broj. Lekcija: ne uzimajte svojstva poput rezolucije kao brojeve iz jezičkog modela; kvalitativno predviđanje + mjerenje.

Slučaj 2 — Izvan opsega primjenjivosti. QSAR model je rekao da je "aktivnost visoka" za veliki makromolekul koji se veoma razlikovao od skupa za obuku. Korisnik je primijetio da molekul ne liči na podatke o treningu i smatra da je predviđanje nepouzdano; Eksperiment je dao zaista nisku aktivnost. Pouka: model uvijek odgovara; Ako je van okvira, odgovor je bezvrijedan.

Slučaj 3 — Ispravna upotreba Lipinskog. Na jednom molekulu kandidata, AI je procijenio Lipinskog vrijednostima iz RDKit: MA 512 (>500, granica), logP 4,8 (povoljno), HBD 2, HBA 7. Korisnik je ispravno protumačio "jedan kriterij ostaje, ali pravilo nije apsolutno" i nije eliminirao molekul u potpunosti. Pouka: pravila su smjernice, a ne pragovi; Interpretirajte sa kontekstom.

Uobičajene greške

  • Dobivanje broja karakteristika iz jezičkog modela. Vrijednosti koje nisu izračunate su izmišljene; Koristite deterministički alat ili model sa nesigurnošću.
  • Zanemarivanje područja primjene. Model generiše brojeve za svaki molekul; nepouzdan van terena.
  • Uzimajući u obzir procijenjeno mjerenje. logS je procjena; To nije zamjena za eksperimentalnu rezoluciju.
  • Smatrajući Lipinskog apsolutnim pravilom. Kandidat koji je na granici nije automatski eliminisan; Mnogi lijekovi krše pravilo.
  • Brkanje "izračunato" sa "procijenjeno". TPSA je izračunata (pouzdana), aktivnost je procijenjena (neizvjesna).
Oprez: Predviđanja funkcija su odlična za rangiranje i određivanje prioriteta kandidata; ali ne i samo odlučivanje. "Model koji se kaže rastvorljiv" je hipoteza; "Izmjerio sam, otapa se" rezultat je.

Ukratko

  • Molekularna svojstva mogu se predvidjeti prije eksperimenta i time se štedi mnogo vremena.
  • Neke karakteristike su izračunate deterministički (MA, TPSA, HBD/HBA), neke su statističke procjene (logS, aktivnost).
  • Domen primjenjivosti je najkritičniji koncept: model uvijek odgovara, ali je nepouzdan izvan domene.
  • Dobijte brojanje karakteristika iz RDKit-a ili modela dvosmislenosti, a ne jezičkog modela.
  • Koristite predviđanja za rangiranje kandidata; Donesite konačnu odluku eksperimentirajući.

Zadatak aplikacije

Odaberite pet molekula (npr. niz lijekova). Izračunajte MA, logP, TPSA, HBD, HBA za svaki sa RDKit-om i procijenite Lipinski. Zasebno, zatražite od AI kvalitativnu procjenu (ne broj) rastvorljivosti svake molekule i upozorenje o polju primjenjivosti. Prikupite determinističke vrijednosti i AI predviđanja u tablici. Koji je molekul dao profil koji je najsličniji drogi? Gdje je neizvjesnost najveća?

kontrolna lista

  • [ ] Ja pravim razliku između determinističkih izračunatih i predviđenih svojstava.
  • [ ] Dobivam vrijednosti svojstava iz RDKit/modela, a ne jezičkog modela.
  • [ ] Primjećujem molekule izvan opsega primjenjivosti.
  • [ ] Koristim Lipinskog kao vodič, a ne kao apsolutno pravilo.
  • [ ] Koristim predviđanja za rangiranje i odluke za eksperimentisanje.
  • [ ] Imam plan da verifikujem kritične karakteristike merenjem.