Yksikkö 7 / 11

Molecular Property Prediction ja QSAR: Resolution, pKa ja Model Limits

Voitot:

  • Kyky erottaa deterministisesti lasketut ja tilastollisesti arvioidut ominaisuudet ja määrittää luottamustasot
  • Kyky arvioida aluetta, jolla malli on luotettava, käyttämällä soveltuvuusalueen käsitettä
  • Kyky ymmärtää, että piirteiden ennusteita tulee käyttää ehdokkaiden luokittelussa ja lopullisen päätöksen tekemisessä kokeilemalla.

Ennen molekyylin syntetisoimista kysymme usein: "Onko se vesiliukoinen? Kuinka hapan se on? Läpäiseekö se solukalvon? Onko se uskottava lääkekandidaatti?" Vastausten ennustaminen näihin kysymyksiin ennen kokeilua säästää paljon aikaa. Tekoäly ja sen erikoismallit (erityisesti QSAR — Quantitative Structure-Activity Relationship, eli tilastollinen malli, joka ennustaa ominaisuuden molekyylin rakenteellisista kuvailijoista) ovat tehokkaita näissä ennusteissa. Mutta nämä ennusteet ovat todennäköisyysennusteita, eivät mittauksia. Tässä osiossa opimme ominaisuuksien ennustamisesta, sen vahvuuksista ja kriittisimmästä konseptista, soveltuvuusvyöhykkeestä (alue, jossa malli on luotettava).

Mitä ominaisuuksia ennustetaan?

  • logP: molekyylin öljy/vesi-jakaantumiskerroin; Se osoittaa lipofiilisyyttä (rasvapitoisuutta). Kriittinen lääkkeen imeytymisessä.
  • Liukoisuus (logS): Kuinka liukoinen se on veteen.
  • pKa: happamuus/emäksisyys; pH, jossa ryhmä ionisoituu.
  • TPSA: Topologinen napapinta-ala; Sitä käytetään läpäisevyyden arvioinnissa.
  • Lipinskin "viiden sääntö": Käytännön kynnysarvot molekyylipainolle, logP:lle, oraalisten lääkekandidaattien H-sidoksen luovuttajien/vastaanottimien lukumäärälle.

Jotkut näistä arvoista lasketaan deterministisesti (esim. TPSA, H-sidosluvut) työkaluilla, kuten RDKit; Jotkut niistä ovat tilastollisia arvioita (logS, biologinen aktiivisuus). Tämän eron tietäminen määrittää, kuinka paljon luotat.

Vinkki: Erottele, onko ominaisuus "laskettu" (sääntöpohjainen, toistettava) vai "ennustettu" (mallista, epävarma). Luota korkeaan laskelmiin, luota varovaisesti ennusteisiin ja varmista ennusteet kokeilemalla.

Soveltamisala: tärkein käsite

QSAR-malli toimii hyvin molekyyleillä, jotka ovat samankaltaisia kuin molekyylit, joihin se on koulutettu. Jos annat molekyylin, joka eroaa suuresti harjoitustiedoista (esimerkiksi erittäin suuri, epätavallinen luuranko), malli tuottaa silti numeron, mutta se on epäluotettava. Tätä kutsutaan "sovellettavuuden ulkopuolelle jäämiseksi". Malli antaa aina vastauksen; Sinun tehtäväsi on kertoa, onko vastaus luotettava vai ei.

Se on vielä riskialtista, kun kielimalli antaa attribuutin arvon: se tuottaa luvun "todennäköiseltä näyttävänä" arvona ilman taustalla olevaa laskelmaa. Joten jos mahdollista, hanki ominaisuusarvot deterministisellä työkalulla (RDKit) tai QSAR-mallista, joka antaa epävarmuuden, ei kielimallista.

Askel askeleelta: turvallisen ominaisuuden ennustaminen

  1. Tarkista molekyyli: Jäsennä SMILES RDKitillä (yksikkö 2).
  2. Laske deterministiset: MA, logP (laskettu), TPSA, H-sidosluvut RDKitista.
  3. Merkitse ennusteet erikseen: Säilytä malliennusteet, kuten lokit, aktiviteetti jne. "ennuste"-tunnisteella.
  4. Tarkista soveltuvuusalue: Näyttääkö molekyyli koulutustiedoista? Onko se erittäin suuri/epätavallinen?
  5. Käytä luokitusta, ei päätöstä: Käytä ennusteita ehdokkaiden luokitteluun; Lopullinen valinta on kokeilu.
  6. Sulje kokeella: Varmista kriittiset ominaisuudet (liukoisuus, pKa) mittaamalla.

Neljä kopioitavaa mallia

1) RDKitin deterministiset ominaisuudet:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (laskettu):" round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-sidoksen luovuttaja:", rdMolDescriptors.CalcNumHBD(mol))print("H-sidoksen vastaanottaja:", rdMolDescriptors.CalcNum)HBA(molDescriptors.

2) Lipinskin säännön arviointi:

Molekyyli (SMILES): [SMILES] Tehtävä: Arvioi Lipinskin viiden säännön noudattaminen MA-, logP-, HBD-, HBA-arvoilla, jotka lasketaan RDKit:stä. Merkitse jokainen kriteeri erikseen hyväksytyksi/hylätyksi. Sääntö: ÄLÄ keksi numeroita; Haen sen RDKitilta, sinä kommentoit.

3) Ominaisuusarvio + epävarmuuspyyntö:

Molekyyli (SMILES): [SMILES]Tehtävä: Anna laadullinen arvio vesiliukoisuudesta (logS) (korkea/keskitaso/matala) ja selitä perustelut rakenteellisilla ominaisuuksilla. Älä anna tarkkaa numeroa; Ilmoita, että tämä on ENNUSTUS ja se on vahvistettava kokeella. Varoita, jos molekyylillä on epätavallinen rakenne (sovellettavuusriski).

4) Ehdokkaiden sijoitus (priorisointi ennusteen mukaan):

Alla on 5 molekyylin SMILES. Tehtävä: Järjestä ne vesiliukoisuuden perusteella (liukoisimmista vähiten) rakenteellisten ominaisuuksien (polaaristen ryhmien lukumäärä, renkaat, lipofiilisyys) perusteella. Kirjoita perustelut jokaiselle sijoituspäätökselle.Huomaa: Tämä on ALUSTAVA lajittelu; Lopullinen valinta tehdään mittaamalla.

Heikko kehote / Vahva kehote

Heikko:

Mikä on tämän molekyylin liukoisuus?

Tekoäly muodostaa luvun, jota ei ole laskennassa (esim. "12 mg/ml"); Se antaa luottamusta, mutta voi olla väärin.

Vahva:

Molekyyli (SMILES): [HYMIÄ]. Tehtävä: 1) Annan RDKit:llä laskettavan logP, TPSA, HBD/HBA: [arvot].2) Selvitä näiden arvojen perusteella, onko resoluutio korkea/keskitaso/matala.3) Tarkka luku; Ilmoita, että se on arvaus ja kokeita tarvitaan.

Ero: otimme deterministiset arvot ajoneuvosta ja saimme tekoälyn vain tulkitsemaan niitä; Pyysimme nimenomaisesti epävarmuutta ja kokeilun tarvetta.

Ominaisuustyypit ja luottamustaso

ominaisuus

Kuinka saada

luottaa

huomautus

molekyylipaino

RDKit (deterministinen)

erittäin korkea

Leikkaa kaavasta

TPSA, HBD/HBA

RDKit (deterministinen)

korkea

sääntöön perustuva

logP (laskettu)

RDKit malli

keskikorkea

Saattaa poiketa kokeellisesta

lokit (resoluutio)

QSAR-arvio

keskikokoinen

Riippuu käyttöalueesta

pKa

erikoismalli

keskikokoinen

Se kuuluu monimutkaiseen rakenteeseen

biologista toimintaa

QSAR/ML

Muuttuva

Muista testata ja tarkistaa

minikotelot

Tapaus 1 — Asennettujen päätöslauselmien lukumäärä. Opiskelija kysyi tekoälyltä yhdisteen liukoisuudesta; Hän sai vastauksen "25 mg/ml" ja asetti koesuunnitelman sen mukaisesti. Todellinen arvo mittauksessa oli ~2 mg/ml, 10-kertainen ero. Tekoäly oli keksinyt numeron. Oppitunti: älä ota ominaisuuksia, kuten resoluutiota, numeroina kielimallista; laadullinen ennuste + mittaus.

Tapaus 2 – Soveltamisalan ulkopuolella. QSAR-malli sanoi "aktiivisuus on korkea" suurelle makromolekyylille, joka oli hyvin erilainen kuin harjoitussarja. Käyttäjä huomasi, että molekyyli ei muistuttanut harjoitustietoja ja piti ennustetta epäluotettavana; Kokeilu antoi todella vähän aktiivisuutta. Oppitunti: malli vastaa aina; Jos se on soveltamisalan ulkopuolella, vastaus on arvoton.

Tapaus 3 – Lipinskin oikea käyttö. Yhdellä ehdokasmolekyylillä tekoäly arvioi Lipinskin RDKit:n arvoilla: MA 512 (>500, raja), logP 4.8 (suotuisa), HBD 2, HBA 7. Käyttäjä tulkitsi oikein "yksi kriteeri säilyy, mutta sääntö ei ole absoluuttinen" eikä poistanut molekyyliä kokonaan. Oppitunti: säännöt ovat ohjeita, eivät kynnysarvoja; Tulkitse kontekstin kanssa.

Yleisiä virheitä

  • Ominaisuusmäärän saaminen kielimallista. Arvot, joita ei ole laskettu, on valmistettu; Käytä determinististä työkalua tai mallia epävarmuudella.
  • Soveltamisalan huomiotta jättäminen. Malli luo numerot jokaiselle molekyylille; epäluotettava kentän ulkopuolella.
  • Ottaen huomioon arvioitu mittaus. logS on arvio; Se ei korvaa kokeellista resoluutiota.
  • Lipinski on ehdoton sääntö. Rajalla olevaa ehdokasta ei poisteta automaattisesti; Monet huumeet rikkovat sääntöä.
  • Sekava "laskettu" ja "arvioitu". TPSA on laskettu (luotettava), aktiivisuus on arvioitu (epävarma).
Varoitus: Ominaisuusennusteet sopivat erinomaisesti ehdokkaiden luokitteluun ja priorisoimiseen. mutta ei tehdä päätöstä yksin. "Malli sanoi liukoiseksi" on hypoteesi; "Mittasin, se liukenee" on tulos.

Yhteenvetona

  • Molekyyliominaisuudet voidaan ennustaa ennen koetta ja säästää paljon aikaa.
  • Jotkut ominaisuudet lasketaan deterministisesti (MA, TPSA, HBD/HBA), jotkut ovat tilastollisia arvioita (logS, aktiivisuus).
  • Sovellettavuusalue on kriittisin käsite: malli vastaa aina, mutta on epäluotettava alueen ulkopuolella.
  • Hanki ominaisuusmäärät RDKitista tai moniselitteisyysmallista, ei kielimallista.
  • Käytä ennusteita ehdokkaiden luokitteluun; Tee lopullinen päätös kokeilemalla.

Sovellustehtävä

Valitse viisi molekyyliä (esim. lääkesarja). Laske MA, logP, TPSA, HBD, HBA kullekin RDKit:llä ja arvioi Lipinski. Pyydä tekoälyltä erikseen laadullinen arvio (ei numero) kunkin molekyylin liukoisuudesta ja soveltuvuusvaroitus. Kerää deterministiset arvot ja AI-ennusteet taulukkoon. Mikä molekyyli antoi eniten lääkettä muistuttavan profiilin? Missä epävarmuus on suurin?

tarkistuslista

  • [ ] Erotan deterministiset lasketut ja ennustetut ominaisuudet.
  • [ ] Saan ominaisuusarvot RDKit:sta/mallista, en kielimallista.
  • [ ] Huomasin soveltuvuusalueen ulkopuolella olevia molekyylejä.
  • [ ] Käytän Lipinskkiä oppaana, en absoluuttisena sääntönä.
  • [ ] Käytän ennusteita paremmuusjärjestykseen ja päätöstä kokeiluun.
  • [ ] Minulla on suunnitelma varmistaa kriittiset ominaisuudet mittaamalla.