Enhet 7 / 11

Molecular Property Prediction og QSAR: Oppløsning, pKa og modellgrenser

Gevinster:

  • Evne til å skille mellom deterministisk beregnede funksjoner og statistisk estimerte funksjoner og bestemme konfidensnivåer
  • Evne til å evaluere regionen der modellen er pålitelig ved å bruke konseptet anvendbarhetsdomene
  • Evne til å forstå at man bør bruke egenskapsprediksjoner for å rangere kandidater og ta den endelige avgjørelsen gjennom eksperimentering.

Før vi syntetiserer et molekyl, spør vi ofte: "Er det vannløselig? Hvor surt er det? Krysser det cellemembranen? Er det plausibelt som medikamentkandidat?" Å forutsi svarene på disse spørsmålene før eksperimentet sparer mye tid. AI og dens spesialiserte modeller (spesielt QSAR — Quantitative Structure-Activity Relationship, dvs. statistisk modell som forutsier en egenskap fra molekylets strukturelle deskriptorer) er kraftige i disse spådommene. Men disse spådommene er spådommer om sannsynlighet, ikke målinger. I denne enheten vil vi lære om funksjonsprediksjon, dens styrker og det mest kritiske konseptet, anvendbarhetssonen (regionen der modellen er pålitelig).

Hvilke funksjoner er spådd?

  • logP: Olje/vann fordelingskoeffisient for molekylet; Det viser lipofilisitet (fett smak). Kritisk i legemiddelabsorpsjon.
  • Løselighet (logS): Hvor løselig det er i vann.
  • pKa: surhet/alkalitet; pH som en gruppe ioniserer ved.
  • TPSA: Topologisk polart overflateareal; Det brukes i permeabilitetsestimering.
  • Lipinski "regel av fem": Praktiske terskler for molekylvekt, logP, antall H-bindingsgivere/akseptorer av orale legemiddelkandidater.

Noen av disse verdiene beregnes deterministisk (f.eks. TPSA, H-bindingstall) med verktøy som RDKit; Noen av dem er statistiske estimater (logS, biologisk aktivitet). Å kjenne denne forskjellen avgjør hvor mye du stoler på.

Tips: Skill om en funksjon er "kalkulert" (regelbasert, repeterbar) eller "forutsagt" (fra modell, usikker). Ha høy tillit til beregninger, forsiktig tillit til spådommer, og verifiser spådommer ved eksperiment.

Anvendelsesområde: det viktigste konseptet

En QSAR-modell fungerer godt på molekyler som ligner på molekylene den ble trent på. Hvis du gir et molekyl som er veldig forskjellig fra treningsdataene (for eksempel et veldig stort, uvanlig skjelett), vil modellen fortsatt produsere et tall, men det tallet vil være upålitelig. Dette kalles «å være utenfor anvendelsesområdet». Modellen gir alltid et svar; Det er din jobb å fortelle om svaret er pålitelig eller ikke.

Det er enda mer risikabelt når språkmodellen gir en attributtverdi: den produserer tallet som en "sannsynlig" verdi, uten noen underliggende beregning. Så hvis mulig, få funksjonsverdier fra et deterministisk verktøy (RDKit) eller en QSAR-modell som gir usikkerhet, ikke fra språkmodellen.

Trinn for trinn: sikker funksjonsprediksjon

  1. Bekreft molekyl: Parse SMILES med RDKit (enhet 2).
  2. Beregn deterministiske: MA, logP (kalkulert), TPSA, H-bindingstall fra RDKit.
  3. Merk spådommer separat: Hold modellspådommer som logS, aktivitet osv. med «prediksjon»-taggen.
  4. Sjekk anvendelighetsdomenet: Ser molekylet ut som treningsdataene? Er den ekstremt stor/uvanlig?
  5. Bruk for rangering, ikke beslutning: Bruk spådommer for å rangere kandidater; Det ultimate valget er eksperimentering.
  6. I nærheten av eksperiment: Verifiser kritiske egenskaper (løselighet, pKa) ved måling.

Fire kopierbare maler

1) Deterministiske funksjoner med RDKit:

fra rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (beregnet):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-binding donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-binding acceptor:", rdMolDescriptors.CalcNumHBA(mol)

2) Lipinski-regelevaluering:

Molecule (SMILES): [SMILES]Oppgave: Evaluer samsvar med Lipinski-regelen på fem med MA, logP, HBD, HBA-verdier som skal beregnes fra RDKit. Merk hvert kriterium separat som bestått/ikke bestått. Regel: IKKE gjør opp tallene; Jeg får det fra RDKit, kommenterer du.

3) Funksjonsestimat + usikkerhetsforespørsel:

Molecule (SMILES): [SMILES]Oppgave: Gi et kvalitativt estimat av vannløselighet (logS) (høy/middels/lav) og forklar begrunnelsen med strukturelle trekk. Ikke oppgi et eksakt tall; Oppgi at dette er en prediksjon og må bekreftes ved eksperiment. Advar dersom molekylet har en uvanlig struktur (anvendelsesrisiko).

4) Kandidatrangering (prioritering etter prediksjon):

Nedenfor er SMIL av 5 molekyler. Oppgave: Ranger dem i form av vannløselighet (mest løselig til minst) basert på strukturelle trekk (antall polare grupper, ringer, lipofilisitet). Skriv begrunnelse for hver rangeringsbeslutning. Merk: Dette er en FORELØPIG sortering; Det endelige utvalget vil bli gjort ved måling.

Svak forespørsel / Sterk forespørsel

Svak:

Hva er løseligheten til dette molekylet?

AI utgjør et tall som ikke eksisterer under beregningen (f.eks. "12 mg/mL"); Det gir selvtillit, men kan være feil.

Sterk:

Molecule (SMILES): [SMILES].Oppgave: 1) Jeg vil gi logP, TPSA, HBD/HBA som skal beregnes med RDKit: [verdier].2) Basert på disse verdiene, tolk om oppløsningen er høy/middels/lav.3) Oppgi det nøyaktige tallet; Oppgi at det er en gjetning og det kreves eksperimenter.

Forskjellen: vi tok deterministiske verdiene fra kjøretøyet og fikk AI-en til å bare tolke dem; Vi ba eksplisitt om usikkerhet og behov for eksperimentering.

Funksjonstyper og tillitsnivå

funksjon

Hvordan få

tillit

merk

molekylvekt

RDKit (deterministisk)

veldig høy

Klipp ut fra formelen

TPSA, HBD/HBA

RDKit (deterministisk)

høy

regelbasert

logP (beregnet)

RDKit-modell

middels høy

Kan avvike fra eksperimentell

logS (oppløsning)

QSAR-estimat

medium

Avhenger av bruksområde

pKa

spesiell modell

medium

Det faller i en kompleks struktur

biologisk aktivitet

QSAR/ML

Variabel

Sørg for å teste og verifisere

minisaker

Tilfelle 1 — Antall oppløsninger montert. En student spurte AI om løseligheten til en forbindelse; Han fikk svaret "25 mg/mL" og satte opp eksperimentelle design deretter. Den faktiske verdien i målingen var ~2 mg/ml, en 10 ganger forskjell. AI hadde laget nummeret. Leksjon: ikke ta egenskaper som oppløsning som tall fra språkmodellen; kvalitativ prediksjon + måling.

Sak 2 – Utenfor anvendelsesområdet. En QSAR-modell sa at "aktiviteten er høy" for et stort makromolekyl som var veldig forskjellig fra treningssettet. Brukeren la merke til at molekylet ikke lignet treningsdataene og anså prediksjonen som upålitelig; Eksperimentet ga virkelig lav aktivitet. Leksjon: modellen reagerer alltid; Hvis det er utenfor omfanget, er svaret verdiløst.

Tilfelle 3 – Riktig bruk av Lipinski. På ett kandidatmolekyl evaluerte AI Lipinski med verdier fra RDKit: MA 512 (>500, borderline), logP 4.8 (gunstig), HBD 2, HBA 7. Brukeren tolket riktig "ett kriterium gjenstår, men regelen er ikke absolutt" og eliminerte ikke molekylet helt. Leksjon: regler er retningslinjer, ikke terskler; Tolk med kontekst.

Vanlige feil

  • Få funksjonen teller fra språkmodellen. Verdier som ikke er beregnet er fabrikkerte; Bruk deterministisk verktøy eller modell med usikkerhet.
  • Ignorerer bruksområdet. Modellen genererer tall for hvert molekyl; upålitelig utenfor banen.
  • Vurderer en estimert måling. logS er et estimat; Det er ikke en erstatning for eksperimentell oppløsning.
  • Vurderer Lipinski den absolutte regelen. Kandidaten som er på grensen blir ikke automatisk eliminert; Mange rusmidler bryter regelen.
  • Forveksler «kalkulert» med «estimert». TPSA beregnes (pålitelig), aktivitet er estimert (usikker).
Forsiktig: Funksjonsspådommer er flotte for å rangere og prioritere kandidater; men ikke for å bestemme en avgjørelse alene. "Modellen sa oppløselig" er en hypotese; «Jeg målte, det løser seg» er et resultat.

Oppsummert

  • Molekylære egenskaper kan forutsies før eksperimentet og sparer mye tid.
  • Noen funksjoner beregnes deterministisk (MA, TPSA, HBD/HBA), noen er statistiske estimater (logS, aktivitet).
  • Anvendbarhetsdomenet er det mest kritiske konseptet: modellen svarer alltid, men er upålitelig utenfor domenet.
  • Få funksjonstallene fra RDKit eller tvetydighetsmodellen, ikke språkmodellen.
  • Bruk spådommer for å rangere kandidater; Ta den endelige avgjørelsen ved å eksperimentere.

Søknadsoppgave

Velg fem molekyler (f.eks. en medikamentserie). Beregn MA, logP, TPSA, HBD, HBA for hver med RDKit og evaluer Lipinski. Se separat, spør AI om et kvalitativt estimat (ikke et tall) av løseligheten til hvert molekyl og en advarsel om bruksområde. Samle deterministiske verdier og AI-spådommer i en tabell. Hvilket molekyl ga den mest medikamentlignende profilen? Hvor er usikkerheten høyest?

sjekkliste

  • [ ] Jeg skiller mellom deterministiske beregnede og predikerte egenskaper.
  • [ ] Jeg henter egenskapsverdiene fra RDKit/modellen, ikke språkmodellen.
  • [ ] Jeg legger merke til molekyler utenfor anvendelsesområdet.
  • [ ] Jeg bruker Lipinski som en guide, ikke en absolutt regel.
  • [ ] Jeg bruker spådommer for rangering og beslutning for eksperimentering.
  • [ ] Jeg har en plan for å verifisere kritiske funksjoner ved måling.