Enhed 7 / 11

Molekylær egenskabsforudsigelse og QSAR: Opløsning, pKa og modelgrænser

Gevinster:

  • Evne til at skelne mellem deterministisk beregnede træk og statistisk estimerede træk og bestemme konfidensniveauer
  • Evne til at evaluere den region, hvor modellen er pålidelig, ved at bruge begrebet anvendelighedsdomæne
  • Evne til at forstå, at man bør bruge egenskabsforudsigelser til at rangere kandidater og træffe den endelige beslutning gennem eksperimentering.

Før vi syntetiserer et molekyle, spørger vi ofte: "Er det vandopløseligt? Hvor surt er det? Passer det cellemembranen? Er det plausibelt som lægemiddelkandidat?" At forudsige svarene på disse spørgsmål før eksperimentet sparer en masse tid. AI og dets specialiserede modeller (især QSAR — Quantitative Structure-Activity Relationship, dvs. statistisk model, der forudsiger en egenskab ud fra molekylets strukturelle deskriptorer) er stærke i disse forudsigelser. Men disse forudsigelser er forudsigelser af sandsynlighed, ikke målinger. I denne enhed lærer vi om egenskabsforudsigelse, dens styrker og det mest kritiske koncept, anvendelighedszonen (det område, hvor modellen er pålidelig).

Hvilke funktioner forudsiges?

  • logP: Olie/vand fordelingskoefficient for molekylet; Det viser lipofilicitet (fedt smag). Kritisk i lægemiddelabsorption.
  • Opløselighed (logS): Hvor opløseligt det er i vand.
  • pKa: surhed/alkalighed; Den pH-værdi, som en gruppe ioniserer ved.
  • TPSA: Topologisk polært overfladeareal; Det bruges til permeabilitetsestimering.
  • Lipinski "regel af fem": Praktiske tærskler for molekylvægt, logP, antal H-bindingsdonorer/acceptorer af orale lægemiddelkandidater.

Nogle af disse værdier beregnes deterministisk (f.eks. TPSA, H-bindingstal) med værktøjer som RDKit; Nogle af dem er statistiske estimater (logS, biologisk aktivitet). At kende denne sondring afgør, hvor meget du stoler på.

Tip: Skeln om en funktion er "beregnet" (regelbaseret, gentagelig) eller "forudsagt" (fra model, usikker). Hav høj tillid til beregninger, forsigtig tillid til forudsigelser, og verificer forudsigelser ved eksperiment.

Anvendelsesområde: det vigtigste koncept

En QSAR-model fungerer godt på molekyler, der ligner de molekyler, den blev trænet på. Hvis du giver et molekyle, der er meget forskelligt fra træningsdataene (for eksempel et meget stort, usædvanligt skelet), vil modellen stadig producere et tal, men det tal vil være upålideligt. Dette kaldes "at være uden for anvendelsesområdet." Modellen giver altid et svar; Det er din opgave at fortælle, om svaret er pålideligt eller ej.

Det er endnu mere risikabelt, når sprogmodellen giver en attributværdi: den producerer tallet som en "sandsynligt udseende" værdi uden nogen underliggende beregning. Så hvis det er muligt, få funktionsværdier fra et deterministisk værktøj (RDKit) eller en QSAR-model, der giver usikkerhed, ikke fra sprogmodellen.

Trin for trin: sikker funktionsforudsigelse

  1. Bekræft molekyle: Parse SMILES med RDKit (enhed 2).
  2. Beregn deterministiske: MA, logP (beregnet), TPSA, H-bindingstal fra RDKit.
  3. Marker forudsigelser separat: Hold modelforudsigelser såsom logS, aktivitet osv. med "forudsigelse"-tagget.
  4. Tjek anvendelighedsdomænet: Ligner molekylet træningsdataene? Er det ekstremt stort/usædvanligt?
  5. Brug til rangering, ikke beslutning: Brug forudsigelser til at rangordne kandidater; Det ultimative valg er eksperimenter.
  6. Tæt ved eksperiment: Bekræft kritiske egenskaber (opløselighed, pKa) ved måling.

Fire kopierbare skabeloner

1) Deterministiske funktioner med RDKit:

fra rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (beregnet):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-binding donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-binding acceptor:", rdMolDescriptors.CalcNumHBA(mol)

2) Lipinski-regelevaluering:

Molekyle (SMILES): [SMILES]Opgave: Evaluer overholdelse af Lipinski-reglen på fem med MA, logP, HBD, HBA-værdier, der skal beregnes ud fra RDKit. Marker hvert kriterium separat som bestået/ikke bestået. Regel: Lad være med at lave tallene op; Jeg får det fra RDKit, kommenterer du.

3) Funktionsestimat + usikkerhedsanmodning:

Molekyle (SMILES): [SMILES]Opgave: Giv et kvalitativt estimat af vandopløselighed (logS) (høj/middel/lav) og forklar rationalet med strukturelle træk. Giv ikke et nøjagtigt tal; Angiv, at dette er en FORUDSIGNING og skal bekræftes ved eksperiment. Advar, hvis molekylet har en usædvanlig struktur (anvendelighedsrisiko).

4) Kandidatrangering (prioritering efter forudsigelse):

Nedenfor er SMIL af 5 molekyler.Opgave: Rangér dem i forhold til vandopløselighed (mest opløseligt til mindst) baseret på strukturelle træk (antal polære grupper, ringe, lipofilicitet).Skriv begrundelse for hver rangeringsbeslutning.Bemærk: Dette er en PRELIMINÆR sortering; Det endelige valg vil blive foretaget ved måling.

Svag prompt / Stærk prompt

Svag:

Hvad er opløseligheden af dette molekyle?

AI udgør et tal, der ikke eksisterer under beregningen (f.eks. "12 mg/mL"); Det giver selvtillid, men kan være forkert.

Stærk:

Molekyle (SMILES): [SMILES].Opgave: 1) Jeg vil give logP, TPSA, HBD/HBA, der skal beregnes med RDKit: [værdier].2) Ud fra disse værdier fortolkes om opløsningen er høj/middel/lav.3) Giver det nøjagtige tal; Angiv, at det er et gæt, og der kræves eksperimenter.

Forskellen: vi tog de deterministiske værdier fra køretøjet og fik AI til bare at fortolke dem; Vi bad eksplicit om usikkerhed og behov for eksperimenter.

Funktionstyper og tillidsniveau

funktion

Hvordan får man

tillid

bemærk

molekylvægt

RDKit (deterministisk)

meget høj

Klip fra formlen

TPSA, HBD/HBA

RDKit (deterministisk)

høj

regel baseret

logP (beregnet)

RDKit model

medium-høj

Kan afvige fra eksperimentel

logS (opløsning)

QSAR estimat

medium

Afhænger af anvendelsesområde

pKa

speciel model

medium

Det falder i en kompleks struktur

biologisk aktivitet

QSAR/ML

Variabel

Sørg for at teste og verificere

mini sager

Tilfælde 1 — Antal monterede opløsninger. En studerende spurgte AI om opløseligheden af ​​en forbindelse; Han modtog svaret "25 mg/mL" og satte det eksperimentelle design op i overensstemmelse hermed. Den faktiske værdi i målingen var ~2 mg/ml, en forskel på 10 gange. AI'en havde lavet nummeret. Lektion: tag ikke egenskaber som opløsning som tal fra sprogmodellen; kvalitativ forudsigelse + måling.

Sag 2 — Uden for anvendelsesområdet. En QSAR-model sagde, at "aktiviteten er høj" for et stort makromolekyle, der var meget forskelligt fra træningssættet. Brugeren bemærkede, at molekylet ikke lignede træningsdataene og anså forudsigelsen for upålidelig; Forsøget gav virkelig lav aktivitet. Lektion: modellen reagerer altid; Hvis det er uden for rækkevidde, er svaret værdiløst.

Case 3 — Korrekt brug af Lipinski. På et kandidatmolekyle vurderede AI Lipinski med værdier fra RDKit: MA 512 (>500, borderline), logP 4.8 (gunstig), HBD 2, HBA 7. Brugeren tolkede korrekt "et kriterium tilbage, men reglen er ikke absolut" og eliminerede ikke molekylet helt. Lektion: regler er retningslinjer, ikke tærskler; Fortolk med kontekst.

Almindelige fejl

  • Få træktællingen fra sprogmodellen. Værdier, der ikke er beregnet, er fremstillet; Brug deterministisk værktøj eller model med usikkerhed.
  • Ignorerer anvendelsesområdet. Modellen genererer tal for hvert molekyle; upålidelige uden for banen.
  • Overvejer en estimeret måling. logS er et skøn; Det er ikke en erstatning for eksperimentel opløsning.
  • I betragtning af Lipinski er den absolutte regel. Kandidaten, der er på grænsen, bliver ikke automatisk elimineret; Mange stoffer overtræder reglen.
  • Forveksler "beregnet" med "estimeret". TPSA beregnes (pålidelig), aktivitet estimeres (usikker).
Forsigtig: Feature forudsigelser er gode til at rangordne og prioritere kandidater; men ikke for at bestemme en beslutning alene. "Modellen sagde opløselig" er en hypotese; "Jeg målte, det opløses" er et resultat.

Sammenfattende

  • Molekylære egenskaber kan forudsiges før eksperimentet og sparer meget tid.
  • Nogle funktioner beregnes deterministisk (MA, TPSA, HBD/HBA), nogle er statistiske estimater (logS, aktivitet).
  • Anvendelighedsdomænet er det mest kritiske koncept: modellen svarer altid, men er upålidelig uden for domænet.
  • Få træktællingerne fra RDKit eller flertydighedsmodellen, ikke sprogmodellen.
  • Brug forudsigelser til at rangere kandidater; Træf den endelige beslutning ved at eksperimentere.

Ansøgningsopgave

Vælg fem molekyler (f.eks. en lægemiddelserie). Beregn MA, logP, TPSA, HBD, HBA for hver med RDKit og evaluer Lipinski. Spørg separat AI om et kvalitativt skøn (ikke et tal) af opløseligheden af ​​hvert molekyle og en advarsel om anvendelsesområde. Saml deterministiske værdier og AI-forudsigelser i en tabel. Hvilket molekyle gav den mest lægemiddellignende profil? Hvor er usikkerheden størst?

tjekliste

  • [ ] Jeg skelner mellem deterministiske beregnede og forudsagte egenskaber.
  • [ ] Jeg henter ejendomsværdierne fra RDKit/modellen, ikke sprogmodellen.
  • [ ] Jeg bemærker molekyler uden for anvendelsesområdet.
  • [ ] Jeg bruger Lipinski som en guide, ikke en absolut regel.
  • [ ] Jeg bruger forudsigelser til rangering og beslutning til eksperimenter.
  • [ ] Jeg har en plan for at verificere kritiske funktioner ved måling.