Eenheid 7 / 11

Voorspelling van moleculaire eigenschappen en QSAR: resolutie, pKa en modellimieten

Winst:

  • Vermogen om onderscheid te maken tussen deterministisch berekende kenmerken en statistisch geschatte kenmerken en om betrouwbaarheidsniveaus te bepalen
  • Mogelijkheid om de regio te evalueren waarin het model betrouwbaar is door het concept van toepasbaarheidsdomein te gebruiken
  • Vermogen om te begrijpen dat men eigenschapsvoorspellingen moet gebruiken om kandidaten te rangschikken en de uiteindelijke beslissing te nemen door middel van experimenten.

Voordat we een molecuul synthetiseren, vragen we vaak: "Is het in water oplosbaar? Hoe zuur is het? Gaat het door het celmembraan? Is het plausibel als kandidaat-medicijn?" Het voorspellen van de antwoorden op deze vragen vóór het experiment bespaart veel tijd. AI en zijn gespecialiseerde modellen (vooral QSAR – Quantitative Structure-Activity Relationship, d.w.z. een statistisch model dat een eigenschap voorspelt op basis van de structurele descriptoren van het molecuul) zijn krachtig in deze voorspellingen. Maar deze voorspellingen zijn waarschijnlijkheidsvoorspellingen, geen metingen. In dit onderdeel leren we over de voorspelling van kenmerken, de sterke punten ervan en het meest kritische concept: de toepasbaarheidszone (de regio waar het model betrouwbaar is).

Welke kenmerken worden voorspeld?

  • logP: olie/water-verdelingscoëfficiënt van het molecuul; Het vertoont lipofiliciteit (het houden van vet). Cruciaal bij de absorptie van geneesmiddelen.
  • Oplosbaarheid (logS): Hoe oplosbaar het is in water.
  • pKa: Zuurgraad/alkaliteit; De pH waarbij een groep ioniseert.
  • TPSA: Topologisch polair oppervlak; Het wordt gebruikt bij het schatten van de permeabiliteit.
  • Lipinski “regel van vijf”: Praktische drempels voor molecuulgewicht, logP, aantal H-bond donoren/acceptoren van orale kandidaat-geneesmiddelen.

Sommige van deze waarden worden deterministisch berekend (bijvoorbeeld TPSA, H-obligatiegetallen) met tools zoals RDKit; Sommigen daarvan zijn statistische schattingen (logS, biologische activiteit). Het kennen van dit onderscheid bepaalt hoeveel u vertrouwt.

Tip: Maak onderscheid of een kenmerk ‘berekend’ (op regels gebaseerd, herhaalbaar) of ‘voorspeld’ (van model, onzeker) is. Heb veel vertrouwen in berekeningen, voorzichtig vertrouwen in voorspellingen en verifieer voorspellingen door middel van experimenten.

Toepassingsgebied: het belangrijkste concept

Een QSAR-model werkt goed op moleculen die vergelijkbaar zijn met de moleculen waarop het is getraind. Als je een molecuul geeft dat heel anders is dan de trainingsgegevens (bijvoorbeeld een heel groot, ongebruikelijk skelet), zal het model nog steeds een getal produceren, maar dat getal zal onbetrouwbaar zijn. Dit heet ‘buiten het toepassingsgebied vallen’. Het model geeft altijd een antwoord; Het is jouw taak om te bepalen of het antwoord betrouwbaar is of niet.

Het is zelfs nog riskanter als het taalmodel een attribuutwaarde geeft: het produceert het getal als een 'waarschijnlijk ogende' waarde, zonder onderliggende berekening. Haal dus indien mogelijk featurewaarden uit een deterministische tool (RDKit) of een QSAR-model dat onzekerheid geeft, niet uit het taalmodel.

Stap voor stap: veilige functievoorspelling

  1. Molecuul verifiëren: SMILES parseren met RDKit (eenheid 2).
  2. Bereken deterministische getallen: MA, logP (berekend), TPSA, H-obligatienummers van RDKit.
  3. Voorspellingen apart markeren: Bewaar modelvoorspellingen zoals logS, activiteit, etc. met de tag "prediction".
  4. Controleer het toepasbaarheidsdomein: lijkt het molecuul op de trainingsgegevens? Is het extreem groot/ongebruikelijk?
  5. Gebruik voor rangschikking, niet voor besluitvorming: gebruik voorspellingen om kandidaten te rangschikken; De uiteindelijke keuze is experimenteren.
  6. Dichtbij experiment: Controleer kritische eigenschappen (oplosbaarheid, pKa) door meting.

Vier kopieerbare sjablonen

1) Deterministische kenmerken met RDKit:

van rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirineprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (berekend):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-binding donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-binding acceptor:", rdMolDescriptors.CalcNumHBA(mol))

2) Evaluatie van de Lipinski-regel:

Molecuul (SMILES): [SMILES] Taak: Evalueer de naleving van de Lipinski-regel van vijf met MA-, logP-, HBD- en HBA-waarden die moeten worden berekend op basis van RDKit. Markeer elk criterium afzonderlijk als geslaagd/niet geslaagd. Regel: verzin de cijfers NIET; Ik haal het van RDKit, jij reageert.

3) Kenmerkschatting + onzekerheidsverzoek:

Molecuul (SMILES): [SMILES]Taak: Geef een kwalitatieve schatting van de wateroplosbaarheid (logS) (hoog/gemiddeld/laag) en leg de grondgedachte uit met structurele kenmerken. Geef geen exact aantal; Geef aan dat dit een VOORSPELLING is en experimenteel bevestigd moet worden. Waarschuw als het molecuul een ongebruikelijke structuur heeft (toepasbaarheidsrisico).

4) Kandidaatrangschikking (prioritering door voorspelling):

Hieronder staan ​​SMILES van 5 moleculen. Taak: Rangschik ze in termen van wateroplosbaarheid (meest oplosbaar tot minst oplosbaar) op basis van structurele kenmerken (aantal polaire groepen, ringen, lipofiliteit). Schrijf een motivering voor elke rangschikkingsbeslissing. Opmerking: dit is een VOORLOPIGE sortering; De definitieve selectie wordt gemaakt door meting.

Zwakke prompt/sterke prompt

Zwak:

Wat is de oplosbaarheid van dit molecuul?

De AI verzint een getal dat bij de berekening niet bestaat (bijvoorbeeld "12 mg/ml"); Het geeft vertrouwen, maar kan verkeerd zijn.

Sterk:

Molecuul (SMILES): [SMILES].Taak: 1) Ik geef de logP, TPSA, HBD/HBA die moet worden berekend met RDKit: [waarden].2) Interpreteer op basis van deze waarden of de resolutie hoog/gemiddeld/laag is.3) Geef het exacte getal op; Geef aan dat het een gok is en dat er experimenten nodig zijn.

Het verschil: we hebben de deterministische waarden uit het voertuig gehaald en de AI deze gewoon laten interpreteren; We vroegen expliciet om onzekerheid en de noodzaak om te experimenteren.

Functietypen en vertrouwensniveau

functie

Hoe te krijgen

vertrouwen

opmerking

molecuulgewicht

RDKit (deterministisch)

zeer hoog

Knip uit de formule

TPSA, HBD/HBA

RDKit (deterministisch)

hoog

gebaseerd op regels

logP (berekend)

RDKit-model

middelhoog

Kan afwijken van experimenteel

logS (resolutie)

QSAR-schatting

middelmatig

Afhankelijk van toepassingsgebied

pKa

speciaal model

middelmatig

Het valt in een complexe structuur

biologische activiteit

QSAR/ML

Variabel

Zorg ervoor dat u test en verifieert

mini-gevallen

Geval 1 — Aantal goedgekeurde resoluties. Een student vroeg de AI naar de oplosbaarheid van een verbinding; Hij kreeg het antwoord "25 mg/ml" en stelde het experimentele ontwerp dienovereenkomstig op. De werkelijke waarde bij de meting was ~2 mg/ml, een tienvoudig verschil. De AI had het nummer verzonnen. Les: neem eigenschappen zoals resolutie niet als getallen uit het taalmodel; kwalitatieve voorspelling + meting.

Geval 2 — Buiten het toepassingsgebied. Een QSAR-model zei dat de activiteit hoog is voor een groot macromolecuul dat heel anders was dan de trainingsset. De gebruiker merkte dat het molecuul niet leek op de trainingsgegevens en achtte de voorspelling onbetrouwbaar; Het experiment gaf een zeer lage activiteit aan. Les: het model reageert altijd; Als het buiten de reikwijdte valt, is het antwoord waardeloos.

Geval 3 — Correct gebruik van Lipinski. Op één kandidaat-molecuul evalueerde AI Lipinski met waarden uit RDKit: MA 512 (>500, borderline), logP 4.8 (gunstig), HBD 2, HBA 7. De gebruiker interpreteerde correct "één criterium blijft over, maar de regel is niet absoluut" en elimineerde het molecuul niet helemaal. Les: regels zijn richtlijnen, geen drempels; Interpreteer met context.

Veel voorkomende fouten

  • Het aantal functies ophalen uit het taalmodel. Waarden die niet berekend zijn, zijn verzonnen; Gebruik een deterministisch instrument of model met onzekerheid.
  • Het toepassingsgebied negerend. Het model genereert cijfers voor elk molecuul; buiten het veld onbetrouwbaar.
  • Rekening houdend met een geschatte meting. logS is een schatting; Het is geen vervanging voor experimentele resolutie.
  • Lipinski als de absolute regel beschouwend. De kandidaat die aan de grens staat, wordt niet automatisch geëlimineerd; Veel medicijnen overtreden de regel.
  • ‘Berekend’ verwarren met ‘geschat’. TPSA wordt berekend (betrouwbaar), activiteit wordt geschat (onzeker).
Let op: functievoorspellingen zijn geweldig voor het rangschikken en prioriteren van kandidaten; maar niet om alleen een beslissing te nemen. "Het model zei oplosbaar" is een hypothese; "Ik heb gemeten, het lost op" is een resultaat.

Samengevat

  • Moleculaire eigenschappen kunnen vóór het experiment worden voorspeld en besparen veel tijd.
  • Sommige kenmerken worden deterministisch berekend (MA, TPSA, HBD/HBA), sommige zijn statistische schattingen (logS, activiteit).
  • Het domein van toepasbaarheid is het meest kritische concept: het model antwoordt altijd, maar is buiten het domein onbetrouwbaar.
  • Haal de functietellingen op uit RDKit of het ambiguïteitmodel, niet uit het taalmodel.
  • Gebruik voorspellingen om kandidaten te rangschikken; Neem de uiteindelijke beslissing door te experimenteren.

Applicatie taak

Selecteer vijf moleculen (bijvoorbeeld een medicijnserie). Bereken MA, logP, TPSA, HBD, HBA voor elk met RDKit en evalueer Lipinski. Vraag de AI afzonderlijk om een ​​kwalitatieve schatting (geen getal) van de oplosbaarheid van elk molecuul en een waarschuwing voor het toepassingsgebied. Verzamel deterministische waarden en AI-voorspellingen in een tabel. Welk molecuul gaf het meest medicijnachtige profiel? Waar is de onzekerheid het grootst?

controlelijst

  • [ ] Ik maak onderscheid tussen deterministisch berekende en voorspelde eigenschappen.
  • [ ] Ik krijg de eigenschapswaarden van de RDKit/model, niet van het taalmodel.
  • [ ] Ik merk moleculen op die buiten het bereik van de toepasbaarheid vallen.
  • [ ] Ik gebruik Lipinski als leidraad, niet als een absolute regel.
  • [ ] Ik gebruik voorspellingen voor rangschikking en beslissing voor experimenten.
  • [ ] Ik heb een plan om kritische kenmerken door meting te verifiëren.