Vinster:
- Förmåga att skilja mellan deterministiskt beräknade egenskaper och statistiskt uppskattade egenskaper och bestämma konfidensnivåer
- Förmåga att utvärdera den region där modellen är tillförlitlig genom att använda begreppet tillämplighetsdomän
- Förmåga att förstå att man bör använda egenskapsförutsägelser för att rangordna kandidater och fatta det slutliga beslutet genom experiment.
Innan vi syntetiserar en molekyl frågar vi ofta: "Är den vattenlöslig? Hur sur är den? Går den över cellmembranet? Är det rimligt som läkemedelskandidat?" Att förutsäga svaren på dessa frågor innan experimentet sparar mycket tid. AI och dess specialiserade modeller (särskilt QSAR — Quantitative Structure-Activity Relationship, dvs. statistisk modell som förutsäger en egenskap från molekylens strukturella deskriptorer) är kraftfulla i dessa förutsägelser. Men dessa förutsägelser är förutsägelser om sannolikhet, inte mätningar. I den här enheten kommer vi att lära oss om funktionsförutsägelse, dess styrkor och det mest kritiska konceptet, tillämpningszonen (den region där modellen är tillförlitlig).
Vilka funktioner förutspås?
- logP: Fördelningskoefficient för olja/vatten för molekylen; Det visar lipofilicitet (fettgilling). Kritisk i läkemedelsabsorption.
- Löslighet (logS): Hur lösligt det är i vatten.
- pKa: surhet/alkalitet; Det pH vid vilket en grupp joniseras.
- TPSA: Topologisk polär yta; Det används vid permeabilitetsuppskattning.
- Lipinski "regel om fem": Praktiska trösklar för molekylvikt, logP, antal H-bindningsgivare/acceptorer av orala läkemedelskandidater.
Vissa av dessa värden beräknas deterministiskt (t.ex. TPSA, H-bindningstal) med verktyg som RDKit; Några av dem är statistiska uppskattningar (logS, biologisk aktivitet). Att känna till denna distinktion avgör hur mycket du litar på.
Tips: Skilj ut om en funktion är "beräknad" (regelbaserad, repeterbar) eller "förutspådd" (från modell, osäker). Ha högt förtroende för beräkningar, försiktigt förtroende för förutsägelser och verifiera förutsägelser genom experiment.
Tillämpningsområde: det viktigaste konceptet
En QSAR-modell fungerar bra på molekyler som liknar de molekyler som den tränades på. Om du ger en molekyl som skiljer sig mycket från träningsdatan (till exempel ett mycket stort, ovanligt skelett) kommer modellen fortfarande att producera ett nummer, men det talet kommer att vara opålitligt. Detta kallas "att vara utanför tillämpningsområdet". Modellen ger alltid ett svar; Det är din uppgift att avgöra om svaret är tillförlitligt eller inte.
Det är ännu mer riskfyllt när språkmodellen ger ett attributvärde: den producerar talet som ett "troligt utseende" värde, utan någon underliggande beräkning. Så om möjligt, hämta funktionsvärden från ett deterministiskt verktyg (RDKit) eller en QSAR-modell som ger osäkerhet, inte från språkmodellen.
Steg för steg: säker funktionsförutsägelse
- Verifiera molekylen: Analysera SMILES med RDKit (enhet 2).
- Beräkna deterministiska: MA, logP (beräknad), TPSA, H-bindningstal från RDKit.
- Markera förutsägelser separat: Behåll modellförutsägelser som logS, aktivitet etc. med "förutsägelse"-taggen.
- Kontrollera tillämplighetsdomänen: Ser molekylen ut som träningsdata? Är den extremt stor/ovanlig?
- Använd för rangordning, inte beslut: Använd förutsägelser för att rangordna kandidater; Det ultimata valet är experiment.
- Nära genom experiment: Verifiera kritiska egenskaper (löslighet, pKa) genom mätning.
Fyra kopierbara mallar
1) Deterministiska egenskaper med RDKit:
från rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (beräknad):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bindningsgivare:", rdMolDescriptors.CalcNumHBD(mol))print("H-bindningsacceptor:", rdMolDescriptors.CalcNumHBA(mol)
2) Lipinski-regelutvärdering:
Molecule (SMILES): [SMILES]Uppgift: Utvärdera överensstämmelse med Lipinski-regeln om fem med MA, logP, HBD, HBA-värden som ska beräknas från RDKit. Markera varje kriterium separat som godkänt/underkänt. Regel: Skapa INTE siffrorna; Jag ska hämta det från RDKit, kommenterar du.
3) Funktionsuppskattning + osäkerhetsbegäran:
Molecule (SMILES): [SMILES]Uppgift: Ge en kvalitativ uppskattning av vattenlöslighet (logS) (hög/medel/låg) och förklara logiken med strukturella egenskaper. Ge inte ett exakt antal; Ange att detta är en FÖRUTSägelse och måste bekräftas genom experiment. Varna om molekylen har en ovanlig struktur (tillämpningsrisk).
4) Kandidatrankning (prioritering efter förutsägelse):
Nedan är LEENDE av 5 molekyler. Uppgift: Rangordna dem i termer av vattenlöslighet (mest lösliga till minst) baserat på strukturella egenskaper (antal polära grupper, ringar, lipofilicitet). Skriv motivering för varje rankningsbeslut. Notera: Detta är en PRELIMINÄR sort; Det slutliga urvalet kommer att göras genom mätning.
Svag prompt / Stark prompt
Svag:
Vad är lösligheten för denna molekyl?
AI:n utgör ett tal som inte finns under beräkningen (t.ex. "12 mg/mL"); Det ger självförtroende men kan vara fel.
Stark:
Molecule (SMILES): [SMILES].Uppgift: 1) Jag kommer att ge logP, TPSA, HBD/HBA som ska beräknas med RDKit: [värden].2) Tolka utifrån dessa värden om upplösningen är hög/medium/låg.3) Ge det exakta antalet; Ange att det är en gissning och experiment krävs.
Skillnaden: vi tog de deterministiska värdena från fordonet och fick AI:n att bara tolka dem; Vi efterfrågade uttryckligen osäkerhet och behov av experiment.
Funktionstyper och förtroendenivå
funktion
Hur man får
lita på
notera
molekylvikt
RDKit (deterministisk)
mycket hög
Klipp från formeln
TPSA, HBD/HBA
RDKit (deterministisk)
hög
regelbaserad
logP (beräknat)
RDKit-modell
medelhög
Kan avvika från experimentell
logS (upplösning)
QSAR-uppskattning
medium
Beror på tillämpningsområde
pKa
specialmodell
medium
Det faller i en komplex struktur
biologisk aktivitet
QSAR/ML
Variabel
Var noga med att testa och verifiera
minifodral
Fall 1 — Antal monterade upplösningar. En student frågade AI om lösligheten av en förening; Han fick svaret "25 mg/ml" och satte upp experimentdesignen därefter. Det faktiska värdet i mätningen var ~2 mg/ml, en 10-faldig skillnad. AI hade gjort upp numret. Lektion: ta inte egenskaper som upplösning som siffror från språkmodellen; kvalitativ förutsägelse + mätning.
Fall 2 — Utanför tillämpningsområdet. En QSAR-modell sa att "aktiviteten är hög" för en stor makromolekyl som skilde sig mycket från träningsuppsättningen. Användaren märkte att molekylen inte liknade träningsdata och ansåg att förutsägelsen var opålitlig; Experimentet gav riktigt låg aktivitet. Lärdom: modellen svarar alltid; Om det ligger utanför räckvidden är svaret värdelöst.
Fall 3 — Korrekt användning av Lipinski. På en kandidatmolekyl utvärderade AI Lipinski med värden från RDKit: MA 512 (>500, borderline), logP 4.8 (gynnsam), HBD 2, HBA 7. Användaren tolkade korrekt "ett kriterium kvarstår men regeln är inte absolut" och eliminerade inte molekylen helt och hållet. Lektion: regler är riktlinjer, inte trösklar; Tolka med sammanhang.
Vanliga misstag
- Få funktionen räkna från språkmodellen. Värden som inte är beräknade är tillverkade; Använd deterministiskt verktyg eller modell med osäkerhet.
- Ignorera tillämpningsområdet. Modellen genererar siffror för varje molekyl; opålitlig utanför fältet.
- Med tanke på ett uppskattat mått. logS är en uppskattning; Det är inte en ersättning för experimentell upplösning.
- Med tanke på att Lipinski är den absoluta regeln. Kandidaten som är på gränsen elimineras inte automatiskt; Många droger bryter mot regeln.
- Blandar ihop "beräknad" med "uppskattad". TPSA beräknas (tillförlitligt), aktiviteten uppskattas (osäker).
Varning: Funktionsförutsägelser är bra för att rangordna och prioritera kandidater; men inte för att ensam avgöra ett beslut. "Modellen sa löslig" är en hypotes; "Jag mätte, det löser sig" är ett resultat.
Sammanfattningsvis
- Molekylära egenskaper kan förutsägas innan experimentet och sparar mycket tid.
- Vissa funktioner beräknas deterministiskt (MA, TPSA, HBD/HBA), vissa är statistiska uppskattningar (logS, aktivitet).
- Tillämpbarhetsdomänen är det mest kritiska konceptet: modellen svarar alltid, men är opålitlig utanför domänen.
- Få funktionerna från RDKit eller tvetydighetsmodellen, inte språkmodellen.
- Använd förutsägelser för att rangordna kandidater; Ta det slutliga beslutet genom att experimentera.
Applikationsuppgift
Välj fem molekyler (t.ex. en läkemedelsserie). Beräkna MA, logP, TPSA, HBD, HBA för var och en med RDKit och utvärdera Lipinski. Se separat, fråga AI om en kvalitativ uppskattning (inte ett antal) av lösligheten för varje molekyl och en varning för tillämplighet. Samla deterministiska värden och AI-förutsägelser i en tabell. Vilken molekyl gav den mest drogliknande profilen? Var är osäkerheten högst?
checklista
- [ ] Jag skiljer mellan deterministiskt beräknade och predikterade egenskaper.
- [ ] Jag hämtar egenskapsvärdena från RDKit/modellen, inte språkmodellen.
- [ ] Jag märker molekyler utanför tillämpningsområdet.
- [ ] Jag använder Lipinski som en guide, inte en absolut regel.
- [ ] Jag använder förutsägelser för rangordning och beslut för experiment.
- [ ] Jag har en plan för att verifiera kritiska egenskaper genom mätning.