Nyereség:
- Képes megkülönböztetni a determinisztikusan számított jellemzőket a statisztikailag becsült jellemzőktől, és meghatározni a megbízhatósági szinteket
- Képes kiértékelni azt a régiót, amelyben a modell megbízható az alkalmazhatósági tartomány fogalmával
- Képes annak megértésére, hogy a tulajdonságok előrejelzéseit kell használni a jelöltek rangsorolásához és a végső döntés meghozatalához kísérletezéssel.
Molekula szintetizálása előtt gyakran feltesszük a kérdést: "Vízoldható-e? Mennyire savas? Átjut a sejtmembránon? Vajon elfogadható gyógyszerjelöltként?" Ha a kísérlet előtt megjósoljuk a válaszokat ezekre a kérdésekre, sok időt takarítunk meg. Az AI és speciális modelljei (különösen a QSAR – Quantitative Structure-Activity Relationship, azaz olyan statisztikai modell, amely a molekula szerkezeti leíróiból jósol egy tulajdonságot) erősek ezekben az előrejelzésekben. De ezek az előrejelzések a valószínűség előrejelzései, nem pedig a mérések. Ebben az egységben megismerjük a jellemzők előrejelzését, annak erősségeit és a legkritikusabb koncepciót, az alkalmazhatósági zónát (az a régió, ahol a modell megbízható).
Milyen jellemzők várhatók?
- logP: a molekula olaj/víz megoszlási együtthatója; Lipofilitást (zsírszeretet) mutat. Kritikus a gyógyszer felszívódása szempontjából.
- Oldhatóság (logS): Mennyire oldódik vízben.
- pKa: Savasság/lúgosság; Az a pH-érték, amelyen egy csoport ionizálódik.
- TPSA: Topológiai poláris felület; A permeabilitás becslésére használják.
- Lipinski „ötös szabály”: Gyakorlati küszöbértékek a molekulatömegre, logP-re, az orális gyógyszerjelöltek H-kötés donorainak/akceptorainak számára.
Ezen értékek egy részét determinisztikusan számítják ki (pl. TPSA, H-kötésszámok) olyan eszközökkel, mint az RDKit; Ezek egy része statisztikai becslés (logS, biológiai aktivitás). Ennek a megkülönböztetésnek az ismerete meghatározza, hogy mennyire bízik meg.
Tipp: Különböztesse meg, hogy egy jellemző „számított” (szabályalapú, megismételhető) vagy „megjósolt” (modellből, bizonytalan). Legyen nagy bizalom a számításokban, óvatosan bízzon az előrejelzésekben, és ellenőrizze az előrejelzéseket kísérletekkel.
Alkalmazási köre: a legfontosabb fogalom
A QSAR modell jól működik azokon a molekulákon, amelyek hasonlóak azokhoz a molekulákhoz, amelyekre betanították. Ha olyan molekulát ad meg, amely nagyon eltér a betanítási adatoktól (például egy nagyon nagy, szokatlan csontvázat), a modell akkor is előállít egy számot, de ez a szám megbízhatatlan lesz. Ezt "az alkalmazhatóság körén kívül esőnek" nevezik. A modell mindig választ ad; Az Ön feladata megmondani, hogy a válasz megbízható-e vagy sem.
Még kockázatosabb, ha a nyelvi modell attribútumértéket ad: a számot "valószínűnek tűnő" értékként állítja elő, mögöttes számítás nélkül. Tehát ha lehetséges, egy determinisztikus eszközből (RDKit) vagy egy bizonytalanságot adó QSAR-modellből szerezzen be jellemző értékeket, ne a nyelvi modellből.
Lépésről lépésre: biztonságos funkciók előrejelzése
- Molekula ellenőrzése: Elemezze a SMILES-t az RDKit segítségével (2. egység).
- Számítsa ki a determinisztikusakat: MA, logP (számított), TPSA, H-kötésszámok az RDKitből.
- Az előrejelzések megjelölése külön: A modell előrejelzéseit, például a logS-t, az aktivitást stb. tartsa a "prediction" címkével.
- Ellenőrizze az alkalmazhatósági tartományt: A molekula úgy néz ki, mint a betanítási adatok? Nagyon nagy/szokatlan?
- Használja rangsoroláshoz, nem döntéshez: Használjon előrejelzéseket a jelöltek rangsorolásához; A végső választás a kísérletezés.
- Kísérleti bezárás: A kritikus tulajdonságok (oldékonyság, pKa) ellenőrzése méréssel.
Négy másolható sablon
1) Az RDKit determinisztikus jellemzői:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):" round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdMolDescriptors.CalcNum))HBA
2) Lipinski-szabály értékelése:
Molekula (SMILES): [SMILES] Feladat: Értékelje az ötös Lipinski-szabály betartását MA, logP, HBD, HBA értékekkel, amelyeket az RDKit-ből kell kiszámítani. Jelölje meg az egyes kritériumokat külön-külön sikeres/nem teljesítettként. Szabály: NE találd ki a számokat; Megszerzem az RDKittől, kommenteled.
3) Funkcióbecslés + bizonytalansági kérés:
Molekula (SMILES): [SMILES]Feladat: Adjon kvalitatív becslést a vízoldhatóságra (logS) (magas/közepes/alacsony), és magyarázza el az indoklást szerkezeti jellemzőkkel. Ne adjon meg pontos számot; Mondja el, hogy ez ELŐREJELZÉS, és ezt kísérlettel kell megerősíteni. Figyelmeztetés, ha a molekulának szokatlan szerkezete van (alkalmazhatósági kockázat).
4) A jelöltek rangsorolása (előrejelzés szerinti rangsorolás):
Az alábbiakban 5 molekulából álló MOSOLYOK láthatók.Feladat: Rangsorolja őket vízben való oldhatóság szempontjából (legjobban oldódik a legkevésbé) szerkezeti jellemzők (poláris csoportok száma, gyűrűk száma, lipofilitás) alapján. Írjon indoklást minden rangsorolási döntéshez.Megjegyzés: Ez egy ELŐZETES rendezés; A végső kiválasztás méréssel történik.
Gyenge felszólítás / Erős felszólítás
Gyenge:
Mennyi ennek a molekulának az oldhatósága?
Az AI egy olyan számot alkot, amely nem létezik a számítás során (pl. "12 mg/ml"); Önbizalmat ad, de lehet, hogy téved.
Erős:
Molekula (MOSOLYOK): [MOSOLYOK].Feladat: 1) Megadom az RDKit-tel számolandó logP, TPSA, HBD/HBA: [értékek].2) Ezen értékek alapján értelmezze, hogy a felbontás nagy/közepes/alacsony.3) Pontos szám megadása; Mondja el, hogy ez csak feltételezés, és kísérletekre van szükség.
A különbség: a determinisztikus értékeket a járműből vettük, és az AI-t csak értelmezni tudtuk; Kifejezetten kértük a bizonytalanságot és a kísérletezés szükségességét.
Funkciótípusok és megbízhatósági szint
jellemzője
Hogyan juthat el
bizalom
megjegyzés
molekulatömeg
RDKit (determinisztikus)
nagyon magas
Vágja ki a képletből
TPSA, HBD/HBA
RDKit (determinisztikus)
magas
szabály alapú
logP (számított)
RDKit modell
középmagas
Eltérhet a kísérletitől
logS (felbontás)
QSAR becslés
közepes
Alkalmazási területtől függ
pKa
speciális modell
közepes
Összetett szerkezetbe esik
biológiai aktivitás
QSAR/ML
Változó
Mindenképpen tesztelje és ellenőrizze
mini tokok
1. eset – A beillesztett állásfoglalások száma. Egy diák megkérdezte az MI-t egy vegyület oldhatóságáról; A „25 mg/mL” választ kapta, és ennek megfelelően állította össze a kísérleti tervet. A mérés tényleges értéke ~2 mg/ml volt, ami 10-szeres különbség. Az AI kitalálta a számot. Tanulság: ne vegyünk olyan tulajdonságokat, mint a felbontás, számokként a nyelvi modellből; minőségi előrejelzés + mérés.
2. eset – Az alkalmazási körön kívül. Egy QSAR-modell szerint "nagy az aktivitás" egy nagy makromolekulánál, amely nagyon különbözik a tréningkészlettől. A felhasználó észrevette, hogy a molekula nem hasonlít a betanítási adatokhoz, és megbízhatatlannak ítélte az előrejelzést; A kísérlet nagyon alacsony aktivitást adott. Tanulság: a modell mindig válaszol; Ha nem terjed ki, a válasz mit sem ér.
3. eset – A Lipinski helyes használata. Az egyik jelölt molekulánál az AI a Lipinskit az RDKit értékeivel értékelte: MA 512 (>500, határvonal), logP 4.8 (kedvező), HBD 2, HBA 7. A felhasználó helyesen értelmezte, hogy "egy kritérium megmarad, de a szabály nem abszolút", és nem szüntette meg teljesen a molekulát. Tanulság: a szabályok iránymutatások, nem küszöbök; Kontextussal értelmezni.
Gyakori hibák
- A jellemzők számának lekérése a nyelvi modellből. A nem kiszámított értékek gyártottak; Használjon determinisztikus eszközt vagy modellt bizonytalansággal.
- Az alkalmazhatósági terület figyelmen kívül hagyása. A modell minden molekulához számokat generál; pályán kívül megbízhatatlan.
- Egy becsült mérést figyelembe véve. logS egy becslés; Nem helyettesíti a kísérleti felbontást.
- Lipinskit tekintve abszolút szabálynak. A határon lévő jelöltet nem zárják ki automatikusan; Sok gyógyszer sérti a szabályt.
- A „számított” és a „becsült” összekeverése. A TPSA kiszámított (megbízható), az aktivitás becsült (bizonytalan).
Figyelem: A jellemzők előrejelzései kiválóan alkalmasak a jelöltek rangsorolására és rangsorolására; de nem egyedül dönteni. "A modell szerint oldható" egy hipotézis; "Mértem, feloldódik" az eredmény.
Összefoglalva
- A molekuláris tulajdonságok a kísérlet előtt megjósolhatók, és sok időt takarítanak meg.
- Néhány jellemzőt determinisztikusan számítanak ki (MA, TPSA, HBD/HBA), néhányat statisztikai becslés (logS, aktivitás).
- Az alkalmazhatóság tartománya a legkritikusabb fogalom: a modell mindig válaszol, de a tartományon kívül megbízhatatlan.
- A funkciószámokat az RDKitből vagy a kétértelműségi modellből szerezze be, ne a nyelvi modellből.
- Használjon előrejelzéseket a jelöltek rangsorolásához; Kísérletekkel hozza meg a végső döntést.
Pályázati feladat
Válasszon ki öt molekulát (például egy gyógyszersorozatot). Számítsa ki mindegyikre MA, logP, TPSA, HBD, HBA-t az RDKit segítségével, és értékelje Lipinskit. Külön kérjen az AI-tól az egyes molekulák oldhatóságának kvalitatív becslését (nem számot), valamint az alkalmazhatóságra vonatkozó figyelmeztetést. Gyűjtsd össze a determinisztikus értékeket és a mesterséges intelligencia előrejelzéseit egy táblázatban. Melyik molekula adta a leginkább gyógyszerszerű profilt? Hol a legnagyobb a bizonytalanság?
ellenőrző lista
- [ ] Megkülönböztetem a determinisztikus számított és előrejelzett tulajdonságokat.
- [ ] A tulajdonságértékeket az RDKit/modellből kapom, nem a nyelvi modellből.
- [ ] Az alkalmazhatóságon kívül eső molekulákat veszek észre.
- [ ] Lipinskit útmutatónak használom, nem abszolút szabályt.
- [ ] Az előrejelzéseket a rangsoroláshoz, a döntést pedig a kísérletezéshez használom.
- [ ] Van egy tervem a kritikus jellemzők méréssel történő ellenőrzésére.