Egység 7 / 11

Molekuláris tulajdonságok előrejelzése és QSAR: Felbontás, pKa és modellhatárok

Nyereség:

  • Képes megkülönböztetni a determinisztikusan számított jellemzőket a statisztikailag becsült jellemzőktől, és meghatározni a megbízhatósági szinteket
  • Képes kiértékelni azt a régiót, amelyben a modell megbízható az alkalmazhatósági tartomány fogalmával
  • Képes annak megértésére, hogy a tulajdonságok előrejelzéseit kell használni a jelöltek rangsorolásához és a végső döntés meghozatalához kísérletezéssel.

Molekula szintetizálása előtt gyakran feltesszük a kérdést: "Vízoldható-e? Mennyire savas? Átjut a sejtmembránon? Vajon elfogadható gyógyszerjelöltként?" Ha a kísérlet előtt megjósoljuk a válaszokat ezekre a kérdésekre, sok időt takarítunk meg. Az AI és speciális modelljei (különösen a QSAR – Quantitative Structure-Activity Relationship, azaz olyan statisztikai modell, amely a molekula szerkezeti leíróiból jósol egy tulajdonságot) erősek ezekben az előrejelzésekben. De ezek az előrejelzések a valószínűség előrejelzései, nem pedig a mérések. Ebben az egységben megismerjük a jellemzők előrejelzését, annak erősségeit és a legkritikusabb koncepciót, az alkalmazhatósági zónát (az a régió, ahol a modell megbízható).

Milyen jellemzők várhatók?

  • logP: a molekula olaj/víz megoszlási együtthatója; Lipofilitást (zsírszeretet) mutat. Kritikus a gyógyszer felszívódása szempontjából.
  • Oldhatóság (logS): Mennyire oldódik vízben.
  • pKa: Savasság/lúgosság; Az a pH-érték, amelyen egy csoport ionizálódik.
  • TPSA: Topológiai poláris felület; A permeabilitás becslésére használják.
  • Lipinski „ötös szabály”: Gyakorlati küszöbértékek a molekulatömegre, logP-re, az orális gyógyszerjelöltek H-kötés donorainak/akceptorainak számára.

Ezen értékek egy részét determinisztikusan számítják ki (pl. TPSA, H-kötésszámok) olyan eszközökkel, mint az RDKit; Ezek egy része statisztikai becslés (logS, biológiai aktivitás). Ennek a megkülönböztetésnek az ismerete meghatározza, hogy mennyire bízik meg.

Tipp: Különböztesse meg, hogy egy jellemző „számított” (szabályalapú, megismételhető) vagy „megjósolt” (modellből, bizonytalan). Legyen nagy bizalom a számításokban, óvatosan bízzon az előrejelzésekben, és ellenőrizze az előrejelzéseket kísérletekkel.

Alkalmazási köre: a legfontosabb fogalom

A QSAR modell jól működik azokon a molekulákon, amelyek hasonlóak azokhoz a molekulákhoz, amelyekre betanították. Ha olyan molekulát ad meg, amely nagyon eltér a betanítási adatoktól (például egy nagyon nagy, szokatlan csontvázat), a modell akkor is előállít egy számot, de ez a szám megbízhatatlan lesz. Ezt "az alkalmazhatóság körén kívül esőnek" nevezik. A modell mindig választ ad; Az Ön feladata megmondani, hogy a válasz megbízható-e vagy sem.

Még kockázatosabb, ha a nyelvi modell attribútumértéket ad: a számot "valószínűnek tűnő" értékként állítja elő, mögöttes számítás nélkül. Tehát ha lehetséges, egy determinisztikus eszközből (RDKit) vagy egy bizonytalanságot adó QSAR-modellből szerezzen be jellemző értékeket, ne a nyelvi modellből.

Lépésről lépésre: biztonságos funkciók előrejelzése

  1. Molekula ellenőrzése: Elemezze a SMILES-t az RDKit segítségével (2. egység).
  2. Számítsa ki a determinisztikusakat: MA, logP (számított), TPSA, H-kötésszámok az RDKitből.
  3. Az előrejelzések megjelölése külön: A modell előrejelzéseit, például a logS-t, az aktivitást stb. tartsa a "prediction" címkével.
  4. Ellenőrizze az alkalmazhatósági tartományt: A molekula úgy néz ki, mint a betanítási adatok? Nagyon nagy/szokatlan?
  5. Használja rangsoroláshoz, nem döntéshez: Használjon előrejelzéseket a jelöltek rangsorolásához; A végső választás a kísérletezés.
  6. Kísérleti bezárás: A kritikus tulajdonságok (oldékonyság, pKa) ellenőrzése méréssel.

Négy másolható sablon

1) Az RDKit determinisztikus jellemzői:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):" round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdMolDescriptors.CalcNum))HBA

2) Lipinski-szabály értékelése:

Molekula (SMILES): [SMILES] Feladat: Értékelje az ötös Lipinski-szabály betartását MA, logP, HBD, HBA értékekkel, amelyeket az RDKit-ből kell kiszámítani. Jelölje meg az egyes kritériumokat külön-külön sikeres/nem teljesítettként. Szabály: NE találd ki a számokat; Megszerzem az RDKittől, kommenteled.

3) Funkcióbecslés + bizonytalansági kérés:

Molekula (SMILES): [SMILES]Feladat: Adjon kvalitatív becslést a vízoldhatóságra (logS) (magas/közepes/alacsony), és magyarázza el az indoklást szerkezeti jellemzőkkel. Ne adjon meg pontos számot; Mondja el, hogy ez ELŐREJELZÉS, és ezt kísérlettel kell megerősíteni. Figyelmeztetés, ha a molekulának szokatlan szerkezete van (alkalmazhatósági kockázat).

4) A jelöltek rangsorolása (előrejelzés szerinti rangsorolás):

Az alábbiakban 5 molekulából álló MOSOLYOK láthatók.Feladat: Rangsorolja őket vízben való oldhatóság szempontjából (legjobban oldódik a legkevésbé) szerkezeti jellemzők (poláris csoportok száma, gyűrűk száma, lipofilitás) alapján. Írjon indoklást minden rangsorolási döntéshez.Megjegyzés: Ez egy ELŐZETES rendezés; A végső kiválasztás méréssel történik.

Gyenge felszólítás / Erős felszólítás

Gyenge:

Mennyi ennek a molekulának az oldhatósága?

Az AI egy olyan számot alkot, amely nem létezik a számítás során (pl. "12 mg/ml"); Önbizalmat ad, de lehet, hogy téved.

Erős:

Molekula (MOSOLYOK): [MOSOLYOK].Feladat: 1) Megadom az RDKit-tel számolandó logP, TPSA, HBD/HBA: [értékek].2) Ezen értékek alapján értelmezze, hogy a felbontás nagy/közepes/alacsony.3) Pontos szám megadása; Mondja el, hogy ez csak feltételezés, és kísérletekre van szükség.

A különbség: a determinisztikus értékeket a járműből vettük, és az AI-t csak értelmezni tudtuk; Kifejezetten kértük a bizonytalanságot és a kísérletezés szükségességét.

Funkciótípusok és megbízhatósági szint

jellemzője

Hogyan juthat el

bizalom

megjegyzés

molekulatömeg

RDKit (determinisztikus)

nagyon magas

Vágja ki a képletből

TPSA, HBD/HBA

RDKit (determinisztikus)

magas

szabály alapú

logP (számított)

RDKit modell

középmagas

Eltérhet a kísérletitől

logS (felbontás)

QSAR becslés

közepes

Alkalmazási területtől függ

pKa

speciális modell

közepes

Összetett szerkezetbe esik

biológiai aktivitás

QSAR/ML

Változó

Mindenképpen tesztelje és ellenőrizze

mini tokok

1. eset – A beillesztett állásfoglalások száma. Egy diák megkérdezte az MI-t egy vegyület oldhatóságáról; A „25 mg/mL” választ kapta, és ennek megfelelően állította össze a kísérleti tervet. A mérés tényleges értéke ~2 mg/ml volt, ami 10-szeres különbség. Az AI kitalálta a számot. Tanulság: ne vegyünk olyan tulajdonságokat, mint a felbontás, számokként a nyelvi modellből; minőségi előrejelzés + mérés.

2. eset – Az alkalmazási körön kívül. Egy QSAR-modell szerint "nagy az aktivitás" egy nagy makromolekulánál, amely nagyon különbözik a tréningkészlettől. A felhasználó észrevette, hogy a molekula nem hasonlít a betanítási adatokhoz, és megbízhatatlannak ítélte az előrejelzést; A kísérlet nagyon alacsony aktivitást adott. Tanulság: a modell mindig válaszol; Ha nem terjed ki, a válasz mit sem ér.

3. eset – A Lipinski helyes használata. Az egyik jelölt molekulánál az AI a Lipinskit az RDKit értékeivel értékelte: MA 512 (>500, határvonal), logP 4.8 (kedvező), HBD 2, HBA 7. A felhasználó helyesen értelmezte, hogy "egy kritérium megmarad, de a szabály nem abszolút", és nem szüntette meg teljesen a molekulát. Tanulság: a szabályok iránymutatások, nem küszöbök; Kontextussal értelmezni.

Gyakori hibák

  • A jellemzők számának lekérése a nyelvi modellből. A nem kiszámított értékek gyártottak; Használjon determinisztikus eszközt vagy modellt bizonytalansággal.
  • Az alkalmazhatósági terület figyelmen kívül hagyása. A modell minden molekulához számokat generál; pályán kívül megbízhatatlan.
  • Egy becsült mérést figyelembe véve. logS egy becslés; Nem helyettesíti a kísérleti felbontást.
  • Lipinskit tekintve abszolút szabálynak. A határon lévő jelöltet nem zárják ki automatikusan; Sok gyógyszer sérti a szabályt.
  • A „számított” és a „becsült” összekeverése. A TPSA kiszámított (megbízható), az aktivitás becsült (bizonytalan).
Figyelem: A jellemzők előrejelzései kiválóan alkalmasak a jelöltek rangsorolására és rangsorolására; de nem egyedül dönteni. "A modell szerint oldható" egy hipotézis; "Mértem, feloldódik" az eredmény.

Összefoglalva

  • A molekuláris tulajdonságok a kísérlet előtt megjósolhatók, és sok időt takarítanak meg.
  • Néhány jellemzőt determinisztikusan számítanak ki (MA, TPSA, HBD/HBA), néhányat statisztikai becslés (logS, aktivitás).
  • Az alkalmazhatóság tartománya a legkritikusabb fogalom: a modell mindig válaszol, de a tartományon kívül megbízhatatlan.
  • A funkciószámokat az RDKitből vagy a kétértelműségi modellből szerezze be, ne a nyelvi modellből.
  • Használjon előrejelzéseket a jelöltek rangsorolásához; Kísérletekkel hozza meg a végső döntést.

Pályázati feladat

Válasszon ki öt molekulát (például egy gyógyszersorozatot). Számítsa ki mindegyikre MA, logP, TPSA, HBD, HBA-t az RDKit segítségével, és értékelje Lipinskit. Külön kérjen az AI-tól az egyes molekulák oldhatóságának kvalitatív becslését (nem számot), valamint az alkalmazhatóságra vonatkozó figyelmeztetést. Gyűjtsd össze a determinisztikus értékeket és a mesterséges intelligencia előrejelzéseit egy táblázatban. Melyik molekula adta a leginkább gyógyszerszerű profilt? Hol a legnagyobb a bizonytalanság?

ellenőrző lista

  • [ ] Megkülönböztetem a determinisztikus számított és előrejelzett tulajdonságokat.
  • [ ] A tulajdonságértékeket az RDKit/modellből kapom, nem a nyelvi modellből.
  • [ ] Az alkalmazhatóságon kívül eső molekulákat veszek észre.
  • [ ] Lipinskit útmutatónak használom, nem abszolút szabályt.
  • [ ] Az előrejelzéseket a rangsoroláshoz, a döntést pedig a kísérletezéshez használom.
  • [ ] Van egy tervem a kritikus jellemzők méréssel történő ellenőrzésére.