Jednotka 7 / 11

Predikcia molekulárnych vlastností a QSAR: Rozlíšenie, pKa a limity modelu

zisky:

  • Schopnosť rozlišovať medzi deterministicky vypočítanými znakmi a štatisticky odhadnutými znakmi a určiť úrovne spoľahlivosti
  • Schopnosť vyhodnotiť oblasť, v ktorej je model spoľahlivý, pomocou konceptu domény použiteľnosti
  • Schopnosť pochopiť, že človek by mal používať predpovede vlastností na klasifikáciu kandidátov a urobiť konečné rozhodnutie prostredníctvom experimentovania.

Pred syntézou molekuly sa často pýtame: "Je rozpustná vo vode? Aká je kyslá? Prechádza cez bunkovú membránu? Je prijateľná ako kandidát na liečivo?" Predpovedanie odpovedí na tieto otázky pred experimentom ušetrí veľa času. AI a jej špecializované modely (najmä QSAR — Quantitative Structure-Activity Relationship, t.j. štatistický model, ktorý predpovedá vlastnosť zo štruktúrnych deskriptorov molekuly) sú v týchto predpovediach silné. Ale tieto predpovede sú predpovede pravdepodobnosti, nie merania. V tomto bloku sa dozvieme o predikcii funkcií, jej silných stránkach a najdôležitejšom koncepte, zóne použiteľnosti (región, v ktorom je model spoľahlivý).

Aké vlastnosti sú predpovedané?

  • logP: rozdeľovací koeficient molekuly olej/voda; Vykazuje lipofilitu (obľuba tuku). Rozhodujúce pre absorpciu liečiva.
  • Rozpustnosť (logS): Ako je rozpustný vo vode.
  • pKa: kyslosť/zásaditosť; pH, pri ktorom sa skupina ionizuje.
  • TPSA: topologická oblasť polárneho povrchu; Používa sa pri odhade priepustnosti.
  • Lipinského „pravidlo piatich“: Praktické prahové hodnoty pre molekulovú hmotnosť, logP, počet donorov/akceptorov H-väzieb kandidátov na perorálne lieky.

Niektoré z týchto hodnôt sú vypočítané deterministicky (napr. TPSA, čísla H-väzieb) pomocou nástrojov, ako je RDKit; Niektoré z nich sú štatistické odhady (logS, biologická aktivita). Poznanie tohto rozdielu určuje, do akej miery si dôverujete.

Tip: Rozlišujte, či je funkcia „vypočítaná“ (na základe pravidiel, opakovateľná) alebo „predpovedaná“ (z modelu, neistá). Majte vysokú dôveru vo výpočty, opatrnú dôveru v predpovede a overujte predpovede experimentom.

Rozsah pôsobnosti: najdôležitejší pojem

Model QSAR funguje dobre na molekulách, ktoré sú podobné molekulám, na ktorých bol trénovaný. Ak zadáte molekulu, ktorá sa veľmi líši od trénovacích údajov (napríklad veľmi veľká, nezvyčajná kostra), model aj tak vytvorí číslo, ale toto číslo bude nespoľahlivé. Hovorí sa tomu „byť mimo rozsahu pôsobnosti“. Model vždy dáva odpoveď; Vašou úlohou je povedať, či je odpoveď spoľahlivá alebo nie.

Je to ešte riskantnejšie, keď jazykový model dáva hodnotu atribútu: vytvára číslo ako „pravdepodobne vyzerajúcu“ hodnotu bez akéhokoľvek základného výpočtu. Ak je to možné, získajte hodnoty funkcií z deterministického nástroja (RDKit) alebo modelu QSAR, ktorý poskytuje neistotu, nie z jazykového modelu.

Krok za krokom: predikcia bezpečných funkcií

  1. Overte molekulu: Analyzujte SMILES pomocou RDKit (jednotka 2).
  2. Vypočítajte deterministické: MA, logP (vypočítané), TPSA, čísla H-väzieb z RDKit.
  3. Predpovede označujte samostatne: Predpovede modelu, ako sú logS, aktivita atď., uchovávajte pomocou značky „predikcia“.
  4. Skontrolujte oblasť použiteľnosti: Vyzerá molekula ako tréningové dáta? Je extrémne veľký/neobvyklý?
  5. Použiť na hodnotenie, nie na rozhodnutie: Použite predpovede na hodnotenie kandidátov; Konečná voľba je experiment.
  6. Záver experimentu: Kritické vlastnosti (rozpustnosť, pKa) overte meraním.

Štyri kopírovateľné šablóny

1) Deterministické funkcie s RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (vypočítané):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond akceptor:", rdMolDescriptors.CalcNumHBA(mol))

2) Vyhodnotenie Lipinského pravidla:

Molekula (SMILES): [SMILES] Úloha: Vyhodnoťte súlad s Lipinského pravidlom piatich s hodnotami MA, logP, HBD, HBA, ktoré sa majú vypočítať z RDKit. Označte každé kritérium samostatne ako vyhovuje/nevyhovuje. Pravidlo: Čísla si nevymýšľajte; Dostanem to z RDKit, komentujte.

3) Odhad funkcie + požiadavka na neistotu:

Molekula (SMILES): [SMILES] Úloha: Uveďte kvalitatívny odhad rozpustnosti vo vode (logS) (vysoká/stredná/nízka) a vysvetlite dôvod pomocou štruktúrnych prvkov. Neuvádzajte presné číslo; Uveďte, že ide o PREDPOVEĎ a je potrebné ju potvrdiť experimentom. Upozornite, ak má molekula neobvyklú štruktúru (riziko použiteľnosti).

4) Poradie kandidátov (určenie priorít podľa predpovede):

Nižšie sú ÚSMEVY 5 molekúl. Úloha: Zoraďte ich z hľadiska rozpustnosti vo vode (najrozpustnejšie po najmenej) na základe štruktúrnych znakov (počet polárnych skupín, kruhov, lipofilita). Ku každému rozhodnutiu o poradí napíšte odôvodnenie. Poznámka: Toto je PREDBEŽNÉ zoradenie; Konečný výber sa uskutoční meraním.

Slabá výzva / Silná výzva

slabé:

Aká je rozpustnosť tejto molekuly?

AI ​​vytvára číslo, ktoré pri výpočte neexistuje (napr. „12 mg/ml“); Dodáva dôveru, ale môže sa mýliť.

Silný:

Molekula (SMILES): [SMILES]. Úloha: 1) Dám logP, TPSA, HBD/HBA na výpočet pomocou RDKit: [hodnoty].2) Na základe týchto hodnôt interpretujte, či je rozlíšenie vysoké/stredné/nízke.3) Uveďte presné číslo; Uveďte, že ide o odhad a sú potrebné experimenty.

Rozdiel: zobrali sme deterministické hodnoty z vozidla a prinútili AI ich len interpretovať; Výslovne sme žiadali o neistotu a potrebu experimentovania.

Typy funkcií a úroveň dôveryhodnosti

vlastnosť

Ako získať

dôverovať

poznámka

molekulovej hmotnosti

RDKit (deterministický)

veľmi vysoká

Vystrihnite zo vzorca

TPSA, HBD/HBA

RDKit (deterministický)

vysoká

založené na pravidlách

logP (vypočítané)

Model RDKit

stredne vysoká

Môže sa líšiť od experimentálneho

logS (rozlíšenie)

odhad QSAR

stredná

Závisí od oblasti použitia

pKa

špeciálny model

stredná

Spadá do zložitej štruktúry

biologická aktivita

QSAR/ML

Variabilné

Určite otestujte a overte

mini prípady

Prípad 1 – Počet prispôsobených rozlíšení. Študent sa opýtal AI na rozpustnosť zlúčeniny; Dostal odpoveď „25 mg/ml“ a podľa toho nastavil experimentálny dizajn. Skutočná hodnota pri meraní bola ~2 mg/ml, čo je 10-násobný rozdiel. AI vymyslela číslo. Ponaučenie: neberte vlastnosti ako rozlíšenie ako čísla z jazykového modelu; kvalitatívna predpoveď + meranie.

Prípad 2 – Mimo rozsahu pôsobnosti. Model QSAR povedal, že „aktivita je vysoká“ pre veľkú makromolekulu, ktorá sa veľmi líšila od tréningovej sady. Používateľ si všimol, že molekula sa nepodobala trénovacím údajom a predikciu považoval za nespoľahlivú; Experiment vykazoval skutočne nízku aktivitu. Ponaučenie: model vždy reaguje; Ak je mimo rozsah, odpoveď je bezcenná.

Prípad 3 – Správne používanie Lipinského. Na jednej kandidátskej molekule AI vyhodnotila Lipinskiho hodnotami z RDKit: MA 512 (>500, hraničná hodnota), logP 4,8 (priaznivé), HBD 2, HBA 7. Používateľ správne interpretoval „jedno kritérium zostáva, ale pravidlo nie je absolútne“ a molekulu úplne nevylúčil. Ponaučenie: pravidlá sú usmernenia, nie prahové hodnoty; Interpretujte s kontextom.

Časté chyby

  • Získanie počtu funkcií z jazykového modelu. Hodnoty, ktoré nie sú vypočítané, sú vyrobené; Použite deterministický nástroj alebo model s neistotou.
  • Ignorovanie oblasti pôsobnosti. Model generuje čísla pre každú molekulu; nespoľahlivé mimo poľa.
  • Berúc do úvahy odhadované meranie. logS je odhad; Nie je náhradou za experimentálne rozlíšenie.
  • Považujúc Lipinského za absolútne pravidlo. Kandidát, ktorý je na hranici, nie je automaticky vyradený; Mnohé drogy porušujú toto pravidlo.
  • Zamieňanie „vypočítaného“ s „odhadom“. TPSA je vypočítaná (spoľahlivá), aktivita je odhadnutá (neistá).
Upozornenie: Predpovede funkcií sú skvelé na hodnotenie a uprednostňovanie kandidátov; ale nie určovať rozhodnutie sám. "Model povedal rozpustný" je hypotéza; "Meral som, rozpúšťa sa" je výsledok.

V súhrne

  • Molekulové vlastnosti sa dajú predpovedať pred experimentom a ušetria veľa času.
  • Niektoré znaky sú vypočítané deterministicky (MA, TPSA, HBD/HBA), niektoré sú štatistické odhady (logS, aktivita).
  • Oblasť použiteľnosti je najdôležitejším konceptom: model vždy odpovedá, ale mimo domény je nespoľahlivý.
  • Získajte počet funkcií z RDKit alebo modelu nejednoznačnosti, nie z jazykového modelu.
  • Použite predpovede na hodnotenie kandidátov; Urobte konečné rozhodnutie experimentovaním.

Aplikačná úloha

Vyberte päť molekúl (napr. sériu liekov). Vypočítajte MA, logP, TPSA, HBD, HBA pre každý s RDKit a vyhodnoťte Lipinského. Samostatne požiadajte AI ​​o kvalitatívny odhad (nie číslo) rozpustnosti každej molekuly a pole varovania o použiteľnosti. Zhromažďujte deterministické hodnoty a predpovede AI do tabuľky. Ktorá molekula mala najpodobnejší profil lieku? Kde je najvyššia neistota?

kontrolný zoznam

  • [ ] Rozlišujem deterministické vypočítané a predpovedané vlastnosti.
  • [ ] Hodnoty vlastností získavam z RDKit/modelu, nie z jazykového modelu.
  • [ ] Všimol som si molekuly mimo rozsahu použiteľnosti.
  • [ ] Lipinského používam ako návod, nie absolútne pravidlo.
  • [ ] Predpovede používam na hodnotenie a rozhodovanie na experimentovanie.
  • [ ] Mám v pláne overiť kritické vlastnosti meraním.