Unitate 7 / 11

Predicția proprietății moleculare și QSAR: Rezoluție, pKa și limite ale modelului

Câștiguri:

  • Abilitatea de a distinge între caracteristicile calculate determinist și caracteristicile estimate statistic și de a determina nivelurile de încredere
  • Abilitatea de a evalua regiunea în care modelul este de încredere utilizând conceptul de domeniu de aplicabilitate
  • Capacitatea de a înțelege că ar trebui să folosiți predicțiile de trăsături pentru a clasifica candidații și pentru a lua decizia finală prin experimentare.

Înainte de a sintetiza o moleculă, întrebăm adesea: "Este solubilă în apă? Cât de acidă este? Traversează membrana celulară? Este plauzibil ca candidat la medicament?" Prezicerea răspunsurilor la aceste întrebări înainte de experiment economisește mult timp. AI și modelele sale specializate (în special QSAR — Relația Cantitativă Structură-Activitate, adică modelul statistic care prezice o proprietate din descriptorii structurali ai moleculei) sunt puternice în aceste predicții. Dar aceste predicții sunt predicții ale probabilității, nu măsurători. În această unitate, vom afla despre predicția caracteristicilor, punctele sale forte și despre cel mai critic concept, zona de aplicabilitate (regiunea în care modelul este de încredere).

Ce caracteristici sunt prevăzute?

  • logP: coeficientul de partiție ulei/apă al moleculei; Prezintă lipofilitate (placerea grăsimilor). Critic în absorbția medicamentelor.
  • Solubilitate (logS): Cât de solubil este în apă.
  • pKa: aciditate/alcalinitate; pH-ul la care se ionizează un grup.
  • TPSA: Aria suprafeței polare topologice; Este utilizat în estimarea permeabilității.
  • „regula celor cinci” Lipinski: praguri practice pentru greutatea moleculară, logP, numărul de donatori/acceptatori de legături H ai candidaților la medicamente orale.

Unele dintre aceste valori sunt calculate determinist (de exemplu, TPSA, numere de legături H) cu instrumente precum RDKit; Unele dintre ele sunt estimări statistice (logS, activitate biologică). Cunoașterea acestei distincții determină cât de mult ai încredere.

Sfat: distingeți dacă o caracteristică este „calculată” (pe bază de reguli, repetabilă) sau „prevăzută” (din model, nesigur). Aveți încredere ridicată în calcule, încredere precaută în predicții și verificați predicțiile prin experiment.

Domeniul de aplicabilitate: cel mai important concept

Un model QSAR funcționează bine pe molecule care sunt similare cu moleculele pe care a fost antrenat. Dacă dați o moleculă care este foarte diferită de datele de antrenament (de exemplu, un schelet foarte mare, neobișnuit), modelul va produce în continuare un număr, dar acel număr va fi nesigur. Acest lucru se numește „a fi în afara domeniului de aplicabilitate”. Modelul dă întotdeauna un răspuns; Este treaba ta să spui dacă răspunsul este de încredere sau nu.

Este și mai riscant atunci când modelul de limbaj oferă o valoare de atribut: produce numărul ca o valoare „probabilă”, fără calcul de bază. Deci, dacă este posibil, obțineți valorile caracteristicilor dintr-un instrument determinist (RDKit) sau un model QSAR care oferă incertitudine, nu din modelul de limbaj.

Pas cu pas: predicție sigură a caracteristicilor

  1. Verificați molecula: Analizați SMILES cu RDKit (unitatea 2).
  2. Calculați numerele deterministe: MA, logP (calculat), TPSA, numere de legătură H din RDKit.
  3. Marcați predicțiile separat: păstrați predicțiile model, cum ar fi logS, activitate etc., cu eticheta „predicție”.
  4. Verificați domeniul de aplicabilitate: Molecula arată ca datele de antrenament? Este extrem de mare/neobișnuit?
  5. Utilizați pentru clasare, nu pentru decizie: utilizați predicții pentru a clasifica candidații; Alegerea finală este experimentul.
  6. În apropierea experimentului: Verificați proprietățile critice (solubilitate, pKa) prin măsurare.

Patru șabloane copiabile

1) Caracteristici deterministe cu RDKit:

din rdkit import Chemfrom rdkit.Chem import Descriptori, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donator de legături H:", rdMolDescriptors.CalcNumHBD(mol))print("Acceptor de legături H:", rdMolDescriptors.CalcNumHBA(mol))

2) Evaluarea regulii Lipinski:

Moleculă (SMILES): [SMILES] Sarcină: Evaluați conformitatea cu regula Lipinski de cinci cu valorile MA, logP, HBD, HBA care urmează să fie calculate din RDKit. Marcați fiecare criteriu separat ca promovat/eșec. Regula: NU alcătuiți numerele; O să-l iau de la RDKit, comentezi.

3) Estimare caracteristică + cerere de incertitudine:

Moleculă (SMILES): [SMILES] Sarcină: Oferiți o estimare calitativă a solubilității în apă (logS) (ridicat/mediu/scăzut) și explicați rațiunea cu caracteristicile structurale. Nu da un număr exact; Precizați că aceasta este o PREDICȚIE și trebuie confirmată prin experiment. Avertizați dacă molecula are o structură neobișnuită (risc de aplicabilitate).

4) Clasamentul candidaților (prioritizare prin predicție):

Mai jos sunt SMILES de 5 molecule. Sarcină: Clasați-le în funcție de solubilitatea în apă (de la cea mai solubilă la cea mai puțin) pe baza caracteristicilor structurale (număr de grupuri polare, inele, lipofilitate). Scrieți justificarea fiecărei decizii de clasare. Notă: Acesta este un sort PRELIMINAR; Selecția finală se va face prin măsurare.

Prompt slab / Prompt puternic

slab:

Care este solubilitatea acestei molecule?

AI alcătuiește un număr care nu există în calcul (de exemplu, „12 mg/mL”); Oferă încredere, dar poate fi greșit.

Puternic:

Molecula (SMILES): [SMILES].Sarcina: 1) Voi da logP, TPSA, HBD/HBA pentru a fi calculat cu RDKit: [valori].2) Pe baza acestor valori, interpretați dacă rezoluția este mare/medie/scăzută.3) Dând numărul exact; Precizați că este o presupunere și sunt necesare experimente.

Diferența: am luat valorile deterministe din vehicul și am făcut ca AI să le interpreteze; Am cerut în mod explicit incertitudinea și nevoia de experimentare.

Tipuri de caracteristici și nivel de încredere

caracteristică

Cum să ajungi

încredere

notă

greutate moleculară

RDKit (determinist)

foarte sus

Tăiați din formulă

TPSA, HBD/HBA

RDKit (determinist)

înalt

bazat pe reguli

logP (calculat)

Model RDKit

mediu-înalt

Poate abate de la experimental

logS (rezoluție)

Estimare QSAR

mediu

Depinde de domeniul de aplicabilitate

pKa

model special

mediu

Se încadrează într-o structură complexă

activitate biologică

QSAR/ML

Variabilă

Asigurați-vă că testați și verificați

mini carcase

Cazul 1 – Numărul de rezoluții aplicate. Un student a întrebat AI despre solubilitatea unui compus; A primit răspunsul „25 mg/mL” și a configurat designul experimental în consecință. Valoarea reală în măsurare a fost de ~2 mg/mL, o diferență de 10 ori. AI-ul inventase numărul. Lecție: nu luați proprietăți precum rezoluția ca numere din modelul de limbaj; predicție calitativă + măsurare.

Cazul 2 – În afara domeniului de aplicare. Un model QSAR spune că „activitatea este mare” pentru o macromoleculă mare, care era foarte diferită de setul de antrenament. Utilizatorul a observat că molecula nu semăna cu datele de antrenament și a considerat predicția nesigură; Experimentul a dat o activitate foarte scăzută. Lecție: modelul răspunde întotdeauna; Dacă este în afara domeniului de aplicare, răspunsul este lipsit de valoare.

Cazul 3 – Utilizarea corectă a lui Lipinski. Pe o moleculă candidată, AI a evaluat Lipinski cu valorile din RDKit: MA 512 (>500, limită), logP 4.8 (favorabil), HBD 2, HBA 7. Utilizatorul a interpretat corect „un criteriu rămâne, dar regula nu este absolută” și nu a eliminat cu totul molecula. Lecția: regulile sunt linii directoare, nu praguri; Interpretați în context.

Greșeli comune

  • Obținerea numărului de caracteristici din modelul de limbă. Valorile care nu sunt calculate sunt fabricate; Utilizați instrument sau model determinist cu incertitudine.
  • Ignorarea domeniului de aplicabilitate. Modelul generează numere pentru fiecare moleculă; nesigur în afara câmpului.
  • Luând în considerare o măsurare estimată. logS este o estimare; Nu este un substitut pentru rezoluția experimentală.
  • Considerând Lipinski regula absolută. Candidatul care se află la graniță nu este eliminat automat; Multe medicamente încalcă regula.
  • Se confundă „calculat” cu „estimat”. TPSA este calculată (de încredere), activitatea este estimată (incertă).
Atenție: predicțiile caracteristicilor sunt excelente pentru clasarea și prioritizarea candidaților; dar nu pentru a determina singur o decizie. „Modelul a spus solubil” este o ipoteză; „Am măsurat, se dizolvă” este un rezultat.

Pe scurt

  • Proprietățile moleculare pot fi prezise înainte de experiment și economisesc mult timp.
  • Unele caracteristici sunt calculate determinist (MA, TPSA, HBD/HBA), unele sunt estimări statistice (logS, activitate).
  • Domeniul de aplicabilitate este conceptul cel mai critic: modelul răspunde întotdeauna, dar nu este de încredere în afara domeniului.
  • Obțineți numărul de caracteristici din RDKit sau modelul de ambiguitate, nu modelul de limbă.
  • Utilizați predicții pentru a clasifica candidații; Luați decizia finală experimentând.

Sarcina de aplicare

Selectați cinci molecule (de exemplu, o serie de medicamente). Calculați MA, logP, TPSA, HBD, HBA pentru fiecare cu RDKit și evaluați Lipinski. Separat, cereți AI o estimare calitativă (nu un număr) a solubilității fiecărei molecule și un avertisment de câmp de aplicabilitate. Colectați valori deterministe și predicții AI într-un tabel. Care moleculă a dat cel mai mult profil de medicament? Unde este cea mai mare incertitudine?

lista de verificare

  • [ ] Disting între proprietățile deterministe calculate și cele prezise.
  • [ ] Obțin valorile proprietăților din RDKit/model, nu din modelul de limbă.
  • [ ] Observ molecule în afara domeniului de aplicabilitate.
  • [ ] Folosesc Lipinski ca ghid, nu o regulă absolută.
  • [ ] Folosesc predicții pentru clasare și decizie pentru experimentare.
  • [ ] Am un plan pentru a verifica caracteristicile critice prin măsurare.