Unità 7 / 11

Previsione delle proprietà molecolari e QSAR: risoluzione, pKa e limiti del modello

Guadagni:

  • Capacità di distinguere tra caratteristiche calcolate deterministicamente e caratteristiche stimate statisticamente e di determinare i livelli di confidenza
  • Capacità di valutare la regione in cui il modello è affidabile utilizzando il concetto di dominio di applicabilità
  • Capacità di comprendere che si dovrebbero utilizzare previsioni sui tratti per classificare i candidati e prendere la decisione finale attraverso la sperimentazione.

Prima di sintetizzare una molecola, spesso ci chiediamo: "È solubile in acqua? Quanto è acida? Attraversa la membrana cellulare? È plausibile come candidato farmacologico?" Predire le risposte a queste domande prima dell'esperimento fa risparmiare molto tempo. L’intelligenza artificiale e i suoi modelli specializzati (in particolare QSAR – Quantitative Structure-Activity Relationship, ovvero un modello statistico che prevede una proprietà dai descrittori strutturali della molecola) sono potenti in queste previsioni. Ma queste previsioni sono previsioni di probabilità, non misurazioni. In questa unità impareremo la previsione delle caratteristiche, i suoi punti di forza e il concetto più critico, la zona di applicabilità (la regione in cui il modello è affidabile).

Quali caratteristiche sono previste?

  • logP: coefficiente di ripartizione olio/acqua della molecola; Mostra lipofilia (gradimento dei grassi). Fondamentale nell'assorbimento dei farmaci.
  • Solubilità (logS): quanto è solubile in acqua.
  • pKa: acidità/alcalinità; Il pH al quale un gruppo ionizza.
  • TPSA: superficie polare topologica; Viene utilizzato nella stima della permeabilità.
  • La “regola del cinque” di Lipinski: soglie pratiche per peso molecolare, logP, numero di donatori/accettori di legami H di candidati farmaci orali.

Alcuni di questi valori sono calcolati in modo deterministico (ad esempio TPSA, numeri di legami H) con strumenti come RDKit; Alcuni di essi sono stime statistiche (logS, attività biologica). Conoscere questa distinzione determina quanto ti fidi.

Suggerimento: distinguere se una caratteristica è "calcolata" (basata su regole, ripetibile) o "prevista" (dal modello, incerta). Avere un'elevata fiducia nei calcoli, una cauta fiducia nelle previsioni e verificare le previsioni mediante esperimenti.

Ambito di applicabilità: il concetto più importante

Un modello QSAR funziona bene su molecole simili a quelle su cui è stato addestrato. Se si fornisce una molecola molto diversa dai dati di addestramento (ad esempio, uno scheletro molto grande e insolito), il modello produrrà comunque un numero, ma quel numero sarà inaffidabile. Questo si chiama "essere al di fuori dell'ambito di applicabilità". Il modello dà sempre una risposta; È tuo compito stabilire se la risposta è affidabile o meno.

È ancora più rischioso quando il modello linguistico fornisce un valore di attributo: produce il numero come un valore "dall'aspetto probabile", senza alcun calcolo sottostante. Quindi, se possibile, ottieni i valori delle caratteristiche da uno strumento deterministico (RDKit) o ​​da un modello QSAR che fornisca incertezza, non dal modello linguistico.

Passo dopo passo: previsione delle funzionalità sicure

  1. Verifica la molecola: Analizza SMILES con RDKit (unità 2).
  2. Calcola quelli deterministici: MA, logP (calcolato), TPSA, numeri di legami H da RDKit.
  3. Contrassegna le previsioni separatamente: conserva le previsioni del modello come logS, attività, ecc. con il tag "previsione".
  4. Controlla il dominio di applicabilità: la molecola assomiglia ai dati di addestramento? È estremamente grande/insolito?
  5. Utilizzo per la classifica, non per prendere decisioni: utilizza le previsioni per classificare i candidati; La scelta finale è sperimentare.
  6. Conclusione dell'esperimento: verificare le proprietà critiche (solubilità, pKa) mediante misurazione.

Quattro modelli copiabili

1) Funzionalità deterministiche con RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calcolato):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donatore di legame H:", rdMolDescriptors.CalcNumHBD(mol))print("Accettore di legame H:", rdMolDescriptors.CalcNumHBA(mol))

2) Valutazione della regola Lipinski:

Molecola (SORRISI): [SORRISI]Compito: valutare la conformità con la regola del cinque di Lipinski con i valori MA, logP, HBD, HBA da calcolare da RDKit. Contrassegnare ciascun criterio separatamente come superato/fallito. Regola: NON inventare i numeri; Lo prenderò da RDKit, commenti.

3) Stima della caratteristica + richiesta di incertezza:

Molecola (SORRISI): [SORRISI]Compito: fornire una stima qualitativa della solubilità in acqua (logS) (alta/media/bassa) e spiegare la logica con le caratteristiche strutturali. Non fornire un numero esatto; Dichiara che questa è una PREVISIONE e deve essere confermata dall'esperimento. Avvertire se la molecola ha una struttura insolita (rischio di applicabilità).

4) Graduatoria dei candidati (priorità tramite pronostico):

Di seguito sono riportati i SORRISI di 5 molecole.Compito: classificarle in termini di solubilità in acqua (da più solubili a meno) in base alle caratteristiche strutturali (numero di gruppi polari, anelli, lipofilicità).Scrivere la giustificazione per ogni decisione di classificazione.Nota: questo è un ordinamento PRELIMINARE; La selezione finale verrà effettuata mediante misurazione.

Prompt debole / Prompt forte

Debole:

Qual è la solubilità di questa molecola?

L'AI costituisce un numero che non esiste nel calcolo (es. "12 mg/mL"); Dà fiducia ma potrebbe essere sbagliato.

Forte:

Molecola (SORRISI): [SORRISI].Compito: 1) Darò i logP, TPSA, HBD/HBA da calcolare con RDKit: [valori].2) Sulla base di questi valori, interpretare se la risoluzione è alta/media/bassa.3) Fornire il numero esatto; Dichiara che si tratta di un'ipotesi e che sono necessari esperimenti.

La differenza: abbiamo preso i valori deterministici dal veicolo e abbiamo fatto in modo che l'IA li interpretasse semplicemente; Abbiamo chiesto esplicitamente l’incertezza e la necessità di sperimentare.

Tipi di funzionalità e livello di affidabilità

caratteristica

Come ottenere

fiducia

nota

peso molecolare

RDKit (deterministico)

molto alto

Taglia dalla formula

TPSA, HBD/HBA

RDKit (deterministico)

alto

basato su regole

logP (calcolato)

Modello RDKit

medio-alto

Può discostarsi da quello sperimentale

logS (risoluzione)

Stima QSAR

medio

Dipende dall'area di applicabilità

pKa

modello speciale

medio

Rientra in una struttura complessa

attività biologica

QSAR/ML

Variabile

Assicurati di testare e verificare

mini custodie

Caso 1 — Numero di risoluzioni adottate. Uno studente ha chiesto all'IA informazioni sulla solubilità di un composto; Ha ricevuto la risposta "25 mg/mL" e ha impostato il disegno sperimentale di conseguenza. Il valore effettivo nella misurazione era di ~2 mg/mL, una differenza di 10 volte. L'intelligenza artificiale aveva composto il numero. Lezione: non prendere proprietà come la risoluzione come numeri dal modello linguistico; previsione qualitativa + misurazione.

Caso 2 – Fuori dall’ambito di applicabilità. Un modello QSAR afferma che "l'attività è elevata" per una grande macromolecola che era molto diversa dal set di addestramento. L'utente ha notato che la molecola non somigliava ai dati di addestramento e ha ritenuto la previsione inaffidabile; L'esperimento ha dato un'attività davvero bassa. Lezione: il modello risponde sempre; Se è fuori portata, la risposta è inutile.

Caso 3 — Uso corretto di Lipinski. Su una molecola candidata, l'AI ha valutato Lipinski con valori di RDKit: MA 512 (>500, borderline), logP 4,8 (favorevole), HBD 2, HBA 7. L'utente ha interpretato correttamente "rimane un criterio ma la regola non è assoluta" e non ha eliminato del tutto la molecola. Lezione: le regole sono linee guida, non soglie; Interpretare con il contesto.

Errori comuni

  • Ottenere il conteggio delle funzionalità dal modello linguistico. I valori non calcolati vengono fabbricati; Utilizzare uno strumento o un modello deterministico con incertezza.
  • Ignorando il campo di applicabilità. Il modello genera numeri per ciascuna molecola; inaffidabile fuori dal campo.
  • Considerando una misurazione stimata. logS è una stima; Non sostituisce la risoluzione sperimentale.
  • Considerando Lipinski la regola assoluta. Il candidato che si trova in frontiera non viene automaticamente eliminato; Molti farmaci violano la regola.
  • Confondere “calcolato” con “stimato”. Il TPSA è calcolato (affidabile), l'attività è stimata (incerto).
Attenzione: le previsioni sulle funzionalità sono ottime per classificare e dare priorità ai candidati; ma non per determinare da solo una decisione. “Il modello detto solubile” è un'ipotesi; "Ho misurato, si dissolve" è il risultato.

In sintesi

  • Le proprietà molecolari possono essere previste prima dell'esperimento e ciò consente di risparmiare molto tempo.
  • Alcune caratteristiche sono calcolate in modo deterministico (MA, TPSA, HBD/HBA), altre sono stime statistiche (logS, attività).
  • Il dominio di applicabilità è il concetto più critico: il modello risponde sempre, ma è inaffidabile al di fuori del dominio.
  • Ottieni il conteggio delle funzionalità da RDKit o dal modello di ambiguità, non dal modello linguistico.
  • Utilizzare le previsioni per classificare i candidati; Prendi la decisione finale sperimentando.

Compito dell'applicazione

Selezionare cinque molecole (ad esempio una serie di farmaci). Calcola MA, logP, TPSA, HBD, HBA per ciascuno con RDKit e valuta Lipinski. Separatamente, chiedere all’IA una stima qualitativa (non un numero) della solubilità di ciascuna molecola e un avviso sul campo di applicabilità. Raccogli valori deterministici e previsioni AI in una tabella. Quale molecola ha fornito il profilo più simile al farmaco? Dove è più alta l’incertezza?

lista di controllo

  • [ ] Distinguo tra proprietà calcolate deterministiche e proprietà previste.
  • [] Ottengo i valori delle proprietà da RDKit/model, non dal modello linguistico.
  • [ ] Noto molecole fuori dall'ambito di applicabilità.
  • [ ] Utilizzo Lipinski come guida, non come regola assoluta.
  • [] Utilizzo le previsioni per il ranking e le decisioni per la sperimentazione.
  • [ ] Ho un piano per verificare le caratteristiche critiche mediante misurazione.