Ganancias:
- Capacidad para distinguir entre características calculadas de manera determinista y características estimadas estadísticamente y determinar niveles de confianza.
- Capacidad para evaluar la región en la que el modelo es confiable utilizando el concepto de dominio de aplicabilidad.
- Capacidad para comprender que se deben utilizar predicciones de rasgos para clasificar a los candidatos y tomar la decisión final mediante la experimentación.
Antes de sintetizar una molécula, a menudo nos preguntamos: "¿Es soluble en agua? ¿Qué tan ácida es? ¿Atraviesa la membrana celular? ¿Es plausible como candidato a fármaco?" Predecir las respuestas a estas preguntas antes del experimento ahorra mucho tiempo. La IA y sus modelos especializados (especialmente QSAR - Relación Cuantitativa Estructura-Actividad, es decir, modelo estadístico que predice una propiedad a partir de los descriptores estructurales de la molécula) son poderosos en estas predicciones. Pero estas predicciones son predicciones de probabilidad, no mediciones. En esta unidad, aprenderemos sobre la predicción de características, sus fortalezas y el concepto más crítico, la zona de aplicabilidad (la región donde el modelo es confiable).
¿Qué características se predicen?
- logP: Coeficiente de partición aceite/agua de la molécula; Muestra lipofilicidad (gusto de grasas). Crítico en la absorción de fármacos.
- Solubilidad (logS): Qué tan soluble es en agua.
- pKa: Acidez/alcalinidad; El pH al que se ioniza un grupo.
- TPSA: Superficie polar topológica; Se utiliza en la estimación de la permeabilidad.
- “Regla de cinco” de Lipinski: umbrales prácticos para el peso molecular, logP, número de donantes/aceptores de enlaces H de candidatos a fármacos orales.
Algunos de estos valores se calculan de forma determinista (por ejemplo, TPSA, números de enlaces H) con herramientas como RDKit; Algunas de ellas son estimaciones estadísticas (logS, actividad biológica). Conocer esta distinción determina cuánto confías.
Consejo: Distinga si una característica está “calculada” (basada en reglas, repetible) o “predicha” (a partir del modelo, incierta). Tenga alta confianza en los cálculos, confianza cautelosa en las predicciones y verifique las predicciones mediante experimentos.
Ámbito de aplicabilidad: el concepto más importante
Un modelo QSAR funciona bien con moléculas que son similares a las moléculas con las que fue entrenado. Si proporciona una molécula que es muy diferente de los datos de entrenamiento (por ejemplo, un esqueleto muy grande e inusual), el modelo seguirá produciendo un número, pero ese número no será confiable. A esto se le llama "estar fuera del ámbito de aplicabilidad". El modelo siempre da una respuesta; Es su trabajo saber si la respuesta es confiable o no.
Es aún más arriesgado cuando el modelo de lenguaje proporciona un valor de atributo: produce el número como un valor "de apariencia probable", sin ningún cálculo subyacente. Entonces, si es posible, obtenga los valores de las características de una herramienta determinista (RDKit) o un modelo QSAR que proporcione incertidumbre, no del modelo de lenguaje.
Paso a paso: predicción segura de funciones
- Verificar molécula: Analizar SMILES con RDKit (unidad 2).
- Calcule los deterministas: MA, logP (calculado), TPSA, números de enlaces H de RDKit.
- Marque las predicciones por separado: mantenga las predicciones del modelo, como registros, actividad, etc., con la etiqueta "predicción".
- Verifique el dominio de aplicabilidad: ¿La molécula se parece a los datos de entrenamiento? ¿Es extremadamente grande/inusual?
- Utilícelo para clasificar, no para tomar decisiones: utilice predicciones para clasificar a los candidatos; La elección final es experimentar.
- Cerrar por experimento: verificar las propiedades críticas (solubilidad, pKa) mediante medición.
Cuatro plantillas copiables
1) Funciones deterministas con RDKit:
from rdkit import Chemfrom rdkit.Chem import Descriptores, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculado):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donante de enlaces H:", rdMolDescriptors.CalcNumHBD(mol))print("Aceptor de enlaces H:", rdMolDescriptors.CalcNumHBA(mol))
2) Evaluación de la regla de Lipinski:
Molécula (SONRISAS): [SONRISAS]Tarea: Evaluar el cumplimiento de la regla de cinco de Lipinski con valores de MA, logP, HBD, HBA a calcular a partir de RDKit. Marque cada criterio por separado como aprobado/reprobado. Regla: NO inventes los números; Lo conseguiré de RDKit, comentas.
3) Estimación de características + solicitud de incertidumbre:
Molécula (SONRISAS): [SONRISAS]Tarea: Dar una estimación cualitativa de la solubilidad en agua (logS) (alta/media/baja) y explicar el fundamento con las características estructurales. No des un número exacto; Indique que esto es una PREDICCIÓN y debe confirmarse mediante un experimento. Advertir si la molécula tiene una estructura inusual (riesgo de aplicabilidad).
4) Clasificación de candidatos (priorización por predicción):
A continuación se muestran SONRISAS de 5 moléculas. Tarea: Clasifíquelas en términos de solubilidad en agua (de más soluble a menos) según las características estructurales (número de grupos polares, anillos, lipofilicidad). Escriba una justificación para cada decisión de clasificación. Nota: Esta es una clasificación PRELIMINAR; La selección final se realizará mediante medición.
Aviso débil / Aviso fuerte
Débil:
¿Cuál es la solubilidad de esta molécula?
El IA constituye un número que no existe en el cálculo (por ejemplo, "12 mg/mL"); Da confianza pero puede estar equivocado.
Fuerte:
Molécula (SONRISAS): [SONRISAS].Tarea: 1) Daré el logP, TPSA, HBD/HBA para calcular con RDKit: [valores].2) En base a estos valores, interpretar si la resolución es alta/media/baja.3) Dando el número exacto; Indique que es una suposición y que se requieren experimentos.
La diferencia: tomamos los valores deterministas del vehículo e hicimos que la IA simplemente los interpretara; Pedimos explícitamente incertidumbre y la necesidad de experimentar.
Tipos de funciones y nivel de confianza
característica
como llegar
confianza
nota
peso molecular
RDKit (determinista)
muy alto
Cortar de la fórmula
TPSA, HBD/HBA
RDKit (determinista)
alto
basado en reglas
logP (calculado)
Modelo RDKit
medio-alto
Puede desviarse de lo experimental.
registros (resolución)
estimación QSAR
medio
Depende del área de aplicabilidad
pka
modelo especial
medio
Cae en una estructura compleja.
actividad biológica
QSAR/ML
variable
Asegúrese de probar y verificar
mini casos
Caso 1: Número de resoluciones ajustadas. Un estudiante preguntó a la IA sobre la solubilidad de un compuesto; Recibió la respuesta "25 mg/mL" y configuró el diseño experimental en consecuencia. El valor real en la medición fue ~2 mg/mL, una diferencia de 10 veces. La IA había inventado el número. Lección: no tome propiedades como la resolución como números del modelo de lenguaje; predicción cualitativa + medición.
Caso 2 — Fuera del ámbito de aplicabilidad. Un modelo QSAR decía que "la actividad es alta" para una macromolécula grande que era muy diferente del conjunto de entrenamiento. El usuario notó que la molécula no se parecía a los datos de entrenamiento y consideró que la predicción no era confiable; El experimento dio una actividad realmente baja. Lección: el modelo siempre responde; Si está fuera de alcance, la respuesta no tiene valor.
Caso 3: Uso correcto de Lipinski. En una molécula candidata, AI evaluó a Lipinski con valores de RDKit: MA 512 (>500, límite), logP 4.8 (favorable), HBD 2, HBA 7. El usuario interpretó correctamente "queda un criterio pero la regla no es absoluta" y no eliminó la molécula por completo. Lección: las reglas son pautas, no umbrales; Interpretar con contexto.
Errores comunes
- Obtener el recuento de funciones del modelo de lenguaje. Los valores que no se calculan son fabricados; Utilice una herramienta determinista o un modelo con incertidumbre.
- Ignorando el campo de aplicabilidad. El modelo genera números para cada molécula; poco confiable fuera del campo.
- Considerando una medida estimada. logS es una estimación; No sustituye a la resolución experimental.
- Considerando a Lipinski la regla absoluta. El candidato que se encuentra en la frontera no es eliminado automáticamente; Muchas drogas violan la regla.
- Confundir “calculado” con “estimado”. Se calcula TPSA (confiable), se estima la actividad (incierta).
Precaución: Las predicciones de funciones son excelentes para clasificar y priorizar candidatos; pero no para determinar una decisión por sí solo. "El modelo dicho soluble" es una hipótesis; "Medí, se disuelve" es el resultado.
En resumen
- Las propiedades moleculares se pueden predecir antes del experimento y ahorran mucho tiempo.
- Algunas características se calculan de forma determinista (MA, TPSA, HBD/HBA), otras son estimaciones estadísticas (logS, actividad).
- El dominio de aplicabilidad es el concepto más crítico: el modelo siempre responde, pero no es confiable fuera de ese dominio.
- Obtenga los recuentos de funciones de RDKit o del modelo de ambigüedad, no del modelo de lenguaje.
- Utilice predicciones para clasificar a los candidatos; Tome la decisión final experimentando.
Tarea de aplicación
Seleccione cinco moléculas (por ejemplo, una serie de medicamentos). Calcule MA, logP, TPSA, HBD, HBA para cada uno con RDKit y evalúe Lipinski. Por separado, solicite a la IA una estimación cualitativa (no un número) de la solubilidad de cada molécula y una advertencia sobre el campo de aplicabilidad. Recopile valores deterministas y predicciones de IA en una tabla. ¿Qué molécula dio el perfil más parecido a un fármaco? ¿Dónde es mayor la incertidumbre?
lista de verificación
- [] Distingo entre propiedades deterministas calculadas y predichas.
- [] Obtengo los valores de propiedad del RDKit/modelo, no del modelo de lenguaje.
- [] Noto moléculas fuera del alcance de aplicabilidad.
- [ ] Utilizo a Lipinski como guía, no como regla absoluta.
- [] Utilizo predicciones para clasificar y tomar decisiones para experimentar.
- [] Tengo un plan para verificar características críticas mediante medición.