Gains :
- Capacité à faire la distinction entre les caractéristiques calculées de manière déterministe et les caractéristiques estimées statistiquement et à déterminer les niveaux de confiance
- Capacité à évaluer la région dans laquelle le modèle est fiable en utilisant le concept de domaine d'applicabilité
- Capacité à comprendre qu'il faut utiliser les prédictions de traits pour classer les candidats et prendre la décision finale par l'expérimentation.
Avant de synthétiser une molécule, on se demande souvent : "Est-elle soluble dans l'eau ? Quel est son degré d'acidité ? Traverse-t-elle la membrane cellulaire ? Est-elle plausible comme candidat médicament ?" Prédire les réponses à ces questions avant l’expérience permet de gagner beaucoup de temps. L’IA et ses modèles spécialisés (notamment QSAR — Quantitative Structure-Activity Relation, c’est-à-dire modèle statistique qui prédit une propriété à partir des descripteurs structuraux de la molécule) sont puissants dans ces prédictions. Mais ces prédictions sont des prédictions de probabilité et non des mesures. Dans cette unité, nous découvrirons la prédiction de caractéristiques, ses points forts et le concept le plus critique, la zone d'applicabilité (la région où le modèle est fiable).
Quelles fonctionnalités sont prévues ?
- logP : Coefficient de partage huile/eau de la molécule ; Il montre une lipophilie (aimer les graisses). Critique dans l’absorption des médicaments.
- Solubilité (logS) : degré de solubilité dans l'eau.
- pKa : acidité/alcalinité ; Le pH auquel un groupe s'ionise.
- TPSA : Surface polaire topologique ; Il est utilisé dans l’estimation de la perméabilité.
- « Règle de cinq » de Lipinski : seuils pratiques pour le poids moléculaire, le logP, le nombre de donneurs/accepteurs de liaisons H des candidats médicaments oraux.
Certaines de ces valeurs sont calculées de manière déterministe (par exemple TPSA, nombres de liaisons H) avec des outils tels que RDKit ; Certaines d'entre elles sont des estimations statistiques (logS, activité biologique). Connaître cette distinction détermine votre degré de confiance.
Astuce : Distinguez si une caractéristique est « calculée » (basée sur des règles, reproductible) ou « prédite » (à partir d'un modèle, incertaine). Avoir une grande confiance dans les calculs, une confiance prudente dans les prédictions et vérifier les prédictions par l'expérience.
Champ d'application : le concept le plus important
Un modèle QSAR fonctionne bien sur des molécules similaires aux molécules sur lesquelles il a été formé. Si vous donnez une molécule très différente des données d'entraînement (par exemple, un squelette très grand et inhabituel), le modèle produira toujours un nombre, mais ce nombre ne sera pas fiable. C'est ce qu'on appelle « être en dehors du champ d'application ». Le modèle donne toujours une réponse ; C'est votre travail de dire si la réponse est fiable ou non.
C'est encore plus risqué lorsque le modèle de langage donne une valeur d'attribut : il produit le nombre comme une valeur "probable", sans calcul sous-jacent. Donc, si possible, obtenez les valeurs des caractéristiques à partir d'un outil déterministe (RDKit) ou d'un modèle QSAR qui donne de l'incertitude, et non à partir du modèle de langage.
Étape par étape : prédiction des fonctionnalités sécurisées
- Vérifier la molécule : analyser SMILES avec RDKit (unité 2).
- Calculez les nombres déterministes : MA, logP (calculé), TPSA, nombres de liaisons H à partir de RDKit.
- Marquez les prédictions séparément : conservez les prédictions du modèle telles que les logS, l'activité, etc. avec la balise "prediction".
- Vérifiez le domaine d'applicabilité : la molécule ressemble-t-elle aux données d'entraînement ? Est-ce extrêmement grand/inhabituel ?
- Utiliser pour le classement, pas pour la décision : utilisez les prédictions pour classer les candidats ; Le choix ultime est l’expérimentation.
- Expérience proche : Vérifier les propriétés critiques (solubilité, pKa) par mesure.
Quatre modèles copiables
1) Fonctionnalités déterministes avec RDKit :
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculé):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Donneur de liaison H :", rdMolDescriptors.CalcNumHBD(mol))print("Accepteur de liaison H :", rdMolDescriptors.CalcNumHBA(mol))
2) Évaluation de la règle Lipinski :
Molécule (SMILES) : [SMILES]Tâche : Évaluer le respect de la règle de cinq de Lipinski avec les valeurs MA, logP, HBD, HBA à calculer à partir de RDKit. Marquez chaque critère séparément comme réussite/échec. Règle : N'inventez PAS de chiffres ; Je vais l'obtenir de RDKit, commentez-vous.
3) Estimation des fonctionnalités + demande d'incertitude :
Molécule (SMILES) : [SMILES]Tâche : Donner une estimation qualitative de la solubilité dans l'eau (logS) (élevée/moyenne/faible) et expliquer la justification des caractéristiques structurelles. Ne donnez pas de chiffre exact ; Déclarez qu’il s’agit d’une PRÉDICTION et qu’elle doit être confirmée par l’expérience. Avertir si la molécule a une structure inhabituelle (risque d'applicabilité).
4) Classement des candidats (priorisation par prédiction) :
Vous trouverez ci-dessous des SMILES de 5 molécules. Tâche : Classez-les en termes de solubilité dans l'eau (de la plus soluble à la moins) en fonction de leurs caractéristiques structurelles (nombre de groupes polaires, d'anneaux, lipophilie). Rédigez la justification de chaque décision de classement. Remarque : Il s'agit d'un tri PRÉLIMINAIRE ; La sélection finale se fera par mesure.
Invite faible/Invite forte
Faible :
Quelle est la solubilité de cette molécule ?
L'IA constitue un nombre qui n'existe pas dans le calcul (par exemple « 12 mg/mL ») ; Cela donne confiance mais peut être faux.
Fort :
Molécule (SMILES) : [SMILES].Tâche : 1) Je donnerai les logP, TPSA, HBD/HBA à calculer avec RDKit : [valeurs].2) Sur la base de ces valeurs, interpréter si la résolution est élevée/moyenne/faible.3) Donner le nombre exact ; Indiquez qu’il s’agit d’une supposition et que des expériences sont nécessaires.
La différence : nous avons pris les valeurs déterministes du véhicule et avons simplement fait en sorte que l'IA les interprète ; Nous avons explicitement demandé l’incertitude et la nécessité d’expérimenter.
Types de fonctionnalités et niveau de confiance
fonctionnalité
Comment obtenir
confiance
remarque
poids moléculaire
RDKit (déterministe)
très élevé
Coupé de la formule
TPSA, HBD/HBA
RDKit (déterministe)
haut
basé sur des règles
logP (calculé)
Modèle RDKit
moyen-élevé
Peut s'écarter de l'expérimental
logS (résolution)
Estimation QSAR
moyen
Dépend du domaine d'application
pKa
modèle spécial
moyen
Il s'inscrit dans une structure complexe
activité biologique
QSAR/ML
Variable
Assurez-vous de tester et de vérifier
mini-cas
Cas 1 — Nombre de résolutions installées. Un étudiant a interrogé l’IA sur la solubilité d’un composé ; Il a reçu la réponse « 25 mg/mL » et a mis en place le plan expérimental en conséquence. La valeur réelle de la mesure était d’environ 2 mg/mL, soit une différence de 10 fois. L’IA avait inventé le chiffre. Leçon : ne prenez pas les propriétés telles que la résolution comme des nombres du modèle de langage ; prédiction qualitative + mesure.
Cas 2 — Hors du champ d’application. Un modèle QSAR indiquait que « l’activité est élevée » pour une grosse macromolécule très différente de l’ensemble d’entraînement. L'utilisateur a remarqué que la molécule ne ressemblait pas aux données d'entraînement et a jugé la prédiction peu fiable ; L'expérience a donné une activité très faible. Leçon : le modèle répond toujours ; Si elle est hors de portée, la réponse ne vaut rien.
Cas 3 — Utilisation correcte de Lipinski. Sur une molécule candidate, AI a évalué Lipinski avec les valeurs de RDKit : MA 512 (>500, limite), logP 4,8 (favorable), HBD 2, HBA 7. L'utilisateur a correctement interprété "un critère demeure mais la règle n'est pas absolue" et n'a pas complètement éliminé la molécule. Leçon : les règles sont des lignes directrices et non des seuils ; Interpréter avec le contexte.
Erreurs courantes
- Obtenir le nombre de fonctionnalités à partir du modèle de langage. Les valeurs qui ne sont pas calculées sont fabriquées ; Utilisez un outil ou un modèle déterministe avec incertitude.
- Ignorer le champ d’applicabilité. Le modèle génère des nombres pour chaque molécule ; peu fiable en dehors du terrain.
- Considérant une mesure estimée. logS est une estimation ; Cela ne remplace pas la résolution expérimentale.
- Considérant Lipinski comme la règle absolue. Le candidat qui se trouve à la frontière n'est pas automatiquement éliminé ; De nombreuses drogues enfreignent la règle.
- Confondre « calculé » avec « estimé ». Le TPSA est calculé (fiable), l'activité est estimée (incertaine).
Attention : les prédictions de fonctionnalités sont idéales pour classer et hiérarchiser les candidats ; mais pas pour prendre une décision seul. « Le modèle dit soluble » est une hypothèse ; "J'ai mesuré, ça se dissout" est un résultat.
En résumé
- Les propriétés moléculaires peuvent être prédites avant l’expérience, ce qui permet de gagner beaucoup de temps.
- Certaines caractéristiques sont calculées de manière déterministe (MA, TPSA, HBD/HBA), d'autres sont des estimations statistiques (logS, activité).
- Le domaine d'applicabilité est le concept le plus critique : le modèle répond toujours, mais n'est pas fiable en dehors du domaine.
- Obtenez le nombre de fonctionnalités de RDKit ou du modèle d'ambiguïté, pas du modèle de langage.
- Utiliser des prédictions pour classer les candidats ; Prenez la décision finale en expérimentant.
Tâche de candidature
Sélectionnez cinq molécules (par exemple une série de médicaments). Calculez MA, logP, TPSA, HBD, HBA pour chacun avec RDKit et évaluez Lipinski. Par ailleurs, demandez à l'IA une estimation qualitative (et non un chiffre) de la solubilité de chaque molécule et un avertissement de champ d'applicabilité. Collectez les valeurs déterministes et les prédictions de l'IA dans un tableau. Quelle molécule a donné le profil le plus médicamenteux ? Où l’incertitude est-elle la plus élevée ?
liste de contrôle
- [ ] Je fais la distinction entre les propriétés déterministes calculées et prédites.
- [ ] J'obtiens les valeurs de propriété du RDKit/model, pas du modèle de langage.
- [ ] Je remarque des molécules hors du champ d'applicabilité.
- [ ] J'utilise Lipinski comme guide, pas comme règle absolue.
- [ ] J'utilise des prédictions pour le classement et la décision à des fins d'expérimentation.
- [ ] J'ai un plan pour vérifier les caractéristiques critiques par mesure.