收益:
- 能够区分确定性计算的特征和统计估计的特征并确定置信水平
- 能够使用适用域的概念来评估模型可靠的区域
- 能够理解应该使用特质预测来对候选人进行排名并通过实验做出最终决定。
在合成分子之前,我们经常会问:“它是否水溶性?它的酸性如何?它是否能穿过细胞膜?它是否可以作为候选药物?”在实验前预测这些问题的答案可以节省大量时间。人工智能及其专门模型(尤其是 QSAR——定量结构-活性关系,即根据分子结构描述符预测属性的统计模型)在这些预测中非常强大。但这些预测只是概率预测,而不是测量结果。在本单元中,我们将了解特征预测、其优点以及最关键的概念:适用区域(模型可靠的区域)。
预测了哪些特征?
- logP:分子的油/水分配系数;它显示出亲脂性(喜欢脂肪)。对药物吸收至关重要。
- 溶解度(logS):它在水中的溶解度。
- pKa:酸度/碱度;基团电离的 pH 值。
- TPSA:拓扑极性表面积;它用于渗透率估计。
- Lipinski“五法则”:口服候选药物的分子量、logP、氢键供体/受体数量的实际阈值。
其中一些值是使用 RDKit 等工具确定性计算的(例如 TPSA、氢键数);其中一些是统计估计(logS,生物活性)。了解这种区别决定了您的信任程度。
提示:区分某个特征是“计算”(基于规则、可重复)还是“预测”(来自模型、不确定)。对计算有高度的信心,对预测有谨慎的信心,并通过实验验证预测。
适用范围:最重要的概念
QSAR 模型对于与其训练的分子相似的分子效果良好。如果您给出的分子与训练数据非常不同(例如,非常大、不寻常的骨架),模型仍会产生一个数字,但该数字将不可靠。这就是所谓的“超出适用范围”。模型总是给出答案;你的工作就是判断答案是否可靠。
当语言模型给出属性值时,风险甚至更大:它生成的数字是“看起来可能”的值,没有底层计算。因此,如果可能的话,从确定性工具(RDKit)或给出不确定性的 QSAR 模型中获取特征值,而不是从语言模型中获取。
一步一步:安全特征预测
- 验证分子:使用 RDKit 解析 SMILES(单元 2)。
- 计算确定性的:MA、logP(计算)、TPSA、来自 RDKit 的氢键数。
- 单独标记预测:使用“预测”标签保留 logS、活动等模型预测。
- 检查适用范围:分子看起来像训练数据吗?它是否非常大/不寻常?
- 用于排名,而不是决策:使用预测对候选人进行排名;最终的选择就是实验。
- 通过实验关闭:通过测量验证关键特性(溶解度、pKa)。
四个可复制模板
1) RDKit 的确定性特征:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (计算):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("氢键供体:", rdMolDescriptors.CalcNumHBD(mol))print("氢键受体:", rdMolDescriptors.CalcNumHBA(mol))
2)Lipinski规则评估:
分子(SMILES):[SMILES]任务:使用从 RDKit 计算的 MA、logP、HBD、HBA 值来评估是否符合 Lipinski 五法则。将每个标准分别标记为通过/失败。规则:不要凑数字;我将从 RDKit 获取它,你评论一下。
3)特征估计+不确定性请求:
分子 (SMILES):[SMILES]任务:给出水溶性 (logS)(高/中/低)的定性估计,并用结构特征解释其基本原理。不要给出确切的数字;说明这是一个预测,需要通过实验来证实。如果分子具有不寻常的结构,则发出警告(适用风险)。
4)候选排名(通过预测确定优先顺序):
下面是 5 个分子的 SMILES。任务:根据结构特征(极性基团的数量、环、亲脂性)按照水溶性(从最易溶到最难溶)对它们进行排名。为每个排名决策写下理由。注意:这是初步排序;最终选择将通过测量做出。
弱提示/强提示
弱:
该分子的溶解度是多少?
AI 弥补了计算中不存在的数字(例如“12 mg/mL”);它给人信心,但可能是错误的。
强:
分子(SMILES):[SMILES]。任务:1)我将给出用RDKit计算的logP,TPSA,HBD/HBA:[值]。2)根据这些值,解释分辨率是高/中/低。3)给出确切的数字;声明这是一个猜测,需要进行实验。
区别:我们从车辆中获取确定性值,然后让人工智能来解释它们;我们明确要求不确定性和实验的必要性。
特征类型和信任级别
特征
如何获得
信任
注释
分子量
RDKit(确定性)
非常高
从公式中切出
TPSA、HBD/HBA
RDKit(确定性)
高
基于规则
logP(计算)
RDKit模型
中高
可能与实验结果有偏差
logS(分辨率)
QSAR 估计
中等
取决于适用范围
酸度
特殊型号
中等
它处于复杂的结构中
生物活性
定量构效关系/机器学习
变量
请务必进行测试和验证
迷你箱
情况 1 — 已安装的分辨率数量。一名学生向 AI 询问化合物的溶解度;他收到了答案“25 mg/mL”并相应地设置了实验设计。测量的实际值约为 2 mg/mL,相差 10 倍。 AI已经补足了这个数字。教训:不要将分辨率等属性视为语言模型中的数字;定性预测+测量。
情况2——超出适用范围。 QSAR 模型表示,与训练集非常不同的大分子“活性很高”。用户注意到该分子与训练数据不相似,并认为预测不可靠;该实验的活性非常低。教训:模型总是响应;如果超出范围,答案就毫无价值。
案例3——正确使用Lipinski。对于一种候选分子,AI 使用 RDKit 中的值对 Lipinski 进行了评估:MA 512(>500,边界)、logP 4.8(有利)、HBD 2、HBA 7。用户正确解释了“仍然存在一个标准,但规则不是绝对的”,并且没有完全消除该分子。教训:规则是指导方针,而不是门槛;结合上下文进行解释。
常见错误
- 从语言模型获取特征计数。未经计算的数值是捏造的;使用具有不确定性的确定性工具或模型。
- 忽略了适用领域。该模型为每个分子生成数字;场外不可靠。
- 考虑估计的测量。 logS 是估计值;它不能替代实验分辨率。
- 考虑到利平斯基是绝对规则。处于边界的候选人不会被自动淘汰;许多药物都违反了规则。
- 混淆“计算”和“估计”。 TPSA 是计算出来的(可靠),活动是估计的(不确定)。
注意:特征预测非常适合对候选者进行排名和优先排序;但不能单独做出决定。 “模型说可溶”是一个假设; “我测量了,它溶解了”就是一个结果。
综上所述
- 可以在实验前预测分子特性,节省大量时间。
- 有些特征是确定性计算的(MA、TPSA、HBD/HBA),有些是统计估计(logS、活动)。
- 适用性域是最关键的概念:模型总是有答案,但在域外则不可靠。
- 从 RDKit 或歧义模型(而不是语言模型)获取特征计数。
- 使用预测对候选人进行排名;通过实验做出最终决定。
应用任务
选择五个分子(例如药物系列)。使用 RDKit 计算每个的 MA、logP、TPSA、HBD、HBA 并评估 Lipinski。另外,要求人工智能对每个分子的溶解度进行定性估计(而不是数字)以及适用性警告的领域。在表中收集确定性值和 AI 预测。哪种分子具有最类似药物的特征?哪里的不确定性最高?
清单
- [ ] 我区分确定性计算属性和预测属性。
- [ ] 我从 RDKit/模型获取属性值,而不是语言模型。
- [ ] 我注意到分子超出了适用范围。
- [ ] 我使用 Lipinski 作为指导,而不是绝对规则。
- [ ] 我使用预测进行排名并使用决策进行实验。
- [ ] 我计划通过测量来验证关键功能。