单位 1 / 11

化学人工智能简介:角色、边界、验证和伦理

收益:

  • 能够区分人工智能在化学工作流程(想法、设计、分析、报告)中节省时间的地方以及结构、数量、资源和安全决策留给人类的地方,具体取决于风险级别。
  • 能够应用通过结构-数字-资源-安全四个步骤独立检查每个输出的规则
  • 了解为什么虚构的化合物和数字、虚假参考和安全误解对这个行业构成风险,必须从一开始就考虑到这一点。

化学是研究物质结构、转化和性质的一门实验科学。化学家在实验室中称重、溶解、加热和测量;他在办公桌前绘制分子、规划反应、解释光谱、浏览文献并撰写报告。人工智能(简称AI,这里特指通过预测“下一个最可能的单词”生成文本的软件,并在大型语言模型(即大量文本数据)上进行训练)可以极大地加快许多此类桌面工作的速度。但它本身并不建造实验室,也不读取秤,最重要的是:它不会验证它代表您生成的任何数字、公式或引文。本模块教授如何在化学中端到端但负责任地使用人工智能。

在第一个单元中,我想在你的脑海中植入一个想法:人工智能是化学的助手,而不是化学家。编写代码、生成大纲、构建逆合成框架、帮助解释谱峰、总结文献。然而,由有能力的化学家来决定该分子是否能够真正合成、反应是否安全、参考文献是否真实以及最终的责任。

人工智能在化学工作流程中发挥着怎样的作用?

让我们将化学项目大致分为五个阶段:(1)想法和文献,(2)分子和反应设计,(3)实验室应用,(4)分析和表征,(5)报告。 AI在这些阶段承载着截然不同的价值。

  • 想法和文献:人工智能快速总结主题,解释关键概念,生成搜索术语。但他可以编造归因;我们稍后会看到这一点。
  • 设计:生成 SMILES(一种将分子写成文本字符串的形式;稍后会详细介绍),建议逆合成步骤,列出反应性替代方案。建议是好的,但不是保证。
  • 实验室:人工智能在这里什么也不做。称重、加热和安全措施均由人工进行。 AI只是帮忙写程序;在执行该程序之前,必须有人对其进行监督以确保安全。
  • 分析:在解释 NMR、IR、质谱(这些是显示分子结构的测量技术)时,YZ 有助于对峰进行分组并列出可能的结构。最后的任务是你的。
  • 报告:制作实验笔记本、文章草稿、安全表格草稿。它非常强大;但数字应该与你的相符。
提示:使用人工智能最安全的地方是“如果出现问题,就会被注意到并立即修复”区域:草稿文本、代码框架、术语描述。最危险的地方是“如果错误,它就会悄然传播”的区域:常量、引用、安全断言、数值结果。

为什么我们要小心?三大结构性风险

大语言模型不是计算器或化学引擎。生成统计上“看起来可能”的文本。这导致了化学领域的三个具体风险:

  1. 虚构(幻觉):可以自信地写下不是模型的化合物、不存在的反应或不正确的分子量。例如,它显示“化合物 X 的分子量为 154.2 g/mol”,而正确值为 168.2。
  2. 虚假引文:可能提供看起来真实但根本不存在的来源,例如“Smith et al., 2019, Journal of Organic Chemistry”。他甚至可以编造一个 DOI 号码。
  3. 安全谬误:可以将危险的试剂组合(例如比例不适当的氧化剂和有机溶剂)描述为“没有问题”。

这三种风险会​​在本模块的各个单元中反复出现。解决方案不是逃避人工智能,而是建立用独立来源验证每个输出的纪律。

迷你箱

情况 1 — 拟合分子量。一名研究生向人工智能询问对硝基苯酚的分子量。 “139.11克/摩尔,”AI说。该学生信心十足,打算称0.05摩尔为6.96克。然而,对硝基苯酚的分子量是 139.11 g/mol,这次是正确的——但学生从未检查过。对于下一个化合物(对氨基苯酚,实际值109.13 g/mol),YZ表示“123.15”;这次学生通过公式(C6H7NO2)手工计算得到了它:6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13。课程:无需公式即可计算每个分子量。

案例 2 — 假 DOI。一位研究人员在他的文献综述中向 AI 询问了 5 个来源。单击时,五个中的两个的 DOI 返回“未找到”;标题是事实,但文章却不是。浪费时间40分钟。教训:并非所有引文都应在未经数据库(DOI、PubMed、Reaxys)验证的情况下使用。

案例 3 — 看似安全的危险。用户向 AI 询问清洁程序; AI 间接提出了将含次氯酸盐的溶液与酸性溶液混合的建议——这种组合可以释放氯气。幸运的是,用户查看了安全数据表(SDS)并停止了操作。教训:每个程序在实施之前都经过人工检查,以了解 SDS 和危险。

弱提示/强提示

弱提示:

合成该分子。

这种说法是模糊的:什么分子,什么起始材料,什么规模,什么限制?人工智能弥补了这一空白。

强力提示:

角色:您是一位经验丰富的有机合成助理。目标分子:4-甲氧基苯乙酮(SMILES:COc1ccc(cc1)C(C)=O)。我们有苯甲醚作为起始材料。任务:给出一个两步逆合成建议。对于每个步骤:试剂、条件(温度、溶剂)和可能的副反应。约束:在不确定的地方标记“VERIFY”,拟合。输出:编号步骤+要验证的点列表。

区别:角色、确切目标(带有 SMILES)、上下文、步骤数、输出格式和“拟合”约束。这些是化学中良好提示的五个组成部分:角色、精确结构表示、背景、任务、验证约束。

AI工具的类型:语言模型还是化学工具?

在化学中,你会遇到两种不同的“人工智能”,重要的是不要混淆它们:

流派

什么是

可靠性

用法示例

通用语言模型

生成文本/代码、解释、撰写草稿

数字少,语言多

流程概要、术语解释

化学库(RDKit等)

确定性地处理分子,计算分子量

高(基于规则)

SMILES验证,MA账户

自定义预测模型(逆合成、特征)

提供经过数据训练的预测

中等,取决于区域

逆合成、溶解度估计

文献/检索工具

真实的数据库查询

高取决于来源

归因确认、反应搜索

最强大的工作流程将这些结合起来:语言模型生成想法,化学库确定性地计算数字,文献工具验证归因,人工验证。我们将在接下来的单元中建立这个链条。

验证规则:四个步骤

每个人工智能输出在进入实验室或报告之前都经过以下四个步骤:

  1. 结构:分子/反应符号 (SMILES/InChI) 有效吗?可以用工具(RDKit)解析吗?
  2. 数量:分子量、化学计量、产率计算是否经过独立验证(手动或图书馆)?
  3. 资料来源:是否每项主张和归属都在真实数据库中得到验证?
  4. 安全性:是否已阅读程序中每种试剂的 SDS,是否存在任何危险的组合?
注意:这四个步骤适用于“始终”,而不是“有时”。人工智能正确的 20 种情况并不能成为人工智能错误的 1 种情况的借口;因为在化学中,一种情况可能是爆炸、中毒或撤回文章。

常见错误

  • 将AI输出误认为是“资源”。人工智能不是资源,而是试图记住资源的生成器(有时是错误的)。这是源数据库。
  • 相信这个数字。使用分子量、pKa、沸点等数字,但未经验证。这些可以确定性地计算/搜索;询问语言模型是最弱的方法。
  • 将安全外包给人工智能。 “人工智能没有说它危险”并不意味着它是安全的。危害评估是人和 SDS 的工作。
  • 模糊提示。不给出分子的名称,而是给出其结构 (SMILES/InChI);由于名称混淆,这会导致错误的分子。
  • 相信一次尝试。以不同的方式再次询问同一问题并且不检查一致性。

综上所述

  • 人工智能是化学领域强大的办公桌助手:它生成代码、轮廓、描述、扫描骨架;但实验室没有这样做,也没有验证其输出。
  • 存在三个固有风险:假化合物/数字、假归因、安全谬误。
  • 分离和组合通用语言模型和确定性化学工具(RDKit、数据库)。
  • 将每个输出通过结构-数字-来源-安全四个步骤。
  • 好的提示:包括角色、显式结构表示、上下文、任务、验证约束。

应用任务

选择您自己研究过的分子(例如阿司匹林,SMILES:CC(=O)Oc1ccccc1C(=O)O)。向 AI 询问三件事:(1) 分子量,(2) 两篇参考论文,(3) 合成步骤。然后独立验证每个:根据公式手动计算分子量,使用 DOI 确认引用,使用安全眼睛检查合成步骤。哪些输出是正确的,哪些需要更正?保留半页的“验证日志”。

清单

  • [ ]我意识到AI是助手,而不是化学家。
  • [ ] 我通过示例认识到捏造、虚假归因和不信任的风险。
  • [ ] 我可以区分语言模型和确定性化学工具。
  • [ ] 我将对每个输出应用结构-编号-来源-安全这四个步骤。
  • [ ] 我通过结构符号 (SMILES/InChI) 来描述分子,而不是通过名称。
  • [ ] 我至少保留了一份验证日志。