单位 11 / 11

人类实验:道德、隐私、责任和端到端工作流程

收益:

  • 将人的原则融入到实验中的端到端工作流程中,并能够在每个阶段分离人工智能/人类的角色
  • 能够使用通用代理示例,而无需向通用人工智能提供机密结构和数据
  • 能够在关键点设置人工审批关口,并以透明和可追溯的方式承担最终责任

在最后一个单元中,我们将整个模块组合成一个框架:人机交互。这一原则表明,无论人工智能的能力如何,人类都必须理解、控制和批准化学决策的每个关键点。在本单元中,我们将首先阐明道德和保密方面,然后建立一个从想法到报告的端到端工作流程,并了解人工智能和人类在每个阶段如何分工。目标是将您所学到的一切转化为适合日常工作的系统。

隐私:什么不应该给人工智能?

化学经常涉及机密信息:未专利分子、公司秘密合成路线、未发表的数据、患者样本。您在公共人工智能服务中输入的文本可能会根据该服务的政策进行存储或处理。所以:

  • 在向公共人工智能发布未发表的原始结构(专利前分子)之前,请检查您的机构政策。
  • 切勿以可识别的形式输入个人/患者数据(临床样本)。
  • 在共享商业秘密合成途径之前审查保密协议。
  • 必要时选择内部/自定义部署人工智能工具。
注意:向通用人工智能询问某个分子可能意味着揭示该分子的结构。对于尚未获得专利的独特结构,这可能会危及您的优先权(专利权)。询问具有通用/替代示例的隐藏结构。

道德:四项原则

  1. 透明度:不要隐藏使用人工智能的地方;遵守出版和机构政策。
  2. 责任:人类对最终决定负责; “人工智能建议”并不能成为安全或完整性违规的借口。
  3. 非恶意:请勿将人工智能用于危险/非法合成、双重用途(潜在武器)应用。
  4. 公平诚实:不扭曲数据、不美化结果、不编造归因。

端到端工作流程:分子→报告

现在让我们将整个模块组合成一个流程。在每个阶段,要注意人工智能所做的事情和人类所做的事情之间的区别。

舞台

人工智能的作用

人类的(关键)作用

1.思想/文献

概念摘要,搜索词

寻找真实来源,确认归属

2、结构说明

产生微笑

使用 RDKit、InChIKey 进行身份验证

3. 综合计划

逆合成,替代品

文献确认、路径选择

4. 安全性

SDS 摘要,初步不匹配

SDS 阅读、批准、PPE 决定

5. 申请

(无)

所有实验室工作

六、分析

频谱评论支持

最终结构分配

7. 数据处理

写代码

运行代码,验证结果

8. 文档

格式化、控制

观察、偏差、签名

9. 报告

案文草稿

数量/引文验证、责任

此表显示了模块的 11 个单元如何排列成单个作业。人工智能加速发展;人们验证并拥有。

一步一步:设置工作流程

  1. 明确角色:对于每项任务,“是由人工智能还是人类来决定?”从一开始就确定。
  2. 设置隐私过滤器:无需向 AI 提供任何内容,您就可以问“这是私有/私有吗?”问。
  3. 放置验证门:每个阶段末尾的验证步骤(单元 10 中的表)。
  4. 保持可追溯性:人工智能的输出是什么,如何验证的,谁批准的。
  5. 设置批准点:在安全和最终结果等关键点上必须进行人工批准。
  6. 反馈:记录发现的每个错误并改进工作流程。

四个可复制模板

1)隐私预过滤器:

在提出问题之前,请考虑以下内容:内容:[我在问什么]任务:此内容是否包含未发布的原创工件、个人数据或商业秘密?如果确实如此,请建议我如何使用隐藏结构的通用/代理示例重写问题。

2) 阶段结束验证门:

我已完成以下阶段:[阶段,例如综合计划]。任务:列出此阶段需要验证的所有元素(数量、引文、结构、安全声明)。对于每一个,写下验证方法以及由谁来确认。在继续下一步之前,标记需要关闭的所有未清项目。

3)人-AI角色分配方案:

我的项目:[简短描述]。任务:将该项目分为几个阶段。对于每个阶段,区分: - 人工智能可以做什么(草稿、代码、摘要) - 人类必须决定什么(安全、后果、批准)。标记最终责任在于人类的关键点。

4)报告完整性检查:

以下是我的报告草稿:[草稿]任务:检查并标记以下内容:1)是否有任何未经验证的数字/引用?2)是否明确说明了人工智能的使用?3)数据是否显得“美化”(异常值隐藏)?4)是否存在任何安全/道德缺陷? [检查]您不确定的地方。

弱提示/强提示

弱:

合成我们公司新秘密分子的最佳方法是什么?[实际原始结构]

这将原始的专利前结构暴露给一般服务;它使优先级和保密性面临风险。

强:

我想了解一类芳香酮的类似结构的一般逆合成策略。通过一个通用示例(苯乙酮衍生物)进行解释,但不给出具体的原始结构。我将把这个策略应用到我自己的内部分子中。

区别:在不揭示潜在结构的情况下,实现了与通用代理示例相同的学习。

迷你箱

案例 1——原始结构被披露。一个团队在申请专利之前向通用人工智能询问了一种独特的分子。法律部门表示,这可能会引起优先权问题;进程被推迟了。教训:要求具有通用代理的独特结构,尊重隐私政策。

案例 2——人类的同意阻止了事故的发生。在自动化工作流程中,人工智能生成程序草案并直接实施;但一位经验丰富的化学家在流通的“安全许可”门处发现了一对不相容的试剂。教训:在关键时刻,人类批准门可以拯救生命。

案例 3 — 端到端纪律。一位硕士生在一个项目中实现了整个模块:利用AI进行文献总结+实际引文验证、利用RDKit进行结构验证、利用代码进行数据分析、利用SDS进行安全性、诚实的文档、透明的报告。结果更快、更稳健;在论文答辩中“你如何验证人工智能?”他清楚地回答了这个问题。教训:人工智能+验证规则协同工作效果最佳。

常见错误

  • 为通用人工智能提供潜在结构。它损害了专利优先权和商业秘密。
  • 输入可识别的个人/患者数据。隐私泄露和法律风险。
  • 绕过审批之门。安全并最终在没有人类批准的情况下继续前进。
  • 将责任转移给人工智能。 “人工智能建议”并不能原谅任何错误。
  • 避免透明度。隐瞒人工智能的使用有损诚信。
  • 忽略双重用途的风险。将人工智能用于有害应用是不道德的。
提示:根据“人类停止并批准的每一个关键决策”来设计您的工作流程。让AI成为加速链条的一环,而承载链条的节点永远是人类。

综上所述

  • 实验中的人性原则:在每一个关键的化学决策中,人类都理解、监督和批准。
  • 隐私:不向公共人工智能提供独特的文物、个人数据和商业秘密;使用通用代理。
  • 道德:透明、责任、非恶意、诚实是四项基本原则。
  • 在端到端的工作流程中,人工智能在每个阶段都在加速;人们验证并拥有。
  • 将人工审批关卡置于关键点(安全、最终结果)并保持可追溯性。

应用任务

选择您自己的项目(真实的或假设的)并从头到尾设计人工智能-人类工作流程。将上面的 9 阶段表应用到您自己的项目中:人工智能在每个阶段会做什么,人类会批准什么?应用隐私预过滤器:您不会向人工智能提供哪些信息,您如何将其通用化?定义至少两个人工审批门和一种可追溯方法。编写一页“工作流程和验证计划”。

清单

  • [ ] 在实验中,我掌握了人类的原理以及为什么它是必要的。
  • [ ] 我将隐藏的结构/数据通用化,而不将其提供给通用人工智能。
  • [ ] 我遵守透明、负责、非恶意和诚实的原则。
  • [ ] 我在端到端工作流程中分离了人工智能/人类角色。
  • [ ] 我将人类批准门置于关键点。
  • [ ] 我跟踪人工智能的输出以及它是如何验证的。

模块考试

1、以下哪项对人工智能在化学领域的定位最准确?

  • A) 人工智能是代码、草稿和编辑的助手;结构、数量、资源、安全和道德决策的责任在于人类 ✔
  • B) 人工智能是一个化学引擎,它给出的分子量总是准确的。
  • C) 人工智能只起文献综述的作用,与分析和安全无关
  • D)由于人工智能比人类更加公正,因此安全决策应该留给它

描述:人工智能;它是编写代码、生成草稿、构建逆合成框架、帮助和组织频谱解释的助手。然而,分子量和化学计量的确定性计算、使用 RDKit 验证结构、确认数据库中的引用、使用 SDS/GHS 进行安全性决定以及最终责任属于有能力的化学家。大语言模型不是计算器或化学引擎;它是一个文本生成器,可生成“下一个最可能的单词”,其未经验证的输出可能会导致不正确的结构、数字或危险。

2.向人工智能描述分子最可靠的方式是什么?

  • A) 只写常见的土耳其名字
  • B) 给出 SMILES 等结构表示并使用 InChIKey 确认身份 ✔
  • C) 只告诉分子量
  • D) 写商标就够了

解释:名称(尤其是商品名称和同义词名称)不明确,可能会导致错误的分子。为分子提供结构符号(例如 SMILES)可以提高精度;他的身份已在 InChIKey 数据库中得到确认。另外,人工智能给出的SMILES必须用RDKit进行解析,并进行规范化验证。

3. 人工智能给出的分子量应该如何使用?

  • A)直接使用它,因为AI在数字上是可靠的
  • B) 手动或使用 RDKit 独立于公式计算和验证 ✔
  • C)询问另一个人工智能并进行比较就足够了
  • D) 分子量不重要,无需验证

说明: 分子量是根据分子式确定计算的量。所以问语言模型是最弱的方法;它应该使用 RDKit 等工具进行独立验证,或者通过公式手动计算。语言模型可以用“可能的外观”值来拟合这些数字。

4、使用人工智能返回的文献引文(文章/DOI)之前应该做什么?

  • A)什么都没有;如果人工智能给出参考,那就是真实的
  • B) 只要看标题就足够了。
  • C) 通过在数据库中解码来确认每个引文和 DOI(doi.org、Crossref)✔
  • D) 长DOI号证明是真实的。

描述:语言模型可以生成看起来真实但不存在的文章、作者和 DOI(假引用)。仅仅因为它提供了 DOI 并不意味着它是有效的。每个引用都必须通过数据库(例如 doi.org、Crossref 或出版商网站)中的解析进行验证;最安全的流程是人类找到真实的文章并由人工智能总结文本。

5. 人工智能在哪些方面最薄弱,需要在反应计划中确认?

  • A)在识别反应属于哪一类时
  • B) 准确的条件数、产量值和试剂/催化剂名称 ✔
  • C)用通俗易懂的语言解释机制
  • D) 集思广益寻找替代路线

解释:人工智能通常可以很好地预测反应类型以及有据可查的反应的主要产物。然而,精确的条件数(温度、时间、当量)、屈服值、罕见反应和试剂/催化剂名称是最弱且最容易伪造的;这些应该通过文献和目录来确认。

6. 在频谱解释中使用人工智能最可靠的方法是什么?

  • A) 只需给出几个峰值并询问“这是什么光谱?”询问
  • B) 提供预期的结构和完整的原始数据并进行一致性检查(假设检验)✔
  • C) 只写入移位值而不执行积分和除法
  • D) 使用单一技术完成明确的结构分配(仅限 IR)

描述:询问人工智能“这个光谱是哪种化合物?”从头开始询问会增加错误率。最可靠的方法是给出预期的结构(SMILES)和原始数据(积分、分割、求解器、峰值列表),并询问“这个数据与这个结构一致吗?”是问;也就是说,使用人工智能作为假设检验器。最后的任务是化学家检查实验光谱。

7. 获得化学计算结果(例如产率百分比)的最可靠方法是什么?

  • A)直接口头向人工智能请求结果
  • B) 打印并运行帐户的 Python 代码并使用已知示例进行测试 ✔
  • C)多次询问同一问题并找出最常出现的数字
  • D)无需指定单位即可快速估算

说明:语言模型通过“预测可能的结果”来进行算术运算,即使是非常简单的乘法也可能是错误的。最可靠的方法是让人工智能编写其代码(例如Python),而不是帐户本身,然后运行该代码;该代码是确定性的且可审计的。还应该使用答案已知的小样本来测试代码。

8. 分子性质预测中“适用域”的概念是什么意思?

  • A) 模型运行计算机的处理能力
  • B) 与训练数据相似的分子区域,模型给出可靠的预测✔
  • C) 模型给出的数字始终准确的保证区域
  • D) 实验室合成分子的温度范围

说明:QSAR/预测模型对于与其训练的分子相似的分子效果良好。给定一个与训练数据非常不同的分子,模型仍然会产生一个数字,但这并不可靠;这称为“超出适用范围”。模型总是给出答案;由人类来评估答案是否可靠。

9. 处理实验文档中的观察结果的正确方法是什么?

  • A)将观察结果写入人工智能以节省时间
  • B) 做实验的人写下观察结果; AI 仅格式化和检查 ✔
  • C) 不记录观察结果就足够了,只写最终产量
  • D)隐藏与计划的偏差以使报告看起来不错

说明:人工智能不知道它是什么;将观察结果(颜色变化、气体释放等)纳入其中,会产生看似合理但实际上并未发生的记录,这是科学欺诈。人工智能格式化录音、召回丢失的字段并检查重复性;但人类实验者必须提供观察结果和事实。与计划的偏差也必须记录下来。

10. 人工智能在实验室安全中的作用和真相来源是什么?

  • A)如果人工智能说“安全”,则不需要其他来源
  • B) 事实来源是 SDS 和 GHS; AI 有帮助,但不能说了算 ✔
  • C)安全决策可以完全委托给人工智能
  • D) 不需要SDS;互联网论坛提供了足够的信息。

描述:安全是化学领域的重中之重,人工智能永远不可能拥有最终决定权。实际安全信息的来源是制造商提供的SDS(安全数据表)和GHS分类。 AI可以汇总SDS文本、生成表格草稿并进行初步不合规筛查;但是,所有声明都必须通过 SDS 进行验证,并且该程序必须得到经验丰富的人员/安全官员的批准。

11. 以下哪种试剂组合是已知的危险(不相容)匹配?

  • A) 混合水和食盐
  • B) 将酸性溶液与含有次氯酸盐的溶液混合(存在氯气风险)✔
  • C) 混合乙醇和水
  • D. 糖和水溶解

说明:虽然某些化学品单独使用相对安全,但它们一起使用却很危险。酸与次氯酸盐混合释放出氯气;氧化剂+有机物会引起火灾/爆炸,水+活性金属热/氢。尽管人工智能知道大多数这些组合,但它并不能保证所有这些组合,并且有时会用无辜的语言提出危险的建议;应筛查每个程序是否不符合 SDS。

12.“幻觉”(人工智能产生捏造信息)最准确的表达是什么?

  • A) 这是一种罕见的软件错误,通过更新可以完全消除。
  • B) 这是语言模型固有的行为;解决方案是独立验证每个输出 ✔
  • C) 它只出现在错误书写的提示中,而不会出现在正确的提示中。
  • D)如果人工智能用安全语言说话,那它就不是幻觉

解释:幻觉不是故障,而是产生“下一个最可能的单词”的语言模型性质的结果;该模型的目标是可能性,而不是真实的。最阴险的部分是,它以与真相相同的自信语言呈现虚假信息。解决方案不是尝试修复模型,而是围绕每个输出构建适合类型的验证 shell;流畅性永远不能证明准确性。

13. 验证临界值(例如分子量)的“三角测量”意味着什么?

  • A)向同一个人工智能询问同一问题三次
  • B) 以多种独立方式进行比较并得出相同结论 ✔
  • C) 同时计算三种不同分子的重量
  • D) 结果四舍五入至小数点后三位

说明:三角测量是通过多条独立的路径得出相同的结论;例如根据人工智能、RDKit计算和手动计算来比较分子量。如果两条独立的路径重叠,则信任度高;如果有人偏离,就会被制止并接受调查。不应依赖单一来源,而应至少寻求两种独立的方法。

14. 向通用人工智能服务询问尚未获得专利的独特分子的正确方法是什么?

  • A)直接给出原始结构,因为速度很重要
  • B) 通过通用/替代示例学习策略,而不揭示原始结构 ✔
  • C)给出结构不是问题,人工智能从不隐藏信息
  • D) 不给出分子名称,而仅分享其整个 SMILES 就足以提供保护。

说明:进入一般人工智能服务的内容可能会根据服务政策进行存储或处理;提供原始结构会带来保密性和专利优先权的风险。正确的方法是从通用/替代示例(类似的结构类别)中学习策略,并将其应用于内部分子,而不揭示原始结构。个人/患者数据也不应以可识别的形式输入。