单位 11 / 11

幻觉、道德、保密和科学诚信

收益:

  • 能够识别物理学中的幻觉形式(假常量、假定律、单位错误、错误结果、假归因)并用适当的方法捕捉它们。
  • 能够通过匿名化和最小化来保护未发布的机密和个人数据,不将其输入未经授权的工具
  • 通过诚实地报告数据而不进行修饰,并透明地记录人工智能的使用,能够了解最终责任在于人类。

在本模块中,我们在每个单元中涵盖了相同的学科:人工智能 (AI) 加速、人类验证。在最后一个单元中,我们将整个验证实践集中在科学完整性(物理科学最基本的价值)的保护之下。物理学追求的是产生关于自然的可验证知识;这项努力的核心是诚信、可重复性和责任感。人工智能可以用来强化这些价值观——但如果使用不当,它就会威胁到所有这些价值观。在本单元中,我们将讨论幻觉的物理形式、数据和隐私责任、道德界限,以及为什么最终责任始终由人类承担。

物理学中的幻觉形式

幻觉——人工智能自信地产生虚假信息——在物理学中呈现出独特而危险的形式。认识到这些是捕捉的第一步:

幻觉类型

例子

捕获方法

拟合固定/数据

材料密度不正确

有可靠参考资料确认

错误的公式/定律

一个不存在的“原则”名称

教科书/SymPy推导

单位/订单错误

将 eV 误认为 J

尺寸分析、单位控制

数值结果不正确

代码输出不正确

运行代码

杜撰的归因

不存在的文章

DOI 验证

错误报告结果

真实文章的扭曲

阅读原始资料

共同点是:大型语言模型的设计不是为了说实话,而是为了生成“看起来可能的文本”。在物理学中,“看似可能”与“真实”的区别正是科学存在的理由。

数据、隐私和知识产权责任

物理学家经常处理敏感数据:未发表的实验数据、专利申请前的设计、工业合作的机密测量结果、涉及个人健康或安全数据的研究。将此类数据输入通用人工智能工具可以让第三方访问这些数据,还可能访问模型的训练数据,这意味着违反保密性和失去科学优先权(第一个发现的权利)。规则很明确:不要将未发布的、机密的或个人数据输入到未经您的组织批准的人工智能工具中。如果您要输入,请匿名、最小化(仅提供必要的内容)并读取工具的数据条件。

注意:将实验室未发表的测量结果或公司的机密设计参数输入人工智能工具“进行快速分析”可能是一个不可逆转的错误。数据一旦共享,就无法撤回。如有疑问,请勿输入数据;首先澄清您所在机构的政策和该工具的隐私条款。

道德界限和科学诚信

使用在技术上可能是可行的,甚至是合法的,但仍然是不道德的。物理学中有几条涉及科学诚信的红线:

数据捏造或修饰。要求人工智能“生成更适合收益率的点”或“让图表看起来更有说服力”是数据欺诈。数据按原样报告;只有在有记录的合法理由的情况下才能消除异常值。

贡献的透明度。如果你在研究中使用过人工智能——代码编写、语言纠正、分析——那么在适当的地方明确说明这一点是公平的。许多期刊和机构都要求这样做。

作者身份和责任。 AI 不是作家,而是作家。不能对作品的内容负责。责任始终在于人类作家。人工智能产生的错误不能用“车辆造成的”来辩护。

再现性。科学结果需要清楚地记录方法(包括使用的代码、参数、人工智能提示),以便其他人可以复制。

三个迷你箱子

案例 1——机密数据泄露。一名研究人员将与一家公司签订的保密协议中的测量数据粘贴到通用人工智能工具中,“用于快速绘制图表”。后来他意识到这个工具可以存储输入。发生了违反合同并可能丧失优先权的情况。经验教训:绝不会将机密数据输入未经批准的工具中。

案例2——美化打印。一名学生要求 AI 进行编辑,“让数据看起来更接近理论”,因为实验数据与理论并不完全相符。他的导师注意到了这一点并阻止了他:差异要么意味着实验中的系统错误,要么意味着有趣的新物理学——需要研究的东西,而不是隐藏的东西。诚实地报告数据并发现系统错误。

案例 3 — 获得透明度。一个团队借助人工智能为一篇论文编写了数据分析代码,并在方法部分明确说明了这一点;将代码和提示作为附加文件共享。裁判审查了代码并建议进行一些小修改。透明度在发表前发现了错误,提高了研究的可信度。

四个可复制模板

1)幻觉筛查:

扫描以下物理输出是否存在幻觉:是否存在任何虚假常数、虚假公式/定律名称、单位/顺序错误、未经验证的数值结果和未经确认的归因?标记每个可疑项目并指定如何验证它(参考、代码、DOI)。输出:[此处]

2)数据隐私预检查:

在将以下数据/文本输入人工智能工具之前对其进行评估:它是否包含未发布的、机密的、个人的或受合同保护的信息?如果是这样,请建议我如何匿名或最小化它。如果不确定,请说“检查公司政策”。内容:[这里]

3) 透明度/贡献声明草案:

在一项研究中,我将人工智能用于:[编码/语言纠正/分析等]。写一份简短的“人工智能使用声明”草稿,诚实地记录这一点。它还应该表明哪些部分已经过人类验证。

4)确保科学完整性:

对以下分析/结果执行完整性检查:按原样报告数据(无修饰)、是否报告不确定性、方法是否以可重复的方式记录、人工智能的使用是否透明?列出所有不足之处。内容:[这里]

弱提示/强提示

弱:“编辑产量以更好地符合理论并使图表令人信服。”
结果:数据造假;直接违反科学诚信,造成不可逆转的声誉损失。
Strong:“产量与理论不完全一致。帮助我分析造成这种差异的可能原因(系统误差、统计波动、模型缺失或新效应);建议如何在不更改数据的情况下诚实地报告差异。”
结果:以诚实、调查和忠实的方式实现科学诚信;冲突成为发现的机会。

常见错误

  • 将幻觉与自信混淆。仅仅因为人工智能说话自信并不能保证准确性;即使是最精确的句子也可能是捏造的。
  • 未经批准将机密数据输入车辆。一旦共享,数据将无法检索;优先级和保密性都会丢失。
  • 美化数据。将数据更改为“拟合理论”是最严重的科学犯罪之一。
  • 隐藏人工智能的使用。透明度是诚实的一项要求,并且在许多机构中都是强制性的。
  • 把责任推到车辆身上。 “人工智能做到了”并不是一种辩护;而是一种辩护。最终的责任始终在于人类。
提示:在每次人工智能驱动的研究结束时,问自己三个问题:(1) 此输出中的每个事实、数字和归因是否都经过独立验证? (2) 我使用的数据是否包含我不应输入的机密/个人信息? (3) 我是否足够透明地记录了我的人工智能使用和方法,以便其他人可以复制它?如果您对这三个问题不能明确回答“是”,则研究尚未完成。

总之

科学完整性是物理学存在的基础,在人工智能时代更加重要。幻觉在物理学中以错误常数、错误定律、单位错误、错误结论和错误参考的形式出现;每个都通过其自己独特的验证方法捕获。机密和个人数据不会输入未经授权的工具;数据永远不会被美化;人工智能的使用有透明记录;最终的责任始终在于人。在整个模块中,您只学习一门学科:人工智能是强大的加速器,但验证、完整性和责任落在有能力的物理学家(即您)的肩上。未经验证的人工智能输出永远不能替代物理学家的确认。

应用任务

选择您在此模块中生成的 AI 输出(帐户、分析或文本)。 1. 用模板筛选幻觉:是否有任何虚拟常数、虚假公式、单位错误或未经验证的归因?使用模板 2,评估您使用的数据是否隐私友好。最后,使用模板 3 起草一份简短的人工智能使用/透明度声明。用 5-6 句话写下:扫描揭示了什么,您采取了哪些验证步骤?

清单

  • [ ] 我独立验证了输出中的每个常数、公式和结果。
  • [ ] 我已通过 DOI/来源验证了每条引文。
  • [ ] 我已检查,未在未经批准的情况下将机密/个人数据输入到该工具中。
  • [ ] 我按原样报告数据,没有任何修饰。
  • [ ] 我以透明且可重复的方式记录了我对人工智能的使用。
  • [ ] 我接受最终责任由我承担;我没有将任何故障归咎于车辆。

模块考试

1、以下哪项对人工智能在物理学上的定位最准确?

  • A) 人工智能是代码、草稿和编辑的助手;单位、等级、验证和道德决策的责任在于人类 ✔
  • B)人工智能是一个计算器,它给出的数值结果总是准确的
  • C) 人工智能只起计算作用,与实验分析和教学无关
  • D)由于人工智能比人类更加公正,因此单位和结果的决定应该留给它。

描述:人工智能;它是编写代码、生成草稿、创建和组织推导框架的助手。然而,对结果进行单位和顺序验证、确保其符合守恒定律、常数和参考确认的最终责任属于有能力的物理学家。大语言模型不是计算器或物理引擎;是一个文本生成器,它生成“下一个最可能的单词”,其未经验证的输出可能会导致不正确的值、设计或结果。

2. 打印到大型语言模型中的计算代码的数值结果最准确的近似值是多少?

  • A)相信模型所说的“这个代码给出了那个”的数字,因为他写了代码
  • B) 自己运行代码并查看输出; ✔ 不依赖模型的口头数值预测
  • C)仅通过查看代码的读取方式来接受代码是否正确,而根本不运行它
  • D) 如果再次直接向模型询问结果,并且模型给出相同的数字,则认为结果是正确的。

解释:法学硕士可能会“计算”他在脑海中编写的代码的输出并返回错误的数字;而当运行相同的代码时,它会给出正确的结果。确定性的是执行的代码;它不是模型的口头预测。因此,代码应该始终在您自己的环境中运行,并且应该可以看到输出。

3. 测试无摩擦动态系统的模拟是否准确反映物理现象的最有力方法是什么?

  • A)看到图表在视觉上看起来整洁且令人信服
  • B)仅使用单个时间步长运行模拟并信任结果
  • C) 监控需要保留的量,例如总能量或动量,并检查其是否保持恒定✔
  • D) 通过运行速度来评估模拟

说明:在无摩擦系统中,总能量(和动量,如果有的话)必须守恒。在整个模拟过程中监控这个幅度并查看它是否保持恒定会揭示数值缺陷(例如,原始欧拉方法不断增加能量)。如果能量漂移,则模拟不可靠;仅仅因为它产生了漂亮的图形并不意味着它是正确的。

4. 将模型与实验数据拟合时,以下哪项是正确的方法?

  • A)选择最适合数据的更高阶多项式,因为它经过所有点
  • B)将参数作为单个数字给出,没有歧义
  • C) 仅通过观察曲线的美丽程度来判断拟合质量。
  • D) 从物理学中选择模型,报告参数及其不确定性并评估残差的拟合度 ✔

说明:应该根据事件必须遵守的物理定律来选择模型,而不是通过查看数据并想知道“哪个最适合”。有了足够的自由参数(例如高次多项式),就可以对任何数据进行“完美”但物理上无意义的拟合(过拟合)。应报告参数的不确定性,应使用残差评估拟合质量,并检查物理合理性。

5. 多次重复测量可以减少哪种类型的不确定性?

  • A) 随机不确定性;系统不确定性不会随着重复而减少,必须找到原因并纠正✔
  • B) 系统不确定性;因为它消除了重新校准误差
  • C)完全消除这两种歧义
  • D) 不减少其中任何一个;不确定度与测量次数无关

解释:重复测量减少了结果随机分布产生的随机不确定性(平均值 std/√N 的标准误差)。另一方面,系统不确定性是一种始终向同一方向偏离的误差(例如,错误校准的天平),并且不会随着重复而减少;然而,原因是可以找到并纠正的。通过多次测量报告“非常小的”不确定性可能会隐藏潜在的系统误差。

6. 验证人工智能导出的误差传播公式最可靠的独立方法是什么?

  • A)依靠公式来显得流畅和令人信服
  • B) 使用蒙特卡罗计算进行交叉检查,该计算对具有不确定性的输入进行随机采样 ✔
  • C)再次向人工智能询问相同的公式并期望它给出相同的结果
  • D)直接收集不确定性并与结果进行比较

说明:AI经常在误差传播公式中混合偏导系数和平方根结构。独立实现这一目标的一种有效方法是蒙特卡罗交叉检查:随机采样每个输入及其不确定性,计算函数数千次,并将输出的标准差与公式给出的不确定性进行比较。两种独立方法的结合增加了信心。

7. 在符号物理的长推导中,AI和SymPy之间的正确分工是什么?

  • A) SymPy产生推导的思路,AI精确验证每一步
  • B) 两者都是不必要的;长推导只能手动完成
  • C) AI构建推导框架,SymPy精确验证每一个代数步骤✔
  • D)人工智能自己推导,不需要验证,因为看起来很流畅

解释:人工智能制定推导策略并解释路径,但在长代数中,它会出现符号错误、转义项和不正确的简化。另一方面,SymPy 根据规则工作并精确验证每个代数步骤。最强大的工作流程将两者结合起来:从 AI 获取骨架,使用 SymPy 获取每个步骤,使用导数积分逆和边界情况测试结果。

8. 量纲分析如何说明物理公式的准确性?

  • A) 量纲分析总是能明确证明公式是正确的
  • B) 量纲分析在物理学中没有实用价值
  • C) 量纲分析只给出了公式的常数因子,没有给出其一致性
  • D) 量纲不成立的公式是绝对错误的;尺寸分析无需计算数字即可发现错误 ✔

说明: 物理方程的两侧必须在尺寸上相等才能在数值上相等。一个在量纲上不成立的公式是完全错误的;这是从计数计算中捕获的。量纲分析并不能最终证明一个公式是正确的(可能会漏掉一个无量纲常数因子或角度),但它能最终证明它是不正确的;因此,这是对每个账户进行的第一次也是最便宜的审计。

9. 计算以 36 公里/小时行驶的物体的动能时,最关键的第一步是什么?

  • A) 将所有输入转换为单一单位制 (SI);将 36 km/h 转换为 10 m/s ✔
  • B) 将速度(km/h)直接代入公式,而不将其转换为 m/s
  • C) 仅将数字相乘而不考虑单位
  • D) 假设计算结果后无需检查顺序

说明:基于 SI 的公式 (E = ½mv²) 期望速度以 m/s 为单位。在计算中将公里/小时与米或小时与秒混淆是物理学中最常见的错误之一。首先,所有输入必须转换为单一单位制 (SI):36 km/h = 10 m/s。由于人工智能可能会在复合单位转换中产生无声错误,因此必须手动或使用单位感知工具来验证此转换。

10. 就科学图表中的“诚实”而言,哪种做法是正确的?

  • A)隐藏不确定性,因为误差线使图表变得混乱
  • B) 用单位标记轴,选择不失真的刻度,并用误差条显示不确定性 ✔
  • C) 始终将 y 轴起始于显示最显着差异的范围内
  • D) 轴上不带单位,因为读者可以猜测单位

描述:诚实的科学图表;它用幅度和单位标记轴,有意识地选择比例且不失真(y 轴从零开始进行夸大会产生误导),并通过误差线使测量不确定性可见。隐藏不确定性会使数据看起来确定,并造成偏见或一致的错误印象。图形越有说服力,完整性检查就越重要。

11.从人工智能获取文献和引文支持时最大的风险和正确的纪律是什么?

  • A)人工智能浪费时间,因为它产生引用的速度非常慢
  • B) 人工智能建议的来源总是真实的,无需验证
  • C) 人工智能可以产生看似真实但并不存在的归因;每个引文都必须经过 DOI/来源验证,并且文献必须从实际数据库中找到 ✔
  • D) 编造的引文很容易被识别,因为它们总是使用不真实的期刊名称

说明:大型语言模型未连接到实际数据库;通过模仿引用模式,它可以生成带有真实期刊名称、可信作者和合理年份的文章,但这些文章完全不存在。因此,文献应该从真实的数据库中找到,人工智能应该仅用于总结/翻译手头的实际文本,并且每个引用都应该通过 DOI 或标题进行独立验证。未经证实的引用是对学术诚信的侵犯。

12. 当人工智能对一篇文章进行总结时,怎样才能得到可靠的结果?

  • A)只给出文章的标题就足够了,模型知道内容
  • B)直接使用摘要而不进行任何检查,因为它看起来很流畅
  • C) 向模型询问两次相同的摘要,如果相似则接受为正确。
  • D) 将原始文本提供给模型,并将生成的摘要与原始文本进行比较,以检查是否没有添加/扭曲任何内容 ✔

解释:简单地给 AI 一篇文章的标题并要求摘要将导致模型在没有看过该文章的情况下得出一个“合理的摘要”;这个总结可能与事实相反。只有将原始文本输入模型并将生成的摘要与原始文本进行比较时,才能获得可靠的摘要。此外,还应检查摘要是否未添加文本中未包含的结果或数字。

13.关于人工智能在物理课程教材制作中的产出,哪一项是正确的?

  • A) 每个解决方案都应经过独立验证,应指定类比的限制,干扰因素应针对真正的误解 ✔
  • B) 人工智能产生的答案总是正确的,无需审核
  • C) 类比在所有情况下都是完美的,没有必要指定它们的限制。
  • D) 干扰因素应该完全随机选择,因为错误选择的性质并不重要。

描述:人工智能生成问题、示例和类比的速度很快,但检查在三点上至关重要:每个问题的解决方案必须独立验证(手工或代码),因为模型可能会在解决方案中出现符号/单位错误;每一个比喻都必须说明它不成立的地方,否则就会产生新的错误;干扰者应该针对真正的误解。责任在老师;错误的答案会让学生产生难以纠正的误解。

14.当实验数据与理论不完全一致时,什么行为符合科学诚信?

  • A)让人工智能组织数据以符合理论并令人信服地显示图表
  • B) 调查差异的原因(系统错误、缺乏模型、新效果)并在不更改数据的情况下如实报告 ✔
  • C) 忽略分歧并仅报告适合的观点
  • D) 删除数据并拟合新的实验结果

解释:要求人工智能“排列数据以更好地符合理论”是数据欺诈,也是对科学诚信的严重侵犯。分歧是需要调查的,而不是隐藏的:它可能表明系统错误、统计波动、缺乏模式或有趣的新效应。数据按原样报告,存在不确定性;最终责任在于人,“工具做到了”并不能作为辩护理由。