单位 9 / 11

幻觉、常见数学错误和验证规则

收益:

  • 能够认识人工智能为什么会在数学上犯错误(作为语言模型,而不是检查逻辑)以及七种主要错误类型
  • 能够通过理解数学中的误差是传播的和准确性是二进制的来解释为什么必须验证每个步骤。
  • 能够通过常识测试、数量级检查、校验和、交叉检查和独立方法应用多层验证规则

本单元深化了该模块的核心思想:人工智能为什么以及如何在数学中犯错误,这些错误的类型是什么,以及我们如何系统地捕获它们?在之前的单元中,我们已经看到了每个主题的验证方法;在这里,我们将错误的剖析集中在一个屋檐下。关键是,当你查看人工智能输出时,你会想“这里可能出了什么错误?”就是获得一种反射性思考的验证心态。

提醒:幻觉是指人工智能自信地产生不真实的信息。在数学中,幻觉常常以“有说服力但错误”的形式出现。为什么人工智能会犯错误?因为它是一个语言模型,而不是一个逻辑引擎——也就是说,它生成具有统计模式的文本,所以它不检查步骤的逻辑有效性。对他来说,“三位数乘法”和“有效证明”的任务是产生相同类型的文本;它没有内部机制来保证准确性。

数学错误剖析:七种类型

以下类型列表总结了您在 AI 输出中遇到的最常见错误以及每种错误的解决方法。

错误类型

它看起来像什么

解毒剂

算术错误

数字错误如 7×8=54

计算器/SymPy

符号错误

−(a−b)=−a−b

手动打开我的名字

虚构定理

不存在的定理名称

消息来源确认

规则误用

不要忘记链式法则

“哪一条规则?”问题

跳过状态

忽略负根

列出所有状态

证明差距

“因此”毫无道理

质疑每一次通过

旧的/不正确的数据

过时的信息

采购

为什么数学需要特别关注?

在大多数领域,一个小错误就会产生一个小后果。在数学中,错误会传播并增长。方程第一行的符号错误会导致接下来的十行和最终结果完全错误。证明中间的空白会使整个证明无效。这种“脆弱性”使得有必要验证数学中的每一步——“一般来说似乎是正确的”是不够的。

此外,数学中的真理是二元的:结果要么是真,要么是假,没有中间状态。 “百分之八十准确”在文本摘要中可能被认为是可接受的;积分中不存在“百分之八十正确”的情况——要么是正确的结果,要么不是。这种双重性质使得验证变得更加关键,并且(幸运的是)更加可能:结果要么通过验证,要么不通过验证。

循序渐进:系统验证的纪律

1. 用工具确认每个数值结果。永远不要让算术依赖人工智能; SymPy、计算器或手动。

2. 使用 SymPy 检查每个符号结果。积分、导数、化简、方程——所有这些都可以使用 SymPy 进行验证。

3. 从源头确认每个定理/公式。名称和表达方式是否正确?编造的定理是最阴险的陷阱。

4. 对每一个证明中的每一个出现提出质疑。 “这真的是上一步的结果吗?”基本情况、隐含假设、差距检查。

5、核对与反核。逆运算、替换、极限状态、量纲分析。

6. 用常识来检验。结果合理吗?如果概率大于 1,则长度为负时会出现错误。

提示:最快的常识测试是“数量级”检查。结果大致在预期范围内吗?如果班级平均分是 250(满分 100),或者概率是 3.5,那么您无需查看详细信息就知道存在错误。这个 5 秒的检查将许多荒谬的结果消除在萌芽状态。

三个迷你箱子

情况 1 — 链符号错误。一名学生发现,在 8 行代数简化中,AI 在第 2 行中犯的符号错误传播到了接下来的 6 行。最终的结果是完全错误的,但AI却完全自信地呈现出来。当学生用 SymPy 从头开始​​简化时,得到了正确的结果,并让 AI 发现了第 2 行的错误。一个符号驳斥了6行。

案例 2——常识挽救了测试。老师让人工智能解决概率问题;结果是1.4。不看细节,老师就说“概率不能大于1”,并查找错误:AI把非离散事件当作离散事件来收集。常识测试在几秒钟内就指出了错误。

案例3——配制配方。一位工程师向人工智能询问一系列总和的“封闭公式”。 AI给出了令人信服的公式。工程师通过公式和手工加法两种方式测试了n值较小(n=3)时的公式;结果不匹配。公式已经制定出来了。稍加调整就可以避免数小时的误用。

四个可复制模板

1)多层验证请求:

您发现:[结果]。现在用三种不同的方式验证这一点:(1) 反向散列它,(2) 测试一个简单的自定义值,(3) 使用 SymPy 检查一些代码(我将看到输出)。告诉我这三种方式是否一致;如果没有,请显示哪个步骤有错误。

2)常识/等级测试:

您发现:[结果]。将其进行常识测试,看看这个结果是否合理:预期的数量级是多少,符号是否正确,是否在限制范围内(例如概率 0-1)?如果不合理,请调查哪里可能有错误。

3)定理/公式确认:

您使用的[定理/公式]真的标准且正确吗?写出其标准表达式和条件。显示一个用小样本测试这一点的帐户(例如 n=3)。如果这是一个虚构的公式或者你不确定的东西,请说清楚。

4)错误模式诊断:

我知道下面的解决方案有一个错误。一一检查这些错误类型:算术、符号、错误规则、跳过条件、域。告诉我这是什么类型的错误以及在哪一步发生的错误。解决方案:[此处]

弱提示/强提示

弱者:“这个结论正确吗?” [粘贴结果]
结果:AI经常说“是的,对”(倾向于确认自己的输出);不可靠,因为没有独立审计。
Strong:“以独立的方式检查此结果:使用不同的解决方法或使用 SymPy 代码进行检查(我将运行代码)。不要只说‘真/假’;显示您进行了哪些检查以及结果。如果校验和失败,请找到错误。”
结果:独立的控制方法受到挑战;防止人工智能盲目批准自己的输出。

常见错误

  • 让人工智能验证自己的输出。 “这是真的吗?”人工智能经常确认自己的错误;需要独立的方法。
  • 跳过常识测试。像概率大于 1 和长度为负之类的废话无需查看细节就可以发现。
  • 依赖于单一验证。对关键结果使用多个独立路径(哈希+ SymPy + 自定义值)。
  • 不使用小样本测试配方。虚构的公式在 n=2、n=3 等较小值时立即崩溃。
  • 忘记了错误会传播。第一行中的错误会破坏整个结果;如果发现错误,请从头开始检查。
注意:人工智能的置信度与其准确性之间没有相关性。看似最坚决、最流畅、最“确定”的句子很可能是完全错误的。相信独立的验证,而不是语气。只有当你手动或使用确定性工具确认结果时,才认为结果是“真实的”——而不是因为人工智能说“确定”。

综上所述

人工智能在数学上犯错误是因为它是统计生成文本的语言模型,而不是控制逻辑的引擎。错误分为七种主要类型:算术错误、符号错误、虚构定理错误、规则误用错误、遗漏案例错误、证明差距错误、陈旧数据错误。在数学中,错误会传播并增长,真理是二元的——因此每一步都必须经过验证。系统性的纪律:验证每一个数值工具,用SymPy验证每一个符号结果,从源头验证每一个定理,通过质疑验证每一个证明;应用检查、反检查和常识测试。人工智能的信心并不是准确性的证据。

应用任务

选择一个中等长度(至少 6-8 个步骤)解决方案的问题并让 AI 解决它。然后使用本单元中的模式 1 和 4 进行多层验证:(a) 常识/等级测试,(b) 使用 SymPy 检查,(c) 对特殊值进行测试。然后,以一种刻意的“寻找错误”的眼光逐行检查解决方案,并检查可能会出现七种类型的错误中的哪一种。记录您发现的每个错误及其类型。

清单

  • [ ] 我使用确定性工具确认了每个数值结果。
  • [ ] 我用 SymPy 检查了每个符号结果。
  • [ ] 我从源代码或小例子中验证了所使用的定理/公式。
  • [ ] 我应用了常识/数量级测试。
  • [ ] 我以独立方式对其进行了审核(不依赖 AI 自己的批准)。
  • [ ] 当我发现错误时,我从头开始重新检查解决方案。