收益:
- 能够根据风险级别区分人工智能在数学任务中哪些地方可以节省时间(策略、草稿、编辑)以及哪些地方需要验证(精确计算、证明的有效性)
- 能够认识到数学中的幻觉是如何产生的(虚构定理、失误、不存在的公式)并理解为什么语言模型不是计算器
- 能够实施一个工作流程,通过分步解决方案、确定性工具验证和反检查规则来检查每个输出。
数学是一个只要一个错误的符号就会反驳整个结果的领域。忘记积分中的减号、跳过证明中“明显”的步骤或在公式中使用不正确的指数——所有这些都会使结果完全无效。这就是为什么在数学中使用人工智能 (AI) 需要比在许多其他领域更严格的纪律。在本单元中,我们将研究我们称为大型语言模型(LLM - 大型语言模型;一种通过统计预测生成文本的人工智能)的工具在哪些方面实际上可以节省数学任务的时间,以及它们在哪些方面可能存在危险;您将学习如何逐步验证每个输出。
首先,有一个明确的概念:幻觉是指人工智能充满信心地产生实际上并不真实的信息,就好像它是真实的一样。在数学中,这种情况表现为虚构的定理名称、错误的代数步骤或不存在的公式。关键点是:LLM 不是计算器。它是一个文本生成器,可以预测“下一个最可能的单词”。大多数时候它都会产生正确的数学,因为它在训练数据中看到了很多正确的数学;但“大多数时候为真”和“始终为真”之间的区别在数学中是至关重要的。
人工智能在数学中哪些地方起作用,哪些地方不起作用?
将人工智能视为智能蓝图和创意伙伴:速度快但必须经过验证。以下区别是该模块的支柱。
任务
人工智能的贡献
人类责任
寻找解决问题的方法
推荐不同的解决策略
选择并实施正确的策略
代数/符号微积分
生成草图,快速求解方程
使用 SymPy 或手动验证每个步骤
校样草稿
提供框架和想法
检查每个逻辑转换
数值计算
编写Python代码
运行代码并确认结果
可视化
生成图形代码
看到图表反映了数学
课程/问题生成
生成草图、样本、干扰物
确认准确性和教学适当性
经验法则:使用 AI 查找和编辑帐户路径,而不是帐户本身;始终使用确定性工具(SymPy、计算器、手动检查)验证结果。这里的“确定性”意味着“总是对相同的输入给出相同且精确正确的输出”;像SymPy这样的符号计算库是这样的,LLM不是。
循序渐进:数学领域的安全 AI 工作流程
1. 明确问题的定义。模棱两可的问题带来模棱两可的答案。不要说“评估这个积分”,而是说“通过部分积分逐步求解不定积分 ∫ x·e^x dx 并显示每个步骤。”
2. 寻求分步解决方案。向 AI 询问中间步骤,而不仅仅是结果。这些步骤是捕获错误的唯一方法。
3.用独立工具验证。验证 SymPy 的符号结果和计算的数值结果。这是该模块的核心原则。
4. 反查。通过积分取回导数的结果;代入方程的根;检查概率是否在 0 到 1 之间。数学充满了自我控制的工具。
5. 保持怀疑态度。当人工智能说“这个定理说”时,从可靠的来源确认定理的名称和陈述。虚构的定理名称很常见。
提示:询问每个 AI 输出“我如何独立检查这个?”带着问题接近。在数学中,几乎每个结果都有一种验证方法:导数积分逆演、根式代入、量纲分析、极限情况。如果找不到验证方式,请不要相信结果。
三个迷你箱子
案例 1——虚构定理。一位老师问人工智能“我用什么定理证明这个不等式?”他问道。 AI提出了一个不存在的定理,叫做“霍尔姆格伦-伯努利不等式”,并做出了令人信服的陈述。当老师在数学资源中搜索这个名字时,没有结果。真正的解决方案是经典的柯西-施瓦茨不等式。损失时间:20分钟;但如果没有事实核查的习惯,讲座中就会传达错误的信息。
情况 2 — 信号错误。一名工科学生向 AI 询问结果 ∫ (2x − 3) dx。 YZ 给出了 x² − 3x + C(正确),但下一步在计算定积分 [0,2] 时,他用 +6 代替了 −3·2,得到了 −2,而不是 10。学生通过求导检查了结果;他在2分钟内就发现了错误。
案例 3 — 获得确认。一位高中老师要求人工智能为 15 个问题的考试生成二次方程问题。尽管 15 个问题中有 2 个问题的判别式是否定的,但 AI 给出了“真根”。老师用SymPy解决并比较所有问题;他在 5 分钟内发现并修复了 2 个错误。如果没有验证,学生就会被评估出错误的答案。
四个可复制模板
1)逐步且可验证的解决方案:
你的角色:数学助理。逐步解决以下问题:[问题]。写下您在每一步中使用的规则/定理。最后,用一句话告诉我如何独立验证结果(例如导数/积分逆、根替换)。如果有一个步骤您不确定,请将其标记为“此步骤必须验证”。
2)定理/概念确认:
告诉我[定理/概念]。写出该定理的完整标准陈述、其通用名称(如果有)及其条件。如果没有该名称的标准定理,请明确地说“这个名称不是标准的”并且不要编造它。说出您不确定的领域。
3)检查我自己的解决方案:
以下是我的解决方案。检查每一步,如果有错误,请说明是在哪一步以及原因;如果正确,则说“这一步是正确的”。不要编写新的解决方案;只需检查我的步骤。我的解决方案:[此处]
4)策略建议(非账户):
建议 3 种不同的方法/策略来解决以下问题(不计算)。用一句话写出每种方法的优缺点。说明哪一个最适合解决这个问题以及原因。
弱提示/强提示
弱:“求解这个积分:∫ x·sin(x) dx”
结果:一行答案;没有中间步骤,没有验证,无法发现任何错误。
Strong:“通过部分积分逐步求解不定积分 ∫ x·sin(x) dx。显示每一步 u 和 dv 的选择。最后,对结果进行微分,并检查并显示它是否返回到 x·sin(x)。”
结果:可审核的步骤、内置验证(派生回查)以及查看错误的能力。
常见错误
- 盲目相信结果。 LLM 的自信语气并不能保证准确性。即使是看似最自信的句子也可能是错误的。
- 不想中间步骤。当你只想要结果时,就不可能发现错误。
- 不使用确定性手段进行验证。如果没有 SymPy、计算器或手动复核,请勿认为任何结果是理所当然的。
- 不确认定理/公式名称。虚构的定理名称是最阴险的幻觉类型。
- 没有给出上下文。不提及学生的水平和允许的方法(例如“使用导数”)会导致无法使用的解决方案。
注意:在将人工智能输出传递给学生或同事之前,请务必验证它。在数学中,不正确的信息会产生一系列其他错误,直到得到纠正。未经验证的输出永远不能替代有能力的人的批准。
总之
人工智能是数学中强大的大纲、策略和组织工具;但它不是计算器或校对器。产生幻觉的风险是真实存在的,数学上的一个小错误就会推翻整个结论。所以基本原则是明确的:逐步解决,通过确定性手段验证,反检验,确认定理,保持怀疑。我们将在本模块的每个单元中加深这种验证思维。
应用任务
从您的领域中选择一个中等难度的数学问题(积分、方程组或概率问题)。让AI按照上面的模板1一步步求解。然后以独立的方式验证结果(导数积分逆、根式代换或 SymPy)。至少在一个步骤中,“我想知道这里是否有错误?”停下来检查一下。用 5-6 句话写下你的发现:人工智能在哪里发挥作用,哪里需要验证?
清单
- [ ] 我在上下文中清楚地定义了问题。
- [ ] 我向 AI 询问了一步一步的解决方案,而不仅仅是结果。
- [ ] 我使用确定性工具或手动验证了结果。
- [ ] 我至少做了一次反查(回微分、根式替换等)。
- [ ] 我已从可靠来源证实了上述定理/公式。
- [ ] 我没有传递任何未经验证的结果。