收益:
- 能够以战略顾问、解决方案制作者和解决方案审核员等三种不同角色使用人工智能解决问题,并适合每个角色的风险级别。
- 能够通过编号、规则查询、算术检查、校验和列出所有案例来系统地检查解决方案的每个步骤。
- 能够用独立的方法验证结果和解决方案,并理解正确的结果并不意味着正确的路径。
数学问题的解决是一系列相互关联的步骤;如果链条中的任何一环被破坏,则结果无效。人工智能非常擅长快速构建这条链,但监控这条链的强度取决于人类。在本单元中,您将学习如何使用人工智能作为解决问题的伙伴,更重要的是,如何系统地控制产生的每个步骤。目标是利用人工智能的速度,同时不遗漏任何错误。
首先定义一下:逐步验证是逐一检查解决方案的每个中间步骤是否正确。在数学中,“结果正确吗?”这个问题还不够; “中间的每一步都正确吗?”这个问题很重要。因为有时错误的步骤会偶然导致正确的结果(不稳定的解决方案),有时正确策略中的单个算术错误会破坏结果。
人工智能在解决问题中的三种不同角色
您可以通过三种不同的方式使用人工智能来解决问题,每种方式都需要不同的验证:
- 策略顾问:“我该如何解决这个问题?”在这里,AI提出了一种方法。风险很低,因为您自己进行计算。
- 解决方案生成器:“解决这个问题。”风险高,因为策略和计算都来自AI;每一步都必须受到监督。
- 解决方案检查器:“检查我的解决方案。”属于中等风险; AI可以发现bug,但它也可以弥补不存在的bug或错过真正的bug。
最安全的方法通常是结合1和3:从AI获取策略,自己或使用SymPy进行计算,然后让AI检查和交叉检查。
一步一步:如何检查解决方案
1. 对每个步骤进行编号。通过向 AI 询问编号步骤的解决方案,您可以说:“第 3 步出错。”
2. 在每一步“哪个规则?”先生。让人工智能记下每遍中使用的代数规则、定理或恒等式。如果规则名称错误,则该步骤也有问题。
3. 单独检查算术。即使代数逻辑是正确的,数字错误也很常见。检查每个加法、乘法和符号变化。
4. 尝试界限和例外。在 x=0、x=1 等简单值下测试结果。如果公式在这些值下毫无意义,则存在错误。
5. 反向返回。通过积分、代入方程根、乘以因式分解来检查导数的结果。
6. 检查尺寸/单位的一致性。如果在应用问题中单位没有相加(例如添加米和秒),则公式不正确。
提示:“逆向运算验证”是数学中最强大的验证工具,而且几乎是免费的。如果你找到了方程的根,请将其代入;如果你取了积分,就取它的导数;如果您进行了因式分解,则乘回来。这个 30 秒的检查可以防止数小时的错误方向。
供应的力量来自于它独立于人工智能。当你替换根时,你会进行确定性检查,该检查完全独立于人工智能在求解过程中所做的事情:要么满足方程,要么不满足,没有中间状态。这就是为什么验证比人工智能说“当然,对”更有价值;因为AI在验证自己的解决方案时可能会重复同样的错误,但独立验证是在这个循环之外的。当您可以通过两种不同的独立方式(例如替换和 SymPy)提供关键结果时,您的信心会呈指数级增长。
错误的分类
下表总结了人工智能解决方案中最常见的错误类型以及捕获每种错误的方法。
错误类型
例子
捕获路径
符号错误
写作 −(a−b) = −a−b
手动打开并检查我的名字
算术错误
7×8 = 54
用计算器/SymPy确认
错误的规则
忘记链式法则
“哪一条规则?”询问
字段/定义错误
获取日志(负)
检查域名
跳过状态
忽略判别式 < 0
列出所有状态
虚构定理
不存在的定理名称
消息来源确认
三个迷你箱子
情况1——正确的结果,错误的道路。一名学生向AI提出了一道极限问题。 AI 发现结果是 3——这是正确的——但在中间步骤中它使用了 L'Hôpital 规则,但无法应用该规则(没有 0/0 不确定性)。学生问“适用哪一条规则以及为什么?”当询问时,AI接受了错误,并以正确的方式再次达到了3。结果是一样的,但路并不稳固;这次旅行也在考试中得到了分数。
案例 2 — 省略案例。一名工程师,|2x − 4| = 6 绝对值方程由YZ 求解。 YZ 只解出了 2x − 4 = 6 并给出 x = 5;它跳过了 2x − 4 = −6 状态 (x = −1)。工程师问“绝对值有多少种状态?”当我询问时,第二个根出现了。通过替换证实了两个根的正确性。
案例 3 — 交叉检查发现 3 个错误。一位老师让 AI 做了 10 步三角身份证明。然后他将相同的证明与 SymPy 的简化函数进行了一步一步的比较。他发现人工智能在 10 个步骤中有 3 个错误地应用了身份。总检查时间12分钟;所获得的信任是无价的。
四个可复制模板
1) 编号的、基于规则的解决方案:
解决这个问题:[问题]。用 NUMBERED 个步骤写出解决方案。在每个步骤中,在括号中说明您使用的规则/定理的名称。不要通过说“显然”来跳过任何步骤;显示每个转换。
2)不要强制所有状态:
解决这个问题:[问题]。列出求解时所有可能的情况(例如绝对值、二次、域约束)。不要跳过任何案例;如果您跳过它,请说明您跳过它的原因。
3) 请求提供:
您发现:[结果]。现在通过逆运算验证这个结果:[微分/替换/乘回]。显示校验和的结果并判断是否与原问题一致。
4)误差导向控制:
只需在下面的解决方案中查找错误即可。按顺序检查每一步;当您发现第一个错误时,记下哪一步、错误类型(符号/算术/规则)以及正确的错误是什么。创建一个新的解决方案。解决方案:[此处]
弱提示/强提示
弱:“求解 x² − 5x + 6 = 0。”
结果:“x = 2 且 x = 3”——可能是正确的,但您不会注意到是否遗漏了奇怪的情况或因式分解错误。
Strong:“通过因式分解和判别式求解方程 x² − 5x + 6 = 0;证明这两种方法给出相同的根。然后通过将每个根代入方程来提供它。”
结果:两种独立的方法相互验证,确保结果准确。如果出现错误,两种方法会发生冲突,您会立即看到它。
常见错误
- 只看结果。正确的结果并不意味着一条坚实的道路。还要检查道路。
- 跳过配置。 30 秒替换/反导数检查可捕获大多数错误;不要忽视它。
- 不列举情况。绝对值、二次、根和域约束的遗漏是最常见的错误。
- 相信人工智能会说“没有错误”。人工智能扮演审计员的角色可能会漏掉真正的错误;人眼在关键工作中至关重要。
- 对一种方法感到满意。如果可能,使用两种独立的方法进行求解和比较。
注意:当人工智能检查你的解决方案时,它有时可能会编造一个不存在的“错误”并阻止你做出正确的解决方案。因此,当AI显示错误时,你还要检查该错误是否真的是错误。审计师也可能是错的。
综上所述
在解决问题时,人工智能扮演三个角色:策略顾问、解决方案生成器、解决方案审核员。最安全的方法是采用人工智能的策略,用独立的工具进行计算,并系统地审核每个步骤。编号步骤,“哪条规则?”问题、校验和(逆运算)、极限情况和列出所有情况是捕获错误的基本工具。正确的结果并不意味着一条坚实的道路;检查结果和路径。
应用任务
选择二次方程或绝对值方程。使用模板 1 和 2 求解 YZ。然后:(a) 检查是否已覆盖所有情况,(b) 通过替换确保每个根,(c) 如果可能,通过第二种方法再次求解和比较。如果发现错误,请记下错误的类型(符号/算术/规则/跳过条件)。
清单
- [ ] 我按照编号的步骤解决了这个问题。
- [ ] 我确认了每个步骤中使用的规则。
- [ ] 我已确认所有意外情况均已得到解决。
- [ ] 我通过逆运算(检查)检查了结果。
- [ ] 如果可能的话,我将其与第二种方法进行了比较。
- [ ]我也独立验证了AI显示的“错误”。