收益:
- 能够让人工智能产生多项选择题、基于典型错误的干扰项,以及通过指定主题、级别和难度分布来生成解决方案的关键。
- 能够通过使用 SymPy 独立验证每个问题和答案键(最好是批量验证)来捕获错误键和多个/零正确选项错误
- 能够评估干扰因素的质量、问题的明确性和难度平衡,并在考试前批准每个问题。
准备考试和练习题是数学教育中最耗时的任务之一:设置适当难度的问题、设计合理的干扰项(错误但合理的选项)、准备答案要点以及平衡难度需要几个小时。人工智能可以加速这一过程——从一个主题生成数十种问题变体、多项选择选项和解决方案关键。但所产生的每一个问题的准确性以及每个答案的无误性都必须经过独立验证;错误的钥匙意味着学生不公平地失去分数。在本单元中,您将学习如何使用人工智能作为问题生成伙伴以及如何审核每个问题。
一些定义。干扰项是多项选择题中的一个不正确的选项,但对应于学生可能犯的常见错误。好的干扰因素不是随机的,而是随机的。反映了典型的错误(符号错误、规则混乱)。答案键是问题的正确答案列表。难度平衡是指考试中简单-中等-困难问题的适当分配。
人工智能对问题生成的贡献
- 问题变化:来自一个模式的多个相似问题(更改数字)。
- 干扰器设计:基于常见错误的看似不正确的选择。
- 解决方案要点大纲:每个问题的逐步解决方案。
- 难度等级:将问题分为简单/中等/困难。
- 主题覆盖范围:涵盖教学大纲不同子主题的问题集。
- 布鲁姆分类法适合:根据记忆、应用、分析等认知水平提出问题。
一步一步:生成一组可靠的问题
1. 明确主题、级别和问题数量。比如“高中十年级,二次方程,10道多项选择题”。
2.询问题型和难度分布。要求分配类似于“4 个简单、4 个中等、2 个困难”。
3.独立解答每一题。自己或使用 SymPy 解决每个问题;与YZ提供的答案进行比较。这一步是没有商量余地的。
4. 检查是否存在干扰因素。错误的选择真的是错误的吗?有时人工智能会产生多个正确选项,或者一个干扰项实际上是正确的。检查每个选项。
5.保证只有一个正确答案。多项选择中,必须只有一个选项是正确的;正确的数量不得为零个或超过 1 个。
6. 检查不确定性和重复。问题是否明确?这两个问题衡量的是同一件事吗?这些数字是否合理(例如,根是否应该为负)?
注意:人工智能在生成多项选择题时最常犯两个错误:(1)它标记为“true”的选项实际上是错误的,(2)多个选项都是正确的,或者没有一个选项是正确的。如果没有独立解决每个问题并分别评估四个选项中的每个选项的正确/错误,请勿使用任何问题。
问题质量控制图
控制
问题
要搜索什么
准确度
答案是否正确?
通过独立解决方案确认
唯一真实的
只有1个选项正确吗?
其他3个一定是错的
干扰器质量
这些错误是否合理?
应基于典型错误
清晰度
问题是否明确?
不应该有任何不确定性
级别合规性
难度与目标相符吗?
既不太容易也不太困难
适用范围
主题是否得到充分体现?
副主题平衡
三个迷你箱子
情况 1 — 密钥错误。一位老师提出了一组包含 12 个问题的多项选择题。当他用 SymPy 解决每一个问题时,他发现在 12 个问题中,有 3 个问题中,AI 标记为“正确”的选项是错误的——实际的正确答案是另一个选项。老师把琴键弄直了。如果未经验证就使用这套,整个班级就会在3个问题上得到不公平的评价。
案例 2——两个正确选项。在一道题中,AI同时输入了“x = 2”和“x = 2 or x = −2”;从某种意义上来说,两者都是正确的,但问题并不清楚。老师重新排列了选项,只留下了一个正确答案。干扰因素肯定是明显错误的。
情况 3 — 干扰因素较弱。在一堂工程课上,AI将“42”、“aksaray”、“蓝色”、“17”等不相关的干扰词放入问题中;正确答案显然是“17”。老师根据典型的计算错误(例如,由符号错误产生的值)要求提供数字干扰项,这些问题成为真正的区分项。好的干扰物代表着一条真正的错误道路。
四个可复制模板
1)多项选择题:
生成关于 [主题] 的 [n] 个多项选择题。等级:[等级]。难度:[x 简单,y 中等,z 困难]。让每个问题有4个选项;假设 EXACT 1 是正确的,其他 3 个是基于典型错误的看似合理的干扰因素。还写出每个问题的逐步解决方案和正确答案。我将使用 SymPy 验证所有这些。
2)问题变化(来自模式):
将此问题作为模式:[示例问题]。生成 [n] 个不同版本,衡量相同的概念,但具有不同的数字/上下文。逐步解决每个版本的答案。让答案彼此不同。
3)解决方案密钥生成:
为以下每个问题制定分步解决方案和最终答案。指定您使用的规则。标记您不确定的解决方案;我会独立验证每个答案。问题:[这里]
4)干扰器改进:
查看此多项选择题的干扰因素。解释每个不正确的干扰项对应的典型学生错误。用基于实际错误的干扰项替换不相关或明显不正确的干扰项。问题:[这里]
弱提示/强提示
弱:“给我做 10 道衍生题。”
结果:不确定的级别、随机的难度分布、未经验证的答案键、随机的干扰项(如果有)。
Strong:“为高中12年级制作10道多项选择导数题:4道简单(基本规则)、4道中等(链式/乘积规则)、2道困难(复合函数)。每道题有4个选择,正好1个正确,其他是基于典型错误(忘记内导数、符号错误)的干扰项。逐步解决每个问题并指出正确答案。”
结果:一组水平、平衡、分散注意力的问题是有意义的,并且每个答案都是可审核的。
常见错误
- 不验证答案键。人工智能所说的“正确”往往是错误的;独立解决每个问题。
- 超过一/零是正确的选项。在多项选择中,必须只有一个事实;分别检查每个选项。
- 干扰因素较弱。不相关或明显不正确的选项会使问题变得毫无特色。
- 未指定难度分布。它们看起来都是同样的困难;无法进行等级评价。
- 重复和重叠。不同的问题可能衡量同一个概念;检查承保余额。
- 表情含糊。具有双重含义的问题会不公平地误导学生。
提示:验证一组问题的最有效方法是使用 SymPy 编写同时解决所有问题的代码。告诉 AI“用 SymPy 编写解决这 10 个问题中每一个问题的代码”,运行代码,并将 SymPy 结果与 AI 的答案进行批量比较。这样,您就不会逐一检查这 10 个问题,而是集体且确定性地检查。
总之
人工智能极大地加快了数学问题和考试的生成速度:问题变化、干扰项设计、解决方案关键、难度评级。但每个问题和每个答案都必须独立验证 - 最好使用 SymPy 进行批量验证。最常见的错误是答案错误、多个/零个正确选项以及弱干扰项。从一开始就指定主题、级别和难度分布可以提高质量。任何未经核实的问题不得进入考试。
应用任务
选择一个主题。让 AI 使用第一个模板生成 8-10 个多项选择题 + 具有一定难度分布的解决方案。然后,记住第 4 单元,让 AI 编写一段代码,用 SymPy 解决所有问题并运行该代码。将 SymPy 结果与 YZ 的答案进行比较。验证每一题中是否只有一个正确的选项,并且干扰项实际上是不正确的。找到并纠正至少一个错误或较弱的干扰因素。
清单
- [ ] 我已经明确说明了题目、级别和难度分布。
- [ ] 我独立解决了每个问题(最好使用 SymPy 进行批处理)。
- [ ] 我将答案与 SymPy 结果进行了比较。
- [ ] 经核实,每一题只有一个正确选项。
- [ ] 我检查了干扰项是基于典型错误并且实际上是错误的。
- [ ] 我确保没有含糊的陈述,也没有重复的问题。