单位 5 / 11

问题和测验制作:项目写作和干扰质量

收益:

  • 能够在人工智能支持下根据成就生成多项选择、开放式和更高层次的思考问题
  • 能够通过应用良好的干扰项(错误但合理的选项)、单一正确答案和项目难度的原则来控制问题质量。
  • 了解人工智能产生错误答案、不客观或有偏见的问题的风险,并能够看到老师必须验证每个项目。

考试和测验是教师衡量学习情况的主要工具;但写出好问题比你想象的要难。模糊的词根、相似的选项以及提供线索的语言都会降低问题的测量价值。 AI快速生成大量与结果相关的问题大纲;您监控质量、验证答案并保持成绩一致性。在本单元中,我们将介绍如何利用人工智能撰写优秀的文章和制作高质量的测验。限制很明确:人工智能可能会产生错误的答案、不客观或有偏见的问题;老师对每一项进行核对。

物质解剖和好问题的原则

多项选择题有两部分: 题干(问题主干)——提出的主要问题;和选项——一个是正确答案,其他都是干扰因素。一个好的干扰因素,即使是错误的,对于尚未完全掌握该科目的学生来说似乎也是合理的;它通常基于一个常见的误解。诸如“月亮会自己发光”之类的常见误解是一个强大的干扰因素。胡言乱语或无关紧要的干扰因素(“月亮是一块奶酪”)会使问题变得更容易,并使其不那么独特。

好问题的原则:(1)词干问得单一、明确; (2)正确答案只有一个; (3) 选项长度相近,并且与词根语法兼容(较长的选项一般是正确的,不给出线索); (4) 尽可能避免“全部/无”选项; (5) 如果词干是否定的(“is not”),则强调; (6) 问题衡量达到的水平——提出回忆问题来分析达到的水平是没有达到目标的。

项目难度是指问题的难易程度;歧视是问题将那些知道的人和那些不知道的人区分开来。一次好的考试是不同难度的项目的组合。

提示:当向 AI 提问时,请指出目标误解:说“干扰因素应该基于这 3 种常见的误解”。这样你就会得到指导性的干扰因素,而不是随机的干扰因素。

问题类型

多项选择:快速测量,自动评分;但衡量高阶思维需要仔细设计。开放式/简短回答:展示学生自己的陈述;它以评分细则(第六单元)评分。对错:速度快但运气因素高。匹配:有利于概念定义关系。高阶思维问题:基于场景的项目询问“为什么/如何/评估”;它衡量分析评估的收益。人工智能为它们绘制蓝图;您的工作是选择哪种类型衡量哪种结果。

一步一步:用人工智能制作测验

  1. 给出增益和Bloom级别。这个问题应该衡量这个水平。
  2. 指定类型和数量。 “6 项多项选择 + 2 项开放式”。
  3. 说出干扰策略的名称。它应该基于哪些误解?
  4. 询问钥匙和理由。每个问题的正确答案以及为什么其他问题是错误的。
  5. 手动验证密钥。自己解决每一个问题; AI划出的线真的是真的吗?
  6. 对齐和偏差检查。这个问题衡量增益吗?是否存在文化/性别偏见?
  7. 难度平衡。调整简单-中-难的混合。

三个迷你箱子

情况 1 — 密钥错误。一位科学老师接受了 AI 的 10 个问题测验。第3题的关键被标记为“B”,但当老师解答时,他看到正确答案是“C”——AI认为自己的干扰物是正确的。如果老师不纠正他,他就会认为这个知道错误的学生。手动解开密钥拯救了整个测验。

情况 2 — 干扰物校正较弱。在老师的第一次测验中,干扰因素毫无意义,学生必须消除并找到正确答案。他让人工智能重现“基于这些常见误解的干扰因素:X、Y、Z”。新测验中的歧视现象有所增加;班级平均分更能反映实际学习情况。

案例 3 — 获得对齐。历史老师的结果处于分析水平(“关联原因”),但人工智能产生了回忆问题(“告诉日期”)。老师将提示更新为“在习得分析级别;提出建立因果关系的情景问题”。问题已成为衡量成就的标准。

可复制模板

1)基于成绩的多项选择集:

您的角色:[科目]老师。增益:“[增益]”([绽放级别]),[X。班级]。写出 6 个多项选择题来衡量这一结果。让每个问题有4个选项;让干扰因素基于这些常见的误解:[写下误解]。对于每个问题,在单独的关键部分中解释正确答案以及每个选项正确/错误的原因。简单-中等-困难的混合。

2)答案键验证:

一一解答下列选择题。对于每个问题:(a) 您找到的正确答案,(b) 原因,(c) 是否与标记的键匹配。将不一致的地方明确标记为“矛盾”。问题及关键:[粘贴]

3)高级(场景)问题:

“[主题]”,[X.课],在分析评估级别写3个基于场景的问题。让每个问题给出一个简短的情况,并要求学生进行论证/比较。不要让它用心去解决。添加示例答案和评估提示。

4) 偏见和合规审计:

检查以下问题:性别/文化/地区偏见、对特定群体的不公平优势/劣势、不适当的背景。标记有问题的项目并提出中立的替代方案。问题:[粘贴]

弱提示/强提示

弱提示:

写 10 道有关分数的问题。

水平、结果、类型、干扰策略,没有关键;它的质量和一致性取决于机遇。

强力提示:

你的角色:数学老师。学习成果:“学生将两个不同分母的分数相加”(应用)。五年级。 6道选择题,4个选项。干扰因素应该基于以下误解:直接将分子和分母相加,保持分子不变并添加分母。给出每个问题的关键和选项描述。混合简单-中等-困难。

问题类型

它测量的水平

实力

注意

多项选择

任何级别(取决于设计)

快速、自动评分

干扰器质量

开放式

理解创造

原始表达

需要一个标题

真假

记住

非常快

运气成分高

基于场景

分析评价

妨碍记忆

拼写很难,人工智能有帮助

常见错误

  • 不验证密钥。最常见、最不公平的错误;人工智能产生了错误的密钥,知道它的学生将成为受害者。
  • 废话分散注意力。这个难以置信的选项免费简化了问题。
  • 增益电平不匹配。记住分析获取的问题;错过目标。
  • 提供线索的语言。最长/最详细的选项总是正确的事实教会了学生模式。
  • 忽视偏见。特定文化/群体的熟悉背景给一些学生带来了不公平的优势。
注意:人工智能有时会产生模棱两可的问题,其中不止一个选项可以被认为是“正确的”。他用“是否存在唯一且无可争议的事实?”这个问题回答了每个项目。通过说来测试它;否则,要弄清楚根源。

总之

一个好的问题可以通过清晰的主旨和合理的干扰因素来衡量达到的程度。 AI快速生成大量问题大纲、干扰项和依赖于获取的关键点;如果你告诉目标的误解,干扰因素将会有启发性。然而,人工智能可能会产生错误的按键、弱干扰、无法获取或有偏见的问题。解决每一项验证关键,检查对齐和偏差;最后的考试是老师的。

应用任务

对于结果,使用“基于结果的多项选择集”模板生成 6 个问题;自己指定干扰策略。然后自己解决每个问题并将其与人工智能的密钥进行比较,然后再使用“答案密钥验证”模板。纠正任何不匹配的地方。最后,编写一个场景版本,将其中一个问题提升到分析级别。

清单

  • [ ] 我是否根据学习成果的 Bloom 级别提出问题?
  • [ ] 我的干扰因素是否基于实际的误解?
  • [ ] 我是否通过自己解决问题来验证了每个问题的关键?
  • [ ] 我确定有一个毫无疑问的正确答案吗?
  • [ ] 我是否检查过偏见和年龄适宜性?