收益:
- 能够理解分析性和整体性的评估标准类型、标准和成功水平概念,并在人工智能的支持下设计透明的评估标准。
- 能够为绩效任务、项目组合和项目评估生成与成就相关的指标和点权重。
- 能够理解评分和最终评价的决定权属于老师,人工智能无法单独评分,一致性必须由老师检查。
告诉学生“这个项目得了 70 分”很容易;但学生问“为什么是 70?”或者家长反对,你必须有一个公平且有理有据的基础。这个基础就是标题:一种评分工具,可以提前显示将根据哪些标准以及在什么水平上评估绩效(项目、作文、演示、作品集)。一个好的评分标准既能告诉学生“对你的期望”,又能使老师的评分一致和透明。人工智能快速起草与成绩相关的指标和级别定义;您可以确定对齐方式、公平性和权重。界限清晰:评分和最终评价是影响学生的决定;责任和最终批准属于老师。人工智能无法单独得分。
量规类型和组件
有两种基本类型。分析性评分标准将表现分解为单独的标准,例如“内容”、“组织”、“语言和表达”、论文中的“写作”,并在不同的成就水平上对每个标准进行评分(例如,4 = 非常好,3 = 好,2 = 改进,1 = 开始)。提供详细的反馈,但需要时间准备和评分。整体的标题为整个研究提供了一个单一的总体水平;它很快,但它并没有显示出它的不足之处。
分析量规的组成部分包括:标准(我们评估的内容)、级别(有多好)、每个单元格的级别定义(该级别的具体指标)和权重(哪个标准占分数的百分比)。良好水平的定义是显而易见的:不是“写得好”,而是“不超过2个错别字,段落符合逻辑顺序”。
提示:在任务之前与学生分享该评分细则。 Rubric不是惊喜笔记工具,而是学习地图;如果学生知道要做什么,他就会生产出更好的产品。
一致性和公平性
该评分标准的真正价值在于一致性:当两名教师在两个不同时间对同一作业进行评分时,结果应该相似。这称为评估者可靠性。人工智能可能会产生标题大纲,但教师提供一致性:教师的工作是使级别描述足够具体,用标题“校准”一些案例研究(审判评分),并澄清边缘案例的规则。
为了公平起见,评分标准不应对与结果无关的事物进行评分(笔迹优美,学生需要社会经济机会获得的材料)。 AI有时会添加一些不达标的标准,例如“呈现美学”;有必要对它们进行整理。
一步一步:使用 AI 进行评分标准设计
- 给出任务和成就。评估标准的衡量内容取决于结果。
- 选择类型。如果你想要详细的反馈、分析;如果你想要快速的一般判断,整体的。
- 询问标准,但要过滤它们。 3-5 个关于成就的标准;删除不相关的。
- 具体级别定义。询问可观察的指标。
- 减肥。哪个标准更重要?令总数为 100。
- 校准。使用评分标准和测试一致性对 1-2 个样本研究进行评分。
- 做出最终决定。即使人工智能建议样本分数,老师也会给出最终分数。
三个迷你箱子
案例 1 — 未达标标准提取。一位土耳其老师向 AI 询问一篇论文的分析标准。 AI提出了5个标准,其中一个是“字迹优美”——这一标准与结果无关,并且不公平地惩罚了字迹不发达的学生。老师把它拿出来,换成了“想法发展”。该标题既公平又与成就一致。
案例 2——具体化。在一位老师的第一个评分标准中,级别是抽象的,例如“非常好/好/一般”;两名学生完成了不同级别的类似作业。他告诉人工智能“用可观察的指标重写每个级别。”当诸如“好=至少3个例子和一个明确的结论段落”之类的具体定义出现时,一致性增加,反对意见减少。
案例 3 — 校准。在项目评估中,老师首先用AI生成的评分标准对3个样本项目进行评分。 AI 向某人提供了 85;老师发现同一个项目的评分为 72,因为人工智能对一项标准的解释过于慷慨。老师澄清了级别描述并亲自分配了最终成绩。 AI加速选秀;老师做出了决定。
可复制模板
1)分析标题大纲:
您的角色:[科目]老师。任务:“[编写表演任务]”,成就:“[成就]”,[X.班级]。创建包含 4 个标准的分析量规。让每个标准都与结果相关(添加非客观标准,例如笔迹和美观)。编写 4 个成功级别,并为每个级别编写一个 OBSERVABLE 指标。对标准进行加权,使总数为 100。
2)具体化级别定义:
以下评分标准的级别描述非常抽象(“良好”、“一般”)。用可观察、可计数的指标重写每个级别(例如“不超过 2 个错误”、“至少 3 个示例”)。标题:[粘贴]
3) 整体评价标准(快速评估):
为“[任务]”编写一个 4 级整体评分标准。让每个级别在一个段落中明显地描述工作的一般性质。增益:“[增益]”。还给出音符范围。
4)校准检查:
下面是一个标题和学生作业。根据标题,说明您在每项措施中的水平,并附上理由。将此作为建议;我将给出最终成绩。标记任何仍不清楚的标准。标题 + 研究:[粘贴]
弱提示/强提示
弱提示:
为该项目编写一个标题。
无任务、成就、类型、标准数量、权重;出现了一个不达标和抽象的标题。
强力提示:
你的角色:科学老师。任务:“学生研究可再生能源并准备海报。”目标:“学生解释能源的工作原理和优点。”七年级。分析标准有 4 个标准:内容准确性、解释清晰度、来源使用、顺序。添加不达标标准。让每个层次都是可观察的;权重之和为 100。
特征
分析量规
整体评价标准
标准数量
多个,单独计分
单一一般判断
反馈意见
详细、基于标准
一般
速度
慢
快
最适合
流程/技能开发
快速概览
人工智能的贡献
标准+级别大纲
水平段落草稿
常见错误
- 不达标措施。对与结果无关的事情进行评分,例如笔迹、美观和材料的获取,有悖于公平性。
- 抽象层次定义。像“好/公平”这样的定义会导致不一致和反对;使用可观察的指标。
- 稍后显示标题。在任务之前不分享会剥夺学生的目标。
- 取得AI成绩。 AI可能会建议样本分数,但老师给出最终分数;一致性控制是老师的。
- 跳过校准。在不尝试案例研究的情况下使用该标题会带来令人惊讶的结果。
注意:给人工智能一份学生作业并说“评分”是很诱人的,但也有风险。学生作业可能包含个人数据(匿名),并且人工智能的分数可能不一致/有偏差。使用人工智能提出要点并概述反馈;你决定。
总之
Rubric 是一种使评估透明、一致且站得住脚的工具。分析性评价标准提供基于标准的详细反馈,整体评价标准提供快速的一般判断。人工智能快速起草与成就相关的指标、具体的级别定义和权重;但教师有责任整理不达标标准,使级别可观察,校准并给出最终分数。成绩是影响学生的决定;它没有委托给人工智能。
应用任务
使用“分析量规大纲”模板为您即将完成的绩效任务创建 4 个标准量规。删除任何不达标标准并使级别定义可观察。然后通过使用此评分标准对您的(或假设的)2 个样本研究进行评分来测试一致性;评估两项研究的分数是否反映了它们的真实质量,并对您的评分标准进行调整。
清单
- [ ] 是否所有标准达到相关(没有未达到标准)?
- [ ] 级别定义是否可观察且具体?
- [ ] 我确定了权重,它们的总和是 100?
- [ ] 我会在任务开始前与学生分享该评分细则吗?
- [ ] 我是否用样本作业校准了评分标准并自己给出了最终评分?