收益:
- 能够生成针对特定职位、基于能力和行为的面试问题
- 能够创建公平且可比较的评估指南(标题)
- 认识人工智能在面试评估中的局限性并保留人类的判断
面试是招聘中最具决定性但也最主观的阶段。两个不同的面试官可能会对同一候选人做出截然不同的评价;因为每个人提出的问题不同,重视的事物也不同,并且常常根据“感觉”做出决定。研究表明,非结构化面试很难预测招聘成功;然而,它表明结构化面试是最有力的预测因素之一。人工智能 (AI) 是减少这种主观性的最实用工具:针对特定职位的问题产生了通用的评估指南和一致的结构。在本单元中,我们将学习如何利用人工智能构建公平、可比且可辩护的面试流程。
术语:结构化面试是一种面试,其中所有候选人都会被问到相同的基于能力的问题,并且答案按照相同的标准进行评分。 Rubric(评估指南)是一个表格,定义每个问题的答案将获得多少分。行为问题询问候选人过去实际做了什么(“告诉我一次你解决冲突的经历”)——因为过去的行为是未来行为的最佳指标。情境问题询问你在假设的场景中会做什么。 STAR 是一个用于构建候选人答案的框架:情况、任务、行动、结果。
分步面试设计
- 确定能力。写下该职位的 4-6 项关键能力(例如解决问题、团队合作、技术深度)。
- 针对每项能力生成问题。向人工智能提出行为和情境问题。
- 创建一个标题。对于每个问题,定义“弱/充分/强”答案。
- 准备后续问题。如果候选人的回答很肤浅,那就深入一些。
- 进行歧视审计。从法律和道德角度审查问题清单。
- 收集分数并与人一起解释它们。 AI调整分数;团队决定。
您的角色:设计结构化面试的人力资源专家。职位:高级软件开发人员关键能力:解决问题、代码质量、团队沟通、学习敏捷性。对于每项能力:- 2 个行为问题(基于过去的经验)- 1 个情境问题(假设场景)- 每个问题 2 个后续问题问题不应具有歧视性;不要询问个人生活/宗教/政治/子女计划。根据能力为输出命名。
提示:明确指示AI“询问个人生活、婚姻状况、孩子计划、宗教、政治、健康”。这些问题在劳动法和平等待遇方面既具有歧视性,又存在风险。即使意图良好,人工智能也可能超越这个限制。
标题:减少主观性的工具
如果没有评分标准,分数会根据面试官的心情而变化。该标题通过预先定义“强有力的答案是什么样的”,让每个人都达成共识。
为以下面试问题写出 1-5 级的评分标准。问题:“当一个项目的技术决策被证明是错误的时,你会做什么?”在标题中定义以下级别: 1(弱):典型答案和缺失信号 3(足够):典型答案和积极信号 5(强):典型答案和强信号 给出每个级别可观察行为的示例(例如承担责任、根本原因分析、学习)。
当你将这些标准应用于所有问题时,不同面试官给出的分数会趋于一致;这称为评估者间的一致性。在通用模板中收集分数可以根据证据而不是单个“我喜欢”句子做出决定。
弱提示/强提示
弱提示:给出软件开发人员的面试问题。
结论:一般问题可以在网上找到;没有标准,没有能力匹配,没有公平性的保证。
强烈提示:[职位+关键能力+行为/情境问题请求+歧视性问题禁令+每个问题1-5个标题+后续问题]
结果是:一套适用于所有候选人的可评分、经得起考验的面试工具包。
用人工智能回答评估:局限性
人工智能可以帮助你按标题组织面试笔记;但这里需要强烈警告:人工智能无法看出候选人的语气、诚意、真正的能力;它只会读取您写的注释。因此,人工智能的作用是构建你的观察结果,而不是做出决策。
根据我给出的标题,在能力标题下整理我的面试笔记。对于每项能力: - 在注释中总结证据 - 在标题中显示其对应的级别 - 标记证据缺失/不清楚的地方 为我最终评分;只需编辑证据即可。<notes>[你的采访笔记]</notes>
人工智能的适当作用
人工智能的不当角色
创建问题和评分标准
单独对候选人进行评分和淘汰
根据标题整理面试官的笔记
通过视频/音频“情感分析”做出决策
注释中标记不一致
诸如“这位候选人在撒谎”之类的判断
关于包含偏见的问题/注释的警告
最终确定聘用决定
注意:基于人工智能的“通过面部表情/语气分析评估候选人”工具在科学上是有问题的,并且会带来严重的歧视风险。不要赋予此类工具决策权;许多国家和框架(例如欧盟人工智能法)认为用于招聘的此类系统具有高风险。
三个迷你箱
案例 1——一致性增益。一家零售连锁店正在通过 3 名不同的面试官对 8 名商店经理候选人进行评估,但分数不一致。使用人工智能创建了一个通用的标题。第二轮面试官(同一候选人)之间的评分差异从平均1.8分下降到0.6分;决策变得更加站得住脚。
案例2——抓住歧视性问题。在他准备的问题清单中,一位经理问道:“你有一个小孩,可以加班吗?”他提出了这个问题。当人工智能被告知“检查问题是否存在歧视”时,这个问题被标记并询问“这个角色需要偶尔加班;你适合这个职位吗?”它已被任何人都可以询问的中性版本所取代。因此,维护了正义,并避免了可能发生投诉的风险。
案例 3 — 配置注释。一个采访小组有零散的笔记。人工智能按标题组织笔记,并显示哪些能力缺少证据。小组就缺失的能力进行了第二次简短讨论,并做出了更可靠的决定。 AI没有决定;编辑了支持决策的信息。
常见错误
- 没有标题的采访。提出问题而不准备评分指南保留了主观性。
- 向候选人提出不同的问题。只有通过常见问题才能进行比较。
- 让人工智能来决定。人工智能没有足够的数据来对候选人做出最终判断。
- 不缓和歧视性问题。即使是善意的面试官也可能会提出具有合理风险的问题;人工智能控制是安全网。
- 依靠“情绪/面部分析”工具。科学依据薄弱,歧视风险很高。
- 会议结束后很长时间才写下这份便条。趁观察结果新鲜时做笔记;人工智能只有在你编写它的时候才能发挥作用。
综上所述
公平面试;它意味着共同的问题、清晰的标题以及保留人类的判断力。人工智能是产生这三重奏中的前两重奏的出色助手:基于特定职位能力的问题、合理的评分指南和歧视监控。但对候选人的实际评估和聘用决定——属于人类观察和责任。
应用任务
选择一个位置。 (1) 确定 4 项关键能力。 (2) 根据上述提示生成行为/情境问题和后续问题。 (3) 针对 3 个最关键的问题创建 1-5 个评分标准。 (4)通过“歧视检查”提示通过问题清单。 (5)让AI根据评分标准编辑一份面试笔记样本,并自己给出最终评分。
清单
- [ ] 这些问题是否与关键能力相关?
- [ ] 是否标准化,以便所有候选人都会被问到相同的问题?
- [ ] 每个关键问题有 1-5 个评分标准吗?
- [ ] 这些问题是否经过歧视检查?
- [ ] 最终的评估和决定是留给人的吗?
- [ ] 是否避免使用“情绪/面部分析”等有风险的工具?