单位 11 / 12

人类控制、透明度、偏见和道德

收益:

  • 区分人类控制的三种模型(在循环中、在循环中、在命令中)
  • 认识并减轻人工智能输出中的偏见和歧视风险
  • 将透明度和可解释性原则转化为具体应用

人工智能系统可能在技术上完美运行,但仍然是错误的:它可能系统地消灭一个群体,无法解释其决定的原因,或者引导人们不加质疑地接受它。在本单元中,我们将治理的“软”但最具决定性的方面——人力控制、偏见管理、透明度和道德——转化为具体实践。我们的目标不是“不要相信人工智能”之类模糊的口号;而是。它们是展示如何审核输出、减少偏见和建立透明度的工作机制。

人类控制的三种模型

人类监督意味着人类保留对人工智能做出的决策的控制。共有三种基本模型,需要根据风险选择合适的模型。

模型

含义

适合的地方

人类在循环中

一个人批准每一个决定

高风险、有影响力的决策

人类在循环中

人工智能发挥作用,人类进行监控并在必要时进行干预

中等风险,大交易量

指挥员

人类设计系统、设定限制、关闭它

整体治理水平

对于对人有重大影响的决策(就业、信贷、医疗保健),首选人机循环模型:人工智能提供建议,但有能力的人做出最终决定。 “人工智能是这么说的”从来都不是借口;责任始终在于人。

注意:人类控制仅仅“纸上谈兵”是不够的。如果人类自动批准人工智能的建议(橡皮图章),那么就没有真正的控制。为了使审计变得有意义,人们必须能够看到其基本原理,提出质疑,并真正说“不”。

偏见和歧视的风险

偏见是指人工智能系统性地对某些群体不利或有利。它的来源通常是训练数据:如果历史数据中存在歧视,人工智能会学习并维护它 - 甚至对其进行缩放。

减少偏见的实际步骤:

  1. 审查敏感变量:检查性别、年龄、种族等领域对决策的影响。
  2. 按组划分的测试结果:系统在不同组中是否产生不同的拒绝/接受率?
  3. 注意代理变量:“邻居”或“学校”等字段可能隐含地传达了种族/阶级区别。
  4. 建立定期监控:持续测试偏差,而不是一次;随着数据的变化,它可能会回来。

三个迷你箱子

案例 1 — 橡皮图章。在一家银行,信贷员未经审查就批准了人工智能评分;他们说“系统已经计算过了”。一项审计显示,在 500 份提交的内容中,有 498 份人类做出了与人工智能完全相同的决定——因此没有真正的审查。解决方案:要求人们看到推理,在一定程度上对决定进行二次猜测,并要求“为什么同意/不同意”注释。

案例 2——隐性偏见。招聘人工智能对女性候选人的评分较低,尽管它根本不考虑性别。从哪里?由于过去的数据主要包括特定职位的男性,因此该模型通过“不间断的职业”等代理变量学习了间接歧视。基于分组的测试揭示了这一点;该团队提取替代变量并监控结果。

案例 3 — 透明的信任。在人工智能驱动的损害评估中,保险公司告知每位客户“该决定是人工智能驱动的,他们可以上诉并要求人工审查。”反对率低于预期,因为客户理解并信任该流程。透明度可以增加信任,同时降低风险。

透明度和可解释性

透明度是指让相关人员清楚人工智能正在发挥作用以及它是如何工作的。可解释性意味着能够以易于理解的方式解释决策的原因。具体应用:

  • 关于 AI 与该人交互的“您正在与 AI 交谈”通知。
  • 自动决策中的解释是“此决策基于以下因素”。
  • 明确提出上诉和请求人工审查的途径。
  • 对于内部团队:记录和记录模型的作用。
提示:询问人工智能决策“影响该决策的三大因素是什么?”用问题来测试一下。如果系统无法使这一点易于理解并且该决定对人产生重大影响,则该系统尚未准备好负责任地使用。

自动化偏见:自己的陷阱

即使建立了透明度和人工监督,人为方面也存在潜在的风险:自动化偏见。人们倾向于相信机器的输出而不是自己的判断。因为屏幕上的人工智能建议显得“客观且经过计算”,人们很容易不加质疑地接受它——这就是橡皮图章的心理根源。

有一些具体的方法可以减少这种情况。首先鼓励反对意见:询问批准决定的人“为什么我可能不同意人工智能?”请他思考这个问题。然后显示置信度分数:表示AI有多自信;单独标记低置信度输出。然后设置冲突警报:如果AI的推荐违反了机构的规则或人类可用的数据,系统将突出显示这一点。最后,将两项人类原则应用于关键决策;单个审批者更容易受到自动化偏差的影响。

注意:说“有人类认可”并不意味着没有自动化偏见。人类必须拥有权力、时间和正确的信息来质疑人工智能。强制审批者在 3 秒内做出 200 个决策的系统实际上并不能提供真正的人为控制。

可复制模板

模板 1 — 人类控制模型选择:“哪种人类控制模型适合以下人工智能用途[描述用途]:在循环中、在循环中或在命令中?考虑到对个人的风险和影响,提出合理建议。指定我应该添加什么控制来避免橡皮图章风险。”

模板 2 — 偏差测试计划:“为以下决策支持 AI 制定一个[描述用法]偏差测试计划:我应该比较哪些组,我应该测量什么指标(拒绝/接受率等),我应该寻找哪些替代变量,我应该多久重复一次测试?一步步写下来。”

模板 3 — 决策描述文本:“为个性化自动化决策编写简单的描述文本:该决策是否由人工智能驱动、影响该决策的关键因素、上诉和请求人工审核的方式。非指责、尊重的语气,120 个字或更少。”

模板 4 — 道德审查清单:“在发布人工智能用途之前准备一份道德审查清单:公平/歧视、透明度、人为控制、隐私、安全、问责制。在每个标题下包括 1-2 个需要回答的明确问题。”

弱提示/强提示

弱:“招聘人工智能公平吗?”-> 模型给出了一个笼统的答案,比如“应该是公平的”;不提供可测试的方法和偏差测量。 STRONG:“为此招聘支持人工智能制定偏见测试计划:一种比较不同性别和年龄组的接受率、要考虑的代理变量、可接受的差异阈值和监控频率的方法。还要添加控制以确保人类做出最终决定。” -> 该模型产生了可测量、可重复的公平机制。

常见错误

  • 将人类控制留在“纸上”并自动批准人工智能建议(橡皮图章)。
  • 让对人有重大影响的决策不受监督,而不是留在循环中。
  • 考虑到仅仅因为“我删除了敏感变量”就解决了偏差;跳过代理变量。
  • 测试一次偏差,而不是持续监控它。
  • 跳过透明度,因为“这是一个技术细节,用户不会理解”。
  • 在关键决策中使用无法解释决策原因的系统。
  • 将伦理评估留到出版后,并表示“我们稍后会看到”。

综上所述

  • 人类控制以三种模式实现;在影响人的决策中,人在循环中是优先的。
  • 控制必须有意义;橡皮图章(自动批准)并不是实际的审核。
  • 偏差通常来自训练数据;应测试并持续监控敏感变量和替代变量。
  • 透明度和可解释性需要向用户清楚地展示人工智能正在发挥作用以及做出决定的原因。
  • 出版前进行伦理审查;责任始终在于人类,“人工智能这么说”不是借口。

应用任务

选择影响组织中人员的 AI 决策流程(例如应用程序评估)。确定此过程的适当人类控制模型并提供理由,并设计具体的控制措施以防止橡皮图章(例如要求查看理由、样品审查)。然后编写偏差测试计划:指定您将比较哪些组、使用什么指标、频率以及您将关注哪些代理变量。最后,起草一份决定解释文本,在此过程中向相关人员展示,并包括上诉/人工审核路径。

清单

  • [ ] 我选择了适合流程的人类控制模型。
  • [ ] 我设计了一个具体的控件来防止橡皮图章。
  • [ ] 我准备了一个偏差测试计划(组、指标、频率)。
  • [ ] 我评估了替代变量的风险。
  • [ ] 我为该人写了一份决定解释文本。
  • [ ] 我已经明确提出了申诉和人工审核的途径。
  • [ ] 我在发表前进行了伦理审查。