单位 10 / 11

公平、歧视和算法责任

收益:

  • 它可以识别算法偏差的数据、设计和使用来源,并以组为基础测试输出。
  • 解释反馈循环和表示误差如何放大不平等并建立影响控制。
  • 它通过确保每个自动化决策的可解释性和吸引力来确保问责制。

公众必须平等地向所有人行使权力:对处于相似情况的两个公民给予相似的待遇,对不同情况按比例区别对待。这一平等原则是宪法义务。人工智能既可以改善这一领域,也可以悄然颠覆这一领域。它可以改进,因为一致应用的规则可以减少任意性和人为偏见。它可能会造成破坏,因为人工智能模型从过去的数据中学习,而过去的数据带有过去的歧视。如果一个系统使用历史上对特定群体不利的数据进行训练,那么它就会在“客观算法”的幌子下,以一种更难以检测的形式将这种劣势带入未来。在本单元中,您将学习在公共部门使用人工智能时如何识别算法偏差(模型输出针对某些群体的系统偏差),如何减少它,最重要的是,如何确保算法问责制(自动决策的基本原理是可解释的、可审计的和可争议的)。

偏见从何而来?

算法偏差有多种来源,并且所有这些在公开场合都是有风险的:

  • 历史偏差:训练数据包含过去的不平等。例如,如果某个区域过去的服务较少,“需求数据”可能会显示该区域的需求较低——而实际上需求较低是因为没有服务。
  • 代表性偏差:某些群体在数据中的代表性不足(那些没有数字访问权限的群体、少数语言群体),并且该模型对他们来说效果不佳。
  • 代理偏见:即使模型不直接查看禁止的标准(种族、宗教),它也可以通过查看与其关联的代理(社区、姓名、邮政编码)来产生相同的歧视。
  • 测量偏差:我们测量的并不是我们真正想要测量的。 “投诉数量”衡量的是投诉的能力而不是需求。
注意:说“我从模型中删除了敏感数据(性别、种族),现在它是公平的”是具有误导性的。通过代理变量进行的歧视可能会继续。公平不是通过删除输入来实现的,而是通过测试组之间的输出来实现的。

测试公平性:查看输出

一个制度是否公平可以通过观察其结果来理解,而不是通过其意图来理解。基本方法:将决策分组并进行比较。不同群体(性别、年龄、地区、收入)之间的接受/拒绝率、错误率、等待时间等输出是否存在显着差异?如果存在差异,这种差异是基于正当理由还是属于歧视?由于此分析可能需要个人数据,因此必须根据 KVKK 进行汇总和执行。

提示:在推出新的人工智能决策系统之前,请按人口群体细分其决策并生成“公平报告”。如果你发现差异,“这个差异可以解释吗?”将问题提交给人民委员会。

可解释性和吸引力:问责制的核心

在公共部门,任何公民都不能因为回答“制度决定如此”而被剥夺权利。对于每个自动化或人工智能辅助决策,必须确保三件事:

  1. 可解释性:决策的依据是什么,哪些因素是有效的,应该用通俗易懂的语言解释。
  2. 上诉方式:公民应该能够反对该决定并要求人员对其进行审查。
  3. 审计跟踪:应记录哪些数据、哪种型号/版本以及由哪位负责人做出的决定。

三个迷你箱子

案例 1 — 捕获替代变体。一种援助优先顺序模型不使用敏感数据,而是查看“邮政编码”。在公平性测试中,发现某些社区的优先级系统性较低——与邮政编码、收入和种族密度相关。该变量被删除,优先级直接与需求指标挂钩。

案例 2——代表性差距。聊天机器人误导非土耳其母语公民提问的可能性高出 41%;训练数据几乎不包含该组的数据。当增加多语言支持和人工切换阈值后,差距就缩小了。

案例 3——不明原因的拒绝。机构自动拒绝申请;公民“为什么?”当被问及时,该官员无法解释,因为该模型的原因无法理解。该事件表明,可解释性较差的模型不能用于做出具有权利的决策;该系统已转变为一个可以产生合理性并需要人类批准的模型。

四个可复制模板

1)偏置扫描的来源:

您的角色:算法公平性专家。查看下面由人工智能驱动的决策流程。列出可能的偏差来源:(1) 历史偏差,(2) 代表性偏差(代表性不足的群体),(3) 代理变量(与禁止标准相关的列),(4) 测量偏差。为每个例子提供一个具体的例子,并告诉我如何测试它。流程:[决策流程和使用的数据]

2)公平性测试方案:

为以下决策输出生成公平性测试计划:我应该细分哪些群体(年龄、性别、地区、收入),我应该比较哪些指标(接受率、错误率、等待时间),如何确定差异是合法的还是歧视性的?添加 KVKK 警告。决定:[什么决定]

3) 决定声明(向公民):

为以下决定写一份公民可以理解的解释草案:用通俗易懂的语言解释哪些因素有影响。最后添加上诉权以及进行人工审查的可能性[时间待确认]。使用诸如“系统决定如此”之类的模糊表达。决策:【总结及影响因素】

4)发布前的责任检查:

在推出人工智能驱动的决策系统之前,制定一份问责清单:是否可以解释,是否有上诉方式,是否维护审计跟踪(数据/模型版本/责任),是否进行了公平性测试,人工批准点在哪里。将丢失的物品标记为危险信号。系统:[配方]

弱提示/强提示

弱者:“这个决策模型公平吗?”

Strong:“你的角色是算法公平性专家。对于这个援助优先级模型,首先扫描偏差来源(历史、代表性、替代变量、测量),并为每个偏差提供具体示例。然后提出一个公平性测试计划:按哪些组、哪些指标、如何确定差异的合法性进行细分;添加 KVKK 警告。最后,在推出系统之前,给出一份可解释性清单、申诉路径和审计跟踪,并对缺陷进行红旗标记。”

不同之处在于:强有力的提示从根源上寻找偏见,让结果经过团体测试,并使问责制广泛化。

正义的维度和控制

尺寸

风险

控制

历史数据

过去带来不平等

按组测试输出

代表性

对某些群体来说效果不佳

基于组的错误率

替代变量

隐性歧视

变量敏感准则关系

可解释性

不合理的决定

生成简单的解释

反对

没收

人工审核路径

反馈回路和表示错误

最阴险的算法歧视形式不是发生在单个错误决策中,而是发生在随着时间的推移而自我强化的反馈循环中(模型的输出影响后续的训练数据,从而强化现有的偏见)。例如,如果检查模型将某个特定社区标记为“有风险”,则对该社区进行的检查越多,创建的记录就越多,该模型就会认为该社区风险更高——即使所检查位置的差异有所增加,而不是实际风险的差异。造成这种情况的通常是表示错误(训练数据不完整或扭曲地反映某些群体)。在公共部门,这些循环可能使弱势群体受到越来越严厉的监视和制裁。保护自己的方法是监控模型的影响,而不仅仅是其输出:定期监控基于群体的决策分布,而不是盲目实施模型的建议。

迷你案例——自我夸大的怀疑。福利欺诈检测模型将过去受到更严格检查的地区标记为高风险。当团队从数据中提取执法强度并测量“相对于人口的真实检出率”时,他们发现地区之间的差异基本上消失了;该模型将不平等误认为是真实风险。

基于组的影响控制模板:

任务:按组检查以下决策数据(无个人数据,分类摘要)。数据:[组|组]总体决定|负面决策率|检查强度]输出:1)阴性判定率是否显示组间显着差异? 2) 差异是否是由于实际风险或控制/表现强度造成的? 3)是否有任何反馈循环的迹象? 4)人类控制的建议。规则:建立因果关系主张;列出可能的解释和测试方法。

注意:“该模型是中立的,因为它对每个人都应用相同的规则”的论点具有误导性。同样的规则,当应用于有偏差的数据时,会保留并放大不平等。正义是通过结果的平等来衡量的,而不是规则。

常见错误

  • 删除敏感数据并认为“这是公平的”。替代变量使歧视永久化;测试输出。
  • 通过意图衡量正义。正义最终出现;将决策分组并进行比较。
  • 忘记代表性不足的群体。该模式对于少数群体来说可能效果不佳;请参阅基于组的错误。
  • 在权利授予决策中使用无法解释的模型。一个不能提供正当理由的体系无法做出公共决策。
  • 不提供任何反对方式。每个自动化决策都应该接受人工审查。
  • 不保留审计跟踪。应记录决策是根据哪些数据/模型/负责人做出的。

综上所述

在公共部门,人工智能可以提高一致性,但也悄悄地延续了过去的歧视。偏差来自历史数据、代表性差距、代理变量和不准确的测量;删除敏感数据并不能解决问题。公平性是通过跨组测试结果来实现的。任何公民都不能因为“制度如此规定”而被剥夺权利:每项决定都必须是可解释的、可争议的和可审计的。负责的是机构,而不是算法。

应用任务

在您的单位中选择人工智能驱动的或自动化的决策流程。列出可能的偏差,并使用“偏差来源扫描”模板找到至少一个替代变量风险。通过“公平性测试计划”确定要查看哪些组的细分。对于示例决策,使用“决策解释”模板生成面向公民的解释。

清单

  • [ ] 我扫描了偏见的来源(历史、代表性、代理、测量)。
  • [ ] 我不仅仅删除了敏感数据;我按组测试了输出。
  • [ ] 我控制了代表性不足群体的错误率。
  • [ ] 我为每个决定提供了简单、可解释的理由。
  • [ ] 我已经定义了异议和人工审核路径。
  • [ ] 维护审计跟踪(数据/模型版本/负责人)。