收益:
- 它可以识别算法偏差的数据、设计和使用来源,并以组为基础测试输出。
- 解释反馈循环和表示误差如何放大不平等并建立影响控制。
- 它通过确保每个自动化决策的可解释性和吸引力来确保问责制。
公众必须平等地向所有人行使权力:对处于相似情况的两个公民给予相似的待遇,对不同情况按比例区别对待。这一平等原则是宪法义务。人工智能既可以改善这一领域,也可以悄然颠覆这一领域。它可以改进,因为一致应用的规则可以减少任意性和人为偏见。它可能会造成破坏,因为人工智能模型从过去的数据中学习,而过去的数据带有过去的歧视。如果一个系统使用历史上对特定群体不利的数据进行训练,那么它就会在“客观算法”的幌子下,以一种更难以检测的形式将这种劣势带入未来。在本单元中,您将学习在公共部门使用人工智能时如何识别算法偏差(模型输出针对某些群体的系统偏差),如何减少它,最重要的是,如何确保算法问责制(自动决策的基本原理是可解释的、可审计的和可争议的)。
偏见从何而来?
算法偏差有多种来源,并且所有这些在公开场合都是有风险的:
- 历史偏差:训练数据包含过去的不平等。例如,如果某个区域过去的服务较少,“需求数据”可能会显示该区域的需求较低——而实际上需求较低是因为没有服务。
- 代表性偏差:某些群体在数据中的代表性不足(那些没有数字访问权限的群体、少数语言群体),并且该模型对他们来说效果不佳。
- 代理偏见:即使模型不直接查看禁止的标准(种族、宗教),它也可以通过查看与其关联的代理(社区、姓名、邮政编码)来产生相同的歧视。
- 测量偏差:我们测量的并不是我们真正想要测量的。 “投诉数量”衡量的是投诉的能力而不是需求。
注意:说“我从模型中删除了敏感数据(性别、种族),现在它是公平的”是具有误导性的。通过代理变量进行的歧视可能会继续。公平不是通过删除输入来实现的,而是通过测试组之间的输出来实现的。
测试公平性:查看输出
一个制度是否公平可以通过观察其结果来理解,而不是通过其意图来理解。基本方法:将决策分组并进行比较。不同群体(性别、年龄、地区、收入)之间的接受/拒绝率、错误率、等待时间等输出是否存在显着差异?如果存在差异,这种差异是基于正当理由还是属于歧视?由于此分析可能需要个人数据,因此必须根据 KVKK 进行汇总和执行。
提示:在推出新的人工智能决策系统之前,请按人口群体细分其决策并生成“公平报告”。如果你发现差异,“这个差异可以解释吗?”将问题提交给人民委员会。
可解释性和吸引力:问责制的核心
在公共部门,任何公民都不能因为回答“制度决定如此”而被剥夺权利。对于每个自动化或人工智能辅助决策,必须确保三件事:
- 可解释性:决策的依据是什么,哪些因素是有效的,应该用通俗易懂的语言解释。
- 上诉方式:公民应该能够反对该决定并要求人员对其进行审查。
- 审计跟踪:应记录哪些数据、哪种型号/版本以及由哪位负责人做出的决定。
三个迷你箱子
案例 1 — 捕获替代变体。一种援助优先顺序模型不使用敏感数据,而是查看“邮政编码”。在公平性测试中,发现某些社区的优先级系统性较低——与邮政编码、收入和种族密度相关。该变量被删除,优先级直接与需求指标挂钩。
案例 2——代表性差距。聊天机器人误导非土耳其母语公民提问的可能性高出 41%;训练数据几乎不包含该组的数据。当增加多语言支持和人工切换阈值后,差距就缩小了。
案例 3——不明原因的拒绝。机构自动拒绝申请;公民“为什么?”当被问及时,该官员无法解释,因为该模型的原因无法理解。该事件表明,可解释性较差的模型不能用于做出具有权利的决策;该系统已转变为一个可以产生合理性并需要人类批准的模型。
四个可复制模板
1)偏置扫描的来源:
您的角色:算法公平性专家。查看下面由人工智能驱动的决策流程。列出可能的偏差来源:(1) 历史偏差,(2) 代表性偏差(代表性不足的群体),(3) 代理变量(与禁止标准相关的列),(4) 测量偏差。为每个例子提供一个具体的例子,并告诉我如何测试它。流程:[决策流程和使用的数据]
2)公平性测试方案:
为以下决策输出生成公平性测试计划:我应该细分哪些群体(年龄、性别、地区、收入),我应该比较哪些指标(接受率、错误率、等待时间),如何确定差异是合法的还是歧视性的?添加 KVKK 警告。决定:[什么决定]
3) 决定声明(向公民):
为以下决定写一份公民可以理解的解释草案:用通俗易懂的语言解释哪些因素有影响。最后添加上诉权以及进行人工审查的可能性[时间待确认]。使用诸如“系统决定如此”之类的模糊表达。决策:【总结及影响因素】
4)发布前的责任检查:
在推出人工智能驱动的决策系统之前,制定一份问责清单:是否可以解释,是否有上诉方式,是否维护审计跟踪(数据/模型版本/责任),是否进行了公平性测试,人工批准点在哪里。将丢失的物品标记为危险信号。系统:[配方]
弱提示/强提示
弱者:“这个决策模型公平吗?”
Strong:“你的角色是算法公平性专家。对于这个援助优先级模型,首先扫描偏差来源(历史、代表性、替代变量、测量),并为每个偏差提供具体示例。然后提出一个公平性测试计划:按哪些组、哪些指标、如何确定差异的合法性进行细分;添加 KVKK 警告。最后,在推出系统之前,给出一份可解释性清单、申诉路径和审计跟踪,并对缺陷进行红旗标记。”
不同之处在于:强有力的提示从根源上寻找偏见,让结果经过团体测试,并使问责制广泛化。
正义的维度和控制
尺寸
风险
控制
历史数据
过去带来不平等
按组测试输出
代表性
对某些群体来说效果不佳
基于组的错误率
替代变量
隐性歧视
变量敏感准则关系
可解释性
不合理的决定
生成简单的解释
反对
没收
人工审核路径
反馈回路和表示错误
最阴险的算法歧视形式不是发生在单个错误决策中,而是发生在随着时间的推移而自我强化的反馈循环中(模型的输出影响后续的训练数据,从而强化现有的偏见)。例如,如果检查模型将某个特定社区标记为“有风险”,则对该社区进行的检查越多,创建的记录就越多,该模型就会认为该社区风险更高——即使所检查位置的差异有所增加,而不是实际风险的差异。造成这种情况的通常是表示错误(训练数据不完整或扭曲地反映某些群体)。在公共部门,这些循环可能使弱势群体受到越来越严厉的监视和制裁。保护自己的方法是监控模型的影响,而不仅仅是其输出:定期监控基于群体的决策分布,而不是盲目实施模型的建议。
迷你案例——自我夸大的怀疑。福利欺诈检测模型将过去受到更严格检查的地区标记为高风险。当团队从数据中提取执法强度并测量“相对于人口的真实检出率”时,他们发现地区之间的差异基本上消失了;该模型将不平等误认为是真实风险。
基于组的影响控制模板:
任务:按组检查以下决策数据(无个人数据,分类摘要)。数据:[组|组]总体决定|负面决策率|检查强度]输出:1)阴性判定率是否显示组间显着差异? 2) 差异是否是由于实际风险或控制/表现强度造成的? 3)是否有任何反馈循环的迹象? 4)人类控制的建议。规则:建立因果关系主张;列出可能的解释和测试方法。
注意:“该模型是中立的,因为它对每个人都应用相同的规则”的论点具有误导性。同样的规则,当应用于有偏差的数据时,会保留并放大不平等。正义是通过结果的平等来衡量的,而不是规则。
常见错误
- 删除敏感数据并认为“这是公平的”。替代变量使歧视永久化;测试输出。
- 通过意图衡量正义。正义最终出现;将决策分组并进行比较。
- 忘记代表性不足的群体。该模式对于少数群体来说可能效果不佳;请参阅基于组的错误。
- 在权利授予决策中使用无法解释的模型。一个不能提供正当理由的体系无法做出公共决策。
- 不提供任何反对方式。每个自动化决策都应该接受人工审查。
- 不保留审计跟踪。应记录决策是根据哪些数据/模型/负责人做出的。
综上所述
在公共部门,人工智能可以提高一致性,但也悄悄地延续了过去的歧视。偏差来自历史数据、代表性差距、代理变量和不准确的测量;删除敏感数据并不能解决问题。公平性是通过跨组测试结果来实现的。任何公民都不能因为“制度如此规定”而被剥夺权利:每项决定都必须是可解释的、可争议的和可审计的。负责的是机构,而不是算法。
应用任务
在您的单位中选择人工智能驱动的或自动化的决策流程。列出可能的偏差,并使用“偏差来源扫描”模板找到至少一个替代变量风险。通过“公平性测试计划”确定要查看哪些组的细分。对于示例决策,使用“决策解释”模板生成面向公民的解释。
清单
- [ ] 我扫描了偏见的来源(历史、代表性、代理、测量)。
- [ ] 我不仅仅删除了敏感数据;我按组测试了输出。
- [ ] 我控制了代表性不足群体的错误率。
- [ ] 我为每个决定提供了简单、可解释的理由。
- [ ] 我已经定义了异议和人工审核路径。
- [ ] 维护审计跟踪(数据/模型版本/负责人)。