单位 9 / 11

偏见、公平与歧视:模型的盲点

收益:

  • 了解人工智能模型中的偏差如何因数据和设计而产生,以及为什么它会在银行业产生法律和道德风险
  • 能够识别受保护的特征、代理变量和间接歧视,并在公平性方面质疑模型决策
  • 能够理解正义指标、被排斥群体和反对权如何融入模型治理并维持歧视红线

人工智能模型不是中立的;它是所学数据的一面镜子。如果数据包含过去的不平等,模型会学习它们并将它们带入未来。在银行业,这不是一场抽象的道德辩论:如果信贷模式系统性地使特定群体处于不利地位,那么这既是非法的(禁止歧视),也是违反道德的行为,给银行带来声誉和制裁风险。本单元的目的是展示模型如何变得有偏见、直接和间接形式的歧视、代理变量陷阱以及将公平融入模型治理的方法。从一开始就必须划出一条红线:歧视,无论它看起来多么“统计”,都是不可接受的。

偏见从何而来?

  • 数据偏差:如果过去的决策不公平(例如,过去某个特定群体获得的信用较少),则模型会假设这是“正常”并继续下去。这就是所谓的历史偏见。
  • 抽样偏差:如果某些群体在数据中代表性不足,则模型对他们的了解很差且不准确。
  • 标签偏差:如果“好客户”的定义本身存在偏差,则模型会针对该偏差进行优化。
  • 设计偏差:人类对使用哪些变量的选择也可能带有偏差。
提示:“模型是基于数据的,所以它是客观的”是一个误解。数据是过去的快照;如果过去是不公正的,那么“客观”模型就会用数学来证明不公正的合理性。客观性并不能保证公正性。

直接和间接歧视

  • 直接歧视:模型直接使用受保护的特征(性别、种族、宗教、年龄)。这是明确禁止的。
  • 间接歧视(代理变量/代理):即使模型不直接使用受保护的特征,它也会通过使用与其强相关的另一个变量(邮政编码、姓名、购物类别、工作区域)产生相同的结果。邮政编码通常代表种族或收入水平。模型说的是“邻居”,但结果却是“起源”歧视。

变量

显然

可以是代理

邮政编码/区

地理

种族、收入水平

名称

身份证号

出身、性别

购物类别

行为

生活方式、信仰

毕业学校

教育

社会经济起源

这就是为什么当你在理由中看到“邻居有风险”这样的说法时,应该敲响警钟:它可能看起来是一个合法的标准,但却带有间接歧视。

注意:从数据中删除受保护的功能并不能结束歧视。代理变量可以返回它。 “敏感专栏我删了”并不能伸张正义;这是通过测试组间模型决策的结果来实现的。

将正义融入治理

  1. 公平性指标。比较各组之间模型的批准/拒绝率和错误率。是否有一组系统地经历了更高的拒绝?
  2. 代理控制。检查所用变量与受保护属性的关系。
  3. 可解释性。每一个决定都必须有理由; “黑匣子”的否认是站不住脚的。
  4. 反对权。客户应有权了解决策的理由并请求人工审核。
  5. 排除的群体。还应该检查数据中代表性不足的群体是否受到虐待。

四个可复制模板

1) 合理性歧视筛查:

检查以下信用决策理由:是否直接/间接引用受保护特征(年龄、性别、出身、宗教)或代理变量(邮政编码、社区、姓名、购物类型)?标记有风险的言论并解释为什么它们会带来歧视风险。原因:[正文]

2)变量列表代理控制:

检查信用模型中使用的变量列表。哪些可以代表受保护的特征并构成间接歧视的风险?写下每个有风险的变体的理由。列表:[变量]

3)公平性方面的决定摘要(中立,可解释):

您的角色:起草可解释的决策理由的助理。仅依赖合法的、非歧视性的标准(债务收入比、付款历史、抵押品)。不要引用受保护的属性和代理变量。用客户能够理解的通俗语言写出理由。我会给予批准。

4) 异议答复草案:

一位客户对信用被拒绝提出上诉并希望得到正当理由。根据合法标准起草一份尊重和描述性的回应;提醒客户他或她有权进行人工审查和纠正。请勿使用任何歧视性含义。已验证拒绝原因:[原因]

弱提示/强提示

弱提示:

在这个地区的应用风险很大,我们在模型中更多地使用地区信息,这样可以提高准确性。

这种做法加强了基于地区的间接歧视;它以“击中”的名义使非法结果合法化。

强力提示:

你的角色:司法审计助理。标记所使用的存在替代变量风险的变量。建议我应该遵循哪些指标来比较各组之间的决策的批准/拒绝率。切勿强化歧视性标准;重定向到合法且可解释的标准。

坚强意志寻找代理风险,引入公平指标,并拒绝歧视。

三个迷你箱子

案例 1——历史偏差。一种模型给特定职业群体系统性的低分,因为它在过去给予的信用较少。公平审计显示,该群体的拒绝率比同等收入水平的其他群体高出 30%。该模型根据合法收入和支付标准进行了重新平衡。

情况 2 — 代理变量。邮政编码是模型中的一个强大变量。审计显示,邮政编码与某些种族集中的社区重叠,产生了间接的血统歧视。该变量被删除并由合法的财务基准取代;绩效保持在可接受的水平,歧视被消除。

案例 3——反对权。被拒绝的客户要求给出理由。银行提供了可解释的理由(高债务收入比)并接受人工审核请求。审查发现对文件的误读;该决定已更正。可解释性和反对权可以用正义来弥补错误。

公平性指标:我们衡量什么以及如何衡量

“这个模型公平吗?”这个问题没有单一的答案;正义有多种定义,有时它们相互冲突。以下是银行业实际遵循的一些方法:

  • 批准/拒绝率比较:具有相似财务状况的不同群体(例如性别群体)之间的批准率是否存在系统性差异?巨大且无法解释的差异是偏见的表现。
  • 错误率相等:模型的错误拒绝(拒绝合法申请)率在各组之间是否平衡?如果一个群体比另一群体更频繁地遭到不公平拒绝,那就存在问题了。
  • 校准:模型中称为“高风险”的客户在每组中的违约率是否真的相似?分数的含义不应因组而异。

这些指标有时无法同时提供;优先考虑哪种正义定义不是技术决定,而是道德和法律决定,需要人类治理。

提示:定期测量公平性指标,而不仅仅是在构建模型时测量。模型可能会公平地运行,但随着时间的推移,由于数据漂移而变得有偏差。正义不是“设立”的问题,而是“监督”的问题。

常见错误

  • “客观数据”谬误。假设模型是中性的;数据带有历史偏差。
  • 只需删除敏感列即可。删除受保护的属性并忽略代理变量。
  • 不跟踪公平指标。根本不比较各组之间的拒绝/错误率。
  • 捍卫黑匣子决定。考虑一个不能被证明是合法的决定。
  • 取消反对权。禁用人工审核,因为“它会减慢流程”。
注意:歧视往往不是出于恶意,而是出于粗心。由于“提高准确性”而添加的变量可能会在不知不觉中排除某个组。因此,正义不是基于善意,而是基于定期检验。

总之

人工智能模型所学到的数据带有偏见,银行业的歧视是一种法律、道德和声誉风险。直接歧视是使用受保护的功能;另一方面,间接歧视使用代理变量(邮政编码、姓名)产生相同的结果。正义不是要删除敏感栏目;而是要删除敏感栏目。通过公平性指标、代理控制、可解释性和反对权来确保。一句话简介:模式重复过去;维护正义、拒绝歧视是人类的责任。

应用任务

为信用模型编写 8-10 个变量的列表(其中一些具有故意代理风险:邮政编码、姓名、购物类别)。 2. 使用模板进行代理检查,并标记有风险的并注明原因。然后编写歧视性理由文本并使用模板 1 对其进行扫描。最后,在段落中规划您将跟踪哪些公平性指标,以比较模型在组之间的拒绝率。

清单

  • [ ] 我已检查模型/基本原理不使用受保护的属性。
  • [ ]我还筛查了代理变量的风险。
  • [ ] 我打算比较各组之间的批准/拒绝和错误率。
  • [ ] 我确保每个决定都有可解释的理由。
  • [ ] 我赋予客户反对权和人工审查权。
  • [ ] 我什至没有以“打人”为由跨越歧视红线。