收益:
- 通过了解偏差来自数据(历史数据、代表性数据、测量数据、聚合数据)并根据子组评估模型,能够检测隐藏的歧视
- 能够通过模型卡在高影响力的决策和文档透明度中提供可解释性、人工监督和问责制
- 能够通过最小的适当模型、及时缩短、缓存和批量来管理财务和环境成本,而不影响质量
一个模型可能在技术上完美运行,但仍然是错误的——如果它对某些人不公平、难以解释或产生不可持续的成本。在本单元中,我们将介绍机器学习工程的三个“看不见”但决定性的维度:偏见和公平、道德和透明度、成本和可持续性。这些并不是后来添加的装饰品,而是工程质量不可或缺的一部分。
偏见从何而来?
模型偏差(模型以不同/不公平的方式系统地对待某些群体)通常来自数据,而不是模型。资料来源:
- 历史偏见:数据反映了过去的不公正现象。如果某个特定群体过去受到的信任较少,那么根据该数据训练的模型就会学习并延续这种歧视。
- 代表性偏差:某些群体在数据中的代表性不足;该模型对他们来说表现不佳(例如,在小样本人群中准确性较低)。
- 测量偏差:标签本身就有偏差(例如,如果“好员工”的定义是基于过去的晋升决策)。
- 聚合偏差:由于数据来自特定渠道,因此不能代表宇宙。
该模型不仅学习这些偏差,而且还学习这些偏差。通过自动化来扩大规模。一个人的偏见决定会影响另一个人;有偏见的模型的判决是数以百万计的。
注意:不要犯这样的错误:“模型是中性的,因为它只是数学。”该模型学习并自动消除数据中的人类偏见。中立性不是默认的,而是必须衡量和确保的结果。
衡量正义
要管理正义,就必须首先衡量正义。为此,请在子组的基础上评估模型:不同人口群体的准确性、召回率、误报率等指标是否相同?正义的几个概念:
- 群体公平性:模型是否以相似的比率正确/错误地对待不同的群体?
- 机会平等:模型是否平等地捕捉到所有群体中真正积极的一面(平等回忆)?
重要事实:正义的不同定义可能不会同时得到满足(这是数学结果)。在这种情况下,哪种正义定义优先是一项道德和商业决策,而不是技术决策,并且是与利益相关者共同制定的。
弱方法/强方法
Poor:“模型的总体准确率为 88%,还算可以。”
Güçlü:“总体准确率为 88%,但当我们将其分为多个小组时,一组的召回率为 91%,另一组的召回率为 67%——该模型系统性地缺失了该组。我们记录了原因(缺乏代表性),收集了该组的数据,并以平等召回目标重新评估了它。我们与利益相关者一起决定我们将优先考虑哪种公平定义。”
区别在于:强方法并不隐藏在一般指标后面,它将子组分开并将公平视为公开决策。
道德和透明度
负责任的人工智能的核心原则是:
- 可解释性:能否解释模型做出此决定的原因?在影响重大的决策(信贷、招聘、医疗保健)中,人们有权获得解释。无法解释的模型不应在这些领域中使用,或者应由可解释的方法支持。
- 人类监督:高影响力的决策不应自动做出;模型表明,人类证实。
- 责任:当模型出错时,应该明确谁负责。 “模型决定”不是借口。
- 透明度:用户应该知道他们正在与人工智能交互以及他们的数据是如何使用的。
在许多国家和部门,这些原则也被纳入立法(高风险人工智能系统的透明度、审计和人工监督义务)。工程师有责任了解其领域的法规。
提示:为每个高影响力模型保留一张“模型卡”:模型的用途、训练数据、模型在哪些组中的表现如何、其已知的限制是什么。该文件既是透明度又是问责工具。
成本和可持续性
人工智能并不便宜。成本管理有两个维度:
财务成本:
- 代币成本(LLM):每个请求和响应都需要花费代币;随着数量的增加,账单也随之增加。不必要的长提示、过大的模型选择和不受控制的代理循环(第 5 单元)会增加成本。
- 培训和托管:微调和模型演示会产生硬件成本。
- 优化:小模型够用就不用大模型;缓存常见问题;缩短提示;对可以处理的内容进行批处理。
环境成本:大型模型训练和推理会消耗大量能源。可持续性使得避免不必要的计算(正确的尺寸模型、高效的架构)成为一项专业责任。
提示:成本优化的第一条规则:“这项工作的最小适当模型是什么?”将最强大的模型放在任何地方就像用大锤敲钉子一样——昂贵且不必要。
三个迷你箱子
案例1——隐藏的歧视。招聘筛选模型总体看起来不错。亚组分析发现,该模型系统地强调了女性候选人,因为历史数据以男性为主——它已经学会了历史偏见。该模型已停止,数据平衡,并监控公平性指标。普遍的正义掩盖了隐藏的歧视。
案例 2 - 不明原因的拒绝。信用模型拒绝了申请,但没有人能解释原因。当客户要求法律澄清时,团队无法回应。该模型已不再用于高影响力的决策,直到添加了可解释的方法并为每次拒绝提供了理由。教训:可解释性对于高影响力的决策至关重要。
案例 3 - 比尔休克。一个团队使用最大的法学硕士,并且针对每个请求都有很长的提示。每月的账单意外增长。事后分析:大部分请求可以用小模型解决,一半提示是多余的,常见问题可以缓存。这三项优化在不影响质量的情况下显着降低了成本。教训:最强大的模型并非在任何地方都必要。
可复制模板
帮助我评估这个模型的偏见/公平性。我应该划分和衡量哪些子群体(人口/细分)?我应该比较哪些指标(准确率、召回率、按组划分的误报率)?公平的不同定义是否会发生冲突,在这种情况下我应该优先考虑哪个,为什么?模型/决策上下文:[解释]
为这个高影响力模型制作模型卡草稿。应包括:目的、培训数据和日期、分组表现、已知限制、适当/不适当使用、可解释性状态、人工监督点。型号:【说明】
帮助我降低这个LLM实现的成本,而不影响质量。可用:模型大小、平均提示长度、请求量、是否有缓存?评估:1)较小的模型是否足够(对于哪些任务)?2)提示是否可以缩短?3)频繁的请求是否可以缓存?4)是否有可用于批量的工作?写下每个建议的估计影响。
为这个高影响力的决策系统制定道德/责任清单。- 可解释性:是否可以提出决策的理由?- 人为监督:高影响力的决策是否需要批准?- 问责制:出现错误时谁负责?- 透明度:用户是否知道正在使用人工智能?- 监管:涉及哪些法律义务?系统:[描述]
偏差源表
来源
症状
预防措施
历史偏见
过去的歧视仍在继续
数据审核+公平指标
代表性偏差
小样本组准确率低
亚组分析+平衡
测量偏差
带有偏见的标签
标签流程审核
聚合偏差
宇宙没有被代表
资源多元化
常见错误
- 依赖于整体指标。如果不进行亚组分析,就无法发现隐藏的歧视。
- 假设“模型中立”。该模型学习并放大数据中的偏差。
- 将具有高影响力的决策留给无法解释的模型。法律和道德风险。
- 绕过人类监督。 “模型决定”不是借口。
- 到处都放着最大的模型。不必要的成本和能源。
- 不跟踪成本。账单悄然膨胀。
综上所述
如果技术上正确的模型不公平、不可解释且不可持续,那么它仍然是失败的。偏差主要来自数据,模型将其放大;按小组衡量公平性,并与利益相关者就公平性的优先定义达成一致。可解释性、人工监督和问责制对于高影响力的决策至关重要;使用模型卡记录透明度。管理成本和能源:选择最小的适当模型,缩短提示,使用缓存和批处理。这些尺寸是工程质量的组成部分,而不是后来添加的装饰。
应用任务
将模型分为至少两个子组,并按组比较召回率和误报率;如果有显着差异,请写出原因和注意事项。为高影响力模型起草一份简短的模型卡(目的、数据、分组表现、边界、可解释性)。确定至少两个具体优化(最小/提示截断/缓存/批量)以降低实施 LLM 的成本并写下其估计影响。
清单
- [ ] 我根据子组评估模型,没有依赖一般指标。
- [ ] 我与利益相关者决定优先考虑哪种正义定义。
- [ ] 高影响力的决策是可以解释的并且需要人们的批准。
- [ ] 我用图案卡记录了透明度和边界。
- [ ]我选择了最小的合适模型;我优化了提示/缓存/批处理。
- [ ] 我监控成本和能源影响。