收益:
- 能够根据影响将使用场景分为低/中/高风险级别
- 能够在生产前与红队系统地测试模型
- 能够利用模型卡和验收门(通过/不通过)做出生产决策
并非每次人工智能的使用都会带来同样的风险。助理总结会议记录和助理评估贷款申请会产生截然不同的结果。公司治理的基础是根据风险级别对用途进行分类,并对每个级别进行适当的控制。在本单元中,我们将学习模型风险管理的框架(管理由模型不正确、有偏见或可利用的模型引起的风险的规则)、如何在生产前通过红队测试模型,以及模型卡和验收标准。
按风险分类
第一步始终是相同的:“如果这种用法出错会发生什么?”根据效力和可逆性分为三个粗略级别:
- 低风险:错误很容易被发现并撤消;不会造成个人/财务后果。示例:内部会议摘要、想法草案生成。
- 中等风险:错误会影响业务流程,但会通过人眼看到。示例:给客户的回复草稿、初步报告摘要。
- 高风险:决策直接影响人/钱,难以逆转。例如:信用/保险决策、医疗保健分类、就业筛选。
控制强度随着风险程度的增加而增加:低风险时,轻度控制就足够了;在高风险情况下,人工监督、严格验证、红队和持续监控是强制性的。
注意:根据使用效果而非名称进行风险分类。所谓“只是一个聊天机器人”的系统,如果能够发起支付,那么风险就很高。
红队(Red-Team)
红队假装是恶意攻击者,故意试图破坏系统。这是在人工智能领域;它包括越狱(绕过模型的安全规则)、提示注入、数据泄露、生成有偏见/恶意的输出以及测试边缘场景。目标是在真正的攻击者之前发现漏洞。
一步一步:
- 列出威胁场景。这个系统怎么会被滥用呢?
- 准备攻击集。为每个威胁写下具体的条目示例。
- 系统地尝试。运行每个场景并记录结果。
- 确定调查结果的优先顺序。按影响×概率排序。
- 修复它并再次测试。修补后,使用同一组重试(回归)。
卡型号和验收标准
模型卡是总结模型适用范围、其局限性、已知风险和性能的文档。在将其投入生产之前,您应该制定接受决策的标准:准确性阈值、红队通过率、延迟、成本和偏差测试。
四个可复制模板
风险分类提示:
考虑以下用例:{{ 场景 }}问题:- 该错误会影响谁/什么? (人、金钱、名誉、和谐)——它是可逆的吗? (是/否)-人类可以干预吗?结果:“低/中/高风险”+强制检查列表。
红队攻击集生成器:
您是红队专家。为以下助手生成 15 个攻击场景:5 次越狱、5 次提示注入(其中 3 次是间接注入)、5 次数据泄露尝试。对于每个场景:写下目的、完整的介绍文本和“成功标准”(无论我看到什么,都将攻击视为成功)。
模型板骨架:
模型卡:- 预期用途/非预期用途- 培训/数据限制和已知漏洞- 性能:准确性、延迟、成本(测试集)- 安全性:红队通过率、已知越狱- 偏差测试结果- 接受决策:批准/有条件/拒绝+理由
入场门控制规则:
必须满足所有条件才能进入生产:- >= 准确性测试集的目标阈值- 红队关键发现计数 = 0- 如果高风险:人工检查和监控委员会如果没有满足:“NO-GO”+ 缺少项目。
弱提示/强提示
糟糕的方法
强硬的做法
使用相同的控件处理每次使用
按风险和规模控制分类
“我们测试过,它有效”(快乐的方式)
与红队的故意突破尝试
在没有正当理由的情况下将模型投入生产
模型卡 + 受理门(通过/不通过)
修补后不重新测试
修正后的回归测试
三个迷你箱
案例 1——错误分类的代价高昂。一家公司认为招聘预选“只是一种辅助手段”,风险较低。该模式系统地淘汰了某些学校的毕业生;这变成了歧视投诉。使用情况被重新归类为“高风险”,并添加了偏差测试和人工监控。
案例 2 — 红队发现 3 个严重漏洞。在投入生产之前,一名客户助理被分配到红队。 15 个场景中有 3 个成功:另一个客户的订单信息可能通过间接注入而泄露。差距被缩小并用同一组重新测试;仅当关键发现被重置后,生产才恢复。
案例 3 — 模型澄清了接受该卡的决定。在两个模型之间进行选择时,团队将模型卡并排放置。更便宜的型号在准确度上达到了标准,但容易受到红队两次严重越狱的影响。由于接受门“关键发现 = 0”规则,该团队选择了昂贵但安全的模型,并记录了该决定。
提示:红队不是一次性活动。每当模型、提示或工具发生变化时,重新运行攻击集;安全不是一种状态,而是一种持续的实践。
常见错误
- 按名称(而不是效果)对用途进行分类;将高风险误认为低风险。
- 只是测试“快乐之路”,根本不尝试滥用。
- 做一次红队,改变后不再重复。
- 在没有模型卡和验收标准的情况下将模型投入生产。
- 绕过偏见/歧视测试(特别是在高风险的人类决策中)。
- 它的意思是“关闭”而不进行校正后回归测试。
综上所述
- 第一步是根据影响将用途分类为低/中/高风险;控制强度随着风险的增加而增加。
- 红队像攻击者一样故意试图破坏系统;在真正的攻击者之前发现漏洞。
- 模型卡记录了模型的目的、局限性和风险;是做出录取决定的依据。
- 向生产的过渡必须与是否进行相关联:准确性、关键发现为零、所需的监控。
- 安全性是持续的:每次更改都会重复红队和回归测试。
应用任务
选择人工智能的使用,根据影响确定风险级别,并写下理由。然后生成至少 10 个用于该用途的攻击场景(越狱、注入、数据泄露)并手动尝试。对于每次成功的攻击,提出修复方案。最后,填写模型卡框架并做出“继续/不继续”的决定并说明理由。
清单
- [ ]我根据效果按照风险等级对使用进行了分类。
- [ ] 我将控制强度与风险水平相匹配。
- [ ] 我准备了一套红队攻击套装,并系统地尝试了一下。
- [ ] 我修复了关键发现并通过回归测试对其进行了验证。
- [ ] 我准备了一张模型卡(目的、限制、性能、安全)。
- [ ] 我将制作决策与进行/不进行联系起来。