收益:
- 能够定义监控使用情况、安全性、质量和性能信号的指标
- 能够通过基线和采样检测输出质量漂移
- 能够针对异常情况和越狱波设置警报和反馈循环
将人工智能系统投入生产只是开始,而不是结束。即使模型保持不变,世界也会发生变化:用户行为、传入数据、攻击技术和业务环境都在不断变化。昨天的正确答案今天可能是错误的。因此,安全的最后一个支柱是持续监控和可观察性,即从外部了解系统内部发生情况的能力。在本单元中,我们将学习要监控哪些指标、如何捕获输出质量漂移以及如何发出异常警报。
为什么要持续监控?
在经典软件中,“它能工作吗”是一个二元问题:要么能回答,要么不能。在人工智能中,虽然系统看起来“有效”,但它可能会悄然恶化:答案慢慢变得不准确,成本上升,越狱尝试增加。捕获这些信号的唯一方法是不断测量正确的信号。
注意:最危险的故障是无声的故障,而不是吵闹的故障。系统不会抛出错误,它的质量只是下降。如果您不设置监控,那么第一个注意到的人将是您的客户或审核员,而不是您。
值得关注的四个信号系列
- 使用和成本:请求量、令牌消耗、每个用户的成本。突然跳跃;这可能是滥用、循环集成或开关泄漏的迹象。
- 安全信号:越狱/注入尝试、车辆呼叫被拒绝、授权错误。增加可能表明存在积极的攻击活动。
- 质量和漂移:输出质量随着时间的推移而下降(漂移)。例如验证通过率、人工审批纠正率、用户满意度等。
- 性能:延迟、错误率、超时。它直接影响用户体验和成本。
什么是漂移以及如何捕捉它?
漂移是指模型输入或输出的质量随着时间的推移而发生未被注意到的变化。有两种类型:数据漂移(传入请求的分布发生变化 - 新主题、新语言)和质量漂移(同一作业的输出逐渐变差)。需要一个基线来捕获: 记录系统健康时指标的正常范围;让偏差成为警报。
一步一步:设置监控
- 测量基线。记录系统健康时各信号的正常范围。
- 定义阈值和警报。哪种偏差会警告谁以及如何警告?
- 抽样+人工检查。让人工定期检查输出样本(质量漂移通常是可见的)。
- 安装仪表板。在一个屏幕上监控四个信号系列。
- 反馈循环。将监测结果与提示/控制改进联系起来。
四个可复制模板
质量抽样评估提示(以法学硕士为评委进行漂移跟踪):
以下是本周 20 个随机打印的内容。将每个评价为“好/可接受/差”并写下简短的理由。最后我将不良率与上周的不良率进行比较;如果本周存在突出的模式(同一类型错误的重复出现),请标记它。<outputs>{{ Examples }}</outputs>
异常总结提示:
检查以下日常指标:请求数量、令牌、成本、工具调用被拒绝、越狱尝试、平均延迟。将偏离基线超过 30% 的任何指标标记为“异常”,并估计可能的原因(攻击、错误、滥用)。<metrics>{{ daily_data }}</metrics>
报警阈值定义规则:
为每个信号定义警报:- 成本:如果超过每日平均值的 2 倍 -> 高优先级警报 - 越狱尝试:如果超过每小时 10 次 -> 通知安全团队 - 验证通过率:如果低于 90% -> 质量审核 - 延迟:如果 p95 超出目标 2 倍 -> 性能审核
漂移研究提示:
过去两周,验证通过率从 94% 下降到 78%。帮我回答以下问题: (1) 传入的请求中是否出现了新的主题/语言/格式? (2) 错误是否集中在某一特定类别? (3) 时机是否与提示/型号/工具变更一致?为每个数据指定要检查的数据。
弱提示/强提示
糟糕的方法
强硬的做法
“如果有错误,我们会看到”
基线+阈值+主动报警
只是检查系统是否正常运行。
监控四个信号系列(使用情况、安全性、质量、性能)
根本不对输出质量进行采样
定期人体采样+法学硕士作为法官
不收集和查看指标
仪表板+反馈循环
三个迷你箱
案例 1 — 成本警报发现钥匙泄漏。一家公司的日常代币成本一夜之间增加了两倍。阈值警报向安全团队发出警报;调查显示测试密钥已泄露并被机器人使用。 25分钟后密钥被撤销;如果没有警报,帐单月底就会被注意到。
案例 2 — 无声质量漂移。一名支持助理的验证通过率在三周内从 95% 悄悄下降到 80%。每周抽样记录了这一点;原因是客户开始询问新产品线,而模型的知识库不完整。当知识库更新时,该比率恢复。
案例3——越狱浪潮来得很早。一天之内,助理的注射尝试次数从每小时 2 次增加到 40 次。安全警报触发;有人看到,某论坛上分享了破解该系统的“秘方”。团队更新了防御提示和可疑账户限速;波浪在变成真正的泄漏之前就消失了。
提示:不要仅仅满足于机器指标。质量漂移通常只需让人读取样本输出即可发现。每周检查 15-20 个随机打印输出的小例程将尽早发现最昂贵的无声故障。
常见错误
- 不将其投入生产并设置监控(“它正在工作,好吧”)。
- 如果不测量基线就无法识别异常。
- 只看“它是否站得住”就错过了质量漂移。
- 根本不通过人眼对输出质量进行采样。
- 没有发出警报并从客户/主管那里找出问题。
- 没有将监测结果与改进联系起来(没有反馈循环)。
综上所述
- 人工智能系统可能会悄悄恶化;最危险的故障不会引发错误,但只会降低质量。
- 跟踪四个信号系列:使用/成本、安全、质量/漂移和性能。
- 仅捕获与基线相比的漂移(输入或输出质量随时间的漂移)。
- 除了机器指标之外,定期进行人体采样可以捕获质量漂移。
- 将监控连接至报警和反馈回路;测量而不观察就不是监控。
应用任务
从四个信号系列中的每一个中为您自己的 AI 系统至少选择一个指标,并写下它们当前(或估计)的基线。为每个指标定义警报阈值。然后取出你上学期的 15 份成果,并根据上面的抽样提示对它们进行评分;注意“坏”率。让它成为您将来比较漂移的第一个基准。
清单
- [ ] 我定义了四个信号系列的指标(使用、安全、质量、性能)。
- [ ] 我为每个指标设置了基线和警报阈值。
- [ ] 我定期通过人眼对输出质量进行采样。
- [ ] 我用显示面板在单个屏幕上监控信号。
- [ ] 向安全团队发出异常和越狱浪潮警报。
- [ ] 我将监测结果归因于提示/控制的改进。