收益:
- 能够通过集成、敏感性分析、交叉验证和盲测来测量和报告不确定性
- 能够通过按井/油田分离数据来防止数据泄漏,并确保报告的准确性反映真正的概括。
- 能够使用可靠性图校准人工智能信任分数,并遵守不使用未校准分数作为概率的原则
本模块的每个单元都有一个反复出现的主题:地球物理学中没有“确定的答案”,只有受不确定性限制的模型。本单元将该主题转变为一门学科。模型不确定性是指存在可以解释相同数据的不同地下模型,并且每个模型都有一个置信区间。验证是用独立证据测试模型或人工智能输出是否确实有效。校准是为了确保模型给出的置信度/概率值与实际结果匹配。在本单元中,我们将研究人工智能 (AI) 如何测量和隐藏不确定性;我们将会看到为什么可靠的验证校准框架使人工智能变得可靠。
不确定性的来源
地球物理不确定性来自几个层面:
- 数据不确定性:测量噪声、有限覆盖范围、校准误差。
- 模型不确定性(一词多义):将多个地下结构拟合到相同的数据。
- 方法/参数不确定性:处理、反演和正则化选择会改变结果。
- AI 特有的不确定性:模型保持自信的能力,但在超出训练分布(分布转移)时会失败。
一名优秀的地球物理学家的工作不是消除这种不确定性,而是测量、沟通和缩小不确定性。人工智能可以使这变得容易(生成多个场景),但也可以通过生成一个自信的答案来轻松隐藏它。
衡量不确定性的方法
一些实用的工具:
- 集成:具有不同启动、参数或模型的多次运行;结果的传播带来了不确定性。
- 敏感性分析:更改输入(参数、数据子集)并查看结果变化量。
- 交叉验证:将数据分成几部分,用一部分进行训练,另一部分进行测试;衡量泛化能力。
- 盲测:使用训练中从未见过的独立井/油田来测试模型。
- 概率输出:将结果提供为分布/置信区间,而不是单个值。
提示:当人工智能给出结果时,总是问:“我需要在输入中移动什么以及多少才能改变这个结果?”如果结果随着一个小的参数变化而逆转,那么该结果是脆弱的并且不确定性很高。
校准:置信度分数是否成立?
AI 模型通常会给出置信度/概率(“90% 错误”)。但如果未经校准,这个数字就会产生误导:在它所说的“90%”的情况下,该模型实际上大约有 60% 是正确的。校准就是使这个数字与实际结果率保持一致。在实践中,绘制了一个可靠性图:一个经过良好校准的模型,当它说“90%”时,确实是90%正确。在地球物理学中,在将AI置信度分数作为决策依据之前,必须用独立数据来校准AI置信度分数。
注意:高精度并不等于良好的校准。模型可能大体上是准确的,但过于自信;在关键决策中重要的是,当它说“95%”时,它才是真正可靠的。不要将未校准的置信度分数视为概率。
验证的黄金规则
对于稳健的验证:(1)独立性——测试数据根本不应该干扰训练/调整过程(数据泄漏——夸大结果)。 (2) 盲测——模型看不到的现场/井。 (3)物理一致性——结果不应与物理学和地质学相矛盾。 (4) 再现性——相同的输入得到相同的结果,并且可以由其他人产生。 (5) 文档——记录使用了什么数据、哪个参数、哪个模型版本。
三个迷你箱子
案例 1——数据泄露谬误。一个团队报告称,相分类器的准确率达到 94%。调查显示,来自同一井的相邻样本同时参与了训练和测试(数据泄漏)。当按井细分时,准确率下降到 71%——这才是真正的概括。泄漏使模型看起来比实际情况更好。
案例 2 — 过度自信的模型。一台故障检测器对其迹象给出了“95% 的置信度”。可靠性图显示“95%”的标记实际上准确率为 70%。一旦模型被校准,置信度分数就变得现实,评论员正确地调整了他们对每个标志的信任程度。
情况 3 — 脆性倒转。重力模型看起来非常有说服力。敏感性分析表明,当正则化权重改变20%时,主要结构消失:结构不是来自数据,而是来自参数选择。该团队将该结构标记为“低可信度”并要求提供更多数据。
四个可复制模板
1) 不确定度测量方案:
您的角色:地球物理不确定性顾问。我有一个[反演/分类/预测]结果。我应用哪些方法(集成、灵敏度、交叉验证、盲测)来测量不确定性以及按什么顺序?解释每个人告诉我的内容以及如何报告结果。
2)校准检查:
我的人工智能模型给出了置信度/概率分数。如何测试这个分数是否经过校准?如何构建可靠性图,识别“过度自信”或“过度谨慎”并将分数与实际结果率保持一致?
3)数据泄露审计:
我训练了一个地球物理分类器。如何发现并防止数据泄漏的风险(同一井/现场样本同时进入训练和测试)?如何按井/田设置分离?我如何知道报告的准确性是否反映了真实的概括?
4)结果脆性测试:
我有一个反演/模型结果。我想了解这个结果有多么脆弱。通过改变哪些参数以及主要结构改变了多少?如何区分结构是来自数据还是参数/前提?给出敏感性方案。
弱提示/强提示
弱提示:
看看我的模型是否具有高精度。
单一真值数;泄漏隐藏了校准和泛化,给出了错误的信心。
强力提示:
您的角色:模型验证专家。输入:[分类器生成 N 个井,置信度分数]。任务:(1)提出基于良好的分配以防止数据泄漏; (2)安装盲井测试; (3)用可靠性图校准置信度得分; (4)测试结果对参数的敏感程度。减少到单个真值;分别报告概括性、校准性和脆弱性。
泄漏、盲测、校准和灵敏度要求使验证更加诚实。
不确定性工具
车辆
它测量什么?
主要风险
输出
合奏团
模型传播
账户费用
范围/分布
灵敏度
参数效果
错过输入
脆弱性
交叉验证
概括
数据泄露
现实的准确性
盲测
独立的成功
测试集不足
信任
校准
相信现实
过度自信
对齐概率
常见错误
- 没有注意到数据泄露。它夸大正义;按井/田分开。
- 使用置信度得分而不对其进行校准。 “90%”实际上可能不是90%。
- 依赖于单一真值数。概括和校准是两个不同的事情。
- 不测试漏洞。参数丢失的结构并不是真实的信息。
- 不报告不确定性。在没有置信区间的情况下呈现结果会产生误导。
综上所述
不确定性是地球物理学无法根除的事实。工作就是衡量它、沟通它并缩小范围。人工智能通过集成、灵敏度和概率输出来促进这一点,但也可以用一个自信的答案来掩盖它。坚固的框架;防止数据泄露,通过盲测衡量泛化能力,校准置信度分数,并测试结果的脆弱性。未经校准的信任、未经验证的真实性和隐藏的不确定性是三种最危险的幻想。可靠的地球物理学是诚实地证明其不确定性的地球物理学。
应用任务
选择AI地球物理结果(分类、反演或预测)。使用“不确定性测量计划”模板规划集成/灵敏度/盲测试步骤。然后使用“数据泄漏审核”模板测试您的训练与测试区别。如果模型给出了置信度分数,请使用“校准检查”模板评估该分数是否真实,并用置信区间写下结果。
清单
- [ ] 我用整体/灵敏度测量了不确定性。
- [ ] 我通过按井/油田分离数据来防止数据泄漏。
- [ ] 我通过盲测测试了泛化能力。
- [ ] 我校准了置信度分数并检查了其真实性。
- [ ] 我用置信区间报告结果,而不是单个值。