Прибуток:
- Можливість вимірювання та звітування про невизначеність за допомогою ансамблю, аналізу чутливості, перехресної перевірки та сліпого тестування
- Здатність запобігати витоку даних, розділяючи їх на основі свердловини/родовища, і гарантувати, що повідомлена точність відображає справжнє узагальнення.
- Здатність відкалібрувати оцінку довіри штучного інтелекту за допомогою діаграми надійності та застосувати дисципліну щодо невикористання некаліброваної оцінки як ймовірності
У кожному розділі цього модуля є повторювана тема: у геофізиці немає «впевнених відповідей», є лише моделі, обмежені невизначеністю. Цей підрозділ перетворює цю тему на дисципліну. Невизначеність моделі — це існування різних моделей надр, які можуть пояснити ті самі дані, і кожна модель має довірчий інтервал. Валідація — це перевірка за допомогою незалежних доказів того, чи дійсно модель або результати штучного інтелекту є дійсними. Калібрування полягає в тому, щоб переконатися, що значення достовірності/ймовірності, надані моделлю, відповідають фактичним результатам. У цьому розділі ми розглянемо, як штучний інтелект (ШІ) може як вимірювати, так і приховувати невизначеність; і ми побачимо, чому надійна система перевірки та калібрування робить ШІ надійним.
Джерела невизначеності
Геофізична невизначеність виникає з кількох рівнів:
- Невизначеність даних: шум вимірювання, обмежене покриття, помилка калібрування.
- Невизначеність моделі (полісемія): підгонка більш ніж однієї підповерхневої структури до тих самих даних.
- Невизначеність методу/параметра: вибір обробки, інверсії та регуляризації змінює результат.
- Невизначеність, характерна для штучного інтелекту: здатність моделі залишатися впевненою, але зазнавати невдачі, коли вона виходить за межі розподілу навчання (зрушення розподілу).
Робота хорошого геофізика полягає не в тому, щоб усунути цю невизначеність, а в тому, щоб виміряти, повідомити та звузити її. ШІ може зробити це легко (генеруючи кілька сценаріїв), але також може легко приховати це, видавши одну впевнену відповідь.
Способи вимірювання невизначеності
Кілька практичних інструментів:
- Ансамбль: кілька запусків з різними стартами, параметрами або моделями; Розкид результатів створює невизначеність.
- Аналіз чутливості: зміна вхідних даних (параметра, підмножини даних) і перегляд того, наскільки змінився результат.
- Перехресна перевірка: розділення даних на частини, навчання з однією частиною та тестування з іншою; Вимірює потужність узагальнення.
- Сліпе тестування: тестування моделі за допомогою незалежної свердловини/родовища, яку вона ніколи не бачив під час навчання.
- Імовірнісний результат: надання результату як розподілу/довірчого інтервалу, а не окремого значення.
Порада: коли AI видає результат, завжди запитуйте: «Що і скільки мені потрібно перемістити у вхідних даних, щоб змінити цей результат?» Якщо результат змінюється з невеликою зміною параметра, цей результат є крихким, а невизначеність високою.
Калібрування: чи відповідає оцінка впевненості?
Моделі AI часто дають впевненість/ймовірність («90% помилка»). Але це число вводить в оману, якщо воно не відкаліброване: модель насправді правильна, можливо, у 60% випадків, як вона каже, що це «90%». Калібрування полягає в узгодженні цього числа з фактичним показником результату. На практиці складається діаграма надійності: добре відкалібрована модель справді на 90% права, коли написано «90%». У геофізиці дуже важливо відкалібрувати оцінку впевненості штучного інтелекту за допомогою незалежних даних, перш ніж зробити це основою для прийняття рішення.
Застереження: Висока точність не означає хороше калібрування. Модель може бути загалом точною, але занадто самовпевненою; Важливим у критичних рішеннях є те, що воно справді надійне, коли написано «95%». Не розглядайте некалібрований показник достовірності як ймовірність.
Золоті правила перевірки
Для надійної перевірки: (1) Незалежність — тестові дані взагалі не повинні заважати процесу навчання/налаштування (витік даних — завищує результат). (2) Сліпий тест — поле/колодязь, які модель не бачить. (3) Фізична узгодженість — результат не повинен суперечити фізиці та геології. (4) Відтворюваність — той самий результат з тими самими вхідними даними, який може отримати хтось інший. (5) Документація — запис того, які дані, який параметр, яка версія моделі використовувалася.
три міні-чохла
Випадок 1 — Помилка витоку даних. Одна команда повідомила, що класифікатор фацій дав 94% точності. Розслідування показало, що сусідні зразки з однієї свердловини брали участь як у навчанні, так і в тестуванні (витік даних). Якщо розбити на добре, точність впала до 71% — це було справжнє узагальнення. Витік змусив модель виглядати краще, ніж вона була насправді.
Випадок 2 — Надто самовпевнена модель. Один дефектоскоп дав «95% впевненості» в своїх ознаках. Діаграма надійності показала, що позначки «95%» насправді були точними на 70%. Після калібрування моделі показники впевненості стали реалістичними, і коментатори правильно відкоригували, наскільки вони будуть довіряти кожному знаку.
Випадок 3 — Крихка інверсія. Гравітаційна модель виглядала дуже переконливо. Аналіз чутливості показав, що основна структура зникла, коли вага регуляризації змінилася на 20%: структура виникла не з даних, а з вибору параметра. Команда позначила структуру як «низьку надійність» і запросила додаткові дані.
Чотири шаблони, які можна копіювати
1) План вимірювання невизначеності:
Ваша роль: консультант з питань геофізичної невизначеності. У мене є результат [інверсії/класифікації/прогнозування]. Які методи (ансамбль, чутливість, перехресна перевірка, сліпий тест) я застосовую для вимірювання невизначеності та в якому порядку? Поясніть, що кожен із них говорить мені, і як повідомити про результат.
2) Перевірка калібрування:
Моя модель ШІ дає оцінку достовірності/ймовірності. Як перевірити, чи цей бал відкалібрований? Як побудувати діаграму надійності, розпізнати «надмірну самовпевненість» або «надмірну обережність» і узгодити оцінку з фактичним показником результату?
3) Аудит витоку даних:
Навчив геофізичного класифікатора. Як знайти та запобігти ризику витоку даних (одні й ті самі зразки свердловин/поля, що надходять як для навчання, так і для тестування)? Як налаштувати поділ за свердловиною/родовищем? Як дізнатися, чи повідомлена точність відображає справжнє узагальнення?
4) Результат тестування крихкості:
У мене є результат інверсії/моделі. Я хочу зрозуміти, наскільки крихкий цей результат. При зміні яких параметрів і наскільки змінюється основна структура? Як розрізнити, чи структура походить від даних чи параметрів/приміщення? Наведіть протокол чутливості.
Слабка підказка / Сильна підказка
Слабка підказка:
Подивіться, чи висока точність моєї моделі.
Єдине число істинності; витік приховує калібрування та узагальнення, надаючи помилкову впевненість.
Потужна підказка:
Ваша роль: експерт з перевірки моделі. Вхідні дані: [класифікатор генерує N добре, оцінки достовірності]. Завдання: (1) запропонувати добре обґрунтований розподіл проти витоку даних; (2) встановити сліпе тестування свердловин; (3) відкалібрувати показник довіри за допомогою діаграми надійності; (4) перевірити, наскільки чутливим є результат до параметра. Зведення до єдиного істинного числа; Узагальнення, калібрування та крихкість повідомте окремо.
Витік, сліпе тестування, калібрування та запит на чутливість роблять перевірку чесною.
Інструменти невизначеності
транспортний засіб
Що це вимірює?
Основний ризик
вихід
ансамбль
Розповсюдження моделі
Вартість рахунку
Діапазон/поширення
Чутливість
Ефект параметра
Пропущений вхід
Крихкість
перехресна перевірка
узагальнення
витік даних
реалістична точність
сліпий тест
самостійний успіх
Недостатній набір тестів
довіра
Калібрування
довіряти реальності
надмірна самовпевненість
вирівняна ймовірність
Поширені помилки
- Не помічаючи витоку даних. Він надуває праведність; Окремо колодязь/поле.
- Використання показника достовірності без його калібрування. «90%» насправді може бути не 90%.
- Покладаючись на єдине число істини. Узагальнення та калібрування – це дві різні речі.
- Не тестування вразливості. Структура, втрачена параметром, не є реальною інформацією.
- Не повідомляє про невизначеність. Подання результату без довірчого інтервалу вводить в оману.
Підсумовуючи
Невизначеність є невикорінним фактом геофізики; завдання полягає в тому, щоб виміряти це, повідомити про це та звузити його. ШІ полегшує це завдяки сукупності, чутливості та ймовірнісним результатам, але також може замаскувати це за допомогою однієї впевненої відповіді. Міцний каркас; запобігання витоку даних, вимірювання узагальнення за допомогою сліпого тестування, калібрування оцінки довіри та тестування крихкості результату. Невивірена довіра, неперевірена правдивість і прихована невпевненість — три найнебезпечніші ілюзії. Надійна геофізика - це та геофізика, яка чесно демонструє свою невизначеність.
Аплікаційне завдання
Виберіть геофізичний результат AI (класифікація, інверсія або прогноз). Сплануйте етапи тестування ансамблю/чутливості/сліпого тестування за допомогою шаблону «План вимірювання невизначеності». Потім перевірте свою відмінність у тренуванні за допомогою шаблону «Аудит витоку даних». Якщо модель дає оцінку довіри, оцініть, чи ця оцінка реалістична, за допомогою шаблону «Перевірка калібрування» та запишіть свій результат із довірчим інтервалом.
контрольний список
- [ ] Я вимірював невизначеність за допомогою ансамблю/чутливості.
- [ ] Я запобіг витоку даних, розділивши їх на основі свердловини/родовища.
- [ ] Я перевірив узагальнення за допомогою сліпого тесту.
- [ ] Я відкалібрував показник впевненості та перевірив його реалістичність.
- [ ] Я повідомив результат із довірчим інтервалом, а не з одним значенням.