Jedinica 10 / 11

Nesigurnost modela, validacija i kalibracija

Dobici:

  • Sposobnost mjerenja i izvješćivanja o nesigurnosti s kompletom, analizom osjetljivosti, unakrsnom validacijom i slijepim testiranjem
  • Sposobnost da se spriječi curenje podataka odvajanjem na osnovu bunara/polja i osigura da prijavljena tačnost odražava pravu generalizaciju.
  • Sposobnost kalibracije rezultata povjerenja umjetne inteligencije s dijagramom pouzdanosti i primjene discipline nekorištenja nekalibriranog rezultata kao vjerovatnoće

U svakoj jedinici ovog modula postoji tema koja se ponavlja: u geofizici nema "sigurnih odgovora", samo modeli ograničeni neizvjesnošću. Ova jedinica pretvara tu temu u disciplinu. Nesigurnost modela je postojanje različitih podzemnih modela koji mogu objasniti iste podatke i svaki model nosi interval povjerenja. Validacija je testiranje neovisnim dokazima da li je model ili AI izlaz zaista valjan. Kalibracija je da se osigura da vrijednosti pouzdanosti/vjerovatnosti koje daje model odgovaraju stvarnim rezultatima. U ovoj jedinici ćemo ispitati kako umjetna inteligencija (AI) može i mjeriti i sakriti neizvjesnost; i videćemo zašto čvrst okvir verifikacije-kalibracije čini AI pouzdanom.

Izvori neizvjesnosti

Geofizička nesigurnost dolazi iz nekoliko slojeva:

  • Nesigurnost podataka: buka mjerenja, ograničena pokrivenost, greška kalibracije.
  • Nesigurnost modela (polisemija): Prilagođavanje više od jedne podzemne strukture istim podacima.
  • Nesigurnost metoda/parametara: Izbori obrade, inverzije i regularizacije mijenjaju ishod.
  • Nesigurnost specifična za AI: Sposobnost modela da ostane samouvjeren, ali ne uspije kada se pomakne izvan distribucije obuke (promjena distribucije).

Posao dobrog geofizičara nije da otkloni ovu nesigurnost, već da je izmjeri, komunicira i suzi. AI to može učiniti lakim (generiranje više scenarija), ali ga također može lako sakriti tako što će dati jedan pouzdan odgovor.

Načini mjerenja nesigurnosti

Nekoliko praktičnih alata:

  1. Ansambl: više pokreta s različitim startovima, parametrima ili modelima; Širenje rezultata daje nesigurnost.
  2. Analiza osjetljivosti: Promjena ulaza (parametar, podskup podataka) i gledanje koliko se rezultat mijenja.
  3. Unakrsna validacija: Podjela podataka na dijelove, obuka s jednim dijelom i testiranje s drugim; Mjeri snagu generalizacije.
  4. Slijepi test: Testiranje modela sa nezavisnom bušotinom/poljom koje nikada nije vidio u obuci.
  5. Probabilistički izlaz: pružanje rezultata kao interval distribucije/povjerljivosti, a ne pojedinačne vrijednosti.
Savjet: Kada AI daje rezultat, uvijek pitajte: "Šta i koliko trebam pomaknuti u unosu da promijenim ovaj rezultat?" Ako se rezultat obrne s malom promjenom parametara, taj rezultat je krhak i neizvjesnost je velika.

Kalibracija: da li je rezultat pouzdanosti istinit?

AI modeli često daju pouzdanost/vjerovatnost (“90% greške”). Ali ovaj broj je pogrešan ako nije kalibriran: model je zapravo ispravan u možda 60% slučajeva za koje kaže da je "90%". Kalibracija je da se ovaj broj uskladi sa stvarnom stopom rezultata. U praksi se crta dijagram pouzdanosti: dobro kalibrirani model je zaista 90% u pravu kada kaže "90%". U geofizici je bitno kalibrirati rezultat AI pouzdanosti s nezavisnim podacima prije nego što to postane osnova za odluku.

Oprez: Visoka preciznost nije isto što i dobra kalibracija. Model može biti općenito tačan, ali previše samouvjeren; Važna stvar u kritičnim odlukama je da je zaista pouzdano kada kaže "95%". Ne kalibrirani rezultat pouzdanosti ne tretirajte kao vjerovatnoću.

Zlatna pravila verifikacije

Za robusnu verifikaciju: (1) Nezavisnost — podaci testa uopšte ne bi trebalo da ometaju proces obuke/podešavanja (curenje podataka — naduvava rezultat). (2) Slijepi test — polje/bunar koji model ne vidi. (3) Fizička konzistentnost — rezultat ne bi trebao biti u suprotnosti sa fizikom i geologijom. (4) Reproducibilnost — isti rezultat sa istim inputom, a može ga proizvesti neko drugi. (5) Dokumentacija — zapis o tome koji podaci, koji parametar, koja verzija modela je korištena.

tri mini kofera

Slučaj 1 — Zabluda o curenju podataka. Jedan tim je izvijestio da je facijalni klasifikator dao 94% tačnosti. Istraživanje je pokazalo da su susjedni uzorci iz iste bušotine bili uključeni u obuku i testiranje (curenje podataka). Kada se raščlani po bunarima, tačnost je pala na 71% — to je bila prava generalizacija. Curenje je učinilo da model izgleda bolje nego što je zapravo bio.

Slučaj 2 — Previše samopouzdan model. Jedan detektor kvara dao je "95% povjerenja" u njegove znakove. Dijagram pouzdanosti pokazao je da su oznake "95%" zapravo 70% tačne. Nakon što je model kalibriran, rezultati pouzdanosti postali su realni i komentatori su ispravno podesili koliko će vjerovati svakom znaku.

Slučaj 3 — Krhka inverzija. Gravitacijski model izgledao je vrlo uvjerljivo. Analiza osjetljivosti je pokazala da je glavna struktura nestala kada se težina regularizacije promijenila za 20%: struktura nije proizašla iz podataka, već iz odabira parametara. Tim je strukturu označio kao "nisku pouzdanost" i zatražio dodatne podatke.

Četiri šablona za kopiranje

1) Plan mjerenja nesigurnosti:

Vaša uloga: konsultant za geofizičku nesigurnost. Imam rezultat [inverzija / klasifikacija / predviđanje]. Koje metode (skupina, osjetljivost, unakrsna validacija, slijepi test) primjenjujem za mjerenje nesigurnosti i kojim redoslijedom? Objasnite šta mi svaki od njih govori i kako da prijavim rezultat.

2) Provjera kalibracije:

Moj AI model daje ocjenu pouzdanosti/vjerovatnosti. Kako da testiram da li je ovaj rezultat kalibriran? Kako da napravim dijagram pouzdanosti, prepoznam "prekomerno samopouzdanje" ili "previše opreza" i uskladim rezultat sa stvarnom stopom ishoda?

3) Revizija curenja podataka:

Obučavao sam geofizičkog klasifikatora. Kako mogu pronaći i spriječiti rizik od curenja podataka (isti uzorci bunara/polja ulaze u obuku i testiranje)? Kako da postavim odvajanje po bušotini/polju? Kako da znam da li prijavljena tačnost odražava pravu generalizaciju?

4) Rezultat ispitivanja krhkosti:

Imam rezultat inverzije/model. Želim razumjeti koliko je ovaj rezultat krhak. Promjenom kojih parametara i koliko se mijenja glavna struktura? Kako mogu razlikovati da li struktura dolazi od podataka ili parametara/premise? Dajte protokol osjetljivosti.

Slaba prompt / Jaka prompt

Slab upit:

Pogledajte da li moj model ima visoku tačnost.

Jedan istinit broj; curenje skriva kalibraciju i generalizaciju, dajući lažno povjerenje.

Snažan upit:

Vaša uloga: stručnjak za validaciju modela. Ulaz: [klasifikator generiše N dobro, rezultati pouzdanosti]. Zadatak: (1) predložiti dobro zasnovanu alokaciju protiv curenja podataka; (2) instalirati slijepo ispitivanje bunara; (3) kalibrirati rezultat pouzdanosti sa dijagramom pouzdanosti; (4) testirati koliko je rezultat osjetljiv na parametar. Redukcija na jedan istinit broj; Zasebno prijavite generalizaciju, kalibraciju i krhkost.

Zahtjevi za curenje, slijepo testiranje, kalibraciju i osjetljivost čine verifikaciju poštenom.

Alati za nesigurnost

vozilo

Šta to mjeri?

Glavni rizik

izlaz

ansambl

Propagacija modela

Troškovi računa

Raspon/distribucija

Osjetljivost

Parametarski efekat

Propušten unos

Krhkost

unakrsna validacija

generalizacija

curenje podataka

realna tačnost

slijepi test

samostalan uspeh

Nedovoljan set testova

povjerenje

Kalibracija

verovati stvarnosti

preterano samopouzdanje

usklađena vjerovatnoća

Uobičajene greške

  • Ne primjećujete curenje podataka. Ona naduvava pravednost; Odvojeno po bunaru/polju.
  • Korištenje ocjene pouzdanosti bez kalibracije. “90%” možda zapravo nije 90%.
  • Oslanjajući se na jedan istinit broj. Generalizacija i kalibracija su dvije različite stvari.
  • Ne testira se ranjivost. Struktura izgubljena parametrom nije stvarna informacija.
  • Neizvještavanje o neizvjesnosti. Predstavljanje rezultata bez intervala povjerenja je pogrešno.

Ukratko

Neizvjesnost je neiskorijenjiva činjenica geofizike; posao je izmjeriti, prenijeti i suziti. AI to olakšava ansamblom, osjetljivošću i vjerovatnoćom, ali može to i prikriti jednim samouvjerenim odgovorom. Čvrsti okvir; sprečavanje curenja podataka, mjerenje generalizacije slijepim testiranjem, kalibriranje rezultata pouzdanosti i testiranje krhkosti rezultata. Nekalibrirano povjerenje, neprovjerena istinitost i prikrivena neizvjesnost su tri najopasnije iluzije. Pouzdana geofizika je geofizika koja iskreno pokazuje svoju nesigurnost.

Zadatak aplikacije

Odaberite geofizički rezultat AI (klasifikacija, inverzija ili predviđanje). Planirajte korake testiranja ansambla/osjetljivosti/slijepog testiranja pomoću šablona "Plan mjerenja nesigurnosti". Zatim testirajte svoju razliku između testiranja voza pomoću predloška „Revizija curenja podataka“. Ako model daje ocjenu pouzdanosti, procijenite da li je rezultat realističan pomoću šablona "Provjera kalibracije" i zapišite svoj rezultat s intervalom povjerenja.

kontrolna lista

  • [ ] Mjerio sam nesigurnost sa ansamblom/osjetljivošću.
  • [ ] Spriječio sam curenje podataka tako što sam ih odvojio na osnovu bunara/polja.
  • [ ] Testirao sam generalizaciju slijepim testom.
  • [ ] Kalibrirao sam rezultat pouzdanosti i provjerio njegovu realističnost.
  • [ ] Prijavio sam rezultat s intervalom povjerenja, a ne jednom vrijednošću.