Vienība 10 / 11

Modeļa nenoteiktība, validācija un kalibrēšana

Ieguvumi:

  • Spēja izmērīt un ziņot par nenoteiktību, izmantojot komplektu, jutīguma analīzi, savstarpēju validāciju un aklo testēšanu
  • Spēja novērst datu noplūdi, atdalot tos pēc akas/lauka principa, un nodrošināt, ka ziņotā precizitāte atspoguļo patiesu vispārinājumu.
  • Spēja kalibrēt mākslīgā intelekta uzticamības rādītāju ar uzticamības diagrammu un piemērot disciplīnu neizmantot nekalibrētu rezultātu kā varbūtību

Katrā šī moduļa vienībā ir atkārtota tēma: ģeofizikā nav "drošu atbilžu", ir tikai modeļi, kurus ierobežo nenoteiktība. Šī vienība pārvērš šo tēmu disciplīnā. Modeļa nenoteiktība ir dažādu apakšzemes modeļu esamība, kas var izskaidrot tos pašus datus, un katram modelim ir ticamības intervāls. Validācija ir pārbaude ar neatkarīgiem pierādījumiem, vai modelis vai AI izvade patiešām ir derīga. Kalibrēšana ir paredzēta, lai nodrošinātu, ka modeļa sniegtās ticamības/varbūtības vērtības atbilst faktiskajiem rezultātiem. Šajā nodaļā mēs pārbaudīsim, kā mākslīgais intelekts (AI) var gan izmērīt, gan slēpt nenoteiktību; un mēs redzēsim, kāpēc stabila verifikācijas-kalibrēšanas sistēma padara AI uzticamu.

Neskaidrības avoti

Ģeofiziskā nenoteiktība nāk no vairākiem slāņiem:

  • Datu nenoteiktība: mērījumu troksnis, ierobežots pārklājums, kalibrēšanas kļūda.
  • Modeļa nenoteiktība (polisēmija): vairāku zemūdens struktūru pielāgošana vieniem un tiem pašiem datiem.
  • Metodes/parametru nenoteiktība: apstrāde, inversija un regularizācijas izvēle maina rezultātu.
  • AI specifiska nenoteiktība: modeļa spēja saglabāt pārliecību, bet neizdodas, kad tas pārvietojas ārpus apmācības sadalījuma (sadales maiņa).

Laba ģeofiziķa darbs nav novērst šo nenoteiktību, bet gan izmērīt, sazināties un sašaurināt to. AI var to atvieglot (vairāku scenāriju ģenerēšana), taču to var arī viegli paslēpt, sniedzot vienu pārliecinošu atbildi.

Nenoteiktības mērīšanas veidi

Daži praktiski rīki:

  1. Ansamblis: vairāki braucieni ar dažādiem startiem, parametriem vai modeļiem; Rezultātu izplatība rada nenoteiktību.
  2. Jutīguma analīze: ievades (parametra, datu apakškopas) maiņa un rezultāta izmaiņu skatīšana.
  3. Savstarpēja validācija: datu sadalīšana gabalos, apmācība ar vienu daļu un testēšana ar otru; Mēra vispārināšanas jaudu.
  4. Aklā pārbaude: modeļa testēšana ar neatkarīgu aku/lauku, kādu tas nekad nav redzējis treniņos.
  5. Varbūtības izvade: rezultātu sniedz kā sadalījuma/uzticamības intervālu, nevis vienu vērtību.
Padoms. Kad AI sniedz rezultātu, vienmēr jautājiet: "Kas un cik daudz man ir jāpārvieto ievadē, lai mainītu šo rezultātu?" Ja rezultāts tiek mainīts ar nelielām parametru izmaiņām, šis rezultāts ir trausls un nenoteiktība ir augsta.

Kalibrēšana: vai ticamības rādītājs ir patiess?

AI modeļi bieži sniedz pārliecību/varbūtību (“90% kļūda”). Bet šis skaitlis ir maldinošs, ja tas nav kalibrēts: modelim patiesībā ir taisnība, iespējams, 60% gadījumu, uz kuriem tas saka "90%. Kalibrēšana ir paredzēta, lai šo skaitli pielīdzinātu faktiskajam rezultāta līmenim. Praksē tiek uzzīmēta uzticamības diagramma: labi kalibrētam modelim patiešām ir 90% taisnība, ja tas saka "90%. Ģeofizikā ir svarīgi kalibrēt AI ticamības rādītāju ar neatkarīgiem datiem, pirms to pieņem par pamatu lēmumam.

Uzmanību: augsta precizitāte nav tas pats, kas laba kalibrēšana. Modelis kopumā var būt precīzs, bet pārāk pašpārliecināts; Svarīga lieta kritiskos lēmumos ir tas, ka tas ir patiesi uzticams, ja tas saka "95%. Neuzskatiet nekalibrētu ticamības rādītāju kā varbūtību.

Pārbaudes zelta likumi

Stingrai pārbaudei: (1) Neatkarība — testa datiem nevajadzētu traucēt apmācības/regulēšanas procesu (datu noplūde — palielina rezultātu). (2) Aklā pārbaude — lauks/aka, ko modelis neredz. (3) Fiziskā konsekvence — rezultāts nedrīkst būt pretrunā ar fiziku un ģeoloģiju. (4) Reproducējamība — tas pats rezultāts ar tādu pašu ievadi, un to var radīt kāds cits. (5) Dokumentācija — ieraksts par to, kādi dati, kāds parametrs, kura modeļa versija tika izmantota.

trīs mini futrāļi

1. gadījums — datu noplūdes kļūda. Viena komanda ziņoja, ka fasiju klasifikators sniedza 94% precizitāti. Izmeklēšana parādīja, ka blakus esošie paraugi no vienas un tās pašas akas bija iesaistīti gan apmācībā, gan testēšanā (datu noplūde). Sadalot pa labi, precizitāte samazinājās līdz 71% — tas bija patiesais vispārinājums. Noplūde lika modelim izskatīties labāk, nekā tas bija patiesībā.

2. gadījums — pārāk pašpārliecināts modelis. Viens defektu detektors sniedza "95% pārliecību" par savām pazīmēm. Uzticamības diagramma parādīja, ka "95%" atzīmes patiesībā bija 70% precīzas. Kad modelis tika kalibrēts, ticamības rādītāji kļuva reālistiski, un komentētāji pareizi pielāgoja, cik ļoti viņi uzticēsies katrai zīmei.

3. gadījums — trausla inversija. Gravitācijas modelis izskatījās ļoti pārliecinoši. Jutīguma analīze parādīja, ka galvenā struktūra pazuda, kad regularizācijas svars mainījās par 20%: struktūra radās nevis no datiem, bet gan no parametru izvēles. Komanda atzīmēja struktūru kā “zemu ticamību” un pieprasīja papildu datus.

Četras kopējamas veidnes

1) Nenoteiktības mērīšanas plāns:

Jūsu loma: ģeofizikālās nenoteiktības konsultants. Man ir [inversija / klasifikācija / prognoze] rezultāts. Kādas metodes (ansambļa, jutīguma, savstarpējās validācijas, aklās pārbaudes) izmantot nenoteiktības mērīšanai un kādā secībā? Paskaidrojiet, ko katrs man saka un kā ziņot par rezultātu.

2) Kalibrēšanas pārbaude:

Mans AI modelis sniedz ticamības/varbūtības rādītāju. Kā pārbaudīt, vai šis rādītājs ir kalibrēts? Kā izveidot uzticamības diagrammu, atpazīt "pārmērīgu pārliecību" vai "pārmērīgu piesardzību" un saskaņot rezultātu ar faktisko rezultātu līmeni?

3) Datu noplūdes audits:

Es apmācīju ģeofizisko klasifikatoru. Kā atrast un novērst datu noplūdes risku (vieni un tie paši akas/lauka paraugi tiek ievadīti gan apmācībā, gan testēšanā)? Kā iestatīt atdalīšanu pēc akas/lauka? Kā es varu zināt, vai paziņotā precizitāte atspoguļo patiesu vispārinājumu?

4) Rezultātu trausluma pārbaude:

Man ir inversijas/modeļa rezultāts. Es gribu saprast, cik trausls ir šis rezultāts. Kurus parametrus mainot un cik lielā mērā mainās galvenā struktūra? Kā atšķirt, vai struktūra nāk no datiem vai parametriem/priekšnoteikumiem? Norādiet jutīguma protokolu.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Skatiet, vai manam modelim ir augsta precizitāte.

Viens patiesības skaitlis; noplūde slēpj kalibrēšanu un vispārināšanu, radot nepatiesu pārliecību.

Spēcīga uzvedne:

Jūsu loma: modeļu apstiprināšanas eksperts. Ievade: [klasifikators labi ģenerē N, ticamības rādītājus]. Uzdevums: (1) ierosināt labi pamatotu sadalījumu pret datu noplūdi; (2) uzstādīt aklo aku testēšanu; (3) kalibrē ticamības rādītāju ar ticamības diagrammu; (4) pārbaudiet, cik jutīgs ir rezultāts pret parametru. Samazinājums līdz vienam patiesības skaitlim; Atsevišķi ziņojiet par vispārināšanu, kalibrēšanu un trauslumu.

Noplūde, aklā pārbaude, kalibrēšana un jutīguma pieprasījums padara verifikāciju godīgu.

Nenoteiktības instrumenti

transportlīdzeklis

Ko tas mēra?

Galvenais risks

izvade

ansamblis

Modeļa izplatība

Konta izmaksas

Diapazons/izplatījums

Jutīgums

Parametru efekts

Nokavēta ievade

Trauslums

krusteniskā validācija

vispārināšana

datu noplūde

reālistiska precizitāte

aklais tests

neatkarīgi panākumi

Nepietiekams testa komplekts

uzticēties

Kalibrēšana

uzticies realitātei

pārmērīga pārliecība

izlīdzinātā varbūtība

Biežas kļūdas

  • Datu noplūdes neievērošana. Tas uzpūš taisnību; Atdalīt pēc akas/lauka.
  • Uzticības rādītāja izmantošana, to nekalibrējot. “90%” patiesībā var nebūt 90%.
  • Paļaujoties uz vienu patiesības skaitli. Vispārināšana un kalibrēšana ir divas dažādas lietas.
  • Nepārbauda ievainojamību. Parametra zaudētā struktūra nav reāla informācija.
  • Neziņo par nenoteiktību. Rezultāta uzrādīšana bez ticamības intervāla ir maldinoša.

Rezumējot

Nenoteiktība ir neizskaužams ģeofizikas fakts; uzdevums ir to izmērīt, paziņot un sašaurināt. AI atvieglo to ar ansambļa, jutīguma un varbūtības izvadi, bet var arī maskēt to ar vienu pārliecinošu atbildi. Ciets rāmis; datu noplūdes novēršana, vispārinājuma mērīšana ar aklo testēšanu, ticamības rādītāja kalibrēšana un rezultāta trausluma pārbaude. Nekalibrēta uzticēšanās, nepārbaudīts patiesums un slēpta nenoteiktība ir trīs visbīstamākās ilūzijas. Uzticama ģeofizika ir ģeofizika, kas godīgi parāda savu nenoteiktību.

Lietojumprogrammas uzdevums

Atlasiet AI ģeofizisko rezultātu (klasifikācija, inversija vai prognoze). Plānojiet ansambļa/jutības/aklās pārbaudes soļus, izmantojot veidni "Nenoteiktības mērījumu plāns". Pēc tam pārbaudiet savu vilcienu testa atšķirību, izmantojot veidni “Datu noplūdes audits”. Ja modelis sniedz ticamības rādītāju, novērtējiet, vai rezultāts ir reālistisks, izmantojot veidni "Kalibrēšanas pārbaude", un ierakstiet rezultātu ar ticamības intervālu.

kontrolsaraksts

  • [ ] Es mērīju nenoteiktību ar ansambli/jutību.
  • [ ] Es novērsu datu noplūdi, atdalot tos pēc akas/lauka principa.
  • [ ] Es pārbaudīju vispārināšanu ar aklo testu.
  • [ ] Es kalibrēju ticamības rādītāju un pārbaudīju tā reālismu.
  • [ ] Es ziņoju rezultātu ar ticamības intervālu, nevis vienu vērtību.