Enota 6 / 11

Priprava podatkov in inženiring funkcij: ravnanje z aktuarskimi podatki z umetno inteligenco

Dobički:

  • Sposobnost zaznavanja manjkajočih vrednosti, izstopajočih vrednosti, izpostavljenosti in težav s kakovostjo podatkov v politiki in poškodovanja podatkov s podporo umetne inteligence ter izdelava osnutka popravkov
  • Inženiring funkcij (nova izpeljava spremenljivk, združevanje, kodiranje) in normalizacija izpostavljenosti umetni inteligenci s pravim kontekstom
  • Zavedajte se, da mora transformacije podatkov, ki jih predlaga umetna inteligenca, revidirati aktuar, da bi preprečili tveganje uhajanja podatkov in skrite pristranskosti.

Del aktuarskega dela, o katerem se najmanj govori, a najbolj zamuden, je priprava podatkov. Izkušeni aktuarji vedo, da se večina časa projekta modeliranja porabi za čiščenje, združevanje in popravljanje podatkov. Ne glede na to, kako eleganten je model, če so vhodni podatki pokvarjeni, je izhod pokvarjen – na kratko, »smeti noter, smeti ven«. V tej enoti bomo videli tipične težave s podatki o politikah in zahtevkih, kako jih odkriti in popraviti z AI ter pristop inženiringa funkcij (izpeljane nove spremenljivke, ki so bolj informativne iz obstoječih podatkov).

Opozorilo že na začetku: priprava podatkov je na videz tehničen in nedolžen korak, a prav tu se skrivajo najnevarnejše napake. Nepravilna normalizacija izpostavljenosti, skrito uhajanje podatkov ali nehote vnesena pristranskost tiho pokvari vse nadaljnje modele. Umetna inteligenca močno pospeši ta korak, a če je nenadzorovana, poveča tudi tveganje.

Tipični problemi aktuarskih podatkov

Podatki o politikah in zahtevkih skoraj nikoli ne prispejo čisti. Najpogostejše težave so: Manjkajoče vrednosti: nekateri pravilniki imajo prazno starost, poklic ali regijo vozila. Slepo polnjenje teh s povprečjem lahko povzroči pristranskost; sama pomanjkljivost včasih nosi informacijo (manjkajoči so druga skupina). Izjemne vrednosti: nelogični zapisi, kot so negativna premija, 200 let staro zavarovanje, politika ničelne izpostavljenosti. Ločiti je treba, ali gre za podatkovne napake ali za prave robne primere. Nedoslednost: različno črkovanje iste regije ("Istanbul", "Istanbul", "34"), zmeda v formatu datuma. Podvojeni vnosi: dvakratni vnos iste škode.

Toda najbolj kritično vprašanje, specifično za aktuarstvo, je izpostavljenost. Če se polica začne sredi leta, zagotavlja delno izpostavljenost (npr. 0,5 leta) za to leto, ne celotnega "leta police". Pogostost in stopnje škode je treba vedno normalizirati glede na izpostavljenost; drugače se zdijo kratkoročne police visoko tvegane. AI lahko kodira izračun izpostavljenosti, vendar morate zagotoviti definicijo in poslovno pravilo.

Naslednja tabela povzema tipične težave in pravilen pristop:

problem

napačen pristop

pravi pristop

manjkajoča vrednost

Vse napolnite s povprečjem

Analizirajte pomanjkljivost; včasih odprete ločeno kategorijo

izstopajoči

Samodejno brisanje

Razlikujte med podatkovno napako in resničnim potencialom

izpostavljenost

Preštejte vse police za 1 leto

Izračunajte delno izpostavljenost

Nedoslednost kategorije

ignoriraj

Ujemanje s standardnim slovarjem

ponavljajoče se poškodbe

ne opazi

Odstrani podvojitve s ključnimi polji

Inženiring funkcij: pridobivanje znanja iz podatkov

Inženiring funkcij je umetnost izpeljave novih spremenljivk, ki so bolj uporabne za model iz obstoječih neobdelanih spremenljivk. Primeri: "starost" iz datuma rojstva, "starostna skupina" (združevanje) iz starosti, "segment tveganja" iz znamke vozila, "ocena letne kilometrine" iz kombinacije naslova in pravilnika. Dobra lastnost nosi močnejši signal kot neobdelani podatki in poveča tako natančnost kot interpretabilnost modela.

Pri aktuarskem delu se pogosto uporabljajo tri tehnike. Vezava: ločevanje zvezne spremenljivke (starosti) v smiselne skupine; to zajame nelinearna razmerja in naredi tarifo berljivo. Kodiranje: pretvorba kategoričnih spremenljivk (regije) v numerično obliko, primerno za model; Kodiranje na podlagi tveganja (ki predstavlja vsako kategorijo z lastno stopnjo škode) je običajno, vendar ga je treba izvajati previdno. Normalizacija: narediti vse primerljivo z delitvijo z izpostavljenostjo. AI hitro ustvari kodo za te transformacije; Vendar morate odobriti logiko vsake transformacije.

Namig: ciljno kodiranje je zmogljivo, vendar je nagnjeno k uhajanju podatkov: model "goljufa", če pri izračunu povprečne škode kategorije vključite lastno škodo vrstice. To vedno naredite znotraj podatkov o usposabljanju, v vzorcu navzkrižnega preverjanja.

Najbolj zahrbtna nevarnost: uhajanje podatkov in implicitna pristranskost

Uhajanje podatkov je vnos informacij v model, ki v času napovedovanja dejansko ne obstajajo. Klasičen primer: uvedba spremenljivke, ki vsebuje izid, kot je »plačane terjatve«, v model, ki napoveduje znesek terjatve. Model je v testnih podatkih videti popoln, vendar je v resničnem svetu neuporaben, ker te informacije v času napovedovanja niso na voljo. Uhajanje je pogosto skrito in se ujame le s previdnim aktuarskim sklepanjem - umetna inteligenca običajno ne opazi, včasih celo pohvali uhajajočo spremenljivko kot "zelo močan napovedovalec".

Druga zahrbtna nevarnost je implicitna pristranskost. Če zgodovinski podatki nepravično predstavljajo določeno skupino (na primer, območje je bilo v preteklosti zavrnjenih preveč politik), funkcije, izpeljane iz teh podatkov, nosijo to pristranskost in model jo posnema v prihodnosti. Faza inženiringa funkcij je najbolj kritičen trenutek, ko je to pristranskost mogoče prepoznati in popraviti.

Pozor: Preden se razveselite, ko spremenljivka »izjemno izboljša napovedno moč«, se vprašajte: ali je ta spremenljivka dejansko prisotna v času napovedi ali vključuje prihodnost? Rezultat, ki je videti predober, je pogosto znak puščanja.

Kako uporabiti AI pri pripravi podatkov

1) Preverjanje kakovosti podatkov:

Vaša vloga: pomočnik za kakovost podatkov. Imate donos aktuarske police. Stolpci: policy_id, začetni_datum, končni_datum, starost, regija, vozilo_starost, premija, število_zahtev, znesek_zahteva. Daj mi kontrolni seznam in skico kode Python (pande): - Preštej manjkajoče vrednosti po stolpcih. - Označi nerazumne vrednosti (negativna premija, starost<16 ali >100, konec<začetek). - Izračunaj delno izpostavljenost (v letih) od začetka/konca.DO NE brisati; Samo sporoči, da se lahko odločim.

2) Izpeljava lastnosti:

Iz svojih podatkov o prometu želim izpeljati nove funkcije. Na voljo: starost, vozilo_starost, regija, letni_km, usage_type.- Katere starostne skupine in skupine kilometrov (združevanje) priporočate, zakaj?- Kako lahko naredim kodiranje na podlagi tveganja za 'regijo' brez uhajanja podatkov?- Predlagajte 3 nove funkcije, ki jih je vredno preizkusiti, in napišite aktuarsko utemeljitev za vsako. se bom odločil.

3) Pregled puščanja:

Moj model predvideva MOŽNOST škode z naslednjimi spremenljivkami: starost, regija, starost vozila, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Katere od teh spremenljivk predstavljajo tveganje za uhajanje podatkov? Za vsako ocenite, ali bo na voljo v času napovedi. Naštejte sumljive in zakaj.

4) Normalizacija osvetlitve:

Nekatere moje politike se začnejo sredi leta. Pojasnite in kodirajte normalizacijo izpostavljenosti za pravilen izračun pogostosti: pogostost = skupno število zahtevkov / skupna izpostavljenost (leto police). Na primeru pokažite, kako izračunati izpostavljenost police, ki se začne sredi leta.

Šibek poziv/močan poziv

Šibek poziv:

Očistite podatke in jih pripravite za model.

AI ne ve, kateri stolpec je kateri, poslovna pravila, definicija izpostavljenosti; Lahko slepo izbriše in zapolni ter poškoduje podatke.

Močan poziv:

Vaša vloga: pomočnik za pripravo aktuarskih podatkov. Podatkovni slovar: policy_id (identiteta), začetni/končni_date (obdobje police), starost (pričakovano 16-90), premija (mora biti >0), štetje_zahtev (>=0), znesek_zahtev (>=0). Naloga:1) Napišite pravilo razumnosti za vsak stolpec in PRIJAVITE kršitve (brisanje).2) Podajte kodo za izračun delne izpostavljenosti.3) 3 različne strategije za manjkajočo 'starost' (izbriši). / povprečje / ločena kategorija) prisoten s plus-minus; Odločitev prepustite meni.4) Opozori, če obstaja stolpec, ki bi lahko predstavljal tveganje uhajanja. Samodejno brisanje katerega koli zapisa; Vsako odločitev bom odobril.

trije mini kovčki

Primer 1 – Napaka pri osvetlitvi. V enem portfelju so bile kratkoročne (3-mesečne) potovalne police štete kot polna leta, zato se je pogostost zdela štirikrat manjša, kot je bila v resnici; Cena je padla napačno. Ko je aktuar izračunal izpostavljenost kot ulomek (0,25 zavarovalnega leta), se je pokazala dejanska pogostost in tarifa je bila popravljena. Koda delne izpostavljenosti, ustvarjena z umetno inteligenco; Aktuar je podal definicijo.

Primer 2 – Latentno puščanje. Ko je pomočnik modelu verjetnosti škode dodal spremenljivko »čas zaprtja datoteke«, se je natančnost dramatično povečala. Veselje je bilo kratkotrajno: to spremenljivko je bilo mogoče poznati šele po nastanku škode, kar pomeni, da v času napovedi ni bila na voljo. Ko smo odstranili puščajočo spremenljivko, se je model zmanjšal na realno raven. Pohvalil je spremenljivko AI kot "močan napovedovalec"; Aktuarjeva presoja je ujela past.

Primer 3 – Replikacija pristranskosti. Eno podjetje je iz preteklih podatkov izpeljalo vzorec »zavrnitve prijave« in ga vključilo v nov model. Analiza je pokazala, da so bile pretekle zavrnitve nesorazmerno koncentrirane v določeni soseski, kar pomeni, da je obstajala zgodovinska pristranskost. Ta funkcija je bila odstranjena iz modela in nadomeščena z bolj nevtralnimi indikatorji tveganja. AI je izdelal analizo, ki je merila prekrivanje vzorca s sosesko; Etično odločitev sta sprejela aktuar in enota za skladnost poslovanja.

Pogoste napake

  • Izpolnjevanje manjkajočih vrednosti s srednjo vrednostjo brez razmišljanja. Samo pomanjkanje je lahko znanje; Slepo izpolnjevanje ustvarja predsodke.
  • Samodejno izbriši odstopanja. Nekateri so res robni primeri; Brisanje podatkov, ne da bi jih ločili od napak, uniči informacije.
  • Izpostavljenost ni normalizirana. Štetje kratkih polic kot polna leta izkrivlja pogostost in izkrivlja ceno.
  • Ne opazim uhajanja podatkov. Predober rezultat je pogosto znak spremenljivke, ki vključuje prihodnost; Vprašajte, ali je vsaka spremenljivka prisotna v času napovedi.
  • Vnašanje implicitne pristranskosti v prihodnost. Nepravičnost v zgodovinskih podatkih lahko pricurlja v izpeljane značilnosti; Preverite na stopnji funkcije.

Če povzamem

Pri aktuarskem modeliranju gre predvsem za pripravo podatkov; Če je vhod poškodovan, je poškodovan tudi izhod. Tipične težave so manjkajoče vrednosti, odstopanja, nedoslednosti in podvajanje; Kritično aktuarsko vprašanje je normalizacija izpostavljenosti. Inženiring funkcij – združevanje, kodiranje, normalizacija – pridobi močnejše signale iz podatkov. Najbolj zahrbtni nevarnosti sta uhajanje podatkov in implicitna pristranskost; oba sta zajeta le z aktuarskim sklepanjem. AI močno pospeši ta korak: skeniranje ustvari kodo in priporočila. Vendar ne izbrišite samodejno nobenih zapisov, pustite ljudem, da preverijo uhajanja in pristranskost ter odobrijo vsako pretvorbo.

Aplikacijska naloga

Pripravite majhen slovar anonimnih podatkov o politikah (5–7 stolpcev, razumen obseg vsakega). Vprašajte AI za (a) pravilo razumnosti in kodo poročila o kršitvi za vsak stolpec, (b) izračun delne izpostavljenosti, (c) predloge za 3 nove funkcije, ki jih lahko preizkusite. Nato na seznam dodajte namerno spremenljivko »pasti puščanja« (npr. »plačano nadomestilo«) in preizkusite, ali AI to ujame kot puščanje.

kontrolni seznam

  • [ ] Ali sem pred brisanjem manjkajočih in izstopajočih vrednosti analiziral zakaj?
  • [ ] Ali sem pravilno razdelil in normaliziral izpostavljenost?
  • [ ] Ali sem napisal aktuarsko utemeljitev za vsako novo izpeljano funkcijo?
  • [ ] Sem se vprašal, ali je vsaka spremenljivka dejansko prisotna (puščanje) v času napovedi?
  • [ ] Ali sem pregledal implicitno pristranskost v izpeljanih funkcijah?
  • [ ] Ali nisem dal AI samodejno izbrisati vseh zapisov in sam odobril vsako odločitev?