Jedinica 6 / 11

Priprema podataka i inženjering značajki: rukovanje aktuarskim podacima pomoću umjetne inteligencije

Dobici:

  • Sposobnost otkrivanja vrijednosti koje nedostaju, izvanrednih vrijednosti, izloženosti i problema s kvalitetom podataka u politici i oštećenja podataka uz podršku umjetne inteligencije i izrade nacrta ispravka
  • Inženjering značajki (nova derivacija varijabli, grupiranje, kodiranje) i normalizacija izloženosti umjetnoj inteligenciji s pravim kontekstom
  • Imajte na umu da transformacije podataka koje predlaže umjetna inteligencija treba revidirati aktuar protiv rizika od curenja podataka i skrivene pristranosti.

Dio aktuarskog posla o kojem se najmanje govori, ali koji oduzima najviše vremena je priprema podataka. Iskusni aktuari znaju da se većina vremena projekta modeliranja troši na čišćenje, kombiniranje i ispravljanje podataka. Bez obzira koliko elegantan model bio, ako su ulazni podaci oštećeni, izlaz je oštećen - ukratko, "smeće unutra, smeće van". U ovoj jedinici vidjet ćemo tipične probleme s podacima o politici i zahtjevima, kako ih otkriti i popraviti pomoću umjetne inteligencije te pristup inženjeringa značajki (izvedene nove varijable koje su informativnije iz postojećih podataka).

Upozorenje od početka: priprema podataka je naizgled tehnički i bezazlen korak, ali tu se kriju najopasnije pogreške. Netočna normalizacija ekspozicije, skriveno curenje podataka ili nenamjerno unesena pristranost tiho kvare sve sljedeće modele. AI uvelike ubrzava ovaj korak, ali ako se ostavi nekontrolirano, također povećava rizik.

Tipični problemi aktuarskih podataka

Podaci o politici i zahtjevima gotovo nikada ne stižu čisti. Najčešći problemi su: Nedostaju vrijednosti: neke politike imaju prazne podatke o starosti vozila, zanimanju ili regiji. Slijepo ispunjavanje ovih prosjekom može stvoriti pristranost; sam nedostatak ponekad nosi informaciju (nedostajući su druga skupina). Outliers: nelogični zapisi kao što su negativna premija, 200 godina staro osiguranje, polica nulte izloženosti. Treba razlučiti radi li se o pogreškama podataka ili stvarnim rubnim slučajevima. Nedosljednost: različito pisanje iste regije ("Istanbul", "Istanbul", "34"), zabuna u formatu datuma. Dvostruki unosi: dvaput upis iste štete.

Ali najkritičnije pitanje specifično za aktuarstvo je izloženost. Ako polica počinje sredinom godine, ona daje djelomičnu izloženost (npr. 0,5 godina) za tu godinu, a ne punu "godinu police". Učestalost i stope oštećenja treba uvijek normalizirati prema izloženosti; inače se kratkoročne police čine visokim rizikom. AI može kodirati izračun izloženosti, ali morate dati definiciju i poslovno pravilo.

Sljedeća tablica sažima tipične probleme i ispravan pristup:

problem

pogrešan pristup

pravi pristup

nedostaje vrijednost

Ispunite sve s prosjekom

Analizirajte nedostatak; ponekad otvoriti zasebnu kategoriju

izuzetak

Automatsko brisanje

Razlikujte pogrešku u podacima i stvarni trag

izloženost

Računajte sve police za 1 godinu

Izračunajte frakcijsko izlaganje

Nedosljednost kategorije

zanemariti

Podudaranje sa standardnim rječnikom

ponavljajuća oštećenja

ne primijetiti

Ukloni duplikat s ključnim poljima

Inženjering značajki: izvođenje znanja iz podataka

Inženjering značajki je umjetnost izvođenja novih varijabli koje su korisnije za model iz postojećih sirovih varijabli. Primjeri: "dob" iz datuma rođenja, "dobna skupina" (biniranje) iz dobi, "rizični segment" iz marke-modela vozila, "godišnja procjena kilometraže" iz kombinacije adrese i pravila. Dobra značajka nosi jači signal od neobrađenih podataka i povećava točnost i interpretabilnost modela.

U aktuarskom radu često se koriste tri tehnike. Povezivanje: razdvajanje kontinuirane varijable (dob) u smislene skupine; ovo bilježi nelinearne odnose i čini tarifu čitljivom. Kodiranje: pretvaranje kategoričkih varijabli (regije) u numerički format prikladan za model; Šifriranje temeljeno na riziku (predstavljanje svake kategorije s vlastitom stopom štete) uobičajeno je, ali treba ga raditi s oprezom. Normalizacija: učiniti sve usporedivim dijeljenjem s izloženošću. AI brzo generira kod za ove transformacije; Ali morate odobriti logiku svake transformacije.

Savjet: ciljno kodiranje je moćno, ali sklono curenju podataka: model "vara" ako uključite vlastitu štetu retka kada izračunate prosječnu štetu kategorije. Uvijek to činite unutar podataka o obuci, u obrascu unakrsne provjere.

Najpodmuklija opasnost: curenje podataka i implicitna pristranost

Curenje podataka je uvođenje informacija u model koje zapravo ne postoje u trenutku predviđanja. Klasičan primjer: uvođenje varijable koja sadrži ishod, kao što je "plaćena potraživanja", u model koji predviđa iznos potraživanja. Model izgleda savršeno u testnim podacima, ali je beskoristan u stvarnom svijetu jer te informacije nisu dostupne u vrijeme predviđanja. Curenje je često skriveno i uhvaćeno samo pažljivim aktuarskim obrazloženjem — umjetna inteligencija obično ne primjećuje, ponekad čak hvale curenje varijable kao "vrlo snažan prediktor".

Druga podmukla opasnost je implicitna pristranost. Ako povijesni podaci nepravedno predstavljaju određenu skupinu (na primjer, neko područje je povijesno odbijeno s previše politika), značajke izvedene iz tih podataka nose tu pristranost i model je replicira u budućnost. Faza inženjeringa značajki je najkritičniji trenutak kada se ova pristranost može prepoznati i ispraviti.

Oprez: Prije nego što se radujete kada varijabla "iznimno poboljša snagu predviđanja", zapitajte se: je li ta varijabla stvarno prisutna u trenutku predviđanja ili uključuje budućnost? Rezultat koji izgleda previše dobro često je znak curenja.

Kako koristiti AI u pripremi podataka

1) Provjera kvalitete podataka:

Vaša uloga: asistent za kvalitetu podataka. Imate prinos prema aktuarskoj polici. Stupci: policy_id, start_date, end_date,age, region, vehicle_age, premium, claim_count, claim_amount. Dajte mi popis za provjeru i skicu koda za Python (pande):- Prebrojite vrijednosti koje nedostaju po stupcu.- Označite nerazumne vrijednosti (negativna premija, starost<16 ili >100, kraj<početak).- Izračunajte djelomičnu izloženost (u godinama) od početka/kraja.DO NE brisati; Samo prijavi pa ću odlučiti.

2) Izvođenje obilježja:

Želim izvesti nove značajke iz svojih prometnih podataka. Dostupno: age, vehicle_age, region, year_km, usage_type.- Koje starosne skupine i kilometre (bining) preporučujete, zašto?- Kako mogu napraviti kodiranje temeljeno na riziku za 'regiju' bez curenja podataka?- Predložite 3 nove značajke koje vrijedi isprobati i napišite aktuarsko opravdanje za svaku. Ja ću odlučiti.

3) Inspekcija curenja:

Moj model predviđa MOGUĆNOST štete sa sljedećim varijablama: starost, regija, starost vozila, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Koje od ovih varijabli predstavljaju rizik od curenja podataka? Za svaki procijenite hoće li biti dostupan u vrijeme predviđanja. Navedite sumnjive i zašto.

4) Normalizacija ekspozicije:

Neke moje police počinju sredinom godine. Objasnite i kodirajte normalizaciju izloženosti kako biste pravilno izračunali učestalost: učestalost = ukupni broj_potraživanja / ukupna izloženost (godina police). Pokažite na primjeru kako izračunati izloženost police koja počinje sredinom godine.

Slab upit / Jak upit

Slab upit:

Očistite podatke i pripremite ih za model.

AI ne zna koji je stupac koji, poslovna pravila, definicija izloženosti; Može naslijepo izbrisati i popuniti i pokvariti podatke.

Snažan upit:

Vaša uloga: asistent za pripremu aktuarskih podataka. Rječnik podataka: policy_id (identitet), start/end_date (razdoblje police), age (očekivano 16-90), premija (mora biti >0), zahtjev_count (>=0), zahtjev_amount (>=0). Zadatak:1) Napišite pravilo razumnosti za svaki stupac i PRIJAVITE kršenja (brisanje).2) Dajte kod za izračunavanje djelomične izloženosti.3) 3 različita strategije za nedostajuću 'dob' (izbrisati). / prosjek / zasebna kategorija) prisutan s plus-minus; Prepustite odluku meni. 4) Upozorenje ako postoji stupac koji može predstavljati rizik od curenja. Automatsko brisanje bilo kojeg zapisa; Ja ću odobriti svaku odluku.

tri mini kućišta

Slučaj 1 — Pogreška ekspozicije. U jednom portfelju, kratkoročne (3-mjesečne) putne police računale su se kao pune godine, pa se učestalost činila četiri puta nižom nego što je zapravo bila; Cijena je pogrešno pala. Kada je aktuar izračunao izloženost kao razlomak (0,25 godina police), otkrivena je stvarna učestalost i tarifa je ispravljena. AI generiran kod djelomične izloženosti; Aktuar je dao definiciju.

Slučaj 2 — Latentno curenje. Kada je pomagač dodao varijablu "vrijeme zatvaranja datoteke" u model vjerojatnosti štete, točnost se dramatično povećala. Radost je bila kratkog vijeka: ova se varijabla mogla znati tek nakon što je nastala šteta, što znači da nije bila dostupna u vrijeme predviđanja. Kada je varijabla curenja uklonjena, model se smanjio na realnu razinu. Pohvalio je AI varijablu kao "moćan prediktor"; Aktuarova prosudba uhvatila je zamku.

Slučaj 3 — Replikacija pristranosti. Jedna je tvrtka izvela obrazac "odbijanja aplikacije" iz povijesnih podataka i stavila ga u novi model. Analiza je pokazala da su prijašnja odbijanja bila nesrazmjerno koncentrirana u određenom susjedstvu, što znači da je postojala povijesna pristranost. Ova je značajka uklonjena iz modela i zamijenjena neutralnijim pokazateljima rizika. AI je izradio analizu mjereći preklapanje uzorka sa susjedstvom; Etičku odluku donijeli su aktuar i jedinica za usklađenost.

Uobičajene greške

  • Ispunjavanje vrijednosti koje nedostaju sa srednjom bez razmišljanja. Sam nedostatak može biti znanje; Ispunjavanje na slijepo stvara predrasude.
  • Automatski izbrišite izvanredne vrijednosti. Neki su pravi rubni slučajevi; Brisanje podataka bez odvajanja od grešaka uništava informacije.
  • Ne normalizira ekspoziciju. Računanje kratkih polica kao punih godina iskrivljuje učestalost i narušava cijenu.
  • Ne primjećuje curenje podataka. Previše dobar rezultat često je znak varijable koja uključuje budućnost; Upitajte je li svaka varijabla prisutna u vrijeme predviđanja.
  • Donošenje implicitne pristranosti u budućnost. Nepravda u povijesnim podacima može procuriti u izvedene značajke; Provjerite u fazi značajke.

Ukratko

Aktuarsko modeliranje uglavnom se odnosi na pripremu podataka; Ako je ulaz oštećen, izlaz je također oštećen. Tipični problemi su nedostajuće vrijednosti, izvanredne vrijednosti, nedosljednosti i dupliciranje; Kritično aktuarsko pitanje je normalizacija izloženosti. Inženjering značajki - grupiranje, kodiranje, normalizacija - izvodi jače signale iz podataka. Najpodmuklije opasnosti su curenje podataka i implicitna pristranost; oba su obuhvaćena samo aktuarskim obrazloženjem. AI uvelike ubrzava ovaj korak: skeniranje generira kod i preporuke. Ali nemojte automatski brisati nikakve zapise, dopustite ljudima da provjere ima li curenja i pristranosti i odobre svaku konverziju.

Zadatak aplikacije

Pripremite mali anonimni rječnik podataka o politici (5-7 stupaca, razuman raspon svakog). Zatražite od umjetne inteligencije (a) pravilo razumnosti i kod izvješća o kršenju za svaki stupac, (b) izračun djelomičnog izlaganja, (c) prijedloge za 3 nove značajke koje treba isprobati. Zatim dodajte namjernu varijablu "zamke curenja" na popis (npr. "isplaćena naknada") i provjerite hvata li je AI kao curenje.

popis za provjeru

  • [ ] Jesam li analizirao zašto prije brisanja nedostajućih i izvanrednih vrijednosti?
  • [ ] Jesam li frakcionirao i normalizirao ekspoziciju ispravno?
  • [ ] Jesam li napisao aktuarsko obrazloženje za svaku novoizvedenu značajku?
  • [ ] Jesam li se zapitao je li svaka varijabla stvarno prisutna (curenje) u vrijeme predviđanja?
  • [ ] Jesam li skenirao implicitnu pristranost u izvedenim značajkama?
  • [ ] Nisam li AI automatski izbrisao sve zapise i sam odobrio svaku odluku?