Jedinica 6 / 11

Priprema podataka i inženjering karakteristika: rukovanje aktuarskim podacima sa veštačkom inteligencijom

Dobici:

  • Sposobnost otkrivanja nedostajućih vrijednosti, odstupanja, izloženosti i problema s kvalitetom podataka u politici i oštećenje podataka uz podršku umjetne inteligencije i izradu nacrta korekcije
  • Inženjering karakteristika (nova derivacija, grupisanje, kodiranje) i normalizacija izloženosti umjetnoj inteligenciji s pravim kontekstom
  • Shvatite da transformacije podataka koje predlaže vještačka inteligencija treba da revidira aktuar u odnosu na rizik od curenja podataka i skrivene pristranosti.

Dio aktuarskog posla o kojem se najmanje govori, ali najviše vremena oduzima je priprema podataka. Iskusni aktuari znaju da se većina vremena projekta modeliranja troši na čišćenje, kombinovanje i ispravljanje podataka. Bez obzira koliko je model elegantan, ako su ulazni podaci oštećeni, izlazni su oštećeni – ukratko, „smeće unutra, smeće van“. U ovoj jedinici ćemo vidjeti tipične probleme sa podacima o politikama i zahtjevima, kako ih otkriti i popraviti pomoću AI-a, te pristup inženjeringa karakteristika (izvedene nove varijable koje su informativnije iz postojećih podataka).

Upozorenje od početka: priprema podataka je naizgled tehnički i nevin korak, ali tu se kriju najopasnije greške. Netačna normalizacija ekspozicije, skriveno curenje podataka ili nesvjesno uvedena pristranost tiho kvare sve naredne modele. AI uvelike ubrzava ovaj korak, ali ako se ne kontrolira, također povećava rizik.

Tipični problemi aktuarskih podataka

Podaci o pravilima i zahtjevima gotovo nikada ne stižu čisti. Najčešći problemi su: Nedostaju vrijednosti: neke politike imaju prazno staro vozilo, zanimanje ili regiju. Slijepo popunjavanje ovih prosjekom može stvoriti pristrasnost; sam nedostatak ponekad nosi informaciju (nedostaci su druga grupa). Nedostaci: nelogični zapisi kao što su negativna premija, 200-godišnji osiguranik, politika nulte izloženosti. Mora se razlikovati da li se radi o greškama podataka ili stvarnim rubnim slučajevima. Nedosljednost: različiti načini pisanja iste regije ("Istanbul", "Istanbul", "34"), konfuzija u formatu datuma. Dvostruki unosi: dva puta unos iste štete.

Ali najkritičnije pitanje specifično za aktuarske poslove je izloženost. Ako polisa počinje sredinom godine, ona obezbjeđuje djelomičnu izloženost (npr. 0,5 godina) za tu godinu, a ne punu „godinu polise“. Učestalost i stope oštećenja treba uvijek biti normalizirane prema izloženosti; u suprotnom kratkoročne politike izgledaju visoko rizične. AI može kodirati izračun izloženosti, ali morate dati definiciju i poslovno pravilo.

Sljedeća tabela sažima tipične probleme i ispravan pristup:

problem

pogrešan pristup

pravi pristup

nedostaje vrijednost

Popunite sve prosekom

Analizirati nedostatak; ponekad otvorite posebnu kategoriju

outlier

Automatsko brisanje

Razlikujte grešku u podacima i stvarnu informaciju

izloženost

Računajte sve polise za 1 godinu

Izračunajte frakcijsku ekspoziciju

Nedosljednost kategorije

ignore

Uskladite se sa standardnim rječnikom

ponavljajuća oštećenja

ne primjecuj

Dedupliciranje s ključnim poljima

Inženjering karakteristika: izvlačenje znanja iz podataka

Inženjering karakteristika je umjetnost izvođenja novih varijabli koje su korisnije za model iz postojećih sirovih varijabli. Primjeri: "dob" od datuma rođenja, "dobna grupa" (binding) od starosti, "segment rizika" od modela vozila, "godišnja procjena kilometraže" iz kombinacije adrese i politike. Dobra karakteristika nosi jači signal od neobrađenih podataka i povećava i tačnost i interpretabilnost modela.

Tri tehnike se često koriste u aktuarskom radu. Vezivanje: razdvajanje kontinuirane varijable (starost) u smislene grupe; ovo obuhvata nelinearne odnose i čini tarifu čitljivom. Kodiranje: pretvaranje kategoričkih varijabli (regija) u numerički format prikladan za model; Kodiranje zasnovano na riziku (predstavlja svaku kategoriju sa sopstvenom stopom štete) je uobičajeno, ali ga treba raditi sa oprezom. Normalizacija: učiniti sve uporedivim tako što ćete ga podijeliti sa njegovom izloženošću. AI brzo generiše kod za ove transformacije; Ali morate odobriti logiku svake transformacije.

Savjet: Ciljno kodiranje je moćno, ali sklono curenju podataka: model "vara" ako uključite vlastitu štetu reda prilikom izračunavanja prosječne štete kategorije. Uvijek to radite unutar podataka o obuci, u obrascu unakrsnog provjere.

Najpodmukla opasnost: curenje podataka i implicitna pristrasnost

Curenje podataka je unošenje informacija u model koje zapravo ne postoje u trenutku predviđanja. Klasičan primjer: uvođenje varijable koja sadrži ishod, kao što je “plaćena potraživanja” u model koji predviđa iznos potraživanja. Model izgleda savršeno u test podacima, ali je beskoristan u stvarnom svijetu jer te informacije nisu dostupne u vrijeme predviđanja. Curenje je često skriveno i uhvaćeno samo pažljivim aktuarskim rasuđivanjem - AI obično ne primjećuje, ponekad čak i hvali varijablu koja curi kao "veoma moćan prediktor".

Druga podmukla opasnost je implicitna pristrasnost. Ako istorijski podaci nepravedno predstavljaju određenu grupu (na primer, nekoj oblasti je istorijski uskraćeno previše politika), karakteristike izvedene iz tih podataka nose tu pristrasnost i model je replicira u budućnost. Faza inženjeringa karakteristika je najkritičniji trenutak kada se ova predrasuda može prepoznati i ispraviti.

Oprez: Prije nego što se obradujete kada varijabla „izrazito poboljšava prediktivnu moć“, zapitajte se: da li je ova varijabla zaista prisutna u vrijeme predviđanja ili uključuje budućnost? Rezultat koji izgleda predobro često je znak curenja.

Kako koristiti AI u pripremi podataka

1) Provjera kvaliteta podataka:

Vaša uloga: pomoćnik za kvalitet podataka. Imate aktuarski prinos. Kolone: policy_id, start_date, end_date,age, region, vehicle_age, premium, claim_count, claim_amount. Dajte mi kontrolnu listu i Python (pande) skicu koda:- Brojite nedostajuće vrijednosti po koloni.- Označite nerazumne vrijednosti (negativna premija, starost<16 do kraja ili >100 godina kalkulacije).- početak/kraj.NE brisati; Samo prijavi da mogu odlučiti.

2) Izvođenje karakteristika:

Želim izvući nove funkcije iz mojih podataka o saobraćaju. Dostupno: starost, starost_vozila, regija, godišnji_km, tip upotrebe.- Koje starosne grupe i grupe kilometara (biniranje) preporučujete, zašto?- Kako mogu napraviti kodiranje zasnovano na riziku za 'region' bez curenja podataka?- Predložite 3 nove funkcije koje vrijedi isprobati i napišite aktuarsko opravdanje za svaku. Ja ću odlučiti.

3) Inspekcija curenja:

Moj model predviđa MOGUĆNOST oštećenja sa sljedećim varijablama: starost, regija, starost vozila, PLAĆENA ZASTAVA_POTRAŽIVANJA, SETTLEMENT_DAYS. Koje od ovih varijabli predstavljaju rizik od curenja podataka? Za svaki procijenite da li će biti dostupan u vrijeme predviđanja. Navedite sumnjive i zašto.

4) Normalizacija ekspozicije:

Neke od mojih politika počinju sredinom godine. Objasnite i kodirajte normalizaciju izloženosti da biste pravilno izračunali učestalost: učestalost = ukupan broj_zahtjeva / ukupna izloženost (godina politike). Pokažite na primjeru kako izračunati izloženost polise koja počinje sredinom godine.

Slaba prompt / Jaka prompt

Slab upit:

Očistite podatke i pripremite ih za model.

AI ne zna koja je kolona koja, poslovna pravila, definicija izloženosti; Može slijepo izbrisati i popuniti i pokvariti podatke.

Snažan upit:

Vaša uloga: pomoćnik u pripremi aktuarskih podataka. Rječnik podataka: ID_politike (identitet), datum početka/završetka (period politike), starost (očekivano 16-90), premija (mora biti >0), broj_zahtjeva (>=0), iznos_zahtjeva (>=0). Zadatak:1) Napišite pravilo razumnosti za svaku kolonu i IZVJEŠTAJte pravilo razumnosti za svaku kolonu i IZVJEŠTAJTE kršenja koda expos3. Give pos3 brisanje). strategije za propuštanje 'doba' (izbriši). / prosječna / posebna kategorija) prisutna sa plus-minus; Prepustite odluku meni. 4) Upozorite ako postoji kolona koja može predstavljati rizik od curenja. Automatsko brisanje bilo kojeg zapisa; Ja ću odobriti svaku odluku.

tri mini kofera

Slučaj 1 — Greška ekspozicije. U jednom portfelju, kratkoročne (3-mjesečne) politike putovanja računale su se kao pune godine, tako da je učestalost bila četiri puta manja nego što je zapravo bila; Cijena je pogrešno pala. Kada je aktuar izračunao izloženost kao razlomak (0,25 polis-godina), otkrivena je stvarna učestalost i tarifa je korigovana. AI generiran frakcijski kod ekspozicije; Aktuar je dao definiciju.

Slučaj 2 — Latentno curenje. Kada je pomoćnik dodao varijablu “vrijeme zatvaranja datoteke” modelu vjerovatnoće oštećenja, preciznost se dramatično povećala. Radost je bila kratkog daha: ova varijabla je mogla biti poznata tek nakon što je šteta nastala, što znači da nije bila dostupna u vrijeme predviđanja. Kada je varijabla koja curi uklonjena, model se smanjio na realističan nivo. Pohvalio je AI varijablu kao "moćan prediktor"; Aktuarska presuda je uhvatila zamku.

Slučaj 3 — Replikacija pristrasnosti. Jedna kompanija je iz istorijskih podataka izvela obrazac „odbijanja aplikacije“ i stavila ga u novi model. Analiza je pokazala da su prošla odbijanja bila nesrazmjerno koncentrisana u određenom susjedstvu, što znači da je postojala istorijska pristrasnost. Ova karakteristika je uklonjena iz modela i zamijenjena neutralnijim indikatorima rizika. AI je napravio analizu mjereći preklapanje uzorka sa susjedstvom; Etičku odluku donijeli su aktuar i jedinica za usklađenost.

Uobičajene greške

  • Dopunjavanje vrijednosti koje nedostaju srednjom vrijednosti bez razmišljanja. Sam nedostatak može biti znanje; Slijepo popunjavanje stvara predrasude.
  • Automatski obrišite vanjske vrijednosti. Neki su pravi rubni slučajevi; Brisanje podataka bez odvajanja od grešaka uništava informacije.
  • Ne normalizira ekspoziciju. Računanje kratkih polisa kao pune godine iskrivljuje učestalost i iskrivljuje cijenu.
  • Ne primjećujete curenje podataka. Previše dobar rezultat je često znak varijable koja uključuje budućnost; Pitajte da li je svaka varijabla prisutna u vrijeme predviđanja.
  • Donošenje implicitne pristrasnosti u budućnost. Nepravda u istorijskim podacima može procuriti u izvedene karakteristike; Provjerite to u fazi funkcije.

Ukratko

Aktuarsko modeliranje se uglavnom odnosi na pripremu podataka; Ako je ulaz oštećen, oštećen je i izlaz. Tipični problemi su nedostajuće vrijednosti, odstupanja, nedosljednosti i dupliciranje; Kritično aktuarsko pitanje je normalizacija izloženosti. Inženjering karakteristika — grupisanje, kodiranje, normalizacija — izvodi jače signale iz podataka. Najpodmuklije opasnosti su curenje podataka i implicitna pristrasnost; oba su obuhvaćena samo aktuarskim obrazloženjem. AI uvelike ubrzava ovaj korak: skeniranje generiše kod i preporuke. Ali nemojte automatski brisati nijedan zapis, pustite ljude da provjere curenja i pristranosti i odobre svaku konverziju.

Zadatak aplikacije

Pripremite mali anonimni rečnik podataka o politici (5-7 kolona, ​​razuman opseg svake). Zatražite od AI za (a) pravilo razumnosti i šifru izvještaja o kršenju za svaku kolonu, (b) izračun frakcije izloženosti, (c) prijedloge za 3 nove funkcije koje možete isprobati. Zatim dodajte namjernu varijablu "zamka curenja" na listu (npr. "plaćena kompenzacija") i testirajte da li je AI uhvati kao curenje.

kontrolna lista

  • [ ] Jesam li analizirao zašto prije brisanja nedostajućih i odbačenih?
  • [ ] Da li sam pravilno frakcionisao i normalizovao ekspoziciju?
  • [ ] Da li sam napisao aktuarsko opravdanje za svaku novoizvedenu karakteristiku?
  • [ ] Da li sam se pitao da li je svaka varijabla zaista prisutna (curenje) u vrijeme predviđanja?
  • [ ] Jesam li skenirao implicitnu pristrasnost u izvedenim karakteristikama?
  • [ ] Nisam li AI automatski izbrisao sve zapise i sam odobrio svaku odluku?