Jedinica 4 / 11

Klasifikacija cijena i rizika: GLM, tarifiranje i umjetna inteligencija

Dobici:

  • Sposobnost uspostavljanja generalizovanog linearnog modela (GLM), faktora rizika, tarifa i koncepata premije rizika uz podršku veštačke inteligencije i prevođenje koeficijenata na poslovni jezik
  • Sposobnost da se raspravlja o ravnoteži varijabilnog odabira, interakcije, prekomjernog prilagođavanja i interpretabilnosti modela strojnog učenja (GBM) s umjetnom inteligencijom
  • Biti u stanju razumjeti da model određivanja cijena ne sadrži zabranjene/diskriminatorne varijable i da je usklađenost konačne tarife sa zakonodavstvom i konkurencijom prepušteno aktuaru.

Cijena polise osiguranja nije nasumično određena. Rizik od saobraćajne nesreće za 22-godišnjeg, tek licenciranog vozača koji živi u velikom gradu statistički je veći nego kod 45-godišnjeg vozača sa 20 godina iskustva; U pravednom sistemu, premije bi takođe trebale biti drugačije. Posao aktuara da izmjeri ovu razliku i odrazi je na cijenu naziva se klasifikacija cijena i rizika. U ovoj cjelini ćemo razgovarati o generaliziranom linearnom modelu (GLM), aktuarskoj okosnici određivanja cijena i njegovim alternativama za strojno učenje i vidjeti kako sigurno koristiti AI u ovom procesu.

Nekoliko osnovnih pojmova. Faktor rizika je varijabla koja utječe na rizik i koristi se u određivanju cijena (starost, starost vozila, regija, predviđena upotreba). Tarifa je skup pravila koja određuju kako će se premija obračunavati prema faktorima rizika. Premija rizika je čisti očekivani trošak gubitka; Kada se dodaju troškovi, provizije, profitne marže i kapitalni troškovi, formira se komercijalna premija (prodajna cijena). Podsjetimo od početka: AI predlaže varijable, gradi modele, objašnjava koeficijente; Ali koja varijabla je zakonska i etička i da li je konačna tarifa u skladu sa zakonodavstvom i konkurencijom pripada aktuaru i jedinici za usklađenost.

Zašto je GLM standard u aktuarstvu

Najčešći metod određivanja cijena je GLM. GLM je skraćenica za “generalizirani linearni model”: proširuje klasičnu linearnu regresiju kako bi odgovarala nenormalno raspoređenim ciljevima, kao što su podaci o šteti. Ima dvije osnovne komponente. Porodica distribucije: Poisson je odabran za frekvenciju, gama je odabran za intenzitet (logika u jedinici 2). Funkcija veze (link): obično logaritamska, što omogućava faktorima da imaju multiplikativni efekat. Multiplikativna struktura je vrlo vrijedna u aktuarstvu jer je upravo tako postavljena tarifa: osnovna premija × faktor starosti × faktor regije × faktor vozila.

Najveća prednost GLM-a je interpretabilnost. Koeficijent vam direktno govori: "grupa mladih vozača povećava frekvenciju za 1,6 puta u odnosu na referentnu grupu." Ova transparentnost je kritična na tri načina: (1) regulator i interna revizija mogu razumjeti i odobriti model; (2) vidljiv je zabranjeni/diskriminatorni efekat; (3) logika cijena može se objasniti prodajnom i menadžerskom timu. Složeniji modeli mašinskog učenja (ispod) ponekad daju veću preciznost, ali nauštrb transparentnosti.

Savjet: GLM koeficijent je na log skali. Zamolite AI da pretvori koeficijent u "faktor množenja" sa exp(koeficijent); Bilo bi mnogo lakše prevesti na poslovni jezik (npr. koeficijent 0,47 → faktor ≈ 1,60 → „60% rizičnije“).

Odabir varijable, prekomjerno prilagođavanje i mašinsko učenje

Najkritičnija odluka u određivanju cijena je koje će varijable ostati u modelu. Postoje dvije zamke. Nekoliko varijabli zasljepljuje model: ako se propusti važan pokretač rizika, cijena će biti pogrešna. Previše varijabilno / prekomjerno prilagođavanje čini da model pamti prošle podatke: model greškom griješi šum sa signalom i ne uspijeva s novim politikama. Ravnoteža se uspostavlja unakrsnom provjerom valjanosti — podjelom podataka na trening i probne komade i testiranjem na podacima koje model ne vidi, jednostavnošću i aktuarskim obrazloženjem.

Interakcija je takođe važna: ponekad se kombinovani efekat dva faktora razlikuje od zbira njihovih odvojenih efekata (mlado + sportsko vozilo može biti rizičnije od zbira njihovih pojedinačnih efekata). U GLM-u se interakcije dodaju eksplicitno.

Poslednjih godina, modeli kao što je GBM (mašina za podizanje gradijenta — moćna metoda mašinskog učenja koja kombinuje mnoga mala stabla odlučivanja) postali su uobičajeni u cenama. Oni automatski hvataju složene obrasce i interakcije, često dajući preciznija predviđanja od GLM-a. Ali to ima svoju cijenu: sklonost da budete "crna kutija". Uobičajena praksa danas je korištenje GBM-a za otkrivanje i generiranje ideja i GLM-a za konačnu transparentnu tarifu; ili tumačenje GBM izlaza pomoću alata za objašnjenje kao što je SHAP.

Sljedeća tabela upoređuje dva pristupa:

kriterijum

GLM

GBM (mašinsko učenje)

Interpretabilnost

Visok (koeficijent uključen)

Niska (zahtijeva alat za napomene)

Snimanje interakcije

Dodano ručno

automatski

Rizik od prenamjene

nisko-srednje

Visoka (potrebno je pažljivo podešavanje)

Odobrenje regulatora/revizije

lako

Teško, zahtijeva dodatnu dokumentaciju

Tipična upotreba

konačna tarifa

otkriće, poređenje

Kako koristiti AI u određivanju cijena

1) Prevođenje GLM koeficijenta na poslovni jezik:

Postavio sam frekvenciju GLM (Poisson, log link). Neki koeficijenti (log skala): starosna grupa_18_25: 0,47 ; region_majority: 0,22 ; arac_yasi_10plus: -0,15. Pretvorite svaki u faktor množenja pomoću exp() i objasnite ga u jednoj rečenici koju menadžer može razumjeti. Također podsjetite šta je referentna grupa.

2) Diskusija o varijabli/interakcija:

Vaša uloga: pomoćnik za određivanje cijena. Moje varijable kandidata za model frekvencije saobraćaja su: starost, pol, regija, starost vozila, snaga motora, godišnji km, profesija. - Koje varijable mogu biti rizične iz regulatorne/etičke perspektive (npr. indirektna diskriminacija)? - Koje bilateralne interakcije bi imalo smisla pokušati? - Koje korake za verifikaciju trebam slijediti kako bih izbjegao preopterećenje? donošenje odluka; Dajte mi okvir za kontrolu i diskusiju.

3) Kontrolni kod prekomjerne opreme:

Napišite komentirani kod koji procjenjuje GLM s k-fold unakrsnom provjerom koristeći Python + scikit-learn / statsmodels. Koristite Poissonovu devijaciju kao metriku. Uporedite rezultate treninga i testa i objasnite u redu za komentare kako čitati znak preopterećenja. Biblioteka je lažna.

4) Diskriminacija/surogat varijabla skrining:

Pokazalo se da je 'Poštanski broj' jaka varijabla u mom modelu cijena. Objasnite rizik da ovo indirektno predstavlja zabranjenu karakteristiku (npr. etničku pripadnost, prihod) kao zamjensku varijablu. - Koju analizu treba da uradim da testiram ovaj rizik? - Koje alternative postoje za smanjenje rizika? Pružanje pravnih savjeta; nacrtati tehnički i etički okvir.

Slaba prompt / Jaka prompt

Slab upit:

Uspostaviti najbolji model cijena za osiguranje saobraćaja.

"Najbolji" je nedefinisan; Nema podataka, nema ograničenja, nema zakona. AI daje generički, neprimjenjiv odgovor.

Snažan upit:

Vaša uloga: pomoćnik aktuara za cijene. Kontekst: Gradim model frekvencije grane saobraćaja, GLM (Poisson, log link). Varijable koje imam: starosna grupa, starost vozila, region (pokrajina), godišnji km, predviđena upotreba. Ograničenje: rod se ne može koristiti u zakonodavstvu; Moram da izbegnem indirektnu diskriminaciju. Zadatak: 1) Predloži početnu specifikaciju modela sa ovim varijablama (uključujući referentne grupe). 2) Navedi razloge za 2 interakcije koje treba da pokušam. 3) Dajte listu koraka za proveru prekomernog prilagođavanja. 4) Dodajte posebnu napomenu za 'region' u smislu indirektne diskriminacije. Ja ću doneti odluku; Vi dajete okvir i opravdanje.

tri mini kofera

Slučaj 1 — Vrijednost transparentnosti. Kompanija je regulatoru predstavila vrlo tačan model određivanja cijena koji je izgradila sa GBM-om, ali nije mogla objasniti koeficijente; odobrenje kasni. Aktuar je konstruisao GLM koji je uhvatio iste signale; Preciznost je pala za 2 posto, ali pošto se svaki faktor mogao uzeti u obzir, model je validiran u roku od mjesec dana. GBM je sačuvan za izviđanje, GLM je postao tarifni. YZ je brzo napravio šifru i opis regulatora upoređujući performanse dva modela.

Slučaj 2 — Zamka prekomjernog ugradnje. Pomoćnik je dobio savršen rezultat na podacima o obuci kada je modelu dodao više od 40 varijabli i brojne interakcije. Ali pri unakrsnoj validaciji, rezultat testa je pao: model je upamtio buku. Performanse u stvarnom svijetu su se povećale kada je broj varijabli smanjen na 12 i pojednostavljen. Lekcija: pogledajte neviđeni rezultat podataka, a ne rezultat treninga.

Slučaj 3 — Indirektna diskriminacija. U jednom modelu, varijabla "susjedstvo" jasno je objasnila premiju. Analiza je pokazala da se ova varijabla u velikoj mjeri preklapa s etničkom koncentracijom, odnosno predstavlja zamjenu za zabranjenu karakteristiku. Aktuar je ovu varijablu zamijenio neutralnijim indikatorima rizika (tip puta, stanje parkinga); i etički i pravni rizici su se smanjili. AI je proizvela analizu korelacije koja mjeri preklapanje i prijedloge alternativnih varijabli; Odluku je donio aktuar i jedinica za usklađenost.

Uobičajene greške

  • Učiniti model koji se ne može protumačiti vrhunskim receptom. Cijena koja se ne može objasniti regulatoru, reviziji i kupcu je neodrživa; Transparentnost je neophodna.
  • Oslanjajući se na obrazovni rezultat. Prekomjerna oprema se otkriva samo u nevidljivim podacima (unakrsna provjera).
  • Korištenje zabranjenih/surogat varijabli bez provjere. Varijable kao što su poštanski broj i zanimanje mogu nositi indirektnu diskriminaciju; Obavezno ga testirajte.
  • Brkanje premije rizika sa komercijalnom premijom. Čista šteta sama po sebi nije prodajna cijena; trošak, dobit i trošak kapitala se dodaju.
  • Ostaviti koeficijent na log skali i pogrešno ga tumačiti. Komentiranje bez konverzije u faktor množenja pomoću exp() će uzrokovati grešku.
Oprez: AI preporuka modela koji "daje najbolju preciznost" nije automatski model koji "treba koristiti". Transparentnost, pravičnost i usklađenost sa zakonima su obavezni kriterijumi, kao i tačnost u aktuarskim cenama.

Ukratko

Određivanje cijena je proces mjerenja rizika sa faktorima rizika i pretvaranja u fer premiju. GLM je standard aktuarskog određivanja cijena sa svojom multiplikativnom i interpretabilnom strukturom; Koeficijenti se pretvaraju u faktore pomoću exp(). Modeli mašinskog učenja kao što je GBM mogu biti precizniji, ali smanjuju transparentnost i obično se koriste za otkrivanje. Odabir varijable treba zaštititi od prekomjernog prilagođavanja unakrsnom validacijom, a indirektnu diskriminaciju (surogat varijabla) treba pažljivo kontrolisati. AI gradi model, piše kod i objašnjava koeficijent; Ali pravno-etička usklađenost i konačna tarifa pripadaju aktuaru i jedinici za usklađenost.

Zadatak aplikacije

Navedite 5-6 faktora rizika za veliki. Zatražite od AI (a) početnu specifikaciju GLM-a sa ovim faktorima, (b) 2 interakcije koje treba pokušati i njihovo obrazloženje, (c) provjeru varijabli koje bi mogle biti izložene riziku od indirektne diskriminacije. Zatim, dajte primjer 3 log-koeficijenta, zamolite AI da ga pretvori u faktor množenja pomoću exp() i prenese ga na poslovni jezik, te ručno provjeri faktore.

kontrolna lista

  • [ ] Može li se moj model protumačiti; Mogu li prevesti uticaj svakog faktora na poslovni jezik?
  • [ ] Jesam li provjerio prekomjernu ugradnju unakrsnom validacijom?
  • [ ] Da li sam skenirao za indirektnu diskriminaciju za zabranjene i proxy varijable?
  • [ ] Da li sam svjesno odvojio premiju rizika od komercijalne premije?
  • [ ] Da li sam konvertovao koeficijente u množitelje pomoću exp() i da li sam ih ispravno interpretirao?
  • [ ] Da li sam donio konačnu odluku o tarifi zajedno sa zakonodavstvom i jedinicom za usklađenost?