Enhet 4 / 11

Prising og risikoklassifisering: GLM, tariffering og kunstig intelligens

Gevinster:

  • Evne til å etablere generalisert lineær modell (GLM), risikofaktor, tariff og risikopremiekonsepter med støtte av kunstig intelligens og oversette koeffisientene til forretningsspråk
  • Evne til å diskutere balansen mellom variabelt utvalg, interaksjon, overtilpasning og tolkning av maskinlæringsmodeller (GBM) med kunstig intelligens
  • Å kunne forstå at prismodellen er fri for forbudte/diskriminerende variabler og at den endelige tariffen overholder lovgivning og konkurranse er overlatt til aktuaren.

Prisen på en forsikring bestemmes ikke tilfeldig. Risikoen for en trafikkulykke for en 22 år gammel, nylisensiert sjåfør som bor i en storby, er statistisk høyere enn for en 45 år gammel sjåfør med 20 års erfaring; I et rettferdig system bør premiene også være annerledes. Aktuarens jobb med å måle denne forskjellen og reflektere den på prisen kalles prising og risikoklassifisering. I denne enheten vil vi diskutere den generaliserte lineære modellen (GLM), den aktuarielle ryggraden i prising og dens maskinlæringsalternativer, og se hvordan du trygt kan bruke AI i denne prosessen.

Noen få grunnleggende termer. Risikofaktor er variabelen som påvirker risikoen og brukes i prissetting (alder, kjøretøyalder, region, tiltenkt bruk). Tariffen er et sett med regler som bestemmer hvordan premien skal beregnes etter risikofaktorer. Risikopremien er den rene forventede tapskostnaden; Når utgifter, provisjoner, fortjenestemarginer og kapitalkostnader legges til, dannes den kommersielle premien (salgsprisen). La oss minne fra begynnelsen: AI foreslår variabler, bygger modeller, forklarer koeffisienter; Men hvilken variabel som er lovlig og etisk og om den endelige tariffen er i samsvar med lovgivning og konkurranse tilhører aktuaren og compliance-enheten.

Hvorfor GLM er standarden innen aktuar

Den mest brukte metoden i prissetting er GLM. GLM står for "generalisert lineær modell": den utvider klassisk lineær regresjon til å passe til ikke-normalfordelte mål, for eksempel skadedata. Den har to grunnleggende komponenter. Distribusjonsfamilie: Poisson er valgt for frekvens, gamma er valgt for intensitet (logikk i enhet 2). Link funksjon (link): vanligvis logaritmisk, som gjør at faktorene kan ha en multiplikativ effekt. Den multiplikative strukturen er svært verdifull i aktuarmessig fordi det er nøyaktig hvordan tariffen er satt opp: grunnpremie × aldersfaktor × regionfaktor × kjøretøyfaktor.

Den største fordelen med GLM er tolkbarhet. En koeffisient forteller deg direkte: "gruppen unge førere øker frekvensen med 1,6 ganger sammenlignet med referansegruppen." Denne åpenheten er kritisk på tre måter: (1) regulatoren og internrevisjonen kan forstå og godkjenne modellen; (2) en forbudt/diskriminerende effekt er synlig; (3) prislogikk kan forklares for salgs- og lederteamet. Mer komplekse maskinlæringsmodeller (nedenfor) gir noen ganger høyere nøyaktighet, men på bekostning av åpenhet.

Hint: GLM-koeffisient er på log-skala. Be AI om å konvertere koeffisienten til en "multiplikeringsfaktor" med exp(koeffisient); Det ville vært mye lettere å oversette til forretningsspråk (f.eks. koeffisient 0,47 → faktor ≈ 1,60 → "60 % mer risikofylt").

Variabelt utvalg, overfitting og maskinlæring

Den mest kritiske avgjørelsen i prisingen er hvilke variabler som vil forbli i modellen. Det er to feller. Få variabler gjør modellen blind: Hvis den viktige risikodriveren savnes, blir prisen feil. For variabel / overtilpasning gjør at modellen husker tidligere data: modellen tar feil av støy som signal og mislykkes med nye retningslinjer. Balansen etableres gjennom kryssvalidering — å dele inn dataene i trenings- og testbiter og teste dem på data som modellen ikke ser, enkelhet og aktuarmessig resonnement.

Interaksjon er også viktig: noen ganger er den kombinerte effekten av to faktorer forskjellig fra summen av deres separate effekter (et ungt + sporty kjøretøy kan være mer risikabelt enn summen av deres individuelle effekter). I GLM legges interaksjoner eksplisitt til.

De siste årene har modeller som GBM (gradient boosting machine — en kraftig maskinlæringsmetode som kombinerer mange små beslutningstrær) blitt vanlig i prissetting. Disse fanger automatisk opp komplekse mønstre og interaksjoner, og gir ofte mer nøyaktige spådommer enn GLM. Men det har en pris: tendensen til å være en "black box". Vanlig praksis i dag er å bruke GBM for oppdagelse og idégenerering og GLM for den endelige transparente tariffen; eller tolke GBM-utdataene med forklaringsverktøy som SHAP.

Følgende tabell sammenligner de to tilnærmingene:

kriterium

GLM

GBM (maskinlæring)

Tolkbarhet

Høy (koeffisient på)

Lav (krever merknadsverktøy)

Interaksjonsfangst

Lagt til manuelt

automatisk

Fare for overmontering

lav-middels

Høy (nøysom justering kreves)

Regulator/revisjonsgodkjenning

enkelt

Vanskelig, krever tilleggsdokumentasjon

Typisk bruk

endelig tariff

oppdagelse, sammenligning

Hvordan bruke AI i prissetting

1) Oversettelse av GLM-koeffisienten til forretningsspråk:

Jeg setter opp en frekvens GLM (Poisson, loggkobling). Noen koeffisienter (loggskala): aldersgruppe_18_25: 0,47 ; region_majority: 0,22 ; arac_yasi_10pluss: -0,15. Konverter hver enkelt til en multiplikatorfaktor med exp() og forklar det i én setning som en leder kan forstå. Minn også på hva referansegruppen er.

2) Variabel/interaksjonsdiskusjon:

Din rolle: prisassistent. Mine kandidatvariabler for trafikkfrekvensmodellen er: alder, kjønn, region, kjøretøyalder, motoreffekt, årlig km, yrke. - Hvilke variabler kan være risikable fra et regulatorisk/etisk perspektiv (f.eks. indirekte diskriminering)? – Hvilke bilaterale interaksjoner vil det være fornuftig å prøve? - Hvilke verifiseringstrinn bør jeg følge for å unngå overmontering? beslutningstaking; Gi meg rammen for kontroll og diskusjon.

3) Overmonteringskontrollkode:

Skriv kommentert kode som evaluerer en GLM med k-fold kryssvalidering ved å bruke Python + scikit-learn / statsmodeller. Bruk Poisson-avvik som metrikk. Sammenlign trenings- og testresultatene og forklar i kommentarfeltet hvordan du kan lese overfitting-skiltet. Biblioteket er falskt.

4) Diskriminering/surrogatvariabel screening:

'Postnummer' viste seg å være en sterk variabel i min prismodell. Forklar risikoen for at dette indirekte representerer en forbudt egenskap (f.eks. etnisitet, inntekt) som en proxy-variabel. – Hvilken analyse bør jeg gjøre for å teste for denne risikoen? – Hvilke alternativer finnes for å redusere risikoen? Gi juridisk rådgivning; tegne et teknisk og etisk rammeverk.

Svak forespørsel / Sterk forespørsel

Svak melding:

Etabler den beste prismodellen for trafikkforsikring.

"Best" er udefinert; Ingen data, ingen restriksjoner, ingen lovgivning. AI gir et generisk, uanvendelig svar.

Kraftig ledetekst:

Din rolle: assistent for prisaktuaren. Kontekst: Jeg bygger en trafikkgrenfrekvensmodell, GLM (Poisson, logglenke). Variablene jeg har: aldersgruppe, kjøretøysalder, region (provins), årlig km, tiltenkt bruk. Begrensning: kjønn kan ikke brukes av lovgivning; Jeg må unngå indirekte diskriminering.Oppgave:1) Foreslå innledende modellspesifikasjon med disse variablene (inkludert referansegrupper).2) Gi begrunnelse for 2 interaksjoner jeg bør prøve.3) Gi en liste over trinn for å sjekke overtilpasning.4) Legg til spesiell oppmerksomhet for 'region' når det gjelder indirekte diskriminering.Jeg vil ta avgjørelsen; Du gir rammene og begrunnelsen.

tre minisaker

Tilfelle 1 – Verdien av åpenhet. Et selskap presenterte en svært nøyaktig prismodell det bygde med GBM for regulatoren, men kunne ikke forklare koeffisientene; godkjenning forsinket. Aktuaren konstruerte en GLM som fanget opp de samme signalene; Nøyaktigheten falt med 2 prosent, men fordi alle faktorer kunne gjøres rede for, ble modellen validert innen en måned. GBM ble reddet for rekognosering, GLM ble tariff. YZ produserte raskt koden og regulatorbeskrivelsen som sammenlignet ytelsen til de to modellene.

Tilfelle 2 — Overfittingfellen. En hjelper fikk en perfekt score på treningsdata da han la til mer enn 40 variabler og mange interaksjoner til modellen. Men ved kryssvalidering kollapset testresultatet: modellen hadde husket støyen. Ytelsen i den virkelige verden økte da antallet variabler ble redusert til 12 og forenklet. Leksjon: se på den enestående datapoengsummen, ikke treningspoengsummen.

Sak 3 – Indirekte diskriminering. I en modell forklarte «nabolag»-variabelen premien sterkt. Analysen viste at denne variabelen i stor grad overlappet med etnisk konsentrasjon, det vil si at den var en proxy for en forbudt egenskap. Aktuaren erstattet denne variabelen med mer nøytrale risikoindikatorer (veitype, parkeringsforhold); både etiske og juridiske risikoer er redusert. AI produserte korrelasjonsanalyse som målte overlapping og forslag til alternative variabler; Aktuar- og complianceenheten tok avgjørelsen.

Vanlige feil

  • Gjør den utolkbare modellen til den ultimate oppskriften. En pris som ikke kan forklares til regulator, revisjon og kunde er uholdbar; Åpenhet er viktig.
  • Stoler på utdanningspoeng. Overtilpasning oppdages kun i usynlige data (kryssvalidering).
  • Bruker forbudte/surrogatvariabler uten å sjekke. Variabler som postnummer og yrke kan medføre indirekte diskriminering; Pass på å teste den.
  • Forveksler risikopremie med kommersiell premie. Ren skadekostnad alene er ikke salgsprisen; utgift, fortjeneste og kapitalkostnad kommer i tillegg.
  • La koeffisienten ligge på en loggskala og feiltolke den. Å kommentere uten å konvertere den til en multiplikatorfaktor med exp() vil forårsake en feil.
Forsiktig: AIs anbefaling av modellen som «gir best nøyaktighet» er ikke automatisk modellen som «bør brukes». Åpenhet, rettferdighet og overholdelse av lovgivning er obligatoriske kriterier samt nøyaktighet i aktuariell prissetting.

Oppsummert

Prising er prosessen med å måle risiko med risikofaktorer og konvertere den til en rettferdig premie. GLM er standarden for aktuariell prising med sin multiplikative og tolkbare struktur; Koeffisienter konverteres til faktorer med exp(). Maskinlæringsmodeller som GBM kan være mer nøyaktige, men de reduserer åpenheten og brukes vanligvis til oppdagelse. Variabelvalg bør beskyttes mot overtilpasning ved kryssvalidering, og indirekte diskriminering (surrogatvariabel) bør kontrolleres nøye. AI bygger modellen, skriver kode og forklarer koeffisienten; Men juridisk-etisk etterlevelse og endelig tariff tilhører aktuar- og etterlevelsesenheten.

Søknadsoppgave

Nevn 5-6 risikofaktorer for en hovedfag. Be AI om (a) en innledende spesifikasjon av GLM med disse faktorene, (b) 2 interaksjoner for å prøve og deres begrunnelse, (c) en screening av variabler som kan være i fare for indirekte diskriminering. Gi så et eksempel på 3 log-koeffisienter, be AI om å konvertere den til en multiplikatorfaktor med exp() og overføre den til forretningsspråket, og verifisere faktorene manuelt.

sjekkliste

  • [ ] Kan modellen min tolkes; Kan jeg oversette virkningen av hver faktor til forretningsspråk?
  • [ ] Har jeg sjekket for overtilpasning ved kryssvalidering?
  • [ ] Har jeg skannet for indirekte diskriminering for forbudte og proxy-variabler?
  • [ ] Har jeg bevisst skilt risikopremien fra den kommersielle premien?
  • [ ] Har jeg konvertert koeffisientene til multiplikatorer med exp() og tolket dem riktig?
  • [ ] Tok jeg den endelige tariffbeslutningen sammen med enheten for lovgivning og etterlevelse?