Gevinster:
- Evne til at etablere generaliseret lineær model (GLM), risikofaktor, tarif og risikopræmiekoncepter med støtte fra kunstig intelligens og oversætte koefficienterne til forretningssprog
- Evne til at diskutere balancen mellem variabel udvælgelse, interaktion, overtilpasning og fortolkning af maskinlæringsmodeller (GBM) med kunstig intelligens
- At kunne forstå, at prismodellen er fri for forbudte/diskriminerende variabler, og den endelige tarifs overensstemmelse med lovgivning og konkurrence er overladt til aktuaren.
Prisen på en forsikring fastsættes ikke tilfældigt. Risikoen for en trafikulykke for en 22-årig, nyautoriseret bilist, der bor i en storby, er statistisk højere end for en 45-årig bilist med 20 års erfaring; I et retfærdigt system bør præmierne også være anderledes. Aktuarens opgave med at måle denne forskel og afspejle den på prisen kaldes prissætning og risikoklassificering. I denne enhed vil vi diskutere den generaliserede lineære model (GLM), den aktuarmæssige rygrad i prisfastsættelsen og dens maskinlæringsalternativer og se, hvordan man sikkert bruger AI i denne proces.
Et par grundlæggende udtryk. Risikofaktor er den variabel, der påvirker risikoen og bruges i prisfastsættelsen (alder, køretøjets alder, region, tilsigtet brug). Taksten er et sæt regler, der bestemmer, hvordan præmien beregnes efter risikofaktorer. Risikopræmien er den rene forventede tabsomkostning; Når udgifter, provisioner, avancer og kapitalomkostninger tillægges, dannes den kommercielle præmie (salgsprisen). Lad os minde fra begyndelsen: AI foreslår variabler, bygger modeller, forklarer koefficienter; Men hvilken variabel, der er lovlig og etisk, og om den endelige tarif overholder lovgivning og konkurrence, tilhører aktuaren og compliance-enheden.
Hvorfor GLM er standarden inden for aktuar
Den mest anvendte metode til prisfastsættelse er GLM. GLM står for "generaliseret lineær model": den udvider klassisk lineær regression til at passe til ikke-normalfordelte mål, såsom skadesdata. Den har to grundlæggende komponenter. Fordelingsfamilie: Poisson er valgt for frekvens, gamma er valgt for intensitet (logik i enhed 2). Link funktion (link): sædvanligvis logaritmisk, som tillader faktorerne at have en multiplikativ effekt. Den multiplikative struktur er meget værdifuld i aktuar, fordi det er præcis sådan, taksten er sat op: basispræmie × aldersfaktor × regionsfaktor × køretøjsfaktor.
Den største fordel ved GLM er fortolkning. En koefficient fortæller dig direkte: "den unge førergruppe øger frekvensen med 1,6 gange sammenlignet med referencegruppen." Denne gennemsigtighed er kritisk på tre måder: (1) regulatoren og den interne revision kan forstå og godkende modellen; (2) en forbudt/diskriminerende virkning er synlig; (3) prislogik kan forklares for salgs- og ledelsesteamet. Mere komplekse maskinlæringsmodeller (nedenfor) giver nogle gange højere nøjagtighed, men på bekostning af gennemsigtighed.
Tip: GLM-koefficienten er på log-skalaen. Bed AI om at konvertere koefficienten til en "multiplikeringsfaktor" med exp(koefficient); Det ville være meget nemmere at oversætte til forretningssprog (f.eks. koefficient 0,47 → faktor ≈ 1,60 → "60 % mere risikabelt").
Variabelt udvalg, overfitting og maskinlæring
Den mest kritiske beslutning i prisfastsættelsen er, hvilke variabler der forbliver i modellen. Der er to fælder. Få variabler gør modellen blind: Hvis den vigtige risikodriver overses, vil prisen være forkert. For variabel/overtilpasning får modellen til at huske tidligere data: modellen forveksler støj med signal og fejler med nye politikker. Balance etableres gennem krydsvalidering - opdeling af data i trænings- og teststykker og testning på data, som modellen ikke kan se, enkelhed og aktuarmæssig begrundelse.
Interaktion er også vigtig: Nogle gange er den kombinerede effekt af to faktorer forskellig fra summen af deres separate effekter (et ungt + sporty køretøj kan være mere risikabelt end summen af deres individuelle effekter). I GLM tilføjes interaktioner eksplicit.
I de senere år er modeller som GBM (gradient boosting machine - en kraftfuld maskinlæringsmetode, der kombinerer mange små beslutningstræer) blevet almindelige i prissætning. Disse fanger automatisk komplekse mønstre og interaktioner, hvilket ofte giver mere præcise forudsigelser end GLM. Men det har en pris: tendensen til at være en "sort boks". Almindelig praksis i dag er at bruge GBM til opdagelse og idégenerering og GLM til den endelige gennemsigtige tarif; eller fortolkning af GBM-outputtet med forklaringsværktøjer såsom SHAP.
Følgende tabel sammenligner de to tilgange:
kriterium
GLM
GBM (machine learning)
Fortolkelighed
Høj (koefficient på)
Lav (kræver annotationsværktøj)
Interaktionsfangst
Tilføjet manuelt
automatisk
Risiko for overmontering
lav-middel
Høj (omhyggelig justering påkrævet)
Regulator/revisionsgodkendelse
let
Svært, kræver yderligere dokumentation
Typisk brug
endelig takst
opdagelse, sammenligning
Sådan bruger du AI i prisfastsættelse
1) Oversættelse af GLM-koefficienten til forretningssprog:
Jeg opretter en frekvens GLM (Poisson, log link). Nogle koefficienter (log skala): age_group_18_25: 0,47 ; region_majority: 0,22 ; arac_yasi_10plus: -0,15. Konverter hver enkelt til en multiplikatorfaktor med exp() og forklar det i én sætning, som en leder kan forstå. Husk også, hvad referencegruppen er.
2) Variabel/interaktionsdiskussion:
Din rolle: prisassistent. Mine kandidatvariabler til trafikfrekvensmodellen er: alder, køn, region, køretøjets alder, motorkraft, årlige km, erhverv. - Hvilke variabler kan være risikable ud fra et regulatorisk/etisk perspektiv (f.eks. indirekte diskrimination)? - Hvilke bilaterale interaktioner ville give mening at prøve? - Hvilke verifikationstrin skal jeg følge for at undgå overfitting? beslutningstagning; Giv mig rammerne for kontrol og diskussion.
3) Overmonteringskontrolkode:
Skriv kommenteret kode, der evaluerer en GLM med k-fold krydsvalidering ved hjælp af Python + scikit-learn / statsmodeller. Brug Poisson-afvigelse som metrik. Sammenlign trænings- og testresultaterne og forklar i kommentarfeltet, hvordan du læser overfitting-skiltet. Biblioteket er falsk.
4) Diskrimination/surrogat variabel screening:
'Postnummer' viste sig at være en stærk variabel i min prismodel. Forklar risikoen for, at dette indirekte repræsenterer en forbudt karakteristik (f.eks. etnicitet, indkomst) som en proxyvariabel. - Hvilken analyse skal jeg lave for at teste for denne risiko? - Hvilke alternativer er der for at mindske risikoen? Ydelse af juridisk rådgivning; tegne en teknisk og etisk ramme.
Svag prompt / Stærk prompt
Svag prompt:
Etabler den bedste prismodel for trafikforsikring.
"Bedst" er udefineret; Ingen data, ingen begrænsninger, ingen lovgivning. AI giver et generisk, uanvendeligt svar.
Kraftig prompt:
Din rolle: assistent for prisaktuaren. Kontekst: Jeg er ved at bygge en trafikgren-frekvensmodel, GLM (Poisson, log link). Variablerne jeg har: aldersgruppe, køretøjets alder, region (provins), årlig km, påtænkt brug. Begrænsning: køn kan ikke anvendes af lovgivning; Jeg skal undgå indirekte diskrimination.Opgave:1) Foreslå indledende modelspecifikation med disse variabler (inklusive referencegrupper).2) Angiv årsager til 2 interaktioner, jeg bør prøve.3) Giv en liste over trin til at kontrollere overtilpasning.4) Tilføj særlig opmærksomhed for 'region' med hensyn til indirekte diskrimination.Jeg vil træffe beslutningen; Du giver rammerne og begrundelsen.
tre minisager
Sag 1 — Værdien af gennemsigtighed. En virksomhed præsenterede en meget nøjagtig prismodel, den byggede med GBM, for regulatoren, men kunne ikke forklare koefficienterne; godkendelse forsinket. Aktuaren konstruerede en GLM, der fangede de samme signaler; Nøjagtigheden faldt med 2 procent, men fordi alle faktorer kunne tages i betragtning, blev modellen valideret inden for en måned. GBM blev gemt til rekognoscering, GLM blev tarif. YZ producerede hurtigt koden og regulatorbeskrivelsen, der sammenlignede ydeevnen af de to modeller.
Tilfælde 2 — Overfittingsfælden. En hjælper fik en perfekt score på træningsdata, da han tilføjede mere end 40 variabler og adskillige interaktioner til modellen. Men ved krydsvalidering kollapsede testresultatet: modellen havde husket støjen. Ydeevnen i den virkelige verden steg, da antallet af variabler blev reduceret til 12 og forenklet. Lektion: se på den hidtil usete datascore, ikke træningsresultatet.
Sag 3 — Indirekte forskelsbehandling. I en model forklarede "naboskabs"-variablen præmien stærkt. Analysen viste, at denne variabel stort set overlappede med etnisk koncentration, dvs. den var en proxy for en forbudt egenskab. Aktuaren erstattede denne variabel med mere neutrale risikoindikatorer (vejtype, parkeringsforhold); både etiske og juridiske risici er faldet. AI producerede korrelationsanalyse, der målte overlap og forslag til alternative variable; Aktuar- og complianceenheden traf beslutningen.
Almindelige fejl
- Gør den ufortolkelige model til den ultimative opskrift. En pris, der ikke kan forklares til regulator, revision og kunde, er uholdbar; Gennemsigtighed er afgørende.
- Stoler på uddannelsesscore. Overfitting detekteres kun i usete data (krydsvalidering).
- Brug af forbudte/surrogatvariabler uden kontrol. Variabler såsom postnummer og besættelse kan medføre indirekte diskrimination; Sørg for at teste det.
- Forveksler risikopræmie med kommerciel præmie. Ren skadesomkostning alene er ikke salgsprisen; udgift, fortjeneste og kapitalomkostninger tillægges.
- Efterlader koefficienten på en log-skala og fejlfortolker den. At kommentere uden at konvertere det til en multiplikatorfaktor med exp() vil forårsage en fejl.
Forsigtig: AI's anbefaling af den model, der "giver den bedste nøjagtighed", er ikke automatisk den model, der "bør bruges". Gennemsigtighed, retfærdighed og overholdelse af lovgivning er obligatoriske kriterier såvel som nøjagtighed i aktuarmæssig prisfastsættelse.
Sammenfattende
Prisfastsættelse er processen med at måle risiko med risikofaktorer og konvertere den til en rimelig præmie. GLM er standarden for aktuarmæssig prisfastsættelse med dens multiplikative og fortolkbare struktur; Koefficienter konverteres til faktorer med exp(). Maskinlæringsmodeller såsom GBM kan være mere nøjagtige, men de reducerer gennemsigtigheden og bruges typisk til opdagelse. Variabel udvælgelse bør beskyttes mod overtilpasning ved krydsvalidering, og indirekte diskrimination (surrogatvariabel) bør kontrolleres omhyggeligt. AI bygger modellen, skriver kode og forklarer koefficienten; Men juridisk-etisk overholdelse og endelig tarif tilhører aktuar- og complianceenheden.
Ansøgningsopgave
Nævn 5-6 risikofaktorer for en major. Bed AI om (a) en indledende specifikation af GLM med disse faktorer, (b) 2 interaktioner for at prøve og deres begrundelse, (c) en screening af variabler, der kan være i fare for indirekte diskrimination. Giv derefter et eksempel på 3 log-koefficienter, bed AI’en om at konvertere den til en multiplikatorfaktor med exp() og overføre den til forretningssproget og verificere faktorerne manuelt.
tjekliste
- [ ] Kan min model fortolkes; Kan jeg oversætte virkningen af hver faktor til forretningssprog?
- [ ] Har jeg tjekket for overtilpasning ved krydsvalidering?
- [ ] Har jeg scannet for indirekte diskrimination for forbudte og proxy-variabler?
- [ ] Har jeg bevidst adskilt risikopræmien fra den kommercielle præmie?
- [ ] Har jeg konverteret koefficienterne til multiplikatorer med exp() og fortolket dem korrekt?
- [ ] Tog jeg den endelige takstbeslutning sammen med enheden for lovgivning og overholdelse?