Vinster:
- Förmåga att etablera generaliserad linjär modell (GLM), riskfaktor, tariff och riskpremiekoncept med stöd av artificiell intelligens och översätta koefficienterna till affärsspråk
- Förmåga att diskutera balansen mellan variabelval, interaktion, överanpassning och tolkning av maskininlärningsmodeller (GBM) med artificiell intelligens
- Att kunna förstå att prissättningsmodellen är fri från förbjudna/diskriminerande variabler och att den slutliga tariffen överensstämmer med lagstiftning och konkurrens överlåts till aktuarien.
Priset på en försäkring bestäms inte slumpmässigt. Risken för en trafikolycka för en 22-årig, nylicenserad förare som bor i en storstad är statistiskt sett högre än för en 45-årig förare med 20 års erfarenhet; I ett rättvist system bör premierna också vara olika. Aktuariens uppgift att mäta denna skillnad och reflektera den på priset kallas prissättning och riskklassificering. I den här enheten kommer vi att diskutera den generaliserade linjära modellen (GLM), den aktuariella ryggraden i prissättningen och dess alternativ för maskininlärning, och se hur man säkert använder AI i denna process.
Några grundläggande termer. Riskfaktor är den variabel som påverkar risken och som används i prissättningen (ålder, fordonsålder, region, avsedd användning). Tariffen är ett regelverk som bestämmer hur premien ska beräknas enligt riskfaktorer. Riskpremien är den rena förväntade förlustkostnaden; När utgifter, provisioner, vinstmarginaler och kapitalkostnader läggs till bildas den kommersiella premien (försäljningspriset). Låt oss påminna från början: AI föreslår variabler, bygger modeller, förklarar koefficienter; Men vilken variabel som är laglig och etisk och om den slutliga tariffen överensstämmer med lagstiftning och konkurrens tillhör aktuarien och complianceenheten.
Varför GLM är standarden inom försäkringsmatematisk
Den mest använda metoden för prissättning är GLM. GLM står för "generaliserad linjär modell": den utökar klassisk linjär regression för att passa icke-normalt fördelade mål, såsom skadedata. Den har två grundläggande komponenter. Distributionsfamilj: Poisson väljs för frekvens, gamma väljs för intensitet (logik i enhet 2). Länkfunktion (länk): vanligtvis logaritmisk, vilket gör att faktorerna kan ha en multiplikativ effekt. Den multiplikativa strukturen är mycket värdefull i försäkringstekniska skäl eftersom det är exakt så taxan är uppbyggd: baspremie × åldersfaktor × regionfaktor × fordonsfaktor.
Den största fördelen med GLM är tolkningsbarhet. En koefficient säger direkt: "den unga förargruppen ökar frekvensen med 1,6 gånger jämfört med referensgruppen." Denna transparens är avgörande på tre sätt: (1) tillsynsmyndigheten och internrevisionen kan förstå och godkänna modellen; (2) en förbjuden/diskriminerande effekt är synlig; (3) prislogik kan förklaras för försäljnings- och ledningsgruppen. Mer komplexa maskininlärningsmodeller (nedan) ger ibland högre noggrannhet, men på bekostnad av transparens.
Tips: GLM-koefficienten är på log-skala. Be AI:n omvandla koefficienten till en "multipliceringsfaktor" med exp(koefficient); Det skulle vara mycket lättare att översätta till affärsspråk (t.ex. koefficient 0,47 → faktor ≈ 1,60 → "60 % mer riskfylld").
Variabelt urval, överutrustning och maskininlärning
Det mest kritiska beslutet vid prissättning är vilka variabler som kommer att finnas kvar i modellen. Det finns två fällor. Få variabler förblindar modellen: om den viktiga riskdrivkraften missas blir priset fel. För variabel/överpassning gör att modellen memorerar tidigare data: modellen missar brus som signal och misslyckas med nya policyer. Balans upprättas genom korsvalidering — uppdelning av data i tränings- och testbitar och testning på data som modellen inte ser, enkelhet och försäkringstekniska resonemang.
Interaktion är också viktigt: ibland skiljer sig den kombinerade effekten av två faktorer från summan av deras separata effekter (ett ungt + sportigt fordon kan vara mer riskfyllt än summan av deras individuella effekter). I GLM läggs interaktioner till explicit.
På senare år har modeller som GBM (gradient boosting machine — en kraftfull maskininlärningsmetod som kombinerar många små beslutsträd) blivit vanliga i prissättningen. Dessa fångar automatiskt komplexa mönster och interaktioner, och ger ofta mer exakta förutsägelser än GLM. Men det har ett pris: tendensen att vara en "svart låda". Vanlig praxis idag är att använda GBM för upptäckt och idégenerering och GLM för den slutliga transparenta tariffen; eller tolka GBM-utdata med förklaringsverktyg som SHAP.
Följande tabell jämför de två metoderna:
kriterium
GLM
GBM (maskininlärning)
Tolkbarhet
Hög (koefficient på)
Låg (kräver anteckningsverktyg)
Interaktionsfångst
Läggs till manuellt
automatiskt
Risk för övermontering
låg-medel
Hög (noggrann justering krävs)
Regulator/revisionsgodkännande
lätt
Svårt, kräver ytterligare dokumentation
Typisk användning
slutlig tariff
upptäckt, jämförelse
Hur man använder AI i prissättning
1) Översätta GLM-koefficienten till affärsspråk:
Jag ställer in en frekvens GLM (Poisson, logglänk). Några koefficienter (log skala): age_group_18_25: 0,47 ; region_majority: 0,22 ; arac_yasi_10plus: -0,15. Konvertera var och en till en multiplikatorfaktor med exp() och förklara det i en mening som en chef kan förstå. Påminn också om vad referensgruppen är.
2) Variabel/interaktionsdiskussion:
Din roll: prisassistent. Mina kandidatvariabler för trafikfrekvensmodellen är: ålder, kön, region, fordonsålder, motoreffekt, årlig km, yrke. - Vilka variabler kan vara riskabla ur ett regulatoriskt/etiskt perspektiv (t.ex. indirekt diskriminering)? - Vilka bilaterala interaktioner skulle vara vettiga att prova? - Vilka verifieringssteg ska jag följa för att undvika övermontering? Beslutsfattande; Ge mig ramarna för kontroll och diskussion.
3) Övermonteringskontrollkod:
Skriv kommenterad kod som utvärderar en GLM med k-faldig korsvalidering med Python + scikit-learn / statsmodeller. Använd Poisson-avvikelse som måttenhet. Jämför tränings- och testresultaten och förklara i kommentarsraden hur man läser övermonteringsskylten. Biblioteket är falskt.
4) Diskriminering/surrogatvariabel screening:
'Postnummer' visade sig vara en stark variabel i min prismodell. Förklara risken för att detta indirekt representerar en förbjuden egenskap (t.ex. etnicitet, inkomst) som en proxyvariabel. - Vilken analys ska jag göra för att testa för denna risk? – Vilka alternativ finns det för att minska risken? Tillhandahållande av juridisk rådgivning; rita en teknisk och etisk ram.
Svag prompt / Stark prompt
Svag uppmaning:
Upprätta den bästa prismodellen för trafikförsäkring.
"Bäst" är odefinierat; Inga data, inga begränsningar, ingen lagstiftning. AI ger ett generiskt, otillämpligt svar.
Kraftfull uppmaning:
Din roll: assistent till prissättningsaktuarien. Sammanhang: Jag bygger en trafikgrenfrekvensmodell, GLM (Poisson, logglänk). Variablerna jag har: åldersgrupp, fordonsålder, region (provins), årlig km, avsedd användning. Begränsning: kön kan inte användas av lagstiftning; Jag måste undvika indirekt diskriminering.Uppgift:1) Föreslå initial modellspecifikation med dessa variabler (inklusive referensgrupper).2) Ange skäl till 2 interaktioner som jag bör försöka.3) Ge en lista med steg för att kontrollera överanpassning.4) Lägg till särskild uppmärksamhet för 'region' när det gäller indirekt diskriminering. Jag kommer att fatta beslutet; Du ger ramarna och motiveringen.
tre minifodral
Fall 1 – Värdet av transparens. Ett företag presenterade en mycket exakt prismodell som det byggde med GBM för regulatorn, men kunde inte förklara koefficienterna; godkännande försenat. Aktuarien konstruerade en GLM som fångade samma signaler; Noggrannheten sjönk med 2 procent, men eftersom varje faktor kunde redovisas validerades modellen inom en månad. GBM sparades för spaning, GLM blev tariff. YZ tog snabbt fram koden och regulatorbeskrivningen som jämförde de två modellernas prestanda.
Fall 2 — Övermonteringsfällan. En hjälpare fick ett perfekt betyg på träningsdata när han lade till mer än 40 variabler och många interaktioner till modellen. Men vid korsvalidering kollapsade testresultatet: modellen hade memorerat bruset. Den verkliga prestandan ökade när antalet variabler reducerades till 12 och förenklades. Lektion: titta på det oöverträffade datapoängen, inte träningspoängen.
Fall 3 — Indirekt diskriminering. I en modell förklarade variabeln "grannskap" premien starkt. Analysen visade att denna variabel till stor del överlappade med etnisk koncentration, dvs den var en proxy för en förbjuden egenskap. Aktuarien ersatte denna variabel med mer neutrala riskindikatorer (vägtyp, parkeringsskick); både etiska och juridiska risker har minskat. AI producerade korrelationsanalys som mätte överlappning och alternativa variabelförslag; Aktuarie- och complianceenheten fattade beslutet.
Vanliga misstag
- Gör den otolkbara modellen till det ultimata receptet. Ett pris som inte kan förklaras för tillsynsmyndigheten, revisionen och kunden är ohållbart; Transparens är viktigt.
- Förlitar sig på utbildningspoäng. Överanpassning upptäcks endast i osynliga data (korsvalidering).
- Använder förbjudna/surrogatvariabler utan att kontrollera. Variabler som postnummer och yrke kan medföra indirekt diskriminering; Se till att testa det.
- Blandar ihop riskpremie med kommersiell premie. Enbart ren skadekostnad är inte försäljningspriset; kostnad, vinst och kapitalkostnad tillkommer.
- Lämna koefficienten på en log skala och misstolka den. Att kommentera utan att konvertera det till en multiplikatorfaktor med exp() kommer att orsaka ett fel.
Varning: AI:s rekommendation av modellen som "ger bäst noggrannhet" är inte automatiskt den modell som "bör användas". Transparens, rättvisa och efterlevnad av lagstiftning är obligatoriska kriterier såväl som noggrannhet i försäkringsteknisk prissättning.
Sammanfattningsvis
Prissättning är processen att mäta risk med riskfaktorer och omvandla den till en rimlig premie. GLM är standarden för försäkringsteknisk prissättning med dess multiplikativa och tolkningsbara struktur; Koefficienter omvandlas till faktorer med exp(). Maskininlärningsmodeller som GBM kan vara mer exakta, men de minskar transparensen och används vanligtvis för upptäckt. Variabelurval bör skyddas mot överanpassning genom korsvalidering, och indirekt diskriminering (surrogatvariabel) bör kontrolleras noggrant. AI bygger modellen, skriver kod och förklarar koefficienten; Men juridisk-etisk efterlevnad och slutlig tariff tillhör aktuarie- och efterlevnadsenheten.
Applikationsuppgift
Lista 5-6 riskfaktorer för en major. Be AI om (a) en initial specifikation av GLM med dessa faktorer, (b) 2 interaktioner att pröva och deras motivering, (c) en screening av variabler som kan vara i riskzonen för indirekt diskriminering. Ge sedan ett exempel på 3 log-koefficienter, be AI:n att konvertera den till en multiplikatorfaktor med exp() och överföra den till affärsspråket och verifiera faktorerna manuellt.
checklista
- [ ] Kan min modell tolkas; Kan jag översätta effekten av varje faktor till affärsspråk?
- [ ] Har jag kontrollerat för överanpassning genom korsvalidering?
- [ ] Har jag skannat efter indirekt diskriminering efter förbjudna variabler och proxyvariabler?
- [ ] Har jag medvetet separerat riskpremien från den kommersiella premien?
- [ ] Omvandlade jag koefficienterna till multiplikatorer med exp() och tolkade jag dem korrekt?
- [ ] Tog jag det slutliga taxebeslutet tillsammans med enheten för lagstiftning och efterlevnad?