Vinster:
- Förmåga att upptäcka saknade värden, extremvärden, exponerings- och datakvalitetsproblem i policy och skada data med stöd för artificiell intelligens och producera ett korrigeringsutkast
- Funktionsteknik (ny variabel härledning, gruppering, kodning) och exponeringsnormalisering för artificiell intelligens med rätt sammanhang
- Förstå att datatransformationer som föreslås av artificiell intelligens bör granskas av en aktuarie mot risken för dataläckage och dold partiskhet.
Den minst omtalade men mest tidskrävande delen av försäkringstekniskt arbete är databeredning. Erfarna aktuarier vet att den mesta tiden av ett modelleringsprojekt går åt till att rengöra, kombinera och korrigera data. Oavsett hur elegant modellen är, om indata är korrupta, är utgången korrupt – kort sagt "skräp in, skräp ut." I den här enheten kommer vi att se typiska problem med policy- och anspråksdata, hur man upptäcker och fixar dem med AI och tillvägagångssättet för funktionsteknik (härledda nya variabler som är mer informativa från befintliga data).
En varning från början: dataförberedelse är ett till synes tekniskt och oskyldigt steg, men det är här de farligaste felen gömmer sig. En felaktig exponeringsnormalisering, en dold dataläcka eller en omedvetet införd bias korrumperar tyst alla efterföljande modeller. AI påskyndar detta steg avsevärt, men om det lämnas okontrollerat förstorar det också risken.
Typiska problem med försäkringstekniska uppgifter
Policy och anspråksdata kommer nästan aldrig rena. De vanligaste problemen är: Saknade värden: vissa försäkringar har tomt fordons ålder, yrke eller region. Att blint fylla dessa med genomsnittet kan skapa partiskhet; själva bristen innehåller ibland information (de saknade är en annan grupp). Outliers: ologiska rekord som negativ premie, 200-åriga försäkrade, noll-exponeringspolicy. Det måste särskiljas om det rör sig om datafel eller riktiga kantfall. Inkonsekvens: olika stavningar av samma region ("Istanbul", "Istanbul", "34"), datumformat förvirring. Dubbletter: införande av samma skada två gånger.
Men den mest kritiska frågan för försäkringsmatematisk är exponering. Om en försäkring börjar mitt på året ger den en delexponering (t.ex. 0,5 år) för det året, inte ett helt "försäkringsår". Frekvens och skadefrekvens bör alltid normaliseras till exponering; annars verkar kortsiktiga försäkringar vara hög risk. AI kan koda exponeringsberäkningen, men du måste tillhandahålla definitionen och affärsregeln.
Följande tabell sammanfattar typiska problem och det korrekta tillvägagångssättet:
problem
fel tillvägagångssätt
rätt tillvägagångssätt
saknat värde
Fyll alla med medel
Analysera bristen; ibland öppna en separat kategori
avvikande
Radera automatiskt
Skilj mellan datafel och verkligt lead
exponering
Räkna alla försäkringar under 1 år
Beräkna fraktionerad exponering
Kategori inkonsekvens
ignorera
Matcha med standardordbok
återkommande skada
märker inte
Avduplicera med nyckelfält
Funktionsteknik: härleda kunskap från data
Funktionsteknik är konsten att härleda nya variabler som är mer användbara för modellen från befintliga råvariabler. Exempel: "ålder" från födelsedatum, "åldersgrupp" (binning) från ålder, "risksegment" från fordonsmärke, "uppskattning av årlig körsträcka" från adress-policykombination. En bra funktion bär en starkare signal än rådata och ökar både noggrannheten och tolkningsbarheten av modellen.
Tre tekniker används ofta i försäkringstekniskt arbete. Bindning: separera en kontinuerlig variabel (ålder) i meningsfulla grupper; detta fångar icke-linjära samband och gör tariffen läsbar. Kodning: omvandling av kategoriska variabler (region) till ett numeriskt format som är lämpligt för modellen; Riskbaserad kodning (som representerar varje kategori med sin egen skadefrekvens) är vanligt men bör göras med försiktighet. Normalisering: gör allt jämförbart genom att dividera det med dess exponering. AI genererar snabbt koden för dessa transformationer; Men du måste godkänna logiken i varje transformation.
Tips: Målkodning är kraftfull men utsatt för dataläckage: modellen "fuskar" om du tar med en rads egen skada när du beräknar den genomsnittliga skadan för en kategori. Gör alltid detta inom träningsdata, i ett korsvalideringsmönster.
Den mest lömska faran: dataläckor och implicit partiskhet
Dataläckage är införandet av information i modellen som faktiskt inte existerar vid tidpunkten för förutsägelsen. Klassiskt exempel: att införa en variabel som innehåller utfallet, till exempel "betalda fordringar", i en modell som förutsäger skadebeloppet. Modellen ser perfekt ut i testdata men är värdelös i den verkliga världen eftersom den informationen inte är tillgänglig vid tidpunkten för förutsägelsen. Läckage döljs ofta och fångas endast upp av noggranna försäkringstekniska resonemang - AI:n märker vanligtvis inte det, ibland till och med prisar den läckande variabeln som "mycket kraftfull prediktor."
Den andra lömska faran är implicit partiskhet. Om historiska data på ett orättvist sätt representerar en viss grupp (till exempel har ett område historiskt nekats för många policyer), har egenskaper som härrör från den data den fördomen och modellen replikerar den in i framtiden. Funktionsteknikfasen är det mest kritiska ögonblicket när denna förspänning kan identifieras och korrigeras.
Varning: Innan du gläds när en variabel "förbättrar prediktiv kraft oerhört", fråga: är denna variabel faktiskt närvarande vid tidpunkten för förutsägelsen, eller involverar den framtiden? Ett resultat som ser för bra ut är ofta ett tecken på en läcka.
Hur man använder AI i databeredning
1) Datakvalitetsscreening:
Din roll: datakvalitetsassistent. Du har försäkringsteknisk avkastning. Kolumner: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount.Ge mig en checklista och Python (pandas) kodskiss:- Räkna saknade värden per kolumn.- Flagga orimliga värden (negativ premie, ålder<16 eller >100, räkna ut bråkdel av exponeringen/slutet år) INTE från början/slutet. ta bort; Anmäl bara så jag kan bestämma mig.
2) Funktionshärledning:
Jag vill hämta nya funktioner från min trafikdata. Tillgängligt: ålder, fordonsålder, region, årlig_km, användningstyp.- Vilka ålders- och kmgrupper (binning) rekommenderar du, varför?- Hur kan jag göra riskbaserad kodning för 'region' utan dataläckage?- Föreslå 3 nya funktioner som är värda att prova och skriv den försäkringstekniska motiveringen för varje. Jag kommer att bestämma mig.
3) Läckageinspektion:
Min modell förutsäger MÖJLIGHETEN för skada med följande variabler: ålder, region, fordonsålder, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Vilken av dessa variabler utgör en risk för dataläckage? För varje, utvärdera om det kommer att vara tillgängligt vid tidpunkten för förutsägelsen. Lista de misstänkta och varför.
4) Normalisering av exponeringen:
Vissa av mina försäkringar börjar mitt på året. Förklara och koda exponeringsnormaliseringen för att beräkna frekvensen korrekt: frequency = total claim_count / total exponering (försäkringsår). Visa med ett exempel hur man beräknar exponeringen av försäkringen som börjar i mitten av året.
Svag prompt / Stark prompt
Svag uppmaning:
Rengör data och gör den redo för modellen.
AI vet inte vilken kolumn som är vilken, affärsregler, exponeringsdefinition; Det kan blint radera och fylla och korrumpera data.
Kraftfull uppmaning:
Din roll: aktuariella databeredningsassistent.Dataordbok: policy_id (identitet), start/slut_datum (policyperiod),ålder (förväntad 16-90), premie (måste vara >0), claim_count (>=0), claim_amount (>=0).Uppgift:1) Skriv rimlighetsregel för varje kolumn och RAPPORTERA överträdelser (beräkna fraal exponering till 3). saknar 'ålder' (radera). / genomsnitt / separat kategori) finns med plus-minus; Lämna beslutet till mig.4) Varna om det finns en kolumn som kan innebära risk för läckage.Automatisk radering av eventuell post; Jag kommer att godkänna varje beslut.
tre minifodral
Fall 1 — Exponeringsfel. I en portfölj räknades kortsiktiga (3-månaders) reseförsäkringar som hela år, så frekvensen verkade fyra gånger lägre än den faktiskt var; Priset föll felaktigt. När aktuarien beräknade exponeringen som en bråkdel (0,25 försäkringsår) avslöjades den verkliga frekvensen och tariffen korrigerades. AI genererad fraktionerad exponeringskod; Aktuarien gav definitionen.
Fall 2 — Latent läckage. När en hjälpare la till variabeln "filstängningstid" till skadesannolikhetsmodellen ökade noggrannheten dramatiskt. Glädjen var kortvarig: denna variabel kunde bara kännas efter att skadan hade inträffat, vilket innebär att den inte var tillgänglig vid tidpunkten för förutsägelsen. När den läckande variabeln togs bort minskade modellen till en realistisk nivå. Han berömde AI-variabeln som en "kraftig prediktor"; Aktuariens omdöme fångade fällan.
Fall 3 – Replikering av bias. Ett företag härledde ett "ansökningsavslagsmönster" från historiska data och lade in det i den nya modellen. Analysen visade att tidigare avslag var oproportionerligt koncentrerade till en viss stadsdel, vilket betyder att det fanns en historisk fördom. Denna funktion togs bort från modellen och ersattes med mer neutrala riskindikatorer. AI producerade analysen som mätte mönstrets överlappning med grannskapet; Det etiska beslutet fattades av aktuarien och complianceenheten.
Vanliga misstag
- Fylla i saknade värden med medelvärdet utan att tänka. Bristen i sig kan vara kunskap; Att fylla i blint skapar fördomar.
- Ta bort extremvärden automatiskt. Vissa är sanna kantfall; Att radera data utan att separera det från fel förstör information.
- Normaliserar inte exponeringen. Att räkna korta försäkringar som hela år snedvrider frekvensen och snedvrider priset.
- Märker inte av dataläckage. Ett för bra resultat är ofta ett tecken på en variabel som involverar framtiden; Fråga om varje variabel är närvarande vid tidpunkten för förutsägelse.
- Att föra in implicit partiskhet in i framtiden. Orättvisa i historiska data kan läcka in i härledda drag; Kontrollera det på inslagsstadiet.
Sammanfattningsvis
Aktuariella modellering handlar till stor del om att förbereda data; Om ingången är korrupt är utmatningen också korrupt. Typiska problem är saknade värden, extremvärden, inkonsekvenser och dubbelarbete; Den kritiska försäkringstekniska frågan är exponeringsnormalisering. Funktionsteknik — gruppering, kodning, normalisering — härleder starkare signaler från data. De mest lömska farorna är dataläckage och implicit partiskhet; båda fångas endast av försäkringstekniska resonemang. AI påskyndar detta steg avsevärt: genomsökning genererar kod och rekommendationer. Men ta inte bort några poster automatiskt, låt människor leta efter läckor och bias och godkänn varje konvertering.
Applikationsuppgift
Förbered en liten anonym policydatalexikon (5-7 kolumner, rimligt utbud av varje). Be AI om (a) rimlighetsregeln och överträdelserapportkoden för varje kolumn, (b) beräkning av fraktionerad exponering, (c) förslag på tre nya funktioner att prova. Lägg sedan till en avsiktlig "läckfälla"-variabel till listan (t.ex. "ersättning utbetald") och testa om AI:n fångar det som en läcka.
checklista
- [ ] Har jag analyserat varför innan jag raderade saknade och extremvärden?
- [ ] Har jag fraktionerat och normaliserat exponeringen korrekt?
- [ ] Har jag skrivit den försäkringstekniska motiveringen för varje nyligen härledd egenskap?
- [ ] Har jag ifrågasatt om varje variabel faktiskt är närvarande (läckage) vid tidpunkten för förutsägelse?
- [ ] Har jag skannat efter implicit bias i härledda funktioner?
- [ ] Fick jag inte AI att automatiskt ta bort några poster och godkände varje beslut själv?