Enhed 6 / 11

Dataforberedelse og funktionsteknik: Håndtering af aktuarmæssige data med kunstig intelligens

Gevinster:

  • Evne til at opdage manglende værdier, outliers, eksponerings- og datakvalitetsproblemer i politik og beskadige data med støtte til kunstig intelligens og udarbejde et korrektionsudkast
  • Feature engineering (ny variabel afledning, gruppering, kodning) og eksponeringsnormalisering til kunstig intelligens med den rigtige kontekst
  • Forstå, at datatransformationer foreslået af kunstig intelligens bør revideres af en aktuar mod risikoen for datalækage og skjulte skævheder.

Den mindst omtalte, men mest tidskrævende del af aktuararbejdet er dataforberedelse. Erfarne aktuarer ved, at det meste af tiden i et modelleringsprojekt går med at rense, kombinere og rette dataene. Uanset hvor elegant modellen er, hvis inputdataene er korrupte, er outputtet korrupt - kort sagt "skrald ind, skrald ud." I denne enhed vil vi se typiske problemer med politik- og kravdata, hvordan man detekterer og løser dem med AI og feature engineering (afledte nye variabler, der er mere informative fra eksisterende data) tilgang.

En advarsel fra begyndelsen: dataforberedelse er et tilsyneladende teknisk og uskyldigt skridt, men det er her, de farligste fejl gemmer sig. En forkert eksponeringsnormalisering, et skjult datalæk eller en uforvarende indført skævhed ødelægger alle efterfølgende modeller. AI accelererer dette trin meget, men hvis det efterlades ukontrolleret, forstørrer det også risikoen.

Typiske problemer med aktuarmæssige data

Politik- og kravdata kommer næsten aldrig rene. De mest almindelige problemer er: Manglende værdier: nogle policer har blanke køretøjers alder, erhverv eller region. Blindt at fylde disse med gennemsnittet kan skabe bias; selve mangelen indeholder nogle gange information (de savnede er en anden gruppe). Outliers: ulogiske optegnelser såsom negativ præmie, 200 år gammel forsikret, nul-eksponeringspolitik. Der skal skelnes mellem, om der er tale om datafejl eller reelle kanttilfælde. Inkonsistens: forskellige stavemåder af samme region ("Istanbul", "Istanbul", "34"), datoformatforvirring. Dubletter: Indtastning af samme skade to gange.

Men det mest kritiske problem, der er specifikt for aktuar er eksponering. Hvis en police begynder midt på året, giver den en deleksponering (f.eks. 0,5 år) for det pågældende år, ikke et helt "forsikringsår". Frekvens og skadesrater bør altid normaliseres til eksponering; ellers ser kortsigtede politikker ud til at være høj risiko. AI kan kode eksponeringsberegningen, men du skal angive definitionen og forretningsreglen.

Følgende tabel opsummerer typiske problemer og den korrekte tilgang:

problem

forkert tilgang

rigtige tilgang

manglende værdi

Fyld alle med gennemsnit

Analyser manglen; nogle gange åbne en separat kategori

afvigende

Slet automatisk

Skelne mellem datafejl og reelt lead

eksponering

Tæl alle policer i 1 år

Beregn fraktioneret eksponering

Kategori inkonsistens

ignorere

Match med standardordbog

tilbagevendende skade

læg ikke mærke til

Dedupliker med nøglefelter

Feature engineering: udledning af viden fra data

Feature engineering er kunsten at udlede nye variable, der er mere nyttige for modellen fra eksisterende råvariabler. Eksempler: "alder" fra fødselsdato, "aldersgruppe" (binning) fra alder, "risikosegment" fra køretøjsmærkemodel, "årlig kilometerestimat" fra adresse-politikkombination. En god funktion bærer et stærkere signal end rådata og øger både nøjagtigheden og fortolkningen af ​​modellen.

Tre teknikker bruges ofte i aktuararbejde. Binding: adskille en kontinuerlig variabel (alder) i meningsfulde grupper; dette fanger ikke-lineære forhold og gør taksten læsbar. Kodning: konvertering af kategoriske variabler (region) til et numerisk format, der passer til modellen; Risikobaseret kodning (der repræsenterer hver kategori med sin egen skaderate) er almindelig, men bør gøres med forsigtighed. Normalisering: gør alt sammenligneligt ved at dividere det med dets eksponering. AI genererer hurtigt koden til disse transformationer; Men du skal godkende logikken i hver transformation.

Tip: Målkodning er kraftfuld, men udsat for datalækage: modellen "snyder", hvis du medtager en rækkes egen skade, når du beregner den gennemsnitlige skade for en kategori. Gør altid dette inden for træningsdataene i et krydsvalideringsmønster.

Den mest lumske fare: datalæk og implicit bias

Datalækage er introduktionen af information i modellen, som faktisk ikke eksisterer på forudsigelsestidspunktet. Klassisk eksempel: Introduktion af en variabel, der indeholder resultatet, såsom "udbetalte erstatningskrav", i en model, der forudsiger skadebeløbet. Modellen ser perfekt ud i testdata, men er ubrugelig i den virkelige verden, fordi den information ikke er tilgængelig på forudsigelsestidspunktet. Lækage er ofte skjult og kun fanget af omhyggelig aktuarmæssig begrundelse - AI lægger normalt ikke mærke til det, nogle gange roser den endda den utætte variabel som "meget kraftfuld prædiktor."

Den anden lumske fare er implicit bias. Hvis historiske data uretfærdigt repræsenterer en bestemt gruppe (f.eks. er et område historisk blevet nægtet for mange politikker), har funktioner, der er afledt af disse data, denne skævhed, og modellen replikerer dem ind i fremtiden. Funktionsudviklingsfasen er det mest kritiske tidspunkt, hvor denne skævhed kan genkendes og korrigeres.

Forsigtig: Før du glæder dig, når en variabel "forbedrer forudsigelseskraften enormt," spørg: er denne variabel faktisk til stede på tidspunktet for forudsigelsen, eller involverer den fremtiden? Et resultat, der ser for godt ud, er ofte et tegn på en lækage.

Sådan bruger du AI i dataforberedelse

1) Datakvalitetsscreening:

Din rolle: datakvalitetsassistent. Du har aktuarpolitisk afkast. Kolonner: policy_id, start_date, end_date, age, region, vehicle_alder, premium, claim_count, claim_amount. Giv mig en tjekliste og Python (pandas) kodeskitse:- Tæl manglende værdier efter kolonne.- Marker urimelige værdier (negativ præmie, alder<16 eller >100, beregner brøkdel af eksponering. IKKE i slutningen <start)-/slut år). slette; Bare meld det, så jeg kan bestemme.

2) Funktionsudledning:

Jeg vil gerne udlede nye funktioner fra mine trafikdata. Tilgængelig: alder, køretøj_alder, region, årlig_km, brugstype.- Hvilke alders- og km-grupper (binning) anbefaler du, hvorfor?- Hvordan kan jeg lave risikobaseret kodning for 'region' uden datalækage?- Foreslå 3 nye funktioner, der er værd at prøve, og skriv den aktuarmæssige begrundelse for hver. Jeg vil bestemme.

3) Lækageinspektion:

Min model forudsiger MULIGHEDEN for skade med følgende variabler: alder, region, køretøjsalder, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Hvilke af disse variable udgør en risiko for datalækage? Evaluer for hver, om den vil være tilgængelig på tidspunktet for forudsigelsen. Angiv de mistænkelige og hvorfor.

4) Normalisering af eksponering:

Nogle af mine forsikringer starter midt på året. Forklar og kode eksponeringsnormaliseringen for at beregne frekvensen korrekt: frekvens = samlet skadeantal / samlet eksponering (forsikringsår). Vis med et eksempel, hvordan man beregner eksponeringen af ​​policen, der starter midt på året.

Svag prompt / Stærk prompt

Svag prompt:

Rens dataene og gør dem klar til modellen.

AI ved ikke, hvilken kolonne der er hvilken, forretningsregler, eksponeringsdefinition; Det kan blindt slette og udfylde og ødelægge dataene.

Kraftig prompt:

Din rolle: aktuarmæssig dataforberedelsesassistent.Dataordbog: policy_id (identitet), start/slutdato (policeperiode),alder (forventet 16-90), præmie (skal være >0), claim_count (>=0), claim_amount (>=0).Opgave:1) Skriv rimelighedsregel for hver kolonne og RAPPORTER overtrædelser (sletning af forskellige strategier til 3). mangler 'alder' (slet). / gennemsnit / separat kategori) til stede med plus-minus; Overlad beslutningen til mig.4) Advar, hvis der er en kolonne, der kan udgøre en risiko for lækage. Automatisk sletning af enhver post; Jeg vil godkende enhver beslutning.

tre minisager

Tilfælde 1 — Eksponeringsfejl. I én portefølje blev kortsigtede (3-måneders) rejseforsikringer regnet som hele år, så hyppigheden forekom fire gange lavere, end den faktisk var; Prisen faldt forkert. Da aktuaren beregnede eksponeringen som en brøkdel (0,25 police-år), blev den reelle frekvens afsløret, og taksten blev korrigeret. AI genereret fraktioneret eksponeringskode; Aktuaren gav definitionen.

Tilfælde 2 - Latent lækage. Når en hjælper tilføjede variabelen "fillukketid" til skadesandsynlighedsmodellen, steg nøjagtigheden dramatisk. Glæden var kortvarig: denne variabel kunne først kendes, efter at skaden var sket, hvilket betyder, at den ikke var tilgængelig på forudsigelsestidspunktet. Da den utætte variabel blev fjernet, faldt modellen til et realistisk niveau. Han roste AI-variablen som en "kraftig forudsigelse"; Aktuarens dømmekraft fangede fælden.

Case 3 — Replikation af bias. En virksomhed udledte et "ansøgningsafvisningsmønster" fra historiske data og satte det ind i den nye model. Analysen viste, at tidligere afvisninger var uforholdsmæssigt koncentreret i et bestemt kvarter, hvilket betyder, at der var en historisk skævhed. Denne funktion blev fjernet fra modellen og erstattet med mere neutrale risikoindikatorer. AI producerede analysen, der målte mønstrets overlap med nabolaget; Den etiske beslutning blev truffet af aktuaren og complianceenheden.

Almindelige fejl

  • At udfylde manglende værdier med middelværdien uden at tænke. Manglen i sig selv kan være viden; At udfylde det blindt skaber fordomme.
  • Slet automatisk outliers. Nogle er ægte kantsager; Sletning af data uden at adskille dem fra fejl ødelægger information.
  • Normaliserer ikke eksponeringen. At tælle korte policer som hele år forvrænger frekvensen og forvrænger prisen.
  • Mærker ikke datalækage. Et for godt resultat er ofte et tegn på en variabel, der involverer fremtiden; Spørg, om hver variabel er til stede på forudsigelsestidspunktet.
  • At bringe implicit bias ind i fremtiden. Uretfærdighed i historiske data kan lække ind i afledte træk; Tjek det på feature-stadiet.

Sammenfattende

Aktuariel modellering handler i høj grad om at udarbejde data; Hvis input er korrupt, er output også korrupt. Typiske problemer er manglende værdier, outliers, inkonsekvenser og duplikering; Det kritiske aktuarmæssige problem er eksponeringsnormalisering. Funktionsteknik - gruppering, kodning, normalisering - udleder stærkere signaler fra data. De mest lumske farer er datalækage og implicit bias; begge er kun fanget af aktuarmæssigt ræsonnement. AI fremskynder dette trin meget: scanning genererer kode og anbefalinger. Men slet ikke automatisk nogen registreringer, lad mennesker tjekke for lækager og bias, og godkend hver konvertering.

Ansøgningsopgave

Forbered en lille anonym politikdataordbog (5-7 kolonner, rimelig rækkevidde af hver). Bed AI om (a) rimelighedsreglen og overtrædelsesrapportkoden for hver kolonne, (b) beregning af fraktioneret eksponering, (c) forslag til 3 nye funktioner, du kan prøve. Tilføj derefter en bevidst "lækagefælde"-variabel til listen (f.eks. "kompensation betalt") og test, om AI'en fanger det som en læk.

tjekliste

  • [ ] Har jeg analyseret hvorfor, før jeg sletter manglende og afvigende værdier?
  • [ ] Har jeg fraktioneret og normaliseret eksponeringen korrekt?
  • [ ] Har jeg skrevet den aktuarmæssige begrundelse for hvert nyligt afledt træk?
  • [ ] Har jeg stillet spørgsmålstegn ved, om hver variabel faktisk er til stede (lækage) på forudsigelsestidspunktet?
  • [ ] Har jeg scannet for implicit bias i afledte funktioner?
  • [ ] Fik jeg ikke AI til automatisk at slette nogen poster og selv godkendte hver beslutning?