Jednotka 6 / 11

Príprava údajov a inžinierstvo funkcií: Spracovanie poistno-matematických údajov pomocou umelej inteligencie

zisky:

  • Schopnosť odhaliť chýbajúce hodnoty, odľahlé hodnoty, problémy s expozíciou a kvalitou údajov v politike a poškodiť údaje s podporou umelej inteligencie a vytvoriť návrh opravy
  • Inžinierstvo funkcií (nové odvodenie premenných, zoskupovanie, kódovanie) a normalizácia expozície umelej inteligencii so správnym kontextom
  • Pochopte, že transformácie údajov navrhnuté umelou inteligenciou by mal skontrolovať poistný matematik proti riziku úniku údajov a skrytej zaujatosti.

Najmenej diskutovanou, ale časovo najnáročnejšou časťou aktuárskej práce je príprava údajov. Skúsení poistní matematici vedia, že väčšinu času modelovacieho projektu strávia čistením, kombinovaním a opravovaním údajov. Bez ohľadu na to, aký elegantný je model, ak sú vstupné údaje poškodené, výstup je poškodený – skrátka „odpadky dovnútra, odpadky von“. V tejto časti uvidíme typické problémy s údajmi o pravidlách a nárokoch, ako ich odhaliť a opraviť pomocou AI a prístup k inžinierstvu funkcií (odvodené nové premenné, ktoré sú informatívnejšie z existujúcich údajov).

Upozornenie na začiatok: príprava dát je zdanlivo technický a nevinný krok, no práve tu sa skrývajú najnebezpečnejšie chyby. Nesprávna normalizácia expozície, skrytý únik údajov alebo neúmyselne zavedené skreslenie v tichosti poškodí všetky nasledujúce modely. Umelá inteligencia tento krok výrazne urýchľuje, no ak je nekontrolovaná, zvyšuje aj riziko.

Typické problémy poistno-matematických údajov

Údaje o pravidlách a nárokoch takmer nikdy nedostanú čisté. Najbežnejšie problémy sú: Chýbajúce hodnoty: niektoré politiky majú prázdne údaje o veku vozidla, zamestnaní alebo regióne. Slepé naplnenie týchto priemerom môže spôsobiť zaujatosť; samotný nedostatok niekedy nesie informáciu (chýbajúci sú iná skupina). Odľahlé hodnoty: nelogické záznamy, ako napríklad záporné poistné, 200-ročný poistenec, politika s nulovou expozíciou. Treba rozlišovať, či ide o dátové chyby alebo skutočné okrajové prípady. Nekonzistentnosť: rôzne hláskovanie rovnakého regiónu ("Istanbul", "Istanbul", "34"), zmätok vo formáte dátumu. Duplicitné záznamy: dvakrát rovnaké poškodenie.

Najkritickejšou otázkou špecifickou pre poistnú matematiku je však expozícia. Ak sa politika začína v polovici roka, poskytuje čiastočnú expozíciu (napr. 0,5 roka) pre daný rok, nie celý „rok politiky“. Frekvencia a miery poškodenia by sa mali vždy normalizovať podľa expozície; inak sa krátkodobé politiky javia ako vysoko rizikové. AI ​​môže kódovať výpočet expozície, ale musíte poskytnúť definíciu a obchodné pravidlo.

Nasledujúca tabuľka sumarizuje typické problémy a správny prístup:

problém

nesprávny prístup

správny prístup

chýbajúca hodnota

Vyplňte všetko priemerom

Analyzujte nedostatok; niekedy otvorte samostatnú kategóriu

odľahlé

Automatické mazanie

Rozlišujte medzi chybou údajov a skutočným potenciálom

expozície

Spočítajte všetky poistky na 1 rok

Vypočítajte frakčnú expozíciu

Nekonzistentnosť kategórie

ignorovať

Zápas so štandardným slovníkom

opakujúce sa poškodenie

nevšímaj si

Deduplikovať pomocou kľúčových polí

Funkcia inžinierstva: odvodzovanie znalostí z údajov

Funkcionalita je umenie odvodzovať nové premenné, ktoré sú pre model užitočnejšie, z existujúcich nespracovaných premenných. Príklady: „vek“ z dátumu narodenia, „veková skupina“ (binning) z veku, „rizikový segment“ z modelu značky vozidla, „ročný odhad najazdených kilometrov“ z kombinácie adresy a politiky. Dobrá funkcia nesie silnejší signál ako nespracované údaje a zvyšuje presnosť aj interpretovateľnosť modelu.

V aktuárskej práci sa často používajú tri techniky. Väzba: oddelenie spojitej premennej (vek) do zmysluplných skupín; toto zachytáva nelineárne vzťahy a robí tarifu čitateľnou. Kódovanie: prevod kategorických premenných (región) do číselného formátu vhodného pre model; Kódovanie založené na riziku (predstavuje každú kategóriu s vlastnou mierou poškodenia) je bežné, ale malo by sa vykonávať opatrne. Normalizácia: urobiť všetko porovnateľným vydelením podľa jeho expozície. AI rýchlo vygeneruje kód pre tieto transformácie; Musíte však schváliť logiku každej transformácie.

Tip: Cieľové kódovanie je výkonné, ale náchylné na únik údajov: model „podvádza“, ak pri výpočte priemerného poškodenia kategórie zahrniete vlastné poškodenie radu. Vždy to robte v rámci tréningových údajov v krížovom overovacom vzore.

Najzákernejšie nebezpečenstvo: únik údajov a implicitná zaujatosť

Únik dát je zavedenie informácií do modelu, ktoré v čase predikcie v skutočnosti neexistujú. Klasický príklad: zavedenie premennej obsahujúcej výsledok, ako napríklad „vyplatené nároky“, do modelu, ktorý predpovedá výšku nároku. Model vyzerá perfektne v testovacích údajoch, ale v reálnom svete je nepoužiteľný, pretože tieto informácie nie sú v čase predpovede dostupné. Únik je často skrytý a zachytený iba starostlivým poistno-matematickým uvažovaním – AI si to zvyčajne nevšimne, niekedy dokonca chváli presakujúcu premennú ako „veľmi silný prediktor“.

Druhým zákerným nebezpečenstvom je implicitná zaujatosť. Ak historické údaje nespravodlivo reprezentujú konkrétnu skupinu (napríklad oblasti bolo v minulosti odmietnutých príliš veľa politík), funkcie odvodené z týchto údajov nesú túto odchýlku a model ju replikuje do budúcnosti. Fáza inžinierstva funkcií je najkritickejším momentom, keď možno túto odchýlku rozpoznať a opraviť.

Pozor: Skôr než sa budete radovať, keď premenná „obrovsky zlepšuje predikčnú silu“, opýtajte sa: je táto premenná skutočne prítomná v čase predikcie alebo sa týka budúcnosti? Výsledok, ktorý vyzerá príliš dobre, je často znakom úniku.

Ako používať AI pri príprave údajov

1) Skríning kvality údajov:

Vaša úloha: asistent kvality dát. Máte výnos z poistnej matematiky. Stĺpce: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount.Dajte mi kontrolný zoznam a náčrt kódu Python (pandy):- Spočítajte chýbajúce hodnoty podľa stĺpca.- Označte neprimerané hodnoty (záporná prémia, vek<16 alebo >100, koniec<začiatok NEODSTRAŇUJTE roky).- Vypočítajte zlomkové roky od začiatku<začiatok. Stačí to nahlásiť, aby som sa mohol rozhodnúť.

2) Odvodenie funkcie:

Chcem odvodiť nové funkcie z mojich údajov o návštevnosti. Dostupné: vek, vek_vozidla, región, ročný_km, typ_použitia.- Ktoré vekové a km skupiny (bining) odporúčate, prečo?- Ako môžem urobiť kódovanie založené na riziku pre „región“ bez úniku údajov?- Navrhnite 3 nové funkcie, ktoré sa oplatí vyskúšať, a pre každú napíšte poistno-matematické zdôvodnenie. ja sa rozhodnem.

3) Kontrola tesnosti:

Môj model predpovedá MOŽNOSŤ škôd s nasledujúcimi premennými: vek, región, vek_vozidla, PAID_CLAIM_FLAG, VYROVNANIE_DNI. Ktoré z týchto premenných predstavujú riziko úniku údajov? Pri každom zhodnoťte, či bude v čase predpovede k dispozícii. Uveďte tie podozrivé a prečo.

4) Normalizácia expozície:

Niektoré z mojich politík začínajú v polovici roka. Vysvetlite a kódujte normalizáciu expozície, aby ste správne vypočítali frekvenciu: frekvencia = celkový počet poistných udalostí / celková expozícia (rok politiky). Ukážte na príklade, ako vypočítať expozíciu politiky, ktorá sa začína v polovici roka.

Slabá výzva / Silná výzva

Slabá výzva:

Vyčistite dáta a pripravte ich na model.

AI nevie, ktorý stĺpec je ktorý, obchodné pravidlá, definícia expozície; Môže slepo vymazať a vyplniť a poškodiť údaje.

Výkonná výzva:

Vaša rola: asistent prípravy poistno-matematických údajov.Dátový slovník: policy_id (identita), dátum začiatku/ukončenia (obdobie poistenia), vek (očakávaný 16-90), poistné (musí byť >0), claim_count (>=0), claim_amount (>=0). / priemer / samostatná kategória) prítomné s plus-mínus; Rozhodnutie nechajte na mňa.4) Upozornite, ak existuje stĺpec, ktorý môže predstavovať riziko úniku.Automatické vymazanie akéhokoľvek záznamu; Každé rozhodnutie schválim.

tri mini prípady

Prípad 1 – Chyba expozície. V jednom portfóliu sa krátkodobé (3-mesačné) cestovné zmluvy počítali ako celé roky, takže frekvencia sa zdala štyrikrát nižšia, ako v skutočnosti bola; Cena klesla nesprávne. Keď poistný matematik vypočítal expozíciu ako zlomok (0,25 roka politiky), odhalila sa skutočná frekvencia a tarifa sa upravila. AI generovaný zlomkový kód expozície; Poistný matematik dal definíciu.

Prípad 2 – Latentný únik. Keď pomocník pridal do modelu pravdepodobnosti poškodenia premennú „čas uzavretia súboru“, presnosť sa dramaticky zvýšila. Radosť bola krátkodobá: táto premenná mohla byť známa až potom, čo došlo k poškodeniu, čo znamená, že v čase predpovede nebola k dispozícii. Po odstránení netesnej premennej sa model znížil na realistickú úroveň. Ocenil premennú AI ako „silný prediktor“; Úsudok aktuára chytil pascu.

Prípad 3 – Replikácia zaujatosti. Jedna spoločnosť odvodila vzor „odmietnutia aplikácie“ z historických údajov a vložila ho do nového modelu. Analýza ukázala, že minulé odmietnutia boli neúmerne sústredené v určitej štvrti, čo znamená, že existovala historická zaujatosť. Táto funkcia bola z modelu odstránená a nahradená neutrálnejšími ukazovateľmi rizika. AI vytvorila analýzu merajúcu prekrytie vzoru so susedstvom; Etické rozhodnutie prijal poistný matematik a útvar compliance.

Časté chyby

  • Bez rozmýšľania doplňte chýbajúce hodnoty priemerom. Samotným nedostatkom môžu byť vedomosti; Jeho slepé vypĺňanie vytvára predsudky.
  • Automaticky odstrániť odľahlé hodnoty. Niektoré sú skutočné okrajové prípady; Odstránenie údajov bez ich oddelenia od chýb ničí informácie.
  • Nenormalizuje expozíciu. Počítanie krátkych zmlúv za celé roky skresľuje frekvenciu a skresľuje cenu.
  • Nevšimol si únik dát. Príliš dobrý výsledok je často znakom premennej zahŕňajúcej budúcnosť; Opýtajte sa, či je každá premenná prítomná v čase predikcie.
  • Vnášanie implicitnej zaujatosti do budúcnosti. Nespravodlivosť v historických údajoch môže preniknúť do odvodených prvkov; Skontrolujte to vo fáze funkcie.

V súhrne

Poistno-matematické modelovanie je z veľkej časti o príprave údajov; Ak je poškodený vstup, je poškodený aj výstup. Typickými problémami sú chýbajúce hodnoty, odľahlé hodnoty, nezrovnalosti a duplicita; Kritickým poistno-matematickým problémom je normalizácia expozície. Funkcionalita – zoskupovanie, kódovanie, normalizácia – odvodzuje z údajov silnejšie signály. Najzákernejšie nebezpečenstvo predstavuje únik údajov a implicitná zaujatosť; obe sú zachytené len poistno-matematickým uvažovaním. AI tento krok výrazne urýchľuje: skenovanie generuje kód a odporúčania. Neodstraňujte však automaticky žiadne záznamy, nechajte ľudí kontrolovať úniky a zaujatosť a schvaľujte každú konverziu.

Aplikačná úloha

Pripravte si malý anonymný slovník údajov o zásadách (5 – 7 stĺpcov, primeraný rozsah každého). Požiadajte AI o (a) pravidlo primeranosti a kód hlásenia porušenia pre každý stĺpec, (b) výpočet čiastkovej expozície, (c) návrhy 3 nových funkcií, ktoré môžete vyskúšať. Potom pridajte do zoznamu zámernú premennú „lapač úniku“ (napr. „vyplatená kompenzácia“) a otestujte, či to AI ​​zachytí ako únik.

kontrolný zoznam

  • [ ] Analyzoval som dôvod pred odstránením chýbajúcich a odľahlých hodnôt?
  • [ ] Rozdelil som a normalizoval som expozíciu správne?
  • [ ] Napísal som poistno-matematické odôvodnenie pre každý novo odvodený prvok?
  • [ ] Spýtal som sa, či je každá premenná skutočne prítomná (únik) v čase predpovede?
  • [ ] Skenoval som implicitné skreslenie v odvodených prvkoch?
  • [ ] Nemal som AI automaticky vymazať všetky záznamy a sám schvaľovať každé rozhodnutie?