Jednotka 6 / 11

Příprava dat a inženýrství funkcí: Práce s pojistně-matematickými daty pomocí umělé inteligence

zisky:

  • Schopnost odhalit chybějící hodnoty, odlehlé hodnoty, problémy s expozicí a kvalitou dat v politikách a poškozovat data s podporou umělé inteligence a vytvořit návrh opravy
  • Inženýrství funkcí (nové odvozování proměnných, seskupování, kódování) a normalizace expozice umělé inteligenci se správným kontextem
  • Pochopte, že transformace dat navržené umělou inteligencí by měly být auditovány pojistným matematikem proti riziku úniku dat a skryté zaujatosti.

Nejméně diskutovanou, ale časově nejnáročnější částí pojistně-matematické práce je příprava dat. Zkušení pojistní matematici vědí, že většinu času modelovacího projektu stráví čištěním, kombinováním a opravami dat. Bez ohledu na to, jak elegantní je model, pokud jsou vstupní data poškozena, je poškozen i výstup – zkrátka „odpadky dovnitř, odpadky ven“. V této jednotce uvidíme typické problémy s údaji o zásadách a nárocích, o tom, jak je detekovat a opravit pomocí AI, a o přístup k inženýrství funkcí (odvozené nové proměnné, které jsou informativnější ze stávajících dat).

Upozornění na začátek: příprava dat je zdánlivě technický a nevinný krok, ale právě zde se skrývají ty nejnebezpečnější chyby. Nesprávná normalizace expozice, skrytý únik dat nebo nevědomky zavedené zkreslení tiše poškodí všechny následující modely. Umělá inteligence tento krok značně urychluje, ale pokud je ponechána nekontrolovaná, také zvyšuje riziko.

Typické problémy pojistně-matematických dat

Data zásad a nároků téměř nikdy nedorazí čistá. Nejběžnější problémy jsou: Chybějící hodnoty: některé zásady mají prázdné údaje o stáří vozidla, povolání nebo regionu. Slepé vyplnění těchto průměrem může vytvořit zkreslení; nedostatek sám někdy nese informaci (chybějící jsou jiná skupina). Odlehlé hodnoty: nelogické záznamy, jako je záporné pojistné, 200 let starý pojištěnec, pojistka s nulovou expozicí. Je třeba rozlišovat, zda se jedná o datové chyby nebo skutečné okrajové případy. Nekonzistence: různé pravopisy ve stejné oblasti ("Istanbul", "Istanbul", "34"), zmatek ve formátu data. Duplicitní záznamy: zadání stejného poškození dvakrát.

Ale nejkritičtějším problémem specifickým pro pojistnou matematiku je expozice. Pokud politika začíná v polovině roku, poskytuje dílčí expozici (např. 0,5 roku) pro daný rok, nikoli celý „rok platnosti“. Frekvence a míry poškození by měly být vždy normalizovány podle expozice; jinak se krátkodobé politiky jeví jako vysoce rizikové. AI může kódovat výpočet expozice, ale musíte poskytnout definici a obchodní pravidlo.

Následující tabulka shrnuje typické problémy a správný přístup:

problém

špatný přístup

správný přístup

chybějící hodnota

Vyplňte vše průměrem

Analyzujte nedostatek; někdy otevřít samostatnou kategorii

odlehlý

Automatické mazání

Rozlišujte mezi chybou dat a skutečným náskokem

expozice

Počítejte všechny pojistky za 1 rok

Vypočítejte dílčí expozici

Nekonzistence kategorií

ignorovat

Porovnejte se standardním slovníkem

opakující se poškození

nevšímej si

Deduplikovat pomocí klíčových polí

Funkce: odvozování znalostí z dat

Funkce je umění odvozovat nové proměnné, které jsou pro model užitečnější, z existujících nezpracovaných proměnných. Příklady: „věk“ z data narození, „věková skupina“ (binning) z věku, „rizikový segment“ z modelu značky vozidla, „roční odhad ujetých kilometrů“ z kombinace adresy a politiky. Dobrá vlastnost nese silnější signál než nezpracovaná data a zvyšuje jak přesnost, tak interpretovatelnost modelu.

V pojistně-matematické práci se často používají tři techniky. Vazba: rozdělení spojité proměnné (věku) do smysluplných skupin; to zachycuje nelineární vztahy a činí tarif čitelným. Kódování: převod kategoriálních proměnných (regionu) do numerického formátu vhodného pro model; Kódování založené na riziku (představuje každou kategorii s vlastní mírou poškození) je běžné, ale mělo by být prováděno opatrně. Normalizace: učinit vše srovnatelným tím, že to vydělíte expozicí. AI rychle generuje kód pro tyto transformace; Ale musíte schválit logiku každé transformace.

Tip: Cílové kódování je výkonné, ale náchylné k úniku dat: model „podvádí“, pokud do výpočtu průměrného poškození kategorie zahrnete vlastní poškození řádku. Vždy to provádějte v rámci tréninkových dat ve vzoru křížové validace.

Nejzákeřnější nebezpečí: úniky dat a implicitní zaujatost

Únik dat je vnesení informací do modelu, které v době predikce ve skutečnosti neexistují. Klasický příklad: zavedení proměnné obsahující výsledek, například „vyplacené nároky“, do modelu, který předpovídá výši nároku. Model vypadá perfektně v testovacích datech, ale v reálném světě je nepoužitelný, protože tyto informace nejsou v době predikce dostupné. Únik je často skrytý a zachycený pouze pečlivým pojistně-matematickým uvažováním – AI si toho obvykle nevšimne, někdy dokonce chválí netěsnou proměnnou jako „velmi silný prediktor“.

Druhým zákeřným nebezpečím je implicitní zaujatost. Pokud historická data nespravedlivě reprezentují určitou skupinu (například oblasti bylo v minulosti odepřeno příliš mnoho politik), vlastnosti odvozené z těchto dat nesou toto zkreslení a model je replikuje do budoucnosti. Fáze inženýrství funkcí je nejkritičtějším okamžikem, kdy lze toto zkreslení rozpoznat a napravit.

Pozor: Než se zaradujete, když proměnná „obrovsky zlepšuje prediktivní sílu“, zeptejte se: je tato proměnná skutečně přítomna v době predikce, nebo se týká budoucnosti? Výsledek, který vypadá příliš dobře, je často známkou netěsnosti.

Jak používat AI při přípravě dat

1) Kontrola kvality dat:

Vaše role: asistent kvality dat. Máte pojistně-matematický výnos. Sloupce: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount. Dejte mi kontrolní seznam a náčrt kódu Python (pandy):- Spočítejte chybějící hodnoty podle sloupce.- Označte nepřiměřené hodnoty (záporná prémie, věk<16 nebo >100, konec<začátek NEODSTRAŇUJTE);-Vypočítejte roky od začátku/ukončete nedělejte zlomek. Stačí to nahlásit, abych se mohl rozhodnout.

2) Odvození funkce:

Chci ze svých údajů o provozu odvodit nové funkce. Dostupné: věk, věk_vozidla, region, roční_km, typ_použití.- Které věkové a km skupiny (bining) doporučujete, proč?- Jak mohu provést kódování založené na riziku pro „region“, aniž by došlo k úniku dat?- Navrhněte 3 nové funkce, které stojí za to vyzkoušet, a pro každou napište pojistně-matematické zdůvodnění. rozhodnu se.

3) Kontrola těsnosti:

Můj model předpovídá MOŽNOST poškození s následujícími proměnnými: věk, region, stáří vozidla, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Které z těchto proměnných představují riziko úniku dat? U každého vyhodnoťte, zda bude v době predikce k dispozici. Uveďte podezřelé a proč.

4) Normalizace expozice:

Některé z mých zásad začínají v polovině roku. Vysvětlete a kódujte normalizaci expozice, abyste správně vypočítali frekvenci: frekvence = celkový počet pojistných událostí / celková expozice (rok politiky). Ukažte na příkladu, jak vypočítat expozici politiky, která začíná v polovině roku.

Slabá výzva / Silná výzva

Slabá výzva:

Vyčistěte data a připravte je pro model.

AI neví, který sloupec je který, obchodní pravidla, definice expozice; Může slepě vymazat a vyplnit a poškodit data.

Výkonná výzva:

Vaše role: asistent přípravy pojistně-matematických dat.Datový slovník: policy_id (identita), počáteční/koncové_datum (období pojištění), věk (očekávaný 16-90), prémie (musí být >0), claim_count (>=0), claim_amount (>=0). / průměr / samostatná kategorie) přítomný s plus-minus; Nechte rozhodnutí na mně.4) Upozorněte, pokud existuje sloupec, který může představovat riziko úniku. Automatické vymazání jakéhokoli záznamu; Budu schvalovat každé rozhodnutí.

tři mini pouzdra

Případ 1 – Chyba expozice. V jednom portfoliu se krátkodobé (3měsíční) cestovní smlouvy počítaly jako celé roky, takže četnost se zdála čtyřikrát nižší, než ve skutečnosti byla; Cena klesla nesprávně. Když pojistný matematik vypočítal expozici jako zlomek (0,25 pojistkového roku), byla odhalena skutečná frekvence a tarif byl opraven. AI generovaný zlomkový kód expozice; Pojistný matematik dal definici.

Případ 2 – Latentní únik. Když pomocník přidal do modelu pravděpodobnosti poškození proměnnou „doba uzavření souboru“, přesnost se dramaticky zvýšila. Radost byla krátkodobá: tato proměnná mohla být známa až poté, co došlo k poškození, což znamená, že v době předpovědi nebyla k dispozici. Když byla odstraněna netěsná proměnná, model klesl na realistickou úroveň. Chválil proměnnou AI jako „mocný prediktor“; Úsudek pojistného matematika chytil past.

Případ 3 – Replikace zkreslení. Jedna společnost odvodila vzorec „odmítnutí žádosti“ z historických dat a vložila jej do nového modelu. Analýza ukázala, že minulá odmítnutí byla neúměrně soustředěna v určité čtvrti, což znamená, že existovala historická zaujatost. Tato funkce byla z modelu odstraněna a nahrazena neutrálnějšími indikátory rizika. AI vytvořila analýzu měřící překrytí vzoru se sousedstvím; Etické rozhodnutí učinil pojistný matematik a oddělení compliance.

Časté chyby

  • Doplnění chybějících hodnot průměrem bez přemýšlení. Samotný nedostatek může být znalostmi; Jeho slepé vyplňování vytváří předsudky.
  • Automaticky odstranit odlehlé hodnoty. Některé jsou skutečné okrajové případy; Smazání dat bez oddělení od chyb ničí informace.
  • Nenormalizuje expozici. Počítání krátkých pojistek jako celých let zkresluje frekvenci a zkresluje cenu.
  • Nezaznamenává únik dat. Příliš dobrý výsledek je často známkou proměnné týkající se budoucnosti; Dotaz, zda je každá proměnná přítomna v době predikce.
  • Vnesení implicitní zaujatosti do budoucnosti. Nespravedlnost v historických datech může proniknout do odvozených prvků; Zkontrolujte to ve fázi funkce.

V souhrnu

Pojistně-matematické modelování je z velké části o přípravě dat; Pokud je poškozen vstup, je poškozen i výstup. Typickými problémy jsou chybějící hodnoty, odlehlé hodnoty, nekonzistence a duplikace; Kritickým pojistně-matematickým problémem je normalizace expozice. Technologie funkcí – seskupování, kódování, normalizace – odvozuje z dat silnější signály. Nejzákeřnějším nebezpečím je únik dat a implicitní zaujatost; obojí je zachyceno pouze pojistně-matematickým uvažováním. AI tento krok výrazně urychluje: skenování generuje kód a doporučení. Neodstraňujte však automaticky žádné záznamy, nechte lidi zkontrolovat úniky a zkreslení a schválit každou konverzi.

Aplikační úkol

Připravte si malý anonymní datový slovník zásad (5–7 sloupců, přiměřený rozsah každého). Požádejte umělou inteligenci o (a) pravidlo přiměřenosti a kód hlášení porušení pro každý sloupec, (b) výpočet dílčí expozice, (c) návrhy 3 nových funkcí, které můžete vyzkoušet. Poté přidejte do seznamu záměrnou proměnnou „leak trap“ (např. „kompenzace zaplacena“) a otestujte, zda ji AI zachytí jako únik.

kontrolní seznam

  • [ ] Analyzoval jsem před odstraněním chybějících a odlehlých hodnot proč?
  • [ ] Rozdělil jsem a normalizoval jsem expozici správně?
  • [ ] Napsal jsem pojistně-matematické odůvodnění pro každý nově odvozený prvek?
  • [ ] Zeptal jsem se, zda je každá proměnná skutečně přítomna (únik) v době predikce?
  • [ ] Skenoval jsem implicitní zkreslení v odvozených prvcích?
  • [ ] Nenechal jsem AI automaticky smazat všechny záznamy a sám schválil každé rozhodnutí?