Nyereség:
- Képes a hiányzó értékek, kiugró értékek, expozíciós és adatminőségi problémák észlelésére a házirendekben, valamint mesterséges intelligencia támogatással az adatok sérülésére, valamint korrekciós tervezet készítésére.
- Funkciótervezés (új változók származtatása, csoportosítása, kódolása) és a mesterséges intelligenciára való kitettség normalizálása a megfelelő kontextussal
- Értse meg, hogy a mesterséges intelligencia által javasolt adatátalakításokat aktuáriusnak kell auditálnia az adatszivárgás és a rejtett torzítás kockázata érdekében.
A biztosításmatematikai munka legkevesebbet emlegetett, de leginkább időigényes része az adatok előkészítése. A tapasztalt aktuáriusok tudják, hogy a modellezési projektek idejének nagy részét az adatok tisztítása, kombinálása és javítása tölti el. Nem számít, milyen elegáns a modell, ha a bemeneti adatok sérültek, a kimenet is sérült – röviden: „szemét be, szemét ki”. Ebben az egységben látni fogjuk az irányelvekkel és a követelésekkel kapcsolatos adatok tipikus problémáit, azok észlelését és kijavítását az AI segítségével, valamint a funkciótervezés (a meglévő adatokból informatívabb új változók) megközelítést.
Figyelmeztetés a kezdetektől: az adatok előkészítése látszólag technikai és ártatlan lépés, de itt bújnak meg a legveszélyesebb hibák. A helytelen expozíciós normalizálás, egy rejtett adatszivárgás vagy egy akaratlanul bevezetett torzítás csendben megsérti az összes további modellt. Az AI nagymértékben felgyorsítja ezt a lépést, de ha nem kontrollálják, akkor a kockázatot is növeli.
Az aktuáriusi adatok tipikus problémái
Az irányelvek és a követelések adatai szinte soha nem érkeznek meg tisztán. A leggyakoribb problémák a következők: Hiányzó értékek: egyes szabályzatok üresen hagyják a jármű korát, foglalkozását vagy régióját. Ezeket vakon kitöltve az átlaggal torzítás jöhet létre; maga a hiányosság néha információt hordoz (a hiányzók más csoportot alkotnak). Outliers: logikátlan rekordok, mint például negatív díj, 200 éves biztosított, nulla kitettség. Meg kell különböztetni, hogy ezek adathibák vagy valós élesetek. Inkonzisztencia: ugyanazon régió különböző írásmódjai ("Isztambul", "Isztambul", "34"), dátumformátum-zavar. Ismétlődő bejegyzések: ugyanazon sebzés kétszer.
De a biztosításmatematikai szempontból legkritikusabb kérdés a kitettség. Ha egy kötvény az év közepén kezdődik, akkor töredékes kitettséget (például 0,5 évet) biztosít az adott évre, nem pedig egy teljes „biztosítási évet”. A gyakoriságot és a sérülési arányt mindig az expozícióra kell normalizálni; egyébként a rövid távú politikák magas kockázatúnak tűnnek. Az AI kódolhatja a kitettség számítását, de meg kell adnia a meghatározást és az üzleti szabályt.
Az alábbi táblázat összefoglalja a tipikus problémákat és a helyes megközelítést:
probléma
rossz megközelítés
helyes megközelítés
hiányzó érték
Töltse ki az összeset átlaggal
Elemezze a hiányt; néha nyit egy külön kategóriát
kiugró
Automatikus törlés
Tegyen különbséget az adathibák és a valódi lead között
expozíció
Az összes szabályzatot 1 évre számolja
Számítsa ki a töredékes expozíciót
Kategória inkonzisztencia
figyelmen kívül hagyni
Egyezik a szabványos szótárral
visszatérő károsodás
ne vegye észre
Szüntesse meg a duplikációt a kulcsmezőkkel
Feature engineering: tudás levezetése adatokból
A jellemzőtervezés a modell számára hasznosabb új változók származtatásának művészete a meglévő nyers változókból. Példák: "életkor" a születési dátumtól, "korcsoport" (binning) az életkortól, "kockázati szegmens" a jármű márkamodelljéből, "éves futásteljesítmény becslés" a cím-házirend kombinációból. A jó tulajdonság erősebb jelet hordoz, mint a nyers adatok, és növeli a modell pontosságát és értelmezhetőségét.
Három technikát használnak gyakran az aktuáriusi munkában. Kötés: folytonos változó (életkor) értelmes csoportokra bontása; ez rögzíti a nem lineáris kapcsolatokat, és olvashatóvá teszi a tarifát. Kódolás: kategorikus változók (régió) konvertálása a modellnek megfelelő numerikus formátumba; A kockázatalapú kódolás (mindegyik kategória saját sebzési arányával) elterjedt, de óvatosan kell végezni. Normalizálás: mindent összehasonlíthatóvá teszünk úgy, hogy elosztjuk a kitettségével. Az AI gyorsan generálja a kódot ezekhez az átalakításokhoz; De minden átalakítás logikáját jóvá kell hagynia.
Tipp: A célkódolás erőteljes, de hajlamos az adatszivárgásra: a modell "csal", ha egy kategória átlagos sebzésének kiszámításakor figyelembe veszi egy sor saját sebzését. Ezt mindig a képzési adatokon belül tegye meg, keresztellenőrzési mintában.
A legálomosabb veszély: adatszivárgás és implicit torzítás
Az adatszivárgás olyan információ bevezetése a modellbe, amely az előrejelzés időpontjában valójában nem létezik. Klasszikus példa: az eredményt tartalmazó változó, például a „kifizetett követelések” bevezetése a követelés összegét előrejelző modellbe. A modell tökéletesnek tűnik a tesztadatokban, de használhatatlan a valós világban, mivel ez az információ nem áll rendelkezésre az előrejelzés időpontjában. A szivárgást gyakran rejtik, és csak gondos aktuáriusi érvelések fogják fel – az AI általában nem veszi észre, sőt néha „nagyon erős előrejelzőként” dicséri a szivárgó változót.
A második alattomos veszély az implicit elfogultság. Ha a múltbeli adatok tisztességtelenül képviselnek egy adott csoportot (például egy területet a múltban túl sok szabályzat tagadott meg), az adatokból származó jellemzők hordozzák ezt a torzítást, és a modell megismétli azt a jövőben. A funkciótervezési szakasz a legkritikusabb pillanat, amikor ez a torzítás felismerhető és korrigálható.
Vigyázat: Mielőtt örülne, amikor egy változó „rendkívüli mértékben javítja a predikciós képességet”, kérdezze meg: ez a változó valóban jelen van az előrejelzés időpontjában, vagy a jövőt érinti? A túl jónak tűnő eredmény gyakran a szivárgás jele.
Hogyan használjuk az AI-t az adatok előkészítésében
1) Adatminőség-szűrés:
Az Ön szerepe: adatminőségi asszisztens. Önnek van aktuáriusi kötvényhozama. Oszlopok: policy_id, start_date, end_date,age, region, vehicle_age, prémium, kárigények_száma, kártérítés összege. Adjon egy ellenőrzőlistát és Python (pandas) kódvázlatot:- Számolja meg a hiányzó értékeket oszloponként.- Jelölje meg az ésszerűtlen értékeket (negatív prémium, életkor kezdete/100, kitettség vége/kezdete). NEM törölni; Csak jelentsd be, hogy dönthessek.
2) Funkció származtatás:
Új funkciókat szeretnék levezetni a forgalmi adataimból. Elérhető: életkor, jármű_kor, régió, éves_km, használati_típus.- Melyik kor- és km-csoportokat (binning) ajánlja, miért?- Hogyan tudok kockázatalapú kódolást végezni a 'régió' számára adatszivárgás nélkül?- Javasoljon 3 új funkciót, amelyet érdemes kipróbálni, és mindegyikhez írja meg a biztosításmatematikai indoklást. én fogom eldönteni.
3) Szivárgásvizsgálat:
A modellem a következő változókkal jelzi előre a károsodás LEHETŐSÉGÉT: kor, régió, jármű_kora, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Az alábbi változók közül melyik jelent az adatszivárgás kockázatát? Mindegyiknél értékelje, hogy elérhető lesz-e az előrejelzés időpontjában. Sorolja fel a gyanúsakat és miért.
4) Expozíció normalizálása:
Egyes kötvényeim az év közepén kezdődnek. Magyarázza el és kódolja a kitettség normalizálását a gyakoriság helyes kiszámításához: gyakoriság = teljes kárigényszám / teljes kitettség (biztosítási év). Mutassa be egy példával, hogyan kell kiszámítani az év közepén kezdődő kötvény kitettségét.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Tisztítsa meg az adatokat, és készítse elő a modellhez.
A mesterséges intelligencia nem tudja, melyik oszlop melyik, üzleti szabályok, kitettség meghatározása; Vakon törölheti, kitöltheti és megrongálhatja az adatokat.
Erőteljes felszólítás:
Az Ön szerepköre: biztosításmatematikai adatelőkészítő asszisztens.Adatszótár: policy_id (identitás), kezdő/vég_dátum (biztosítási időszak),életkor (várhatóan 16-90), prémium (>0-nak kell lennie), kárigényszám (>=0), kártérítés összege (>=0).Feladat:1) Írjon ésszerűségi szabályt minden oszlophoz és JELENTÉSI SZÁMÍTÁSI SZÁMÍTÁST 3 különböző G-kitettségi kódok.3 kiszámításához. hiányzó „életkor” miatt (törlés). / átlagos / külön kategória) plusz-mínuszban jelennek meg; Bízza rám a döntést.4) Figyelmeztetés, ha van olyan oszlop, amely szivárgási kockázatot jelenthet.Bármely rekord automatikus törlése; Minden döntést jóváhagyok.
három mini tok
1. eset – Expozíciós hiba. Egy portfólióban a rövid távú (3 hónapos) utazási kötvények teljes évnek számítottak, így a gyakoriság négyszer kisebb volt a ténylegesnél; Az ár hibásan esett. Amikor az aktuárius töredékben számította ki a kitettséget (0,25 kötvényév), kiderült a valós gyakoriság, és korrigált a tarifa. AI által generált töredékes expozíciós kód; Az aktuárius megadta a meghatározást.
2. eset – Látens szivárgás. Amikor egy segítő hozzáadta a „fájlzárási idő” változót a sérülés valószínűségi modelljéhez, a pontosság drámaian megnőtt. Az öröm rövid életű volt: ezt a változót csak a kár bekövetkezte után lehetett megismerni, vagyis az előrejelzés időpontjában nem volt elérhető. Amikor a szivárgó változót eltávolították, a modell reális szintre csökkent. Az AI-változót „erős előrejelzőként” dicsérte; Az aktusvezető ítélete elkapta a csapdát.
3. eset – Elfogultság replikációja. Az egyik vállalat előzményadatokból származtatott egy „alkalmazás-elutasítási” mintát, és beépítette az új modellbe. Az elemzés kimutatta, hogy a múltbeli elutasítások aránytalanul koncentrálódtak egy adott környéken, ami azt jelenti, hogy történelmi elfogultság áll fenn. Ezt a funkciót eltávolították a modellből, és semlegesebb kockázati mutatókkal helyettesítették. A mesterséges intelligencia elkészítette az elemzést, amely a minta szomszédságával való átfedését mérte; Az etikai döntést az aktuárius és a megfelelési egység hozta meg.
Gyakori hibák
- Hiányzó értékek kitöltése az átlaggal gondolkodás nélkül. A hiány maga is lehet tudás; Vakon kitöltése előítéleteket kelt.
- A kiugró értékek automatikus törlése. Némelyik valódi szélső eset; Az adatok törlése a hibáktól való elválasztás nélkül megsemmisíti az információkat.
- Nem normalizálja az expozíciót. Ha a rövid kötvényeket teljes évnek számoljuk, az torzítja a gyakoriságot és torzítja az árat.
- Nem veszi észre az adatszivárgást. A túl jó eredmény gyakran a jövőt érintő változó jele; Kérdezze meg, hogy az egyes változók jelen vannak-e az előrejelzés időpontjában.
- Implicit elfogultság hozása a jövőbe. A történelmi adatok igazságtalansága származtatott jellemzőkké szivároghat; Ellenőrizze a funkció szakaszában.
Összefoglalva
Az aktuáriusi modellezés nagyrészt az adatok előkészítéséről szól; Ha a bemenet sérült, a kimenet is sérült. Tipikus problémák a hiányzó értékek, a kiugró értékek, az inkonzisztenciák és a párhuzamosságok; A kritikus aktuáriusi probléma a kitettség normalizálása. A szolgáltatástervezés – csoportosítás, kódolás, normalizálás – erősebb jeleket von le az adatokból. A leginkább alattomos veszélyek az adatszivárgás és az implicit torzítás; mindkettőt csak az aktuáriusi érvelés ragadja meg. Az AI nagyban felgyorsítja ezt a lépést: a szkennelés kódot és ajánlásokat generál. De ne töröljön automatikusan semmilyen rekordot, hagyja, hogy az emberek ellenőrizzék a szivárgást és a torzítást, és hagyjanak jóvá minden konverziót.
Pályázati feladat
Készítsen egy kis névtelen házirend-adatszótárat (5-7 oszlop, mindegyik megfelelő tartományban). Kérje meg a mesterséges intelligencia (a) az ésszerűségi szabályt és a szabálysértési jelentés kódját minden oszlophoz, (b) a töredékes expozíció kiszámítását, (c) javaslatokat 3 új kipróbálható funkcióra. Ezután adjon hozzá egy szándékos „szivárgáscsapda” változót a listához (például „kifizetett kompenzáció”), és tesztelje, hogy az AI szivárgásként fogja-e fel.
ellenőrző lista
- [ ] A hiányzó és kiugró értékek törlése előtt elemeztem, hogy miért?
- [ ] Megfelelően frakcionáltam és normalizáltam az expozíciót?
- [ ] Megírtam minden újonnan származtatott jellemző biztosításmatematikai indoklását?
- [ ] Megkérdőjeleztem, hogy az egyes változók valóban jelen vannak-e (szivárgás) az előrejelzés időpontjában?
- [ ] Megvizsgáltam a származtatott jellemzők implicit torzítását?
- [ ] Nem töröltem automatikusan a mesterséges intelligencia rekordokat, és nem hagytam jóvá minden döntést?