Jednotka 4 / 11

Ceny a klasifikácia rizika: GLM, tarify a umelá inteligencia

zisky:

  • Schopnosť vytvoriť všeobecný lineárny model (GLM), rizikový faktor, tarify a koncepty rizikových prémií s podporou umelej inteligencie a preložiť koeficienty do obchodného jazyka
  • Schopnosť diskutovať o rovnováhe medzi výberom premenných, interakciou, nadmerným prispôsobením a interpretovateľnosťou modelov strojového učenia (GBM) s umelou inteligenciou
  • Byť schopný pochopiť, že cenový model neobsahuje zakázané/diskriminačné premenné a že súlad konečnej tarify s legislatívou a hospodárskou súťažou je ponechaný na aktuára.

Cena poistky nie je určená náhodne. Riziko dopravnej nehody u 22-ročného, ​​čerstvo licencovaného vodiča žijúceho vo veľkom meste je štatisticky vyššie ako u 45-ročného vodiča s 20-ročnou praxou; V spravodlivom systéme by sa malo líšiť aj poistné. Úloha aktuára zmerať tento rozdiel a premietnuť ho do ceny sa nazýva oceňovanie a klasifikácia rizika. V tejto časti budeme diskutovať o zovšeobecnenom lineárnom modeli (GLM), poistno-matematickej chrbtici tvorby cien a jeho alternatívach strojového učenia a uvidíme, ako v tomto procese bezpečne používať AI.

Niekoľko základných pojmov. Rizikový faktor je premenná, ktorá ovplyvňuje riziko a používa sa pri oceňovaní (vek, vek vozidla, región, zamýšľané použitie). Sadzobník je súbor pravidiel, ktoré určujú, ako sa bude poistné počítať podľa rizikových faktorov. Riziková prémia je čistá cena očakávanej straty; Keď sa pripočítajú náklady, provízie, ziskové marže a kapitálové náklady, vytvorí sa obchodná prémia (predajná cena). Pripomeňme od začiatku: AI navrhuje premenné, zostavuje modely, vysvetľuje koeficienty; Ale ktorá premenná je legálna a etická a či je konečná tarifa v súlade s legislatívou a hospodárskou súťažou, patrí aktuárovi a jednotke dodržiavania predpisov.

Prečo je GLM štandardom v poistnej matematike

Najpoužívanejšou metódou pri tvorbe cien je GLM. GLM je skratka pre „generalizovaný lineárny model“: rozširuje klasickú lineárnu regresiu tak, aby vyhovovala nenormálne distribuovaným cieľom, ako sú údaje o škodách. Má dve základné zložky. Rodina distribúcie: Poisson sa volí pre frekvenciu, gama pre intenzitu (logika v jednotke 2). Link funkcia (link): zvyčajne logaritmická, ktorá umožňuje faktorom multiplikačný účinok. Multiplikatívna štruktúra je v poistnej matematike veľmi cenná, pretože presne tak je nastavená tarifa: základné poistné × faktor veku × faktor regiónu × faktor vozidla.

Najväčšou výhodou GLM je interpretovateľnosť. Koeficient vám priamo hovorí: "skupina mladých vodičov zvyšuje frekvenciu 1,6-krát v porovnaní s referenčnou skupinou." Táto transparentnosť je kritická tromi spôsobmi: (1) regulátor a interný audit môžu pochopiť a schváliť model; (2) je viditeľný zakázaný/diskriminačný účinok; (3) cenovú logiku je možné vysvetliť tímu predaja a manažmentu. Zložitejšie modely strojového učenia (nižšie) niekedy poskytujú vyššiu presnosť, ale na úkor transparentnosti.

Tip: Koeficient GLM je na logaritmickej stupnici. Požiadajte AI, aby previedol koeficient na "násobiaci faktor" s exp (koeficient); Bolo by oveľa jednoduchšie preložiť do obchodného jazyka (napr. koeficient 0,47 → faktor ≈ 1,60 → „o 60 % rizikovejšie“).

Variabilný výber, overfitting a strojové učenie

Najkritickejším rozhodnutím pri oceňovaní je, ktoré premenné zostanú v modeli. Sú tam dve pasce. Len málo premenných zatemňuje model: ak sa vynechá dôležitý faktor rizika, cena bude nesprávna. Príliš variabilné / prehnané prispôsobenie núti model zapamätať si minulé údaje: model si mýli šum so signálom a s novými politikami zlyhá. Rovnováha sa vytvára krížovou validáciou – rozdelením údajov na tréningové a testovacie kusy a ich testovaním na údajoch, ktoré model nevidí, jednoduchosťou a poistno-matematickým zdôvodnením.

Dôležitá je aj interakcia: niekedy sa kombinovaný účinok dvoch faktorov líši od súčtu ich samostatných účinkov (mladé + športové vozidlo môže byť riskantnejšie ako súčet ich jednotlivých účinkov). V GLM sa interakcie pridávajú explicitne.

V posledných rokoch sa modely ako GBM (gradient boosting machine – výkonná metóda strojového učenia, ktorá kombinuje mnoho malých rozhodovacích stromov) stali bežnými pri tvorbe cien. Tieto automaticky zachytávajú zložité vzorce a interakcie a často poskytujú presnejšie predpovede ako GLM. Má to však svoju cenu: tendenciu byť „čiernou skrinkou“. Bežnou praxou je dnes používanie GBM na objavovanie a generovanie nápadov a GLM na konečnú transparentnú tarifu; alebo interpretácia výstupu GBM pomocou nástrojov vysvetlenia, ako je SHAP.

Nasledujúca tabuľka porovnáva tieto dva prístupy:

kritérium

GLM

GBM (strojové učenie)

Interpretovateľnosť

Vysoká (koeficient zapnutý)

Nízka (vyžaduje nástroj na poznámky)

Zachytenie interakcie

Pridané ručne

automatické

Riziko nadmernej montáže

nízka-stredná

Vysoká (vyžaduje sa starostlivé nastavenie)

Schválenie regulátora/audítora

ľahké

Náročné, vyžaduje si ďalšiu dokumentáciu

Typické použitie

konečná tarifa

objav, porovnanie

Ako používať AI pri stanovovaní cien

1) Preklad koeficientu GLM do obchodného jazyka:

Nastavil som frekvenciu GLM (Poisson, log link). Niektoré koeficienty (log škála): vek_skupina_18_25: 0,47 ; region_majority: 0,22 ; arac_yasi_10plus: -0,15. Preveďte každý z nich na multiplikačný faktor pomocou exp() a vysvetlite ho jednou vetou, ktorej manažér rozumie. Tiež pripomeňte, čo je referenčná skupina.

2) Diskusia o premennej/interakcii:

Vaša úloha: cenový asistent. Moje kandidátske premenné pre model dopravnej frekvencie sú: vek, pohlavie, región, vek vozidla, výkon motora, ročné km, povolanie. - Ktoré premenné môžu byť rizikové z regulačného/etického hľadiska (napr. nepriama diskriminácia)? - Ktoré bilaterálne interakcie by malo zmysel vyskúšať? - Aké overovacie kroky by som mal dodržiavať, aby som sa vyhol nadmernej montáži? Rozhodovanie; Dajte mi rámec pre kontrolu a diskusiu.

3) Kontrolný kód nadmernej montáže:

Napíšte komentovaný kód, ktorý vyhodnotí GLM s k-násobným krížovým overením pomocou Python + scikit-learn / statsmodels. Ako metriku použite Poissonovu odchýlku. Porovnajte výsledky školenia a testov a vysvetlite v riadku komentárov, ako čítať označenie nadmernej montáže. Knižnica je falošná.

4) Diskriminačný/náhradný skríning:

„PSČ“ sa ukázalo ako silná premenná v mojom cenovom modeli. Vysvetlite riziko, že to bude nepriamo reprezentovať zakázanú charakteristiku (napr. etnicitu, príjem) ako proxy premennú. - Akú analýzu by som mal urobiť, aby som otestoval toto riziko? - Aké alternatívy existujú na zníženie rizika? Poskytovanie právneho poradenstva; vypracovať technický a etický rámec.

Slabá výzva / Silná výzva

Slabá výzva:

Vytvorte najlepší cenový model pre dopravné poistenie.

"Najlepšie" nie je definované; Žiadne dáta, žiadne obmedzenia, žiadna legislatíva. AI dáva všeobecnú, nepoužiteľnú odpoveď.

Výkonná výzva:

Vaša úloha: asistent cenového aktuára. Kontext: Vytváram frekvenčný model dopravnej vetvy, GLM (Poisson, log link). Premenné mám: veková skupina, vek vozidla, región (provincia), ročný km, zamýšľané použitie. Obmedzenie: legislatíva nemôže používať pohlavie; Musím sa vyhnúť nepriamej diskriminácii. Úloha: 1) Navrhnite počiatočnú špecifikáciu modelu s týmito premennými (vrátane referenčných skupín).2) Uveďte dôvody pre 2 interakcie, ktoré by som mal vyskúšať.3) Uveďte zoznam krokov na kontrolu nadmerného vybavenia.4) Pridajte osobitnú poznámku venovanú „regiónu“ z hľadiska nepriamej diskriminácie. Urobím rozhodnutie; Poskytnete rámec a odôvodnenie.

tri mini prípady

Prípad 1 – Hodnota transparentnosti. Spoločnosť predložila regulátorovi veľmi presný cenový model, ktorý vytvorila s GBM, ale nevedela vysvetliť koeficienty; schválenie oneskorené. Poistný matematik skonštruoval GLM, ktorý zachytil rovnaké signály; Presnosť klesla o 2 percentá, ale keďže bolo možné zohľadniť každý faktor, model bol overený do mesiaca. GBM bol uložený na prieskum, GLM sa stal tarifou. YZ rýchlo vytvoril kód a popis regulátora porovnávajúci výkon týchto dvoch modelov.

Prípad 2 – Pasca s nadmernou montážou. Pomocník získal perfektné skóre na tréningových údajoch, keď do modelu pridal viac ako 40 premenných a množstvo interakcií. Ale pri krížovej validácii sa skóre testu zrútilo: model si zapamätal hluk. Reálny výkon sa zvýšil, keď sa počet premenných znížil na 12 a zjednodušil sa. Ponaučenie: pozrite sa na bezprecedentné skóre údajov, nie na tréningové skóre.

Prípad 3 – Nepriama diskriminácia. V jednom modeli premenná „susedstvo“ silne vysvetlila prémiu. Analýza ukázala, že táto premenná sa do značnej miery prekrývala s etnickou koncentráciou, t. j. bola zástupcom zakázanej charakteristiky. Poistný matematik nahradil túto premennú neutrálnejšími ukazovateľmi rizika (typ cesty, stav parkovania); etické aj právne riziká sa znížili. AI vytvorila korelačnú analýzu merajúcu presah a návrhy alternatívnych premenných; Rozhodol o tom útvar poistnej matematiky a compliance.

Časté chyby

  • Robiť z nevysvetliteľného modelu konečný recept. Cena, ktorú nemožno vysvetliť regulátorovi, auditu a zákazníkovi, je neudržateľná; Transparentnosť je nevyhnutná.
  • Spoliehanie sa na vzdelanie. Nadmerné vybavenie sa zistí iba v neviditeľných údajoch (krížová validácia).
  • Používanie zakázaných/náhradných premenných bez kontroly. Premenné, ako je PSČ a povolanie, môžu mať nepriamu diskrimináciu; Určite ho otestujte.
  • Zamieňanie rizikovej prémie s komerčnou prémiou. Samotné náklady na poškodenie nie sú predajnou cenou; pripočítavajú sa náklady, zisk a náklady kapitálu.
  • Ponechanie koeficientu na logaritmickej stupnici a jeho nesprávna interpretácia. Komentovanie bez konverzie na multiplikačný faktor pomocou exp() spôsobí chybu.
Upozornenie: Odporúčanie modelu AI, ktorý „poskytuje najlepšiu presnosť“, nie je automaticky modelom, ktorý „by sa mal použiť“. Transparentnosť, spravodlivosť a súlad s legislatívou sú povinné kritériá, ako aj presnosť poistno-matematických cien.

V súhrne

Stanovenie cien je proces merania rizika pomocou rizikových faktorov a jeho premena na primeranú prémiu. GLM je štandardom poistno-matematického oceňovania s jeho multiplikatívnou a interpretovateľnou štruktúrou; Koeficienty sa prevedú na faktory pomocou exp(). Modely strojového učenia, ako je GBM, môžu byť presnejšie, ale znižujú transparentnosť a zvyčajne sa používajú na zisťovanie. Výber premenných by mal byť chránený pred nadmerným vybavením krížovou validáciou a nepriama diskriminácia (náhradná premenná) by mala byť starostlivo kontrolovaná. AI zostaví model, napíše kód a vysvetlí koeficient; Ale právno-etické dodržiavanie a konečná tarifa patria do aktuárskej a compliance jednotky.

Aplikačná úloha

Uveďte 5-6 rizikových faktorov pre major. Požiadajte AI o (a) počiatočnú špecifikáciu GLM s týmito faktormi, (b) 2 interakcie na vyskúšanie a ich zdôvodnenie, (c) skríning premenných, ktoré môžu byť ohrozené nepriamou diskrimináciou. Potom uveďte príklad 3 log-koeficientov, požiadajte AI, aby ho previedla na multiplikačný faktor pomocou exp() a preniesla ho do obchodného jazyka a faktory manuálne overte.

kontrolný zoznam

  • [ ] Dá sa môj model interpretovať? Môžem preložiť vplyv každého faktora do obchodného jazyka?
  • [ ] Skontroloval som krížovým overením, či nedošlo k nadmernému vybaveniu?
  • [ ] Skenoval som nepriamu diskrimináciu zakázaných a proxy premenných?
  • [ ] Oddelil som vedome rizikovú prémiu od obchodnej prémie?
  • [ ] Previedol som koeficienty na multiplikátory pomocou exp() a interpretoval som ich správne?
  • [ ] Urobil som konečné rozhodnutie o tarife spolu s legislatívou a jednotkou pre dodržiavanie predpisov?