Jednotka 4 / 11

Ceny a klasifikace rizik: GLM, tarifování a umělá inteligence

zisky:

  • Schopnost vytvořit zobecněný lineární model (GLM), koncepty rizikového faktoru, tarifu a rizikové prémie s podporou umělé inteligence a převést koeficienty do obchodního jazyka
  • Schopnost diskutovat o rovnováze výběru proměnných, interakce, nadměrného přizpůsobení a interpretovatelnosti modelů strojového učení (GBM) s umělou inteligencí
  • Být schopen pochopit, že cenový model neobsahuje zakázané/diskriminační proměnné a soulad konečného tarifu s legislativou a konkurencí je ponechán na pojistném matematikovi.

Cena pojistky není určena náhodně. Riziko dopravní nehody u 22letého, nově licencovaného řidiče žijícího ve velkém městě je statisticky vyšší než u 45letého řidiče s 20letou praxí; Ve spravedlivém systému by se mělo lišit i pojistné. Úkol pojistného matematika měřit tento rozdíl a promítnout jej do ceny se nazývá oceňování a klasifikace rizika. V této jednotce probereme zobecněný lineární model (GLM), pojistně-matematickou páteř tvorby cen a jeho alternativy strojového učení a uvidíme, jak v tomto procesu bezpečně používat umělou inteligenci.

Několik základních pojmů. Rizikový faktor je proměnná, která ovlivňuje riziko a používá se při stanovení ceny (stáří, stáří vozidla, region, zamýšlené použití). Sazebník je soubor pravidel, která určují, jak se bude vypočítávat pojistné podle rizikových faktorů. Riziková prémie je čistý náklad očekávané ztráty; Když se sečtou náklady, provize, ziskové marže a kapitálové náklady, vznikne obchodní prémie (prodejní cena). Připomeňme od začátku: AI navrhuje proměnné, staví modely, vysvětluje koeficienty; Ale která proměnná je legální a etická a zda je konečný tarif v souladu s legislativou a hospodářskou soutěží, přísluší pojistnému matematikovi a útvaru compliance.

Proč je GLM standardem v pojistných matematikách

Nejpoužívanější metodou stanovení ceny je GLM. GLM znamená „generalizovaný lineární model“: rozšiřuje klasickou lineární regresi tak, aby vyhovovala nenormálně distribuovaným cílům, jako jsou data poškození. Má dvě základní složky. Rodina rozdělení: Poisson je zvolen pro frekvenci, gama je zvolen pro intenzitu (logika v jednotce 2). Link function (link): obvykle logaritmická, která umožňuje, aby faktory měly multiplikativní účinek. Multiplikativní struktura je velmi cenná v pojistně matematické praxi, protože přesně tak je nastaven tarif: základní pojistné × faktor stáří × faktor regionu × faktor vozidla.

Největší výhodou GLM je interpretovatelnost. Koeficient vám přímo říká: "skupina mladých řidičů zvyšuje frekvenci 1,6krát ve srovnání s referenční skupinou." Tato transparentnost je kritická třemi způsoby: (1) regulátor a interní audit mohou modelu porozumět a schválit jej; (2) je viditelný zakázaný/diskriminační účinek; (3) cenová logika může být vysvětlena prodejnímu a manažerskému týmu. Složitější modely strojového učení (níže) někdy poskytují vyšší přesnost, ale na úkor transparentnosti.

Tip: Koeficient GLM je na logaritmické stupnici. Požádejte AI, aby převedl koeficient na "násobící faktor" pomocí exp(koeficient); Bylo by mnohem snazší přeložit do obchodního jazyka (např. koeficient 0,47 → faktor ≈ 1,60 → „60 % riskantnější“).

Variabilní výběr, overfitting a strojové učení

Nejdůležitějším rozhodnutím při stanovení ceny je, které proměnné v modelu zůstanou. Jsou tam dvě pasti. Jen málo proměnných model zatemňuje: pokud se přehlédne důležitý faktor rizika, cena bude špatná. Příliš variabilní/přepastování způsobuje, že si model zapamatuje minulá data: model zaměňuje šum za signál a selhává s novými politikami. Rovnováha je nastolena prostřednictvím křížové validace – rozdělením dat na tréninkové a testovací kusy a jejich testování na datech, která model nevidí, jednoduchost a pojistně-matematické uvažování.

Důležitá je také interakce: někdy se kombinovaný účinek dvou faktorů liší od součtu jejich samostatných účinků (mladé + sportovní vozidlo může být riskantnější než součet jejich jednotlivých účinků). V GLM jsou interakce přidány explicitně.

V posledních letech se modely jako GBM (gradient boosting machine – výkonná metoda strojového učení, která kombinuje mnoho malých rozhodovacích stromů) staly běžnými při stanovování cen. Ty automaticky zachycují složité vzorce a interakce a často poskytují přesnější předpovědi než GLM. Má to však svou cenu: tendenci být „černou skříňkou“. Běžnou praxí je dnes používat GBM pro objevování a generování nápadů a GLM pro konečný transparentní tarif; nebo interpretaci výstupu GBM pomocí nástrojů pro vysvětlení, jako je SHAP.

Následující tabulka porovnává dva přístupy:

kritérium

GLM

GBM (strojové učení)

Interpretovatelnost

Vysoký (koeficient zapnutý)

Nízká (vyžaduje nástroj pro poznámky)

Zachycení interakce

Přidáno ručně

automatické

Nebezpečí nadměrného vybavení

nízká-střední

Vysoká (vyžaduje pečlivé nastavení)

Schválení regulátorem/auditem

snadné

Obtížné, vyžaduje další dokumentaci

Typické použití

konečný tarif

objev, srovnání

Jak používat AI při stanovování cen

1) Překlad GLM koeficientu do obchodního jazyka:

Nastavil jsem frekvenci GLM (Poisson, log link). Některé koeficienty (logaritmická škála): age_group_18_25: 0,47 ; region_většina: 0,22 ; arac_yasi_10plus: -0,15. Převeďte každý z nich na multiplikační faktor pomocí exp() a vysvětlete jej jednou větou, které manažer rozumí. Připomeňte také, co je referenční skupina.

2) Diskuse o proměnných/interakcích:

Vaše role: cenový asistent. Moje kandidátní proměnné pro model dopravní frekvence jsou: věk, pohlaví, region, stáří vozidla, výkon motoru, roční km, profese. - Které proměnné mohou být rizikové z regulačního/etického hlediska (např. nepřímá diskriminace)? - Které bilaterální interakce by mělo smysl vyzkoušet? – Jaké ověřovací kroky bych měl dodržovat, abych se vyhnul nadměrnému vybavení? rozhodování; Dejte mi rámec pro kontrolu a diskusi.

3) Kontrolní kód přemontování:

Napište komentovaný kód, který vyhodnotí GLM s k-násobným křížovým ověřením pomocí Pythonu + scikit-learn / statsmodels. Jako metriku použijte Poissonovu odchylku. Porovnejte výsledky školení a testů a vysvětlete v řádku komentářů, jak číst označení nadměrného vybavení. Knihovna je falešná.

4) Diskriminační/náhradně variabilní screening:

'Postcode' se ukázalo jako silná proměnná v mém cenovém modelu. Vysvětlete riziko, že toto nepřímo představuje zakázanou charakteristiku (např. etnicitu, příjem) jako zástupnou proměnnou. - Jakou analýzu bych měl udělat, abych otestoval toto riziko? - Jaké existují alternativy ke snížení rizika? Poskytování právního poradenství; vypracovat technický a etický rámec.

Slabá výzva / Silná výzva

Slabá výzva:

Stanovte nejlepší cenový model pro dopravní pojištění.

"Nejlepší" není definováno; Žádná data, žádná omezení, žádná legislativa. AI dává obecnou, nepoužitelnou odpověď.

Výkonná výzva:

Vaše role: asistent cenového pojistného matematika. Kontext: Buduji frekvenční model dopravních větví, GLM (Poisson, log link). Proměnné mám: věková skupina, stáří vozidla, region (provincie), roční km, zamýšlené použití. Omezení: legislativa nemůže používat pohlaví; Potřebuji se vyhnout nepřímé diskriminaci. Úkol: 1) Navrhněte počáteční specifikaci modelu s těmito proměnnými (včetně referenčních skupin).2) Uveďte důvody pro 2 interakce, které bych měl zkusit.3) Uveďte seznam kroků ke kontrole nadměrného vybavení.4) Přidejte zvláštní poznámku k „regionu“ z hlediska nepřímé diskriminace. Rozhodnu se já; Vy poskytujete rámec a odůvodnění.

tři mini pouzdra

Případ 1 – Hodnota transparentnosti. Jedna společnost předložila regulátorovi velmi přesný cenový model, který vytvořila s GBM, ale nedokázala vysvětlit koeficienty; schválení zpožděno. Pojistný matematik zkonstruoval GLM, který zachytil stejné signály; Přesnost klesla o 2 procenta, ale protože bylo možné zohlednit každý faktor, byl model ověřen do měsíce. GBM byl uložen na průzkum, GLM se stal tarifem. YZ rychle vytvořil kód a popis regulátoru srovnávající výkon obou modelů.

Případ 2 — Přebytečná past. Pomocník získal perfektní skóre na tréninkových datech, když do modelu přidal více než 40 proměnných a četné interakce. Ale při křížové validaci se skóre testu zhroutilo: model si hluk zapamatoval. Reálný výkon se zvýšil, když byl počet proměnných snížen na 12 a zjednodušen. Ponaučení: podívejte se na bezprecedentní datové skóre, ne na tréninkové skóre.

Případ 3 – Nepřímá diskriminace. V jednom modelu proměnná „sousedství“ silně vysvětlovala pojistné. Analýza ukázala, že tato proměnná se do značné míry překrývala s etnickou koncentrací, tj. byla zástupným znakem zakázané charakteristiky. Pojistný matematik nahradil tuto proměnnou neutrálnějšími indikátory rizika (typ silnice, stav parkování); snížila se etická i právní rizika. AI vytvořila korelační analýzu měřící překrytí a návrhy alternativních proměnných; Rozhodla o tom oddělení pojistných matematiků a compliance.

Časté chyby

  • Udělat z nevysvětlitelného modelu konečný recept. Cena, kterou nelze vysvětlit regulátorovi, auditu a zákazníkovi, je neudržitelná; Transparentnost je zásadní.
  • Spoléhání na vzdělání. Nadměrná montáž je detekována pouze v neviditelných datech (křížová validace).
  • Použití zakázaných/náhradních proměnných bez kontroly. Proměnné, jako je PSČ a povolání, mohou nést nepřímou diskriminaci; Určitě to otestujte.
  • Zaměňování rizikové prémie s komerční prémií. Samotná cena škody není prodejní cenou; sčítají se náklady, zisk a náklady kapitálu.
  • Ponechání koeficientu na logaritmické stupnici a jeho nesprávná interpretace. Komentování bez převodu na multiplikační faktor pomocí exp() způsobí chybu.
Upozornění: Doporučení AI modelu, který „poskytuje nejlepší přesnost“, není automaticky modelem, který „by měl být použit“. Transparentnost, spravedlnost a soulad s legislativou jsou povinnými kritérii, stejně jako přesnost pojistně-matematických cen.

V souhrnu

Oceňování je proces měření rizika pomocí rizikových faktorů a jeho přeměna na spravedlivou prémii. GLM je standardem pojistně-matematických cen se svou multiplikativní a interpretovatelnou strukturou; Koeficienty jsou převedeny na faktory pomocí exp(). Modely strojového učení, jako je GBM, mohou být přesnější, ale snižují transparentnost a obvykle se používají pro objevování. Výběr proměnných by měl být chráněn proti nadměrnému přizpůsobení křížovou validací a nepřímá diskriminace (náhradní proměnná) by měla být pečlivě kontrolována. AI sestaví model, napíše kód a vysvětlí koeficient; Právně-etické dodržování a konečná sazba však patří do jednotky pojistných matematiků a dodržování předpisů.

Aplikační úkol

Uveďte 5-6 rizikových faktorů pro hlavní. Požádejte AI ​​o (a) počáteční specifikaci GLM s těmito faktory, (b) 2 interakce k vyzkoušení a jejich zdůvodnění, (c) screening proměnných, které mohou být ohroženy nepřímou diskriminací. Poté uveďte příklad 3 log-koeficientů, požádejte AI, aby jej převedla na multiplikační faktor pomocí exp() a přenesla jej do obchodního jazyka a ověřte faktory ručně.

kontrolní seznam

  • [ ] Lze můj model interpretovat; Mohu převést dopad každého faktoru do obchodního jazyka?
  • [ ] Zkontroloval(a) jsem křížovou validací, zda nedošlo k nadměrnému vybavení?
  • [ ] Skenoval jsem nepřímou diskriminaci pro zakázané a proxy proměnné?
  • [ ] Oddělil jsem vědomě rizikovou prémii od obchodní prémie?
  • [ ] Převedl jsem koeficienty na multiplikátory pomocí exp() a interpretoval jsem je správně?
  • [ ] Učinil jsem konečné rozhodnutí o tarifu společně s legislativou a jednotkou pro dodržování předpisů?