Jednotka 2 / 11

Modelování poškození: frekvenčně-závažná diskriminace a analýza podporovaná umělou inteligencí

zisky:

  • Schopnost stanovit a interpretovat rozdíl mezi četností poškození a množstvím (závažností), vhodnými distribucemi (Poissonovo, záporné binomické, gama) a logikou kompozitního modelu s podporou umělé inteligence.
  • Třídění extrémně velkých ztrát (odlehlé hodnoty/velké ztráty), omezení dat a korekce trendu/vývoje umělé inteligence pomocí správných otázek a dat.
  • Schopnost pochopit, že výběr distribuce a parametry vytvořené umělou inteligencí by měly být potvrzeny testy dobré shody a pojistně-matematickým uvažováním.

Nejzákladnější otázka pro pojišťovnu zní: "Jakou škodu zaplatíme za tuto pojistnou skupinu v příštím roce?" Správné zodpovězení této otázky je předpokladem jak pro správné nastavení pojistného, ​​tak pro alokaci dostatečných rezerv. Pojistní matematici odpovídají na tuto otázku rozdělením na dvě; protože je mnohem přesnější modelovat dvě samostatná chování odděleně místo odhadu celkových škod v jednom kuse. Tyto dvě části jsou frekvence a intenzita.

Frekvence (frekvence poškození) je počet poškození, ke kterému dojde při dané expozici; Například 100 vozidel - 8 nehod ročně. Závažnost je průměrná výše každé vzniklé škody; například 30 000 TL za nehodu. Vynásobením těchto dvou získáte rizikovou prémii: očekávané náklady na poškození na expozici (0,08 × 30 000 = 2 400 USD). V této jednotce krok za krokem uvidíme, jak pomocí umělé inteligence stanovit toto rozlišení, zvolit správné rozdělení pravděpodobnosti a spravovat odlehlé hodnoty. Připomeňme od začátku: AI navrhuje distribuce a píše kód, ale je na pojistném matematikovi, aby potvrdil výběr distribuce pomocí testů dobré shody a posouzení.

Proč jsou frekvence a intenzita modelovány odděleně?

Frekvence a intenzita vykazují různé statistické chování. Počet nároků je proměnná počtu (0, 1, 2, 3...) a je obvykle modelována s Poissonovým rozdělením nebo záporným binomickým rozdělením, pokud existuje nadměrná disperze (rozptyl > průměr). Poisson je klasická distribuce, která modeluje počet vzácných a nezávislých událostí. Výše škody je spojitá a zkosená proměnná: většina škod je malých, několik škod je velmi velkých. Proto je závažnost často modelována pomocí gama nebo lognormálního rozdělení; jde o pozitivní a pravoúhlé rozdělení.

Modelování těchto dvou samostatně má tři konkrétní výhody. Za prvé, můžete vidět, že každý má své vlastní řidiče (rizikové faktory): mladý řidič zvyšuje frekvenci, drahé vozidlo zvyšuje násilí. Za druhé, když se data změní, můžete diagnostikovat proč: zvýšily se náklady na poškození nebo počet škod? Za třetí, extrémně velké ztráty můžete uvažovat samostatně pouze na straně násilí. Kombinace těchto dvou se nazývá složený model; očekávané celkové poškození = očekávaná frekvence × očekávaná závažnost.

Nápověda: Věta „Náš poměr ztráty/prémie se zvýšil“ sama o sobě nic neříká. Oddělte otázku, zda se zvýšila frekvence nebo intenzita; zásah (cena, krytí, zvládání škod) by byl úplně jiný.

Odlehlé hodnoty, zkrácení a korekce trendů

Data poškození v nezpracované podobě nejsou připravena pro stavbu modelu. Téměř vždy jsou nutné tři opravy. První je třídění extrémního/velkého poškození: několik obřích poškození (např. požár továrny) zkresluje průměr; ty jsou modelovány jako samostatný „zátěž velkého poškození“. Druhým je stropování: fixace velmi velkých škod na určitém stropu (například 1 000 000 TL) a samostatný výpočet horní části činí model stabilní. Zatřetí, korekce trendu a vývoje: minulé pohledávky by měly být aktualizovány s inflací na dnešní cenovou hladinu (trend) a pohledávky, které ještě nebyly plně uhrazeny, by měly být převedeny na konečnou úroveň (vývoj — tomuto tématu se budeme věnovat v bloku 3).

Následující tabulka porovnává vlastnosti obou komponent:

funkce

Frekvence (frekvence)

násilí (množství)

Variabilní typ

Počítání (0,1,2...)

konstantní, pozitivní

Typická distribuce

Poisson, negativní binom

Gamma, lognormální

Příklady hlavních ovladačů

Věk, zkušenosti, region, využití

Hodnota vozidla, limit pokrytí, náklady na opravu

Odlehlý problém

nízká

Vysoká (velké škody)

Inflační efekt

slabý

silný

Jak používat AI při modelování poškození

Tam, kde je AI nejsilnější, je diskuse o výběru distribuce, psaní kódu a interpretace výsledku. Níže jsou čtyři kopírovatelné šablony.

1) Diskutujte o výběru distribuce:

Vaše role: pojistně-matematický asistent modelování. Mám údaje o pojistné události AMOUNT (anonymní, 1 600 škod). Shrnutí: průměr 30 300 TL, medián 12 500 TL, maximum 940 000 TL, šikmost je vysoká. Otázka: byla by pro model závažnosti vhodnější gama nebo lognormal? Jaký je předpoklad každého plus/mínus a pomocí kterého testu dobré shody (např. Vysvětlete, že se rozhodnu (graf Q-Q, test K-S, AIC). Definitivní rozhodnutí; Dejte mi srovnávací rámec.

2) Kód výpočtu frekvenční intenzity:

Napište komentovaný kód pomocí Python + pandas, který provede následující kroky: 1) V df jsou sloupce 'exposure', 'claim_count', 'claim_amount'. 2) Obecná četnost = celkový počet pojistných událostí / celková expozice. 3) Průměrná závažnost = celková částka_žádosti / celkový počet_nároků. 4) Riziková prémie = četnost × závažnost. 5) Vytisknout každý mezivýsledek na obrazovku, abych jej mohl ručně ověřit. Vybavení knihoven; stačí použít pandy.

3) Analýza extrémních hodnot/mezních hodnot:

Mám anonymní rozdělení pohledávek. Nároky jako 950 000, 720 000, 610 000 TL tvoří 22 % z celkové částky. Řekněte mi o svém přístupu k omezení: – Které možnosti omezení jsou rozumné (např. 500 000, 750 000, 1 milion)? - Jak přidám zpět uříznutou část jako samostatný "zátěž s velkým poškozením"? - Ukažte mi krok za krokem, jak toto rozhodnutí ovlivňuje rizikovou prémii.

4) Překlad výsledku do obchodního jazyka:

Moje frekvence se zvýšila z 0,13 na 0,15; Průměrné násilí se zvýšilo z 28 000 na 34 000 TL. Shrňte to do 4 vět, kterým manažer rozumí: - Co se stalo, která složka se o kolik zvýšila? - Jaký je celkový vliv na rizikovou prémii? - Napište možné důvody a 2 předpoklady, které potřebuji ověřit.

Slabá výzva / Silná výzva

Slabá výzva:

Nastavit můj model ztráty a vypočítat pojistné.

Nejasné: která data, která složka, jaké rozdělení, jaké období? AI zaplňuje tuto mezeru výmyslem.

Výkonná výzva:

Vaše role: pojistně-matematický asistent modelování. Údaje (anonymní, dopravní odvětví, 2024): expozice 20 000 pojistných let, počet škod 2 600, celková škoda 91 000 000 TL, 5 největších škod celkem 12 000 000 TL. Úkol: 1) Vypočítejte frekvenci a hrubou průměrnou závažnost, ukažte vzorec. 2) 5 největších škod Omezte to na 1 000 000 TL a znovu vypočítejte upravenou závažnost. 3) Porovnejte rizikovou prémii s a bez stropu, okomentujte rozdíl. 4) Zapište každý krok s mezičísly, abych si to mohl ověřit ručně. Stačí použít čísla, která jsem uvedl; Pokud chybí, zeptejte se.

tři mini pouzdra

Případ 1 – Síla oddělení. U jednoho pojistného matematika se poměr ztráty a pojistného v odvětví bydlení za jeden rok zvýšil z 68 procent na 81 procent. Než bylo navrženo panické zvýšení cen, bylo provedeno rozlišení frekvence a závažnosti: frekvence byla téměř konstantní (0,041 → 0,043), ale průměrná závažnost vyskočila z 14 200 TL na 19 800 TL. Důvodem byla inflace stavebních nákladů, nikoli počet pojistek nebo rizikových zákazníků. Správným zásahem bylo aktualizovat částky krytí, nikoli slepé zvýšení pojistného.

Případ 2 – Odlehlá past. Průměr 1 800 škod v portfoliu podnikatelského pojištění byl 42 000 TL. Samotné poškození ohněm ve výši 6,4 milionu TL však zvýšilo tento průměr přibližně o 3 500 TL. Když byla tato velká škoda modelována a omezena jako samostatná „zátěž velkých škod“, základní závažnost se snížila na 38 500 TL a prémie se stala spravedlivější. Umělá inteligence rychle vygenerovala kód pro omezení a alternativní omezení; Pojistný matematik učinil rozhodnutí.

Případ 3 – Špatná distribuce. Asistent bez pochyb spustil kód AI, který vybral normální (gaussovské) rozdělení závažnosti. Vzhledem k tomu, že normální rozdělení umožňovalo záporné hodnoty a symetrii, neodpovídalo pravoúhlým datům poškození; model nadhodnocoval malé škody a podceňoval velké. Když byly porovnány graf Q-Q a AIC, bylo vidět, že gama sedí mnohem lépe. Lekce: Distribuce navržená umělou inteligencí je vždy testována testováním shody.

Časté chyby

  • Kombinace frekvence a intenzity a predikce s jediným modelem. Skrývá dvě různá chování; ztratíte řidiče a proč.
  • Průměrování bez eliminace extrémních/velkých škod. Několik obřích poškození zkresluje celý obraz; prémie je uměle navýšena.
  • Použití starého poškození bez použití trendu inflace. Škoda z roku 2019 není stejná jako dnešní cena; je nutná korekce trendu.
  • Přizpůsobení normálního rozdělení pravoúhlým datům. Předpoklad záporné hodnoty a symetrie je v rozporu s údaji o poškození; Myslete na gama/lognormální.
  • Neověřování výběru distribuce pomocí testování shody. Návrh AI je začátek; Potvrďte pomocí Q-Q, K-S, AIC.
Pozor: Úroveň čepice (řezání) není zvolena libovolně. Příliš nízký strop skrývá riziko velkých škod; příliš vysoký strop dělá čalounění zbytečným. Vyberte si podle minulých zkušeností s významnými ztrátami portfolia a podmínek zajištění.

V souhrnu

Způsob, jak přesně odhadnout celkovou škodu, je rozdělit ji na frekvenci (frekvenci) a závažnost (množství). Frekvence je modelována pomocí Poissonova/negativního binomu, intenzita pomocí gama/lognormální; Riziková prémie se zjistí vynásobením těchto dvou. Nezpracovaná data vyžadují odstranění odlehlých hodnot, zkrácení a korekci trendů. Diskuse o distribuci AI je vynikajícím pomocníkem pro kódování a komentování; ale výběr distribuce a rozhodnutí o stropu jsou potvrzeny testy shody a pojistně-matematickým úsudkem.

Aplikační úkol

Připravte si anonymní souhrn škod (expozice, počet škod, celková škoda, 3–5 největších škod). Požádejte AI, aby vypočítala (a) hrubou prémii za frekvenci-závažnost-riziko, (b) omezila velké ztráty a vypočítala upravenou rizikovou prémii. Ověřte tyto dva výsledky ručně a poznamenejte si, o jaké procentuální omezení změní rizikovou prémii. Poté položte AI otázku „gamma nebo lognormal pro násilí“ a shrňte srovnávací rámec, který poskytuje, svými vlastními slovy.

kontrolní seznam

  • [ ] Počítal jsem frekvenci a intenzitu zvlášť, nebo jsem se na ně díval jako na jeden kus?
  • [ ] Zjistil jsem velké/extrémní poškození a řešil jsem je samostatně?
  • [ ] Použil jsem úpravu inflace/trendu na staré pohledávky?
  • [ ] Ověřil jsem rozložení intenzity testem dobré shody?
  • [ ] Přepočítal jsem nezávisle rizikovou prémii (četnost × závažnost)?
  • [ ] Zpochybnil jsem úroveň distribuce a limitu navrženou umělou inteligencí a potvrdil jsem ji úsudkem?