Enota 2 / 11

Modeliranje škode: diskriminacija frekvence in resnosti in analiza, podprta z umetno inteligenco

Dobički:

  • Znati ugotoviti in interpretirati razlikovanje med pogostostjo škode in višino (težo) škode, ustrezne porazdelitve (Poisson, negativni binom, gama) in logiko sestavljenega modela s podporo umetne inteligence.
  • Razvrščanje izredno velikih izgub (izjemi/velike izgube), omejevanje podatkov in popravki trendov/razvoja umetne inteligence s pravimi vprašanji in podatki.
  • Sposobnost razumevanja, da je treba distribucijsko izbiro in parametre, ki jih proizvede umetna inteligenca, potrditi s testi ustreznosti in aktuarskim sklepanjem.

Najbolj osnovno vprašanje za zavarovalnico je: "Koliko škode bomo plačevali po tej zavarovalni skupini naslednje leto?" Pravilen odgovor na to vprašanje je predpogoj tako za pravilno določitev premije kot tudi za oblikovanje zadostnih rezerv. Aktuarji na to vprašanje odgovarjajo tako, da ga razdelijo na dvoje; ker je veliko bolj natančno modelirati dve ločeni vedenji ločeno, namesto da bi ocenili skupno škodo v enem kosu. Ta dva dela sta frekvenca in intenzivnost.

Frekvenca (pogostost poškodb) je, koliko poškodb nastane na dano izpostavljenost; Na primer, 100 vozil - 8 nesreč na leto. Resnost je povprečni znesek vsake nastale škode; na primer 30.000 TL na nesrečo. Z množenjem teh dveh dobimo premijo za tveganje: pričakovani strošek škode na izpostavljenost (0,08 × 30.000 = 2.400 USD). V tej enoti bomo korak za korakom videli, kako uporabiti umetno inteligenco za vzpostavitev tega razlikovanja, izbiro prave porazdelitve verjetnosti in upravljanje izstopajočih vrednosti. Naj spomnimo od začetka: AI predlaga distribucije in piše kodo, vendar mora aktuar potrditi izbiro distribucije s testi primernosti in presojo.

Zakaj sta frekvenca in intenzivnost modelirani ločeno?

Pogostost in intenzivnost kažeta različno statistično obnašanje. Število zahtevkov je spremenljivka štetja (0, 1, 2, 3 ...) in se običajno modelira s Poissonovo porazdelitvijo ali negativno binomsko porazdelitvijo, če obstaja prevelika disperzija (varianca > povprečje). Poissonova je klasična porazdelitev, ki modelira število redkih in neodvisnih dogodkov. Znesek škode je zvezna in desno nagnjena spremenljivka: večina zahtevkov je majhnih, nekaj zahtevkov je zelo velikih. Zato je resnost pogosto modelirana z gama ali lognormalno porazdelitvijo; to so pozitivne in desno poševne porazdelitve.

Ločeno modeliranje obeh ima tri konkretne prednosti. Prvič, lahko vidite, da ima vsak svoje voznike (dejavnike tveganja): mlad voznik poveča pogostost, drago vozilo poveča nasilje. Drugič, ko se podatki spremenijo, lahko diagnosticirate, zakaj: ali so se stroški škode povečali ali število zahtevkov? Tretjič, izredno velike izgube lahko obravnavate ločeno na strani nasilja. Kombinacija teh dveh se imenuje sestavljeni model; pričakovana skupna škoda = pričakovana pogostost × pričakovana resnost.

Namig: Stavek "Naše razmerje med izgubo in premijo se je povečalo" sam po sebi ne pove ničesar. Ločite vprašanje, ali se je povečala pogostost ali intenzivnost; poseg (cena, kritje, obvladovanje škode) bi bil popolnoma drugačen.

Odstopanja, odrezki in popravki trendov

Podatki o škodi v surovi obliki niso pripravljeni za izdelavo modela. Skoraj vedno so potrebni trije popravki. Prva je razvrščanje ekstremne/velike škode: nekaj velikanskih škod (npr. požar v tovarni) popači povprečje; te so modelirane kot ločena "obremenitev večje škode". Drugi je omejevanje: določitev zelo velike škode na določeno zgornjo mejo (na primer 1.000.000 TL) in ločen izračun zgornjega dela naredi model stabilen. Tretjič, popravek trenda in razvoja: pretekle terjatve je treba posodobiti z inflacijo na današnjo raven cen (trend), terjatve, ki še niso v celoti poplačane, pa spraviti na končno raven (razvoj — to temo bomo obravnavali v 3. enoti).

Naslednja tabela primerja lastnosti obeh komponent:

funkcija

Frekvenca (frekvenca)

Nasilje (količina)

Vrsta spremenljivke

Štetje (0,1,2 ...)

konstanten, pozitiven

Tipična porazdelitev

Poisson, negativni binom

Gama, lognormalna

Primeri glavnega voznika

Starost, izkušnje, regija, uporaba

Vrednost vozila, omejitev kritja, stroški popravila

Izjemna težava

nizka

Visoka (velika škoda)

Učinek inflacije

šibka

močan

Kako uporabljati AI pri modeliranju škode

Umetna inteligenca je najmočnejša pri razpravljanju o izbiri distribucije, pisanju kode in razlagi rezultata. Spodaj so štiri predloge, ki jih je mogoče kopirati.

1) Pogovorite se o izbiri distribucije:

Vaša vloga: pomočnik pri aktuarskem modeliranju. Imam podatke o zavarovalnih zahtevkih AMOUNT (anonimno, 1600 zahtevkov). Povzetek: povprečje 30.300 TL, mediana 12.500 TL, največ 940.000 TL, asimetrija je velika. Vprašanje: ali bi bila gama ali lognormal bolj primerna za model resnosti? Kakšna je predpostavka vsakega, plus/minus in s katerim testom primernosti (npr. Pojasnite, da se bom odločil (karta Q-Q, test K-S, AIC). Sprejem dokončne odločitve; Daj mi primerjalni okvir.

2) Koda za izračun frekvence in intenzivnosti:

Napišite komentirano kodo s Python + pandas, ki izvaja naslednje korake: 1) V df so stolpci 'exposure', 'claim_count', 'claim_amount'. 2) Splošna pogostost = skupno število zahtevkov / skupna izpostavljenost. 3) Povprečna resnost = skupni znesek zahtevka / skupno število zahtevkov. 4) Premija za tveganje = pogostost × resnost. 5) Natisnite vsak vmesni rezultat na zaslon, da ga lahko ročno preverim. Opremljanje knjižnice; samo uporabljajte pande.

3) Ekstremna vrednost / analiza meje:

Imam anonimno razdelitev zneska zahtevka. Zahtevki, kot so 950.000, 720.000, 610.000 TL, predstavljajo 22 % celotnega zneska. Povejte mi o svojem pristopu omejevanja: – Katere možnosti omejevanja so razumne (npr. 500K, 750K, 1M)? - Kako dodam nazaj odrezani del kot ločeno "obremenitev večje škode"? - Pokažite mi korak za korakom, kako ta odločitev vpliva na premijo za tveganje.

4) Prevajanje rezultata v poslovni jezik:

Moja frekvenca se je povečala z 0,13 na 0,15; Povprečno nasilje se je povečalo z 28.000 na 34.000 TL. Povzemite to v 4 stavke, ki jih vodja razume: - Kaj se je zgodilo, katera komponenta se je povečala za koliko? - Kakšen je skupni učinek na premijo za tveganje? - Napišite možne razloge in 2 predpostavki, ki ju moram preveriti.

Šibek poziv/močan poziv

Šibek poziv:

Nastavite svoj model izgube in izračunajte premijo.

Nejasno: kateri podatki, katera komponenta, katera porazdelitev, katero obdobje? AI zapolni to vrzel z izmišljotino.

Močan poziv:

Vaša vloga: pomočnik pri aktuarskem modeliranju. Podatki (anonimno, prometna veja, 2024): izpostavljenost 20.000 zavarovalnih let, število zahtevkov 2.600, skupna škoda 91.000.000 TL, 5 največjih škod skupaj 12.000.000 TL. Naloga: 1) Izračunajte frekvenco in surovo povprečno resnost, pokažite formulo. 2) 5 največjih odškodnin Omejite na 1.000.000 TL in ponovno izračunajte prilagojeno resnost. 3) Primerjajte premijo za tveganje z in brez zgornje meje, komentirajte razliko. 4) Vsak korak zapišite z vmesnimi številkami, da ga lahko ročno preverim. Samo uporabite številke, ki sem jih dal; Če manjka, vprašajte.

trije mini kovčki

Primer 1 – Moč ločevanja. En aktuar je opazil, da se je razmerje med izgubo in premijo v stanovanjski panogi v enem letu povečalo z 68 odstotkov na 81 odstotkov. Preden je bilo predlagano povišanje cene za paniko, je bilo opravljeno razlikovanje med pogostostjo in resnostjo: pogostost je bila skoraj konstantna (0,041 → 0,043), vendar je povprečna resnost poskočila s 14.200 TL na 19.800 TL. Razlog je bila inflacija gradbenih stroškov, ne pa število polic ali tveganih strank. Pravilna intervencija je bila posodobitev zneskov kritja, ne slepo zvišanje premije.

Primer 2 – past izstopa. Povprečje 1.800 zahtevkov v poslovnem zavarovalnem portfelju je bilo 42.000 TL. Vendar pa je samo en sam požar v višini 6,4 milijona TL to povprečje povečal za približno 3500 TL. Ko je bila ta večja škoda modelirana in omejena kot ločeno "breme velike škode", se je osnovna resnost zmanjšala na 38.500 TL in premija je postala pravičnejša. AI je hitro ustvaril kodo za omejitev in alternativne omejitve; Odločil je aktuar.

Primer 3 – Nepravilna distribucija. Brez dvoma je pomočnik zagnal kodo AI, ki je za resnost izbrala normalno (Gaussovo) porazdelitev. Ker je normalna porazdelitev dovoljevala negativne vrednosti in simetrijo, ni ustrezala podatkom o poškodbah, poševnih v desno; model je precenjeval majhne škode in podcenjeval velike. Ko sta primerjali graf Q-Q in AIC, je bilo ugotovljeno, da se gama veliko bolje ujema. Lekcija: Porazdelitev, ki jo predlaga AI, je vedno preizkušena s testiranjem primernosti.

Pogoste napake

  • Združevanje frekvence in intenzivnosti ter napovedovanje z enim samim modelom. Skriva dve različni vedenji; izgubiš voznika in zakaj.
  • Povprečenje brez izključitve ekstremne/večje škode. Nekaj ​​velikanskih poškodb popači celotno sliko; premija je umetno napihnjena.
  • Uporaba stare škode brez uporabe trenda inflacije. Škoda iz leta 2019 ni enaka današnji ceni; potrebna je korekcija trenda.
  • Prilagajanje normalne porazdelitve desno poševnim podatkom. Predpostavka o negativni vrednosti in simetriji je v nasprotju s podatki o poškodbah; Pomislite na gama/lognormalno.
  • Ne preverjanje izbire distribucije s testiranjem prileganja. Predlog AI je začetek; Potrdite s Q-Q, K-S, AIC.
Pozor: Stopnja kapice (reza) ni izbrana poljubno. Prenizek strop skriva nevarnost večje škode; previsok strop naredi obloge neuporabne. Izberite tako, da pogledate pretekle izkušnje z večjimi izgubami portfelja in pozavarovalne pogoje.

Če povzamem

Način za natančno oceno celotne škode je, da jo razdelimo na pogostost (pogostost) in resnost (znesek). Frekvenca je modelirana s Poissonovim/negativnim binomom, intenzivnost z gama/lognormalnim; Premijo za tveganje dobimo z množenjem obeh. Neobdelani podatki zahtevajo odstranitev izstopajočih vrednosti, obrezovanje in popravek trenda. Razprava o distribuciji AI je odličen pomočnik za kodo in komentiranje; vendar sta izbira razdelitve in odločitev o zgornji meji potrjena s testi primernosti in aktuarsko presojo.

Aplikacijska naloga

Pripravite anonimni povzetek škode (izpostavljenost, število škod, skupna škoda, top 3-5 škod). Prosite umetno inteligenco, da izračuna (a) surovo premijo za tveganje, pogostost, resnost, (b) omeji velike izgube in izračuna prilagojeno premijo za tveganje. Ročno preverite oba rezultata in zabeležite, za koliko odstotkov omejitev spremeni premijo za tveganje. Nato AI zastavite vprašanje "gama ali lognormal za nasilje" in s svojimi besedami povzamete primerjalni okvir, ki ga poda.

kontrolni seznam

  • [ ] Ali sem frekvenco in intenzivnost izračunal ločeno ali sem ju gledal kot eno?
  • [ ] Ali sem ugotovil večjo/ekstremno škodo in jo obravnaval ločeno?
  • [ ] Ali sem za stare terjatve uporabil prilagoditev inflacije/trenda?
  • [ ] Ali sem porazdelitev intenzivnosti preveril s testom primernosti?
  • [ ] Ali sem neodvisno preračunal premijo za tveganje (pogostost × resnost)?
  • [ ] Ali sem dvomil o distribuciji in ravni zgornje meje, ki ju je predlagala umetna inteligenca, in ju potrdil s presojo?