Jednostka 4 / 11

Klasyfikacja cen i ryzyka: GLM, taryfy i sztuczna inteligencja

Zyski:

  • Możliwość ustalenia uogólnionego modelu liniowego (GLM), koncepcji czynników ryzyka, taryf i premii za ryzyko przy wsparciu sztucznej inteligencji oraz przełożenia współczynników na język biznesowy
  • Umiejętność omówienia równowagi między wyborem zmiennych, interakcją, nadmiernym dopasowaniem i interpretowalnością modeli uczenia maszynowego (GBM) ze sztuczną inteligencją
  • Zrozumienie, że model cenowy jest wolny od zabronionych/dyskryminujących zmiennych, a zgodność ostatecznej taryfy z przepisami prawa i konkurencją pozostaje w gestii aktuariusza.

Cena polisy ubezpieczeniowej nie jest ustalana losowo. Ryzyko wypadku drogowego dla 22-letniego, świeżo upieczonego kierowcy, mieszkającego w dużym mieście, jest statystycznie wyższe w porównaniu z 45-letnim kierowcą z 20-letnim stażem; W sprawiedliwym systemie składki też powinny być inne. Zadaniem aktuariusza jest zmierzenie tej różnicy i odzwierciedlenie jej w cenie, co nazywa się wyceną i klasyfikacją ryzyka. W tej części omówimy uogólniony model liniowy (GLM), aktuarialny szkielet wyceny i jego alternatywy w zakresie uczenia maszynowego, a także zobaczymy, jak bezpiecznie wykorzystywać sztuczną inteligencję w tym procesie.

Kilka podstawowych terminów. Czynnik ryzyka to zmienna wpływająca na ryzyko i wykorzystywana przy ustalaniu ceny (wiek, wiek pojazdu, region, przeznaczenie). Taryfa to zbiór zasad określających sposób naliczania składki w zależności od czynników ryzyka. Premia za ryzyko to czysty koszt oczekiwanej straty; Po dodaniu wydatków, prowizji, marży zysku i kosztów kapitałowych powstaje premia handlowa (cena sprzedaży). Przypomnijmy od początku: AI sugeruje zmienne, buduje modele, wyjaśnia współczynniki; Ale która zmienna jest legalna i etyczna oraz to, czy ostateczna taryfa jest zgodna z ustawodawstwem i konkurencją, należy do aktuariusza i jednostki ds. zgodności.

Dlaczego GLM jest standardem w aktuarialnym

Najczęściej stosowaną metodą ustalania cen jest GLM. GLM oznacza „uogólniony model liniowy”: rozszerza klasyczną regresję liniową, aby dopasować cele o rozkładzie normalnym, takie jak dane dotyczące uszkodzeń. Posiada dwa podstawowe elementy. Rodzina rozkładów: Poissona wybrano dla częstotliwości, gamma dla intensywności (logika w jednostce 2). Funkcja łączenia (link): zwykle logarytmiczna, co pozwala, aby czynniki miały efekt mnożnikowy. Struktura multiplikatywna jest bardzo cenna w aktuarialnym, ponieważ dokładnie w ten sposób ustalana jest taryfa: składka podstawowa × współczynnik wieku × współczynnik regionu × współczynnik pojazdu.

Największą zaletą GLM jest interpretowalność. Współczynnik mówi wprost: „grupa młodych kierowców zwiększa częstotliwość 1,6 razy w porównaniu z grupą odniesienia”. Ta przejrzystość jest kluczowa z trzech powodów: (1) organ regulacyjny i audyt wewnętrzny mogą zrozumieć i zatwierdzić model; (2) widoczny jest skutek zabroniony/dyskryminujący; (3) logikę cen można wyjaśnić zespołowi sprzedaży i kierownictwu. Bardziej złożone modele uczenia maszynowego (poniżej) czasami zapewniają większą dokładność, ale kosztem przejrzystości.

Wskazówka: współczynnik GLM jest w skali logarytmicznej. Poproś sztuczną inteligencję o przekształcenie współczynnika w „współczynnik mnożenia” za pomocą exp(współczynnik); Znacznie łatwiej byłoby to przełożyć na język biznesowy (np. współczynnik 0,47 → współczynnik ≈ 1,60 → „60% ryzykowne”).

Selekcja zmiennych, nadmierne dopasowanie i uczenie maszynowe

Najważniejszą decyzją dotyczącą wyceny jest to, które zmienne pozostaną w modelu. Są dwie pułapki. Niewiele zmiennych zaślepia model: jeśli pominięty zostanie ważny czynnik ryzyka, cena będzie błędna. Zbyt zmienna/nadmierne dopasowanie powoduje, że model zapamiętuje przeszłe dane: model myli szum z sygnałem i zawodzi w przypadku nowych zasad. Równowagę ustala się poprzez krzyżową walidację — podzielenie danych na część uczącą i testową oraz przetestowanie ich na danych, których model nie widzi, prostotę i rozumowanie aktuarialne.

Ważna jest także interakcja: czasami łączny wpływ dwóch czynników różni się od sumy ich odrębnych skutków (młody + sportowy pojazd może być bardziej ryzykowny niż suma ich indywidualnych skutków). W GLM interakcje są dodawane jawnie.

W ostatnich latach modele takie jak GBM (gradient boosting machine — potężna metoda uczenia maszynowego, która łączy wiele małych drzew decyzyjnych) stały się powszechne w ustalaniu cen. Automatycznie wychwytują one złożone wzorce i interakcje, często dając dokładniejsze prognozy niż GLM. Ma to jednak swoją cenę: tendencja do bycia „czarną skrzynką”. Obecnie powszechną praktyką jest wykorzystywanie GBM do odkrywania i generowania pomysłów oraz GLM do ustalania ostatecznej przejrzystej taryfy; lub interpretowanie wyników GBM za pomocą narzędzi wyjaśniających, takich jak SHAP.

Poniższa tabela porównuje oba podejścia:

kryterium

GLM

GBM (uczenie maszynowe)

Interpretowalność

Wysoki (współczynnik włączony)

Niski (wymaga narzędzia do adnotacji)

Przechwytywanie interakcji

Dodano ręcznie

automatyczne

Ryzyko nadmiernego dopasowania

nisko-średni

Wysoka (wymagana staranna regulacja)

Zatwierdzenie organu regulacyjnego/audytu

łatwe

Trudne, wymaga dodatkowej dokumentacji

Typowe użycie

taryfa ostateczna

odkrycie, porównanie

Jak wykorzystać sztuczną inteligencję w ustalaniu cen

1) Przekładając współczynnik GLM na język biznesowy:

Ustawiłem częstotliwość GLM (Poisson, link do dziennika). Niektóre współczynniki (skala logarytmiczna): grupa wiekowa_18_25: 0,47 ; większość_regionu: 0,22; arac_yasi_10plus: -0,15. Przekształć każdy z nich na mnożnik za pomocą exp() i wyjaśnij to jednym zdaniem zrozumiałym dla menedżera. Przypomnij także, czym jest grupa odniesienia.

2) Dyskusja na temat zmiennych/interakcji:

Twoja rola: asystent ds. cen. Moje zmienne kandydujące do modelu częstotliwości ruchu to: wiek, płeć, region, wiek pojazdu, moc silnika, roczny przebieg, zawód. - Które zmienne mogą być ryzykowne z punktu widzenia regulacyjnego/etycznego (np. dyskryminacja pośrednia)? - Jakich dwustronnych interakcji warto byłoby spróbować? - Jakie kroki weryfikacyjne powinienem wykonać, aby uniknąć nadmiernego dopasowania? Podejmowanie decyzji; Daj mi ramy do kontroli i dyskusji.

3) Kod kontrolny przeuczenia:

Napisz kod z komentarzem, który ocenia GLM z k-krotną walidacją krzyżową, używając Pythona + scikit-learn / statsmodels. Jako metrykę użyj odchylenia Poissona. Porównaj wyniki treningu i testu i wyjaśnij w komentarzu, jak odczytać znak nadmiernego dopasowania. Biblioteka jest fałszywa.

4) Dyskryminacja/badanie zmiennych zastępczych:

„Kod pocztowy” okazał się silną zmienną w moim modelu cenowym. Wyjaśnij ryzyko pośredniego przedstawienia zabronionej cechy (np. pochodzenia etnicznego, dochodu) jako zmiennej zastępczej. - Jaką analizę powinienem przeprowadzić, aby przetestować to ryzyko? - Jakie są alternatywy pozwalające zmniejszyć ryzyko? Udzielanie porad prawnych; nakreślić ramy techniczne i etyczne.

Słaba zachęta/silna zachęta

Słaba zachęta:

Ustal najlepszy model cenowy ubezpieczenia komunikacyjnego.

„Najlepszy” jest nieokreślony; Żadnych danych, żadnych ograniczeń, żadnych przepisów. AI daje ogólną, niemożliwą do zastosowania odpowiedź.

Potężny monit:

Twoja rola: asystent aktuariusza ds. cen. Kontekst: Buduję model częstotliwości gałęzi ruchu, GLM (Poisson, link do dziennika). Zmienne jakie mam to: grupa wiekowa, wiek pojazdu, region (województwo), roczny przebieg, przeznaczenie. Ograniczenie: płeć nie może być stosowana w przepisach; Muszę unikać dyskryminacji pośredniej. Zadanie: 1) Zaproponuj wstępną specyfikację modelu z tymi zmiennymi (łącznie z grupami odniesienia). 2) Podaj powody 2 interakcji, których powinienem spróbować. 3) Podaj listę kroków w celu sprawdzenia nadmiernego dopasowania. 4) Dodaj specjalną uwagę dotyczącą „regionu” pod kątem dyskryminacji pośredniej. Podejmę decyzję; Podajesz ramy i uzasadnienie.

trzy mini etui

Przypadek 1 – Wartość przejrzystości. Przedsiębiorstwo przedstawiło organowi regulacyjnemu bardzo dokładny model wyceny, który zbudował przy użyciu GBM, ale nie potrafiło wyjaśnić współczynników; zatwierdzenie opóźnione. Aktuariusz skonstruował GLM, który przechwycił te same sygnały; Dokładność spadła o 2 procent, ale ponieważ każdy czynnik mógł zostać uwzględniony, model został zweryfikowany w ciągu miesiąca. GBM został zachowany do celów rozpoznawczych, GLM stał się taryfowy. Firma YZ szybko stworzyła kod i opis regulatora, porównując wydajność obu modeli.

Przypadek 2 — Pułapka nadmiernego dopasowania. Pomocnik uzyskał doskonały wynik w zakresie danych szkoleniowych, gdy dodał do modelu ponad 40 zmiennych i liczne interakcje. Jednak po weryfikacji krzyżowej wynik testu się załamał: model zapamiętał szum. Wydajność w świecie rzeczywistym wzrosła, gdy liczba zmiennych została zmniejszona do 12 i uproszczona. Lekcja: spójrz na bezprecedensowy wynik danych, a nie wynik treningu.

Przypadek 3 – Dyskryminacja pośrednia. W jednym modelu zmienna „sąsiedztwa” silnie wyjaśniała składkę. Analiza wykazała, że ​​zmienna ta w dużym stopniu pokrywała się z koncentracją etniczną, czyli była wyznacznikiem cechy zabronionej. Aktuariusz zastąpił tę zmienną bardziej neutralnymi wskaźnikami ryzyka (rodzaj drogi, stan parkingu); zmniejszyło się zarówno ryzyko etyczne, jak i prawne. Sztuczna inteligencja stworzyła analizę korelacji mierzącą nakładanie się i sugestie alternatywnych zmiennych; Decyzję podjęły aktuariusze i dział ds. zgodności.

Typowe błędy

  • Uczynienie z niemożliwego do zinterpretowania modelu ostatecznej recepty. Cena, której nie da się wyjaśnić organowi regulacyjnemu, audytowi i klientowi, jest nie do utrzymania; Przejrzystość jest niezbędna.
  • Opierając się na wynikach edukacji. Nadmierne dopasowanie jest wykrywane tylko w niewidocznych danych (weryfikacja krzyżowa).
  • Używanie zabronionych/zastępczych zmiennych bez sprawdzania. Zmienne takie jak kod pocztowy i zawód mogą wiązać się z dyskryminacją pośrednią; Koniecznie przetestuj.
  • Mylenie premii za ryzyko z premią komercyjną. Sam koszt szkód nie jest ceną sprzedaży; dodaje się koszty, zysk i koszt kapitału.
  • Pozostawienie współczynnika na skali logarytmicznej i błędna jego interpretacja. Komentowanie bez konwersji na mnożnik za pomocą exp() spowoduje błąd.
Uwaga: zalecenie AI dotyczące modelu, który „zapewnia najlepszą dokładność” nie jest automatycznie modelem, który „należy zastosować”. Przejrzystość, uczciwość i zgodność z przepisami są kryteriami obowiązkowymi, podobnie jak dokładność cen aktuarialnych.

Podsumowując

Wycena to proces pomiaru ryzyka z uwzględnieniem czynników ryzyka i przekształcenia go w godziwą składkę. GLM to standard wyceny aktuarialnej z jego multiplikatywną i interpretowalną strukturą; Współczynniki są konwertowane na czynniki za pomocą exp(). Modele uczenia maszynowego, takie jak GBM, mogą być dokładniejsze, ale zmniejszają przejrzystość i są zwykle używane do wykrywania. Wybór zmiennej powinien być chroniony przed nadmiernym dopasowaniem poprzez weryfikację krzyżową, a dyskryminacja pośrednia (zmienna zastępcza) powinna być dokładnie kontrolowana. AI buduje model, pisze kod i wyjaśnia współczynnik; Jednak zgodność prawno-etyczna i ostateczna taryfa należą do aktuariusza i jednostki ds. zgodności.

Zadanie aplikacji

Wymień 5-6 czynników ryzyka dla głównej choroby. Poproś sztuczną inteligencję o (a) wstępną specyfikację GLM z tymi czynnikami, (b) 2 interakcje do wypróbowania i ich uzasadnienie, (c) przegląd zmiennych, które mogą być narażone na dyskryminację pośrednią. Następnie podaj przykład 3 współczynników log, poproś sztuczną inteligencję o przekształcenie go na współczynnik mnożnika za pomocą exp() i przeniesienie go na język biznesowy oraz zweryfikuj współczynniki ręcznie.

lista kontrolna

  • [ ] Czy mój model można zinterpretować; Czy mogę przełożyć wpływ każdego czynnika na język biznesowy?
  • [ ] Czy sprawdziłem, czy nie doszło do nadmiernego dopasowania poprzez weryfikację krzyżową?
  • [ ] Czy przeskanowałem pod kątem pośredniej dyskryminacji pod kątem zmiennych zabronionych i zastępczych?
  • [ ] Czy świadomie oddzieliłem premię za ryzyko od premii komercyjnej?
  • [ ] Czy zamieniłem współczynniki na mnożniki za pomocą exp() i poprawnie je zinterpretowałem?
  • [ ] Czy ostateczną decyzję taryfową podjąłem wspólnie z działem ds. legislacji i zgodności?