Zyski:
- Możliwość ustalenia uogólnionego modelu liniowego (GLM), koncepcji czynników ryzyka, taryf i premii za ryzyko przy wsparciu sztucznej inteligencji oraz przełożenia współczynników na język biznesowy
- Umiejętność omówienia równowagi między wyborem zmiennych, interakcją, nadmiernym dopasowaniem i interpretowalnością modeli uczenia maszynowego (GBM) ze sztuczną inteligencją
- Zrozumienie, że model cenowy jest wolny od zabronionych/dyskryminujących zmiennych, a zgodność ostatecznej taryfy z przepisami prawa i konkurencją pozostaje w gestii aktuariusza.
Cena polisy ubezpieczeniowej nie jest ustalana losowo. Ryzyko wypadku drogowego dla 22-letniego, świeżo upieczonego kierowcy, mieszkającego w dużym mieście, jest statystycznie wyższe w porównaniu z 45-letnim kierowcą z 20-letnim stażem; W sprawiedliwym systemie składki też powinny być inne. Zadaniem aktuariusza jest zmierzenie tej różnicy i odzwierciedlenie jej w cenie, co nazywa się wyceną i klasyfikacją ryzyka. W tej części omówimy uogólniony model liniowy (GLM), aktuarialny szkielet wyceny i jego alternatywy w zakresie uczenia maszynowego, a także zobaczymy, jak bezpiecznie wykorzystywać sztuczną inteligencję w tym procesie.
Kilka podstawowych terminów. Czynnik ryzyka to zmienna wpływająca na ryzyko i wykorzystywana przy ustalaniu ceny (wiek, wiek pojazdu, region, przeznaczenie). Taryfa to zbiór zasad określających sposób naliczania składki w zależności od czynników ryzyka. Premia za ryzyko to czysty koszt oczekiwanej straty; Po dodaniu wydatków, prowizji, marży zysku i kosztów kapitałowych powstaje premia handlowa (cena sprzedaży). Przypomnijmy od początku: AI sugeruje zmienne, buduje modele, wyjaśnia współczynniki; Ale która zmienna jest legalna i etyczna oraz to, czy ostateczna taryfa jest zgodna z ustawodawstwem i konkurencją, należy do aktuariusza i jednostki ds. zgodności.
Dlaczego GLM jest standardem w aktuarialnym
Najczęściej stosowaną metodą ustalania cen jest GLM. GLM oznacza „uogólniony model liniowy”: rozszerza klasyczną regresję liniową, aby dopasować cele o rozkładzie normalnym, takie jak dane dotyczące uszkodzeń. Posiada dwa podstawowe elementy. Rodzina rozkładów: Poissona wybrano dla częstotliwości, gamma dla intensywności (logika w jednostce 2). Funkcja łączenia (link): zwykle logarytmiczna, co pozwala, aby czynniki miały efekt mnożnikowy. Struktura multiplikatywna jest bardzo cenna w aktuarialnym, ponieważ dokładnie w ten sposób ustalana jest taryfa: składka podstawowa × współczynnik wieku × współczynnik regionu × współczynnik pojazdu.
Największą zaletą GLM jest interpretowalność. Współczynnik mówi wprost: „grupa młodych kierowców zwiększa częstotliwość 1,6 razy w porównaniu z grupą odniesienia”. Ta przejrzystość jest kluczowa z trzech powodów: (1) organ regulacyjny i audyt wewnętrzny mogą zrozumieć i zatwierdzić model; (2) widoczny jest skutek zabroniony/dyskryminujący; (3) logikę cen można wyjaśnić zespołowi sprzedaży i kierownictwu. Bardziej złożone modele uczenia maszynowego (poniżej) czasami zapewniają większą dokładność, ale kosztem przejrzystości.
Wskazówka: współczynnik GLM jest w skali logarytmicznej. Poproś sztuczną inteligencję o przekształcenie współczynnika w „współczynnik mnożenia” za pomocą exp(współczynnik); Znacznie łatwiej byłoby to przełożyć na język biznesowy (np. współczynnik 0,47 → współczynnik ≈ 1,60 → „60% ryzykowne”).
Selekcja zmiennych, nadmierne dopasowanie i uczenie maszynowe
Najważniejszą decyzją dotyczącą wyceny jest to, które zmienne pozostaną w modelu. Są dwie pułapki. Niewiele zmiennych zaślepia model: jeśli pominięty zostanie ważny czynnik ryzyka, cena będzie błędna. Zbyt zmienna/nadmierne dopasowanie powoduje, że model zapamiętuje przeszłe dane: model myli szum z sygnałem i zawodzi w przypadku nowych zasad. Równowagę ustala się poprzez krzyżową walidację — podzielenie danych na część uczącą i testową oraz przetestowanie ich na danych, których model nie widzi, prostotę i rozumowanie aktuarialne.
Ważna jest także interakcja: czasami łączny wpływ dwóch czynników różni się od sumy ich odrębnych skutków (młody + sportowy pojazd może być bardziej ryzykowny niż suma ich indywidualnych skutków). W GLM interakcje są dodawane jawnie.
W ostatnich latach modele takie jak GBM (gradient boosting machine — potężna metoda uczenia maszynowego, która łączy wiele małych drzew decyzyjnych) stały się powszechne w ustalaniu cen. Automatycznie wychwytują one złożone wzorce i interakcje, często dając dokładniejsze prognozy niż GLM. Ma to jednak swoją cenę: tendencja do bycia „czarną skrzynką”. Obecnie powszechną praktyką jest wykorzystywanie GBM do odkrywania i generowania pomysłów oraz GLM do ustalania ostatecznej przejrzystej taryfy; lub interpretowanie wyników GBM za pomocą narzędzi wyjaśniających, takich jak SHAP.
Poniższa tabela porównuje oba podejścia:
kryterium
GLM
GBM (uczenie maszynowe)
Interpretowalność
Wysoki (współczynnik włączony)
Niski (wymaga narzędzia do adnotacji)
Przechwytywanie interakcji
Dodano ręcznie
automatyczne
Ryzyko nadmiernego dopasowania
nisko-średni
Wysoka (wymagana staranna regulacja)
Zatwierdzenie organu regulacyjnego/audytu
łatwe
Trudne, wymaga dodatkowej dokumentacji
Typowe użycie
taryfa ostateczna
odkrycie, porównanie
Jak wykorzystać sztuczną inteligencję w ustalaniu cen
1) Przekładając współczynnik GLM na język biznesowy:
Ustawiłem częstotliwość GLM (Poisson, link do dziennika). Niektóre współczynniki (skala logarytmiczna): grupa wiekowa_18_25: 0,47 ; większość_regionu: 0,22; arac_yasi_10plus: -0,15. Przekształć każdy z nich na mnożnik za pomocą exp() i wyjaśnij to jednym zdaniem zrozumiałym dla menedżera. Przypomnij także, czym jest grupa odniesienia.
2) Dyskusja na temat zmiennych/interakcji:
Twoja rola: asystent ds. cen. Moje zmienne kandydujące do modelu częstotliwości ruchu to: wiek, płeć, region, wiek pojazdu, moc silnika, roczny przebieg, zawód. - Które zmienne mogą być ryzykowne z punktu widzenia regulacyjnego/etycznego (np. dyskryminacja pośrednia)? - Jakich dwustronnych interakcji warto byłoby spróbować? - Jakie kroki weryfikacyjne powinienem wykonać, aby uniknąć nadmiernego dopasowania? Podejmowanie decyzji; Daj mi ramy do kontroli i dyskusji.
3) Kod kontrolny przeuczenia:
Napisz kod z komentarzem, który ocenia GLM z k-krotną walidacją krzyżową, używając Pythona + scikit-learn / statsmodels. Jako metrykę użyj odchylenia Poissona. Porównaj wyniki treningu i testu i wyjaśnij w komentarzu, jak odczytać znak nadmiernego dopasowania. Biblioteka jest fałszywa.
4) Dyskryminacja/badanie zmiennych zastępczych:
„Kod pocztowy” okazał się silną zmienną w moim modelu cenowym. Wyjaśnij ryzyko pośredniego przedstawienia zabronionej cechy (np. pochodzenia etnicznego, dochodu) jako zmiennej zastępczej. - Jaką analizę powinienem przeprowadzić, aby przetestować to ryzyko? - Jakie są alternatywy pozwalające zmniejszyć ryzyko? Udzielanie porad prawnych; nakreślić ramy techniczne i etyczne.
Słaba zachęta/silna zachęta
Słaba zachęta:
Ustal najlepszy model cenowy ubezpieczenia komunikacyjnego.
„Najlepszy” jest nieokreślony; Żadnych danych, żadnych ograniczeń, żadnych przepisów. AI daje ogólną, niemożliwą do zastosowania odpowiedź.
Potężny monit:
Twoja rola: asystent aktuariusza ds. cen. Kontekst: Buduję model częstotliwości gałęzi ruchu, GLM (Poisson, link do dziennika). Zmienne jakie mam to: grupa wiekowa, wiek pojazdu, region (województwo), roczny przebieg, przeznaczenie. Ograniczenie: płeć nie może być stosowana w przepisach; Muszę unikać dyskryminacji pośredniej. Zadanie: 1) Zaproponuj wstępną specyfikację modelu z tymi zmiennymi (łącznie z grupami odniesienia). 2) Podaj powody 2 interakcji, których powinienem spróbować. 3) Podaj listę kroków w celu sprawdzenia nadmiernego dopasowania. 4) Dodaj specjalną uwagę dotyczącą „regionu” pod kątem dyskryminacji pośredniej. Podejmę decyzję; Podajesz ramy i uzasadnienie.
trzy mini etui
Przypadek 1 – Wartość przejrzystości. Przedsiębiorstwo przedstawiło organowi regulacyjnemu bardzo dokładny model wyceny, który zbudował przy użyciu GBM, ale nie potrafiło wyjaśnić współczynników; zatwierdzenie opóźnione. Aktuariusz skonstruował GLM, który przechwycił te same sygnały; Dokładność spadła o 2 procent, ale ponieważ każdy czynnik mógł zostać uwzględniony, model został zweryfikowany w ciągu miesiąca. GBM został zachowany do celów rozpoznawczych, GLM stał się taryfowy. Firma YZ szybko stworzyła kod i opis regulatora, porównując wydajność obu modeli.
Przypadek 2 — Pułapka nadmiernego dopasowania. Pomocnik uzyskał doskonały wynik w zakresie danych szkoleniowych, gdy dodał do modelu ponad 40 zmiennych i liczne interakcje. Jednak po weryfikacji krzyżowej wynik testu się załamał: model zapamiętał szum. Wydajność w świecie rzeczywistym wzrosła, gdy liczba zmiennych została zmniejszona do 12 i uproszczona. Lekcja: spójrz na bezprecedensowy wynik danych, a nie wynik treningu.
Przypadek 3 – Dyskryminacja pośrednia. W jednym modelu zmienna „sąsiedztwa” silnie wyjaśniała składkę. Analiza wykazała, że zmienna ta w dużym stopniu pokrywała się z koncentracją etniczną, czyli była wyznacznikiem cechy zabronionej. Aktuariusz zastąpił tę zmienną bardziej neutralnymi wskaźnikami ryzyka (rodzaj drogi, stan parkingu); zmniejszyło się zarówno ryzyko etyczne, jak i prawne. Sztuczna inteligencja stworzyła analizę korelacji mierzącą nakładanie się i sugestie alternatywnych zmiennych; Decyzję podjęły aktuariusze i dział ds. zgodności.
Typowe błędy
- Uczynienie z niemożliwego do zinterpretowania modelu ostatecznej recepty. Cena, której nie da się wyjaśnić organowi regulacyjnemu, audytowi i klientowi, jest nie do utrzymania; Przejrzystość jest niezbędna.
- Opierając się na wynikach edukacji. Nadmierne dopasowanie jest wykrywane tylko w niewidocznych danych (weryfikacja krzyżowa).
- Używanie zabronionych/zastępczych zmiennych bez sprawdzania. Zmienne takie jak kod pocztowy i zawód mogą wiązać się z dyskryminacją pośrednią; Koniecznie przetestuj.
- Mylenie premii za ryzyko z premią komercyjną. Sam koszt szkód nie jest ceną sprzedaży; dodaje się koszty, zysk i koszt kapitału.
- Pozostawienie współczynnika na skali logarytmicznej i błędna jego interpretacja. Komentowanie bez konwersji na mnożnik za pomocą exp() spowoduje błąd.
Uwaga: zalecenie AI dotyczące modelu, który „zapewnia najlepszą dokładność” nie jest automatycznie modelem, który „należy zastosować”. Przejrzystość, uczciwość i zgodność z przepisami są kryteriami obowiązkowymi, podobnie jak dokładność cen aktuarialnych.
Podsumowując
Wycena to proces pomiaru ryzyka z uwzględnieniem czynników ryzyka i przekształcenia go w godziwą składkę. GLM to standard wyceny aktuarialnej z jego multiplikatywną i interpretowalną strukturą; Współczynniki są konwertowane na czynniki za pomocą exp(). Modele uczenia maszynowego, takie jak GBM, mogą być dokładniejsze, ale zmniejszają przejrzystość i są zwykle używane do wykrywania. Wybór zmiennej powinien być chroniony przed nadmiernym dopasowaniem poprzez weryfikację krzyżową, a dyskryminacja pośrednia (zmienna zastępcza) powinna być dokładnie kontrolowana. AI buduje model, pisze kod i wyjaśnia współczynnik; Jednak zgodność prawno-etyczna i ostateczna taryfa należą do aktuariusza i jednostki ds. zgodności.
Zadanie aplikacji
Wymień 5-6 czynników ryzyka dla głównej choroby. Poproś sztuczną inteligencję o (a) wstępną specyfikację GLM z tymi czynnikami, (b) 2 interakcje do wypróbowania i ich uzasadnienie, (c) przegląd zmiennych, które mogą być narażone na dyskryminację pośrednią. Następnie podaj przykład 3 współczynników log, poproś sztuczną inteligencję o przekształcenie go na współczynnik mnożnika za pomocą exp() i przeniesienie go na język biznesowy oraz zweryfikuj współczynniki ręcznie.
lista kontrolna
- [ ] Czy mój model można zinterpretować; Czy mogę przełożyć wpływ każdego czynnika na język biznesowy?
- [ ] Czy sprawdziłem, czy nie doszło do nadmiernego dopasowania poprzez weryfikację krzyżową?
- [ ] Czy przeskanowałem pod kątem pośredniej dyskryminacji pod kątem zmiennych zabronionych i zastępczych?
- [ ] Czy świadomie oddzieliłem premię za ryzyko od premii komercyjnej?
- [ ] Czy zamieniłem współczynniki na mnożniki za pomocą exp() i poprawnie je zinterpretowałem?
- [ ] Czy ostateczną decyzję taryfową podjąłem wspólnie z działem ds. legislacji i zgodności?