единици
1. Въведение в изкуствения интелект в актюерската наука: роли, граници, автентификация и поверителност 2. Моделиране на щети: Дискриминация по честота-сериозност и анализ, поддържан от изкуствен интелект 3. Резервен (провизионен) акаунт: Проверка с IBNR, верижна стълба и изкуствен интелект 4. Ценообразуване и класификация на риска: GLM, тарифиране и изкуствен интелект 5. Сметки за живот и пенсиониране: смъртност, рента и пасив 6. Подготовка на данни и проектиране на функции: работа с актюерски данни с изкуствен интелект 7. Анализ на сценария и стрес тестване: Управление на несигурността 8. Платежоспособност II, капиталова адекватност и валидиране на модела 9. Отчитане и комуникация: актюерски доклад, представяне на ръководството и регулаторен език 10. Етика, дискриминация, поверителност и професионална отговорност 11. Актюерски работен процес от край до край, интегриране на AI и надеждност за бъдещето
единица 4 / 11

Ценообразуване и класификация на риска: GLM, тарифиране и изкуствен интелект

Печалби:

  • Способност за установяване на концепции за генерализиран линеен модел (GLM), рисков фактор, тарифа и премия за риск с подкрепата на изкуствен интелект и превод на коефициентите на бизнес език
  • Възможност за обсъждане на баланса на избора на променливи, взаимодействието, пренастройването и интерпретируемостта на моделите за машинно обучение (GBM) с изкуствен интелект
  • Възможността да се разбере, че моделът на ценообразуване не съдържа забранени/дискриминационни променливи и съответствието на крайната тарифа със законодателството и конкуренцията е оставено на актюера.

Цената на застрахователната полица не се определя случайно. Рискът от пътнотранспортно произшествие за 22-годишен, току-що правоспособен водач, живеещ в голям град, е статистически по-висок от този на 45-годишен шофьор с 20 години стаж; В една справедлива система премиите също трябва да са различни. Работата на актюера да измерва тази разлика и да я отразява върху цената се нарича ценообразуване и класификация на риска. В тази част ще обсъдим генерализирания линеен модел (GLM), актюерската основа на ценообразуването и неговите алтернативи за машинно обучение и ще видим как безопасно да използваме AI в този процес.

Няколко основни термина. Рисковият фактор е променливата, която влияе върху риска и се използва при ценообразуването (възраст, възраст на превозното средство, регион, предназначение). Тарифата е набор от правила, които определят как ще се изчислява премията според рисковите фактори. Рисковата премия е чистата очаквана цена на загубата; Когато се добавят разходи, комисионни, маржове на печалба и капиталови разходи, се формира търговската премия (продажната цена). Нека напомним от самото начало: AI предлага променливи, изгражда модели, обяснява коефициенти; Но коя променлива е законна и етична и дали крайната тарифа е в съответствие със законодателството и конкуренцията принадлежи на актюера и звеното за съответствие.

Защо GLM е стандартът в актюерството

Най-използваният метод при ценообразуване е GLM. GLM означава „генерализиран линеен модел“: той разширява класическата линейна регресия, за да пасне на ненормално разпределени цели, като например данни за щети. Има два основни компонента. Семейство на разпределение: Поасон е избран за честота, гама е избрана за интензитет (логика в единица 2). Функция на връзката (връзка): обикновено логаритмична, което позволява факторите да имат мултипликативен ефект. Мултипликативната структура е много ценна в актюерството, защото точно така е създадена тарифата: базова премия × фактор възраст × фактор регион × фактор превозно средство.

Най-голямото предимство на GLM е интерпретируемостта. Коефициентът ви казва директно: „групата на младите шофьори увеличава честотата с 1,6 пъти в сравнение с референтната група“. Тази прозрачност е критична по три начина: (1) регулаторът и вътрешният одит могат да разберат и одобрят модела; (2) видим е забранен/дискриминационен ефект; (3) ценовата логика може да бъде обяснена на екипа по продажбите и управлението. По-сложните модели за машинно обучение (по-долу) понякога дават по-висока точност, но за сметка на прозрачността.

Съвет: GLM коефициентът е в логаритмична скала. Помолете AI ​​да преобразува коефициента в "коефициент на умножение" с exp(coefficient); Би било много по-лесно да се преведе на бизнес език (напр. коефициент 0,47 → фактор ≈ 1,60 → „60% по-рисково“).

Избор на променливи, пренастройване и машинно обучение

Най-критичното решение при ценообразуването е кои променливи ще останат в модела. Има два капана. Малко променливи заслепяват модела: ако се пропусне важният двигател на риска, цената ще бъде грешна. Твърде променливата/пренастройването кара модела да запаметява минали данни: моделът приема шума за сигнал и се проваля с новите политики. Балансът се установява чрез кръстосано валидиране — разделяне на данните на части за обучение и тестове и тестването им върху данни, които моделът не вижда, простота и актюерски аргументи.

Взаимодействието също е важно: понякога комбинираният ефект на два фактора се различава от сбора на отделните им ефекти (млад + спортен автомобил може да бъде по-рисков от сбора на техните отделни ефекти). В GLM взаимодействията се добавят изрично.

През последните години модели като GBM (машина за повишаване на градиента — мощен метод за машинно обучение, който съчетава много малки дървета на решения) станаха често срещани в ценообразуването. Те автоматично улавят сложни модели и взаимодействия, като често дават по-точни прогнози от GLM. Но това си има цена: тенденцията да бъдеш „черна кутия“. Обичайна практика днес е да се използва GBM за откриване и генериране на идеи и GLM за крайна прозрачна тарифа; или интерпретиране на GBM изхода с инструменти за обяснение като SHAP.

Следната таблица сравнява двата подхода:

критерий

GLM

GBM (машинно обучение)

Интерпретируемост

Висок (включен коефициент)

Ниско (изисква инструмент за анотация)

Улавяне на взаимодействие

Добавено ръчно

автоматичен

Риск от прекомерно оборудване

ниско-средно

Високо (изисква се внимателна настройка)

Одобрение от регулатор/одит

лесно

Трудно, изисква допълнителна документация

Типична употреба

окончателна тарифа

откритие, сравнение

Как да използваме AI в ценообразуването

1) Превеждане на GLM коефициента на бизнес език:

Настроих честота GLM (Poisson, лог връзка). Някои коефициенти (логаритмична скала): age_group_18_25: 0,47 ; регион_мнозинство: 0,22 ; arac_yasi_10plus: -0,15. Преобразувайте всеки един в коефициент на умножение с exp() и го обяснете с едно изречение, което мениджърът може да разбере. Напомнете също каква е референтната група.

2) Дискусия за променлива/взаимодействие:

Вашата роля: ценови асистент. Моите кандидат променливи за модела на честотата на трафика са: възраст, пол, регион, възраст на превозното средство, мощност на двигателя, годишни километри, професия. - Кои променливи може да са рискови от регулаторна/етична гледна точка (напр. непряка дискриминация)? - Кои двустранни взаимодействия има смисъл да опитате? - Какви стъпки за проверка трябва да следвам, за да избегна прекомерното оборудване? Вземане на решения; Дайте ми рамката за контрол и дискусия.

3) Контролен код за прекомерно оборудване:

Напишете коментиран код, който оценява GLM с k-кратно кръстосано валидиране, използвайки Python + scikit-learn / statsmodels. Използвайте отклонението на Поасон като показател. Сравнете резултатите от обучението и теста и обяснете в реда за коментари как да разчетете знака за прекомерно оборудване. Библиотеката е фалшива.

4) Скрининг на дискриминация/сурогатна променлива:

„Пощенският код“ се оказа силна променлива в моя модел на ценообразуване. Обяснете риска това косвено да представлява забранена характеристика (напр. етническа принадлежност, доход) като прокси променлива. - Какъв анализ трябва да направя, за да тествам за този риск? - Какви алтернативи има за намаляване на риска? Предоставяне на правни консултации; начертайте техническа и етична рамка.

Слаба подкана / Силна подкана

Слаба подкана:

Установете най-добрия модел на ценообразуване за застраховка на трафика.

„Най-добър“ е недефиниран; Няма данни, няма ограничения, няма законодателство. AI дава общ, неприложим отговор.

Мощна подкана:

Вашата роля: асистент на ценообразуващия актюер. Контекст: Изграждам честотен модел на клона на трафика, GLM (Poisson, лог връзка). Променливите, които имам: възрастова група, възраст на превозното средство, регион (провинция), годишни километри, предназначение. Ограничение: полът не може да се използва от законодателството; Трябва да избягвам непряка дискриминация. Задача: 1) Предложете първоначална спецификация на модела с тези променливи (включително референтни групи). 2) Посочете причини за 2 взаимодействия, които трябва да опитам. 3) Дайте списък със стъпки за проверка на прекомерното приспособяване. 4) Добавете специална бележка за „регион“ по отношение на непряка дискриминация. Аз ще взема решението; Вие предоставяте рамката и обосновката.

три мини калъфа

Случай 1 — Стойността на прозрачността. Една компания представи на регулатора много точен модел на ценообразуване, който е изградила с GBM, но не можа да обясни коефициентите; забавено одобрение. Актюерът конструира GLM, който улавя същите сигнали; Точността спадна с 2 процента, но тъй като всеки фактор можеше да бъде отчетен, моделът беше валидиран в рамките на един месец. GBM беше запазен за разузнаване, GLM стана тарифа. YZ бързо изготви кода и описанието на регулатора, сравнявайки производителността на двата модела.

Случай 2 — Капанът за прекомерно оборудване. Помощник получи перфектен резултат за данните за обучение, когато добави повече от 40 променливи и множество взаимодействия към модела. Но при кръстосано валидиране резултатът от теста се срина: моделът беше запомнил шума. Производителността в реалния свят се увеличи, когато броят на променливите беше намален до 12 и опростен. Урок: погледнете безпрецедентния резултат от данни, а не резултата от обучението.

Случай 3 — Непряка дискриминация. В един модел променливата "съседство" обяснява премията силно. Анализът показа, че тази променлива до голяма степен се припокрива с етническата концентрация, т.е. тя е заместител на забранена характеристика. Актюерът замени тази променлива с по-неутрални индикатори за риск (тип път, състояние на паркиране); както етичните, така и правните рискове са намалели. AI произвежда корелационен анализ, измерващ припокриването и алтернативни предложения за променливи; Звеното за актюерство и съответствие взе решение.

Често срещани грешки

  • Превръщане на неинтерпретируемия модел в най-добрата рецепта. Цена, която не може да бъде обяснена на регулатора, одита и клиента, е неустойчива; Прозрачността е от съществено значение.
  • Разчитайки на резултата от образованието. Пренастройването се открива само в невидяни данни (кръстосано валидиране).
  • Използване на забранени/сурогатни променливи без проверка. Променливи като пощенски код и професия могат да носят непряка дискриминация; Не пропускайте да го тествате.
  • Объркване на рисковата премия с търговската премия. Чистата цена на щетите сама по себе си не е продажната цена; добавят се разходи, печалба и цена на капитала.
  • Оставянето на коефициента в логаритмична скала и неправилното му тълкуване. Коментирането без преобразуването му в коефициент на умножение с exp() ще доведе до грешка.
Внимание: препоръката на AI за модела, който „дава най-добра точност“, не е автоматично моделът, който „трябва да се използва“. Прозрачността, справедливостта и съответствието със законодателството са задължителни критерии, както и точността на актюерското ценообразуване.

В обобщение

Ценообразуването е процес на измерване на риска с рискови фактори и превръщането му в справедлива премия. GLM е стандартът за актюерско ценообразуване със своята мултипликативна и интерпретируема структура; Коефициентите се преобразуват в фактори с exp(). Моделите за машинно обучение като GBM може да са по-точни, но намаляват прозрачността и обикновено се използват за откриване. Изборът на променливи трябва да бъде защитен от пренастройване чрез кръстосано валидиране, а непряката дискриминация (сурогатна променлива) трябва да бъде внимателно контролирана. AI изгражда модела, пише код и обяснява коефициента; Но правно-етичното съответствие и окончателната тарифа принадлежат на актюера и звеното за съответствие.

Задача за приложение

Избройте 5-6 рискови фактора за специалност. Помолете AI за (a) първоначална спецификация на GLM с тези фактори, (b) 2 взаимодействия, които да опитате и тяхната обосновка, (c) скрининг на променливи, които може да са изложени на риск от непряка дискриминация. След това дайте пример за 3 логаритмични коефициента, помолете AI да го преобразува в коефициент на умножение с exp() и да го прехвърли на бизнес езика, и ръчно проверете факторите.

контролен списък

  • [ ] Моят модел може ли да бъде интерпретиран; Мога ли да преведа влиянието на всеки фактор на бизнес език?
  • [ ] Проверил ли съм за прекомерно оборудване чрез кръстосано валидиране?
  • [ ] Сканирал ли съм за непряка дискриминация за забранени и прокси променливи?
  • [ ] Съзнателно ли съм разделил рисковата премия от търговската премия?
  • [ ] Преобразувах ли коефициентите в множители с exp() и правилно ли ги интерпретирах?
  • [ ] Взех ли окончателното тарифно решение заедно със законодателството и отдела за съответствие?