Печалби:
- Способност за установяване на концепции за генерализиран линеен модел (GLM), рисков фактор, тарифа и премия за риск с подкрепата на изкуствен интелект и превод на коефициентите на бизнес език
- Възможност за обсъждане на баланса на избора на променливи, взаимодействието, пренастройването и интерпретируемостта на моделите за машинно обучение (GBM) с изкуствен интелект
- Възможността да се разбере, че моделът на ценообразуване не съдържа забранени/дискриминационни променливи и съответствието на крайната тарифа със законодателството и конкуренцията е оставено на актюера.
Цената на застрахователната полица не се определя случайно. Рискът от пътнотранспортно произшествие за 22-годишен, току-що правоспособен водач, живеещ в голям град, е статистически по-висок от този на 45-годишен шофьор с 20 години стаж; В една справедлива система премиите също трябва да са различни. Работата на актюера да измерва тази разлика и да я отразява върху цената се нарича ценообразуване и класификация на риска. В тази част ще обсъдим генерализирания линеен модел (GLM), актюерската основа на ценообразуването и неговите алтернативи за машинно обучение и ще видим как безопасно да използваме AI в този процес.
Няколко основни термина. Рисковият фактор е променливата, която влияе върху риска и се използва при ценообразуването (възраст, възраст на превозното средство, регион, предназначение). Тарифата е набор от правила, които определят как ще се изчислява премията според рисковите фактори. Рисковата премия е чистата очаквана цена на загубата; Когато се добавят разходи, комисионни, маржове на печалба и капиталови разходи, се формира търговската премия (продажната цена). Нека напомним от самото начало: AI предлага променливи, изгражда модели, обяснява коефициенти; Но коя променлива е законна и етична и дали крайната тарифа е в съответствие със законодателството и конкуренцията принадлежи на актюера и звеното за съответствие.
Защо GLM е стандартът в актюерството
Най-използваният метод при ценообразуване е GLM. GLM означава „генерализиран линеен модел“: той разширява класическата линейна регресия, за да пасне на ненормално разпределени цели, като например данни за щети. Има два основни компонента. Семейство на разпределение: Поасон е избран за честота, гама е избрана за интензитет (логика в единица 2). Функция на връзката (връзка): обикновено логаритмична, което позволява факторите да имат мултипликативен ефект. Мултипликативната структура е много ценна в актюерството, защото точно така е създадена тарифата: базова премия × фактор възраст × фактор регион × фактор превозно средство.
Най-голямото предимство на GLM е интерпретируемостта. Коефициентът ви казва директно: „групата на младите шофьори увеличава честотата с 1,6 пъти в сравнение с референтната група“. Тази прозрачност е критична по три начина: (1) регулаторът и вътрешният одит могат да разберат и одобрят модела; (2) видим е забранен/дискриминационен ефект; (3) ценовата логика може да бъде обяснена на екипа по продажбите и управлението. По-сложните модели за машинно обучение (по-долу) понякога дават по-висока точност, но за сметка на прозрачността.
Съвет: GLM коефициентът е в логаритмична скала. Помолете AI да преобразува коефициента в "коефициент на умножение" с exp(coefficient); Би било много по-лесно да се преведе на бизнес език (напр. коефициент 0,47 → фактор ≈ 1,60 → „60% по-рисково“).
Избор на променливи, пренастройване и машинно обучение
Най-критичното решение при ценообразуването е кои променливи ще останат в модела. Има два капана. Малко променливи заслепяват модела: ако се пропусне важният двигател на риска, цената ще бъде грешна. Твърде променливата/пренастройването кара модела да запаметява минали данни: моделът приема шума за сигнал и се проваля с новите политики. Балансът се установява чрез кръстосано валидиране — разделяне на данните на части за обучение и тестове и тестването им върху данни, които моделът не вижда, простота и актюерски аргументи.
Взаимодействието също е важно: понякога комбинираният ефект на два фактора се различава от сбора на отделните им ефекти (млад + спортен автомобил може да бъде по-рисков от сбора на техните отделни ефекти). В GLM взаимодействията се добавят изрично.
През последните години модели като GBM (машина за повишаване на градиента — мощен метод за машинно обучение, който съчетава много малки дървета на решения) станаха често срещани в ценообразуването. Те автоматично улавят сложни модели и взаимодействия, като често дават по-точни прогнози от GLM. Но това си има цена: тенденцията да бъдеш „черна кутия“. Обичайна практика днес е да се използва GBM за откриване и генериране на идеи и GLM за крайна прозрачна тарифа; или интерпретиране на GBM изхода с инструменти за обяснение като SHAP.
Следната таблица сравнява двата подхода:
критерий
GLM
GBM (машинно обучение)
Интерпретируемост
Висок (включен коефициент)
Ниско (изисква инструмент за анотация)
Улавяне на взаимодействие
Добавено ръчно
автоматичен
Риск от прекомерно оборудване
ниско-средно
Високо (изисква се внимателна настройка)
Одобрение от регулатор/одит
лесно
Трудно, изисква допълнителна документация
Типична употреба
окончателна тарифа
откритие, сравнение
Как да използваме AI в ценообразуването
1) Превеждане на GLM коефициента на бизнес език:
Настроих честота GLM (Poisson, лог връзка). Някои коефициенти (логаритмична скала): age_group_18_25: 0,47 ; регион_мнозинство: 0,22 ; arac_yasi_10plus: -0,15. Преобразувайте всеки един в коефициент на умножение с exp() и го обяснете с едно изречение, което мениджърът може да разбере. Напомнете също каква е референтната група.
2) Дискусия за променлива/взаимодействие:
Вашата роля: ценови асистент. Моите кандидат променливи за модела на честотата на трафика са: възраст, пол, регион, възраст на превозното средство, мощност на двигателя, годишни километри, професия. - Кои променливи може да са рискови от регулаторна/етична гледна точка (напр. непряка дискриминация)? - Кои двустранни взаимодействия има смисъл да опитате? - Какви стъпки за проверка трябва да следвам, за да избегна прекомерното оборудване? Вземане на решения; Дайте ми рамката за контрол и дискусия.
3) Контролен код за прекомерно оборудване:
Напишете коментиран код, който оценява GLM с k-кратно кръстосано валидиране, използвайки Python + scikit-learn / statsmodels. Използвайте отклонението на Поасон като показател. Сравнете резултатите от обучението и теста и обяснете в реда за коментари как да разчетете знака за прекомерно оборудване. Библиотеката е фалшива.
4) Скрининг на дискриминация/сурогатна променлива:
„Пощенският код“ се оказа силна променлива в моя модел на ценообразуване. Обяснете риска това косвено да представлява забранена характеристика (напр. етническа принадлежност, доход) като прокси променлива. - Какъв анализ трябва да направя, за да тествам за този риск? - Какви алтернативи има за намаляване на риска? Предоставяне на правни консултации; начертайте техническа и етична рамка.
Слаба подкана / Силна подкана
Слаба подкана:
Установете най-добрия модел на ценообразуване за застраховка на трафика.
„Най-добър“ е недефиниран; Няма данни, няма ограничения, няма законодателство. AI дава общ, неприложим отговор.
Мощна подкана:
Вашата роля: асистент на ценообразуващия актюер. Контекст: Изграждам честотен модел на клона на трафика, GLM (Poisson, лог връзка). Променливите, които имам: възрастова група, възраст на превозното средство, регион (провинция), годишни километри, предназначение. Ограничение: полът не може да се използва от законодателството; Трябва да избягвам непряка дискриминация. Задача: 1) Предложете първоначална спецификация на модела с тези променливи (включително референтни групи). 2) Посочете причини за 2 взаимодействия, които трябва да опитам. 3) Дайте списък със стъпки за проверка на прекомерното приспособяване. 4) Добавете специална бележка за „регион“ по отношение на непряка дискриминация. Аз ще взема решението; Вие предоставяте рамката и обосновката.
три мини калъфа
Случай 1 — Стойността на прозрачността. Една компания представи на регулатора много точен модел на ценообразуване, който е изградила с GBM, но не можа да обясни коефициентите; забавено одобрение. Актюерът конструира GLM, който улавя същите сигнали; Точността спадна с 2 процента, но тъй като всеки фактор можеше да бъде отчетен, моделът беше валидиран в рамките на един месец. GBM беше запазен за разузнаване, GLM стана тарифа. YZ бързо изготви кода и описанието на регулатора, сравнявайки производителността на двата модела.
Случай 2 — Капанът за прекомерно оборудване. Помощник получи перфектен резултат за данните за обучение, когато добави повече от 40 променливи и множество взаимодействия към модела. Но при кръстосано валидиране резултатът от теста се срина: моделът беше запомнил шума. Производителността в реалния свят се увеличи, когато броят на променливите беше намален до 12 и опростен. Урок: погледнете безпрецедентния резултат от данни, а не резултата от обучението.
Случай 3 — Непряка дискриминация. В един модел променливата "съседство" обяснява премията силно. Анализът показа, че тази променлива до голяма степен се припокрива с етническата концентрация, т.е. тя е заместител на забранена характеристика. Актюерът замени тази променлива с по-неутрални индикатори за риск (тип път, състояние на паркиране); както етичните, така и правните рискове са намалели. AI произвежда корелационен анализ, измерващ припокриването и алтернативни предложения за променливи; Звеното за актюерство и съответствие взе решение.
Често срещани грешки
- Превръщане на неинтерпретируемия модел в най-добрата рецепта. Цена, която не може да бъде обяснена на регулатора, одита и клиента, е неустойчива; Прозрачността е от съществено значение.
- Разчитайки на резултата от образованието. Пренастройването се открива само в невидяни данни (кръстосано валидиране).
- Използване на забранени/сурогатни променливи без проверка. Променливи като пощенски код и професия могат да носят непряка дискриминация; Не пропускайте да го тествате.
- Объркване на рисковата премия с търговската премия. Чистата цена на щетите сама по себе си не е продажната цена; добавят се разходи, печалба и цена на капитала.
- Оставянето на коефициента в логаритмична скала и неправилното му тълкуване. Коментирането без преобразуването му в коефициент на умножение с exp() ще доведе до грешка.
Внимание: препоръката на AI за модела, който „дава най-добра точност“, не е автоматично моделът, който „трябва да се използва“. Прозрачността, справедливостта и съответствието със законодателството са задължителни критерии, както и точността на актюерското ценообразуване.
В обобщение
Ценообразуването е процес на измерване на риска с рискови фактори и превръщането му в справедлива премия. GLM е стандартът за актюерско ценообразуване със своята мултипликативна и интерпретируема структура; Коефициентите се преобразуват в фактори с exp(). Моделите за машинно обучение като GBM може да са по-точни, но намаляват прозрачността и обикновено се използват за откриване. Изборът на променливи трябва да бъде защитен от пренастройване чрез кръстосано валидиране, а непряката дискриминация (сурогатна променлива) трябва да бъде внимателно контролирана. AI изгражда модела, пише код и обяснява коефициента; Но правно-етичното съответствие и окончателната тарифа принадлежат на актюера и звеното за съответствие.
Задача за приложение
Избройте 5-6 рискови фактора за специалност. Помолете AI за (a) първоначална спецификация на GLM с тези фактори, (b) 2 взаимодействия, които да опитате и тяхната обосновка, (c) скрининг на променливи, които може да са изложени на риск от непряка дискриминация. След това дайте пример за 3 логаритмични коефициента, помолете AI да го преобразува в коефициент на умножение с exp() и да го прехвърли на бизнес езика, и ръчно проверете факторите.
контролен списък
- [ ] Моят модел може ли да бъде интерпретиран; Мога ли да преведа влиянието на всеки фактор на бизнес език?
- [ ] Проверил ли съм за прекомерно оборудване чрез кръстосано валидиране?
- [ ] Сканирал ли съм за непряка дискриминация за забранени и прокси променливи?
- [ ] Съзнателно ли съм разделил рисковата премия от търговската премия?
- [ ] Преобразувах ли коефициентите в множители с exp() и правилно ли ги интерпретирах?
- [ ] Взех ли окончателното тарифно решение заедно със законодателството и отдела за съответствие?