Прибыль:
- Способность создавать обобщенную линейную модель (GLM), концепции коэффициента риска, тарифа и премии за риск при поддержке искусственного интеллекта и переводить коэффициенты на деловой язык.
- Способность обсуждать баланс выбора переменных, взаимодействия, переобучения и интерпретируемости моделей машинного обучения (GBM) с искусственным интеллектом.
- Возможность понять, что модель ценообразования свободна от запрещенных/дискриминационных переменных, а соответствие окончательного тарифа законодательству и конкуренции остается на усмотрение актуария.
Цена страхового полиса определяется не случайно. Риск дорожно-транспортного происшествия для 22-летнего водителя с новыми правами, проживающего в большом городе, статистически выше, чем для 45-летнего водителя с 20-летним стажем; В справедливой системе премии также должны быть разными. Работа актуария по измерению этой разницы и отражению ее в цене называется ценообразованием и классификацией рисков. В этом разделе мы обсудим обобщенную линейную модель (GLM), актуарную основу ценообразования и ее альтернативы машинному обучению, а также посмотрим, как безопасно использовать ИИ в этом процессе.
Несколько основных терминов. Фактор риска – это переменная, которая влияет на риск и используется при ценообразовании (возраст, возраст транспортного средства, регион, предполагаемое использование). Тариф представляет собой свод правил, определяющих, как будет рассчитываться премия с учетом факторов риска. Премия за риск представляет собой чистую стоимость ожидаемых убытков; При сложении расходов, комиссий, размера прибыли и капитальных затрат формируется коммерческая премия (цена реализации). Напомним с самого начала: ИИ подсказывает переменные, строит модели, объясняет коэффициенты; Но какая переменная является юридической и этической, а также вопрос о том, соответствует ли окончательный тариф законодательству и конкуренции, зависит от актуария и подразделения по обеспечению соблюдения требований.
Почему GLM является стандартом актуарной деятельности
Наиболее часто используемый метод ценообразования – GLM. GLM означает «обобщенная линейная модель»: она расширяет классическую линейную регрессию, чтобы соответствовать ненормально распределенным целям, таким как данные о повреждениях. Он состоит из двух основных компонентов. Семейство распределения: Пуассон выбирается для частоты, гамма выбирается для интенсивности (логика в блоке 2). Функция связи (связь): обычно логарифмическая, что позволяет факторам оказывать мультипликативный эффект. Мультипликативная структура очень ценна в актуарной практике, поскольку именно так формируется тариф: базовая премия × коэффициент возраста × коэффициент региона × коэффициент транспортного средства.
Самым большим преимуществом GLM является интерпретируемость. Коэффициент прямо говорит вам: «группа молодых водителей увеличивает частоту в 1,6 раза по сравнению с контрольной группой». Эта прозрачность имеет решающее значение по трем причинам: (1) регулирующий орган и внутренний аудит могут понять и одобрить модель; (2) заметен запрещенный/дискриминационный эффект; (3) логику цен можно объяснить команде продаж и руководству. Более сложные модели машинного обучения (ниже) иногда дают более высокую точность, но за счет прозрачности.
Подсказка: коэффициент GLM имеет логарифмическую шкалу. Попросите ИИ преобразовать коэффициент в «множитель» с помощью exp(коэффициента); Гораздо проще было бы перевести на деловой язык (например, коэффициент 0,47 → фактор ≈ 1,60 → «на 60% рискованнее»).
Выбор переменных, переобучение и машинное обучение
Наиболее важным решением при ценообразовании является вопрос о том, какие переменные останутся в модели. Есть две ловушки. Немногие переменные ослепляют модель: если упустить важный фактор риска, цена будет неправильной. Слишком переменная/переобучение заставляет модель запоминать прошлые данные: модель принимает шум за сигнал и терпит неудачу при использовании новых политик. Баланс устанавливается посредством перекрестной проверки — разделения данных на обучающие и тестовые части и тестирования их на данных, которые модель не видит, простоты и актуарных рассуждений.
Важным является и взаимодействие: иногда совокупное воздействие двух факторов отличается от суммы их отдельных воздействий (молодой + спортивный автомобиль может оказаться более рискованным, чем сумма их индивидуальных воздействий). В GLM взаимодействия добавляются явно.
В последние годы в ценообразовании стали распространены такие модели, как GBM (машина повышения градиента — мощный метод машинного обучения, объединяющий множество небольших деревьев решений). Они автоматически фиксируют сложные закономерности и взаимодействия, часто давая более точные прогнозы, чем GLM. Но за это приходится платить: тенденция быть «черным ящиком». Сегодня общепринятой практикой является использование GBM для открытий и генерации идей и GLM для окончательного прозрачного тарифа; или интерпретировать результаты GBM с помощью инструментов объяснительности, таких как SHAP.
В следующей таблице сравниваются два подхода:
критерий
ГЛМ
ГБМ (машинное обучение)
Интерпретируемость
Высокий (коэффициент включен)
Низкий (требуется инструмент аннотаций)
Захват взаимодействия
Добавлено вручную
автоматический
Риск переобучения
низкий-средний
Высокий (требуется тщательная регулировка)
Одобрение регулирующего органа/аудита
легко
Сложно, требует дополнительной документации
Типичное использование
окончательный тариф
открытие, сравнение
Как использовать ИИ в ценообразовании
1) Перевод коэффициента GLM на деловой язык:
Настроил частоту GLM (Пуассон, ссылка на лог). Некоторые коэффициенты (логарифмическая шкала): age_group_18_25: 0,47; регион_большинство: 0,22; arac_yasi_10plus: -0,15. Преобразуйте каждый из них в множитель с помощью exp() и объясните это в одном предложении, понятном менеджеру. Также напомните, что такое референтная группа.
2) Обсуждение переменных/взаимодействий:
Ваша роль: помощник по ценообразованию. Мои кандидатские переменные для модели частоты движения: возраст, пол, регион, возраст транспортного средства, мощность двигателя, годовой километраж, профессия. - Какие переменные могут быть рискованными с нормативной/этической точки зрения (например, косвенная дискриминация)? - Какие двусторонние взаимодействия имеет смысл попробовать? - Какие шаги проверки мне следует выполнить, чтобы избежать переобучения? Принятие решений; Дайте мне основу для контроля и обсуждения.
3) Код управления переоснащением:
Напишите код с комментариями, который оценивает GLM с k-кратной перекрестной проверкой, используя Python + scikit-learn/statsmodels. Используйте отклонение Пуассона в качестве метрики. Сравните результаты обучения и тестов и объясните в комментариях, как читать знак переобучения. Библиотека фейковая.
4) Дискриминация/проверка суррогатных переменных:
«Почтовый индекс» оказался сильной переменной в моей модели ценообразования. Объясните риск того, что это косвенно представляет запрещенную характеристику (например, этническую принадлежность, доход) в качестве прокси-переменной. - Какой анализ мне следует сделать, чтобы проверить наличие этого риска? - Какие альтернативы существуют для снижения риска? Предоставление юридических консультаций; разработать техническую и этическую основу.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Установите лучшую ценовую модель страхования дорожного движения.
«Лучший» не определен; Никаких данных, никаких ограничений, никакого законодательства. ИИ дает общий, неприменимый ответ.
Мощная подсказка:
Ваша роль: помощник актуария по ценообразованию. Контекст: я создаю модель частоты ветвей трафика, GLM (Пуассон, ссылка на журнал). Переменные у меня есть: возрастная группа, возраст автомобиля, регион (провинция), годовой километраж, предполагаемое использование. Ограничение: гендер не может использоваться законодательством; Мне нужно избегать косвенной дискриминации. Задача: 1) Предложить первоначальную спецификацию модели с этими переменными (включая референтные группы). 2) Привести причины двух взаимодействий, которые мне следует попробовать. 3) Дать список шагов для проверки переобучения. 4) Добавить особое внимание к «региону» с точки зрения косвенной дискриминации. Я приму решение; Вы предоставляете основу и обоснование.
три мини-кейса
Случай 1 — Ценность прозрачности. Компания представила регулятору очень точную модель ценообразования, построенную с помощью GBM, но не смогла объяснить коэффициенты; одобрение задерживается. Актуарий построил GLM, который улавливал те же сигналы; Точность упала на 2 процента, но поскольку можно было учесть каждый фактор, модель была проверена в течение месяца. GBM был сохранен для разведки, GLM стал тарифным. YZ быстро подготовил код и описание регулятора, сравнивая производительность двух моделей.
Случай 2. Ловушка переобучения. Помощник получил высшую оценку на обучающих данных, когда добавил в модель более 40 переменных и множество взаимодействий. Но при перекрестной проверке результаты теста рухнули: модель запомнила шум. Реальная производительность увеличилась, когда количество переменных было уменьшено до 12 и упрощено. Урок: смотрите на беспрецедентный показатель данных, а не на результат обучения.
Случай 3 — Косвенная дискриминация. В одной модели переменная «соседство» четко объясняла премию. Анализ показал, что эта переменная во многом перекрывается с этнической концентрацией, т. е. является показателем запрещенной характеристики. Актуарий заменил эту переменную более нейтральными индикаторами риска (тип дороги, состояние парковки); как этические, так и юридические риски снизились. ИИ провел корреляционный анализ, измеряя перекрытие и предложив альтернативные переменные; Решение принял актуарий и отдел комплаенса.
Распространенные ошибки
- Создание неинтерпретируемой модели — лучший рецепт. Цена, которую невозможно объяснить регулирующему органу, аудитору и потребителю, является неустойчивой; Прозрачность имеет важное значение.
- Опираясь на баллы по образованию. Переобучение обнаруживается только в невидимых данных (перекрестная проверка).
- Использование запрещенных/суррогатных переменных без проверки. Такие переменные, как почтовый индекс и род занятий, могут нести косвенную дискриминацию; Обязательно проверьте это.
- Путаница премии за риск с коммерческой премией. Чистая стоимость ущерба сама по себе не является ценой продажи; добавляются расходы, прибыль и стоимость капитала.
- Оставить коэффициент в логарифмическом масштабе и неправильно его интерпретировать. Комментирование без преобразования его в коэффициент множителя с помощью exp() приведет к ошибке.
Внимание: рекомендация ИИ о модели, которая «даёт наибольшую точность», не является автоматически той моделью, которую «следует использовать». Прозрачность, справедливость и соблюдение законодательства являются обязательными критериями, а также точность актуарного ценообразования.
В итоге
Ценообразование — это процесс измерения риска с учетом факторов риска и преобразования его в справедливую премию. GLM — это стандарт актуарного ценообразования с его мультипликативной и интерпретируемой структурой; Коэффициенты преобразуются в факторы с помощью exp(). Модели машинного обучения, такие как GBM, могут быть более точными, но они снижают прозрачность и обычно используются для обнаружения. Выбор переменных должен быть защищен от переобучения путем перекрестной проверки, а косвенная дискриминация (суррогатная переменная) должна тщательно контролироваться. ИИ строит модель, пишет код и объясняет коэффициент; Но соблюдение правовых и этических норм и окончательный тариф относятся к актуарию и отделу обеспечения соответствия.
Задача приложения
Перечислите 5-6 факторов риска для основного заболевания. Попросите ИИ предоставить (а) первоначальную спецификацию GLM с этими факторами, (б) 2 взаимодействия и их обоснование, (в) проверку переменных, которые могут подвергаться риску косвенной дискриминации. Затем приведите пример 3-х лог-коэффициентов, попросите ИИ преобразовать его в коэффициент множителя с помощью exp() и передать на бизнес-язык, а затем проверить коэффициенты вручную.
контрольный список
- [ ] Можно ли интерпретировать мою модель; Могу ли я перевести влияние каждого фактора на деловой язык?
- [ ] Проверил ли я переобучение путем перекрестной проверки?
- [ ] Просканировал ли я косвенную дискриминацию запрещенных и прокси-переменных?
- [ ] Сознательно ли я отделил премию за риск от коммерческой премии?
- [ ] Преобразовал ли я коэффициенты в множители с помощью exp() и правильно ли их интерпретировал?
- [ ] Принял ли я окончательное решение по тарифам вместе с отделом по законодательству и соблюдению требований?