Единицы
1. Введение в искусственный интеллект в актуарной науке: роли, границы, аутентификация и конфиденциальность 2. Моделирование повреждений: частотно-серьёзная дискриминация и анализ с поддержкой искусственного интеллекта 3. Резервный (обеспечительный) счет: проверка с помощью IBNR, цепной лестницы и искусственного интеллекта 4. Ценообразование и классификация рисков: GLM, тарификация и искусственный интеллект 5. Счета жизни и пенсионного обеспечения: смертность, аннуитет и ответственность 6. Подготовка данных и разработка функций: обработка актуарных данных с помощью искусственного интеллекта 7. Сценарный анализ и стресс-тестирование: управление неопределенностью 8. Платежеспособность II, достаточность капитала и проверка модели 9. Отчетность и коммуникация: отчет актуария, презентация руководства и нормативные языки 10. Этика, дискриминация, конфиденциальность и профессиональная ответственность 11. Комплексный актуарный рабочий процесс, интеграция искусственного интеллекта и готовность к будущему
Единица 4 / 11

Ценообразование и классификация рисков: GLM, тарификация и искусственный интеллект

Прибыль:

  • Способность создавать обобщенную линейную модель (GLM), концепции коэффициента риска, тарифа и премии за риск при поддержке искусственного интеллекта и переводить коэффициенты на деловой язык.
  • Способность обсуждать баланс выбора переменных, взаимодействия, переобучения и интерпретируемости моделей машинного обучения (GBM) с искусственным интеллектом.
  • Возможность понять, что модель ценообразования свободна от запрещенных/дискриминационных переменных, а соответствие окончательного тарифа законодательству и конкуренции остается на усмотрение актуария.

Цена страхового полиса определяется не случайно. Риск дорожно-транспортного происшествия для 22-летнего водителя с новыми правами, проживающего в большом городе, статистически выше, чем для 45-летнего водителя с 20-летним стажем; В справедливой системе премии также должны быть разными. Работа актуария по измерению этой разницы и отражению ее в цене называется ценообразованием и классификацией рисков. В этом разделе мы обсудим обобщенную линейную модель (GLM), актуарную основу ценообразования и ее альтернативы машинному обучению, а также посмотрим, как безопасно использовать ИИ в этом процессе.

Несколько основных терминов. Фактор риска – это переменная, которая влияет на риск и используется при ценообразовании (возраст, возраст транспортного средства, регион, предполагаемое использование). Тариф представляет собой свод правил, определяющих, как будет рассчитываться премия с учетом факторов риска. Премия за риск представляет собой чистую стоимость ожидаемых убытков; При сложении расходов, комиссий, размера прибыли и капитальных затрат формируется коммерческая премия (цена реализации). Напомним с самого начала: ИИ подсказывает переменные, строит модели, объясняет коэффициенты; Но какая переменная является юридической и этической, а также вопрос о том, соответствует ли окончательный тариф законодательству и конкуренции, зависит от актуария и подразделения по обеспечению соблюдения требований.

Почему GLM является стандартом актуарной деятельности

Наиболее часто используемый метод ценообразования – GLM. GLM означает «обобщенная линейная модель»: она расширяет классическую линейную регрессию, чтобы соответствовать ненормально распределенным целям, таким как данные о повреждениях. Он состоит из двух основных компонентов. Семейство распределения: Пуассон выбирается для частоты, гамма выбирается для интенсивности (логика в блоке 2). Функция связи (связь): обычно логарифмическая, что позволяет факторам оказывать мультипликативный эффект. Мультипликативная структура очень ценна в актуарной практике, поскольку именно так формируется тариф: базовая премия × коэффициент возраста × коэффициент региона × коэффициент транспортного средства.

Самым большим преимуществом GLM является интерпретируемость. Коэффициент прямо говорит вам: «группа молодых водителей увеличивает частоту в 1,6 раза по сравнению с контрольной группой». Эта прозрачность имеет решающее значение по трем причинам: (1) регулирующий орган и внутренний аудит могут понять и одобрить модель; (2) заметен запрещенный/дискриминационный эффект; (3) логику цен можно объяснить команде продаж и руководству. Более сложные модели машинного обучения (ниже) иногда дают более высокую точность, но за счет прозрачности.

Подсказка: коэффициент GLM имеет логарифмическую шкалу. Попросите ИИ преобразовать коэффициент в «множитель» с помощью exp(коэффициента); Гораздо проще было бы перевести на деловой язык (например, коэффициент 0,47 → фактор ≈ 1,60 → «на 60% рискованнее»).

Выбор переменных, переобучение и машинное обучение

Наиболее важным решением при ценообразовании является вопрос о том, какие переменные останутся в модели. Есть две ловушки. Немногие переменные ослепляют модель: если упустить важный фактор риска, цена будет неправильной. Слишком переменная/переобучение заставляет модель запоминать прошлые данные: модель принимает шум за сигнал и терпит неудачу при использовании новых политик. Баланс устанавливается посредством перекрестной проверки — разделения данных на обучающие и тестовые части и тестирования их на данных, которые модель не видит, простоты и актуарных рассуждений.

Важным является и взаимодействие: иногда совокупное воздействие двух факторов отличается от суммы их отдельных воздействий (молодой + спортивный автомобиль может оказаться более рискованным, чем сумма их индивидуальных воздействий). В GLM взаимодействия добавляются явно.

В последние годы в ценообразовании стали распространены такие модели, как GBM (машина повышения градиента — мощный метод машинного обучения, объединяющий множество небольших деревьев решений). Они автоматически фиксируют сложные закономерности и взаимодействия, часто давая более точные прогнозы, чем GLM. Но за это приходится платить: тенденция быть «черным ящиком». Сегодня общепринятой практикой является использование GBM для открытий и генерации идей и GLM для окончательного прозрачного тарифа; или интерпретировать результаты GBM с помощью инструментов объяснительности, таких как SHAP.

В следующей таблице сравниваются два подхода:

критерий

ГЛМ

ГБМ (машинное обучение)

Интерпретируемость

Высокий (коэффициент включен)

Низкий (требуется инструмент аннотаций)

Захват взаимодействия

Добавлено вручную

автоматический

Риск переобучения

низкий-средний

Высокий (требуется тщательная регулировка)

Одобрение регулирующего органа/аудита

легко

Сложно, требует дополнительной документации

Типичное использование

окончательный тариф

открытие, сравнение

Как использовать ИИ в ценообразовании

1) Перевод коэффициента GLM на деловой язык:

Настроил частоту GLM (Пуассон, ссылка на лог). Некоторые коэффициенты (логарифмическая шкала): age_group_18_25: 0,47; регион_большинство: 0,22; arac_yasi_10plus: -0,15. Преобразуйте каждый из них в множитель с помощью exp() и объясните это в одном предложении, понятном менеджеру. Также напомните, что такое референтная группа.

2) Обсуждение переменных/взаимодействий:

Ваша роль: помощник по ценообразованию. Мои кандидатские переменные для модели частоты движения: возраст, пол, регион, возраст транспортного средства, мощность двигателя, годовой километраж, профессия. - Какие переменные могут быть рискованными с нормативной/этической точки зрения (например, косвенная дискриминация)? - Какие двусторонние взаимодействия имеет смысл попробовать? - Какие шаги проверки мне следует выполнить, чтобы избежать переобучения? Принятие решений; Дайте мне основу для контроля и обсуждения.

3) Код управления переоснащением:

Напишите код с комментариями, который оценивает GLM с k-кратной перекрестной проверкой, используя Python + scikit-learn/statsmodels. Используйте отклонение Пуассона в качестве метрики. Сравните результаты обучения и тестов и объясните в комментариях, как читать знак переобучения. Библиотека фейковая.

4) Дискриминация/проверка суррогатных переменных:

«Почтовый индекс» оказался сильной переменной в моей модели ценообразования. Объясните риск того, что это косвенно представляет запрещенную характеристику (например, этническую принадлежность, доход) в качестве прокси-переменной. - Какой анализ мне следует сделать, чтобы проверить наличие этого риска? - Какие альтернативы существуют для снижения риска? Предоставление юридических консультаций; разработать техническую и этическую основу.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Установите лучшую ценовую модель страхования дорожного движения.

«Лучший» не определен; Никаких данных, никаких ограничений, никакого законодательства. ИИ дает общий, неприменимый ответ.

Мощная подсказка:

Ваша роль: помощник актуария по ценообразованию. Контекст: я создаю модель частоты ветвей трафика, GLM (Пуассон, ссылка на журнал). Переменные у меня есть: возрастная группа, возраст автомобиля, регион (провинция), годовой километраж, предполагаемое использование. Ограничение: гендер не может использоваться законодательством; Мне нужно избегать косвенной дискриминации. Задача: 1) Предложить первоначальную спецификацию модели с этими переменными (включая референтные группы). 2) Привести причины двух взаимодействий, которые мне следует попробовать. 3) Дать список шагов для проверки переобучения. 4) Добавить особое внимание к «региону» с точки зрения косвенной дискриминации. Я приму решение; Вы предоставляете основу и обоснование.

три мини-кейса

Случай 1 — Ценность прозрачности. Компания представила регулятору очень точную модель ценообразования, построенную с помощью GBM, но не смогла объяснить коэффициенты; одобрение задерживается. Актуарий построил GLM, который улавливал те же сигналы; Точность упала на 2 процента, но поскольку можно было учесть каждый фактор, модель была проверена в течение месяца. GBM был сохранен для разведки, GLM стал тарифным. YZ быстро подготовил код и описание регулятора, сравнивая производительность двух моделей.

Случай 2. Ловушка переобучения. Помощник получил высшую оценку на обучающих данных, когда добавил в модель более 40 переменных и множество взаимодействий. Но при перекрестной проверке результаты теста рухнули: модель запомнила шум. Реальная производительность увеличилась, когда количество переменных было уменьшено до 12 и упрощено. Урок: смотрите на беспрецедентный показатель данных, а не на результат обучения.

Случай 3 — Косвенная дискриминация. В одной модели переменная «соседство» четко объясняла премию. Анализ показал, что эта переменная во многом перекрывается с этнической концентрацией, т. е. является показателем запрещенной характеристики. Актуарий заменил эту переменную более нейтральными индикаторами риска (тип дороги, состояние парковки); как этические, так и юридические риски снизились. ИИ провел корреляционный анализ, измеряя перекрытие и предложив альтернативные переменные; Решение принял актуарий и отдел комплаенса.

Распространенные ошибки

  • Создание неинтерпретируемой модели — лучший рецепт. Цена, которую невозможно объяснить регулирующему органу, аудитору и потребителю, является неустойчивой; Прозрачность имеет важное значение.
  • Опираясь на баллы по образованию. Переобучение обнаруживается только в невидимых данных (перекрестная проверка).
  • Использование запрещенных/суррогатных переменных без проверки. Такие переменные, как почтовый индекс и род занятий, могут нести косвенную дискриминацию; Обязательно проверьте это.
  • Путаница премии за риск с коммерческой премией. Чистая стоимость ущерба сама по себе не является ценой продажи; добавляются расходы, прибыль и стоимость капитала.
  • Оставить коэффициент в логарифмическом масштабе и неправильно его интерпретировать. Комментирование без преобразования его в коэффициент множителя с помощью exp() приведет к ошибке.
Внимание: рекомендация ИИ о модели, которая «даёт наибольшую точность», не является автоматически той моделью, которую «следует использовать». Прозрачность, справедливость и соблюдение законодательства являются обязательными критериями, а также точность актуарного ценообразования.

В итоге

Ценообразование — это процесс измерения риска с учетом факторов риска и преобразования его в справедливую премию. GLM — это стандарт актуарного ценообразования с его мультипликативной и интерпретируемой структурой; Коэффициенты преобразуются в факторы с помощью exp(). Модели машинного обучения, такие как GBM, могут быть более точными, но они снижают прозрачность и обычно используются для обнаружения. Выбор переменных должен быть защищен от переобучения путем перекрестной проверки, а косвенная дискриминация (суррогатная переменная) должна тщательно контролироваться. ИИ строит модель, пишет код и объясняет коэффициент; Но соблюдение правовых и этических норм и окончательный тариф относятся к актуарию и отделу обеспечения соответствия.

Задача приложения

Перечислите 5-6 факторов риска для основного заболевания. Попросите ИИ предоставить (а) первоначальную спецификацию GLM с этими факторами, (б) 2 взаимодействия и их обоснование, (в) проверку переменных, которые могут подвергаться риску косвенной дискриминации. Затем приведите пример 3-х лог-коэффициентов, попросите ИИ преобразовать его в коэффициент множителя с помощью exp() и передать на бизнес-язык, а затем проверить коэффициенты вручную.

контрольный список

  • [ ] Можно ли интерпретировать мою модель; Могу ли я перевести влияние каждого фактора на деловой язык?
  • [ ] Проверил ли я переобучение путем перекрестной проверки?
  • [ ] Просканировал ли я косвенную дискриминацию запрещенных и прокси-переменных?
  • [ ] Сознательно ли я отделил премию за риск от коммерческой премии?
  • [ ] Преобразовал ли я коэффициенты в множители с помощью exp() и правильно ли их интерпретировал?
  • [ ] Принял ли я окончательное решение по тарифам вместе с отделом по законодательству и соблюдению требований?