Прибыль:
- Способность обнаруживать пропущенные значения, выбросы, проблемы с уязвимостями и качеством данных в политике и повреждать данные с помощью искусственного интеллекта, а также создавать проект исправлений.
- Разработка функций (выведение новых переменных, группировка, кодирование) и нормализация воздействия искусственного интеллекта в правильном контексте.
- Поймите, что преобразования данных, предложенные искусственным интеллектом, должны проверяться актуарием на предмет риска утечки данных и скрытой предвзятости.
Меньше всего обсуждается, но наиболее трудоемкой частью актуарной работы является подготовка данных. Опытные актуарии знают, что большая часть времени проекта моделирования уходит на очистку, объединение и исправление данных. Независимо от того, насколько элегантна модель, если входные данные повреждены, выходные данные будут повреждены — короче говоря, «мусор на входе — мусор на выходе». В этом модуле мы увидим типичные проблемы с данными о политиках и претензиях, способы их обнаружения и устранения с помощью ИИ, а также подход к разработке функций (получение новых переменных, которые более информативны из существующих данных).
Предупреждение с самого начала: подготовка данных — казалось бы, технический и невинный шаг, но именно здесь скрываются самые опасные ошибки. Неправильная нормализация экспозиции, скрытая утечка данных или непреднамеренно внесенное смещение незаметно портят все последующие модели. ИИ значительно ускоряет этот шаг, но, если его оставить без контроля, он также увеличивает риск.
Типичные проблемы актуарных данных
Данные о политике и претензиях почти никогда не поступают чистыми. Наиболее распространенными проблемами являются: Отсутствующие значения: в некоторых политиках не указан возраст транспортного средства, род занятий или регион. Слепое заполнение этих значений средним значением может привести к предвзятости; сам недостаток иногда несет информацию (отсутствующие – это другая группа). Выбросы: нелогичные записи, такие как отрицательная премия, 200-летняя страховка, полис нулевого риска. Необходимо различать, являются ли это ошибками данных или реальными крайними случаями. Несоответствие: разное написание одного и того же региона («Стамбул», «Стамбул», «34»), путаница формата даты. Дубликаты записей: запись одного и того же повреждения дважды.
Но наиболее важной проблемой, специфичной для актуарной деятельности, является подверженность риску. Если действие полиса начинается в середине года, он обеспечивает частичный риск (например, 0,5 года) на этот год, а не полный «год действия политики». Частота и степень ущерба всегда должны быть нормированы в зависимости от воздействия; в противном случае краткосрочная политика будет представлять собой высокий риск. ИИ может запрограммировать расчет риска, но вы должны предоставить определение и бизнес-правило.
В следующей таблице приведены типичные проблемы и правильный подход:
проблема
неправильный подход
правильный подход
недостающее значение
Заполните все средним значением
Проанализировать недостаток; иногда открываю отдельную категорию
выброс
Автоматическое удаление
Различие между ошибкой данных и реальным преимуществом
воздействие
Посчитайте все полисы за 1 год
Рассчитать дробное воздействие
Несоответствие категорий
игнорировать
Сопоставить со стандартным словарем
повторяющийся ущерб
не замечаю
Дедупликация с ключевыми полями
Разработка функций: получение знаний из данных
Разработка функций — это искусство получения новых переменных, которые более полезны для модели, из существующих необработанных переменных. Примеры: «возраст» по дате рождения, «возрастная группа» (группировка) по возрасту, «сегмент риска» по марке транспортного средства, «оценка годового пробега» по комбинации адреса и политики. Хороший признак несет более сильный сигнал, чем необработанные данные, и повышает точность и интерпретируемость модели.
В актуарной работе часто используются три метода. Связывание: разделение непрерывной переменной (возраста) на значимые группы; это фиксирует нелинейные зависимости и делает тариф читабельным. Кодирование: преобразование категориальных переменных (региона) в числовой формат, подходящий для модели; Кодирование на основе рисков (представляющее каждую категорию со своим уровнем ущерба) является обычным явлением, но его следует выполнять с осторожностью. Нормализация: сделать все сопоставимым, разделив на экспозицию. ИИ быстро генерирует код для этих преобразований; Но вы должны утвердить логику каждого преобразования.
Совет: Целевое кодирование является мощным, но подвержено утечке данных: модель «обманывает», если вы включаете собственный урон строки при расчете среднего урона категории. Всегда делайте это с обучающими данными, используя шаблон перекрестной проверки.
Самая коварная опасность: утечки данных и неявная предвзятость
Утечка данных — это внедрение в модель информации, которой на самом деле не существует на момент прогнозирования. Классический пример: введение переменной, содержащей результат, например «выплаченные претензии», в модель, прогнозирующую сумму претензии. Модель выглядит идеально на тестовых данных, но бесполезна в реальном мире, поскольку эта информация недоступна на момент прогнозирования. Утечка часто скрыта и обнаруживается только путем тщательного актуарного рассуждения — ИИ обычно этого не замечает, иногда даже хваля утечку переменной как «очень мощный предсказатель».
Вторая коварная опасность – это неявная предвзятость. Если исторические данные несправедливо представляют определенную группу (например, в какой-то области исторически было отказано в слишком большом количестве полисов), характеристики, полученные на основе этих данных, несут эту предвзятость, и модель воспроизводит ее в будущем. Фаза разработки функций — наиболее критический момент, когда эту предвзятость можно распознать и исправить.
Предостережение: прежде чем радоваться, когда переменная «значительно улучшает предсказательную силу», спросите: действительно ли эта переменная присутствует во время предсказания или она затрагивает будущее? Слишком хороший результат часто является признаком утечки.
Как использовать ИИ при подготовке данных
1) Проверка качества данных:
Ваша роль: помощник по качеству данных. У вас есть доходность по актуарной политике. Столбцы: policy_id, start_date, end_date,age, Region, Vehicle_age, premium, претензия_count, претензия_сумма. Дайте мне контрольный список и эскиз кода Python (pandas): — Подсчитайте недостающие значения по столбцу. — Отметьте необоснованные значения (отрицательная премия, возраст <16 или> 100, конец <начало). — Рассчитайте дробное воздействие (в годах) от начала/конца. НЕ удаляйте; Просто сообщите об этом, чтобы я мог принять решение.
2) Вывод признаков:
Я хочу получить новые функции на основе данных о трафике. Доступно: возраст, транспортное средство_возраст, регион, годовой_км, тип использования.- Какие группы по возрасту и километрам (биннинг) вы рекомендуете, почему?- Как я могу выполнить кодирование на основе рисков для «региона» без утечки данных?- Предложите 3 новые функции, которые стоит попробовать, и напишите актуарное обоснование для каждой. Я решу.
3) Проверка утечек:
Моя модель прогнозирует ВОЗМОЖНОСТЬ ущерба с помощью следующих переменных: возраст, регион, транспортное средство_возраст, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Какие из этих переменных представляют риск утечки данных? Для каждого оцените, будет ли он доступен на момент предсказания. Перечислите подозрительные и почему.
4) Нормализация экспозиции:
Некоторые из моих полисов начинают действовать в середине года. Объясните и закодируйте нормализацию рисков, чтобы правильно рассчитать частоту: частота = общее количество претензий / общий риск (год действия политики). Покажите на примере, как рассчитать риск по полису, который начинается в середине года.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Очистите данные и подготовьте их для модели.
ИИ не знает, какой столбец какой, бизнес-правила, определение воздействия; Он может слепо удалять, заполнять и портить данные.
Мощная подсказка:
Ваша роль: помощник по подготовке актуарных данных. Словарь данных: policy_id (личность), start/end_date (период действия полиса), возраст (ожидаемый 16-90), страховая премия (должна быть >0), претензия_count (>=0), претензия_сумма (>=0). Задача: 1) Написать правило разумности для каждого столбца и ОТЧЕТАТЬ о нарушениях (удаление). 2) Предоставить код для расчета дробного риска. 3) 3 различных стратегии для отсутствующего «возраста» (удалить). /средняя/отдельная категория) присутствует плюс-минус; Оставьте решение мне. 4) Предупредить, если есть столбец, который может представлять опасность утечки. Автоматическое удаление любой записи; Я одобряю каждое решение.
три мини-кейса
Случай 1 — Ошибка экспозиции. В одном портфеле краткосрочные (3-месячные) полисы поездок учитывались как полные годы, поэтому частота поездок оказалась в четыре раза ниже, чем была на самом деле; Цена упала неправильно. Когда актуарий рассчитал размер риска как долю (0,25 полиса-года), была выявлена реальная частота и тариф был скорректирован. ИИ сгенерировал дробный код воздействия; Актуарий дал определение.
Случай 2 — Скрытая утечка. Когда помощник добавил в модель вероятности повреждения переменную «время закрытия файла», точность резко возросла. Радость была недолгой: эту переменную можно было узнать только после того, как произошел ущерб, то есть на момент прогнозирования она была недоступна. Когда вытекающая переменная была удалена, модель снизилась до реалистичного уровня. Он похвалил переменную ИИ как «мощный предсказатель»; Решение актуария попало в ловушку.
Случай 3 — Воспроизведение предвзятости. Одна компания вывела шаблон «отклонения заявки» на основе исторических данных и включила его в новую модель. Анализ показал, что прошлые отказы были непропорционально сконцентрированы в определенном районе, а это означает, что существовала историческая предвзятость. Эта функция была удалена из модели и заменена более нейтральными индикаторами риска. ИИ провел анализ, измеряя перекрытие паттерна с окрестностями; Этическое решение было принято актуарием и отделом обеспечения соответствия.
Распространенные ошибки
- Заполнение пропущенных значений средним не задумываясь. Сам недостаток может быть знанием; Заполнение его вслепую порождает предрассудки.
- Автоматически удалять выбросы. Некоторые из них являются настоящими крайними случаями; Удаление данных без отделения их от ошибок уничтожает информацию.
- Не нормализует экспозицию. Если считать короткие полисы полными годами, это искажает частоту и цену.
- Не замечая утечки данных. Слишком хороший результат часто является признаком переменной, затрагивающей будущее; Запросите, присутствует ли каждая переменная во время прогнозирования.
- Привнесение неявной предвзятости в будущее. Несправедливость исторических данных может просочиться в производные функции; Проверьте это на этапе функции.
В заключение
Актуарное моделирование в основном связано с подготовкой данных; Если входные данные повреждены, выходные данные также будут повреждены. Типичными проблемами являются пропущенные значения, выбросы, несоответствия и дублирование; Важнейшим актуарным вопросом является нормализация рисков. Разработка функций — группировка, кодирование, нормализация — позволяет получать более сильные сигналы из данных. Самыми коварными опасностями являются утечка данных и неявная предвзятость; оба охватываются только актуарными рассуждениями. ИИ значительно ускоряет этот шаг: при сканировании генерируется код и рекомендации. Но не удаляйте автоматически никакие записи, позвольте людям проверять утечки и предвзятость и одобрять каждое преобразование.
Задача приложения
Подготовьте небольшой анонимный словарь данных политики (5–7 столбцов, разумный диапазон каждого). Спросите у ИИ (а) правило разумности и код отчета о нарушении для каждого столбца, (б) расчет дробного воздействия, (в) предложения по 3 новым функциям, которые можно попробовать. Затем добавьте в список намеренную переменную «ловушки утечек» (например, «выплаченная компенсация») и проверьте, уловит ли ИИ ее как утечку.
контрольный список
- [ ] Проанализировал ли я причину, прежде чем удалять отсутствующие и выпадающие значения?
- [ ] Правильно ли я фракционировал и нормализовал экспозицию?
- [ ] Написал ли я актуарное обоснование для каждого вновь полученного признака?
- [ ] Задавался ли я вопросом, действительно ли каждая переменная присутствует (утечка) во время прогнозирования?
- [ ] Просканировал ли я неявное смещение в производных функциях?
- [ ] Разве у меня не было ИИ, который автоматически удалял все записи и сам одобрял каждое решение?