одиниці
1. Вступ до штучного інтелекту в актуарній науці: ролі, межі, автентифікація та конфіденційність 2. Моделювання пошкоджень: дискримінація за частотою та серйозністю та аналіз за допомогою штучного інтелекту 3. Обліковий запис резерву (забезпечення): перевірка за допомогою IBNR, ланцюгової драбини та штучного інтелекту 4. Ціноутворення та класифікація ризиків: GLM, тарифікація та штучний інтелект 5. Довічні та пенсійні рахунки: смертність, ануїтет і відповідальність 6. Підготовка даних та розробка функцій: обробка актуарних даних за допомогою штучного інтелекту 7. Аналіз сценаріїв і стрес-тестування: управління невизначеністю 8. Платоспроможність II, достатність капіталу та перевірка моделі 9. Звітність та комунікація: звіт актуарія, презентація керівництва та нормативна мова 10. Етика, дискримінація, конфіденційність і професійна відповідальність 11. Наскрізний актуарний робочий процес, інтеграція ШІ та перспективність
одиниця 6 / 11

Підготовка даних та розробка функцій: обробка актуарних даних за допомогою штучного інтелекту

Прибуток:

  • Можливість виявлення відсутніх значень, викидів, ризиків і проблем із якістю даних у політиці та пошкодження даних за допомогою штучного інтелекту та створення чернетки виправлення
  • Розробка функцій (виведення нових змінних, групування, кодування) і нормалізація впливу на штучний інтелект з правильним контекстом
  • Зрозумійте, що перетворення даних, запропоновані штучним інтелектом, повинні бути перевірені актуарієм на предмет ризику витоку даних і прихованих упереджень.

Найменш обговорювана, але найбільш трудомістка частина актуарної роботи – це підготовка даних. Досвідчені актуарії знають, що більшість часу проекту моделювання витрачається на очищення, комбінування та виправлення даних. Незалежно від того, наскільки елегантною є модель, якщо вхідні дані пошкоджені, вихідні дані будуть пошкодженими — коротше кажучи, «сміття входить, сміття виходить». У цьому розділі ми побачимо типові проблеми, пов’язані з політикою та даними претензій, як виявити та виправити їх за допомогою штучного інтелекту, а також підхід розробки функцій (отримання нових змінних, які є більш інформативними з наявних даних).

Попередження з самого початку: підготовка даних - це, здавалося б, технічний і невинний крок, але саме тут ховаються найнебезпечніші помилки. Неправильна нормалізація експозиції, прихований витік даних або ненавмисно внесене зміщення мовчки пошкоджує всі наступні моделі. ШІ значно прискорює цей крок, але якщо його залишити без контролю, він також збільшує ризик.

Типові проблеми актуарних даних

Дані політики та претензій майже ніколи не надходять чистими. Найпоширенішими проблемами є: Відсутні значення: у деяких полісах не вказано вік, професію чи регіон автомобіля. Сліпе заповнення їх середнім може створити упередженість; дефіцит сам по собі іноді несе інформацію (відсутні - це інша група). Викиди: нелогічні записи, такі як негативна премія, 200-річна страховка, поліс нульового ризику. Слід розрізняти, чи це помилки даних, чи реальні граничні випадки. Невідповідність: різні варіанти написання одного регіону («Стамбул», «Стамбул», «34»), плутанина формату дати. Подвійні записи: введення однієї і тієї ж шкоди двічі.

Але найбільш критичним питанням, характерним для актуаріїв, є ризик. Якщо поліс починається в середині року, він забезпечує частковий ризик (наприклад, 0,5 року) для цього року, а не повний «рік поліса». Частота та показники пошкодження завжди повинні бути нормалізовані відповідно до впливу; інакше короткострокові поліси здаються високим ризиком. ШІ може кодувати розрахунок впливу, але ви повинні надати визначення та бізнес-правило.

У наступній таблиці наведено типові проблеми та правильний підхід:

проблема

неправильний підхід

правильний підхід

відсутнє значення

Залити все середнім

Проаналізуйте недолік; іноді відкривають окрему категорію

викид

Автоматичне видалення

Розрізняйте помилку даних і справжній потенційний результат

експозиція

Підрахувати всі поліси за 1 рік

Розрахувати фракційну експозицію

Невідповідність категорії

ігнорувати

Відповідність зі стандартним словником

повторювані пошкодження

не помічають

Дедуплікати з ключовими полями

Розробка функцій: отримання знань із даних

Розробка функцій — це мистецтво отримання нових змінних, які є більш корисними для моделі, із існуючих необроблених змінних. Приклади: «вік» від дати народження, «вікова група» (групування) від віку, «сегмент ризику» від марки-моделі автомобіля, «орієнтовний річний пробіг» від комбінації адреси та політики. Хороша функція передає сильніший сигнал, ніж необроблені дані, і підвищує як точність, так і можливість інтерпретації моделі.

В актуарній роботі часто використовуються три техніки. Прив'язка: поділ безперервної змінної (віку) на значущі групи; це фіксує нелінійні залежності та робить тариф зрозумілим. Кодування: перетворення категоріальних змінних (області) у числовий формат, придатний для моделі; Кодування на основі ризику (що представляє кожну категорію з власним рівнем збитків) є поширеним, але його слід виконувати з обережністю. Нормалізація: роблячи все порівняльним шляхом розподілу на експозицію. AI швидко генерує код для цих перетворень; Але ви повинні затвердити логіку кожного перетворення.

Порада: цільове кодування є потужним, але схильне до витоку даних: модель «обманює», якщо ви включаєте власний збиток рядка під час обчислення середнього збитку категорії. Завжди робіть це в межах навчальних даних у шаблоні перехресної перевірки.

Найпідступніша небезпека: витік даних і неявне упередження

Витік даних — це введення в модель інформації, яка фактично не існує на момент прогнозування. Класичний приклад: введення змінної, що містить результат, наприклад «оплачених претензій», у модель, яка передбачає суму претензії. Модель виглядає ідеально в тестових даних, але марна в реальному світі, оскільки ця інформація недоступна на момент прогнозування. Витік часто прихований і виявляється лише завдяки ретельним актуарним міркуванням — ШІ зазвичай не помічає, іноді навіть вихваляючи змінну витоку як «дуже потужний провісник».

Другою підступною небезпекою є неявна упередженість. Якщо історичні дані несправедливо представляють певну групу (наприклад, у певній області раніше було відмовлено в застосуванні занадто багатьох політик), ознаки, отримані з цих даних, містять таке упередження, і модель відтворює його в майбутньому. Фаза розробки функцій є найбільш критичним моментом, коли цю упередженість можна розпізнати та виправити.

Застереження: перш ніж радіти, коли змінна «надзвичайно покращує передбачувальну силу», запитайте: чи ця змінна насправді присутня під час прогнозу, чи вона стосується майбутнього? Результат, який виглядає занадто добре, часто є ознакою витоку.

Як використовувати ШІ для підготовки даних

1) Перевірка якості даних:

Ваша роль: помічник з якості даних. Ви маєте прибутковість актуарної політики. Стовпці: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount. Дайте мені контрольний список і ескіз коду Python (pandas):- Підрахуйте відсутні значення за стовпцями.- Позначте необґрунтовані значення (негативна премія, вік <16 або >100, кінець<початок).- Обчисліть частковий ризик (у роках) від початку/кінця.DO НЕ видаляти; Просто повідомте про це, щоб я міг вирішити.

2) Виведення функції:

Я хочу отримати нові функції з даних про трафік. Доступно: age, vehicle_age, region, year_km, usage_type.– Які вікові групи та групи кілометрів (групування) ви рекомендуєте, чому?– Як я можу виконати кодування на основі ризиків для «регіону» без витоку даних?– Запропонуйте 3 нові функції, які варто спробувати, і напишіть актуарне обґрунтування для кожної. Я буду вирішувати.

3) Перевірка витоку:

Моя модель передбачає МОЖЛИВІСТЬ пошкодження за допомогою таких змінних: age, region, vehicle_age, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Які з цих змінних становлять ризик витоку даних? Для кожного оцініть, чи буде він доступний на момент передбачення. Перелічіть підозрілі та чому.

4) Нормалізація експозиції:

Деякі з моїх полісів починаються в середині року. Поясніть і закодуйте нормалізацію ризику, щоб правильно обчислити частоту: частота = загальна кількість_позовів / загальна сума ризику (рік страхування). Покажіть на прикладі, як розрахувати експозицію полісу, що починається в середині року.

Слабка підказка / Сильна підказка

Слабка підказка:

Очистіть дані та підготуйте їх до моделі.

ШІ не знає, який стовпець, бізнес-правила, визначення впливу; Він може сліпо видаляти, заповнювати та пошкоджувати дані.

Потужна підказка:

Ваша роль: помічник з підготовки актуарних даних. Словник даних: policy_id (ідентифікація), start/end_date (період дії полісу), age (очікуваний 16-90), премія (має бути >0), претензія_count (>=0), претензія_amount (>=0). Завдання: 1) Напишіть правило обґрунтованості для кожного стовпця та ПОВІДОМІТЬ про порушення (видалення). 2) Надайте код для розрахунку часткового ризику. 3) 3 різні стратегії для відсутнього «віку» (видалити). / середній / окрема категорія) подається з плюсом-мінусом; Залиште рішення мені. 4) Попереджайте, якщо є стовпець, який може становити ризик витоку. Автоматичне видалення будь-якого запису; Я буду схвалювати кожне рішення.

три міні-чохла

Випадок 1 — помилка експозиції. В одному портфоліо короткострокові (3-місячні) туристичні поліси враховувалися як повні роки, тому частота виявилася в чотири рази меншою, ніж була насправді; Ціна впала невірно. Коли актуарій розрахував ризик у вигляді частки (0,25 поліс-рік), було виявлено реальну частоту і тариф було скориговано. штучний інтелект згенерував код дробової експозиції; Актуарій дав визначення.

Випадок 2 — Прихований витік. Коли помічник додав змінну «час закриття файлу» до моделі ймовірності пошкодження, точність різко зросла. Радість була недовгою: цю змінну можна було знати лише після того, як сталося пошкодження, тобто вона була недоступна на момент прогнозування. Коли витік змінної було видалено, модель знизилася до реалістичного рівня. Він похвалив змінну AI як «потужний провісник»; Судження актуарія впіймали пастку.

Випадок 3 — Тиражування упередженості. Одна компанія вивела шаблон «відхилення заявки» з історичних даних і включила його в нову модель. Аналіз показав, що минулі відмови були непропорційно зосереджені в певному районі, тобто існувала історична упередженість. Цю функцію було видалено з моделі та замінено більш нейтральними показниками ризику. ШІ виконував аналіз, вимірюючи перекриття візерунка з околицями; Етичне рішення було прийнято актуарієм і відділом комплаєнсу.

Поширені помилки

  • Заповнення пропущених значень середнім без роздумів. Сам недолік може бути знанням; Заповнення наосліп створює упередження.
  • Автоматично видаляти викиди. Деякі з них є справжніми крайніми випадками; Видалення даних без відокремлення від помилок знищує інформацію.
  • Не нормалізує експозицію. Врахування коротких полісів як повних років спотворює частоту та спотворює ціну.
  • Не помічаючи витоку даних. Занадто хороший результат часто є ознакою змінної, що стосується майбутнього; Запитайте, чи присутня кожна змінна під час передбачення.
  • Внесення неявної упередженості в майбутнє. Несправедливість в історичних даних може просочитися в похідні функції; Перевірте це на етапі функції.

Підсумовуючи

Актуарне моделювання здебільшого стосується підготовки даних; Якщо вхідні дані пошкоджені, вихідні дані також пошкоджені. Типовими проблемами є відсутні значення, викиди, невідповідності та дублювання; Критичною актуарною проблемою є нормалізація ризику. Розробка функцій — групування, кодування, нормалізація — отримує сильніші сигнали з даних. Найбільш підступними небезпеками є витік даних і неявна упередженість; обидва охоплюються лише актуарними міркуваннями. AI значно прискорює цей крок: сканування генерує код і рекомендації. Але не видаляйте автоматично будь-які записи, дозвольте людям перевіряти наявність витоків і зміщень і затверджувати кожне перетворення.

Аплікаційне завдання

Підготуйте невеликий анонімний словник даних політики (5-7 колонок, розумний діапазон кожної). Попросіть штучного інтелекту надати (a) правило розумності та код звіту про порушення для кожного стовпця, (b) розрахунок часткового впливу, (c) пропозиції щодо 3 нових функцій, які варто спробувати. Потім додайте навмисну ​​змінну «пастки витоку» до списку (наприклад, «виплачена компенсація») і перевірте, чи AI уловлює це як витік.

контрольний список

  • [ ] Чи проаналізував я причину, перш ніж видаляти відсутні та викиди?
  • [ ] Чи правильно я розділив і нормалізував експозицію?
  • [ ] Чи я написав актуарне обґрунтування для кожної нововиведеної функції?
  • [ ] Чи сумнівався я, чи кожна змінна насправді присутня (витік) під час прогнозування?
  • [ ] Чи перевірив я неявну упередженість у похідних функціях?
  • [ ] Хіба штучний інтелект автоматично видаляв будь-які записи та самостійно схваляв кожне рішення?