единици
1. Въведение в изкуствения интелект в актюерската наука: роли, граници, автентификация и поверителност 2. Моделиране на щети: Дискриминация по честота-сериозност и анализ, поддържан от изкуствен интелект 3. Резервен (провизионен) акаунт: Проверка с IBNR, верижна стълба и изкуствен интелект 4. Ценообразуване и класификация на риска: GLM, тарифиране и изкуствен интелект 5. Сметки за живот и пенсиониране: смъртност, рента и пасив 6. Подготовка на данни и проектиране на функции: работа с актюерски данни с изкуствен интелект 7. Анализ на сценария и стрес тестване: Управление на несигурността 8. Платежоспособност II, капиталова адекватност и валидиране на модела 9. Отчитане и комуникация: актюерски доклад, представяне на ръководството и регулаторен език 10. Етика, дискриминация, поверителност и професионална отговорност 11. Актюерски работен процес от край до край, интегриране на AI и надеждност за бъдещето
единица 6 / 11

Подготовка на данни и проектиране на функции: работа с актюерски данни с изкуствен интелект

Печалби:

  • Възможност за откриване на липсващи стойности, извънредни стойности, експозиция и проблеми с качеството на данните в правилата и повреждане на данни с поддръжка на изкуствен интелект и изготвяне на чернова на корекция
  • Инженеринг на функции (ново извличане на променливи, групиране, кодиране) и нормализиране на излагането на изкуствен интелект с правилния контекст
  • Разберете, че трансформациите на данни, предложени от изкуствения интелект, трябва да бъдат одитирани от актюер срещу риска от изтичане на данни и скрити пристрастия.

Най-малко обсъжданата, но отнемаща най-много време част от актюерската работа е подготовката на данни. Опитните актюери знаят, че по-голямата част от времето на проекта за моделиране се изразходва за почистване, комбиниране и коригиране на данните. Без значение колко елегантен е моделът, ако входните данни са повредени, изходът е повреден – накратко, „боклук вътре, боклук вън“. В този раздел ще видим типични проблеми с данните за политиката и искове, как да ги открием и поправим с AI и подхода за инженеринг на функции (извлечени нови променливи, които са по-информативни от съществуващите данни).

Предупреждение от самото начало: подготовката на данните е на пръв поглед техническа и невинна стъпка, но тук се крият най-опасните грешки. Неправилно нормализиране на експозицията, скрито изтичане на данни или несъзнателно въведено отклонение безшумно поврежда всички следващи модели. AI значително ускорява тази стъпка, но ако остане неконтролирана, тя също така увеличава риска.

Типични проблеми на актюерските данни

Данните за политики и искове почти никога не пристигат чисти. Най-честите проблеми са: Липсващи стойности: някои политики имат празни възраст, професия или регион на превозното средство. Сляпото попълване на тези със средната стойност може да създаде пристрастие; самият дефицит понякога носи информация (липсващите са друга група). Извънредности: нелогични записи като отрицателна премия, 200-годишна застраховка, полица с нулева експозиция. Трябва да се разграничи дали това са грешки в данните или реални крайни случаи. Несъответствие: различно изписване на един и същи регион („Истанбул“, „Истанбул“, „34“), объркване на формата на датата. Дублирани записи: въвеждане на едни и същи щети два пъти.

Но най-критичният проблем, специфичен за актюерството, е експозицията. Ако дадена полица започва в средата на годината, тя предоставя частична експозиция (например 0,5 години) за тази година, а не пълна „година на полица“. Честотата и нивата на увреждане трябва винаги да се нормализират спрямо експозицията; в противен случай краткосрочните политики изглеждат високорискови. AI може да кодира изчислението на експозицията, но вие трябва да предоставите дефиницията и бизнес правилото.

Следващата таблица обобщава типичните проблеми и правилния подход:

проблем

грешен подход

правилен подход

липсваща стойност

Напълнете всички със средно

Анализирайте дефицита; понякога отворете отделна категория

отклонение

Автоматично изтриване

Правете разлика между грешка в данните и реален потенциален клиент

експозиция

Пребройте всички полици за 1 година

Изчислете частична експозиция

Несъответствие на категорията

игнорирайте

Съвпадение със стандартния речник

повтарящи се щети

не забелязвайте

Дедупликация с ключови полета

Инженеринг на функции: извличане на знания от данни

Инженерингът на функции е изкуството да се извличат нови променливи, които са по-полезни за модела от съществуващи необработени променливи. Примери: „възраст“ от датата на раждане, „възрастова група“ (групиране) от възрастта, „рисков сегмент“ от модела марка на превозното средство, „приблизителна оценка на годишния пробег“ от комбинацията адрес-правила. Една добра характеристика носи по-силен сигнал от необработените данни и повишава както точността, така и интерпретируемостта на модела.

В актюерската работа често се използват три техники. Свързване: разделяне на непрекъсната променлива (възраст) на значими групи; това улавя нелинейни зависимости и прави тарифата четлива. Кодиране: конвертиране на категориални променливи (регион) в цифров формат, подходящ за модела; Базираното на риска кодиране (представляващо всяка категория със собствен процент на щети) е често срещано, но трябва да се прави с повишено внимание. Нормализация: правене на всичко сравнимо чрез разделянето му на неговата експозиция. AI бързо генерира кода за тези трансформации; Но трябва да одобрите логиката на всяка трансформация.

Съвет: Целевото кодиране е мощно, но предразположено към изтичане на данни: моделът „изневерява“, ако включите собствените щети на ред, когато изчислявате средните щети на категория. Винаги правете това в рамките на данните за обучение, в модел за кръстосано валидиране.

Най-коварната опасност: изтичане на данни и скрито пристрастие

Изтичането на данни е въвеждането на информация в модела, която всъщност не съществува към момента на прогнозиране. Класически пример: въвеждане на променлива, съдържаща резултата, като „изплатени искове“, в модел, който предвижда сумата на иска. Моделът изглежда перфектно в тестовите данни, но е безполезен в реалния свят, тъй като тази информация не е налична по време на прогнозирането. Изтичането често е скрито и се улавя само чрез внимателни актюерски разсъждения — AI обикновено не забелязва, понякога дори възхвалявайки изтичащата променлива като „много мощен предиктор“.

Втората коварна опасност е имплицитното пристрастие. Ако историческите данни несправедливо представляват конкретна група (например на дадена област в миналото са били отказвани твърде много политики), характеристиките, извлечени от тези данни, носят това отклонение и моделът го възпроизвежда в бъдещето. Фазата на проектиране на функции е най-критичният момент, когато това отклонение може да бъде разпознато и коригирано.

Внимание: Преди да се зарадвате, когато дадена променлива „подобрява значително предсказващата сила“, попитайте: тази променлива действително ли присъства по време на прогнозата или включва бъдещето? Резултат, който изглежда твърде добре, често е признак на изтичане.

Как да използваме AI при подготовката на данни

1) Проверка на качеството на данните:

Вашата роля: асистент за качеството на данните. Имате доходност по актюерска полица. Колони: policy_id, start_date, end_date,age, region, vehicle_age, premium, claim_count, claim_amount. Дайте ми контролен списък и скица на кода на Python (pandas): - Преброяване на липсващите стойности по колона. - Маркиране на неразумни стойности (отрицателна премия, възраст <16 или >100, край <начало). - Изчисляване на частична експозиция (в години) от начало/край.DO НЕ изтривайте; Просто докладвай, за да мога да реша.

2) Извеждане на характеристики:

Искам да извлека нови функции от моите данни за трафика. Налични: възраст, vehicle_age, регион, year_km, usage_type.- Кои възрастови и километрични групи (групиране) препоръчвате, защо?- Как мога да направя базирано на риска кодиране за „регион“ без изтичане на данни?- Предложете 3 нови функции, които си струва да опитате, и напишете актюерската обосновка за всяка. Аз ще реша.

3) Проверка на течове:

Моят модел прогнозира ВЪЗМОЖНОСТТА за повреда със следните променливи: възраст, регион, възраст на превозното средство, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Коя от тези променливи крие риск от изтичане на данни? За всеки преценете дали ще бъде наличен по време на прогнозата. Избройте подозрителните и защо.

4) Нормализация на експозицията:

Някои от полиците ми започват в средата на годината. Обяснете и кодирайте нормализацията на експозицията, за да изчислите правилно честотата: честота = общ_брой_за_искове / обща експозиция (година на политиката). Покажете с пример как се изчислява експозицията на полицата, която започва в средата на годината.

Слаба подкана / Силна подкана

Слаба подкана:

Почистете данните и ги подгответе за модела.

AI не знае коя колона коя е, бизнес правила, дефиниция на експозиция; Той може сляпо да изтрие и попълни и повреди данните.

Мощна подкана:

Вашата роля: асистент за подготовка на актюерски данни. Речник на данни: policy_id (идентификация), начална/крайна_дата (период на полицата), възраст (очаква се 16-90), премия (трябва да е >0), брой_на_искове (>=0), сума_на_иск (>=0).Задача:1) Напишете правило за разумност за всяка колона и ОТЧЕТЕТЕ нарушения (изтриване).2) Дайте код за изчисляване на частична експозиция.3) 3 различни стратегии за липсваща „възраст“ (изтриване). / средно / отделна категория) присъства с плюс-минус; Оставете решението на мен. 4) Предупреждавайте, ако има колона, която може да представлява риск от изтичане. Автоматично изтриване на всеки запис; Ще одобря всяко решение.

три мини калъфа

Случай 1 — Грешка на експозицията. В едно портфолио краткосрочните (3-месечни) полици за пътуване са отчетени като цели години, така че честотата изглежда четири пъти по-ниска, отколкото е била в действителност; Цената падна неправилно. Когато актюерът изчисли експозицията като дроб (0,25 полицева година), реалната честота беше разкрита и тарифата беше коригирана. AI генериран код за частична експозиция; Актюерът даде определението.

Случай 2 — Скрито изтичане. Когато помощник добави променливата „време за затваряне на файла“ към модела на вероятността от повреда, точността се увеличи драстично. Радостта беше краткотрайна: тази променлива можеше да бъде известна само след настъпване на щетите, което означава, че не е била налична по време на прогнозата. Когато изтичащата променлива беше премахната, моделът намаля до реалистично ниво. Той похвали променливата AI като „мощен предиктор“; Преценката на актюера улови капана.

Случай 3 — Възпроизвеждане на отклонение. Една компания извлече модел на „отхвърляне на приложение“ от исторически данни и го постави в новия модел. Анализът показа, че миналите откази са били непропорционално концентрирани в определен квартал, което означава, че е имало историческо пристрастие. Тази функция беше премахната от модела и заменена с по-неутрални рискови индикатори. AI направи анализа, измервайки припокриването на модела с квартала; Етичното решение е взето от актюера и отдела за съответствие.

Често срещани грешки

  • Попълване на липсващите стойности със средната без мислене. Самата липса може да бъде знание; Попълването му на сляпо създава предразсъдъци.
  • Автоматично изтриване на отклонения. Някои са истински крайни случаи; Изтриването на данни без отделянето им от грешки унищожава информацията.
  • Не се нормализира експозицията. Преброяването на късите полици като цели години изкривява честотата и изкривява цената.
  • Не забелязва изтичане на данни. Твърде добрият резултат често е знак за променлива, включваща бъдещето; Запитване дали всяка променлива присъства в момента на прогнозиране.
  • Внасяне на скрито пристрастие в бъдещето. Несправедливостта в историческите данни може да изтече в производни характеристики; Проверете го на етапа на функцията.

В обобщение

Актюерското моделиране до голяма степен е свързано с подготовка на данни; Ако входът е повреден, изходът също е повреден. Типичните проблеми са липсващи стойности, извънредни стойности, несъответствия и дублиране; Критичният актюерски проблем е нормализирането на експозицията. Инженерингът на функции - групиране, кодиране, нормализиране - извлича по-силни сигнали от данните. Най-коварните опасности са изтичането на данни и имплицитните пристрастия; и двете са обхванати само от актюерски разсъждения. AI значително ускорява тази стъпка: сканирането генерира код и препоръки. Но не изтривайте автоматично никакви записи, оставете хората да проверяват за течове и отклонения и одобряват всяко преобразуване.

Задача за приложение

Подгответе малък анонимен речник с данни за правилата (5-7 колони, разумен диапазон на всяка). Помолете AI за (a) правилото за разумност и кода на доклада за нарушение за всяка колона, (b) изчисляване на частична експозиция, (c) предложения за 3 нови функции, които да опитате. След това добавете умишлена променлива „улов на изтичане“ към списъка (напр. „платена компенсация“) и проверете дали AI го хваща като изтичане.

контролен списък

  • [ ] Анализирал ли съм защо, преди да изтрия липсващите и извънредните стойности?
  • [ ] Правилно ли съм разделил и нормализирал експозицията?
  • [ ] Написал ли съм актюерската обосновка за всяка новоизведена характеристика?
  • [ ] Питал ли съм дали всяка променлива действително присъства (изтичане) по време на прогнозата?
  • [ ] Сканирал ли съм за имплицитно отклонение в производните функции?
  • [ ] Не накарах ли AI автоматично да изтрие всички записи и да одобря сам всяко решение?