Единици
1. Вовед во вештачката интелигенција во актуарската наука: улоги, граници, автентикација и приватност 2. Моделирање на штета: Дискриминација на фреквенција и сериозност и анализа поддржана од вештачка интелигенција 3. Сметка на резерва (обезбедување): верификација со IBNR, Chain Ladder и вештачка интелигенција 4. Класификација на цени и ризик: GLM, тарифирање и вештачка интелигенција 5. Сметки за живот и пензионирање: смртност, ануитет и одговорност 6. Подготовка на податоци и инженерство на карактеристики: Ракување со актуарски податоци со вештачка интелигенција 7. Анализа на сценарија и тестирање на стрес: Управување со несигурноста 8. Солвентност II, Адекватност на капиталот и валидација на моделот 9. Известување и комуникација: актуарски извештај, презентација на менаџментот и регулаторен јазик 10. Етика, дискриминација, доверливост и професионална одговорност 11. Актуарски работен тек од крај до крај, интеграција со вештачка интелигенција и проверка на иднината
Единица 6 / 11

Подготовка на податоци и инженерство на карактеристики: Ракување со актуарски податоци со вештачка интелигенција

Добивки:

  • Способност да се детектираат вредностите што недостасуваат, оддалечените, изложеноста и проблемите со квалитетот на податоците во политиката и податоците за оштетување со поддршка за вештачка интелигенција и да се произведе нацрт за корекција
  • Инженеринг на карактеристики (нова деривација на променлива, групирање, кодирање) и нормализација на изложеноста на вештачка интелигенција со вистинскиот контекст
  • Разберете дека трансформациите на податоците предложени од вештачката интелигенција треба да бидат ревидирани од актуар против ризикот од истекување на податоци и скриена пристрасност.

Најмалку за кој се зборува, но најмногу време одзема дел од актуарската работа е подготовката на податоците. Искусните актуари знаат дека поголемиот дел од времето на проект за моделирање се троши на чистење, комбинирање и коригирање на податоците. Без разлика колку е елегантен моделот, ако влезните податоци се корумпирани, излезот е корумпиран - накратко, „ѓубре внатре, ѓубре надвор“. Во оваа единица, ќе видиме типични проблеми со податоците за политиките и побарувањата, како да ги откриеме и поправиме со ВИ и пристапот на инженерството на карактеристики (изведени нови променливи кои се поинформативни од постоечките податоци).

Предупредување од почеток: подготовката на податоците е навидум технички и невин чекор, но тука се кријат најопасните грешки. Неточната нормализација на изложеноста, скриеното истекување на податоци или несвесно воведената пристрасност тивко ги корумпира сите следни модели. ВИ во голема мера го забрзува овој чекор, но ако се остави неконтролирано, исто така го зголемува ризикот.

Типични проблеми на актуарските податоци

Податоците за политиката и побарувањата речиси никогаш не пристигнуваат чисти. Најчестите проблеми се: Недостасуваат вредности: некои полиси имаат празна старост, занимање или регион на возилото. Слепо пополнување на овие со просекот може да создаде пристрасност; самиот недостаток понекогаш носи информации (исчезнатите се друга група). Исклучително: нелогични записи како негативна премија, осигуреник стар 200 години, полиса за нулта изложеност. Мора да се разликува дали се работи за грешки во податоците или за вистински рабови. Неконзистентност: различни правописи од истиот регион („Истанбул“, „Истанбул“, „34“), конфузија на форматот на датумот. Дупликат записи: внесување на истата штета двапати.

Но, најкритичното прашање специфично за актуарската е изложеноста. Ако полисата започнува кон средината на годината, таа обезбедува фракционална изложеност (на пр. 0,5 години) за таа година, а не целосна „политичка година“. Фреквенцијата и стапките на оштетување секогаш треба да се нормализираат на изложеност; инаку краткорочните политики изгледаат со висок ризик. Вештачката интелигенција може да ја шифрира пресметката на изложеноста, но мора да ја дадете дефиницијата и деловното правило.

Следната табела ги сумира типичните проблеми и правилниот пристап:

проблем

погрешен пристап

правилен пристап

недостасува вредност

Пополнете ги сите со просек

Анализирајте го недостатокот; понекогаш отвора посебна категорија

надворешно

Автоматско бришење

Разграничување помеѓу грешка во податоците и вистински олово

изложеност

Сметајте ги сите полиси за 1 година

Пресметајте ја фракционата експозиција

Неконзистентност на категоријата

игнорирај

Поврзете се со стандарден речник

повторливи оштетувања

не забележувај

Дедупликат со клучни полиња

Инженеринг на карактеристики: изведување знаења од податоци

Инженерството на карактеристики е уметност на изведување нови променливи кои се покорисни за моделот од постоечките сурови променливи. Примери: „возраст“ од датумот на раѓање, „возрасна група“ (binning) од возраста, „ризичен сегмент“ од моделот на возилото, „проценка на годишна километража“ од комбинација на адреса-политика. Добрата карактеристика носи посилен сигнал од необработените податоци и ја зголемува точноста и интерпретабилноста на моделот.

Во актуарската работа често се користат три техники. Врзување: одвојување на континуирана променлива (возраст) во значајни групи; ова ги опфаќа нелинеарните односи и ја прави тарифата читлива. Кодирање: конвертирање на категорични променливи (регион) во нумерички формат погоден за моделот; Кодирањето засновано на ризик (што ја претставува секоја категорија со сопствена стапка на штета) е вообичаено, но треба да се прави со претпазливост. Нормализација: да се направи сè споредливо со тоа што ќе се подели со неговата изложеност. ВИ брзо го генерира кодот за овие трансформации; Но, мора да ја одобрите логиката на секоја трансформација.

Совет: Целното кодирање е моќно, но склоно кон протекување податоци: моделот „измамува“ ако ја вклучите сопствената штета на редот при пресметувањето на просечната штета на категоријата. Секогаш правете го ова во рамките на податоците за обуката, во шема на вкрстена валидација.

Најподмолна опасност: протекување податоци и имплицитна пристрасност

Протекување податоци е воведување на информации во моделот што всушност не постои во моментот на предвидување. Класичен пример: воведување на променлива која го содржи исходот, како што е „платени побарувања“, во модел кој го предвидува износот на побарувањето. Моделот изгледа совршено во податоците од тестот, но е бескорисен во реалниот свет, бидејќи тие информации не се достапни во моментот на предвидување. Истекувањето често се крие и се забележува само со внимателно актуарско расудување - вештачката интелигенција обично не забележува, понекогаш дури и ја пофалува променливата што протекува како „многу моќен предвидувач“.

Втората подмолна опасност е имплицитна пристрасност. Ако историските податоци неправедно претставуваат одредена група (на пример, на некоја област историски и биле одбиени премногу политики), карактеристиките што произлегуваат од тие податоци ја носат таа пристрасност и моделот ги реплицира во иднина. Фазата на инженерство на карактеристики е најкритичниот момент кога оваа пристрасност може да се препознае и коригира.

Внимание: Пред да се радувате кога променливата „извонредно ја подобрува моќта на предвидување“, прашајте: дали оваа променлива е всушност присутна во времето на предвидувањето или ја вклучува иднината? Резултатот што изгледа премногу добро често е знак за истекување.

Како да се користи вештачката интелигенција при подготовка на податоци

1) Проверка на квалитетот на податоците:

Вашата улога: асистент за квалитет на податоци. Имате принос од актуарска политика. Колони: id на политика, почеток_датум, крај_датум, возраст, регион, старост на возилото, премија, броење_побарувања, износ_побарувања. Дајте ми листа за проверка и скица на кодот на Python (пандите): - Брои ги вредностите што недостасуваат по колона. години) од почеток/крај. НЕ бришете; Само пријавете го за да можам да одлучам.

2) Изведување на карактеристики:

Сакам да извлечам нови функции од моите податоци за сообраќајот. Достапно: возраст, старост на возилото, регион, годишен_км, тип_употреба.- Кои старосни и км групи (поврзување) ги препорачувате, зошто?- Како можам да направам кодирање базирано на ризик за „регион“ без истекување на податоци?- Предложете 3 нови функции што вреди да се пробаат и напишете актуарско оправдување за секоја од нив. Јас ќе одлучам.

3) Инспекција на истекување:

Мојот модел ја предвидува МОЖНОСТА за оштетување со следните променливи: возраст, регион, старост на возилото, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Која од овие променливи претставува ризик од истекување на податоци? За секој, проценете дали ќе биде достапен во времето на предвидувањето. Наведете ги сомнителните и зошто.

4) Нормализација на изложеноста:

Некои од моите политики почнуваат од средината на годината. Објаснете и шифрирајте ја нормализацијата на изложеноста за правилно да ја пресметате фреквенцијата: фреквенција = вкупен број_побарувања / вкупна изложеност (полиса-година). Покажете со пример како се пресметува изложеноста на полисата што започнува во средината на годината.

Слаб промпт / Силен промпт

Слаба навестување:

Исчистете ги податоците и подгответе ги за моделот.

ВИ не знае која колона е која, деловни правила, дефиниција на изложеност; Може слепо да ги избрише и пополни и корумпира податоците.

Моќен потсетник:

Вашата улога: асистент за подготовка на актуарски податоци. Речник на податоци: политика_ид (идентитет), датум на почеток/крај (период на политика), возраст (се очекува 16-90), премија (мора да биде >0), број_побарувања (>=0), износ_побарувања (>=0). Задача:1) Напишете правило за разумност за секоја колона и ПРИЈАВИ прекршувања на разумност (прекршување на шифрата)2. изложување.3) 3 различни стратегии за промашување на „возраст“ (бришење). / просечна / посебна категорија) присутна со плус-минус; Оставете ја одлуката на мене.4) Предупреди ако има колона што може да претставува ризик од истекување.Автоматско бришење на кој било запис; Ќе ја одобрам секоја одлука.

три мини футроли

Случај 1 - Грешка при изложување. Во едно портфолио, краткорочните (3-месечни) полиси за патување беа пресметани како цели години, па фреквенцијата се појави четири пати помала отколку што всушност беше; Цената падна погрешно. Кога актуарот ја пресметал изложеноста како дропка (0,25 полиса-година), вистинската фреквенција беше откриена и тарифата беше корегирана. ВИ генерира фракционо код за експозиција; Актуарот ја даде дефиницијата.

Случај 2 - Латентно истекување. Кога помошникот ја додаде променливата „време на затворање на датотека“ на моделот на веројатност за оштетување, точноста драстично се зголеми. Радоста беше краткотрајна: оваа променлива можеше да се знае само откако ќе се случи штетата, што значи дека не беше достапна во времето на предвидувањето. Кога променливата што протекува беше отстранета, моделот се намали на реално ниво. Тој ја пофали променливата ВИ како „моќен предвидувач“; Пресудата на актуарот ја фати стапицата.

Случај 3 - Репликација на пристрасност. Една компанија извлече шема за „отфрлање апликација“ од историски податоци и ја стави во новиот модел. Анализата покажа дека минатите отфрлања биле несразмерно концентрирани во одреден кварт, што значи дека постоела историска пристрасност. Оваа карактеристика беше отстранета од моделот и заменета со понеутрални индикатори за ризик. ВИ ја произведе анализата мерејќи го преклопувањето на моделот со соседството; Етичката одлука ја донеле актуарот и единицата за усогласеност.

Вообичаени грешки

  • Пополнување на пропуштените вредности со средната вредност без размислување. Самиот недостаток може да биде знаење; Слепо пополнување создава предрасуди.
  • Автоматски бришете оддалечени. Некои се вистински рабови; Бришењето податоци без нивно одвојување од грешки ги уништува информациите.
  • Не нормализирање на изложеноста. Пребројувањето на кратки полиси како цели години ја нарушува фреквенцијата и ја нарушува цената.
  • Не забележувајќи истекување на податоци. Премногу добар резултат често е знак за променлива која ја вклучува иднината; Прашајте дали секоја променлива е присутна во времето на предвидувањето.
  • Внесување имплицитна пристрасност во иднината. Неправдата во историските податоци може да протече во изведени карактеристики; Проверете го во фаза на функција.

Сумирано

Актуарското моделирање во голема мера се однесува на подготовка на податоци; Ако влезот е корумпиран, излезот е исто така корумпиран. Типични проблеми се вредностите што недостасуваат, оддалеченоста, недоследностите и дуплирањето; Критичното актуарско прашање е нормализацијата на изложеноста. Инженерството на карактеристики - групирање, кодирање, нормализација - изведува посилни сигнали од податоците. Најподмолните опасности се истекување на податоци и имплицитна пристрасност; и двете се доловуваат само со актуарско расудување. ВИ во голема мера го забрзува овој чекор: скенирањето генерира код и препораки. Но, немојте автоматски да бришете никакви записи, оставете ги луѓето да проверат за протекување и пристрасност и да ја одобруваат секоја конверзија.

Задача за апликација

Подгответе мал анонимен речник со податоци за политиките (5-7 колони, разумен опсег од секоја). Побарајте од вештачката интелигенција (а) правилото за разумност и кодот за извештај за прекршување за секоја колона, (б) пресметување на фракционата изложеност, (в) предлози за 3 нови функции што треба да ги испробате. Потоа додадете намерна променлива „замка за истекување“ на списокот (на пр. „исплатена компензација“) и тестирајте дали вештачката интелигенција ја фаќа како протекување.

листа за проверка

  • [ ] Дали анализирав зошто пред да ги избришам исчезнатите и оддалечените?
  • [ ] Дали правилно ја фракционирав и нормализирав експозицијата?
  • [ ] Дали сум напишал актуарско оправдување за секоја новоизведена карактеристика?
  • [ ] Дали се прашував дали секоја променлива е навистина присутна (истекување) во времето на предвидувањето?
  • [ ] Дали скенирав за имплицитна пристрасност во изведените карактеристики?
  • [ ] Дали немав вештачка интелигенција автоматски да брише записи и сам да ја одобрив секоја одлука?