Birlik 6 / 11

Ma'lumotlarni tayyorlash va xususiyat muhandisligi: Sun'iy intellekt yordamida aktuar ma'lumotlar bilan ishlash

Daromadlar:

  • Sun'iy intellekt yordamida siyosatdagi etishmayotgan qiymatlar, chegaralar, ta'sir qilish va ma'lumotlar sifati muammolarini aniqlash va sun'iy intellekt yordamida ma'lumotlarga zarar yetkazish va tuzatish loyihasini yaratish qobiliyati
  • Xususiyat muhandisligi (yangi o'zgaruvchilarni olish, guruhlash, kodlash) va to'g'ri kontekst bilan sun'iy intellektga ta'sir qilishni normallashtirish
  • Sun'iy intellekt tomonidan taklif qilingan ma'lumotlarni o'zgartirish aktuariy tomonidan ma'lumotlarning sizib chiqishi va yashirin tarafkashlik xavfiga qarshi tekshirilishi kerakligini tushuning.

Aktuar ishining eng kam gapiriladigan, lekin ko'p vaqt talab qiladigan qismi ma'lumotlarni tayyorlashdir. Tajribali aktuarlar, modellashtirish loyihasining ko'p vaqtini ma'lumotlarni tozalash, birlashtirish va tuzatishga sarflashini biladilar. Model qanchalik oqlangan bo'lishidan qat'i nazar, agar kirish ma'lumotlari buzilgan bo'lsa, chiqish buziladi - qisqasi, "axlat ichkarida, axlat tashqarida". Ushbu bo'limda biz siyosat va da'vo ma'lumotlarining odatiy muammolarini, ularni AI yordamida qanday aniqlash va tuzatishni va xususiyat muhandisligi (mavjud ma'lumotlardan ko'proq ma'lumot beruvchi yangi o'zgaruvchilarni olish) yondashuvini ko'rib chiqamiz.

Boshidan ogohlantirish: ma'lumotlarni tayyorlash texnik va begunoh ko'rinadigan qadamdir, ammo bu erda eng xavfli xatolar yashiringan. Noto'g'ri ta'sir qilishni normallashtirish, yashirin ma'lumotlarning sizib chiqishi yoki beixtiyor kiritilgan noto'g'ri yondashuv keyingi barcha modellarni jimgina buzadi. AI bu qadamni sezilarli darajada tezlashtiradi, ammo nazoratsiz qolsa, u ham xavfni oshiradi.

Aktuar ma'lumotlarning tipik muammolari

Siyosat va daʼvo maʼlumotlari deyarli hech qachon toza kelmaydi. Eng keng tarqalgan muammolar quyidagilardir: etishmayotgan qiymatlar: ba'zi siyosatlarda avtomobil yoshi, kasbi yoki mintaqasi bo'sh. Bularni ko'r-ko'rona o'rtacha bilan to'ldirish noto'g'rilikni keltirib chiqarishi mumkin; kamchilikning o'zi ba'zan ma'lumotni olib yuradi (etishmayotganlar boshqa guruhdir). Chiqib ketishlar: mantiqiy bo'lmagan yozuvlar, masalan, salbiy mukofot, 200 yillik sug'urtalangan, nol ta'sir qilish siyosati. Bu ma'lumotlar xatosi yoki haqiqiy chekka holatlarmi farqlanishi kerak. Mos kelmaslik: bir mintaqaning turli xil imlolari ("Istanbul", "Istanbul", "34"), sana formati chalkashligi. Ikki nusxadagi yozuvlar: bir xil zararni ikki marta kiritish.

Ammo aktuarga xos bo'lgan eng muhim masala bu ta'sir qilishdir. Agar siyosat yil o'rtalarida boshlangan bo'lsa, u o'sha yil uchun to'liq "siyosat yili" emas, balki qisman ta'sirni (masalan, 0,5 yil) beradi. Chastota va zarar stavkalari har doim ta'sir qilish uchun normallashtirilishi kerak; aks holda qisqa muddatli siyosatlar yuqori xavf tug'diradi. AI EHM hisobini kodlashi mumkin, ammo siz ta'rif va biznes qoidasini taqdim etishingiz kerak.

Quyidagi jadval odatiy muammolar va to'g'ri yondashuvni umumlashtiradi:

muammo

noto'g'ri yondashuv

to'g'ri yondashuv

etishmayotgan qiymat

Hammasini o'rtacha bilan to'ldiring

Kamchilikni tahlil qilish; ba'zan alohida toifani ochadi

chegaradan tashqari

Avtomatik o'chirish

Ma'lumotlar xatosi va haqiqiy etakchi o'rtasidagi farq

ta'sir qilish

1 yil uchun barcha siyosatlarni hisoblang

Fraksiyonel ekspozitsiyani hisoblang

Kategoriyalarning nomuvofiqligi

e'tibor bermaslik

Standart lug'at bilan mos

takroriy zarar

sezma

Kalit maydonlar bilan ikki nusxada

Xususiyat muhandisligi: ma'lumotlardan bilim olish

Xususiyat muhandisligi - bu mavjud xom o'zgaruvchilardan model uchun foydaliroq bo'lgan yangi o'zgaruvchilarni olish san'ati. Misollar: "yosh" tug'ilgan kundan boshlab, "yosh guruhi" (binning) yoshdan, "xavf segmenti" avtomobil modelidan, "yillik kilometr smetasi" manzil va siyosat kombinatsiyasidan. Yaxshi xususiyat xom ma'lumotlarga qaraganda kuchliroq signalga ega va modelning aniqligi va talqin qilinishini oshiradi.

Ko'pincha aktuar ishda uchta usul qo'llaniladi. Bog'lanish: uzluksiz o'zgaruvchini (yoshni) mazmunli guruhlarga ajratish; bu chiziqli bo'lmagan munosabatlarni ushlaydi va tarifni o'qilishi mumkin qiladi. Kodlash: kategorik o'zgaruvchilarni (mintaqa) modelga mos keladigan raqamli formatga aylantirish; Xavfga asoslangan kodlash (har bir toifani o'ziga xos zarar darajasi bilan ifodalaydi) keng tarqalgan, ammo ehtiyotkorlik bilan bajarilishi kerak. Normalizatsiya: hamma narsani uning ta'siriga bo'lish orqali solishtirish mumkin. AI tezda ushbu transformatsiyalar uchun kodni yaratadi; Lekin har bir transformatsiyaning mantiqini tasdiqlashingiz kerak.

Maslahat: Maqsadli kodlash kuchli, lekin maʼlumotlarning sizib chiqishiga moyil: agar siz toifadagi oʻrtacha zararni hisoblashda qatorning oʻz zararini kiritsangiz, model “aldaydi”. Buni har doim oʻquv maʼlumotlari doirasida, oʻzaro tekshirish tartibida bajaring.

Eng makkor xavf: ma'lumotlarning sizib chiqishi va yashirin tarafkashlik

Ma'lumotlarning chiqib ketishi - bu bashorat qilish vaqtida mavjud bo'lmagan ma'lumotlarning modelga kiritilishi. Klassik misol: da'vo miqdorini bashorat qiluvchi modelga "to'langan da'volar" kabi natijani o'z ichiga olgan o'zgaruvchini kiritish. Model test ma'lumotlarida mukammal ko'rinadi, lekin haqiqiy dunyoda foydasiz, chunki bu ma'lumot bashorat qilish vaqtida mavjud emas. Oqish ko'pincha yashirin bo'ladi va faqat ehtiyotkor aktuar mulohazalar bilan ushlanadi - AI odatda sezmaydi, ba'zan hatto oqish o'zgaruvchisini "juda kuchli bashoratchi" sifatida maqtadi.

Ikkinchi makkor xavf - bu aniq tarafkashlikdir. Agar tarixiy ma'lumotlar ma'lum bir guruhni nohaqlik bilan ifodalasa (masalan, hudud tarixan juda ko'p siyosatlar rad etilgan bo'lsa), ushbu ma'lumotlardan olingan xususiyatlar bu noto'g'rilikni ta'minlaydi va model uni kelajakda takrorlaydi. Xususiyatlarni yaratish bosqichi bu noto'g'rilikni tan olish va tuzatish mumkin bo'lgan eng muhim momentdir.

E'tibor bering: "O'zgaruvchining bashorat qilish kuchini sezilarli darajada yaxshilaganidan" xursand bo'lishdan oldin, so'rang: bu o'zgaruvchi haqiqatda bashorat qilish vaqtida mavjudmi yoki kelajakni o'z ichiga oladimi? Juda yaxshi ko'rinadigan natija ko'pincha oqish belgisidir.

Ma'lumotlarni tayyorlashda AIdan qanday foydalanish kerak

1) Ma'lumotlar sifatini tekshirish:

Sizning rolingiz: ma'lumotlar sifati bo'yicha yordamchi. Sizda aktuar siyosat daromadi bor. Ustunlar: siyosat_identifikatori, boshlanish_sanasi, tugash_sanasi, yosh, mintaqa, transport_yoshi, mukofot, da'vo_hisoblash, da'vo_summa. Menga nazorat ro'yxatini va Python (pandas) kod eskizini bering: - etishmayotgan qiymatlarni ustun bo'yicha hisoblang.- Asossiz qiymatlarni belgilang (salbiy mukofot, yosh<0-0, ekspluatatsiya 10-sonli sana). (yil bo'yicha) boshidan/oxiridan. O'CHIRMANG; Men qaror qilishim uchun bu haqda xabar bering.

2) Xususiyatning kelib chiqishi:

Men trafik ma'lumotlarimdan yangi xususiyatlarni olmoqchiman. Mavjud: yosh, transport vositasining yoshi, mintaqa, yillik_km, foydalanish_turi.- Qaysi yosh va km guruhlarini tavsiya qilasiz, nega?- Maʼlumotlar sizib chiqmasdan “mintaqa” uchun xavfga asoslangan kodlashni qanday amalga oshirishim mumkin?- Har biri uchun aktuar asoslashni sinab koʻrishga arziydigan 3 ta yangi xususiyatni taklif qiling. Men qaror qilaman.

3) Oqish tekshiruvi:

Mening modelim quyidagi o'zgaruvchilar bilan zarar ehtimolini bashorat qiladi: yosh, mintaqa, transport_yoshi, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Ushbu o'zgaruvchilardan qaysi biri ma'lumotlarning sizib chiqishi xavfini tug'diradi? Har biri uchun, bashorat qilish vaqtida mavjud bo'lishini baholang. Shubhalilarni sanab o'ting va nima uchun.

4) EHMni normallashtirish:

Ba'zi siyosatlarim yil o'rtalarida boshlanadi. Chastotani to'g'ri hisoblash uchun EHM normalizatsiyasini tushuntiring va kodlang: chastota = jami da'vo_hisoblash / umumiy ta'sir qilish (politika-yil). Yil o'rtasidan boshlanadigan siyosatning ta'sirini qanday hisoblashni misol bilan ko'rsating.

Zaif taklif / Kuchli taklif

Zaif taklif:

Ma'lumotlarni tozalang va uni modelga tayyorlang.

AI qaysi ustunni, biznes qoidalarini, ta'sir qilish ta'rifini bilmaydi; U ma'lumotlarni ko'r-ko'rona o'chirib tashlashi, to'ldirishi va buzishi mumkin.

Kuchli so'rov:

Sizning rolingiz: aktuar ma'lumotlarini tayyorlash yordamchisi. Ma'lumotlar lug'ati: siyosat_identifikatori (identifikatsiya), boshlanish/tugash_sanasi (siyosat davri), yosh (kutilgan 16-90), premium (>0 bo'lishi kerak), da'volar_hisoblash (>=0), da'vo_summasi (>=0).Vazifa:1) Har bir ustunlik uchun asoslilik qoidasini yozing (G'ning har bir ustuni va 2-kod buzilishini xisoblash). ta'sir qilish.3) etishmayotgan "yosh" uchun 3 xil strategiya (o'chirish). / o'rtacha / alohida toifa) ortiqcha minus bilan mavjud; Qarorni menga qoldiring.4) Agar sizib chiqish xavfi bo'lgan ustun mavjud bo'lsa, ogohlantiring.Har qanday yozuvni avtomatik ravishda o'chirish; Men har bir qarorni ma'qullayman.

uchta mini holat

1-holat - EHM xatosi. Bitta portfelda qisqa muddatli (3 oylik) sayohat siyosatlari to'liq yillar sifatida hisoblangan, shuning uchun chastota haqiqiydan to'rt baravar pastroq ko'rindi; Narx noto'g'ri tushib ketdi. Aktuariy ekspozitsiyani kasr sifatida (0,25 siyosat yili) hisoblaganda, haqiqiy chastota aniqlandi va tarif tuzatildi. AI tomonidan yaratilgan fraksiyonel ta'sir qilish kodi; Ta'rifni aktuariy berdi.

2-holat - yashirin oqish. Yordamchi zarar ehtimoli modeliga "faylni yopish vaqti" o'zgaruvchisini qo'shganda, aniqlik keskin oshdi. Xursandchilik qisqa umr ko'rdi: bu o'zgaruvchini faqat zarar etkazilganidan keyin bilish mumkin edi, ya'ni bashorat qilish vaqtida mavjud emas edi. Oqish o'zgaruvchisi olib tashlanganda, model haqiqiy darajaga tushdi. U AI o'zgaruvchisini "kuchli bashoratchi" sifatida maqtadi; Aktuariyning hukmi tuzoqqa tushdi.

3-holat - tarafkashlikning takrorlanishi. Bir kompaniya tarixiy ma'lumotlardan "ilovani rad etish" namunasini oldi va uni yangi modelga kiritdi. Tahlil shuni ko'rsatdiki, o'tmishdagi rad etishlar nomutanosib ravishda ma'lum bir mahallada to'plangan, ya'ni tarixiy tarafkashlik mavjud edi. Ushbu xususiyat modeldan olib tashlandi va ko'proq neytral xavf ko'rsatkichlari bilan almashtirildi. AI namunaning mahalla bilan o'xshashligini o'lchaydigan tahlilni ishlab chiqdi; Axloqiy qaror aktuariy va muvofiqlik bo'limi tomonidan qabul qilindi.

Umumiy xatolar

  • O'ylamasdan etishmayotgan qiymatlarni o'rtacha bilan to'ldirish. Kamchilikning o'zi bilim bo'lishi mumkin; Uni ko'r-ko'rona to'ldirish noto'g'ri fikrni keltirib chiqaradi.
  • Chiqib ketishlarni avtomatik ravishda o'chirish. Ba'zilari haqiqiy chekka holatlardir; Ma'lumotlarni xatolardan ajratmasdan o'chirish axborotni yo'q qiladi.
  • EHMni normallashtirmaslik. Qisqa siyosatlarni to'liq yillar sifatida hisoblash chastotani buzadi va narxni buzadi.
  • Ma'lumotlarning sizib chiqishini sezmaslik. Juda yaxshi natija ko'pincha kelajakni o'z ichiga olgan o'zgaruvchining belgisidir; Har bir o'zgaruvchining bashorat qilish vaqtida mavjudligini so'rang.
  • Kelajakka nomutanosib qarashlarni keltirish. Tarixiy ma'lumotlardagi nohaqlik olingan xususiyatlarda oqib chiqishi mumkin; Uni xususiyat bosqichida tekshiring.

Xulosa

Aktuar modellashtirish asosan ma'lumotlarni tayyorlash bilan bog'liq; Agar kirish buzilgan bo'lsa, chiqish ham buzilgan. Odatiy muammolar - etishmayotgan qiymatlar, chegaralar, nomuvofiqliklar va takrorlash; Muhim aktuar muammo - bu ta'sirni normallashtirish. Xususiyat muhandisligi - guruhlash, kodlash, normallashtirish - ma'lumotlardan kuchliroq signallarni oladi. Eng makkor xavf - bu ma'lumotlarning sizib chiqishi va yashirin tarafkashlik; ikkalasi ham faqat aktuar fikrlash orqali olinadi. AI bu bosqichni sezilarli darajada tezlashtiradi: skanerlash kod va tavsiyalarni yaratadi. Ammo hech qanday yozuvni avtomatik ravishda o'chirmang, odamlarga sizib chiqish va noto'g'rilikni tekshirishga imkon bering va har bir konvertatsiyani tasdiqlang.

Ilova vazifasi

Kichik anonim siyosat ma'lumotlari lug'atini tayyorlang (5-7 ustun, har birining o'rtacha diapazoni). AIdan (a) har bir ustun uchun asoslilik qoidasi va buzilish hisoboti kodini, (b) kasr taʼsirini hisoblashni, (c) sinab koʻrish uchun 3 ta yangi funksiya boʻyicha takliflarni soʻrang. Keyin ro'yxatga qasddan "oqish tuzog'i" o'zgaruvchisini qo'shing (masalan, "tovon to'lanadi") va AI uni qochqin sifatida ushlaydimi yoki yo'qligini tekshiring.

nazorat ro'yxati

  • [ ] Nima uchun etishmayotgan va oʻzgarmas qiymatlarni oʻchirishdan oldin tahlil qildimmi?
  • [ ] EHMni to‘g‘ri qismlarga ajratdim va normallashtirdimmi?
  • [ ] Har bir yangi olingan xususiyat uchun aktuar asoslashni yozdimmi?
  • [ ] Men har bir o'zgaruvchining bashorat qilish vaqtida haqiqatda mavjud (oqish) bor yoki yo'qligini so'radimmi?
  • [ ] Olingan xususiyatlarda noaniq tarafkashlikni tekshirdimmi?
  • [ ] Menda AI hech qanday yozuvni avtomatik ravishda o'chira olmadimmi va har bir qarorni o'zim tasdiqlamadimmi?