Qazanclar:
- Siyasətdə çatışmayan dəyərləri, kənar göstəriciləri, məruz qalma və məlumat keyfiyyəti problemlərini aşkar etmək və süni intellekt dəstəyi ilə məlumatlara ziyan vurmaq və düzəliş layihəsi hazırlamaq bacarığı
- Xüsusiyyət mühəndisliyi (yeni dəyişən törəmə, qruplaşdırma, kodlaşdırma) və düzgün kontekstlə süni intellektə məruz qalmanın normallaşdırılması
- Anlayın ki, süni intellektin təklif etdiyi məlumat transformasiyaları məlumat sızması riskinə və gizli qərəzliliyə qarşı aktuari tərəfindən yoxlanılmalıdır.
Aktuar işinin ən az danışılan, lakin ən çox vaxt aparan hissəsi məlumatların hazırlanmasıdır. Təcrübəli aktuarilər bilirlər ki, modelləşdirmə layihəsinin vaxtının çox hissəsi məlumatların təmizlənməsi, birləşdirilməsi və korrektə edilməsinə sərf olunur. Model nə qədər zərif olursa olsun, giriş məlumatları pozulubsa, çıxış pozulur - bir sözlə, "zibil daxil, çöp atılır". Bu bölmədə biz siyasət və iddia məlumatlarının tipik problemlərini, onların AI ilə necə aşkarlanacağını və düzəltməsini və xüsusiyyət mühəndisliyi (mövcud məlumatlardan daha informativ olan yeni dəyişənlər əldə etmək) yanaşmasını görəcəyik.
Əvvəldən xəbərdarlıq: məlumatların hazırlanması zahirən texniki və günahsız addımdır, lakin ən təhlükəli səhvlərin gizləndiyi yer budur. Yanlış ifşa normallaşdırılması, gizli məlumat sızması və ya istəmədən təqdim edilən qərəz bütün sonrakı modelləri səssizcə korlayır. Süni intellekt bu addımı xeyli sürətləndirir, lakin nəzarətsiz qaldıqda riski də artırır.
Aktuar məlumatların tipik problemləri
Siyasət və iddia məlumatları demək olar ki, heç vaxt təmiz gəlmir. Ən çox rast gəlinən problemlər bunlardır: Çatışmayan dəyərlər: bəzi siyasətlərdə avtomobilin yaşı, peşəsi və ya bölgəsi boşdur. Bunları kor-koranə orta ilə doldurmaq qərəz yarada bilər; əskikliyin özü bəzən məlumat daşıyır (itkin olanlar başqa qrupdur). Outliers: mənfi mükafat, 200 illik sığortalı, sıfır məruz qalma siyasəti kimi məntiqsiz qeydlər. Bunların məlumat xətaları və ya real kənar hallar olub-olmadığını ayırd etmək lazımdır. Uyğunsuzluq: eyni bölgənin fərqli yazımları ("İstanbul", "İstanbul", "34"), tarix formatı qarışıqlığı. Dublikat qeydlər: eyni zərərin iki dəfə daxil olması.
Lakin aktuarlara xas olan ən kritik məsələ məruz qalmadır. Siyasət ilin ortasında başlayırsa, o, tam “siyasət ili” deyil, həmin il üçün fraksiya riskini (məsələn, 0,5 il) təmin edir. Tezlik və zərər dərəcələri həmişə məruz qalma ilə normallaşdırılmalıdır; əks halda qısamüddətli siyasətlər yüksək riskli görünür. AI məruz qalma hesablamasını kodlaya bilər, lakin siz tərif və iş qaydasını təqdim etməlisiniz.
Aşağıdakı cədvəl tipik problemləri və düzgün yanaşmanı ümumiləşdirir:
problem
yanlış yanaşma
düzgün yanaşma
itkin dəyər
Hamısını orta ilə doldurun
Çatışmazlığı təhlil edin; bəzən ayrıca kateqoriya açılır
kənar
Avtomatik silin
Məlumat xətası ilə real potensialı fərqləndirin
məruz qalma
1 il üçün bütün siyasətləri hesablayın
Kəsrə məruz qalmağı hesablayın
Kateqoriya uyğunsuzluğu
etinasızlıq etmək
Standart lüğətlə uyğunlaşın
təkrarlanan zərər
fərq etmə
Əsas sahələrlə təkmilləşdirin
Xüsusiyyət mühəndisliyi: verilənlərdən bilik əldə etmək
Xüsusiyyət mühəndisliyi, mövcud xam dəyişənlərdən model üçün daha faydalı olan yeni dəyişənlərin əldə edilməsi sənətidir. Nümunələr: doğum tarixindən "yaş", yaşdan "yaş qrupu" (binning), nəqliyyat vasitəsinin modelindən "risk seqmenti", ünvan-siyasət birləşməsindən "illik yürüş təxmini". Yaxşı xüsusiyyət xam məlumatdan daha güclü siqnal daşıyır və modelin həm dəqiqliyini, həm də şərh oluna bilənliyini artırır.
Aktuar işində tez-tez üç texnika istifadə olunur. Bağlama: davamlı dəyişəni (yaşı) mənalı qruplara ayırmaq; bu qeyri-xətti əlaqələri ələ keçirir və tarifi oxunaqlı edir. Kodlaşdırma: kateqoriyalı dəyişənlərin (region) model üçün uyğun ədədi formata çevrilməsi; Risk əsaslı kodlaşdırma (hər bir kateqoriyanı öz zərər dərəcəsi ilə təmsil edir) adi haldır, lakin ehtiyatla aparılmalıdır. Normallaşdırma: hər şeyi onun məruz qaldığı yerə bölmək yolu ilə müqayisə edilə bilən hala gətirmək. Süni intellekt bu çevrilmələrin kodunu tez yaradır; Ancaq hər bir transformasiyanın məntiqini təsdiqləməlisiniz.
İpucu: Hədəf kodlaşdırması güclüdür, lakin məlumat sızmasına meyllidir: kateqoriyanın orta zərərini hesablayarkən cərgənin öz zərərini daxil etsəniz, model “fırıldaq edir”. Bunu həmişə təlim məlumatları daxilində, çarpaz doğrulama nümunəsində edin.
Ən məkrli təhlükə: məlumat sızması və gizli qərəzlilik
Məlumat sızması, proqnozlaşdırma zamanı əslində mövcud olmayan məlumatın modelə daxil edilməsidir. Klassik nümunə: iddia məbləğini proqnozlaşdıran modelə “ödənilmiş iddialar” kimi nəticəni ehtiva edən dəyişənin tətbiqi. Model test məlumatlarında mükəmməl görünür, lakin real dünyada faydasızdır, çünki bu məlumat proqnozlaşdırma zamanı mövcud deyil. Sızma çox vaxt gizlədilir və yalnız diqqətli aktuar mülahizə ilə tutulur – AI adətən fərqinə varmır, bəzən hətta sızan dəyişəni “çox güclü proqnozlaşdırıcı” kimi tərifləyir.
İkinci məkrli təhlükə gizli qərəzdir. Tarixi məlumatlar ədalətsiz olaraq müəyyən bir qrupu təmsil edirsə (məsələn, bir sahə tarixən çoxlu siyasətdən imtina edilibsə), həmin məlumatdan əldə edilən xüsusiyyətlər bu qərəzliyi daşıyır və model onu gələcəyə təkrarlayır. Xüsusiyyət mühəndisliyi mərhələsi bu qərəzliyi tanımaq və düzəltmək mümkün olan ən kritik məqamdır.
Diqqət: Dəyişən “proqnozlaşdırma qabiliyyətini çox yaxşılaşdıran” zaman sevinməzdən əvvəl soruşun: bu dəyişən proqnoz zamanı həqiqətən mövcuddur, yoxsa gələcəyi əhatə edir? Çox yaxşı görünən bir nəticə çox vaxt sızma əlamətidir.
Məlumatların hazırlanmasında AI-dən necə istifadə etmək olar
1) Məlumat keyfiyyətinin yoxlanılması:
Rolunuz: məlumat keyfiyyəti köməkçisi. Sizdə aktuar siyasət gəliri var. Sütunlar: siyasət_id, başlanğıc_tarixi, bitmə_tarixi,yaş, bölgə, nəqliyyat_yaşı, mükafat, iddia_sayı, iddia_məbləği. Mənə yoxlama siyahısı və Python (pandas) kodu eskizini verin:- Çatışmayan dəyərləri sütun üzrə sayın.- Əsassız dəyərləri qeyd edin (mənfi mükafat, yaş <0-16 və ya təxmini son). (illərlə) başlanğıcdan/sondan. SİLMƏYİN; Sadəcə bildirin ki, mən qərar verim.
2) Xüsusiyyətin əldə edilməsi:
Mən trafik məlumatlarımdan yeni funksiyalar əldə etmək istəyirəm. Mövcuddur: yaş, nəqliyyat vasitəsinin_yaşı, bölgə, illik_km, istifadə_növü.- Hansı yaş və km qruplarını (binning) tövsiyə edirsiniz, niyə?- Məlumat sızması olmadan 'region' üçün risk əsaslı kodlaşdırmanı necə edə bilərəm?- Sınamağa dəyər 3 yeni funksiya təklif edin və hər biri üçün aktuar əsaslandırma yazın. mən qərar verəcəm.
3) Sızma yoxlaması:
Modelim aşağıdakı dəyişənlərlə zərərin MÜMKÜNLƏRİNİ proqnozlaşdırır: yaş, bölgə, avtomobil_yaşı, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Bu dəyişənlərdən hansı məlumat sızması riski yaradır? Hər biri üçün onun proqnoz zamanı mövcud olub-olmadığını qiymətləndirin. Şübhəli olanları sadalayın və niyə.
4) Ekspozisiyanın normallaşdırılması:
Bəzi siyasətlərim ilin ortasında başlayır. Tezliyi düzgün hesablamaq üçün ekspozisiya normallaşdırılmasını izah edin və kodlayın: tezlik = ümumi iddia_sayi / ümumi məruz qalma (siyasət-il). İlin ortasında başlayan siyasətin təsirini necə hesablayacağınızı bir nümunə ilə göstərin.
Zəif məlumat / Güclü göstəriş
Zəif çağırış:
Məlumatları təmizləyin və model üçün hazırlayın.
Süni intellekt hansı sütunun hansı olduğunu bilmir, biznes qaydaları, məruz qalma tərifi; Məlumatları kor-koranə silə, doldura və korlaya bilər.
Güclü göstəriş:
Rolunuz: aktuar məlumatların hazırlanması köməkçisi.Məlumat lüğəti: siyasət_id (şəxsiyyət), başlanğıc/bitmə_tarixi (siyasət dövrü), yaş (gözlənilən 16-90), mükafat (>0 olmalıdır), iddia_sayı (>=0), iddia_məbləği (>=0). Tapşırıq:1) Hər bir sütun üçün əsaslılıq qaydasını yazın (hər bir G sütunu və HESABAT kodu pozuntularını hesablamaq üçün). məruz qalma.3) itkin "yaş" üçün 3 müxtəlif strategiya (silmək). / orta / ayrı kateqoriya) plus-minus ilə təqdim olunur; Qərarı mənə həvalə edin.4) Sızma riski yarada biləcək sütun varsa xəbərdar edin.Hər hansı qeydin avtomatik silinməsi; Hər qərarı təsdiq edəcəyəm.
üç mini qutu
1-ci hal - Ekspozisiya xətası. Bir portfeldə qısa müddətli (3 aylıq) səyahət siyasətləri tam illər kimi sayılırdı, buna görə də tezlik faktiki olduğundan dörd dəfə aşağı görünür; Qiymət səhv düşdü. Aktuari ekspozisiyanı fraksiya kimi hesabladıqda (polis ili 0,25), real tezlik aşkarlanmış və tarifə düzəliş edilmişdir. AI tərəfindən yaradılan fraksiya ifşa kodu; Aktuari tərif verdi.
2-ci hal - Gizli sızma. Köməkçi zərər ehtimalı modelinə “faylın bağlanma vaxtı” dəyişənini əlavə etdikdə dəqiqlik kəskin şəkildə artdı. Sevinc qısa sürdü: bu dəyişən yalnız zərər baş verdikdən sonra bilinə bilərdi, yəni proqnoz zamanı mövcud deyildi. Sızdıran dəyişən çıxarıldıqda, model real səviyyəyə qədər azaldı. O, AI dəyişənini "güclü proqnozlaşdırıcı" kimi təriflədi; Aktuarinin qərarı tələyə düşdü.
3-cü hal – Qərəzliyin təkrarlanması. Bir şirkət tarixi məlumatlardan “müraciətdən imtina” nümunəsini əldə etdi və onu yeni modelə qoydu. Təhlil göstərdi ki, keçmiş imtinalar qeyri-mütənasib olaraq müəyyən bir məhəllədə cəmləşib, yəni tarixi qərəz var. Bu xüsusiyyət modeldən çıxarılıb və daha neytral risk göstəriciləri ilə əvəz edilib. AI nümunənin qonşuluqla üst-üstə düşməsini ölçən analiz hazırladı; Etik qərar aktuari və uyğunluq bölməsi tərəfindən qəbul edilmişdir.
Ümumi səhvlər
- Çatışmayan dəyərləri düşünmədən orta ilə doldurmaq. Əskikliyin özü bilik ola bilər; Onu kor-koranə doldurmaq qərəz yaradır.
- Həddindən artıq göstəriciləri avtomatik silin. Bəziləri əsl kənar hallardır; Məlumatı səhvlərdən ayırmadan silmək informasiyanı məhv edir.
- Ekspozisiyanı normallaşdırmır. Qısa siyasətləri tam illər kimi hesablamaq tezliyi təhrif edir və qiyməti təhrif edir.
- Məlumat sızmasını fərq etməmək. Çox yaxşı nəticə çox vaxt gələcəyi əhatə edən dəyişənin əlamətidir; Hər bir dəyişənin proqnoz zamanı mövcud olub-olmadığını soruşun.
- Gələcəyə gizli qərəzli yanaşma. Tarixi məlumatlarda ədalətsizlik əldə edilmiş xüsusiyyətlərə sıza bilər; Xüsusiyyət mərhələsində yoxlayın.
Xülasə
Aktuar modelləşdirmə əsasən məlumatların hazırlanması ilə bağlıdır; Giriş pozulmuşsa, çıxış da pozulmuşdur. Tipik problemlər çatışmayan dəyərlər, kənar göstəricilər, uyğunsuzluqlar və təkrarlanmadır; Kritik aktuar məsələ məruz qalmanın normallaşdırılmasıdır. Xüsusiyyət mühəndisliyi - qruplaşdırma, kodlaşdırma, normallaşdırma - verilənlərdən daha güclü siqnallar əldə edir. Ən məkrli təhlükələr məlumat sızması və gizli qərəzdir; hər ikisi yalnız aktuar əsaslandırma ilə tutulur. Süni intellekt bu addımı xeyli sürətləndirir: skanlama kod və tövsiyələr yaradır. Ancaq heç bir qeydi avtomatik silməyin, insanlara sızma və qərəzliyi yoxlamağa icazə verin və hər bir dönüşümü təsdiqləsin.
Tətbiq tapşırığı
Kiçik bir anonim siyasət məlumatı lüğəti hazırlayın (5-7 sütun, hər birinin məqbul diapazonu). Süni intellektdən (a) hər bir sütun üçün əsaslılıq qaydası və pozuntu hesabatı kodu, (b) fraksiya məruz qalma hesablaması, (c) sınamaq üçün 3 yeni funksiya üçün təkliflər soruşun. Sonra siyahıya qəsdən “sızma tələsi” dəyişənini əlavə edin (məsələn, “ödənilmiş kompensasiya”) və AI-nin onu sızma kimi tutduğunu yoxlayın.
yoxlama siyahısı
- [ ] Mən çatışmayan və kənar göstəriciləri silməzdən əvvəl niyə təhlil etmişəm?
- [ ] Ekspozisiyanı düzgün şəkildə fraksiyalaşdırdım və normallaşdırdım?
- [ ] Mən hər bir yeni əldə edilmiş xüsusiyyət üçün aktuar əsaslandırma yazmışammı?
- [ ] Proqnoz zamanı hər bir dəyişənin həqiqətən mövcud olub-olmadığını (sızma) soruşdum?
- [ ] Mən əldə edilmiş xüsusiyyətlərdə gizli qərəzliyi skan etmişəm?
- [ ] Mən süni intellektə malik olmamışammı ki, heç bir qeydi avtomatik silib, hər qərarı özüm təsdiqləmişəm?