Njësia 6 / 11

Përgatitja e të dhënave dhe inxhinieria e veçorive: Trajtimi i të dhënave aktuariale me inteligjencë artificiale

Fitimet:

  • Aftësia për të zbuluar vlerat e munguara, periferitë, ekspozimin dhe problemet e cilësisë së të dhënave në politikat dhe dëmtimin e të dhënave me mbështetjen e inteligjencës artificiale dhe për të prodhuar një draft korrigjimi
  • Inxhinieria e veçorive (arritja e variablave të reja, grupimi, kodimi) dhe normalizimi i ekspozimit ndaj inteligjencës artificiale me kontekstin e duhur
  • Kuptoni se transformimet e të dhënave të sugjeruara nga inteligjenca artificiale duhet të auditohen nga një aktuar kundër rrezikut të rrjedhjes së të dhënave dhe paragjykimeve të fshehura.

Pjesa për të cilën është folur më pak, por që kërkon më shumë kohë e punës aktuariale është përgatitja e të dhënave. Aktuarët me përvojë e dinë se pjesa më e madhe e kohës së një projekti modelimi shpenzohet duke pastruar, kombinuar dhe korrigjuar të dhënat. Pavarësisht se sa elegant është modeli, nëse të dhënat hyrëse janë të korruptuara, dalja është e korruptuar - me pak fjalë, "mbeturinat brenda, mbeturinat jashtë". Në këtë njësi, ne do të shohim problemet tipike të të dhënave të politikave dhe pretendimeve, si t'i zbulojmë dhe rregullojmë ato me AI, dhe qasjen e inxhinierisë së veçorive (variabla të reja të nxjerra që janë më informuese nga të dhënat ekzistuese).

Një paralajmërim që në fillim: përgatitja e të dhënave është një hap në dukje teknik dhe i pafajshëm, por këtu fshihen gabimet më të rrezikshme. Një normalizim i pasaktë i ekspozimit, një rrjedhje e fshehur e të dhënave ose një paragjykim i paraqitur pa dashje korrupton në heshtje të gjitha modelet e mëvonshme. Inteligjenca artificiale e përshpejton shumë këtë hap, por nëse lihet e pakontrolluar, ajo gjithashtu rrit rrezikun.

Probleme tipike të të dhënave aktuariale

Të dhënat e politikave dhe pretendimeve pothuajse kurrë nuk arrijnë të pastra. Problemet më të zakonshme janë: Vlerat që mungojnë: disa politika kanë vjetërsi, profesion ose rajon të automjetit bosh. Mbushja verbërisht e këtyre me mesataren mund të krijojë paragjykime; vetë mangësia ndonjëherë mbart informacion (të munguarit janë një grup tjetër). Të dhënat e jashtme: të dhëna të palogjikshme si primi negativ, i siguruar 200-vjeçar, politika me ekspozim zero. Duhet të dallohet nëse këto janë gabime të dhënash apo raste reale të skajeve. Mospërputhje: drejtshkrime të ndryshme të të njëjtit rajon ("Stamboll", "Stamboll", "34"), konfuzion i formatit të datës. Regjistrime të dyfishta: futja e të njëjtit dëm dy herë.

Por çështja më kritike specifike për aktuari është ekspozimi. Nëse një politikë fillon në mes të vitit, ajo ofron një ekspozim të pjesshëm (p.sh. 0,5 vjet) për atë vit, jo një "vit të plotë politikash". Frekuenca dhe shkalla e dëmtimit duhet të normalizohet gjithmonë ndaj ekspozimit; përndryshe politikat afatshkurtra paraqiten me rrezikshmëri të lartë. AI mund të kodojë llogaritjen e ekspozimit, por ju duhet të jepni përkufizimin dhe rregullin e biznesit.

Tabela e mëposhtme përmbledh problemet tipike dhe qasjen e duhur:

problem

qasje e gabuar

qasje e drejtë

vlera e munguar

Plotësoni të gjitha me mesatare

Analizoni mungesën; ndonjëherë hapni një kategori të veçantë

i jashtëzakonshëm

Fshij automatikisht

Dalloni midis gabimit të të dhënave dhe plumbit real

ekspozimi

Numëroni të gjitha politikat për 1 vit

Llogaritni ekspozimin e pjesshëm

Mospërputhje kategorie

injorojnë

Përputhja me fjalorin standard

dëmtime të përsëritura

mos vini re

Dedubliko me fushat kryesore

Inxhinieria e veçorive: nxjerrja e njohurive nga të dhënat

Inxhinieria e veçorive është arti i nxjerrjes së variablave të reja që janë më të dobishme për modelin nga variablat ekzistues të papërpunuar. Shembuj: "mosha" nga data e lindjes, "grupmosha" (binding) nga mosha, "segment rreziku" nga modeli i automjetit, "vlerësimi vjetor i kilometrazhit" nga kombinimi adresë-politikë. Një veçori e mirë mbart një sinjal më të fortë se të dhënat e papërpunuara dhe rrit saktësinë dhe interpretueshmërinë e modelit.

Tre teknika përdoren shpesh në punën aktuariale. Lidhja: ndarja e një ndryshoreje të vazhdueshme (mosha) në grupe kuptimplote; kjo kap marrëdhënie jolineare dhe e bën tarifën të lexueshme. Kodimi: konvertimi i variablave kategorikë (rajon) në një format numerik të përshtatshëm për modelin; Kodimi i bazuar në rrezik (duke përfaqësuar secilën kategori me shkallën e vet të dëmtimit) është i zakonshëm, por duhet bërë me kujdes. Normalizimi: duke e bërë gjithçka të krahasueshme duke e ndarë atë me ekspozimin e saj. AI gjeneron shpejt kodin për këto transformime; Por ju duhet të miratoni logjikën e çdo transformimi.

Këshillë: Kodimi i synuar është i fuqishëm, por i prirur për rrjedhje të të dhënave: modeli "mashtron" nëse përfshin dëmtimin e një rreshti kur llogarit dëmin mesatar të një kategorie. Gjithmonë bëjeni këtë brenda të dhënave të trajnimit, në një model verifikimi të kryqëzuar.

Rreziku më tinëzar: rrjedhjet e të dhënave dhe paragjykimi i nënkuptuar

Rrjedhja e të dhënave është futja e informacionit në model që në të vërtetë nuk ekziston në kohën e parashikimit. Shembull klasik: futja e një variabli që përmban rezultatin, të tilla si "kërkesat e paguara", në një model që parashikon shumën e kërkesës. Modeli duket i përsosur në të dhënat e testimit, por është i padobishëm në botën reale, sepse ai informacion nuk është i disponueshëm në kohën e parashikimit. Rrjedhja shpesh fshihet dhe kapet vetëm nga arsyetimi i kujdesshëm aktuarial - AI zakonisht nuk e vëren, ndonjëherë edhe duke lavdëruar variablin që rrjedh si "parashikues shumë i fuqishëm".

Rreziku i dytë tinëzar është paragjykimi i nënkuptuar. Nëse të dhënat historike përfaqësojnë në mënyrë të padrejtë një grup të caktuar (për shembull, një zone i është mohuar historikisht shumë politika), veçoritë që rrjedhin nga ato të dhëna mbartin atë paragjykim dhe modeli e përsërit atë në të ardhmen. Faza e inxhinierisë së veçorive është momenti më kritik kur ky paragjykim mund të njihet dhe korrigjohet.

Kujdes: Përpara se të gëzoheni kur një variabël "përmirëson jashtëzakonisht fuqinë parashikuese", pyesni: a është në të vërtetë ky variabël i pranishëm në kohën e parashikimit, apo përfshin të ardhmen? Një rezultat që duket shumë i mirë është shpesh një shenjë e një rrjedhjeje.

Si të përdorni AI në përgatitjen e të dhënave

1) Shqyrtimi i cilësisë së të dhënave:

Roli juaj: asistent i cilësisë së të dhënave. Ju keni rendiment të politikës aktuariale. Kolonat: id-i i politikës, data_fillimi, data_mbarimi, mosha, rajoni, mosha_e automjetit, premium, numërimi_pretendimi, shuma_kërkese. Më jep një listë kontrolli dhe skicën e kodit Python (panda):- Numëro vlerat që mungojnë sipas kolonës.- Flamuro vlerat e paarsyeshme (premium negativ, mosha e fundit<16, fraza e fundit). vjet) nga fillimi/mbarimi. MOS fshini; Thjesht raportojeni që të vendos.

2) Derivimi i veçorive:

Dua të nxjerr veçori të reja nga të dhënat e mia të trafikut. E disponueshme: mosha, mosha e automjetit, rajoni, km vjetore, lloji i përdorimit.- Cilat grupmosha dhe km (binding) rekomandoni, pse?- Si mund të bëj kodimin e bazuar në rrezik për 'rajonin' pa rrjedhje të dhënash?- Sugjeroni 3 veçori të reja që ia vlen të provoni dhe shkruani justifikimin aktuarial për secilën. Unë do të vendos.

3) Inspektimi i rrjedhjeve:

Modeli im parashikon MUNDËSINË e dëmtimit me variablat e mëposhtëm: mosha, rajoni, mosha e automjetit, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Cili nga këto variabla paraqet rrezik për rrjedhje të të dhënave? Për secilën, vlerësoni nëse do të jetë i disponueshëm në kohën e parashikimit. Rendisni ato të dyshimta dhe pse.

4) Normalizimi i ekspozimit:

Disa nga politikat e mia fillojnë në mes të vitit. Shpjegoni dhe kodoni normalizimin e ekspozimit për të llogaritur saktë frekuencën: frekuenca = numri_gjithsej i pretendimit / ekspozimi total (viti i politikës). Tregoni me një shembull se si llogaritet ekspozimi i politikës që fillon në mes të vitit.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Pastroni të dhënat dhe bëjeni gati për modelin.

AI nuk e di se cila kolonë është, rregullat e biznesit, përkufizimi i ekspozimit; Mund të fshijë verbërisht dhe të plotësojë dhe korruptojë të dhënat.

Njoftim i fuqishëm:

Roli juaj: asistenti i përgatitjes së të dhënave aktuariale. Fjalori i të dhënave: ID-ja e politikës (identiteti), data e fillimit/mbarimit (periudha e politikës), mosha (e pritshme 16-90), premium (duhet të jetë >0), numri_kërkese (>=0), shuma_kërkese (>=0). Detyra:1) Shkruani rregullin e arsyeshmërisë për çdo kolonë dhe RAPORTOJNË 2 shkeljet e përcaktimit të kodit. ekspozimi.3) 3 strategji të ndryshme për mungesën e 'moshës' (fshij). / mesatare / kategori e veçantë) e pranishme me plus-minus; Më lini mua vendimin.4) Paralajmëroni nëse ka një kolonë që mund të përbëjë rrezik rrjedhjeje.Fshirja automatike e çdo regjistrimi; Unë do të miratoj çdo vendim.

tre mini kuti

Rasti 1 - Gabim ekspozimi. Në një portofol, politikat afatshkurtra (3-mujore) të udhëtimit u llogaritën si vite të plota, kështu që frekuenca u shfaq katër herë më e ulët se sa ishte në të vërtetë; Çmimi ra gabimisht. Kur aktuari llogariti ekspozimin si fraksion (0.25-viti i politikës), frekuenca reale u zbulua dhe tarifa u korrigjua. Kodi i ekspozimit i pjesshëm i gjeneruar nga AI; Aktuari dha përkufizimin.

Rasti 2 - Rrjedhje latente. Kur një ndihmës shtoi variablin "koha e mbylljes së skedarit" në modelin e probabilitetit të dëmtimit, saktësia u rrit në mënyrë dramatike. Gëzimi ishte jetëshkurtër: ky variabël mund të njihej vetëm pasi të kishte ndodhur dëmi, që do të thotë se nuk ishte i disponueshëm në kohën e parashikimit. Kur ndryshorja e rrjedhur u hoq, modeli u ul në një nivel realist. Ai vlerësoi variablin e AI si një "parashikues të fuqishëm"; Gjykimi i aktuarit kapi kurthin.

Rasti 3 - Përsëritja e paragjykimeve. Një kompani nxori një model "refuzimi të aplikacionit" nga të dhënat historike dhe e vendosi atë në modelin e ri. Analiza tregoi se refuzimet e kaluara ishin të përqendruara në mënyrë disproporcionale në një lagje të caktuar, që do të thotë se kishte një paragjykim historik. Kjo veçori u hoq nga modeli dhe u zëvendësua me tregues më neutral të rrezikut. AI prodhoi analizën duke matur mbivendosjen e modelit me lagjen; Vendimi etik u mor nga aktuari dhe njësia e pajtueshmërisë.

Gabimet e zakonshme

  • Plotësimi i vlerave që mungojnë me mesataren pa u menduar. Mungesa në vetvete mund të jetë njohuri; Plotësimi i tij verbërisht krijon paragjykime.
  • Fshi automatikisht pikat e jashtme. Disa janë rastet e vërteta të skajit; Fshirja e të dhënave pa i ndarë nga gabimet shkatërron informacionin.
  • Mos normalizimi i ekspozimit. Numërimi i policave të shkurtra si vite të plota shtrembëron frekuencën dhe shtrembëron çmimin.
  • Duke mos vënë re rrjedhje të të dhënave. Një rezultat shumë i mirë është shpesh një shenjë e një ndryshoreje që përfshin të ardhmen; Pyetni nëse çdo variabël është i pranishëm në kohën e parashikimit.
  • Sjellja e paragjykimeve të nënkuptuara në të ardhmen. Padrejtësia në të dhënat historike mund të rrjedhë në tipare të prejardhura; Kontrolloni atë në fazën e veçorive.

Në përmbledhje

Modelimi aktuarial ka të bëjë kryesisht me përgatitjen e të dhënave; Nëse inputi është i korruptuar, dalja është gjithashtu e korruptuar. Problemet tipike janë vlerat që mungojnë, anët e jashtme, mospërputhjet dhe dyfishimi; Çështja kritike aktuariale është normalizimi i ekspozimit. Inxhinieria e veçorive - grupimi, kodimi, normalizimi - nxjerr sinjale më të forta nga të dhënat. Rreziqet më tinëzare janë rrjedhja e të dhënave dhe paragjykimi i nënkuptuar; të dyja janë kapur vetëm nga arsyetimi aktuarial. AI e përshpejton shumë këtë hap: skanimi gjeneron kode dhe rekomandime. Por mos fshini automatikisht asnjë regjistrim, lërini njerëzit të kontrollojnë për rrjedhje dhe paragjykime dhe të miratojnë çdo konvertim.

Detyra e aplikimit

Përgatitni një fjalor të vogël anonim të të dhënave të politikave (5-7 kolona, ​​diapazoni i arsyeshëm i secilës). Kërkojini AI për (a) rregullin e arsyeshmërisë dhe kodin e raportit të shkeljes për secilën kolonë, (b) llogaritjen e ekspozimit të pjesshëm, (c) sugjerime për 3 veçori të reja për t'u provuar. Pastaj shtoni një variabël të qëllimshëm "kurth rrjedhjeje" në listë (p.sh. "kompensimi i paguar") dhe provoni nëse AI e kap atë si rrjedhje.

listë kontrolli

  • [ ] A e kam analizuar pse përpara se të fshij ato që mungojnë dhe ato të jashtme?
  • [ ] A e kam fraksionuar dhe normalizuar saktë ekspozimin?
  • [ ] A e kam shkruar unë justifikimin aktuarial për çdo tipar të sapoardhur?
  • [ ] A kam vënë në dyshim nëse çdo variabël është në të vërtetë i pranishëm (rrjedhje) në kohën e parashikimit?
  • [ ] A kam skanuar për paragjykime të nënkuptuara në veçoritë e prejardhura?
  • [ ] A nuk kisha AI që të fshinte automatikisht ndonjë regjistrim dhe të miratoja vetë çdo vendim?