Ieguvumi:
- Spēja atklāt trūkstošās vērtības, novirzes, ekspozīcijas un datu kvalitātes problēmas politikā un bojāt datus ar mākslīgā intelekta atbalstu un sagatavot labojuma uzmetumu
- Funkciju inženierija (jaunu mainīgo atvasināšana, grupēšana, kodēšana) un ekspozīcijas normalizēšana mākslīgajam intelektam ar pareizo kontekstu
- Saprotiet, ka mākslīgā intelekta ierosinātās datu transformācijas ir jāpārbauda aktuāram, lai novērstu datu noplūdes un slēptās novirzes risku.
Vismazāk apspriestā, bet laikietilpīgākā aktuāra darba daļa ir datu sagatavošana. Pieredzējuši aktuāri zina, ka lielākā daļa modelēšanas projekta laika tiek veltīta datu tīrīšanai, apvienošanai un labošanai. Neatkarīgi no tā, cik elegants ir modelis, ja ievades dati ir bojāti, izvade ir bojāta — īsi sakot, “atkritumi iekšā, atkritumi ārā”. Šajā nodaļā mēs redzēsim tipiskas politikas un pretenziju datu problēmas, kā tās atklāt un novērst, izmantojot AI, kā arī funkciju inženierijas (no esošajiem datiem iegūti jauni mainīgie, kas ir informatīvāki) pieeju.
Brīdinājums jau no paša sākuma: datu sagatavošana ir šķietami tehnisks un nevainīgs solis, taču tieši šeit slēpjas visbīstamākās kļūdas. Nepareiza ekspozīcijas normalizācija, slēpta datu noplūde vai netīši ieviesta novirze klusi sabojā visus turpmākos modeļus. AI ievērojami paātrina šo soli, taču, ja tas netiek kontrolēts, tas arī palielina risku.
Tipiskas aktuāro datu problēmas
Politikas un pretenziju dati gandrīz nekad nenonāk tīri. Visbiežāk sastopamās problēmas ir šādas: Trūkst vērtības: dažās politikās nav norādīts transportlīdzekļa vecums, nodarbošanās vai reģions. Akli to aizpildīšana ar vidējo vērtību var radīt neobjektivitāti; pats trūkums dažkārt nes informāciju (trūkstošie ir cita grupa). Ārpuses: neloģiski ieraksti, piemēram, negatīva prēmija, 200 gadus vecs apdrošināts, nulles riska politika. Jānošķir, vai tās ir datu kļūdas vai reāli malas gadījumi. Neatbilstība: viena un tā paša reģiona atšķirīga rakstība ("Stambula", "Stambula", "34"), datuma formāta neskaidrības. Ierakstu dublikāti: viena un tā paša bojājuma ierakstīšana divreiz.
Taču vissvarīgākā aktuāra problēma ir ekspozīcija. Ja politika sākas gada vidū, tā nodrošina daļēju ekspozīciju (piemēram, 0,5 gadus) šim gadam, nevis pilnu “polises gadu”. Biežums un bojājumu līmenis vienmēr ir jānormalizē atbilstoši iedarbībai; pretējā gadījumā īstermiņa politika šķiet augsta riska pakāpe. AI var kodēt ekspozīcijas aprēķinu, taču jums ir jānorāda definīcija un uzņēmējdarbības noteikums.
Šajā tabulā ir apkopotas tipiskas problēmas un pareizā pieeja:
problēma
nepareiza pieeja
pareizā pieeja
trūkstošās vērtības
Aizpildiet visu ar vidējo
analizēt trūkumus; dažreiz atveriet atsevišķu kategoriju
izņēmums
Automātiska dzēšana
Atšķiriet datu kļūdu un reālo potenciālo pirkumu
ekspozīcija
Uzskaitiet visas polises par 1 gadu
Aprēķināt daļēju ekspozīciju
Kategoriju neatbilstība
ignorēt
Saskaņot ar standarta vārdnīcu
atkārtoti bojājumi
nepamana
Atceliet dublikātus ar galvenajiem laukiem
Līdzekļu inženierija: zināšanu iegūšana no datiem
Līdzekļu inženierija ir māksla no esošajiem neapstrādātiem mainīgajiem atvasināt jaunus mainīgos, kas ir noderīgāki modelim. Piemēri: "vecums" no dzimšanas datuma, "vecuma grupa" (grupēšana) no vecuma, "riska segments" no transportlīdzekļa markas modeļa, "gada nobraukuma aprēķins" no adreses un politikas kombinācijas. Laba funkcija pārraida spēcīgāku signālu nekā neapstrādāti dati un palielina gan modeļa precizitāti, gan interpretējamību.
Aktuāra darbā bieži tiek izmantotas trīs metodes. Saistīšana: nepārtraukta mainīgā (vecuma) sadalīšana nozīmīgās grupās; tas uztver nelineāras attiecības un padara tarifu lasāmu. Kodēšana: kategorisko mainīgo (reģiona) konvertēšana modelim piemērotā skaitliskā formātā; Uz risku balstīta kodēšana (attēlojot katru kategoriju ar savu bojājumu līmeni) ir izplatīta, taču tā jāveic piesardzīgi. Normalizācija: padarot visu salīdzināmu, dalot to ar tā ekspozīciju. AI ātri ģenerē kodu šīm transformācijām; Bet jums ir jāapstiprina katras transformācijas loģika.
Padoms. Mērķa kodējums ir spēcīgs, taču pakļauts datu noplūdei: modelis "krāpjas", ja, aprēķinot kategorijas vidējo bojājumu, iekļaujat pašas rindas bojājumus. Vienmēr dariet to apmācības datos, izmantojot savstarpējās validācijas shēmu.
Vismānīgākās briesmas: datu noplūde un netieša novirze
Datu noplūde ir tādas informācijas ievadīšana modelī, kas prognozēšanas brīdī faktiski nepastāv. Klasisks piemērs: mainīgā lieluma, kas satur rezultātu, piemēram, “apmaksātās prasības”, ieviešana modelī, kas paredz prasības summu. Modelis izskatās perfekti testa datos, bet reālajā pasaulē ir bezjēdzīgs, jo šī informācija nav pieejama prognozēšanas laikā. Noplūde bieži tiek slēpta un tiek uztverta tikai rūpīgā aktuāra spriešanā — AI parasti to nepamana, dažreiz pat slavē noplūdušo mainīgo kā "ļoti spēcīgu prognozētāju".
Otrais mānīgais apdraudējums ir netieša neobjektivitāte. Ja vēsturiskie dati negodīgi atspoguļo noteiktu grupu (piemēram, apgabalam vēsturiski ir liegts pārāk daudz politiku), no šiem datiem iegūtie līdzekļi ietver šo novirzi, un modelis to atkārto nākotnē. Funkciju izstrādes fāze ir viskritiskākais brīdis, kad šo novirzi var atpazīt un labot.
Uzmanību: pirms priecājaties, ja mainīgais “ļoti uzlabo prognozēšanas spēku”, pajautājiet: vai šis mainīgais patiešām ir pareģošanas brīdī, vai arī tas attiecas uz nākotni? Rezultāts, kas izskatās pārāk labs, bieži liecina par noplūdi.
Kā izmantot AI datu sagatavošanā
1) Datu kvalitātes pārbaude:
Jūsu loma: datu kvalitātes asistents. Jums ir aktuārā politikas ienesīgums. Slejas: politikas_id, sākuma_datums, beigu_datums, vecums, reģions, transportlīdzekļa_vecums, piemaksa, pretenziju_skaits, pretenziju_summa.Sniedziet man kontrolsarakstu un Python (pandas) koda skici:- Saskaitiet trūkstošās vērtības pa kolonnām.- Atzīmējiet nepamatotas vērtības (negatīva piemaksa, vecums <16 vai >100, no sākuma/beigas gadiem). NAV izdzēst; Vienkārši ziņojiet, lai es varu izlemt.
2) Funkciju atvasināšana:
Es vēlos iegūt jaunas funkcijas no saviem trafika datiem. Pieejams: vecums, transportlīdzekļa_vecums, reģions, gada_km, lietojuma_veids.- Kuras vecuma un km grupas (binning) jūs ieteiktu, kāpēc?- Kā es varu veikt uz risku balstītu "reģiona" kodēšanu bez datu noplūdes?- Iesakiet 3 jaunas funkcijas, kuras ir vērts izmēģināt, un uzrakstiet katrai no tām aktuāro pamatojumu. Es izlemšu.
3) Noplūdes pārbaude:
Mans modelis paredz bojājumu IESPĒJAMĪBU ar šādiem mainīgajiem: vecums, reģions, transportlīdzekļa_vecums, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Kurš no šiem mainīgajiem rada datu noplūdes risku? Katram izvērtējiet, vai tas būs pieejams pareģošanas brīdī. Uzskaitiet aizdomīgos un kāpēc.
4) Ekspozīcijas normalizācija:
Dažas no manām politikām sākas gada vidū. Izskaidrojiet un iekodējiet iedarbības normalizēšanu, lai pareizi aprēķinātu biežumu: biežums = kopējais prasību_skaits / kopējais riska darījumu skaits (politikas gads). Parādiet ar piemēru, kā aprēķināt polises ekspozīciju, kas sākas gada vidū.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Notīriet datus un sagatavojiet tos modelim.
AI nezina, kura kolonna ir kura, biznesa noteikumi, iedarbības definīcija; Tas var akli dzēst un aizpildīt un sabojāt datus.
Spēcīga uzvedne:
Jūsu loma: aktuāra datu sagatavošanas palīgs.Datu vārdnīca: politikas_id (identitāte), sākuma/beigu_datums (polises periods),vecums (paredzams 16-90), prēmija (jābūt >0), prasījumu_skaits (>=0), prasījuma_summa (>=0).Uzdevums:1) Uzrakstiet saprātīguma noteikumu katrai kolonnai un ATZIŅOTI par daļējām stratēģijām, lai aprēķinātu G iedarbības kodus.3). par trūkstošo "vecumu" (dzēst). / vidējais / atsevišķa kategorija) norādīts ar plus-mīnusu; Atstājiet lēmumu manā ziņā.4) Brīdiniet, ja ir kolonna, kas var radīt noplūdes risku.Jebkura ieraksta automātiska dzēšana; Es apstiprināšu katru lēmumu.
trīs mini futrāļi
1. gadījums — ekspozīcijas kļūda. Vienā portfelī īstermiņa (3 mēnešu) ceļojumu polises tika skaitītas kā pilni gadi, tāpēc biežums bija četras reizes mazāks nekā patiesībā; Cena nokritās nepareizi. Kad aktuārs aprēķināja riska darījumu kā daļu (0,25 polises gadā), tika atklāts reālais biežums un tarifs tika koriģēts. AI ģenerēts daļējas ekspozīcijas kods; Aktuārs sniedza definīciju.
2. gadījums — latenta noplūde. Kad palīgs bojājuma varbūtības modelim pievienoja mainīgo “faila aizvēršanas laiks”, precizitāte ievērojami palielinājās. Prieks bija īslaicīgs: šo mainīgo varēja uzzināt tikai pēc bojājuma nodarīšanas, kas nozīmē, ka prognozēšanas brīdī tas nebija pieejams. Kad noplūdes mainīgais tika noņemts, modelis samazinājās līdz reālistiskam līmenim. Viņš slavēja AI mainīgo kā "spēcīgu prognozētāju"; Aktuāra spriedums nokļuva slazdā.
3. gadījums — aizspriedumu atkārtošana. Viens uzņēmums no vēsturiskajiem datiem atvasināja “lietojumprogrammas noraidīšanas” modeli un ievietoja to jaunajā modelī. Analīze parādīja, ka pagātnes noraidījumi bija nesamērīgi koncentrēti noteiktā apkaimē, kas nozīmē, ka pastāv vēsturiska neobjektivitāte. Šī funkcija tika noņemta no modeļa un aizstāta ar neitrālākiem riska rādītājiem. AI sagatavoja analīzi, mērot modeļa pārklāšanos ar apkārtni; Ētisku lēmumu pieņēma aktuārs un atbilstības nodaļa.
Biežas kļūdas
- Trūkstošo vērtību aizpildīšana ar vidējo bez domāšanas. Pats trūkums var būt zināšanas; Aklo aizpildīšana rada aizspriedumus.
- Automātiski dzēst novirzes. Daži ir patiesi malas gadījumi; Dzēšot datus, neatdalot tos no kļūdām, informācija tiek iznīcināta.
- Nenormalizē ekspozīciju. Uzskaitot īsas polises kā pilnus gadus, tiek izkropļota biežums un izkropļota cena.
- Datu noplūdes neievērošana. Pārāk labs rezultāts bieži vien liecina par mainīgo lielumu, kas ietver nākotni; Vaicājiet, vai katrs mainīgais ir klāt prognozēšanas brīdī.
- Netieša neobjektivitāte nākotnē. Netaisnība vēsturiskajos datos var izplūst atvasinātās pazīmēs; Pārbaudiet to funkcijas stadijā.
Rezumējot
Aktuārā modelēšana galvenokārt ir saistīta ar datu sagatavošanu; Ja ievade ir bojāta, arī izvade ir bojāta. Tipiskas problēmas ir trūkstošās vērtības, novirzes, neatbilstības un dublēšanās; Kritiskā aktuāra problēma ir ekspozīcijas normalizēšana. Funkciju inženierija — grupēšana, kodēšana, normalizācija — no datiem iegūst spēcīgākus signālus. Vismānīgākās briesmas ir datu noplūde un netieša novirze; abus uztver tikai aktuāra argumentācija. AI ievērojami paātrina šo darbību: skenēšana ģenerē kodu un ieteikumus. Taču automātiski neizdzēsiet nekādus ierakstus, ļaujiet cilvēkiem pārbaudīt, vai nav noplūdes un novirzes, un apstiprināt katru reklāmguvumu.
Lietojumprogrammas uzdevums
Sagatavojiet nelielu anonīmu politikas datu vārdnīcu (5–7 kolonnas, katras saprātīgs diapazons). Lūdziet mākslīgajam intelektam (a) saprātīguma noteikumu un pārkāpuma ziņojuma kodu katrai kolonnai, (b) daļējas ekspozīcijas aprēķinu, (c) ieteikumus par 3 jaunām funkcijām, ko izmēģināt. Pēc tam pievienojiet sarakstam apzinātu “noplūdes slazda” mainīgo (piemēram, “izmaksātā kompensācija”) un pārbaudiet, vai mākslīgais intelekts to uztver kā noplūdi.
kontrolsaraksts
- [ ] Vai pirms trūkstošo un izņēmuma gadījumu dzēšanas esmu analizējis iemeslu?
- [ ] Vai esmu pareizi frakcionējis un normalizējis ekspozīciju?
- [ ] Vai esmu uzrakstījis aktuāro pamatojumu katrai jaunatvasinātajai pazīmei?
- [ ] Vai esmu apšaubījis, vai katrs mainīgais faktiski pastāv (noplūde) prognozēšanas brīdī?
- [ ] Vai esmu skenējis atvasinātajos objektos netiešu novirzi?
- [ ] Vai man nebija AI automātiski izdzēsti ieraksti un es pats neapstiprināju katru lēmumu?