Vienetas 6 / 11

Duomenų paruošimas ir funkcijų inžinerija: aktuarinių duomenų tvarkymas naudojant dirbtinį intelektą

Pelnas:

  • Galimybė aptikti trūkstamas vertes, iškrypimus, poveikio ir duomenų kokybės problemas politikoje ir sugadinti duomenis naudojant dirbtinio intelekto palaikymą bei parengti taisymo juodraštį
  • Funkcijų inžinerija (naujas kintamųjų išvedimas, grupavimas, kodavimas) ir poveikio normalizavimas dirbtiniam intelektui su tinkamu kontekstu
  • Supraskite, kad dirbtinio intelekto pasiūlytas duomenų transformacijas turėtų patikrinti aktuaras, kad išvengtų duomenų nutekėjimo ir paslėpto šališkumo.

Mažiausiai kalbama, bet daugiausiai laiko atimanti aktuarinio darbo dalis yra duomenų paruošimas. Patyrę aktuarai žino, kad didžioji dalis modeliavimo projekto laiko tenka duomenų valymui, derinimui ir taisymui. Nesvarbu, koks elegantiškas modelis, jei įvesties duomenys yra sugadinti, išvestis yra sugadinta – trumpai tariant, „šiukšlės įvedamos, išvežtos šiukšlės“. Šiame skyriuje pamatysime tipines politikos ir pretenzijų duomenų problemas, kaip jas aptikti ir išspręsti naudojant AI, ir funkcijų inžinerijos (iš esamų duomenų gauti nauji kintamieji, kurie yra informatyvesni) metodą.

Perspėjimas nuo pat pradžių: duomenų paruošimas – iš pažiūros techninis ir nekaltas žingsnis, tačiau čia slepiasi pavojingiausios klaidos. Neteisingas ekspozicijos normalizavimas, paslėptas duomenų nutekėjimas arba netyčia įvestas šališkumas tyliai sugadina visus tolesnius modelius. AI labai pagreitina šį žingsnį, tačiau jei jis nekontroliuojamas, jis taip pat padidina riziką.

Tipinės aktuarinių duomenų problemos

Politikos ir pretenzijų duomenys beveik niekada nėra švarūs. Dažniausios problemos yra šios: Trūkstamos reikšmės: kai kuriose taisyklėse nenurodytas transporto priemonės amžius, profesija arba regionas. Aklai užpildžius juos vidurkiu, gali atsirasti šališkumo; pats trūkumas kartais neša informaciją (trūkstantys yra kita grupė). Nukrypimai: nelogiški įrašai, pvz., neigiama įmoka, 200 metų senumo draudimas, nulinės rizikos politika. Reikia atskirti, ar tai duomenų klaidos, ar tikrosios briaunos atvejai. Nenuoseklumas: skirtingos to paties regiono rašybos („Stambulas“, „Stambulas“, „34“), datos formato painiava. Pasikartojantys įrašai: tos pačios žalos įrašymas du kartus.

Tačiau svarbiausias aktuarinis klausimas yra ekspozicija. Jei politika pradedama taikyti metų viduryje, ji suteikia dalį tų metų poveikio (pvz., 0,5 metų), o ne visus „politikos metus“. Dažnis ir žalos rodikliai visada turi būti normalizuoti pagal poveikį; kitu atveju trumpalaikė politika atrodo didelė rizikinga. AI gali užkoduoti poveikio skaičiavimą, tačiau turite pateikti apibrėžimą ir verslo taisyklę.

Šioje lentelėje apibendrinamos tipinės problemos ir teisingas požiūris:

problema

neteisingas požiūris

teisingas požiūris

trūkstamos vertės

Užpildykite viską vidutiniškai

Išanalizuoti trūkumą; kartais atidarykite atskirą kategoriją

išskirtinis

Automatinis ištrynimas

Atskirkite duomenų klaidą ir tikrąjį laidą

ekspozicija

Skaičiuokite visas politikos priemones 1 metams

Apskaičiuokite dalinę ekspoziciją

Kategorijos neatitikimas

ignoruoti

Suderinti su standartiniu žodynu

pasikartojanti žala

nepastebėti

Pašalinkite pasikartojimą naudodami pagrindinius laukus

Funkcijų inžinerija: žinių gavimas iš duomenų

Funkcijų inžinerija yra naujų modeliui naudingesnių kintamųjų iš esamų neapdorotų kintamųjų išvedimo menas. Pavyzdžiai: „amžius“ nuo gimimo datos, „amžiaus grupė“ (sujungimas) iš amžiaus, „rizikos segmentas“ pagal transporto priemonės modelį, „metinis ridos įvertinimas“ iš adreso ir politikos derinio. Gera funkcija perduoda stipresnį signalą nei neapdoroti duomenys ir padidina modelio tikslumą bei aiškinamumą.

Aktuariniame darbe dažnai naudojami trys metodai. Įrišimas: tęstinio kintamojo (amžiaus) atskyrimas į reikšmingas grupes; tai užfiksuoja nelinijinius ryšius ir leidžia įskaityti tarifą. Kodavimas: kategorinių kintamųjų (regiono) konvertavimas į modeliui tinkamą skaitmeninį formatą; Rizika pagrįstas kodavimas (atstovaujantis kiekvienai kategorijai su savo žalos lygiu) yra įprastas, tačiau jį reikia daryti atsargiai. Normalizavimas: viską galima palyginti, padalijus iš ekspozicijos. AI greitai sugeneruoja šių transformacijų kodą; Bet jūs turite patvirtinti kiekvienos transformacijos logiką.

Patarimas: Tikslinė koduotė yra galinga, bet linkusi į duomenų nutekėjimą: modelis „apgauna“, jei skaičiuodami vidutinę kategorijos žalą įtraukiate pačios eilutės žalą. Visada darykite tai treniruočių duomenimis, kryžminio patvirtinimo būdu.

Labiausiai klastingas pavojus: duomenų nutekėjimas ir numanomas šališkumas

Duomenų nutekėjimas yra informacijos įvedimas į modelį, kurios prognozavimo metu iš tikrųjų nėra. Klasikinis pavyzdys: kintamojo, kuriame yra rezultatas, pvz., „apmokėtos pretenzijos“, įvedimas į modelį, kuris numato ieškinio sumą. Modelis atrodo nepriekaištingai bandymo duomenyse, bet yra nenaudingas realiame pasaulyje, nes prognozavimo metu tos informacijos nėra. Nutekėjimas dažnai yra paslėptas ir pagaunamas tik kruopščiais aktuariniais samprotavimais – AI paprastai nepastebi, kartais net giria nutekėjusį kintamąjį kaip „labai galingą prognozuotoją“.

Antrasis klastingas pavojus yra numanomas šališkumas. Jei istoriniai duomenys nesąžiningai atspindi tam tikrą grupę (pavyzdžiui, srityje istoriškai buvo atsisakyta per daug politikos nuostatų), iš tų duomenų gautos funkcijos turi tą šališkumą ir modelis atkartoja jį ateityje. Funkcijos inžinerijos etapas yra pats svarbiausias momentas, kai galima atpažinti ir ištaisyti šį paklaidą.

Atsargiai: prieš džiaugdamiesi, kai kintamasis „labai pagerina nuspėjamąją galią“, paklauskite: ar šis kintamasis iš tikrųjų yra numatymo metu, ar jis susijęs su ateitimi? Per gerai atrodantis rezultatas dažnai yra nutekėjimo požymis.

Kaip naudoti AI rengiant duomenis

1) Duomenų kokybės patikra:

Jūsų vaidmuo: duomenų kokybės asistentas. Jūs turite aktuarinės politikos pajamingumą. Stulpeliai: politikos_id, pradžios_data, pabaigos_data, amžius, regionas, transporto priemonės_amžius, priemoka, pretenzijų_skaičius, pretenzijos_suma. Pateikite kontrolinį sąrašą ir Python (pandos) kodo eskizą:- Suskaičiuokite trūkstamas reikšmes pagal stulpelius.- Pažymėkite nepagrįstas reikšmes (neigiama priemoka, amžius <16 arba >100, ekspozicijos pradžia/pabaigos metai.pradžioje). NEGALIMA ištrinti; Tiesiog praneškite, kad galėčiau nuspręsti.

2) Funkcijų išvedimas:

Iš savo srauto duomenų noriu gauti naujų funkcijų. Pasiekiama: amžius, transporto priemonės_amžius, regionas, metinis_km, naudojimo_tipas.- Kurias amžiaus ir km grupes (sugrupavimas) rekomenduojate, kodėl?- Kaip galiu atlikti rizika pagrįstą „regiono“ kodavimą be duomenų nutekėjimo?- Pasiūlykite 3 naujas funkcijas, kurias verta išbandyti, ir parašykite kiekvienos iš jų aktuarinį pagrindimą. Aš nuspręsiu.

3) Nuotėkio patikrinimas:

Mano modelis numato žalos GALIMYBĘ su šiais kintamaisiais: amžius, regionas, transporto priemonės_amžius, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Kurie iš šių kintamųjų kelia duomenų nutekėjimo pavojų? Kiekvienam įvertinkite, ar ji bus prieinama numatymo metu. Išvardykite įtartinus ir kodėl.

4) Ekspozicijos normalizavimas:

Kai kurios mano politikos taikomos metų viduryje. Paaiškinkite ir užkoduokite poveikio normalizavimą, kad teisingai apskaičiuotumėte dažnį: dažnis = bendras pretenzijų_ skaičius / bendra rizika (politikos metai). Pateikite pavyzdį, kaip apskaičiuoti politikos, kuri prasideda metų viduryje, poveikį.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Išvalykite duomenis ir paruoškite juos modeliui.

AI nežino, kuris stulpelis yra kuris, verslo taisyklės, poveikio apibrėžimas; Jis gali aklai ištrinti, užpildyti ir sugadinti duomenis.

Galingas raginimas:

Jūsų vaidmuo: aktuarinių duomenų rengimo asistentas.Duomenų žodynas: policy_id (tapatybė), pradžios/pabaigos_data (poliso laikotarpis),amžius (numatomas 16-90), priemoka (turi būti >0), pretenzijų_skaičius (>=0), pretenzijos_suma (>=0).Užduotis:1) Parašykite kiekvieno stulpelio pagrįstumo taisyklę ir ATASKAITĄ apie skirtingus pažeidimus (ištrynimo kodus).3) dėl trūkstamo „amžiaus“ (išbraukti). / vidutinis / atskira kategorija) pateikti su pliusu-minusu; Palikite sprendimą man.4) Įspėkite, jei yra stulpelis, kuris gali kelti nutekėjimo pavojų. Automatinis bet kurio įrašo ištrynimas; Pritarsiu kiekvienam sprendimui.

trys mini dėklai

1 atvejis – ekspozicijos klaida. Viename portfelyje trumpalaikės (3 mėnesių) kelionių polisai buvo skaičiuojami kaip pilni metai, todėl dažnis pasirodė keturis kartus mažesnis nei buvo iš tikrųjų; Kaina nukrito neteisingai. Kai aktuaras apskaičiavo poziciją kaip trupmeną (0,25 poliso metų), buvo atskleistas tikrasis dažnis ir patikslintas tarifas. AI sugeneruotas trupmeninės ekspozicijos kodas; Aktuaras pateikė apibrėžimą.

2 atvejis – latentinis nuotėkis. Kai pagalbininkas prie žalos tikimybės modelio pridėjo „failo uždarymo laiko“ kintamąjį, tikslumas labai padidėjo. Džiaugsmas buvo trumpalaikis: šį kintamąjį buvo galima sužinoti tik po to, kai buvo padaryta žala, o tai reiškia, kad prognozavimo metu jis nebuvo prieinamas. Pašalinus nesandarią kintamąjį, modelis sumažėjo iki realaus lygio. Jis gyrė AI kintamąjį kaip „galingą prognozuotoją“; Aktuarijos sprendimas pakliuvo į spąstus.

3 atvejis – šališkumo atkartojimas. Viena įmonė iš istorinių duomenų išvedė „programos atmetimo“ modelį ir įtraukė jį į naują modelį. Analizė parodė, kad praeities atmetimai buvo neproporcingai sutelkti tam tikroje kaimynystėje, o tai reiškia, kad buvo istorinis šališkumas. Ši funkcija buvo pašalinta iš modelio ir pakeista neutralesniais rizikos rodikliais. AI parengė analizę, matuojant modelio sutapimą su kaimynyste; Etinį sprendimą priėmė aktuarijus ir atitikties skyrius.

Dažnos klaidos

  • Trūkstamų reikšmių užpildymas vidurkiu negalvojant. Pats trūkumas gali būti žinios; Aklai jį pildydami sukuriamas išankstinis nusistatymas.
  • Automatiškai ištrinti nukrypimus. Kai kurie yra tikri atvejai; Duomenų ištrynimas neatskiriant jų nuo klaidų sunaikina informaciją.
  • Nenormalizuoja ekspozicijos. Skaičiuojant trumpus polisus kaip ištisus metus, iškreipiamas dažnis ir iškreipiama kaina.
  • Nepastebi duomenų nutekėjimo. Per geras rezultatas dažnai yra kintamojo, apimančio ateitį, ženklas; Užklausa, ar kiekvienas kintamasis yra numatymo metu.
  • Netiesioginio šališkumo įtraukimas į ateitį. Istorinių duomenų neteisingumas gali nutekėti į išvestinius požymius; Patikrinkite tai funkcijos etape.

Apibendrinant

Aktuarinis modeliavimas daugiausia susijęs su duomenų paruošimu; Jei įvestis sugadinta, išvestis taip pat yra sugadinta. Tipiškos problemos yra trūkstamos reikšmės, nuokrypiai, neatitikimai ir dubliavimasis; Esminis aktuarinis klausimas yra poveikio normalizavimas. Funkcijų inžinerija – grupavimas, kodavimas, normalizavimas – iš duomenų gauna stipresnius signalus. Labiausiai klastingi pavojai yra duomenų nutekėjimas ir numanomas šališkumas; abu yra užfiksuoti tik aktuariniais samprotavimais. AI labai pagreitina šį veiksmą: nuskaitymas generuoja kodą ir rekomendacijas. Tačiau automatiškai neištrinkite jokių įrašų, leiskite žmonėms patikrinti, ar nėra nutekėjimo ir šališkumo, ir patvirtinti kiekvieną konversiją.

Taikymo užduotis

Paruoškite nedidelį anoniminį politikos duomenų žodyną (5–7 stulpeliai, tinkamas kiekvieno iš jų diapazonas). Paprašykite dirbtinio intelekto (a) pagrįstumo taisyklės ir pažeidimo ataskaitos kodo kiekvienam stulpeliui, (b) dalinio poveikio skaičiavimui, (c) pasiūlymų dėl 3 naujų funkcijų, kurias reikia išbandyti. Tada į sąrašą įtraukite tyčinį „nuotėkio spąstų“ kintamąjį (pvz., „išmokėta kompensacija“) ir patikrinkite, ar dirbtinis intelektas jį užfiksuoja kaip nuotėkį.

kontrolinis sąrašas

  • [ ] Ar išanalizavau kodėl prieš ištrindamas trūkstamus ir išskirtinius duomenis?
  • [ ] Ar teisingai suskaidžiau ir normalizavau ekspoziciją?
  • [ ] Ar parašiau kiekvieno naujai gauto požymio aktuarinį pagrindimą?
  • [ ] Ar aš suabejojau, ar kiekvienas kintamasis iš tikrųjų yra (nutekėjimas) numatymo metu?
  • [ ] Ar nuskaitau, ar išvestinėse funkcijose nėra numanomo šališkumo?
  • [ ] Ar aš neturėjau PG automatiškai ištrinti jokių įrašų ir pats patvirtinau kiekvieno sprendimo?