Voitot:
- Kyky havaita puuttuvat arvot, poikkeamat, altistumis- ja tietojen laatuongelmat politiikassa ja vahingoittaa tietoja tekoälyn tuella ja tuottaa korjausluonnos
- Ominaisuussuunnittelu (uusi muuttujien johtaminen, ryhmittely, koodaus) ja altistumisen normalisointi tekoälylle oikeassa kontekstissa
- Ymmärrä, että tekoälyn ehdottamat datamuunnokset on tarkastettava aktuaarin toimesta tietovuodon ja piilotettujen harhojen varalta.
Vähiten puhuttu, mutta eniten aikaa vievä osa aktuaarityötä on tietojen valmistelu. Kokeneet aktuaarit tietävät, että suurin osa mallinnusprojektin ajasta kuluu tietojen puhdistamiseen, yhdistämiseen ja korjaamiseen. Riippumatta siitä, kuinka tyylikäs malli on, jos syöttötiedot ovat korruptoituneita, tulos on korruptoitunut - lyhyesti sanottuna "roskaa sisään, roskat ulos". Tässä osiossa näemme tyypillisiä käytäntö- ja vaatimustietojen ongelmia, niiden havaitsemista ja korjaamista tekoälyn avulla sekä ominaisuussuunnittelun (johdettu uudet muuttujat, jotka ovat informatiivisempia olemassa olevasta tiedosta) lähestymistapaa.
Varoitus alusta alkaen: tietojen valmistelu on näennäisesti tekninen ja viaton askel, mutta tässä piilevät vaarallisimmat virheet. Virheellinen valotuksen normalisointi, piilotettu tietovuoto tai tahattomasti käyttöön otettu harha turmelee kaikki myöhemmät mallit. Tekoäly nopeuttaa tätä vaihetta huomattavasti, mutta jos se jätetään hallitsematta, se myös lisää riskiä.
Vakuutusmatemaattisten tietojen tyypillisiä ongelmia
Käytäntö- ja korvaustiedot eivät lähes koskaan toimi puhtaina. Yleisimmät ongelmat ovat: Puuttuvat arvot: joissakin käytännöissä on tyhjä ajoneuvon ikä, ammatti tai alue. Näiden sokea täyttäminen keskiarvolla voi aiheuttaa harhaa; puute itsessään sisältää joskus tietoa (puuttuvat ovat eri ryhmä). Outliers: epäloogiset tietueet, kuten negatiivinen vakuutusmaksu, 200 vuotta vanha vakuutettu, nollariskivakuutus. On erotettava, ovatko nämä tietovirheitä vai todellisia reunatapauksia. Epäjohdonmukaisuus: saman alueen eri kirjoitusasu ("Istanbul", "Istanbul", "34"), päivämäärämuodon sekaannus. Päällekkäiset merkinnät: sama vahinko kahdesti.
Mutta kaikkein kriittisin vakuutusmatemaattinen ongelma on altistuminen. Jos vakuutus alkaa vuoden puolivälissä, se tarjoaa murto-osan (esim. 0,5 vuotta) kyseiselle vuodelle, ei koko "vakuutusvuodelle". Taajuus ja vaurioiden määrä tulee aina normalisoida altistumiseen; Muutoin lyhyen aikavälin sopimukset vaikuttavat suurelta riskiltä. Tekoäly voi koodata altistumislaskelman, mutta sinun on annettava määritelmä ja liiketoimintasääntö.
Seuraavassa taulukossa on yhteenveto tyypillisistä ongelmista ja oikeasta lähestymistavasta:
ongelma
väärä lähestymistapa
oikea lähestymistapa
puuttuva arvo
Täytä kaikki keskiarvolla
Analysoi puute; joskus avata erillinen luokka
poikkeava
Automaattinen poisto
Erota datavirhe ja todellinen liidi
altistuminen
Laske kaikki vakuutukset vuodeksi
Laske murto-altistus
Luokan epäjohdonmukaisuus
jättää huomiotta
Vastaa vakiosanakirjan kanssa
toistuvia vahinkoja
älä huomaa
Poista kaksoiskappale avainkentillä
Ominaisuussuunnittelu: tiedon johtaminen tiedoista
Ominaisuussuunnittelu on taidetta johtaa olemassa olevista raakamuuttujista uusia, mallille hyödyllisempiä muuttujia. Esimerkkejä: "ikä" syntymäajasta, "ikäryhmä" (binning) iästä, "riskisegmentti" ajoneuvon merkistä, "vuosittainen ajokilometriarvio" osoitteen ja politiikan yhdistelmästä. Hyvä ominaisuus välittää voimakkaamman signaalin kuin raakadata ja lisää sekä mallin tarkkuutta että tulkittavuutta.
Aktuaarityössä käytetään usein kolmea tekniikkaa. Sidonta: jatkuvan muuttujan (ikä) erottaminen merkityksellisiin ryhmiin; tämä kaappaa epälineaariset suhteet ja tekee tariffista luettavan. Koodaus: kategoristen muuttujien (alue) muuntaminen mallille sopivaan numeeriseen muotoon; Riskiin perustuva koodaus (joka edustaa jokaista luokkaa omalla vauriotasolla) on yleistä, mutta sitä tulee tehdä varoen. Normalisointi: kaiken tekeminen vertailukelpoiseksi jakamalla se altistuksella. AI luo nopeasti koodin näitä muunnoksia varten; Mutta sinun on hyväksyttävä jokaisen muunnoksen logiikka.
Vinkki: Kohdekoodaus on tehokas, mutta altis tietovuodolle: malli "huijaa", jos sisällytät rivin oman vahingon laskettaessa luokan keskimääräistä vahinkoa. Tee tämä aina harjoitustietojen sisällä ristiinvalidointimallissa.
Kaikkein salakavalin vaara: tietovuodot ja implisiittinen harha
Tietovuoto on sellaisen tiedon tuomista malliin, jota ei ennustushetkellä todellisuudessa ole olemassa. Klassinen esimerkki: tuloksen sisältävän muuttujan, kuten "maksetut korvaukset", lisääminen malliin, joka ennustaa korvauksen määrän. Malli näyttää täydelliseltä testitiedoissa, mutta on hyödytön todellisessa maailmassa, koska tiedot eivät ole saatavilla ennustushetkellä. Vuoto on usein piilotettu, ja se jää kiinni vain huolelliseen vakuutusmatemaattiseen päättelyyn – tekoäly ei yleensä huomaa, joskus jopa ylistää vuotavaa muuttujaa "erittäin voimakkaaksi ennustajaksi".
Toinen salakavala vaara on implisiittinen ennakkoluulo. Jos historialliset tiedot edustavat epäoikeudenmukaisesti tiettyä ryhmää (esimerkiksi alueelta on historiallisesti evätty liian monta käytäntöä), tiedoista johdetut ominaisuudet sisältävät tämän harhan ja malli toistaa sen tulevaisuuteen. Ominaisuuden suunnitteluvaihe on kriittisin hetki, jolloin tämä harha voidaan tunnistaa ja korjata.
Varoitus: Ennen kuin iloitset, kun muuttuja "parantaa ennustusvoimaa valtavasti", kysy: onko tämä muuttuja todella läsnä ennustuksen aikaan vai liittyykö siihen tulevaisuus? Liian hyvältä näyttävä tulos on usein merkki vuodosta.
Kuinka käyttää tekoälyä tietojen valmistelussa
1) Tietojen laadun seulonta:
Sinun roolisi: tiedonlaadun avustaja. Sinulla on vakuutusmatemaattinen tuotto. Sarakkeet: policy_id, start_date, end_date,age, region, vehicle_age, premium, korvauksen_määrä, korvauksen_määrä.Anna minulle tarkistuslista ja Python (panda)-koodiluonnos:- Laske puuttuvat arvot sarakkeittain.- Merkitse kohtuuttomat arvot (negatiivinen palkkio, ikä <16 tai >100, ikä alkaa/lasketaan DOalku). ÄLÄ poista; Ilmoita vain, jotta voin päättää.
2) Ominaisuuden johtaminen:
Haluan saada uusia ominaisuuksia liikennetiedoistani. Saatavilla: ikä, ajoneuvon_ikä, alue, vuosikilometri, käyttötyyppi.- Mitä ikä- ja kilometriryhmiä (binning) suosittelet, miksi?- Kuinka voin tehdä riskiperusteisen koodauksen "alueelle" ilman tietovuotoa?- Ehdota kolmea uutta ominaisuutta, joita kannattaa kokeilla, ja kirjoita jokaiselle vakuutusmatemaattinen perustelu. Minä päätän.
3) Vuototarkastus:
Mallini ennustaa vahingon MAHDOLLISUUDEN seuraavilla muuttujilla: ikä, alue, ajoneuvon_ikä, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Mikä näistä muuttujista aiheuttaa tietovuotojen riskin? Arvioi jokaisen kohdalla, onko se saatavilla ennusteen tekohetkellä. Luettele epäilyttävät ja miksi.
4) Altistuksen normalisointi:
Jotkut politiikoistani alkavat vuoden puolivälissä. Selitä ja koodaa altistumisen normalisointi, jotta voit laskea esiintymistiheyden oikein: toistuvuus = vahinkojen kokonaismäärä / kokonaisaltistuminen (vakuutusvuosi). Näytä esimerkillä, kuinka lasketaan vuoden puolivälissä alkavan vakuutuksen altistuminen.
Heikko kehote / Vahva kehote
Heikko kehote:
Puhdista tiedot ja valmista ne mallia varten.
Tekoäly ei tiedä, mikä sarake on mikä, liiketoimintasäännöt, altistumisen määritelmä; Se voi sokeasti poistaa ja täyttää ja vioittaa tiedot.
Tehokas kehotus:
Roolisi: vakuutusmatemaattisten tietojen valmisteluassistentti. Tietosanakirja: policy_id (identiteetti), aloitus/lopetuspäivä (vakuutuskausi), ikä (odotettu 16-90), palkkio (täytyy olla >0), korvausmäärä (>=0), korvausmäärä (>=0). Tehtävä: 1) Kirjoita kohtuullisuussääntö jokaiselle sarakkeelle ja RAPORTOINTI eri rikkomuksista (poistokoodit)3. puuttuvan "iän" vuoksi (poista). / keskimääräinen / erillinen luokka) plus-miinus; Jätä päätös minulle.4) Varoita, jos sarakkeessa voi olla vuotoriski. Tietueiden automaattinen poistaminen; Hyväksyn jokaisen päätöksen.
kolme minilaukkua
Tapaus 1 – Valotusvirhe. Yhdessä salkussa lyhytaikaiset (3 kk) matkavakuutukset laskettiin täysiksi vuosiksi, joten esiintymistiheys oli neljä kertaa pienempi kuin se todellisuudessa oli; Hinta putosi väärin. Kun aktuaari laski riskin murto-osana (0,25 vakuutusvuotta), todellinen esiintymistiheys paljastui ja tariffi korjattiin. AI luotu murto-altistuskoodi; Aktuaari antoi määritelmän.
Tapaus 2 – Piilevä vuoto. Kun apulainen lisäsi "tiedoston sulkemisaika" -muuttujan vaurion todennäköisyysmalliin, tarkkuus parani dramaattisesti. Ilo oli lyhytaikainen: tämä muuttuja voitiin tietää vasta vahingon sattumisen jälkeen, eli se ei ollut käytettävissä ennustehetkellä. Kun vuotava muuttuja poistettiin, malli laski realistiselle tasolle. Hän kehui tekoälymuuttujaa "voimakkaaksi ennustajaksi"; Vakuutusmatemaatin tuomio osui ansaan.
Tapaus 3 – harhan replikointi. Yksi yritys johti "sovelluksen hylkäys" -mallin historiallisista tiedoista ja lisäsi sen uuteen malliin. Analyysi osoitti, että aiemmat hylkäämiset keskittyivät suhteettoman paljon tietylle alueelle, mikä tarkoittaa, että kyseessä oli historiallinen harha. Tämä ominaisuus poistettiin mallista ja korvattiin neutraalemmilla riskiindikaattoreilla. AI tuotti analyysin, joka mittasi kuvion päällekkäisyyttä naapuruston kanssa; Eettisen päätöksen tekivät aktuaari ja vaatimustenmukaisuusyksikkö.
Yleisiä virheitä
- Puuttuvien arvojen täyttäminen keskiarvolla ajattelematta. Puute itsessään voi olla tietoa; Sen täyttäminen sokeasti luo ennakkoluuloja.
- Poista poikkeamat automaattisesti. Jotkut ovat todellisia reunatapauksia; Tietojen poistaminen erottamatta niitä virheistä tuhoaa tiedot.
- Ei normalisoi altistusta. Lyhyiden vakuutusten laskeminen kokonaisiksi vuosiksi vääristää taajuutta ja vääristää hintaa.
- Tietovuotoa ei huomaa. Liian hyvä tulos on usein merkki tulevaisuuteen liittyvästä muuttujasta; Kysy, onko jokainen muuttuja läsnä ennustushetkellä.
- Tuo implisiittistä ennakkoluulottomuutta tulevaisuuteen. Epäoikeudenmukaisuus historiallisissa tiedoissa voi vuotaa johdetuiksi piirteiksi; Tarkista se ominaisuusvaiheessa.
Yhteenvetona
Vakuutusmatemaattinen mallinnus on suurelta osin tietojen valmistelua; Jos tulo on vioittunut, myös lähtö on vioittunut. Tyypillisiä ongelmia ovat puuttuvat arvot, poikkeamat, epäjohdonmukaisuudet ja päällekkäisyys; Kriittinen vakuutusmatemaattinen ongelma on altistumisen normalisointi. Ominaisuussuunnittelu – ryhmittely, koodaus, normalisointi – saa datasta vahvempia signaaleja. Kaikkein salakavalimpia vaaroja ovat tietovuoto ja implisiittinen harha; molemmat ovat vain vakuutusmatemaattisten päätelmien mukaisia. Tekoäly nopeuttaa tätä vaihetta huomattavasti: skannaus luo koodia ja suosituksia. Älä kuitenkaan poista automaattisesti tietueita, anna ihmisten tarkistaa vuodot ja harha ja hyväksyä jokainen muunnos.
Sovellustehtävä
Valmistele pieni anonyymi käytäntötietosanakirja (5–7 saraketta, kohtuullinen valikoima kutakin). Pyydä tekoälyltä (a) kohtuullisuussääntö ja rikkomusraporttikoodi jokaiselle sarakkeelle, (b) murto-altistuksen laskenta, (c) ehdotuksia kolmelle uudelle ominaisuudelle. Lisää sitten luetteloon tahallinen "vuotoloukku"-muuttuja (esim. "kompensaatio maksettu") ja testaa, havaitseeko tekoäly sen vuodona.
tarkistuslista
- [ ] Olenko analysoinut miksi ennen puuttuvien ja poikkeavien arvojen poistamista?
- [ ] Olenko fraktioinut ja normalisoinut valotuksen oikein?
- [ ] Olenko kirjoittanut vakuutusmatemaattisen perustelun jokaiselle äskettäin johdetulle ominaisuudelle?
- [ ] Olenko kysynyt, onko jokainen muuttuja todella olemassa (vuoto) ennustushetkellä?
- [ ] Olenko tarkistanut johdettujen ominaisuuksien epäsuoraa harhaa?
- [ ] Enkö tehnyt tekoälyä automaattisesti poistamaan tietueita ja hyväksynyt jokaista päätöstä itse?