Câștiguri:
- Capacitatea de a detecta valori lipsă, valori aberante, probleme de expunere și de calitate a datelor în datele de politică și deteriorarea datelor cu suport de inteligență artificială și de a produce un proiect de corecție
- Ingineria caracteristicilor (noua derivare a variabilelor, grupare, codificare) si normalizarea expunerii la inteligenta artificiala in contextul potrivit
- Înțelegeți că transformările datelor sugerate de inteligența artificială ar trebui să fie auditate de un actuar împotriva riscului de scurgere de date și de părtinire ascunsă.
Cea mai puțin discutată, dar cea mai consumatoare parte a activității actuariale este pregătirea datelor. Actuarii cu experiență știu că cea mai mare parte a timpului unui proiect de modelare este petrecut cu curățarea, combinarea și corectarea datelor. Indiferent cât de elegant ar fi modelul, dacă datele de intrare sunt corupte, ieșirea este coruptă - pe scurt, „gunoi intră, gunoi afară”. În această unitate, vom vedea problemele tipice ale datelor privind politicile și reclamațiile, cum să le detectăm și să le remediem cu AI și abordarea ingineriei caracteristicilor (variabile noi derivate care sunt mai informative din datele existente).
Un avertisment de la început: pregătirea datelor este un pas aparent tehnic și inocent, dar aici se ascund cele mai periculoase erori. O normalizare incorectă a expunerii, o scurgere de date ascunse sau o părtinire introdusă fără să vrea corupe în tăcere toate modelele ulterioare. AI accelerează foarte mult acest pas, dar dacă este lăsat necontrolat, mărește și riscul.
Probleme tipice ale datelor actuariale
Datele privind politicile și reclamațiile nu ajung aproape niciodată curate. Cele mai frecvente probleme sunt: Valori lipsă: unele polițe au vârsta vehiculului, ocupația sau regiunea necompletate. Umplerea orbește a acestora cu media poate crea părtinire; deficiența în sine poartă uneori informații (dispăruții sunt un grup diferit). Valori aberante: înregistrări ilogice, cum ar fi prima negativă, asigurat de 200 de ani, poliță de expunere zero. Trebuie să se distingă dacă acestea sunt erori de date sau cazuri marginale reale. Incoerență: ortografii diferite ale aceleiași regiuni („Istanbul”, „Istanbul”, „34”), confuzie în formatul datei. Intrări duplicate: introducerea aceluiași prejudiciu de două ori.
Dar cea mai critică problemă specifică actuariale este expunerea. Dacă o poliță începe la jumătatea anului, aceasta oferă o expunere fracțională (de exemplu, 0,5 ani) pentru acel an, nu un „an-politică” complet. Frecvența și ratele de deteriorare ar trebui să fie întotdeauna normalizate la expunere; în caz contrar, politicile pe termen scurt par cu risc ridicat. AI poate codifica calculul expunerii, dar trebuie să furnizați definiția și regula de afaceri.
Următorul tabel rezumă problemele tipice și abordarea corectă:
problema
abordare greșită
abordare corectă
valoare lipsă
Completați totul cu medie
Analizați deficiența; deschide uneori o categorie separată
anormal
Ștergere automată
Distingeți între eroarea de date și lead real
expunerea
Numărați toate polițele pentru 1 an
Calculați expunerea fracționată
Incoerență de categorie
ignora
Potriviți cu dicționarul standard
daune recurente
nu observa
Deduplicați cu câmpuri cheie
Ingineria caracteristicilor: obținerea cunoștințelor din date
Ingineria caracteristicilor este arta de a deriva variabile noi care sunt mai utile modelului din variabilele brute existente. Exemple: „vârstă” de la data nașterii, „grup de vârstă” (binning) de la vârstă, „segment de risc” din marca-model de vehicul, „estimare anuală de kilometraj” din combinația adresa-politică. O caracteristică bună transmite un semnal mai puternic decât datele brute și mărește atât acuratețea, cât și interpretabilitatea modelului.
Trei tehnici sunt utilizate frecvent în munca actuarială. Legare: separarea unei variabile continue (vârstă) în grupuri semnificative; aceasta surprinde relațiile neliniare și face ca tariful să fie lizibil. Codificare: conversia variabilelor categoriale (regiune) într-un format numeric potrivit pentru model; Codarea bazată pe risc (reprezentând fiecare categorie cu propria sa rată de deteriorare) este obișnuită, dar trebuie făcută cu prudență. Normalizare: face totul comparabil împărțind-o la expunerea sa. AI generează rapid codul pentru aceste transformări; Dar trebuie să aprobați logica fiecărei transformări.
Sfat: Codarea țintă este puternică, dar predispusă la scurgeri de date: modelul „trișează” dacă includeți daunele proprii ale unui rând atunci când calculați daunele medii ale unei categorii. Faceți întotdeauna acest lucru în cadrul datelor de antrenament, într-un model de validare încrucișată.
Cel mai insidios pericol: scurgeri de date și părtinire implicită
Scurgerea datelor este introducerea de informații în model care nu există de fapt la momentul predicției. Exemplu clasic: introducerea unei variabile care conține rezultatul, cum ar fi „creanțe plătite”, într-un model care prevede valoarea cererii. Modelul arată perfect în datele de testare, dar este inutil în lumea reală, deoarece informațiile respective nu sunt disponibile în momentul predicției. Scurgerea este adesea ascunsă și surprinsă doar de un raționament actuarial atent - AI de obicei nu observă, uneori chiar lăudând variabila cu scurgeri drept „predictor foarte puternic”.
Al doilea pericol insidios este părtinirea implicită. Dacă datele istorice reprezintă în mod nedrept un anumit grup (de exemplu, o zonă a fost refuzată din punct de vedere istoric prea multe politici), caracteristicile derivate din acele date poartă această părtinire, iar modelul o reproduce în viitor. Faza de inginerie a caracteristicilor este momentul cel mai critic în care această părtinire poate fi recunoscută și corectată.
Atenție: înainte de a vă bucura când o variabilă „îmbunătățește enorm puterea de predicție”, întrebați: este această variabilă prezentă în momentul predicției sau implică viitorul? Un rezultat care arată prea bine este adesea un semn al unei scurgeri.
Cum să utilizați AI în pregătirea datelor
1) Verificarea calității datelor:
Rolul dvs.: asistent pentru calitatea datelor. Aveți un randament al politicii actuariale. Coloane: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount. Dați-mi o listă de verificare și o schiță a codului Python (pandas):- Numărați valorile lipsă pe coloană.- Semnalați valorile nerezonabile (primă negativă, vârstă <16 sau >100, NU (la sfârșitul anilor) de la începutul fracțional. șterge; Doar raportează-l ca să pot decide.
2) Derivarea caracteristicilor:
Doresc să obțin funcții noi din datele mele de trafic. Disponibil: age, vehicle_age, region, annual_km, usage_type.- Ce grupe de vârstă și km (binning) recomandați, de ce?- Cum pot face codificare bazată pe risc pentru „regiune” fără scurgeri de date?- Sugerați 3 funcții noi care merită încercate și scrieți justificarea actuarială pentru fiecare. voi decide.
3) Verificarea scurgerilor:
Modelul meu prezice POSIBILITATEA de daune cu următoarele variabile: vârstă, regiune, vârstă_vehicul, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Care dintre aceste variabile prezintă un risc de scurgere de date? Pentru fiecare, evaluați dacă va fi disponibil la momentul predicției. Enumerați cele suspecte și de ce.
4) Normalizarea expunerii:
Unele dintre polițele mele încep la jumătatea anului. Explicați și codificați normalizarea expunerii pentru a calcula corect frecvența: frecvență = total claim_count / total expunere (policy-an). Arată cu un exemplu cum se calculează expunerea poliței care începe la mijlocul anului.
Prompt slab / Prompt puternic
Prompt slab:
Curățați datele și pregătiți-le pentru model.
AI nu știe care coloană este care, reguli de afaceri, definiție de expunere; Poate șterge orbește, umple și corupe datele.
Solicitare puternică:
Rolul dvs.: asistent de pregătire a datelor actuariale. Dicționar de date: policy_id (identitate), start/end_date (perioada de politică), vârstă (prevăzută 16-90), premium (trebuie să fie >0), claim_count (>=0), claim_amount (>=0). lipsește „vârsta” (șterge). / medie / categorie separată) prezentă cu plus-minus; Lăsați decizia în seama mea.4) Avertizați dacă există o coloană care poate prezenta un risc de scurgere.Ștergerea automată a oricărei înregistrări; Voi aproba fiecare decizie.
trei mini cutii
Cazul 1 – Eroare de expunere. Într-un portofoliu, polițele de călătorie pe termen scurt (3 luni) au fost considerate ca ani întregi, astfel încât frecvența a apărut de patru ori mai mică decât era de fapt; Pretul a scazut incorect. Atunci când actuarul a calculat expunerea ca o fracțiune (0,25 an poliță), frecvența reală a fost dezvăluită și tariful a fost corectat. Codul de expunere fracționat generat de AI; Actuarul a dat definiția.
Cazul 2 – Scurgere latentă. Când un asistent a adăugat variabila „timp de închidere a fișierului” la modelul de probabilitate de deteriorare, precizia a crescut dramatic. Bucuria a fost de scurtă durată: această variabilă a putut fi cunoscută doar după ce a avut loc paguba, ceea ce înseamnă că nu era disponibilă la momentul predicției. Când variabila leaky a fost eliminată, modelul a scăzut la un nivel realist. El a lăudat variabila AI ca un „predictor puternic”; Judecata actuarului a prins capcana.
Cazul 3 – Replicarea părtinirii. O companie a derivat un model de „respingere a aplicației” din datele istorice și l-a introdus în noul model. Analiza a arătat că respingerile din trecut au fost concentrate în mod disproporționat într-un anumit cartier, ceea ce înseamnă că a existat o părtinire istorică. Această caracteristică a fost eliminată din model și înlocuită cu indicatori de risc mai neutri. AI a produs analiza măsurând suprapunerea modelului cu vecinătatea; Decizia etică a fost luată de actuar și unitatea de conformitate.
Greșeli comune
- Completați valorile lipsă cu media fără să vă gândiți. Lipsa însăși poate fi cunoaștere; Completarea orbește creează prejudecăți.
- Ștergeți automat valorile aberante. Unele sunt adevărate cazuri de margine; Ștergerea datelor fără a le separa de erori distruge informațiile.
- Nu normalizează expunerea. Socotirea polițelor scurte ca ani întregi denaturează frecvența și denaturează prețul.
- Nu am observat scurgeri de date. Un rezultat prea bun este adesea un semn al unei variabile care implică viitorul; Întrebați dacă fiecare variabilă este prezentă în momentul predicției.
- Aducerea părtinirii implicite în viitor. Nedreptatea în datele istorice se poate scurge în caracteristici derivate; Verificați-l în etapa de caracteristică.
Pe scurt
Modelarea actuarială se referă în mare parte la pregătirea datelor; Dacă intrarea este coruptă, și ieșirea este coruptă. Problemele tipice sunt valorile lipsă, valorile aberante, inconsecvențele și duplicarea; Problema actuarială critică este normalizarea expunerii. Ingineria caracteristicilor - grupare, codificare, normalizare - derivă semnale mai puternice din date. Cele mai insidioase pericole sunt scurgerile de date și părtinirea implicită; ambele sunt surprinse doar de raționamentul actuarial. AI accelerează foarte mult acest pas: scanarea generează cod și recomandări. Dar nu ștergeți automat nicio înregistrare, lăsați oamenii să verifice scurgeri și părtiniri și să aprobe fiecare conversie.
Sarcina de aplicare
Pregătiți un mic dicționar anonim de date privind politicile (5-7 coloane, interval rezonabil pentru fiecare). Solicitați AI (a) regula de rezonanță și codul raportului de încălcare pentru fiecare coloană, (b) calculul expunerii fracționale, (c) sugestii pentru 3 funcții noi de încercat. Apoi adăugați o variabilă intenționată „capcană de scurgere” la listă (de exemplu, „compensație plătită”) și testați dacă AI-ul o prinde ca o scurgere.
lista de verificare
- [ ] Am analizat de ce înainte de a șterge elementele lipsă și aberante?
- [ ] Am fracţionat şi normalizat corect expunerea?
- [ ] Am scris justificarea actuarială pentru fiecare caracteristică nou derivată?
- [ ] M-am întrebat dacă fiecare variabilă este de fapt prezentă (scurgere) la momentul predicției?
- [ ] Am scanat pentru părtinire implicită în caracteristicile derivate?
- [ ] Nu am avut AI să șterg automat orice înregistrări și am aprobat singur fiecare decizie?