Unitate 4 / 11

Prețuri și clasificare a riscurilor: GLM, tarifare și inteligență artificială

Câștiguri:

  • Abilitatea de a stabili model liniar generalizat (GLM), factor de risc, tarif și concepte de primă de risc cu sprijinul inteligenței artificiale și de a traduce coeficienții în limbajul de afaceri
  • Capacitatea de a discuta echilibrul dintre selecția variabilelor, interacțiunea, supraadaptarea și interpretabilitatea modelelor de învățare automată (GBM) cu inteligență artificială
  • A putea înțelege că modelul de prețuri este lipsit de variabile interzise/discriminatorii, iar conformitatea tarifului final cu legislația și concurența este lăsată la latitudinea actuarului.

Prețul unei polițe de asigurare nu este determinat aleatoriu. Riscul unui accident de circulație pentru un șofer de 22 de ani, proaspăt permis, care locuiește într-un oraș mare este statistic mai mare decât cel al unui șofer de 45 de ani cu 20 de ani de experiență; Într-un sistem echitabil, primele ar trebui să fie și ele diferite. Sarcina actuarului de a măsura această diferență și de a o reflecta asupra prețului se numește stabilirea prețurilor și clasificarea riscului. În această unitate, vom discuta despre modelul liniar generalizat (GLM), coloana vertebrală actuarială a prețurilor și alternativele sale de învățare automată și vom vedea cum să folosim în siguranță AI în acest proces.

Câțiva termeni de bază. Factorul de risc este variabila care afectează riscul și este utilizată în stabilirea prețurilor (vârstă, vârsta vehiculului, regiune, utilizare prevăzută). Tariful este un set de reguli care determină modul în care va fi calculată prima în funcție de factorii de risc. Prima de risc este costul pur al pierderii așteptate; Când se adaugă cheltuieli, comisioane, marjele de profit și costurile de capital, se formează prima comercială (prețul de vânzare). Să reamintim de la început: AI sugerează variabile, construiește modele, explică coeficienți; Dar care variabilă este legală și etică și dacă tariful final respectă legislația și concurența aparține actuarului și unității de conformitate.

De ce GLM este standardul în actuariat

Cea mai utilizată metodă de stabilire a prețurilor este GLM. GLM înseamnă „model liniar generalizat”: extinde regresia liniară clasică pentru a se potrivi țintelor nedistribuite în mod normal, cum ar fi datele daune. Are două componente de bază. Familia de distribuție: Poisson este ales pentru frecvență, gamma este ales pentru intensitate (logica în unitatea 2). Funcția de legătură (link): de obicei logaritmică, care permite factorilor să aibă un efect multiplicativ. Structura multiplicativă este foarte valoroasă în actuariat deoarece exact așa este stabilit tariful: prima de bază × factor de vârstă × factor de regiune × factor de vehicul.

Cel mai mare avantaj al GLM este interpretabilitatea. Un coeficient vă spune direct: „grupul de șoferi tineri crește frecvența de 1,6 ori față de grupul de referință”. Această transparență este critică în trei moduri: (1) autoritatea de reglementare și auditul intern pot înțelege și aproba modelul; (2) este vizibil un efect interzis/discriminatoriu; (3) logica prețului poate fi explicată echipei de vânzări și management. Modelele de învățare automată mai complexe (mai jos) oferă uneori o precizie mai mare, dar în detrimentul transparenței.

Sugestie: coeficientul GLM este pe scară logaritmică. Cereți AI să convertească coeficientul într-un „factor de multiplicare” cu exp(coeficient); Ar fi mult mai ușor de tradus în limbajul de afaceri (de exemplu, coeficient 0,47 → factor ≈ 1,60 → „60% mai riscant”).

Selecție variabilă, supraadaptare și învățare automată

Cea mai critică decizie în stabilirea prețurilor este care variabile vor rămâne în model. Sunt două capcane. Puține variabile orbesc modelul: dacă este ratat factorul de risc important, prețul va fi greșit. Prea variabil / supraadaptare face ca modelul să memoreze datele din trecut: modelul confundă zgomotul cu semnal și eșuează cu noile politici. Echilibrul este stabilit prin validare încrucișată - împărțirea datelor în piese de antrenament și test și testarea lor pe date pe care modelul nu le vede, simplitate și raționament actuarial.

Interacțiunea este de asemenea importantă: uneori efectul combinat al doi factori diferă de suma efectelor lor separate (un vehicul tânăr + sportiv poate fi mai riscant decât suma efectelor lor individuale). În GLM, interacțiunile sunt adăugate în mod explicit.

În ultimii ani, modele precum GBM (gradient boosting machine — o metodă puternică de învățare automată care combină mulți arbori de decizie mici) au devenit comune în stabilirea prețurilor. Acestea captează automat modele și interacțiuni complexe, oferind adesea predicții mai precise decât GLM. Dar are un preț: tendința de a fi o „cutie neagră”. Practica comună astăzi este utilizarea GBM pentru descoperire și generare de idei și GLM pentru tariful transparent final; sau interpretarea rezultatelor GBM cu instrumente de explicabilitate, cum ar fi SHAP.

Următorul tabel compară cele două abordări:

criteriu

GLM

GBM (învățare automată)

Interpretabilitate

Ridicat (coeficient activat)

Scăzut (necesită instrument de adnotare)

Captarea interacțiunii

Adăugat manual

automată

Risc de supraadaptare

scăzut-mediu

Ridicat (este necesară o ajustare atentă)

Autoritatea de reglementare/audit

usor

Greu, necesită documente suplimentare

Utilizare tipică

tariful final

descoperire, comparație

Cum să utilizați AI în stabilirea prețurilor

1) Traducerea coeficientului GLM în limbajul de afaceri:

Am configurat o frecvență GLM (Poisson, link link). Unii coeficienți (scara logaritmică): grupa_vârstă_18_25: 0,47 ; regiune_majoritate: 0,22 ; arac_yasi_10plus: -0,15. Convertiți fiecare într-un factor multiplicator cu exp() și explicați-l într-o propoziție pe care un manager o poate înțelege. De asemenea, amintiți-vă care este grupul de referință.

2) Discuție variabilă/interacțiune:

Rolul tău: asistent de prețuri. Variabilele mele candidate pentru modelul de frecvență a traficului sunt: ​​vârsta, sexul, regiunea, vârsta vehiculului, puterea motorului, km anual, profesie. - Ce variabile ar putea fi riscante din punct de vedere normativ/etic (de exemplu, discriminarea indirectă)? - Ce interacțiuni bilaterale ar avea sens să încercăm? - Ce pași de verificare ar trebui să urmez pentru a evita supraadaptarea? Luarea deciziilor; Dă-mi cadrul pentru control și discuție.

3) Cod de control al supraajustării:

Scrieți cod comentat care evaluează un GLM cu validare încrucișată k-fold folosind Python + scikit-learn / statmodels. Utilizați abaterea Poisson ca metrică. Comparați scorurile de antrenament și teste și explicați în linia de comentarii cum să citiți semnul de supraadaptare. Biblioteca este falsă.

4) Discriminare/screening variabilă surogat:

„Codul poștal” sa dovedit a fi o variabilă puternică în modelul meu de preț. Explicați riscul ca aceasta să reprezinte indirect o caracteristică interzisă (de exemplu, etnie, venit) ca o variabilă proxy. - Ce analiză ar trebui să fac pentru a testa acest risc? - Ce alternative există pentru a reduce riscul? Oferirea de consultanță juridică; elaborați un cadru tehnic și etic.

Prompt slab / Prompt puternic

Prompt slab:

Stabiliți cel mai bun model de preț pentru asigurarea de trafic.

„Cel mai bun” este nedefinit; Fără date, fără restricții, fără legislație. AI oferă un răspuns generic, inaplicabil.

Solicitare puternică:

Rolul dumneavoastră: asistent al actuarului de prețuri. Context: construiesc un model de frecvență a ramurilor de trafic, GLM (Poisson, link log). Variabilele pe care le am: grupa de vârstă, vârsta vehiculului, regiunea (provinția), km anual, destinația de utilizare. Constrângere: genul nu poate fi folosit de legislație; Trebuie să evit discriminarea indirectă. Sarcină: 1) Sugerați specificația inițială a modelului cu aceste variabile (inclusiv grupurile de referință).2) Prezentați motivele pentru 2 interacțiuni pe care ar trebui să le încerc.3) Oferiți o listă de pași pentru a verifica supraadaptarea.4) Adăugați o notă specială de atenție pentru „regiune” în ceea ce privește discriminarea indirectă. Voi lua decizia; Dumneavoastră furnizați cadrul și justificarea.

trei mini cutii

Cazul 1 – Valoarea transparenței. O companie a prezentat autorității de reglementare un model de preț foarte precis pe care l-a construit cu GBM, dar nu a putut explica coeficienții; aprobarea amânată. Actuarul a construit un GLM care a captat aceleași semnale; Precizia a scăzut cu 2 procente, dar pentru că fiecare factor a putut fi luat în considerare, modelul a fost validat în decurs de o lună. GBM a fost salvat pentru recunoaștere, GLM a devenit tarif. YZ a produs rapid codul și descrierea regulatorului comparând performanța celor două modele.

Cazul 2 — Capcana supraadaptarii. Un ajutor a obținut un scor perfect la datele de antrenament atunci când a adăugat peste 40 de variabile și numeroase interacțiuni la model. Dar la validarea încrucișată, scorul testului sa prăbușit: modelul memorase zgomotul. Performanța în lumea reală a crescut atunci când numărul de variabile a fost redus la 12 și simplificat. Lecție: uită-te la scorul de date fără precedent, nu la scorul de antrenament.

Cazul 3 – Discriminare indirectă. Într-un model, variabila „cartier” a explicat puternic prima. Analiza a arătat că această variabilă s-a suprapus în mare măsură cu concentrarea etnică, adică a fost un proxy pentru o caracteristică interzisă. Actuarul a înlocuit această variabilă cu indicatori de risc mai neutri (tip de drum, stare de parcare); au scăzut atât riscurile etice, cât și cele legale. AI a produs o analiză de corelație care măsoară suprapunerea și sugestii de variabile alternative; Actuarul și unitatea de conformitate au luat decizia.

Greșeli comune

  • Făcând modelul ininterpretabil rețeta supremă. Un preț care nu poate fi explicat autorităților de reglementare, auditului și clientului este nesustenabil; Transparența este esențială.
  • Bazându-se pe scorul de educație. Supraadaptarea este detectată numai în datele nevăzute (validare încrucișată).
  • Utilizarea variabilelor interzise/surogat fără verificare. Variabile precum codul poștal și ocupația pot duce la discriminare indirectă; Asigurați-vă că îl testați.
  • Confundând prima de risc cu prima comercială. Numai costul de daune pur nu este prețul de vânzare; se adaugă cheltuielile, profitul și costul capitalului.
  • Lăsând coeficientul pe o scară logaritmică și interpretându-l greșit. Comentarea fără a-l converti într-un factor multiplicator cu exp() va provoca o eroare.
Atenție: recomandarea AI cu privire la modelul care „oferă cea mai bună acuratețe” nu este automat modelul care „ar trebui folosit”. Transparența, corectitudinea și conformitatea cu legislația sunt criterii obligatorii, precum și acuratețea în stabilirea prețurilor actuariale.

În concluzie

Prețul este procesul de măsurare a riscului cu factori de risc și de transformare a acestuia într-o primă echitabilă. GLM este standardul de preț actuarial cu structura sa multiplicativă și interpretabilă; Coeficienții sunt convertiți în factori cu exp(). Modelele de învățare automată, cum ar fi GBM, pot fi mai precise, dar reduc transparența și sunt utilizate de obicei pentru descoperire. Selecția variabilelor ar trebui protejată împotriva supraadaptării prin validare încrucișată, iar discriminarea indirectă (variabilă surogat) ar trebui controlată cu atenție. AI construiește modelul, scrie cod și explică coeficientul; Dar conformitatea juridico-etică și tariful final aparțin unității de actuar și conformitate.

Sarcina de aplicare

Enumerați 5-6 factori de risc pentru un major. Solicitați AI (a) o specificație inițială a GLM cu acești factori, (b) 2 interacțiuni de încercat și justificarea acestora, (c) o examinare a variabilelor care ar putea fi expuse riscului de discriminare indirectă. Apoi, dați un exemplu de 3 log-coeficienți, cereți AI să-l convertească într-un factor multiplicator cu exp() și să-l transfere în limbajul de afaceri și să verifice manual factorii.

lista de verificare

  • [ ] Poate fi interpretat modelul meu; Pot traduce impactul fiecărui factor în limbajul de afaceri?
  • [ ] Am verificat dacă există supraadaptare prin validare încrucișată?
  • [ ] Am scanat pentru discriminare indirectă pentru variabilele interzise și proxy?
  • [ ] Am separat în mod conștient prima de risc de prima comercială?
  • [ ] Am convertit coeficienții în multiplicatori cu exp() și am interpretat corect?
  • [ ] Am luat decizia finală de tarifare împreună cu unitatea de legislație și conformitate?