Yunit 4 / 11

Pagpepresyo at Pag-uuri ng Panganib: GLM, Tariffing at Artificial Intelligence

Mga nadagdag:

  • Kakayahang magtatag ng generalized linear model (GLM), risk factor, taripa at risk premium concepts na may suporta ng artificial intelligence at isalin ang mga coefficient sa business language
  • Kakayahang talakayin ang balanse ng variable selection, interaction, overfitting, at interpretability ng machine learning models (GBM) na may artificial intelligence
  • Ang kakayahang maunawaan na ang modelo ng pagpepresyo ay libre mula sa mga ipinagbabawal/nagdidiskriminang variable at ang pagsunod sa huling taripa sa batas at kumpetisyon ay ipinauubaya sa actuary.

Ang presyo ng isang patakaran sa seguro ay hindi random na tinutukoy. Ang panganib ng isang aksidente sa trapiko para sa isang 22-taong-gulang, bagong lisensyadong driver na naninirahan sa isang malaking lungsod ay mas mataas sa istatistika kaysa sa isang 45-taong-gulang na driver na may 20 taong karanasan; Sa isang patas na sistema, ang mga premium ay dapat ding iba. Ang trabaho ng actuary sa pagsukat ng pagkakaibang ito at pagpapakita nito sa presyo ay tinatawag na pag-uuri ng pagpepresyo at panganib. Sa unit na ito, tatalakayin natin ang generalized linear model (GLM), ang actuarial backbone ng pagpepresyo, at ang mga alternatibong machine learning nito, at tingnan kung paano ligtas na gamitin ang AI sa prosesong ito.

Ilang pangunahing termino. Ang kadahilanan ng peligro ay ang variable na nakakaapekto sa panganib at ginagamit sa pagpepresyo (edad, edad ng sasakyan, rehiyon, nilalayon na paggamit). Ang taripa ay isang hanay ng mga panuntunan na tumutukoy kung paano kakalkulahin ang premium ayon sa mga kadahilanan ng panganib. Ang risk premium ay ang dalisay na inaasahang gastos sa pagkawala; Kapag ang mga gastos, komisyon, mga margin ng tubo at mga gastos sa kapital ay idinagdag, ang komersyal na premium (presyo ng benta) ay nabuo. Paalalahanan natin mula sa simula: Ang AI ay nagmumungkahi ng mga variable, bumubuo ng mga modelo, nagpapaliwanag ng mga coefficient; Ngunit aling variable ang legal at etikal at kung ang pinal na taripa ay sumusunod sa batas at ang kumpetisyon ay nabibilang sa actuary at sa unit ng pagsunod.

Bakit GLM ang pamantayan sa actuarial

Ang pinaka ginagamit na paraan sa pagpepresyo ay GLM. Ang GLM ay kumakatawan sa "generalized linear model": pinapalawak nito ang classical linear regression upang magkasya sa mga hindi normal na distributed na target, gaya ng data ng pinsala. Mayroon itong dalawang pangunahing sangkap. Pamilya sa pamamahagi: Ang Poisson ay pinili para sa dalas, ang gamma ay pinili para sa intensity (logic sa unit 2). Pag-andar ng link (link): kadalasang logarithmic, na nagpapahintulot sa mga salik na magkaroon ng multiplicative effect. Napakahalaga ng multiplicative na istraktura sa actuarial dahil ganoon mismo ang pag-set up ng taripa: base premium × age factor × region factor × vehicle factor.

Ang pinakamalaking bentahe ng GLM ay interpretability. Direktang sasabihin sa iyo ng isang koepisyent: "tinataas ng grupo ng batang driver ang dalas ng 1.6 beses kumpara sa grupo ng sanggunian." Ang transparency na ito ay kritikal sa tatlong paraan: (1) mauunawaan at maaprubahan ng regulator at internal audit ang modelo; (2) nakikita ang ipinagbabawal/diskriminadong epekto; (3) ang lohika ng presyo ay maaaring ipaliwanag sa pangkat ng mga benta at pamamahala. Ang mas kumplikadong mga modelo ng machine learning (sa ibaba) ay nagbibigay minsan ng mas mataas na katumpakan, ngunit sa kapinsalaan ng transparency.

Hint: Ang GLM coefficient ay nasa log scale. Hilingin sa AI na i-convert ang coefficient sa isang "multiplying factor" na may exp(coefficient); Mas magiging mas madaling isalin sa wikang pangnegosyo (hal. coefficient 0.47 → factor ≈ 1.60 → “60% riskier”).

Variable selection, overfitting at machine learning

Ang pinakamahalagang desisyon sa pagpepresyo ay kung aling mga variable ang mananatili sa modelo. Mayroong dalawang bitag. Ang ilang mga variable ay bumubulag sa modelo: kung ang mahalagang driver ng panganib ay napalampas, ang presyo ay magiging mali. Ang masyadong variable / overfitting ay ginagawang kabisaduhin ng modelo ang nakaraang data: nagkakamali ang modelo ng ingay para sa signal at nabigo sa mga bagong patakaran. Ang balanse ay itinatag sa pamamagitan ng cross-validation — paghahati ng data sa pagsasanay at pagsubok at pagsubok nito sa data na hindi nakikita ng modelo, pagiging simple at aktuarial na pangangatwiran.

Mahalaga rin ang pakikipag-ugnayan: minsan ang pinagsamang epekto ng dalawang salik ay naiiba sa kabuuan ng magkahiwalay na epekto nito (maaaring mas mapanganib ang isang batang + sporty na sasakyan kaysa sa kabuuan ng kanilang mga indibidwal na epekto). Sa GLM, tahasang idinaragdag ang mga pakikipag-ugnayan.

Sa mga nakalipas na taon, naging karaniwan sa pagpepresyo ang mga modelo gaya ng GBM (gradient boosting machine — isang mahusay na paraan ng pag-aaral ng machine na pinagsasama-sama ang maraming maliliit na decision tree. Ang mga ito ay awtomatikong kumukuha ng mga kumplikadong pattern at pakikipag-ugnayan, kadalasang nagbibigay ng mas tumpak na mga hula kaysa sa GLM. Ngunit ito ay dumating sa isang presyo: ang ugali na maging isang "itim na kahon". Ang karaniwang kasanayan ngayon ay ang paggamit ng GBM para sa pagtuklas at pagbuo ng ideya at GLM para sa panghuling transparent na taripa; o pagbibigay-kahulugan sa output ng GBM gamit ang mga tool sa pagpapaliwanag tulad ng SHAP.

Inihahambing ng sumusunod na talahanayan ang dalawang diskarte:

pamantayan

GLM

GBM (machine learning)

Pagbibigay-kahulugan

Mataas (coefficient on)

Mababa (nangangailangan ng tool ng anotasyon)

Pagkuha ng pakikipag-ugnayan

Manu-manong idinagdag

awtomatiko

Panganib ng overfitting

low-medium

Mataas (kailangan ng maingat na pagsasaayos)

Pag-apruba ng regulator/audit

madali

Mahirap, nangangailangan ng karagdagang dokumentasyon

Karaniwang paggamit

huling taripa

pagtuklas, paghahambing

Paano gamitin ang AI sa pagpepresyo

1) Pagsasalin ng GLM coefficient sa wika ng negosyo:

Nag-set up ako ng frequency GLM (Poisson, log link). Ilang coefficient (log scale): age_group_18_25: 0.47 ; rehiyon_majority: 0.22 ; arac_yasi_10plus: -0.15. I-convert ang bawat isa sa isang multiplier factor na may exp() at ipaliwanag ito sa isang pangungusap na mauunawaan ng isang manager. Paalalahanan din kung ano ang reference group.

2) Diskusyon sa variable/interaksyon:

Ang iyong tungkulin: katulong sa pagpepresyo. Ang mga variable ng aking kandidato para sa modelo ng dalas ng trapiko ay: edad, kasarian, rehiyon, edad ng sasakyan, lakas ng makina, taunang km, propesyon. - Aling mga variable ang maaaring mapanganib mula sa isang regulasyon/etikal na pananaw (hal. hindi direktang diskriminasyon)? - Aling mga bilateral na pakikipag-ugnayan ang makatuwirang subukan? - Anong mga hakbang sa pag-verify ang dapat kong sundin upang maiwasan ang overfitting? Paggawa ng desisyon; Bigyan mo ako ng balangkas para sa kontrol at talakayan.

3) Overfitting na control code:

Sumulat ng nagkomento na code na sinusuri ang isang GLM na may k-fold cross-validation gamit ang Python + scikit-learn / statsmodels. Gamitin ang Poisson deviation bilang sukatan. Ihambing ang mga marka ng pagsasanay at pagsusulit at ipaliwanag sa linya ng mga komento kung paano basahin ang overfitting sign. Ang library ay peke.

4) Diskriminasyon/kapalit na variable screening:

Ang 'Postcode' ay naging isang malakas na variable sa aking modelo ng pagpepresyo. Ipaliwanag ang panganib nitong hindi direktang kumakatawan sa isang ipinagbabawal na katangian (hal. etnisidad, kita) bilang proxy variable. - Anong pagsusuri ang dapat kong gawin upang subukan ang panganib na ito? - Anong mga alternatibo ang mayroon upang mabawasan ang panganib? Pagbibigay ng legal na payo; gumuhit ng teknikal at etikal na balangkas.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Itatag ang pinakamahusay na modelo ng pagpepresyo para sa seguro sa trapiko.

Ang "Pinakamahusay" ay hindi natukoy; Walang data, walang mga paghihigpit, walang batas. Nagbibigay ang AI ng generic, hindi naaangkop na sagot.

Napakahusay na prompt:

Ang iyong tungkulin: katulong sa actuary sa pagpepresyo. Konteksto: Bumubuo ako ng modelo ng dalas ng sangay ng trapiko, GLM (Poisson, log link). Ang mga variable na mayroon ako: pangkat ng edad, edad ng sasakyan, rehiyon (probinsya), taunang km, nilalayon na paggamit. Limitasyon: hindi maaaring gamitin ng batas ang kasarian; Kailangan kong iwasan ang di-tuwirang diskriminasyon.Gawain:1) Magmungkahi ng paunang detalye ng modelo sa mga variable na ito (kabilang ang mga pangkat ng sanggunian).2) Magbigay ng mga dahilan para sa 2 pakikipag-ugnayan na dapat kong subukan.3) Magbigay ng listahan ng mga hakbang upang suriin ang overfitting.4) Magdagdag ng espesyal na tala ng atensyon para sa 'rehiyon' sa mga tuntunin ng hindi direktang diskriminasyon. Ako ang gagawa ng desisyon; Ibigay mo ang balangkas at katwiran.

tatlong mini case

Case 1 — Ang halaga ng transparency. Nagpakita ang isang kumpanya ng napakatumpak na modelo ng pagpepresyo na binuo nito gamit ang GBM sa regulator, ngunit hindi maipaliwanag ang mga coefficient; naantala ang pag-apruba. Ang actuary ay nagtayo ng isang GLM na nakakuha ng parehong mga signal; Bumaba ng 2 porsiyento ang katumpakan, ngunit dahil mabibilang ang bawat salik, na-validate ang modelo sa loob ng isang buwan. Ang GBM ay na-save para sa reconnaissance, ang GLM ay naging taripa. Mabilis na ginawa ng YZ ang code at paglalarawan ng regulator na naghahambing sa pagganap ng dalawang modelo.

Case 2 — Ang overfitting trap. Nakakuha ang isang helper ng perpektong marka sa data ng pagsasanay noong nagdagdag siya ng higit sa 40 variable at maraming pakikipag-ugnayan sa modelo. Ngunit sa cross-validation, bumagsak ang marka ng pagsusulit: kabisado ng modelo ang ingay. Tumaas ang pagganap sa real-world kapag ang bilang ng mga variable ay binawasan sa 12 at pinasimple. Aralin: tingnan ang hindi pa naganap na marka ng data, hindi ang marka ng pagsasanay.

Kaso 3 — Hindi direktang diskriminasyon. Sa isang modelo, mariing ipinaliwanag ng variable na "kapitbahayan" ang premium. Ipinakita ng pagsusuri na ang variable na ito ay higit na nag-overlap sa konsentrasyon ng etniko, ibig sabihin, ito ay isang proxy para sa isang ipinagbabawal na katangian. Pinalitan ng actuary ang variable na ito ng mas neutral na mga indicator ng panganib (uri ng kalsada, kondisyon ng paradahan); parehong etikal at legal na mga panganib ay nabawasan. Gumawa ang AI ng pagsusuri ng ugnayan na sumusukat sa overlap at alternatibong mga suhestiyon sa variable; Ang actuary at compliance unit ang gumawa ng desisyon.

Mga karaniwang pagkakamali

  • Ang paggawa ng hindi maipaliwanag na modelo ang pinakahuling recipe. Ang isang presyo na hindi maipaliwanag sa regulator, pag-audit at customer ay hindi napapanatiling; Mahalaga ang transparency.
  • Umaasa sa marka ng edukasyon. Ang overfitting ay nakikita lamang sa hindi nakikitang data (cross-validation).
  • Paggamit ng mga ipinagbabawal/kapalit na mga variable nang hindi sinusuri. Ang mga variable tulad ng zip code at trabaho ay maaaring magdala ng hindi direktang diskriminasyon; Tiyaking subukan ito.
  • Nakalilito ang risk premium sa commercial premium. Ang purong gastos sa pinsala lamang ay hindi ang presyo ng pagbebenta; gastos, tubo at halaga ng kapital ay idinagdag.
  • Iniiwan ang coefficient sa isang log scale at maling interpretasyon nito. Ang pagkomento nang hindi ito kino-convert sa isang multiplier factor na may exp() ay magdudulot ng error.
Babala: Ang rekomendasyon ng AI sa modelo na "nagbibigay ng pinakamahusay na katumpakan" ay hindi awtomatikong ang modelo na "dapat gamitin." Ang transparency, pagiging patas at pagsunod sa batas ay mandatoryong pamantayan pati na rin ang katumpakan sa actuarial na pagpepresyo.

Sa buod

Ang pagpepresyo ay ang proseso ng pagsukat ng panganib sa mga kadahilanan ng panganib at pag-convert nito sa isang patas na premium. Ang GLM ay ang pamantayan ng actuarial na pagpepresyo kasama ang multiplicative at interpretable na istraktura nito; Ang mga coefficient ay kino-convert sa mga salik na may exp(). Maaaring mas tumpak ang mga modelo ng machine learning gaya ng GBM, ngunit binabawasan ng mga ito ang transparency at karaniwang ginagamit para sa pagtuklas. Dapat protektahan ang pagpili ng variable laban sa overfitting sa pamamagitan ng cross-validation, at dapat na maingat na kontrolin ang hindi direktang diskriminasyon (surrogate variable). Binubuo ng AI ang modelo, nagsusulat ng code at ipinapaliwanag ang koepisyent; Ngunit ang legal-ethical compliance at final taripa ay nabibilang sa actuary at compliance unit.

Gawain ng aplikasyon

Maglista ng 5-6 na kadahilanan ng panganib para sa isang major. Hilingin sa AI ang (a) isang paunang detalye ng GLM na may mga salik na ito, (b) 2 pakikipag-ugnayan na susubukan at ang kanilang katwiran, (c) isang screening ng mga variable na maaaring nasa panganib para sa hindi direktang diskriminasyon. Pagkatapos, magbigay ng isang halimbawa ng 3 log-coefficient, hilingin sa AI na i-convert ito sa isang multiplier factor na may exp() at ilipat ito sa wika ng negosyo, at manu-manong i-verify ang mga salik.

checklist

  • [ ] Maaari bang bigyang-kahulugan ang aking modelo; Maaari ko bang isalin ang epekto ng bawat salik sa wika ng negosyo?
  • [ ] Sinuri ko ba para sa overfitting sa pamamagitan ng cross-validation?
  • [ ] Nag-scan ba ako para sa hindi direktang diskriminasyon para sa mga ipinagbabawal at proxy na variable?
  • [ ] Sinasadya ko bang ihiwalay ang risk premium mula sa commercial premium?
  • [ ] Na-convert ko ba ang mga coefficient sa mga multiplier na may exp() at nai-interpret ko ang mga ito nang tama?
  • [ ] Ginawa ko ba ang pinal na desisyon sa taripa kasama ng lehislasyon at yunit ng pagsunod?