Winst:
- Mogelijkheid om concepten van gegeneraliseerde lineaire modellen (GLM), risicofactoren, tarieven en risicopremies vast te stellen met behulp van kunstmatige intelligentie en de coëfficiënten in zakelijke taal te vertalen
- Mogelijkheid om de balans tussen variabeleselectie, interactie, overfitting en interpreteerbaarheid van machine learning-modellen (GBM) met kunstmatige intelligentie te bespreken
- Het kunnen begrijpen dat het prijsmodel vrij is van verboden/discriminerende variabelen en dat het voldoen van het uiteindelijke tarief aan de wetgeving en concurrentie aan de actuaris wordt overgelaten.
De prijs van een verzekering wordt niet willekeurig bepaald. Het risico op een verkeersongeval voor een 22-jarige bestuurder met nieuw rijbewijs die in een grote stad woont, is statistisch gezien hoger dan dat van een 45-jarige bestuurder met 20 jaar ervaring; In een eerlijk systeem moeten de premies ook anders zijn. De taak van de actuaris om dit verschil te meten en dit in de prijs weer te geven, wordt prijsstelling en risicoclassificatie genoemd. In deze unit bespreken we het gegeneraliseerde lineaire model (GLM), de actuariële ruggengraat van prijsstelling en de machine learning-alternatieven ervan, en bekijken we hoe we AI veilig in dit proces kunnen gebruiken.
Een paar basistermen. Risicofactor is de variabele die het risico beïnvloedt en wordt gebruikt bij de prijsstelling (leeftijd, leeftijd van het voertuig, regio, beoogd gebruik). Het tarief is een geheel van regels die bepalen hoe de premie wordt berekend op basis van risicofactoren. De risicopremie is de zuivere verwachte verlieskost; Wanneer kosten, provisies, winstmarges en kapitaalkosten bij elkaar opgeteld worden, ontstaat de commerciële premie (verkoopprijs). Laten we er vanaf het begin aan herinneren: AI suggereert variabelen, bouwt modellen, legt coëfficiënten uit; Maar welke variabele juridisch en ethisch is en of het eindtarief in overeenstemming is met de wetgeving en de concurrentie is een zaak van de actuaris en de compliance-eenheid.
Waarom GLM de standaard is in het actuarieel vakgebied
De meest gebruikte prijsbepalingsmethode is GLM. GLM staat voor ‘gegeneraliseerd lineair model’: het breidt de klassieke lineaire regressie uit naar niet-normaal verdeelde doelen, zoals schadegegevens. Het heeft twee basiscomponenten. Distributiefamilie: Poisson wordt gekozen voor frequentie, gamma wordt gekozen voor intensiteit (logica in eenheid 2). Linkfunctie (link): meestal logaritmisch, waardoor de factoren een multiplicatief effect kunnen hebben. De multiplicatieve structuur is zeer waardevol in het actuarieel omdat dat precies is hoe het tarief is opgebouwd: basispremie x leeftijdsfactor x regiofactor x voertuigfactor.
Het grootste voordeel van GLM is de interpreteerbaarheid. Een coëfficiënt vertelt u direct: "de groep jonge bestuurders verhoogt de frequentie 1,6 keer vergeleken met de referentiegroep." Deze transparantie is op drie manieren van cruciaal belang: (1) de toezichthouder en de interne audit kunnen het model begrijpen en goedkeuren; (2) er is een verboden/discriminerend effect zichtbaar; (3) prijslogica kan worden uitgelegd aan het verkoop- en managementteam. Complexere machine learning-modellen (hieronder) geven soms een hogere nauwkeurigheid, maar dit gaat ten koste van de transparantie.
Tip: de GLM-coëfficiënt is op logschaal. Vraag de AI om de coëfficiënt om te zetten in een "vermenigvuldigingsfactor" met exp(coëfficiënt); Het zou veel gemakkelijker zijn om het in zakelijke taal te vertalen (bijvoorbeeld coëfficiënt 0,47 → factor ≈ 1,60 → “60% risicovoller”).
Variabele selectie, overfitting en machine learning
De meest kritische beslissing bij de prijsstelling is welke variabelen in het model blijven. Er zijn twee vallen. Er zijn maar weinig variabelen die het model verblinden: als de belangrijke risicofactor wordt gemist, zal de prijs verkeerd zijn. Te variabel/overfitting zorgt ervoor dat het model gegevens uit het verleden onthoudt: het model ziet ruis aan voor een signaal en faalt met nieuw beleid. Het evenwicht wordt tot stand gebracht door middel van kruisvalidatie: het verdelen van de gegevens in trainings- en teststukken en het testen ervan op gegevens die het model niet ziet, eenvoud en actuariële redenering.
Interactie is ook belangrijk: soms verschilt het gecombineerde effect van twee factoren van de som van hun afzonderlijke effecten (een jong + sportief voertuig kan riskanter zijn dan de som van hun individuele effecten). In GLM worden interacties expliciet toegevoegd.
De afgelopen jaren zijn modellen zoals GBM (gradient boosting machine – een krachtige machine learning-methode die veel kleine beslissingsbomen combineert) gemeengoed geworden in de prijsstelling. Deze leggen automatisch complexe patronen en interacties vast en geven vaak nauwkeurigere voorspellingen dan GLM. Maar daar zit een prijs aan: de neiging om een ‘black box’ te zijn. Tegenwoordig is het gebruikelijk om GBM te gebruiken voor het ontdekken en genereren van ideeën, en GLM voor het uiteindelijke transparante tarief; of het interpreteren van de GBM-uitvoer met uitlegmiddelen zoals SHAP.
De volgende tabel vergelijkt de twee benaderingen:
criterium
GLM
GBM (machine learning)
Interpreteerbaarheid
Hoog (coëfficiënt aan)
Laag (vereist annotatietool)
Interactie vastleggen
Handmatig toegevoegd
automatisch
Risico op overfitting
laag-medium
Hoog (zorgvuldige aanpassing vereist)
Goedkeuring toezichthouder/audit
gemakkelijk
Moeilijk, vereist aanvullende documentatie
Typisch gebruik
eindtarief
ontdekking, vergelijking
Hoe AI te gebruiken in de prijsstelling
1) De GLM-coëfficiënt vertalen naar zakelijk taalgebruik:
Ik heb een frequentie GLM ingesteld (Poisson, loglink). Enkele coëfficiënten (logschaal): age_group_18_25: 0,47; regiomeerderheid: 0,22; arac_yasi_10plus: -0,15. Converteer ze allemaal naar een vermenigvuldigingsfactor met exp() en leg dit in één zin uit die een manager kan begrijpen. Herinner er ook aan wat de referentiegroep is.
2) Discussie over variabelen/interactie:
Jouw rol: prijsassistent. Mijn kandidaatvariabelen voor het verkeersfrequentiemodel zijn: leeftijd, geslacht, regio, leeftijd voertuig, motorvermogen, jaarkilometers, beroep. - Welke variabelen kunnen riskant zijn vanuit een regelgevend/ethisch perspectief (bijvoorbeeld indirecte discriminatie)? - Welke bilaterale interacties zouden zinvol zijn om te proberen? - Welke verificatiestappen moet ik volgen om overfitting te voorkomen? Besluitvorming; Geef mij het raamwerk voor controle en discussie.
3) Controlecode voor overfitting:
Schrijf code met commentaar die een GLM evalueert met k-voudige kruisvalidatie met behulp van Python + scikit-learn / statsmodels. Gebruik Poisson-afwijking als metriek. Vergelijk de trainings- en testscores en leg in de opmerkingenregel uit hoe u het overfitting-teken moet lezen. De bibliotheek is nep.
4) Discriminatie/screening van surrogaatvariabelen:
'Postcode' bleek een sterke variabele in mijn prijsmodel. Leg uit wat het risico is dat dit indirect een verboden kenmerk (bijvoorbeeld etniciteit, inkomen) vertegenwoordigt als proxyvariabele. - Welke analyse moet ik uitvoeren om dit risico te testen? - Welke alternatieven zijn er om het risico te verkleinen? Het verstrekken van juridisch advies; een technisch en ethisch kader te schetsen.
Zwakke prompt/sterke prompt
Zwakke prompt:
Bepaal het beste prijsmodel voor verkeersverzekeringen.
"Beste" is niet gedefinieerd; Geen data, geen beperkingen, geen wetgeving. AI geeft een generiek, niet-toepasbaar antwoord.
Krachtige prompt:
Jouw rol: assistent van de prijsactuaris. Context: Ik ben een frequentiemodel voor de verkeerstak aan het bouwen, GLM (Poisson, loglink). De variabelen die ik heb: leeftijdsgroep, leeftijd voertuig, regio (provincie), jaarkilometers, beoogd gebruik. Beperking: gender mag niet door de wetgeving worden gebruikt; Ik moet indirecte discriminatie vermijden. Taak: 1) Stel een initiële modelspecificatie voor met deze variabelen (inclusief referentiegroepen). 2) Geef redenen voor twee interacties die ik zou moeten proberen. 3) Geef een lijst met stappen om overfitting te controleren. 4) Voeg speciale aandacht toe voor 'regio' in termen van indirecte discriminatie. Ik zal de beslissing nemen; Je geeft het kader en de onderbouwing.
drie minikoffers
Geval 1 — De waarde van transparantie. Een bedrijf presenteerde een zeer nauwkeurig prijsmodel dat het samen met GBM had ontwikkeld aan de toezichthouder, maar kon de coëfficiënten niet verklaren; goedkeuring uitgesteld. De actuaris construeerde een GLM die dezelfde signalen opvangde; De nauwkeurigheid daalde met 2 procent, maar omdat met elke factor rekening kon worden gehouden, werd het model binnen een maand gevalideerd. GBM werd bewaard voor verkenning, GLM werd tarief. YZ produceerde snel de code en beschrijving van de regelaar waarin de prestaties van de twee modellen werden vergeleken.
Geval 2 — De overfitting-val. Een helper behaalde een perfecte score op trainingsgegevens toen hij meer dan 40 variabelen en talloze interacties aan het model toevoegde. Maar bij kruisvalidatie stortte de testscore in: het model had de ruis onthouden. De prestaties in de echte wereld namen toe toen het aantal variabelen werd teruggebracht tot twaalf en vereenvoudigd. Les: kijk naar de ongekende datascore, niet naar de trainingsscore.
Zaak 3 — Indirecte discriminatie. In één model verklaarde de variabele 'buurt' de premie sterk. Uit de analyse bleek dat deze variabele grotendeels overlapte met etnische concentratie, dat wil zeggen dat het een indicatie was voor een verboden kenmerk. De actuaris heeft deze variabele vervangen door meer neutrale risico-indicatoren (wegtype, parkeerconditie); zowel de ethische als de juridische risico’s zijn afgenomen. AI produceerde een correlatieanalyse waarbij de overlap en alternatieve variabelenuggesties werden gemeten; De actuaris en compliance-unit namen het besluit.
Veel voorkomende fouten
- Van het oninterpreteerbare model het ultieme recept maken. Een prijs die niet kan worden uitgelegd aan de toezichthouder, audit en klant is onhoudbaar; Transparantie is essentieel.
- Afhankelijk van de onderwijsscore. Overfitting wordt alleen gedetecteerd in ongeziene gegevens (kruisvalidatie).
- Verboden/surrogaatvariabelen gebruiken zonder te controleren. Variabelen zoals postcode en beroep kunnen indirecte discriminatie met zich meebrengen; Zorg ervoor dat je het test.
- Risicopremie verwarren met commerciële premie. De zuivere schadekosten alleen zijn niet de verkoopprijs; kosten, winst en kapitaalkosten worden bij elkaar opgeteld.
- De coëfficiënt op een logschaal laten staan en deze verkeerd interpreteren. Commentaar geven zonder het om te zetten in een vermenigvuldigingsfactor met exp() zal een fout veroorzaken.
Let op: AI's aanbeveling van het model dat "de beste nauwkeurigheid geeft" is niet automatisch het model dat "zou moeten worden gebruikt". Transparantie, eerlijkheid en naleving van de wetgeving zijn verplichte criteria, evenals nauwkeurigheid bij de actuariële prijsstelling.
Samengevat
Prijsbepaling is het proces waarbij risico's worden gemeten met risicofactoren en dit wordt omgezet in een eerlijke premie. GLM is de standaard voor actuariële prijsstelling met zijn multiplicatieve en interpreteerbare structuur; Coëfficiënten worden met exp() omgezet naar factoren. Machine learning-modellen zoals GBM zijn misschien nauwkeuriger, maar verminderen de transparantie en worden doorgaans gebruikt voor ontdekking. Variabeleselectie moet worden beschermd tegen overfitting door kruisvalidatie, en indirecte discriminatie (surrogaatvariabele) moet zorgvuldig worden gecontroleerd. AI bouwt het model, schrijft code en legt de coëfficiënt uit; Maar de juridisch-ethische compliance en het eindtarief behoren tot de unit actuaris en compliance.
Applicatie taak
Noem 5-6 risicofactoren voor een ernstige aandoening. Vraag de AI om (a) een initiële specificatie van de GLM met deze factoren, (b) 2 interacties om te proberen en hun grondgedachte, (c) een screening van variabelen die mogelijk risico lopen op indirecte discriminatie. Geef vervolgens een voorbeeld van 3 log-coëfficiënten, vraag de AI om deze met exp() om te zetten in een vermenigvuldigingsfactor en over te zetten naar de bedrijfstaal, en verifieer de factoren handmatig.
controlelijst
- [ ] Kan mijn model geïnterpreteerd worden; Kan ik de impact van elke factor vertalen in zakelijke taal?
- [ ] Heb ik gecontroleerd op overfitting door middel van kruisvalidatie?
- [ ] Heb ik gescand op indirecte discriminatie voor verboden variabelen en proxyvariabelen?
- [ ] Heb ik bewust de risicopremie gescheiden van de commerciële premie?
- [ ] Heb ik de coëfficiënten met exp() in vermenigvuldigers omgezet en correct geïnterpreteerd?
- [ ] Heb ik samen met de cel wetgeving en compliance de definitieve tariefbeslissing genomen?