Unità 2 / 11

Modellazione del danno: discriminazione frequenza-gravità e analisi supportata dall'intelligenza artificiale

Guadagni:

  • Essere in grado di stabilire e interpretare la distinzione tra frequenza del danno e ammontare del danno (gravità), distribuzioni appropriate (Poisson, binomiale negativo, gamma) e logica del modello composito con il supporto dell'intelligenza artificiale.
  • Individuazione di perdite estremamente elevate (valori anomali/grandi perdite), limitazione dei dati e correzioni di tendenza/sviluppo all'intelligenza artificiale con le domande e i dati giusti.
  • Capacità di comprendere che la selezione della distribuzione e i parametri prodotti dall'intelligenza artificiale dovrebbero essere confermati da test di adattamento e ragionamento attuariale.

La domanda più semplice per una compagnia di assicurazioni è: "Quanti danni pagheremo per questo gruppo assicurativo l'anno prossimo?" Rispondere correttamente a questa domanda è un prerequisito sia per fissare correttamente il premio sia per allocare riserve sufficienti. Gli attuari rispondono a questa domanda dividendola in due; perché è molto più accurato modellare separatamente due comportamenti separati invece di stimare il danno totale in un unico pezzo. Queste due parti sono frequenza e intensità.

La frequenza (frequenza del danno) è quanti danni si verificano per una data esposizione; Ad esempio, 100 veicoli - 8 incidenti all'anno. La gravità è l'importo medio di ciascun danno subito; ad esempio, 30.000 TL per incidente. Moltiplicando i due si ottiene il premio di rischio: costo del danno atteso per esposizione (0,08 × 30.000 = $ 2.400). In questa unità vedremo passo dopo passo come utilizzare l'intelligenza artificiale per stabilire questa distinzione, scegliere la giusta distribuzione di probabilità e gestire i valori anomali. Ricordiamolo fin dall'inizio: l'IA propone le distribuzioni e scrive il codice, ma spetta all'attuario confermare la scelta della distribuzione attraverso test e giudizi di bontà di adattamento.

Perché frequenza e intensità sono modellate separatamente?

Frequenza e intensità mostrano un comportamento statistico diverso. Il numero di sinistri è una variabile di conteggio (0, 1, 2, 3...) ed è solitamente modellato con una distribuzione di Poisson o una distribuzione binomiale negativa se c'è sovradispersione (varianza > media). Poisson è la distribuzione classica che modella il numero di eventi rari e indipendenti. L’importo del danno è una variabile continua e distorta a destra: la maggior parte delle richieste di indennizzo sono piccole, alcune sono molto grandi. Pertanto, la gravità è spesso modellata con una distribuzione gamma o lognormale; queste sono distribuzioni positive e distorte a destra.

Modellare i due separatamente presenta tre vantaggi concreti. Innanzitutto, puoi vedere che ognuno ha i propri conducenti (fattori di rischio): i conducenti giovani aumentano la frequenza, i veicoli costosi aumentano la violenza. In secondo luogo, quando i dati cambiano, è possibile diagnosticare il motivo: è aumentato il costo del danno o il numero di sinistri? In terzo luogo, dal lato della violenza si possono considerare separatamente solo perdite estremamente ingenti. La combinazione di questi due è chiamata modello composto; danno totale previsto = frequenza prevista × gravità prevista.

Suggerimento: la frase "Il nostro rapporto perdite/premi è aumentato" non dice nulla da sola. Separare la questione se la frequenza o l'intensità siano aumentate; l’intervento (prezzo, copertura, gestione del danno) sarebbe completamente diverso.

Outlier, troncamenti e correzioni di trend

I dati sui danni nella loro forma grezza non sono pronti per la costruzione del modello. Sono quasi sempre necessarie tre correzioni. Il primo è la classificazione dei danni estremi/gravi: alcuni danni enormi (ad esempio un incendio in una fabbrica) distorcono la media; questi sono modellati come un "carico di danno grave" separato. Il secondo è il capping: fissare danni molto grandi a un determinato massimale (ad esempio 1.000.000 di TL) e calcolare separatamente la parte superiore rende stabile il modello. Terzo, correzione del trend e dello sviluppo: i sinistri passati dovrebbero essere aggiornati con l’inflazione al livello dei prezzi odierni (tendenza), e i sinistri che non sono stati ancora interamente pagati dovrebbero essere portati al loro livello finale (sviluppo – tratteremo questo argomento nell’unità 3).

La tabella seguente confronta le proprietà dei due componenti:

caratteristica

Frequenza (frequenza)

Violenza (importo)

Tipo variabile

Conteggio (0,1,2...)

costante, positivo

Distribuzione tipica

Poisson, binomio negativo

Gamma, lognormale

Esempi di conducenti principali

Età, esperienza, regione, utilizzo

Valore del veicolo, limite di copertura, costo di riparazione

Problema anomalo

basso

Alto (danni gravi)

Effetto inflazione

debole

forte

Come utilizzare l'intelligenza artificiale nella modellazione dei danni

Il punto in cui l’intelligenza artificiale è più forte è nel discutere la scelta della distribuzione, scrivere il codice e interpretare il risultato. Di seguito sono riportati quattro modelli copiabili.

1) Discutere la scelta della distribuzione:

Il tuo ruolo: assistente modellistica attuariale. Ho i dati dell'IMPORTO della richiesta di risarcimento assicurativo (anonimo, 1.600 richieste). Riepilogo: media 30.300 TL, media 12.500 TL, massimo 940.000 TL, l'asimmetria è elevata. Domanda: gamma o lognormale sarebbero più adatti per il modello di gravità? Qual è il presupposto di ciascuno, più/meno e con quale test di bontà di adattamento (ad es. Spiegare che prenderò una decisione (grafico Q-Q, test K-S, AIC). Prendere una decisione definitiva; Fornirmi un quadro di confronto.

2) Codice di calcolo dell'intensità della frequenza:

Scrivi un codice commentato con Python + panda che esegua i seguenti passaggi: 1) Ci sono colonne "exposure", "claim_count", "claim_amount" nel df. 2) Frequenza generale = numero_sinistri totale / esposizione totale. 3) Gravità media = importo_risarcimento totale / conteggio_risarcimenti totale. 4) Premio per il rischio = frequenza × gravità. 5) Stampa sullo schermo ogni risultato intermedio in modo da poterlo verificare manualmente. Allestimento libreria; basta usare i panda.

3) Analisi del valore estremo/cutoff:

Ho una distribuzione anonima dell'importo della richiesta. Sinistri come 950.000, 720.000, 610.000 TL costituiscono il 22% dell'importo totale. Parlami del tuo approccio al limite: - Quali opzioni di limite sono ragionevoli (ad esempio 500.000, 750.000, 1 milione)? - Come posso aggiungere nuovamente la parte tagliata come "carico di danno grave" separato? - Mostrami passo dopo passo come questa decisione influisce sul premio di rischio.

4) Tradurre il risultato nel linguaggio commerciale:

La mia frequenza è aumentata da 0,13 a 0,15; La violenza media è aumentata da 28.000 a 34.000 TL. Riassumilo in 4 frasi che un manager possa comprendere: - Cosa è successo, quale componente è aumentata e di quanto? - Qual è l'effetto totale sul premio di rischio? - Scrivi le possibili ragioni e 2 ipotesi che devo verificare.

Prompt debole / Prompt forte

Suggerimento debole:

Imposta il mio modello di perdita e calcola il premio.

Non chiaro: quali dati, quale componente, quale distribuzione, quale periodo? L’intelligenza artificiale colma questa lacuna con la fabbricazione.

Suggerimento potente:

Il tuo ruolo: assistente modellistica attuariale. Dati (anonimi, ramo traffico, 2024): esposizione 20.000 anni di polizza, numero di sinistri 2.600, danno totale 91.000.000 TL, i 5 danni maggiori ammontano a 12.000.000 TL. Compito: 1) Calcolare la frequenza e la gravità media grezza, mostrare la formula. 2) I 5 danni maggiori Limitalo a 1.000.000 di TL e calcola nuovamente la gravità modificata. 3) Confrontare il premio per il rischio con e senza cap, commentare la differenza. 4) Scrivi ogni passaggio con numeri intermedi in modo da poterlo verificare manualmente. Usa semplicemente i numeri che ho fornito; Se manca, chiedi.

tre mini custodie

Caso 1 — Il potere di separazione. Un attuario ha visto il rapporto perdite/premi nel settore immobiliare salire in un anno dal 68% all'81%. Prima che venisse suggerito l’aumento dei prezzi dovuto al panico, è stata fatta una distinzione tra frequenza e gravità: la frequenza era quasi costante (0,041 → 0,043), ma la gravità media era passata da 14.200 TL a 19.800 TL. Il motivo era l’inflazione dei costi di costruzione, non il numero di polizze o di clienti a rischio. L'intervento corretto è stato l'aggiornamento degli importi della copertura, non un aumento cieco del premio.

Caso 2 – Trappola anomala. La media di 1.800 sinistri in un portafoglio assicurativo aziendale era di 42.000 TL. Tuttavia, un singolo danno da incendio di 6,4 milioni di TL ha gonfiato questa media di circa 3.500 TL. Quando questo danno grave è stato modellato e limitato come un "onere del danno grave" separato, la gravità di base è scesa a 38.500 TL e il premio è diventato più equo. L'intelligenza artificiale ha generato rapidamente codici di limitazione e limiti alternativi; La decisione è stata presa dall'attuario.

Caso 3 – Maldistribuzione. Senza dubbio, un assistente ha eseguito un codice AI che selezionava una distribuzione normale (gaussiana) per la gravità. Poiché la distribuzione normale consentiva valori negativi e simmetria, non si adattava ai dati sui danni distorti a destra; il modello ha sovrastimato i danni piccoli e sottovalutato quelli grandi. Quando sono stati confrontati il ​​grafico Q-Q e l'AIC, si è visto che la gamma si adattava molto meglio. Lezione: la distribuzione proposta dall'IA viene sempre testata tramite fit testing.

Errori comuni

  • Combinazione di frequenza e intensità e previsione con un unico modello. Nasconde due comportamenti diversi; perdi l'autista e perché.
  • Media senza eliminare danni estremi/gravi. Alcuni danni giganteschi distorcono l'intero quadro; il premio è gonfiato artificialmente.
  • Utilizzo dei vecchi danni senza applicare il trend dell'inflazione. Il danno del 2019 non è lo stesso del prezzo di oggi; è necessaria una correzione del trend.
  • Adattare una distribuzione normale a dati distorti a destra. L'assunzione di valore negativo e simmetria è contraria ai dati sui danni; Pensa a gamma/lognormale.
  • Non verificare la scelta distributiva con fit testing. La proposta di AI è un inizio; Confermare con Q-Q, K-S, AIC.
Attenzione: il livello massimo (di taglio) non viene scelto arbitrariamente. Un soffitto troppo basso nasconde il rischio di danni importanti; un soffitto troppo alto rende inutile la rifinitura. Scegli esaminando l'esperienza passata di perdite gravi e i termini di riassicurazione del portafoglio.

In sintesi

Il modo per stimare con precisione il danno totale è dividerlo in frequenza (frequenza) e gravità (entità). La frequenza è modellata dal binomio Poisson/negativo, l'intensità da gamma/lognormale; Il premio per il rischio si trova moltiplicando i due. I dati grezzi richiedono la rimozione dei valori anomali, il troncamento e la correzione del trend. La discussione sulla distribuzione dell'intelligenza artificiale è un eccellente assistente per il codice e i commenti; ma la scelta della distribuzione e la decisione sul tetto sono confermate da fit test e giudizi attuariali.

Compito dell'applicazione

Preparare un riepilogo anonimo dei danni (esposizione, numero di sinistri, danno totale, primi 3-5 sinistri). Chiedi all’IA di calcolare (a) il premio di rischio grezzo per frequenza e gravità, (b) limitare le grandi perdite e calcolare il premio di rischio corretto. Verifica manualmente i due risultati e nota in quale percentuale il limite modifica il premio di rischio. Quindi chiedi all'IA la domanda "gamma o lognormale per la violenza" e riassumi il quadro di confronto fornito con parole tue.

lista di controllo

  • [ ] Ho calcolato la frequenza e l'intensità separatamente o le ho considerate come un unico pezzo?
  • [ ] Ho identificato i danni gravi/estremi e li ho affrontati separatamente?
  • [ ] Ho applicato l'aggiustamento dell'inflazione/tendenza ai vecchi sinistri?
  • [ ] Ho verificato la distribuzione dell'intensità con un test di bontà di adattamento?
  • [ ] Ho ricalcolato in modo indipendente il premio per il rischio (frequenza × gravità)?
  • [ ] Ho messo in dubbio la distribuzione e il livello massimo suggerito dall’IA e l’ho confermato con giudizio?