收益:
- 能够在人工智能的支持下建立和解释损坏频率和损坏量(严重程度)之间的区别、适当的分布(泊松、负二项式、伽马)和复合模型逻辑。
- 通过正确的问题和数据,对人工智能的巨大损失(异常值/大损失)、数据上限和趋势/发展修正进行分类。
- 能够理解人工智能产生的分布选择和参数应通过拟合优度检验和精算推理来确认。
对于保险公司来说最基本的问题是:“明年我们将为这个保单组支付多少损失?”正确回答这个问题是正确设定保费和分配足够准备金的前提。精算师通过将其分为两部分来回答这个问题:因为单独对两个单独的行为进行建模比估计单个行为的总损害要准确得多。这两个部分是频率和强度。
频率(损坏频率)是指每次给定暴露发生多少次损坏;例如,100 辆车 - 每年发生 8 起事故。严重程度是指每次损害发生的平均金额;例如,每次事故 30,000 里拉。将两者相乘得出风险溢价:每次暴露的预期损失成本 (0.08 × 30,000 = $2,400)。在本单元中,我们将逐步了解如何使用人工智能来建立这种区别、选择正确的概率分布以及管理异常值。让我们从一开始就提醒一下:人工智能提出分布并编写代码,但要由精算师通过拟合优度测试和判断来确认分布的选择。
为什么频率和强度要分开建模?
频率和强度显示出不同的统计行为。索赔数量是一个计数变量(0、1、2、3...),如果存在过度离散(方差 > 均值),则通常使用泊松分布或负二项分布进行建模。泊松分布是对罕见且独立事件的数量进行建模的经典分布。损害金额是一个连续且右偏的变量:大多数索赔规模较小,少数索赔规模很大。因此,严重程度通常用伽玛分布或对数正态分布建模;这些是正且右偏的分布。
分别对两者进行建模具有三个具体好处。首先,你可以看到每个人都有自己的司机(风险因素):年轻司机增加频率,昂贵车辆增加暴力。其次,当数据发生变化时,您可以诊断原因:损害成本或索赔数量是否增加了?第三,只能在暴力方面单独考虑极大的损失。这两者的组合称为复合模型;预期总损害=预期频率×预期严重程度。
提示:“我们的损失/保费比率增加了”这句话本身并没有说明任何事情。将频率或强度是否增加的问题分开;干预(价格、承保范围、损害管理)将完全不同。
异常值、截断和趋势修正
原始形式的损坏数据尚未准备好用于模型构建。几乎总是需要进行三次更正。第一个是极端/重大损害排序:一些巨大的损害(例如工厂火灾)会扭曲平均值;这些被建模为单独的“重大损坏负载”。第二个是上限:将非常大的损害固定到某个上限(例如1,000,000 TL)并单独计算上部部分使模型稳定。第三,趋势和发展修正:过去的索赔应根据通货膨胀更新到今天的价格水平(趋势),尚未完全支付的索赔应达到最终水平(发展 - 我们将在第 3 单元中讨论这个主题)。
下表比较了两个组件的属性:
特征
频率(频率)
暴力(数量)
变量类型
计数(0,1,2...)
恒定、积极
典型分布
泊松,负二项式
伽玛,对数正态
主驱动示例
年龄、经验、地区、用途
车辆价值、承保限额、维修费用
异常值问题
低
高(严重损坏)
通货膨胀效应
弱
强
如何在损伤建模中使用人工智能
人工智能最强大的地方在于讨论分布选择、编写代码和解释结果。以下是四个可复制的模板。
1)讨论分布选择:
您的角色:精算建模助理。我有保险索赔 AMOUNT 数据(匿名,1,600 项索赔)。摘要:平均值为 30,300 TL,中位数为 12,500 TL,最大值为 940,000 TL,偏度较高。问题:gamma 还是对数正态更适合严重性模型?每个的假设是什么,加/减以及拟合优度检验(例如解释我将做出决定(Q-Q 图、K-S 检验、AIC)。做出明确的决定;给我一个比较框架。
2)频率-强度计算代码:
使用 Python + pandas 编写注释代码,执行以下步骤: 1) df.txt 文件中有 'exposure'、'claim_count'、'claim_amount' 列。 2)一般频率=总索赔次数/总曝光量。 3) 平均严重程度=总索赔金额/总索赔计数。 4)风险溢价=频率×严重程度。 5)将每个中间结果打印到屏幕上,以便我可以手动验证。图书馆装修;只需使用熊猫即可。
3)极值/截止分析:
我有一个匿名索赔金额分布。 950,000、720,000、610,000 TL等索赔额占总金额的22%。请告诉我您的上限方法: - 哪些上限选项是合理的(例如 500K、750K、1M)? - 如何将切割部分添加回作为单独的“主要损坏负载”? - 逐步向我展示该决定如何影响风险溢价。
4)将结果翻译成商业语言:
我的频率从0.13增加到0.15;平均暴力事件从 28,000 土耳其里拉增加到 34,000 土耳其里拉。用经理可以理解的 4 句话来概括这一点: - 发生了什么,哪个组件增加了多少? - 对风险溢价的总体影响是多少? - 写出可能的原因和我需要验证的 2 个假设。
弱提示/强提示
弱提示:
设置我的损失模型并计算保费。
不清楚:哪些数据、哪些组成部分、哪些分布、哪个时期?人工智能通过制造填补了这一空白。
强力提示:
您的角色:精算建模助理。数据(匿名,交通部门,2024 年):风险 20,000 个保单年,索赔数量 2,600 起,总损失 91,000,000 里拉,5 个最大损失总计 12,000,000 里拉。任务: 1) 计算频率和原始平均严重性,显示公式。 2) 5个最大的损害上限为1,000,000 TL,并重新计算调整后的严重程度。 3)比较有上限和无上限的风险溢价,评论差异。 4)用中间数字写下每个步骤,以便我可以手动验证。只需使用我给出的数字即可;如果丢失,请询问。
三个迷你箱子
案例1——分离的力量。一位精算师发现,一年内住房部门的损失/保费比率从 68% 上升到 81%。在提出恐慌性价格上涨之前,进行了频率与严重性的区分:频率几乎恒定(0.041 → 0.043),但平均严重性从 14,200 TL 跃升至 19,800 TL。原因是建筑成本上涨,而不是保单或高风险客户的数量。正确的干预措施是更新承保金额,而不是盲目增加保费。
案例 2 — 异常值陷阱。商业保险组合中 1,800 起索赔的平均金额为 42,000 里拉。然而,仅单次火灾损失就达 640 万里拉,这一平均值就增加了约 3,500 里拉。当这种重大损害被建模并限制为单独的“重大损害负担”时,基本严重程度降低至 38,500 TL,保费变得更加公平。 AI快速生成上限代码和替代上限;精算师做出了决定。
案例 3——分布不均。毫无疑问,助手运行了一段人工智能代码,为严重性选择了正态(高斯)分布。因为正态分布允许负值和对称性,所以它不适合右偏损伤数据;该模型高估了小损失并低估了大损失。当比较 Q-Q 图和 AIC 时,可以看出 gamma 拟合得更好。教训:AI提出的分布总是通过拟合测试来测试的。
常见错误
- 将频率和强度结合起来并用单个模型进行预测。它隐藏了两种不同的行为;你失去了司机以及为什么。
- 在不消除极端/重大损坏的情况下进行平均。一些巨大的损坏扭曲了整个画面;保费被人为抬高。
- 使用旧的伤害而不应用通货膨胀趋势。 2019年的损害与今天的价格不一样;趋势修正是必要的。
- 将正态分布拟合到右偏数据。负值和对称性的假设与损伤数据相反;想想伽马/对数正态分布。
- 没有通过拟合测试来验证分布选择。 AI的提议只是一个开始;通过Q-Q、K-S、AIC确认。
注意:上限(切割)水平不是任意选择的。天花板太低会隐藏重大损坏的风险;天花板太高会使装饰毫无用处。通过查看投资组合过去的重大损失经历和再保险条款来进行选择。
综上所述
准确估计总损害的方法是将其分为频率(频率)和严重程度(金额)。频率由泊松/负二项式建模,强度由伽玛/对数正态建模;风险溢价是通过将两者相乘得出的。原始数据需要异常值去除、截断和趋势校正。 AI分发讨论是代码和评论的优秀助手;但分配选择和上限决定是通过拟合检验和精算判断来确定的。
应用任务
准备匿名损害摘要(曝光、索赔数量、总损害、前 3-5 项索赔)。要求人工智能计算(a)原始频率-严重性-风险溢价,(b)限制大额损失并计算调整后的风险溢价。手动验证这两个结果,并记下上限百分比会改变风险溢价。然后向人工智能询问“暴力的伽玛或对数正态”问题,并用自己的话总结它给出的比较框架。
清单
- [ ] 我是分别计算频率和强度,还是将它们视为一个整体?
- [ ] 我是否已识别出重大/极端损坏并单独处理?
- [ ] 我是否对旧索赔应用了通货膨胀/趋势调整?
- [ ] 我是否通过拟合优度检验验证了强度分布?
- [ ] 我是否独立重新计算了风险溢价(频率×严重性)?
- [ ] 我是否对人工智能建议的分布和上限水平提出了质疑并通过判断确认了它?