单位 6 / 11

数据准备和特征工程:用人工智能处理精算数据

收益:

  • 能够在人工智能支持下检测保单中的缺失值、异常值、暴露和数据质量问题并损坏数据并生成修正草案
  • 特征工程(新变量推导、分组、编码)和在正确的上下文中对人工智能进行标准化
  • 了解人工智能建议的数据转换应由精算师针对数据泄露和隐藏偏差的风险进行审核。

精算工作中谈论最少但最耗时的部分是数据准备。经验丰富的精算师知道,建模项目的大部分时间都花在清理、组合和纠正数据上。无论模型多么优雅,如果输入数据损坏,输出也会损坏——简而言之,“垃圾输入,垃圾输出”。在本单元中,我们将看到保单和索赔数据的典型问题,如何使用人工智能检测和修复它们,以及特征工程(从现有数据中派生出信息更丰富的新变量)方法。

从一开始就警告:数据准备是一个看似技术性且无害的步骤,但这却是最危险的错误隐藏的地方。不正确的暴露标准化、隐藏的数据泄漏或无意中引入的偏差都会默默地破坏所有后续模型。人工智能极大地加速了这一步骤,但如果不加控制,也会放大风险。

精算数据的典型问题

保单和理赔数据几乎从来都不是干净的。最常见的问题是: 缺失值:有些保单的车龄、职业或地区为空白。盲目地用平均值来填充这些数据可能会产生偏差;缺陷本身有时会携带信息(缺失的是不同的群体)。异常值:负保费、200年投保、零风险保单等不合逻辑的记录。必须区分这些是数据错误还是真正的边缘情况。不一致:同一地区的不同拼写(“Istanbul”、“Istanbul”、“34”)、日期格式混乱。重复条目:相同伤害条目两次。

但精算最关键的问题是风险暴露。如果保单于年中开始,它会提供当年的部分风险敞口(例如 0.5 年),而不是完整的“保单年度”。频率和损坏率应始终根据暴露进行标准化;否则短期政策就会出现高风险。 AI可以对曝光计算进行编码,但你必须提供定义和业务规则。

下表总结了典型问题和正确处理方法:

问题

错误的做法

正确的方法

缺失值

全部用平均值填充

分析不足;有时会打开一个单独的类别

异常值

自动删除

区分数据错误和真实领先

曝光

计算所有保单 1 年

计算暴露分数

类别不一致

忽略

与标准词典匹配

反复损害

没注意到

关键字段去重

特征工程:从数据中获取知识

特征工程是从现有的原始变量中派生出对模型更有用的新变量的艺术。示例:来自出生日期的“年龄”、来自年龄的“年龄组”(分档)、来自车辆品牌模型的“风险段”、来自地址策略组合的“年度里程估计”。好的特征比原始数据携带更强的信号,并提高模型的准确性和可解释性。

精算工作中经常使用三种技术。绑定:将连续变量(年龄)分成有意义的组;这捕获了非线性关系并使关税变得可读。编码:将分类变量(区域)转换为适合模型的数值格式;基于风险的编码(用自己的损坏率代表每个类别)很常见,但应谨慎执行。标准化:通过将所有内容除以其曝光度来使所有内容具有可比性。人工智能快速生成这些转换的代码;但你必须批准每个转换的逻辑。

提示:目标编码功能强大,但容易出现数据泄漏:如果在计算类别的平均损坏时包含行自身的损坏,则模型会“作弊”。始终在训练数据中以交叉验证模式执行此操作。

最隐蔽的危险:数据泄露和隐性偏见

数据泄漏是将预测时实际不存在的信息引入模型中。经典示例:将包含结果(例如“已支付的索赔”)的变量引入到预测索赔金额的模型中。该模型在测试数据中看起来很完美,但在现实世界中毫无用处,因为在预测时无法获得该信息。泄漏通常是隐藏的,只有通过仔细的精算推理才能发现——人工智能通常不会注意到,有时甚至称赞泄漏变量为“非常强大的预测器”。

第二个潜在的危险是隐性偏见。如果历史数据不公平地代表了某个特定群体(例如,某个地区在历史上被拒绝了太多政策),那么从该数据派生的特征就会带有这种偏差,并且该模型会将其复制到未来。特征工程阶段是识别和纠正这种偏差的最关键时刻。

注意:当你为某个变量“极大地提高了预测能力”而感到高兴之前,先问问:这个变量在预测时是否实际存在,或者是否涉及未来?看起来太好的结果通常是泄漏的迹象。

如何在数据准备中使用人工智能

1)数据质量筛选:

您的角色:数据质量助理。您有精算保单收益率。列:policy_id、start_date、end_date、age、region、vehicle_age、premium、claim_count、claim_amount。给我一份清单和 Python(pandas)代码草图:- 按列计算缺失值。- 标记不合理值(负保费、年龄 <16 或 >100、end<start)。- 计算从开始/结束开始的暴露分数(以年为单位)。请勿删除;只需报告一下,以便我做出决定。

2)特征推导:

我想从流量数据中获取新特征。可用:年龄、车辆年龄、地区、年度公里、使用类型。- 您推荐哪些年龄和公里组(分箱),为什么?- 如何在不泄漏数据的情况下对“地区”进行基于风险的编码?- 建议 3 个值得尝试的新功能,并为每个功能编写精算理由。我会决定。

3)泄漏检查:

我的模型使用以下变量预测损坏的可能性:年龄、地区、车辆年龄、PAID_CLAIM_FLAG、SETTLMENT_DAYS。这些变量中哪些会带来数据泄露的风险?对于每个,评估它在预测时是否可用。列出可疑的以及原因。

4)曝光归一化:

我的一些政策从年中开始。解释并编码风险归一化以正确计算频率:频率 = 总索赔计数 / 总风险(保单年)。举例说明如何计算年中开始的保单的风险敞口。

弱提示/强提示

弱提示:

清理数据并为模型做好准备。

AI不知道哪一栏是哪一栏、业务规则、曝光定义;它可以盲目地删除、填充和破坏数据。

强力提示:

您的角色:精算数据准备助理。数据字典:policy_id(身份)、start/end_date(保单期限)、年龄(预计16-90)、保费(必须>0)、claim_count(>=0)、claim_amount(>=0)。任务:1)为每列编写合理性规则并报告违规情况(删除)。2)给出计算部分暴露的代码。3)3种不同的缺失策略“年龄”(删除)。 /平均/单独类别)呈现正负; 4)如果有可能存在泄露风险的列,则发出警告。自动删除任何记录;我会批准每一个决定。

三个迷你箱子

情况 1 — 曝光错误。在一个投资组合中,短期(3个月)旅行保单被计为全年,因此频率似乎比实际低四倍;价格下跌不正确。当精算师将风险敞口计算为分数(0.25 个保单年)时,真实频率就会被揭示,费率也会得到纠正。 AI生成分数曝光代码;精算师给出了定义。

案例 2 — 潜在泄漏。当助手将“文件关闭时间”变量添加到损坏概率模型中时,准确性显着提高。喜悦是短暂的:这个变量只有在损坏发生后才能知道,这意味着它在预测时是不可用的。当泄漏变量被删除时,模型下降到现实水平。他称赞AI变量是“强大的预测器”;精算师的判断落入了陷阱。

案例 3——偏见的复制。一家公司从历史数据中得出了“申请拒绝”模式,并将其放入新模型中。分析显示,过去的拒绝不成比例地集中在特定社区,这意味着存在历史偏见。该功能已从模型中删除,并替换为更中性的风险指标。人工智能进行分析,测量模式与邻域的重叠;道德决定由精算师和合规部门做出。

常见错误

  • 不假思索地用均值填充缺失值。缺乏本身可能是知识;盲目填写会造成偏见。
  • 自动删除异常值。有些是真正的边缘情况;删除数据而不将其与错误分开会破坏信息。
  • 没有使暴露正常化。将短期保单计算为全年会扭曲频率并扭曲价格。
  • 没有注意到数据泄露。太好的结果往往预示着未来存在变数;查询每个变量在预测时是否存在。
  • 将隐性偏见带入未来。历史数据中的不公正可能会渗透到派生特征中;在功能阶段检查它。

综上所述

精算建模主要是准备数据;如果输入损坏,则输出也会损坏。典型的问题是缺失值、异常值、不一致和重复;关键的精算问题是风险暴露标准化。特征工程——分组、编码、标准化——从数据中得出更强的信号。最隐蔽的危险是数据泄露和隐性偏见;两者都只能通过精算推理来捕捉。人工智能大大加快了这一步骤:扫描生成代码和建议。但不要自动删除任何记录,让人们检查是否存在泄漏和偏见,并批准每次转换。

应用任务

准备一个小型匿名策略数据字典(5-7列,每列合理范围)。向 AI 询问 (a) 每列的合理性规则和违规报告代码,(b) 分数曝光计算,(c) 3 个新功能尝试的建议。然后在列表中添加一个有意的“泄漏陷阱”变量(例如“已支付补偿”)并测试人工智能是否将其捕获为泄漏。

清单

  • [ ] 在删除缺失值和异常值之前我是否分析过原因?
  • [ ] 我是否正确分解和归一化曝光?
  • [ ] 我是否为每个新派生的特征编写了精算理由?
  • [ ] 我是否质疑每个变量在预测时是否实际存在(泄漏)?
  • [ ] 我是否扫描了派生特征中的隐式偏差?
  • [ ] 难道我没有让AI自动删除任何记录并亲自批准每一个决定吗?