ユニット 4 / 11

価格設定とリスク分類: GLM、関税、人工知能

利益:

  • 人工知能のサポートを受けて一般化線形モデル (GLM)、リスク係数、料金、およびリスクプレミアムの概念を確立し、係数をビジネス言語に翻訳する能力
  • 人工知能を使用した機械学習モデル (GBM) の変数選択、相互作用、過学習、および解釈可能性のバランスについて議論する能力
  • 価格設定モデルには禁止/差別的な変数が含まれておらず、最終的な料金表が法律や競争に準拠しているかどうかは保険数理士に任されているということを理解することができます。

保険の価格はランダムに決定されるわけではありません。大都市に住む 22 歳の新しく免許を取得したドライバーの交通事故のリスクは、20 年の経験を持つ 45 歳のドライバーよりも統計的に高くなります。公平な制度であれば、保険料も異なるはずです。この差を測定し、価格に反映させるアクチュアリーの仕事は、価格設定とリスク分類と呼ばれます。この単元では、価格設定の保険数理のバックボーンである一般化線形モデル (GLM) とその機械学習の代替手段について説明し、このプロセスで AI を安全に使用する方法を見ていきます。

いくつかの基本的な用語。リスク係数はリスクに影響を与える変数であり、価格設定に使用されます (年齢、車両の使用年数、地域、使用目的)。料金表は、リスク要因に応じて保険料を計算する方法を決定する一連のルールです。リスクプレミアムは純粋に期待される損失コストです。経費、手数料、利益率、資本コストが加算されると、商業プレミアム(販売価格)が形成されます。最初から思い出してください。AI は変数を提案し、モデルを構築し、係数を説明します。しかし、どの変数が法的かつ倫理的であるか、そして最終的な料金が法律や競争に準拠しているかどうかは、アクチュアリーとコンプライアンス部門に属します。

なぜGLMが保険数理の標準なのか

価格設定で最もよく使用される方法は GLM です。 GLM は「一般化線形モデル」の略で、古典的な線形回帰を拡張して、損傷データなどの非正規分布ターゲットに適合します。これには 2 つの基本コンポーネントがあります。分布ファミリー: 周波数にはポアソンが選択され、強度にはガンマが選択されます (ユニット 2 のロジック)。リンク関数 (リンク): 通常は対数関数であり、係数に乗算効果を持たせることができます。乗法構造は、まさに保険料が基本保険料 × 年齢要因 × 地域要因 × 車両要因として設定される方法であるため、保険数理上非常に価値があります。

GLM の最大の利点は解釈可能性です。係数は、「若いドライバーのグループは、参照グループと比較して頻度が 1.6 倍増加する」ことを直接示します。この透明性は次の 3 つの点で重要です。(1) 規制当局と内部監査がモデルを理解して承認できる。 (2) 禁止/差別的効果が目に見えるもの。 (3) 価格ロジックを営業および経営チームに説明できる。より複雑な機械学習モデル (下記) では、より高い精度が得られる場合がありますが、透明性が犠牲になります。

ヒント: GLM 係数は対数スケールです。 AIにexp(coefficient)で係数を「乗算係数」に変換してもらいます。ビジネス用語に翻訳するのははるかに簡単です (例: 係数 0.47 → 係数 ≈ 1.60 → 「60% リスクが高い」)。

変数の選択、過学習、機械学習

価格設定における最も重要な決定は、どの変数をモデルに残すかということです。罠は2つあります。モデルを盲目にする変数はほとんどありません。重要なリスク要因を見逃した場合、価格は間違ったものになります。変数が多すぎる/過学習すると、モデルが過去のデータを記憶するようになります。モデルはノイズを信号と間違え、新しいポリシーで失敗します。バランスは相互検証を通じて確立されます。データをトレーニングピースとテストピースに分割し、モデルが認識しないデータ、シンプルさ、保険数理上の推論でテストします。

相互作用も重要です。2 つの要因を組み合わせた効果は、それぞれの個別の効果の合計とは異なる場合があります (若くてスポーティな車は、個々の効果の合計よりもリスクが高い場合があります)。 GLM では、インタラクションは明示的に追加されます。

近年、GBM (勾配ブースティング マシン - 多数の小さなデシジョン ツリーを組み合わせた強力な機械学習手法) などのモデルが価格設定において一般的になってきました。これらは複雑なパターンと相互作用を自動的にキャプチャし、多くの場合、GLM よりも正確な予測を提供します。しかし、それには代償が伴います。それは、「ブラックボックス」になる傾向です。今日の一般的な慣行は、発見とアイデア生成には GBM を使用し、最終的な透明な料金表には GLM を使用することです。または、SHAP などの説明ツールを使用して GBM 出力を解釈します。

次の表では、2 つのアプローチを比較しています。

基準

GLM

GBM(機械学習)

解釈可能性

高(係数オン)

低 (注釈ツールが必要)

インタラクションキャプチャ

手動で追加

自動

過学習のリスク

低~中

高(慎重な調整が必要)

規制当局/監査の承認

簡単な

難しい、追加の文書が必要

一般的な使用法

最終料金表

発見、比較

AIを価格設定に活用する方法

1) GLM 係数をビジネス言語に翻訳する:

周波数GLM(ポアソン、ログリンク)を設定しました。いくつかの係数 (対数スケール): age_group_18_25: 0.47 ;地域マジョリティ: 0.22 ; arac_yasi_10plus: -0.15。それぞれをexp()で乗数に変換し、管理者が理解できる一文で説明します。また、参照グループが何であるかを思い出してください。

2) 変数/相互作用の議論:

あなたの役割: 価格設定アシスタント。交通頻度モデルの候補変数は、年齢、性別、地域、車両の年齢、エンジン出力、年間走行距離、職業です。 - 規制/倫理の観点からリスクがある可能性のある変数はどれですか (間接差別など)? - どのような二国間交流を試みるのが理にかなっていますか? - 過学習を避けるためにはどのような検証手順に従う必要がありますか?意思決定;コントロールとディスカッションの枠組みを教えてください。

3) オーバーフィッティング制御コード:

Python + scikit-learn / statsmodels を使用して、k 分割相互検証で GLM を評価するコメント付きコードを作成します。ポアソン偏差を指標として使用します。トレーニングとテストのスコアを比較し、過剰適合の兆候を読み取る方法をコメント行で説明します。図書館は偽物です。

4) 識別/代理変数のスクリーニング:

私の価格モデルでは「郵便番号」が強力な変数であることが判明しました。これが禁止された特性 (民族、収入など) を代理変数として間接的に表すことのリスクを説明してください。 - このリスクをテストするにはどのような分析を行う必要がありますか? - リスクを軽減するにはどのような代替策がありますか?法的アドバイスの提供;技術的かつ倫理的な枠組みを描きます。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

交通保険の最適な価格設定モデルを確立します。

「最高」とは定義されていません。データも制限も法律もありません。 AI は一般的で当てはまらない答えを返します。

強力なプロンプト:

あなたの役割: 価格設定アクチュアリーのアシスタント。コンテキスト: 交通分岐頻度モデル、GLM (ポアソン、ログ リンク) を構築しています。私が持っている変数: 年齢層、車両の年齢、地域 (州)、年間走行距離、使用目的。制約: 性別は法律で使用できません。間接差別を避ける必要があります。タスク:1) これらの変数 (参照グループを含む) を使用した初期モデル仕様を提案します。2) 試すべき 2 つの交互作用の理由を示します。3) 過学習をチェックする手順のリストを示します。4) 間接差別に関して「領域」に関する特別な注意を追加します。決定は私が行います。枠組みと根拠を提供するのはあなたです。

ミニケース3個

ケース 1 — 透明度の値。ある企業は、GBM を使用して構築した非常に正確な価格設定モデルを規制当局に提示しましたが、係数については説明できませんでした。承認が遅れた。保険数理士は、同じシグナルを捕捉する GLM を構築しました。精度は 2% 低下しましたが、すべての要素を考慮できるため、モデルは 1 か月以内に検証されました。 GBMは偵察用に保存され、GLMは関税となった。 YZ は、2 つのモデルの性能を比較するコードとレギュレーターの説明をすぐに作成しました。

ケース 2 — 過剰適合の罠。あるヘルパーは、40 を超える変数と多数の相互作用をモデルに追加したときに、トレーニング データで満点を獲得しました。しかし、相互検証ではテスト スコアが崩壊しました。モデルはノイズを記憶していました。変数の数を 12 に減らして単純化すると、現実世界のパフォーマンスが向上しました。教訓: トレーニング スコアではなく、前例のないデータ スコアに注目してください。

ケース 3 — 間接差別。あるモデルでは、「近隣」変数がプレミアムを強く説明しました。分析の結果、この変数は民族集中と主に重なっている、つまり禁止された特性の代用であることが示されました。保険計理士は、この変数をより中立的なリスク指標 (道路の種類、駐車状況) に置き換えました。倫理的リスクと法的リスクの両方が減少しました。 AI は、重複と代替変数の提案を測定する相関分析を生成しました。保険計理士とコンプライアンス部門が決定を下した。

よくある間違い

  • 解釈できないモデルを究極のレシピにする。規制当局、監査、顧客に説明できない価格は持続不可能です。透明性は不可欠です。
  • 教育スコアに依存します。過学習は、目に見えないデータでのみ検出されます (交差検証)。
  • 禁止されている/代理変数をチェックせずに使用する。郵便番号や職業などの変数は、間接的な差別をもたらす可能性があります。必ずテストしてください。
  • リスクプレミアムと商業プレミアムを混同する。純粋な損害コストだけでは販売価格にはなりません。経費、利益、資本コストが加算されます。
  • 係数を対数スケールのままにして、それを誤解します。 exp()で乗数に変換せずにコメントするとエラーになります。
注意: AI が「最高の精度を与える」モデルを推奨しても、自動的に「使用すべき」モデルになるわけではありません。透明性、公平性、法律の順守は、保険数理価格の正確性と同様に必須の基準です。

要約すれば

価格設定は、リスク要因を考慮してリスクを測定し、それを公正な保険料に換算するプロセスです。 GLM は、乗算的で解釈可能な構造を備えた保険数理価格の標準です。係数はexp()で因数に変換されます。 GBM などの機械学習モデルはより正確である可能性がありますが、透明性が低下するため、通常は発見に使用されます。変数の選択は交差検証によって過剰適合から保護する必要があり、間接的な区別 (代理変数) は慎重に制御する必要があります。 AI がモデルを構築し、コードを書き、係数を説明します。しかし、法的倫理遵守と最終料金は保険計理人およびコンプライアンス部門に属します。

アプリケーションタスク

メジャーのリスク要因を 5 ~ 6 つ挙げてください。 AI に、(a) これらの要素を含む GLM の初期仕様、(b) 試行する 2 つの相互作用とその理論的根拠、(c) 間接差別のリスクがある可能性のある変数のスクリーニングについて質問します。次に、3 つの対数係数の例を出し、AI に exp() で乗数係数に変換してもらい、ビジネス言語に転送し、手動で係数を検証します。

チェックリスト

  • [ ] 私のモデルは解釈できますか?各要因の影響をビジネス言語に翻訳できますか?
  • [ ] 交差検証によって過剰適合をチェックしましたか?
  • [ ] 禁止変数および代理変数の間接差別をスキャンしましたか?
  • [ ] リスクプレミアムを商業プレミアムから意識的に分離しましたか?
  • [ ] exp() を使用して係数を乗数に変換し、正しく解釈しましたか?
  • [ ] 私は法律およびコンプライアンス部門と協力して最終的な料金決定を行いましたか?