سود:
- امکان ایجاد مدل خطی تعمیم یافته (GLM)، ضریب ریسک، تعرفه و مفاهیم حق بیمه ریسک با پشتیبانی از هوش مصنوعی و ترجمه ضرایب به زبان تجاری
- توانایی بحث در مورد تعادل انتخاب متغیر، تعامل، برازش بیش از حد، و تفسیرپذیری مدلهای یادگیری ماشین (GBM) با هوش مصنوعی
- توانایی درک اینکه مدل قیمت گذاری عاری از متغیرهای ممنوعه/تبعیض آمیز است و انطباق تعرفه نهایی با قوانین و رقابت به اکچوئر واگذار شده است.
قیمت بیمه نامه به صورت تصادفی تعیین نمی شود. خطر تصادف رانندگی برای یک راننده 22 ساله و تازه گواهینامه که در یک شهر بزرگ زندگی می کند از نظر آماری بیشتر از یک راننده 45 ساله با 20 سال سابقه است. در یک سیستم منصفانه، حق بیمه نیز باید متفاوت باشد. کار اکچوئری برای اندازه گیری این تفاوت و انعکاس آن بر روی قیمت، طبقه بندی قیمت و ریسک نامیده می شود. در این بخش، مدل خطی تعمیم یافته (GLM)، ستون فقرات اکچوئری قیمتگذاری و جایگزینهای یادگیری ماشینی آن را مورد بحث قرار میدهیم و نحوه استفاده ایمن از هوش مصنوعی را در این فرآیند خواهیم دید.
چند اصطلاح اساسی عامل ریسک متغیری است که بر ریسک تأثیر می گذارد و در قیمت گذاری استفاده می شود (سن، سن خودرو، منطقه، استفاده مورد نظر). تعرفه مجموعه ای از قوانین است که تعیین می کند حق بیمه با توجه به عوامل خطر چگونه محاسبه می شود. حق بیمه ریسک، هزینه زیان مورد انتظار خالص است. هنگامی که هزینه ها، کمیسیون ها، حاشیه سود و هزینه های سرمایه اضافه می شود، حق بیمه تجاری (قیمت فروش) تشکیل می شود. بیایید از ابتدا یادآوری کنیم: هوش مصنوعی متغیرها را پیشنهاد می کند، مدل ها را می سازد، ضرایب را توضیح می دهد. اما اینکه کدام متغیر قانونی و اخلاقی است و اینکه تعرفه نهایی با قوانین و رقابت مطابقت دارد یا خیر متعلق به اکچوئر و واحد تطبیق است.
چرا GLM استاندارد در اکچوئری است
پرکاربردترین روش در قیمت گذاری GLM است. GLM مخفف «مدل خطی تعمیمیافته» است: رگرسیون خطی کلاسیک را برای متناسب کردن اهداف غیرعادی توزیع شده، مانند دادههای آسیب، گسترش میدهد. دارای دو جزء اساسی است. خانواده توزیع: پواسون برای فرکانس، گاما برای شدت انتخاب می شود (منطق در واحد 2). تابع پیوند (پیوند): معمولاً لگاریتمی، که به عوامل اجازه می دهد تا اثر ضربی داشته باشند. ساختار ضرب در اکچوئری بسیار ارزشمند است زیرا تعرفه دقیقاً به این صورت تنظیم می شود: حق بیمه پایه × عامل سن × عامل منطقه × عامل وسیله نقلیه.
بزرگترین مزیت GLM قابلیت تفسیر است. یک ضریب به طور مستقیم به شما می گوید: "گروه راننده جوان فرکانس را 1.6 برابر در مقایسه با گروه مرجع افزایش می دهد." این شفافیت از سه جهت حیاتی است: (1) تنظیم کننده و ممیزی داخلی می توانند مدل را درک و تأیید کنند. (2) یک اثر ممنوعه/تبعیض آمیز قابل مشاهده است. (3) منطق قیمت را می توان برای تیم فروش و مدیریت توضیح داد. مدلهای پیچیدهتر یادگیری ماشین (در زیر) گاهی دقت بالاتری را ارائه میدهند، اما به قیمت شفافیت.
نکته: ضریب GLM در مقیاس ورود به سیستم است. از هوش مصنوعی بخواهید ضریب را با exp(ضریب) به "ضریب ضرب" تبدیل کند. ترجمه به زبان تجاری بسیار ساده تر خواهد بود (به عنوان مثال ضریب 0.47 → ضریب ≈ 1.60 → "60% خطرناک تر").
انتخاب متغیر، برازش بیش از حد و یادگیری ماشین
مهم ترین تصمیم در قیمت گذاری این است که کدام متغیرها در مدل باقی می مانند. دو تله وجود دارد. تعداد کمی از متغیرها مدل را کور می کنند: اگر محرک ریسک مهم از دست برود، قیمت اشتباه خواهد بود. بیش از حد متغیر / برازش بیش از حد باعث می شود مدل داده های گذشته را به خاطر بسپارد: مدل نویز را به عنوان سیگنال اشتباه می گیرد و با خط مشی های جدید شکست می خورد. تعادل از طریق اعتبارسنجی متقابل ایجاد می شود - تقسیم داده ها به قطعات آموزشی و آزمایشی و آزمایش آن بر روی داده هایی که مدل نمی بیند، سادگی و استدلال اکچوئری.
تعامل نیز مهم است: گاهی اوقات تأثیر ترکیبی دو عامل با مجموع تأثیرات جداگانه آنها متفاوت است (یک وسیله نقلیه جوان + اسپرت ممکن است از مجموع تأثیرات فردی آنها خطرناکتر باشد). در GLM، تعاملات به صراحت اضافه می شوند.
در سالهای اخیر، مدلهایی مانند GBM (ماشین تقویت گرادیان - یک روش یادگیری ماشینی قدرتمند که بسیاری از درختهای تصمیمگیری کوچک را ترکیب میکند) در قیمتگذاری رایج شدهاند. اینها به طور خودکار الگوها و تعاملات پیچیده را ثبت می کنند و اغلب پیش بینی های دقیق تری نسبت به GLM ارائه می دهند. اما بهایی دارد: تمایل به "جعبه سیاه" بودن. روش رایج امروزی استفاده از GBM برای کشف و تولید ایده و GLM برای تعرفه شفاف نهایی است. یا تفسیر خروجی GBM با ابزارهای قابل توضیح مانند SHAP.
جدول زیر این دو رویکرد را با هم مقایسه می کند:
معیار
GLM
GBM (یادگیری ماشین)
تفسیر پذیری
بالا (ضریب روشن)
کم (نیاز به ابزار حاشیه نویسی)
ضبط تعامل
به صورت دستی اضافه شد
خودکار
خطر نصب بیش از حد
کم متوسط
بالا (تنظیم دقیق مورد نیاز است)
تایید رگولاتور/حسابرسی
آسان
دشوار است، به اسناد اضافی نیاز دارد
استفاده معمولی
تعرفه نهایی
کشف، مقایسه
نحوه استفاده از هوش مصنوعی در قیمت گذاری
1) ترجمه ضریب GLM به زبان تجاری:
من یک فرکانس GLM (پواسون، پیوند ورود) تنظیم کردم. برخی از ضرایب (مقیاس ورود به سیستم): سن_گروه_18_25: 0.47 ; منطقه_اکثریت: 0.22 ; arac_yasi_10plus: -0.15. هر کدام را با exp() به یک ضریب ضرب تبدیل کنید و آن را در یک جمله توضیح دهید که یک مدیر بتواند آن را بفهمد. همچنین یادآوری کنید که گروه مرجع چیست.
2) بحث متغیر/تعامل:
نقش شما: دستیار قیمت گذاری متغیرهای نامزد من برای مدل فرکانس ترافیک عبارتند از: سن، جنسیت، منطقه، سن وسیله نقلیه، قدرت موتور، کیلومتر سالانه، حرفه. - کدام متغیرها ممکن است از منظر مقرراتی/اخلاقی خطرناک باشند (مثلاً تبعیض غیرمستقیم)؟ - امتحان کدام تعاملات دوجانبه منطقی است؟ - برای جلوگیری از تطبیق بیش از حد، چه مراحل تأیید را باید دنبال کنم؟ تصمیم گیری؛ چارچوبی برای کنترل و بحث به من بدهید.
3) کد کنترل بیش از حد:
کد نظری بنویسید که یک GLM را با اعتبارسنجی متقابل k-fold با استفاده از Python + scikit-learn / statsmodels ارزیابی کند. از انحراف پواسون به عنوان متریک استفاده کنید. نمرات آموزش و آزمون را مقایسه کنید و در قسمت نظرات نحوه خواندن علامت اضافه برازش را توضیح دهید. کتابخانه جعلی است
4) غربالگری متغیر تبعیض/جانشین:
"کد پستی" یک متغیر قوی در مدل قیمت گذاری من بود. خطر این را که به طور غیرمستقیم یک ویژگی ممنوعه (مانند قومیت، درآمد) را به عنوان یک متغیر نیابتی نشان می دهد، توضیح دهید. - برای آزمایش این خطر چه تحلیلی باید انجام دهم؟ - چه جایگزین هایی برای کاهش خطر وجود دارد؟ ارائه مشاوره حقوقی؛ یک چارچوب فنی و اخلاقی ترسیم کنید.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
ایجاد بهترین مدل قیمت گذاری برای بیمه ترافیک.
"بهترین" تعریف نشده است. بدون داده، بدون محدودیت، بدون قانون. هوش مصنوعی پاسخی کلی و غیرقابل اجرا می دهد.
اعلان قدرتمند:
نقش شما: دستیار اکچوئر قیمت گذاری. زمینه: من در حال ساخت یک مدل فرکانس شاخه ترافیک، GLM (پواسون، پیوند ورود) هستم. متغیرهایی که دارم: گروه سنی، سن وسیله نقلیه، منطقه (استان)، کیلومتر سالانه، کاربری مورد نظر. محدودیت: جنسیت نمی تواند توسط قانون استفاده شود. من باید از تبعیض غیرمستقیم اجتناب کنم. وظیفه: 1) مشخصات مدل اولیه را با این متغیرها (از جمله گروه های مرجع) پیشنهاد کنید. 2) دلایلی را برای 2 تعاملی که باید امتحان کنم. 3) فهرستی از مراحل را برای بررسی بیش از حد مناسب ارائه دهید. شما چارچوب و توجیه را ارائه می دهید.
سه کیف کوچک
مورد 1 - ارزش شفافیت. یک شرکت مدل قیمت گذاری بسیار دقیقی را که با GBM ساخته بود به تنظیم کننده ارائه کرد، اما نتوانست ضرایب را توضیح دهد. تصویب به تعویق افتاد آکچوئر یک GLM ساخت که همان سیگنال ها را دریافت می کرد. دقت 2 درصد کاهش یافت، اما از آنجایی که هر عاملی را میتوان در نظر گرفت، مدل ظرف یک ماه اعتبار سنجی شد. GBM برای شناسایی ذخیره شد، GLM تعرفه شد. YZ به سرعت توضیحات کد و تنظیم کننده را با مقایسه عملکرد دو مدل تولید کرد.
مورد 2 - تله بیش از حد مناسب. یک کمک کننده زمانی که بیش از 40 متغیر و تعاملات متعدد را به مدل اضافه کرد، امتیاز کاملی در داده های آموزشی کسب کرد. اما در اعتبارسنجی متقاطع، نمره آزمون سقوط کرد: مدل نویز را به خاطر سپرده بود. وقتی تعداد متغیرها به 12 کاهش یافت و ساده شد، عملکرد دنیای واقعی افزایش یافت. درس: به امتیاز داده های بی سابقه نگاه کنید، نه امتیاز آموزشی.
مورد 3 - تبعیض غیرمستقیم. در یک مدل، متغیر "همسایگی" حق بیمه را به شدت توضیح داد. تجزیه و تحلیل نشان داد که این متغیر تا حد زیادی با تمرکز قومی همپوشانی دارد، یعنی نماینده یک ویژگی ممنوع است. آکچوئر این متغیر را با شاخص های خطر خنثی تر (نوع جاده، وضعیت پارکینگ) جایگزین کرد. خطرات اخلاقی و قانونی کاهش یافته است. هوش مصنوعی تجزیه و تحلیل همبستگی را با اندازه گیری همپوشانی و پیشنهادهای متغیر جایگزین تولید کرد. اکچوئر و واحد انطباق این تصمیم را گرفتند.
اشتباهات رایج
- تبدیل مدل غیرقابل تفسیر به دستور العمل نهایی. قیمتی که نمی توان آن را برای تنظیم کننده، حسابرسی و مشتری توضیح داد، ناپایدار است. شفافیت ضروری است.
- با تکیه بر نمره تحصیلی تطبیق بیش از حد فقط در دادههای دیده نشده (تأیید متقابل) شناسایی میشود.
- استفاده از متغیرهای ممنوعه/جانشین بدون بررسی. متغیرهایی مانند کد پستی و شغل ممکن است دارای تبعیض غیرمستقیم باشند. حتما تستش کن
- اشتباه گرفتن حق بیمه ریسک با حق بیمه تجاری. هزینه خسارت خالص به تنهایی قیمت فروش نیست. هزینه، سود و هزینه سرمایه اضافه می شود.
- گذاشتن ضریب در مقیاس لگاریتم و تفسیر نادرست آن. نظر دادن بدون تبدیل آن به ضریب ضرب کننده با exp() باعث خطا می شود.
احتیاط: توصیه هوش مصنوعی در مورد مدلی که "بهترین دقت را ارائه می دهد" به طور خودکار مدلی نیست که "باید استفاده شود". شفافیت، انصاف و انطباق با قوانین معیارهای اجباری و همچنین دقت در قیمت گذاری اکچوئری هستند.
به طور خلاصه
قیمت گذاری فرآیند اندازه گیری ریسک با عوامل خطر و تبدیل آن به حق بیمه منصفانه است. GLM استاندارد قیمت گذاری اکچوئری با ساختار ضربی و قابل تفسیر آن است. ضرایب با exp() به فاکتور تبدیل می شوند. مدلهای یادگیری ماشینی مانند GBM ممکن است دقیقتر باشند، اما شفافیت را کاهش میدهند و معمولاً برای کشف استفاده میشوند. انتخاب متغیر باید با اعتبارسنجی متقاطع در برابر برازش بیش از حد محافظت شود و تبعیض غیرمستقیم (متغیر جایگزین) باید به دقت کنترل شود. هوش مصنوعی مدل را می سازد، کد می نویسد و ضریب را توضیح می دهد. اما رعایت حقوقی-اخلاقی و تعرفه نهایی متعلق به واحد اکچوئری و انطباق است.
وظیفه کاربردی
5-6 عامل خطر برای یک رشته را فهرست کنید. از هوش مصنوعی بخواهید (الف) مشخصات اولیه GLM با این عوامل، (ب) 2 تعامل برای امتحان و منطق آنها، (ج) غربالگری متغیرهایی که ممکن است در معرض خطر تبعیض غیرمستقیم باشند. سپس، یک مثال از 3 ضریب log ارائه دهید، از هوش مصنوعی بخواهید که با exp() آن را به یک ضریب ضریب تبدیل کند و آن را به زبان تجاری منتقل کند و فاکتورها را به صورت دستی تأیید کند.
چک لیست
- [ ] آیا می توان مدل من را تفسیر کرد. آیا می توانم تأثیر هر عامل را به زبان تجاری ترجمه کنم؟
- [ ] آیا از طریق اعتبارسنجی متقاطع، تطبیق بیش از حد را بررسی کرده ام؟
- [ ] آیا تبعیض غیرمستقیم را برای متغیرهای ممنوعه و پروکسی بررسی کرده ام؟
- [ ] آیا من آگاهانه حق بیمه ریسک را از حق بیمه تجاری جدا کرده ام؟
- [ ] آیا من ضرایب را با exp() به ضریب تبدیل کردم و آنها را به درستی تفسیر کردم؟
- [ ] آیا من تصمیم نهایی تعرفه را همراه با قانون و واحد انطباق گرفتم؟