سود:
- توانایی تشخیص مقادیر گمشده، نقاط پرت، نوردهی و مشکلات کیفیت داده در خط مشی و آسیب به داده ها با پشتیبانی هوش مصنوعی و تولید پیش نویس تصحیح
- مهندسی ویژگی (اشتقاق متغیر جدید، گروه بندی، کدگذاری) و عادی سازی قرار گرفتن در معرض هوش مصنوعی با زمینه مناسب
- درک کنید که تحولات داده پیشنهاد شده توسط هوش مصنوعی باید توسط یک اکچوئر در برابر خطر نشت داده ها و سوگیری پنهان حسابرسی شود.
کمترین صحبت در مورد اما زمان برترین بخش کار اکچوئری تهیه داده است. آکچوئرهای با تجربه می دانند که بیشتر زمان یک پروژه مدل سازی صرف تمیز کردن، ترکیب و تصحیح داده ها می شود. مهم نیست که مدل چقدر ظریف است، اگر داده های ورودی خراب باشد، خروجی خراب است - به طور خلاصه، "زباله داخل، زباله بیرون". در این واحد، مشکلات معمولی دادههای خطمشی و ادعاها، نحوه شناسایی و رفع آنها با هوش مصنوعی، و رویکرد مهندسی ویژگی (متغیرهای جدید مشتق شده که اطلاعات بیشتری از دادههای موجود دارند) مشاهده خواهیم کرد.
یک هشدار از ابتدا: آماده سازی داده ها یک مرحله به ظاهر فنی و بی گناه است، اما خطرناک ترین خطاها در اینجا پنهان می شوند. عادی سازی نوردهی نادرست، نشت داده های پنهان، یا یک سوگیری ناخواسته معرفی شده بی سر و صدا همه مدل های بعدی را خراب می کند. هوش مصنوعی این مرحله را بسیار تسریع می کند، اما اگر کنترل نشود، خطر را نیز افزایش می دهد.
مشکلات معمولی داده های اکچوئری
دادههای خطمشی و ادعاها تقریباً هرگز پاک نمیشوند. رایج ترین مشکلات عبارتند از: مقادیر از دست رفته: برخی از خط مشی ها دارای سن، شغل یا منطقه خودرو خالی هستند. پر کردن کورکورانه این موارد با میانگین میتواند سوگیری ایجاد کند. خود کمبود گاهی اطلاعاتی را به همراه دارد (گمشدگان گروهی متفاوت هستند). موارد پرت: سوابق غیرمنطقی مانند حق بیمه منفی، بیمه شده 200 ساله، بیمه نامه مواجهه صفر. باید تشخیص داد که آیا این خطاهای داده هستند یا موارد لبه واقعی. ناسازگاری: املای مختلف یک منطقه ("استانبول"، "استانبول"، "34")، اشتباه در قالب تاریخ. ورودی های تکراری: ورود همان آسیب دو بار.
اما بحرانی ترین موضوع ویژه اکچوئری، قرار گرفتن در معرض است. اگر خطمشی از اواسط سال شروع شود، در معرض کسری (مثلاً 0.5 سال) برای آن سال قرار میگیرد، نه یک «سال سیاستگذاری» کامل. فرکانس و میزان آسیب همیشه باید به نوردهی نرمال شود. در غیر این صورت سیاست های کوتاه مدت با ریسک بالا به نظر می رسند. هوش مصنوعی می تواند محاسبه نوردهی را رمزگذاری کند، اما شما باید تعریف و قانون تجارت را ارائه دهید.
جدول زیر مشکلات معمولی و رویکرد صحیح را خلاصه می کند:
مشکل
رویکرد اشتباه
رویکرد درست
مقدار از دست رفته
همه را با میانگین پر کنید
تجزیه و تحلیل کمبود؛ گاهی اوقات یک دسته جداگانه باز کنید
پرت
حذف خودکار
بین خطای داده و سرنخ واقعی تمایز قائل شوید
قرار گرفتن در معرض
همه سیاست ها را برای 1 سال حساب کنید
نوردهی کسری را محاسبه کنید
ناهماهنگی دسته بندی
نادیده گرفتن
مطابقت با فرهنگ لغت استاندارد
آسیب های مکرر
متوجه نشو
با فیلدهای کلیدی کپی برداری کنید
مهندسی ویژگی: استخراج دانش از داده ها
مهندسی ویژگی هنر استخراج متغیرهای جدیدی است که برای مدل از متغیرهای خام موجود مفیدتر هستند. مثالها: «سن» از تاریخ تولد، «گروه سنی» (binning) از سن، «بخش خطر» از مدل خودرو، «تخمین مسافت پیموده شده سالانه» از ترکیب خطمشی-آدرس. یک ویژگی خوب سیگنال قویتری نسبت به دادههای خام دارد و هم دقت و هم قابلیت تفسیر مدل را افزایش میدهد.
سه تکنیک اغلب در کار اکچوئری استفاده می شود. Binding: جدا کردن یک متغیر پیوسته (سن) به گروه های معنی دار. این روابط غیر خطی را ثبت می کند و تعرفه را قابل خواندن می کند. رمزگذاری: تبدیل متغیرهای طبقه بندی شده (منطقه) به قالب عددی مناسب برای مدل. کدگذاری مبتنی بر ریسک (که هر دسته را با میزان آسیب خاص خود نشان می دهد) رایج است اما باید با احتیاط انجام شود. عادی سازی: قابل مقایسه کردن همه چیز با تقسیم آن بر نوردهی آن. هوش مصنوعی به سرعت کد این تغییرات را تولید می کند. اما شما باید منطق هر تحول را تایید کنید.
نکته: رمزگذاری هدف قدرتمند است اما مستعد نشت داده است: اگر خسارت خود ردیف را هنگام محاسبه میانگین آسیب یک دسته لحاظ کنید، مدل "تقلب" می کند. همیشه این کار را در داده های آموزشی، در یک الگوی اعتبار سنجی متقاطع انجام دهید.
موذیانه ترین خطر: نشت داده ها و سوگیری ضمنی
نشت داده، ورود اطلاعاتی به مدل است که در زمان پیشبینی وجود ندارد. مثال کلاسیک: معرفی متغیری حاوی نتیجه، مانند «دعاهای پرداخت شده» در مدلی که مبلغ خسارت را پیشبینی میکند. این مدل در داده های آزمایشی عالی به نظر می رسد اما در دنیای واقعی بی فایده است زیرا این اطلاعات در زمان پیش بینی در دسترس نیست. نشت اغلب پنهان است و فقط با استدلال دقیق اکچوئری مشخص می شود - هوش مصنوعی معمولا متوجه نمی شود، حتی گاهی اوقات متغیر نشت را به عنوان "پیش بینی بسیار قدرتمند" تحسین می کند.
دومین خطر موذیانه، سوگیری ضمنی است. اگر دادههای تاریخی بهطور ناعادلانه یک گروه خاص را نشان میدهند (مثلاً، یک منطقه از لحاظ تاریخی از سیاستهای زیادی رد شده است)، ویژگیهای به دست آمده از آن دادهها این سوگیری را دارند و مدل آن را در آینده تکرار میکند. فاز مهندسی ویژگی بحرانی ترین لحظه ای است که می توان این سوگیری را تشخیص داد و اصلاح کرد.
احتیاط: قبل از اینکه وقتی متغیری «قدرت پیشبینی فوقالعاده را بهبود میبخشد» خوشحال شوید، بپرسید: آیا این متغیر واقعاً در زمان پیشبینی وجود دارد یا آینده را در بر میگیرد؟ نتیجه ای که خیلی خوب به نظر می رسد اغلب نشانه نشتی است.
نحوه استفاده از هوش مصنوعی در تهیه داده ها
1) غربالگری کیفیت داده ها:
نقش شما: دستیار کیفیت داده. شما بازده سیاست اکچوئری دارید. ستونها: Policy_id، start_date، end_date، سن، منطقه، خودرو_سن، حق بیمه، ادعای_شمار، ادعای_amount. یک چک لیست و طرح کد Python (پانداها) به من بدهید: - مقادیر گمشده را بر اساس ستون بشمارید. - پرچمگذاری مقادیر نامعقول (حق بیمه منفی، سن <0-16، 16 یا <10). سال) از شروع/پایان. حذف نکنید. فقط گزارش دهید تا من تصمیم بگیرم.
2) اشتقاق ویژگی:
من می خواهم ویژگی های جدیدی را از داده های ترافیک خود استخراج کنم. موجود: سن، سن خودرو، منطقه، کیلومتر_سال، نوع_استفاده.- کدام گروه های سنی و کیلومتری (binning) را توصیه می کنید، چرا؟- چگونه می توانم برنامه نویسی مبتنی بر ریسک را برای "منطقه" بدون نشت داده انجام دهم؟- 3 ویژگی جدید را پیشنهاد کنید که ارزش امتحان کردن دارند و برای هر کدام توجیه اکچوئری بنویسید. من تصمیم خواهم گرفت.
3) بازرسی نشتی:
مدل من احتمال آسیب را با متغیرهای زیر پیشبینی میکند: سن، منطقه، سن خودرو، PAID_CLAIM_FLAG، SETTLEMENT_DAYS. کدام یک از این متغیرها خطر نشت داده را به همراه دارد؟ برای هر کدام، ارزیابی کنید که آیا در زمان پیشبینی در دسترس خواهد بود یا خیر. موارد مشکوک و دلیل آن را فهرست کنید.
4) عادی سازی نوردهی:
برخی از سیاست های من از اواسط سال شروع می شود. نرمالسازی قرار گرفتن در معرض را برای محاسبه صحیح فراوانی توضیح و کدنویسی کنید: فرکانس = شمارش_مدعی کل / مواجهه کل (سال سیاست). با یک مثال نحوه محاسبه قرار گرفتن در معرض سیاستی را که از اواسط سال شروع می شود نشان دهید.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
داده ها را پاک کرده و برای مدل آماده کنید.
هوش مصنوعی نمی داند کدام ستون کدام است، قوانین تجاری، تعریف قرار گرفتن در معرض. می تواند کورکورانه داده ها را حذف و پر و خراب کند.
اعلان قدرتمند:
نقش شما: دستیار آمادهسازی دادههای اکچوئری. فرهنگ لغت داده: Policy_id (هویت)، شروع/پایان_تاریخ (دوره خطمشی)، سن (مورد انتظار 16 تا 90)، حق بیمه (باید >0 باشد)، ادعای_شمار (>=0)، ادعای_مبلغ (>=0). وظیفه:1) قانون منطقی بودن را برای هر ستون و REPORT محاسبه کنید. قرار گرفتن در معرض.3) 3 استراتژی مختلف برای از دست دادن "سن" (حذف). / متوسط / دسته جداگانه) با مثبت-منفی وجود دارد. تصمیم گیری را به من بسپارید. 4) اگر ستونی وجود دارد که ممکن است خطر نشت داشته باشد هشدار دهید. حذف خودکار هر رکورد. من هر تصمیمی را تایید خواهم کرد.
سه کیف کوچک
مورد 1 - خطای مواجهه. در یک سبد، سیاستهای سفر کوتاهمدت (3 ماهه) بهعنوان سالهای کامل محاسبه شد، بنابراین تعداد دفعات آن چهار برابر کمتر از آنچه بود، ظاهر شد. قیمت به اشتباه کاهش یافت. زمانی که اکچوئر میزان مواجهه را به صورت کسری (0.25-سال سیاستی) محاسبه کرد، فرکانس واقعی آشکار شد و تعرفه اصلاح شد. کد نوردهی کسری تولید شده توسط هوش مصنوعی. آکچوئر تعریف را ارائه کرد.
مورد 2 - نشت پنهان. هنگامی که یک کمک کننده متغیر "زمان بسته شدن فایل" را به مدل احتمال آسیب اضافه کرد، دقت به طور چشمگیری افزایش یافت. این شادی کوتاه مدت بود: این متغیر تنها پس از وقوع آسیب قابل شناسایی بود، به این معنی که در زمان پیشبینی در دسترس نبود. زمانی که متغیر نشتی حذف شد، مدل به سطح واقعی کاهش یافت. او متغیر هوش مصنوعی را به عنوان یک "پیش بینی قدرتمند" تحسین کرد. قضاوت آکچوئر دام را گرفت.
مورد 3 - تکرار سوگیری. یک شرکت الگوی "رد برنامه" را از داده های تاریخی استخراج کرد و آن را در مدل جدید قرار داد. تجزیه و تحلیل نشان داد که رد گذشته به طور نامتناسبی در یک محله خاص متمرکز شده است، به این معنی که یک سوگیری تاریخی وجود دارد. این ویژگی از مدل حذف شد و با شاخص های خطر خنثی تر جایگزین شد. هوش مصنوعی تجزیه و تحلیل را با اندازه گیری همپوشانی الگو با همسایگی تولید کرد. تصمیم اخلاقی توسط اکچوئر و واحد انطباق گرفته شد.
اشتباهات رایج
- پر کردن مقادیر از دست رفته با میانگین بدون تفکر. فقدان خود ممکن است دانش باشد; پر کردن کورکورانه آن تعصب ایجاد می کند.
- حذف خودکار نقاط پرت برخی از موارد لبه واقعی هستند. حذف داده ها بدون جدا کردن آن از خطا، اطلاعات را از بین می برد.
- عادی نشدن نوردهی شمارش سیاست های کوتاه به عنوان سال های کامل، فرکانس را مخدوش می کند و قیمت را مخدوش می کند.
- عدم توجه به نشت اطلاعات نتیجه خیلی خوب اغلب نشانه متغیری است که آینده را در بر می گیرد. بررسی کنید که آیا هر متغیر در زمان پیشبینی وجود دارد یا خیر.
- آوردن سوگیری ضمنی به آینده. بی عدالتی در داده های تاریخی می تواند به ویژگی های مشتق شده نفوذ کند. آن را در مرحله ویژگی بررسی کنید.
به طور خلاصه
مدلسازی اکچوئری عمدتاً در مورد تهیه دادهها است. اگر ورودی خراب باشد، خروجی نیز خراب است. مشکلات معمولی عبارتند از فقدان مقادیر، نقاط پرت، ناسازگاری و تکرار. مسئله اکچوئری بحرانی عادی سازی مواجهه است. مهندسی ویژگی - گروهبندی، کدگذاری، عادیسازی - سیگنالهای قویتری از دادهها به دست میآورد. موذیانه ترین خطرات نشت داده و سوگیری ضمنی است. هر دو فقط با استدلال اکچوئری گرفته می شوند. هوش مصنوعی این مرحله را تا حد زیادی سرعت می بخشد: اسکن کد و توصیه ها را تولید می کند. اما به طور خودکار هیچ رکوردی را حذف نکنید، به انسان اجازه دهید نشت و سوگیری را بررسی کند و هر تبدیل را تأیید کند.
وظیفه کاربردی
یک فرهنگ لغت داده خط مشی ناشناس کوچک (5-7 ستون، محدوده معقول هر کدام) آماده کنید. از هوش مصنوعی بخواهید (الف) قانون منطقی بودن و کد گزارش تخلف برای هر ستون، (ب) محاسبه نوردهی کسری، (ج) پیشنهادات برای 3 ویژگی جدید برای امتحان کردن. سپس یک متغیر عمدی "تله نشت" را به لیست اضافه کنید (به عنوان مثال "غرامت پرداخت شده") و آزمایش کنید که آیا هوش مصنوعی آن را به عنوان نشت تشخیص می دهد یا خیر.
چک لیست
- [ ] آیا قبل از حذف موارد گمشده و پرت آنالیز کرده ام که چرا؟
- [ ] آیا نوردهی را به درستی تکه تکه و نرمال کرده ام؟
- [ ] آیا من توجیه اکچوئری را برای هر ویژگی تازه مشتق شده نوشته ام؟
- [ ] آیا من سؤال کرده ام که آیا هر متغیر در زمان پیش بینی واقعاً وجود دارد (نشت)؟
- [ ] آیا من برای تعصب ضمنی در ویژگی های مشتق شده اسکن کرده ام؟
- [ ] آیا هوش مصنوعی نداشتم که هیچ رکوردی را به طور خودکار حذف کنم و هر تصمیمی را خودم تأیید کنم؟