واحد 6 / 11

آماده سازی داده ها و مهندسی ویژگی: مدیریت داده های اکچوئری با هوش مصنوعی

سود:

  • توانایی تشخیص مقادیر گمشده، نقاط پرت، نوردهی و مشکلات کیفیت داده در خط مشی و آسیب به داده ها با پشتیبانی هوش مصنوعی و تولید پیش نویس تصحیح
  • مهندسی ویژگی (اشتقاق متغیر جدید، گروه بندی، کدگذاری) و عادی سازی قرار گرفتن در معرض هوش مصنوعی با زمینه مناسب
  • درک کنید که تحولات داده پیشنهاد شده توسط هوش مصنوعی باید توسط یک اکچوئر در برابر خطر نشت داده ها و سوگیری پنهان حسابرسی شود.

کمترین صحبت در مورد اما زمان برترین بخش کار اکچوئری تهیه داده است. آکچوئرهای با تجربه می دانند که بیشتر زمان یک پروژه مدل سازی صرف تمیز کردن، ترکیب و تصحیح داده ها می شود. مهم نیست که مدل چقدر ظریف است، اگر داده های ورودی خراب باشد، خروجی خراب است - به طور خلاصه، "زباله داخل، زباله بیرون". در این واحد، مشکلات معمولی داده‌های خط‌مشی و ادعاها، نحوه شناسایی و رفع آنها با هوش مصنوعی، و رویکرد مهندسی ویژگی (متغیرهای جدید مشتق شده که اطلاعات بیشتری از داده‌های موجود دارند) مشاهده خواهیم کرد.

یک هشدار از ابتدا: آماده سازی داده ها یک مرحله به ظاهر فنی و بی گناه است، اما خطرناک ترین خطاها در اینجا پنهان می شوند. عادی سازی نوردهی نادرست، نشت داده های پنهان، یا یک سوگیری ناخواسته معرفی شده بی سر و صدا همه مدل های بعدی را خراب می کند. هوش مصنوعی این مرحله را بسیار تسریع می کند، اما اگر کنترل نشود، خطر را نیز افزایش می دهد.

مشکلات معمولی داده های اکچوئری

داده‌های خط‌مشی و ادعاها تقریباً هرگز پاک نمی‌شوند. رایج ترین مشکلات عبارتند از: مقادیر از دست رفته: برخی از خط مشی ها دارای سن، شغل یا منطقه خودرو خالی هستند. پر کردن کورکورانه این موارد با میانگین می‌تواند سوگیری ایجاد کند. خود کمبود گاهی اطلاعاتی را به همراه دارد (گمشدگان گروهی متفاوت هستند). موارد پرت: سوابق غیرمنطقی مانند حق بیمه منفی، بیمه شده 200 ساله، بیمه نامه مواجهه صفر. باید تشخیص داد که آیا این خطاهای داده هستند یا موارد لبه واقعی. ناسازگاری: املای مختلف یک منطقه ("استانبول"، "استانبول"، "34")، اشتباه در قالب تاریخ. ورودی های تکراری: ورود همان آسیب دو بار.

اما بحرانی ترین موضوع ویژه اکچوئری، قرار گرفتن در معرض است. اگر خط‌مشی از اواسط سال شروع شود، در معرض کسری (مثلاً 0.5 سال) برای آن سال قرار می‌گیرد، نه یک «سال سیاست‌گذاری» کامل. فرکانس و میزان آسیب همیشه باید به نوردهی نرمال شود. در غیر این صورت سیاست های کوتاه مدت با ریسک بالا به نظر می رسند. هوش مصنوعی می تواند محاسبه نوردهی را رمزگذاری کند، اما شما باید تعریف و قانون تجارت را ارائه دهید.

جدول زیر مشکلات معمولی و رویکرد صحیح را خلاصه می کند:

مشکل

رویکرد اشتباه

رویکرد درست

مقدار از دست رفته

همه را با میانگین پر کنید

تجزیه و تحلیل کمبود؛ گاهی اوقات یک دسته جداگانه باز کنید

پرت

حذف خودکار

بین خطای داده و سرنخ واقعی تمایز قائل شوید

قرار گرفتن در معرض

همه سیاست ها را برای 1 سال حساب کنید

نوردهی کسری را محاسبه کنید

ناهماهنگی دسته بندی

نادیده گرفتن

مطابقت با فرهنگ لغت استاندارد

آسیب های مکرر

متوجه نشو

با فیلدهای کلیدی کپی برداری کنید

مهندسی ویژگی: استخراج دانش از داده ها

مهندسی ویژگی هنر استخراج متغیرهای جدیدی است که برای مدل از متغیرهای خام موجود مفیدتر هستند. مثال‌ها: «سن» از تاریخ تولد، «گروه سنی» (binning) از سن، «بخش خطر» از مدل خودرو، «تخمین مسافت پیموده شده سالانه» از ترکیب خط‌مشی-آدرس. یک ویژگی خوب سیگنال قوی‌تری نسبت به داده‌های خام دارد و هم دقت و هم قابلیت تفسیر مدل را افزایش می‌دهد.

سه تکنیک اغلب در کار اکچوئری استفاده می شود. Binding: جدا کردن یک متغیر پیوسته (سن) به گروه های معنی دار. این روابط غیر خطی را ثبت می کند و تعرفه را قابل خواندن می کند. رمزگذاری: تبدیل متغیرهای طبقه بندی شده (منطقه) به قالب عددی مناسب برای مدل. کدگذاری مبتنی بر ریسک (که هر دسته را با میزان آسیب خاص خود نشان می دهد) رایج است اما باید با احتیاط انجام شود. عادی سازی: قابل مقایسه کردن همه چیز با تقسیم آن بر نوردهی آن. هوش مصنوعی به سرعت کد این تغییرات را تولید می کند. اما شما باید منطق هر تحول را تایید کنید.

نکته: رمزگذاری هدف قدرتمند است اما مستعد نشت داده است: اگر خسارت خود ردیف را هنگام محاسبه میانگین آسیب یک دسته لحاظ کنید، مدل "تقلب" می کند. همیشه این کار را در داده های آموزشی، در یک الگوی اعتبار سنجی متقاطع انجام دهید.

موذیانه ترین خطر: نشت داده ها و سوگیری ضمنی

نشت داده، ورود اطلاعاتی به مدل است که در زمان پیش‌بینی وجود ندارد. مثال کلاسیک: معرفی متغیری حاوی نتیجه، مانند «دعاهای پرداخت شده» در مدلی که مبلغ خسارت را پیش‌بینی می‌کند. این مدل در داده های آزمایشی عالی به نظر می رسد اما در دنیای واقعی بی فایده است زیرا این اطلاعات در زمان پیش بینی در دسترس نیست. نشت اغلب پنهان است و فقط با استدلال دقیق اکچوئری مشخص می شود - هوش مصنوعی معمولا متوجه نمی شود، حتی گاهی اوقات متغیر نشت را به عنوان "پیش بینی بسیار قدرتمند" تحسین می کند.

دومین خطر موذیانه، سوگیری ضمنی است. اگر داده‌های تاریخی به‌طور ناعادلانه یک گروه خاص را نشان می‌دهند (مثلاً، یک منطقه از لحاظ تاریخی از سیاست‌های زیادی رد شده است)، ویژگی‌های به دست آمده از آن داده‌ها این سوگیری را دارند و مدل آن را در آینده تکرار می‌کند. فاز مهندسی ویژگی بحرانی ترین لحظه ای است که می توان این سوگیری را تشخیص داد و اصلاح کرد.

احتیاط: قبل از اینکه وقتی متغیری «قدرت پیش‌بینی فوق‌العاده را بهبود می‌بخشد» خوشحال شوید، بپرسید: آیا این متغیر واقعاً در زمان پیش‌بینی وجود دارد یا آینده را در بر می‌گیرد؟ نتیجه ای که خیلی خوب به نظر می رسد اغلب نشانه نشتی است.

نحوه استفاده از هوش مصنوعی در تهیه داده ها

1) غربالگری کیفیت داده ها:

نقش شما: دستیار کیفیت داده. شما بازده سیاست اکچوئری دارید. ستون‌ها: Policy_id، start_date، end_date، سن، منطقه، خودرو_سن، حق بیمه، ادعای_شمار، ادعای_amount. یک چک لیست و طرح کد Python (پانداها) به من بدهید: - مقادیر گمشده را بر اساس ستون بشمارید. - پرچم‌گذاری مقادیر نامعقول (حق بیمه منفی، سن <0-16، 16 یا <10). سال) از شروع/پایان. حذف نکنید. فقط گزارش دهید تا من تصمیم بگیرم.

2) اشتقاق ویژگی:

من می خواهم ویژگی های جدیدی را از داده های ترافیک خود استخراج کنم. موجود: سن، سن خودرو، منطقه، کیلومتر_سال، نوع_استفاده.- کدام گروه های سنی و کیلومتری (binning) را توصیه می کنید، چرا؟- چگونه می توانم برنامه نویسی مبتنی بر ریسک را برای "منطقه" بدون نشت داده انجام دهم؟- 3 ویژگی جدید را پیشنهاد کنید که ارزش امتحان کردن دارند و برای هر کدام توجیه اکچوئری بنویسید. من تصمیم خواهم گرفت.

3) بازرسی نشتی:

مدل من احتمال آسیب را با متغیرهای زیر پیش‌بینی می‌کند: سن، منطقه، سن خودرو، PAID_CLAIM_FLAG، SETTLEMENT_DAYS. کدام یک از این متغیرها خطر نشت داده را به همراه دارد؟ برای هر کدام، ارزیابی کنید که آیا در زمان پیش‌بینی در دسترس خواهد بود یا خیر. موارد مشکوک و دلیل آن را فهرست کنید.

4) عادی سازی نوردهی:

برخی از سیاست های من از اواسط سال شروع می شود. نرمال‌سازی قرار گرفتن در معرض را برای محاسبه صحیح فراوانی توضیح و کدنویسی کنید: فرکانس = شمارش_مدعی کل / مواجهه کل (سال سیاست). با یک مثال نحوه محاسبه قرار گرفتن در معرض سیاستی را که از اواسط سال شروع می شود نشان دهید.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

داده ها را پاک کرده و برای مدل آماده کنید.

هوش مصنوعی نمی داند کدام ستون کدام است، قوانین تجاری، تعریف قرار گرفتن در معرض. می تواند کورکورانه داده ها را حذف و پر و خراب کند.

اعلان قدرتمند:

نقش شما: دستیار آماده‌سازی داده‌های اکچوئری. فرهنگ لغت داده: Policy_id (هویت)، شروع/پایان_تاریخ (دوره خط‌مشی)، سن (مورد انتظار 16 تا 90)، حق بیمه (باید >0 باشد)، ادعای_شمار (>=0)، ادعای_مبلغ (>=0). وظیفه:1) قانون منطقی بودن را برای هر ستون و REPORT محاسبه کنید. قرار گرفتن در معرض.3) 3 استراتژی مختلف برای از دست دادن "سن" (حذف). / متوسط ​​/ دسته جداگانه) با مثبت-منفی وجود دارد. تصمیم گیری را به من بسپارید. 4) اگر ستونی وجود دارد که ممکن است خطر نشت داشته باشد هشدار دهید. حذف خودکار هر رکورد. من هر تصمیمی را تایید خواهم کرد.

سه کیف کوچک

مورد 1 - خطای مواجهه. در یک سبد، سیاست‌های سفر کوتاه‌مدت (3 ماهه) به‌عنوان سال‌های کامل محاسبه شد، بنابراین تعداد دفعات آن چهار برابر کمتر از آنچه بود، ظاهر شد. قیمت به اشتباه کاهش یافت. زمانی که اکچوئر میزان مواجهه را به صورت کسری (0.25-سال سیاستی) محاسبه کرد، فرکانس واقعی آشکار شد و تعرفه اصلاح شد. کد نوردهی کسری تولید شده توسط هوش مصنوعی. آکچوئر تعریف را ارائه کرد.

مورد 2 - نشت پنهان. هنگامی که یک کمک کننده متغیر "زمان بسته شدن فایل" را به مدل احتمال آسیب اضافه کرد، دقت به طور چشمگیری افزایش یافت. این شادی کوتاه مدت بود: این متغیر تنها پس از وقوع آسیب قابل شناسایی بود، به این معنی که در زمان پیش‌بینی در دسترس نبود. زمانی که متغیر نشتی حذف شد، مدل به سطح واقعی کاهش یافت. او متغیر هوش مصنوعی را به عنوان یک "پیش بینی قدرتمند" تحسین کرد. قضاوت آکچوئر دام را گرفت.

مورد 3 - تکرار سوگیری. یک شرکت الگوی "رد برنامه" را از داده های تاریخی استخراج کرد و آن را در مدل جدید قرار داد. تجزیه و تحلیل نشان داد که رد گذشته به طور نامتناسبی در یک محله خاص متمرکز شده است، به این معنی که یک سوگیری تاریخی وجود دارد. این ویژگی از مدل حذف شد و با شاخص های خطر خنثی تر جایگزین شد. هوش مصنوعی تجزیه و تحلیل را با اندازه گیری همپوشانی الگو با همسایگی تولید کرد. تصمیم اخلاقی توسط اکچوئر و واحد انطباق گرفته شد.

اشتباهات رایج

  • پر کردن مقادیر از دست رفته با میانگین بدون تفکر. فقدان خود ممکن است دانش باشد; پر کردن کورکورانه آن تعصب ایجاد می کند.
  • حذف خودکار نقاط پرت برخی از موارد لبه واقعی هستند. حذف داده ها بدون جدا کردن آن از خطا، اطلاعات را از بین می برد.
  • عادی نشدن نوردهی شمارش سیاست های کوتاه به عنوان سال های کامل، فرکانس را مخدوش می کند و قیمت را مخدوش می کند.
  • عدم توجه به نشت اطلاعات نتیجه خیلی خوب اغلب نشانه متغیری است که آینده را در بر می گیرد. بررسی کنید که آیا هر متغیر در زمان پیش‌بینی وجود دارد یا خیر.
  • آوردن سوگیری ضمنی به آینده. بی عدالتی در داده های تاریخی می تواند به ویژگی های مشتق شده نفوذ کند. آن را در مرحله ویژگی بررسی کنید.

به طور خلاصه

مدل‌سازی اکچوئری عمدتاً در مورد تهیه داده‌ها است. اگر ورودی خراب باشد، خروجی نیز خراب است. مشکلات معمولی عبارتند از فقدان مقادیر، نقاط پرت، ناسازگاری و تکرار. مسئله اکچوئری بحرانی عادی سازی مواجهه است. مهندسی ویژگی - گروه‌بندی، کدگذاری، عادی‌سازی - سیگنال‌های قوی‌تری از داده‌ها به دست می‌آورد. موذیانه ترین خطرات نشت داده و سوگیری ضمنی است. هر دو فقط با استدلال اکچوئری گرفته می شوند. هوش مصنوعی این مرحله را تا حد زیادی سرعت می بخشد: اسکن کد و توصیه ها را تولید می کند. اما به طور خودکار هیچ رکوردی را حذف نکنید، به انسان اجازه دهید نشت و سوگیری را بررسی کند و هر تبدیل را تأیید کند.

وظیفه کاربردی

یک فرهنگ لغت داده خط مشی ناشناس کوچک (5-7 ستون، محدوده معقول هر کدام) آماده کنید. از هوش مصنوعی بخواهید (الف) قانون منطقی بودن و کد گزارش تخلف برای هر ستون، (ب) محاسبه نوردهی کسری، (ج) پیشنهادات برای 3 ویژگی جدید برای امتحان کردن. سپس یک متغیر عمدی "تله نشت" را به لیست اضافه کنید (به عنوان مثال "غرامت پرداخت شده") و آزمایش کنید که آیا هوش مصنوعی آن را به عنوان نشت تشخیص می دهد یا خیر.

چک لیست

  • [ ] آیا قبل از حذف موارد گمشده و پرت آنالیز کرده ام که چرا؟
  • [ ] آیا نوردهی را به درستی تکه تکه و نرمال کرده ام؟
  • [ ] آیا من توجیه اکچوئری را برای هر ویژگی تازه مشتق شده نوشته ام؟
  • [ ] آیا من سؤال کرده ام که آیا هر متغیر در زمان پیش بینی واقعاً وجود دارد (نشت)؟
  • [ ] آیا من برای تعصب ضمنی در ویژگی های مشتق شده اسکن کرده ام؟
  • [ ] آیا هوش مصنوعی نداشتم که هیچ رکوردی را به طور خودکار حذف کنم و هر تصمیمی را خودم تأیید کنم؟