وحدة 6 / 11

إعداد البيانات وهندسة الميزات: التعامل مع البيانات الاكتوارية بالذكاء الاصطناعي

المكاسب:

  • القدرة على اكتشاف القيم المفقودة والقيم المتطرفة ومشاكل التعرض وجودة البيانات في السياسات وبيانات الضرر بدعم الذكاء الاصطناعي وإنتاج مسودة التصحيح
  • هندسة الميزات (اشتقاق متغير جديد، وتجميع، وترميز) وتطبيع التعرض للذكاء الاصطناعي في السياق الصحيح
  • افهم أن تحويلات البيانات التي يقترحها الذكاء الاصطناعي يجب أن تخضع للتدقيق من قبل خبير اكتواري ضد مخاطر تسرب البيانات والتحيز الخفي.

أقل ما يتم الحديث عنه ولكن الجزء الأكثر استهلاكًا للوقت من العمل الاكتواري هو إعداد البيانات. يعرف الخبراء الاكتواريون ذوو الخبرة أن معظم وقت مشروع النمذجة يتم إنفاقه في تنظيف البيانات ودمجها وتصحيحها. بغض النظر عن مدى أناقة النموذج، إذا كانت بيانات الإدخال فاسدة، فإن المخرجات فاسدة - باختصار، "قمامة تدخل، قمامة تخرج". في هذه الوحدة، سنرى المشاكل النموذجية لبيانات السياسة والمطالبات، وكيفية اكتشافها وإصلاحها باستخدام الذكاء الاصطناعي، ونهج هندسة الميزات (مشتقات جديدة أكثر إفادة من البيانات الموجودة).

تحذير من البداية: إعداد البيانات يبدو خطوة فنية وبريئة، ولكن هنا تختبئ أخطر الأخطاء. يؤدي تطبيع التعرض غير الصحيح، أو تسرب البيانات المخفية، أو التحيز الذي تم تقديمه عن غير قصد إلى إفساد جميع النماذج اللاحقة بصمت. يعمل الذكاء الاصطناعي على تسريع هذه الخطوة بشكل كبير، ولكن إذا تركها دون سيطرة، فإنه يؤدي أيضًا إلى تفاقم المخاطر.

المشاكل النموذجية للبيانات الاكتوارية

لا تصل بيانات السياسات والمطالبات بشكل نظيف أبدًا. المشاكل الأكثر شيوعًا هي: القيم المفقودة: تحتوي بعض السياسات على عمر السيارة أو المهنة أو المنطقة الفارغة. إن ملء هذه القيم بالمتوسط ​​بشكل أعمى يمكن أن يؤدي إلى التحيز؛ أحيانًا يحمل النقص نفسه معلومات (المفقودون مجموعة مختلفة). القيم المتطرفة: السجلات غير المنطقية مثل القسط السلبي، والتأمين لمدة 200 عام، وسياسة عدم التعرض. يجب التمييز بين ما إذا كانت هذه أخطاء في البيانات أو حالات حافة حقيقية. عدم الاتساق: تهجئات مختلفة لنفس المنطقة ("اسطنبول"، "اسطنبول"، "34")، ارتباك في تنسيق التاريخ. الإدخالات المكررة: دخول نفس الضرر مرتين.

لكن القضية الأكثر أهمية بالنسبة للاكتواري هي التعرض. إذا بدأت السياسة في منتصف العام، فإنها توفر تعرضًا جزئيًا (على سبيل المثال 0.5 سنة) لتلك السنة، وليس "سنة السياسة" كاملة. ينبغي دائمًا ضبط معدلات التكرار والضرر وفقًا للتعرض؛ وإلا فإن السياسات قصيرة المدى تبدو عالية المخاطر. يمكن للذكاء الاصطناعي ترميز حساب التعرض، ولكن يجب عليك تقديم التعريف وقاعدة العمل.

يلخص الجدول التالي المشاكل النموذجية والنهج الصحيح:

مشكلة

نهج خاطئ

النهج الصحيح

القيمة المفقودة

املأ الكل بالمتوسط

تحليل النقص. في بعض الأحيان فتح فئة منفصلة

ناشز

الحذف التلقائي

التمييز بين خطأ البيانات والرصاص الحقيقي

التعرض

عد جميع السياسات لمدة 1 سنة

حساب التعرض الجزئي

عدم تناسق الفئة

تجاهل

تطابق مع القاموس القياسي

الضرر المتكرر

لا تلاحظ

إلغاء التكرار مع الحقول الرئيسية

هندسة الميزات: استخلاص المعرفة من البيانات

هندسة الميزات هي فن استخلاص متغيرات جديدة أكثر فائدة للنموذج من المتغيرات الأولية الموجودة. أمثلة: "العمر" من تاريخ الميلاد، "الفئة العمرية" (التجميع) من العمر، "شريحة المخاطر" من طراز السيارة، "تقدير الأميال السنوي" من مجموعة سياسة العنوان. الميزة الجيدة تحمل إشارة أقوى من البيانات الأولية وتزيد من دقة النموذج وقابليته للتفسير.

يتم استخدام ثلاث تقنيات بشكل متكرر في العمل الاكتواري. الربط: فصل المتغير المستمر (العمر) إلى مجموعات ذات معنى؛ وهذا يجسد العلاقات غير الخطية ويجعل التعريفة قابلة للقراءة. الترميز: تحويل المتغيرات الفئوية (المنطقة) إلى تنسيق رقمي مناسب للنموذج؛ يعد الترميز القائم على المخاطر (الذي يمثل كل فئة بمعدل الضرر الخاص بها) أمرًا شائعًا ولكن يجب القيام به بحذر. التطبيع: جعل كل شيء قابلاً للمقارنة بتقسيمه على تعرضه. يقوم الذكاء الاصطناعي بإنشاء الكود الخاص بهذه التحولات بسرعة؛ ولكن يجب عليك الموافقة على منطق كل تحويل.

نصيحة: يعتبر التشفير المستهدف قويًا ولكنه عرضة لتسرب البيانات: النموذج "يغش" إذا قمت بتضمين الضرر الخاص بالصف عند حساب متوسط ​​الضرر للفئة. افعل ذلك دائمًا ضمن بيانات التدريب، في نمط التحقق المتبادل.

الخطر الأكثر غدرا: تسرب البيانات والتحيز الضمني

تسرب البيانات هو إدخال معلومات في النموذج غير موجودة فعليًا في وقت التنبؤ. مثال كلاسيكي: إدخال متغير يحتوي على النتيجة، مثل "المطالبات المدفوعة"، في نموذج يتنبأ بمبلغ المطالبة. يبدو النموذج مثاليًا في بيانات الاختبار ولكنه عديم الفائدة في العالم الحقيقي لأن هذه المعلومات غير متوفرة في وقت التنبؤ. غالبًا ما يكون التسرب مخفيًا ولا يتم اكتشافه إلا من خلال التفكير الاكتواري الدقيق - عادةً لا يلاحظ الذكاء الاصطناعي، بل ويمتدح في بعض الأحيان المتغير المتسرب باعتباره "مؤشرًا قويًا للغاية".

أما الخطر الخبيث الثاني فهو التحيز الضمني. إذا كانت البيانات التاريخية تمثل بشكل غير عادل مجموعة معينة (على سبيل المثال، تم حرمان منطقة ما تاريخيا من الكثير من السياسات)، فإن الميزات المشتقة من تلك البيانات تحمل هذا التحيز ويقوم النموذج بتكراره في المستقبل. تعد مرحلة هندسة الميزات هي اللحظة الأكثر أهمية عندما يمكن التعرف على هذا التحيز وتصحيحه.

تحذير: قبل أن تبتهج عندما يقوم أحد المتغيرات "بتحسين القدرة التنبؤية بشكل كبير"، اسأل: هل هذا المتغير موجود بالفعل في وقت التنبؤ، أم أنه ينطوي على المستقبل؟ النتيجة التي تبدو جيدة جدًا غالبًا ما تكون علامة على وجود تسرب.

كيفية استخدام الذكاء الاصطناعي في إعداد البيانات

1) فحص جودة البيانات:

دورك: مساعد جودة البيانات. لديك عائد السياسة الاكتوارية. الأعمدة: Policy_id، start_date، end_date،age، المنطقة، Vehicle_age، premium،claim_count،claim_amount. أعطني قائمة مرجعية ورسم كود Python (pandas): - احسب القيم المفقودة حسب العمود. - ضع علامة على القيم غير المعقولة (القسط السلبي، العمر<16 أو >100، النهاية<start).- احسب التعرض الجزئي (بالسنوات) من البداية/النهاية.لا تحذف؛ فقط أبلغ عنه حتى أتمكن من اتخاذ القرار.

2) اشتقاق الميزة:

أريد استخلاص ميزات جديدة من بيانات حركة المرور الخاصة بي. متاح: العمر، عمر_المركبة، المنطقة، السنوي_كم، نوع_الاستخدام. - ما هي مجموعات العمر وعدد الكيلومترات (binning) التي توصي بها، لماذا؟ - كيف يمكنني إجراء الترميز على أساس المخاطر لـ "المنطقة" دون تسرب البيانات؟ - اقترح 3 ميزات جديدة تستحق التجربة واكتب التبرير الاكتواري لكل منها. سأقرر.

3) فحص التسرب:

يتنبأ النموذج الخاص بي باحتمال حدوث ضرر بالمتغيرات التالية: العمر، المنطقة، عمر_المركبة، PAID_CLAIM_FLAG، SETTLEMENT_DAYS. أي من هذه المتغيرات يشكل خطر تسرب البيانات؟ ولكل منها، قم بتقييم ما إذا كانت ستكون متاحة في وقت التنبؤ. قائمة المشبوهة ولماذا.

4) تطبيع التعرض:

بعض سياساتي تبدأ في منتصف العام. اشرح وترميز تطبيع التعرض لحساب التكرار بشكل صحيح: التردد = إجمالي عدد المطالبات / إجمالي التعرض (سنة السياسة). اعرض بمثال كيفية حساب انكشاف الوثيقة الذي يبدأ في منتصف العام.

موجه ضعيف / موجه قوي

حث ضعيف:

تنظيف البيانات وجعلها جاهزة للنموذج.

لا يعرف الذكاء الاصطناعي أي عمود هو، قواعد العمل، تعريف التعرض؛ يمكنه حذف البيانات وملؤها وإفسادها بشكل أعمى.

مطالبة قوية:

دورك: مساعد إعداد البيانات الاكتوارية. قاموس البيانات: Policy_id (الهوية)، تاريخ البدء/الانتهاء (فترة السياسة)، العمر (المتوقع 16-90)، القسط (يجب أن يكون > 0)، عدد_المطالبات (>=0)، مبلغ_المطالبة (>=0).المهمة:1) كتابة قاعدة المعقولية لكل عمود والإبلاغ عن الانتهاكات (الحذف).2) إعطاء رمز لحساب التعرض الجزئي.3) 3 استراتيجيات مختلفة لفقد "العمر" (الحذف). / فئة متوسطة / منفصلة) موجودة مع علامة زائد ناقص؛ اترك القرار لي. 4) تحذير إذا كان هناك عمود قد يشكل خطر التسرب. الحذف التلقائي لأي سجل؛ سأوافق على كل قرار.

ثلاث حالات صغيرة

الحالة 1 - خطأ التعرض. وفي إحدى المحافظ، تم احتساب سياسات السفر قصيرة الأجل (3 أشهر) على أنها سنوات كاملة، وبالتالي بدا التكرار أقل بأربع مرات مما كان عليه في الواقع؛ انخفض السعر بشكل غير صحيح. وعندما قام الخبير الاكتواري بحساب التعرض ككسر (0.25 سنة بوليصة)، تم الكشف عن التكرار الحقيقي وتم تصحيح التعريفة. قام الذكاء الاصطناعي بإنشاء كود تعريض جزئي؛ أعطى الخبير الاكتواري التعريف.

الحالة 2 – التسرب الكامن. عندما أضاف أحد المساعدين متغير "وقت إغلاق الملف" إلى نموذج احتمالية الضرر، زادت الدقة بشكل كبير. ولم تدم الفرحة طويلاً: فلا يمكن معرفة هذا المتغير إلا بعد وقوع الضرر، مما يعني أنه لم يكن متاحاً في وقت التنبؤ. وعندما تمت إزالة المتغير المتسرب، انخفض النموذج إلى مستوى واقعي. وأشاد بمتغير الذكاء الاصطناعي باعتباره «مؤشرًا قويًا»؛ وقع حكم الخبير الاكتواري في الفخ.

الحالة 3 - تكرار التحيز. استمدت إحدى الشركات نمط "رفض الطلب" من البيانات التاريخية ووضعته في النموذج الجديد. وأظهر التحليل أن حالات الرفض السابقة كانت مركزة بشكل غير متناسب في حي معين، مما يعني وجود تحيز تاريخي. تمت إزالة هذه الميزة من النموذج واستبدالها بمؤشرات مخاطر أكثر حيادية. أنتج الذكاء الاصطناعي تحليلاً يقيس تداخل النمط مع الحي؛ تم اتخاذ القرار الأخلاقي من قبل الخبير الاكتواري ووحدة الامتثال.

الأخطاء الشائعة

  • ملء القيم الناقصة بالوسط دون تفكير. قد يكون النقص في حد ذاته معرفة؛ إن ملئه بشكل أعمى يخلق التحيز.
  • حذف القيم المتطرفة تلقائيا. بعضها عبارة عن حالات حافة حقيقية؛ يؤدي حذف البيانات دون فصلها عن الأخطاء إلى تدمير المعلومات.
  • عدم تطبيع التعرض. إن احتساب السياسات القصيرة كسنوات كاملة يشوه التكرار ويشوه السعر.
  • عدم ملاحظة تسرب البيانات. النتيجة الجيدة جدًا غالبًا ما تكون علامة على وجود متغير يتضمن المستقبل؛ استفسر عما إذا كان كل متغير موجودًا في وقت التنبؤ.
  • جلب التحيز الضمني إلى المستقبل. ومن الممكن أن يتسرب الظلم في البيانات التاريخية إلى السمات المشتقة؛ التحقق من ذلك في مرحلة الميزة.

باختصار

تتعلق النمذجة الاكتوارية إلى حد كبير بإعداد البيانات؛ إذا كان الإدخال تالفًا، فإن الإخراج تالف أيضًا. المشاكل النموذجية هي القيم المفقودة، والقيم المتطرفة، والتناقضات، والازدواجية؛ والمسألة الاكتوارية الحاسمة هي تطبيع التعرض. تستمد هندسة الميزات - التجميع، والترميز، والتطبيع - إشارات أقوى من البيانات. وتتمثل المخاطر الأكثر غدراً في تسرب البيانات والتحيز الضمني؛ وكلاهما يتم التقاطهما فقط من خلال المنطق الاكتواري. يعمل الذكاء الاصطناعي على تسريع هذه الخطوة بشكل كبير: حيث يؤدي المسح إلى إنشاء تعليمات برمجية وتوصيات. ولكن لا تحذف أي سجلات تلقائيًا، واسمح للبشر بالتحقق من التسريبات والتحيز، والموافقة على كل تحويل.

مهمة التطبيق

قم بإعداد قاموس صغير لبيانات السياسة المجهولة (5-7 أعمدة، نطاق معقول لكل منها). اطلب من الذكاء الاصطناعي (أ) قاعدة المعقولية ورمز تقرير الانتهاك لكل عمود، (ب) حساب التعرض الجزئي، (ج) اقتراحات لثلاث ميزات جديدة لتجربتها. ثم أضف متغير "مصيدة التسرب" المتعمد إلى القائمة (على سبيل المثال "التعويض المدفوع") واختبر ما إذا كان الذكاء الاصطناعي قد اكتشفه باعتباره تسربًا.

قائمة مرجعية

  • [ ] هل قمت بتحليل السبب قبل حذف القيم المفقودة والمتطرفة؟
  • [ ] هل قمت بتجزئة التعريض الضوئي وتطبيعه بشكل صحيح؟
  • [ ] هل قمت بكتابة التبرير الاكتواري لكل ميزة مشتقة حديثًا؟
  • [ ] هل تساءلت عما إذا كان كل متغير موجود بالفعل (تسرب) في وقت التنبؤ؟
  • [ ] هل قمت بالبحث عن التحيز الضمني في الميزات المشتقة؟
  • [ ] هل لم يكن لدي الذكاء الاصطناعي لحذف أي سجلات تلقائيًا والموافقة على كل قرار بنفسي؟