وحدة 7 / 11

تقييم النموذج: المقاييس والتحقق المتبادل والتعلم الفائق

المكاسب:

  • القدرة على اختيار وتفسير مقاييس التصنيف والانحدار (مصفوفة الارتباك، الدقة/الاستدعاء/F1، MAE/RMSE/R²) وفقًا للغرض من الوظيفة
  • القدرة على اكتشاف التعلم الزائد من خلال مقارنة درجات التدريب والاختبار والحصول على أداء موثوق به من خلال التحقق المتبادل
  • القدرة على تقييم ما إذا كان كل نموذج يضيف قيمة حقيقية من خلال مقارنته بخط الأساس

من السهل إعداد نموذج؛ من الصعب قياس ما إذا كان يعمل بالفعل أم لا. موضوع هذه الوحدة هو المهارة الأكثر أهمية لعالم البيانات: تقييم النموذج بالمقاييس الصحيحة، وتحقيق أداء تنبؤي موثوق، والقبض على الفخ الأكثر خبثًا: التعلم الزائد (الحفظ). يقوم الذكاء الاصطناعي بحساب المقاييس وتفسيرها ومقارنتها؛ ولكن الأمر متروك للإنسان ليقرر المقياس المناسب لعملك وما إذا كان النموذج "جيدًا بما فيه الكفاية". يمكن للفريق الذي ينظر إلى المقياس الخاطئ أن يخطئ في اعتبار النموذج السيئ لعدة أشهر بمثابة "نجاح".

لماذا الدقة ليست كافية: مصفوفة الارتباك

المقياس الأول الذي يتبادر إلى الذهن في التصنيف هو الدقة (الدقة - النسبة الإجمالية للتنبؤات الصحيحة). لكن كما رأينا في الوحدة السادسة، فإن الدقة تكون مضللة مع البيانات غير المتوازنة. البداية الأفضل هي مصفوفة الارتباك، وهي جدول يقسم التنبؤات إلى أربع صناديق:

  • إيجابي حقيقي (TP): نطلق على المزيف ما هو مزيف حقًا. (جيد)
  • صحيح سلبي (TN): قلنا نظيفة حقا. (جيد)
  • الإيجابي الكاذب (FP): قلنا خطأً أن النظيف مزيف. (إنذار كاذب)
  • سلبي كاذب (FN): أخطأنا الزيف وسميناه نظيفا. (التهديد المفقود)

يشتق مقياسان رئيسيان من هذه المربعات الأربعة. الدقة: "ما هو مقدار ما أسميه مزيفًا وهو في الواقع مزيف؟" — مهم إذا كانت تكاليف الإنذار الكاذب مرتفعة. الحساسية (أذكر باللغة الإنجليزية): "كم عدد المنتجات المزيفة الحقيقية التي اكتشفتها؟" - مهم عندما يكون تفويت التهديد باهظ الثمن. غالبًا ما يكون الاثنان على خلاف مع بعضهما البعض: إذا خفضت الحد وقلت "زائف" أكثر، فإن التذكر يزداد ولكن الدقة تنخفض. درجة F1 هي المتوسط ​​المتوازن (المتوسط ​​التوافقي) لهذين الاثنين.

تنبيه: الإجابة على السؤال "ما هو المقياس المهم" هي قرار تجاري، وليس قرارًا تقنيًا. إن فقدان حالة (استدعاء منخفض) في فحص السرطان أمر كارثي؛ من المزعج إرسال بريد إلكتروني مهم إلى البريد العشوائي (دقة منخفضة) في مرشح البريد العشوائي. التكلفة تحدد المقياس.

مقاييس الانحدار

إذا كان الناتج عبارة عن أرقام، فسيتم استخدام مقاييس مختلفة. MAE (متوسط ​​الخطأ المطلق): مدى انحراف التقديرات عن المتوسط ​​الفعلي، في نفس الوحدة (على سبيل المثال، "نحن مخطئون بمقدار 4200 ليرة تركية في المتوسط"). RMSE (الخطأ الجذري للمتوسط ​​التربيعي): يعاقب الأخطاء الكبرى بشكل أكثر شدة ويكون حساسًا للقيم المتطرفة. R² (مربع R - معامل التحديد): مقدار التباين في الهدف الذي يفسره النموذج (القريب من 1 جيد، 0 سيئ مثل التنبؤ بالمتوسط، والسالب أسوأ).

الفخ الأكثر غدرا: الإفراط في التعلم

إن التجاوز - حيث يحفظ النموذج بيانات التدريب ولكنه يفشل في البيانات الجديدة - هو الخطأ الأكثر شيوعًا في علم البيانات. العَرَض واضح: النموذج رائع في مجموعة التدريب (98%)، وسيئ في مجموعة الاختبار (72%). لقد حفظ النموذج ضوضاء تلك العينة المحددة، وليس النمط الفعلي في البيانات. هناك أيضًا العكس: عدم ملاءمة النموذج – حيث يكون النموذج سيئًا في كل من التدريب والاختبار لأنه من السهل جدًا التقاط النمط.

طرق مكافحة التعلم الزائد: تبسيط النموذج، والمزيد من البيانات، والتنظيم - المكبح الرياضي الذي يمنع النموذج من أن يصبح معقدًا للغاية - والأهم من ذلك، التحقق من الصحة.

التحقق من الصحة: لا تثق في جزء واحد

قد تكون حجرة التدريب/الاختبار الواحدة محظوظة أو سيئة الحظ؛ يمكنك الحصول على درجات عالية في مجموعة الاختبار لمجرد أن تلك العينة سهلة. التحقق من الصحة (CV للاختصار) يحل هذه المشكلة. الشكل الأكثر شيوعًا هو k-fold CV: يتم تقسيم البيانات إلى أجزاء k (على سبيل المثال 5)؛ في كل جولة، جزء واحد هو الاختبار والباقي هو التدريب؛ يتم تكرار هذا 5 مرات ويتم حساب متوسط ​​الدرجات الخمسة. لذلك سترى أن الأداء يعتمد على متوسط ​​عمليات التقسيم المتعددة، وليس على عملية تقسيم محظوظة واحدة. يعد توزيع الدرجات مفيدًا أيضًا: تشير الدرجات المتقلبة جدًا (85٪ في أحد الطوابق، و 62٪ في الطابق الآخر) إلى أن النموذج غير مستقر.

لا يتم استخدام k-fold العادي في السلاسل الزمنية (تسريب المستقبل)؛ بدلاً من ذلك، تقوم بـ "التسلسل الأمامي" (تقسيم السلاسل الزمنية): التدريب دائمًا على الماضي واختبار المستقبل.

متري

نوع المشكلة

متى يهم؟

الدقة

التصنيف

إذا كانت الفصول متوازنة

الدقة

التصنيف

الإنذار الكاذب مكلف

الحساسية (الاستدعاء)

التصنيف

إذا كان تفويتها باهظ الثمن

F1

التصنيف

إذا كان هناك حاجة إلى التوازن

ماي

الانحدار

خطأ قابل للتفسير

RMSE

الانحدار

إذا كانت الأخطاء الكبيرة حاسمة

ص²

الانحدار

قوة تفسيرية

ثلاث حالات صغيرة

الحالة 1 - وهم الدقة العالية. أظهر أحد نماذج الاحتيال دقة بنسبة 99.2% واحتفل الفريق. وبالنظر إلى مصفوفة الارتباك، فإن المعدل الحقيقي: المزيف في البيانات كان 0.8%؛ لم يلتقط النموذج أي شيء مزيف تقريبًا، فقط قال "كل شيء واضح". وكان أذكر 6 ٪. الدرس المستفاد: انظر إلى المقاييس، وليس الدقة.

الحالة 2 - التعلم الزائد الكامن. قام أحد الفرق بتسليم وتعزيز XGBoost إلى 97% في مجموعة التدريب. كانت مجموعة الاختبار 69%، لكن لم ينظر أحد. انهار النموذج في الإنتاج. إذا تم إجراء التحقق المتبادل، لكان الفرق الكبير بين الطيات (التعلم الزائد) مرئيًا من البداية. الدرس المستفاد: الثقة في السيرة الذاتية ودرجة الاختبار، وليس درجة التعليم.

الحالة 3 - تقسيم محظوظ. كان أحد المحللين سعيدًا بالحصول على 88٪ في عملية تقسيم واحدة. عندما قام زميله بعمل سيرة ذاتية مكونة من 5 أضعاف، كانت الدرجات 88%، 71%، 83%، 64%، 79% - المتوسط ​​هو 77%، لكنها متقلبة للغاية. كان النموذج غير مستقر. كانت المقصورة المفردة مضللة. الدرس: انظر إلى متوسط ​​السيرة الذاتية والتوزيع، وليس السلة الفردية.

أربعة قوالب قابلة للنسخ

1) تقرير التصنيف الكامل:

لقد قمت بتدريب النموذج ومجموعة الاختبار. إنشاء: مصفوفة الارتباك والدقة والاستدعاء وF1 (لكل فئة) وأعداد الدعم. أنا أستنتج، لكن الأمر متروك لي: سأخبرك ما هو المقياس المهم. لاحظ أن الدقة يمكن أن تكون مضللة مع البيانات غير المتوازنة.

2) التحكم في التعلم الزائد:

اطبع نتائج النموذج الخاص بي في مجموعتي التدريب والاختبار جنبًا إلى جنب. احسب الفرق بينهما وحذر لأن الاختلاف الكبير علامة على التعلم الزائد. إذا كان الفرق كبيرا، فاقترح التنظيم أو التبسيط.

3) التحقق المتقاطع:

إجراء التحقق المتبادل 5 أضعاف (للتصنيف الطبقي). اطبع النتيجة والمتوسط ​​والانحراف المعياري لكل طية. إذا كانت النتائج متقلبة للغاية (عالية الأمراض المنقولة جنسيا)، تشير إلى أن النموذج غير مستقر. استخدم خطوط الأنابيب بحيث يتم تعلم التحويلات فقط من قطعة التدريب في كل طبقة.

4) مقارنة خط الأساس:

ضع مقياس نموذجي جنبًا إلى جنب مع خط الأساس DummyClassifier. هل يتفوق النموذج بشكل كبير على خط الأساس؟ إذا لم ينجح، وضح أن النموذج لا يضيف أي قيمة حقيقية.

موجه ضعيف / موجه قوي

حث ضعيف:

هل النموذج الخاص بي جيد؟

"جيد" غير محدد؛ ليس من الواضح أي مقياس، أي عتبة، أي خط أساس. يمكن للذكاء الاصطناعي إعطاء رقم دقة واحد والتضليل.

مطالبة قوية:

دورك: مساعد التقييم. التصنيف، بيانات غير متوازنة (12% إيجابية). الأولوية: التذكير (عدم إغفال الإيجابيات). المهمة: (1) مصفوفة الارتباك، (2) الدقة/الاستدعاء/F1، (3) متوسط ​​السيرة الذاتية الطبقية 5 أضعاف والقياسات المعيارية، (4) مقارنة خط الأساس DummyClassifier. ركز على الاستدعاء والاختلاف الأساسي، وليس الدقة. التعليق، ولكن أنا اتخاذ القرار النهائي.

هنا، تكون أولوية المقياس والسيرة الذاتية وحالة خط الأساس واضحة.

الأخطاء الشائعة

  • الثقة في الدقة في البيانات غير المتوازنة. دقة 99% قد لا تلتقط فئة الأقلية على الإطلاق؛ انظر إلى مصفوفة الارتباك.
  • مجرد النظر إلى درجة التعليم الخاص بك. التعليم العالي، وانخفاض درجات الاختبار هو الإفراط في التعلم؛ قارن دائمًا بين درجتين.
  • الاعتماد على حجرة واحدة. القسمة المحظوظة مضللة؛ انظر إلى المتوسط ​​والتوزيع مع التحقق من الصحة.
  • لا تقارن مع خط الأساس. لا يمكنك أن تقول "جيد" دون معرفة ما إذا كان النموذج يتفوق على المتنبئ الغبي.
  • استخدام k-fold العادي في السلاسل الزمنية. يسرب المستقبل. مطلوب تقسيم السلسلة الزمنية.
نصيحة: اكتب ثلاثة أرقام بجوار كل نموذج: درجة التدريب، ومتوسط ​​التحقق من الصحة، والنتيجة الأساسية. يكشف هذا الثلاثي في ​​لمحة سريعة عن التعلم الزائد (التدريب >> السيرة الذاتية) والتقليل من القيمة (السيرة الذاتية ≈ خط الأساس).

باختصار

إن بناء نموذج أمر سهل، لكن تقييمه بصدق أمر صعب. في التصنيف، تعد مصفوفة الارتباك والدقة والاستدعاء أكثر إفادة من الدقة؛ تكلفة الوظيفة تحدد أي منها مهم. يتم استخدام MAE وRMSE وR² في الانحدار. إن الفخ الأكثر خطورة هو التعلم الزائد: قم دائمًا بمقارنة التدريب ونتائج الاختبار. الاعتماد على متوسط ​​وتوزيع التحقق المتبادل، وليس تقسيمًا واحدًا؛ قارن كل شيء بخط الأساس. يقوم الذكاء الاصطناعي بحساب كل هذه الأمور، ولكن الأمر متروك للإنسان لتحديد المقياس الذي يجب استخدامه.

مهمة التطبيق

استخراج مصفوفة الارتباك والدقة والاستدعاء وF1 لنموذج التصنيف؛ ثم قم بإجراء التحقق المتبادل بخمسة أضعاف وانظر إلى توزيع الدرجات عبر الطيات. أخيرًا، قم بتدوين درجة التدريب ومتوسط ​​السيرة الذاتية والنتيجة الأساسية جنبًا إلى جنب. علق بجملة واحدة عما إذا كان نموذجك يتفوق في التعلم ويتجاوز خط الأساس.

قائمة مرجعية

  • [ ] هل نظرت إلى المقياس الفعلي للمهمة (الدقة/الاسترجاع/F1 وما إلى ذلك) بدلاً من الدقة؟
  • [ ] هل قمت بفحص مصفوفة الارتباك؟
  • [ ] هل قمت بمقارنة نتائج التدريب والاختبار وتحققت من التعلم الزائد؟
  • [ ] هل نظرت إلى المتوسط ​​والتوزيع من خلال التحقق المتبادل؟
  • [ ] هل قمت بمقارنة النموذج بخط الأساس؟