وحدة 3 / 11

نموذج التدريب والتقييم: مقاييس دقيقة، وقياس أداء صادق

المكاسب:

  • القدرة على اختيار المقياس المناسب لنوع المشكلة وسياق العمل (PR-AUC/الاستدعاء في البيانات غير المتوازنة، MAE/RMSE في الانحدار) والتعرف على التعلم الزائد/الناقص
  • القدرة على تفسير كل مقياس مقابل خط الأساس وقياس الانحراف وفصل الضوضاء عن التقدم من خلال التحقق المتبادل
  • القدرة على الإبلاغ عن نتائج غير متفائلة عن طريق ضبط المعلمات الفائقة مع مجموعة التحقق من الصحة واستخدام مجموعة الاختبار فقط في النهاية

يعد التدريب النموذجي (التدريب: عملية تعلم أنماط التعلم من البيانات) هو الخطوة الأكثر وضوحًا ولكنها الأكثر تضليلًا في هندسة تعلم الآلة. ويبدو أنه ينتج رقماً مرضياً مثل "الدقة 95%". مضلل لأن هذا الرقم غالبًا ما يكون الإجابة الصحيحة على السؤال الخطأ. في هذه الوحدة، تتم مناقشة التعليم والتقييم مع التخصص الهندسي؛ نحن نستخدم الذكاء الاصطناعي كشريك في التصميم التجريبي ونبني القرار على القياس.

منطق الدورة التدريبية

يتعلم النموذج النمط الموجود في البيانات عن طريق تقليل دالة الخسارة: وهي دالة تقيس خطأ النموذج عدديًا. تعمل خوارزمية التحسين (مثل نزول التدرج) على تقليل الخسارة عن طريق ضبط المعلمات خطوة بخطوة. الهدف ليس حفظ بيانات التدريب، بل تعميمها على بيانات غير مسبوقة.

خطران رئيسيان:

  • التجهيز الزائد: يحفظ النموذج بيانات التدريب ويفشل في الحصول على بيانات جديدة. نجاح التدريب مرتفع، ونجاح التحقق منخفض.
  • عدم التجهيز: لا يمكن للنموذج التقاط النمط؛ كل من نجاح التدريب والتحقق من الصحة منخفض.

إيجاد التوازن هو فن التعليم. توجد مجموعة التحقق من الصحة لمراقبة هذا التوازن: إذا بدأ نجاح التحقق في الانخفاض بينما زاد نجاح التدريب، فهذا يعني أن التعلم الزائد قد بدأ.

نصيحة: قم بتخطيط خسارة التدريب والتحقق من الصحة معًا في كل خطوة. النقطة التي يبدأ عندها المنحنيان بالتباعد هي حيث يبدأ التعلم الزائد وهي اللحظة المناسبة "للتوقف المبكر".

اختيار المقياس: القرار الأكثر أهمية

المقياس الخاطئ يجعل النموذج الجيد يبدو سيئًا والنموذج السيئ يبدو جيدًا. تحدد المشكلة المقياس:

  • تصنيف غير متوازن (فئة واحدة نادرة جدًا، مثل الاحتيال): الدقة مضللة. النموذج الذي يقول "اتصل بكل شيء بأنه طبيعي" سيحصل على دقة بنسبة 99% ولكنه لن يتمكن من اكتشاف عملية احتيال واحدة. وبدلاً من ذلك، يتم استخدام الدقة (مقدار ما تم التقاطه هو في الواقع إيجابي)، والتذكر (كم من ما تم التقاطه هو إيجابي حقًا) وتوازنهما F1 أو PR-AUC.
  • التصنيف المتوازن: قد تكون الدقة وROC-AUC مناسبة.
  • الانحدار (تقدير العدد): MAE (متوسط ​​الخطأ المطلق)، RMSE (يعاقب الأخطاء الكبيرة)، MAPE (النسبة المئوية للخطأ).
  • الترتيب/التوصية: NDCG، MRR، Recall@K.

تعتمد أهمية الدقة أو التذكر على سياق العمل. يعتبر التذكير (عدم فقدان أي مريض) أولوية في فحص السرطان؛ تعد الدقة في تصفية البريد العشوائي (عدم إرسال رسائل البريد الإلكتروني المهمة إلى البريد العشوائي) أمرًا مهمًا. وهذا قرار تجاري، وليس قرارًا فنيًا، ويتم اتخاذه معًا من قبل المهندس والمالك.

موجه ضعيف / موجه قوي

مطالبة ضعيفة: "تقييم أداء النموذج الخاص بي، الدقة 0.97."

مطالبة قوية: "لدي نموذج للكشف عن الاحتيال؛ معدل الفصل الإيجابي هو 1.5%. تم الإبلاغ عن الدقة على أنها 0.97. اشرح لماذا قد يكون هذا المقياس مضللاً، وأخبرني عن المقاييس (الدقة، الاستدعاء، PR-AUC) التي يجب أن أفضّلها ولماذا. احسب أيضًا مدى دقة النموذج الأساسي "استدعاء كل شيء سلبي" في هذه البيانات، حتى أتمكن من رؤية القيمة المضافة الحقيقية."

الفرق: موجه قوي يعطي نسبة الفصل وسياق العمل؛ كما أنه يطلب أيضًا مقارنة النماذج الأساسية - وهذا هو المرتكز الأكثر أهمية لمعرفة ما إذا كان المقياس ذا معنى أم لا.

خط الأساس: القياس بدون مقارنة لا معنى له

المقياس ليس جيدًا أو سيئًا في حد ذاته؛ إنه جيد أو سيئ وفقًا للنموذج الأساسي. النموذج الأساسي هو أبسط الحلول التي تتبادر إلى الذهن: "أخبر فئة الأغلبية دائمًا"، "كرر قيمة الأسبوع الماضي"، "خمن المتوسط". إذا لم يتمكن نموذجك من اجتياز هذا الحل البسيط بوضوح، فكل التعقيدات تذهب سدى.

تحذير: الجملة "نموذجي دقيق بنسبة 85%" في حد ذاتها لا تقول أي شيء. إذا حصل النموذج الأساسي بالفعل على 84%، فإن نموذجك لا قيمة له تقريبًا؛ إذا حصل النموذج الأساسي على 50%، فهذا يعني أن نموذجك مثالي. تحدث دائمًا من حيث النموذج الأساسي.

التحقق المتبادل والثقة

قد يكون تقسيم التدريب/الاختبار الفردي نتيجة للصدفة. التحقق من الصحة: ​​يُظهر تقسيم البيانات إلى أجزاء k واختبار كل جزء بالتسلسل مدى استقرار الأداء. في التحقق المتقاطع 5 أضعاف، تحصل على خمس درجات مختلفة؛ إن متوسطهم وانحرافهم المعياري مهمان. إذا كان المتوسط ​​80% ولكن الانحراف هو ±12%، فإن النموذج الخاص بك غير مستقر - وقد يتصرف بشكل مختلف تمامًا في الدفعة التالية من البيانات.

وهذا أمر بالغ الأهمية أيضًا بالنسبة "لمقارنة النموذجين". إذا حصل النموذج "أ" على 81%، والنموذج "ب" على 82%، فهل يكون النموذج "ب" أفضل حقًا؟ إذا كان الانحراف ±3%، فقد يكون هذا الاختلاف ضوضاء. فكر فيما إذا كان الفرق كبيرًا قبل اتخاذ القرار.

ضبط المعلمة الفائقة: مع التحقق من الصحة، وليس الاختبار

يتم تعيين المعلمات الفائقة (الإعدادات التي يتم تحديدها يدويًا قبل التدريب - معدل التعلم، وعمق الشجرة، وما إلى ذلك) مع مجموعة التحقق من الصحة. يتم استخدام مجموعة الاختبار فقط في النهاية، مرة واحدة. إذا قمت بتحديد المعلمات الفائقة من خلال النظر إلى مجموعة الاختبار، فستكون مجموعة الاختبار ملوثة وسيكون الأداء الذي أبلغت عنه متفائلاً وهو ما لا يحدث في الواقع.

يعد الذكاء الاصطناعي مساعدًا جيدًا في تصميم مساحة البحث ذات المعلمات الفائقة وكتابة كود البحث (بحث الشبكة، البحث العشوائي، التحسين بايزي). لكنك لا تزال تقرر "ما المقياس الذي سنقوم بتحسينه؟"

ثلاث حالات صغيرة

الحالة 1 - فخ الدقة. كان فريق طبي فخورًا بنموذج اكتشف مرضًا نادرًا: دقة تصل إلى 98%. عندما تم إجراء مقارنة النماذج الأساسية، ظهرت الحقيقة: بما أن معدل المرض كان 2%، فإن النموذج الذي يقول "اتصل بكل شخص بصحة جيدة" حصل أيضًا على 98%. بلغت نسبة استدعاء النموذج 11% فقط، وهو ما أدى إلى فقدان معظم المرضى. وبمجرد تحويل المقياس إلى PR-AUC، تم قياس الأداء الفعلي وإعادة تصميم النموذج.

الحالة 2 - الخلط بين الضوضاء والتقدم. أمضى الفريق أشهرًا في تحسين النموذج من 86.2% إلى 86.9%. أظهر التحقق المتبادل أن التحيز كان ±1.4%، لذا فإن "التحسن" بمقدار 0.7 نقطة كان بمثابة ضجيج إحصائي. لقد أضاع الفريق ثلاثة أسابيع على أرباح غير حقيقية. العبرة: لا تعلن النصر دون التأكد من أن التحسن أكبر من الانحراف.

الحالة 3 - تلوث مجموعة الاختبار. نظر أحد المهندسين مرارًا وتكرارًا إلى مجموعة الاختبار لاختيار أفضل المعلمات الفائقة. انخفضت نسبة 91٪ التي أبلغت عنها إلى 83٪ في الإنتاج. السبب: لقد اختار النموذج دون قصد وفقًا لذلك من خلال النظر إلى مجموعة الاختبار مرارًا وتكرارًا (التعلم الزائد في مجموعة الاختبار). تداخل الأداء المبلغ عنه والفعلي عند استخدام مجموعة التحقق المنفصلة.

قوالب قابلة للنسخ

ساعدني في اختيار المقياس المناسب لمشكلة التصنيف هذه. المشكلة: [ما هو متوقع] التوزيع الطبقي: [معدل إيجابي

تقييم المقارنة بين النموذجين التاليين. التحقق من صحة النموذج أ: [قائمة الدرجات] التحقق من صحة النموذج ب: [قائمة الدرجات] حساب المتوسط والانحراف المعياري. هل الفرق ذو دلالة إحصائية أم أنه مجرد ضجيج ضمن الانحراف؟ أيهما تنصحني أن أختار ولماذا؟

تحقق من رمز التدريب هذا لما يلي: 1) هل تم تحديد المعلمات الفائقة مع مجموعة الاختبار أو مجموعة التحقق من الصحة؟ 2) هل تتم مراقبة التوقف المبكر باستخدام المجموعة الصحيحة؟ 3) هل هناك أي علامات على التعلم الزائد (فرق فقدان التدريب/التحقق من الصحة)؟ الكود: [code]

أي من MAE وRMSE وMAPE يجب أن أقوم بالإبلاغ عن مشكلة الانحدار هذه؟ مقياس المتغير الهدف: [نطاق] هل الأخطاء الكبيرة سيئة بشكل غير متناسب (RMSE)، أم أنها كلها متساوية (MAE)؟ هل هناك قيم قريبة من الصفر (هل تشوه MAPE)؟ اقترح مع تبرير موجز.

جدول اختيار متري

نوع المشكلة

متري مناسب

يجب تجنبه

لماذا

تصنيف غير متوازن

PR-AUC، F1، أذكر

الدقة

فئة الأغلبية تضخم المتري

تصنيف متوازن

الدقة، ROC-AUC

موثوقة في البيانات المتوازنة

الانحدار (القيمة المتطرفة الكبيرة)

RMSE

MAPE (إذا كان الصفر)

يعاقب الأخطاء الكبيرة

الانحدار (الوزن المتساوي)

ماي

من السهل تفسيرها

الترتيب/التوصية

NDCG، Recall@K

الدقة

النظام مهم

الأخطاء الشائعة

  • استخدام الدقة في البيانات غير المتوازنة. الخطأ المتري الأكثر شيوعا.
  • عدم إجراء مقارنات للنماذج الأساسية. يجعل المقياس يفقد معناه.
  • النظر في مجموعة الاختبار للمعلمات الفائقة. نتيجة متفائلة وغير واقعية.
  • الاعتماد على حجرة واحدة. بدون التحقق المتبادل لن ترى التحيز.
  • الخلط بين الضوضاء والتقدم. "التحسينات" الصغيرة من الانحراف هي في الغالب حظ.
  • تجاهل سياق الأعمال. يعد توازن الدقة/الاستدعاء قرارًا تجاريًا.

باختصار

إن المهارة الحقيقية في التدريب النموذجي ليست إنتاج رقم كبير، بل معرفة ما يعنيه هذا الرقم. تحدد المشكلة وسياق العمل المقياس الصحيح؛ تفسير كل مقياس وفقًا لنموذج خط الأساس؛ قم بقياس التحيز من خلال التحقق المتبادل ولا تخلط بين الضوضاء والتقدم؛ استخدم مجموعة الاختبار فقط في النهاية، مرة واحدة. الذكاء الاصطناعي هو شريكك في تصميم التجربة، ولكن قرار "الجيد بما فيه الكفاية" يعود إليك ولكم.

مهمة التطبيق

بالنسبة لنموذج التصنيف: (1) اكتب توزيع الفصل، (2) أنشئ نموذجًا أساسيًا مناسبًا وقم بقياس درجاته، (3) قم بتقييم النموذج الخاص بك من خلال التحقق من صحة 5 أضعاف والإبلاغ عن المتوسط والانحراف المعياري، (4) احسب المقياس المناسب للمشكلة (على سبيل المثال PR-AUC) بدلاً من الدقة. اكتب ما إذا كان نموذجك يتفوق على النموذج الأساسي بهامش كبير دون تحيز.

قائمة مرجعية

  • [ ] لقد اخترت المقياس بناءً على نوع المشكلة وسياق العمل.
  • [ ] لقد قمت ببناء نموذج أساسي ومقارنته به.
  • [ ] لقد أبلغت عن المتوسط ​​والانحراف من خلال التحقق من الصحة.
  • [ ] وأكدت أن التحسن أكبر من الانحراف.
  • [ ] لقد قمت بتحديد المعلمات الفائقة مع مجموعة التحقق من الصحة.
  • [ ] لقد استخدمت مجموعة الاختبار مرة واحدة فقط، في النهاية.