المكاسب:
- القدرة على التعرف على الأسباب الصامتة لتدهور النموذج (انجراف البيانات، وانجراف المفهوم، والخطأ في المنبع) وإنشاء مراقبة ثلاثية الطبقات (التشغيلية، والمدخلات، والمخرجات)
- القدرة على تقييم أنظمة LLM في طبقات متعددة من خلال عمليات التحقق من القواعد، وتقييم LLM المحكم والتقييم البشري، والمعايرة باستخدام المرساة البشرية لحكم LLM
- القدرة على تصميم مجموعة تقييم تحتوي على حالات الحافة والأمان وتحويل كل خطأ تم اكتشافه إلى حالة اختبار دائمة
بمجرد دخول النموذج إلى مرحلة الإنتاج، لا يتم إنجاز عملك؛ المسؤولية الحقيقية تبدأ للتو. لأن النموذج يمكن أن ينهار بصمت عندما لا ينظر أحد. في هذه الوحدة، نغطي تخصصين متكاملين: التقييم (قياس جودة النموذج بشكل منهجي) والمراقبة (المراقبة المستمرة للنموذج في الإنتاج). يعد التقييم أكثر صعوبة، خاصة في أنظمة LLM، ويتطلب المزيد من العناية مقارنة بتعلم الآلة الكلاسيكي.
لماذا ينهار نموذج الإنتاج بهدوء؟
يتعطل الخطأ، ويطبع السجل، وينطلق الإنذار. من ناحية أخرى، يمكن أن يكون نموذج ML خاطئًا دون التسبب في أخطاء. ثلاثة أسباب رئيسية للتدهور:
- انحراف البيانات: يتغير توزيع البيانات المدخلة مع مرور الوقت (منتجات جديدة، تغير سلوك المستخدم، الموسمية). يبقى النموذج كما هو لكن العالم يتغير.
- انجراف المفهوم: تتغير العلاقة بين المدخلات والمخرجات. تتطور أساليب الاحتيال وأنماط البريد العشوائي؛ ما كان صحيحا بالأمس سيكون خطأ اليوم.
- الفساد في المنبع: يتغير تنسيق مصدر البيانات، وتصبح المنطقة حرة؛ النموذج يسيل لعابه بصمت مع المدخلات التالفة.
التتبع يجعل هذه التشوهات الصامتة مسموعة.
ما يجب مشاهدته: ثلاث طبقات
تغطي المراقبة الجيدة ثلاث طبقات:
- المقاييس التشغيلية: زمن الاستجابة، ومعدل الخطأ، وحجم الطلب، واستخدام الموارد. "هل النظام قائم؟"
- مقاييس البيانات/المدخلات: هل توزيع المدخلات مشابه لذلك الموجود في التدريب؟ هل زاد معدل القيمة المفقودة؟ هل وصلت فئات جديدة؟ "هل يرى النموذج بيانات مألوفة؟"
- مقاييس النموذج/الإخراج: سجل توزيع التنبؤ؟ هل انخفضت درجات الثقة؟ وإذا أمكن، ما هي الدقة مقارنة بالحقيقة الأرضية؟ "هل لا يزال النموذج دقيقًا؟"
الطبقة الثالثة هي الأكثر قيمة ولكنها الأكثر صعوبة؛ لأن النتيجة الحقيقية عادة ما تأتي متأخرة (يتضح بعد أشهر هل سيتم سداد القرض أم لا).
نصيحة: إذا تأخرت النتيجة الفعلية، قم بمراقبة توزيع المدخلات والتنبؤات أولاً. يعد تغيير توزيع المدخلات علامة مبكرة على تدهور الدقة ويمكن أن يطلق إنذارًا دون انتظار النتيجة الفعلية.
تقييم أنظمة LLM: التحدي الخاص
في تعلم الآلة الكلاسيكي، تكون "الإجابة الصحيحة" واضحة (الفئة 0 أو 1). من ناحية أخرى، فإن نتيجة LLM مفتوحة: قد يكون هناك العديد من الإجابات الصحيحة لنفس السؤال، وكلمة "صحة" لا تتناسب مع رقم واحد. مناهج تقييم LLM:
- المقاييس المشار إليها: مقارنة الإخراج بالإجابة المثالية. محدود؛ لأنه قد يعتبر الإجابة الصحيحة المعبر عنها بشكل مختلف على أنها "خاطئة".
- عمليات التحقق المستندة إلى القواعد: هل الناتج صالح لـ JSON؟ هل هناك أي كلمات محظورة؟ هل تحتوي على الحقول المطلوبة؟ رخيصة وموثوقة وضيقة.
- قاضي ماجستير في القانون (قاضي ماجستير في القانون): لا تجعل النموذج يسأل "هل هذه الإجابة جيدة وفقًا لهذا المعيار؟" إنه مقياس، ولكن يجب التحقق من الحكم نفسه.
- المراجعة البشرية: المعيار الذهبي ولكنه مكلف وبطيء. يتم استخدامه على العينة.
ومن الناحية العملية، يتم استخدام هذه العناصر معًا: قواعد رخيصة للتحقق من كل مخرجات، وتحكيم ماجستير في القانون على عينة كبيرة، وتقييم بشري على عينة صغيرة ولكنها صارمة.
نهج ضعيف / نهج قوي
ضعيف: "لقد سألت الحكم، 92% من إجاباتنا كانت جيدة. النظام رائع."
غوتشلو: "قمنا في البداية بتصنيف 100 نسخة مطبوعة من قبل الإنسان. وقمنا بإجراء قاضي الماجستير في القانون على نفس 100 نسخة مطبوعة وقمنا بقياس اتفاق الإنسان مع القاضي - اتفاق بنسبة 85%، مقبول. وقمنا بتوثيق الأخطاء التي ارتكبها القاضي بشكل منهجي (الميل إلى العثور على إجابات طويلة جيدة بشكل غير عادل) وقمنا بإصلاح رسالته. وعندها فقط أصبحنا نثق في درجات القاضي."
الفرق: النهج القوي يتحقق من الحكم بمرساة بشرية، وليس بشكل أعمى. يمنح حكم LLM الذي لم يتم التحقق منه ثقة جميلة ولكن زائفة.
تنبيه: حكم LLM هو أيضًا نموذج؛ المهلوسة، المتحيزة (تفضل الإجابات الطويلة/الواثقة)، يمكن أن تكون غير متسقة. قم بمعايرة نتائج الحكام باستخدام العلامات البشرية قبل اتخاذ قرارات الإنتاج.
مجموعة التقييم: مصممة بعناية
تمثل مجموعة التقييم الجيدة مجموعة متنوعة من الاستخدام الحقيقي والحالات الصعبة. إن التقييم المليء بالأمثلة السهلة فقط سوف يتركك في ثقة زائفة. تأكد من وضعه في مجموعة التقييم:
- حالات الحافة: مدخلات فارغة، مدخلات طويلة جدًا، تنسيق غير عادي.
- الحالات الصعبة المعروفة: أمثلة حيث ارتكب النموذج أخطاء في الماضي (كاختبار الانحدار).
- الحوادث الأمنية: محاولات الحقن الفوري، والطلبات الضارة، وفخاخ انتهاك الخصوصية.
تنمو مجموعة التقييم بمرور الوقت: كل خطأ جديد تكتشفه في الإنتاج يصبح حالة اختبار للتقييم التالي.
الإنذار والتدخل
تظل المراقبة غير مكتملة بدون إنذار. يجب أن يكون هناك حد وخطة استجابة لكل مقياس مهم: "أخطر المهندس إذا تجاوز انحراف الإدخال X"، "التراجع التلقائي إذا تجاوز معدل الخطأ Y". اجعل الإنذارات ذات معنى - فالكثير من الإنذارات الكاذبة تؤدي إلى إضعاف حساسية الفريق وتجعلهم يغيبون عن الإنذار الحقيقي.
ثلاث حالات صغيرة
الحالة 1 - الإنذار المبكر. أصبحت الدقة الحقيقية لنموذج توقعات الطلب واضحة فقط في نهاية الأسبوع. كان الفريق يراقب توزيع المدخلات ولاحظ الارتفاع المفاجئ لفئة منتج جديد يوم الثلاثاء - وهو أمر لم يشهده النموذج من قبل. لقد قاموا بتحديث النموذج دون انتظار انخفاض الدقة. مراقبة المدخلات المحفوظة الأيام.
الحالة 2 - حكم لم يتم التحقق منه. أفاد أحد الفرق بأن "الجودة لدينا ممتازة" استنادًا إلى مراجع LLM. عندما زادت شكاوى العملاء، تم إدخال المراقبة البشرية: اعتبر الحكم الإجابات الواثقة ولكن غير الصحيحة على أنها "جيدة". بمجرد معايرة الحكم باستخدام العلامات البشرية، تم الكشف عن الجودة الحقيقية وكانت أقل بكثير. الدرس المستفاد: لا تثق بالحكم دون التأكد منه.
الحالة 3 - اختبار الانحدار. يؤدي التغيير السريع إلى حل مشكلة واحدة بينما يؤدي إلى كسر مشكلة أخرى بصمت. لكن الفريق احتفظ بالأخطاء السابقة في دلو التقييم؛ عندما تم اختبار التغيير الجديد على هذه المجموعة، تم اكتشاف الحالة المعطلة على الفور وتم إصلاح التغيير. الدرس المستفاد: كل خطأ تم إصلاحه يجب أن يصبح حالة اختبار دائمة.
قوالب قابلة للنسخ
قم بإعداد خطة تتبع لنموذج الإنتاج هذا. تغطية ثلاث طبقات: 1) التشغيل (زمن الوصول، معدل الخطأ، الحجم) 2) الإدخال/البيانات (تحول التوزيع، القيمة المفقودة، الفئة الجديدة) 3) النموذج/المخرج (توزيع التنبؤ، الثقة، الدقة إن أمكن) النموذج: [الوصف]. كم من الوقت يستغرق وصول النتيجة الفعلية: [المدة] أضف عتبة وتوصية بالتدخل لكل مقياس.
اقترح استراتيجية تقييم (تقييم) لنظام LLM هذا. المهمة: [وصف] تحديد الطبقات: - ما هي عمليات التحقق القائمة على القواعد التي يجب تشغيلها على كل مخرج؟ - ما هي المعايير التي يجب على محكم LLM تقييمها وكيف يجب التحقق من صحتها (مرساة بشرية)؟ - في أي عينة يجب إجراء التقييم البشري؟ أدرج حالات الحافة والسلامة التي يجب أن أضعها في مجموعة التقييم.
تحقق من مطالبة حكم LLM هذه: - هل معايير التقييم واضحة أم ذاتية؟ - هل هي عرضة لتحيز الطول/الثقة؟ - كيف يمكنني معايرة الحكم باستخدام العلامات البشرية؟ مطالبة الحكم: [مطالبة]
اكتب دليل تشغيل الاستجابة لإنذار المراقبة هذا. الإنذار: [على سبيل المثال. تم تجاوز عتبة انحراف الإدخال]يجب أن يحتوي على: خطوات التحكم الأولية، والأسباب المحتملة، ومعايير التراجع، ومن يجب إبلاغه.
جدول أسباب التدهور
تشويه
أعراض
طريقة الكشف المبكر
انجراف البيانات
تغييرات توزيع المدخلات
مراقبة توزيع المدخلات
تحول المفهوم
الحق يسقط بصمت
التنبؤ + المقارنة الفعلية
خطأ المنبع
تصبح الحقول شاغرة/تغيرات التنسيق
التحقق من صحة المخطط + المعدل المفقود
عدم تناسق النموذج
تحولات توزيع الإخراج
مراقبة توزيع المخرجات
الأخطاء الشائعة
- عدم إنشاء المراقبة. النموذج ينهار بصمت، لا أحد يرى ذلك.
- تتبع المقاييس التشغيلية فقط. لقد انتهى النظام، لكن التوقعات قد تكون خاطئة.
- استخدام LLM دون التحقق من الحكم. يعطي ثقة زائفة.
- التقييم مع أمثلة سهلة. لا يشير إلى صعوبة حقيقية.
- عدم تضمين الأخطاء السابقة في التقييم. ويعود نفس الخطأ مرة أخرى.
- إنذارات عالية. يصبح الفريق حساسًا ويفقد الإنذار الحقيقي.
باختصار
يمكن أن يكون النموذج غير دقيق دون التسبب في أخطاء في الإنتاج؛ لذا فإن التقييم والرصد لا يقل أهمية عن التنمية. إنشاء مراقبة على ثلاث مستويات (التشغيلية، والمدخلات، والمخرجات)؛ استخدم انحراف الإدخال كإنذار مبكر إذا تأخرت النتيجة الفعلية. في أنظمة LLM، يكون التقييم مفتوحًا؛ استخدم عمليات التحقق من القواعد وحكم LLM والتقييم البشري معًا - ولكن تأكد من التحقق من صحة حكم LLM باستخدام مرساة بشرية. قم بإثراء مجموعة Eval الخاصة بك بحالات الحافة والأمان وقم بتحويل كل خطأ تم اكتشافه إلى حالة اختبار دائمة.
مهمة التطبيق
اكتب خطة مراقبة ثلاثية الطبقات لنموذج الإنتاج (أو شبه الإنتاج) وحدد العتبة + الإنذار لمقياس توزيع المدخلات واحد على الأقل. إذا كان لديك نظام LLM: قم بوضع علامة على 30 مخرجًا مع البشر، وقم بتشغيل حكم LLM على نفس المخرجات، وقياس اتفاقية الحكم البشري؛ لاحظ تحيز الحكم المنهجي. أضف ما لا يقل عن 3 حواف وحالتين أمنيتين إلى مجموعة التقييم الخاصة بك.
قائمة مرجعية
- [ ] تغطي المراقبة جميع الطبقات الثلاث (التشغيلية، والمدخلات، والمخرجات).
- [ ] أستخدم انجراف المدخلات كإنذار مبكر إذا تأخرت النتيجة الفعلية.
- [ ] لقد قمت بمعايرة محكم LLM باستخدام ملصقات بشرية.
- [ ] تحتوي مجموعة Eval على حالات الحافة والأمان.
- [ ] لقد حولت كل خطأ اكتشفته إلى حالة اختبار دائمة.
- [ ] كل مقياس مهم له عتبة وخطة استجابة.