المكاسب:
- تحديد المقاييس التي تقيس جودة الاحتفاظ والتوليد بشكل منفصل
- قم بإعداد مجموعة أسئلة ذهبية وقم بإجراء تقييم تلقائي باستخدام LLM-as-قاضي
- الحفاظ على الجودة من خلال ردود الفعل والمراقبة واختبار الانحدار في الإنتاج
الجملة "لقد قمت بتثبيت المساعد، يبدو أنه يعمل بشكل جيد" ليست عبارة هندسية. تتعطل أنظمة RAG بصمت: نوع مستند جديد يخدع عملية الاسترجاع، والتغيير الفوري يقلل الدقة، ويصبح الفهرس قديمًا. الطريقة الوحيدة لتحقيق ذلك هي القياس. في هذه الوحدة، نغطي كيفية قياس جودة RAG (الاسترجاع والتوليد بشكل منفصل)، والتقييم التلقائي (LLM كحكم) والحفاظ على الجودة في الإنتاج (المراقبة والانحدار). "لا يمكنك تحسين ما لا تقيسه" هو شعار هذه الوحدة.
قياس شيئين منفصلين
يحتوي RAG على ساقين ويجب قياسه بشكل منفصل لأن المشكلة قد تكون في أي منهما:
- جودة الاسترجاع: هل وصلت القطعة الصحيحة؟
- جودة التوليد: هل تم إنتاج الإجابة الصحيحة من القطعة الواردة؟
إذا كانت الإجابة سيئة، فأنت بحاجة إلى معرفة أي ساق سيئة أولاً. إذا لم يصل الجزء الصحيح مطلقًا، فلن يتم حفظ حتى أفضل مطالبة (مشكلة في الاسترداد). إذا وصل الجزء الصحيح لكن النموذج أخطأ في قراءته، فإن تحسين الاسترجاع يكون عديم الجدوى (مشكلة التوليد).
مقاييس الاسترجاع
الاسترجاع عبارة عن مشكلة فرز/وصول؛ تقاس بمقاييس استرجاع المعلومات الكلاسيكية. ولهذا يجب أن يكون لديك المجموعة الذهبية: معرفة القطعة "الصحيحة" لكل سؤال.
متري
ما التدابير
تعريف بسيط
أذكر @ ك
هل القطعة الصحيحة في الجزء العلوي k؟
معدل التقاط الجزء الصحيح
الدقة @ ك
كم عدد القطع k التي تم إرجاعها ذات الصلة؟
تنظيف ما يتم إحضاره
MRR (متوسط الرتبة المتبادلة)
في أي ترتيب هي القطعة الصحيحة؟
المكافآت تكون في أعلى الرتب
معدل الضرب
هل وصلت قطعة واحدة صحيحة على الأقل؟
المقياس الأساسي للنجاح
تعليق عملي: إذا كانت قيمة Recall@k منخفضة، فيجب إعادة صياغة استراتيجية التجزئة أو البحث (الهجينة، k، إعادة الترتيب). إذا كانت الدقة منخفضة ولكن الاستدعاء مرتفع، فإن إضافة إعادة التصنيف يعد خطوة جيدة.
مقاييس الجيل
عندما يصل الجزء الصحيح، نقوم بقياس جودة الاستجابة التي ينتجها النموذج. ثلاثة أبعاد أساسية:
- الإخلاص: هل كل ادعاء في الإجابة مدعوم بالسياق؟ هل هناك أي المناسب؟ إنه مقياس مباشر للهلوسة.
- أهمية الإجابة: هل الإجابة تجيب بالفعل على السؤال أم أنها خارج الموضوع؟
- الاكتمال: هل تم استخدام جميع المعلومات ذات الصلة في السياق أم أنها مفقودة؟
غالبًا ما يتم تسجيل هذه النقاط على أساس متدرج (على سبيل المثال، 1-5)، وليس على أساس ثنائي مثل "صواب/خطأ".
نصيحة: تتبع الإخلاص كمقياس منفصل. إذا انخفض الإخلاص مع انخفاض الدقة، فالمشكلة هي التوليد؛ إذا كان الإخلاص مرتفعا ولكن الإجابة خاطئة، فالمشكلة هي القطعة الخاطئة (الاسترجاع). يشكل هذان المقياسان معًا بوصلة توضح موقع الخلل.
إنشاء مجموعة الأسئلة الذهبية
يتطلب كل قياس مجموعة ذهبية / مجموعة بيانات تقييم: أسئلة واقعية + إجابات صحيحة متوقعة + أجزاء مصدر صحيحة. البدء بـ 30-50 سؤالًا تم اختياره جيدًا أفضل من 500 سؤال عشوائي. قم بتضمين ما يلي في المجموعة: الأسئلة الحقيقية المتداولة، والأسئلة الصعبة المعروفة، والأسئلة الفخاخية بدون إجابات (يجب على المرء أن يقول "لا أعرف")، والأسئلة ذات المصادر المتناقضة.
# مثال المجموعة الذهبية (مفاهيمي)[ {"question": "كم عدد أيام الإجازة السنوية؟"، "expected_answer": "14 يومًا لمدة 1-5 سنوات من الأقدمية"، "correct_part_id": "two-part-3"، "category": "leave"}، {"question": "أين يقع مكتب الشركة في المريخ؟"، "expect_answer": "NO_INFORMATION"، # trap: لا أعرف "correct_part_id": فارغ، "الفئة": "مصيدة"}]
ماجستير في القانون كقاضي: التقييم التلقائي
إن تسجيل مئات الإجابات باليد أمر متعب. نموذج LLM-as-قاضي هو عندما يسجل أحد النماذج ويبرر إجابة نموذج آخر بناءً على معايير معينة. يحدد القاضي الجيد المعايير بوضوح، ويعطي الأمثلة ويطلب التبرير.
# موجه LLM كقاضي (مفاهيمي) أنت مقيم محايد. قم بتقييم الإجابة أدناه وفقًا للسياق المحدد والإجابة المتوقعة. الدرجة (1-5) وبرر:- الإخلاص: هل كل ادعاء في الإجابة مدعوم في السياق؟ - الدقة: هل تتطابق الإجابة مع الإجابة المتوقعة؟ - الاكتمال: هل المعلومات ذات الصلة كاملة؟ على وجه الخصوص: إذا كانت الإجابة تحتوي على معلومات ليست في السياق، فأعط الإخلاص 1 وحدد الادعاء الملفق. السياق: {سياق} متوقع: {متوقع} الإجابة: {إجابة} النتيجة: {الإخلاص، الدقة، الاكتمال، التبرير}
تحذير: ماجستير القانون كقاضي ليس مثاليًا؛ قد يكون لديهم تحيزاتهم الخاصة (إجابة طويلة، مفضلين أسلوبهم الخاص). وتحقق أيضًا من القاضي: احصل على بعض الإجابات التي سجلها كل من القاضي والإنسان وقياس مدى الاتفاق بينهما. إذا كان القاضي متسقًا مع النتائج البشرية، فيمكنك الوثوق به.
تصنيف ضعيف/قوي
ضعيف ("كان جيدًا بالنسبة لي"):
لقد طرحت بعض الأسئلة وبدت الإجابات جيدة. لقد حصلت عليه على الهواء مباشرة.# المشكلة: لا توجد قياسات، والانحدار غير محسوس، والتحسن أعمى.
قوية (مجموعة الذهب + المقاييس المنفصلة + الحكم التلقائي + الانحدار):
المجموعة الذهبية من 40 سؤالا. مع كل تغيير، استدعاء@5، يتم قياس الإخلاص والدقة تلقائيًا. إذا انخفضت النتيجة، يتم التراجع عن التغيير. في الإنتاج، يتم جمع تعليقات المستخدمين وإضافتها إلى المجموعة.
المراقبة والانحدار في الإنتاج
التقييم لا يتم مرة واحدة وينتهي. ثلاث ممارسات ثابتة:
- اختبار الانحدار: تشغيل المجموعة الذهبية تلقائيًا عند كل تغيير مطالبة/استرجاع/نموذج. إذا تم تخفيض النتيجة، يتم عكس التغيير. وهذا يمنع "كسرها أثناء محاولة تحسينها".
- مراقبة الإنتاج: تتم مراقبة معدل "لم أتمكن من العثور على معلومات" في الأسئلة الحقيقية، ومتوسط التأخير، والتكلفة، وتعليقات المستخدمين (👍/👎). الزيادة المفاجئة في عبارة "لا أعرف" غالبًا ما تكون أول علامة على وجود خلل في الفهرس أو الاسترجاع.
- حلقة التغذية الراجعة: تتم مراجعة الأسئلة الحقيقية التي يقدمها المستخدم 👎 وإضافتها إلى الكومة الذهبية؛ وبالتالي، تصبح المجموعة أكثر ثراءً بمرور الوقت ويتم إغلاق النقاط العمياء في النظام.
ثلاث حالات صغيرة
الحالة 1 - الانحدار الصامت. قام فريق بتعديل المطالبة من أجل "تحسينها"؛ زادت الدقة العامة، لكن الإخلاص انخفض بنسبة 30% في أسئلة الفخ (بدأ النموذج يناسب أكثر). ولم يكن من الممكن ملاحظة ذلك لولا أسئلة الفخ في العنقود الذهبي؛ أعاد اختبار الانحدار التغيير.
الحالة الثانية – تقويم الساق الخاطئة. في أحد المساعدين كانت الإجابات سيئة؛ عمل الفريق على المطالبة لأسابيع. عندما قمنا بقياس مقاييس الاسترجاع، كانت نسبة الاستدعاء @5 48% فقط - وكانت المشكلة في الاسترجاع، وليس في التوليد. عندما تمت إضافة نظام الهجين + إعادة التصنيف، زادت نسبة الاستدعاء إلى 89% وزادت الدقة أيضًا.
الحالة 3 - تنبيه الإنتاج. في أحد الأيام، قفز معدل "لم أتمكن من العثور على معلومات" لمساعد الدعم من 6% إلى 34%. حذرت لوحة التتبع؛ وكان السبب هو أن مهمة الفهرسة، التي تتم ليلاً، فشلت بصمت ولم يتم تحميل مقالات جديدة. ولولا المراقبة لكانت التصريحات غير الصحيحة "لا أعرف" ستستمر لأيام.
الأخطاء الشائعة
- الرضا عن عبارة "لقد نجح الأمر بشكل جيد بالنسبة لي": بدون قياس، يمر الانحدار دون أن يلاحظه أحد.
- عدم الفصل بين الاسترجاع والتوليد: سوف تصحح الساق الخطأ وتضيع الوقت.
- عدم طرح أسئلة الفخ: لا يظهر الميل إلى اختلاق الأمور في العنقود الذهبي.
- عدم التحقق من القاضي: هيئة المحلفين المتحيزة تعطي ثقة زائفة.
- عدم مراقبة الإنتاج: فشل المؤشر، ويستمر انفجار التكلفة بصمت.
باختصار
- في RAG، يتم قياس جودة الاسترجاع والتوليد بشكل منفصل؛ يجب أولاً تحديد الساق المتضررة.
- Recall@k، الدقة@k، MRR للاسترجاع؛ يتم استخدام الإخلاص والملاءمة والاكتمال للجيل.
- يتطلب كل قياس كتلة ذهبية؛ ضع فيه أسئلة حقيقية وصعبة وفخية ومتناقضة.
- LLM-as-قاضي مجموعات كبيرة من الدرجات التلقائية؛ ولكن القاضي نفسه ينبغي أن يتبرر على الإنسان.
- يحافظ اختبار الانحدار ومراقبة الإنتاج وحلقة التغذية الراجعة على الجودة بمرور الوقت.
مهمة التطبيق
(1) قم بإنشاء مجموعة ذهبية مكونة من 15 سؤالًا على الأقل لمساعدك الخاص: تتضمن على الأقل 3 أفخاخ (بدون إجابات)، 3 أسئلة صعبة، وسؤالين مصدريين متناقضين. اكتب الإجابة المتوقعة والجزء الصحيح لكل سؤال. (2) مقارنة إصدارين مختلفين للمطالبة يدويًا بهذه المجموعة؛ أعط كل إجابة 1-5 نقاط للإخلاص والدقة. (3) قم بتكييف مطالبة LLM-as-قاضي أعلاه وفقًا لمعاييرك الخاصة. (4) حدد 3 مقاييس ستتتبعها في الإنتاج واسأل لكل منها "ما هي عتبة الإنذار؟" اكتب القيمة.
قائمة مرجعية
- [ ] يمكنني قياس جودة الاحتفاظ بالمنتجات وإنتاجها باستخدام مقاييس منفصلة.
- [ ] أعرف ما تعنيه مقاييس مثل Recall@k والإخلاص.
- [ ] أستطيع بناء مجموعة ذهبية تتضمن أسئلة حقيقية وصعبة ومفخخة ومتناقضة.
- [ ] يمكنني إعداد التقييم التلقائي والتحقق من القاضي بصفته قاضيًا في LLM.
- [ ] يمكنني تشغيل اختبار الانحدار ومراقبة الإنتاج وحلقة التغذية الراجعة.