وحدة 3 / 11

التحقق من المخرجات والتفتيش البشري

المكاسب:

  • القدرة على إنشاء طبقات التحقق من صحة المخرجات المستندة إلى المخطط والقواعد
  • القدرة على طلب وجود الإنسان في الحلقة بشكل هادف في القرارات عالية التأثير
  • القدرة على تصميم التوجيه القائم على التحقق وعتبة الثقة مع النموذج الثاني

يُنتج النموذج اللغوي أسلوبًا سلسًا ومقنعًا ودقيقًا في كثير من الأحيان، لكن كلمة "مقنع" ليست مثل كلمة "صحيح". يمكن للنموذج احتواء مبلغ أو تاريخ أو حقل JSON بصمت؛ وهذا ما يسمى الهلوسة (ينتج النموذج بثقة معلومات غير موجودة في الواقع). في نظام المؤسسة، إذا تدفقت هذه المخرجات إلى الخطوة التالية - الدفع، أو البريد الإلكتروني، أو كتابة قاعدة البيانات - فإن الخطأ ينتشر إلى العالم الحقيقي. في هذه الوحدة، سوف نتعلم تصفية المخرجات باستخدام طبقات التحقق قبل دخولها إلى النظام، كما سنتعلم ضرورة وجود الإنسان في الحلقة في القرارات عالية التأثير.

لماذا يلزم التحقق من صحة الإخراج؟

يمكن أن يتلف مخرجات النموذج بطريقتين أساسيتين: التنسيق (لا يتوافق مع مخطط JSON المتوقع، الحقل مفقود/زائد) والمحتوى (التنسيق صحيح ولكن القيمة خاطئة - رمز منتج غير موجود، تاريخ غير منطقي). هناك بعد ثالث من حيث الأمان: المخرجات الخبيثة (أمر خبيث ينتج نتيجة الحقن أو التسرب). نظام متين يوقف الثلاثة عند الباب.

تحذير: "النموذج دقيق بشكل عام" ليس معيارًا للإنتاج. في نظام بدون التحقق، حتى خطأ واحد في الألف يعني 100 معاملة خاطئة يوميًا من بين 100000 طلب يوميًا.

طبقات المصادقة: خطوة بخطوة

  1. التحقق من صحة المخطط. تحقق مع الجهاز من أن الإخراج يتوافق مع البنية المتوقعة: هل الحقول موجودة، هل أنواعها صحيحة، هل الحقول المطلوبة مملوءة؟
  2. التحقق من صحة القاعدة/منطق العمل. هل تتوافق القيم مع قواعد العمل؟ (المبلغ > 0، التاريخ ليس في المستقبل، رمز المنتج ينتمي إلى الكتالوج.)
  3. المرجع/التحكم في المصدر. إذا أنتج النموذج تأكيدًا، فهل يمكن ربطه بالمصدر؟ (هل اقتباس RAG موجود بالفعل في المستند؟)
  4. التحقق من صحة النموذج الثاني (LLM-as-قاضي). يقوم نموذج مستقل بتقييم المخرجات على أنها "صحيحة/غير مكتملة/محفوفة بالمخاطر".
  5. عتبة الثقة والتوجه. إذا أبلغ النموذج أو أداة التحقق عن انخفاض الثقة، فلن يتم تمرير الإخراج تلقائيًا؛ وهي موجهة للإنسان.
  6. السيطرة البشرية. تعتمد النتيجة عالية الفعالية أو منخفضة الأمان على موافقة الخبير.

أربعة قوالب قابلة للنسخ

مخطط + "اصنعها إذا كنت لا تعرف" معًا:

قم بإرجاع الاستجابة في مخطط JSON التالي فقط: اكتب "منخفض". لا تكتب أبدًا تقديرًا كما لو كان دقيقًا.

التحقق بالنموذج الثاني (موجه القاضي):

أنت مدقق مستقل. يوجد أدناه نص <مصدر> و<مطالبة>. تحقق لمعرفة ما إذا كان كل رقم وتاريخ في المطالبة مذكورًا حرفيًا في المصدر. ولكل منها قول: "تم التحقق | ليس في المصدر | يخالف المصدر". إذا كان أحدهما "غائب/متعارض"، ضع علامة على النتيجة بأنها "مطلوب مراجعة بشرية".<source>{{ text }}</source><claim>{{ model_output }}</claim>

قاعدة توجيه عتبة الثقة:

قاعدة التوجيه: - emin_misin = "مرتفع" والمبلغ < 10,000 ليرة تركية -> المعالجة التلقائية - emin_misin = "متوسط" أو المبلغ 10,000-100,000 ليرة تركية -> التحقق من النموذج الثاني - emin_misin = "منخفض" أو المبلغ> 100,000 ليرة تركية -> موافقة بشرية مطلوبة

بطاقة ملخص التدقيق البشري (تسريع عملية المراجعة):

عند تقديم القرار لشخص ما، قم بإبراز هذه البطاقة: - ما هو المقترح؟ (جملة واحدة)- ما هو مصدرها؟ (مقال/مرجع مستند)- ما هما أضعف افتراضين؟- في حالة الموافقة عليهما، هل يمكن الرجوع عنهما؟ (نعم / لا)

موجه ضعيف / موجه قوي

نهج الفقراء

نهج قوي

"خصم المبلغ من الفاتورة" (نص حر)

مخطط JSON صارم + حقل ثقة فارغ

كتابة المخرجات مباشرة لنظام الدفع

المخطط → القاعدة → موافقة الإنسان (إذا لزم الأمر)

فقط أقول للنموذج "تأكد"

التحقق من صحة الرقم/التاريخ مع النموذج الثاني

معالجة كل مخرجات بثقة متساوية

التوجيه على أساس التأثير والثقة

ولا يأمل النهج القوي أن يكون النموذج صحيحا؛ إنه يخلق بابًا يمسك بك عندما تكون مخطئًا.

ثلاث حالات صغيرة

الحالة الأولى: المخطط وحده لم يكن كافياً. كانت أتمتة المحاسبة تستخرج المبلغ من الفواتير بتنسيق JSON. كان المخطط صحيحًا، لكن النموذج أنتج "125000" بدلاً من "1250.00" في الفاتورة (إزاحة عشرية). فشل المخطط في التقاط هذا؛ تم اكتشاف التحقق من القاعدة ("يجب أن يتماشى المبلغ مع إجمالي عناصر الفاتورة بنسبة ±1%") وتم منع التسجيل غير الصحيح لـ 112,500 ليرة تركية.

الحالة 2 - النموذج الثاني يصور الهلوسة. "إشعار بالإنهاء لمدة 30 يومًا"، حسبما ذكر مساعد الدعم القانوني في ملخص العقد؛ ومع ذلك، في العقد كان 90 يوما. عندما وضع القاضي المستقل علامة على النموذج باعتباره "متعارضًا مع المصدر"، تمت إعادة توجيه الإخراج إلى الإنسان وتصحيحه. إذا كان ذلك تلقائيًا، فسيقوم العميل بإخطار الإلغاء بناءً على تاريخ خاطئ.

الحالة 3 - أدى التوجيه إلى تقليل الحمل بنسبة 70%. وافق نظام مطالبات التأمين تلقائيًا على المطالبات ذات المبلغ المنخفض والمطالبات ذات الأمان العالي وأرسل فقط المطالبات ذات الحد الأعلى/المنخفض التأمين إلى الخبير. ومن بين 3200 طلب يومي، سقط 950 فقط على عاتق الإنسان؛ كرّس الخبراء وقتهم للنسبة 30% المحفوفة بالمخاطر حقًا، مع انخفاض متوسط ​​وقت المعاملة من 4 ساعات إلى 40 دقيقة.

نصيحة: لا تقم بإعداد التحكم البشري بحيث "يتمكن الناس من رؤية كل شيء" - فهذا سوف يرهق الناس وستصبح الموافقة بمثابة ختم مطاطي. وبدلاً من ذلك، قم فقط بتوجيه المخرجات عالية التأثير ومنخفضة الثقة إلى الإنسان؛ وهذا يركز الاهتمام على ما يهم حقا.

جعل السيطرة البشرية ذات معنى

إن "الإنسان في الحلقة" لا يعني وضع مربع اختيار على الورق. يجب أن يكون لدى المراجع (1) السياق لفهم القرار، (2) الوصول إلى المصدر، و (3) السلطة لقول "لا". وبخلاف ذلك، تظل السيطرة تجميلية. تهدف بطاقة المراجعة (النموذج الرابع أعلاه) إلى توفير هذا السياق فقط.

الأخطاء الشائعة

  • ما عليك سوى إجراء التحقق من صحة المخطط وتخطي أخطاء المحتوى/القيمة.
  • معتقدًا أنه بإخبار النموذج "تأكد" أنك تقوم بالتحقق الحقيقي.
  • التنفيذ التلقائي للقرارات عالية التأثير والتي لا رجعة فيها.
  • وضع سيطرة بشرية على كل مخرجات وتحويل الموافقة إلى ختم مطاطي لا معنى له.
  • قول "موافقة" للمراجع دون ذكر المصدر والسياق.
  • معالجة جميع المخرجات بنفس المخاطر دون تحديد عتبة الثقة والتوجيه.

باختصار

  • يتم إتلاف الإخراج بثلاث طرق: النموذج والمحتوى والنية الخبيثة؛ نظام متين يوقف الثلاثة عند الباب.
  • الطبقات: التحقق من صحة المخطط، ومنطق القاعدة/الأعمال، والتحكم في المصدر، والنموذج الثاني (LLM-as-dudge)، وتوجيه عتبة الثقة.
  • يجب أن يكون وجود الإنسان في الحلقة إلزاميًا بالنسبة للمخرجات عالية التأثير ومنخفضة السلامة.
  • يجب أن تكون المراجعة البشرية ذات معنى: يجب أن يتمتع المراجع بالسياق، والوصول إلى الموارد، والسلطة ليقول "لا".
  • يتم تحقيق السلامة والكفاءة من خلال توجيه العناصر الخطرة فقط إلى البشر، وليس كل المخرجات.

مهمة التطبيق

خذ مثالاً من مخرجات الذكاء الاصطناعي الخاصة بك. قم أولاً بتعريف مخطط JSON وفرض الإخراج عليه. ثم اكتب قاعدتي عمل على الأقل (على سبيل المثال، "المبلغ يطابق إجمالي العناصر"). أخيرًا، قم بإعداد جدول توجيه: ما هي مجموعة الثقة/التأثير التي تذهب تلقائيًا، والتي تذهب إلى النموذج الثاني، والتي تذهب إلى الإنسان؟ قم بإنشاء عينة معيبة ولاحظ مكان التقاطها في كل طبقة.

قائمة مرجعية

  • [ ] أقوم بتحديد مخطط صارم للإخراج والتحقق منه باستخدام الجهاز.
  • [ ] لقد قمت بإضافة تحقق واحد على الأقل من صحة الأعمال/القواعد (منطق القيمة).
  • [ ] يمكنني ربط التأكيدات بالمصدر والتحقق منها.
  • [ ] يتوفر النموذج الثاني أو التحقق البشري للحصول على نتائج عالية التأثير/منخفضة السلامة.
  • [ ] يتم تعريف قاعدة التوجيه على أساس الثقة والتأثير.
  • [ ] يتم تزويد المراجع بالسياق والمصدر وسلطة الرفض.