وحدة 8 / 11

مراقبة الجودة (QA) ومقاييس التقييم وLQA

المكاسب:

  • القدرة على التمييز بين طبقات ضمان الجودة التلقائي وطبقات ضمان الجودة اللغوية وتطبيق كليهما بالترتيب الصحيح
  • القدرة على تقييم الترجمة بشكل موضوعي وفقًا للفئة والوزن (حرج/رئيسي/ثانوي) مع إطار خطأ مثل MQM
  • القدرة على اتخاذ القرار النهائي عند استخدام الذكاء الاصطناعي كمدقق، ومعرفة عماه من ترجمته الخاصة، وخطر ارتكاب الأخطاء، وحدود المقاييس الآلية

في اللحظة التي تقول فيها أن الترجمة "تم"، فهذا نصف العمل؛ والنصف الآخر هو إثبات أن هذه الترجمة موثوقة بالفعل. في هذه الوحدة، ستتعلم طرقًا منهجية لقياس جودة الترجمة: فحوصات ضمان الجودة الآلية، وأطر أخطاء LQA المستندة إلى الإنسان، ومقاييس الجودة، وكيفية استخدام الذكاء الاصطناعي باعتباره "مفتشًا" - وحدوده. الهدف هو الابتعاد عن الذاتية التي تقول "أعتقد أن هذا جيد" وأن تصبح خبيرًا يحدد الجودة ويقيسها ويثبتها.

نوعان من مراقبة الجودة: آلي ولغوي

يعمل ضمان الجودة (ضمان الجودة) في طبقتين في الترجمة:

ضمان الجودة التلقائي: الأخطاء الأسلوبية التي تلتقطها أدوات CAT والبرامج النصية - عدم تطابق الأرقام، والمساحة المفقودة/الزائدة، والمصطلح غير المتسق، والجزء غير المترجم، والعنصر النائب/العلامة السيئة، والمسافة المزدوجة، وعلامات الترقيم. ويتم مسحها ضوئيًا بسرعة وبشكل كامل بواسطة الآلة؛ إنها تفلت من العين البشرية لكن السيارة تلتقطها.

LQA (ضمان الجودة اللغوية): هذه هي الطبقة التي يقوم فيها المقيم البشري بفحص المعنى والمصطلحات والأسلوب والنحو والملاءمة المحلية. ضمان الجودة الآلي "هل يتطابق الرقم؟" ينظر إلى السؤال؛ LQA "هل المعنى صحيح، هل النغمة مناسبة، هل هي مناسبة ثقافيا؟" وهو ينظر إلى السؤال. الاثنان يكملان بعضهما البعض؛ واحد لا يحل محل الآخر.

نصيحة: قم دائمًا بتشغيل ضمان الجودة التلقائي أولاً؛ يتيح تنظيف الأخطاء الشكلية للمقيم البشري تكريس الاهتمام للمشكلات اللغوية الحقيقية. المراجع الذي يهتم بخطأ الرقم سوف يفوت خطأ النغمة.

إطارات الخطأ: MQM وDQF

تُستخدم نماذج الأخطاء القياسية لجعل الجودة قابلة للقياس بدلاً من "جيدة/سيئة". الأكثر شيوعًا هو MQM (مقاييس الجودة متعددة الأبعاد): فهو يعين كل خطأ إلى فئة (الدقة، والطلاقة، والمصطلحات، والأسلوب، والمحلية، والتنسيق) والوزن (حرج، رئيسي، ثانوي). إطار عمل آخر هو DQF (إطار الجودة الديناميكي) ويتم ذكره مع MQM.

لماذا هو مهم؟ لأنه باستخدام هذا الإطار، يمكنك إعطاء درجة خطأ للترجمة، والمقارنة بشكل موضوعي بين المترجمين/المحركات المختلفة والسؤال "هل يمكن تسليم هذا النص؟" أنت تجيب على السؤال بعتبة رقمية. على سبيل المثال: خطأ فادح = 10 نقاط، رئيسي = 5، ثانوي = 1؛ يمر النص الموجود أسفل حد معين لكل كلمة معينة.

الخطأ الفادح: الخطأ الذي يقلب المعنى، ويخلق مخاطر أمنية/قانونية، ويضر بالعلامة التجارية (جرعة خاطئة، "غير مسؤول" بدلاً من "مسؤول"). الرئيسية: مزعجة ولكنها غير ضارة. طفيف: ملحوظ ولكن لا ينتقص من المعنى (أسلوب بسيط/علامات الترقيم).

استخدام الذكاء الاصطناعي كوحدة تحكم – وحدوده

يعد الذكاء الاصطناعي سريعًا ومفيدًا في التحقق من الترجمة مقابل إطار الخطأ: يمكنك أن تقول "ضع علامة على الصحة والمصطلحات وأخطاء الطلاقة في هذه الترجمة باستخدام فئات MQM". إنه يقلل من البقع العمياء ويمنحك "عينًا ثانية" سريعة.

ولكن هناك ثلاثة حدود حاسمة: (1) يمكن أن يكون الذكاء الاصطناعي أعمى عند التحقق من الترجمة التي ينتجها - سواء ارتكب نفس الخطأ أو أكده؛ تحقق من نموذج مختلف أو ارجع إلى المصدر. (2) يمكن للذكاء الاصطناعي أيضًا اختلاق "أخطاء" هلوسية - الإبلاغ عن خطأ غير موجود؛ قم بتأكيد كل تحذير. (3) قد لا يدرك الذكاء الاصطناعي بشكل كامل مدى خطورة الخطأ الفادح في العالم الحقيقي (يمكن أن يكون خطأ الجرعة قاتلاً)؛ الخبير يقوم بالترجيح. لذلك يعمل الذكاء الاصطناعي على تسريع عملية ضمان الجودة، ولكن القرار النهائي بشأن الجودة والموافقة على التسليم يقع على عاتق الإنسان.

تحذير: إن القول "لقد اجتاز الذكاء الاصطناعي ضمان الجودة، إنه نظيف" هو شعور زائف بالثقة. إن تدقيق الذكاء الاصطناعي ليس بديلاً عن LQA البشري والمقارنة مع المصدر؛ إنها طبقة فحص مسبقة تجعلهم يصلون إلى السرعة.

ثلاث حالات صغيرة

الحالة 1 - عثرت ضمان الجودة الآلي على 40 خطأ في الأرقام. في ترجمة التقارير المالية، اكتشف ضمان الجودة الآلي 40 حالة عدم تطابق في الأرقام/التنسيقات بين المصدر والهدف (فاصل الآلاف، العلامة العشرية، العملة). سوف تفتقد العين البشرية معظم هذه الأشياء؛ السيارة المدرجة في ثوان.

الحالة 2 - أدت نتيجة MQM إلى اختيار المحرك. قام أحد مكاتب MQM بتقييم مخرجات محركين مختلفين لـ MT عند 2000 كلمة: المحرك A 12 نقطة خطأ، المحرك B 31. حسم القياس الموضوعي الجدل حول "أيهما أفضل" بنتيجة؛ جعل المكتب المحرك "أ" هو المعيار وخطط لميزانيته بعد المراجعة وفقًا لذلك.

الحالة 3 - أخطأت عملية تدقيق الذكاء الاصطناعي في ارتكاب خطأ ما. كان المترجم يشرف على ترجمة LLM من قبل نفس LLM؛ قالت العارضة "لا مشكلة"، وهو خطأ في المصطلحات ارتكبته بنفسها. تم الكشف عن الخطأ عندما قام المترجم بمراجعة نموذج ومصدر مختلفين؛ اعتمد الفريق قاعدة مفادها أن "النموذج نفسه لا ينبغي أن يتحكم في نفسه".

أربعة قوالب قابلة للنسخ

1) التحقق من الأخطاء على أساس MQM:

دورك: مقيم LQA. قارن بين المصدر والترجمة أدناه. قدم كل خطأ تجده بالتنسيق التالي: [الفئة: الدقة/المصطلحات/الطلاقة/النمط/التنسيق] [الوزن: حرج/كبير/ثانوي] [الموقع] [تعليق] [تصحيح]. ضع علامة على التحذير الذي لست متأكدًا منه على أنه "مطلوب تأكيد"؛ خطأ في التصنيع. المصدر: [...] | الترجمة: [...]

2) فحص الأخطاء الجسيمة (خطورة عالية):

ابحث عن الأخطاء الجسيمة فقط في الترجمة أدناه: المعنى العكسي، خطأ في الرقم/الجرعة/التاريخ، فقدان النفي، استبدال الالتزام القانوني، خطأ تحذير السلامة. تجاهل مشاكل التصميم البسيطة. استشهد بمصدر كل نتيجة مهمة. المصدر: [...] | الترجمة: [...]

3) التحكم التلقائي في ضمان الجودة:

قم بإدراج التناقضات الرسمية في أزواج المصدر والهدف التالية: عدم تطابق الأرقام، العنصر النائب أو العلامة المفقودة/الإضافية، المصطلح غير المتسق، المقطع غير المترجم، فرق الوحدة/العملة. مجرد إعطاء المشاكل مع موقعهم. الأزواج: [...]

4) العين الثانية المستقلة (الفحص المتقاطع):

قم بتقييم هذه الترجمة دون تحيز؛ لا تفترض أنك كتبت ذلك. امنح المصدر تصنيف جودة (1-5) من حيث الإخلاص والمصطلحات والطبيعية، وقم بإدراج أهم 3 مشاكل. الأمر متروك لي لأقرر. المصدر: [...] | الترجمة: [...]

موجه ضعيف / موجه قوي

ضعيف: "هل هذه الترجمة جيدة؟" (لا توجد معايير؛ يقوم الذكاء الاصطناعي بإرجاع إجابة غير مفيدة مثل "جيد بشكل عام.")

Strong: "تحقق من هذه الترجمة مقابل المصدر. قم بتسمية كل خطأ حسب الفئة (الدقة/المصطلحات/الطلاقة) وخطورة (حرج/رئيسي/ثانوي). ركز بشكل خاص على أخطاء العدد والنفي والمصطلحات. لا تقم باختلاق الأخطاء؛ ضع علامة "مطلوب تأكيد" إذا لم تكن متأكدًا."

الفرق: الموجه القوي يعطي إطارًا للخطأ وتركيزًا؛ الناتج عبارة عن تقرير جودة قابل للمقارنة وقابل للتنفيذ.

جدول طبقات الجودة

طبقة

ما يمسك

من/ماذا يفعل

ضمان الجودة التلقائي

الرقم، التسمية، الاتساق

الأداة/البرنامج النصي

التحكم بالذكاء الاصطناعي

الأخطاء المحتملة في المعنى/المصطلحات

ماجستير في القانون (مع التأكيد)

LQA البشري

المعنى، النغمة، الثقافة، الوزن

مقيم خبير

نقاط MQM/DQF

درجة الخطأ الموضوعي

الإنسان مع الإطار

تأكيد التسليم

المسؤولية النهائية

مترجم مختص

الأخطاء الشائعة

  • تخطي ضمان الجودة الآلي والبدء مباشرة في القراءة. الأخطاء الأسلوبية تشتت الانتباه.
  • استبدال فحص الذكاء الاصطناعي بـLQA البشري. الشاشات المسبقة لمنظمة العفو الدولية، لا توافق.
  • وجود نفس النموذج تحقق من ترجمته الخاصة. نقطة عمياء؛ مطلوب فحص متقاطع.
  • لا أخطاء الترجيح. رؤية الحرجة والثانوية كما هو يعطل الأولوية.
  • تصحيح "الأخطاء" التي يصنعها الذكاء الاصطناعي دون التأكد منها. يمكنك تشويه الجملة الصحيحة.

المقاييس التلقائية: BLEU، COMET والحدود

هناك أيضًا عالم من المقاييس الآلية في قياس الجودة. BLEU (دراسة التقييم ثنائي اللغة) يقارن الترجمة الآلية بالترجمة المرجعية البشرية ويعطي درجة من 0 إلى 100 بناءً على تداخل الكلمات؛ لقد كان هذا هو المعيار لمقارنة أنظمة الترجمة الآلية لفترة طويلة. المقياس الأحدث، COMET، يعتمد على الشبكة العصبية ويلتقط التشابه الدلالي بشكل أفضل من BLEU. تعتبر هذه المقاييس ذات قيمة للمقارنة السريعة والتلقائية بين محركين على البيانات الضخمة.

لكن حدودها واضحة: فالمقاييس مثل BLEU تنظر إلى تداخل الكلمات، ولا تفهم المعنى حقًا. الترجمة التي تختلف عن المرجع ولكنها دقيقة قد تحصل على درجة منخفضة؛ الترجمة المشابهة للمرجع ولكنها غير صحيحة قد تحصل على درجة عالية. الخطأ السلبي الفادح هو كلمة واحدة، لذلك ليس له تأثير يذكر على المقياس، ولكنه في الواقع كارثي. ولهذا السبب تقوم المقاييس الآلية بقياس الاتجاهات على مستوى النظام، وليس تحديد إمكانية تسليم نص فردي. يقرر التقييم البشري القائم على MQM وأحكام الخبراء ما إذا كانت الترجمة ستذهب إلى العميل أم لا، وليس النتيجة التلقائية. استخدم المقاييس كبوصلة، وليس كحكم.

في ملخص

جودة الترجمة ليست شعورًا ذاتيًا، بل هي شيء قابل للقياس. يقوم ضمان الجودة التلقائي بفحص شامل بحثًا عن الأخطاء الرسمية؛ يقوم LQA البشري بتقييم المعنى والنبرة والثقافة؛ تقوم أطر الخطأ مثل MQM بقياس الجودة حسب الفئة والوزن، مما يتيح المقارنة الموضوعية. الذكاء الاصطناعي هو عين ثانية قوية تعمل على تسريع عملية التحكم هذه، ولكنها يمكن أن تكون عمياء عن ترجمتها الخاصة، وترتكب الأخطاء، وتفشل في فهم ثقل العالم الحقيقي بشكل كامل؛ ولذلك فإن قرار الجودة النهائي والترجيح والموافقة على التسليم يعود للمترجم المختص.

مهمة التطبيق

احصل على مخرجات الترجمة الآلية. قم بإدراج الأخطاء الرسمية أولاً باستخدام "التحقق الإضافي التلقائي لضمان الجودة"، ثم قم بإدراج الأخطاء اللغوية حسب الفئة والوزن باستخدام "التحقق من الأخطاء المستندة إلى MQM". أقوم بتقييم كل خطأ (حرج 10، كبير 5، صغير 1) مع حد لكل كلمة وأسأل "هل يمكن تسليمه؟" أجب عن السؤال. أخيرًا، تأكد مع المصدر من عدد الأخطاء التي أبلغ عنها الذكاء الاصطناعي وعددها حقيقي وعدد منها ملفق.

قائمة مرجعية

  • [ ] قمت بتشغيل ضمان الجودة التلقائي وقمت بتنظيف أي أخطاء رسمية.
  • [ ] قمت بتعليم الأخطاء اللغوية بمربع (الفئة + الوزن).
  • [ ] لقد قمت بفحص الأخطاء الجسيمة في جولة منفصلة ذات أولوية.
  • [ ] لقد حصلت على عنصر تحكم الذكاء الاصطناعي وقمت بفحصه باستخدام نموذج مختلف إذا لزم الأمر.
  • [ ] لقد اتخذت قرار التسليم بناءً على الحد الرقمي وحكم الخبراء الخاص بي.