المكاسب:
- فهم مفاهيم ذاكرة الترجمة (TM)، والمطابقات والمقاطع الغامضة، والقدرة على استخدام الاختلافات في المطابقات الغامضة من خلال تكييفها بدلاً من التكيف الأعمى.
- القدرة على تطبيق نظام كتابة الترجمات المعتمدة فقط لذاكرة الترجمة، والحفاظ على ذاكرة الترجمة الخاصة بالعميل منفصلة، وإجراء صيانة ذاكرة الترجمة
- القدرة على حماية الخصوصية من خلال التحكم في مكان انتقال البيانات في تكامل MT/LLM داخل CAT
غالبًا ما تتم الترجمة الاحترافية باستخدام أداة الترجمة بمساعدة الحاسوب، وليس في محرر نص عادي. في هذه الوحدة، ستتعلم أدوات الترجمة بمساعدة الحاسوب، وذاكرة الترجمة (TM) في قلب الترجمة، وكيفية عملها مع الترجمة الآلية وماجستير القانون، وكيفية استخدام هذا النظام البيئي بكفاءة وأمان. الهدف هو أن تصبح مستخدمًا لتكنولوجيا الترجمة ويدير المشروع بأكمله، وليس الجمل الفردية، بطريقة متسقة وسريعة ويمكن تتبعها.
المفاهيم الأساسية
أداة CAT (الترجمة بمساعدة الكمبيوتر) هي برامج احترافية (مثل Trados وmemoQ وPhrase وMateCat) التي تنظم جملة الترجمة جملة (قطعة) وتربط ذاكرة الترجمة وقاعدة المصطلحات. يُظهر المصدر والهدف جنبًا إلى جنب، ويلتقط التكرارات، ويحافظ على التنسيق.
TM (ذاكرة الترجمة) هي قاعدة بيانات تخزن أزواج الجمل المصدر والهدف التي قمت بترجمتها مسبقًا. عندما تصل جملة جديدة، إذا كانت هناك جملة مماثلة في TM، فإن الوكيل يقترحها عليك. المفهوم الأساسي هنا هو المطابقة الغامضة: تشابه الجملة الجديدة مع جملة في ذاكرة الترجمة (100% = نفس الشيء تمامًا، 85% = متشابه إلى حد كبير). تعمل التطابقات العالية على تسريع العمل لأنك تعيد استخدام ترجمتك السابقة.
المقطع هو الوحدة الأساسية للترجمة، عادة ما يكون جملة. تقوم أداة CAT بتقسيم النص إلى أجزاء وتحرير كل منها على حدة.
أهمية ذاكرة الترجمة: تنتج الترجمة الآلية مسودات أولية، لكن ذاكرة الترجمة تُرجع ترجماتك السابقة المعتمدة ذات الجودة البشرية. الاثنان مختلفان: MT هو التنبؤ، TM هي الذاكرة.
نصيحة: لا تخلط بين TM وMT. تعتبر مطابقة ذاكرة الترجمة بنسبة 100% (ترجمتك المعتمدة مسبقًا) موثوقة بشكل عام؛ ينبغي دائمًا التحقق من توصية MT. تُظهر أدوات CAT الاثنين بألوان/تسميات مختلفة؛ نرى دائما هذا الاختلاف.
دمج MT وLLM في CAT
تستدعي أدوات CAT الحديثة محركات MT وLLMs بشكل متزايد داخليًا: إذا لم يكن هناك تطابق في ذاكرة الترجمة، يقوم الوكيل تلقائيًا بإرجاع توصية MT للقطاع؛ تقوم بتحريره لاحقًا (أي تدفقات MTPE في CAT). تدمج أدوات الجيل الأحدث أيضًا LLM: يمكنك القيام بعمليات مثل "إعادة كتابة هذا الجزء بهذه النغمة"، "تصحيح هذا المصطلح إلى قاعدة المصطلحات" وما إلى ذلك في الأداة.
الاستفادة من هذا التكامل: يتم دمج TM وtermbase وMT وLLM في شاشة واحدة؛ بالنسبة لكل جملة، يتم إنشاء التدفق "انظر إلى TM أولاً، وإلا فاقترح MT، ومصطلح ضمان الجودة تلقائيًا". الجانب السلبي والحذر: أين تذهب البيانات؟ يمكن لتكامل MT/LLM القائم على السحابة إرسال النص إلى خوادم خارجية؛ في العمل السري، قد يكون هذا خرقًا للعقد. تأكد من معرفة المحرك الذي تتصل به السيارة وبأي سياسة بيانات.
تغذية ومسح ذاكرة الترجمة
إن قيمة ذاكرة الترجمة هي بقدر جودة الترجمات الموجودة فيها. القمامة في الداخل والقمامة في الخارج. اثنين من التخصصات:
- ما عليك سوى كتابة الترجمة المعتمدة إلى TM. إذا قمت بحفظ مخرجات MT الخام إلى TM دون التحقق من صحتها، فسوف تعود إلى وظائفك المستقبلية كـ "ذاكرة" سيئة.
- إجراء صيانة TM. مع مرور الوقت، تتغير المصطلحات وتدخل الأخطاء. قم بتنظيف TM بشكل دوري، وتصحيح الأزواج البالية/غير الصحيحة. في هذا العمل، أستخدم LLM لطرح السؤال "هل هناك أي تناقضات/تحيز في المصطلحات في أزواج TM هذه؟" يمكنك استخدامه كمدقق.
تنبيه: يعد استخدام ذاكرة الترجمة الخاصة بأحد العملاء في أعمال عميل آخر انتهاكًا للسرية وخطر حدوث ارتباك في المصطلحات. يتم الاحتفاظ بذاكرات السفر منفصلة على أساس العميل/المشروع. إن "كل شيء TM" المختلط يدمر السرية والجودة.
ثلاث حالات صغيرة
الحالة 1 - طار TM الإعادة. كانت إحدى الشركات المصنعة تترجم مجموعة منتجاتها حيث ظل 70% من دليلها كما هو سنة بعد سنة. بفضل TM، ظهرت المطابقات بنسبة 100% وعالية الغموض تلقائيًا في كل إصدار جديد؛ فقط ما يقرب من 9000 كلمة من أصل 30000 كلمة كانت ترجمة جديدة فعلية. تم تخفيض الوقت والتكلفة بمقدار الثلث.
الحالة 2 - قامت Dirty TM بنشر الخطأ. قام أحد الفرق بحفظ مخرجات MT الخام في TM دون التحقق. وبعد مرور عام، تكررت نفس الترجمة الخاطئة مرارًا وتكرارًا، وبدت "موثوقة" باعتبارها مطابقة بنسبة 100%؛ تم توزيع الخطأ عبر 14 مستندًا مختلفًا. وضع الفريق قاعدة "ترجمة معتمدة إلى ذاكرة الترجمة فقط" وجولة تنظيف.
الحالة 3 - تسربت السرية في التكامل. قام أحد المترجمين بعمل سري في مشروع CAT الذي كان متصلاً تلقائيًا بسحابة MT؛ انتقل النص إلى محرك خارجي سياسة بياناته غير واضحة. بمجرد ملاحظة ذلك، تم إيقاف تشغيل تكامل MT للمشاريع السرية ولم يتم استخدام سوى محركات المؤسسات التي "لا تخزن/تدرب البيانات".
أربعة قوالب قابلة للنسخ
1) تقييم المطابقة الغامضة (إلى LLM):
فيما يلي الجملة المصدرية الجديدة، والجملة المشابهة في TM وترجمتها المعتمدة. أخبرني بالضبط ما الذي أحتاج إلى تغييره لتكييف ترجمة ذاكرة الترجمة مع الجملة الجديدة؛ لا تقترح تغييرات غير ضرورية. أظهر الفرق في المعنى بوضوح. مصدر جديد: [...] | مصدر TM: [...] | ترجمة الترجمة: [...]
2) التحقق من اتساق TM:
فيما يلي أزواج المصدر والهدف من TM. ضع علامة على التناقضات وانحرافات المصطلحات حيث تتم ترجمة نفس الجمل المصدرية أو المشابهة جدًا بشكل مختلف. فقط قم بإدراج المشاكل. الأزواج: [...]
3) إعادة كتابة نغمة المقطع (LLM في CAT):
اجعل المقطع المستهدف التالي [النغمة المرغوبة] دون تغيير المعنى. الالتزام بقائمة الشروط: [...]. احتفظ بالأرقام والأسماء. تصدير الجزء المعاد كتابته فقط. شريحة: [...]
4) الفحص المسبق للخصوصية/التكامل:
سأستخدم تكامل MT/LLM في مشروع CAT. سأصف نوع النص في هذا المشروع؛ أخبرني ما إذا كان من المناسب إرسال هذا النص إلى محرك خارجي قائم على السحابة، وما هي الأسئلة (الاحتفاظ بالبيانات، والتدريب، والموقع) التي يجب أن أطرحها على المزود. نوع النص/حالة الخصوصية: [...]
موجه ضعيف / موجه قوي
ضعيف: "استخدم الترجمة في TM." (ليس من الواضح ما هو معدل المطابقة وما الذي يجب تعديله؛ فالنسخ الأعمى يؤدي إلى حدوث أخطاء).
قوي: "تتطابق هذه الجملة الجديدة مع الجملة الموجودة في ذاكرة الترجمة بنسبة 90% من الوقت. اعتمد على ترجمة ذاكرة الترجمة ولكن اعكس هذا الاختلاف: يحتوي المصدر على كلمة "سنوي" بدلاً من "شهري"، لذلك يجب أن يكون "سنويًا" بدلاً من "شهريًا". لا تغير أي شيء آخر."
الفرق: يشير الموجه القوي إلى فرق المطابقة؛ فهو يمنع "ترك الترجمة القديمة كما هي"، وهو الخطأ الأكثر شيوعًا في المطابقة الغامضة.
جدول مكونات النظام البيئي لـ CAT
مكون
ماذا يفعل
العلاقة مع الذكاء الاصطناعي
TM (ذاكرة الترجمة)
إرجاع الترجمات السابقة المعتمدة
موثوقة؛ يسبق جبل
قاعدة المصطلح
يضمن اتساق المصطلح
يتم تقديمه كموجه إلى LLM
توصية MT
رسم أولي إلى جزء فارغ
يجب أن يتم تحريره لاحقًا
التكامل LLM
النغمة/المصطلح/إعادة الكتابة
السيطرة والاهتمام بالخصوصية
وحدة ضمان الجودة
يقوم بمسح الرقم/المصطلح/خطأ في العلامة
التحكم الآلي
الأخطاء الشائعة
- القبول الأعمى للمباراة الغامضة. يمكن لمطابقة 85% أن تخفي اختلافًا بنسبة 15% في المعنى.
- كتابة مخرجات MT الخام إلى TM. تحمل Dirty TM الخطأ إلى المستقبل وتنشره.
- خلط TMs للعميل/المشروع. السرية وخطر الخلط بين المصطلحات.
- عدم معرفة أين تذهب بيانات التكامل. قد يتسرب النص المخفي دون علمك بذلك.
- نسيان الفرق TM/MT. MT هو تقدير. TM هي الذاكرة. الاثنان ليسا آمنين على حد سواء.
ما قبل الترجمة والمحاذاة
تعمل وظيفتا CAT المتقدمتان على تسريع سير العمل في عصر الذكاء الاصطناعي. الأول هو الترجمة المسبقة: في بداية المشروع، تقوم الأداة تلقائيًا بملء جميع المقاطع بـ TM وMT؛ بدلاً من الملف الفارغ، تبدأ بملف تمت الموافقة على المطابقات بنسبة 100%، والمطابقات الغامضة في انتظار تعديلها، والمطابقات الفارغة هي مسودات MT. يؤدي هذا إلى تغيير المهمة من "الكتابة من الصفر" إلى "المراجعة والتحرير" - ولكنك تحتاج إلى تقييم كل جزء بدلاً من الموافقة العمياء على الترجمة المسبقة.
والثاني هو المحاذاة: إذا كان لديك زوج من المستندات المصدر والهدف تمت ترجمته من قبل ولكن لم يتم إدخاله إلى ذاكرة الترجمة، فإن أداة المحاذاة تطابقهما قطعة تلو الأخرى وتحولهما إلى ذاكرة الترجمة. وبالتالي، تتم إضافة ترجماتك السابقة إلى "الذاكرة". الحذر في المحاذاة: المطابقة التلقائية ليست صحيحة دائمًا؛ يؤدي انزلاق جزء واحد إلى تعطيل المحاذاة بأكملها. إن مراجعة الأزواج المحاذية قبل TMing تمنع خطر TM القذرة في المقام الأول. تقوم هاتان الوظيفتان بتحويل أصولك الحالية (الترجمات السابقة) إلى استثمارات في الأعمال المستقبلية.
باختصار
أدوات الترجمة بمساعدة الحاسوب؛ فهو يجمع بين ذاكرة الترجمة وقاعدة المصطلحات والترجمة الآلية وماجستير القانون في خط إنتاج واحد. ذاكرة الترجمة هي ذاكرة تقوم باسترداد ترجماتك السابقة المعتمدة وتوفر سرعة كبيرة في المهام المتكررة؛ MT هو توقع يحتاج دائمًا إلى التحقق منه. يقوم المستخدم الذكي بتكييف الاختلافات في المطابقات الغامضة بعناية، ويكتب فقط الترجمات المعتمدة إلى ذاكرة الترجمة، ويبقي ذاكرة الترجمة الخاصة بالعملاء منفصلة، ويحمي الخصوصية من خلال معرفة أين تذهب البيانات في عملية التكامل.
مهمة التطبيق
قم بإعداد مشروع صغير باستخدام أداة CAT (تعمل أيضًا أداة CAT مجانية عبر الإنترنت): أضف قاعدة مصطلحات وذاكرة ترجمة فارغة. ترجمة نص مكون من 10 جمل، وحفظ الترجمات المعتمدة في TM. ثم قم بترجمة نص ثانٍ مشابه جدًا للنص الأول وقم بتكييف التطابقات الغامضة التي أرجعتها TM باستخدام قالب "تقييم التطابق الغامض"؛ لاحظ عدد الجمل التي قد ترتكب خطأً فيها إذا قبلت TM بشكل أعمى.
قائمة مرجعية
- [ ] لقد قمت بتوصيل TM وtermbase بالمشروع.
- [ ] لقد استخدمت الفرق في التطابقات الغامضة بشكل تكيفي وليس بشكل أعمى.
- [ ] لقد كتبت إلى TM فقط الترجمة المعتمدة التي قمت بالتحقق منها.
- [ ] أبقيت ذاكرات السفر الخاصة بالعميل/المشروع منفصلة.
- [ ] لقد تحققت من أين تذهب البيانات في تكامل MT/LLM.