وحدة 7 / 11

الترجمة والدبلجة والترجمة السمعية والبصرية

المكاسب:

  • القدرة على الملاءمة مع الحفاظ على المعنى من خلال تطبيق القواعد الفنية للترجمة (السطر، الحرف، CPS)
  • القدرة على التحقق من أخطاء الاسم الصحيح والأرقام عن طريق الصوت أثناء تسريع النسخ والترميز الزمني التلقائي باستخدام ASR
  • القدرة على إدارة حدود الذكاء الاصطناعي من خلال مراعاة السياق البصري والاختلاف اللوني ومزامنة الشفاه في الدبلجة

تختلف ترجمة فيلم أو مسلسل تلفزيوني أو فيديو خاص بشركة أو دورة تدريبية عبر الإنترنت اختلافًا جذريًا عن ترجمة نص عادي: فالوقت وسرعة القراءة والصورة التي تظهر على الشاشة والصوت وحركة الشفاه للشخصيات هي أيضًا قيود. في هذه الوحدة، ستتعلم الترجمة الصوتية والمرئية (ترجمة الأفلام والدبلجة والتعليق الصوتي)، والقواعد الفنية لترجمة الأفلام والنسخ المدعوم بالذكاء الاصطناعي وترميز الوقت، ومخاطر الجودة في هذا المجال. الهدف هو العمل كخبير في الترجمة السمعية والبصرية "يناسب عيون وآذان الجمهور" بدلاً من "ترجمة النص".

المفاهيم الأساسية

الترجمة السمعية البصرية (AVT) هي ترجمة المحتوى الذي يحتوي على الصوت والفيديو؛ الأشكال الرئيسية هي الترجمة والدبلجة والوصف الصوتي. الترجمة هي انعكاس الكلام بشكل مكتوب على الشاشة. الدبلجة هي إعادة دبلجة الصوت الأصلي في اللغة الهدف. يتم التعليق الصوتي عندما يتم كتم الصوت الأصلي وقراءة الترجمة فوقه (وهو أمر شائع في الأفلام الوثائقية).

هناك مصطلحان تقنيان مهمان لترجمة الشاشة: يحد CPS (الأحرف في الثانية) من سرعة ترجمة الشاشة حتى يتمكن المشاهد من قراءتها بشكل مريح؛ الحد الأعلى المقبول عمومًا هو حوالي 17 حرفًا في الثانية (أقل بالنسبة لمحتوى الأطفال). الرمز الزمني هو وقت البدء والانتهاء الذي يشير إلى متى ستظهر الترجمة وتختفي على الشاشة (مثل 00:01:23400).

لماذا هو صعب؟ لأنه يعني ترجمة ملائمة إلى ترجمات. سطرين، ~42 حرفًا في كل سطر، بحد أدنى ~1 ثانية وحد أقصى ~6 ثوانٍ من وقت الشاشة، وحد CPS - تحتاج إلى الالتزام بكل هذه الأمور مع الحفاظ على المعنى والنغمة. ولهذا السبب فإن ترجمة الترجمة غالبًا ما تكون مسألة ضغط وإعادة صياغة، وليست ترجمة كلمة مقابل كلمة.

نصيحة: تجنب انعكاس "ترجمة كل كلمة" في الترجمة. يشاهد المشاهد الصورة ويقرأها؛ لا يمكن قراءة الترجمات الطويلة جدًا. إن العثور على أقصر تعبير طبيعي يحافظ على المعنى هو الإتقان الحقيقي للمعلق.

دور الذكاء الاصطناعي في الترجمة السمعية البصرية

يعمل الذكاء الاصطناعي على تسريع عدة خطوات في هذا المجال بشكل ملحوظ:

  1. النسخ: باستخدام ASR (التعرف التلقائي على الكلام)، يتم نسخ الصوت تلقائيًا. يؤدي هذا إلى استخراج المصدر الخام للترجمة في دقائق.
  2. ترميز الوقت التلقائي: تقوم الأدوات بتقسيم المحادثة إلى أجزاء وإنتاج مسودة رموز زمنية.
  3. مسودة الترجمة: يتم ترجمة نص النص.
  4. التحكم في CPS/الطول: يستطيع الذكاء الاصطناعي تحديد الترجمة التي تتجاوز سرعة القراءة واقتراح تقصيرها.

لكن احذر: يخطئ ASR في الضوضاء، واللكنة، والكلام المتداخل، وأسماء الأعلام، والمصطلحات التقنية؛ لا يمكن تقديم "وصف صوتي"؛ من يتحدث قد يرتبك. لا ترى ترجمة الذكاء الاصطناعي الصورة، ولا يمكنها معرفة متى يسمى الكائن المعروض على الشاشة "ذلك". ولذلك، يتحقق الإنسان من السياق البصري ودقة فك التشفير.

تحذير: الخطأ الأكثر شيوعًا هو الاعتقاد بأن مخرجات ASR "تم فك تشفيرها". يرتكب ASR أخطاء متكررة، خاصة في الأسماء الصحيحة والأرقام وأسماء العلامات التجارية والمصطلحات الفنية؛ ينتقل النسخ غير الصحيح إلى الترجمة والترجمة. تأكد من التحقق من المناطق الحرجة من خلال الاستماع إلى الصوت.

قواعد تنسيق الترجمة

القواعد المشتركة (تختلف حسب النظام الأساسي):

  • ~37-42 حرفًا في كل سطر، سطرين كحد أقصى.
  • المدة: ~1-6 ثواني؛ تجنب الترجمات القصيرة جدًا "الفلاش".
  • يجب ألا يتجاوز CPS ~17 (محتوى للبالغين).
  • اكسر الجملة حيثما كان ذلك منطقيًا (لا تترك "و" أو "لكن" في نهاية السطر).
  • إذا كان ذلك ممكنًا، لا تتخطى مقطع المشهد (تغيير اللقطة).
  • اتبع قواعد النظام الأساسي لعناصر مثل الشتائم والأغاني وكتابة الشاشة.

ثلاث حالات صغيرة

الحالة 1 - تسريع عملية ASR + التحرير اللاحق بنسبة 60%. قام الفريق أولاً بنسخ فيلم وثائقي مدته 45 دقيقة وترميزه الزمني باستخدام ASR، ثم ترجمته وتحريره لاحقًا. تم تقليل الوقت بنسبة 60% مقارنة بالنسخ + ترميز الوقت من الصفر. ولكن تم تصحيح جميع الأسماء والأرقام الصحيحة عن طريق المقارنة السليمة.

الحالة 2 - تحقق CPS من إمكانية القراءة المحفوظة. كانت الترجمة الأولى لمقطع فيديو تعليمي مع ترجمة دقيقة، ولكن بلغ متوسط ​​CPS 24 - ولم يتمكن الجمهور من مواكبة ذلك. أدت جولة من التقصير المدعوم بالذكاء الاصطناعي إلى تقصير الترجمات بنسبة 30%، مما أدى إلى تقليل CPS إلى 16؛ تم الحفاظ على المعنى، وجاءت سهولة القراءة.

الحالة 3 - خطأ في السياق المرئي. في الترجمة المستندة إلى ASR، أشار أحد الأشخاص إلى علامة على الشاشة وقال "اقرأ ذلك"؛ وقد ترجمها الذكاء الاصطناعي إلى "اقرأها"، لكن النص الموجود على اللافتة لم تتم ترجمته، لذلك لم يتمكن المشاهد من رؤية ما يقرأه. أضاف المُعلق تعليقًا منفصلاً للتسمية التوضيحية للشاشة؛ الشخص الذي رأى الصورة صنع الفارق.

أربعة قوالب قابلة للنسخ

1) قائمة التحقق من النسخ (ASR):

فيما يلي النسخ التلقائي للفيديو. ضع علامة على الأخطاء المحتملة في النسخ: الأسماء الصحيحة، وأسماء العلامات التجارية، والأرقام، والمصطلحات الفنية، والجمل الغامضة/غير الكاملة. قم بإدراجها كـ "التحقق عن طريق الصوت". لا تترجم. نسخ: [...]

2) ترجمة الترجمة (CPS/الطول محدود):

قم بترجمة النسخ التالي إلى ترجمات [اللغة المستهدفة]. القيد: يجب أن يتكون كل عنوان فرعي من سطرين كحد أقصى، والسطر ~42 حرفًا، وألا يتجاوز CPS ~17. الاختصار والتطبيع مع الحفاظ على المعنى؛ لا تترجم كلمة بكلمة. الحفاظ على رموز الوقت. النسخ + رموز الوقت: [...]

3) التحقق من CPS/قابلية القراءة:

قم بحساب CPS التقريبي بناءً على المدة وعدد الأحرف لكل من الترجمات التالية. ضع علامة على كل ما يتجاوز 17 واقترح بديلا أقصر يحفظ المعنى. الترجمة (النص | المدة بالثواني): [...]

4) التحقق من نص الشاشة/السياق المرئي:

في الحوار التالي، حدد الأماكن التي قد تشير إلى الصورة (نص الشاشة، كائن مدبب، علامة). قل ما إذا كانت هناك حاجة إلى ترجمات/تفسيرات إضافية لها، على افتراض أن المشاهد لا يمكنه رؤية الصورة. الحوار: [...]

موجه ضعيف / موجه قوي

ضعيف: "ترجمة هذه الترجمات." (لا يوجد طول، CPS، قواعد الخط؛ لن يتناسب الإخراج مع الشاشة، غير قابل للقراءة.)

غوتشلو: "ترجم نص الحوار هذا إلى ترجمة تركية. يجب أن يكون كل عنوان فرعي بحد أقصى سطرين، 42 حرفًا في كل سطر؛ قم بتقصيره مع الحفاظ على المعنى عند الضرورة لسرعة القراءة. استخدم اللغة المنطوقة باللغة التركية الطبيعية، وخفف من حدة اللغة العامية. لا تلمس رموز الوقت."

الفرق: الموجه القوي يعطي القيود الفنية للترجمة (السطر، الحرف، CPS، النغمة)؛ يقترب الإخراج فعليًا من الترجمات القابلة للاستخدام.

مخطط مقارنة تنسيقات AVT

تنسيق

ماذا يفعل

مساهمة الذكاء الاصطناعي

نقطة حرجة للإنسان

العنوان الفرعي

ينقل الكلام

ASR، الترجمة، CPS

مناسبا، السياق البصري

الدبلجة

التعليق الصوتي باللغة الهدف

مسودة الترجمة

مزامنة الشفاه، والتمثيل

التعليق الصوتي

إقرأ الترجمة أعلاه

الترجمة، التوقيت

التدفق الطبيعي، لهجة

الوصف الصوتي

وصف الصورة بالصوت

مسودة النص

التفسير البصري (الإنسان)

الأخطاء الشائعة

  • ترجمة نسخة ASR دون التحقق منها. يتم نقل أخطاء الاسم/الرقم الصحيح إلى الترجمة.
  • ترجمة كلمة بكلمة والالتفاف حول CPS. الجمهور لا يستطيع القراءة. يجب أن يتم ذلك.
  • تجاهل السياق البصري. يبقى نص الشاشة والكائنات المدببة غير مترجمة.
  • جعل تقسيم الخط لا معنى له. إنه يفسد سهولة القراءة.
  • تسطيح النغمة/التسجيل. تختفي لهجات الشخصيات والعامية.

الدبلجة ومزامنة الشفاه

في حين أن قيد الترجمة هو سرعة القراءة، فإن قيد الدبلجة هو الوقت والشفاه. هناك ثلاثة أنواع متميزة من المزامنة في ترجمة التعليق الصوتي: مزامنة الشفاه — حيث تتطابق الترجمة مع حركة فم الشخصية، وخاصة حروف العلة المفتوحة في اللقطات المقربة؛ تزامن زمني — يكون سطر الترجمة بنفس طول السطر الأصلي، وليس قصيرًا جدًا ولا طويلًا جدًا؛ تزامن الإيماءات - مطابقة ما يقال مع حركات يد وذراع الشخصية. ولهذا السبب غالبًا ما يكتب المترجم المدبلج سطرًا "جذابًا" يحافظ على المعنى ولكن بكلمات مختلفة تمامًا؛ دقة الكلمة أقل من الترجمة هنا.

يستطيع الذكاء الاصطناعي تقديم مسودة ترجمة أولية وتحذير زمني للدبلجة ("هذا السطر أطول بنسبة 40% من النص الأصلي، قم بتقصيره"). ويمكن للتقنيات الجديدة أيضًا استنساخ الصوت وإنتاج الدبلجة التلقائية؛ لكن التمثيل والعاطفة والضبط الدقيق لتنفس الشخصية ومزامنة الشفاه لا تزال وظيفة المترجم البشري وممثل الصوت. توفر الدبلجة التلقائية مخططًا تفصيليًا؛ القرار الفني والمتزامن هو قرار الإنسان. بالإضافة إلى ذلك، فإن موافقة الشخص الذي يتم استنساخ صوته هي مسألة أخلاقية وقانونية مهمة.

باختصار

الترجمة السمعية البصرية هي فن ملاءمة النص ضمن القيود التي تفرضها عين المشاهد وأذنه: حدود الخط/الشخصية/CPS في ترجمة الأفلام، ومزامنة الشفاه في الدبلجة، والسياق البصري هو العامل الحاسم في كل ذلك. يعمل الذكاء الاصطناعي على تسريع عملية النسخ وترميز الوقت وصياغة الترجمة وفحص CPS باستخدام ASR؛ لكن ASR مخطئ في الأسماء الصحيحة والضوضاء، ولا يمكنه رؤية الصورة ويتم اتخاذ القرارات المناسبة من قبل الإنسان. لا يقوم المترجم الرئيسي بترجمة كلمة بكلمة؛ يجد التعبير الأقصر والأكثر طبيعية الذي يحافظ على المعنى.

مهمة التطبيق

اختر مقطع فيديو قصيرًا (2-3 دقائق). قم بالنسخ باستخدام أداة ASR وقارن وصحح المناطق الخطرة مع الصوت باستخدام قالب "التحقق من النسخ". ثم قم بالترجمة باستخدام قيد CPS ~17 باستخدام قالب "ترجمة الترجمة" واختصر الترجمات التي تتجاوز الحد باستخدام "تحكم CPS". إذا كان هناك نص أو علامة على الشاشة، فقم بتطبيق "التحقق من السياق البصري".

قائمة مرجعية

  • [ ] لقد قمت بالتحقق من فك تشفير ASR صوتيًا للاسم/الرقم المحدد.
  • [ ] لقد جعلت الترجمات تتناسب مع قواعد السطر/الحرف/CPS.
  • [ ] لقد اختصرته وطبّعته، وليس كلمة كلمة، حفظاً للمعنى.
  • [ ] لقد أخذت السياق المرئي (النص الذي يظهر على الشاشة، الإشارة) في الاعتبار.
  • [ ] قمت بترجمته حفاظاً على الاختلافات في اللهجة والشخصية.