单位 7 / 11

字幕、配音和视听翻译

收益:

  • 能够通过应用字幕的技术规则(行、字符、CPS)来适应,同时保留含义
  • 能够通过语音验证正确的姓名和号码错误,同时使用 ASR 加速转录和自动时间编码
  • 能够通过在配音中考虑视觉背景、音调差异和口型同步来管理人工智能的局限性

翻译电影、电视剧、企业视频或在线课程与翻译纯文本有很大不同:时间、阅读速度、屏幕图像、声音和人物的嘴唇运动也是限制因素。在本单元中,您将学习视听翻译(字幕、配音、画外音)、字幕的技术规则、人工智能支持的转录和时间编码,以及该领域的质量陷阱。目的是像视听翻译专家一样“适合观众的眼睛和耳朵”,而不是“翻译文本”。

基本概念

视听翻译(AVT)是对包含音频和视频的内容进行翻译;主要形式有字幕、配音和口述。字幕是将演讲以书面形式反映在屏幕上。配音是将原声用目标语言重新配音。画外音是指将原始声音静音并朗读翻译内容(常见于纪录片中)。

字幕的两个关键技术术语:CPS(每秒字符数)限制字幕的速度,以便观众可以舒适地阅读;普遍接受的上限约为每秒 17 个字符(儿童内容的上限较低)。时间码是指示字幕何时在屏幕上出现和消失的开始结束时间(例如 00:01:23,400)。

为什么很难呢?因为这意味着翻译成字幕。两行、每行约 42 个字符、最少约 1 秒、最多约 6 秒的屏幕时间以及 CPS 限制 — 您需要遵守所有这些,同时保持含义和语气。这就是为什么字幕翻译通常是压缩和改写,而不是逐字翻译。

提示:避免字幕中“翻译每个单词”的条件反射。观看者既观看又阅读图像;字幕太长看不懂。找到保留意义的最短自然表达是字幕作者的真正掌握。

人工智能在视听翻译中的作用

人工智能显着加快了该领域的几个步骤:

  1. 转录:通过 ASR(自动语音识别),可以自动转录语音。这会在几分钟内提取字幕的原始来源。
  2. 自动时间编码:工具将对话分成多个片段并生成草稿时间代码。
  3. 翻译草稿:翻译成绩单文本。
  4. CPS/长度控制:AI可以标记哪个字幕超过阅读速度并建议缩短。

但要注意:ASR 在噪音、口音、重叠语音、专有名称和技术术语方面会出错;无法提供“音频描述”;谁在说话可能会感到困惑。人工智能翻译看不到图像——它无法知道屏幕上显示的物体何时被称为“那个”。因此,人类验证视觉上下文和解读准确性。

注意:最常见的错误是认为 ASR 输出已“解码”。 ASR 经常犯错误,特别是在专有名称、数字、品牌名称和技术术语方面;错误的转录会影响到翻译和字幕。请务必通过收听音频来验证关键区域。

字幕格式规则

通用规则(因平台而异):

  • 每行约 37-42 个字符,最多 2 行。
  • 持续时间:~1-6 秒;避免使用非常短的“闪光”字幕。
  • CPS 不超过 ~17(成人内容)。
  • 在有意义的地方断开句子(不要在行尾留下“and”或“but”)。
  • 如果可能,不要跳过场景切换(镜头切换)。
  • 脏话、歌曲、编剧等项目请遵守平台规则。

三个迷你箱子

案例 1 — ASR + 后期编辑速度加快 60%。一个团队首先使用 ASR 转录和时间编码了一部 45 分钟的纪录片,然后对其进行翻译和后期编辑。与从头开始转录+编码的时间相比,时间减少了60%。但所有专有名称和数字都通过声音比较得到纠正。

案例 2 — CPS 检查保存的可读性。带字幕的教学视频的第一个翻译是准确的,但 CPS 平均为 24 - 观众跟不上。一轮AI缩短字幕,字幕缩短30%,CPS降至16;意义得以保留,可读性得以提高。

情况 3 — 视觉上下文错误。在基于 ASR 的翻译中,一个角色指向屏幕上的一个标志并说“读那个”; AI将其翻译为“阅读它”,但标牌上的文字并未翻译,因此观看者看不到要阅读的内容。字幕师为屏幕字幕添加了单独的字幕;看到图像的人弥补了差异。

四个可复制模板

1)转录(ASR)验证清单:

以下是视频的自动转录。标记转录中可能存在的错误:专有名称、品牌名称、数字、技术术语、歧义/不完整的句子。将它们列为“通过语音验证”。不要翻译。抄写:[...]

2) 字幕翻译(CPS/长度有限):

将以下转录翻译成[目标语言]字幕。约束:每个字幕不得超过 2 行,行约 42 个字符,CPS 不超过约 17。缩短并自然化,同时保留含义;不要逐字翻译。保留时间代码。转录+时间码:[...]

3) CPS/可读性检查:

根据以下每个字幕的持续时间和字符数计算近似 CPS。标记任何超过 17 的内容,并建议保留其含义的较短替代方案。字幕(文本 | 持续时间秒):[...]

4) 屏幕文本/视觉上下文检查:

在下面的对话中,标记可能涉及图像的地方(屏幕文本、指向的物体、标志)。假设观众看不到图像,请说明是否需要额外的字幕/解释。对话:[...]

弱提示/强提示

弱:“翻译这些字幕。” (没有长度、CPS、行规则;输出不适合屏幕,不可读。)

Güçlü:“将此对话记录翻译成土耳其语字幕。每个字幕不得超过 2 行,每行 42 个字符;为了阅读速度,必要时缩短字幕,同时保留含义。以自然的土耳其语提供口语,软化俚语。不要触及时间代码。”

区别:强提示给出了字幕的技术限制(台词、字符、CPS、语气);输出实际上接近可用的字幕。

AVT格式比较表

格式

什么是

人工智能贡献

人类临界点

副标题

转录演讲内容

ASR、翻译、CPS

适合、视觉环境

配音

目标语言配音

翻译稿

口形同步、表演

画外音

阅读上面的翻译

翻译、时间安排

自然流畅、音调

音频描述

用声音描述图像

案文草稿

视觉解释(人类)

常见错误

  • 翻译 ASR 记录而不验证它。正确的姓名/号码错误会转移到副标题中。
  • 逐字翻译并绕过 CPS。观众无法阅读;必须进行配合。
  • 忽略视觉背景。屏幕文本和指向的对象保持未翻译。
  • 使线路分割毫无意义。它破坏了可读性。
  • 使音调/音域变得平坦。人物的方言和俚语消失了。

配音和口型同步

字幕的限制是阅读速度,配音的限制是时间和嘴唇。画外音翻译中存在三种不同的同步类型: 口型同步 — 翻译与角色的嘴巴运动相匹配,尤其是特写镜头中的开元音;等时性——翻译线与原始线的长度相同,既不太短也不太长;手势同步——将所说内容与角色的手和手臂动作相匹配。这就是为什么配音译者经常会写出“朗朗上口”的台词,保留原意,但用词却完全不同;这里的文字保真度甚至低于字幕。

AI可以提供原始译稿和配音时间警告(“这句台词比原来长了40%,缩短一下”)。新技术甚至可以克隆声音并产生自动配音;但表演、情感、微调角色的呼吸和口型同步仍然是人工翻译和配音演员的工作。自动配音提供大纲;艺术性和同步性的决定是人类的。此外,声音被克隆者的同意是一个重要的道德和法律问题。

综上所述

视听翻译是在观众的眼睛和耳朵的限制内调整文本的艺术:字幕中的台词/字符/CPS 边界、配音中的口型同步、视觉上下文是所有这些的决定因素。 AI 通过 ASR 加速转录、时间编码、翻译起草和 CPS 检查;但 ASR 在专有名称和噪声方面存在错误,它看不到图像,而且适应色调的决定是由人类做出的。主字幕不会逐字翻译;找到保留意思的最短、最自然的表达方式。

应用任务

选择一个简短的(2-3 分钟)视频剪辑。使用 ASR 工具进行转录,并使用“转录验证”模板与音频进行比较并纠正风险区域。然后使用“字幕翻译”模板以 CPS ~17 约束进行翻译,并使用“CPS 控制”缩短超出限制的字幕。如果有屏幕文本或标志,请应用“视觉上下文检查”。

清单

  • [ ] 我通过语音验证了特定姓名/号码的 ASR 解密。
  • [ ] 我使字幕符合台词/字符/CPS 规则。
  • [ ] 我对其进行了缩短和自然化,而不是逐字逐句地保留其含义。
  • [ ] 我考虑了视觉环境(屏幕上的文本、标志)。
  • [ ] 我翻译它是为了保留语气和性格上的差异。