单位 4 / 11

转录和字幕:语音转文本和多语言字幕

收益:

  • 能够理解自动转录和说话者分离的概念,并将原始录音转换为时间编码文本
  • 能够理解字幕格式(SRT/VTT)、阅读速度和行规则,并能够制作和编辑多语言字幕草稿
  • 了解编辑有责任在出版前验证自动记录中的术语、专有名称、标点符号错误和翻译错误。

传统上,后期制作中最繁琐、最耗时的任务是转录:剪辑师会无休止地听几个小时的采访片段,用手打出每个句子。一小时的录音很容易需要四到五个小时才能转录。人工智能从根本上改变了这一行业:如今,长达一小时的录音可以在几分钟内转变为时间编码的文本。这既加快了编辑流程,又实现了可访问性(为听力受损的观众提供字幕和静音观看)。但自动输出永远不适合以原始形式出版;在本单元中,我们将看到其威力和陷阱。

让我们从条款开始。转录是将语音转化为文字。自动语音识别 (ASR) 是将语音转换为文本的技术。时间码是显示文本对应于视频中哪一秒的符号。说话人分类是区分“谁说话”并将文本划分为说话人。副标题(subtitle/caption)是出现在屏幕上的时间编码文本。 SRT 和 VTT 是最常见的字幕文件格式;它们包含每行的顺序、开始结束时间和文本。阅读速度(CPS:每秒字符数)决定了该行必须在屏幕上保留多长时间才能让观看者舒适地阅读字幕。

自动转录的力量和极限

人工智能转录可以以非常高的准确度转录以正确的土耳其语录制的清晰的单人语音。但它在以下情况下会出错,了解这些可以让你有针对性地进行验证:专有名称(人名、品牌、地名经常拼写错误)、技术术语和缩写、发音相似的单词(“kar/kar”、“still/still”)、重叠语音(两个人同时讲话)、背景噪音和音乐、方言/口音差异和标点符号(问题或句子结尾)。此外,模型可能会“听到”并转录一个在喧闹时刻从未说过的单词——这就是转录的幻觉。

下表总结了自动转录的强条件和弱条件:

条件

准确度

编辑重点

单扬声器,声音清晰,环境安静

非常高

专有名称、标点符号

多扬声器面板

中等

说话人分离、语音重叠

噪音/室外录音

低中

造词,跳跃

技术/术语内容

中等

术语和缩写的书写

带口音的讲话

变量

词语错误、含义

字幕格式和可读性规则

一个好的副标题不仅仅是“正确的文字”,而是“正确的文字”。必须可读。国际惯例有一些经验法则:一行字幕一般不超过两行;每行应保持合理的长度(大约 37-42 个字符);字幕必须在屏幕上停留足够长的时间以便于阅读(通常为 1-6 秒);阅读速度不应该太高(大多数指南认为〜15-17个字符/秒为限制)。人工智能工具会自动分割字幕,但这些分割有时会在不好的地方切断句子(以“and”结尾的行,打破分割含义)。编辑的工作是使文本准确而流畅。

您的角色:字幕编辑助理。以下是自动转录。任务:1)根据SRT逻辑将文本划分为字幕块。2)每个块最多2行,每行不应超过~40个字符。3)在有意义的地方划分句子;以“and”、“but”、“that”结尾的行。4) 使用 [CHECK] 标记标记专有名词和术语,以便我可以手动验证它们。5) 不要更改文本,只需拆分和标记。

这个提示中的“[CONTROL]标签”想法很有价值:让人工智能标记不确定或有风险的区域(专有名称、术语),可以将编辑的注意力引导到正确的位置,并防止盲目信任。

多语言字幕和翻译

将视频打开为多种语言可以增加观众数量。人工智能可以获取文字记录,将其翻译成目标语言,并生成字幕文件。这是一项强大的功能,但也是最脆弱的:机器翻译可能会歪曲习语、文化参考、幽默和双关语、术语和上下文。逐字翻译“It's raining cats and dogs”这句话是一场灾难。字幕翻译还存在空间限制:目标语言的句子可能较长,超过阅读速度。这就是为什么多语言字幕必须由了解目标语言的人来验证翻译,特别是对于品牌、法律或健康等敏感内容,不正确的翻译可能会产生严重后果。

将以下土耳其语字幕块翻译成英语。规则: - 传递成语和笑话,不是逐字逐句,但保留其含义。 - 品牌名称和产品名称保持原样,不要翻译。 - 让每个块保持其读取速度;如有必要,请缩短,但不要扭曲含义。 - 使用[译者注]指定您不确定的文化参考或术语。

三个迷你箱子

情况 1 — 加速线。纪录片摄制组花了三周时间手工记录了 12 小时的采访档案。自动转录,一天内输出原始文本;通过文本搜索(逐字),团队在几秒钟内找到了他们想要的时刻。然后,他们精心编辑了他们将使用的 40 分钟的剧集并为其添加了字幕。三个星期变成了四天;验证工作集中于所使用的部分。

案例 2——虚构的词。一个新闻频道未经检查就以自动字幕播放了喧闹的街头采访。模型在背景嗡嗡声中“听到”了一个未说出来的词,而标题则将一个未说出来的词归咎于受访者。社交媒体上引起了反响,并发布了更正。教训:在嘈杂的录音中,自动字幕必须与原始音频进行比较。

案例 3——翻译灾难。某品牌发布其宣传视频的英文字幕,采用机器翻译且不受控制。当一个土耳其成语(“keep an eye out”)被逐字翻译时,对英国观众来说似乎毫无意义,甚至很有趣,品牌的严肃性也受到了损害。正确的方法:让懂目标语言的人验证翻译。

弱提示/强提示

弱提示:

为该视频添加字幕并将其翻译成英文。

没有格式、没有可读性规则、没有验证标记。产出将是粗糙且有风险的。

强力提示:

您的角色:双语字幕编辑器。输入:土耳其语时间编码文字记录。任务:1) 编辑 2 行/~40 个字符/良好的划分规则的土耳其语字幕。2) 使用 [CONTROL] 标记专有名称和术语。3) 单独生成英文翻译;按字面意思转换短语,保留品牌名称。4)用[LONG]标记超出阅读速度的块。5)不要编造任何单词;写出不定发音[未指示]。

常见错误

  • 不受控制地自动发布成绩单。专有名称、术语、标点符号和合成词中的错误仍然存​​在。
  • 坏线分裂。以“and/but/ki”结尾的行使阅读变得困难。
  • 超越阅读速度。屏幕上太短的长字幕无法阅读。
  • 不验证机器翻译。如果一个习语、笑话或术语出了问题,品牌就会受到影响。
  • 绕过说话人的区别。如果面板中的“谁说了什么”存在混淆,则副标题将会产生误导。
提示:编辑脚本时,以 1.25-1.5 的速度观看视频并检查其与字幕是否同步。通过这种方式,您可以快速捕获时间码漂移和弥补/遗漏的单词。
注意:在医疗保健、法律、金融等领域,一个错误转录的单词(例如剂量、成分编号)可能会产生严重后果。在这些内容中,每个数字和术语都必须单独验证。

综上所述

自动转录和字幕是后期制作中最大的节省时间的方法,并且可以实现无障碍。人工智能将转录时间缩短为几分钟,并支持通过文本进行搜索。但输出不适合以原始形式出版:专有名称、术语、标点符号、虚构单词和错误的换行符必须更正。可读性规则(行长、持续时间、阅读速度)使文本对于观看者来说流畅。在多语言字幕中,机器翻译必须由了解目标语言的人员进行验证。 AI倾倒并建议;准确性、可读性和意义是编辑的责任。

应用任务

录制一段简短的对话录音(可能是您自己的声音,2-3 分钟)并自动转录。将输出与原始音频进行比较,并标记专有名词、术语和标点符号错误;至少找出五个错误。然后,将文本按照上述规则划分为字幕块,翻译成一种语言,并纠正翻译中至少两个风险点(习语/术语)。报告该过程以及您发现的任何错误。

清单

  • [ ] 我是否将转录内容与原始音频进行了比较并纠正了任何专有名词/术语/标点符号错误?
  • [ ] 我是否检查过是否有虚构或遗漏的单词?
  • [ ] 我是否根据行长、时长和阅读速度规则编辑了字幕?
  • [ ] 对于多语言字幕,我是否与了解目标语言的人仔细验证了翻译?
  • [ ] 我是否单独验证了敏感内容中的每个数字和术语?