收益:
- 能够理解文本转语音 (TTS)、语音克隆和人工配音(配音/口型同步)工具并生成画外音草稿
- 通过语气、节奏、重音和发音指令实现自然发声,并能够规划多语言版本
- 克隆一个人的声音需要同意、版权和个人权利;了解未经批准的声音模仿行为违反道德和法律
音频是视频的一半。观众可以原谅不好的形象;不原谅坏声音。在传统制作中,配音既昂贵又缓慢:寻找配音艺术家、建立工作室、录音,并在出现错误时回电。人工智能改变了这一局面:文本转语音工具可以在几分钟内将文本转换为自然语音;声音克隆可以“学习”一个人的声音并让他们说出新的句子;人工配音工具可以将视频转换为另一种与嘴唇动作和谐的语言。这些强大的能力中的每一项也都承担着严重的道德和法律责任。在本单元中,我们将涵盖技术和边界。
条款。文本转语音 (TTS) 是一种将书面文本转换为合成语音的技术。语音克隆正在创建一个模型,从语音样本中模仿真人的声音。人工配音是将视频的语音翻译成另一种语言,并用该语言配音,通常使其与唇部运动兼容(唇形同步)。韵律是语音的语调、重音和节奏的模式——句子的“情感”很大程度上来自韵律。音素是语言中最小的声音单位;发音问题通常在音素层面得到解决。
语音文本转语音
如今,TTS 工具变得异常自然;但要获得“良好”的配音需要正确引导车辆。粘贴原始文本并说“已读”会产生平面且机械化的结果。为了获得良好的配音,指导:声音特征(年龄、性别、温暖)、语气(真诚、严肃、兴奋)、节奏(缓慢的叙述或充满活力的广告)、重音(哪个词应该突出)、停顿(呼吸、标点符号)和发音(专有名词、缩写、外来词)。许多工具通过向文本添加标点符号和简短说明或使用特殊标记来为您提供这种控制。
你的角色:助理配音导演。文字:【下方60秒旁白文字】配音指令:- 配音角色:30多岁的女声,温暖安心。- 语气:平静、真诚;禁止商业喊叫。- 节奏:中慢;每句话末尾都有短促的呼吸。- 重音:稍微突出“免费”和“30 天”这两个词。- 发音:“AiEdu”->“ey-edu”; “%” -> “百分比”。任务:准备根据此说明标记的文本(指定强调/暂停将出现的位置)。
请务必聆听并检查 TTS 输出:正确的名称发音错误、奇怪的重音和不自然的停顿都很常见。在土耳其语中,外来词,尤其是词、缩写和数字会引起问题(“2024”->“2024”或“2224”?)。
声音克隆:权力与责任
语音克隆可以通过几分钟的录音生成一个模仿人声的模型。它有合法的用途:在生病的日子里,经演示者同意,用演示者的声音完成画外音;一致使用品牌认可的“声音标识”;让自己的声音用其他语言说话。但正是这种权力划出了最大的道德界限:在未经个人明确同意的情况下克隆和使用他或她的声音是对个人权利的侵犯,并在许多地方引起法律责任。声音是一个人身份的一部分;模仿可能会导致欺诈、诽谤和声誉受损。
语音克隆应遵循的基本原则:
原则
应用
明确同意
特定范围内语音所有者的书面许可
范围清晰
它将在哪里、使用多长时间以及用于什么目的?
透明度
必要时,信息“此声音是人工产生的”
有限使用
不超出同意范围(新项目、不同产品)
伸缩性
个人撤回同意的权利
注意:在未经名人、政客或您认识的人同意的情况下克隆他们的声音并创建内容 - 即使意图是“笑话”或“实验” - 是一种严重的违规行为。超出您控制范围的制作内容的传播无法撤消。
多语言配音
合成配音是将视频打开为不同语言的最快方法:该工具翻译语音,用目标语言配音,有时还同步嘴唇动作。对于想要接触全球受众的内容创作者来说,这是革命性的。但这是最容易受到攻击的点之一,因为三个独立的错误层重叠:翻译错误(习语、术语、上下文)、发声错误(错误的语气、发音)和同步错误(唇型不匹配、时间不匹配)。因此,在多语言配音中,需要由一个对目标语言具有母语水平的人来验证翻译和配音。品牌、意义和情感的完整性只能通过人为控制来保护。
三个迷你箱子
案例 1 — 快速且合乎道德的配音。一个电子学习团队必须更新 40 个视频课程的叙述;每次更新时召回艺术家的成本都很高。他们与艺术家签订了一份书面合同,规定了为本课程克隆他/她的声音的范围。因此,在他的声音和批准下,他们在几分钟内完成了文本更改。艺术家既收到了费用,又保持了控制权;球队获得了动力。
案例 2——未经同意的克隆丑闻。一位内容创作者从一位著名配音演员的 YouTube 视频中克隆了他的声音,并将其用于广告中。艺术家认出了他的声音,启动了法律程序,媒体报道了这一事件。品牌声誉受损,内容被删除,赔偿也被提上日程。教训:未经同意的音频使用既是道德灾难,也是法律灾难。
案例 3——未经验证的配音。一个频道人为地将其视频配音为西班牙语,但从未对其进行检查。一个技术术语被误译,画外音的强调颠倒了句子的含义。西班牙观众指出评论中的错误,信任受到损害。正确的方法是让懂目标语言的人验证。
弱提示/强提示
弱提示:
说出这段文字。
没有声音特征、音调、节奏或发音。输出变得扁平且机械化。
强力提示:
你的角色:配音导演。目的:45秒的产品宣传解说。声音:35岁,温暖的男声,让人安心。语气:信息丰富但真诚;毫不夸张。节奏:中等;技术句子稍微放慢。强调:突出显示价格和保修字样。发音:“3D”->“三维”;品牌名称 [BRAND] 原样。输出:带有强调和暂停标记的画外音文本。约束:仅使用同意/合成语音;冒充真人。
常见错误
- 在没有指导的情况下阅读原始文本。如果没有给出语气、节奏和重音,声音听起来会很机械。
- 使用 TTS 输出而不听它。发音错误(正确名称、数字、缩写)很常见。
- 未经同意的声音克隆。违反道德和法律行为; “实验/笑话”的借口是无效的。
- 超出同意范围。在另一作品中使用某个项目的许可是一种违法行为。
- 未验证配音。翻译+配音+同步错误重叠。
提示:在 TTS 中,在文本中清楚地写出数字、缩写和专有名称(“百分之三十”、“三维”、“ey-edu”)。您可以确定发音,而不是让模型来猜测。
总之
合成配音、语音克隆和配音从根本上加快了视频制作中的音频工作并实现了全球覆盖。为了获得良好的效果,请使用语气、节奏、重音和发音指南来指导 TTS,并确保收听输出。声音克隆很强大,但它划出了最清晰的道德界限:一个人的声音只能在明确的、有范围的、书面同意的情况下使用;未经同意的模仿属于侵权行为。由于多语言配音中翻译、配音和同步错误会重叠,因此需要了解目标语言的人员进行验证。产生车辆声音;同意、准确性和含义是您的责任。
应用任务
写一篇 60 秒的叙述性文字。使用 TTS 工具将其发音出来,并使用上述的语气/节奏/重音/发音指南。听输出并找到并纠正至少三个发音错误的地方(数字、专有名称、缩写)。然后起草一份简单的声音克隆“同意书”:谁的声音、哪个项目、持续多长时间、用于什么用途、撤回权。总结一下你的工作。
清单
- [ ] 我是否用语调、节奏、重音和发音指导来指导发声?
- [ ] 我是否听过 TTS 输出并纠正了任何发音/数字/缩写错误?
- [ ] 对于我克隆/使用的声音是否有明确且具体的书面同意?
- [ ] 我是否确定自己没有超出同意的范围(地点、期限、目的)?
- [ ] 我是否与了解目标语言的人验证了配音输出的翻译/语气/同步?