收益:
- 能够区分基于NMT和LLM的翻译的优缺点,并根据业务类型选择合适的引擎
- 能够对文本对机器的适用性进行预先分类,并预先评估其实际时间和价格
- 能够从五个维度快速测量原始机器输出的质量并标记风险,而不会混淆平滑度和准确性
作为译者,最强大的加速器是机器翻译 (MT),但有意识地使用工具意味着将其以正确的语言对和正确的期望应用于正确的工作。在本单元中,您将了解 MT 的两大家族(NMT 和基于 LLM 的翻译),了解哪一个更适合哪项工作,如何在交付前快速衡量翻译的原始输出质量,以及如何根据工作选择引擎。目的是摆脱“都一样,粘贴翻译”的想法,成为能够预见哪些文本适合机器、哪些文本需要人力密集型劳动的专家。
两个系列:基于 NMT 和 LLM 的翻译
NMT(神经机器翻译)是从数百万个双语句子中学习并翻译整个句子的系统;谷歌翻译、DeepL、微软翻译就是其中的例子。优点:非常快、一致、流利的短句。弱点:经常看不到句子边界之外的上下文(从全文来看);通过查看该段落可能很难确定“bank”一词是指银行还是河岸,并且它不符合所提供的术语列表。
基于LLM的翻译(大语言模型)是利用ChatGPT、Claude、Gemini等指令驱动的模型进行翻译。优势:接受指示——理解诸如“使用正式语气”、“遵循术语列表”、“目标受众是儿童”等指示;看到更广泛的背景;更好地捕捉习语和语气。弱点:有时可能“太有创意”并增加来源(产生幻觉的风险),在长文本中失去连贯性,并且成本/速度因工作而异。
经验法则:在直接、重复的技术文本中,NMT 通常快速且足够;法学硕士对于需要语气、语境、词汇和教学方面要求严格的文本更加灵活。如今,大多数专业人士同时使用两者:NMT 的快速草稿、LLM 的语气/术语校正。
提示:语言对(例如土耳其语→英语)的机器质量可能与相反方向(英语→土耳其语)不同。具有粘着性、灵活语法的语言,例如土耳其语,对于机器翻译来说通常更具挑战性。通过一些示例文本,您可以自己判断哪一个引擎在您自己的配对中更好。
文本的机器兼容性:首先询问这个
并非所有文本都同样适合机器。在开始翻译之前,将文本通过“适合性”过滤器:
- 非常适合机器:技术手册、产品描述、重复的界面文本、标准对应、表格/列表。语言平实,术语固定,创造力稀缺。
- 适合媒介:新闻、企业内容、教育材料。该机器可以产生良好的轮廓,但需要对音调和流程进行严格的后期编辑。
- 不适合机器(高风险):法律合同、医疗文本、广告/口号、文学文本、幽默、诗歌。在这里,机器只给出想法;这项工作很大程度上落在了人身上。
如果您从一开始就做出这种区分,您既可以为客户提供正确的时间/价格,又可以保护自己免受盲目信任原始输出的影响。
快速测量原始输出质量
当您看到 MT 输出时,您会想“它是好是坏?”用快速清单回答问题,而不是凭直觉。看这五个维度:准确性(意思是否忠实于原文?)、完整性(句子是省略还是添加?)、术语(是否正确且一致?)、流畅性(目标语言是否自然?)、格式(标签、数字、格式是否保留?)。我们将在下一个质量单元中深化这些维度;现在,让它成为您的产前反射。
注意:MT 输出最危险的错误是“流畅但不正确”的错误。该句子可能是完美的土耳其语,但源中的“15% 折扣”可能已更改为“50% 折扣”。不要因为流利而被推迟;始终分别查看数字、否定词和专有名词。
三个迷你箱子
案例 1 — 正确的引擎将时间缩短了一半。一位译者选择用 NMT 翻译一个 12000 字的软件界面,用 LLM 翻译一本同卷的营销手册。 NMT在界面上的一致性使得工作速度更快; LLM 在小册子中的语气灵活性减少了 40% 的重写负担。将这两项工作交给同一个引擎会浪费时间。
案例2——预评估节省了价格。一个办公室即将提供一份法律文本,因为“它可以用机器制造,而且很便宜”。预评估中,翻译了500字的样本;机器返回了两个法律术语,但系统的等效术语错误。该办公室将这项工作定价为“繁重的后期编辑”,并给出了现实的截止日期;他避免了因为错误的报价而损失金钱。
案例 3 — 语言对差异。一个团队认为,在英语→德语中表现良好的引擎在土耳其语→阿拉伯语中也具有相同的质量。 300 字测试表明阿拉伯语输出需要更多修正。团队根据语言对分配不同的引擎和不同的后期编辑预算。
四个可复制模板
1)文本适宜性评估:
您的角色:高级 MTPE 专家。评价以下文本是否适合机器翻译:文字/技术还是创意/上下文?将其分类为 (1) 非常适合机器、(2) 中等、(3) 高风险并写下您的理由。估计预期的后期编辑负载为轻/中/重。文本示例:[粘贴 200-300 个字]
2)指导LLM翻译(包括术语和语气控制):
翻译此文本[来源]→[目标]。受众:[谁]。语气:[例如官方的]。字段:[例如金融]。术语列表(一定要使用):[A→a,B→b]。规则:不要添加来源中没有的内容,保留数字/日期/名称,用一个句子替换每个句子。用[?]标记您不确定的地方。文本:[...]
3)两种引擎对比:
以下是同一源句子的两个不同翻译(A 和 B)。比较每一个的正确性、术语和自然性,并告诉我哪一个需要较少的修正,并说明理由。来源:[...] |翻译A:[...] |翻译B:[...]
4)原始输出快速检查:
以下是源代码和机器翻译。只需标记以下内容:(1)省略/添加信息,(2)错误的数字/日期/名称,(3)否定错误,(4)不一致的术语。不要写任何更正,只需列出有风险的区域。来源:[...] |翻译:[...]
弱提示/强提示
弱者:“翻译一下这段文字就好了。” (对于引擎来说,“好”是不确定的;没有音调,没有术语,没有质量。)
Güçlü:“将此产品说明从英语翻译成土耳其语。领域:电子商务。受众:年轻消费者。语气:友好但令人放心。‘结帐’→‘结帐步骤’,‘愿望清单’→‘愿望清单’。更改数字和品牌名称。流利的土耳其语,没有任何翻译气味。”
差异:强烈的提示给引擎一个可衡量的目标;输出直接近似于后期编辑的草稿。
NMT 与 LLM 比较表
尺寸
NMT(谷歌、DeepL)
法学硕士(ChatGPT,克劳德)
速度
非常快
中等
接收指令/提示音
弱
强
遵守术语表
有限
好(有提示)
广泛的背景
弱
好
产生幻觉的风险
低
中等(需要控制)
最适合的工作
直接/技术/重复
语气/语境/创意
常见错误
- 每项工作都使用相同的引擎。不根据工作类型选择发动机会导致时间和质量的损失。
- 给出价格/时间,无需预先评估。 200-300字的测试从一开始就揭示了惊喜。
- 将流畅性误认为准确性。美丽的句子并不意味着正确的句子。
- 忽略语言对和方向差异。一对中的好引擎可能在另一对中很弱。
- 没有注意到LLM的补充。 LLM 有时会添加原文中没有的句子“以提供帮助”;看看这个。
上下文窗口和一致性
当使用法学硕士翻译长文本时,有必要了解一个技术限制:上下文窗口——模型一次可以“看到”并记住的文本量。如果文本大于此窗口,您将必须将其拆分为块,并且模型可能会在下一个块中“忘记”您在前一个块中做出的术语决策或语气。因此,不要将一本很长的书或文档翻译成一篇,而是提醒每一篇的术语库和风格摘要,以保持一致性。这个问题在短文本中不会出现;但在小说、手册等长篇作品中,还需要额外检查段落的一致性。实用的解决方案:准备一个“项目记忆”(术语+字符+语气决定)并将其添加到每篇文章的开头,并在翻译结束时扫描各片段之间的一致性。在 NMT 中,这个问题以不同的方式经历:由于 NMT 逐句翻译,段落长度一致性已经很弱,因此术语库承担了术语纪律。
总之
机器翻译有两个系列:NMT(快速且一致)和 LLM(接受指令并更好地了解上下文和语气)。翻译大师提前对文本对机器的适合性进行评分,根据工作选择引擎,在交付前快速测量原始输出的质量,从不混淆流畅性和准确性。这种预评估反射使您既可以给出现实的时间/价格,又可以保护自己免受盲目信任。
应用任务
使用 NMT 工具和法学硕士翻译相同的 200 字文本。从五个维度(准确性、完整性、术语、流畅性、格式)比较两个输出,并写出本文需要较少后期编辑的原因。然后使用“原始输出快速检查”模板标记两者的问题/意外事件/术语风险。
清单
- [ ] 我对文本对机器的适用性进行了分类(低/中/高风险)。
- [ ] 根据工作类型,我决定使用NMT还是LLM。
- [ ] 我通过小样本进行了初步评估,并据此确定了工期/价格。
- [ ] 我快速检查了五个维度的原始输出。
- [ ] 我分别检查了号码、日期、姓名和底片,没有被流畅性所迷惑。