收益:
- 了解翻译记忆库 (TM)、模糊匹配和句段的概念,并能够通过调整而不是盲目地利用模糊匹配的差异。
- 能够应用仅将经批准的翻译写入 TM 的规则、将客户 TM 分开并执行 TM 维护
- 能够通过控制数据在 CAT 内的 MT/LLM 集成中的去向来保护隐私
专业翻译通常是在 CAT 工具中完成,而不是在纯文本编辑器中完成。在本单元中,您将学习 CAT 工具、翻译核心的翻译记忆库 (TM)、它们如何与机器翻译和法学硕士协同工作,以及如何高效、安全地使用这个生态系统。我们的目标是成为一名翻译技术用户,以一致、快速和可追踪的方式管理整个项目,而不是单个句子。
基本概念
CAT工具(计算机辅助翻译)是逐句(句段)组织翻译并连接翻译记忆库和术语库的专业软件(如Trados、memoQ、Phrase、MateCat)。并排显示源和目标、捕获重复、保留格式。
TM(翻译记忆库)是一个数据库,存储您之前翻译过的源-目标句子对。当有新的句子到来时,如果TM中有类似的句子,代理就会向您推荐。这里的关键概念是模糊匹配:新句子与 TM 中句子的相似度(100% = 完全相同,85% = 很大程度上相似)。高匹配度可以加快工作速度,因为您可以重复使用以前的翻译。
句段是翻译的基本单位——通常是句子。 CAT 工具将文本分成多个片段并单独编辑每个片段。
TM 的重要性:MT 生成原始草稿,但 TM 会返回经过批准的、人工质量的过去翻译。两者不同:MT是预测,TM是记忆。
提示:不要混淆 TM 和 MT。 100% TM 匹配(您之前批准的翻译)通常是可靠的;应始终验证 MT 的建议。 CAT 工具用不同的颜色/标签显示两者;总是看到这种差异。
将 MT 和 LLM 整合到 CAT 中
现代 CAT 工具在内部调用 MT 引擎和越来越多的法学硕士:如果 TM 中没有匹配项,代理会自动返回该细分市场的 MT 推荐;您对其进行后期编辑(即 CAT 中的 MTPE 流)。最新一代工具还集成了LLM:您可以在工具中执行“用这种语气重写此段”、“将此术语更正到术语库”等操作。
这种集成的优点:TM、术语库、MT 和 LLM 合并在一个屏幕中;对于每个句子,建立“首先看TM,否则建议MT,自动术语QA”的流程。缺点和注意事项:数据去了哪里?基于云的MT/LLM集成可以将文本发送到外部服务器;在保密工作中,这可能违反合同。请务必了解车辆连接到哪个引擎以及使用哪个数据策略。
传送和清除翻译记忆库
TM 的价值与其翻译的质量一样重要。垃圾进来,垃圾出去。两个学科:
- 只需将经过认证的翻译写给 TM 即可。如果您将原始 MT 输出保存到 TM 而不对其进行验证,它将作为错误的“内存”返回到您未来的工作中。
- 执行 TM 维护。随着时间的推移,术语会发生变化并出现错误。定期清洁 TM,纠正磨损/不正确的配对。在这项工作中,我使用法学硕士来询问“这些 TM 对中是否存在不一致/术语偏差?”您可以将其用作审核员。
注意:在另一客户的业务中使用一个客户的 TM 既违反机密性,又存在术语混淆的风险。 TM 根据客户/项目分开保存。混合的“一切TM”都会破坏机密性和质量。
三个迷你箱子
案例 1 — TM 播放了重播。一家制造商正在翻译一个产品系列,其中 70% 的手册年复一年保持不变。感谢 TM,每个新版本都会自动实现 100% 和高度模糊匹配; 30,000 字的作品中只有约 9,000 字是真正的新译文。时间和成本减少了三分之一。
情况 2 — Dirty TM 传播错误。一个团队未经验证就将原始 MT 输出保存到 TM 中。一年后,同样的误译一次又一次出现,显得“可靠”,100%匹配;该错误分布在 14 个不同的文档中。该团队制定了“仅限 TM 的认证翻译”规则和清理工作。
案例3——整合过程中的机密泄露。翻译人员在自动连接云端MT的CAT项目中进行机密工作;该文本发送到一个数据策略尚不清楚的外部引擎。一旦被发现,秘密项目的 MT 集成就被关闭,只使用“不存储/训练数据”的企业引擎。
四个可复制模板
1)模糊匹配评估(到LLM):
以下是新的源句子、TM 中的相似句子及其批准的翻译。准确地告诉我需要更改哪些内容才能使 TM 翻译适应新句子;不要建议不必要的更改。清楚地表明含义的差异。新来源:[...] | TM 来源:[...] | TM 翻译:[...]
2)TM一致性检查:
以下是来自 TM 的源-目标对。标记不一致和术语偏差,其中相同或非常相似的源句子被不同地翻译。只需列出问题即可。夫妇:[...]
3)段音重写(CAT中的LLM):
将以下目标片段设置为 [所需语气],但不改变其含义。遵守术语列表:[...]。保留号码和姓名。仅导出重写的段。部分: [...]
4) 隐私/集成预检查:
我将在 CAT 项目中使用 MT/LLM 集成。我将描述这个项目中的文本类型;告诉我是否适合将此文本发送到基于云的外部引擎,我应该询问提供商哪些问题(数据保留、培训、位置)。文本类型/隐私状态:[...]
弱提示/强提示
弱:“使用TM中的翻译。” (目前还不清楚匹配率和适应内容;盲目复制会引入错误。)
Strong:“这个新句子与 TM 中的句子 90% 的情况相匹配。以 TM 翻译为基础,但反映了这一差异:源中使用的是“年度”而不是“每月”,因此应该是“年度”而不是“每月”。不要更改任何其他内容。”
差异:强力提示,精准定位匹配差异;它可以防止“保留旧翻译原样”,这是模糊匹配最常见的错误。
CAT 生态系统组成表
组件
什么是
与人工智能的关系
TM(翻译记忆库)
返回已批准的过去翻译
可靠;优先于 MT
术语库
确保术语一致性
它是作为LLM的提示而给出的
MT推荐
原始草图进入空段
必须经过后期编辑
法学硕士整合
语气/术语/重写
受控、注重隐私
质量保证模块
扫描号码/术语/标签错误
自动控制
常见错误
- 一味地接受模糊匹配。 85% 的匹配度可以隐藏 15% 的含义差异。
- 将原始 MT 输出写入 TM。 Dirty TM 将错误带入未来并使其扩散。
- 混合客户/项目 TM。保密性和术语混淆的风险。
- 不知道集成数据去了哪里。隐藏的文本可能会在您不知情的情况下泄露。
- 忘记 TM/MT 的区别。 MT 是估计值; TM是记忆。两者并不同样安全。
预翻译和对齐
两项先进的 CAT 功能进一步加速了人工智能时代的工作流程。首先是预翻译:在项目开始时,工具自动用TM和MT填充所有句段;您从一个文件开始,而不是空文件,其中 100% 匹配已获得批准,模糊匹配正在等待调整,空文件是 MT 草稿。这将工作从“从头开始写作”转变为“审阅和编辑”——但你需要评估每个片段,而不是盲目批准预翻译。
第二个是对齐:如果您有一个之前翻译过但尚未进入 TM 的源-译文文档对,对齐工具会逐段匹配它们并将其转换为 TM。因此,您过去的翻译将被添加到“记忆”中。对齐注意事项:自动匹配并不总是正确的;某一部分的滑动会破坏整个对齐。在 TMing 之前检查对齐对可以首先防止脏 TM 的风险。这两个功能将您当前的资产(过去的翻译)转化为对未来业务的投资。
综上所述
计算机辅助翻译工具;它将翻译记忆库、术语库、机器翻译和法学硕士整合到一条生产线中。 TM 是一个存储器,可以检索您批准的过去翻译,并在重复性任务中提供极快的速度;机器翻译是一种总是需要验证的预测。精明的用户会仔细调整模糊匹配中的差异,仅将批准的翻译写入 TM,将客户 TM 分开,并通过了解数据在集成中的去向来保护隐私。
应用任务
在 CAT 工具(免费的在线 CAT 也可以)中设置一个小项目:添加术语库和空 TM。翻译 10 句文本,将批准的翻译保存到 TM。然后翻译与第一个文本非常相似的第二个文本,并使用“模糊匹配评估”模板调整TM返回的模糊匹配;请注意,如果您盲目接受 TM,您会犯多少个句子。
清单
- [ ] 我将 TM 和术语库连接到该项目。
- [ ] 我自适应地使用了模糊匹配的差异,而不是盲目地使用。
- [ ] 我只给TM写了我已经验证过的认证翻译。
- [ ] 我将客户/项目 TM 分开。
- [ ] 我检查了 MT/LLM 集成中数据的去向。