单位 8 / 11

质量控制 (QA)、评估指标和 LQA

收益:

  • 能够区分自动 QA 和语言 LQA 层并以正确的顺序应用两者
  • 能够使用 MQM 等错误框架根据类别和权重(关键/主要/次要)客观评估翻译
  • 使用人工智能作为审计员时能够做出最终决定,了解其自身翻译的盲目性、犯错误的风险以及自动化指标的局限性

当您说翻译“完成”时,工作就完成了一半;另一半是证明该翻译实际上是可靠的。在本单元中,您将学习衡量翻译质量的系统方法:自动 QA 检查、基于人工的 LQA 错误框架、质量指标以及如何使用人工智能作为“检查员”及其局限性。目的是摆脱“我觉得好”的主观性,成为定义、衡量和证明质量的专家。

两种类型的质量控制:自动和语言

QA(质量保证)在翻译中分两层进行:

自动 QA:CAT 工具和脚本捕获的文体错误 — 数字不匹配、空格缺失/过多、术语不一致、未翻译的片段、错误的占位符/标签、双空格、标点符号。这些由机器快速、完整地扫描;它逃过了人眼,但车辆捕捉到了它。

LQA(语言质量保证):这是人类评估者检查含义、术语、风格、语法和本地适用性的层。自动 QA“数字是否匹配?”看问题; LQA“意思是否正确、语气是否合适、文化上是否合适?”他看着问题。两者相辅相成;其中之一不能取代另一个。

提示:始终先运行自动 QA;清除形式错误可以让人类评估者将注意力集中在真正的语言问题上。担心数字错误的审稿人会错过音调错误。

错误帧:MQM 和 DQF

标准错误类型用于使质量可衡量,而不是“好/坏”。最常见的是 MQM(多维质量指标):它将每个错误分配给一个类别(准确性、流畅性、术语、风格、位置、格式)和权重(严重、主要、次要)。另一个框架是 DQF(动态质量框架),与 MQM 一起提及。

为什么它很重要?因为有了这个框架,你可以给翻译打一个错误分数,客观地比较不同的翻译器/引擎并问“这个文本可以交付吗?”您用数字阈值回答问题。例如:严重错误 = 10 分,主要错误 = 5,次要错误 = 1;低于特定阈值的文本通过每个特定单词。

严重错误:颠倒含义、造成安全/法律风险、损害品牌的错误(剂量错误、“不负责”而不是“负责”)。主要:具有破坏性但无害。次要:明显但不减损其含义(次要样式/标点符号)。

使用人工智能作为控制器——及其局限性

AI 可以快速且有助于根据错误框架检查翻译:您可以说“使用 MQM 类别标记此翻译中的正确性、术语、流畅性错误”。它减少了您的盲点并为您提供了快速的“第二只眼睛”。

但存在三个关键限制:(1)人工智能在检查其生成的翻译时可能是盲目的——既犯了同样的错误,又确认了同样的错误;使用不同的模型进行交叉检查或返回源。 (2)AI还可以弥补幻觉的“错误”——报告不存在的错误;确认每个警告。 (3)AI可能无法完全掌握现实世界中关键错误的严重性(剂量错误可能是致命的);专家进行加权。因此,人工智能加快了质量检查速度,但最终的质量决策和交付批准取决于人类。

注意:说“AI 已经通过了 QA,它是干净的”是一种错误的自信感。人工智能审核不能替代人类 LQA 和与源的比较;这是一个预筛选层,可以让他们加快速度。

三个迷你箱子

案例 1 — 自动 QA 发现 40 个数字错误。在财务报告翻译中,自动 QA 发现源和目标之间存在 40 个数字/格式不匹配的情况(千位分隔符、小数点、货币)。人眼会忽略其中的大部分;车辆以秒为单位列出。

案例 2 — MQM 分数决定了引擎的选择。一个局 MQM 对两个不同 MT 引擎的输出进行了 2,000 个单词的评级:引擎 A 12 个错误点,引擎 B 31 个错误点。客观测量用分数解决了“哪个更好”的争论;该局以发动机A为标准,并相应地规划了修订后的预算。

案例3——人工智能审计漏掉了自己的错误。一名译者的法学硕士翻译由同一个法学硕士监督;模特说“没问题”,这是她自己犯的一个术语错误。当译者与不同的模型和来源进行交叉检查时,发现了这个错误;团队采用了“同一个模型不应该控制自己”的规则。

四个可复制模板

1)基于MQM的错误检查:

您的角色:LQA 评估员。比较下面的来源和翻译。按以下格式提供您发现的每个错误:[类别:准确性/术语/流畅性/风格/格式][权重:关键/主要/次要][位置][评论][更正]。将您不确定的警告标记为“需要确认”;错误制造。来源:[...] |翻译:[...]

2)严重错误扫描(高风险):

仅在以下翻译中查找严重错误:含义颠倒、数字/剂量/日期错误、否定丢失、法律义务替代、安全警告错误。忽略小的样式问题。引用每个关键发现的来源。来源:[...] |翻译:[...]

3)自动QA补充控制:

列出以下源-目标对中的形式不一致之处:数字不匹配、缺少/额外占位符或标签、术语不一致、未翻译的段、单位/货币差异。只需给出其位置的问题即可。对:[...]

4)独立的第二只眼睛(交叉检查):

不带偏见地评估此翻译;别以为是你写的。对来源的保真度、术语和自然度进行质量评级 (1-5),并列出前 3 个问题。由我来决定。来源:[...] |翻译:[...]

弱提示/强提示

弱者:“这个翻译好不好?” (没有标准;人工智能返回一个无用的答案,例如“一般好”。)

强:“根据来源检查此翻译。用类别(准确性/术语/流畅性)和严重性(严重/主要/次要)标记每个错误。特别关注数字、否定和术语错误。不要捏造错误;如果不确定,请标记“需要确认”。”

区别:强烈提示给出错误框和焦点;输出是一份可比较且可操作的质量报告。

质量层表

什么抓住了

谁/做什么

自动质量检查

数量、标签、一致性

工具/脚本

人工智能控制

可能的含义/术语错误

LLM(有确认)

人类LQA

含义、语气、文化、分量

专家评估员

MQM/DQF 分数

客观错误评分

人类与框架

交货确认

最终责任

有能力的翻译

常见错误

  • 跳过自动 QA 并直接开始阅读。文体错误会分散注意力。
  • 用人工 LQA 取代人工智能检查。 AI预筛选,不批准。
  • 让相同的模型检查它自己的翻译。盲点;需要交叉检查。
  • 不是称重错误。将关键和次要视为相同会破坏优先级。
  • 在没有确认的情况下纠正人工智能所制造的“错误”。你可以歪曲正确的句子。

自动指标:BLEU、COMET 和限制

质量测量中还有一个自动化指标的世界。 BLEU(双语评估研究)将机器翻译与人类参考翻译进行比较,并根据单词重叠给出 0-100 分的分数;长期以来,它是比较 MT 系统的标准。较新的指标 COMET 基于神经网络,比 BLEU 更好地捕获语义相似性。这些指标对于快速、自动地比较两个引擎的大数据非常有价值。

但它的局限性很明显:像 BLEU 这样的指标着眼于单词重叠,而不是真正理解含义。与参考文献不同但准确的翻译可能会获得低分;与参考文献相似但不正确的翻译可能会获得高分。严重的负面错误是一个单词,因此它对指标的影响很小,但实际上是灾难性的。这就是为什么自动化指标衡量系统级别的趋势,而不是决定单个文本的交付能力。基于 MQM 的人工评估和专家判断决定翻译是否发送给客户,而不是自动评分。使用指标作为指南针,而不是法官。

总之

翻译质量不是主观感受,而是可衡量的东西。自动 QA 彻底扫描形式错误;人类 LQA 评估含义、语气和文化; MQM 等错误框架按类别和权重量化质量,从而实现客观比较。人工智能是强大的第二只眼睛,可以加速这种控制,但它可能会忽视自己的翻译,犯错误,并且无法完全掌握现实世界的重量;因此,最终的质量决定、权重和交付批准属于有能力的翻译人员。

应用任务

获取机器翻译输出。首先使用“自动 QA 补充检查”列出形式错误,然后使用“基于 MQM 的错误检查”按类别和权重列出语言错误。我用每个单词的阈值对每个错误(严重 10 个、主要 5 个、次要 1 个)进行评级,并询问“可以交付吗?”回答问题。最后,与消息来源确认人工智能标记的错误有多少是真实的,有多少是捏造的。

清单

  • [ ] 我运行了自动 QA 并清除了所有形式错误。
  • [ ] 我用方框标记了语言错误(类别+权重)。
  • [ ] 我在单独的优先轮次中扫描了关键错误。
  • [ ] 我采购了人工智能控制,并在必要时使用不同的模型进行了交叉检查。
  • [ ] 我根据数字阈值和我自己的专家判断做出了交付决定。