ユニット 8 / 11

品質管理 (QA)、評価指標および LQA

利益:

  • 自動 QA レイヤーと言語 LQA レイヤーを区別し、両方を正しい順序で適用する機能
  • MQMなどのエラーフレームワークを使用して、カテゴリと重み(重大/重大/軽度)に従って翻訳を客観的に評価する能力
  • AI を監査役として使用する場合、AI 自身の翻訳に対する盲目さ、間違いのリスク、自動化された指標の限界を理解した上で、最終的な決定を下すことができる

翻訳が「完了」したと言った瞬間、それは作業の半分です。残りの半分は、その翻訳が実際に信頼できることを証明することです。この単元では、自動化された QA チェック、人間ベースの LQA エラー フレームワーク、品質指標、AI を「検査官」として使用する方法、およびその限界など、翻訳の品質を測定する体系的な方法を学びます。 「良いと思う」という主観から脱却し、品質を定義し、測定し、証明する専門家になることを目指します。

2 種類の品質管理: 自動および言語による品質管理

QA (品質保証) は、翻訳において 2 つの層で機能します。

自動QA: CATツールとスクリプトがキャッチする文体エラー - 数値の不一致、スペースの欠落/過剰、一貫性のない用語、未翻訳のセグメント、不正なプレースホルダー/タグ、ダブルスペース、句読点。これらは機械によって迅速かつ完全にスキャンされます。人間の目からは逃れますが、車両がそれを捉えます。

LQA (言語品質保証): これは、人間の評価者が意味、用語、スタイル、文法、および局所的な適切性を検査する層です。自動QA「番号は合っていますか?」質問を見てください。 LQA「意味は正しいか、トーンは適切か、文化的に適切か?」彼は質問を見つめます。この 2 つは互いに補完し合います。一方が他方に置き換わることはありません。

ヒント: 常に最初に自動 QA を実行してください。形式的エラーをクリーンアップすることで、人間の評価者は実際の言語上の問題に注意を集中できるようになります。数値のエラーを気にする査読者は、トーンのエラーを見逃してしまいます。

エラー フレーム: MQM および DQF

標準エラー類型論は、品質を「良い/悪い」ではなく測定可能にするために使用されます。最も一般的なのは MQM (多次元品質メトリクス) です。これは、各エラーをカテゴリ (精度、流暢さ、用語、スタイル、局所性、形式) と重み (クリティカル、メジャー、マイナー) に割り当てます。もう 1 つのフレームワークは DQF (Dynamic Quality Framework) であり、MQM とともに言及されます。

なぜ重要なのでしょうか?このフレームワークを使用すると、翻訳にエラー スコアを付け、さまざまな翻訳者/エンジンを客観的に比較して、「このテキストは配信できるか?」と尋ねることができるからです。数値のしきい値を使用して質問に答えます。例: クリティカルエラー = 10 ポイント、メジャー = 5、マイナー = 1;特定の単語ごとに、特定のしきい値を下回るテキストが合格します。

重大なエラー: 意味を逆転させ、セキュリティ/法的リスクを生み出し、ブランドに損害を与えるエラー (誤った用量、「責任がある」ではなく「責任がない」)。少佐: 破壊的ですが無害です。マイナー: 目立ちますが、意味を損なうことはありません (マイナーなスタイル/句読点)。

AI をコントローラーとして使用する - とその限界

AI は、翻訳をエラー フレームワークと照合して迅速にチェックするのに役立ちます。「この翻訳の正確性、用語、流暢さのエラーを MQM カテゴリでマークする」と言うことができます。死角を減らし、すぐに「第二の目」を得ることができます。

しかし、重大な限界が 3 つあります。(1) AI は、生成した翻訳をチェックするときに盲目になる可能性があり、同じ間違いを犯したり確認したりすることの両方です。別のモデルでクロスチェックするか、ソースに戻ります。 (2) AI は幻覚的な「エラー」をでっち上げることもできます。存在しないエラーを報告します。各警告を確認してください。 (3) AI は重大なエラーの現実世界の重大度を完全に把握できない可能性があります (線量エラーは致命的になる可能性があります)。専門家が重み付けを行います。つまり、AI によって QA は迅速化されますが、最終的な品質の決定と納品の承認は人間が行うことになります。

注意: 「AI は QA に合格しており、クリーンです」と言うのは誤った自信です。 AI 監査は、人間による LQA やソースとの比較に代わるものではありません。それは、彼らに最新情報を提供するための事前スクリーニング層です。

ミニケース3個

ケース 1 — 自動 QA で 40 個の数値エラーが見つかりました。財務レポートの翻訳では、自動 QA により、ソースとターゲットの間で 40 件の数値/形式の不一致 (桁区切り、小数点、通貨) が検出されました。人間の目ではこれらのほとんどを見逃してしまうでしょう。車両が秒単位でリストされます。

ケース 2 — MQM スコアがエンジンの選択につながりました。ある局は、2,000 ワードで 2 つの異なる MT エンジンの出力を MQM 評価しました。エンジン A は 12 エラー ポイント、エンジン B は 31 ポイントでした。客観的な測定により、「どちらが優れているか」という議論はスコアで決着しました。同局はエンジン A を標準とし、それに応じて改正後の予算を計画した。

ケース 3 — AI 監査は自身のミスを見逃しました。翻訳者は、同じ LLM の監督下で LLM の翻訳を行いました。モデルは「問題ありません」と言いましたが、これは彼女自身が用語法を間違えたものです。このエラーは、翻訳者が別のモデルとソースを使用してクロスチェックしたときに判明しました。チームは「同じモデルが自らを制御してはならない」というルールを採用した。

コピー可能な 4 つのテンプレート

1) MQM ベースのエラーチェック:

あなたの役割: LQA 評価者。以下のソースと翻訳を比較してください。見つかった各エラーを次の形式で提供してください: [カテゴリ: 正確さ/用語/流暢さ/スタイル/形式][重要度: 重大/重大/重大] [場所] [コメント] [修正]。不明な警告には「要確認」としてマークを付けてください。出典: [...] |翻訳: [...]

2) 重大なエラーのスキャン (高リスク):

以下の翻訳では、意味の逆転、数値/用量/日付の誤り、否定の喪失、法的義務の置き換え、安全警告の誤りなど、重大な誤りのみを探してください。些細なスタイルの問題は無視してください。それぞれの重要な発見の出典を引用します。出典: [...] |翻訳: [...]

3) 自動 QA 補助制御:

次のソースとターゲットのペアにおける形式的な不一致をリストします: 数値の不一致、プレースホルダーまたはタグの欠落/余分、一貫性のない用語、未翻訳の分節、単位/通貨の違い。場所の問題点だけをあげてください。ペア: [...]

4) 独立した第 2 の目 (クロスチェック):

偏見を持たずにこの翻訳を評価してください。自分が書いたと思わないでください。ソースの忠実度、用語、自然さについて品質評価 (1 ~ 5) を付け、問題の上位 3 つをリストします。それを決めるのは私です。出典: [...] |翻訳: [...]

弱いプロンプト / 強いプロンプト

弱者:「この翻訳は良いですか?」 (基準はありません。AI は「概ね良好」などの役に立たない答えを返します。)

Strong: 「この翻訳をソースと照らし合わせてチェックしてください。各エラーにカテゴリ (精度/用語/流暢さ) と重大度 (重大/重大/軽度) のラベルを付けます。特に数、否定、用語のエラーに注目してください。エラーをでっち上げないでください。確信が持てない場合は、「要確認」とマークしてください。」

違い: 強力なプロンプトではエラー フレームとフォーカスが与えられます。出力は、比較可能な実用的な品質レポートです。

品質レイヤーのテーブル

レイヤー

何が引っかかるのか

誰が/何をするのか

自動QA

番号、ラベル、一貫性

ツール/スクリプト

AI制御

意味/用語の誤りの可能性

LLM(確認あり)

人間の LQA

意味、口調、文化、重み

専門評価者

MQM/DQF スコア

客観的なエラースコア

フレームを持つ人間

配達確認

最終的な責任

有能な翻訳者

よくある間違い

  • 自動化された QA をスキップして、すぐに読んでください。文体の間違いは注意をそらすものです。
  • AI 検査を人間の LQA に置き換えます。 AIが事前に審査し、承認しません。
  • 同じモデルに独自の翻訳をチェックしてもらいます。死角;クロスチェックが必要です。
  • 重み付けエラーではありません。クリティカルとマイナーを同じものとみなすと、優先順位が崩れます。
  • AIが作り上げた「間違い」を確認せずに修正すること。正しい文を歪曲することもできます。

自動メトリクス: BLEU、COMET、および制限

品質測定には自動化されたメトリクスの世界もあります。 BLEU (Bilingual Evaluation Understudy) は、機械翻訳と人による参照翻訳を比較し、単語の重複に基づいて 0 ~ 100 のスコアを与えます。長い間、MT システムを比較するための基準でした。新しいメトリックである COMET はニューラル ネットワーク ベースであり、BLEU よりもセマンティックな類似性をより正確に捕捉します。これらのメトリクスは、ビッグ データ上の 2 つのエンジンを迅速かつ自動的に比較するのに役立ちます。

しかし、その限界は明らかです。BLEU のような指標は単語の重複に注目するものであり、意味を実際には理解していません。参考文献とは異なるが正確な翻訳は、低いスコアを受け取る可能性があります。参考文献に似ているが間違っている翻訳には、高いスコアが与えられる場合があります。重大な否定性エラーは 1 つの単語であるため、メトリクスにはほとんど影響しませんが、実際には致命的です。そのため、自動化されたメトリクスは、個々のテキストの配信可能性を決定するのではなく、システム レベルで傾向を測定します。翻訳がクライアントに届くかどうかは、自動スコアではなく、MQM ベースの人的評価と専門家の判断によって決まります。指標は判断基準ではなく、羅針盤として使用してください。

要約すれば

翻訳の品質は主観的な感覚ではなく、測定可能なものです。自動 QA は正式なエラーを徹底的にスキャンします。人間の LQA は、意味、トーン、文化を評価します。 MQM などのエラー フレームワークは、カテゴリと重み別に品質を定量化し、客観的な比較を可能にします。 AI はこの制御を加速する強力な第 2 の目ですが、AI 自身の翻訳に盲目になったり、間違いを犯したり、現実世界の重みを完全に把握できなかったりする可能性があります。したがって、最終的な品質の決定、重み付け、納品の承認は有能な翻訳者に属します。

アプリケーションタスク

機械翻訳の出力を取得します。最初に「自動 QA 補足チェック」を使用して形式的なエラーをリストし、次に「MQM ベースのエラー チェック」を使用してカテゴリおよび重み別に言語エラーをリストします。各エラー (クリティカル 10、メジャー 5、マイナー 1) を単語ごとのしきい値で評価し、「納品できるか?」と尋ねます。質問に答えてください。最後に、AI によってフラグが付けられたエラーのうち、どれだけが本物で、どれだけが捏造されたものであるかを情報源に確認します。

チェックリスト

  • [ ] 自動 QA を実行し、形式的なエラーをすべてクリーンアップしました。
  • [ ] 言語上の誤りをボックス (カテゴリ + 重み) でマークしました。
  • [ ] 別の優先順位の高いラウンドで重大なエラーをスキャンしました。
  • [ ] AI コントロールを入手し、必要に応じて別のモデルとクロスチェックしました。
  • [ ] 私は数値閾値と私自身の専門家の判断に基づいて配送を決定しました。