ユニット 5 / 11

AI と CAT ツールおよび翻訳メモリ (TM) の統合

利益:

  • 翻訳メモリ (TM)、あいまい一致、分節の概念を理解し、あいまい一致の違いを盲目的にではなく適応させて利用できるようになります。
  • 承認された翻訳のみを TM に作成し、顧客の TM を分離し、TM メンテナンスを実行するという規律を適用する能力
  • CAT 内の MT/LLM 統合でデータの送信先を制御することでプライバシーを保護する機能

専門的な翻訳は、プレーン テキスト エディターではなく、CAT ツールで行われることがほとんどです。この単元では、翻訳の中心となる翻訳メモリ (TM) である CAT ツール、それらが機械翻訳や LLM とどのように連携するか、このエコシステムを効率的かつ安全に使用する方法について学びます。目標は、個々の文ではなくプロジェクト全体を、一貫性があり、迅速かつ追跡可能な方法で管理できる翻訳テクノロジー ユーザーになることです。

基本的な概念

CAT ツール (Computer-Assisted Translation) は、翻訳を文 (セグメント) ごとに整理し、翻訳メモリと用語ベースを接続する専門的なソフトウェア (Trados、memoQ、Phrase、MateCat など) です。ソースとターゲットを並べて表示し、繰り返しをキャッチし、書式を保持します。

TM (翻訳メモリ) は、以前に翻訳した原文と訳文のペアを保存するデータベースです。新しい文が到着したとき、TM 内に類似の文があれば、エージェントはそれを提案します。ここでの重要な概念はあいまい一致です。つまり、新しい文と TM 内の文の類似性 (100% = まったく同じ、85% = ほぼ類似) です。一致率が高いと、以前の翻訳を再利用するため、作業がスピードアップします。

セグメントは翻訳の基本単位であり、通常は文です。 CAT ツールはテキストをセグメントに分割し、それぞれを個別に編集します。

TM の重要性: MT は未加工のドラフトを作成しますが、TM は承認された人間による品質の過去の翻訳を返します。この 2 つは異なります。MT は予測、TM は記憶です。

ヒント: TM と MT を混同しないでください。 100% TM 一致 (以前に承認された翻訳) は、一般的に信頼できます。 MT の推奨事項は常に検証する必要があります。 CAT ツールでは、2 つが異なる色/ラベルで表示されます。常にこの違いを確認してください。

MT と LLM の CAT への統合

最新の CAT ツールは、内部で MT エンジンと LLM を呼び出すことが増えています。TM 内に一致がない場合、エージェントは自動的にそのセグメントに対する MT 推奨を返します。それを後編集します (つまり、CAT の MTPE フロー)。最新世代のツールには LLM も統合されており、「このセグメントをこの口調で書き直す」、「この用語を用語ベースに修正する」などの操作をツール内で実行できます。

この統合の利点: TM、用語ベース、MT、LLM が 1 つの画面に統合されています。各文について、「最初に TM を見て、それ以外の場合は MT を提案し、自動的に用語 QA を実行する」というフローが確立されます。欠点と注意点: データはどこに行くのか?クラウドベースの MT/LLM 統合により、テキストを外部サーバーに送信できます。機密業務の場合、これは契約違反となる可能性があります。車両がどのエンジンに接続され、どのデータ ポリシーが適用されているかを必ず把握してください。

翻訳メモリのフィードとクリア

TM の価値は、TM 内の翻訳の品質と同じくらい重要です。ゴミが入って、ゴミが出る。 2 つの分野:

  1. 認証された翻訳をTMに書くだけです。生の MT 出力を検証せずに TM に保存すると、それは不良な「メモリ」として今後のジョブに戻ってきます。
  2. TM メンテナンスを実行します。時間の経過とともに条件が変化し、エラーが発生します。 TM を定期的に清掃し、摩耗したペアや間違ったペアを修正します。この作業では、LLM を使用して「これらの TM ペアに矛盾や用語の偏りはありますか?」と尋ねています。監査役としてもご利用いただけます。
注意: ある顧客の TM を別の顧客のビジネスで使用することは、機密保持の違反であり、用語の混乱の危険性もあります。 TM はクライアント/プロジェクトごとに分けて保管されます。 「すべて TM」が混在すると、機密性と品質の両方が破壊されます。

ミニケース3個

ケース 1 — TM はリプレイを飛ばしました。あるメーカーは、マニュアルの 70% が毎年同じままである製品ファミリーを翻訳していました。 TM のおかげで、すべての新しいバージョンで 100% および高度なあいまい一致が自動的に実現されました。 30,000 ワードの作品のうち、実際に新訳されたのは 9,000 ワードのみです。時間とコストが 3 分の 1 に削減されました。

ケース 2 — Dirty TM によってエラーが伝播されました。あるチームは、生の MT 出力を検証せずに TM に保存していました。 1 年後、同じ誤訳が何度も再発し、100% 一致として「信頼できる」ように見えました。このエラーは 14 の異なる文書に広がっていました。チームは「TM のみへの認定翻訳」ルールと清掃ツアーを制定しました。

ケース 3 — 統合中に機密が漏洩した。翻訳者は、クラウド MT に自動的に接続された CAT プロジェクトで機密作業を行いました。テキストは、データ ポリシーが不明瞭な外部エンジンに送信されました。極秘プロジェクトの MT 統合は一旦無効になり、「データを保存/トレーニングしない」エンタープライズ エンジンのみが使用されるようになりました。

コピー可能な 4 つのテンプレート

1) ファジー一致評価 (LLM へ):

以下は、新しい原文、TM の類似文、およびその承認済みの翻訳です。 TM 翻訳を新しい文に適合させるために何を変更する必要があるかを正確に教えてください。不必要な変更を提案しないでください。意味の違いを明確に示します。新しいソース: [...] | TM ソース: [...] | TM 翻訳: [...]

2) TM の一貫性チェック:

以下は TM からのソースとターゲットのペアです。同じまたは非常に類似した原文が別々に翻訳されている不一致や用語の逸脱をマークします。問題を列挙してみましょう。カップル: [...]

3) セグメントトーン書き換え (CAT の LLM):

次の訳文を意味を変えずに[希望の音]にしてください。用語のリストに従ってください: [...]。番号と名前を保管してください。書き換えられたセグメントのみをエクスポートします。セグメント: [...]

4) プライバシー/統合の事前チェック:

CAT プロジェクトで MT/LLM 統合を使用します。このプロジェクトのテキストの種類について説明します。このテキストをクラウドベースの外部エンジンに送信することが適切かどうか、プロバイダーにどのような質問 (データ保持、トレーニング、場所) を尋ねるべきかを教えてください。テキストの種類/プライバシー ステータス: [...]

弱いプロンプト / 強いプロンプト

弱者: 「TM の翻訳を使用してください。」 (一致率と何を適応させるかは不明です。ブラインド コピーではエラーが発生します。)

Strong: 「この新しい文は 90% の確率で TM の文と一致します。TM の翻訳に基づいて構築されていますが、この違いを反映しています。ソースには 'monthly' ではなく 'annual' があるため、'monthly' ではなく 'annual' にする必要があります。それ以外は何も変更しないでください。」

違い: 強力なプロンプトが一致の違いを正確に示します。ファジーマッチングで最もよくある間違いである「古い翻訳をそのままにする」ことを防ぎます。

CAT エコシステム コンポーネントの表

コンポーネント

どういうことですか

AIとの関係

TM (翻訳メモリ)

承認された過去の翻訳を返却します

信頼できる; MT に先行する

用語ベース

用語の一貫性を確保

これは LLM へのプロンプトとして与えられます

MT推奨

空のセグメントへの生のスケッチ

事後編集する必要がある

LLM の統合

口調/用語/リライト

管理され、プライバシーに配慮

QAモジュール

スキャン番号/用語/タグエラー

自動制御

よくある間違い

  • ファジーマッチを盲目的に受け入れます。 85% 一致すると、意味の 15% の違いが隠蔽される可能性があります。
  • 生の MT 出力を TM に書き込みます。 Dirty TM はエラーを将来に持ち越し、増殖させます。
  • 顧客/プロジェクトの TM の混合。機密保持と用語の混同のリスク。
  • 統合データがどこに行くかわからない。隠し文字が気づかないうちに漏れてしまう場合があります。
  • TMとMTの違いを忘れています。 MT は推定値です。 TMは思い出です。この 2 つは同じように安全というわけではありません。

事前翻訳と位置合わせ

2つの先進的なCAT機能でAI時代のワークフローをさらに加速します。 1 つ目は事前翻訳です。プロジェクトの開始時に、ツールはすべてのセグメントに TM と MT を自動的に入力します。空のファイルの代わりに、100% 一致が承認され、あいまい一致が適応を待機し、空のファイルが MT ドラフトであるファイルから開始します。これにより、仕事が「ゼロから書く」から「レビューと編集」に変わりますが、翻訳前を盲目的に承認するのではなく、各セグメントを評価する必要があります。

2 つ目は位置合わせです。以前に翻訳されたものの TM に入っていないソースとターゲットのドキュメントのペアがある場合、位置合わせツールはそれらをセグメントごとに照合し、TM に変換します。こうして、あなたの過去の翻訳が「記憶」に追加されます。位置合わせの際の注意: 自動マッチングは常に正しいとは限りません。 1 つのセグメントがずれると、全体のアライメントが乱れます。 TM を実行する前に整列したペアを確認することで、そもそもダーティな TM のリスクを回避できます。これら 2 つの機能により、現在の資産 (過去の翻訳) が将来のビジネスへの投資に変わります。

要約すると

CAT ツール。翻訳メモリ、用語ベース、機械翻訳、LLM を 1 つの生産ラインに統合します。 TM は、承認された過去の翻訳を取得し、反復的なタスクを高速に実行できるメモリです。 MT は常に検証が必要な予測です。知識のあるユーザーは、あいまい一致の差異を注意深く調整し、承認された翻訳のみを TM に書き込み、顧客の TM を分離し、統合内のデータの保存先を把握することでプライバシーを保護します。

アプリケーションタスク

CAT ツールで小さなプロジェクトをセットアップします (無料のオンライン CAT も機能します)。用語ベースと空の TM を追加します。 10 文のテキストを翻訳し、承認された翻訳を TM に保存します。次に、最初のテキストによく似た 2 番目のテキストを翻訳し、TM から返されたあいまい一致を「あいまい一致評価」テンプレートに適合させます。盲目的にTMを受け入れた場合、どれだけの文章を間違えるかに注目してください。

チェックリスト

  • [ ] TM と用語ベースをプロジェクトに接続しました。
  • [ ] ファジーマッチの違いを盲目的にではなく適応的に使用しました。
  • [ ] 私が検証した認定翻訳のみを TM に書きました。
  • [ ] 顧客とプロジェクトの TM を分けておきました。
  • [ ] MT/LLM 統合でデータがどこに行くのかを確認しました。