利益:
- 字幕の技術ルール(セリフ、文字、CPS)を適用し、意味を保ったまま収める能力
- ASR による文字起こしと自動タイムコーディングを高速化しながら、適切な名前と番号のエラーを音声で検証する機能
- 吹き替えにおける視覚的なコンテキスト、音の違い、リップシンクを考慮して人工知能の限界を管理する能力
映画、テレビ シリーズ、企業ビデオ、オンライン コースの翻訳は、プレーン テキストの翻訳とは根本的に異なります。時間、読む速度、画面上の画像、音声、登場人物の唇の動きにも制約があります。この単元では、視聴覚翻訳 (字幕、吹き替え、ナレーション)、字幕の技術ルール、AI サポートの文字起こしとタイム コーディング、およびこの分野の品質上の落とし穴について学びます。 「テキストを翻訳する」のではなく、「視聴者の目と耳にフィットする」視聴覚翻訳の専門家のような仕事を目指しています。
基本的な概念
オーディオビジュアル翻訳 (AVT) は、オーディオとビデオを含むコンテンツの翻訳です。主な形式は、字幕、吹き替え、音声説明です。字幕は、スピーチを文字形式で画面に反映することです。吹き替えとは、元の音声をターゲット言語で再吹き替えすることです。ナレーションとは、元の音声をミュートして、その上に翻訳を読み上げることです (ドキュメンタリーで一般的)。
字幕作成に関する 2 つの重要な技術用語: CPS (Characters Per Second) は、視聴者が快適に読めるように字幕作成の速度を制限します。一般に受け入れられている上限は 1 秒あたり約 17 文字です (子供向けコンテンツの場合はこれより低くなります)。タイムコードは、字幕が画面上にいつ表示され、いつ消えるかを示す開始時間と終了時間です (00:01:23,400 など)。
なぜ難しいのでしょうか?翻訳を字幕に合わせるということですから。 2 行、1 行あたり最大 42 文字、表示時間は最小約 1 秒、最大約 6 秒、CPS 制限。意味とトーンを維持しながら、これらすべてに準拠する必要があります。そのため、字幕の翻訳では、一語一語の翻訳ではなく、圧縮と言い換えが重要になることがよくあります。
ヒント: 字幕で「すべての単語を翻訳する」という反射的な動作は避けてください。視聴者は画像を見たり読んだりします。長すぎる字幕は読めません。意味を保持した最短の自然な表現を見つけることは、キャプション担当者の真の熟練です。
視聴覚翻訳における AI の役割
AI は、この分野のいくつかのステップを大幅にスピードアップします。
- 文字起こし: ASR (自動音声認識) を使用すると、音声が自動的に文字起こしされます。これにより、数分で字幕の生のソースが抽出されます。
- 自動タイム コーディング: ツールは会話をセグメントに分割し、ドラフト タイム コードを生成します。
- 翻訳ドラフト: トランスクリプトのテキストが翻訳されます。
- CPS/長さ制御:AIはどの字幕が読み上げ速度を超えているかをマークし、短縮を提案します。
ただし、注意してください。ASR は、ノイズ、アクセント、重複する音声、固有名、および専門用語に関して誤りを犯します。 「音声説明」を提供することはできません。話している人が混乱するかもしれません。 AI 翻訳は画像を認識しません。画面に表示されたオブジェクトがいつ「あれ」と呼ばれるかを知ることができません。したがって、人間は視覚的なコンテキストと解読の正確さを検証します。
注意: 最もよくある間違いは、ASR 出力が「デコードされている」と考えることです。 ASR は、特に固有名、番号、ブランド名、専門用語などで頻繁に間違いを犯します。不正確な転写は翻訳と字幕に引き継がれます。重要な部分は必ず音声を聞いて確認してください。
字幕形式のルール
共通ルール (プラットフォームによって異なります):
- 1 行あたり最大 37 ~ 42 文字、最大 2 行。
- 継続時間: ~1 ~ 6 秒。非常に短い「フラッシュ」字幕は避けてください。
- CPS は ~17 (アダルト コンテンツ) を超えてはなりません。
- 意味のあるところで文を区切ります (行末に「and」または「but」を残さないでください)。
- できればシーンカット(ショットチェンジ)は飛ばさないでください。
- 暴言、歌、脚本などの項目については、プラットフォームのルールに従ってください。
ミニケース3個
ケース 1 — ASR + ポストエディットにより 60% 高速化されました。チームはまず ASR を使用して 45 分のドキュメンタリーを文字起こししてタイムコーディングし、次に翻訳して後編集しました。ゼロからの文字起こし + コーディングにかかる時間を 60% 削減。ただし、すべての固有名詞と番号は音の比較によって修正されました。
ケース 2 — CPS は保存された可読性をチェックします。字幕付きの説明ビデオの最初の翻訳は正確でしたが、CPS は平均 24 で、視聴者は追いつけませんでした。 AI を利用した短縮ラウンドにより、字幕が 30% 短縮され、CPS が 16 に低下しました。意味が保たれ、読みやすくなりました。
ケース 3 — 視覚的なコンテキスト エラー。 ASR ベースの翻訳では、キャラクターが画面上の標識を指して「それを読んでください」と言った。 AIは「読んでください」と翻訳しましたが、看板の文字は翻訳されていないため、視聴者は何を読めばよいのかわかりませんでした。キャプション担当者は、画面キャプションに別のキャプションを追加しました。画像を見た人が違いを生み出しました。
コピー可能な 4 つのテンプレート
1) 転写 (ASR) 検証リスト:
以下はビデオの自動文字起こしです。転記の際に考えられるエラーをマークします: 固有名、ブランド名、数字、専門用語、曖昧/不完全な文。これらを「音声による確認」としてリストします。翻訳しないでください。転写: [...]
2) 字幕翻訳 (CPS/長さ制限):
次の文字起こしを [ターゲット言語] の字幕に翻訳します。制約: 各サブタイトルは最大 2 行、行最大 42 文字、CPS は最大 17 を超えてはなりません。意味を保ちながら短縮して自然化します。単語ごとに翻訳しないでください。タイムコードを保存します。文字起こし + タイムコード: [...]
3) CPS/可読性チェック:
次の各字幕の長さと文字数に基づいて、おおよその CPS を計算します。 17 を超えるものにマークを付け、意味を維持する短い代替案を提案します。字幕 (テキスト | 再生時間秒): [...]
4) 画面テキスト/視覚的コンテキストのチェック:
次のダイアログで、画像を参照している可能性のある場所 (画面のテキスト、指示されたオブジェクト、標識) をマークします。視聴者が画像を見ることができないことを前提として、これらについて追加の字幕/説明が必要かどうかを述べてください。ダイアログ: [...]
弱いプロンプト / 強いプロンプト
弱者: 「この字幕を翻訳してください。」 (長さ、CPS、行のルールがありません。出力は画面に収まらず、読めません。)
ギュシュル: 「この会話の記録をトルコ語の字幕に翻訳してください。各字幕は最大 2 行、1 行あたり 42 文字にする必要があります。読む速度を高めるために必要な場合は、意味を保ちながら短くしてください。話し言葉は自然なトルコ語で、スラングは柔らかくしてください。タイムコードには触れないでください。」
違い: 強力なプロンプトは、字幕の技術的な制約 (セリフ、文字、CPS、トーン) を与えます。出力は実際に使用可能な字幕に近づきます。
AVTフォーマット比較表
フォーマット
どういうことですか
AIの貢献
人間の臨界点
サブタイトル
スピーチを文字に起こします
ASR、翻訳、CPS
フィット感、視覚的なコンテキスト
ダビング
ターゲット言語でのナレーション
翻訳草案
リップシンク、演技
ナレーション
上の翻訳を読む
翻訳、タイミング
自然な流れ、音色
音声解説
画像を音声で説明します
ドラフトテキスト
視覚的通訳(人間)
よくある間違い
- ASR トランスクリプトを検証せずに翻訳する。固有名/番号のエラーは字幕に引き継がれます。
- 単語ごとに翻訳して CPS を回避します。聴衆は文字を読むことができません。フィット感を作らなければなりません。
- 視覚的なコンテキストを無視します。画面のテキストと指されたオブジェクトは翻訳されないままになります。
- 行分割を無意味にします。可読性が損なわれます。
- トーン/音域を平坦化します。登場人物の方言やスラングが消えます。
吹き替えとリップシンク
字幕の制約は読む速度ですが、吹き替えの制約は時間と口数です。ナレーション翻訳には 3 つの異なるタイプの同期があります。 リップシンク - 翻訳がキャラクターの口の動き、特にクローズアップでの開いた母音に一致する場合。等時性 — 翻訳行は元の行と同じ長さであり、短すぎず長すぎません。ジェスチャーの同期 - 言われた内容とキャラクターの手や腕の動きを一致させます。そのため、吹き替え翻訳者は、意味はそのままに、まったく異なる単語を使用して「キャッチーな」セリフを書くことがよくあります。ここでは言葉の忠実度は字幕よりもさらに劣ります。
AI は、生の翻訳草稿とアフレコの時間警告 (「このセリフはオリジナルより 40% 長いので、短くしてください」) を提供できます。新しいテクノロジーにより、サウンドのクローンを作成し、自動ダビングを生成することもできます。しかし、演技、感情、キャラクターの呼吸や口パクの微調整は、依然として人間の翻訳者と声優の仕事です。自動ダビングでは概要が提供されます。芸術的かつ同期的な決定は人間が行います。さらに、音声のクローンを作成される人の同意は重要な倫理的および法的問題です。
要約すると
視聴覚翻訳は、視聴者の目と耳の制約内にテキストを適合させる技術です。字幕ではセリフ/文字/CPS の境界があり、吹き替えではリップシンクが行われますが、それらすべてにおいて視覚的なコンテキストが決定要因となります。 AI は、ASR による文字起こし、タイムコーディング、翻訳草稿、CPS チェックを高速化します。しかし、ASR は固有名とノイズが間違われ、画像を見ることができず、フィットトーンの決定は人間によって行われます。マスター字幕作成者は一語一語翻訳しません。意味を保持した最も短くて最も自然な表現を見つけます。
アプリケーションタスク
短い (2 ~ 3 分) ビデオ クリップを選択します。 ASR ツールで文字起こしし、「文字起こし検証」テンプレートを使用して音声と危険な部分を比較して修正します。次に、「字幕翻訳」テンプレートを使用して CPS ~17 の制約で翻訳し、制限を超えた字幕を「CPS コントロール」で短縮します。画面テキストや記号がある場合は、「ビジュアルコンテキストチェック」を適用します。
チェックリスト
- [ ] 特定の名前/番号の音声による ASR 復号を確認しました。
- [ ] 字幕はセリフ・文字・CPSルール内に収まるようにしました。
- [ ] 一字一句ではなく、意味を保ったまま短縮して自然化しました。
- [ ] 視覚的なコンテキスト (画面上のテキスト、記号) を考慮しました。
- [ ] 口調と性格の違いを保つために翻訳しました。