ユニット 4 / 11

文字起こしと字幕作成: Speech to Text と多言語字幕作成

利益:

  • 自動文字起こしと話者分離の概念を理解し、生の録音をタイムコード化されたテキストに変換する能力
  • 字幕フォーマット(SRT/VTT)、読み上げ速度、行規則を理解し、多言語字幕ドラフトを作成および編集できる能力
  • 出版前に自動転写の用語、固有名、句読点の間違い、翻訳の間違いを確認するのは編集者の責任であることを理解します。

ポストプロダクションで最も退屈で時間のかかる作業は伝統的に文字起こしでした。編集者は何時間ものインタビュー映像を延々と聞き、各文を手書きで入力していました。 1 時間の録音であれば、書き起こすのに軽く 4 ~ 5 時間かかります。人工知能はこのビジネスを根本的に変えました。今日では、1 時間の録音を数分でタイムコード付きのテキストに変換できます。これにより、編集パイプラインが高速化され、アクセシビリティ (聴覚障害のある視聴者向けの字幕やサイレント視聴) が可能になります。しかし、自動出力は、そのままの形式で出版するのには決して適していません。この単元では、その威力と落とし穴の両方を見ていきます。

まずは用語から始めましょう。文字起こしとは、音声を文字に起こすことです。自動音声認識 (ASR) は、音声をテキストに変換するテクノロジーです。タイムコードは、テキストがビデオ内の何秒に対応するかを示す記号です。話者ダイアライゼーションとは、「誰が話したか」を区別し、テキストを話者ごとに分割することです。サブタイトル (字幕/キャプション) は、画面に表示されるタイムコード化されたテキストです。 SRT と VTT は最も一般的な字幕ファイル形式です。これらには、各行の順序、開始時間と終了時間、テキストが含まれています。読み取り速度 (CPS: 1 秒あたりの文字数) によって、視聴者が字幕を快適に読むために画面上に行がどれだけ長く留まる必要があるかが決まります。

自動文字起こしの威力と限界

AI 文字起こしは、適切なトルコ語で録音されたクリアな 1 人の話者の音声を非常に高い精度で文字に起こします。ただし、次のような状況では間違いが発生します。これらを知っておくと、固有名 (人名、ブランド、場所の綴りがよく間違えられる)、専門用語と略語、似た発音の単語 (「kar/kar」、「still/still」)、重複する音声 (同時に 2 人)、背景雑音と音楽、方言/アクセントの違い、句読点 (質問または文末) などを対象に検証することができます。さらに、モデルは騒がしい瞬間に一度も話されたことのない単語を「聞いて」文字に起こすことがあります。これは文字起こしの幻覚です。

次の表は、自動転写の強い条件と弱い条件をまとめたものです。

状態

精度

編集者の焦点

シングルスピーカー、クリアなサウンド、静かな環境

非常に高い

固有名詞、句読点

マルチスピーカーパネル

中程度

話者の分離、音声の重複

騒音・屋外での録音

低~中

造語、ジャンプ

技術/専門用語の内容

中程度

用語と略語の書き方

なまりのある話し方

変数

単語の間違い、意味

字幕の形式と可読性のルール

優れたサブタイトルは、単なる「正しいテキスト」ではありません。読み取れる必要があります。国際的な慣行にはいくつかの経験則があります。通常、字幕の行は 2 行以内である必要があります。各行は適切な長さ (約 37 ~ 42 文字) に保つ必要があります。字幕は読める程度に十分な時間画面上に表示されている必要があります (通常は 1 ~ 6 秒)。読む速度は速すぎてはなりません (ほとんどのガイドでは、1 秒あたり 15 ~ 17 文字が限界だと考えられています)。 AI ツールは字幕を自動的に分割しますが、この分割によって文章が不適切な場所 (「と」で終わる行、意味を分割する改行) でカットされる場合があります。編集者の仕事は、テキストを正確かつ流暢にすることです。

あなたの役割: 字幕編集アシスタント。以下は自動転写です。タスク:1) SRT ロジックに従ってテキストを字幕ブロックに分割します。2) 各ブロックは最大 2 行にする必要があり、各行は ~40 文字を超えてはなりません。3) 意味のある場所で文を分割します。 「and」、「but」、「that」で終わる行。4) 手動で確認できるように、固有名詞や用語を [CHECK] タグでマークします。5) テキストは変更せず、分割してマークするだけです。

このプロンプトの「[CONTROL] タグ」というアイデアは貴重です。AI に不確実または危険な領域 (固有名、用語) をマークさせることで、編集者の目を適切な場所に導き、盲目的な信頼を防ぐことができます。

多言語字幕と翻訳

ビデオを複数の言語に公開すると、視聴者が増加します。 AI はトランスクリプトを取得し、ターゲット言語に翻訳して、字幕ファイルを生成できます。これは強力な機能ですが、最も脆弱です。機械翻訳は、慣用句、文化的参照、ユーモアや駄洒落、用語、文脈を誤って伝える可能性があります。 「猫と犬の雨が降っている」という文を一字一句翻訳するのは大変なことです。字幕翻訳にはスペースの制約もあります。ターゲット言語の文が長くなり、読む速度を超える場合があります。そのため、多言語字幕では、ターゲット言語を知っている人に翻訳を確認してもらうことが不可欠です。特にブランディング、法律、健康などの機密性の高いコンテンツの場合、誤った翻訳は重大な結果を招く可能性があります。

次のトルコ語の字幕ブロックを英語に翻訳してください。ルール: - 慣用句やジョークをそのままではなく、意味を保ったまま転送します。 - ブランド名と製品名は翻訳せず、そのままにしておきます。 - 各ブロックの読み取り速度を維持します。必要に応じて短くしてください。ただし、意味を歪めないでください。 - [翻訳者のメモ] で、不明な文化的参照や用語を指定します。

ミニケース3個

ケース 1 — 加速ライン。ドキュメンタリー制作スタッフは 3 週間を費やして、12 時間に及ぶインタビューのアーカイブを手書きで書き起こしました。自動文字起こしを使用すると、生のテキストが 1 日で出力されました。テキストで (単語ごとに) 検索することで、チームは必要な瞬間を数秒で見つけました。その後、使用する 40 分のエピソードのみを注意深く編集し、字幕を付けました。 3週間が4日間になりました。使用セクションに焦点を当てた検証作業が行われました。

ケース 2 — 造語。ニュースチャンネルは、騒々しい街頭インタビューをチェックもせずに自動字幕付きで放送した。モデルは背景の鼻歌の中で暗黙の言葉を「聞いて」、キャプションはその暗黙の言葉をインタビュー対象者に伝えました。 SNS上で反響があり、訂正が掲載されました。教訓: 騒音の多い録音では、自動字幕を元の音声と比較する必要があります。

ケース 3 — 翻訳の惨事。あるブランドが、自社のプロモーション ビデオの英語字幕を、機械翻訳を使用して制御なしで公開しました。トルコ語の慣用句(「目を離さないでください」)を一語一語翻訳したところ、英語の視聴者にとっては無意味で滑稽にさえ映り、ブランドの真剣さが損なわれてしまいました。正しい方法: ターゲット言語を知っている人に翻訳を検証してもらうことです。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

このビデオに字幕を付けて英語に翻訳してください。

書式設定、可読性ルール、検証マークはありません。出力は粗雑で危険です。

強力なプロンプト:

あなたの役割: バイリンガル字幕編集者。入力: トルコ語のタイムコード付きトランスクリプト。タスク: 1) トルコ語字幕を 2 行 / ~ 40 文字 / 適切な分割ルールで編集します。2) [コントロール] で固有名と用語をマークします。3) 英語翻訳を別途作成します。フレーズを文字通りに転送し、ブランド名を保持します。4) 読み取り速度を超えるブロックには [LONG] のマークを付けます。5) 造語は使用しないでください。不定音[UNNDICATED]と書きます。

よくある間違い

  • 制御なしで自動トランスクリプトを公開します。固有名詞、用語、句読点、造語などの誤りが残っています。
  • 行分割が不良です。 「そして/しかし/き」で終わる行は読みにくくなります。
  • 読み取り速度を超えています。画面上で短すぎる長い字幕は読むことができません。
  • 機械翻訳は検証していません。慣用句、ジョーク、用語が間違っていると、ブランドに損害が生じます。
  • 話者の区別をバイパスします。パネル内で「誰が何を言ったか」が混乱していると、サブタイトルが誤解を招くことになります。
ヒント: トランスクリプトを編集している間、ビデオを 1.25 ~ 1.5 の速度で視聴し、字幕と同期していることを確認してください。こうすることで、タイムコードのドリフトと造語/欠落した単語の両方をすぐに把握できます。
注意: 医療、法律、金融などの分野では、誤って転写された単一の単語 (投与量、成分番号など) が重大な結果をもたらす可能性があります。これらの内容では、各数値と用語を個別に確認する必要があります。

要約すると

自動文字起こしと字幕作成はポストプロダクションの時間を最大に節約し、アクセシビリティを可能にします。 AI により、何時間もの文字起こしが数分に短縮され、テキストによる検索が可能になります。ただし、出力はそのままの形式で出版するには適していません。固有名詞、用語、句読点、造語、不適切な改行は修正する必要があります。読みやすさのルール (行の長さ、長さ、読む速度) により、テキストは閲覧者にとって流暢なものになります。多言語字幕では、機械翻訳はターゲット言語を知っている人によって検証される必要があります。 AIが注いで提案します。正確さ、読みやすさ、意味は編集者の責任です。

アプリケーションタスク

短い会話を録音し (自分の声、2 ~ 3 分など)、自動的に文字に起こします。出力を元の音声と比較し、固有名詞、用語、句読点のエラーにフラグを立てます。少なくとも 5 つのエラーを見つけます。次に、テキストを上記のルールに従って字幕ブロックに分割し、1 つの言語に翻訳し、翻訳中の少なくとも 2 つの危険な点 (熟語/用語) を修正します。プロセスと見つけたエラーを報告します。

チェックリスト

  • [ ] トランスクリプトを元の音声と比較し、固有名詞/用語/句読点の間違いを修正しましたか?
  • [ ] 造語や省略された単語がないか確認しましたか?
  • [ ] 行の長さ、長さ、読む速度のルールに従って字幕を編集しましたか?
  • [ ] 多言語字幕の場合、ターゲット言語を知っている人に翻訳を注意深く確認しましたか?
  • [ ] 機密コンテンツに含まれる各数字と用語を個別に確認しましたか?