ユニット 3 / 11

文字起こしとオーディオ/ビデオ分析: インタビューからテキストへ、テキストからニュースへ

利益:

  • 自動音声認識 (ASR) を使用して生のトランスクリプトを作成し、タイムスタンプと話者の識別の検証に使用する機能
  • ニュースに含まれるすべての引用を逐語的に検証し、固有名、数字、専門用語などの誤りが多い領域を優先するという規律を適用する能力。
  • 記録は生の草稿であり、引用は修正せずにそのまま保存する必要があり、機密記録では最初から機密性を考慮する必要があることを理解する能力。

記者にとって最も価値があるが、最も消耗する素材の 1 つは音声です。インタビューの録音、記者会見、電話での会話、議会の公聴会、生放送のアーカイブなどです。経験豊富な人でも、1 時間の会話を手書きで書き写すのに 4 ~ 6 時間かかります (業界用語でのトランスクリプション)。音声を自動的にテキストに変換する人工知能ベースの自動音声認識 (ASR) テクノロジーにより、この時間が数分に短縮されます。しかし、トランスクリプトは粗雑な草稿です。名前、専門用語、重複するスピーチ、騒々しい文章などはすべて間違っている可能性があります。したがって、ルールは変わりません。AI が生のトランスクリプトを生成します。引用が録音と正確に一致しているか、誰が何を言ったか、そして文脈が正確に一致しているかを検証するのはジャーナリストです。空気中に入るあらゆる倒置文は、音声と比較されなければニュースになりません。

ステップバイステップ: 音声から信頼できる見積もりまで

ステップ 1 — 録音を準備し、プライバシーを考慮します。オーディオ ファイルにソースを示す名前が含まれている場合、またはソースを保護する必要がある場合は、ファイルがどのツールにアップロードされるかに注意してください。機密性の高い記録の場合は、データ セキュリティを備えたオフライン ソリューションまたは企業ソリューションが推奨されます。録音が許可されていることを確認してください (一部の録音には法的な制限があります)。

ステップ 2 — 生のトランスクリプトを取得します。 ASR ツールを使用して音声をテキストに変換します。可能であれば、タイムスタンプ (各文が話された分数) と日記 (誰がどの文を言ったかを区別する) をオンにします。これらにより検証が非常に高速になります。

ステップ 3 — 高エラー領域をマークします。固有名、機関名、数字、外国語、2 人が同時に話す場所などは、間違いが最も多く発生する領域です。これらを優先チェックリストに入れてください。

ステップ 4 — 見積もりと録音を比較します。タイムスタンプに移動して音声を聞いて、ニュースに含める各文を逐語的に確認します。単語を 1 つ変更するだけでも、意味や法的責任が変わる可能性があります。

ステップ 5 — AI を使用して概要とテーマを抽出します (別のジョブ)。トランスクリプトがクリーンアップされたら、AI に「主要なテーマ」、「ニュース価値のある文章」、「矛盾」などの草稿出力を依頼できます。ただし、これらは方向性を提供するものであり、引用の置き換えではありません。

注意: 自動デコードでは、単語が簡単に置き換えられます。「私たちはしませんでした」が「私たちはしました」に、ある名詞が別の名詞に置き換えられます。引用符で囲んだ文章を音声を聞かずに放送しないでください。虚偽の見積もりは倫理違反であり、免責事項/訴訟の原因となります。

精度に影響を与える要因

転写の品質。録音品質(マイク、ノイズ、エコー)、話者の数、アクセント、方言、専門用語、音声の重なりによって異なります。電話の録音や混雑した環境では、最も多くのエラーが発生します。したがって、「ツールの精度は 95% です」などの表現に安心しないでください。残りの 5% は、名前や数字など、ニュースにとって最も重要な場所に含まれている可能性があります。

ミニケース3個

ケース 1 — 変更される唯一の単語。記者は「この主張は検証できない」という当局者の発言を自動的に文字に起こした。記録には「検証できる」と書かれていたが、意味は逆だった。レポーターはタイムスタンプを聞いて修正しました。もしこの一言の間違いが訂正されていなかったら、そのニュースは当局者に彼が言っていないことを言わせていただろう。

ケース 2 — 時間の増加、議会のセッション。 5 時間のセッション記録を手動でデコードするには、最大 25 時間かかります。 ASR は生のテキストを 40 分で抽出しました。話者の分離とタイムスタンプのおかげで、記者は 3 人の重要な話者の 20 分間の一節だけを聞いて検証することができました。合計時間は約 4 時間に短縮されました。

ケース 3 — 専門用語の間違い。保健記者は、専門家とのインタビューで言及された薬物の名前が記録内でスペルが間違っていることに気づきました。似たような別の薬と混合されていました。彼は専門家に短いメッセージでそれを確認させた。間違った薬剤名が公表された場合、それは誤った情報となり、健康に危険を及ぼします。

コピー可能なテンプレート

1) 生のトランスクリプトからチェックリストを抽出します。

以下は自動転写です。 (1) 固有名詞と機関名、(2) 番号と日付、(3) 外国語・専門用語、(4) 文の意味が不明瞭な箇所に印を付けます。これらは記録前に検証されます。テキストを修正してください。チェックリストを作成するだけです。転写: [ここ]

2) 講演者とテーマの概要 (清書されたトランスクリプトより):

以下の検証済みトランスクリプトを使用してください。 (1) 各話者のアナテーゼを一文に要約します。 (2) ニュース価値のある 5 つの文章にタイムスタンプを付けます。 (3) 発言者間の矛盾点を列挙します。見積書の作成;彼らの位置を示すだけです。転写: [ここ]

3) 引用候補抽出(検証予定):

このトランスクリプトからニュースに適した短い引用候補を 8 つ選択します。それぞれのタイムスタンプ [12:04] と発言者を書き込みます。引用符を短縮または編集します。記録から確認できるように、そのままコピーします。転写: [ここ]

4) うるさい/不明瞭な通路標識:

次のトランスクリプト内で、「[あいまい]」、「...」、または意味が欠如している箇所を列挙してください。それぞれのタイムスタンプを書き留めて、その部分をもう一度聞くことができるようにします。空白を推測で埋めてください。転写: [ここ]

弱いプロンプト / 強いプロンプト

弱いプロンプト: 「このインタビューを要約して、最良の引用を引き出してください。」

結果: AI は書き起こしの間違いを正しいとみなして、引用を「美化」し、文を短縮し、変更します。いつ失われたと言われているかは確認できません。

強力なプロンプト: 「このトランスクリプトから 8 つの引用候補を正確に (一字一句) 抽出し、それぞれにタイムスタンプと発言者を追加します。修正したり短縮したりしないでください。不明瞭なものについては別のリストを作成して、録音から聞くことができるようにしてください。」

違い: 強力なプロンプトにより、引用の変更が禁止され、タイムスタンプによって検証可能になり、曖昧な部分が分離されます。ジャーナリストはすべての引用を音声で確認できます。

比較表

特徴

それは何をするのですか?

検証効果

自動復号化 (ASR)

音声をテキストに変換します

生のドラフト。すべて確認が必要です

タイムスタンプ

文の分を返します

見積もりをすぐに見つけて聞く

スピーカーの分離

誰が言うかは別として

虚偽の帰属を防止(要確認)

自動要約

ドラフトのテーマ

それは方向性を与えます。引用は置き換えられません

自動翻訳(上書き)

外国の記録を翻訳します

二重過失のリスク。二重認証

よくある間違い

  • 聞かずに引用文を投稿する。転写された文が正しいと考えて引用符で囲んで使用する。たった一つの単語の間違いで意味が逆転してしまう可能性があります。
  • 信頼できる名前と番号。固有名、機関、数字こそが間違いが最も起こりやすい場所であることを忘れています。
  • AIに見積もりを「修正」してもらう。文をより流動的にするために変更する。引用は逐語的に行う必要があり、修正箇所は角括弧内に示されています。
  • 機密レコードを無計画にロードします。録音を制御されていない車両に送信して、ソースを配布したり、許可なく送信したりすること。
  • 話者差別を盲目的に信頼する。 AI は 2 人を混乱させる可能性があります。音声から重要な帰属を確認します。

文字起こしの品質を向上させるための実践的なヒント

転写の正確さは、作業の開始時、つまり録音時に決定されます。現場に出た記者は、いくつかの簡単な習慣でAIの仕事を楽にし、検証の負担を減らすことができる。マイクを話者の近くに移動し、風や交通などの背景ノイズを低減すると、エラー率が大幅に減少します。話者に交代を依頼することで、音声の重複(文字起こしの最大の弱点)を防ぐことができます。インタビューの初めに話者に名前と役職を言ってもらうと、話者の特定とその後の帰属の両方が容易になります。技術的なトピックについて議論する場合、頻繁に使用される一般的な名前や用語のリストを作成しておくと、転記時に最も起こりやすい間違いを事前に知ることができます。録音でこれらの用語を聞いたら、まず確認します。

2 番目の方法: トランスクリプトを生の形式でアーカイブし、修正されたバージョンを別に保管します。異議申し立てや法的手続きが発生した場合、どの単語がいつ、どのように修正されたかを示すことができれば、ジャーナリストは保護されます。また、検証する各見積の横にあるタイムスタンプをメモしておくと、数か月後にその見積に戻る必要があるときに検索にかかる時間を節約できます。トランスクリプトがクリーンアップされ、タイムスタンプを使用して整理されると、同じ記録をニュース記事、コラム、および次のフォローアップ記事の両方で安全に何度も使用できます。

要約すると

自動文字起こしは、生の音声素材を数時間から数分に短縮する強力なアクセラレータです。タイムスタンプと話者の分離により検証が容易になります。しかし、文字起こしは青写真です。名前、数字、専門用語、重複した音声はうまくいかないことがよくあります。ニュースに含まれるすべての引用は、録音をそのまま聞くことによって検証されます。引用文はAIでは修正できません。要約とテーマの抽出は別のタスクであり、方向性を示すだけです。機密記録では、プライバシーと同意が最初から考慮されます。

アプリケーションタスク

音声録音 (自分のインタビューまたは公共の場でのスピーチ) を自動的に文字に起こします。 「引用候補の削除」プロンプトを使用して 8 つの候補を取得します。タイムスタンプからそれぞれを聞き、それが正確に正しいかどうかをマークします。エラー (特に名前や数字) を含む引用符の数と、修正にかかる時間に注意してください。

チェックリスト

  • [ ] 私はこの記録を生の草稿だと考えています。意見を聞かずに引用を公開することはありません。
  • [ ] まず記録から個人名、機関、番号を確認します。
  • [ ] 引用文は修正されません。変更点を角括弧で示します。
  • [ ] 検証にはタイムスタンプと話者の区別を使用します。
  • [ ] 機密性または許可が必要な記録で、安全な車両と許可状況をチェックします。