ユニット 2 / 11

調査報道におけるデータ分析: 大量の文書をニュースに変える

利益:

  • 人工知能を使用してデータセットを探索し、ニュース価値のある質問を生成し、機密データを抽出する機能
  • 人工知能に計算をさせる代わりに、監査可能なツールでメソッドを記述して実行し、生データから各結果を検証する習慣を身につけます。
  • 外れ値を草案し、アーカイブ関係を文書化し、元の情報源で確認するのがジャーナリストの責任であることを理解する。

調査報道は多くの場合、数千行の入札スプレッドシート、数百ページの貸借対照表、漏洩した電子メール アーカイブ、オープンソースの公的支出セットなどの山から始まります。データジャーナリズム、つまり数値データや文書データからパターン、異常、関係を見つけてニュースにする実践は、まさにこの大量のデータを理解する仕事です。手動で調べるには人間の一生がかかるこれらの山では、人工知能 (AI) が最初のスクリーニングおよびアイデア生成の強力なツールです。表を要約したり、テキスト アーカイブ内の重複する名前を抽出したり、分析のために尋ねるべき質問を提案したり、データのクリーニング手順を説明したりすることができます。しかし、最初から一文だけ言っておきましょう。AI はデータ分析のパートナーです。結果の正確性とニュース価値を判断し、生データから数値を再検討するのはジャーナリストです。幻覚のリスクは、数字上、ここで最も危険です。

ステップバイステップ: AI を使用してデータセットを探索する

ステップ 1 — データを理解します。まず、列、行数、日付範囲、単位を理解します。 RAW ファイルを AI にロードする前に、それが何であるかを自分で理解してください。そうしないと、AIの「発見」は宙に浮いたままになってしまいます。

ステップ 2 — 機密データを抽出します。個人データ(名前、TR ID、住所、健康状態)が含まれる場合は、公開AIツールに渡さず匿名化するか、分析対象の列のみを送信します。出所を明らかにする漏洩文書の痕跡も除去されます (1 号機と 10 号機)。

ステップ 3 — AI を使用して発見用の質問を生成します。 「このデータセットにはどんなニュースが隠されているのでしょうか?」と言って始めてください。 AI は、上位 10 品目、リピートサプライヤー、異常なジャンプ、空白の領域など、尋ねるべき質問のリストを作成します。

ステップ 4 — AI に分析を行わせるのではなく、説明します。ここが重要なポイントです。 AIが頭の中で計算する平均やパーセンテージは間違っていることがよくあります。代わりに、信頼できるツール (スプレッドシートの数式、クエリ、スクリプト) で実行する手順を AI に尋ねます。したがって、微積分を監査可能なツールにし、AI は単に方法を提供するだけです。

ステップ 5 — 結果を確認します。 AI が指摘するあらゆる異常を、生のラインに戻って確認します。テーブルをフィルターし、「この会社は 40 件の入札のうち 31 件を獲得した」という主張を数えます。未確認の数字はニュースにはなりません。

ステップ 6 — コンテキストを確立します。数字だけではニュースになりません。比較(昨年、同様の機関、人口比)、背景、専門家の意見はジャーナリストの仕事です。

注意: AI に「この表の平均を計算してください」と言わせ、その結果を直接ニュースに掲載することは、データ ジャーナリズムで最も一般的な免責事項を生み出す間違いです。 AI は言語モデルであり、計算機ではありません。ツールに計算を行わせ、AI に方法と解釈を求めるだけです。

メタデータとドキュメントの分析

調査報道では、数値表のほかに、電子メール、議事録、契約書などの大規模なテキスト アーカイブも扱われます。ここでは、AI が「誰がいつ誰と話したか」「どの話題が繰り返されるか」「どの名前が一緒に言及されるか」などの関係マップを作成できます。繰り返しますが、ルールは同じです。AI が初期マップを提供します。 AI は存在しないリンクを説得力を持って説明できるため、すべてのリンクは元の文書で確認されます。

ミニケース3個

ケース 1 — 隠れた結露。記者は 2,400 行の公共調達スプレッドシートを持っていました。彼は AI に探索的な質問を作成させました。 「同じサプライヤーが何件入札を受けましたか?」という質問。が前面に出てきました。記者はAIにこれを計算させたわけではない。彼は YZ 自身が提案したスプレッドシートの計算式を実行したところ、1 つの企業が 2,400 品目のうち 380 (15.8%) を受け取ったことがわかりました。彼はそれを手動で確認しましたが、番号は正しかったです。 AI の最初の「推定」は 22% だったので、もし AI が信頼されるなら、そのニュースは間違っていることになります。

ケース 2 — 時間を節約し、電子メールをアーカイブします。 6,000 件のメールのアーカイブから「どんなトピックが起こっているのか」を手動で検索するには数日かかります。 AI は 15 分でトピック クラスターの概要を作成しました。記者はこれらの中から、有望なクラスターを 3 つ選択し、元のメールを読みました。合計の検出時間は最大 3 日間に短縮されましたが、公開されたすべての見積もりは元の電子メールから逐語的に検証されました。

ケース 3 — 幻覚が捉えられました。経済記者はYZから貸借対照表から「人件費が1年間で6割増加した」という概要を受け取った。生のテーブルに戻ったとき、増加が 6% であり、AI が 1 桁読み間違えていたことがわかりました。 1 回のファクト チェックで、「60% 爆発」などの誤った大げさな見出しは阻止されました。

コピー可能なテンプレート

1) データセットの認識と発見に関する質問:

データセットの列見出しと最初の 20 行を示します。このデータを使用して実行できる 10 個のジャーナリスティックな質問を生成します: 集中、異常値、時間のジャンプ、欠落/空白領域、繰り返し登場人物の観点から。数値計算はありません。どの質問が尋ねる価値があるのか、そしてなぜそれがニュースになるのかを書くだけです。データ: [見出し + サンプル行]

2) 計算は行わず、次のことを記述させます。

次のような分析を行いたいと考えています。各サプライヤーの入札総額とシェア率を調べます]。これをスプレッドシートで自分で実行したいと考えています。どの式/ピボット設定をインストールするかを段階的に書いてください。 SEN の計算結果。メソッドを指定するだけです。私の列: [列名]

3) 外れ値ハンティング:

以下に要約統計量 (最小値、最大値、平均値、中央値) を示します。どの値が異常/疑わしいのか、またニュースとしてそれらをチェックする必要がある理由を説明します。最終的な判断を下さないでください。チェックリストは「次の行を手動でチェックする必要があります」という形式で表示されます。概要: [こちら]

4) 文書アーカイブ関係図(案):

書類テキスト一式をお渡しします。以下を下書きとして出力します: 頻繁に一緒に出現する名前、繰り返し現れるトピック、注目すべき日付。 [B12] のように、各リンクの元のドキュメントにマークを付けます。文書に明示的に書かれていない関係は追加しないでください。ドキュメント: [ここ]

弱いプロンプト / 強いプロンプト

弱いプロンプト: 「このグラフを分析して、重要な結果があれば述べてください。」

結果: AI はパーセンテージと平均を真正面から計算し、異常を想像しますが、どのラインに基づいているかは不明です。検証できません。

強力なプロンプト: 「この表の列と最初の 20 行を指定します。(1) ニュース価値がある可能性のある分析をリストします。(2) 実行できるように、各分析のスプレッドシート式を提案します。(3) 結果は一切計算しません。(4) [S45] のように、チェックする行にマークを付けます。」

違い: 強力なプロンプトは計算を制御可能なツールに任せ、AI を方法と方向の役割に限定します。幻覚が数字に漏れるのを防ぎます。

比較表

ステージ

AIはそうする

ジャーナリストはそうする

検証

データの認識

コラム・パターンまとめ

単位と文脈を理解している

ソースデータディクショナリ

発見の質問

質問のリストを生成します

ニュース価値を選択します

計算

方法を説明します

車両内でフォーミュラを実行します

手動プロビジョニング

外れ値

候補者にマークを付ける

生のラインを見てください

フィルターとカウント

コメント/コンテキスト

ドラフトフレーム

比較、専門家

2番目の情報源

よくある間違い

  • AIに計算させる。 AIに平均、割合、合計などを計算させ、その結果を利用する。 AI は頻繁に間違いを犯すので、車両に計算をさせます。
  • 調査結果を生の線に結び付けていない。表をフィルタリングしたり集計したりせずに、「この会社はほとんどの入札で落札した」という主張を書きます。
  • 文脈なしに数字を公開する。比較や比率を伴わずにそのままの数字を報告することは誤解を招きます。
  • 機密データをそのままアップロードします。車両を清掃せずに、個人データまたは情報源を明らかにする文書を車両に提供する。
  • 偽りの関係を真実だと思い込む。 AIがアーカイブ内で「見た」リンクを、元の文書で確認せずに地図に処理します。

要約すれば

データ ジャーナリズムにおいて、AI は発見と洞察のパートナーです。AI は山をスキャンし、尋ねるべき質問を生成し、分析方法を説明し、外れ値の候補にフラグを立てます。しかし、AI に数値そのものを計算させるのは最も危険な間違いです。計算を監査可能なツールに委託し、生データに戻って各結果を検証し、数値にコンテキストと比較を追加します。文書アーカイブでは、AI が開始マップを提供します。各リンクはオリジナルの文書で確認されています。

アプリケーションタスク

あなたが持っている(または公開されている)データセットを使用します。まず、「探索の質問」プロンプトで 10 個の質問を生成してもらいます。質問を選択し、「計算の説明」プロンプトで AI から式を取得し、自分で実行します。次に、AI に同じ計算を直接依頼し、2 つの結果を比較します。違いとその教訓に注目してください。

チェックリスト

  • [ ] データをツールに渡す前に、列、単位、機密フィールドを理解しました。
  • [ ] AI に計算をさせません。メソッドを説明し、監査可能なツールで実行します。
  • [ ] 生の行に戻って、各結果を手動で検証します。
  • [ ] 数値に比較とコンテキストを追加します。単純な数字を報告しているわけではありません。
  • [ ] 私はアーカイブ内のすべての関係を元の文書で確認します。