ユニット 8 / 12

コンテンツ分析とパターン発見

利益:

  • NER、関係性抽出、タイムライン、ネットワーク分析などの技術を使用して、大規模なテキストのセットからパターンを抽出する機能
  • パターンを証拠ではなく仮説として見ることができ、エンティティをソースに関連付け、人間の承認を得て正規化することができます。
  • データの欠落やサンプリングのバイアスにより数値がどのように誤解を招く可能性があるかを理解し、不自然な関係や年表を回避する能力。

歴史研究は単に個々の文書を読むだけではありません。多くの場合、大規模なドキュメントのセットからパターンを探します。特定の名前は長年にわたってどのような文脈で登場するのでしょうか?集落に関係しているのは誰ですか?時間の経過とともにトピックはどのように変化するのでしょうか?誰が誰と対応しているのでしょうか?このような質問をするには、単一の文書ではなく、何百もの文書をまとめて調べる必要があります。これはデジタル人文科学と呼ばれることが多く、歴史や文学などの分野への計算手法の応用です。

AI は、大量のテキストのセットから構造化された情報を抽出するのに強力です。この単元では、NER (固有表現認識)、パターンと関係の抽出、トピック モデリング ロジック、およびタイムラインの作成について学びます。しかし、これらの手法の最も危険な落とし穴、つまり、AI が存在しないパターンを「見つけた」かのように見せかけることについても説明します。

基本テクニック

  • NER (Named Entity Recognition): テキストから人、場所、機関、日付などのエンティティを自動抽出します。 「これら 500 件の文書に記載されているすべての地名」のようなリストを数分で作成します。
  • 関係の推論: エンティティ間の関係をマークします (「場所 Y にいる人 X」、「A は B に対応します」)。
  • トピック モデリング: 大量のテキスト セット内で繰り返し発生するトピックのクラスターを統計的に見つけます。どの時期にどのテーマが集中しているかを示します。
  • タイムライン推論: 文書内の日付の付いたイベントを時系列に並べます。
  • ネットワーク分析:人や組織間の関係をネットワークとして可視化する(誰が中心で、誰が接続点になるか)。

これらすべてに共通の目標は、単一の文書には現れず、コレクション全体に現れる構造を明らかにすることです。これらのテクニックにより、読書だけでは決して見えないパターンが目に見えるようになります。しかし、それらはそれぞれ「兆候」であって「証拠」ではありません。元の文書に何が記載されているかを確認することが重要です。

この分野で頻繁に使用される概念は、精読(テキストを一行ずつ深く読む)と遠読(数百、数千のテキストをまとめて統計的に見る)の区別です。 AI により、リモートでの読み取りが可能になります。つまり、人間の一生分に相当する大きさのコーパスのパターンが表示されます。しかし、遠読みがパターンを示している場合、それを理解するには、近読み、つまり元の文書に戻る必要があります。 2 つの方法には互換性はありません。 1 つはパターンを示し、もう 1 つはその意味を示します。最も堅牢な研究では、両方を併用します。

ヒント: 仮説生成手段としてパターン分析を使用します。「AI はここにパターンを発見しました。これは本物ですか?」次に、ドキュメント内のそのパターンを 1 つずつ確認します。パターンは研究の出発点であり、結果ではありません。

ワークフロー: ステップバイステップ

1. 質問を明確にします。 「このコレクションで最も頻繁に一緒に登場するのは誰ですか?」みたいな明確なパターンの質問。

2. データを準備してラベルを付けます。ソース参照を使用してテキストを整理し、見つかったアセットをドキュメントにリンクできるようにします。

3. エンティティ/パターンが表示されます。 AI を使用して NER、関係性、またはタイムラインのアウトラインを生成します。

4. 正規化します。同じ人物/場所の異なるスペルを組み合わせます (「Istanbul / Istanbul / Kostantiniyye」同じ場所ですか?)。このステップは重要です。省略するとパターンが崩れてしまいます。

5. 文書で確認します。実際のドキュメントで、フラグが立てられた重要なパターンがないか確認してください。 AI がでっち上げのリンクを追加しないようにしてください。

6. コメントします。パターンが何を意味するかは歴史家の判断です。 AIはパターンをマークするだけです。

数値と統計のトラップ

パターン分析では、「名前 X は 47 回出現する」、「このテーマは文書の 30% に存在する」などの数値が得られることがよくあります。これらの数字は客観的であるように見えますが、誤解を招く可能性があります。

  • データの欠落: コレクションがすでに不完全である場合 (文書が紛失しており、グループが記録されていない場合)、数値は現実ではなく、生き残っている文書を反映しています。
  • 正規化エラー: 同じ人物のスペルが異なっていて別々にカウントされると、数値が不正確になります。
  • 文脈の喪失: 「47 回発生」では何も語られません。どのように渡されるか(肯定的/否定的、主語/目的語)が重要です。

パターン出力

明らかな意味

本当のリスク

「Xは47回出現する」

大切な人

不完全なコレクション、スペルのバリエーション

「テーマ30%」

支配的なトピック

サンプリングバイアス

「A-Bはよく一緒にいる」

親密な関係

偶然、文脈の欠如

「タイムライン」

正確な年表

日付のない文書、捏造された注文書

ミニケース3個

ケース 1 — ネットワーク分析により、隠れた仲介者が判明しました。研究者は800通の手紙からなる通信コレクションを調べた。 AIで誰が誰に書いたかを判断してネットワークを構築。ネットワークは、一見すると重要ではないように見える人物が、実際には 2 つのグループ間の重要な連絡先であることを示しました。研究者はこの人物の手紙に注目し、新たな発見に達した。ただし、最初にドキュメント内のすべてのリンクを確認しました。

ケース 2 — 正規化エラーにより数値が破損しました。ある生徒は、文書にその場所が登場する回数を数えさせました。 AIは同じ場所の3つの異なる綴りを別々に数えたため、その数は実際の数の3分の1であることが判明しました。綴りを組み合わせると、place は実際に 3 番目に頻繁に出現する位置になりました。教訓: 正規化しないと数値は信頼できません。

ケース 3 — でっち上げられたタイムライン。研究者は日付のない文書から年表を作成しました。 AIは未知の出来事を「論理的」な順序で整理し、正確な年表を提示した。しかし、この一連の流れは資料にはなく、AIが作り上げたものだった。教訓: タイムラインは、文書内に日付があるイベントのみから構築されます。残りは「日付なし」のままです。

コピー可能な 4 つのテンプレート

1) NER (エンティティ推論):

以下の文書に記載されている人物、場所、機関、日付は別のリストとして表示されます。各エンティティがどの文書 (参照) に記載されているかを示します。本文に明確に記載されている内容のみを取り上げてください。推測で追加します。発音がわからない場合は[?]をマークしてください。ドキュメント: [ここ]

2) エンティティの正規化:

以下の実体リストでは、同じ人物/場所である可能性のある異なるスペルをグループ化します (例: "Istanbul / Kostantiniyye")。各グループに可能な共通フォーマットを提案しますが、正確な組み合わせを強制するものではありません。 「おそらく同じかもしれないので、人々に確認してもらいましょう」という注記を追加します。よくわからない場合は放っておいてください。リスト: [ここ]

3) 関係/ネットワークの概要:

以下の一連の通信/文書から「誰が誰に関係しているか」リンクを抽出します。各リンクについて、どの文書(参照)に基づいているかを示します。文書に明確に記載されていない関係をでっち上げた。曖昧なリンクを [不明瞭] としてマークします。ドキュメント: [ここ]

4) 日付付きタイムライン:

以下の文書に明確に記載されている出来事のみを時系列順にリストします。すべてのイベントをそのソースにリンクします。日付が不確かなイベントは「日付なし」という見出しの下に個別にリストし、順番に並べないでください。予定日をでっちあげないでください。ドキュメント: [ここ]

弱いプロンプト / 強いプロンプト

弱い:

これらの文書を分析し、重要なパターン、関係、タイムラインを抽出します。

「重要なパターンの抽出」により、AI は存在しないつながりと正確な年表を発明し、正規化せずに数値を提示します。

強い:

それぞれを文書参照に接続することにより、次の文書から人、場所、機関のエンティティを抽出します。異なるスペルが同じである可能性があるが「マージされる可能性がある」とマークしますが、マージしません。文書に明確に記載されていない関係や日付が不確かな出来事は捏造してはなりません。日付のないものは別にしてください。ドキュメント: [ここ]

違い: 情報源への帰属、正規化を人間に任せること、架空のつながりや歴史の禁止、日付のない出来事の分離により、パターンは擁護可能になります。

よくある間違い

  • パターンを証拠と間違える。パターンは仮説です。文書で確認されています。
  • 正規化をスキップします。同じエンティティのスペルが異なると、番号とネットワークが歪められます。
  • 数字を盲目的に信頼する。不完全な収集とサンプリングの偏りにより、数値が誤解を招くことになります。
  • 作り上げたタイムライン。日付のないイベントは年表には含まれません。
  • 文脈を無視する。 「何回合格したか」ではなく、「どのように合格したか」が重要なのです。

要約すれば

コンテンツ分析とパターン発見は、エンティティ抽出、関係ネットワーク、トピック クラスター、タイムラインなど、読むだけでは見えない構造を AI が可視化する強力な分野です。しかし、すべてのパターンは仮説であり、証拠ではありません。アセットをソースにリンクし、人間による検証を使用して慎重に正規化し、欠落データや偏りについて数値を照会し、不自然な関係や年表を避けます。 AI がパターンをマークします。それが何を意味するか、そしてそれが真実かどうかは歴史家の判断です。

アプリケーションタスク

少なくとも 15 個のドキュメント (参考文献を含む) を収集します。 「NER」テンプレートを使用して人物を抽出し、エンティティを配置します。次に、「エンティティの正規化」を使用して異なるスペルをグループ化し、グループを自分で確認します。最後に、「日付付きタイムライン」テンプレートを実行して、「日付なし」のままのイベントの数を確認します。 AI が不十分なプロンプトを使用して作成したリンクや年表の数を比較してください。

チェックリスト

  • [ ] 私はパターンの質問を明確に定義しました。
  • [ ] 各エンティティをドキュメント参照にリンクしました。
  • [ ] エンティティの型指定を正規化し、それを人間の承認と組み合わせました。
  • [ ] 私はデータの欠落と偏りについて数値に疑問を抱きました。
  • [ ] 私は日付のない出来事を年表にまとめず、別々に保管しました。