ユニット 1 / 12

歴史とアーカイブにおける人工知能の概要: 役割、境界、検証、倫理

利益:

  • リスクのレベルに応じて、人工知能が歴史およびアーカイブ作業(転写、編集、スキャン、下書き)の時間を節約する部分と、解釈、情報源の批判、および最終決定が専門家に委ねられる部分を区別できるようになります。
  • 各出力をソースに接続し、相互確認し、時代錯誤をフィルタリングすることにより、幻覚に対して検証規律を適用する能力。
  • 歴史やアーカイブ資料において、なぜ機密保持、著作権、文化的配慮が最初から考慮されなければならないのかを理解する。

歴史家やアーキビストが机に座っていると、多くの場合、彼の前には黄ばんだノート、マイクロフィルム化された新聞、数千枚のデジタル写真、手書きの手紙、公式通信、土地記録などの巨大な山が置かれています。この山を読み、整理し、定義し、理解するのは何年もかかる作業です。人工知能 (略して AI。パターンを学習し、大量のテキストや画像からテキストを生成および分類するコンピューター システム) は、この作業の機械的で反復的な部分を大幅にスピードアップできます。しかし、まさに歴史やアーカイブのような、証拠、情報源、正確性に依存する分野では、AI がどこに役立ち、どこに危険があるのか​​を最初から知っておく必要があります。

このユニットはモジュール全体の羅針盤です。ここでは、AI が歴史とアーカイブ作業のどの部分で時間を節約するか、人間の専門家の判断が不可欠な部分、すべての出力が検証されなければならない理由、およびこの分野の具体的な倫理的境界について説明します。

AI を正しく配置する: 意思決定者ではなくアシスタント

最も基本的なルールは次のとおりです。AI はアシスタントであり、歴史家やアーキビストではありません。 AI;これは、ドキュメントの転記、コレクションの要約、テキストの翻訳、コレクションのメタデータの提案、およびパターンのフラグ付けを行うクイック ヘルパーです。しかし、「この文書は本物なのか」、「この出来事は何を意味するのか」、「この情報源は信頼できるのか」、「このコレクションはどのように整理すべきか」など、判断、解釈、責任を必要とする決定は専門家に属します。

この違いを表で明確にしましょう。

業種

AIは強力ですか?

誰の責任ですか?

印刷されたテキストをマシンテキストに変換する (OCR)

はい、とても速いです

人間は正しい

原稿転写草案

部分的には誤差が大きい

人々は間違いなくそれを修正します

数千の文書を要約/スキャン

はい

人間は根源に辿り着く

メタデータ(日付、場所、件名)の概要

はい

人間が承認する

文書の信頼性を判断する

いいえ

専門家のみ

歴史の解釈と原因と結果の確立

いいえ

歴史家のみ

情報源の信頼性を評価する

いいえ

専門家のみ

この状況を一言で要約すると、AI がデータを準備し、専門家が意味を理解して意思決定を下します。

なぜ検証が重要なのか:幻覚と時代錯誤

人文科学や社会科学での AI 使用の最大の危険は幻覚です。幻覚とは、AI が実際には存在しない情報、情報源、引用を自信を持って捏造することです。 AIは、「わかりません」と言う代わりに、信じられそうなでっち上げた答えで空白を埋める傾向があります。歴史において、これは致命的です。存在しない文書への言及、捏造された歴史、実際には話されていない言葉、起こっていない出来事です。

2 番目の大きな危険は時代錯誤です。時代錯誤とは、ある時代の要素(言葉、制度、技術、概念)を別の時代に誤って配置することです。 AI は現在の言語と概念でトレーニングされているため、現在のレンズを通して過去を説明したり、存在しない制度や用語を過去に移し替えたりする傾向があります。たとえば、16 世紀の文書を要約するとき、当時存在しなかったタイトルや行政単位を使用することがあります。

注意: AI が生成するすべての日付、名前、番号、引用、出典は、ユーザーが独自に検証するまでは事実ではなく主張です。 「AIがそう言った」は歴史学の情報源ではありません。それは、あなたを本当の情報源に導く手がかりにすぎません。

検証規律: 3 つのステップ

このモジュール全体で繰り返す検証習慣を提案してみましょう。

1. ソースに接続します。 AI に関するすべての主な主張は、元の文書、アーカイブされた参考文献、または信頼できる出版物に基づいてください。出典のない主張は使用しないでください。

2. 相互確認。重要な事実 (日付、名前、イベント) については、少なくとも 2 つの独立した情報源を参照してください。 AIの概要は実際の文書に記載されている内容と同じですか?

3. 時代錯誤と一貫性をフィルタリングします。出力に期間に合わない用語、不可能な日付、一貫性のない名前はありませんか? 「今の時期に合っていますか?」と聞いてみましょう。専門家の視点から。

ミニケース3個

ケース 1 — 捏造されたアーカイブ参照。大学院生が AI に、あるテーマに関する「アーカイブ ソース」を求めました。 YZ は、ファンド名、ファイル番号、日付という形式が完璧であると思われる 6 つのアーカイブ参照を返しました。学生がアーカイブカタログを検索したところ、6 件の参考文献のうち 4 件がまったく存在しないことがわかりました。残りの2つは番号が間違っていました。教訓: AI によって生成されたリファレンスは、カタログでの検証なしには使用できません。

ケース 2 — OCR により 40 時間が 6 時間に短縮されました。市のアーカイブでは、1950 年から 1970 年にかけて印刷された市議会議事録 3,200 ページがデジタル化されました。手動による書き換えには 40 営業日かかると見積もられていました。 OCR を使用すると、生のテキストが数分で出力されます。スタッフは 6 営業日以内にテキストを修正し、確認しました。 AI により機械的な作業は 85% 削減されましたが、最終的な読み取りと編集は引き続き人間に委ねられました。

ケース 3 — 時代錯誤的な要約。アーキビストは YZ に 18 世紀の財団の記録を要約するよう依頼しました。要約は流暢でしたが、文書には登場せず、時代にも属さない現代の行政用語が使用されていました。もしアーキビストがオリジナルの文書を調べていなかったら、この時代錯誤はカタログの記録に記録されていたでしょう。教訓: 要約は常に主要文書と比較されます。

コピー可能な 4 つのテンプレート

1) 役割と境界を決定する開口部:

あなたの役割: 歴史とアーカイブで働くアシスタント。タスクには、テキストの編集、アウトラインの作成、パターンのマーキングが含まれます。厳格なルール: (1) 私があなたに与えたテキストのみに依存し、あなた自身の「記憶」からの事実、日付、情報源を追加しないでください。 (2) わからない場合は、でっち上げずに「不明」と記入してください。 (3) 出典のない主張は行わないでください。理解できましたら確認してからテキストをお渡しします。

2) 幻覚防止指導:

以下に本文を要約します。ルール: テキスト内で明確に言及されていない名前、日付、場所、数字を追加しないでください。本文にない「おそらく」情報も追加しないでください。本文に記載がない場合は「本文に記載なし」と記載してください。テキスト: [ここ]

3) 時代錯誤チェック:

以下の[用語]論文の要約草案を確認してください。この期間に属さない可能性のある用語、制度、タイトル、概念にフラグを立てます。それぞれについて、なぜ疑わしいのかを簡単に書きます。最終的な判断を下さないでください。人間の専門家がチェックすべき点のみをリストします。草案: [ここ]

4) ソースクレームパーサー:

次のテキストの各文を、(A) ソースに直接記載された事実、(B) 解釈/推論の 2 つのカテゴリに分類します。また、出典が不明瞭な発言には「要検証」とマークを付けます。テキスト: [ここ]

弱いプロンプト / 強いプロンプト

弱い:

このオスマン帝国の文書について教えてください。

このプロンプトは、AI に自身の「記憶」に基づいて話すよう促し、捏造された詳細と時代錯誤を追加します。

強い:

あなたの役割は歴史アシスタントです。文書のみに基づいて、以下にトランスクリプトを貼り付けました。(1) 文書で言及されている人物、場所、日付を列挙します。(2) 文書の種類は推測できますが、「よくわかりません」と言ってください。(3) 本文にない情報を追加します。(4) 疑わしい/読めない領域には [?] を付けます。ドキュメント: [ここ]

違いは明らかです。役割、単一ソースへの依存、製造の禁止、曖昧さへのフラグの許可、明確な出力構造により、出力の信頼性が高まります。

倫理、プライバシー、文化的配慮

歴史とアーカイブの資料は、無害なテキストの山ではありません。これには、人々の個人データ (民事記録、健康ファイル、裁判所文書)、地域社会の機密の記憶、著作権で保護された作品、および文化的に機密性の高い資料が含まれる場合があります。いくつかの原則:

  • プライバシー: 存命人物を特定できる機密文書 (個人データ) を公開 AI ツールにアップロードすることは、法律と倫理の両方に違反する可能性があります。所属機関のデータポリシーと関連する法律を遵守してください。
  • 著作権: デジタル化したすべての文書がパブリック ドメインになるわけではありません。 AI に権利を与える前に、権利を検討してください。
  • 文化的配慮: コミュニティによっては、歴史資料がどのように使用されるかについて発言権を持っています。 AI の「効率的な」提案は、コミュニティの感性を無視することはできません。
  • 透明性: AI によって生成された文字起こしまたはメタデータが AI の助けを借りて生成されたことを記録します。これは、後続の研究者が検証できるようにするために必要です。
ヒント: クラウドベースの AI ツールにドキュメントをアップロードする前に、「このドキュメントの内容がインターネット上に公開されたら誰が被害を受けるでしょうか?」という質問を 1 つしてください。答えが「誰もない」の場合は、まず企業の承認を得て安全なツールを探してください。

よくある間違い

  • AIを歴史家と間違える。 AIは解釈したり判断したりしません。彼らは準備ができています。その意味と責任はあなたにあります。
  • 出力を検証せずに使用する。すべての日付、名前、引用、参照はクレームです。情報源によって確認されるまでは事実ではありません。
  • 捏造された情報源に依存している。 AI は、信頼できるが存在しない参考文献を生成できます。カタログ内で検索してください。
  • 時代錯誤を見逃します。現在の言語で過去を説明する出力を、時代の観点からフィルタリングします。
  • 機密文書を無計画にアップロードする。個人データ、著作権、文化的配慮を最初から考慮してください。

要約すると

歴史とアーカイブにおいて、AI は機械的で反復的な作業 (転記、編集、スキャン、メタデータの作成) を大幅にスピードアップする強力なアシスタントです。しかし、まさにこの証拠の分野において、幻覚と時代錯誤が本当の危険である。各出力をソース、相互検証、期間フィルターにリンクします。解釈、決定、最終的な責任は常に自分自身で行ってください。初日からプライバシー、著作権、文化的配慮を遵守してください。この分野により、AI は歴史研究を遅らせるのではなく、加速するツールになります。

アプリケーションタスク

印刷物またはデジタルのいずれかで所有している歴史的文書を選択します。まずは「開口部設定役割と境界」テンプレートでAIを配置します。次に、文書を要約してもらうときに「幻覚防止指導」を使用します。出力に「source-claim parser」のタグを付け、「検証が必要」とマークされた各ステートメントを実際の文書と比較します。 AI によって追加または歪められたポイントの数に注目してください。

チェックリスト

  • [ ] 私は AI を意思決定者としてではなく、アシスタントとして位置づけました。
  • [ ] 私が与えたソースに基づいてほしかっただけです。
  • [ ] 私はそれぞれの日付、名前、参照を独自に検証しました。
  • [ ] 時代錯誤がないか出力をフィルタリングしました。
  • [ ] 私は機密文書における機密保持、著作権、文化的配慮を観察してきました。