ユニット 12 / 12

エンドツーエンド プロジェクト: 人工知能によるアーカイブ コレクションの処理

利益:

  • 倫理審査から出版まで、各段階で人間によるチェックポイントを伴う 7 段階のワークフローでコレクションを処理する能力
  • 早期チェックポイントがエラー (間違った日付/名前) がチェーン全体に伝播するのをどのように防ぐかを理解する
  • マスター ファイルを保存し、検証を節約せず、総合的なプロジェクトで AI の使用を宣言するという原則を適用する能力

これまでの単元では、デジタル化、転写、メタデータ、スキャン、翻訳、検証、パターン分析、検索、保存、倫理といった個人のスキルを取り上げてきました。この最後のユニットはすべてを組み合わせたものです。真のアーカイブ プロジェクトでは、これらのステップが個別に実行されるのではなく、相互に接続されたワークフローとして実行されます。ここでは、AI がサポートしつつ人間が制御するプロセスで、段階的に制御チェーンを使用してコレクションを最初から最後まで処理する方法を見ていきます。

目標は、AI を「あらゆるステップを加速するが、どのステップについても最終決定権を持たない」パートナーとして位置づけることです。この単元を完了すると、乱雑な文書の山を、研究にすぐに使用できる検証済みの倫理的にクリーンなコレクションに変換する総合的な方法が得られます。

シナリオ: 私たちが持っているもの

250 の文書のコレクションを受け取ったとします。いくつかは印刷物 (印刷された通信、広告)、いくつかの原稿 (手紙、ノート)、日付が異なり、一部には機密の個人データが含まれています。目標: このコレクションをデジタル化、転写、カタログ化し、研究者が利用できるようにすること。プロセスを 7 つの段階に分けて見てみましょう。

7 ステップのワークフロー

フェーズ 1 — 評価と倫理スクリーニング。まずはコレクションについて知りましょう。どの文書に機密の個人データが含まれていますか?著作権のステータスは何ですか?文化的な感受性はありますか?このスキャンにより、どのドキュメントをクラウドベースの AI ツールに与えることができ、どのドキュメントが閉鎖/承認された環境でのみ処理されるかが決まります。この段階をスキップすると、プロジェクト全体が倫理的リスクにさらされます。

ステージ 2 — デジタル化。高解像度 (少なくとも 300 ~ 400 DPI、良好なコントラスト) でドキュメントをスキャンします。元の (マスター) ファイルはそのままにしておきます。すべての処理はコピーに対して行われます。

ステージ 3 — テキストの抽出。ハードコピー文書には OCR を適用し、原稿には HTR を適用します。 AI に「安全な校正」命令を使用して生の出力をクリーンアップさせます。光学エラー/認識エラーのみ、内容コメントなし、読めない箇所 [?]。オスマン帝国/写本の代替読書と古学者による管理。

ステージ 4 — メタデータとカタログ作成。ドキュメントごとに標準 (Dublin Core/ISAD(G)) メタデータを作成します。 「存在しないフィールドは空白のままにする」という許可を得ています。トピック用語を管理されたリストにマッピングします。日付と名前を文書で確認します。

ステージ 5 — 強化とパターン化。エンティティ (人/場所/組織) を抽出し、正規化し、関係とタイムラインのアウトラインを作成します。文書内の各パターンを確認します。人為的なつながりや年表はありません。

ステージ 6 — ツールにアクセスします。収集用の捜索援助の概要を作成します。履歴セクションは検証済みのメモのみに基づいて作成してください。アクセス制限(プライバシー/著作権)を明確に示します。

ステージ 7 — 検証、宣言、公開。重要なフィールド (日付、名前、引用、参照) を最後にもう一度確認します。 AIの使用を宣言します。専門家が最終承認を与えます。コレクションは研究のために公開されています。

ヒント: 各段階に「人間によるチェックポイント」を設置します。次の段階に進む前に、専門家が AI の出力を検証します。これらのチェックポイントがないと、最初の段階でのエラー (日付の読み間違い) がチェーン全体に伝播し、最終的にはカタログ、パターン、ガイドに漏れることになります。

コントロールチェーンテーブル

ステージ

AIの仕事

人間のチェックポイント

1. 倫理審査

機密データのマーキング

設置決定

2. デジタル化

(画像補正)

品質、マスター保護

3. テキスト抽出

OCR/HTR + 確実な補正

名前/日付/読み方確認

4. メタデータ

標準ドラフト

フィールド確認、用語マッチング

5. パターン

実体、関係、タイムライン

文書での検証

6. アクセスツール

援助草案を見つける

履歴と制約の承認

7. リリース

最終承認、宣言

ミニケース3個

ケース 1 — チェーンエラーが発生しました。あるプロジェクトのフェーズ 3 では、文書の日付が「1888」ではなく「1868」となっていました。ステージ 3 のチェックポイントでこのエラーが検出されなかった場合、日付はカタログ (4)、タイムライン (5)、ガイド (6) に分散されていたでしょう。チェックポイントのおかげで、バグは 1 か所で修正されました。教訓: 早期にチェックすることで、エラーがチェーンの上に伝播するのを防ぎます。

ケース 2 — 倫理審査によりプロジェクトが救われました。 250 件の文書のうち 18 件には存命人物の機密データが含まれていました。フェーズ 1 の倫理スクリーニングでは、これらにフラグが立てられました。これら 18 の文書は閉鎖環境で処理され、残りは標準ツールを使用して処理されました。スキャンがスキップされ、すべてがクラウドにアップロードされていた場合、重大な侵害になっていたでしょう。教訓: 倫理審査は最初のステップであり、後から追加される修正ではありません。

ケース 3 — 時間と労力。従来の方法を使用すると、250 のドキュメントのコレクションを完全に処理するには約 8 ~ 10 か月かかります。 AI を活用したチェックポイント ワークフローにより、プロセスは約 3 か月に短縮されました。しかし、その節約は「AI がすべてを行った」ことではなく、「AI が機械的な作業を行い、人間による検証に重点を置いた」ことによってもたらされました。検証に費やされる時間は減っていません。機械作業に費やす時間が減少しました。

コピー可能な 4 つのテンプレート

1) プロジェクトの初期計画:

[番号] 個の文書のコレクションがあります: [印刷物と原稿の混合]、[時代]、そのうちのいくつかには機密データが含まれている可能性があります。このコレクションをデジタル化してカタログ化するための 7 ステップのワークフロー プランを作成します。各段階で AI のタスクと人間のチェックポイントを指定します。倫理審査を第一に。

2) 段階移行チェックリスト:

ステージ[ステージ名]を終了しました。次の段階に進む前に確認する必要がある重要な点のチェックリストを作成します。どのような事実 (日付/名前/参照) を確認する必要があるか、どのエラーがチェーンを上流に伝播する可能性があるかなどです。私は最終的な承認を得ています。あなたは私にチェックリストをくれます。

3) エンドツーエンドの品質管理:

以下は、処理されたドキュメントのすべてのレイヤーです: 転写、メタデータ、抽出されたアセット。レイヤー間の図の概念の欠如: 転写された日付はメタデータと一致しますか、エンティティはテキスト内に実際に存在しますか?訂正の賦課;不一致のリストを生成します。レイヤー: [ここ]

4) プロジェクトの終了と宣言:

この収集プロジェクトでは、[リスト] の段階で AI を使用しました。プロジェクト文書の場合: (1) どの段階でどのような AI サポートが使用されたか、(2) 人間による検証はどのように行われたか、(3) どのような制限/制約があるか - これらを含む正直な締めくくりのメモと AI 使用に関する声明の草案を書きます。

弱いプロンプト / 強いプロンプト

弱い:

このコレクションを AI で徹底的に処理し、研究に使える状態にします。

単一の「何でもする」指示は、倫理審査、チェックポイント、検証を回避します。エラーはチェーンに沿って伝播します。

強い:

このコレクションには 7 段階のワークフローを設定し、各段階で人間によるチェックポイントを設けます。第 1 段階を倫理/プライバシー審査とします。各段階で AI によって生成された出力は、次の段階に進む前に検証されます。重要な事実 (日付/名前/参照) をマークします。どの段階においても、AI には最終決定権はありません。

違いは、段階的な構造、倫理の優先順位、チェックポイント、そして「最終決定権は人々にある」という原則により、プロジェクト全体が安全かつ防御可能になるということです。

よくある間違い

  • 倫理審査は最後まで残す。プライバシー/著作権スキャンは最初のステップです。後で追加した場合、違反はすでに発生しています。
  • チェックポイントを回避します。検証されないエラーはチェーン全体に広がります。
  • マスターファイルを保護していません。原本をそのまま保管しておかないと返却できなくなります。
  • 検証の手間を省きます。 AI は機械的な作業を短縮します。検証時間を短くすると品質が低下します。
  • AIの利用を宣言していない。透明性はコレクションの科学的信頼性の一部です。

要約すれば

エンドツーエンドのアーカイブ プロジェクトでは、個人のスキルを一連の制御 (倫理スキャン、デジタル化、テキスト抽出、メタデータ、パターン、検索ツール、出版) に結び付けます。各段階で、AI は機械的な作業を高速化します。各段階で、人間のチェックポイントが最終決定権を持ちます。倫理審査は第 1 段階であり、マスター ファイルは保護され、エラーがチェーンに広がらないように早期に発見され、AI の使用が正直に宣言されます。 AI がすべてを行うことで節約できるのではなく、人間が機械的な作業から解放され、検証に集中することで節約できます。 AIは加速します。人間は歴史の正確さと完全性を保証します。

アプリケーションタスク

小さなコレクション (10 ~ 20 個のドキュメント、独自の資料またはサンプル セット) を選択します。 「プロジェクト始動計画」テンプレートを使用して、7 ステップのワークフローを作成します。このフローで少なくとも 2 つのドキュメント (倫理スキャン、テキスト抽出、メタデータ、パターン レイヤー) を実行します。 「ステージ移行チェックリスト」で各ステージを確認します。最後に、「プロジェクトの終了と声明」テンプレートを使用して AI の使用を文書化します。初期のチェックポイントでどのエラーが検出されたかに注目してください。

チェックリスト

  • [ ] 最初の段階で倫理/プライバシー審査を行いました。
  • [ ] マスターファイルはそのままにしておきました。
  • [ ] 各ステージに人間のチェックポイントを置きました。
  • [ ] 重要な事実がチェーン上に伝播される前に、私はそれを検証しました。
  • [ ] プロジェクトのクロージングでAIの活用を宣言しました。

モジュール試験

1. 歴史とアーカイブにおける人工知能の最も適切な位置付けは何ですか?

  • A) AI は要約、編集、および製図ツールです。コメント、情報源の批判、最終的な責任は専門家に帰属します ✔
  • B) 歴史家のように、人工知能が文書の信頼性と意味を独自に判断できる
  • C) 人工知能はテキストの翻訳にのみ機能し、他のアーカイブタスクとは何の関係もありません
  • D) 人工知能は常に人間よりも公平であるため、歴史の解釈は人工知能に委ねられるべきです。

説明: 人工知能。テキストの編集、スキャン、翻訳、下書きの作成を行うアシスタントです。ソースの批判、解釈、因果関係の確立、および最終的な決定は専門家に属します。検証されていない出力は、ソースの捏造、日付の偽り、または時代錯誤につながる可能性があります。

2. 歴史研究において人工知能が生み出す幻覚とは何ですか?

  • A) 人工知能は文書を非常にゆっくりと処理します。
  • B) 人工知能は、存在しない情報源、引用、またはイベントを本物のように捏造します ✔
  • C) 書類が物理的に破損している
  • D) アーカイブ カタログが最新ではない

説明: 幻覚とは、人工知能が実際には存在しない情報、情報源、引用、または出来事を確信を持って捏造することです。その形は完璧に見えますが、その内容は本物ではありません。したがって、すべての参考カタログでは、すべての引用が元の情報源で検証されなければなりません。

3. OCR 出力を人工知能で修正するための最良のアプローチは何ですか?

  • A) 文章が流暢で美しく、足りない部分を論理的に補完することを求めます。
  • B) コンテキストに基づいてすべての数値と日付を修正できるようにする
  • C) 光学認識エラーのみを修正し、判読できない領域 [?] はそのままにし、番号や日付は変更しないように依頼します ✔
  • D) 生徒に、読めない単語を最も可能性の高い推測で埋めるように依頼します。

説明: OCR 修正の黄金律は、明らかな光学認識エラー (rn から m、l から 1 など) のみを修正することです。テキストの内容を解釈したり完成させたりするものではありません。読めない部分には[?]が付いています。番号と日付は変更されておらず、画像で確認されています。

4. オスマン帝国のテキストに母音が書かれていない単語を読む場合、人工知能に何を尋ねるべきですか?

  • A) 1 回で正確に読み取り、作業をスピードアップします。
  • B) 意味が最も伝わりやすい単語を選択し、空白を埋める
  • C) 読めない部分を自分の一般知識から補完する。
  • D) 決定的な読みを押し付けるのではなく、可能な読みの代替案を提示し、曖昧な領域にマークを付ける ✔

説明: オスマントルコ語では、短母音はほとんど書かれません。たった 1 つの母音と文字の違い (アブルとカブール、ワリとヴァリ) で意味が完全に変わります。したがって、決定的な読み取りを押し付けるのではなく、可能な代替案を尋ね、読み取り不可能な領域を保存し、最終的な決定を古生物学者に委ねるべきです。

5. AI にメタデータのドラフト (カタログ レコード) を作成させる場合、幻覚を防ぐ最も効果的な方法は何ですか?

  • A) ドキュメントにフィールドが含まれていない場合は、そのフィールドを空白のままにする許可を明示的に付与します ✔
  • B) すべてのフィールドに記入し、不完全なままにしないように要求します。
  • C) 日付のない文書の内容に基づいて日付を推定する
  • D) 人工知能による参照コードの生成を許可する

説明: 記入圧力により、AI は文書にない日付や作成者を推測して文書を作成するように強制されます。これに対する最も強力な防御策は、フィールドが文書内にない場合にフィールドを空白のままにする許可を明示的に与えることです。さらに、トピック用語は管理された語彙にマッピングされます。

6. 人工知能によって作成された文書要約は歴史研究においてどのように位置づけられるべきですか?

  • A) 直接引用できる信頼できる証拠として
  • B) 実際のドキュメントに誘導するディスカバリー マップとして。証拠は元の文書から取得されます ✔
  • C) 文書自体を置き換えることができる適切なリソースとして
  • D) 文書に戻ることなく学習に使用できるテキストとして

説明: この概要は発見マップであり、証拠ではありません。この文書には次のようなものがあり、行って見てくださいと書かれています。文書に書かれていることを正確に述べているわけではありません。イベント、引用、データを研究に含める場合は、元の文書からそのまま引用する必要があります。

7. 歴史的文書を翻訳して出版するときに時代錯誤を避ける適切な方法は何ですか?

  • A) すべての期間用語を今日の最も近い用語に置き換えます。
  • B) 文章をできるだけ流暢かつ現代的に伝えること
  • C) 時代のタイトルと機関名は一意のままにし、説明を追加します ✔
  • D) 固有名詞を現在の用法に適応させる

説明: 時代錯誤とは、要素をある時代から別の時代に誤って移すことです。時代のタイトル、機関名、個人名を今日の用語に変更すると、読者はその時代に属さない世界に連れて行かれます。正しい方法は、期間用語を保持し、その横に説明を追加することです。

8. 人工知能によって与えられたアーカイブ参照 (ファンド名、ファイル番号) が本物であることを確認するにはどうすればよいですか?

  • A) 形式が正しいと思われるので、リファレンスを信頼します。
  • B) AI に参照が正しいかどうかを再度尋ねることによって
  • C) 説得力があり詳細であるため、その参考文献を真実として受け入れる
  • D) アーカイブ カタログまたは信頼できる情報源から参照を個人的に見つけて確認する ✔

説明: 人工知能は、形式的には完璧でも、実際には存在しない参照を生成できます。架空の参照は、実際の参照と同じ形式になります。参照が存在することを証明する唯一の方法は、元のソースが存在する場所 (アーカイブ カタログ、ライブラリ) で参照を見つけることです。

9. 人工知能によるパターン分析 (NER、ネットワーク、タイムライン) を実行するときに見つかったパターンはどのように評価されるべきですか?

  • A) 文書内で検証する必要がある仮説として。結果ではなく出発点 ✔
  • B) 検証を必要としない最終的な所見として
  • C) 数値的なものであるため、議論の余地のない客観的事実です。
  • D) 人工知能を発見したため直接研究に投入できる結果として

説明: すべてのパターンは仮説であり、証拠ではありません。実体は情報源にリンクされるべきであり、(同じ人物/場所の)異なるスペルは人間の承認を得て正規化されるべきであり、数値はデータの欠落とサンプリングの偏りについて疑問視されるべきであり、日付のない出来事は年代順に記録されるべきではありません。

10. 検索補助資料の経歴/組織歴セクションに特別な注意が必要なのはなぜですか?

  • A) このセクションは重要ではないため、検証なしで公開できます。
  • B) 人工知能はこのセクションに捏造されたイベント、虚偽の日付、タイトルを追加する可能性があるため、検証された情報源のみに依存する必要があります ✔
  • C) 人工知能は歴史の記述に誤りがないため、安全に使用できます。
  • D) 研究者のみがこのセクションに記入し、アーキビストは興味を持たない

説明: 歴史セクションは、幻覚が最も頻繁に忍び寄る場所です。AI は、人物や組織に関する一般的な情報から流暢なテキストを書きながら、存在しない出来事、偽の日付、でっちあげのタイトルを挿入することができます。このセクションは検証済みの情報源のみに基づいてください。

11. 人工知能は、リファレンス (相談) サービスにおいて研究者の事実に関する質問にどのように答えるべきですか?

  • A) 質問に対する答えは、直接かつ明確な事実として与えられるべきです。
  • B) 信頼できる日付または名前を作成し、研究者に伝えなければなりません。
  • C) 事実を直接提供する代わりに、研究者を関連するコレクションと情報源に誘導する必要があります ✔
  • D) 研究者が情報源に行く必要がないように、完全な答えを提供する必要があります。

説明: レファレンスサービスでは、人工知能は直接的な事実の答えを与えるべきではありませんが、研究者を情報源に誘導する必要があります。なぜなら、人工知能によって与えられる直接の事実に基づく答えは捏造される可能性があり、研究者がそれを情報源と間違える可能性があるからです。 「答えはこれです」ではなく、「このコレクションのこれらの文書を見てください」と言うべきです。

12. 破損した文書画像を人工知能で処理する場合、どの操作が許容され、どの操作が好ましくありませんか?

  • A) 不足部分の補充を含むあらゆる作業は無料です。
  • B) いかなるアクションも取るべきではありません。画像には決して触れてはいけません
  • C) 不足しているセクションを埋めることは、文書を完成させるため、最も価値のあるアクションです。
  • D) コントラスト/ノイズなどの可読性の操作は許容されます。足りない部分を推測で埋めるのは不便です✔

説明: 可読性を向上させるプロセス (コントラスト、照明、ノイズ低減) は、コンテンツを変更しないため許容されます。しかし、欠落している部分や読めない部分を推測で補うことは、文書にないもの、つまり歴史の捏造を生み出す危険性があります。原本は保存され、取引は記録されます。

13. 機密の個人データを含むアーカイブ文書を処理する前に何をする必要がありますか?

  • A) 必要に応じてプライバシー スキャンと匿名化を行うか、非公開/承認されたツールを使用します ✔
  • B) 何も考えずに書類を公共車両に直接アップロードする
  • C) 効率性のためにプライバシーの問題を無視する
  • D) 効率性を理由にアクセス制限を克服する

開示: 生存者を特定する機密データ (健康、宗教、民族、住所) を含む文書をクラウドベースの公開ツールにアップロードすると、重大なプライバシー侵害となる可能性があります。プライバシー スクリーニングを最初に実行し、必要に応じて匿名化または非公開/承認されたツールを使用する必要があります。

14. エンドツーエンドのアーカイブ プロジェクトにおける人間によるチェックポイントの主な目的は何ですか?

  • A) 人工知能の働きが遅くなり、プロジェクトが遅れる
  • B) 1 つのステージでのエラー (間違った日付/名前) が後続のすべてのステージに連鎖するのを防ぐため ✔
  • C) 人間の労働力を増やし、自動化を完全に放棄する
  • D) 人工知能が最終決定権を持っていることを保証する

説明: 各段階で人間によるチェックポイントが行われ、次の段階に進む前に AI の出力が確実に検証されます。これがないと、最初の段階でのエラー (日付の読み間違い) が、カタログ、パターン、ガイドを通じて上流に伝播してしまいます。早期にチェックすることで、エラーが 1 か所で確実に修正されます。

15.人文科学や社会科学における人工知能の使用において、透明性と信頼性には何が必要ですか?

  • A) 人工知能の使用を秘密にし、誰も知らないようにする
  • B) 人工知能によって生成されたすべてのテキストを独自のオリジナルのアイデアとして提示する
  • C) 人工知能の使用を正直に宣言し、その成果物を自分のオリジナル作品として提示しない ✔
  • D) 方法を説明せずに結果だけを共有する

説明: 透明性には、転写、メタデータ、または翻訳が人工知能の助けを借りて作成されたことの記録が含まれます。オリジナリティとは、人工知能によって生成されたコメントを自分のオリジナルのアイデアとして提示しないことを意味します。これは、後続の研究者による検証と学術的誠実のために不可欠です。