ユニット 6 / 11

デジタルアーカイブ、デジタル化、OCR、長期保存

利益:

  • スキャンしたドキュメントを OCR および HTR でテキストに変換し、出力を実際の画像と比較することで修正する機能
  • アーカイブ文書の原本性と完全性を保持し、AI による内容の変更や復元の捏造を防ぐ機能
  • 出所情報と耐久性のあるフォーマットを使用して長期的なデジタル保存を計画する能力

アーキビストは、50 年前の新聞、手書きの手紙、古い写真などを未来に運ぶ任務を負っています。これらの文書は時間の経過とともに消耗します。文書を保存し、アクセスできるようにするために、デジタル化が行われます。これは、物理文書をスキャンしてデジタル コピーに変換する行為です。しかし、スクリーニングだけでは十分ではありません。デジタル オブジェクトは、長期にわたって検索可能、読み取り可能、保守可能でなければなりません。この単元では、デジタル化、転写、デジタル保存のワークフローで人工知能を使用する方法を学びます。しかし、なぜ自分が独創性と正確さに対して責任を負うのかを学ぶことになるでしょう。

いくつかの概念。 OCR (光学文字認識) は、文書の画像内のテキストを機械編集可能なテキストに変換するテクノロジーです。 HTR (手書きテキスト認識) は手書きの文書に対して同じ仕事をしますが、はるかに困難です。デジタル保存は、ファイル形式が古くなりソフトウェアが変更された場合でも、デジタル オブジェクトを数十年にわたって読み取り可能な状態に保つための計画的な取り組みです。 AI は、3 つの分野すべてにおいて強力ではありますが、欠陥のあるアシスタントです。

ステップバイステップ: デジタル化から保存まで

1. 優先順位を付ける。すべてを一度にデジタル化することはできません。最も壊れやすく、最もリクエストが多く、最もユニークなドキュメントが最初に配置されます。これは司法判断です。 AIはリストの編集を支援しますが、優先順位は教育機関が決定します。

2. スキャンして OCR/HTR を適用します。高解像度でドキュメントをスキャンし、OCR または HTR を使用してテキストを抽出します。ここでは、古くて難しいテキストであっても、AI ベースのツールがますます改良されています。

3. テキストを修正して確認します。 OCR/HTR 出力は決して完璧ではありません。特に古い文章、汚れたページ、または原稿がある場合、間違いはよくあります。出力を実際の画像と比較し、修正することが重要です。

4. メタデータと保護情報を追加します。デジタル オブジェクトに、その出所、スキャン条件、フォーマット情報、出所、つまり文書がどこから来たのか、どのように処理されたのかを追加します。この情報は、将来の検証と保護にとって重要です。

5. 長期的な保護を計画します。オープンで一般的で耐久性のあるファイル形式を選択してください。バックアップします。フォーマットが廃止された場合に備えて移行計画を立ててください。

ヒント: OCR 出力を「クリア テキスト」として受け入れないでください。検索システムがこのテキストを処理した場合、誤って認識された単語によりソースが見つからなくなる可能性があります。重要なコレクションの場合、人間の目で OCR 出力を修正することで、その後のすべてのアクセスの品質が決まります。

デジタルオブジェクトの信頼性と完全性

アーカイブ作業の中心となるのは、信頼性と完全性です。つまり、文書が真に主張された情報源からのものであり、その内容が変更されていないことの保証です。この時点で、AI は 2 つの側面からの脅威を生み出します。まず、OCR/HTR 修正または「強化」中に、AI は黙ってテキストを変更できます。 「修正」という名前で存在しない単語を追加できます。第二に、画像の「修復」または「復元」が AI で行われる場合、オリジナルではない詳細が生成される可能性があります。

アーキビストのルールは明確です。デジタル保存コピーはオリジナルに忠実でなければなりません。 AI を使用して行われたすべての改善は文書化する必要があり、実際の (生の) スキャンは常に保存する必要があります。文書を「美化」すると、その歴史的証拠価値が損なわれる可能性があります。

注意: 古い写真や文書を AI で「改善」したくなるかもしれません。しかし、AIは足りない部分を補うことによって補います。アーカイブ文書において、これは偽の歴史的証拠を作成することを意味します。復元出力が元のソースを置き換えることはありません。明確にラベル付けされた別個のバリアントとして保存されます。

ミニケース3個

ケース 1 — 新聞アーカイブが検索可能になりました。ある図書館は、30 年にわたる地元新聞のコレクションをデジタル化しました。 OCR を使用すると、90,000 ページが転写され、検索可能になりました。以前は数日かかっていたトピック検索が数秒に短縮されました。しかし、チームは、古くて汚れたページでは OCR の精度が 80% に低下していることに気づき、人間の目で上位の年を修正することを優先しました。

ケース 2 — HTR が原稿を開いた。アーカイブでは、読みにくい 19 世紀の手紙のコレクションに HTR が適用されました。専門家による数か月にわたる調査により、このシステムは大幅に高速化されました。しかし、人名や地名に誤りがあったため、印刷物の各ページは専門の古学者(古代文字の専門家)によってオリジナルと比較されました。

ケース 3 — 偽の「修復」は拒否されました。あるチームは、破れた歴史的写真をAIで「修復」することを検討した。足りない顔のパーツをAIが当てはめて完成させた。アーキビストは、これらの捏造された詳細が歴史的証拠を歪曲することになることに気づきました。修復された画像は元の画像とは別に保存され、「AI 派生物」とだけ明確にラベル付けされていました。

アクセスコピー、保存コピーおよびフォーマットの決定

デジタル化における良い習慣は、同じオブジェクトのコピーを異なる目的に分けることです。保存マスターは、将来に持ち越される実際のデジタル オブジェクトであり、最高解像度、非圧縮または可逆形式で保存されます。ほとんど触れられません。アクセス コピーは、ユーザーに表示される、小さくて簡単に開くことができるバリアントです。実用的に使用できる形式 (小さい、圧縮された形式) は長期保存には適していない可能性があるため、この区別は重要です。保存に理想的な形式 (大きく、ロスレス) は、日常的に使用するには扱いにくいものです。このワークフローでは、AI がファイルのインベントリ作成、欠落しているバリアントの検出、2 つのコピー間でのメタデータの一貫性の維持に役立ちます。ただし、形式の選択は保存に関する決定です。(独自のクローズドな形式ではなく) オープンで広く文書化され、耐久性のある形式が優先されるべきであり、形式が時間の経過とともに廃止された場合に備えて移行計画を準備しておく必要があります。 AI が形式を提案したとしても、最終決定権は機関の長期保存ポリシーにあります。

ヒント: 各デジタル オブジェクトについて、「オリジナルのソースはどこにあるのか、保存コピーはどのような形式で、アクセス コピーはどのような形式で、どれがユーザーに提供されているのか?」という質問に答える簡単な記録を保管してください。これら 3 つのレイヤーを混在させると、今後どのファイルが信頼できるマスターになるかが不明確になります。

コピー可能な 4 つのテンプレート

1) OCR 出力補正ヘルプ:

以下は、実際のページの OCR テキストと説明です。 openOCR エラー (不正な文字、複合語/分割語) のみを修正します。内容を変更したり、単語を追加または削除したりしないでください。よくわからない場合は「[?]」でマークしてください。 OCR テキスト: [ここ]

2) テキストと画像の一貫性チェック:

以下の修正後のテキストには、元の文書には含まれていないと予想される (作成された可能性がある) 追加事項はありますか?疑わしい部分をそれぞれマークし、なぜ疑わしいのかを書きます。テキスト: [ここ]

3) 保護メタデータのドラフト:

次のデジタル化オブジェクトの保存メタデータ アウトラインを生成します: ソース、来歴、スキャン日/解像度、ファイル形式、トランザクション履歴。私が提供した情報を使用し、不足しているフィールドは空白のままにしてください。情報:[こちら]

4) 優先順位付けのヘルプ:

以下はデジタル化を待っているコレクションのリストです。脆弱性、需要、独自性に基づいて優先順位付けを支援します。各リソースの理由を簡単に説明します。最終的な判断は私にお任せください。一覧は【こちら】

弱いプロンプト / 強いプロンプト

弱いプロンプト:

このスキャンしたテキストを修正して美化します。

「美化」は AI に内容を変更させ、欠落を補わせます。アーカイブ文書の原本性が損なわれています。

強力なプロンプト:

あなたの役割: デジタル化編集アシスタント。次の OCR テキストでは、明示的な認識エラー (不正な文字、間違った単語の分割) のみを修正します。単語を追加、削除、変更しないでください。不明な点は「[?]」のままにしてください。行った各修正を別のリストに表示します。テキスト: [ここ]

強力なプロンプトにより、AI はエラーの認識のみに制限され、コンテンツへの接触が禁止され、修正が追跡可能になります。

ワークフローとリスク表

ステージ

AIの貢献

主なリスク

保護措置

スキャン

品質が悪い

高解像度

OCR/HTR

テキストに変換する

認識エラー

人間の矯正

修正

エラーの提案

内容の変更

オリジナルとの比較

修復

派生画像

フィッティングの詳細

生のオリジナルを保管し、ラベルを付けます

保護

メタデータのドラフト

起源の喪失

来歴記録

よくある間違い

  • OCR 出力を修正せずに受け入れます。エラーにより検索とアクセスが中断されます。
  • AIを「美しくする」と呼ぶ。内容が変わり、オリジナリティが損なわれます。
  • 実際の証拠を AI 復元で置き換えます。捏造された詳細は偽りの歴史を生み出します。
  • 生のスキャンを保存していません。原本がなければ修正を確認することはできません。
  • 出典情報は省略します。文書の信頼性が追跡できなくなります。

要約すれば

デジタルアーカイブとデジタル化におけるAI。これは、OCR/HTR 転写、メタデータの作成、優先順位付けを高速化する貴重な支援です。しかし、アーカイブ作業の本質は信頼性と完全性です。OCR 出力は人間の目で修正されるべきであり、AI がコンテンツを黙って置き換えてはならず、復元派生物が元の証拠を置き換えてはならず、生のスキャンと出所情報は常に保存されるべきです。 AI は、文書を「改善」するのではなく、文書に忠実でありながらアクセスしやすくするツールとして使用します。

アプリケーションタスク

OCR 出力の短いサンプルを入手します (独自の出力または実際のスキャンからのいずれか)。 「OCR出力修正ヘルプ」テンプレートで認識ミスのみを修正してもらい、「文字・画像整合性チェック」テンプレートでAIがコンテンツを追加したかどうかを確認します。次に、「保存メタデータ ドラフト」テンプレートを使用して、オブジェクトの出所と形式情報を含むレコードを作成します。

チェックリスト

  • [ ] OCR/HTR出力を実際の画像と比較し、修正しました。
  • [ ] AIによるコンテンツの追加・変更が行われないことを確認しました。
  • [ ] 生 (マスター) スキャンを個別に変更せずに保管しました。
  • [ ] 出所と形式の情報をメタデータに追加しました。
  • [ ] 私は復元亜種を「AI 派生版」と明確にラベル付けしました。