利益:
- 人工知能を使用して、ISAD(G) や Dublin Core などの標準に従ってメタデータのドラフトを作成する機能
- 幻覚を防止し、空白のままにする許可により対象用語を管理された語彙にマッピングする機能
- 日付、個人名、参照コードなどのどのフィールドが人間の承認を必要とし、どのフィールドが機関によってのみ割り当てられるべきかを区別する機能
アーカイブやライブラリは、それがどれほど豊富であっても、明確に定義されていなければ見つけることができません。文書を「検索可能」にするのは、文書についての説明情報です。つまり、誰が、いつ、どこで、その主題が何で、どのコレクションに属しているかです。この情報はメタデータと呼ばれます (メタデータ - 文書に関する記述データ。「データに関するデータ」)。カタログ化は、このメタデータを含むドキュメントを識別し、検索可能なシステムに保存するプロセスです。分類とは、主題、種類、出所などの基準に従って文書を整理することです。
メタデータの生成には非常に時間がかかります。大規模なコレクションに含まれる何千もの文書に対して、日付、件名、人物、場所の情報を個別に入力するには、何年もかかることがあります。 AI は、このビジネスにおいて強力なドラフト生成手段です。この単元では、AI を使用してメタデータを生成する方法、標準 (ISAD(G)、ダブリン コア) に準拠したカタログ作成方法、自動分類の能力と落とし穴の両方について説明します。
アーカイブ基準: アーカイブ基準が必要な理由
メタデータはランダムに入力されるわけではありません。さまざまな機関の記録が相互に通信できるようにするための国際標準があります。
- ISAD(G) (一般国際標準アーカイブ記述): アーカイブ資料を階層的に (基金、シリーズ、ファイル、文書レベルで) 記述するための規則。これには、参照コード、タイトル、日付、範囲、作成者などのフィールドが含まれます。
- Dublin Core: デジタル リソースを記述するための 15 のコア フィールド (タイトル、作成者、件名、日付、ジャンル、形式、ソース、言語など) で構成される共通標準。
- Fonds: 1 人の個人、家族、または団体の活動の結果として自然に形成された一連の記録。これは、アーカイブの基本的な編成単位です。
- 来歴 (起源): 文書が誰から来たのか、どの人の手を経たのかに関する情報。アーカイブでは、文書はその出所に従ってまとめて保管されます。
AI にメタデータを生成させるときにターゲット標準を明示的に指定することで、出力を企業に直接入力できるようになります。
もう 1 つの重要な概念は典拠レコードです。これは、人、場所、または機関の名前の単一の標準的で承認された形式を定義するレコードです。歴史的文書では、同じ人物や場所が異なる綴りで登場する場合があります。典拠レコードはそれらすべてを 1 つの承認された形式にバインドするため、検索中にそれらが分散することはありません。 AI が文書から名前を提案します。ただし、この名前を典拠レコードの標準形式にマッピングするのは人間の作業です。 AIが「アーメド」と言うものを、機関の典拠記録にある「アーメド・ベイ(1840-1912)」と結び付けることで、カタログの一貫性が保たれます。
ワークフロー: ステップバイステップ
1. ソースを準備します。文書のトランスクリプトまたは画像とコンテキスト情報を収集します。
2. 規格と領域を特定します。 AI に、どの標準 (ISAD(G)、ダブリン コア) に応じて、どのフィールドに従って出力を生成するかを指示します。
3. ドラフトメタデータを生成します。 AI は文書から抽出できるフィールド (日付、人物、場所、件名、言語、ジャンル) を入力します。削除できない領域は空白のままになります。
4. 管理された語彙にマッピングします。主題名と地名はほとんどの機関で自由ではなく、事前定義されたリスト (管理された語彙/シソーラス) に関連付けられています。 AIが提案した主題用語をこのリストにマッピングします。
5. 確認して確認します。各フィールド、特に日付、名前、件名は、人間によって権威のある文書や記録と比較されます。
ヒント: AI に「空白のままにする」許可を明示的に与えます。そうしないと、ドキュメントにない日付または作成者が「推測」されて入力され、偽のメタデータがカタログに挿入されます。 「文書にない場合はこのフィールドを空白のままにしてください」という指示は、幻覚に対する最強の盾です。
テーブル内のフィールドと信頼レベル
メタデータフィールド
AI はどの程度信頼できるのでしょうか?
検証
言語
高い
サンプル
文書の種類
中~高
コントロール
人名・地名
中(読み取りエラー)
必須
日付
低~中 (捏造のリスク)
必須
主題用語
中(無料生成)
チェックリストへのマッピング
範囲/概要
中~高
ソースと比較する
参考コード
なし(機関が与える)
人間の投げ物
概要: AI は言語やジャンルなどの分野で高速かつ信頼性が高く、日付、名前、件名などのフィールドで下書きを生成しますが、人間の承認が必要です。 AI は参照コードなどの制度的なフィールドを生成することはありません。
ミニケース3個
ケース 1 — 8,000 枚の写真のメタデータをドラフトします。市のアーカイブには 8,000 枚の歴史的写真がカタログ化されていました。各写真の裏にあるメモは転写され、AI に与えられました。 AI が生成した日付、場所、トピックの概要。人間のチームはそれをフィールドごとに検証し、管理されたリストにマッピングしました。推定 10 か月かかる仕事が 3 か月に短縮されました。ただし、すべての日付と場所名は目視で確認されました。
ケース 2 — でっち上げられた履歴。アーキビストは AI に日付のない手紙のカタログを作成させました。 YZさんは手紙の内容を見て、「1912年」という日付を正確に書きました。しかし、その文書には日付が記載されていなかった。 AIが予測した。アーキビストが「文書にない場合は空白のままにしておく」という指示を追加していなかった場合、カタログにはでっちあげの日付が記入されていたでしょう。教訓: 空白の許可は必須です。
ケース 3 — 自由な主題条件により混乱が生じました。 AIは、同様の文書に「移民」、「移民」、「定住」など、似ているが異なる自由な用語を割り当てました。管理された語彙にマッピングされていない場合、同じトピックに 3 つの異なる用語がタグ付けされ、検索内に散在していました。用語を単一の典拠リストにマッピングすることで、一貫性が実現されました。教訓: トピック用語は公開されず、リストにリンクされます。
コピー可能な 4 つのテンプレート
1) ダブリンコアの概要:
以下の文書転写から Dublin Core メタデータのドラフトを抽出します。フィールド: タイトル、作成者、件名、説明、日付、ジャンル、言語、範囲 (場所/期間)。ルール: (1) 本文では明確に情報のみを使用してください。 (2) テキストにないフィールドは空白のままにし、推測しないでください。 (3) 不明な値には[?]を付けてください。転写: [ここ]
2) ISAD(G) 草案定義:
次の文書のドラフトを ISAD(G) フィールドに生成します: タイトル、日付、説明レベル (文書/ファイル)、範囲と内容 (短い概要)、作成者、言語。参照コードは空白のままにしておきます (教育機関が提供します)。本文にない情報は追加しないでください。存在しないフィールドは空白のままにしてください。ドキュメント: [ここ]
3) トピック用語の提案 (制御):
以下の文書に適切なトピック用語を 3 ~ 5 つ提案してください。まず、文書内の事実に頼ってください。以下は当機関の管理用語リストです。まず、このリストから選択します。リストにない場合は、新しい用語の提案を個別にマークします。リスト: [用語]。ドキュメント: [ここ]
4) 一括一貫性チェック:
以下は、同じコレクションのドキュメントのメタデータ レコードです。不一致にフラグを立てます: 同じ場所/人物の綴りの違い、日付形式の違い、同じ主題の用語の違いを記録します。訂正の強制;人間がレビューできるように、不一致のリストを作成するだけです。記録: [ここ]
弱いプロンプト / 強いプロンプト
弱い:
このドキュメントの完全なカタログ レコードを作成します。
「完全な」命令は、AI にあらゆる空間を埋めるように促します。つまり、存在しない歴史や創造者を発明させます。
強い:
Dublin Core はこの文書用に草案されています。転写に明確に含まれている情報のみを使用してください。存在しないフィールドは空白のままにしておきます。推測しないでください。この管理されたリスト [リスト] からトピック用語を選択してください。資料と照合できるよう、日付と人名に[?]を付けてください。転写: [ここ]
違い: 「完全な」編集ではなく「空白のままにする」許可、管理されたリストの順守および検証マークにより、カタログが捏造から保護されます。
よくある間違い
- 「完全に埋める」という意味です。これにより、存在しないフィールドを当てはめることになります。 「空白のままにする」許可を与える必要があります。
- 主題の用語を解放します。管理された語彙にマッピングされていない用語は、検索の妨げになります。
- AIに歴史を予測させる。日付のない文書に架空の日付を入力すると、カタログが汚染されます。
- AIがリファレンスコードを生成する。これは企業のユニークなスペースです。人々は投げます。
- 規格を定めていない。基準が言及されていない場合、出力は機関に入力できない乱雑な草案になります。
要約すれば
メタデータとカタログ作成は研究者にアーカイブを公開する目に見えないインフラストラクチャであり、多大な労力を必要とします。 AI は文字起こしから、日付、人物、場所、主題、ジャンルなどのフィールドの概要を迅速に生成します。 ISAD(G) や Dublin Core などの標準に従って動作できます。しかし、「完全に埋めなければならない」というプレッシャーにより、AI は物事をでっち上げようとします。 「空白のままにする」許可、管理された語彙へのマッピング、および日付/名前の人による確認により、カタログの信頼性が保たれます。 AI が草案を作成します。カタログの正確性についてはお客様の責任となります。
アプリケーションタスク
文書の転写を取得し、「ダブリン コア ドラフト」テンプレートを使用して AI からメタデータをリクエストします。存在しないフィールドが空白のままになっていることを確認してください。次に、独自の (またはサンプルの) チェックリストを使用して「トピック用語の提案」テンプレートを実行します。最後に、「一括整合性チェック」を使用していくつかのレコードをテストします。 AI が予測を入力しようとするフィールドの数と、リストにマッピングする必要がある主題用語の数に注意してください。
チェックリスト
- [ ] 対象規格(ISAD(G)/Dublin Core)を明記しました。
- [ ] 「空白フィールドを空白のままにする」許可を与えました。
- [ ] トピック用語を管理リストにマッピングしました。
- [ ] 日付と人物名を文書/典拠記録で確認しました。
- [ ] 参照コードは AI ではなく機関に任せました。