利益:
- 実際のインプリント情報から MARC や Dublin Core などの標準に従ってドラフト メタデータを生成することにより、カタログ作成時間を短縮する機能
- 出版年、ISBN、著者名など、捏造のリスクが高いフィールドを元の情報源と照合し、管理された語彙から主題用語をマッピングする機能
- 著者と主題のフォーマットを権限制御で単一承認し、カタログの一貫性を維持する機能
目録作成は、目には見えませんが、図書館の最も基本的な仕事です。リソース (書籍、記事、地図、録音、デジタル ファイル) の発見は、正しいメタデータがあれば可能です。メタデータとは、「データに関するデータ」を意味します。リソースのタイトル、著者、発行年、主題、言語、物理的属性を記述する構造化情報です。メタデータが適切であれば、ユーザーはリソースを見つけます。不良または不完全な場合、リソースは存在していても失われます。この単元では、ドラフト メタデータの生成に人工知能を使用する方法と、標準への準拠と正確性を確保する方法を学びます。
まず 2 つの概念を定義しましょう。 MARC (Machine-Readable Cataloging) は、図書館が数十年にわたって使用してきたレコード形式で、各情報を番号付きフィールドに配置します。たとえば、フィールド 245 にはタイトルが保持され、フィールド 100 には主著者が保持されます。 Dublin Core は、デジタル リソース用の簡略化されたメタデータ標準であり、15 の基本フィールド (タイトル、作成者、件名、日付、ジャンルなど) で構成されます。これらの標準により、異なるライブラリのレコードが相互に通信できることが保証されます。
ステップバイステップ: 人工知能を使用してドラフトメタデータを生成する
1. ソースの ID 情報を収集します。本の表紙、タイトルページ、デジタルファイルの内容またはテキスト。 AI は、ユーザーから与えられた情報に基づいてのみ機能します。不完全な情報を提供すると、不完全または捏造されたメタデータが生成されます。
2. 対象規格を指定します。 「ダブリンコアフィールドまで」や「MARC 245、100、260、650フィールドまで」など、AIに明確な目標を与えます。標準を指定しない場合は、任意の形式が生成されます。
3. ドラフトを作成します。 AI は、提供された情報に基づいて、タイトル、責任声明、出版情報、およびトピックの提案を作成します。
4. 権限制御を実行します。権威ある記録とは、著者の名前、機関、または主題の単一の標準的な形式を確立するものです (例: 「Atatürk, Mustafa Kemal, 1881-1938」)。 AI はさまざまな方法で名前を書くことができます。承認された典拠フォーマットを確認して修正します。
5. 確認して確認します。各フィールドを元のソースと比較します。特に、出版年、ISBN、著者名などの正確な情報は、AIによって偽造される可能性が非常に高いです。
ヒント: AI に情報源の実際のクレジット ページの写真またはテキストを与えます。 「本の名前を当ててください」とは言わないでください。予測メタデータはカタログの信頼性を損ないます。 AI は予測を行うときに自信を持って書きますが、これがユーザーの誤解を招く可能性があります。
管理された語彙と一貫性
カタログ作成では一貫性がすべてです。同じトピックが 2 つの異なるレコードに 2 つの異なる用語で書かれている場合、ユーザーは一方を見つけて、もう一方を見逃してしまいます。そのため、図書館では管理された語彙、つまり承認された標準的な用語リストが使用されます。フリーテキストから用語を提案する場合、AI はこのリストにある正式な用語ではなく、それに相当する口語表現を選択できます。たとえば、AI は「心臓発作」と書くかもしれません。一方、承認された用語は「心筋梗塞」である可能性があります。
解決策は、AI に制御された語彙を与え、「このリストから選択するだけ」と指示することです。そのため、AIは用語を自由に作成するのではなく、承認されたリストから最も適切なものを照合します。
注意: AI によって提案された対象用語が管理語彙に含まれていない場合は、その用語をカタログに追加しないでください。新しい用語を追加するかどうかの決定は、権限管理を担当する専門家に任されています。任意の用語を追加すると、カタログの一貫性が損なわれます。
ミニケース3個
ケース 1 — 寄付集めが加速します。公共図書館は 1,200 冊の書籍の寄贈を受けました。目録作成のスペシャリストは AI に各本の奥付ページを読み取らせ、ダブリン・コアの草稿を作成させました。 1 回の録音にかかる時間は 9 分から 3.5 分に短縮されました。専門家は残りの時間を権限のチェックと検証に充てた。合計時間は約 55% 短縮されましたが、検証されずにシステムに入力された記録はありませんでした。
ケース 2 — 偽の ISBN が見つかった。専門家はAIに30冊の本の草稿を作成させた。チェック中に、4 つのレコードの ISBN が偽であることが判明しました。本の実際の番号は知らなかったにもかかわらず、AI が妥当と思われる 13 桁の番号を書き込んだのです。この検証手順により、4 つの間違った ISBN がカタログ内に残ることがなくなりました。
ケース 3 — 権限の不一致が修正されました。図書館では、著者が「J. Smith」として記録されているものと、「John Smith」として記録されているものと、「Smith, John」として記録されているものとがありました。 AI は典拠ファイルと照合され、すべての記録が単一の承認された形式 (「スミス、ジョン、1965 年-」) にまとめられました。この作業を手動で行うと数日かかりますが、AI の提案により数時間に短縮されましたが、各試合は専門家によって承認されました。
遡及変換と古い記録
多くの図書館には、何年も前に異なるルールで入力された、不完全または古いレコードが保存されています。これらを現在の標準に移行することは遡及変換と呼ばれ、手動で行うと非常に手間がかかります。 AI は古いレコードを読み取り、それを現在のフィールド構造に移動するためのドラフトを生成できます。たとえば、フリーテキストの引用を解析して、それを正しいフィールドに配布できます。ただし、ここには 2 つの危険があります。まず、AI は不足している情報を補って「補う」ことができます。 2 つ目は、古いレコードのエラーを修正するのではなく、新しい形式にコピーすることで永続化する可能性があります。したがって、遡及的変換では、AI の出力はサンプリングによってではなく、重要な分野 (著者、年、識別番号) によって系統的にチェックされる必要があります。変換前と変換後のレコードを並べて表示し、それぞれの変更が見えるようにすることをお勧めします。そのため、専門家は、何が移動されたか、何が変更されたか、何が捏造された可能性があるかを一目で確認できます。
注意: AI によって生成されたドラフトメタデータは、1 つずつ確認せずにバッチとしてシステムに転送しないでください。大量エラーにより一度に数百件のレコードが破損し、取得は生成よりもはるかに面倒です。小さなバッチで作成して検証するのが最も安全です。
コピー可能な 4 つのテンプレート
1) ダブリンコアの概要:
あなたの役割: 目録作成アシスタント。次の署名テキストから Dublin Core フィールドに入力します: タイトル、作成者、件名、説明、発行者、日付、ジャンル、形式、言語。テキスト内で明確な情報のみを使用してください。不足しているフィールド「[情報なし]」は推測せずにそのままにしておきます。奥付テキスト: [ここ]
2) MARC フィールドの概要:
以下の書籍情報から次の MARC フィールドの概要を提案してください:245 (タイトル/クレジット)、100 (主著者)、260/264 (出版物)、300 (物理的記述)、650 (件名)。不明なフィールドには「[検証が必要]」とマークしてください。情報:[こちら]
3) 管理された語彙からのトピックのマッチング:
以下は、出典の概要と承認されたトピック用語のリストです。リストから 3 ~ 5 個の最も適切な用語のみをソースと照合します。リストに適切な用語がない場合は、「リストに適切な用語がありません」と記入し、新しい用語を作成しないでください。概要: [こちら] / 用語一覧: [こちら]
4) 権限フォーム制御:
以下の著者名を、私が提供した典拠リストの承認済みフォームと照合してください。各名前について: 記録内の形式 -> 承認された形式。リストに相当するものがない場合は、「典拠記録なし」と記入してください。名前: [こちら] / 権限リスト: [こちら]
弱いプロンプト / 強いプロンプト
弱いプロンプト:
次の書籍のカタログ情報を抽出します:「人工知能と社会」。
タイトルのみが示されています。 AIは著者、出版年、出版社、ISBNを強制的に構成します。目標とする基準はありません。結果: 説得力はありますが、おそらく誤った記録です。
強力なプロンプト:
あなたの役割: 目録作成アシスタント。以下は本の奥付ページの全文です。ここからダブリンコアのフィールドに入力します。本文に明確に記載されている情報のみを使用してください。テキスト以外のフィールドは空白のままにして、「[情報なし]」と入力します。日付、名前、ISBN は作成されません。奥付テキスト: [全文はこちら]
強力なプロンプトにより、AI は実際の署名情報に制限され、空白を作成するのではなく正直に残すよう強制されます。
メタデータフィールドと検証テーブル
エリア
捏造の危険性
確認方法
タイトル
低い
奥付ページと比較
著者/典拠の形式
中程度
典拠ファイル内を検索する
出版年
高い
奥付・奥付で確認
ISBN
非常に高い
バーコード/ソースによる 1 対 1 の制御
対象用語
高い
管理された語彙で一致する
よくある間違い
- タイトルからメタデータをリクエストするだけです。不完全な情報が AI に物事を作り上げさせるのです。
- 対象となる規格を定めていない。恣意的なフォーマットはレコードの調和を乱します。
- ISBN と年を検証せずに受け入れます。これらの領域は捏造のリスクが最も高くなります。
- 管理された語彙の外から主題用語を取得する。一貫性と可用性が損なわれます。
- 権限制御をバイパスします。同じ著者がさまざまな形式で分散しているため、ユーザーはソースを見逃してしまいます。
要約すると
メタデータ生成において、AI は強力なアシスタントとしてインプリント情報を迅速に抽出し、カタログ作成時間を大幅に短縮します。しかし、生産性の代償として、捏造のリスクに対する厳格な検証が求められます。ターゲット標準 (MARC、ダブリンコア) を明確にし、実際の副詞知識のみで AI を実行し、管理された語彙から主題用語をマッピングし、典拠形式を検証します。 AIはギャップを埋めるのではなく、正直に空白のままにしておくべきです。最終的な承認はあなたが保持します。
アプリケーションタスク
「ダブリンコアドラフト」テンプレートで、あなたが持っている実際の書籍の奥付ページのテキストをAIに与え、ドラフトを取得します。次に、タイトルだけ (「弱いプロンプト」) で同じ本を作成し、2 つの出力を比較します。どの分野が捏造されたのか?次に、「管理された語彙からのトピック マッピング」テンプレートを使用して、承認された用語の短いリストを指定して、トピックが一致するようにし、AI がリストから外れているかどうかを確認します。
チェックリスト
- [ ] 情報源の正体情報を AI に与え、推測に任せませんでした。
- [ ] 対象となるメタデータ規格 (MARC/Dublin Core) を明確に指定しました。
- [ ] 出版年と ISBN を原資料で逐語的に確認しました。
- [ ] 管理された語彙からトピック用語をマッピングしました。
- [ ] 承認された記録で権限の形式を確認しました。