利益:
- 実際のコンテンツからトピック抽出を抽出し、承認されたトピック リストからプライマリ トピックとセカンダリ トピックをマッピングする機能
- デューイなどの分類提案のメインクラスを受け入れ、公式テーブルでサブレベルを検証できること。
- 分類の判断的および表現的な性質を理解し、提案を古い用語や除外的な用語と照合する能力。
リソースが「何について」なのかを判断することは、図書館員にとって最も判断力が求められる作業の 1 つです。これはトピック分析と呼ばれます。文書の内容を読み取り、それを正しい件名見出しと正しい分類番号と照合します。ユーザーが棚で関連書籍を並べて見つけたり、カタログ内のトピックを検索したときに正確な結果が得られたりする場合、その裏には優れたトピック分析が存在します。この単元では、トピックの推奨、分類、自動インデックス付けで人工知能を使用する方法を学びます。しかし、最終的な主題の決定をなぜ人間が下さなければならないのかを学ぶでしょう。
いくつかの概念を定義しましょう。分類システムは、主題に従ってソースに番号を付けるシステムです。最も一般的なのは、デューイ十進分類 (DDC) と米国議会図書館分類 (LCC) です。たとえば、デューイでは、500 は自然科学を示し、900 は歴史と地理を示します。インデックス作成は、文書を見つけやすくするために重要な用語を文書に割り当てるタスクです。自動インデックス作成は、ソフトウェアがこのジョブを提案するときに行われます。 AI は 3 つのタスクすべてで提案を生成しますが、それぞれのタスクについて最終決定権を持つのは専門家です。
ステップバイステップ: 人工知能によるトピック分析
1. 文書の要点を AI に伝えます。全文、要約、目次、または序文。トピック分析はコンテキストに基づいて行われます。 AI にタイトルだけを与えると、表面的で誤解を招くような推奨事項が得られるでしょう。
2. AI にコンテンツの概要を要求します。まず、「この文書は主に何について書かれていますか?」聞く。これは、素早く理解するのに役立ち、AI が主題を正しく把握したかどうかを示すのにも役立ちます。
3. 管理されたトピックと一致します。 AI に承認されたトピックのリストを渡し、「このリストから最も適切なトピックだけを提案してください」と言います。自由な用語の生成を許可しないでください。
4. 分類番号を提案します。 AI に「この文書はデューイのどの主要クラスに分類されますか?」と尋ねることができます。ただし、番号の正確な桁は公式の分類表で必ず確認してください。 AI は妥当ではあるが不正確な数値を生成することがあります。
5. 決定を下し、それを正当化します。 AI の提案を検討し、教育機関のポリシーとユーザー ベースを考慮して選択し、必要に応じて拒否します。最終的な主題の決定と分類にはあなたの署名が付けられます。
ヒント: ドキュメントには複数のトピックを指定できます。 AI からの質問「この文書の主なトピックは何ですか? 副次的なトピックは何ですか?」別途お尋ねください。主な主題を正しく選択すると、リソースが棚の適切な場所に確実に配置されます。二次トピックでは、カタログ内の追加のアクセス ポイントが提供されます。
分類の法的性質
分類は中立的なように見えますが、そうではありません。文書を「女性学」と「社会学」のどちらに分類するか、さらには歴史的出来事をどの地理に分類するかについても、視点を含む決定が必要です。分類システムには、特定の時代や文化の仮定が含まれています。一部の用語は、時間の経過とともに時代遅れになったり、排他的になったりします。 AI は、トレーニングの対象となるデータからこれらのバイアスをそのまま継承し、さらにバイアスを強化する可能性があります。
したがって、トピック分析はAIに任せることのできない判断です。 AI はどのタイトルが「可能性が高い」かを示します。しかし、どのタイトルが情報源を最も正確かつ公平に表しているかについての決定は、機関とそのユーザーベースの価値観を知っている専門家に属します。
注意: AI によって提案されたトピックが、出典を偽ったり除外したりしないようにしてください。特にアイデンティティ、民族性、宗教、性別などのデリケートなトピックに関して、AI が生成した用語を教育機関の最新かつ包括的な語彙と比較します。
ミニケース3個
ケース 1 — 大量のトピックの提案。図書館は、800 件の記事からなるデジタル コレクションにトピックを割り当てます。専門家は各記事の概要をAIに渡し、承認されたタイトルリストからの一致を求めました。 AI レコメンデーションは、記事ごとに平均 3 つ中 2 つの適格なタイトルを正しくキャプチャしました。専門家は 3 番目の提案を追加し、間違った提案を取り除きました。作業は完全に手作業で行う場合よりも約 40% 早く完了しました。
ケース 2 — 分類番号が正しくありません。専門家は病歴書のために AI にデューイ番号を求めました。 YZ は「610 (医学)」を提案しました。ただし、この本は主に医学の歴史に関するもので、正しくは「610.9 (医学の歴史)」でした。専門家は公式のデューイ表を見て修正しました。 AI はメインクラスを見つけましたが、サブブレークを見逃しました。
ケース 3 — 時代遅れの用語が見つかりました。 AI は、時代遅れで現在では除外対象とみなされている主題用語を社会学の書籍に提案しました。この古い用語はトレーニング データで一般的だったためです。専門家は、機関の現在の包括的な語彙から正しい用語を選択しました。これはAIが過去のバイアスを引き継いでいることを示す具体例でした。
深さと一貫性: どれくらい具体的であるべきですか?
トピック分析における一般的な決定は、割り当てる用語の具体性のレベルです。リソースに一般的すぎるタイトル (「日付」) を付けると、そのトピックを検索しているユーザーは何百もの無関係な結果に圧倒されてしまいます。タイトルが狭すぎると、より幅広い情報源を探しているユーザーがその情報を見つけることができなくなります。ルールは、情報源を最も具体的かつ完全にカバーする用語を選択することです。情報源がセルジューク朝時代の建築のみを扱っている場合、「建築」ではなく「セルジューク建築」が正しいレベルです。 AI はこのバランスを欠いていることがよくあります。生成される提案は、一般的すぎるか、分散しすぎます。そのため、「ソースで取り上げられている最も具体的なトピックを提案し、ソースが実際に触れていないサブトピックは追加しないでください」などの明確な指示を AI に与える必要があります。さらに、同じトピックに関するリソースに長期間一貫してラベルを付けることは、カタログの完全性にとって、特異性と同じくらい重要です。ある日は「セルジューク朝の建築」、次の日は「セルジューク朝時代の建物」と言うとユーザーが分かれます。
ヒント: リソースに複数のタイトルを付ける場合は、互いのサブセットである用語を不必要に積み重ねないでください。 「オスマン帝国の歴史」と「歴史」の両方を与えると、後者は不要になります。最も具体的なものを選択し、実際に異なるリーチを追加するタイトルのみを含めます。
コピー可能な 4 つのテンプレート
1) トピックの抽出:
以下の文書の主なトピックを 1 つの文で記述し、副次的なトピックを 3 項目に分けて記述します。本文にないトピックを本文のみに基づいて追加する。ドキュメント/概要: [こちら]
2) 承認されたヘッダーからのマッチング:
以下は文書の概要と承認された主題の見出しのリストです。リストから、文書に最も適切な 3 ~ 5 個の見出しのみを、最も適切なものから順に照合します。各選択肢の理由を 1 文で書きます。リストに適切なタイトルがない場合は、指定してください。概要: [こちら] / 一覧: [こちら]
3) 分類マスタークラスの提案:
次の文書について、デューイ十進分類で考えられる主要クラス (3 桁) を提案し、それを選択した理由を説明してください。下位の数字には「公式の表から確認する必要がある」とマークし、正確な数字は記載しないでください。ドキュメント: [ここ]
4) バイアスと通貨チェック:
以下のトピックの提案の中に、時代遅れ、排他的、または一方的である可能性のある用語はありますか?該当する場合は、それにマークを付けて、なぜ問題があるのかを説明してください。提案: [ここ]
弱いプロンプト / 強いプロンプト
弱いプロンプト:
この本の主題をあげてください:「オスマン帝国の商業」。
タイトルのみから作業する AI は、文脈を知らずに一般的な用語を作り上げ、管理された語彙を無視します。結果: 一貫性がなく、おそらく間違ったタイトルになります。
強力なプロンプト:
あなたの役割: アシスタントの主題アナリスト。以下は本の紹介と内容です。承認されたトピックのリストも提供しました。 (1) この本の主なトピックを一文で要約します。 (2) リストから最も適切な 3 ~ 5 個のタイトルのみを根拠と照合します。 (3) リストから外れたり、条件をでっち上げたりしないでください。本文: [こちら] /承認済みリスト: [こちら]
強力なプロンプトにより、AI は実際のコンテンツと制御された語彙に制限されます。精度と一貫性の両方を維持します。
トピック分析タスクチャート
クエスト
AIの役割
男の決断
内容概要
クイックドラフト
精度チェック
タイトルの提案
リストから一致
最終的な選択、正当化
分類番号
マスタークラスの提案
細分化検証
バイアスチェック
マーキング
包括的な期間の決定
よくある間違い
- タイトルから話題を求めてるだけです。トピック分析はコンテキストに基づいて行われます。タイトルは誤解を招きます。
- 分類番号を確認せずに受け入れる。 AI はメインクラスを見つけましたが、サブブレークを見逃しました。
- 統制された語彙をスキップする。フリータームは一貫性を損なう。
- 偏見を無視する。 AI は過去の時代遅れの排他的な条件を引き継ぐ可能性があります。
- 判断はすべてAIに任せる。代表と正義には判断が必要です。決定はその人次第です。
要約すると
トピックの分析と分類において、AI はコンテンツの概要を抽出し、承認されたリストからトピックを照合し、分類マスター クラスを提案する高速アシスタントです。しかし、主題の分析は本質的に判断と表現の問題です。どのタイトルが情報源、分類番号の正確な桁数、および用語の現在の状況を最も正確かつ公平に説明しているかを判断するのは専門家次第です。実際のコンテンツと制御された語彙を使用して AI を実行し、分類番号を公式の表で検証し、偏見に注意してください。
アプリケーションタスク
手持ちの情報源への紹介文と、承認されたトピックの短いリストを準備します。 「トピック抽出」および「承認済みトピックマッチング」テンプレートを使用して AI の提案を取得します。次に、その提案を公式の分類表および教育機関の現在の語彙と比較します。いくつの提案が正しく、いくつを修正しましたか? 「バイアスと最新性のチェック」テンプレートを使用して、古い用語の推奨事項を確認します。
チェックリスト
- [ ] タイトルではなく、実際の内容からトピック分析をしてもらいました。
- [ ] 管理された語彙からタイトルをマッピングしました。
- [ ] 分類番号の下桁を公式表で検証してみました。
- [ ] 古い用語や除外用語に対する提案を確認しました。
- [ ] 最終的な科目と分類の決定は私が独断で行いました。