收益:
- 能够从实际内容中提取主题摘录,并从批准的主题列表中映射主要和次要主题
- 能够接受杜威等分类建议的主类,并与官方表格验证子级别。
- 能够理解分类的判断性和代表性本质,并根据过时和排他性术语检查建议。
确定资源“关于”什么是图书馆管理工作中最具判断力的任务之一。这称为主题分析:阅读文档内容并将其与正确的主题标题和正确的分类号进行匹配。如果用户能够在书架上并排找到相关书籍,或者在目录中搜索某个主题时得到准确的结果,那么背后就有一个很好的主题分析。在本单元中,您将学习如何在主题推荐、分类和自动索引中使用人工智能;但你会了解到为什么人类应该做出最终的主题决定。
让我们定义几个概念。分类系统是根据主题对来源进行编号的系统;最常见的是杜威十进制分类 (DDC) 和国会图书馆分类 (LCC)。例如,在杜威中,500表示自然科学,900表示历史和地理。索引是将关键术语分配给文档以使其易于查找的任务。自动索引是软件建议这项工作的时候。人工智能在所有三项任务中都会提出建议,但专家对每一项任务都有最终决定权。
循序渐进:利用人工智能进行主题分析
1. 向 AI 提供文档要点。全文、摘要、目录或简介。主题分析基于上下文;如果你只给人工智能一个标题,你会得到一个肤浅且具有误导性的推荐。
2.向AI请求内容摘要。首先,“这份文件的主要内容是什么?”问。这既可以帮助你快速理解,也可以显示AI是否正确掌握了主题。
3、与受控主题相匹配。向人工智能提供您批准的主题列表,并说“仅建议此列表中最合适的主题。”不要让它产生自由术语。
4.建议分类号。你可以问AI“这份文档在杜威中属于哪一个主类?”但请务必使用官方分类表验证数字的准确数字。人工智能可以产生合理但不准确的数字。
5. 做出决定并证明其合理性。审查人工智能的建议,根据机构的政策和用户群进行选择,并在必要时拒绝它们。最终的主题决定和分类须有您的签名。
提示:一个文档可以指定多个主题。来自 AI 的“本文档的主要主题是什么,次要主题是什么?”分别询问。正确选择主要主题可确保资源放置在货架上的正确位置;次要主题提供目录中的其他访问点。
分类的司法性质
分类看起来是中性的,但事实并非如此。将一篇文献置于“妇女研究”还是“社会学”之下,甚至将历史事件归入哪个地理范畴,都是涉及视角的决定。分类系统带有特定时期和文化的假设;随着时间的推移,有些术语会变得过时或具有排他性。人工智能从它所训练的数据中逐字继承这些偏见,甚至可能强化它们。
因此,话题分析是一个判断问题,不能交给AI。 AI 指示哪些标题是“可能的”;但哪个标题最准确、最公平地代表来源的决定权属于了解该机构及其用户群价值观的专家。
注意:确保 AI 建议的主题不会歪曲或排除来源。将人工智能生成的术语与机构当前的包容性词汇进行比较,特别是在身份、种族、宗教和性别等敏感话题上。
三个迷你箱子
案例1——大众话题提案。图书馆会将主题分配给包含 800 篇文章的数字馆藏。专家将每篇文章的摘要交给人工智能,并要求从批准的标题列表中进行匹配。 AI 推荐平均正确捕获了每篇文章 3 个符合条件的标题中的 2 个;专家添加了第三个并删除了错误的建议。与完全手工完成相比,这项工作的完成速度大约快 40%。
情况 2 — 分类号不正确。一位专家向人工智能请求提供一本病史书籍的杜威数。 YZ建议“610(医学)”;不过,这本书主要是关于医学史的,正确的位置是“610.9(医学史)”。专家查看了官方的杜威表并进行了修正; AI找到了主课,但错过了小休息。
案例 3 — 发现过时术语。 AI 为社会学书籍提出了一个过时且现在被认为具有排他性的主题术语;因为这个旧术语在训练数据中很常见。专家从该机构当前的包容性词汇中选择了正确的术语。这是人工智能带有过去偏见的一个具体例子。
深度和一致性:应该具体到什么程度?
主题分析中的一个常见决定是要分配的术语的特殊性级别。如果您为资源指定的标题过于笼统(“日期”),则搜索该主题的用户将被淹没在数百个不相关的结果中。如果您给出的标题太窄,则寻找更广泛来源的用户将无法找到它。规则是选择最具体但完全涵盖来源的术语:如果来源仅涉及塞尔柱时期的建筑,则“塞尔柱建筑”而不是“建筑”是正确的级别。人工智能经常会失去这种平衡;它产生的建议要么过于笼统,要么过于分散。因此,有必要向人工智能给出明确的指示,例如“建议来源所涵盖的最具体的主题,并且不要添加来源实际上没有涉及的子主题”。此外,随着时间的推移,对同一主题的资源进行一致的标记对于目录的完整性和特异性同样重要;有一天说“塞尔柱建筑”,第二天说“塞尔柱时期的建筑”,用户就会产生分歧。
提示:为资源提供多个标题时,请勿不必要地堆叠彼此互为子集的术语。同时给出“奥斯曼历史”和“历史”使得后者变得不必要;选择最具体的,并且只包含真正增加不同影响力的标题。
四个可复制模板
1)主题提取:
用一句话写出下面文档的主要主题,用 3 个项目写出次要主题。添加文本中没有的主题,仅根据文本。文档/摘要:[此处]
2)从批准的标头匹配:
以下是文件摘要和已批准主题标题的列表。从最合适的开始,仅匹配列表中最适合文档的 3-5 个标题。为每个选择写一句话理由。如果列表中没有合适的标题,请指定它。摘要:[此处] / 列表:[此处]
3)分类大师班建议:
对于以下文档,建议杜威十进制分类中可能的主要类别(3 位数字)并解释选择它的原因。将较低的数字标记为“必须从官方表格中验证”,不要给出确切的数字。文档:[此处]
4) 偏差和货币检查:
以下主题建议中是否存在可能过时、排他性或片面性的术语?如果是这样,请标记它并解释为什么它可能会出现问题。建议:[此处]
弱提示/强提示
弱提示:
给出这本书的主题:“奥斯曼帝国的商业”。
人工智能仅从标题出发,在不了解上下文的情况下组成通用术语,并忽略受控词汇。结果:标题不一致,甚至可能不正确。
强力提示:
您的角色:助理主题分析师。以下是本书的简介和内容;我还提供了已批准主题的列表。 (1) 用一句话概括本书的主要主题。 (2) 仅将列表中的 3-5 个最合适的标题与理由相匹配。 (三)不脱单、不编造条件。文本:[此处] /批准列表:[此处]
强烈的提示将AI限制在真实内容和受控词汇上;保持准确性和一致性。
主题分析任务图
任务
人工智能的作用
男人的决定
内容概要
快速草稿
准确性检查
标题建议
从列表中匹配
最终选择、理由
分类号
大师班建议
细分验证
偏差检查
标记
包容性期限决定
常见错误
- 只是从标题中询问一个主题。主题分析基于上下文;标题具有误导性。
- 未经验证就接受分类号。虽然 AI 找到了主类,但它错过了子中断。
- 跳过受控词汇。免费期限破坏了一致性。
- 无视偏见。人工智能可能会延续过去过时的排他性条款。
- 将决定完全留给人工智能。代表和正义需要判断力;决定取决于人。
综上所述
在主题分析和分类中,AI是一个快速助手,提取内容摘要,从批准的列表中匹配主题,并建议分类大师班。但主题分析本质上是一个判断和表述的问题:由专家决定哪个标题最准确、最公正地描述来源、分类号的确切数字以及术语的流行。用真实内容和受控词汇运行人工智能,用官方表格验证分类数字,并警惕偏见。
应用任务
准备一份对您拥有的来源的介绍以及一份已批准主题的简短列表。通过“主题提取”和“批准的主题匹配”模板获取人工智能建议。然后将建议与官方分类表和机构当前词汇进行比较:有多少建议是正确的,你纠正了多少?使用“偏差和新近度检查”模板检查过时术语的建议。
清单
- [ ] 我是根据实际内容而不是标题来进行主题分析的。
- [ ] 我从受控词汇中映射了标题。
- [ ]我用官方表格验证了分类号的低位数字。
- [ ] 我已检查了针对过时和排他性术语的建议。
- [ ] 我自行决定了最终的主题和分类决定。