单位 2 / 11

编目和元数据生成中的人工智能

收益:

  • 能够根据真实印记信息根据 MARC 和都柏林核心等标准生成草稿元数据,从而缩短编目时间
  • 能够验证具有高伪造风险的字段,例如出版年份、ISBN、作者姓名以及原始来源,并从受控词汇表中映射主题术语
  • 能够使作者和主题格式通过权限控制进行单一批准并保持目录一致性

编目是图书馆工作中看不见的但却最基本的工作。使用正确的元数据可以发现资源(书籍、文章、地图、录音、数字文件)。元数据意味着“关于数据的数据”:描述资源的标题、作者、出版年份、主题、语言和物理属性的结构化信息。如果元数据良好,则用户找到该资源;如果元数据良好,则用户可以找到该资源。如果损坏或不完整,即使资源存在,也会丢失。在本单元中,您将学习如何在草稿元数据生成中使用人工智能,以及如何确保标准合规性和准确性。

我们先来定义一下这两个概念。 MARC(机器可读编目)是图书馆使用了数十年的一种记录格式,它将每条信息放在编号字段中;例如,字段 245 保存标题,字段 100 保存主要作者。 Dublin Core 是数字资源的简化元数据标准,由 15 个基本字段(标题、创建者、主题、日期、流派等)组成。这些标准确保来自不同图书馆的记录可以相互通信。

一步一步:使用人工智能生成草稿元数据

1. 收集来源的身份信息。书籍的封面、扉页、数字文件的内容或文本。人工智能只能根据你提供的信息发挥作用;如果您提供不完整的信息,则会产生不完整或捏造的元数据。

2. 明确目标标准。给AI一个明确的目标,例如“by Dublin Core fields”或“by MARC 245, 100, 260, 650 fields”。如果您不指定标准,它会生成任意格式。

3. 制作草稿。 AI 根据您提供的信息起草标题、责任声明、出版信息和主题提案。

4、实行权限控制。权威记录是建立作者姓名、机构或主题的单一标准形式的记录(例如“Atatürk, Mustafa Kemal, 1881-1938”)。 AI可以用不同的方式写名字;您检查并更正批准的授权格式。

5. 验证并确认。将每个字段与原始来源进行比较。特别是出版年份、ISBN、作者姓名等精确信息很容易被人工智能伪造。

提示:给AI一张来源实际信用页面的照片或文字;不要说“猜猜这本书的名字”。预测元数据破坏了目录的可靠性。人工智能在做出预测时会自信地书写,这会误导你。

受控词汇和一致性

一致性就是编目的一切。如果同一主题在两个不同的记录中使用两个不同的术语编写,则用户将找到一个而错过另一个。这就是图书馆使用受控词汇的原因——经过批准的标准术语列表。当从自由文本中建议术语时,人工智能可以选择其口语等效术语,而不是此列表中的官方术语。例如,AI可能会写出“心脏病发作”;而批准的术语可能是“心肌梗塞”。

解决方案是给人工智能受控词汇并说“只需从这个列表中选择”。因此,人工智能不会随意编造术语,而是从批准的列表中匹配最合适的术语。

注意:如果人工智能建议的主题术语不在受控词汇表中,请勿将该术语添加到目录中。添加新术语的决定由负责权限管理的专家决定;添加任意术语会破坏目录的一致性。

三个迷你箱子

案例一——善款募集加速。一家公共图书馆收到了 1,200 本书的捐赠。编目专家让人工智能阅读每本书的版本说明页,并生成都柏林核心的草稿;每次录音的时间从 9 分钟减少到 3.5 分钟。专家将剩下的时间用于权威检查和验证;总时间减少了大约 55%,但没有任何记录未经验证就进入系统。

案例 2 — 假 ISBN 被抓获。一位专家让人工智能制作了 30 本书的草稿。在检查过程中,他发现4条记录中的ISBN是假的:AI写了一个看似合理的13位数字,尽管他不知道这本书的真实编号。验证步骤防止了四个不正确的 ISBN 在目录中持续存在。

案例 3 — 纠正权限不一致。图书馆在某些记录中找到了一位作者为“J. Smith”,在其他记录中找到了“John Smith”,在其他记录中找到了“Smith, John”。 AI 与权威文件相匹配,将所有记录纳入单一批准的格式(“Smith, John, 1965-”);如果这项工作是人工完成的话,需要几天的时间,但有了人工智能的建议,时间缩短到了几个小时,而且每场比赛都得到了专家的认可。

追溯转换和旧记录

许多图书馆都有不完整或过时的记录,这些记录是多年前按照不同的规则输入的。将这些转换为当前标准称为追溯转换,手动完成非常费力。人工智能可以读取旧记录并生成草稿,将其移动到当前的字段结构:例如,它可以解析自由文本引文并将其分发到正确的字段。然而,这里有两个危险。首先,AI可以通过弥补缺失的信息来“弥补”;其次,它可能会通过将旧记录复制为新格式而不是更正它来使旧记录中的错误永久存在。因此,在回顾性转化中,应该系统地检查人工智能的输出,不是通过抽样,而是通过关键字段(作者、年份、识别号码)。一个好的做法是并排显示转换前和转换后的记录,使每个更改都可见;因此专家一眼就能看出什么被移动了、什么被改变了、什么可能被捏造了。

注意:AI生成的元数据草稿未经一一审核,请勿批量传输至系统。一次大规模错误会同时损坏数百条记录,并且检索比生成要麻烦得多。小批量生产和验证是最安全的。

四个可复制模板

1)都柏林核心概要:

您的角色:助理编目员。使用以下署名文本填写都柏林核心字段:标题、创建者、主题、描述、出版商、日期、流派、格式、语言。仅使用文本中明确的信息;留下缺失字段“[无信息]”,不要猜测。印记文字:[此处]

2) MARC字段概要:

从以下图书信息中提出以下 MARC 字段的大纲:245(标题/学分)、100(主要作者)、260/264(出版物)、300(物理描述)、650(主题)。将您不确定的任何字段标记为“[需要验证]”。信息:[此处]

3)受控词汇的主题匹配:

以下是来源摘要和已批准主题术语的列表。仅将列表中的 3-5 个最合适的术语与源进行匹配。如果列表中没有合适的术语,请写“列表中没有合适的术语”,不要编造新术语。摘要:[此处]/术语列表:[此处]

4)权限形式控制:

将下面的作者姓名与我提供的权威列表中批准的表格相匹配。对于每个名称:记录中的格式 -> 批准的格式。如果列表中没有同等记录,请写“无权限记录”。姓名:[此处] / 权限列表:[此处]

弱提示/强提示

弱提示:

提取以下书籍的编目信息:“人工智能与社会”。

仅给出标题; AI被迫补足作者、年份、出版商和ISBN。没有目标标准。结果:令人信服但可能是错误的记录。

强力提示:

您的角色:助理编目员。以下是该书版本说明页的全文。从此填写都柏林核心字段。仅使用文本中明确说明的信息;将非文本字段留空并写入“[无信息]”。日期、姓名或 ISBN 均不是虚构的。印记文字:[此处为全文]

强大的提示将人工智能限制在真实的署名信息上,并迫使它诚实地留下空白而不是弥补。

元数据字段和验证表

面积

造假风险

如何验证

标题

与印记页比较

作者/权威格式

中等

在权威档案中检索

出版年份

通过印记/指纹确认

国际标准书号

非常高

使用条形码/来源进行一对一控制

主题词

受控词汇匹配

常见错误

  • 只是从标题请求元数据。不完整的信息驱使人工智能去弥补。
  • 没有明确目标标准。任意格式会破坏记录的和谐性。
  • 接受 ISBN 和年份而不进行验证。这些区域的制造风险最高。
  • 从受控词汇之外获取主语术语。一致性和可用性受到损害。
  • 绕过权限控制。同一作者分散在不同的格式中,用户错过了来源。

综上所述

在元数据生成中,人工智能是一个强大的助手,可以快速提取印记信息,显着缩短编目时间。但生产力的代价是对制造风险的严格验证:明确目标标准(MARC,都柏林核心),仅使用真实的单词知识运行人工智能,从受控词汇表中映射主题术语,并验证权威形式。 AI不应该去弥补缺口,而应该老老实实地将其留空;您保留最终批准权。

应用任务

将您拥有的一本真实书籍的版本页文本与“都柏林核心草稿”模板一起交给人工智能并获得草稿。然后制作同一本书,仅使用标题(“弱提示”)并比较两个输出:哪些字段是捏造的?然后,使用“受控词汇的主题映射”模板,给出一个已批准术语的简短列表,以匹配主题并检查 AI 是否超出列表。

清单

  • [ ] 我把消息来源的真实身份信息交给了AI,我没有让它去猜测。
  • [ ] 我已经明确指定了目标元数据标准(MARC/Dublin Core)。
  • [ ] 我已逐字核实出版年份和 ISBN 与原始来源。
  • [ ] 我从受控词汇中映射了主题术语。
  • [ ] 我已通过批准记录确认了授权形式。