收益:
- 能够利用人工智能根据 ISAD(G) 或都柏林核心等标准生成元数据草案
- 能够防止幻觉,并将主题术语映射到具有留空权限的受控词汇
- 能够区分哪些字段(例如日期、人员姓名和参考代码)需要人工批准,哪些字段只能由机构分配
档案馆或图书馆,无论多么丰富,除非有明确的定义,否则都无法找到。使文档“可查找”的是关于它的描述性信息:谁编写的、何时、何地、主题是什么、属于哪个集合。这些信息称为元数据(元数据 — 关于文档的描述性数据;“关于数据的数据”)。编目是使用此元数据识别文档并将其保存在可搜索系统中的过程。分类是根据主题、类型或来源等标准来组织文档。
生成元数据极其耗时;为大量文档中的数千份文档单独输入日期、主题、人物和地点信息可能需要数年时间。人工智能是这个行业中强大的草稿生成器。在本单元中,我们将了解如何使用人工智能生成元数据、如何根据标准(ISAD(G)、都柏林核心)进行编目,以及自动分类的威力和陷阱。
档案标准:为什么需要它们
元数据不是随机输入的;有国际标准,以便不同机构的记录可以相互交流:
- ISAD(G)(通用国际标准档案描述):按层次描述档案材料的规则(基金、系列、文件、文档级别)。它包含参考代码、标题、日期、范围、创建者等字段。
- 都柏林核心:由 15 个核心字段组成的通用标准,用于描述数字资源(标题、创建者、主题、日期、流派、格式、来源、语言等)。
- 基金会:由于个人、家庭或机构的活动而自然形成的一组记录。它是档案的基本组织单位。
- Provenance(起源):有关文件来自谁以及经过哪一手的信息。在归档过程中,文件根据其来源保存在一起。
让AI生成元数据时明确指定目标标准,确保输出可直接输入企业。
另一个关键概念是规范记录——定义个人、地点或机构名称的单一、标准、批准形式的记录。在历史文献中,同一个人或地点可能会以不同的拼写出现;规范记录将它们全部绑定到单一批准的格式中,这样它们就不会在搜索中分散。人工智能从文档中建议名字;但是将此名称映射到规范记录中的标准形式是人类的工作。将人工智能所说的“艾哈迈德”与该机构的权威记录中的“艾哈迈德·贝(1840-1912)”联系起来可以保持目录的一致性。
工作流程:一步一步
1. 准备源码。收集文档的文字记录或图像以及任何上下文信息。
2. 明确标准和领域。告诉AI哪个标准(ISAD(G),都柏林核心)以及根据哪些字段它将产生输出。
3. 生成草稿元数据。 AI填写可以从文档中提取的字段(日期、人物、地点、主题、语言、流派);它将无法删除的区域留为空白。
4. 映射到受控词汇。在大多数机构中,主题和地名不是免费的,而是与预定义的列表(受控词汇/同义词库)相关联。将 AI 建议的主题词映射到此列表。
5. 验证并确认。每个字段,特别是日期、名称和主题,都由人类与权威文件和记录进行比较。
提示:明确给予AI“留空”权限。否则,它会“猜测”填写文档中没有的日期或创建者,并将虚假元数据插入到您的目录中。 “如果文档中没有此字段,则将此字段留空”的说明是防止幻觉的最强盾牌。
表中的字段和信任级别
元数据字段
人工智能有多可靠?
验证
语言
高
样品
文件类型
中高
控制
人名/地名
中(读取错误)
强制性的
日期
低-中(制造风险)
强制性的
主题条款
中等(免费生成)
映射到清单
范围/摘要
中高
与源码比较
参考代码
无(机构给出)
人为投掷
总结:人工智能在语言、体裁等领域快速可靠;生成日期、名称和主题等字段的草稿,但需要人工批准; AI永远不会产生参考代码等制度领域。
三个迷你箱子
案例 1 — 8,000 张照片的草稿元数据。一个城市档案馆正在对 8,000 张历史照片进行编目。每张照片背面的注释都会被转录并交给人工智能; AI 生成日期、地点和主题大纲。人类团队逐场验证并将其映射到受控列表。预计10个月的工作时间减少到3个月;但每个日期和地名都经过目视检查。
案例2——编造的历史。一名档案管理员让人工智能对一封未注明日期的信件进行了编目。 YZ看了信的内容,准确地写下了日期“1912”。但文件中没有注明日期;人工智能预测。如果档案保管员没有添加“如果文档中没有则留空”的说明,目录中就会填充一个虚构的日期。教训:空白权限是强制性的。
案例 3 — 自由主题术语造成混乱。人工智能为类似文件分配了类似但不同的自由术语,例如“移民”、“移民”、“定居”。当它没有映射到受控词汇时,同一主题被标记为三个不同的术语并分散在搜索中。通过将术语映射到单个权威列表中来实现一致性。教训:主题术语不会发布,它们会链接到列表。
四个可复制模板
1)都柏林核心概要:
从下面的文档转录中提取都柏林核心元数据草稿。字段:标题、创作者、主题、描述、日期、类型、语言、范围(地点/时期)。规则: (1) 仅在文本中明确使用信息。 (2) 将文本中没有的字段留空,不要猜测。 (3) 用[?]标记您不确定的值。转录:[此处]
2) ISAD(G)定义草案:
在 ISAD(G) 字段中生成以下文档的草稿:标题、日期、描述级别(文档/文件)、范围和内容(简短摘要)、创建者、语言。将参考代码留空(机构将提供)。不要添加任何文本中没有的信息;将不存在的字段留空。文档:[此处]
3)主题术语建议(受控):
建议 3-5 个适合以下文档的主题术语。首先,依赖文件中的事实。以下是我们机构的受控术语列表;首先,从此列表中选择它,如果列表中没有,请单独标记您的新术语建议。列表:[术语]。文档:[此处]
4)批量一致性检查:
以下是同一集合中文档的元数据记录。标记不一致:同一地点/人的记录拼写不同、日期格式不同、同一主题的不同术语。修正拼版;只需生成一个不一致的列表供人工审核即可。记录:[此处]
弱提示/强提示
弱:
为此文档创建完整的目录记录。
“完整”指令推动AI填补每一个空间,即发明不存在的历史和创造者。
强:
都柏林核心是为本文件起草的。仅使用转录中明确包含的信息;将不存在的字段留空,不要猜测。从此受控列表中选择主题术语:[列表]。用 [?] 标记日期和人名,以便我可以通过文档进行验证。转录:[此处]
区别:“留空”权限而不是“完整”版本,受控列表遵守和验证标记可防止目录被伪造。
常见错误
- 意思是“完全填满”。这会导致拟合不存在的字段;应给予“留空”许可。
- 发布主题条款。未映射到受控词汇表的术语会分散搜索的注意力。
- 让人工智能预测历史。在未注明日期的文档中输入虚构的日期会污染目录。
- 拥有AI生成的参考代码。这是一个企业、独特的空间;人们扔。
- 没有明确标准。如果不提及标准,输出将是一份无法输入机构的杂乱草案。
总之
元数据和编目是向研究人员开放档案的隐形基础设施,需要付出大量的努力。人工智能根据转录内容生成日期、人物、地点、主题和流派等字段的快速大纲;它可以根据 ISAD(G) 或都柏林核心等标准工作。但“完全填写”的压力迫使人工智能去弥补; “留空”权限、映射到受控词汇以及人工确认日期/名称使目录值得信赖。 AI准备草稿;您对目录的准确性负责。
应用任务
使用“都柏林核心草案”模板进行文档转录并向 AI 请求元数据;检查它是否留下了不存在的空白字段。然后使用您自己的(或示例)清单运行“主题术语建议”模板。最后,通过“批量一致性检查”测试一些记录。请注意人工智能尝试用预测填充多少字段以及需要将多少主题术语映射到列表。
清单
- [ ] 我已经明确说明了目标标准(ISAD(G)/Dublin Core)。
- [ ] 我授予了“将空白字段留空”权限。
- [ ] 我将主题术语映射到受控列表。
- [ ] 我已使用文档/权限记录验证了日期和人名。
- [ ] 我把参考代码留给了机构,而不是AI。