单位 6 / 11

数字档案、数字化、OCR 和长期保存

收益:

  • 能够通过使用 OCR 和 HTR 将扫描文档转换为文本并将输出与实际图像进行比较来纠正扫描文档
  • 能够保留档案文件的原创性和完整性,防止人工智能更改内容和伪造修复
  • 能够利用出处信息和持久格式来规划长期数字保存

档案管理员的任务是将五十年前的报纸卷、手写信件或旧照片带到未来。这些文件会随着时间的推移而磨损;为了保存它们并使其易于访问,需要进行数字化:扫描物理文档并将其转换为数字副本的行为。但仅进行筛查是不够的;还需要进行筛查。从长远来看,数字对象必须是可查找、可读和可维护的。在本单元中,您将学习如何在数字化、转录和数字保存工作流程中使用人工智能;但您将了解为什么您要对原创性和准确性负责。

几个概念。 OCR(光学字符识别)是一种将文档图像中的文本转换为机器可编辑文本的技术。 HTR(手写文本识别)对手写文档执行相同的工作,但难度要大得多。数字保存是一项有计划的工作,旨在确保数字对象在数十年内保持可读性,即使文件格式已过时且软件发生变化。人工智能在这三个领域都是一个强大但有缺陷的助手。

一步一步:从数字化到保存

1. 确定优先顺序。你无法立即将所有内容数字化。最脆弱、最需要和最独特的文件被放在第一位。这是司法决定;人工智能帮助进行列表编辑,但优先级由机构决定。

2. 扫描并应用 OCR/HTR。以高分辨率扫描文档,然后使用 OCR 或 HTR 提取文本。基于人工智能的工具在这里变得越来越好,即使是旧的和困难的文本。

3. 更正并验证文本。 OCR/HTR 输出从来都不是完美的。错误很常见,尤其是当有旧的文字、污迹斑斑的页面或手稿时。必须将输出与实际图像进行比较并进行纠正。

4. 添加元数据和保护信息。向数字对象添加其出处、扫描条件、格式信息和出处——文档来自何处以及如何处理。 This information is critical for future verification and protection.

5、长期保护规划。 Choose file formats that are open, common and durable;备份; Make a migration plan in case formats become obsolete.

Tip: Don't accept the OCR output as "clear text".如果搜索系统要处理此文本,错误识别的单词将导致找不到源。对于关键馆藏,纠正人眼的 OCR 输出决定了所有后续访问的质量。

数字对象的真实性和完整性

档案工作的核心是真实性和完整性:确保文件确实来自所声称的来源并且其内容未被更改。在这一点上,人工智能造成了两方面的威胁。首先,在OCR/HTR校正或“增强”过程中,AI可以默默地修改文本;可以添加名称“更正”下不存在的单词。其次,如果用人工智能对图像进行“修复”或“恢复”,可能会产生非原始的细节。

档案保管员的规则很明确:数字保存副本必须忠实于原件。人工智能所做的每一项改进都应记录下来,并且应始终保留实际(原始)扫描。 “美化”一份文件可能会破坏其历史证据价值。

注意:用人工智能“改进”旧照片或文档可能很诱人;但人工智能会通过弥补来填补缺失的部分。在档案文件中,这意味着创造虚假的历史证据。恢复输出永远不会取代原始来源;存储为单独的、明确标记的变体。

三个迷你箱子

案例 1 — 报纸档案变得可搜索。一家图书馆已将拥有 30 年历史的当地报纸收藏数字化。通过 OCR,90,000 个页面被转录并可供搜索;以前需要几天时间的主题搜索现在已经减少到几秒钟。然而,该团队注意到旧页面和污点页面的 OCR 准确率下降至 80%,因此优先使用人眼纠正顶部年份。

案例 2 — HTR 打开手稿。一家档案馆将 HTR 应用于一系列难以阅读的 19 世纪信件。经过专家数月的阅读,系统速度得到了显着提高;但打印输出的每一页都由古文字学家(古代文字专家)与原件进行了比较,因为人名和地名都存在错误。

案例3——假“恢复”被拒绝。一个团队考虑用人工智能“修复”一张破损的历史照片。人工智能通过拟合来完成缺失的面部部位。档案保管员意识到这些捏造的细节会扭曲历史证据;修复后的图像与原始图像分开存储,仅明确标记为“AI衍生品”。

访问副本、保存副本和格式决定

数字化的一个很好的做法是为不同的目的分离同一对象的副本。保存母版是要带入未来的实际数字对象,以最高分辨率、未压缩或无损格式存储;它很少被触及。访问副本是呈现给用户的较小且易于打开的变体。这种区别很重要,因为实用的格式(小、压缩)可能不适合长期保存;理想的保存格式(大、无损)对于日常使用来说很麻烦。在此工作流程中,人工智能可以帮助清点文件、检测缺失的变体以及保持两个副本之间的元数据一致。然而,格式的选择是一个保存决策:应该首选开放的、广泛记录的和持久的格式(而不是专有的、封闭的格式),并且应该准备好迁移计划,以防格式随着时间的推移而过时。即使AI建议一种格式,机构的长期保存政策也有最终决定权。

提示:对于每个数字对象,保留一个简短的记录,回答以下问题:“原始来源在哪里,保存副本采用什么格式,访问副本采用什么格式,以及哪些格式可供用户使用?”混合这三层使得不清楚哪个文件是未来的可信主文件。

四个可复制模板

1)OCR输出校正帮助:

下面是实际页面的 OCR 文本和描述。仅修复 openOCR 错误(错误字符、复合词/拆分词)。请勿更改内容、添加或删除文字。如果您不确定,请用“[?]”标记。 OCR 文本:[此处]

2)文本图像一致性检查:

下面更正后的文本中是否有任何原始文档中没有的内容(可能是编造的)?标记每个可疑部分并写出可疑的原因。文本:[此处]

3)保护元数据草案:

为以下数字化对象生成保存元数据大纲:来源、出处、扫描日期/分辨率、文件格式、交易历史记录。只需使用我提供的信息,将缺少的字段留空。信息:[此处]

4)优先级帮助:

以下是等待数字化的馆藏列表;根据脆弱性、需求和独特性协助确定优先级。为每项资源提供简短的理由;将最终决定权留给我。列表:[此处]

弱提示/强提示

弱提示:

修正并美化此扫描文本。

《美化》邀请AI改变内容,弥补遗漏;归档文件的原创性被破坏。

强力提示:

您的角色:数字化编辑助理。在以下 OCR 文本中,仅修复显式识别错误(错误字符、错误拆分单词)。请勿添加、删除或更改任何文字。不确定的地方留下“[?]”。在单独的列表中显示您所做的每项更正。文本:[此处]

强大的提示限制人工智能只能识别错误,禁止其触摸内容,并使更正可追溯。

工作流程和风险表

舞台

人工智能的贡献

主要风险

保护措施

扫描

质量差

高分辨率

光学字符识别/高温识别

转换为文本

识别错误

人工修正

修正

错误建议

改变内容

与原版比较

恢复

图像衍生

配件细节

保留原始原件,贴上标签

保护

元数据草稿

失去原点

出处记录

常见错误

  • 接受 OCR 输出而不进行修正。错误会扰乱搜索和访问。
  • 称人工智能“创造美丽”。它改变了内容并破坏了原创性。
  • 用人工智能修复代替实际证据。捏造的细节创造了虚假的历史。
  • 不存储原始扫描。没有原件就无法验证更正。
  • 省略出处信息。文件的可靠性变得不可追踪。

总之

数字档案和数字化中的人工智能;它是加速 OCR/HTR 转录、元数据起草和优先级排序的宝贵辅助工具。但档案工作的本质是真实性和完整性:OCR输出应该由人眼纠正,人工智能永远不应该默默地取代内容,修复衍生品不应该取代原始证据,原始扫描和出处信息应该始终保留。使用人工智能作为一种工具,不会“改进”文档,而是在保持文档真实性的同时使其易于访问。

应用任务

获取 OCR 输出的简短样本(您自己的作品或实际扫描的作品)。仅使用“OCR输出校正帮助”模板校正识别错误,然后使用“文本图像一致性检查”模板检查AI是否添加了内容。然后使用“保留元数据草稿”模板创建包含对象出处和格式信息的记录。

清单

  • [ ] 我将 OCR/HTR 输出与实际图像进行了比较并进行了修正。
  • [ ] 我已经检查过,AI没有添加/更改内容。
  • [ ] 我单独保留原始(主)扫描且未更改。
  • [ ] 我向元数据添加了出处和格式信息。
  • [ ] 我已经明确地将恢复变体标记为“AI衍生品”。