收益:
- 能够逐步设置数字化和 OCR 工作流程(扫描、预处理、识别、校正、验证)
- 能够使用 AI 根据上下文纠正 OCR 错误,同时保持纠正和重写行并用 [?] 标记歧义
- 了解为什么数字、日期和专有名称必须进行目视验证以及质量控制的作用。
档案馆或图书馆的物理书架上的数百万页只有在数字化并可搜索时才能真正向研究人员开放。数字化是通过扫描或拍照将物理文档转换为数字图像。但页面照片还不是“文本”;它是“文本”。对于计算机来说,它仍然是图像,您无法在其中进行搜索。这就是 OCR 发挥作用的地方。
OCR(光学字符识别)是一种识别文档图像中的打印字母并将其转换为机器可读、可搜索文本的技术。在本单元中,您将学习如何使用 OCR 将历史印刷文档数字化、人工智能如何帮助纠正此过程中的 OCR 错误,以及人眼在哪些方面至关重要。 (手写文本需要不同的技术;我们将在下一个单元中介绍。)
数字化工作流程:一步一步
1. 准备和筛选。以尽可能最高的质量扫描文档。历史研究的一般经验法则是分辨率至少为 300-400 DPI(每英寸点数)。低分辨率会导致后续 OCR 阶段的错误率急剧上升。
2.图像预处理。在 OCR 之前改进图像可大大提高成功率:校正扫描页面、消除瑕疵、增加对比度、转换为黑白。基于人工智能的现代工具可以自动化这一步骤。
3.OCR应用。您将图像输入 OCR 引擎;引擎识别字母并生成文本。输出通常由两层组成:可见文档图像和下面的“可搜索隐藏文本层”。
4.修正(修正后)。原始 OCR 输出永远不会完美。由于旧字体、泛黄纸张、墨水污迹和扫描错误,导致字符读取不正确。这就是人工智能的强大帮手:它使用上下文建议并纠正 OCR 错误。
5.验证和质量控制。更正后的文本由人工抽样或完全检查。特别是关键区域,如名称、日期和数字,必须进行目视验证。
OCR 为什么会出错,AI 如何提供帮助
历史文档中 OCR 面临的典型问题:陈旧且花哨的字体、过时的字母形式(例如长“s”(ſ))、两栏页面布局、脚注、手写插入物、印章和褪色的墨水。由于 OCR 引擎一个接一个地“看到”字母,因此它经常将二进制“rn”混淆为“m”,将字母“l”混淆为数字“1”,将字母“O”混淆为“0”。
人工智能语言模型在这里提供了不同的能力:它们理解上下文。如果 OCR 引擎写下“1stanbu1”,AI 可以从上下文中推断出它应该是“Istanbul”。但这里存在一个很大的危险:当“纠正”AI时,它也可以改变文本。他可以添加“我更正了”一个不存在的词,或者用自己的猜测填补不清楚的地方。这会破坏转录的保真度。
注意:OCR 纠正的黄金法则是:AI 应该只纠正明显的识别错误,而不是解释或补充文本内容。 “1stanbu1→伊斯坦布尔”是合法的;这不是用猜测来填充一个不可读的单词。不确定的地方用[?]标注,不宜补。
OCR 错误类型和表格方法
错误类型
例子
人工智能可以修复它吗?
人为控制
角色混合
rn↔m,l↔1,O↔0
是的,很安全
样品
旧字体
长 ſ → s
是的,很安全
样品
褪色/无法辨认的文字
“ka___n”
不,应该放[?]
强制性的
专有名称/地名
“康斯坦丁尼耶”
小心
强制性的
编号/日期
“1867”与“1857”
有风险的
强制性的
页面布局(栏/脚注)
混流
部分地
强制性的
用一句话概括图片:AI 可靠地清除普通字符错误;但特殊名称、数字、日期和难以辨认的地方需要人眼来识别。
三个迷你箱子
案例 1 — 报纸档案变得可搜索。一家大学图书馆已将 1930 年代的 12,000 页当地报纸数字化。原始 OCR 准确率估计为 82%(每 100 个字符中有 18 个是错误的)。基于 AI 的纠正通过适合报纸语言的词典和上下文将准确率提高到 96%。对于剩余的错误,进行了样本检查而不是全文检查;该集合在三周内即可搜索。
案例2——人工智能“纠正”和扭曲了历史。一名档案管理员让人工智能更正了 OCR 打印输出上的日期“1863”。人工智能通过查看上下文中的另一个事件,将日期“更正”为“1868”——尽管文件明确指出是 1863 年。如果档案管理员没有查看原始图像,目录就会输入错误的日期。教训:数字和日期永远不会留给人工智能,它们是通过图像进行验证的。
情况 3 — 两栏页面混淆。 19 世纪年鉴的两栏页面在 OCR 中混合成一个流,并且句子交织在一起。原始输出不可读。当我第一次将页面布局划分为区域(分段)并单独处理每一列时,文本得到了改进。教训:在复杂的页面布局中,结构第一,文本第二。
四个可复制模板
1) 安全OCR校正:
以下是历史文档的原始 OCR 输出。您的任务是仅纠正明显的光学识别错误(例如 rn→m、1→l、0→O、长 ſ→s)。规则: (1)解释课文的意思。 (2) 纠正不可读/歧义的单词,保留原样并用[?]标记。 (3) 不得添加、删除或完成句子。 (4) 更改号码和日期;如果有疑问,请标记 [数字?]。原始 OCR:[此处]
2)OCR质量报告:
检查下面的 OCR 输出并生成质量报告:(1) 列出可能存在识别错误的单词,(2) 标记看起来不可读/不清楚的区域,(3) 列出需要人工检查的具体名称、日期和数字。不要纠正;仅生成清单。文本:[此处]
3)列/结构解析帮助:
由于下面的 OCR 文本来自两列页面,因此流程可能会混乱。将文本重新排列成逻辑段落,但不要更改、添加或删除任何单词。只需更正顺序即可。用 [order?] 标记您不确定的顺序。文本:[此处]
4)标准化为标准语言(可选,单独层):
用今天的拼写制作一个简化的阅读版本,在一个单独的栏中,位于下面更正的历史文本上方。切勿更改原文;让简化成为一个单独的层。只需更新拼写/发音而不添加含义。原文:[此处]
弱提示/强提示
弱:
修正并美化此 OCR 文本。
“美化”让AI可以重写文字、弥补遗漏、解读内容;破坏忠诚度。
强:
仅修复此原始 OCR 输出中的光学识别错误。不要解释含义、添加/删除单词、用 [?] 留下不可读的部分、更改数字和日期。以“原始→更正”的格式在单独的列表中显示您所做的每个更正,以便我可以验证。文本:[此处]
区别在于:有限责任、禁止捏造、标记歧义以及可追踪的更正列表使输出可审计。
常见错误
- 以低分辨率扫描。大多数 OCR 错误是由不良图像引起的;高质量扫描是最便宜的投资。
- 称人工智能“创造美丽”。这产生的是流畅性而不是保真度;该文档被重写。
- 将数字和日期留给人工智能。当从上下文中“纠正”时,它们会悄悄地被破坏;必须通过图像验证。
- 用猜测填写不可读的区域。它应该受到不确定性的保护[?],而不是弥补。
- 根本不控制而是采样。即使 96% 的准确率也意味着 12,000 页中存在数千个错误;扫描关键区域。
综上所述
OCR 通过将打印的历史文档转换为可搜索的文本,向研究人员开放档案。 AI 是根据上下文纠正原始 OCR 输出中的字符错误的强大辅助工具;但你必须在编辑和重写之间划清界限。高质量扫描、安全校正指令、用 [?] 保留歧义以及对姓名/日期/数字进行人眼验证,使数字化既快速又可靠。 AI清理文本;您是忠诚的守护者。
应用任务
扫描印刷的历史文档(旧报纸、官方信件、书页)或进行 OCR 打印输出。使用“安全 OCR 更正”模板更正文本,并通过“原始 → 更正”列表请求更正。然后,用“OCR质量报告”删除需要人为控制的区域。将列表中的每个日期和专有名称与实际图像进行比较;注意有多少被错误地“纠正”。
清单
- [ ] 我以至少 300 DPI 和良好对比度扫描文档。
- [ ]我只要求AI进行光学纠错,而不是重写。
- [ ] 我用[?]保护了不可读的部分。
- [ ] 我用图像验证了所有数字、日期和专有名称。
- [ ] 我对关键区域进行了抽样或全面检查。