单位 6 / 11

金石志、古代手稿和文本的阅读和翻译

收益:

  • 使用 OCR/HTR 将铭文和手稿转录成草稿文本时,能够将读取的字符和估计的完成情况分开并标记
  • 能够识别各种形式的幻觉,例如模糊的文本完成、错误的翻译和捏造的归属,并根据源和回译检查翻译。
  • 能够理解语言、写作和体裁的语境如何决定人工智能的可靠性,并且最终的阅读和解释属于语言学家专家

过去留给我们的最直接的声音之一是书面来源:刻在石头上的铭文、泥板、莎草纸、羊皮纸手稿、墓碑和印章。在本单元中,我们将了解金石学(研究刻在石头、金属、陶瓷等硬表面上的铭文的科学)、古文字学(阅读和测定古代手迹的专业知识)和人工智能如何加速这些文本的阅读、翻译和编辑,但为什么每次阅读都必须由专家语言学家确认。

基本原理:人工智能帮助阅读微弱的文本,翻译语言,并建议可能的补充;但铭文的最终解读、缺失字母的补全和含义则由了解语言和时期的专家决定。正是在这个区域,人工智能产生幻觉的风险最大,因为该模型很容易用一些“看似合理”但虚构的东西来填充缺失或模糊的文本。

使用书面资料的步骤

1. 文档。铭文或手稿以高分辨率、对比度增强的格式显示。对于模糊的表面,可以使用特殊的照明(侧光)和 RTI 等技术;人工智能有助于锐化对比度和字母边缘。

2. 字符识别。 OCR(光学字符识别)用于打印文本,HTR(手写文本识别)用于手写文本。基于人工智能的 HTR 在抄写旧手稿方面非常强大。

3. 转录和完成。对于褪色或破损的部分,专家建议根据语法和平行文本进行可能的修复。完整的字母始终用方括号等符号表示;所读到的和所预测的永远不会混淆。

4. 翻译。文本是从源语言(拉丁语、古希腊语、奥斯曼语、楔形文字等)翻译而来的。 AI给出初稿翻译;专家的细微差别纠正了术语和历史背景。

5.评论。文本所说的内容、作者是谁以及所指的事件都是历史解释,属于专家的范畴。

提示:如果你告诉人工智能“阅读并完成”晦涩的文本,它会安全地弥补空白。相反,应该说“只提供清晰可读的字符,留空并标记您不确定的区域”。要求在单独的步骤中完成,并说明理由,并确保得到专家的确认。

幻觉:这个区域最大的危险

人工智能在人文学科中最具毁灭性的错误是捏造。该领域有四种典型形式:

  • 文字捏造:将模糊铭文中不存在的部分“补全”,添加一个不存在的文字。
  • 假翻译:翻译一个他不流利但错误的单词;读者无法注意到,因为他不知道来源。
  • 捏造的参考文献:上面写着“此铭文发表在该出版物上”,但该出版物并不存在。
  • 错误的日期/归因:自信地将一种写作风格置于错误的时期。

如果没有看到来源并了解语言的专家确认,所有这些都不能使用。

注意:仅仅因为翻译流畅且令人信服并不意味着它是正确的。人工智能甚至可以将它无法理解的楔形文字符号转化为自信的句子。无法阅读源文本的人永远无法自行验证人工智能翻译的准确性。

三个迷你箱子

案例 1 — HTR 打开档案。一份档案馆向研究人员关闭了数千页的奥斯曼手稿,因为阅读它们需要专业知识和时间。基于人工智能的 HTR 将笔记本转录为可搜索的草稿文本;专家对草稿进行了修正,不可读的地方也被标记出来。虽然不是全文,但强大的扫描工具已经出现。

案例 2 — 预制完井被抓。一名学生让人工智能读取了一块破损的拉丁文墓碑; AI用流利的句子“补全”了缺失的一行。铭文学家表明,拟议的完成在物理上是不可能的,因为石头中没有留下任何空间。完成品是根据平行铭文重建和标记的。

案例 3 — 错误翻译已得到纠正。一个团队将报告人工智能对古希腊铭文的翻译;当语言学家检查时,他发现人工智能以错误的时态翻译了一个动词,颠倒了文本的含义(无论是祭品还是纪念)。返回源保存评论。

四个可复制模板

1)保守转录:

您的角色:转录助理。在此铭文/手稿图像中,仅给出清晰可读的字符。不要阅读不清楚、破损或不确定的部分;将其标记为“[不可读]”。完成缺失的部分。另请注意您怀疑的字符。

2)合理的完成建议:

下面是带有精确阅读部分和[空格]的文本。针对空白提出可能的补充,但对于每个建议:(a) 理由(语法、平行文本),(b) 空白是否适合字母数量,(c) 替代方案。这些是建议;不是一个明确的阅读。说明需要专家批准。

3) 翻译草稿(受来源保护):

翻译下面的[语言]文本。将源文本放在每个句子旁边(逐行对齐)。标记您不确定的单词并给出替代翻译。请勿虚构条款;如果您不知道,请写“不确定”。这是草案;语言学家专家会检查。

4)翻译验证(反向翻译):

将此翻译翻译回源语言,并将其与原始源文本进行比较。标记含义发生改变、添加或删除的部分。特别要检查时态、主语和数字。

弱提示/强提示

弱提示:

阅读这段古老的铭文并告诉我们它说了什么。

在微弱的铭文中,人工智能弥补了空白,可能会误译语言,而没有看到来源的人不会注意到这一点。

强力提示:

在此铭文图像中,首先仅转录清晰可读的字符,留下模糊部分“[不可读]”。然后分别提出可能的补充,并给出合理的理由,但不要提供任何明确的建议。最后,提供翻译草稿并标记您不确定的单词。所有这些都需要经过专家的批准。

区别:第一个给出了虚构的“读数”;后者使读取、预测和翻译层保持独立且可验证。

语言、文字与人工智能的知识前沿

考古文本涵盖多种语言和文字:拉丁文和古希腊铭文、奥斯曼和阿拉伯手稿、楔形文字板、埃及象形文字、符文铭文等等。 AI对这些语言和文字的熟练程度很参差不齐。虽然对于拉丁语和古希腊语等数字文本丰富的语言来说,草稿翻译可能是合理的,但对于记录、破译或只有少数专家阅读的文本来说,人工智能几乎完全不可靠;在这些领域产生令人信服但完全捏造的“翻译”。

还有背景和类型的问题。同一个词在法律文件、祈祷文和墓碑中可以有不同的含义。语言学家专家能够识别文本的类型(奉献、纪念碑、合同、信件)并在正确的上下文中阅读该单词;人工智能缺乏这种通用的敏感性,并强加了最常见的含义。缩写、公式和常用表达方式(尤其是在铭文中非常常见)很容易误导人工智能。

所以黄金法则是:用人工智能作为你知道的语言、你可以控制的语言的加速器;切勿仅依赖人工智能翻译您无法阅读的语言。无法阅读原文的人无法验证翻译的准确性,因此无法将该翻译转化为科学主张。

提示:向人工智能提供文本时,请指定其语言、预计期限和类型(题词/信件/文档)。上下文知识部分减少了人工智能对最常见但不正确的阅读的偏离——但并不能消除确认的需要。

书面资源任务表

任务

人工智能的作用

人类的决定

验证

图像增强

对比度/边缘

选择标准

与原版比较

光学字符识别/高温识别

案文草稿

不确定的性格

专家校对

完成

建议(理由)

接受/拒绝

并行文本、位置控制

翻译

草案

细微差别,术语

回译、来源

评论

背景摘要

历史意义

专家、文献

常见错误

  • 完成模糊的文字。人工智能填补空白;读数和预测应分开并标记。
  • 不看原文就相信翻译。流利的翻译并不是正确的翻译。
  • 接受虚构的归因。说“在那个广播中”需要确认。
  • 不检查完成的物理位置。该提案必须适合破碎的空间。
  • 将解释留给AI。文本的历史意义是专家语言学家的事情。

综上所述

金石学和古代文本中的人工智能;它显着加快了图像改进、HTR/OCR 草稿、完成提案和草稿翻译的速度,并开放封闭档案进行研究。但这是产生幻觉的风险最高的领域:阅读与预测分开,补充被标记,翻译与源和反向翻译进行检查,最终的阅读和解释属于专家语言学家。

应用任务

选择题词或手稿图像(来自开放获取收藏)。使用“保守转录”模板仅提取清晰的字符,然后使用“合理的完成建议”获取空格建议。制作翻译草稿并使用“翻译验证”模板进行回译,并标记含义发生变化的位置。如果可能的话,与已发表的阅读材料进行比较。

清单

  • [ ] 我分别标记了读取的字符和预测的完成。
  • [ ] 我检查了完成部分是否适合损坏的区域。
  • [ ] 我对照源文本和回译检查了翻译。
  • [ ] 我确认了 YZ 在实际目录中给出的出版物/引文。
  • [ ] 我将最终的阅读和解释留给了专家批准。