单位 3 / 12

转录:奥斯曼土耳其语和手稿

收益:

  • 能够设置 HTR 和音译工作流程并解释为什么原始草案需要专家逐行检查
  • 在奥斯曼土耳其语中出现元音/字母歧义的情况下,能够通过询问替代方案来保护不可读的区域,而不是强加精确的阅读
  • 能够将原始音译与单独的简化层分开,让古文字学家承担最终的科学责任

也许历史研究中要求最高的部分是将手稿和旧的书面文件抄写成可读的文本。一封信、一本笔记本、一份法庭记录或一份奥斯曼文件只有在经过转录后才能被搜索。转录是将文档内容(通常是手写或古代文字)转换为书面可读文本的行为。就奥斯曼帝国而言,这通常伴随着音译:将阿拉伯字母的文本转换为拉丁字母及其对应的字母。

我们对印刷文本使用 OCR;手写需要不同的技术:HTR(手写文本识别)。 HTR 是一种类似于 OCR 的技术,但更具挑战性,可将手写文档转换为机器文本。在本单元中,我们将了解如何在奥斯曼和手稿转录中使用 HTR 和人工智能、误差幅度以及为什么验证在这里更为重要。

为什么写字这么难?

手写体比印刷体文本的变化要大得多:每个作者都有独特的手写体,字母链接在一起,使用缩写和特殊符号,墨水会渗出,纸张会磨损。在奥斯曼土耳其语中,难度成倍增加:

  • 上下文字母形式:同一个字母在词首、词中和词尾的写法不同。
  • 不写元音:短元音常常不写;读者根据上下文完成。这会产生诸如“接受还是拒绝?”之类的歧义。
  • 不同的书写风格:有不同的书写风格,如rik'a、divani、ta'lik;每个都需要不同的阅读专业知识。
  • 奥斯曼词汇:来自阿拉伯语和波斯语的单词,在今天的土耳其语中不存在。

因此,与打印 OCR 相比,HTR 和人工智能在奥斯曼土耳其语中的错误率要高得多。古文字学家的眼睛(古文字学 - 阅读古代文字的科学)在这里不是工具,而是必需品。

工作流程:一步一步

1.准备文件质量。与 OCR 一样,高分辨率和良好的对比度至关重要。这对于书法来说更为重要。

2. 选择HTR 型号。针对特定时期专门训练的奥斯曼、阿拉伯手写或 HTR 模型比一般模型成功得多。测试哪种模型适合某个时期和写作风格。

3. 生成原始转录。 HTR 模型生成轮廓。在奥斯曼土耳其语中,这份草案是一个充满错误的开始,经验丰富的眼睛必须彻底检查。

4. 利用人工智能改善情境。您可以在原始输出中发现 AI 标记的不一致、可能的阅读替代方案以及可疑位置。但人工智能的“纠正”在这里尤其危险:它可能会建议人为的阅读。

5、音译和简化(分层)。将阿拉伯字母文本音译成拉丁字母,然后将其简化读成今天的土耳其语,这些过程是作为单独的图层生成的。原来的永远不会破裂。

6.专家验证。最终的转录由具有古文字学和时代知识的专家通过与文献进行比较来批准。

注意:在奥斯曼土耳其语中,当从上下文中“猜测”一个带有未写出的元音的单词时,人工智能可能会产生完全错误的读数,并以自信的语言呈现出来。字母的差异,例如“kabul”代替“kabil”或“alem”代替“alim”,完全改变了含义。每一个不确定的阅读都应该有替代方案,并且不应该强加单一的明确阅读。

表格中的层级和责任

内容

人工智能的作用

专家的作用

图片

原始文件

来源

高温气冷堆草案

原始机器读取

产生

从开始到结束的控制

音译

拉丁字母转位

草案建议

更正,更正

不确定性注释

[?] 和替代方案

迹象

决定

简化

今天的土耳其语

草案建议

批准

科学出版物

最终文本+注释

仅限专家

三个迷你箱子

案例 1 — HTR 将初稿速度加快了 5 倍。一名博士生会抄写一本 200 页的奥斯曼笔记本。完全手动转录预计需要 60 个工作日。通过该时期训练的 HTR 模型,草稿在几个小时内就出来了;学生修改了这个草稿,将工作时间缩短到了12个工作日。但他必须将每一页与文档逐行进行比较;大约 30% 的草稿是错误的。

案例 2——一个字母,一个意思。一位研究人员依赖人工智能解读为“州长”的一个词。在专家的控制下,了解到这个词实际上是“监护人”(对孩子/人负责),并且由于元音没有被标记,所以AI猜错了。该文件的法律含义正在彻底改变。教训:在奥斯曼土耳其语中,单个字母/元音的差异会导致文档从头开始解释;需要专家。

案例 3——人为完成。一行墨水已经用完,其中一个单词无法辨认,人工智能用一个“逻辑”单词填补了空白。专家意识到这个空白实际上是一个地名,是人工智能弥补的。剩余空间为[难以辨认]。教训:不可读的空间不是被填充,而是被标记。

四个可复制模板

1)保留歧义的音译:

以下是奥斯曼文档的 HTR 原始输出/音译。您的任务是审阅文本并标记可能的阅读错误。规则: (1) 为每个你不确定的单词提供 2-3 个可能的阅读替代方案,不要强加一个。 (2) 在难以辨认的地方留下[难以辨认],不要填写。 (3)添加文中不存在的词语。 (4) 给出元音不明确的单词的替代词。文本:[此处]

2)分层阅读(原文+简化):

为以下经过验证的奥斯曼音译生成两列:(1) 原始音译(触摸),(2) 简化阅读当今的土耳其语。添加含义,添加简化解释;只需更新语言即可。标记含义不明确的地方[不明确]。音译:[这里]

3)术语和人称提取:

下面转录中提到的人名、地名、标题和周期术语出现在单独的列表中。只考虑文中明确提到的内容;不要通过猜测来添加。如果您不确定发音,请用 [?] 标记。文本:[此处]

4)可疑的读控制:

该角色是一位经验丰富的古文字管理员。在下面的转录中,标出含义不一致、不符合句号或不符合上下文的单词,并写出它们的可疑原因。实施明确的纠正;生成可疑点列表,供人类专家与文档进行比较。文本:[此处]

弱提示/强提示

弱:

阅读这段奥斯曼文本并给我翻译。

这促使人工智能产生单一、明确的读数,隐藏歧义并填补空白。在奥斯曼土耳其语中,这几乎是一个必然的错误。

强的:

查看下面的奥斯曼音译。权威读物:强加。为每个不明确的单词提供可能的替代词,省略[难以辨认]的部分,不要添加文本中没有的任何内容。在单独的专栏中提供当今土耳其语的简化阅读,但保留原始内容。用[?]标记任何您不确定的地方,以便专家可以将其与文档进行比较。文本:[此处]

区别:严格的读取禁止、请求替代方案、保留空白以及分层输出支持专家验证。

常见错误

  • 误认为 HTR 草案是正确的。在奥斯曼土耳其语中,大部分草稿可能不准确;逐行控制是必须的。
  • 唯一确定的解读就是强加。如果替代项隐藏在未写出元音的单词中,则会记录错误的含义。
  • 填充无法读取的区域。它应该受到空白[难以辨认]的保护,而不是被弥补。
  • 将原始与简化混合在一起。简化应该是一个单独的层;原文的音译不应被扭曲。
  • 禁用专家。在没有古文字和时代知识的情况下,AI的阅读只是猜测,没有任何科学价值。

总之

借助 HTR 和 AI,可以在原始草稿阶段大大加快 Ottoman 和手稿转录速度;您将获得第一个输出,将工作天数缩短为数小时。但正是在这个领域,单个字母、单个元音的差异改变了含义;人工智能往往会隐藏不确定性并填补空白。正确的方法是分层的:原始轮廓、歧义的替代注释、单独的简化层,以及最重要的是,由熟悉古文字学的专家对文档进行逐行验证。 AI加快初读速度;科学责任属于专家。

应用任务

获取奥斯曼帝国或手稿文档的音译(您自己的作品或出版的副本)。要求人工智能使用“保留歧义的音译”模板进行替代阅读。然后用“分层读取”单独生成简化层。将每个模糊标记的单词与专家资料或词典进行比较;请注意,如果人工智能强加一次读数,它会产生多少错误。

清单

  • [ ] 我使用了适合时代和写作风格的 HTR/模型。
  • [ ] 我向 AI 询问了精确读数的替代方案。
  • [ ] 我用[不可读]保护了不可读的部分。
  • [ ] 我将原始音译与简化分开。
  • [ ] 我让一位了解古文字学的专家/纪录片验证了最终文本。