单位 4 / 11

古代文本、简化和音译:使用奥斯曼和 Divan 文本

收益:

  • 了解简化和转录之间的区别,并且能够仅将人工智能用于有限的、可验证的任务(理解支持、词典假设、简化草稿)。
  • 能够用原文和可靠来源验证每个输出,避免补全缺失文本、理顺内容等陷阱
  • 能够理解人类语言学家在抄写、韵律和科学编辑等作品中是不可或缺的。

土耳其文学的很大一部分是用当今读者无法直接阅读的语言写成的:奥斯曼土耳其语(奥斯曼土耳其语 - 用阿拉伯字母书写的土耳其语,在奥斯曼帝国时期使用,富含阿拉伯语和波斯语单词和短语)。大多数迪万诗歌、历史书籍、报纸和档案文件都是用这种语言写的。将它们提供给当今的读者需要两个过程:转录(将文本从一种字母翻译成另一种字母,保留带有特殊符号的声音;例如,将阿拉伯字母文本更改为拉丁字母)和简化(用当今读者可以理解的单词替换文本中旧的和沉重的单词)。

在本单元中,我们将学习使用人工智能作为这些任务的助手,但这里的警告比以往任何时候都更加强烈:在遗留文本工作中,人工智能错误和幻觉的风险非常高;每个输出未经该领域有能力的人员通过与原始文本进行比较进行验证,不得使用。人工智能可以误读一个单词、“补全”一副对联、编造一个不存在的含义。这里AI是提纲和讨论的工具;它永远不会取代语言学家专家。

为什么该地区的风险较高?

出于三个原因:

  1. 读起来有歧义。在阿拉伯文字中,通常不写短元音;同一串字母可以是多个单词。正确的阅读需要上下文和专业知识。人工智能可以将最有可能的预测呈现为“确定”。
  2. 词汇量大。集锦文本中阿拉伯-波斯语短语、隐喻(古典诗歌中的刻板图像)和 aruz(基于音节长度的度量)的微妙之处在表面简化中丢失或扭曲。
  3. 完成的倾向。人工智能可以根据“应该”的内容自动填充缺失或磨损的文本。这是语言学上的一个严重错误。就是编造一个不存在的文本。
注意:告诉AI“翻译这首奥斯曼对联”并在没有验证的情况下发布输出是该领域最危险的错误。转录和简化的输出应始终与原文、可靠的词典以及现有版本(学术出版物)(如果可能)进行比较。

如何安全使用人工智能

在较旧的文本中,使用人工智能来完成这些有限但有用的任务:

  • 理解(要点)支持:学习今天相当于拉丁字母文本中的重词作为草稿。
  • 字典假设:列出一个单词的可能含义,然后根据可靠的字典进行验证。
  • 简化草案:用当前土耳其语起草一个段落的粗略草案,然后让专家对其进行修改。
  • 比较:将你的简化与人工智能的简化进行比较,看看被忽视的地方。

另一方面,不要让AI单独完成以下任务:从阿拉伯文字图像音译;科学版;完成缺失的文本;主张确定的意义。

提示:要求两个版本的简化:(1) 保留含义的紧密简化,(2) 解释单词等效项的列表。第二个列表使专家更容易快速确认,并使人工智能炮制的反应可见。

三个迷你箱子

案例 1——字典假设节省了时间。一名研究生收到了 AI 提供的相当于历史文本中 30 个拉丁字母重单词的草稿。 30 个由可靠词典确认的等效词;有4处错误,已更正。词典浏览时间明显缩短,但验证步骤并未跳过。

情况 2 — 捕获完成错误。一位研究人员向人工智能询问一副破旧对联的缺失部分。人工智能对韵律进行了恰当、流畅但完全捏造的完成。当研究人员查看版本注释时,他发现这一章实际上有所不同。 “人工智能填补缺失的文本”陷阱已经变得具体。

案例 3——简化扭曲了意义。一位编辑对一副对联进行了人工智能简化;由于人工智能将比喻(八股形象)翻译成字面意思,所以这副对联的本意就丢失了。编辑咨询了领域专家并进行了简化,保留了内容。

四个可复制模板

1) 重词等效(以确认为条件):

下面列出了旧土耳其语文本中带有拉丁字母的当前可能对应词 aggravated 的列表。对于每个单词,都注明“不确定,应从词典中查证”。添加文本中没有的单词,完成文本。文本:[在此处粘贴文本]

2)两版本简化:

通过两种方式简化以下文本:(1)保留含义和图像的封闭版本,(2)显示您更改的每个单词的旧/新等效项的表格。填补缺失的部分,添加不存在的意义。不确定的地方标记一下。文字:[粘贴文字]

3)简化控制:

以下是实际文本和我的简化。标记出我的版本中含义被扭曲、省略或歪曲的地方。不要强加你自己的版本;只需指出有问题的地方并将你的推理与文本联系起来即可。原文:[...]我的版本:[...]

4)情节/概念解释:

解释下列对联中的经典形象和隐喻。对于每个:可能的含义、传统用法以及注释“必须从专家来源进行验证”。不做明确判断,也陈述替代读法。 对联:【写对联】

弱提示/强提示

弱:“将这段奥斯曼文本翻译成今天的土耳其语。”

Strong:“用下面的拉丁字母简化旧的土耳其语文本;保留图像和隐喻,不要将其简化为字面意思。在旧/新表中显示您更改的每个单词。完成缺失或不明确的部分;将其标记为“不确定,必须由专家验证”。不要添加文本中没有的任何单词或诗句。”

强大的提示功能可以关闭完成陷阱,防止内容丢失,并提示表格,使验证更容易。微弱的提示为人工智能的适应和平滑敞开了大门。

任务和安全表

商业

仅人工智能

正确使用

拉丁字母文本中单词“heavy”的含义

有风险的

草稿+词典确认

阿拉伯文字的音译

未完成

语言学家专家

简化

草案

专家检修

补全缺失的文字

绝对没有完成

版/专家

说明

假设

专家消息来源确认

科学版

未完成

语言学家

阿鲁兹和米特:为什么人工智能特别困难?

大多数土耳其古典诗歌都是用阿鲁兹(一种基于音节长短和模式的测量系统)写成的。确定一副对联属于哪一种阿鲁兹模式,需要一一解读音节是长还是短,并了解一些微妙之处(例如将一个长音节数为两个短音节或删除一个元音)。这是一项常规但非常微妙的工作,这也是人工智能经常出错的地方:它可能会错误地命名模式,错误地测量音节,或者建议一个“听起来不错”但错误的模式。

因此,确定aruz米并不是AI可以盲目完成的工作;它最多给出一个“候选者”,而这个候选者必须由懂仪表的人在对联本身上进行验证。音节格(民间诗歌的格律以每行音节数为单位)的停顿和格律分析也是如此;人工智能甚至在计算音节时也会出错。韵律是检验文学分析准确性的地方:对韵律的错误主张会使论文从一开始就不可靠。

注意:请勿在未经验证的情况下将 AI 给出的韵律模式名称放入研究中(例如“failatün failureatün...”)。测量既是技术知识又是文化知识,在这个领域中人类的专业知识是不可或缺的。最多使用人工智能来指导“我应该在哪里寻找这副对联的尺度,可能有哪些模式?”这个问题。

常见错误

  • 未经验证就发布转录/简化版本。每个输出都会与原始文本进行比较。
  • 让人工智能填写缺失的文本。这是在编造不存在的文本;这绝对是没有完成。
  • 将意思简化为字面意思。经典的图像必须保留。
  • 认为只有读书才是确定的。阿拉伯文字中多重读法很常见;询问替代方案。
  • 在不咨询专家的情况下总结关键文本。人类语言学家在这个领域是不可或缺的。

综上所述

旧文本中的人工智能;对于理解支持、词汇假设和简化草图来说,它是一个有用但高风险的工具。转录、编辑和补全缺失文本等任务属于语言学家专家的职责。用原始文本、可靠的词典和当前版本验证每个打印输出;不要陷入完成和扁平化的陷阱。在这个领域,人类的专业知识优先于速度。

应用任务

找到一段简短的、未简化的拉丁字母古代文本(对句或历史段落)。以“双版简化”模板,从AI获取蓝图。然后用可靠的词典验证词表中的每个词;勾选错误的。检查是否将图像简化为其字面含义,并在必要时进行更正。

清单

  • [ ] 我没有让 AI 自己进行阿拉伯文字转录。
  • [ ] 我没有填写缺失/不明确的部分。
  • [ ] 我从可靠的词典中确认了该词的对应词。
  • [ ] 我检查了图像和图像是否被保留。
  • [ ] 我咨询了专门研究批评文本的语言学家。