单位 3 / 11

语言学和语料库分析:用数字阅读词汇

收益:

  • 能够利用人工智能起草语料库测量,例如词频、搭配、词汇丰富度和关键词
  • 知道人工智能在精确计数方面并不可靠,并且能够使用单独的工具验证每个计数
  • 能够理解数字本身并没有表达任何内容,并且建立含义的语言解释属于人类。

文学和语言研究不仅仅是“评论”;它还具有可测量和可数的方面。作者使用了多少种不同的单词,他喜欢将哪些单词与哪些单词一起使用,哪些单词在某个时期变得常见——这些都是通过语言学(研究语言的声音、结构、含义和使用的科学),特别是语料库语言学来研究的。语料库是文本的集合,例如作者的全集、报纸的年度档案或某个时期的诗歌。语料库分析寻找该块中的数字模式。

在本单元中,我们将学习使用人工智能作为语料库分析助手:快速提取词频(一个词在文本中出现的次数)、搭配(经常一起出现的词对,例如“黑色”+“我的财富”)、词汇丰富度和季节变化等指标。但从一开始就警告:人工智能在单独计算时可能会犯错误;需要特殊的工具来进行大量且精确的计数,而您是确定每个数字含义的语言学家。

AI在语料分析上强在哪里、弱在哪里?

它的优点是:识别中小型文本中的模式,生成有关文本词汇的假设,建议候选搭配,解释结果,描述方法。 AI 询问“这位作者的哪些短语脱颖而出?”它为问题提供了一个快速的开始。

缺点:计数准确。 AI是一种语言模型,而不是计算器;可以在长文本中对“发生了多少次”的问题给出近似的、有时是错误的答案。为了获得精确的频率、精确的共置统计或数千个单词的大型语料库扫描,需要使用专门的软件(例如 AntConc 等语料库工具或电子表格)。人工智能在解释这些工具的输出方面很有价值;但不要让他盲目地进行原始计数。

提示:如果您需要精确的数字,可以使用两种方法:使用工具以小文本进行计数,然后让 AI 对其进行解释;或者让AI统计一下,用其他方式验证一下。切勿在未经确认的情况下使用“AI 说它发生了 47 次”这句话。

循序渐进的语料库研究

  1. 提出问题。 “颜色词在这位诗人身上是如何分布的?”如果没有明确的问题,计数就没有意义,例如:
  2. 定义语料库。哪些文字?哪个版本?哪个时期?边界必须清晰。
  3. 选择测量。词汇的频率、搭配、丰富程度?
  4. 测量并验证。进行计数,然后确认第二种方法。
  5. 评论。数字本身并不能说明什么;正是你的评论使得“颜色词在第二个时期翻倍”的发现变得有意义。

词汇丰富度的常用衡量标准是不同单词的数量与单词总数的比率(类型/标记比率)。如果该比率高,则文本是单词多样性的,如果该比率低,则意味着文本是重复的。但这个比例受文本长度的影响;直接比较短文本和长文本时要小心。

三个迷你箱子

案例一——搭配彰显风格。一位研究人员检查了一位小说家的三本小说中的形容词-名词配对。 AI建议“pale”一词匹配5个不同的名词;研究人员验证了其中 4 条文本,删除了 1 条捏造的文本。确认的模式成为关于作者描述风格的论文陈述。

情况 2 — 发现计数错误。一名学生询问 AI 在 2000 字的文本中“夜晚”一词出现了多少次; AI说“23”。当学生将文本放入电子表格并进行计数时,实际数字是 17。很明显,人工智能的原始计数是不可靠的。

案例3——周期性变化引发争议。一组比较了诗人早期和晚期诗歌中抽象词的比例。人工智能的初稿提出了一种趋势;当小组返回文本并验证计数时,结果证明趋势是真实的,但人工智能提出的“原因”是无法验证的猜测并被消除。

四个可复制模板

1)词频大纲(带验证):

列出下面文本中出现频率最高的 15 个实词(不包括连词和介词等虚词)及其大概出现频率。警告:请注意,计数可能不准确,并注意“为了准确,必须使用单独的计数工具对其进行验证”。文本:[在此处粘贴文本]

2) 主机托管候选人:

建议在下面的文本中经常一起出现的单词对(搭配)。为每一对至少引用一段文本。文本中没有对应内容的双重捏造;如果您不确定,请将其标记为“需要验证”。文本:[粘贴文本]

3)词汇比较:

我会给你两段文字。对于每个:大致的总单词数、对不同单词变体的观察以及突出的单词域(例如颜色、性质、情感)。说明这些数字是近似值。比较的解释留给我验证吧。文本 A:[...] 文本 B:[...]

4)结果解读:

我从计数工具得到以下结果:[粘贴结果]。针对这些数字在语言上的含义生成 2-3 个假设。将每个假设标记为“需要证据”,并告诉我如何测试它。避免过多的评论。

弱提示/强提示

弱:“这篇文章中哪个词出现最多?”

强:“列出本文中最常见的实词及其大概出现频率;排除功能词。明确数字并不准确,需要使用单独的工具进行验证。为每个词提供一个例句。”

强大的提示让AI接受计数限制,并提前告诉你需要验证。在弱提示中,AI给出一个数字,你不知道它可能是错的。

测量和可靠性表

测量

显示什么

仅人工智能

正确的方式

词频

常用词

关于,有风险

柜台+AI解说

托管

那些一起走过的人

产生候选人

从文字上确认

类型/代币比率

言语多样性

可能会产生误导

带有工具的帐户

季节变化

随时间变化的趋势

产生假设

测量并验证

结论性评论

含义

强大但夸张

人类的判断

关键字和 n 元语法概念

有两个概念可以让您的语料库分析工作变得更加轻松。第一个是关键字(英语中的关键字 - 与一般语言相比,在文本或作者中出现的频率比预期高得多的单词,赋予该文本其“特征”)。作者的关键词揭示了他的兴趣和风格;例如,如果“大海”和“分离”在诗人身上出现的频率比预期的要高,那么这种统计突出就成为解释的起点。为了识别关键词,需要将文本的频率与参考语料库(用于比较的一般的、大型文本体)的频率进行比较;这种比较是一项明确的工具工作,是人工智能无法自行可靠地进行的计算。

第二种是n-gram(文本中n个连续单词的序列;两个单词的序列称为“bigram”,三个单词的序列称为“trigram”)。 N-gram 分析揭示了作者的公式化表达和常用短语。例如,如果一个作家非常频繁地使用“kind of”或“however”等短语,这表明他造句的习惯。 AI可以建议这些短语作为候选;但为了获得真实的频率和统计显着性,有必要回到计数工具。

提示:告诉人工智能,“列出文本中值得注意的短语(两个或三个单词)作为候选词,并为每个词给出文本中的示例。”获取候选列表并使用单独的工具测量实际频率。将人工智能定位为“观察者”,将代理定位为“柜台”,将你自己定位为“解释者”。

常见错误

  • 依赖人工智能的原始计数。人工智能不是计算器;通过单独的工具验证确切的数字。
  • 提供数字,不加评论。 “通过了47次”并没有说明什么;你创造了意义。
  • 忽略文本长度。歌词多样性率对长度敏感。
  • 在没有验证搭配的情况下发表论文。非人工智能夫妇可能会建议;从文字上确认。
  • 极端评论。不要在没有证据的情况下接受AI提出的“理由”。

综上所述

语料库分析揭示了文献的可数方面:频率、搭配、词汇、周期变化。人工智能在识别模式和解释结果方面在这一领域非常强大;但绝对计数是不可靠的。使用单独的工具验证数字,确认文本中的搭配,并自己确定每个数字的含义。数字不是证据,而是证据之门。

应用任务

选择一个短文本(500-1000 字)。识别内容词(例如“夜晚”或“道路”)。首先,在文本中算上你自己。然后让AI来数一下。比较两个结果;如果有差异,请调查原因。然后针对该词在文中的功能写一段评论——将数字转化为意义。

清单

  • [ ] 我提出了一个明确的语言问题。
  • [ ] 我定义了语料库的边界(文本、版本、时期)。
  • [ ] 我用第二种方法验证了AI的计数。
  • [ ] 我从文本中确认了搭配。
  • [ ] 我没有留下号码而不发表评论;我自己创造了意义。