单位 8 / 12

内容分析和模式发现

收益:

  • 能够使用 NER、关系提取、时间线和网络分析等技术从大量文本中提取模式
  • 能够将模式视为假设而不是证据,将实体与来源联系起来并在人类认可的情况下将其标准化
  • 能够理解数字如何因数据缺失和抽样偏差而产生误导,并避免人为的关系和时间顺序。

历史研究不仅仅是阅读个别文献;而是阅读历史文献。经常在大量文档中寻找模式。多年来,某个特定名称出现在什么背景下?哪些人与和解有关?主题如何随时间变化?谁与谁对应?此类问题需要查看的不是单个文档,而是数百个文档。这通常被称为数字人文——计算方法在历史和文学等领域的应用。

人工智能在从大量文本中提取结构化信息方面非常强大。在本单元中,您将学习NER(命名实体识别)、模式和关系提取、主题建模逻辑和时间线创建;但我们还将讨论这些技术最危险的陷阱——人工智能将自己描述为“发现”了一个不存在的模式。

基本技术

  • NER(命名实体识别):从文本中自动提取人物、地点、机构、日期等实体。它会在几分钟内生成一个类似“这 500 个文档中提到的所有地名”的列表。
  • 关系推断:标记实体之间的联系(“X 人在 Y 地”、“A 与 B 对应”)。
  • 主题建模:统计地查找大量文本中重复出现的主题集群。它显示了哪些主题集中在哪个时期。
  • 时间线推断:按时间顺序排列文档中的日期事件。
  • 网络分析:将人与机构之间的关系可视化为网络(谁是中心,谁是连接点)。

所有这些的共同目标是揭示未出现在单个文档中而是出现在整个集合中的结构。这些技术使可见的模式仅通过阅读是无法看到的。但每一个都是“征兆”,而不是“证据”;验证原始文档中的内容至关重要。

该领域经常使用的概念是细读(逐行深入阅读文本)和远读(统计性地集体查看数百/数千篇文本)之间的区别。人工智能使远程阅读成为可能:你可以看到足够大的语料库中的模式,足以维持一个人的一生。但当远读指向某种模式时,就必须回到精读,即回到原始文献,才能理解它的意义。两种方法不可互换;一个显示模式,另一个给出其含义。最可靠的研究将两者结合使用。

提示:使用模式分析作为假设生成器:“人工智能在这里发现了一个模式,它是真的吗?”然后在文档中一一检查该模式。模式是研究的起点,而不是结果。

工作流程:一步一步

1. 澄清问题。 “在这个系列中,哪些人最常一起出现?”一个清晰的模式问题,例如。

2. 准备并标记数据。使用源引用组织文本,以便找到的任何资产都可以链接回文档。

3. 出现实体/图案。使用 AI 生成 NER、关系或时间线大纲。

4. 正常化。组合同一个人/地点的不同拼写(“Istanbul / Istanbul / Kostantiniyye”同一个地方?)。这一步很关键;如果省略,该模式就会崩溃。

5. 在文件中验证。检查实际文档中是否有任何标记的重要模式。确保AI没有添加虚构的链接。

6.评论。模式意味着什么,是历史学家的判断;人工智能只是标记模式。

数字和统计陷阱

模式分析通常会产生数字:“名字 X 出现了 47 次”,“这个主题出现在 30% 的文档中”。这些数字看似客观,但可能具有误导性:

  • 缺失数据:如果收集已经不完整(文档已丢失,一组从未被记录),则该数字反映的是幸存文档,而不是实际情况。
  • 归一化错误:如果同一个人拼写不同,单独统计,数字就会不正确。
  • 上下文丢失:“出现 47 次”没有说明任何内容;它如何传递(正/负,主语/客体)很重要。

模式输出

表面意义

真实风险

“X 出现 47 次”

重要人物

收集不完整,拼写变化

《主题30%》

主导话题

抽样偏差

“A-B经常在一起”

亲密关系

巧合,缺少上下文

“时间线”

准确的年表

未注明日期的文件、捏造的订单

三个迷你箱子

案例 1——网络分析揭示了一个隐藏的中介。一名研究人员检查了 800 封信件的信件集。有了人工智能,谁给谁写信就被确定了,并创建了一个网络。网络显示,一个乍一看不起眼的人,实际上是两个群体之间的关键联络点。研究人员仔细研究了此人的信件,并得出了新的发现。但首先要验证文档中的所有链接。

情况 2 — 标准化错误损坏了数字。一名学生让他们计算某个地点在文档中出现的次数。由于AI分别统计了同一个地方的三种不同拼写,结果结果是真实数量的三分之一。当拼写组合起来时,地点实际上是第三个最常出现的位置。教训:如果没有标准化,数字就无法信任。

案例 3——编造的时间线。一名研究人员根据未注明日期的文件创建了一个时间表。人工智能将未知事件按照“逻辑”顺序排列,并呈现出精确的年表。然而,这个序列并没有出现在文档中,是人工智能杜撰出来的。教训:时间线仅根据文档中具有日期的事件构建;其余部分仍然“未注明日期”。

四个可复制模板

1)NER(实体推理):

以下文件中提到的人物、地点、机构和日期以单独的列表形式出现。指出在哪个文档(参考文献)中提到了每个实体。仅采用文本中明确说明的内容;通过猜测添加。如果您不确定发音,请标记 [?]。文件:[此处]

2)实体规范化:

在下面的实体列表中,将可能是同一个人/地点的不同拼写分组(例如“Istanbul / Kostantiniyye”)。为每个组建议可能的通用格式,但不要强加确切的组合;添加注释“也许相同,让人们验证”。如果您不确定,请不要管它。列表:[此处]

3)关系/网络概要:

从以下一组信件/文档中提取“谁与谁相关”链接。对于每个链接,请指出它基于哪个文档(参考)。杜撰了文档中未明确说明的关系。标记不明确的链接[模糊]。文档:[此处]

4) 日期时间表:

仅按时间顺序列出以下文件中明确说明的事件;将每个事件与其来源联系起来。将日期不确定的事件单独列在“未注明日期”标题下,请勿按顺序排列。不要弥补预计日期。文档:[此处]

弱提示/强提示

弱:

分析这些文档并提取重要的模式、关系和时间表。

“提取重要模式”推动人工智能发明不存在的联系和精确的年表,呈现未经标准化的数字。

强的:

通过将每个实体连接到文档引用,从以下文档中提取人员/地点/机构实体。标记可能与“可能合并”相同的不同拼写,但不要合并。文件中未明确说明的关系和日期不确定的事件请勿伪造;将没有日期的分开。文档:[此处]

区别在于:归因于来源,将规范化留给人类,禁止虚构的联系/历史,以及未注明日期的事件的分离使该模式具有防御性。

常见错误

  • 将模式误认为证据。模式就是假设;已在文档中验证。
  • 跳过标准化。同一实体的不同拼写会扭曲数字和网络。
  • 盲目相信数字。不完整的收集和抽样偏差使数字具有误导性。
  • 编造的时间表。未注明日期的事件不包含在年表中。
  • 忽略上下文。重要的不是“通过了多少次”,而是“如何通过”。

总之

内容分析和模式发现是一个强大的领域,人工智能可以生成仅通过阅读无法看到的可见结构:实体提取、关系网络、主题集群、时间线。但每种模式都是假设,而不是证据。将资产链接到来源,通过人工验证仔细规范化,查询缺失数据和偏差的数字,避免人为的关系和时间顺序。 AI标记图案;其意义何在,是否属实,尚待历史学家评判。

应用任务

收集至少 15 份文档(附参考文献)。使用“NER”模板提取人物并放置实体。然后使用“实体规范化”对不同的拼写进行分组,并自己验证这些组。最后,运行“已注明日期的时间线”模板,看看有多少事件仍然“未注明日期”。比较人工智能在提示不佳的情况下会产生多少个编造的链接或年表。

清单

  • [ ] 我已经明确定义了我的模式问题。
  • [ ] 我将每个实体链接到文档参考。
  • [ ] 我规范了实体类型并将其与人类批准相结合。
  • [ ] 我质疑这些数字是否存在缺失数据和偏差。
  • [ ] 我没有将未注明日期的事件放入年表中,而是将它们分开保存。