单位 2 / 11

调查性新闻中的数据分析:将成堆的文件变成新闻

收益:

  • 能够利用人工智能探索数据集、生成具有新闻价值的问题并提取敏感数据
  • 不是让人工智能进行计算,而是在可审核的工具中描述和运行方法,并养成从原始数据验证每个发现的习惯。
  • 了解记者有责任起草异常值并记录档案关系并在原始来源中确认它们。

新闻调查通常从一堆开始:数千行的招标电子表格、数百页的资产负债表、泄露的电子邮件档案、开源公共支出集。数据新闻——在数字和文献数据中发现模式、异常和关系并将其转化为新闻的实践——正是理解这一群体的工作。在这些需要人类一生才能手动查看的成堆文件中,人工智能 (AI) 是一种强大的初步筛选和创意生成工具:它可以总结表格、提取文本档案中的重复名称、建议分析时提出哪些问题,甚至描述数据清理步骤。但我们还是从一开始就放一句话:AI是分析数据的伙伴;记者决定结果的准确性和新闻价值,并重新审视原始数据中的数字。从数量上看,幻觉的风险在这里是最危险的。

一步一步:用人工智能探索数据集

第 1 步 — 了解数据。首先了解列数、行数、日期范围、单位。在将原始文件加载到 AI 之前,请先了解它是什么;否则,人工智能的“发现”仍然悬而未决。

第 2 步 — 提取敏感数据。如果它包含个人数据(姓名、TR ID、地址、健康状况),请将其匿名化,而不将其提供给公共人工智能工具,或者仅发送要分析的列。揭示来源的泄露文件痕迹也被清除(第 1 单元和第 10 单元)。

第 3 步 — 使用 AI 生成发现问题。 “这个数据集可能隐藏什么新闻?”先说吧。人工智能会列出一系列要问的问题:前 10 项、重复供应商、异常跳跃、留空区域。

第 4 步——不要让 AI 进行分析,而是进行描述。这是关键点。人工智能在头脑中计算出的平均值或百分比往往是错误的。相反,向人工智能询问您将在可靠的工具中运行的步骤(电子表格公式、查询、脚本)。因此,微积分成为一种可审计的工具,人工智能只是给出了方法。

第 5 步 — 验证发现。通过返回原始线来查看 AI 指出的每个异常情况。过滤表并计算声明“This company won 31 of 40 bids”。任何未经证实的数字都不会出现在新闻中。

第 6 步——建立背景。这个数字本身并不是新闻。比较(去年的类似机构、人口比例)、背景和专家意见是记者的工作。

注意:让人工智能说“计算这个表的平均值”并将结果直接放入新闻中是数据新闻中最常见的免责声明错误。人工智能是一种语言模型,而不是计算器。让工具做数学计算,只需向 AI 询问方法和解释即可。

元数据和文档分析

除了数字表格之外,新闻调查还涉及大型文本档案:电子邮件、会议记录、合同。在这里,AI可以绘制“谁在何时与谁交谈”、“哪个话题被重复”、“哪些名字一起被提及”等关系图。同样,规则是相同的:AI 给出初始地图;每个链接都在原始文档中得到确认,因为人工智能可以令人信服地解释不存在的链接。

三个迷你箱子

案例 1 — 隐蔽凝结。一名记者有一个包含 2,400 行的公共采购电子表格。他让人工智能提出探索性问题;问题“同一供应商收到了多少份标书?”脱颖而出。记者没有人工智能计算这一点;他运行了 YZ 自己建议的电子表格公式,发现一家公司收到了 2,400 件商品中的 380 件(15.8%)。他手动检查了一下,号码是正确的。 AI 的初步“估计”为 22%——因此,如果 AI 值得信任,那么这个消息就是错误的。

案例 2 — 节省时间、电子邮件存档。在包含 6,000 封电子邮件的存档中手动搜索“正在发生的主题”需要花费几天的时间。 AI在15分钟内生成了主题集群的轮廓;记者从中选出了3个有前景的集群并阅读了邮件原文。总发现时间减少到约 3 天,但每条上线的报价都经过原始电子邮件的逐字验证。

案例3——出现幻觉。经济日报记者收到YZ的一份资产负债表摘要称,“一年内人员费用增长了60%”。当他回到原始表时,他看到增幅为6%,并且AI误读了一位数字。一次事实核查就阻止了诸如“60%爆炸”之类虚假且自命不凡的标题。

可复制模板

1)数据集识别和发现问题:

我将为您提供列标题和数据集的前 20 行。生成 10 个可以利用这些数据完成的新闻问题:集中度、异常值、时间跳跃、缺失/空白区域、重复演员。无需进行数字计算;只需写下哪些问题值得提出以及为什么它们可能成为新闻。数据:[标题+样本行]

2)不进行计算,而是进行描述:

我想做以下分析:求各供应商的投标总额及份额比例]。我想在电子表格中自己运行这个。逐步告诉我要安装哪些公式/枢轴设置。 SEN计算结果;只需给出方法。我的列:[列名称]

3)异常值搜寻:

我将在下面给出汇总统计数据(最小值、最大值、平均值、中值)。解释哪些值不寻常/可疑,以及为什么我应该检查它们以获取新闻。不做最后的判断;检查表以“应手动检查以下行”的格式出现。摘要:[此处]

4)文档归档关系图(草稿):

我会给你一组文档文本。将以下内容输出为草稿:经常一起出现的名称、重复出现的主题、值得注意的日期。标记每个链接来自的文档,例如 [B12]。不要添加文档中未明确写入的任何关系。文档:[此处]

弱提示/强提示

弱提示:“分析此图表并说明任何重要发现。”

结果:AI正面计算百分比和平均值,想象异常,不清楚它是基于哪条线。无法验证。

强有力的提示:“我给出了该表的列和前 20 行。(1) 列出哪些分析可能具有新闻价值。(2) 为每个分析建议一个电子表格公式,以便我可以运行它。(3) 不要计算任何结果。(4) 标记要检查的行,如 [S45]。”

区别:强提示将计算留给了可控工具,让AI沦为方法和方向的角色;防止幻觉泄漏到数字中。

对比图

舞台

人工智能确实

记者确实

验证

识别数据

列/模式摘要

了解单位和上下文

源数据字典

发现问题

生成问题列表

选择新闻价值

计算

描述方法

在车辆中运行公式

手动配置

异常值

标记候选人

查看原始线

过滤和计数

评论/上下文

草案框架

比较,专家

第二来源

常见错误

  • 让人工智能进行计算。让AI计算平均值、百分比、总计等并使用结果;人工智能经常犯错误,让车辆来计算。
  • 未将发现结果与原始线路连接起来。在不过滤表格和计数的情况下编写声明“这家公司赢得了大部分投标”。
  • 发布没有上下文的数字。在没有比较和比率的情况下报告裸露的数字是具有误导性的。
  • 按原样上传敏感数据。在不清洁车辆的情况下向车辆提供个人数据或揭示来源的文件。
  • 以为假关系是真的。将AI在档案中“看到”的链接处理到地图中,而无需在原始文档中进行确认。

总之

在数据新闻领域,人工智能是发现和洞察的伙伴:它扫描数据堆,生成要提出的问题,描述分析方法,标记异常值的候选者。但让人工智能自己计算数字是最危险的错误;将计算外包给可审核的工具,通过返回原始数据来验证每个发现,并添加上下文和与数字的比较。在文档档案中,AI给出了起始图;每个链接均在原始文档中得到确认。

应用任务

获取您拥有的(或公开的)数据集。首先,让他们根据“探索问题”提示提出 10 个问题。选择一个问题,在“描述计算”提示下从AI中获取公式,然后自己运行。然后直接要求AI进行同样的计算,并比较两个结果;请注意其中的差异及其教训。

清单

  • [ ] 在将数据提供给工具之前,我了解了列、单位和敏感字段。
  • [ ] 我不让AI做计算;我描述了该方法并在可审核工具中运行它。
  • [ ] 我通过返回原始行来手动验证每个发现。
  • [ ] 我在数字中添加了比较和上下文;我不会报告赤裸裸的数字。
  • [ ] 我确认了原始文档中存档中的每个关系。