收益:
- 能够区分新闻工作流程(转录、初稿、扫描、翻译)中人工智能可以实时节省时间,以及根据任务风险级别将准确性判断和来源保护等决策留给记者的地方
- 能够应用一门学科,通过将每个人工智能输出链接到主要来源、与辅助来源确认并手动检查数量来验证每个人工智能输出。
- 在将敏感文档和资源交给人工智能之前,能够识别幻觉和偏见的局限性,并获得匿名化和元数据清理反射
新闻业的新伙伴:人工智能的作用、局限性和验证反射
在新闻编辑室,时间是最稀缺的资源。记者从现场回来,带着两个小时的录音、四十页的资产负债表和十五页的浏览器历史记录;编辑说:“半小时后我需要一个位置。”这种压力是人工智能(AI)——能够理解人类语言并产生文本、摘要、翻译和分类等输出的计算机程序——在新闻业迅速普及的主要原因。人工智能将重复且耗时的任务(转录、初稿、扫描长文档、翻译)减少到几分钟。但新闻业是一个容错率非常小的职业:假名、捏造的引述、未经证实的主张,一旦发表,就会损害个人的生命和出版物的声誉。这就是为什么该模块的第一句话是:人工智能不会为记者做决定;人工智能不会为记者做决定;人工智能不会为记者做决定。草稿、速度、扫描——但核实真相、保护消息来源并决定播出内容始终是记者的工作。
第一个单元建立了三个基础:区分人工智能在新闻工作流程中哪些地方可以实时节省时间,哪些地方应该停止;反射性地验证每个输出;保护源数据和敏感数据。这三者是所有后续单元的底层安全基础。
人工智能在哪里加速,决定权在哪里?
它有助于在风险轴上思考报告任务。风险是指如果出现问题,会对公众、消息来源和出版物造成多大的损害。
人工智能大大加速的低风险任务:提取录音的原始记录、扫描长篇报道的主要标题、撰写新闻报道的初稿、生成标题的十个替代方案、为不同平台重新包装文本、粗略翻译一份外国文档、列出大型数据表中的显着模式。这里AI解决了“空白页”和“堆栈筛选”问题;记者纠正、选择、丰富。
由记者做出决定的高风险任务:宣布某项主张“真实”、发表引文、发表指控某人的声明、判断文件的真实性、处理包含消息来源身份的信息、建立公共利益与隐私的平衡。这些决定影响人们的声誉和安全;责任和最终决定权始终属于记者。在这里,人工智能最多提出一个假设或清单,它无法做出判断。
注意:“AI这样总结”并不是新闻原因。未经有能力的记者确认,断言的来源、引文的真实性或文件的真实性不能公开。未经证实的人工智能输出就像单一来源的谣言——它可能是真的,但它需要第二个来源才能上线。
为什么需要验证?幻觉和偏见
人工智能不是通过“知道”而是通过“预测可能的单词”来生成文本。这就是为什么有时它会提供极其流畅但实际上不正确的信息。这被称为幻觉:不存在的法院判决、未说出口的引述、虚假的日期、不存在的学术论文、看似真实但捏造的案件编号。这对新闻业来说是致命的,因为捏造的“消息来源”破坏了新闻并导致否认。
第二个问题是偏见:人工智能可以在经过训练的大量文本中重复社交模式;可以系统地构建一个群体、地区或观点,无论是消极的还是积极的。如果记者在不知情的情况下将这个框架带入新闻中,客观性就会受到损害。
由于这两个限制,我们建议对每个输出应用四步验证规则:
- 深入到源头。返回原始文档、记录或 AI 提供的每个事实、名称、日期、数字和引用的主要来源。 AI是一个缩影;这不是证据。
- 寻找第二个来源。报告规则不会因人工智能而改变:关键主张至少得到两个独立来源的证实。
- 手动检查号码。根据原始数据重新计算每个数字输出,例如百分比、总计、比率等。
- 承担责任。当你批准出版的那一刻,这句话就是你的了;您的签名也有错误。
资源保护:从一开始就保护隐私
在新闻业中,消息来源保护是对线人身份保密的原则,在大多数国家都是一项合法权利;对于记者来说,这是一个职业的荣誉问题。写下线人的姓名、位置、他发送的文件的身份痕迹,或者允许他进入公共人工智能工具的详细信息,就会立即违反这种保护。许多免费的人工智能工具可以存储您输入的文本或在模型训练中使用它;所以你让数据脱离了你的控制。
规则很简单:首先匿名并提取敏感数据。消息来源的姓名、电话号码、工作地点和文档中的元数据(文件中嵌入的作者、日期、位置信息)都会被清除,而无需发送给人工智能。在散列文档之前删除识别行;对于敏感文件,如果可能的话,选择具有数据处理保证的离线或企业工具。我们将在第 10 单元中深化这一原则;现在就让它成为一种条件反射。
提示:在将文档上传到 AI 之前,请清除元数据并搜索文本中的姓名、电话、地址、机构。即使是会泄露来源的最小细节(日期、房间描述)也必须被省略。
三个迷你箱子
案例 1——伪造的案例记录。法院记者向YZ索取判例摘要。 YZ 用令人信服的语言给出了它以及三个“最高法院判决”的数字。记者通过官方决策搜索系统查询了这些数字:三个中的两个根本无法获得。如果他未经核实而使用它,就会出现基于捏造先例的新闻报道。验证步骤确保它仅使用唯一现有的决策;虽然消息晚了 20 分钟,但消息确实可靠。
案例 2 — 节省转录时间。调查团队通常会花费大约 40 个小时手动解码 14 小时的会议录像。使用基于AI的转录,2小时内输出原始文本;团队用剩下的时间根据录音纠正 6 个关键段落并建立上下文。总时间从 40 小时减少到约 9 小时;准确性并没有因为记者手动更正原始记录中的姓名和号码错误而降低。
案例 3 — 资源保护反射。一名记者试图向AI咨询一名向他泄露文件的公职人员的情况,并准备将文件原封不动地粘贴过来。他注意到了,但没有发送;清理文档的元数据,删除签名和单位名称,将该人概括为“机构雇员”。他的出版策略理念再次发挥了作用。但没有任何迹象表明来源。
可复制模板
1)按风险级别划分任务:
您的角色:记者的副编辑助理。将以下报道任务分为两个列表:(A)人工智能可以自信地生成大纲/摘要的低风险工作,(B)最终决定必须由记者做出的高风险工作。为每项任务写一句话理由。任务:[粘贴自己的每周任务]
2)幻觉狩猎提示:
列出下面文本中提到的每个事实、名称、日期、数字、引用和来源项目。给每一项贴上“必须从主要来源进行验证”的标签,并建议应查找哪些文件/记录。不要根据您自己的知识说“正确”;它仅推断需要验证的内容。文本:[此处]
3)匿名化预检查:
在发布下面的文本之前,标记出任何可能泄露来源的元素:名称、标题、机构、地点、日期、可识别的细节。建议对每个标志进行更安全的概括(例如“公职人员”)。不要更改文本,仅报告风险。文本:[此处]
4) 编辑验证清单:
您将评估新闻草稿。列出以下标题下的缺陷:(1)来源单一;(2)未经证实的数字;(3)来源不明的引用;(4)没有给予当事人发言权的地方;(5)推论与事实混淆的句子。只需制作一份清单,不要重写新闻。草稿:[此处]
弱提示/强提示
弱提示:“根据本文档写一篇新闻报道。”
结果:人工智能注入漏洞,产生未归属的声明,添加文档中没有的上下文。记者无法区分什么是文件,什么是捏造的。
强力提示:“仅根据以下文档制作新闻报道的骨架。在每个句子旁边,标记它是基于文档中的哪个段落,例如[P3]。不要添加文档中没有的任何信息;将缺少的部分留空为“[必须验证]”。文档:[此处]”
不同之处在于:强大的提示将人工智能与文档联系起来,使每个声明都可追溯,并使幻觉可见。记者知道该证实哪句话。
对比图
任务
人工智能的作用
决定/责任
强制验证
录音转录
生成原始文本
关键段落见记者
将姓名/号码与记录进行比较
长文档扫描
创建标题和摘要
什么新闻由记者决定
回到原来的段落
初稿写作
建议骨架和语言
引文和事实由记者掌握
将每个声明链接到来源
报价选择
主格句符号
记者发表
从记录中逐字确认
来源/文档处理
(有限)援助
记者身份保护
元数据和名称清理
常见错误
- 将 AI 输出误认为来源。 AI是草稿生成器,而不是资源;在未从主要文件中确认事实的情况下发布事实会导致否认。
- 按原样粘贴敏感文档。任何文档都不应在不清除泄露来源的元数据和名称的情况下进入公共工具。
- 用人工智能绕过“两种资源”规则。人工智能纲要是单一来源;该关键主张再次需要两次独立的确认。
- 相信数字。人工智能经常错误计算百分比和总数;重新测试原始数据中的每个数字。
- 不承认偏见。不加质疑地采用人工智能框架并将其转移到新闻语言中会破坏客观性。
总之
在本单元中,我们将人工智能定位为报道的助手:它加快了重复性和大规模筛选任务的速度,但由记者决定真相、发布引文并保护消息来源。幻觉和偏见是两个主要限制;针对这些,四步验证规则(找到来源、第二来源、检查数字、承担责任)和从一开始的隐私反射(匿名、干净的元数据)适用于每个输出。下一个单元将安装在这片土地上。
应用任务
写下您上周完成的 8 项报告任务。将每个标签标记为“低风险 - 人工智能使其更快”或“高风险 - 这取决于我”,并添加一句话理由。然后选择一个并将上面的“幻觉狩猎”提示应用于实际文本;请注意有多少 AI 标志的声明实际上需要验证。
清单
- [ ] 我可以按风险级别分离任务;我知道有些工作是由记者决定的。
- [ ] 我将每个 AI 输出归因于主要来源;我不会用人工智能绕过“两种资源”规则。
- [ ] 我知道幻觉和偏见的风险,并且我手工计算数字。
- [ ] 在将敏感文档/资源提供给人工智能之前,我会清理所有元数据和身份痕迹。
- [ ] 我已经意识到“AI说”的理由对于广播来说是无效的。