收益:
- 能够分别验证源真实性(第 1 层)和内容保真度(第 2 层)
- 能够通过将引文与主要来源完全匹配并断章取义来识别失真
- 能够通过修复印记、页面和打印信息来保持引文完整性
我们在上一单元中谈到了捏造消息来源的危险。在本单元中,我们将更进一步,将来源验证(以指定形式独立确认指定来源中确实存在引用、参考文献或声明的过程)和引用完整性(作品中的每个引用都是真实的、正确引用的、忠实于上下文的原则)的主题转化为系统方法。一部作品在人文和社会领域的价值很大程度上取决于其来源的可靠性。在人工智能时代,这一点变得更加重要,因为现在不仅存在“错误引用来源”的风险,而且还存在“当来源根本不存在时将其呈现为真实的”的风险。
在本单元中,我们将建立引文验证的步骤、人工智能的引文生成行为、“内容保真度”控制以及保护学术可靠性的控制系统。
两个独立的身份验证层
源验证分别询问两个不同的问题。
第 1 层 — 来源真实吗?这篇文章、这本书、这页真的存在吗?作者、年份和杂志是否正确?这是对前一个单元的制造源搜寻,并通过独立目录控制来解决。
第 2 层——内容真实吗?即使来源是真实的,其观点、引用或数据在该来源中是否确实如此?人工智能可以将错误的观点归因于真实的来源:它可以将现有书籍中不存在的句子归因于该书中不存在的句子,或者作者实际上并未辩护的论文。这是第二个也是更阴险的错误,因为它通过了第一次检查,因为来源是真实的。
未通过两层的引文不应进入您的作品。
提示:在验证引用时,请同时检查以下三件事:(1) 是否有来源,(2) 引用是否逐字出现在该来源中,(3) 引用是否被断章取义,其含义是否发生了变化?第三项检查是最常被跳过的一项,也是最大扭曲的来源。
验证步骤
1. 对印记进行编目。作者、标题、年份、出版地点——所有信息都在可靠的数据库中进行匹配。更正或丢弃任何不匹配的标签。
2. 转到主要来源。直接从原文而不是二次摘要中确认观点或引用。亲眼看看“某某说”说法的来源。
3. 准确匹配报价。引号中的每个句子都必须在源中逐字引用。人工智能经常产生“接近但不准确”的报价;即使是一个词的改变也会使引用无效。
4. 检查上下文。这句话在其原始上下文中意味着什么?作者是否对此进行辩护,或者他是否表达并反驳了相反的观点?断章取义的引用可能会导致作者说完全相反的话。
5. 固定页面并打印。不同版本页码不同;记下您使用的版本。
注意:最危险的歪曲是断章取义地摘取真实作者的真实句子。例如,引用一位哲学家的观点,以“有人可能声称……”开头,然后反驳,就好像这是他自己的论文一样。在未阅读引用周围的段落之前,请勿使用任何引用。
三个迷你箱子
案例 1——真实来源,虚假报价。一位研究人员想要使用人工智能根据一本实际存在的书给出的引文。当他打开书查看相关页面时,句子是“接近”但不准确,而且两个关键词不同;这种差异改变了句子的重点。研究人员使用了逐字记录的文本。第 1 层通过了(来源是真实的),但第 2 层出现了问题(内容保真度)。
案例 2——断章取义。一名学生通过人工智能从一篇道德文章中检索到一句话:作者似乎提倡某种特定观点。当学生读到原段时,他看到作者构造这句话是为了表达相反的观点,然后立即反驳。作者的引述恰恰相反。上下文检查防止了严重的失真。
情况 3 — 压力差。一名博士生依靠人工智能给出的页码。当他的顾问检查时,页面不匹配;因为AI使用了不同版本的编号。该学生修复了他正在使用的版本并重新验证了所有页码。 1 版本差异已经改变了所有参考文献。
弱提示/强提示
弱提示:
为我找到这个观点的引用和来源。
此提示会产生捏造的来源和断章取义/错误引用,从而掩盖了验证的负担。
强力提示:
您的角色:细致的引文检查员。我会给你一段文字及其引文。对于每个引用: 1) 标记引用是否逐字出现在文本中(如果没有,请说“不匹配”)。 2) 显示引文周围的 2 个句子,以便我可以看到上下文。 3)指出作者是否用这句话来捍卫或表达反对观点。请勿捏造消息来源;只需使用我给出的文本即可。文本和引号:[粘贴]
该提示控制一对一匹配、上下文以及防御/转移区别——涵盖所有三个层。
四个可复制模板
1)精确报价匹配:
下面我提供了源文本和候选引文。告诉我引用是否逐字(逐字)出现在源中。如果不是,请标出不同的单词。添加评论。来源:[文本] 引用候选者:[引用]
2)上下文保真度检查:
根据来源的上下文确定以下引文是作者自己的观点还是他表达/批评的观点。显示引用前后的句子。解释如果断章取义,它的含义会如何被扭曲。来源:[文字] 引用:[引用]
3)引文验证清单:
对于以下引文,清单将显示为我需要在各个目录中检查的所有字段(作者、标题、年份、出版商/期刊、卷/期、页码、版本、DOI)的清单。 SEN确认其真实性;只需给出检查步骤即可。引用: [印记]
4)段落准确度:
下面我给出源文本和我的释义。释义是否忠实于来源的含义,或者是否增加/减少了细微差别?如果不是,请指出偏离的地方。仅依赖来源。来源:[文本] 段落:[文本]
认证层表
控制
问题
如何验证
跳过的风险
源现实
有吗?
独立目录
幽灵归因
压印精度
印记是否正确?
与目录匹配
错误的参考
引用字面意思
一个字一个字都一样吗?
与原版比较
编造的报价
上下文保真度
意义是否保留?
阅读环境段落
逆畸变
页/打印
号码正确吗?
修复打印
皮划艇参考
常见错误
- 仅仅因为来源是真实的,就认为这句话是真实的。通过第 1 层的资源可能在第 2 层(内容)失败;分别检查两者。
- 不读上下文。在没有看到周围环境的情况下使用这句话可能会导致作者说相反的话。
- 将“近”引用误认为是字面意思。只要改变一个字,引号就无效;要么逐字逐句地接受,要么将其转化为释义。
- 不检查释义。假设你自己的释义忠实于来源;添加/删除细微差别也是失真。
- 盲目相信页码。印刷差异会改变数字;确定您使用的压力。
总之
来源验证由两个独立的层组成:来源是否真实以及内容是否已忠实传输。人工智能在两个层面都会产生错误——不真实的来源和错误归因于真实来源的观点。为了安全归属,请对署名进行编目,转到主要来源,逐字匹配引用,阅读上下文,然后固定版本。最阴险的歪曲是断章取义。引文完整性是人文学科学术信誉的基础;人工智能可以加快这一速度,但你是保证人。
应用任务
- 让人工智能针对某个主题生成一段带有 3 个引号的段落。
- 对于每条引文,请转到来源并使用“逐字引文匹配”模板逐字检查。
- 使用“上下文保真度检查”模板检查至少一个引用的上下文:这是作者自己的观点吗?
- 用自己的话解释引文,并使用“解释准确性”模板检查其保真度。
- 根据您使用的版本确认印记的页码。
清单
- [ ] 我验证了独立目录中每个资源(第 1 层)的真实性。
- [ ] 我检查了原文中每个引用的内容保真度(第 2 层)。
- [ ] 我已确认引号内的引号是字面意思。
- [ ] 我阅读了引文的上下文并确保没有任何扭曲。
- [ ] 我已检查我的段落是否忠实于来源。
- [ ] 我根据我使用的版本固定了页码。