收益:
- 能够使用人工智能来总结和比较真实来源,消除“仅基于给定来源”约束的捏造归因基础
- 能够应用验证实际目录中的每个引文、验证每个摘要的来源以及捕获 DOI/印记幻觉的能力
- 能够理解时事性、多语言性和灰色文学如何决定人工智能知识的局限性以及为什么需要原创写作。
考古学和文化遗产是一门累积性的科学:每项新研究都建立在跨越几个世纪的先前出版物的基础上。扫描一个地区、一种发现或一个时期的文献(关于该主题的文章、书籍、报告和论文的总体)是任何科学研究的第一步,也是最累人的一步。在本单元中,我们将深入了解人工智能如何加快文献审查速度,为什么来源验证在该领域至关重要,以及如何对抗人工智能最危险的错误:幻觉(捏造来源、引文和信息)。
基本原理:人工智能帮助总结、比较和整理文献;但如果没有在真实的目录中得到确认,任何引文都不能被使用,如果不阅读来源本身,任何总结都不能变成科学主张。在人文学科中,一个错误的来源就会破坏整部作品的可信度。
为什么幻觉在这个领域如此重要?
公共聊天工具最常见的错误是产生不存在但看起来非常现实的学术资源。人工智能可以通过结合真实作者的姓名、真实期刊的名称和合理的标题来组成看起来“完美”的引文。从哪里?
- 人工智能产生“下一个最可能的单词”;它不会查看实际的数据库(除非连接了特殊工具)。
- 由于学术引文是有模式的,人工智能非常“擅长”创建符合模式但内容是捏造的引文。
- 在人文学科中,读者通常不会立即检查出处;这使得虚假归因能够在不被注意的情况下上线。
结论:对于考古学家来说,人工智能输出中的每个作者-年份标题三元组都应被视为可疑,除非另有证明。
提示:不要将人工智能用作“资源查找器”,而是将其用作“处理您拥有的真实资源”的助手。自己找到实际的文章,将 PDF 提供给人工智能,然后说“只需依赖我给你的这些文本”。这样,产生幻觉的基础就基本消除了。
文献综述的步骤
- 范围和问题。你要买什么?明确主题、时期、地区和语言界限。
- 真实资源收集。从图书馆目录、机构数据库和可信目录中查找正宗出版物。这一步为AI“寻找”资源是有风险的。
- 总结和映射。将您收集的实际文本交给人工智能来总结和映射主题和讨论。
- 比较和差距分析。比较不同作者的观点,发现矛盾和未探讨的差距。
- 拼写和归属。写下你自己的论点,并附上经过验证的引文。 AI给出草稿;你用你的分析和实际引用重写。
来源验证纪律
对于每个引用,请检查:
- 有吗?作者、年份、标题、期刊/出版商是否位于实际目录(图书馆、DOI、索引)中?
- 他说的是他说的吗?消息来源真的如人工智能所声称的那样吗?打开源代码并阅读相关部分。
- 上下文正确吗?引用的内容是出于作者的意图吗?反对的观点是否归因于作者?
- 它是最新的并且可靠吗?该出版物是经过同行评审的、最新的还是反映了过时的观点?
注意:AI 提供的 DOI 或库存编号以“正确格式”显示并不表明该记录存在。搜索真实系统中的号码。不存在的 DOI 是最常见的幻觉迹象之一。
三个迷你箱子
案例 1 — 摘要节省了时间。一名博士生将 60 篇真实文章(全部是他找到并下载的)交给 AI,并创建了主题图;他在两天而不是几周内起草了一张表格,比较了不同作者对查找类型的看法。每个摘要都经过来源和验证。
案例 2 — 避免了假焊灾难。一名研究生要求人工智能“建议有关该主题的来源”,并得到了一份包含 15 条引用的漂亮列表。当他在图书馆检查时,他发现列表中的 9 个根本不存在——真正的作者,虚构的标题。如果这份清单被纳入论文参考书目,答辩的可信度就会崩溃,甚至可能被视为科学不端行为。
案例 3 — 纠正了不正确的归因。一个团队报告称,人工智能告诉一位作家“他将该网站的日期确定为罗马时期”;当我们转向来源时,发现作者声称相反,该网站是前罗马时代的。人工智能扭转了这一观点。阅读源代码避免了严重错误。
四个可复制模板
1)仅依赖给出的来源:
你的角色:文献综述助理。仅依赖我将在下面粘贴的文本。请勿添加这些文本之外的任何信息、来源或参考文献。写下你的每一个主张,指出我给你的文本的哪一部分是基于的。如果你被问及文本中没有的内容,请说“它不在给出的来源中”。
2)主题图及对比:
我将在下面提供 [N] 个来源的摘要。按主题将它们分组并创建一个比较表:对于每个主题,作者说了什么,他们同意的地方,他们矛盾的地方。仅使用我给出的文本中的观点;添加评论。
3) 引文验证清单:
当验证下面的引文列表时,请拿出我需要检查每个的步骤(在目录中搜索、DOI 确认、阅读相关页面、上下文检查)。您不确认归因的准确性;告诉我应该检查什么。来源捏造。
4)差距分析:
根据我提供的文献摘要,列出有关该主题的研究似乎不足的问题/差距。对于每个差距,显示哪个来源使其保持开放状态。只依赖我给你的文本;不要猜测。
弱提示/强提示
弱提示:
给出关于该主题的 15 个最重要的学术来源及其摘要。
人工智能会在不查看真实数据库的情况下生成一个真实但可能部分捏造的列表;这就是错误归因陷阱本身。
强力提示:
下面我贴出我找到的12篇真实文章的完整引文和摘要。仅基于这些,就会出现主题图和比较表。添加新资源。指出每一行来自哪一篇文章。将缺失的主题标记为“此资源集中未涵盖”。
区别在于:第一个充满了伪造来源的风险;第二个充满了伪造来源的风险。后者可靠地处理实际资源。
时事性、语言和灰色文学
考古文献的三个特点使得人工智能的使用特别危险。第一个是时事性:模型的知识被冻结在某个日期,并且在该日期之后不存在挖掘、新的约会和更正。人工智能可以将被取代的观点呈现为仍然有效;这就是为什么您应该扫描当前的出版物。第二,多语言:考古学是用德语、法语、意大利语、土耳其语和英语以外的许多当地语言撰写的。一份重要的发掘报告可能只以一种语言发表;仅仅依赖英语资源意味着会丢失很大一部分文献。人工智能有助于扫描这些外语来源,但同样,你手头必须有实际的来源。
第三,灰色文献:绝大多数考古知识存在于官方期刊上没有出现的文献中,例如商业发掘报告、机构档案和未发表的论文。灰色文献(商业或企业渠道制作的报告,在传统出版物目录中不易获得)在人工智能训练数据中要么不存在,要么很少;因此,AI要么不知道这些信息,要么是编造的。一个地区真实的考古故事往往存在于这些灰色文献中,只有从机构档案中亲手才能触及。
提示:在某个主题上说“人工智能找不到任何东西”或“资源很少”并不意味着该主题上的工作很少;相反,通常来源是灰色文献、外语或模型的信息部分之后。向真正的档案馆询问资源缺乏的情况,而不是向人工智能询问。
文献任务表
任务
人工智能的作用
人类的决定
验证
采购
弱势/有风险
从真实目录中选择
目录确认
总结
强(对于给定文本)
准确性、选择
阅读源码
比较
主题/矛盾图
评论、权重
源上下文
引文写作
格式大纲
内容、准确性
有/有说吗
差距分析
候选人提问
研究价值
领域知识
常见错误
- 让人工智能“寻找”资源。产生错误归属;自己找资源吧。
- 依赖于 DOI/版本说明格式。尽管格式看起来正确,但记录可能是捏造的;在系统中搜索。
- 使用摘要而不阅读源代码。 AI可以扭转作者的观点。
- 按原样发布 AI 文本。原创性和抄袭风险;写下自己的分析。
- 不设置“仅给定资源”约束。人工智能在不受限制的情况下添加外部捏造的信息。
综上所述
在文献综述中,人工智能节省了大量的总结、比较和分析事实来源的时间。但在人文学科中,来源验证是不可协商的:自己找到来源,验证实际目录中的每个引用,回溯每个摘要,施加“仅引用来源”的约束,并用自己的原始分析编写最终文本。虚假来源会毁掉你的工作。
应用任务
选择一个主题,在图书馆/索引中找到 8-10 个真实出版物并收集它们的引文。使用“仅基于源”和“主题地图”模板制作比较图表。在另一个实验中,告诉人工智能“建议来源”(没有任何限制),并在目录中一一检查它建议的引文,并记下有多少是真实的。
清单
- [ ] 我自己从真实的目录中找到了来源。
- [ ] 我对人工智能施加了“仅依赖给定来源”的约束。
- [ ] 我已通过目录/DOI 确认了每个引文。
- [ ] 我已经通过返回源来验证每个摘要。
- [ ] 我用自己的原始分析和确认的参考文献写下了最终的文本。