收益:
- 能够理解普通聊天工具会产生虚假引用,并应用验证实际数据库中每个源的规则。
- 通过使用 RAG(资源依赖生成)方法将文献合成与真实文档连接起来,能够减少幻觉
- 通过使用人工智能在系统审查中进行初步筛选,并将最终决定和透明度保留在人类手中,能够将假设解释为开始而不是证据
生物工程领域的知识爆炸是一个真正的问题:每年发表数十万篇文章,积累了针对单个主题的数千项研究。在建立假设、选择方法或解释结果之前,工程师需要浏览相关文献;但这需要手动花费数周时间。人工智能是在文献查阅、总结和信息综合方面最节省时间的领域之一。但它也是最危险的幻觉来源:人工智能可以产生不存在的文章、捏造的 DOI 和虚假的发现。本单元的主要课程是在文学中使用人工智能时将每个主张与原始来源联系起来的纪律。
在本单元中,您将学习如何在安全文献综述中使用人工智能,为什么 RAG(检索增强生成 - 人工智能从真实文档数据库而不是从其内存中查找并生成答案)方法更可靠、系统的综述支持和假设生成。
为什么普通聊天工具很危险?
当你告诉语言模型“查找有关以下内容的文章时,这意味着流动但虚构的参考文献:作者姓名、期刊、年份和 DOI,就好像它们是真实的一样。因此,永远不要违反文献综述中的两条规则:(1) 验证实际数据库(PubMed、Google Scholar、期刊页面)中的每个参考文献,(2) 如果可能,使用链接到真实文章的基于 RAG 的工具(例如 Elicit、Consensus、Scite)。
注意:来自人工智能的推荐可能看起来是真实的——以正确的格式、熟悉的日记、合理的年份。这并不意味着它存在。仅当您在 PubMed/DOI 中找到并打开某篇文章时,才将其视为存在。在您的出版物中包含伪造的参考文献是一个错误,可能会损害您的科学声誉。
RAG:资源依赖型生产
在 RAG 方法中,人工智能首先从真实的文档存储库(您上传的 PDF 或科学数据库)中找到相关段落,然后根据这些段落生成答案并指向来源。这大大减少了幻觉,因为模型必须“引用”而不是“想象”。将您自己的 PDF 库提供给 RAG 工具并询问“这 40 篇文章对某某内容有何评论”比直接对话可靠得多;但是,请参阅实际文章中每个引用的段落。
提示:即使在使用 RAG 时,也要明确指示“仅从我提供的文档中引用来源和答案,不要添加非文档信息”。然后在实际文档中找到模型指向的段落。这两个步骤使您的合成具有防御性。
系统回顾和假设生成
系统评价——通过以透明且可重复的方法扫描所有相关文献来回答特定问题——需要高度的方法严谨性:搜索策略、纳入/排除标准、数据提取。人工智能加快了这一过程的机械部分(摘要筛选、初步筛选、数据提取草稿),但每个决定(是否包含或排除论文)的责任和透明度取决于研究人员。人工智能还通过指出文献中的空白来激发假设的产生;但它产生的假设只是一个起点,而不是证据。
三个迷你箱子
案例 1 — 扫描速度加快 10 倍。审查小组必须筛选 1,850 篇文章摘要。使用基于 RAG 的工具,纳入/排除资格预审时间从 3 天缩短到 5 小时。但两名研究人员独立检查了 120 篇被 AI 视为“排除”的文章,并恢复了 9 篇错误排除的文章;人工智能做出选择,人类做出最终决定。
案例 2 — 伪造的参考被捕获。一名博士生向 YZ 索取 15 篇论文参考文献。当他查看 PubMed 时,发现其中 6 个根本不存在,另外 3 个被归咎于错误的作者。简单的聊天工具生成了真实但虚假的参考书目。验证避免了一场学术灾难。
案例 3——假设灵感。一个代谢工程团队向人工智能提供了包含 60 篇论文的语料库,并询问“哪些途径尚未得到充分研究?” AI 指出了一种未经测试的酶组合。研究团队以此为假设,在文献中进行了验证,并设计了实验;最终,他们得出了一个真正提高生产力的发现。灵感来自人工智能,证据来自实验。
四个可复制模板
1)来源相关文献综合(RAG):
您的角色:科学审查助理。仅根据我上传的文件回答;不要添加任何额外的文档信息。对于每项主张,请给出源文件名称和相关段落。对于文档中没有答案的问题,说“文档中没有”。参考文献、DOI 或查找 FITTING。问题:[问题]
2) 参考核查纪律:
我给你一个话题。建议可能的关键词和搜索策略(使用 PubMed 语法)。但你的文章列表是假的;我自己去打电话。告诉我应该使用哪些术语、过滤器和包含/排除标准。
3)系统编译排除辅助:
我会给你文章标题+摘要。根据以下包含标准(包括:[标准])建议包含/排除/不清楚每个内容,并写下您的理由。我会手动审查“不确定”的。请注意,该决定是初步的,而不是最终的;请勿无理删除任何文章。
4)假设生成(仔细):
我将为您提供有关某个主题的调查结果的摘要。根据文献中的 GAPS 和未经检验的组合,向我建议 3 个可检验的假设。对于每个假设:说明基础、如何测试它,以及它是一个开始,而不是证据。不要依赖不存在的证据。
弱提示/强提示
弱提示:
为我查找并总结 10 篇有关使用 CRISPR 进行酶工程的文章。
该模型不执行实际搜索;很可能会生成虚假参考。
强力提示:
您的角色:构建助理。仅根据我上传的 12 个 PDF,我综合了“基于 CRISPR 的酶工程”主题的主要发现。对于每项发现,请显示其来自哪个 PDF 以及完整的段落。请勿添加 PDF 中未包含的任何研究、DOI 或结果。将未涵盖的任何子主题标记为“这些文档未涵盖”。
区别:链接到实际文件、来源+段落要求、禁止伪造、范围诚实。
文献任务和可靠的方法
任务
危险的道路
安全的方式
验证
查找文章
在聊天中说“查找”
PubMed + RAG 工具
DOI 确认
总结
没有文档的摘要
加载的 PDF 的摘要
查看实际段落
消除
对人工智能的盲目信任
AI资格预审+人工
第二审稿人
合成
免费生产
依赖源的合成
报价检查
假设
误以为“证据”
起点
实验测试
常见错误
- 不验证参考文献。人工智能产生真实但虚假的资源;每个都应该出现在数据库中。
- 将普通聊天误认为是通话。模型从记忆中生成;实际搜索需要RAG/数据库。
- 完全委托淘汰决定。错误的消除会破坏编译;需要第二位审稿人。
- 将假设误认为证据。人工智能产生的假设在经过实验检验之前只是推测。
- 夸大范围。人工智能可能会给人一种“我扫描了一切”的印象;您记录实际范围。
总之
文献综述是AI最节省时间但产生幻觉最多的领域。普通的聊天工具可以产生真实但虚假的推荐;因此,根据实际数据库验证每个来源,如果可能,请使用依赖于实际文档的基于 RAG 的工具。在系统审查中,人工智能会进行初步筛选,但最终的决定和透明度属于研究人员。人工智能激发假设生成;在实验证实之前,该假设只是一个起点,而不是证据。
应用任务
选择一个主题并告诉人工智能(通过简单的聊天工具)“找到关于该主题的 8 篇文章并进行总结。”根据 PubMed 或 DOI 逐一验证他提供的每一条参考文献,并计算有多少是真实的。然后使用 RAG 工具或上传您自己下载的一些 PDF 并按照“仅从这些文档中回答”的说明重复相同的任务。写出两种方法可靠性的简要比较。
清单
- [ ] 我根据实际数据库验证了人工智能给出的每一个参考。
- [ ] 我在文献合成中使用了依赖于源(RAG/加载的文档)的方法。
- [ ] 我与第二位审稿人一起审核了筛选决定。
- [ ] 我认为人工智能产生的假设不是证据,而是测试的开始。
- [ ] 我看到了原文章中每句话的段落。
- [ ] 我如实记录了扫描的真实范围和局限性。