收益:
- 能够使用人工智能作为工具来快速浏览大量文献并总结术语和概念
- 每一个引文、研究和数据都应根据真实文章和当前指南进行确认,管理捏造来源的风险
- 能够批判性地阅读摘要、评估证据水平(荟萃分析、随机对照试验、病例系列)和利益冲突。
现代医学是以证据为基础的:决策应基于最新、最有力的科学证据。但每年都会发表数百万篇文章;医生不可能全部读完。人工智能(AI)在这里是一个强大的扫描和总结工具:快速总结主题,解释术语,比较相反的观点,将论文的主要发现提炼成几句话。但这正是人工智能在医学文献中最危险的弱点出现的地方:人工智能可以编造(幻觉)不存在的文章、作者和 DOI 号码。在本单元中,您将学习如何使用人工智能作为文献综述的加速器以及如何验证每个来源。经验法则:AI推荐资源;您从真实数据库确认来源。
了解证据的层次结构
并非所有研究都具有同等的权重。证据的强度被认为是金字塔。最上面是系统评价和荟萃分析(将许多研究汇集在一起并在统计上结合起来的研究)。接下来是随机对照试验(RCT;最可靠的实验类型,其中将患者随机分组)。然后是队列和病例对照研究,然后是病例系列和病例报告,最后是专家意见和动物/实验室研究。
AI 在总结索赔时通常不会指定此级别。 “这种治疗有效”这句话可以基于荟萃分析或单个小病例系列。两者之间的差异完全改变了您的临床判断。因此,询问每个主张基于什么级别的证据是阅读 AI 简介的第一步。
提示:询问人工智能“这个说法基于什么级别的证据?”问。但还要验证答案;人工智能也可能会错误地判断证据的级别。最终评估是通过阅读主要来源和当前指南来做出的。
循序渐进:AI 安全文献综述
- 澄清问题。 PICO 框架的作用是:患者/人群、干预、比较、结果。
- 请求 AI 提供概念和术语的摘要。了解主题并找到正确的搜索词。
- 在真实的数据库中搜索AI给出的每一个资源。 PubMed、Cochrane、最新指南网站。
- 阅读主要来源的现有文章。 AI的总结和文章实际结论一样吗?
- 考虑证据水平和利益冲突。谁资助的,样本中有多少人,结果有意义吗?
- 与当前指导进行比较。如果个别研究与手册相悖,请务必小心。
三个迷你箱子
案例 1 — 伪造源。一名居民向 AI 请求 5 个资源来治疗罕见的血管炎。 AI 的格式非常好,带有 DOI 的引用次数为 5。助理在 PubMed 上搜索了所有这些:3 个根本不存在,1 个是不同主题的,只有 1 个是真实的。如果没有进行确认,这 4 个错误来源就会被包含在研讨会演示中。
案例 2 — 证据混乱程度。一位医生从人工智能摘要中读取到一种新的补充剂“有效”。当他查看主要来源时,他发现该说法是基于一项不受控制、制造商支持的 24 人研究。目前的指南称,没有明确的证据。医生根据指南而不是根据单一研究来评估建议。
案例3——正确、快速的使用。医生接收AI的概念总结,了解当前疾病诊断标准的变化;简而言之,它找到正确的搜索词并到达当前指南的相关部分。 40 分钟的通话时间缩短为 10 分钟。人工智能引领潮流;指导文本做出了决定。
源验证表
由人工智能给出
验证路径
风险
文章标题/作者
检索数据库(PubMed)
可能是假的
DOI 号
通过 doi.org 解决
可能无效/捏造
数值结果(%,HR)
阅读文章的结论
可能会被错误地转移
“指南建议”
打开当前指南的官方文本
它可能已经过时了
证据级别
查看主要来源的研究类型
可能会被错误归因
四个可复制模板
任务:在 PICO 框架内构建以下临床问题,并提供概念性摘要以帮助我理解该主题。请勿编造来源;建议我应该搜索哪些术语以及哪些数据库。问题:[...]
任务:在下面的人工智能摘要中列出每一项医疗主张,并针对每一项:-它将基于什么级别的证据(荟萃分析/随机对照试验/病例系列)?-注意“必须从主要来源进行验证”来源捏造;仅标记要验证的点。摘要:[...]
任务:总结本文的主要发现(下文),简化样本量、主要终点和局限性。不要添加自己的知识;仅依赖提供的文本。文本:[...]
任务:制作一份清单,将以下声明与当前指南进行比较:哪个指南、哪个部分、哪个推荐类别存在利益冲突?不要编造指南文字;给出检查点。声明:[...]
弱提示/强提示
弱:“这个病最好的治疗方法是什么,给个来源。”
Strong:“构建治疗 Y 相对于 Z 的优越性问题,以防万一
在强大的提示下,AI无法匹配资源,其任务仅限于扫描和指挥。
常见错误
- 将捏造的来源误认为是真实的。每个引文都应该在数据库中搜索。
- 忽略证据的水平。荟萃分析和案例展示的权重不同。
- 用AI摘要代替文章。摘要可能会错误引用;主要来源已阅读。
- 将单一作品保持在指南之上。该指南考虑了证据的整体性。
- 绕过利益冲突。谁资助它可以影响结果。
无障碍 (RAG) 车辆及其限制
近年来,使用“访问生成”(英文为RAG;模型在生成答案时引用真实文档库的方法)的医疗工具已变得普遍。这些工具比简单的语言模型更可靠,因为它们将答案链接到实际来源并显示引用。尽管如此,它也不是盲目信任的。仍然存在两个风险:首先,该工具扫描的资源池可能不是最新的或不全面的;其次,模型可能会误解它引用的来源(真实的文章,但其结论是扭曲的)。换句话说,仅仅因为它“引用了来源”并不能阻止您阅读该来源。
正确的用法是查看这些工具指向的引用,而不是作为捷径,而是作为验证的开始:打开引用的文章,看看它是否确实说了该结论,并将其与当前指南进行比较。可用工具减少但并没有消除验证负担。
提示:即使是“引用”人工智能工具也可能产生错误的摘要。始终与主要来源核实引用的引文;引用的存在并不保证其引用正确。
总之
人工智能为医学文献带来了巨大的速度:总结概念、解释术语、给出搜索方向。但他可以捏造消息来源并错误地分配证据的级别。在实际数据库中搜索每篇文章,从主要来源阅读,评估证据水平和利益冲突,并将其与当前指南进行比较。 AI简介是一个开始;您的证据决定的基础始终是经过验证的主要来源和指南。
应用任务
选择您感兴趣的当前临床问题。向 AI 请求 PICO 摘要和 5 个资源。这 5 个来源中有多少实际上在 PubMed 上?有多少人的结果和AI说的一样?注意每个证据的水平,并将其与同一主题的当前指南建议进行比较。如果事实证明它是捏造的来源,请写下您是如何注意到它的。
清单
- [ ] 我用 PICO 构建了这个问题。
- [ ] 我收到了来自 AI 的概念简介和搜索方向。
- [ ] 我在实际数据库中搜索了每个来源。
- [ ] 我从主要来源阅读了现有文章。
- [ ] 我已经评估了证据水平和利益冲突。
- [ ] 我已将这些声明与当前指南进行了比较。
- [ ] 我删除了捏造的来源并将其记下来。