收益:
- 能够利用人工智能构建临床问题并进行文献回顾、总结和证据汇编
- 通过使用 DOI 和原始文章确认人工智能给出的每个来源,能够管理伪造参考文献(幻觉)的风险
- 能够批判性地阅读人工智能摘要,评估证据水平、利益冲突和及时性
药学是一个知识不断更新的职业;昨天正确知道的剂量或建议可能会随着新的研究而改变。循证药学意味着用最新、最可靠的科学证据来回答问题。但科学文献数量巨大且分散;在寻找问题的答案时,很容易被数百篇文章淹没。人工智能在这里是一种强大的扫描和总结辅助工具:它有助于构建问题、生成搜索词、总结长文本。但人工智能最危险的错误恰恰就在这方面:它可以编造不存在的文章和 DOI。在本单元中,您将学习如何使用人工智能作为文献综述中安全且经过验证的工具。
循证方法的步骤
通过以下步骤回答基于证据的问题:
- 构建问题。一个好的临床问题通常是用 PICO 框架来构建的:患者/人群(患者)、干预、比较、结果。示例:“与药物 Y (C) 相比,药物 X (I) 对患有 2 型糖尿病 (P) 的老年人的低血糖风险 (O) 有何影响?”
- 寻找证据。搜索适当的数据库和资源。
- 评估证据。研究类型、质量、样本量和偏倚风险。
- 应用并监控。使研究结果适应患者的情况。
人工智能在第 1 步和第 3 步(构建问题并帮助评估文本)特别快;但第 2 步(采购)需要严格验证。
证据层次
并非所有证据都是平等的。一般层次结构:
证据级别
例子
电源
最高
系统评价、荟萃分析
多项研究的结合
高
随机对照试验(RCT)
受控、低偏差
中等
队列,病例对照
观察性的、混杂因素的风险
低
案例系列、专家意见
普遍性有限
最低
未经证实的轶事网络内容
证据价值差
在总结发现时,人工智能可能会混淆证据的级别或将弱来源呈现为强来源。您始终控制水平。
此外,对于同一主题可能存在相互矛盾的研究。 AI有时只能突出一侧而忽略另一侧;这称为“选择性呈现”。强有力的证据评估会寻找该主题的总体趋势(许多研究的共同点)以及当前的系统评价(如果有)。基于单一研究(尤其是小样本或单中心研究)改变实践是有风险的。询问AI“在这个问题上是否存在相互矛盾的发现,哪一方有更有力的证据”是平衡片面总结的好方法;但最终的权衡是由你通过阅读原始资料来完成的。
注意:人工智能可能会生成完全捏造的参考文献,其中包含真实的标题、作者姓名、期刊和 DOI;这被称为“参考幻觉”。切勿在未打开原始数据库/期刊中的 DOI 并查看其内容的情况下引用来源。
三个迷你箱子
案例 1 — 虚构的 DOI。一位药剂师向人工智能询问药物有效性的来源;人工智能产生了三篇文章和 DOI。当药剂师尝试打开 DOI 时,他发现其中两个与任何记录均不对应;一个是真实的,但报告了不同的结果。药剂师只使用了他验证过的真品。如果未经核实,一份报告中就会包含两个虚构的消息来源。
案例 2 — 使用 PICO 搜索。一位药剂师正在研究两种止痛药对老年人的安全性比较。他要求人工智能将问题转储到 PICO 中并生成搜索词。 AI给出了清晰的术语和同义词;有了这些,药剂师自己在知名数据库中进行了实际搜索并评估了结果。人工智能加速搜索;药剂师找到了来源并阅读了它们。
案例 3 — 摘要失真。一位药剂师有一篇人工智能总结的真实文章。摘要声称该研究显示出“明确的优越性”;但文章本身称该结果“未达到统计显着性”。药剂师阅读了原文,注意到其中的歪曲,并更正了摘要。 AI的总结夸大了;回到源头,真相就揭晓了。
情况4——缺少主题。药剂师从人工智能收到有关药物推荐用途的信息。这个答案看似合理,但却是基于几年前的指南;然而,该建议已被更新。当药剂师打开更新后的指南时,他看到了差异,并以新的建议为基础。由于人工智能的知识被冻结在特定日期,它无法知道最新的变化;最新检查弥补了这一差距。
循证筛查
- 使用 PICO 提出问题。人口、干预、比较、结果。
- 生成搜索词。从人工智能中获取关键词和同义词。
- 你做出真正的决定。搜索知名数据库/来源;为人工智能“创造”资源。
- 验证每个来源。打开 DOI,作者/期刊/年份是否真实,内容是否支持声明?
- 评估证据水平。工作类型、质量、利益冲突、及时性。
- 结合上下文并保存。将发现与患者/问题、记录来源联系起来。
弱提示/强提示
弱弱:“这个药有效吗,给个来源。”
Strong:“在 PICO 框架中构建以下临床问题:[问题]。然后为该问题生成有效的搜索术语和同义词。不要编造来源/文章;告诉我应该寻找什么类型的研究(RCT、荟萃分析)以及哪些数据库。如果您指定来源,请标记“未经验证,必须通过 DOI 确认”。”
强提示下,框架、边界、验证条件明确;人工智能并不被迫制造资源。
四个可复制模板
任务:将临床问题绘制到 PICO 中。问题:[...]。输出:P(总体)、I(干扰)、C(比较)、O(结果)和一个句子结构的研究问题。
任务:生成搜索词(FITTING 源)。主题:[...]。输出:关键词+同义词+建议的研究类型。信用证/DOI;只要告诉我怎么打电话就可以了。
任务:公正地总结本文(不夸张)。文本:[文章]。输出:目的、方法、样本、主要发现、约束条件、结论。表达结果比文字内容更强烈;保持不确定性。
任务:制作参考验证清单。参考:[...]。排序依据: DOI 开放?作者/期刊/年份是否成立?内容是否支持该主张?证据级别如何?是否存在利益冲突?
常见错误
- 无需打开即可引用人工智能给出的DOI。参考幻觉的风险是最大的危险。
- 用摘要代替来源。对于批评性的主张,应该回到原文。
- 证据水平令人困惑。专家意见和荟萃分析并不具有相同的权重。
- 跳过更新。较旧的研究可能与当前的指导相冲突;应检查日期。
- 忽视利益冲突。资助和利益申报影响解释。
总之
人工智能是构建问题、生成搜索词和总结文献搜索中长文本的强大加速器。但它最危险的错误,即参照幻觉,就发生在这个领域:它可以产生看似现实但并不存在的来源。因此,您自己进行实际检索,使用 DOI 验证每个来源,将摘要与原文进行比较,并严格评估证据水平。对证据的最终解释及其对患者的适应取决于药剂师。
应用任务
从您自己的实践中选择一个临床问题,让人工智能将其翻译成 PICO。使用搜索词并在公认的数据库上自行进行实际搜索。向 AI 询问有关该主题的一些“来源”,并尝试打开每个来源的 DOI;注意有多少是真实的,有多少是编造的。最后,让人工智能总结一篇真实的文章,将摘要与原始结果进行比较,并标记任何扭曲。
清单
- [ ] 我围绕 PICO 构建了这个问题。
- [ ] 我拿了搜索词,自己进行了实际搜索。
- [ ] 我用 DOI 打开了每个来源并验证了其真实性。
- [ ] 我将摘要与原文进行了比较。
- [ ] 我评估了证据水平和及时性。
- [ ] 我考虑过利益冲突。
- [ ] 我已保存经过验证的来源。