单位 3 / 12

文献回顾和获取循证信息

收益:

  • 能够在文献映射、概念扫描和阅读优先级中使用人工智能来管理伪造来源(幻觉)的风险
  • 能够建立验证流程,确认来自主要来源的每一次引用、发现和效果大小声明
  • 能够区分证据级别(荟萃分析、随机对照试验、案例)并根据证据层次权衡人工智能摘要

心理学是一个以证据为基础的专业:研究证据告诉我们干预措施是否有效,而不是“对我来说似乎是这样”。当专家想要了解最新情况、撰写论文或为案例选择正确的方法时,他会转向文献。但文献是巨大的;每年发表数万篇文章。人工智能(AI)在这里是一个巨大的加速器:它定义了一个概念,绘制了该领域的地图,建议您应该首先阅读哪一篇文章,简化了复杂的文本。但这就是文献中人工智能最危险的特征:它伪造了不存在的来源。在本单元中,您将学习如何使人工智能成为文学行业的加速器,如何在不陷入捏造来源(幻觉)的陷阱的情况下工作。

人工智能在文献中的作用是什么?它由什么组成?

人工智能强项的文学任务:用通俗易懂的语言解释概念;总结某个领域的主要争论;使文本可读;建议关键词和搜索策略;总结一篇文章(当您提供文本时);比较不同的观点。在这些内容中,人工智能将阅读时间缩短为几分钟。

AI 组成的东西:引文(看起来完美但不存在的来源,包括作者、年份、期刊、DOI 号);统计数据(真实的数字,如效应大小、样本大小、p 值);发现(一项研究声称“发现”,但实际上没有)。这是因为人工智能不是搜索引擎,而是“可能的单词猜测器”:它生成最有可能的引文格式,而不检查其准确性。

注意:未经您从主要来源(文章本身)验证,AI 给出的任何引用都是无效的。即使看似完美的 DOI 也可能是假的。说“我找不到它”总是比说“我放错了来源”要好。

证据层次:并非所有发现都是平等的

当人工智能总结一个发现时,它不会告诉你它的证据强度。然而,证据是有层次的。在权衡一项主张时,了解其基于什么类型的证据至关重要。

证据级别

你什么意思?

电源

荟萃分析/系统评价

多项研究的统计组合

最高

随机对照试验(RCT)

将参与者随机分为几组的实验

纵向/横断面研究

观察性、非实验性

中等

案例系列/案例报告

单个或多个案例的描述

专家意见/理论写作

解释多于证据

最低

当人工智能告诉你“研究表明……”时,你的第一个问题应该是:哪种类型的研究?荟萃分析的发现与单个病例报告的发现具有不同的重要性。

一步一步:人工智能驱动的安全文献流

  1. 让人工智能解释这个概念。为了快速切入主题,请向 AI 询问简单的摘要和关键概念。 (这是一个入门,而不是来源。)
  2. 设置搜索策略。让 AI 建议关键词、同义词和搜索字符串;在真实数据库(学术搜索引擎、期刊档案)上使用它。
  3. 自己寻找真正的来源。从同行评审的数据库获取文章。使用人工智能建议的标题作为搜索线索,而不是作为引文。
  4. 将文本摘要到 AI。将你找到的实际文章的文本交给人工智能,并要求进行总结/比较。人工智能不再编造东西,因为它有真实的文本。
  5. 确认每个数字和发现。人工智能将摘要中的效果大小与文本中的实际值进行比较。
  6. 标记证据级别。在每个发现旁边写下证据类型。
提示:在文学中使用人工智能有两种不同的模式:“无源暗示”(概念阐述、搜索想法)和“有源总结者”(当你给出文本时)。后者是安全的,因为人工智能根据你提供的文本工作,而不是根据它自己的记忆。

三个迷你箱子

案例 1——虚假归因流行。一名研究生请求 AI 引用有关焦虑症的 15 个来源章节。 AI 以 APA 格式提供这一切。当学生检查时,他发现 15 个来源中有 6 个实际上并不存在 (40%),并且 3 个被分配给了错误的期刊。所以一半的列表是无法使用的。教训:归因来自真实的数据库,而不是人工智能。

案例2——正确使用。一位临床医生将 4 项真实荟萃分析的 PDF 文本一一交给 AI,并说“列出每一项的样本数量、主效应大小和局限性。” AI 在 10 分钟内将 4 篇 30 页的文章缩减为对比表。临床医生通过文字确认每个数字;所有这些都被证明是正确的,因为人工智能是根据给定的文本而不是根据自己的记忆进行工作的。

案例 3 — 证据级别陷阱。一位专家问 AI:“X 疗法有效吗?”他问道。人工智能说“是的,研究支持它”,并统计了四项“研究”。专家查看后发现,其中三篇是个案报告,一篇是博客文章;甚至没有一个随机对照试验。尽管这一主张看似正式“得到证实”,但其证据力却非常薄弱。

可复制的提示和模板

我刚刚开始讨论这个话题。无需创建资源,只需给我一个概念性的介绍:基本概念、该领域的主要讨论以及我在搜索时可以使用的关键字+同义词列表。归因;如果需要归属,请说“自己查找来源”。主题:[主题]

我在下面粘贴了一篇实际文章的文本。仅根据本文进行工作,请勿添加外部信息。摘录以下内容:研究问题、方法、样本(n)、主要发现和效应大小、局限性、证据水平。正文:[文章正文]

以下是3篇文章的正文。将它们放在比较表中,并包含以下列:作者年份、样本、方法、主要发现、证据水平、局限性。仅根据给定的文本进行工作,不要添加来源。文本:[文本]

在单独的行中列出本文中的每个数字声明(n、p、效果大小、百分比),以便我可以与原始文章进行确认。不要添加任何您无法自行验证的数字。文本:[摘要]

弱提示/强提示

弱提示:“给出 10 个关于认知行为疗法治疗抑郁症有效性的学术资料。”

这个提示要求AI根据记忆来弥补归因;输出的很大一部分是假的。

强力提示:“建议关键词、同义词和搜索字符串来搜索认知行为治疗和抑郁症的数据库。不要提供来源/引文;我会从实际数据库中找到文章,然后给你他们的文本。”

这个提示将AI置于安全角色(搜索策略师);参考资料均来自真实来源。

常见错误

  • 直接使用AI给出的归因。看似完美的消息来源往往是捏造的;未经确认绝不会使用。
  • 盲目信任 DOI/链接。 AI还可以产生真实但不存在的DOI;在您打开并检查之前,它不会被视为有效。
  • 忽略证据的水平。不问“研究说”这句话背后是否有博客或荟萃分析。
  • 用AI摘要代替文章。这是一个概要图;仅根据摘要做出关键决定意味着在不阅读文本的情况下做出判断。
  • 在单机模式下使用。始终以“内存资源”模式使用AI;而安全的模式是“根据给定文本进行总结”模式。

综上所述

在文学行业,人工智能是概念澄清、搜索策略和摘要(当您提供文本时)的强大加速器。但他根据自己的记忆捏造了参考资料、统计数据和发现(幻觉)。验证主要来源的每个引文和编号;考虑一下您找不到的无效来源。标记每个发现的证据级别(从荟萃分析到病例报告)。以两种不同的模式使用人工智能:“无源暗示”和“有源总结器”,优先选择后者。

应用任务

选择一个主题。首先向 AI 询问该主题的 5 次引用(来源模式)。然后在真实的学术搜索引擎中一一搜索这 5 条引文,并记下实际存在的数量。然后找到两篇关于同一主题的真实文章,将它们的文本输入人工智能,并让它生成一个比较表。比较两种体验:哪一种提供可靠的输出?

清单

  • [ ] 我没有在未经确认的情况下使用AI给出的任何参考文献。
  • [ ] 我从真实的同行评审数据库中获取了这些文章。
  • [ ] 为了总结,我给了 AI 实际的文章文本(不是凭记忆)。
  • [ ] 我将每个数字声明与原文进行了比较。
  • [ ] 我标记了每个发现的证据级别。
  • [ ] 我使我找不到的来源无效。