单位 3 / 12

医生对图像判读的认可:假阳性、假阴性和验证规则

收益:

  • 能够用牙科例子解释假阳性和假阴性的概念,并评估其对患者的临床后果。
  • 能够读取基本水平的 AI 置信度评分、灵敏度和特异性等指标,并决定输出应承担多少权重
  • 能够建立一个协议,通过临床相关性、附加图像和必要时的第二医生意见来确认每个放射线人工智能发现

在上一个单元中,我们了解了人工智能放射成像工具的工作原理。在本单元中,我们触及问题的核心:这些工具的准确度如何,它们何时会出错,以及这些错误会给患者带来什么后果?因为一个工具是“有用”还是“危险”不是取决于它何时正确工作,而是取决于它出错时会发生什么。了解牙科人工智能的两种基本错误类型——误报和漏报——是安全使用的先决条件。

两种基本类型的错误

误报:人工智能将某物标记为存在,但实际上并不存在。例如,它将健康的牙齿显示为“腐烂”。结果是:不必要的焦虑,不必要的进一步检查,甚至有因不正确的治疗而损失健康组织的风险。

漏报:当人工智能“忽略”实际发生的事情时,即不标记它。例如,绕过现有的根尖周病变(根尖的炎症区域)。结果:病理缺失、治疗延误、疾病进展。这通常是牙科领域最危险的错误。因为如果医生相信人工智能并说“清楚”,那么真正的病理学就会悄无声息地进行。

注意:仅仅因为人工智能没有标记任何东西并不意味着“一切都很好”。假阴性总是可能的。任何情况下都不能跳过临床检查和医师阅读。

敏感性和特异性:两个关键指标

两个数字概括了车辆的性能:

  • 灵敏度:发现真正患病者的比率。高灵敏度可减少假阴性。意思是“他不漏病”。
  • 特异性:真正健康的个体被准确地视为“干净”的比率。高特异性减少误报。意思是“他不会无缘无故地发出警报”。

这两个人经常发生争执。如果你将工具设置得太“敏感”(它会标记所有怀疑),它会漏掉更少的病理,但会发出很多误报。如果将其设置得太“有选择性”,误报会减少,但错过真实病理的风险会增加。在临床上,牙科领域通常首选高灵敏度,因为错过病灶比空白警报的风险更大。但最终的决定权还是在临床检查中。

概念

采取什么措施

高能提供什么?

灵敏度

捕捉病人

假阴性减少

特异性

净化健康

误报减少

置信度得分

模型对该样本的“置信度”

仅用于排名/阈值的提示

提示:如果工具仅显示置信度分数,请向制造商询问该分数背后的敏感性/特异性值。这些值对于哪些人群以及如何测试是有意义的。

验证协议:针对每个发现

通过以下步骤验证每个 AI 射线照相结果:

  1. 临床相关性:该发现与患者的症状和检查相符吗?
  2. 附加影像学检查:如有必要,可通过根尖周检查、咬翼检查或 CBCT 进行确认。
  3. 随着时间的推移进行比较:与以前的射线照片进行比较并评估变化(如果有)。
  4. 第二医生意见:同事对可疑或高风险病例的意见。
  5. 记录:在患者图表中清楚地写下决定、理由和人工智能的作用。

小案例 1:误报的成本

AI 工具以 88% 的置信度标记一名 34 岁患者下第一磨牙的“龋齿”。临床检查显示,牙齿完好,没有插入导管,患者也没有任何不适。医生用咬合片确认:没有龋齿,痕迹是由于修复体(填充物)的放射线阴影造成的。如果医生直接依赖人工智能进行干预,就会导致健康组织的损失。此处仅通过医生的临床控制来防止假阳性。

小案例 2:假阴性的危险

一名 62 岁的患者主诉下颌隐隐约约饱满。 AI在全景扫描中不会标记任何东西。年轻医生松了口气,“AI说干净了。”资深医师坚持并要求进行临床检查和CBCT; AI 漏掉的根尖处出现病变。教训:人工智能的沉默从来都不是一种诊断;而是一种诊断。临床怀疑始终优先。

小案例3:阈值设置的效果

诊所测试车辆的标记阈值。当阈值降低到 50% 时,该工具每月给出 900 个信号;其中只有 25% 具有临床意义,其余均为误报——医生不知所措。当阈值增加到 80% 时,标记物数量下降到 320 个,显着性增加到 55%,但两个真正的早期病变仍低于阈值并逃逸。诊所在 70% 的阈值上找到平衡,并将低分区域列入“审查”列表。教训:没有一个门槛是完美的;医生的眼睛弥补了这些差距。

可复制模板

使用时无需添加真实患者 ID。

角色:确认教练(非诊断)。任务:为以下 AI 放射线检查结果生成验证清单:临床相关问题、可能推荐的其他图像、鉴别诊断标题、记录注释项。最终决定写作。发现:[匿名]

作用:错误类型描述性。任务:确定以下情况是否存在假阳性或假阴性的风险,并向患者解释可能的临床结果。建议医生应采取什么行动。场景:[写]

作用:指标描述符。任务:用通俗易懂的语言解释制造商提供的敏感性、特异性和测试人群信息;列出问题让我质疑这些值是否符合我们的患者资料。值:[粘贴]

角色:第二意见请求撰写者。任务:起草一份简短、专业、匿名的消息,请求同事提供第二次射线照相意见。不包括患者身份信息。背景:[匿名发现]

弱提示/强提示

弱:“AI说90%,这不是很确定吗?”

为什么它很弱:将置信度分数误认为证据,跳过临床验证,并将决定委托给人工智能。

Strong:“对于AI标记为90%置信度的这个区域,我应该遵循哪些临床和放射学步骤来确认或排除龋齿的诊断?还要考虑假阳性的可能性。”

为什么它强大:它不将分数视为绝对证据,它删除了验证步骤并考虑了错误的可能性。

自动化偏差:最隐蔽的风险

误报和漏报属于技术错误;但最隐蔽的风险来自于人的方面:自动化偏见。这是一种更相信工具的输出而不是我们自己的判断的倾向。随着时间的推移,该工具被证明“基本准确”,医生可以停止质疑它,并盲目地跟踪该工具不准确的少数危急病例。悖论是这样的:工具工作得越好,人类注意力萎缩的风险就越大,罕见错误也就越危险。

克服这种偏见的实际方法是以“我第一,工具第二”的格式设置工作流程:首先自己阅读图像,做出决定,然后与人工智能进行比较。因此,该工具不再是指导您,而是成为补充您的阅读的第二意见。我还经常问“在这种情况下,人工智能会不会错了?”询问,保持注意力。提出这个问题是针对自动化偏见的最有力的防御措施,即使该工具具有很高的信任评分。

小案例4:注意力萎缩

在一家诊所,人工智能工具可以非常准确地运行数月,医生们逐渐开始不加质疑地接受其输出。有一天,车辆“干净”地通过了一个看起来不典型的真正损伤;因为信任已经成为一种习惯,第一位医生也没有注意到。幸运的是,根据患者持续的主诉进行的仔细临床检查揭示了病变。然后诊所强制执行“医生先阅读,然后是人工智能”的规则。教训:工具的成功不应取代人类的注意力;工作流程必须确保这一点。

常见错误

  • 淡化假阴性并认为人工智能沉默是“健康的”。
  • 独立于敏感性/特异性解释置信度得分。
  • 在不知道该工具已在与您自己的患者概况不同的人群中进行测试的情况下使用该工具。
  • 对于高风险结果不寻求第二意见。
  • 没有在患者图表中写下人工智能的作用和决策的理由。

综上所述

人工智能放射成像工具会犯两种类型的错误:误报(显示不存在的内容)和漏报(漏掉存在的内容)。在牙科领域,假阴性往往更加危险,因为医生可能会信任并错过病理结果。敏感性和特异性是理解这些错误的关键;置信度分数本身并不能作为证据。每个发现都应通过临床相关性、附加图像、时间比较以及必要时的第二意见来确认,并记录决定和理由。

应用任务

从您自己的档案中(匿名)选择 3 个真实示例:一个是人工智能误报的,一个是误报的,一个是正确的。对于每一个,写下错误类型、临床结果和正确的验证步骤。将结果转化为一页的“放射线人工智能验证协议”,以便在您的诊所中实施。

清单

  • [ ] 我可以通过例子区分假阳性和假阴性的概念。
  • [ ] 我可以在基本层面上解释敏感性和特异性。
  • [ ] 我对每个发现进行临床关联和附加图像步骤。
  • [ ] 我在高风险情况下获得第二意见。
  • [ ] 我在患者图表中记录该决定、其理由以及 AI 的角色。