单位 2 / 11

医学图像分析支持:放射学(X 射线、CT、MR)

收益:

  • 能够解释如何在放射图像中建立人工智能支持的检测、分割和优先级工作流程
  • 能够将模型输出(热图、概率、测量)与放射科医生的决策分开并将其定位为支持角色
  • 能够验证图像模型输出的敏感性/特异性、误报负担和临床背景

放射学是人工智能在生物医学工程中最成熟的应用领域。 X射线(X射线)、计算机断层扫描(CT;英文CT,结合从不同角度拍摄的X射线切片)和磁共振(MR;英文MRI,利用强磁场和无线电波对组织进行成像)每天都会产生数百万张图像。放射科医生需要多年的专业知识才能解读这些图像。人工智能通过检测(引起对发现的注意)、分段(绘制结构的边界;用英语进行分段)和优先级排序(将紧急情况放在队列的开头;用英语进行分类)为这一过程做出贡献。在本单元中,我们将了解如何设置这些工作流程,以及最重要的是如何将输出定位为放射科医生决策的输入,而不是替代。

作为一名工程师,您的工作通常是开发模型、集成、验证模型并与临床团队一起监控其性能。放射科医生做出诊断。 AI不诊断;引起注意、采取措施、分类。

放射人工智能工作流程的步骤

步骤 1 — 数据和预处理。图像采用 DICOM(医学数字成像和通信;医学图像的标准文件和通信格式)。预处理;其中包括加窗(调整图像对比度)、重新采样(将切片大小调整为标准大小)和降噪。此步骤安全且适合自动化。

第 2 步 — 检测和分割。该图案标记了与肺结节、骨折或出血相对应的区域。输出通常采用概率得分和热图(用颜色显示模型注意力集中区域的层)的形式。在分割中,模型绘制器官或病变的像素边界;这用于体积测量。

第 3 步——确定优先级。如果发现紧急情况(例如脑出血),该病例就会在工作清单中提出。这里的目的不是更换放射科医生,而是确保更早地看到危重病例。

第 4 步 — 放射科医生评估。模型输出作为推荐层呈现给放射科医生。放射科医生接受、拒绝或改变。最终报告和诊断属于放射科医生。

第 5 步 — 验证和监控。一旦模型投入使用,其性能就会受到持续监控;不同设备和患者组的假阳性和假阴性率分别进行跟踪。

敏感性、特异性和假阳性负担

图像模型评估有两个基本指标。灵敏度是指真正患病者的检出率:灵敏度高意味着漏检的情况更少。特异性是指我们准确消除真正健康者的速度:高特异性意味着更少的误报。这两者之间有一个平衡;如果降低阈值并检测到更多发现,错误警报就会增加。

诊所中的一个关键概念是误报的负担:如果模型过于频繁地表示“可疑”,放射科医生必须每次都排除这些标志,并且在一段时间后不会认真对待警报(警报疲劳)。因此,不仅应该评估模型的敏感性,还应该评估实际工作流程中的误报数量。

三个迷你案例:从数字来看

案例 1 — 通过优先级划分节省的时间。一家医院实施了脑部 CT 出血优先模型。放射科医生首次看到出血病例的平均时间从 28 分钟减少到 8 分钟。然而,该模型未能捕捉到遗漏的少量蛛网膜下腔出血;因此,所有病例再次接受放射科医生的全面解读。该模型加快了排序速度,但并没有消除阅读。

案例 2 — 误报负担。当以较低阈值运行时,肺结节检测模型平均会产生每个患者 6 个“可疑”迹象,将灵敏度提高到 94%;其中大部分是血管切片和良性病灶。两周内,放射科医生开始忽视这些迹象。当重新调整阈值并且每个患者的标记数量减少到 1.5 个时,该模型再次变得有用。

案例 3 — 场转移。在 A 医院的数字 X 射线机上,骨折检测模型的灵敏度为 91%,但在 B 医院使用不同制造商的便携式设备时,灵敏度下降到 72%。图像质量和定位不同。如果没有在每个设备和使用该模型的人群上进行进一步验证,就不能认为该模型是可靠的。

弱提示/强提示

注意:以下提示用于配置文本报告或工作流程,而不是用于解释图像本身。图像诊断是经过验证的临床软件和放射科医生的工作。

弱提示:

看看这张X光报告,告诉我病人是否生病了。[报告]

强力提示:

您的角色:您是放射学工作流程助理(您不是诊断)。匿名放射学报告文本的结构如下: - 将发现、测量和解剖位置制成表格。 - 保持模糊/否定的陈述(“不能排除”)不变,不要做出最终决定。 - 不要添加文本中没有的任何发现。 - 在单独的部分中收集“推荐/后续”句子。 - 最后,列出放射科医生应确认的 3 点。匿名举报:[文]

强大的提示模型,让模型远离解释,专注于配置;保持模糊性是可取的,因为在放射学语言中,“不能排除”和“可用”之间的区别至关重要。

四个可复制模板

1)报表配置:

将以下匿名放射学报告分为以下标题:适应症、技术、结果、结论、建议。坚持正文,不要添加评论。报告:[文本]

2)测量一致性检查:

列出本报告中的所有数值测量值(毫米、厘米、HU)并标记冲突或非生理值。报告:[文本]

3)模型评估计划:

为图像检测模型编写评估计划草案:敏感性、特异性、假阳性/患者、亚组(设备、年龄)分析、外部验证集。单独标记临床批准点。

4) 误报分诊注意事项:

将以下检测输出列表分类为“放射科医生优先级高/低”;写下每堂课的理由。说明您将决定权留给放射科医生。列表:[输出]

模型的角色:按发现类型分类

查找类型

人工智能贡献

关键性

验证

紧急出血优先顺序

非常高

放射科医生完整阅读

肺结节检测

阈值+跟踪协议

骨龄/测量

中等

专家掌控

器官体积分割

中等

手动样品验证

报告配置(文本)

放射科医生确认

提示:评估显示模型时切勿依赖单一准确率百分比。一起询问敏感性、特异性、假阳性负担和亚组表现; “您在哪些设备和患者组上测试了模型?”问题揭示了大多数问题。
注意:热图不能保证模型“为什么”做出这样的决定;它只是显示您的注意力集中在哪里。有时,模型会出于错误的原因给出正确的答案(例如,通过查看图像中的标记)。可解释性输出也需要验证。

常见错误

  • 依赖单一指标。高整体准确度可能掩盖关键子组中的低敏感性。
  • 不测量误报负载。产生过多信号的模型会造成刺激疲劳并被放弃。
  • 在单个设备上验证模型并在任何地方使用它。场漂移是图像 AI 失败的最常见原因。
  • 将热图误认为证据。注意力图不是一种解释;而是一种解释。正确的答案可能是基于错误的原因。
  • 消除放射科医生。该模型优先级和标记;诊断和报告属于放射科医生。

总之

  • 放射人工智能;它通过检测、细分和优先级排序来产生价值,并且不会取代诊断。
  • 敏感性和特异性之间存在平衡;假阳性负担是诊所的一个关键指标。
  • 模型必须在将使用它们的每个设备和人群上进行外部验证(域转移)。
  • 热图显示注意力,但不保证解释;不能作为证据。
  • 最终诊断和报告属于放射科医生; AI是一个支撑层。

应用任务

选择现有的(或假设的)图像检测场景。为此模型编写一个评估框架:指定您将使用哪些指标(敏感性、特异性、假阳性/患者)、哪些子组(设备、年龄、性别)以及哪个外部验证集。然后标记工作流程中放射科医生做出决定的确切点,并在一段中解释如何将模型的输出输入到该决定中。

清单

  • [ ] 我可以区分放射人工智能的检测、分割和优先级角色。
  • [ ] 我可以一起评估敏感性、特异性和假阳性负担。
  • [ ] 我知道什么是场转移以及为什么需要外部验证。
  • [ ] 我意识到热图不是解释,需要验证。
  • [ ] 我可以将模型输出定位为放射科医生决策的输入,而不是替代它。