收益:
- 能够解释 AI 对整个幻灯片图像 (WSI) 工作流程中的细胞计数、分割和分级的支持
- 能够识别绘画和扫描变化对模型性能和域转移的影响
- 能够通过参考标准、采样和病理学家批准来验证病理学 AI 输出
病理学是医学的一个分支,通过在显微镜下检查组织样本来识别疾病。许多癌症诊断的“金标准”都是在这里制定的。数字病理学是使用高分辨率扫描仪对载玻片上的染色组织切片进行数字化。生成的文件称为整个幻灯片图像(简称 WSI);一张幻灯片可以是十亿像素大小的巨型图像,即数十亿像素。人工智能支持这些巨大图像中的细胞计数、区域分割和分级。在本单元中,我们将了解 WSI 工作流程、其最大的技术陷阱:染色/扫描变异性,以及为什么病理学家的批准至关重要。
让我们从头说起:人工智能可以是计数器、初步扫描仪和病理学的第二只眼睛;但癌症诊断、分期和分级的决定属于病理学家。该模型不进行诊断。
WSI工作流程的步骤
第 1 步 — 筛选和质量控制。扫描载玻片;可以自动检测散焦、折痕、气泡等缺陷。质量差的扫描根本不应该进入模型。
第 2 步 — 去除瓷砖(补丁)。千兆像素图像无法直接处理;被分成小方块(英文补丁,通常为256x256或512x512像素)。该模型分别评估每个图块,然后组合结果。
步骤 3 — 组织/细胞分析。模型;它执行肿瘤部位分割、有丝分裂(分裂细胞)计数、核密度或标记物计算(例如 Ki-67 染色率)等任务。输出是数值测量或热图。
第 4 步 — 合并和报告。平铺结果在幻灯片级别组合;产生总结,例如“肿瘤面积的百分比”或“有丝分裂计数”。
第 5 步 — 病理学家评估。病理学家检查模型标记的区域和计数;接受、更正或拒绝。诊断和分级由病理学家决定。
最大的陷阱:染色和扫描的可变性
组织切片通常用 H&E(苏木精和伊红;将细胞核染成蓝紫色、将细胞质染成粉红色的标准染料)染色。但染色强度因实验室、染色批次、切片厚度和扫描仪品牌而异。人眼很容易适应这些差异。该型号可能不兼容。
如果模型是根据实验室 A 的粉紫色色调进行学习的,那么其在实验室 B 的较浅或较深的染色上的性能将会下降。这种现象称为域移位,是数字病理学失败的最常见原因。解决方案方法:颜色标准化(将图像移动到公共颜色空间)、多中心训练数据,以及最重要的是在每个要使用的实验室进行外部验证。
三个迷你案例:从数字来看
案例 1 — 有丝分裂计数的一致性。有丝分裂计数在乳腺癌分级中很重要,但很费力,并且因观察者而异。在一个实验室的人工智能辅助初步计数中,两名病理学家之间的一致性(kappa)从 0.55 增加到 0.71,每张玻片的计数时间从 4 分钟减少到 1.5 分钟。然而,每个最终计数都得到了病理学家的确认;病理学家决定,根据模型的建议。
案例 2 — 发生现场移位。在开发肿瘤分割模型的实验室中,它在 93% 的时间里都能正常工作。在合作实验室中,使用不同的扫描仪和染料,同一模型系统地将肿瘤面积高估了 20%。在使用该实验室的 200 张载玻片进行颜色标准化和重新验证后,差异降至可接受的水平。
案例 3——抽样谬误。一名模型在载玻片上说“没有”肿瘤;然而,该模型仅评估扫描区域,肿瘤位于未采样的切片中。病理诊断与玻片选择和取样一样好; AI“负”输出不会补偿欠采样。这就是为什么人工智能的阴性结果本身并不意味着“没有疾病”。
弱提示/强提示
注:以下提示用于配置病理报告和工作流程文本;组织图像诊断是经过验证的软件和病理学家的工作。
弱提示:
根据这份病理报告,是不是有癌症? [报告]
强力提示:
您的角色:您是病理报告结构助理(您不是诊断)。构建以下匿名病理报告:- 列出标本类型、染色、肿瘤类型/等级、手术切缘、标记物。- 保持不明确的措辞(“建议非典型,临床相关性”)完整。- 不添加文本中未包含的发现;在缺失的字段中写上“未指定”。- 最后,列出病理学家应确认的 3 点。匿名报告:[文本]
四个可复制模板
1)报告标准化:
将以下匿名病理报告绘制为结构化字段(器官、诊断、分级、边缘、标记物百分比)。坚持正文。报告:[文本]
2)Token一致性检查:
列出本报告中提到的所有百分比和数字标记(Ki-67、ER、PR、HER2);标记相互冲突或与诊断冲突的值。报告:[文本]
3)模型验证计划(数字病理):
为 WSI 分割模型编写验证计划草案:颜色归一化、多中心外部验证、病理学家协议 (kappa)、场转移测试。单独标记病理学家验证点。
4)添加采样警告:
在以下阴性 AI 结果中添加“采样可能有限,阴性结果不能排除疾病”的警告以及病理学家确认的要求。输出:[文本]
模型的角色:按任务类型
任务类型
人工智能贡献
关键性
验证
肿瘤区域分割
高
高
病理学家+外部验证
有丝分裂/细胞计数
高
高
病理学家确认
标记物的百分比 (Ki-67)
高
中等
参考对比
质量控制(焦点/缺陷)
高
低
抽查
报告配置(文本)
高
低
病理学家确认
提示:在评估数字病理学中的模型提案时,请始终询问:“该模型在哪些实验室的染色剂和扫描仪上进行过训练,并且是否在我的实验室中得到了验证?”如果答案为“否”,则绩效数据尚不适用于您。
注意:人工智能说“无肿瘤”并不意味着未采样的组织中没有肿瘤。病理学的阴性结果受到采样质量的限制;该模式不能超过此限制,并且阴性结果不能保证诊断。
常见错误
- 低估颜色/染料的变异性。场漂移是数字病理学失败的最常见原因。
- 在一个中心进行培训并在任何地方使用。不同的浏览器和颜色会导致性能悄然下降。
- 将负面结果误认为是保证。模型无法补偿采样限制。
- 忽略观察者间的变异性。如果参考标准本身是可变的,则应相应地评估模型。
- 消除病理学家。支持计数和分段;诊断和分级由病理学家负责。
综上所述
- 数字病理学通过将十亿像素 WSI 图像划分为图块来分析它们;人工智能支持细胞计数和分割。
- 最大的技术陷阱是由于染色/扫描变化引起的场漂移;颜色标准化和外部验证至关重要。
- 阴性 AI 结果受到采样限制的限制,不能提供诊断保证。
- 参考标准和观察者间的变异性是模型评估的背景。
- 诊断、分期和分级由病理学家负责; AI不会诊断。
应用任务
选择假设的数字病理模型(例如 Ki-67 百分比计算)。为此模型编写一个外部验证计划:来自哪个实验室的多少张载玻片、什么颜色归一化、如何测量病理学家的一致性以及如何测试场漂移。然后用一句话写出应添加到模型的负/正输出中的约束警告。
清单
- [ ] 我了解 WSI 工作流程的扫描、平铺、分析和合成步骤。
- [ ] 我了解绘制/扫描变化如何导致场漂移以及如何管理它。
- [ ] 据我了解,负的 AI 结果受到采样限制的限制。
- [ ] 我可以使用外部验证和病理学家协议 (kappa) 的概念。
- [ ] 我已经认识到诊断和分级决定仍由病理学家决定。