收益:
- 能够区分人工智能在生物医学工作流程中的哪些位置产生安全价值,以及哪些决策仍然由医生和授权工程师负责。
- 能够应用一门学科,通过生理数量级、临床合理性和独立证据交叉验证每个人工智能输出
- 认识到幻觉、数据泄露和患者安全的风险,并养成通过匿名上下文设置安全提示的习惯。
生物医学工程是人体的复杂性与工程学对精度的追求相交叉的职业。 ECG 信号是心脏的电阴影,MRI 图像是组织的磁回波,实验室值是快照。所有这些测量都是间接的、有噪声的并且需要解释。人工智能(AI;从大数据模式中学习并生成文本/图像/数字的软件系统)可以加快这种解释速度,但也可以用流利的语言隐藏其错误。该单元为构建整个模块奠定了两个基础:人工智能在生物医学工作流程中的何处产生真正的价值以及我们如何验证每个输出。
让我们从一开始就划出一条绝对的界限:您在本模块中学到的任何技术都无法取代合格医生的诊断、有能力的工程师的批准以及经过验证的设备流程。人工智能不会诊断。人工智能是助手;快速阅读、快速签名、捕捉规律。但如果遗漏了肿瘤、设备发出误报、剂量计算错误,责任不在于软件,而在于做出决定的医生和工程师。你会在每个单元以不同的形式看到这句话,因为这是工程中唯一关系到患者安全的真理。
人工智能在生物医学工作流程中的哪些地方创造价值?
生物医学工程师或临床技术团队的一周工作大致分为三类工作:数据准备(信号清洗、图像预处理、表格编辑、日志提取)、解释和分析(发现检测、分类、预测建模、风险评分)、沟通和文档(技术文件、验证报告、文献总结、设备手册)。人工智能涉及这三个领域,但其贡献和风险各不相同。
数据准备是人工智能最安全、最赚钱的领域。从原始信号中去除噪声、将图像缩放到标准尺寸、将自由文本临床笔记翻译成结构化字段、对齐不一致的单元——这些都是重复性、基于规则且易于验证的任务。即使这里出现错误,也需要几分钟时间才能返回源(原始数据)并进行检查。
解释和分析领域具有最高的价值和最高的风险。 AI可以标记图像中的可疑区域,检测信号中可能存在的心律失常;这可能揭示了在繁忙的诊所中可能被忽视的模式。但同一个模型可以自信地得出不存在的发现(这种现象称为幻觉:模型将不存在的信息呈现为真实的)。在这个领域,人工智能是一种假设和优先级排序工具,而不是决策者。
通信和文档领域的人工智能草稿加速器。在几分钟内生成验证报告的方法部分、文献摘要或风险分析的初稿。这里的风险是,虚构的来源和不正确的数字可能会溜进流动的文本中而不被注意到。
验证规则:三锚规则
该模块的核心是一个习惯:在未经验证的情况下,不要将任何人工智能输出纳入临床或工程决策。我们基于三个独立的锚进行验证。
第一个锚点——生理数量级。结果是否在人类生理学已知的范围内?静息心率通常为每分钟 50-100 次;如果模型给出 400,则存在伪影或编辑错误。成人体温在36-38℃范围内; 45°C 在生理上与生物不相容。成人的总血容量约为5升。此检查需要几秒钟的时间并捕获大多数错误。
第二个锚点——临床合理性。输出结果与患者的临床病史和医学原理一致吗?如果模型对 25 岁无症状患者的高级发现提出“高置信度”,则预测试概率较低,并且会额外怀疑该信号。年龄、性别、病史和症状是每一种解释都必须通过的合理性过滤器。
第三个锚点——独立证据。这是最强的锚。参考标准测试、第二种成像方法、实验室确认、专家第二意见。人工智能标记的发现将根据黄金标准方法或专家的独立评估进行测试。临床真理总是获胜。
三个迷你案例:从数字来看
案例 1 — 节省信号预处理时间。一名临床工程师正在为一项研究手动分割和标记 320 个心电图记录中的伪影;每次录音平均 7 分钟,总计约 37 小时。借助人工智能驱动的预处理工作流程,它将每条记录的初稿标记时间减少到 40 秒,将剩余时间用于目视检查。总时间减少至12小时左右;关键是节省下来的时间用于核查。
案例 2——捕捉到的幻觉。当一位生物医学工程师要求提供设备临床评估报告的文献摘要时,文本中包含句子“Yilmaz et al. 2019 reports 98%sensitivity”。没有这样的文章;该模型通过模仿真实的模式来制造归因。来源验证(DOI 和日志检查)在报告签署之前发现了错误。
情况 3 — 单位错误。在剂量计算辅助工具中,模型通过将药物浓度与 µg/mL(而不是 mg/mL)混淆,将推荐体积改变了 1000 倍。生理数量级检查——“一个成年人喝的是2毫升,而不是2升”——立刻就暴露了错误。这一计算仍需经过药剂师和医生的批准;人工智能只是一个中间控制工具。
弱提示/强提示
弱提示:
查看该患者的数据并说明他的诊断。[数据]
强力提示:
您的角色:您是一名生物医学数据分析师(您不进行诊断)。仅根据所提供的数据总结以下匿名测量结果。 - 不进行诊断;仅给出数值结果和正常范围比较。 - 不要添加数据中没有的任何发现、价值观或故事。 - 在每个观察值旁边用括号显示您所依据的数据行。 - 在不清楚的地方写上“数据不足”。 - 最后:单独列出医生必须确认的 3 点。匿名数据:[测量]
强大的提示对模型强加了三件事:坚持来源、不假设诊断权威以及标记要验证的内容。这并不能完全结束幻觉,但它使它可见并正确定位角色。
四个可复制模板
1)建立匿名上下文:
我需要生物医学任务方面的帮助。患者姓名、身份、日期和机构信息均为机密;我会给他们一些有代表性的表达方式,比如“Patient-A”、“Day-0”。任务:[任务]。只需依赖我提供的匿名技术数据即可。
2)三个锚点验证请求:
对以下输出进行三项检查:1)生理数量级:每个数字是否在人类范围内?如果不是,请标记。2) 临床合理性:是否存在与年龄/病史/症状不一致的说法?3) 验证清单:由独立测试/专家确认的项目。输出:[文本]
3)加强歧义:
以三个置信度级别给出您的解释:- 高置信度(直接由数据支持)- 中等置信度(合理的推论)- 推测(需要额外的数据/测试) 任务:[任务]。数据:[匿名数据]
4)决策/支持区别:
将以下任务分为两部分:A)人工智能可以自信地完成数据/草稿工作B)必须经过授权医生/工程师批准的决策点任务描述:[定义]
人工智能的作用:按任务类型划分的风险
任务类型
人工智能贡献
风险等级
验证密度
信号/图像预处理
高
低
抽查
寻找初步标记
高
中等
专家+合理
预测/风险评分
中等
高
校准+独立
诊断/治疗决定
有限
非常高
获得医生的充分批准
报告/文献草稿
高
中等
来源确认
设备安全决策
有限
非常高
标准+V&V+批准
提示:要确定一项任务的风险级别,请提出一个问题:“如果此输出不正确,患者会怎样?”如果答案是“我会损失几分钟”,请轻轻验证;如果“患者可能受到伤害”,请将输出视为假设,并在整个临床/工程过程中运行它。
注意:人工智能最危险的特征不是它会犯错误,而是它自信地、用医学语言犯错误。流畅、技术性和专业性的文本并不意味着它是正确的。相信证据,而不是风格。
常见错误
- 将流畅性误认为准确性。无论文本看起来多么医学,事实声明(价值、发现、来源、剂量)都应该得到独立验证。
- 没有按任务类型来衡量风险。以与电子邮件草稿相同的方式查看剂量帐户。验证是根据对患者的潜在伤害来衡量的。
- 不假思索地输入患者数据。健康数据是特殊的个人数据;在进入不受控制的车辆之前进行匿名处理。
- 赋予AI诊断权威。 AI不诊断;产生假设。诊断和治疗决定属于医生。
- 忽略不确定性。仅仅因为模型看起来“自信”并不意味着不确定性消失了;询问置信水平和范围。
综上所述
- 生物医学测量是间接的且充满噪音;人工智能既可以加快速度,又可以隐藏错误。
- 人工智能在数据准备方面是最安全、最有利可图的,在解释/分析方面是最有价值但风险最大的,在文档方面是加速器。
- 每个结果都通过三个锚点进行验证:生理数量级、临床合理性、独立证据。
- 结果的风险等于如果结果不正确会给患者造成的伤害;验证规模相应。
- AI不诊断;关于患者安全的每项决定均需经过授权医生和工程师的批准。
应用任务
列出您在自己的工作中每周完成的五项生物医学任务(例如信号清除、飞行前查找、报告部分、风险注释、设备测试)。根据本单元中的表格将每个人置于风险级别,并询问“如果错误,患者会怎样?”用一句话回答问题。然后为风险最低的任务写一个强有力的、匿名的提示并尝试一下;使用三个锚点检查输出,并记下哪个锚点发现了问题。
清单
- [ ] 我可以区分人工智能在生物医学工作流程中哪些地方产生安全价值,哪些地方产生风险价值。
- [ ] 我已经获得了用生理程度、临床合理性和独立证据来验证每一个结果的本能。
- [ ] 任务的风险级别“如果出现问题,患者会怎样?”我可以通过问题来确定。
- [ ] 我知道什么是幻觉和不确定性以及如何使它们可见。
- [ ] 我已经认识到,人工智能不会诊断,诊断/治疗决定取决于医生。