收益:
- 能够解释使用人工智能清理、编码和分析电子健康记录 (EHR) 数据的步骤。
- 能够识别临床数据风险,例如数据缺失、偏差、类别不平衡和时间泄漏
- 能够通过校准、亚组表现和临床实用性来验证预测模型输出
现代医院的记忆是电子健康记录 (EHR):诊断、实验室结果、药物、程序、护士记录和医生观察的数字集合。这些数据对于人工智能来说既是宝藏,也是雷区。珍贵,因为它包含数以百万计的病态年度模式;雷区是因为临床数据杂乱、不完整、有偏见且充满时间陷阱。该单元包括利用人工智能清理、编码和分析 EHR 数据;最隐蔽的错误(时间泄漏、偏差、类别不平衡);我们将看到如何验证预测模型的输出。
让我们从一开始就提醒一下:风险模型可能会说“这个病人有很高的再入院概率”;但这是决策支持输出,而不是诊断或治疗决策。 AI不诊断;该决定取决于医生和临床团队。
使用 EHR 数据的步骤
步骤 1 — 减去并合并。数据来自不同系统(实验室、药房、放射科);与患者 ID 相结合。在此阶段,保密性是最高优先级的(参见第 10 单元)。
第 2 步 — 清洁。缺失值、单位不一致(mg/dL 和 mmol/L 混淆)、重复记录和不太可能的值(年龄 200、血压 0)均被消除。人工智能在异常值标记和自由文本结构方面非常强大。
第 3 步 — 编码和标准化。诊断被映射到标准代码,例如ICD(国际疾病分类),药物被映射到标准词典。从自由文本笔记中提取结构化信息称为自然语言处理(NLP);人工智能在这里很有价值,但其输出需要验证。
第 4 步——特征工程。模型输入是根据原始数据生成的:最后的实验室值、趋势、药物数量、合并症评分等。
第 5 步 — 建模和评估。预测模型的构建和最关键的部分是以仔细、无泄漏的方式进行评估。
三个最阴险的错误
时间泄漏。将预测时尚不存在的信息放入特征中。例如,使用出院诊断或最后一天的实验室检测来估计入院时的死亡风险。该模型在实验室里看起来很完美,但在实际使用中却崩溃了,因为它看到了“未来”。
偏见。数据反映了过去的临床决策;如果这些决策已经不平等,模型会学习并强化这一点。例如,如果某个群体历来接受较少的检测,模型可能会认为该群体的疾病程度“较低”。
阶级失衡。如果感兴趣的事件(例如罕见的并发症)占数据的 1%,则始终显示“无事件”的模型看起来准确度为 99%,但毫无用处。需要的不是准确性,而是灵敏度、精确度和基于事件的指标。
评估:歧视还不够,必须校准
有两个不同的问题。歧视(AUC 的典型衡量标准):模型是否正确地按风险对患者进行排序?校准:模型给出的概率与实际频率相符吗?大约 20% 的说“20% 风险”的患者实际上发生过事件吗?由于决策是根据临床阈值做出的,排名良好但校准不佳的模型将导致错误的阈值决策。此外,应单独报告亚组表现(年龄、性别、种族、医院),并应询问临床实用性问题(使用该模型是否真的会产生更好的结果?)。
三个迷你案例:从数字来看
案例 1——因泄密而夸大成功。在内部测试中,再入院模型的 AUC 为 0.92;看起来很棒。审查发现,功能包括“出院后门诊预约”;该信息在预测时尚不可用。一旦泄漏被清理干净,AUC 就会下降到 0.71——一个现实且可用的值。
案例 2 — 校准漂移。虽然脓毒症早期预警评分在制定该评分的医院得到了很好的校准,但患者资料显示,同一评分在不同医院的实际事件发生率是其两倍。分数排名正确,但概率错误;如果不重新校准,则无法使用阈值。
案例 3 — 使用 NLP 节省时间。一个研究小组从 12,000 份患者笔记中手动提取吸烟史;每个音符大约 2 分钟,总共 400 小时。 NLP 辅助提取将时间缩短到几个小时;该团队仅手工检查了模型“不清楚”的随机选择的验证样本。至关重要的是对验证样本的仔细检查。
弱提示/强提示
弱提示:
根据该患者数据构建风险模型并报告结果。[数据]
强力提示:
您的角色:您是一名临床数据分析助理(由您决定)。批评以下匿名变量列表的预测模型计划:- 标记每个变量在预测时是否存在(时间泄漏的风险)。- 列出类别不平衡和潜在偏差来源。- 建议区分 + 校准 + 亚组 + 评估的临床有用性。 - 声明决定权在于临床团队。匿名变量和目标:[列表]
四个可复制模板
1)泄漏检查:
将以下功能列表分类为“预测时可用”/“未来信息(泄漏)”并证明其合理性。目标和预测时刻:[定义]。特点:[列表]
2)数据质量报告:
检查该匿名表的缺失值率、缺失值、单位不一致和重复记录;将出现质量汇总表。表:[数据]
3)NLP推理验证方案:
为 NLP 步骤编写验证计划,从自由文本注释中提取[变量]:随机样本大小、黄金标准标签、拟合度量、误差分析。
4)评估框架:
为该临床模型编写评估框架草案:歧视(AUC)、校准曲线、亚组表现、决策曲线分析。型号:【说明】
模型的角色:按任务类型
任务类型
人工智能贡献
关键性
验证
数据清理/异常值
高
低
抽查
从笔记中提取 NLP
高
中等
样品验证
风险/预测评分
中等
高
校准+分组
资源/容量规划
中等
中等
业务单位审批
治疗决定
有限
非常高
获得医生的充分批准
提示:如果临床模型的 AUC 出乎意料地高(例如高于 0.95),请在庆祝之前查找时间泄漏。在现实世界中,如此高的值通常是信息泄露的标志。
注意:该模型可能会学习并强化历史数据中的不平等。整体准确性高可能意味着某些患者群体会受到系统性伤害;应始终按小组报告绩效。
常见错误
- 没有注意到时间泄漏。对未来的了解会在实验室中产生虚假的成功。
- 对准确性感到满意。不平衡的数据会导致准确性产生误导;需要灵敏度和校准。
- 不报告亚组。总体指标隐藏了偏见和不平等。
- 跳过校准。即使是好的排名模型也可能在阈值决策中犯错误。
- 将决定权留给模型。输出为支持;治疗决定取决于临床团队。
综上所述
- EHR 数据很强大,但不完整、不完整且存在偏见;清洁和编码是关键步骤。
- 时间泄漏是最隐蔽的错误;未来的知识会在实验室中产生虚假的成功。
- 类别不平衡和偏差使准确度指标产生误导。
- 评估应包括区分、校准、分组和临床实用性。
- 预测输出是支持;诊断和治疗决定属于临床团队。
应用任务
构建预测目标和十个变量的列表(有意包括“前景”变量,例如出院诊断)。使用强大的提示来检查模型是否存在泄漏,并查看它是否捕获了该变量。然后为该模型编写一个评估框架,分三个项目,包括区分、校准和分组。
清单
- [ ] 我了解处理 EHR 数据的提取、清理、编码和建模步骤。
- [ ] 我可以识别时间泄漏并检查属性列表。
- [ ] 我意识到阶级不平衡和偏见如何误导准确性。
- [ ] 我知道辨别和校准之间的区别以及两者的必要性。
- [ ] 我可以将预测输出定位为支持,而不是决策。