单位 7 / 11

临床数据分析和电子健康记录

收益:

  • 能够解释使用人工智能清理、编码和分析电子健康记录 (EHR) 数据的步骤。
  • 能够识别临床数据风险,例如数据缺失、偏差、类别不平衡和时间泄漏
  • 能够通过校准、亚组表现和临床实用性来验证预测模型输出

现代医院的记忆是电子健康记录 (EHR):诊断、实验室结果、药物、程序、护士记录和医生观察的数字集合。这些数据对于人工智能来说既是宝藏,也是雷区。珍贵,因为它包含数以百万计的病态年度模式;雷区是因为临床数据杂乱、不完整、有偏见且充满时间陷阱。该单元包括利用人工智能清理、编码和分析 EHR 数据;最隐蔽的错误(时间泄漏、偏差、类别不平衡);我们将看到如何验证预测模型的输出。

让我们从一开始就提醒一下:风险模型可能会说“这个病人有很高的再入院概率”;但这是决策支持输出,而不是诊断或治疗决策。 AI不诊断;该决定取决于医生和临床团队。

使用 EHR 数据的步骤

步骤 1 — 减去并合并。数据来自不同系统(实验室、药房、放射科);与患者 ID 相结合。在此阶段,保密性是最高优先级的(参见第 10 单元)。

第 2 步 — 清洁。缺失值、单位不一致(mg/dL 和 mmol/L 混淆)、重复记录和不太可能的值(年龄 200、血压 0)均被消除。人工智能在异常值标记和自由文本结构方面非常强大。

第 3 步 — 编码和标准化。诊断被映射到标准代码,例如ICD(国际疾病分类),药物被映射到标准词典。从自由文本笔记中提取结构化信息称为自然语言处理(NLP);人工智能在这里很有价值,但其输出需要验证。

第 4 步——特征工程。模型输入是根据原始数据生成的:最后的实验室值、趋势、药物数量、合并症评分等。

第 5 步 — 建模和评估。预测模型的构建和最关键的部分是以仔细、无泄漏的方式进行评估。

三个最阴险的错误

时间泄漏。将预测时尚不存在的信息放入特征中。例如,使用出院诊断或最后一天的实验室检测来估计入院时的死亡风险。该模型在实验室里看起来很完美,但在实际使用中却崩溃了,因为它看到了“未来”。

偏见。数据反映了过去的临床决策;如果这些决策已经不平等,模型会学习并强化这一点。例如,如果某个群体历来接受较少的检测,模型可能会认为该群体的疾病程度“较低”。

阶级失衡。如果感兴趣的事件(例如罕见的并发症)占数据的 1%,则始终显示“无事件”的模型看起来准确度为 99%,但毫无用处。需要的不是准确性,而是灵敏度、精确度和基于事件的指标。

评估:歧视还不够,必须校准

有两个不同的问题。歧视(AUC 的典型衡量标准):模型是否正确地按风险对患者进行排序?校准:模型给出的概率与实际频率相符吗?大约 20% 的说“20% 风险”的患者实际上发生过事件吗?由于决策是根据临床阈值做出的,排名良好但校准不佳的模型将导致错误的阈值决策。此外,应单独报告亚组表现(年龄、性别、种族、医院),并应询问临床实用性问题(使用该模型是否真的会产生更好的结果?)。

三个迷你案例:从数字来看

案例 1——因泄密而夸大成功。在内部测试中,再入院模型的 AUC 为 0.92;看起来很棒。审查发现,功能包括“出院后门诊预约”;该信息在预测时尚不可用。一旦泄漏被清理干净,AUC 就会下降到 0.71——一个现实且可用的值。

案例 2 — 校准漂移。虽然脓毒症早期预警评分在制定该评分的医院得到了很好的校准,但患者资料显示,同一评分在不同医院的实际事件发生率是其两倍。分数排名正确,但概率错误;如果不重新校准,则无法使用阈值。

案例 3 — 使用 NLP 节省时间。一个研究小组从 12,000 份患者笔记中手动提取吸烟史;每个音符大约 2 分钟,总共 400 小时。 NLP 辅助提取将时间缩短到几个小时;该团队仅手工检查了模型“不清楚”的随机选择的验证样本。至关重要的是对验证样本的仔细检查。

弱提示/强提示

弱提示:

根据该患者数据构建风险模型并报告结果。[数据]

强力提示:

您的角色:您是一名临床数据分析助理(由您决定)。批评以下匿名变量列表的预测模型计划:- 标记每个变量在预测时是否存在(时间泄漏的风险)。- 列出类别不平衡和潜在偏差来源。- 建议区分 + 校准 + 亚组 + 评估的临床有用性。 - 声明决定权在于临床团队。匿名变量和目标:[列表]

四个可复制模板

1)泄漏检查:

将以下功能列表分类为“预测时可用”/“未来信息(泄漏)”并证明其合理性。目标和预测时刻:[定义]。特点:[列表]

2)数据质量报告:

检查该匿名表的缺失值率、缺失值、单位不一致和重复记录;将出现质量汇总表。表:[数据]

3)NLP推理验证方案:

为 NLP 步骤编写验证计划,从自由文本注释中提取[变量]:随机样本大小、黄金标准标签、拟合度量、误差分析。

4)评估框架:

为该临床模型编写评估框架草案:歧视(AUC)、校准曲线、亚组表现、决策曲线分析。型号:【说明】

模型的角色:按任务类型

任务类型

人工智能贡献

关键性

验证

数据清理/异常值

抽查

从笔记中提取 NLP

中等

样品验证

风险/预测评分

中等

校准+分组

资源/容量规划

中等

中等

业务单位审批

治疗决定

有限

非常高

获得医生的充分批准

提示:如果临床模型的 AUC 出乎意料地高(例如高于 0.95),请在庆祝之前查找时间泄漏。在现实世界中,如此高的值通常是信息泄露的标志。
注意:该模型可能会学习并强化历史数据中的不平等。整体准确性高可能意味着某些患者群体会受到系统性伤害;应始终按小组报告绩效。

常见错误

  • 没有注意到时间泄漏。对未来的了解会在实验室中产生虚假的成功。
  • 对准确性感到满意。不平衡的数据会导致准确性产生误导;需要灵敏度和校准。
  • 不报告亚组。总体指标隐藏了偏见和不平等。
  • 跳过校准。即使是好的排名模型也可能在阈值决策中犯错误。
  • 将决定权留给模型。输出为支持;治疗决定取决于临床团队。

综上所述

  • EHR 数据很强大,但不完整、不完整且存在偏见;清洁和编码是关键步骤。
  • 时间泄漏是最隐蔽的错误;未来的知识会在实验室中产生虚假的成功。
  • 类别不平衡和偏差使准确度指标产生误导。
  • 评估应包括区分、校准、分组和临床实用性。
  • 预测输出是支持;诊断和治疗决定属于临床团队。

应用任务

构建预测目标和十个变量的列表(有意包括“前景”变量,例如出院诊断)。使用强大的提示来检查模型是否存在泄漏,并查看它是否捕获了该变量。然后为该模型编写一个评估框架,分三个项目,包括区分、校准和分组。

清单

  • [ ] 我了解处理 EHR 数据的提取、清理、编码和建模步骤。
  • [ ] 我可以识别时间泄漏并检查属性列表。
  • [ ] 我意识到阶级不平衡和偏见如何误导准确性。
  • [ ] 我知道辨别和校准之间的区别以及两者的必要性。
  • [ ] 我可以将预测输出定位为支持,而不是决策。