Прибуток:
- Здатність пояснити етапи очищення, кодування та аналізу даних електронних медичних записів (EHR) за допомогою штучного інтелекту.
- Здатність розпізнавати ризики клінічних даних, такі як відсутність даних, упередженість, дисбаланс класів і тимчасовий витік
- Можливість перевірки результатів прогнозної моделі шляхом калібрування, ефективності підгрупи та клінічної придатності
Пам’яттю сучасних лікарень є електронна медична карта (EHR): цифрова колекція діагнозів, результатів лабораторних досліджень, ліків, процедур, нотаток медсестри та спостережень лікаря. Ці дані є і скарбом, і мінним полем для штучного інтелекту. Скарб, тому що містить мільйони хворих річних візерунків; мінне поле, оскільки клінічні дані невпорядковані, неповні, упереджені та сповнені часових пасток. Цей блок включає очищення, кодування та аналіз даних EHR за допомогою штучного інтелекту; найпідступніші помилки (часовий витік, упередженість, класовий дисбаланс); і ми побачимо, як перевіряються результати прогнозної моделі.
Нагадаємо з самого початку: модель ризику може говорити про «у цього пацієнта висока ймовірність повторної госпіталізації»; але це результат підтримки прийняття рішень, а не рішення щодо діагнозу чи лікування. ШІ не діагностує; Рішення залежить від лікаря та клінічної команди.
Етапи роботи з даними EHR
Крок 1 — Відніміть і об’єднайте. Дані надходять з різних систем (лабораторії, аптеки, радіології); поєднується з ідентифікатором пацієнта. На цьому етапі конфіденційність є найвищим пріоритетом (див. Розділ 10).
Крок 2 — Очищення. Відсутні значення, невідповідності одиниць (плутання мг/дл і ммоль/л), повторювані записи та малоймовірні значення (вік 200, артеріальний тиск 0) усуваються. ШІ тут сильний у позначенні викидів і вільному структуруванні тексту.
Крок 3 — Кодування та стандартизація. Діагнози зіставляються зі стандартними кодами, такими як МКХ (Міжнародна класифікація хвороб), а ліки зіставляються зі стандартними словниками. Отримання структурованої інформації з довільних текстових нотаток називається обробкою природної мови (NLP); ШІ є цінним тут, але його результати потребують перевірки.
Крок 4 — Розробка функцій. Вхідні дані моделі створюються з необроблених даних: останнє лабораторне значення, тенденція, кількість ліків, оцінка супутніх захворювань тощо.
Крок 5 — Моделювання та оцінка. Прогностична модель будується та — найважливіша частина — оцінюється ретельно, без витоків.
Три найпідступніші помилки
Тимчасове витікання. Введення в функцію інформації, яка ще не існує на момент передбачення. Наприклад, використовуючи діагностику при виписці або лабораторні дослідження останньої доби, щоб оцінити ризик смерті при надходженні. Модель виглядає ідеально в лабораторії, але виходить з ладу в реальному використанні, тому що вона побачила «майбутнє».
Упередження. Дані відображають минулі клінічні рішення; Якщо ці рішення вже нерівні, модель навчається та посилює це. Наприклад, якщо певну групу історично замовляли менше для тестування, модель може подумати, що захворювання є «нижчим» у цій групі.
Класовий дисбаланс. Якщо подія, що цікавить (наприклад, рідкісне ускладнення), становить 1% даних, модель, яка завжди каже «немає події», виглядатиме точною на 99%, але буде марною. Замість точності потрібні чутливість, точність і метрики на основі подій.
Оцінка: розрізнення недостатньо, калібрування є обов’язковим
Є два різних питання. Дискримінація (типова міра AUC): чи модель правильно ранжує пацієнтів за ризиком? Калібрування: чи ймовірності, задані моделлю, відповідають фактичним частотам? Чи приблизно у 20% пацієнтів, які кажуть «ризик 20%», насправді є подія? Оскільки рішення приймаються на основі порогових значень у клініці, добре ранжована, але погано відкалібрована модель призведе до неправильних порогових рішень. Крім того, слід окремо повідомити про показники підгрупи (вік, стать, етнічна приналежність, лікарня) і поставити питання про клінічну корисність (чи справді використання цієї моделі дає кращі результати?).
Три міні-кейси: у цифрах
Випадок 1 — успіх завищений витоком. Модель реадмісії показала AUC 0,92 у внутрішньому тестуванні; це виглядало чудово. Огляд виявив, що функції включають «амбулаторний прийом після виписки»; Ця інформація була недоступна на момент прогнозування. Після того, як витік було усунено, AUC впав до 0,71 — реалістичного та придатного значення.
Випадок 2 — калібрувальний дрейф. Хоча бал раннього попередження про сепсис був добре відкалібрований у лікарні, де він був розроблений, профіль пацієнта показав подвійну фактичну частоту подій для того самого бала в іншій лікарні. Оцінка оцінена правильно, але ймовірності були неправильними; поріг не можна використовувати без повторного калібрування.
Кейс 3 — Економія часу за допомогою НЛП. Одна дослідницька група вручну вилучала історію куріння з 12 000 нотаток пацієнтів; Приблизно 2 хвилини на ноту, загалом 400 годин. Екстракція за допомогою НЛП скоротила це до кількох годин; Команда лише вручну перевірила випадково вибраний зразок перевірки, який модель залишила «незрозумілим». Вирішальним було ретельне дослідження зразка перевірки.
Слабка підказка / Сильна підказка
Слабка підказка:
Створіть модель ризику на основі цих даних пацієнта та повідомте про результати.[data]
Потужна підказка:
Ваша роль: Ви асистент з аналізу клінічних даних (ВИ НЕ ВИРІШУЄТЕ). Критикуйте ПЛАН моделі прогнозування для наступного списку анонімних змінних:- Позначте, чи присутня кожна змінна під час прогнозування (ризик тимчасового витоку).- Перелічіть дисбаланс класу та потенційні джерела упередженості.- Запропонуйте дискримінацію + калібрування + підгрупу + клінічну корисність для оцінки.- Вкажіть, що рішення залишається за клінічною групою. Анонімні змінні та target:[список]
Чотири шаблони, які можна копіювати
1) Перевірка витоку:
Класифікуйте наведений нижче список функцій як «доступний на момент передбачення» / «майбутня інформація (витік)» і обґрунтуйте це. Ціль і момент передбачення: [визначення]. Особливості: [список]
2) Звіт про якість даних:
Перевірте, чи відсутні показники значення, відсутні значення, неузгодженість одиниць вимірювання та повторюваний запис для цієї анонімної таблиці; З’явиться зведена таблиця якості. Таблиця: [дані]
3) Схема перевірки висновку НЛП:
Напишіть план перевірки для кроку NLP, який витягує [змінну] з довільних текстових анотацій: розмір випадкової вибірки, маркування золотого стандарту, метрика відповідності, аналіз помилок.
4) Структура оцінювання:
Напишіть проект схеми оцінювання для цієї клінічної моделі: розрізнення (AUC), калібрувальна крива, ефективність підгрупи, аналіз кривої прийняття рішення. Модель: [опис]
Роль моделі: За типом завдання
Тип завдання
внесок ШІ
критичність
перевірка
Очищення даних/викиди
висока
низький
вибіркова перевірка
Витяг НЛП із записок
висока
середній
Перевірка зразка
Оцінка ризику/прогнозування
середній
висока
Калібрування + підгрупа
Планування ресурсів/потужності
середній
середній
Затвердження підрозділу
Рішення про лікування
обмежений
дуже високий
Повний дозвіл лікаря
Порада: якщо AUC клінічної моделі неочікувано висока (наприклад, вище 0,95), подивіться на тимчасовий витік, перш ніж святкувати. У реальному світі такі високі значення зазвичай є ознакою витоку інформації.
Застереження: модель може вивчити та посилити нерівності в історичних даних. Висока загальна точність може означати систематичне заподіяння шкоди певним групам пацієнтів; Результати завжди слід повідомляти в підгрупах.
Поширені помилки
- Не помічаючи тимчасового витоку. Знання про майбутнє породжує помилковий успіх у лабораторії.
- Будьте задоволені точністю. Точність вводить в оману через незбалансовані дані; Потрібна чутливість і калібрування.
- Підгрупи не повідомляються. Загальний показник приховує упередженість і нерівність.
- Пропуск калібрування. Навіть хороша модель ранжирування може припуститися помилок у своїх порогових рішеннях.
- Залишаючи рішення моделі. Вихід - підтримка; Рішення про лікування приймає клінічна команда.
Підсумовуючи
- Дані EHR є потужними, але неоднозначними, неповними та упередженими; очищення та кодування є критично важливими кроками.
- Тимчасова витік - найпідступніша помилка; Майбутнє знання породжує помилковий успіх у лабораторії.
- Дисбаланс класів і зміщення роблять метрику точності оманливою.
- Оцінка повинна включати розрізнення, калібрування, підгрупування та клінічну корисність.
- Підтримка прогнозних результатів; Рішення про діагностику та лікування належать клінічній команді.
Аплікаційне завдання
Побудуйте ціль прогнозування та список із десяти змінних (навмисно включіть змінну «перспективу», наприклад, діагноз при виписці). Використовуйте потужну підказку, щоб перевірити модель на наявність витоків і перевірити, чи вона фіксує цю змінну. Потім напишіть структуру оцінки для цієї моделі за трьома елементами, включаючи дискримінацію, калібрування та підгрупування.
контрольний список
- [ ] Я розумію етапи вилучення, очищення, кодування та моделювання роботи з даними EHR.
- [ ] Я можу розпізнати тимчасовий витік і перевірити список власності.
- [ ] Я зрозумів, як класовий дисбаланс і упередження вводять в оману точність.
- [ ] Я знаю різницю між дискримінацією та калібруванням і необхідність обох.
- [ ] Я можу позиціонувати прогнозний результат як підтримку, а не рішення.