Единицы
1. Введение в искусственный интеллект в радиологии: роли, границы, одобрение радиологов и этика 2. Предварительная оценка изображений и определение приоритетности (сортировка): определение приоритетности срочных результатов 3. Структурированная отчетность и проект отчета: рентгенолог проверяет проект AI 4. Автоматизация измерений: измерения узлов, повреждений, объема и плотности 5. Рабочий процесс PACS, RIS и DICOM: подключение ИИ в нужном месте 6. Риск ложноотрицательных и ложноположительных результатов: CAD, чувствительность и предвзятость автоматизации 7. Искусственный интеллект, специфичный для модальности: рентген легких, КТ, МРТ, маммография и инсульт 8. Качество изображения, протокол и оптимизация дозы: до и после съемки 9. Сравнительное чтение и последующее наблюдение: предыдущие обследования, изменения и RECIST 10. Конфиденциальность данных, анонимизация DICOM, KVKK, этика и проверка модели 11. Комплексный рабочий процесс, управление качеством и самоаудит
Единица 6 / 11

Риск ложноотрицательных и ложноположительных результатов: CAD, чувствительность и предвзятость автоматизации

Прибыль:

  • Способность интерпретировать концепции чувствительности, специфичности, ложноотрицательных и ложноположительных результатов в контексте радиологии и критически читать показатели модели.
  • Уметь распознавать предвзятость автоматизации (чрезмерную зависимость от искусственного интеллекта) и, наоборот, тревожную усталость, и защищать дисциплину чтения от этих двух ловушек.
  • Понимание того, что радиолог должен прочитать область, не отмеченную искусственным интеллектом, и что отрицательный результат ИИ не является гарантией диагноза.

Два наиболее важных показателя для радиологического ИИ — это количество результатов, которые он фиксирует, и количество ложных тревог, которые он выдает. Если производитель говорит вам, что «наша модель точна на 96%», это само по себе почти ничего не говорит. Потому что для редкого результата (скажем, 10 заболеваний в 1000 обследований) даже модель, которая ничего не отмечает, может оказаться «точной на 99%» — она правильно распознает 990 здоровых и пропускает только 10 пациентов. В этом модуле мы научимся критически оценивать важнейшие показатели радиологии — чувствительность, специфичность, ложноотрицательный и ложноположительный результат — как эксперт, и распознавать две опасные человеческие ловушки — предвзятость автоматизации и усталость от тревог.

Основной принцип: рентгенолог также считывает область, не отмеченную искусственным интеллектом. Отрицательный результат ИИ не является гарантией диагноза; модель могла пропустить результат (ложноотрицательный результат). Смысл человеческого мониторинга состоит в том, чтобы точно зафиксировать моменты, когда модель безопасно ошибочна.

Чтение показателей как эксперт

Давайте проясним четыре основных понятия. Допустим, мы протестировали модель на 1000 экзаменах, и в 100 из них действительно было выявлено заболевание.

  • Истинно положительный результат (TP): модель отметила пациента как действительно больного.
  • Ложноотрицательный результат (ЛН): Модель не отмечена, но пациент болен — промах. Самый опасный в радиологии.
  • Ложное срабатывание (FP): модель помечена, но пациент здоров — ложная тревога.
  • Истинно отрицательный результат (TN): Модель не отмечена, действительно здорова.

Из этого возникают две основные метрики:

  • Чувствительность = TP/(TP+FN): Сколько реальных пациентов мы поймали? Высокая чувствительность означает низкое отведение.
  • Специфичность = TN/(TN+FP): Сколько здоровых мы посчитали здоровыми? Высокая специфичность означает меньше ложных тревог.

метрика

формула

Когда это высоко

Радиологическое значение

Чувствительность

ТП/(ТП+ФН)

Мало ложноотрицательных результатов

Критически важно, чтобы не пропустить (скрининг, сортировка)

специфика

ТН/(ТН+ФП)

Мало ложных срабатываний

Уменьшает ненужное обследование

Ложноотрицательный показатель

ФН/(ТП+ФН)

плохой

Тихий вред; рентгенолог должен поймать

Ложноположительная нагрузка

количество ФП

нагрузка увеличивается

Тревога усталости, отзыв

"точность"

(ТП+ТН)/всего

вводящий в заблуждение

Появляется высокий уровень редких заболеваний, обманывает

Модель имеет порог (выше которого оценка считается «положительной»), и этот порог меняет чувствительность и специфичность в противоположных направлениях: если вы снижаете порог, вы улавливаете больше (чувствительность ↑), но вызываете больше ложных тревог (специфичность ↓). Это не инженерная установка, а клиническое решение: высокая цена пропажи или бремя ложной тревоги? Чувствительность обычно имеет приоритет при скрининге и сортировке.

Внимание: никогда не доверяйте одному числу, например «точность 95 %». В редких случаях точность вводит в заблуждение. Истинную эффективность модели невозможно узнать, не задав вопрос о чувствительности, специфичности, частоте ложноотрицательных результатов и популяции, в которой она была измерена.

Две человеческие ловушки

Предвзятость автоматизации: когда люди чрезмерно полагаются на результаты автоматизированной системы и ослабляют собственное независимое суждение. Если рентгенолог поверхностно пропустит изображение, сказав: «ИИ сказал, что оно отрицательное, значит, оно чистое», результат, пропущенный моделью, будет полностью пропущен. Когда ложноотрицательные результаты сочетаются с предвзятостью автоматизации, смысл человеческого контроля исчезает.

Усталость от оповещений: в результате того, что модель выдает большое количество ложных срабатываний, рентгенолог теряет доверие к флажкам и начинает рефлекторно их устранять. Верный результат после десятой ложной тревоги также может быть исключен. Эти две ловушки расположены в противоположных направлениях, но результат у них один и тот же: упущение настоящей находки.

Противоядие от этих двух ловушек одно и то же: независимо от того, что говорит вывод ИИ, радиолог самостоятельно проводит систематическое чтение. Независимо от того, отмечает это ИИ или нет, сканируется всё изображение. ИИ — «второй глаз»; Первый глаз всегда у рентгенолога.

три мини-кейса

Случай 1 — Ложноотрицательный результат + систематическая ошибка автоматизации. На рентгенограмме грудной клетки CAD пропускает (ложноотрицательный) небольшой узелок в верхней левой зоне. В напряженный день рентгенолог спешит просматривать рентгенограммы, думая: «CAD чист» (предвзятость автоматизации). Узелок замечают через 8 месяцев в виде образования размером 2 см. Две ошибки в совокупности: модель пропущена, человек не проверил. Урок: несмотря на отрицательный результат CAD, систематическое чтение имеет важное значение.

Случай 2 — Усталость от тревоги. Модель пневмоторакса выдает в среднем 8 сигналов в день в течение двух недель, из которых только 1-2 настоящие (около 80% ложных срабатываний). Радиолог теряет доверие к флажкам. На третьей неделе истинный признак апикального пневмоторакса также рефлекторно воспринимается как «нет»; Через сутки пациенту становится хуже. Урок: модели с высоким уровнем ложных срабатываний следует отслеживать, проверять пороговые значения/модели и в любом случае подтверждать каждый флаг.

Случай 3 — Правильный баланс. В центре инсульта модель сортировки КТ головного мозга работает с высокой чувствительностью; Ложноположительных результатов много, но рентгенолог подтверждает каждый признак за 60 секунд и обнаруживает настоящее кровотечение в течение нескольких минут. Команда еженедельно отслеживает уровень ложных срабатываний, согласовывая пороговое значение с производителем, когда оно превышает 70%. Здесь метриками управляли сознательно; Ни предвзятости к автоматизации, ни усталости от тревог не возникло.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Эта модель точна на 97%, надежна ли она?

Одиночный показатель вводит в заблуждение; На него невозможно ответить, не задав вопросов о популяции, чувствительности, специфичности и ложноотрицательных результатах.

Мощная подсказка:

Ваша роль: ПОМОГИТЕ мне критически оценить показатели производительности модели ИИ. Принятие решений; Объясните, какие вопросы мне следует задать и что означают ответы. Я дам вам претензии к модели. Подумайте: (1) какие показатели указаны, а какие отсутствуют (чувствительность, специфичность, уровень ложноотрицательных результатов, популяция, устройство), (2) вводит ли в заблуждение сама по себе «точность», (3) уместно ли использовать эту модель для сортировки/скрининга или диагностики. Окончательное решение остается за рентгенологом/учреждением. Утверждение: «Модель протестирована на 1200 пациентах с точностью 97 %».

Высокий спрос ставит под сомнение недостающие показатели и исключает необходимость полагаться на отдельные цифры.

Копируемые шаблоны подсказок

ШАБЛОН МЕТРИЧЕСКОГО КРИТИЧЕСКОГО ЧТЕНИЯВаша роль: ПОМОЩЬ. Я приведу вам заявленные характеристики модели. Перечислите недостающие показатели (чувствительность, специфичность, уровень ложноотрицательных результатов, популяцию тестируемых, устройство/протокол), а также укажите, где одно число (точность) может вводить в заблуждение. Обсудите, для какой задачи (сортировка/скрининг/помощь в диагностике) подходит модель. Решение находится в учреждении. Претензия: [написать]

ШАБЛОН ОПИСАНИЯ ПОРОГОВОГО БАЛАНСА предоставит вам сценарий повышения/понижения порога модели. Опишите влияние каждого сценария на чувствительность, специфичность, ложноотрицательный и ложноположительный результат и запишите его клинический результат (пропуск или ненужный отзыв). Решение является клиническим/институциональным. Сценарий: [написать]

ШАБЛОН САМО-АУДИТА АВТОМАТИЧЕСКИХ ПРЕДСТАВЛЕНИЙ Предоставьте мне контрольный список, который защитит мою дисциплину чтения от предвзятости автоматизации: какие шаги мне следует предпринять даже при отрицательных результатах ИИ, как поддерживать систематическое сканирование, как сохранить ИИ в качестве «помощника», а не «инструмента доставки».

ШАБЛОН МОНИТОРИНГА ПРЕДУПРЕЖДЕНИЯ УСТАЛОСТИ предоставит вам еженедельные подсчеты флагов и фактические положительные цифры. Рассчитайте уровень ложных срабатываний, оцените риск утомления оповещения и предложите, при каком пороге мне следует предпринять действия по пересмотру порога/модели. Напомните мне принцип, согласно которому каждый флаг все равно должен быть подтвержден. Данные: [записать]

Распространенные ошибки

  • Опираясь на единственное «правдивое» число. Редкая находка также вводит в заблуждение; Чувствительность и специфичность следует задавать вместе.
  • Рассматривать отрицательный результат AI как диагностическую гарантию. Модель, возможно, это пропустила; Систематическое чтение обязательно.
  • Впадение в предвзятость к автоматизации. Чрезмерная зависимость от ИИ подрывает независимость суждений.
  • Игнорирование тревожной усталости. Следует отслеживать высокий уровень ложноположительных результатов; каждый флаг еще должен быть подтвержден.
  • Принятие порога за «техническую настройку». Порог представляет собой клинический баланс; Радиолог/учреждение взвешивает стоимость промахов и ложных тревог.
Совет: Возьмите за правило: «Что бы ни говорил ИИ, я читаю изображение целиком». Это единственное правило одновременно сдерживает как предвзятость к автоматизации (не расслабляться на негативе), так и усталость от тревоги (не рефлекторно устранять позитив).

В итоге

Оценка радиологической модели заключается не в рассмотрении одного показателя «точности». Чувствительность (отсутствие промахов), специфичность (отсутствие ложных тревог), уровень ложноотрицательных результатов и популяцию исследуемых следует рассматривать вместе; Выбор порога – это клинический баланс. Две человеческие ловушки — чрезмерная уверенность в ИИ (предвзятость автоматизации) и привыкание к ложным тревогам и устранению флага (усталость от тревоги) — идут в противоположных направлениях, но заканчиваются одним и тем же результатом, упуская реальные результаты. Есть только одно противоядие: что бы ни говорил ИИ, рентгенолог самостоятельно проводит систематическое чтение. Негативный ИИ — это не гарантия, а, в лучшем случае, полезный сигнал; Немаркированную область также необходимо прочитать.

Задача приложения

Возьмите рекламный текст имеющейся у вас модели (или образец). С помощью шаблона «Критическое чтение метрик» оцените, какие метрики предусмотрены, какие отсутствуют и для какой задачи целесообразно использовать модель. Затем создайте простую диаграмму, чтобы отслеживать, сколько раз в течение недели срабатывает флаг сортировки; Запишите, какие действия вы предпримете, если уровень ложных срабатываний превысит установленный вами порог (например, 70%). Наконец, адаптируйте список «Самоконтроль предвзятости автоматизации» к своей собственной рутине чтения.

контрольный список

  • [ ] Я не полагался на одно число «точности»; Я спросил о чувствительности и специфичности.
  • [ ] Я узнал уровень ложноотрицательных результатов и тестируемую группу.
  • [ ] Несмотря на отрицательные результаты ИИ, я систематически читал.
  • [ ] Я не был слишком уверен в ИИ (по сравнению с предвзятостью к автоматизации).
  • [ ] Я следил за ложными срабатываниями; Я подтвердил каждый флаг (против усталости от тревоги).
  • [ ] Я принял во внимание, что выбор порога представляет собой клинический баланс.
  • [ ] Я следовал правилу «Я читаю все изображение, независимо от того, что говорит ИИ».