Добивки:
- Способност да се толкуваат концептите на чувствителност, специфичност, лажно негативно и лажно позитивно во контекст на радиологијата и критички да се читаат метриката на моделот.
- Способност да препознае предрасуди за автоматизација (прекумерно потпирање на вештачката интелигенција) и, напротив, аларм за замор и заштита на дисциплината за читање од овие две стапици
- Разбирање дека радиологот мора да чита област што не е обележана со вештачка интелигенција и дека негативниот излез на ВИ не е гаранција за дијагноза.
Двата најважни бројки за вештачката интелигенција за радиологија се колку наоди фаќа и колку лажни аларми предизвикува. Ако производителот ви каже „нашиот модел е 96% точен“, само тоа не кажува речиси ништо. Затоа што за редок наод (да речеме, 10 болести на 1.000 испити), дури и модел што не означува ништо може да изгледа како „99% точно“ - правилно препознава 990 здрави и пропушта само 10 пациенти. Во оваа единица, ќе научиме како критички да ги читаме клучните метрики на радиологијата - чувствителност, специфичност, лажно негативно, лажно позитивно - како експерт и да препознаваме две опасни човечки замки - пристрасност на автоматизација и замор од аларм.
Основен принцип: област која не е означена со вештачка интелигенција ја чита и радиологот. Негативниот резултат на вештачката интелигенција не е гаранција за дијагноза; моделот можеби го пропуштил наодот (лажно негативно). Причината за постоењето на човечкото следење е да се доловат точните моменти кога моделот е безбедно погрешен.
Читање на метрика како експерт
Ајде да разјасниме четири основни концепти. Да речеме дека тестиравме модел на 1000 испити и 100 од нив всушност ја имаа болеста.
- Вистински позитивен (ТП): Моделот го означи пациентот, навистина болен.
- Лажно негативно (FN): Моделот не е обележан, но пациентот е болен - промашување. Најопасен во радиологијата.
- Лажно позитивно (FP): Моделот е означен, но пациентот е здрав - лажна тревога.
- Вистински негативен (TN): Моделот не е обележан, навистина здрав.
Две основни метрики произлегуваат од овие:
- Чувствителност = TP / (TP + FN): Колку вистински пациенти фативме? Високата чувствителност значи ниско киднапирање.
- Специфичност = TN / (TN + FP): Колку од здравите изброивме како здрави? Високата специфичност значи помалку лажни аларми.
метрички
формула
Кога е високо
Радиолошко значење
Чувствителност
TP/(TP+FN)
Неколку лажни негативи
Критично за да се избегне пропуштање (скрининг, тријажа)
специфичност
TN/(TN+FP)
Неколку лажни позитиви
Го намалува непотребното испитување
Лажно негативна стапка
FN/(TP+FN)
лошо
Тивко штета; радиологот мора да фати
Лажно позитивно оптоварување
број на FP
оптоварувањето се зголемува
Аларм замор, потсети се
"точност"
(TP+TN)/вкупно
погрешно
Се појавува високо во ретка болест, мами
Моделот има праг (над она што резултатот се смета за „позитивен“), и овој праг ја менува чувствителноста и специфичноста во спротивни насоки: ако го намалите прагот, фаќате повеќе (чувствителност ↑), но покренувате повеќе лажни аларми (специфичност ↓). Ова не е инженерско опкружување, туку клиничка одлука: тешките трошоци за исчезнати или товарот на лажна тревога? Чувствителноста е генерално приоритетна при скрининг и тријажа.
Внимание: Никогаш не верувајте на еден број како „95% точност“. Во ретките наоди, точноста е погрешна. Вистинската изведба на моделот не може да се знае без да се праша за чувствителноста, специфичноста, лажно негативната стапка и популацијата во која е измерен.
Две човечки стапици
Пристрасност за автоматизација: Кога луѓето претерано се потпираат на излезот од автоматизиран систем и го релаксираат сопственото независно расудување. Доколку радиологот површно ја прескокне сликата велејќи „АИ рече дека е негативна, значи е чиста“, наодот што го пропуштил моделот целосно ќе биде прескокнат. Кога лажните негативи се комбинираат со пристрасноста на автоматизацијата, причината за постоењето на човечката инспекција е елиминирана.
Предупредување замор: Како резултат на тоа што моделот произведува голем број лажни позитиви, радиологот ја губи довербата во знамињата и почнува рефлексно да ги елиминира сите. Вистинскиот наод по десеттата лажна тревога, исто така, може да се елиминира. Овие две стапици се во спротивни насоки, но нивните резултати се исти: недостасува вистински наод.
Противотровот за овие две стапици е ист: без разлика што вели излезот на вештачката интелигенција, радиологот прави сопствено систематско читање. Без разлика дали вештачката интелигенција го означува или не, целата слика се скенира. ВИ е „второ око“; Првото око е секогаш радиологот.
три мини футроли
Случај 1 - Лажно негативно + пристрасност за автоматизација. На градна радиографија CAD промаши (лажно негативен) мал јазол во горната лева зона. Во напорен ден, радиологот брза низ радиографијата мислејќи дека „CAD е јасно“ (пристрасност за автоматизација). Јазолот се забележува по 8 месеци како маса од 2 cm во големина. Две грешки комбинирани: моделот промашил, човекот не проверил. Лекција: и покрај негативниот CAD, систематското читање е од суштинско значење.
Случај 2 - Алармен замор. Модел на пневмоторакс фрла во просек по 8 знамиња дневно во текот на две недели, од кои само 1-2 се реални (околу 80% лажни позитиви). Радиологот ја губи довербата во знамињата. Во третата недела, вистинското апикално знаме на пневмоторакс исто така рефлексно се пренесува како „не“; Пациентот се влошува по еден ден. Лекција: моделите со висока стапка на лажно позитивни треба да се следат, да се прегледаат прагот/моделот и во секој случај да се потврди секое знаме.
Случај 3 - Вистинската рамнотежа. Во центар за мозочен удар, моделот на тријажа на КТ на мозокот работи со висока чувствителност; Лажните позитиви се високи, но радиологот го потврдува секое знаме за 60 секунди и открива вистинско крварење за неколку минути. Тимот ја следи лажно позитивната стапка неделно, прегледувајќи го прагот кај производителот кога ќе надмине 70%. Овде, метриката се управуваше свесно; Ниту пристрасноста на автоматизацијата, ниту заморот од алармот не се појавија.
Слаб промпт / Силен промпт
Слаба навестување:
Овој модел е 97% прецизен, дали е сигурен?
Една метрика е погрешна; не може да се одговори без да се поставуваат прашања за популацијата, чувствителноста, специфичноста и лажните негативи.
Моќен потсетник:
Вашата улога: ПОМОГНЕТЕ ми критички да ги прочитам показателите за перформансите на моделот со вештачка интелигенција. Донесување одлуки; Објасни кои прашања треба да ги поставам и што значат одговорите. Ќе ви ги дадам тврдењата на една манекенка. Размислете: (1) кои метрики се дадени, а кои недостасуваат (чувствителност, специфичност, лажно негативна стапка, популација, уред), (2) дали само „точноста“ е погрешна, (3) дали е соодветно да се користи овој модел за тријажа/скрининг или дијагноза. Конечната одлука е на радиологот/институцијата. Тврдење: „Модел тестиран кај 1200 пациенти со 97% точност“.
Силната побарувачка ги доведува во прашање метриките што недостасуваат и ја прекинува зависноста од единечни броеви.
Шаблони за копирање на брзините
МЕТРИЧНО КРИТИЧНО ЧИТАЊЕ ВАША улога: ПОМОШ. Ќе ви дадам тврдење за изведба на модел. Наведете ги метриките што недостасуваат (чувствителност, специфичност, стапка на лажно негативна стапка, популација на тестирање, уред/протокол) и каде еден број (точност) може да погреши. Дискутирајте за која задача (триажа/скрининг/дијагностичка помош) моделот е соодветен за употреба. Решението е во институцијата. Приговор: [напиши]
ОБРАБОТ ЗА ОПИС НА БАЛАНС НА ПРАГОТ ќе ви дадам сценарио за подигање/намалување на прагот на моделот. Опишете го влијанието на секое сценарио врз чувствителноста, специфичноста, лажно негативните и лажно позитивните и запишете го неговиот клинички исход (пропуштање наспроти непотребно отповикување). Одлуката е клиничка/институционална. Сценарио: [напиши]
шаблон за САМОРЕВИЗИЈА ЗА ПРИЛОЖУВАЊЕ НА АВТОМАТИЗАТА Направете ми листа за проверка што ќе ја заштити мојата дисциплина за читање од пристрасност во автоматизацијата: кои чекори треба да ги преземам дури и со негативен излез на вештачката интелигенција, како да одржувам систематско скенирање, како да ја задржам вештачката интелигенција како „помошник“ наместо „алатка за испорака“.
ОБРАБОТ ЗА СЛЕДЕЊЕ НА ЗАМОР ЗА АЛЕРТ ќе ви даде неделни броеви на знамиња и вистински позитивни бројки. Пресметајте ја лажно позитивната стапка, проценете го ризикот од замор на алармирање и предложете на кој праг треба да преземам акција за да го ревидирам прагот/моделот. Потсети ме на принципот дека секое знаме сепак треба да биде потврдено. Податоци: [напиши]
Вообичаени грешки
- Потпирајќи се на единствениот број „вистина“. Реткиот наод е исто така погрешен; Чувствителноста и специфичноста треба да се прашаат заедно.
- Третирање на негативниот излез на ВИ како дијагностичка гаранција. Моделот можеби го пропуштил; Систематското читање е задолжително.
- Паѓање во предрасуди за автоматизација. Преголемото потпирање на вештачката интелигенција го поткопува независното расудување.
- Игнорирање на замор од аларм. Треба да се следат високи лажни позитиви; секое знаме сепак мора да биде потврдено.
- Грешка на прагот за „техничко поставување“. Прагот е клиничка рамнотежа; Радиологот/институцијата ги мери трошоците за промашување и лажни аларми.
Совет: Направете правило за себе: „Без разлика што вели вештачката интелигенција, ја прочитав целата слика“. Ова единствено правило истовремено ги спречува и пристрасноста на автоматизацијата (не релаксирачки на негативното) и заморот од алармот (не рефлексивно елиминирање на позитивното).
Сумирано
Оценувањето на моделот за радиологија не е за гледање на единствен број „точност“. Чувствителноста (без промашување), специфичноста (без лажни аларми), лажно негативната стапка и тест популацијата треба да се читаат заедно; Изборот на прагот е клиничка рамнотежа. Двете човечки замки - прекумерна доверба во вештачката интелигенција (пристрасност на автоматиката) и навикнување на лажни аларми и елиминирање на знамето (замор на алармот) - одат во спротивни насоки, но завршуваат со истиот резултат, пропуштајќи вистинско откритие. Има само еден противотров: Без разлика што вели вештачката интелигенција, радиологот прави сопствено систематско читање. Негативната вештачка интелигенција не е гаранција, туку најмногу корисен сигнал; Необележаната област исто така мора да се прочита.
Задача за апликација
Земете го промотивниот текст на моделот што го имате (или примерок). Со шаблонот „Критичко читање на метрика“, проценете кои метрики се дадени, кои недостасуваат и за која задача е соодветно да се користи моделот. Потоа дизајнирајте едноставна табела за да следите колку пати знамето за тријажа се остварува во текот на една недела; Запишете каква акција ќе преземете ако стапката на лажна позитивна вредност го надмине прагот што сте го поставиле (на пример, 70%). Конечно, приспособете ја листата „Автоматска пристрасност само-ревизија“ во вашата сопствена рутина за читање.
листа за проверка
- [ ] Не се потпирав на единствениот број „точност“; Прашав за чувствителноста и специфичноста.
- [ ] Ја научив лажно негативната стапка и тест популацијата.
- [ ] И покрај негативниот излез на вештачката интелигенција, го правев моето систематско читање.
- [ ] Не бев премногу сигурен во вештачката интелигенција (наспроти пристрасноста на автоматизацијата).
- [ ] Гледав за лажни позитиви; Го потврдив секое знаме (против алармниот замор).
- [ ] Имав предвид дека изборот на праг е клиничка рамнотежа.
- [ ] Го следев правилото „Ја прочитав целата слика без разлика што вели вештачката интелигенција“.