Pelnas:
- Gebėjimas interpretuoti jautrumo, specifiškumo, klaidingo neigiamo ir klaidingo teigiamo sąvokas radiologijos kontekste ir kritiškai skaityti modelio metrikas.
- Gebėjimas atpažinti automatizavimo šališkumą (perdėtą pasitikėjimą dirbtiniu intelektu) ir, priešingai, įspėti apie nuovargį, ir apsaugoti skaitymo discipliną nuo šių dviejų spąstų
- Supratimas, kad radiologas turi perskaityti sritį, kuri nėra pažymėta dirbtiniu intelektu, o neigiama AI išvestis nėra diagnozės garantija.
Du svarbiausi radiologijos AI skaičiai yra tai, kiek radinių jis sugauna ir kiek klaidingų pavojaus signalų sukelia. Jei gamintojas jums sako, kad „mūsų modelis yra 96 % tikslus“, vien tai beveik nieko nesako. Nes retam radiniui (tarkim, 10 ligų iš 1000 tyrimų) net ir nieko nežymintis modelis gali pasirodyti „99% tikslus“ – jis teisingai atpažįsta 990 sveikų ir praleidžia tik 10 pacientų. Šiame skyriuje išmoksime kaip ekspertas kritiškai perskaityti svarbiausius radiologijos rodiklius – jautrumą, specifiškumą, klaidingą neigiamą, klaidingą teigiamą – ir atpažinti du pavojingus žmogaus spąstus – automatikos šališkumą ir aliarmo nuovargį.
Pagrindinis principas: sritį, kuri nėra pažymėta dirbtiniu intelektu, taip pat skaito radiologas. Neigiamas AI rezultatas nėra diagnozės garantija; modelis galėjo praleisti radinį (klaidingai neigiamas). Žmonių stebėjimo prasmė yra užfiksuoti tikslias akimirkas, kai modelis saugiai klysta.
Skaito metriką kaip ekspertas
Paaiškinkime keturias pagrindines sąvokas. Tarkime, kad išbandėme modelį atlikdami 1000 egzaminų ir 100 iš jų iš tikrųjų sirgo šia liga.
- Tikras teigiamas (TP): modelis pažymėjo pacientą, tikrai sergantį.
- Klaidingai neigiamas (FN): modelis nepažymėjo, bet pacientas serga – praleisti. Pavojingiausias radiologijoje.
- Klaidingai teigiamas (FP): modelis pažymėtas, bet pacientas sveikas – klaidingas pavojaus signalas.
- Tikras neigiamas (TN): modelis nepasižymėjo, tikrai sveikas.
Iš jų atsiranda dvi pagrindinės metrikos:
- Jautrumas = TP / (TP + FN): kiek tikrų pacientų sugavome? Didelis jautrumas reiškia mažą pagrobimą.
- Specifiškumas = TN / (TN + FP): kiek sveikų laikėme sveikais? Didelis specifiškumas reiškia mažiau klaidingų aliarmų.
metrinė
formulę
Kai jis aukštas
Radiologinė reikšmė
Jautrumas
TP/(TP+FN)
Keletas klaidingų negatyvų
Labai svarbu, kad netrūktų (atranka, skirstymas)
specifiškumas
TN/(TN+FP)
Keletas klaidingų teigiamų rezultatų
Sumažina nereikalingų tyrimų skaičių
Klaidingai neigiamas rodiklis
FN/(TP+FN)
blogai
Tyli žala; radiologas turi sugauti
Klaidingai teigiama apkrova
FP skaičius
apkrova didėja
Pavojaus nuovargis, prisiminimas
"tikslumas"
(TP+TN)/iš viso
klaidinantis
Pasirodo daug retų ligų, apgaudinėja
Modelis turi slenkstį (virš to, ko balas laikomas „teigiamu“), o šis slenkstis keičia jautrumą ir specifiškumą priešingomis kryptimis: jei sumažinsite slenkstį, sugaunate daugiau (jautrumas ↑), bet sukelsite daugiau klaidingų aliarmų (specifiškumas ↓). Tai ne inžinerinė aplinka, o klinikinis sprendimas: didelės dingimo išlaidos ar klaidingo pavojaus našta? Atrankos ir skirstymo metu jautrumui paprastai teikiama pirmenybė.
Įspėjimas: niekada nepasitikėkite vienu skaičiumi, pvz., „95 % tikslumas“. Retais radiniais tikslumas yra klaidinantis. Tikrasis modelio veikimas negali būti žinomas nepaklausus jautrumo, specifiškumo, klaidingai neigiamo rodiklio ir populiacijos, kurioje jis buvo matuojamas.
Du žmonių spąstai
Automatizavimo šališkumas: kai žmonės per daug pasikliauja automatizuotos sistemos rezultatais ir atsipalaiduoja nuo savo nepriklausomo sprendimo. Jei radiologas paviršutiniškai praleidžia vaizdą sakydamas „AI sakė, kad jis neigiamas, taigi jis švarus“, modelio nepastebėta radinys bus visiškai praleistas. Kai klaidingai neigiami rezultatai derinami su automatizavimo šališkumu, žmogaus tikrinimo priežastis pašalinama.
Įspėjamasis nuovargis: dėl to, kad modelis pateikia daug klaidingų teigiamų rezultatų, radiologas praranda pasitikėjimą vėliavėlėmis ir pradeda refleksiškai jas visas pašalinti. Tikras radinys po dešimto klaidingo aliarmo taip pat gali būti pašalintas. Šios dvi spąstai yra priešingomis kryptimis, tačiau jų rezultatai yra tokie patys: trūksta tikro radinio.
Šių dviejų spąstų priešnuodis yra tas pats: nesvarbu, ką sako AI išvestis, radiologas atlieka savo sistemingą skaitymą. Nesvarbu, ar dirbtinis intelektas tai pažymi, ar ne, visas vaizdas nuskaitomas. AI yra „antroji akis“; Pirmoji akis visada yra radiologas.
trys mini dėklai
1 atvejis – klaidingas neigiamas + automatizavimo šališkumas. Krūtinės ląstos rentgenograma CAD nepastebi (klaidingai neigiamas) mažo mazgo viršutinėje kairiojoje zonoje. Įtemptą dieną radiologas skuba per rentgenogramą galvodamas „CAD yra aiškus“ (automatizacijos šališkumas). Mazgelis pastebimas po 8 mėnesių kaip 2 cm dydžio masė. Dvi klaidos kartu: modelis praleistas, žmogus nepatikrino. Pamoka: nepaisant neigiamo CAD, sistemingas skaitymas yra būtinas.
2 atvejis – nuovargis. Pneumotorakso modelis dvi savaites per dieną išmeta vidutiniškai 8 vėliavėles, iš kurių tik 1-2 yra tikros (apie 80 % klaidingų teigiamų rezultatų). Radiologas praranda pasitikėjimą vėliavėlėmis. Trečią savaitę tikrojo viršūninio pneumotorakso vėliavėlė taip pat refleksiškai perduodama „ne“; Pacientas pablogėja po paros. Pamoka: modeliai su dideliu klaidingų teigiamų rezultatų rodikliu turėtų būti stebimi, slenkstis / modelis peržiūrėti ir kiekviena vėliavėlė vis tiek patvirtinama.
3 atvejis – tinkama pusiausvyra. Insulto centre smegenų KT triažo modelis veikia labai jautriai; Klaidingų teigiamų rezultatų yra daug, tačiau radiologas kiekvieną žymą patvirtina per 60 sekundžių ir per kelias minutes nustato tikrą kraujavimą. Komanda kas savaitę stebi klaidingų teigiamų rezultatų rodiklį, kartu su gamintoju peržiūri slenkstį, kai jis viršija 70%. Čia metrika buvo valdoma sąmoningai; Neatsirado nei automatikos šališkumo, nei signalizacijos nuovargio.
Silpnas raginimas / Stiprus raginimas
Silpnas raginimas:
Šis modelis yra 97% tikslus, ar jis patikimas?
Viena metrika yra klaidinanti; negalima atsakyti neuždavus klausimų apie populiaciją, jautrumą, specifiškumą ir klaidingus neigiamus dalykus.
Galingas raginimas:
Jūsų vaidmuo: PADĖKITE man kritiškai perskaityti AI modelio našumo metrikas.Sprendimų priėmimas; Paaiškinkite, kokius klausimus turėčiau užduoti ir ką reiškia atsakymai. Pateiksiu modelio pretenzijas. Apsvarstykite: (1) kurios metrikos pateiktos, o kurių trūksta (jautrumas, specifiškumas, klaidingai neigiamas rodiklis, populiacija, prietaisas), (2) ar vien „tikslumas“ yra klaidinantis, (3) ar tikslinga naudoti šį modelį rūšiavimui / patikrai ar diagnozei. Galutinį sprendimą priima radiologas/įstaiga. Teiginys: "Modelis išbandytas 1200 pacientų 97% tikslumu."
Didelė paklausa kelia abejonių dėl trūkstamų metrikų ir nutrūksta pasikliovimas atskirais skaičiais.
Kopijuojami raginimo šablonai
METRIKO KRITINIO SKAITYMO ŠABLONASjūsų vaidmuo: PAGALBA. Pateiksiu jums modelio našumo pretenziją. Išvardykite trūkstamas metrikas (jautrumas, specifiškumas, klaidingai neigiamas rodiklis, bandymų populiacija, įrenginys / protokolas) ir tai, kur vienas skaičius (tikslumas) gali klaidinti. Aptarkite, kuriai užduočiai atlikti (skyrimas/atranka/diagnostinė pagalba) modelis tinkamas naudoti. Sprendimas yra institucijoje. Pretenzija: [rašyti]
Slenksčio balanso APRAŠYMO ŠABLONYS pateiks modelio slenksčio padidinimo / sumažinimo scenarijų. Apibūdinkite kiekvieno scenarijaus poveikį jautrumui, specifiškumui, klaidingai neigiamam ir klaidingai teigiamam ir užrašykite jo klinikinę baigtį (praleidžiamas ar nereikalingas prisiminimas). Sprendimas yra klinikinis/institucinis. Scenarijus: [rašyti]
AUTOMATIZAVIMO POŽIŪRIAUS SAVIAudITO ŠABLONASPadarykite man kontrolinį sąrašą, kuris apsaugos mano skaitymo discipliną nuo automatizavimo šališkumo: kokių veiksmų turėčiau imtis net esant neigiamam AI išėjimui, kaip palaikyti sistemingą nuskaitymą, kaip dirbtinį intelektą laikyti „asistentu“, o ne „pristatymo įrankiu“.
ĮSPĖJIMO NUOVARGIO STEBĖJIMO ŠABLONAS pateiks savaitės vėliavėlių skaičių ir faktinius teigiamus skaičius. Apskaičiuokite klaidingai teigiamą rodiklį, įvertinkite perspėjimo nuovargio riziką ir pasiūlykite, prie kokios slenksčio turėčiau imtis veiksmų, kad peržiūrėčiau slenkstį / modelį. Priminkite man principą, kad kiekviena vėliava vis tiek turi būti patvirtinta. Duomenys: [rašyti]
Dažnos klaidos
- Remdamiesi vienu „tiesos“ skaičiumi. Retas radinys taip pat yra klaidinantis; Jautrumo ir specifiškumo reikėtų klausti kartu.
- Neigiamos AI išvesties traktavimas kaip diagnostikos garantija. Modelis galėjo tai praleisti; Sistemingas skaitymas yra būtinas.
- Patekimas į automatizavimo šališkumą. Per didelis pasitikėjimas dirbtiniu intelektu kenkia nepriklausomam sprendimui.
- Žadintuvo nuovargio nepaisymas. Reikėtų stebėti didelius klaidingus teigiamus rezultatus; kiekviena vėliavėlė vis tiek turi būti patvirtinta.
- Klaidingas „techninės nuostatos“ slenkstis. Slenkstis yra klinikinė pusiausvyra; Radiologas/įstaiga pasveria praleidimų ir klaidingų pavojaus signalų išlaidas.
Patarimas: nustatykite sau taisyklę: „Nesvarbu, ką sako AI, aš perskaičiau visą vaizdą“. Ši vienintelė taisyklė vienu metu pažaboja ir automatizavimo šališkumą (neatsipalaiduoja nuo neigiamo), ir aliarmo nuovargį (refleksiškai nepašalina teigiamo).
Apibendrinant
Radiologijos modelio vertinimas nereiškia vieno „tikslumo“ skaičiaus žiūrėjimo. Jautrumas (nėra praleistų), specifiškumas (nėra klaidingų pavojaus signalų), klaidingai neigiamas rodiklis ir bandymo populiacija turėtų būti skaitomi kartu; Slenksčio pasirinkimas yra klinikinė pusiausvyra. Dvi žmonių spąstai – per didelis pasitikėjimas dirbtiniu intelektu (automatizavimo šališkumas) ir pripratimas prie klaidingų pavojaus signalų bei vėliavėlės pašalinimas (signalizacijos nuovargis) – eina priešingomis kryptimis, bet baigiasi tuo pačiu rezultatu, nesant tikro radinio. Yra tik vienas priešnuodis: nesvarbu, ką sako AI, radiologas pats sistemingai skaito. Neigiamas AI nėra garantija, o daugiausiai naudingas signalas; Taip pat reikia perskaityti nepažymėtą sritį.
Taikymo užduotis
Paimkite turimo modelio reklaminį tekstą (arba pavyzdį). Naudodami šabloną „Metrikos kritinis skaitymas“ įvertinkite, kurios metrikos pateikiamos, kurių trūksta ir kokiai užduočiai modelį tikslinga naudoti. Tada sukurkite paprastą diagramą, kad galėtumėte stebėti, kiek kartų per savaitę išsipildo suskirstymo žyma; Užsirašykite, kokių veiksmų imsitės, jei klaidingai teigiamų rezultatų rodiklis viršys jūsų nustatytą ribą (pavyzdžiui, 70%). Galiausiai pritaikykite „Automatizacijos šališkumo savikontrolės“ sąrašą prie savo skaitymo rutinos.
kontrolinis sąrašas
- [ ] Aš nepasitikėjau vienu „tikslumo“ skaičiumi; Paklausiau apie jautrumą ir specifiškumą.
- [ ] Sužinojau klaidingai neigiamą rodiklį ir bandomąją populiaciją.
- [ ] Nepaisant neigiamos AI išvesties, sistemingai skaičiau.
- [ ] Nebuvau per daug pasitikintis dirbtiniu intelektu (palyginti su automatizavimo šališkumu).
- [ ] Stebėjau, ar nėra klaidingų teigiamų rezultatų; Aš patvirtinau kiekvieną vėliavėlę (nuo perspėjimo nuovargio).
- [ ] Atsižvelgiau į tai, kad slenksčio pasirinkimas yra klinikinė pusiausvyra.
- [ ] Aš laikiausi taisyklės „Perskaičiau visą vaizdą, nesvarbu, ką sako AI“.