Fitimet:
- Aftësia për të interpretuar konceptet e ndjeshmërisë, specifikës, false negative dhe false pozitive në kontekstin e radiologjisë dhe për të lexuar në mënyrë kritike matjet e një modeli.
- Të jesh në gjendje të njohësh paragjykimet e automatizimit (mbështetja e tepërt në inteligjencën artificiale) dhe, përkundrazi, të alarmosh lodhjen dhe të mbrosh disiplinën e leximit kundër këtyre dy kurtheve
- Të kuptuarit se radiologu duhet të lexojë një zonë që nuk është e shënuar nga inteligjenca artificiale dhe se një dalje negative e AI nuk është një garanci për diagnozën.
Dy numrat më të rëndësishëm për një AI radiologjike janë sa gjetje kap dhe sa alarme false ngre. Nëse një prodhues ju thotë "modeli ynë është 96% i saktë", kjo vetëm nuk thotë pothuajse asgjë. Sepse për një gjetje të rrallë (të themi, 10 sëmundje në 1000 provime), edhe një model që shënon asgjë mund të duket se është "99% i saktë" - ai njeh saktë 990 të shëndetshëm dhe i mungon vetëm 10 pacientë. Në këtë njësi, ne do të mësojmë se si të lexojmë në mënyrë kritike matjet thelbësore të radiologjisë - ndjeshmërinë, specifikën, negativen e rreme, false pozitive - si një ekspert dhe të njohim dy kurthe të rrezikshme njerëzore - paragjykimin e automatizimit dhe lodhjen e alarmit.
Parimi kryesor: Një zonë që nuk shënohet nga inteligjenca artificiale lexohet gjithashtu nga radiologu. Një rezultat negativ i AI nuk është një garanci për diagnozën; modeli mund të ketë humbur gjetjen (negativ i rremë). Arsyeja e ekzistencës së monitorimit njerëzor është të kapni momentet e sakta kur modeli është i gabuar.
Leximi i metrikës si një ekspert
Le të sqarojmë katër koncepte bazë. Le të themi se kemi testuar një model në 1000 provime dhe 100 prej tyre e kishin vërtetë sëmundjen.
- Pozitive e vërtetë (TP): Modeli e shënoi pacientin, vërtet të sëmurë.
- Negativ i rremë (FN): Modeli nuk shënoi, por pacienti është i sëmurë - humb. Më e rrezikshmja në radiologji.
- Pozitiv i rremë (FP): Modeli u shënua, por pacienti është i shëndetshëm - alarm i rremë.
- Negativ i vërtetë (TN): Modeli nuk shënoi, vërtet i shëndetshëm.
Dy metrikë bazë dalin nga këto:
- Ndjeshmëria = TP / (TP + FN): Sa pacientë të vërtetë kapëm? Ndjeshmëri e lartë do të thotë rrëmbim i ulët.
- Specifikimi = TN / (TN + FP): Sa nga të shëndoshët numëruam si të shëndetshëm? Specifikimi i lartë do të thotë më pak alarme false.
metrikë
formulë
Kur është i lartë
Rëndësia radiologjike
Ndjeshmëria
TP/(TP+FN)
Pak negativë të rremë
Kritike për të shmangur mungesën (ekzaminimi, klasifikimi)
specifika
TN/(TN+FP)
Pak rezultate false
Redukton ekzaminimin e panevojshëm
Shkalla e rreme negative
FN/(TP+FN)
keq
Dëmtim i heshtur; radiologu duhet të kap
Ngarkesa false pozitive
numri i FP-ve
ngarkesa rritet
Lodhje alarmi, kujto
"saktësia"
(TP+TN)/gjithsej
mashtruese
Shfaqet i lartë në sëmundje të rralla, mashtron
Një model ka një prag (mbi atë që rezultati konsiderohet "pozitiv") dhe ky prag ndryshon ndjeshmërinë dhe specifikën në drejtime të kundërta: nëse ulni pragun, kapni më shumë (ndjeshmëria ↑), por ngrini më shumë alarme false (specifiteti ↓). Ky nuk është një mjedis inxhinierik, por një vendim klinik: kostoja e rëndë e mungesës, apo barra e një alarmi të rremë? Ndjeshmëria është përgjithësisht prioritare në shqyrtimin dhe triazhin.
Kujdes: Asnjëherë mos i besoni një numri të vetëm si "saktësia 95%. Në gjetjet e rralla, saktësia është mashtruese. Performanca e vërtetë e një modeli nuk mund të dihet pa pyetur ndjeshmërinë, specifikën, shkallën e rreme negative dhe popullsinë në të cilën është matur.
Dy kurthe njerëzore
Paragjykimi i automatizimit: Kur njerëzit mbështeten tepër në rezultatin e një sistemi të automatizuar dhe lehtësojnë gjykimin e tyre të pavarur. Nëse radiologu e kalon sipërfaqësisht imazhin duke thënë "AI tha se ishte negativ, pra është i pastër", gjetja e humbur nga modelja do të anashkalohet plotësisht. Kur negativët e rremë kombinohen me paragjykimet e automatizimit, arsyeja e ekzistencës së inspektimit njerëzor eliminohet.
Lodhja e alarmit: Si rezultat i modelit që prodhon një numër të madh të rezultateve false, radiologu humb besimin te flamujt dhe fillon t'i eliminojë në mënyrë refleksive të gjitha. Një gjetje e vërtetë pas alarmit të dhjetë të rremë mund të eliminohet gjithashtu. Këto dy kurthe janë në drejtime të kundërta, por rezultatet e tyre janë të njëjta: mungon një gjetje e vërtetë.
Kundërhelmi ndaj këtyre dy kurtheve është i njëjtë: pavarësisht se çfarë thotë prodhimi i AI, radiologu bën leximin e tij sistematik. Pavarësisht nëse AI e shënon apo jo, i gjithë imazhi skanohet. AI është një "sy i dytë"; Syri i parë është gjithmonë radiologu.
tre mini kuti
Rasti 1 - Negativ i rremë + paragjykim i automatizimit. Një radiografi e gjoksit CAD humbet (negativ fals) një nyjë të vogël në zonën e sipërme të majtë. Në një ditë të ngarkuar, radiologu nxiton përmes radiografisë duke menduar se "CAD është i qartë" (paragjykimi i automatizimit). Noduli vihet re pas 8 muajsh si masë me përmasa 2 cm. Dy gabime të kombinuara: modeli humbi, njeriu nuk kontrolloi. Mësimi: pavarësisht CAD negative, leximi sistematik është thelbësor.
Rasti 2 - Lodhje alarmi. Një model pneumotoraks hedh mesatarisht 8 flamuj në ditë për dy javë, vetëm 1-2 prej të cilëve janë realë (rreth 80% false pozitive). Radiologu humb besimin te flamujt. Në javën e tretë, një flamur i vërtetë pneumotoraks apikal gjithashtu kalohet në mënyrë refleksive si "jo"; Pacienti përkeqësohet pas një dite. Mësimi: modelet me një shkallë të lartë false pozitive duhet të monitorohen, pragu/modeli të rishikohet dhe çdo flamur të konfirmohet gjithsesi.
Rasti 3 - Bilanci i duhur. Në një qendër goditjeje, modeli i triazhit të CT të trurit funksionon me ndjeshmëri të lartë; Rezultatet false janë të larta, por radiologu konfirmon çdo flamur në 60 sekonda dhe zbulon gjakderdhje reale brenda disa minutave. Ekipi monitoron normën false pozitive çdo javë, duke rishikuar pragun me prodhuesin kur kalon 70%. Këtu, metrikat u menaxhuan me vetëdije; As paragjykimi i automatizimit dhe as lodhja e alarmit nuk janë vendosur.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
Ky model është 97% i saktë, a është i besueshëm?
Metrika e vetme është mashtruese; nuk mund të përgjigjet pa bërë pyetje në lidhje me popullsinë, ndjeshmërinë, specifikën dhe negativët e rremë.
Njoftim i fuqishëm:
Roli juaj: Më ndihmoni të lexoj në mënyrë kritike matjet e performancës së një modeli të AI. Vendimmarrja; Shpjegoni se cilat pyetje duhet të bëj dhe çfarë kuptimi kanë përgjigjet. Unë do t'ju jap pretendimet e një modeleje. Merrni parasysh: (1) cilat metrika janë dhënë dhe cilat mungojnë (ndjeshmëria, specifika, shkalla e rreme negative, popullsia, pajisja), (2) nëse vetëm "saktësia" është mashtruese, (3) nëse është e përshtatshme të përdoret ky model për triazhim/skrining ose diagnostikim. Vendimi përfundimtar i takon radiologut/institucionit. Pretendimi: "Modeli i testuar në 1200 pacientë me 97% saktësi."
Kërkesa e fortë vë në pikëpyetje matjet që mungojnë dhe thyen varësinë nga numrat e vetëm.
Modele të shpejtë të kopjueshëm
MOBILI I LEXIMIT KRITIK METRIK Roli juaj: NDIHMË. Unë do t'ju jap një pretendim për performancën e një modeli. Listoni metrikat që mungojnë (ndjeshmëria, specifika, shkalla e rreme negative, popullsia e testit, pajisja/protokolli) dhe ku një numër i vetëm (saktësia) mund të jetë mashtrues. Diskutoni për cilën detyrë (triazh/skrining/asistencë diagnostikuese) modeli është i përshtatshëm për t'u përdorur. Vendimi është në institucion. Pretendimi: [shkruaj]
TEMPLATEI I PËRSHKRIMIT I BILANCIT TË PARGUT do t'ju japë një skenar të rritjes/uljes së pragut të një modeli. Përshkruani ndikimin e secilit skenar në ndjeshmërinë, specifikën, negativen e rreme dhe false pozitive dhe shkruani rezultatin e tij klinik (mungesa kundër kujtimit të panevojshëm). Vendimi është klinik/institucional. Skenari: [shkruaj]
SHBALLIN E VETËAUDITIMIT TË ANËQYRJES SË AUTOMATIVE Më krijoni një listë kontrolli që do të mbrojë disiplinën time të leximit kundër paragjykimeve të automatizimit: çfarë hapash duhet të ndërmarr edhe me dalje negative të AI, si të mbaj skanimin sistematik, si ta mbaj AI si "asistent" dhe jo si "mjet shpërndarjeje".
TEMPLATEI I MONITORIMIT TË LODHJES SË ALERT do t'ju japë numërimet javore të flamujve dhe numrat aktualë pozitivë. Llogaritni shkallën false pozitive, vlerësoni rrezikun e lodhjes së alarmit dhe sugjeroni se në cilin prag duhet të ndërmarr veprime për të rishikuar pragun/modelin. Më kujto parimin se çdo flamur duhet ende të konfirmohet. Të dhënat: [shkruaj]
Gabimet e zakonshme
- Duke u mbështetur në numrin e vetëm të "të vërtetës". Gjetja e rrallë është gjithashtu mashtruese; Ndjeshmëria dhe specifika duhet të pyeten së bashku.
- Trajtimi i prodhimit negativ të AI si një garanci diagnostikuese. Modelit mund ta ketë humbur atë; Leximi sistematik është i domosdoshëm.
- Duke rënë në paragjykimet e automatizimit. Mbështetja e tepërt në AI minon gjykimin e pavarur.
- Injorimi i lodhjes së alarmit. Duhet të monitorohen rezultatet e larta false; çdo flamur duhet ende të konfirmohet.
- Gabimi i pragut për një "vendosje teknike". Pragu është një ekuilibër klinik; Radiologu/institucioni peshon koston e humbjeve dhe alarmeve false.
Këshillë: Bëni një rregull për veten tuaj: "Pavarësisht se çfarë thotë AI, unë lexova të gjithë imazhin". Ky rregull i vetëm frenon njëkohësisht paragjykimet e automatizimit (duke mos relaksuar në negativ) dhe lodhjen e alarmit (duke mos eliminuar në mënyrë refleksive pozitiven).
Në përmbledhje
Vlerësimi i një modeli radiologjik nuk ka të bëjë me shikimin e një numri të vetëm të "saktësisë". Ndjeshmëria (pa mungesë), specifika (pa alarme të rreme), shkalla e rreme negative dhe popullata e testimit duhet të lexohen së bashku; Zgjedhja e pragut është një ekuilibër klinik. Dy kurthe njerëzore - besimi i tepërt në AI (paragjykim i automatizimit) dhe mësimi me alarmet e rreme dhe eliminimi i flamurit (lodhja e alarmit) - shkojnë në drejtime të kundërta, por përfundojnë me të njëjtin rezultat, duke humbur një gjetje të vërtetë. Ekziston vetëm një antidot: Pavarësisht se çfarë thotë AI, radiologu bën leximin e tij sistematik. Inteligjenca artificiale negative nuk është garanci, por më së shumti një sinjal ndihmues; Duhet të lexohet edhe zona e pashënuar.
Detyra e aplikimit
Merrni tekstin promovues të një modeli që keni (ose një mostër). Me shabllonin "Leximi kritik i metrikës", vlerësoni cilat metrika ofrohen, cilat mungojnë dhe për çfarë detyre është e përshtatshme të përdoret modeli. Më pas hartoni një tabelë të thjeshtë për të gjurmuar se sa herë bëhet e vërtetë një flamur i triazhit gjatë një jave; Shkruani çfarë veprimi do të ndërmerrni nëse norma false pozitive tejkalon pragun që keni vendosur (për shembull, 70%). Së fundi, përshtatni listën "Automation Bias Self-Audit" në rutinën tuaj të leximit.
listë kontrolli
- [ ] Nuk u mbështeta në numrin e vetëm të "saktësisë"; Pyeta për ndjeshmërinë dhe specifikën.
- [ ] Mësova normën e rreme negative dhe popullsinë e testimit.
- [ ] Pavarësisht rezultatit negativ të AI, bëra leximin tim sistematik.
- [ ] Nuk isha tepër i sigurt në AI (kundër paragjykimeve të automatizimit).
- [ ] Kam shikuar për pozitive false; Konfirmova çdo flamur (kundër lodhjes së alarmit).
- [ ] Kam marrë parasysh që zgjedhja e pragut është një ekuilibër klinik.
- [ ] Unë ndoqa rregullin e "E lexova të gjithë imazhin, pavarësisht se çfarë thotë AI".