Kasu:
- Oskus radioloogia kontekstis tõlgendada tundlikkuse, spetsiifilisuse, valenegatiivse ja valepositiivse mõisteid ning kriitiliselt lugeda mudeli mõõdikuid.
- Võimalus ära tunda automatiseerimise eelarvamusi (ülemäärane sõltuvus tehisintellektile) ja vastupidi, äratada väsimust ning kaitsta lugemisdistsipliini nende kahe lõksu eest
- Arusaamine, et radioloog peab lugema piirkonda, mis ei ole tehisintellektiga märgistatud, ja negatiivne AI väljund ei ole diagnoosi tagatis.
Radioloogia tehisintellekti kaks kõige olulisemat numbrit on see, kui palju leide see tabab ja kui palju valehäireid see tekitab. Kui tootja ütleb teile, et meie mudeli täpsus on 96%, ei ütle see üksi peaaegu midagi. Sest harvaesineva leiu korral (näiteks 10 haigust 1000 eksamiga) võib isegi mitte midagi märgistav mudel tunduda "99% täpne" – see tunneb õigesti ära 990 tervet ja jätab vahele vaid 10 patsienti. Selles õppetükis õpime kriitiliselt lugema radioloogia olulisi mõõdikuid – tundlikkust, spetsiifilisust, valenegatiivset, valepositiivset – nagu ekspert, ning ära tundma kahte ohtlikku inimlõksu – automatiseerimise kallutatust ja häireväsimust.
Põhiprintsiip: Tehisintellektiga tähistamata ala loeb ka radioloog. Negatiivne AI tulemus ei garanteeri diagnoosi; mudelil võis leid märkimata jääda (valenegatiivne). Inimeste jälgimise põhjus on jäädvustada täpsed hetked, mil mudel on ohutult vale.
Lugege mõõdikuid nagu ekspert
Teeme selgeks neli põhimõistet. Oletame, et testisime mudelit 1000 eksamiga ja 100 neist põdes seda haigust.
- Tõeliselt positiivne (TP): mudel märkis, et patsient on tõeliselt haige.
- Valenegatiivne (FN): mudel ei märgistanud, kuid patsient on haige – preamata. Kõige ohtlikum radioloogias.
- Valepositiivne (FP): mudel on märgistatud, kuid patsient on terve – valehäire.
- Tõeline negatiivne (TN): Modell ei teinud märke, tõesti terve.
Nendest tulenevad kaks põhimõõdikut:
- Tundlikkus = TP / (TP + FN): mitu tegelikku patsienti tabasime? Kõrge tundlikkus tähendab madalat röövimist.
- Spetsiifilisus = TN / (TN + FP): kui palju terveid me terveteks lugesime? Kõrge spetsiifilisus tähendab vähem valehäireid.
meetriline
valem
Kui see on kõrge
Radioloogiline tähtsus
Tundlikkus
TP/(TP+FN)
Vähe valenegatiivseid
Kriitiline, et vältida kadumist (sõeluuringud, triaaž)
spetsiifilisus
TN/(TN+FP)
Vähesed valepositiivsed tulemused
Vähendab tarbetut läbivaatust
Valenegatiivne määr
FN/(TP+FN)
halb
Vaikne kahju; radioloog peab kinni püüdma
Valepositiivne koormus
FP-de arv
koormus suureneb
Alarm väsimus, meeldetuletus
"täpsus"
(TP+TN)/kokku
eksitav
Tundub kõrge haruldaste haiguste korral, petab
Mudelil on lävi (üle selle, mida skoor loetakse positiivseks) ja see lävi muudab tundlikkust ja spetsiifilisust vastupidises suunas: kui alandate läve, saate rohkem kinni (tundlikkus ↑), kuid tõstate rohkem valehäireid (spetsiifilisus ↓). See ei ole insenertehniline seade, vaid kliiniline otsus: kadumise suur hind või valehäire koorem? Tundlikkus on üldiselt sõeluuringul ja triaažil esikohal.
Ettevaatust. Ärge kunagi usaldage ühtegi numbrit, näiteks "95% täpsus". Harvade leidude puhul on täpsus eksitav. Mudeli tegelikku jõudlust ei saa teada, küsimata tundlikkust, spetsiifilisust, valenegatiivset määra ja populatsiooni, milles seda mõõdeti.
Kaks inimlõksu
Automatiseerimise eelarvamus: kui inimesed loodavad liigselt automatiseeritud süsteemi väljundile ja lõdvestavad oma sõltumatut otsust. Kui radioloog jätab pildi pealiskaudselt vahele, öeldes: "AI ütles, et see oli negatiivne, seega on see puhas", jäetakse modelli poolt vastamata leid täielikult vahele. Kui valenegatiivsed tulemused kombineeritakse automatiseerimise kallutatusega, kaob inimeste kontrollimise põhjus.
Hoiatusväsimus: kuna mudel annab suure hulga valepositiivseid tulemusi, kaotab radioloog lippude vastu usalduse ja hakkab neid kõiki refleksiivselt kõrvaldama. Samuti võib kõrvaldada tõene leid pärast kümnendat valehäiret. Need kaks lõksu on vastupidises suunas, kuid nende tulemused on samad: puudub tõeline leid.
Nende kahe lõksu vastumürk on sama: olenemata sellest, mida AI väljund ütleb, teeb radioloog ise süstemaatilise lugemise. Olenemata sellest, kas AI märgib seda või mitte, skannitakse kogu pilt. AI on "teine silm"; Esimene silm on alati radioloog.
kolm minikarpi
Juhtum 1 – valenegatiivne + automatiseerimise kallutatus. Rindkere röntgenülesvõttel CAD puudub (valenegatiivne) väike sõlm ülemises vasakpoolses tsoonis. Kiirel päeval tormab radioloog läbi röntgenipildi, mõeldes “CAD on selge” (automaatika eelarvamus). Sõlm on märgatav 8 kuu pärast 2 cm suuruse massina. Kaks viga kokku: mudel jäi vahele, inimene ei kontrollinud. Õppetund: vaatamata negatiivsele CAD-ile on süstemaatiline lugemine hädavajalik.
Juhtum 2 – alarmi väsimus. Pneumotoraksi mudel viskab kahe nädala jooksul keskmiselt 8 lippu päevas, millest ainult 1-2 on tõelised (umbes 80% valepositiivseid). Radioloog kaotab lippude vastu usalduse. Kolmandal nädalal antakse refleksiivselt vastu ka tõeline apikaalne pneumotooraksi lipp kui "ei"; Patsient halveneb päeva pärast. Õppetund: kõrge valepositiivse määraga mudeleid tuleks jälgida, lävi/mudel üle vaadata ja iga lipp kinnitada niikuinii.
3. juhtum – õige tasakaal. Insuldikeskuses töötab aju CT-triaažimudel suure tundlikkusega; Valepositiivsed tulemused on kõrged, kuid radioloog kinnitab iga lipu 60 sekundi jooksul ja tuvastab tõelise verejooksu mõne minuti jooksul. Meeskond jälgib iganädalaselt valepositiivsete tulemuste määra ja vaatab koos tootjaga läbi künnise, kui see ületab 70%. Siin juhiti mõõdikuid teadlikult; Automaatika kallutatust ega häireväsimust pole sisse tulnud.
Nõrk viip / Tugev viip
Nõrk viip:
Selle mudeli täpsus on 97%, kas see on usaldusväärne?
Üksik mõõdik on eksitav; ei saa vastata, esitamata küsimusi populatsiooni, tundlikkuse, spetsiifilisuse ja valenegatiivsuse kohta.
Võimas viip:
Sinu roll: AITA mul kriitiliselt lugeda tehisintellekti mudeli jõudlusnäitajaid.Otsuste tegemine; Selgitage, milliseid küsimusi peaksin küsima ja mida need vastused tähendavad. Ma annan teile mudeli väited. Mõelge: (1) millised mõõdikud on antud ja millised puuduvad (tundlikkus, spetsiifilisus, valenegatiivne määr, populatsioon, seade), (2) kas "täpsus" üksi on eksitav, (3) kas seda mudelit on asjakohane kasutada triaažiks/sõeluuringuks või diagnoosimiseks. Lõpliku otsuse teeb radioloog/asutus. Väide: "1200 patsiendil testitud mudelit 97% täpsusega."
Tugev nõudlus seab kahtluse alla puuduvad mõõdikud ja katkestab sõltuvuse üksikutest numbritest.
Kopeeritavad viipade mallid
MEETRILINE KRIITILINE LUGEMISMALLTEE roll: ABI. Esitan teile modelli jõudluse väite. Loetlege puuduvad mõõdikud (tundlikkus, spetsiifilisus, valenegatiivsete näitajate määr, testimispopulatsioon, seade/protokoll) ja kus üks arv (täpsus) võib olla eksitav. Arutage, millise ülesande (triaaž/sõeluuringud/diagnostikaabi) jaoks on mudelit sobiv kasutada. Otsus on asutuses. Nõue: [kirjutada]
LÄVESALDO KIRJELDUSMAAL annab teile stsenaariumi mudeli läve tõstmiseks/langetamiseks. Kirjeldage iga stsenaariumi mõju tundlikkusele, spetsiifilisusele, valenegatiivsele ja valepositiivsele ning kirjutage üles selle kliiniline tulemus (mis vs. tarbetu meenutamine). Otsus on kliiniline/institutsionaalne. Stsenaarium: [kirjutada]
AUTOMATISEERIMISE ALUSTAMISE ENESEKONDI MALLTooge mulle kontroll-loend, mis kaitseb minu lugemisdistsipliini automatiseerimise kallutatuse eest: milliseid samme peaksin astuma isegi negatiivse tehisintellekti väljundi korral, kuidas säilitada süstemaatilist skannimist, kuidas hoida tehisintellekti pigem "assistendi" kui "edastustööriistana".
ALERT FATIGUE MONITORING TEMPLATEI annab teile iganädalased lipuarvud ja tegelikud positiivsed numbrid. Arvutage valepositiivne määr, hinnake häireväsimuse riski ja tehke ettepanek, millise läve juures peaksin läve/mudeli ülevaatamiseks meetmeid võtma. Tuletage meelde põhimõtet, et iga lipp tuleks ikkagi kinnitada. Andmed: [kirjutada]
Levinud vead
- Tuginedes ühele "tõe" numbrile. Haruldane leid on ka eksitav; Tundlikkust ja spetsiifilisust tuleks küsida koos.
- Negatiivse AI väljundi käsitlemine diagnostilise garantiina. Modell võis sellest mööda vaadata; Süstemaatiline lugemine on kohustuslik.
- Langemine automatiseerimise eelarvamustesse. Liigne AI-le tuginemine õõnestab sõltumatut otsustusvõimet.
- Häireväsimuse ignoreerimine. Kõrgeid valepositiivseid tulemusi tuleks jälgida; iga lipp tuleb ikkagi kinnitada.
- "Tehnilise seadistuse" läve eksitamine. Lävi on kliiniline tasakaal; Radioloog/asutus kaalub vahelejäämiste ja valehäirete kulusid.
Näpunäide: tehke enda jaoks reegel: "Ükskõik, mida AI ütleb, loen ma kogu pildi." See üksainus reegel vähendab samaaegselt nii automatiseerimise kallutatust (ei lõdvesta negatiivset) kui ka häireväsimust (ei elimineeri refleksiivselt positiivset).
Kokkuvõttes
Radioloogiamudeli hindamine ei tähenda ühe "täpsuse" arvu vaatamist. Tundlikkust (ei mingeid möödalaskmisi), spetsiifilisust (valehäireid pole), valenegatiivset määra ja katsepopulatsiooni tuleks lugeda koos; Läve valik on kliiniline tasakaal. Kaks inimlõksu – liigne enesekindlus AI vastu (automaatika eelarvamus) ning valehäiretega harjumine ja lipu kaotamine (häireväsimus) – lähevad vastandlikesse suundadesse, kuid lõppevad sama tulemusega, jättes puudu tõelisest leidmisest. On ainult üks vastumürk: olenemata sellest, mida AI ütleb, teeb radioloog ise süstemaatilise lugemise. Negatiivne AI ei ole garantii, vaid kõige rohkem abistav signaal; Samuti tuleb läbi lugeda märgistamata ala.
Rakenduse ülesanne
Võtke mõne mudeli reklaamtekst (või näidis). Hinnake malliga „Mõõdikute kriitiline lugemine“, millised mõõdikud on esitatud, millised puuduvad ja millise ülesande jaoks on mudelit otstarbekas kasutada. Seejärel koostage lihtne diagramm, et jälgida, mitu korda triaažilipp nädala jooksul täide läheb; Kirjutage üles, mida teete, kui valepositiivsete tulemuste määr ületab teie seatud läve (näiteks 70%). Lõpuks kohandage loendit "Automatiseerimise eelarvamuste enesekontroll" oma lugemisrutiini järgi.
kontrollnimekiri
- [ ] Ma ei lootnud ühele "täpsuse" numbrile; Küsisin tundlikkuse ja spetsiifilisuse kohta.
- [ ] Sain teada valenegatiivse määra ja testpopulatsiooni.
- [ ] Vaatamata negatiivsele tehisintellekti väljundile tegin süstemaatilise lugemise.
- [ ] Ma ei olnud tehisintellektis (versus automatiseerimise eelarvamus) liiga enesekindel.
- [ ] Vaatasin valepositiivseid tulemusi; Kinnitasin iga lipu (ärksuse väsimuse vastu).
- [ ] Võtsin arvesse, et läve valik on kliiniline tasakaal.
- [ ] Järgisin reeglit "Ma loen kogu pildi, olenemata sellest, mida AI ütleb."