Yksikkö 6 / 11

Väärien negatiivisten ja väärien positiivisten tulosten riski: CAD, herkkyys ja automaatioharha

Voitot:

  • Kyky tulkita herkkyyden, spesifisyyden, väärän negatiivisen ja väärän positiivisen käsitteitä radiologian kontekstissa ja lukea kriittisesti mallin mittareita.
  • Kyky tunnistaa automaatioharha (liiallinen riippuvuus tekoälyyn) ja päinvastoin hälyttää väsymyksestä ja suojata lukukuria näiltä kahdelta ansalta
  • Ymmärtäminen, että radiologin on luettava alue, jota ei leimaa tekoäly, ja että negatiivinen tekoälytulos ei ole tae diagnoosista.

Radiologian tekoälyn kaksi tärkeintä lukua ovat se, kuinka monta löytöä se saa ja kuinka monta väärää hälytystä se herättää. Jos valmistaja sanoo, että mallimme on 96 % tarkka, se ei yksinään kerro juuri mitään. Koska harvinaisen löydön (esimerkiksi 10 sairautta 1 000 tutkimuksessa) kohdalla jopa malli, joka ei merkitse mitään, saattaa näyttää olevan "99% tarkka" – se tunnistaa oikein 990 tervettä ja jättää väliin vain 10 potilasta. Tässä osiossa opimme lukemaan kriittisesti radiologian tärkeitä mittareita – herkkyys, spesifisyys, väärä negatiivinen, väärä positiivinen – asiantuntijan tavoin ja tunnistamaan kaksi vaarallista ihmisansaa – automaation harhaa ja hälytysväsymystä.

Perusperiaate: Radiologi lukee myös alueen, jota ei ole leimattu tekoälyllä. Negatiivinen tekoälytulos ei ole tae diagnoosista; malli on saattanut jättää löydön huomioimatta (väärä negatiivinen). Ihmisen seurannan tarkoitus on vangita tarkat hetket, jolloin malli on turvallisesti väärässä.

Lukee mittareita kuin asiantuntija

Selvitetään neljä peruskäsitettä. Oletetaan, että testasimme mallia 1000 kokeessa ja 100 heistä todella sairastui sairauteen.

  • Tosi positiivinen (TP): Malli merkitsi potilaan todella sairaaksi.
  • Väärä negatiivinen (FN): Malli ei merkinnyt, mutta potilas on sairas – näkemättä. Vaarallisin radiologiassa.
  • Väärä positiivinen (FP): Malli merkitty, mutta potilas on terve – väärä hälytys.
  • Tosi negatiivinen (TN): Malli ei merkinnyt, todella terve.

Näistä syntyy kaksi perusmittaria:

  • Herkkyys = TP / (TP + FN): Kuinka monta todellista potilasta saimme kiinni? Suuri herkkyys tarkoittaa alhaista sieppausta.
  • Spesifisyys = TN / (TN + FP): Kuinka monta tervettä laskettiin terveeksi? Korkea spesifisyys tarkoittaa vähemmän vääriä hälytyksiä.

metristä

kaava

Kun se on korkealla

Radiologinen merkitys

Herkkyys

TP/(TP+FN)

Vähän vääriä negatiivisia

Kriittinen puuttumisen välttämiseksi (seulonta, triage)

spesifisyyttä

TN/(TN+FP)

Vähän vääriä positiivisia

Vähentää tarpeettomia tutkimuksia

Väärin negatiivinen korko

FN/(TP+FN)

huono

Hiljainen vahinko; radiologin täytyy saada kiinni

Väärä positiivinen kuorma

FP:iden määrä

kuormitus kasvaa

Hälytys väsymys, muistaa

"tarkkuus"

(TP+TN)/yhteensä

harhaanjohtavaa

Vaikuttaa korkealta harvinaisissa sairauksissa, pettää

Mallilla on kynnys (yli mitä pistemäärä pidetään "positiivisena"), ja tämä kynnys muuttaa herkkyyttä ja spesifisyyttä vastakkaisiin suuntiin: jos lasket kynnystä, saat enemmän (herkkyys ↑) mutta lisää vääriä hälytyksiä (spesifisyys ↓). Tämä ei ole tekninen ympäristö, vaan kliininen päätös: katoamisen suuret kustannukset vai väärän hälytyksen taakka? Herkkyys asetetaan yleensä etusijalle seulonnassa ja lajittelussa.

Varoitus: Älä koskaan luota yhteen numeroon, kuten "95% tarkkuus". Harvinaisissa löydöissä tarkkuus on harhaanjohtava. Mallin todellista suorituskykyä ei voida tietää kysymättä herkkyyttä, spesifisyyttä, vääriä negatiivista määrää ja populaatiota, jossa se mitattiin.

Kaksi ihmisen ansoja

Automaatioharha: Kun ihmiset luottavat liikaa automatisoidun järjestelmän tuotteeseen ja rentoutuvat itsenäisesti. Jos radiologi ohittaa kuvan pinnallisesti sanomalla "AI sanoi sen olevan negatiivinen, joten se on puhdas", mallin huomaamatta jäänyt löydös ohitetaan kokonaan. Kun väärät negatiivit yhdistetään automaation harhaan, ihmisen tarkastuksen syy eliminoituu.

Varoitusväsymys: Koska malli tuottaa suuren määrän vääriä positiivisia tuloksia, radiologi menettää luottamuksensa lippuihin ja alkaa refleksiivisesti eliminoida niitä kaikkia. Todellinen löytö kymmenennen väärän hälytyksen jälkeen voidaan myös eliminoida. Nämä kaksi ansoja ovat vastakkaisiin suuntiin, mutta niiden tulokset ovat samat: todellinen löytö puuttuu.

Vastalääke näille kahdelle ansalle on sama: riippumatta siitä, mitä tekoälytulos sanoo, radiologi tekee oman systemaattisen lukemansa. Merkitseepä tekoäly sen tai ei, koko kuva skannataan. AI on "toinen silmä"; Ensimmäinen silmä on aina radiologi.

kolme minilaukkua

Tapaus 1 – Väärä negatiivinen + automaatioharha. Rintakehän röntgenkuvasta CAD puuttuu (väärä negatiivinen) pieni kyhmy vasemmalla ylävyöhykkeellä. Kiireisenä päivänä radiologi ryntää läpi röntgenkuvan ajattelemalla "CAD on selvä" (automaatioharha). Kyhmy havaitaan 8 kuukauden kuluttua 2 cm:n massana. Kaksi virhettä yhdistettynä: malli puuttui, ihminen ei tarkistanut. Oppitunti: negatiivisesta CAD:stä huolimatta järjestelmällinen lukeminen on välttämätöntä.

Tapaus 2 – Hälytys väsymys. Ilmarintamalli heittää keskimäärin 8 lippua päivässä kahden viikon ajan, joista vain 1-2 on todellista (noin 80 % vääriä positiivisia). Radiologi menettää luottamuksensa lippuihin. Kolmannella viikolla todellinen apikaalinen ilmarintalippu annetaan myös refleksiivisesti "ei"; Potilas pahenee vuorokauden kuluttua. Oppitunti: malleja, joissa on korkea väärien positiivisten prosenttiosuus, tulee tarkkailla, kynnys/malli tarkistaa ja jokainen lippu joka tapauksessa vahvistaa.

Tapaus 3 – Oikea tasapaino. Aivohalvauskeskuksessa aivojen CT-triage-malli toimii suurella herkkyydellä; Vääriä positiivisia arvoja on paljon, mutta radiologi vahvistaa jokaisen lipun 60 sekunnissa ja havaitsee todellisen verenvuodon minuuteissa. Tiimi tarkkailee vääriä positiivisia tuloksia viikoittain ja tarkistaa kynnyksen valmistajan kanssa, kun se ylittää 70 %. Tässä mittareita hallittiin tietoisesti; Ei ole tullut automaation harhaa tai hälytyksen väsymistä.

Heikko kehote / Vahva kehote

Heikko kehote:

Tämä malli on 97 % tarkka, onko se luotettava?

Yksittäinen mittari on harhaanjohtava; ei voida vastata kysymättä kysymyksiä väestöstä, herkkyydestä, spesifisyydestä ja vääristä negatiivisista.

Tehokas kehotus:

Sinun roolisi: Auta minua lukemaan kriittisesti tekoälymallin suorituskykymittareita. Päätöksenteko; Selitä, mitä kysymyksiä minun pitäisi kysyä ja mitä vastaukset tarkoittavat. Annan sinulle mallin väitteet. Harkitse: (1) mitkä mittarit annetaan ja mitkä puuttuvat (herkkyys, spesifisyys, väärä negatiivinen osuus, populaatio, laite), (2) onko "tarkkuus" yksinään harhaanjohtava, (3) onko asianmukaista käyttää tätä mallia lajitteluun/seulomiseen tai diagnoosiin. Lopullisen päätöksen tekee radiologi/laitos. Väite: "Malli testattiin 1200 potilaalla 97 %:n tarkkuudella."

Vahva kysyntä kyseenalaistaa puuttuvat mittarit ja katkaisee riippuvuuden yksittäisiin numeroihin.

Kopioitavat kehotemallit

METRIC CRRIICAL READING MALLINERoolisi: APUA. Annan sinulle mallin suorituskykyä koskevan väitteen. Luettele puuttuvat tiedot (herkkyys, spesifisyys, väärien negatiivinen osuus, testipopulaatio, laite/protokolla) ja se, missä yksittäinen luku (tarkkuus) voi olla harhaanjohtava. Keskustele, mihin tehtävään (triage/seulonta/diagnostiikka-apu) mallia on tarkoituksenmukaista käyttää. Päätös on toimielimessä. Väite: [kirjoita]

KYNNYSSALDO KUVAUS MALLI antaa sinulle skenaarion mallin kynnyksen nostamisesta/laskemisesta. Kuvaile kunkin skenaarion vaikutusta herkkyyteen, spesifisyyteen, vääriin negatiivisiin ja vääriin positiivisiin ja kirjoita ylös sen kliininen tulos (huolimaton vs. tarpeeton muistaminen). Päätös on kliininen/laitoskohtainen. Käsikirjoitus: [kirjoita]

AUTOMAATIOVAIHTOON ITSETARKASTUSMALLITuottakaa minulle tarkistuslista, joka suojaa lukukuriani automaatioharhaa vastaan: mihin toimiin minun tulisi ryhtyä, vaikka tekoälytulos olisi negatiivinen, kuinka ylläpitää systemaattista skannausta, kuinka pitää tekoäly "avustajana" eikä "toimitustyökaluna".

ALERT FATIGUE MONITORING TEMPLATEI antaa sinulle viikoittaiset lippumäärät ja todelliset positiiviset luvut. Laske väärän positiivisuuden määrä, arvioi hälytysväsymysriski ja ehdota, millä kynnysarvolla minun pitäisi ryhtyä toimiin kynnyksen/mallin tarkistamiseksi. Muistuta minua periaatteesta, että jokainen lippu on silti vahvistettava. Tiedot: [kirjoita]

Yleisiä virheitä

  • Luotetaan yhteen "totuuden" numeroon. Harvinainen havainto on myös harhaanjohtava; Herkkyyttä ja spesifisyyttä tulee kysyä yhdessä.
  • Negatiivisen AI-lähdön käsitteleminen diagnostisena takuuna. Malli on saattanut unohtaa sen; Järjestelmällinen lukeminen on välttämätöntä.
  • Putoaminen automaatioharhaan. Liiallinen tekoäly heikentää riippumatonta harkintaa.
  • Hälyttimen väsymisen huomioiminen. Suuria vääriä positiivisia tuloksia tulee seurata; jokainen lippu on silti vahvistettava.
  • "Teknisen asetuksen" kynnyksen erehtyminen. Kynnys on kliininen tasapaino; Radiologi/laitos punnitaan poissaoloista ja vääristä hälytyksistä aiheutuvat kustannukset.
Vinkki: Tee itsellesi sääntö: "Riippumatta siitä, mitä tekoäly sanoo, luen koko kuvan." Tämä yksittäinen sääntö hillitsee samanaikaisesti sekä automaation harhaa (ei rentoudu negatiivisessa) että hälytyksen väsymystä (ei poista refleksiivisesti positiivista).

Yhteenvetona

Radiologian mallin arvioinnissa ei ole kyse yksittäisen "tarkkuuden" tarkastelusta. Herkkyys (ei ohituksia), spesifisyys (ei vääriä hälytyksiä), väärien negatiivisten tekijöiden määrä ja testipopulaatio tulee lukea yhdessä; Kynnyksen valinta on kliininen tasapaino. Kaksi ihmisen ansaa – liiallinen luottamus tekoälyyn (automaatioharha) ja vääriin hälytyksiin tottuminen ja lipun poistaminen (hälytysväsymys) – kulkevat vastakkaisiin suuntiin, mutta päättyvät samaan tulokseen, todellisen löydön puuttuessa. On vain yksi vastalääke: riippumatta siitä, mitä tekoäly sanoo, radiologi tekee oman systemaattisen lukemansa. Negatiivinen tekoäly ei ole takuu, mutta korkeintaan hyödyllinen signaali; Myös merkitsemätön alue on luettava.

Sovellustehtävä

Ota mallin mainosteksti (tai näyte). Arvioi "Metrics Critical Reading" -mallin avulla, mitä mittareita tarjotaan, mitkä puuttuvat ja mihin tehtävään mallia on tarkoituksenmukaista käyttää. Suunnittele sitten yksinkertainen kaavio, jonka avulla voit seurata, kuinka monta kertaa triage-lippu toteutuu viikon aikana. Kirjoita muistiin, mihin toimiin aiot ryhtyä, jos väärä positiivisuus ylittää asettamasi kynnyksen (esimerkiksi 70 %). Muokkaa lopuksi "Automation Bias Self-Audit" -luettelo omaksi lukurutiinisi.

tarkistuslista

  • [ ] En luottanut yhteen "tarkkuus" numeroon; Kysyin herkkyydestä ja spesifisyydestä.
  • [ ] Opin väärän negatiivisen määrän ja testipopulaation.
  • [ ] Negatiivisesta tekoälytuloksesta huolimatta tein systemaattisen lukemani.
  • [ ] En ollut liian luottavainen tekoälyyn (versus automaation bias).
  • [ ] Katsoin vääriä positiivisia tuloksia; Vahvistin jokaisen lipun (valppautta vastaan).
  • [ ] Otin huomioon, että kynnyksen valinta on kliininen tasapaino.
  • [ ] Noudatin sääntöä "Luen koko kuvan riippumatta siitä, mitä tekoäly sanoo."