Kasu:
- Oskus selgitada elektroonilise tervisekaardi (EHR) andmete puhastamise, kodeerimise ja tehisintellektiga analüüsimise etappe.
- Võimalus ära tunda kliiniliste andmete riske, nagu puuduvad andmed, eelarvamused, klasside tasakaalustamatus ja ajaline leke
- Võimalus kinnitada prognoositavaid mudeli väljundeid kalibreerimise, alarühma jõudluse ja kliinilise kasulikkuse kaudu
Kaasaegsete haiglate mälu on elektrooniline terviselugu (EHR): diagnooside, laboritulemuste, ravimite, protseduuride, õe märkmete ja arstide tähelepanekute digitaalne kogu. Need andmed on tehisintellekti jaoks nii aare kui ka miiniväli. Aare, sest see sisaldab miljoneid haigeid aastamustreid; miiniväli, sest kliinilised andmed on korrastamata, mittetäielikud, kallutatud ja täis ajalisi lõkse. See üksus hõlmab EHR-andmete puhastamist, kodeerimist ja analüüsimist tehisintellektiga; kõige salakavalamad vead (ajaline leke, eelarvamus, klasside tasakaalustamatus); ja me näeme, kuidas ennustava mudeli väljundid valideeritakse.
Tuletame algusest peale meelde: riskimudel võib öelda "sellel patsiendil on suur tagasivõtmise tõenäosus"; kuid see on otsust toetav väljund, mitte diagnoos või raviotsus. AI ei diagnoosi; Otsuse teevad arst ja kliiniline meeskond.
EHR-andmetega töötamise sammud
1. samm – lahutage ja ühendage. Andmed pärinevad erinevatest süsteemidest (labor, apteek, radioloogia); kombineeritakse patsiendi ID-ga. Selles etapis on konfidentsiaalsus kõrgeim prioriteet (vt 10. osa).
2. etapp – puhastamine. Puuduvad väärtused, ühikute vastuolud (mg/dl ja mmol/l segadus), topeltkirjed ja ebatõenäolised väärtused (vanus 200, vererõhk 0) elimineeritakse. AI on siin tugev kõrvalekallete märgistamises ja vaba teksti struktureerimises.
3. etapp – kodeerimine ja standardimine. Diagnoosid kaardistatakse standardkoodidega, nagu ICD (rahvusvaheline haiguste klassifikatsioon) ja ravimid standardsõnastike järgi. Struktureeritud teabe eraldamist vabateksti märkmetest nimetatakse loomuliku keele töötlemiseks (NLP); AI on siin väärtuslik, kuid selle väljund nõuab valideerimist.
4. etapp – funktsioonide projekteerimine. Mudeli sisendid genereeritakse algandmetest: viimane laboriväärtus, trend, ravimite arv, kaasuvate haiguste skoor jne.
5. etapp – modelleerimine ja hindamine. Ennustav mudel on koostatud ja – kõige kriitilisem osa – hinnatud hoolikalt ja lekkevabalt.
Kolm kõige salakavalamat viga
Ajutine leke. Info lisamine funktsiooni, mida ennustamise ajal veel ei eksisteeri. Näiteks haiglast lahkumise diagnoosi või viimase päeva laboratoorsete testide kasutamine, et hinnata surmaohtu vastuvõtul. Mudel näeb laboris täiuslik välja, kuid jookseb reaalses kasutuses kokku, sest on näinud "tulevikku".
Eelarvamus. Andmed kajastavad varasemaid kliinilisi otsuseid; Kui need otsused on juba ebavõrdsed, õpib mudel seda ja tugevdab seda. Näiteks kui teatud rühmale on ajalooliselt vähem testimiseks tellitud, võib mudel arvata, et haigus on selles rühmas "madalam".
Klassi tasakaalustamatus. Kui huvipakkuv sündmus (nt haruldane tüsistus) moodustab 1% andmetest, näib mudel, mis ütleb alati "sündmust pole", 99% täpne, kuid oleks kasutu. Täpsuse asemel on vaja tundlikkust, täpsust ja sündmusepõhiseid mõõdikuid.
Hindamine: diskrimineerimisest ei piisa, kalibreerimine on kohustuslik
On kaks erinevat küsimust. Diskrimineerimine (tüüpiline AUC mõõt): kas mudel järjestab patsiendid õigesti riski järgi? Kalibreerimine: kas mudeli antud tõenäosused vastavad tegelikele sagedustele? Kas umbes 20% patsientidest, kes ütlevad "20% risk", on tegelikult mõni sündmus? Kuna kliinikus tehakse otsuseid lävendite alusel, siis hästi järjestatud, kuid halvasti kalibreeritud mudel toob kaasa valed läveotsused. Lisaks tuleks eraldi teatada alarühmade tulemuslikkusest (vanus, sugu, rahvus, haigla) ja küsida kliinilise kasulikkuse küsimus (kas selle mudeli kasutamine annab tõesti paremaid tulemusi?).
Kolm miniümbrist: numbrite järgi
Juhtum 1 – lekke tõttu paisutatud õnnestumine. Tagasivõtumudel andis sisetestides AUC 0,92; see nägi suurepärane välja. Läbivaatamise käigus leiti, et funktsioonide hulka kuulub "väljakirjutamise järgne ambulatoorne vastuvõtt"; See teave ei olnud prognoosimise ajal saadaval. Kui leke oli kõrvaldatud, langes AUC 0,71-ni - see on realistlik ja kasutatav väärtus.
Juhtum 2 – kalibreerimise triiv. Kuigi sepsise varajase hoiatamise skoor oli haiglas, kus see välja töötati, hästi kalibreeritud, näitas patsiendi profiil kahekordset tegelikku sündmuste esinemissagedust sama skoori puhul teises haiglas. Tulemus oli õige, kuid tõenäosused olid valed; künnist ei saanud ilma ümberkalibreerimiseta kasutada.
Juhtum 3 – aja kokkuhoid NLP abil. Üks uurimisrühm võttis käsitsi välja suitsetamise ajaloo 12 000 patsiendi märkmetest; Umbes 2 minutit noodi kohta, kokku 400 tundi. NLP-abiga ekstraheerimine vähendas selle mõne tunnini; Meeskond kontrollis käsitsi ainult juhuslikult valitud valideerimisproovi, mille mudel jättis "ebaselgeks". Kriitiline oli valideerimisproovi põhjalik uurimine.
Nõrk viip / Tugev viip
Nõrk viip:
Koostage nendest patsiendiandmetest riskimudel ja esitage tulemused.[andmed]
Võimas viip:
Teie roll: olete kliiniliste andmete analüüsi assistent (TE EI OTSUSTA). Kritiseerige ennustusmudeli PLAN järgmise anonüümsete muutujate loendi jaoks:- Märkige, kas iga muutuja on prognoosimise ajal olemas (ajalise lekke oht).- Loetlege klasside tasakaalustamatus ja võimalikud kõrvalekalde allikad.- Soovitage hindamiseks diskrimineerimist + kalibreerimist + alarühma + kliiniline kasulikkus.- Märkige, et otsus jääb kliinilise meeskonna teha. Anonüümsed muutujad ja sihtmärk:[loend]
Neli kopeeritavat malli
1) Lekkekontroll:
Liigitage järgmine funktsioonide loend kategooriasse "ennustuse ajal saadaval" / "tulevikuteave (leke)" ja põhjendage seda. Eesmärk ja ennustushetk: [definitsioon]. Omadused: [loend]
2) Andmekvaliteedi aruanne:
Kontrollige selle anonüümse tabeli puuduva väärtuse määra, puuduvaid väärtusi, ühikute vastuolusid ja duplikaate; Kuvatakse kvaliteedi koondtabel. Tabel: [andmed]
3) NLP järelduste kontrollimise skeem:
Kirjutage NLP-etapi valideerimisplaan, mis eraldab vabateksti annotatsioonidest [muutuja]: juhusliku valimi suurus, kuldstandardi märgistus, sobivuse mõõdik, veaanalüüs.
4) Hindamisraamistik:
Kirjutage selle kliinilise mudeli hindamisraamistiku mustand: diskrimineerimine (AUC), kalibreerimiskõver, alarühma jõudlus, otsustuskõvera analüüs. Mudel: [kirjeldus]
Modelli roll: ülesande tüübi järgi
Ülesande tüüp
AI panus
kriitilisus
kontrollimine
Andmete puhastamine/kõrvalväärtus
kõrge
madal
kohapealne kontroll
NLP eraldamine märkmetest
kõrge
keskmine
Näidise kinnitamine
Riski/ennustuse hindamine
keskmine
kõrge
Kalibreerimine + alarühm
Ressursi/võimsuse planeerimine
keskmine
keskmine
Äriüksuse heakskiit
Ravi otsus
piiratud
väga kõrge
Täielik arsti heakskiit
Näpunäide: kui kliinilise mudeli AUC on ootamatult kõrge (nt üle 0,95), otsige enne tähistamist ajalist leket. Reaalses maailmas on sellised kõrged väärtused tavaliselt teabe lekke märgiks.
Ettevaatust! Mudel võib õppida ja tugevdada ajalooliste andmete ebavõrdsust. Kõrge üldine täpsus võib teatud patsiendirühmades tähendada süstemaatilist kahju; Tulemuslikkusest tuleb alati aru anda alarühmade kaupa.
Levinud vead
- Ei märka ajalist leket. Teadmised tuleviku kohta toovad laboris valeedu.
- Olge täpsusega rahul. Tasakaalustamata andmete puhul on täpsus eksitav; Nõutav tundlikkus ja kalibreerimine.
- Alarühmadest aruandlust ei esitata. Üldine mõõdik peidab eelarvamusi ja ebavõrdsust.
- Kalibreerimise vahelejätmine. Isegi hea edetabelimudel võib oma lävendiotsuste tegemisel vigu teha.
- Jättes otsustamise modelli hooleks. Väljund on tugi; Raviotsuse teeb kliiniline meeskond.
Kokkuvõttes
- EHR-andmed on võimsad, kuid lünklikud, mittetäielikud ja kallutatud; puhastamine ja kodeerimine on kriitilised sammud.
- Ajaline leke on kõige salakavalam viga; Tulevikuteadmised toovad laboris valeedu.
- Klassi tasakaalustamatus ja eelarvamus muudavad täpsuse mõõdiku eksitavaks.
- Hindamine peaks hõlmama diskrimineerimist, kalibreerimist, alarühmitamist ja kliinilist kasulikkust.
- Prognoosiväljundid on tugi; Diagnostika ja raviotsused kuuluvad kliinilisele meeskonnale.
Rakenduse ülesanne
Koostage ennustuseesmärk ja kümnest muutujast koosnev loend (sisaldage tahtlikult väljavaadete muutuja, nt tühjenemise diagnoos). Kasutage võimsat viipa, et kontrollida mudelit lekete suhtes ja kontrollida, kas see fikseerib selle muutuja. Seejärel kirjutage selle mudeli hindamisraamistik kolmes punktis, sealhulgas diskrimineerimine, kalibreerimine ja alamrühmitamine.
kontrollnimekiri
- [ ] Saan aru EHR-andmetega töötamise, ekstraheerimise, puhastamise, kodeerimise ja modelleerimise etappidest.
- [ ] Tunnen ajutise lekke ära ja uurin kinnisvaraloendit.
- [ ] Sain aru, kuidas klasside tasakaalustamatus ja eelarvamused eksitavad täpsust.
- [ ] Ma tean erinevust diskrimineerimise ja kalibreerimise vahel ning mõlema vajalikkust.
- [ ] Prognoositava väljundi saan positsioneerida toetuseks, mitte otsuseks.