Enhet 7 / 11

Klinisk dataanalyse og elektroniske helsejournaler

Gevinster:

  • Evne til å forklare trinnene i rengjøring, koding og analyse av elektronisk helsejournal (EPJ) data med kunstig intelligens.
  • Evne til å gjenkjenne kliniske datarisikoer som manglende data, skjevhet, klasseubalanse og tidsmessig lekkasje
  • Evne til å validere prediktive modellutganger gjennom kalibrering, undergruppeytelse og klinisk nytte

Minnet til moderne sykehus er den elektroniske helsejournalen (EPJ): en digital samling av diagnoser, laboratorieresultater, medisiner, prosedyrer, sykepleiernotater og legeobservasjoner. Disse dataene er både en skatt og et minefelt for kunstig intelligens. Skat fordi den inneholder millioner av syke årlige mønstre; minefelt fordi kliniske data er uorganiserte, ufullstendige, partiske og fulle av tidsmessige feller. Denne enheten inkluderer rengjøring, koding og analyse av EPJ-data med kunstig intelligens; de mest lumske feilene (temporell lekkasje, skjevhet, klasseubalanse); og vi vil se hvordan de prediktive modellens utdata blir validert.

La oss minne fra begynnelsen om: en risikomodell kan si "denne pasienten har stor sannsynlighet for reinnleggelse"; men dette er en beslutningsstøtte, ikke en diagnose eller behandlingsbeslutning. AI diagnostiserer ikke; Avgjørelsen er opp til legen og det kliniske teamet.

Trinn for å jobbe med EPJ-data

Trinn 1 — Trekk fra og slå sammen. Data kommer fra forskjellige systemer (laboratorium, apotek, radiologi); er kombinert med pasient-ID. På dette stadiet er konfidensialitet høyeste prioritet (se enhet 10).

Trinn 2 — Rengjøring. Manglende verdier, enhetsinkonsekvenser (forvirring av mg/dL og mmol/L), dupliserte registreringer og usannsynlige verdier (alder 200, blodtrykk 0) elimineres. AI er sterk her når det gjelder utmerking og fritekststrukturering.

Trinn 3 — Koding og standardisering. Diagnoser er kartlagt til standardkoder som ICD (International Classification of Diseases), og medisiner er kartlagt til standardordbøker. Å trekke ut strukturert informasjon fra fritekstnotater kalles naturlig språkbehandling (NLP); AI er verdifull her, men produksjonen krever validering.

Trinn 4 — Funksjonsteknikk. Modellinndata genereres fra rådata: siste laboratorieverdi, trend, antall medisiner, komorbiditetspoeng, etc.

Trinn 5 — Modellering og evaluering. Den prediktive modellen er bygget og – den mest kritiske delen – evaluert på en forsiktig, lekkasjefri måte.

De tre mest lumske feilene

Tidsmessig lekkasje. Legge inn informasjon i funksjonen som ennå ikke eksisterer på tidspunktet for prediksjon. For eksempel ved bruk av utskrivningsdiagnose eller siste dag laboratorietesting for å estimere risikoen for død ved innleggelse. Modellen ser perfekt ut i laboratoriet, men krasjer ved reell bruk fordi den har sett «fremtiden».

Fordommer. Dataene gjenspeiler tidligere kliniske beslutninger; Hvis disse beslutningene allerede er ulike, lærer og forsterker modellen dette. For eksempel, hvis en bestemt gruppe historisk har blitt bestilt mindre for testing, kan modellen tro at sykdommen er "lavere" i den gruppen.

Klasse ubalanse. Hvis hendelsen av interesse (f.eks. en sjelden komplikasjon) er 1 % av dataene, vil en modell som alltid sier "ingen hendelse" se 99 % nøyaktig ut, men være ubrukelig. I stedet for nøyaktighet kreves sensitivitet, presisjon og hendelsesbaserte beregninger.

Evaluering: Diskriminering er ikke nok, kalibrering er et must

Det er to forskjellige spørsmål. Diskriminering (typisk mål på AUC): rangerer modellen pasienter riktig etter risiko? Kalibrering: samsvarer sannsynlighetene gitt av modellen med de faktiske frekvensene? Har omtrent 20 % av pasientene som sier «20 % risiko» faktisk en hendelse? Siden beslutninger tas basert på terskler i klinikken, vil en godt rangert, men dårlig kalibrert modell føre til feil terskelvedtak. I tillegg bør undergruppeytelse (alder, kjønn, etnisitet, sykehus) rapporteres separat og spørsmålet om klinisk nytte (gir bruk av denne modellen virkelig bedre resultater?) bør stilles.

Tre minivesker: etter tallene

Tilfelle 1 — Suksess blåst opp av lekkasje. En reinnleggelsesmodell ga en AUC på 0,92 i intern testing; det så flott ut. Gjennomgangen fant at funksjonene inkluderte "poliklinisk avtale etter utskrivning"; Denne informasjonen var ikke tilgjengelig på prognosetidspunktet. Når lekkasjen var ryddet opp, falt AUC til 0,71 - en realistisk og brukbar verdi.

Tilfelle 2 — Kalibreringsavdrift. Mens en tidlig advarselsscore for sepsis var godt kalibrert på sykehuset der den ble utviklet, viste pasientprofilen to ganger den faktiske hendelsesraten for samme skår ved et annet sykehus. Poengsummen rangerte riktig, men sannsynlighetene var feil; terskelen kunne ikke brukes uten omkalibrering.

Tilfelle 3 — Spar tid med NLP. Et forskerteam tok manuelt ut røykehistorie fra 12 000 pasientnotater; Omtrent 2 minutter per tone, totalt 400 timer. NLP-assistert ekstraksjon reduserte dette til noen få timer; Teamet håndsjekket bare en tilfeldig valgt valideringsprøve som modellen etterlot "uklar." Kritisk var den grundige undersøkelsen av valideringsprøven.

Svak forespørsel / sterk forespørsel

Svak melding:

Bygg en risikomodell fra disse pasientdataene og rapporter resultater.[data]

Kraftig ledetekst:

Din rolle: Du er en klinisk dataanalyseassistent (DU BESTEMMER IKKE). Kritikk en prediksjonsmodell PLAN for følgende liste over anonyme variabler:- Merk av om hver variabel er tilstede på prediksjonstidspunktet (risiko for tidslekkasje).- List opp klasseubalanse og potensielle kilder til skjevhet.- Foreslå diskriminering + kalibrering + undergruppe + klinisk nytteverdi for evaluering.- Oppgi at beslutningen ligger hos det kliniske teamet. Anonyme variabler og mål:[liste]

Fire kopierbare maler

1) Lekkasjeinspeksjon:

Klassifiser følgende liste over funksjoner som "tilgjengelig på tidspunktet for prediksjon" / "fremtidig informasjon (lekkasje)" og begrunn det. Mål og spådomsmoment: [definisjon]. Funksjoner: [liste]

2) Datakvalitetsrapport:

Se etter manglende verdirate, manglende verdier, enhetsinkonsistens og duplikatpost for denne anonyme tabellen; En kvalitetssammendragstabell vises. Tabell: [data]

3) NLP-slutningsverifiseringsskjema:

Skriv en valideringsplan for et NLP-trinn som trekker ut [variabel] fra fritekstkommentarer: tilfeldig prøvestørrelse, gullstandardmerking, tilpasningsmetrikk, feilanalyse.

4) Evalueringsramme:

Skriv et utkast til evalueringsrammeverk for denne kliniske modellen: diskriminering (AUC), kalibreringskurve, undergruppeytelse, beslutningskurveanalyse. Modell: [beskrivelse]

Modellens rolle: Etter oppgavetype

Oppgavetype

AI-bidrag

kritikalitet

verifisering

Datarensing/outlier

høy

lav

stikkprøve

NLP-utvinning fra notater

høy

medium

Eksempel validering

Risiko/prediksjonsscoring

medium

høy

Kalibrering + undergruppe

Ressurs-/kapasitetsplanlegging

medium

medium

Godkjenning av forretningsenhet

Behandlingsvedtak

begrenset

veldig høy

Full godkjenning fra lege

Tips: Hvis en klinisk modells AUC er uventet høy (f.eks. over 0,95), se etter tidslekkasje før du feirer. I den virkelige verden er slike høye verdier vanligvis et tegn på informasjonslekkasje.
Forsiktig: Modellen kan lære og forsterke ulikheter i historiske data. Høy total nøyaktighet kan innebære systematisk skade i visse pasientgrupper; Ytelse skal alltid rapporteres i undergrupper.

Vanlige feil

  • Merker ikke tidsmessig lekkasje. Kunnskap om fremtiden gir falsk suksess i laboratoriet.
  • Vær fornøyd med nøyaktigheten. Nøyaktighet er misvisende med ubalanserte data; Følsomhet og kalibrering kreves.
  • Rapporterer ikke undergrupper. Den generelle beregningen skjuler skjevhet og ulikhet.
  • Hopp over kalibrering. Selv en god rangeringsmodell kan gjøre feil i sine terskelbeslutninger.
  • Overlater avgjørelsen til modellen. Utgangen er støtte; Behandlingsbeslutningen er opp til det kliniske teamet.

Oppsummert

  • EPJ-data er kraftige, men usammenhengende, ufullstendige og partiske; rengjøring og koding er kritiske trinn.
  • Temporell lekkasje er den mest lumske feilen; Fremtidig kunnskap gir falsk suksess i laboratoriet.
  • Klasseubalanse og skjevhet gjør nøyaktighetsmålingen misvisende.
  • Evaluering bør inkludere diskriminering, kalibrering, undergruppering og klinisk nytte.
  • Prognose utganger er støtte; Diagnose og behandlingsbeslutninger tilhører det kliniske teamet.

Søknadsoppgave

Konstruer et prediksjonsmål og en liste med ti variabler (inkluder med hensikt en "prospekt"-variabel, f.eks. utskrivningsdiagnose). Bruk den kraftige ledeteksten for å sjekke modellen for lekkasjer og se om den fanger opp denne variabelen. Skriv deretter et evalueringsrammeverk for denne modellen i tre elementer, inkludert diskriminering, kalibrering og undergruppering.

sjekkliste

  • [ ] Jeg forstår trinnene for utvinning, rengjøring, koding og modellering av arbeid med EPJ-data.
  • [ ] Jeg kan gjenkjenne den tidsmessige lekkasjen og inspisere eiendomslisten.
  • [ ] Jeg innså hvordan klasseubalanse og fordommer villeder nøyaktighet.
  • [ ] Jeg vet forskjellen mellom diskriminering og kalibrering og nødvendigheten av begge.
  • [ ] Jeg kan plassere den prediktive utgangen som støtte, ikke beslutning.