Enhed 7 / 11

Klinisk dataanalyse og elektroniske sundhedsjournaler

Gevinster:

  • Evne til at forklare trinene i rengøring, kodning og analyse af elektroniske patientjournaler (EPJ) data med kunstig intelligens.
  • Evne til at genkende kliniske datarisici såsom manglende data, bias, klasseubalance og tidsmæssig lækage
  • Evne til at validere prædiktive modeloutput gennem kalibrering, undergruppeydelse og klinisk anvendelighed

Moderne hospitalers hukommelse er den elektroniske sygejournal (EPJ): en digital samling af diagnoser, laboratorieresultater, medicin, procedurer, sygeplejerskenotater og lægeobservationer. Disse data er både en skat og et minefelt for kunstig intelligens. Skat, fordi den indeholder millioner af syge årlige mønstre; minefelt, fordi kliniske data er uorganiserede, ufuldstændige, partiske og fulde af tidsmæssige fælder. Denne enhed omfatter rengøring, kodning og analyse af EPJ-data med kunstig intelligens; de mest lumske fejl (tidsbestemt lækage, skævhed, klasseubalance); og vi vil se, hvordan de prædiktive modeloutput valideres.

Lad os minde fra begyndelsen om: en risikomodel kan sige "denne patient har stor sandsynlighed for genindlæggelse"; men dette er en beslutningsstøtte, ikke en diagnose eller behandlingsbeslutning. AI diagnosticerer ikke; Beslutningen er op til lægen og det kliniske team.

Trin til at arbejde med EPJ-data

Trin 1 — Træk fra og flet. Data kommer fra forskellige systemer (laboratorium, apotek, radiologi); kombineres med patient-id. På dette stadium er fortrolighed den højeste prioritet (se enhed 10).

Trin 2 — Rengøring. Manglende værdier, enhedsinkonsistens (forvirring af mg/dL og mmol/L), duplikerede registreringer og usandsynlige værdier (alder 200, blodtryk 0) elimineres. AI er stærk her i outlier-flaggning og fritekststrukturering.

Trin 3 — Kodning og standardisering. Diagnoser er kortlagt til standardkoder såsom ICD (International Classification of Diseases), og medicin er kortlagt til standardordbøger. At udtrække struktureret information fra fritekstnoter kaldes naturlig sprogbehandling (NLP); AI er værdifuld her, men dens output kræver validering.

Trin 4 — Feature engineering. Modelinput genereres ud fra rådata: sidste laboratorieværdi, trend, antal medicin, komorbiditetsscore osv.

Trin 5 — Modellering og evaluering. Den forudsigende model er bygget og - den mest kritiske del - evalueret på en omhyggelig, lækagefri måde.

De tre mest lumske fejl

Tidsmæssig lækage. Indsætte oplysninger i funktionen, som endnu ikke eksisterer på forudsigelsestidspunktet. For eksempel ved hjælp af udskrivningsdiagnose eller sidste-dag laboratorietest til at estimere risikoen for død ved indlæggelse. Modellen ser perfekt ud i laboratoriet, men styrter ned i rigtig brug, fordi den har set "fremtiden".

Fordom. Dataene afspejler tidligere kliniske beslutninger; Hvis disse beslutninger allerede er ulige, lærer og forstærker modellen dette. For eksempel, hvis en bestemt gruppe historisk set er blevet bestilt mindre til test, kan modellen tro, at sygdommen er "lavere" i den gruppe.

Klasse ubalance. Hvis begivenheden af ​​interesse (f.eks. en sjælden komplikation) er 1 % af dataene, ville en model, der altid siger "ingen hændelse", se 99 % nøjagtig ud, men ville være ubrugelig. I stedet for nøjagtighed kræves følsomhed, præcision og hændelsesbaserede metrics.

Evaluering: Diskrimination er ikke nok, kalibrering er et must

Der er to forskellige spørgsmål. Diskriminering (typisk mål for AUC): rangerer modellen korrekt patienter efter risiko? Kalibrering: svarer modellens sandsynlighed til de faktiske frekvenser? Har ca. 20% af de patienter, der siger "20% risiko", faktisk en hændelse? Da beslutninger træffes ud fra tærskler i klinikken, vil en velplaceret, men dårligt kalibreret model føre til forkerte tærskelbeslutninger. Derudover bør undergruppepræstationer (alder, køn, etnicitet, hospital) rapporteres separat, og spørgsmålet om klinisk anvendelighed (frembringer brugen af ​​denne model virkelig bedre resultater?) bør stilles.

Tre minietuier: Efter numrene

Tilfælde 1 — Succes oppustet af lækage. En genindlæggelsesmodel gav en AUC på 0,92 i intern test; det så godt ud. Gennemgangen fandt, at funktioner omfattede "ambulant aftale efter udskrivelse"; Disse oplysninger var ikke tilgængelige på forudsigelsestidspunktet. Da lækagen var ryddet op, faldt AUC til 0,71 - en realistisk og brugbar værdi.

Tilfælde 2 — Kalibreringsafdrift. Mens en tidlig advarselsscore for sepsis var godt kalibreret på det hospital, hvor den blev udviklet, viste patientprofilen to gange den faktiske hændelsesrate for den samme score på et andet hospital. Scoren rangerede korrekt, men sandsynligheden var forkert; tærsklen kunne ikke bruges uden omkalibrering.

Case 3 — Spar tid med NLP. Et forskerhold udtog manuelt rygehistorie fra 12.000 patientnotater; Cirka 2 minutter pr. tone, 400 timer i alt. NLP-assisteret ekstraktion reducerede dette til et par timer; Holdet håndtjekkede kun en tilfældigt udvalgt valideringsprøve, som modellen efterlod "uklar." Kritisk var den omhyggelige undersøgelse af valideringsprøven.

Svag prompt / stærk prompt

Svag prompt:

Byg en risikomodel ud fra disse patientdata og rapporter resultater.[data]

Kraftig prompt:

Din rolle: Du er klinisk dataanalyseassistent (DU BESTEMMER IKKE). Kritik af en forudsigelsesmodel PLAN for følgende liste af anonyme variable:- Marker om hver variabel er til stede på forudsigelsestidspunktet (risiko for tidsmæssig lækage).- List klasseubalance og potentielle kilder til bias.- Foreslå diskrimination + kalibrering + undergruppe + klinisk anvendelighed til evaluering.- Angiv, at beslutningen ligger hos det kliniske team. Anonyme variabler og mål:[liste]

Fire kopierbare skabeloner

1) Lækageinspektion:

Klassificer følgende liste over funktioner som "tilgængelige på forudsigelsestidspunktet" / "fremtidige oplysninger (lækage)", og begrund det. Mål og forudsigelsestid: [definition]. Funktioner: [liste]

2) Rapport om datakvalitet:

Tjek for manglende værdirate, manglende værdier, enhedsinkonsistens og dubletpost for denne anonyme tabel; Der vises en kvalitetsoversigtstabel. Tabel: [data]

3) NLP-inferensverifikationsskema:

Skriv en valideringsplan for et NLP-trin, der uddrager [variabel] fra fritekstannoteringer: tilfældig stikprøvestørrelse, guldstandardmærkning, tilpasningsmetrik, fejlanalyse.

4) Evalueringsramme:

Skriv et udkast til evalueringsramme for denne kliniske model: diskrimination (AUC), kalibreringskurve, undergruppeydelse, beslutningskurveanalyse. Model: [beskrivelse]

Modellens rolle: Efter opgavetype

Opgavetype

AI-bidrag

kritikalitet

verifikation

Datarensning/outlier

høj

lav

stikprøvekontrol

NLP-ekstraktion fra noter

høj

medium

Prøve validering

Risiko/forudsigelsesscoring

medium

høj

Kalibrering + undergruppe

Ressource/kapacitetsplanlægning

medium

medium

Godkendelse af forretningsenhed

Behandlingsbeslutning

begrænset

meget høj

Fuld lægegodkendelse

Tip: Hvis en klinisk models AUC er uventet høj (f.eks. over 0,95), skal du kigge efter tidsmæssig lækage, før det fejres. I den virkelige verden er sådanne høje værdier normalt et tegn på informationslækage.
Forsigtig: Modellen kan lære og forstærke uligheder i historiske data. Høj samlet nøjagtighed kan betyde systematisk skade i visse patientgrupper; Ydelse skal altid rapporteres i undergrupper.

Almindelige fejl

  • Mærker ikke tidsmæssig lækage. Viden om fremtiden giver falsk succes i laboratoriet.
  • Vær tilfreds med nøjagtigheden. Nøjagtighed er vildledende med ubalancerede data; Følsomhed og kalibrering påkrævet.
  • Rapporterer ikke undergrupper. Den overordnede metrik skjuler bias og ulighed.
  • Springer kalibrering over. Selv en god rangeringsmodel kan lave fejl i sine tærskelbeslutninger.
  • Overlader beslutningen til modellen. Outputtet er support; Behandlingsbeslutningen er op til det kliniske team.

Sammenfattende

  • EPJ-data er kraftfulde, men usammenhængende, ufuldstændige og partiske; rengøring og kodning er kritiske trin.
  • Tidsmæssig lækage er den mest lumske fejl; Fremtidig viden giver falsk succes i laboratoriet.
  • Klasseubalance og bias gør nøjagtighedsmetrikken misvisende.
  • Evaluering bør omfatte diskrimination, kalibrering, undergruppering og klinisk anvendelighed.
  • Prognose output er understøttelse; Diagnose og behandlingsbeslutninger tilhører det kliniske team.

Ansøgningsopgave

Konstruer et forudsigelsesmål og en liste med ti variable (inkluder med vilje en "prospekt"-variabel, f.eks. udskrivningsdiagnose). Brug den kraftfulde prompt til at tjekke modellen for lækager og se, om den fanger denne variabel. Skriv derefter en evalueringsramme for denne model i tre punkter, herunder diskrimination, kalibrering og undergruppering.

tjekliste

  • [ ] Jeg forstår udtræks-, rengørings-, kodnings- og modelleringstrinene ved at arbejde med EPJ-data.
  • [ ] Jeg kan genkende den tidsmæssige lækage og inspicere ejendomslisten.
  • [ ] Jeg indså, hvordan klasseubalance og fordomme vildleder nøjagtighed.
  • [ ] Jeg kender forskellen mellem diskrimination og kalibrering og nødvendigheden af ​​begge dele.
  • [ ] Jeg kan placere det prædiktive output som støtte, ikke beslutning.