Vienetas 7 / 11

Klinikinių duomenų analizė ir elektroniniai sveikatos įrašai

Pelnas:

  • Gebėjimas paaiškinti elektroninių sveikatos įrašų (EHR) duomenų valymo, kodavimo ir analizės veiksmus dirbtiniu intelektu.
  • Gebėjimas atpažinti klinikinių duomenų riziką, pvz., trūkstamų duomenų, šališkumo, klasių disbalanso ir laikino nutekėjimo
  • Galimybė patvirtinti nuspėjamuosius modelio rezultatus kalibruojant, pogrupio veikimu ir klinikiniu naudingumu

Šiuolaikinių ligoninių atmintis yra elektroninis sveikatos įrašas (EHR): skaitmeninis diagnozių, laboratorinių tyrimų rezultatų, vaistų, procedūrų, slaugytojų užrašų ir gydytojų stebėjimų rinkinys. Šie duomenys yra ir dirbtinio intelekto lobis, ir minų laukas. Lobis, nes jame yra milijonai sergančių kasmetinių modelių; minų laukas, nes klinikiniai duomenys yra netvarkingi, neišsamūs, šališki ir pilni laiko spąstų. Šis skyrius apima EHR duomenų valymą, kodavimą ir analizę dirbtiniu intelektu; klastingiausios klaidos (laikinis nutekėjimas, šališkumas, klasių disbalansas); ir pamatysime, kaip patvirtinami nuspėjamojo modelio išėjimai.

Priminkime nuo pat pradžių: rizikos modelis gali pasakyti „šis pacientas turi didelę readmisijos tikimybę“; bet tai yra sprendimų palaikymo rezultatas, o ne diagnozės ar gydymo sprendimas. AI nediagnozuoja; Sprendimą priima gydytojas ir klinikų komanda.

Darbo su ESI duomenimis žingsniai

1 veiksmas – atimkite ir sujunkite. Duomenys gaunami iš skirtingų sistemų (laboratorijos, vaistinės, radiologijos); derinamas su paciento ID. Šiame etape konfidencialumas yra didžiausias prioritetas (žr. 10 skyrių).

2 žingsnis – valymas. Trūkstamos reikšmės, vienetų neatitikimai (mg/dL ir mmol/l painiavos), pasikartojantys įrašai ir mažai tikėtinos reikšmės (amžius 200, kraujospūdis 0) pašalinamos. AI čia yra stiprus išskirtinių žymėjimų ir laisvo teksto struktūrizavimo srityse.

3 žingsnis – kodavimas ir standartizavimas. Diagnozės susietos su standartiniais kodais, tokiais kaip TLK (Tarptautinė ligų klasifikacija), o vaistai – į standartinius žodynus. Struktūrinės informacijos ištraukimas iš laisvo teksto užrašų vadinamas natūralios kalbos apdorojimu (NLP); Dirbtinis intelektas čia yra vertingas, tačiau jo išvestį reikia patvirtinti.

4 veiksmas – funkcijų projektavimas. Modelio įvestis generuojamos iš neapdorotų duomenų: paskutinės laboratorinės vertės, tendencijos, vaistų skaičiaus, gretutinių ligų balo ir kt.

5 žingsnis. Modeliavimas ir įvertinimas. Nuspėjamasis modelis kuriamas ir – pati svarbiausia dalis – vertinama atsargiai ir be nuotėkio.

Trys klastingiausios klaidos

Laikinas nutekėjimas. Informacijos įtraukimas į funkciją, kurios numatymo metu dar nėra. Pavyzdžiui, naudojant išrašymo diagnozę arba paskutinės dienos laboratorinius tyrimus, kad būtų galima įvertinti mirties riziką priėmimo metu. Laboratorijoje modelis atrodo tobulai, tačiau realiai naudojant sugenda, nes matė „ateitį“.

Išankstinis nusistatymas. Duomenys atspindi praeities klinikinius sprendimus; Jei šie sprendimai jau nevienodi, modelis tai išmoksta ir sustiprina. Pavyzdžiui, jei tam tikrai grupei istoriškai buvo užsakyta mažiau tyrimų, modelis gali manyti, kad liga yra „žemesnė“ toje grupėje.

Klasės disbalansas. Jei dominantis įvykis (pvz., reta komplikacija) sudaro 1 % duomenų, modelis, kuris visada sako „nėra įvykio“, atrodytų 99 % tikslus, bet būtų nenaudingas. Vietoj tikslumo reikia jautrumo, tikslumo ir įvykiais pagrįstos metrikos.

Vertinimas: diskriminacijos nepakanka, kalibravimas yra privalomas

Yra du skirtingi klausimai. Diskriminacija (tipinis AUC matas): ar modelis teisingai klasifikuoja pacientus pagal riziką? Kalibravimas: ar modelio pateiktos tikimybės sutampa su faktiniais dažniais? Ar maždaug 20 % pacientų, kurie sako „20 % rizika“, iš tikrųjų turi įvykį? Kadangi sprendimai klinikoje priimami remiantis slenksčiais, gerai įvertintas, bet prastai sukalibruotas modelis lems neteisingus slenksčio sprendimus. Be to, apie pogrupio rezultatus (amžių, lytį, etninę kilmę, ligoninę) reikėtų pranešti atskirai ir užduoti klausimą dėl klinikinio naudingumo (ar naudojant šį modelį tikrai gaunami geresni rezultatai?).

Trys mini dėklai: pagal numerius

1 atvejis – sėkmė išpūsta dėl nuotėkio. Atliekant vidinį bandymą readmisijos modelis davė 0,92 AUC; atrodė puikiai. Peržiūros metu nustatyta, kad funkcijos apima „ambulatorinį priėmimą po išrašymo“; Šios informacijos prognozavimo metu nebuvo. Kai nuotėkis buvo pašalintas, AUC sumažėjo iki 0,71 - reali ir tinkama vertė.

2 atvejis – kalibravimo poslinkis. Nors ligoninėje, kurioje jis buvo sukurtas, ankstyvojo perspėjimo apie sepsią balas buvo gerai sukalibruotas, paciento profilis parodė dvigubai didesnį įvykio dažnį, esant tam pačiam balui kitoje ligoninėje. Rezultatas įvertintas teisingai, bet tikimybės buvo klaidingos; slenkstis negalėjo būti naudojamas be pakartotinio kalibravimo.

3 atvejis – laiko taupymas naudojant NLP. Viena tyrimų grupė rankiniu būdu ištraukė rūkymo istoriją iš 12 000 pacientų užrašų; Apytiksliai 2 minutės vienai natai, iš viso 400 valandų. Ekstrahavimas naudojant NLP sumažino tai iki kelių valandų; Komanda tik ranka patikrino atsitiktinai atrinktą patvirtinimo pavyzdį, kurį modelis paliko „neaišku“. Labai svarbu buvo kruopštus patvirtinimo mėginio tyrimas.

Silpnas raginimas / stiprus raginimas

Silpnas raginimas:

Sukurkite rizikos modelį iš šių pacientų duomenų ir praneškite apie rezultatus.[duomenys]

Galingas raginimas:

Jūsų vaidmuo: esate klinikinių duomenų analizės asistentas (TU NESPRENDĖTE). Kritikuokite šio anoniminių kintamųjų sąrašo numatymo modelio PLANĄ:- Pažymėkite, ar kiekvienas kintamasis yra numatymo metu (laikinio nutekėjimo rizika).- Išvardykite klasių disbalansą ir galimus šališkumo šaltinius.- Pasiūlykite diskriminaciją + kalibravimą + pogrupį + klinikinį naudingumą vertinimui.- Nurodykite, kad sprendimas priklauso klinikinei komandai. Anoniminiai kintamieji ir taikymas: [sąrašas]

Keturi kopijuojami šablonai

1) Nuotėkio patikrinimas:

Toliau pateiktą funkcijų sąrašą klasifikuokite kaip „pasiekiama numatymo metu“ / „ateities informacija (nutekėjimas)“ ir tai pagrįskite. Numatymo tikslas ir momentas: [apibrėžimas]. Savybės: [sąrašas]

2) Duomenų kokybės ataskaita:

Patikrinkite, ar šioje anoniminėje lentelėje nėra trūkstamų verčių rodiklio, trūkstamų reikšmių, vienetų neatitikimų ir dublikatų; Pasirodo kokybės suvestinė lentelė. Lentelė: [duomenys]

3) NLP išvadų tikrinimo schema:

Parašykite NLP etapo patvirtinimo planą, kuris iš laisvo teksto anotacijų išskiria [kintamąjį]: atsitiktinis imties dydis, aukso standarto ženklinimas, pritaikymo metrika, klaidų analizė.

4) Vertinimo sistema:

Parašykite šio klinikinio modelio vertinimo sistemos projektą: diskriminacija (AUC), kalibravimo kreivė, pogrupio veikla, sprendimo kreivės analizė. Modelis: [description]

Modelio vaidmuo: pagal užduoties tipą

Užduoties tipas

AI indėlis

kritiškumas

patikrinimas

Duomenų valymas/išskirtinis

aukštas

žemas

patikra vietoje

NLP ištraukimas iš užrašų

aukštas

vidutinis

Pavyzdžio patvirtinimas

Rizikos / numatymo balai

vidutinis

aukštas

Kalibravimas + pogrupis

Išteklių/pajėgumų planavimas

vidutinis

vidutinis

Verslo padalinio patvirtinimas

Gydymo sprendimas

ribotas

labai aukštas

Pilnas gydytojo patvirtinimas

Patarimas: jei klinikinio modelio AUC yra netikėtai didelis (pvz., didesnis nei 0,95), prieš švęsdami pažiūrėkite, ar nėra laiko nuotėkio. Realiame pasaulyje tokios didelės vertės paprastai yra informacijos nutekėjimo požymis.
Atsargiai: modelis gali išmokti ir sustiprinti istorinių duomenų nelygybes. Didelis bendras tikslumas gali reikšti sistemingą žalą tam tikroms pacientų grupėms; Rezultatai visada turi būti pateikiami pogrupiuose.

Dažnos klaidos

  • Laikino nuotėkio nepastebėjimas. Žinios apie ateitį sukelia klaidingą sėkmę laboratorijoje.
  • Būkite patenkinti tikslumu. Tikslumas yra klaidinantis su nesubalansuotais duomenimis; Reikalingas jautrumas ir kalibravimas.
  • Nepraneša apie pogrupius. Bendra metrika slepia šališkumą ir nelygybę.
  • Praleidžiamas kalibravimas. Net ir geras reitingavimo modelis gali klysti priimdamas slenksčio sprendimus.
  • Palikti sprendimą modeliui. Išvestis yra palaikymas; Sprendimą dėl gydymo priima klinikų komanda.

Apibendrinant

  • ESI duomenys yra galingi, bet fragmentiški, neišsamūs ir šališki; valymas ir kodavimas yra svarbūs žingsniai.
  • Laikinas nuotėkis yra pati klastingiausia klaida; Ateities žinios sukelia klaidingą sėkmę laboratorijoje.
  • Dėl klasių disbalanso ir šališkumo tikslumo metrika yra klaidinanti.
  • Vertinimas turėtų apimti diskriminaciją, kalibravimą, suskirstymą į pogrupius ir klinikinį naudingumą.
  • Prognozės rezultatai palaiko; Diagnostikos ir gydymo sprendimai priklauso klinikų komandai.

Taikymo užduotis

Sukurkite numatymo tikslą ir dešimties kintamųjų sąrašą (tyčia įtraukite „perspektyvų“ kintamąjį, pvz., iškrovos diagnozę). Naudokite galingą raginimą, kad patikrintumėte, ar modelyje nėra nuotėkio, ir pažiūrėkite, ar jis užfiksuoja šį kintamąjį. Tada parašykite šio modelio vertinimo sistemą trimis punktais, įskaitant diskriminaciją, kalibravimą ir pogrupiavimą.

kontrolinis sąrašas

  • [ ] Suprantu darbo su ESI duomenimis išgavimo, valymo, kodavimo ir modeliavimo veiksmus.
  • [ ] Galiu atpažinti laikiną nuotėkį ir apžiūrėti nuosavybės sąrašą.
  • [ ] Supratau, kaip klasių disbalansas ir išankstiniai nusistatymai klaidina tikslumą.
  • [ ] Žinau skirtumą tarp diskriminacijos ir kalibravimo ir abiejų būtinybę.
  • [ ] Nuspėjamąjį rezultatą galiu išdėstyti kaip paramą, o ne sprendimą.