Jednostka 7 / 11

Analiza danych klinicznych i elektroniczna dokumentacja medyczna

Zyski:

  • Umiejętność wyjaśnienia etapów czyszczenia, kodowania i analizowania danych w elektronicznej karcie zdrowia (EHR) za pomocą sztucznej inteligencji.
  • Umiejętność rozpoznawania zagrożeń związanych z danymi klinicznymi, takich jak brakujące dane, stronniczość, nierównowaga klas i wyciek czasowy
  • Możliwość walidacji wyników modelu predykcyjnego poprzez kalibrację, działanie podgrup i przydatność kliniczną

Pamięć współczesnych szpitali to elektroniczna karta zdrowia (EHR): cyfrowy zbiór diagnoz, wyników badań laboratoryjnych, leków, procedur, notatek pielęgniarek i obserwacji lekarzy. Dane te są zarówno skarbem, jak i polem minowym dla sztucznej inteligencji. Skarb, bo zawiera miliony chorych wzorców rocznych; pole minowe, ponieważ dane kliniczne są zdezorganizowane, niekompletne, stronnicze i pełne pułapek czasowych. Jednostka ta obejmuje czyszczenie, kodowanie i analizowanie danych EHR za pomocą sztucznej inteligencji; najbardziej podstępne błędy (przeciek czasowy, stronniczość, brak równowagi klasowej); i zobaczymy, jak zweryfikowane zostaną wyniki modelu predykcyjnego.

Przypomnijmy od początku: model ryzyka może mówić „ten pacjent ma duże prawdopodobieństwo ponownej hospitalizacji”; jest to jednak wynik wspierający decyzję, a nie decyzja dotycząca diagnozy lub leczenia. AI nie diagnozuje; Decyzja należy do lekarza i zespołu klinicznego.

Kroki do pracy z danymi EHR

Krok 1 — Odejmij i połącz. Dane pochodzą z różnych systemów (laboratorium, farmacja, radiologia); jest łączony z identyfikatorem pacjenta. Na tym etapie poufność jest najwyższym priorytetem (patrz rozdział 10).

Krok 2 — Czyszczenie. Brakujące wartości, niespójności jednostek (pomieszanie mg/dl i mmol/l), zduplikowane zapisy i mało prawdopodobne wartości (wiek 200, ciśnienie krwi 0) są eliminowane. Sztuczna inteligencja jest tutaj silna w oznaczaniu wartości odstających i strukturyzowaniu dowolnego tekstu.

Krok 3 — Kodowanie i standaryzacja. Diagnozy są odwzorowywane na standardowych kodach, takich jak ICD (Międzynarodowa Klasyfikacja Chorób), a leki na standardowych słownikach. Wyodrębnianie uporządkowanych informacji z notatek tekstowych nazywa się przetwarzaniem języka naturalnego (NLP). Sztuczna inteligencja jest tutaj cenna, ale jej wyniki wymagają walidacji.

Krok 4 — Inżynieria cech. Dane wejściowe modelu są generowane na podstawie surowych danych: ostatnia wartość laboratoryjna, trend, liczba leków, wynik chorób współistniejących itp.

Krok 5 — Modelowanie i ewaluacja. Model predykcyjny jest budowany i – co najważniejsze – oceniany w sposób ostrożny i pozbawiony wycieków.

Trzy najbardziej podstępne błędy

Tymczasowy wyciek. Umieszczenie w obiekcie informacji, która jeszcze nie istnieje w momencie prognozowania. Na przykład diagnostyka wypisowa lub badania laboratoryjne wykonane w ostatnim dniu w celu oszacowania ryzyka zgonu przy przyjęciu. Model wygląda idealnie w laboratorium, ale w rzeczywistym użyciu ulega awarii, ponieważ widział „przyszłość”.

Uprzedzenie. Dane odzwierciedlają wcześniejsze decyzje kliniczne; Jeśli te decyzje są już nierówne, model uczy się tego i wzmacnia. Na przykład, jeśli w przeszłości określonej grupie zlecano mniejszą liczbę badań, model może pomyśleć, że liczba zachorowań w tej grupie jest „rzadsza”.

Nierównowaga klas. Jeśli interesujące zdarzenie (np. rzadkie powikłanie) stanowi 1% danych, model, który zawsze mówi „brak zdarzenia”, będzie wyglądał na 99% dokładny, ale będzie bezużyteczny. Zamiast dokładności wymagana jest czułość, precyzja i metryki oparte na zdarzeniach.

Ocena: Dyskryminacja nie wystarczy, kalibracja jest koniecznością

Są dwa różne pytania. Dyskryminacja (typowa miara AUC): czy model prawidłowo klasyfikuje pacjentów według ryzyka? Kalibracja: czy prawdopodobieństwa podane w modelu odpowiadają rzeczywistym częstotliwościom? Czy u około 20% pacjentów, którzy twierdzą, że „ryzyko 20%” faktycznie doszło do zdarzenia? Ponieważ decyzje podejmowane są w klinice na podstawie progów, dobrze oceniany, ale źle skalibrowany model będzie prowadził do błędnych decyzji dotyczących progów. Dodatkowo należy osobno zgłosić wyniki podgrup (wiek, płeć, pochodzenie etniczne, szpital) i zadać pytanie o przydatność kliniczną (czy stosowanie tego modelu rzeczywiście daje lepsze wyniki?).

Trzy mini etui: w liczbach

Przypadek 1 — Sukces zawyżony przez wyciek. Model readmisji wykazał w testach wewnętrznych AUC wynoszące 0,92; wyglądało świetnie. Przegląd wykazał, że funkcje obejmowały „wizytę ambulatoryjną po wypisaniu ze szpitala”; W momencie prognozowania informacja ta nie była dostępna. Po usunięciu wycieku wartość AUC spadła do 0,71 – wartości realistycznej i użytecznej.

Przypadek 2 — Dryft kalibracyjny. Chociaż wynik wczesnego ostrzegania przed sepsą został dobrze skalibrowany w szpitalu, w którym został opracowany, profil pacjenta wykazał dwukrotnie większą częstość występowania zdarzeń w przypadku tego samego wyniku w innym szpitalu. Wynik został poprawnie sklasyfikowany, ale prawdopodobieństwo było błędne; próg nie mógł zostać użyty bez ponownej kalibracji.

Przypadek 3 — Oszczędność czasu dzięki NLP. Jeden zespół badawczy ręcznie wyodrębniał historię palenia z 12 000 notatek pacjentów; Około 2 minuty na nutę, łącznie 400 godzin. Ekstrakcja wspomagana NLP skróciła ten czas do kilku godzin; Zespół ręcznie sprawdził jedynie losowo wybraną próbkę walidacyjną, którą model pozostawił „niejasną”. Kluczowe znaczenie miała skrupulatna analiza próbki walidacyjnej.

Słaba podpowiedź/silna podpowiedź

Słaba zachęta:

Zbuduj model ryzyka na podstawie danych pacjenta i zgłoś wyniki.[dane]

Potężny monit:

Twoja rola: Jesteś asystentem analizy danych klinicznych (NIE DECYDUJESZ). Dokonaj oceny PLANU modelu predykcyjnego dla poniższej listy anonimowych zmiennych: - Zaznacz, czy każda zmienna jest obecna w momencie przewidywania (ryzyko wycieku czasowego). - Wymień brak równowagi klas i potencjalne źródła błędów. - Zasugeruj dyskryminację + kalibrację + podgrupę + przydatność kliniczną do oceny. - Stwierdz, że decyzja należy do zespołu klinicznego. Anonimowe zmienne i cel:[lista]

Cztery szablony do kopiowania

1) Kontrola szczelności:

Sklasyfikuj poniższą listę funkcji jako „dostępne w momencie przewidywania” / „informacje o przyszłości (wyciek)” i uzasadnij ją. Cel i moment przewidywania: [definicja]. Funkcje: [lista]

2) Raport dotyczący jakości danych:

Sprawdź współczynnik brakujących wartości, brakujące wartości, niespójność jednostek i zduplikowany rekord dla tej anonimowej tabeli; Pojawi się tabela podsumowująca jakość. Tabela: [dane]

3) Schemat weryfikacji wnioskowania NLP:

Napisz plan walidacji dla etapu NLP, który wyodrębni [zmienną] z adnotacji w postaci dowolnego tekstu: losowa wielkość próbki, oznakowanie według złotego standardu, metryka dopasowania, analiza błędów.

4) Ramy oceny:

Napisz projekt ram oceny dla tego modelu klinicznego: dyskryminacja (AUC), krzywa kalibracji, wyniki podgrup, analiza krzywej decyzyjnej. Modelka: [opis]

Rola modela: Według typu zadania

Typ zadania

Wkład AI

krytyczność

weryfikacja

Czyszczenie danych/wartość odstająca

wysoki

niski

kontrola na miejscu

Ekstrakcja NLP z notatek

wysoki

średni

Walidacja próbki

Ocena ryzyka/przewidywania

średni

wysoki

Kalibracja + podgrupa

Planowanie zasobów/zdolności

średni

średni

Zatwierdzenie jednostki biznesowej

Decyzja o leczeniu

ograniczone

bardzo wysoki

Pełna zgoda lekarza

Wskazówka: Jeśli AUC modelu klinicznego jest nieoczekiwanie wysokie (np. powyżej 0,95), przed świętowaniem poszukaj wycieku czasowego. W prawdziwym świecie tak wysokie wartości są zwykle oznaką wycieku informacji.
Uwaga: Model może uczyć się i wzmacniać nierówności w danych historycznych. Wysoka ogólna dokładność może oznaczać systematyczne szkody w niektórych grupach pacjentów; Wyniki należy zawsze zgłaszać w podgrupach.

Typowe błędy

  • Nie zauważyłem tymczasowego wycieku. Znajomość przyszłości daje fałszywy sukces w laboratorium.
  • Bądź zadowolony z dokładności. Dokładność wprowadza w błąd w przypadku niezrównoważonych danych; Wymagana czułość i kalibracja.
  • Nie zgłaszanie podgrup. Ogólny wskaźnik ukrywa stronniczość i nierówności.
  • Pomijanie kalibracji. Nawet dobry model rankingowy może popełniać błędy przy podejmowaniu decyzji progowych.
  • Decyzję pozostawiam modelowi. Dane wyjściowe to wsparcie; Decyzja o leczeniu należy do zespołu klinicznego.

Podsumowując

  • Dane EHR są potężne, ale niejednolite, niekompletne i stronnicze; czyszczenie i kodowanie to kluczowe etapy.
  • Przeciek czasowy jest najbardziej podstępnym błędem; Przyszła wiedza daje fałszywy sukces w laboratorium.
  • Nierównowaga klas i stronniczość powodują, że metryka dokładności wprowadza w błąd.
  • Ocena powinna obejmować dyskryminację, kalibrację, podział na podgrupy i przydatność kliniczną.
  • Wyniki prognozy są wsparciem; Decyzje dotyczące diagnozy i leczenia należą do zespołu klinicznego.

Zadanie aplikacji

Skonstruuj cel predykcyjny i listę dziesięciu zmiennych (celowo uwzględnij zmienną „potencjalną”, np. diagnozę wypisu). Użyj potężnego podpowiedzi, aby sprawdzić model pod kątem wycieków i zobaczyć, czy przechwytuje tę zmienną. Następnie napisz ramy oceny tego modelu składające się z trzech elementów, w tym dyskryminacji, kalibracji i podgrupowania.

lista kontrolna

  • [ ] Rozumiem etapy ekstrakcji, czyszczenia, kodowania i modelowania podczas pracy z danymi EHR.
  • [ ] Potrafię rozpoznać tymczasowy wyciek i sprawdzić listę nieruchomości.
  • [ ] Zdałem sobie sprawę, jak brak równowagi klasowej i uprzedzenia wprowadzają w błąd dokładność.
  • [ ] Znam różnicę pomiędzy rozróżnianiem i kalibracją oraz potrzebę obu.
  • [ ] Mogę pozycjonować wyniki predykcyjne jako wsparcie, a nie decyzję.