واحد 7 / 11

تجزیه و تحلیل داده های بالینی و پرونده الکترونیک سلامت

سود:

  • امکان توضیح مراحل پاکسازی، کدگذاری و تجزیه و تحلیل داده های پرونده الکترونیک سلامت (EHR) با هوش مصنوعی.
  • توانایی تشخیص خطرات داده های بالینی مانند داده های از دست رفته، سوگیری، عدم تعادل کلاس و نشت زمانی
  • توانایی اعتبارسنجی خروجی های مدل پیش بینی از طریق کالیبراسیون، عملکرد زیرگروه و سودمندی بالینی

حافظه بیمارستان‌های مدرن، پرونده الکترونیک سلامت (EHR) است: مجموعه‌ای دیجیتالی از تشخیص‌ها، نتایج آزمایشگاهی، داروها، روش‌ها، یادداشت‌های پرستار و مشاهدات پزشک. این داده ها هم گنج و هم میدان مین برای هوش مصنوعی هستند. گنج، زیرا حاوی میلیون ها الگوی بیمار سالانه است. میدان مین زیرا داده های بالینی بهم ریخته، ناقص، مغرضانه و پر از تله های زمانی هستند. این واحد شامل تمیز کردن، کدگذاری و تجزیه و تحلیل داده های EHR با هوش مصنوعی است. موذیانه ترین خطاها (نشت زمانی، تعصب، عدم تعادل کلاس)؛ و خواهیم دید که چگونه خروجی های مدل پیش بینی اعتبار می شوند.

بیایید از ابتدا یادآوری کنیم: یک مدل خطر ممکن است بگوید "این بیمار احتمال بستری مجدد دارد"؛ اما این یک خروجی پشتیبانی تصمیم است، نه یک تصمیم تشخیص یا درمان. هوش مصنوعی تشخیص نمی دهد. تصمیم گیری به عهده پزشک و تیم بالینی است.

مراحل کار با داده های EHR

مرحله 1 - تفریق و ادغام داده ها از سیستم های مختلف (آزمایشگاه، داروخانه، رادیولوژی) می آیند. با شناسه بیمار ترکیب می شود. در این مرحله، محرمانگی بالاترین اولویت است (به بخش 10 مراجعه کنید).

مرحله 2 - تمیز کردن مقادیر از دست رفته، تناقضات واحد (آشفتگی mg/dL و mmol/L)، سوابق تکراری و مقادیر بعید (سن 200، فشار خون 0) حذف می شوند. هوش مصنوعی در اینجا در پرچم‌گذاری پرت و ساختار متن آزاد قوی است.

مرحله 3 - کدگذاری و استانداردسازی تشخیص‌ها با کدهای استاندارد مانند ICD (طبقه‌بندی بین‌المللی بیماری‌ها) و داروها به فرهنگ‌های استاندارد نگاشت می‌شوند. استخراج اطلاعات ساختاریافته از یادداشت های متن آزاد، پردازش زبان طبیعی (NLP) نامیده می شود. هوش مصنوعی در اینجا ارزشمند است، اما خروجی آن نیاز به اعتبارسنجی دارد.

مرحله 4 - مهندسی ویژگی. ورودی‌های مدل از داده‌های خام تولید می‌شوند: آخرین ارزش آزمایشگاهی، روند، تعداد داروها، امتیاز همبودی و غیره.

مرحله 5 - مدل سازی و ارزیابی مدل پیش‌بینی ساخته شده و - حیاتی‌ترین بخش - به روشی دقیق و بدون نشت ارزیابی می‌شود.

سه اشتباه موذیانه

نشت موقت. قرار دادن اطلاعات در ویژگی که هنوز در زمان پیش بینی وجود ندارد. به عنوان مثال، استفاده از تشخیص ترخیص یا آزمایشات آزمایشگاهی روز آخر برای تخمین خطر مرگ در هنگام پذیرش. این مدل در آزمایشگاه کامل به نظر می رسد، اما در استفاده واقعی خراب می شود زیرا "آینده" را دیده است.

تعصب داده ها منعکس کننده تصمیمات بالینی گذشته است. اگر این تصمیمات قبلاً نابرابر باشند، مدل این را می آموزد و تقویت می کند. برای مثال، اگر گروه خاصی از لحاظ تاریخی کمتر برای آزمایش سفارش داده شده باشد، مدل ممکن است فکر کند که بیماری در آن گروه «پایین‌تر» است.

عدم تعادل طبقاتی اگر رویداد مورد علاقه (به عنوان مثال یک عارضه نادر) 1٪ از داده ها باشد، مدلی که همیشه می گوید "بدون رویداد" 99٪ دقیق به نظر می رسد اما بی فایده است. به جای دقت، حساسیت، دقت و معیارهای مبتنی بر رویداد مورد نیاز است.

ارزیابی: تبعیض کافی نیست، کالیبراسیون یک الزام است

دو سوال متفاوت وجود دارد. تبعیض (اندازه گیری معمولی AUC): آیا این مدل به درستی بیماران را بر اساس خطر رتبه بندی می کند؟ کالیبراسیون: آیا احتمالات داده شده توسط مدل با فرکانس های واقعی مطابقت دارند؟ آیا تقریباً 20٪ از بیمارانی که می گویند "20٪ خطر" واقعاً یک رویداد دارند؟ از آنجایی که تصمیمات بر اساس آستانه در کلینیک گرفته می شود، یک مدل با رتبه بندی خوب اما کالیبره شده ضعیف منجر به تصمیم گیری های آستانه نادرست می شود. علاوه بر این، عملکرد زیرگروه ها (سن، جنسیت، قومیت، بیمارستان) باید به طور جداگانه گزارش شود و سوال مفید بودن بالینی (آیا استفاده از این مدل واقعا نتایج بهتری ایجاد می کند؟) باید پرسیده شود.

سه مورد کوچک: با اعداد

مورد 1 - موفقیت با نشت متورم شد. یک مدل پذیرش مجدد AUC 0.92 را در آزمایش داخلی به همراه داشت. عالی به نظر می رسید این بررسی نشان داد که ویژگی‌ها شامل «نوبت سرپایی پس از ترخیص» است. این اطلاعات در زمان پیش بینی در دسترس نبود. هنگامی که نشت پاک شد، AUC به 0.71 کاهش یافت - یک مقدار واقعی و قابل استفاده.

مورد 2 - رانش کالیبراسیون. در حالی که نمره هشدار اولیه سپسیس در بیمارستانی که در آن ایجاد شده بود به خوبی کالیبره شده بود، پروفایل بیمار دو برابر نرخ واقعی رویداد را برای همان امتیاز در بیمارستانی دیگر نشان داد. امتیاز به درستی رتبه بندی شد اما احتمالات اشتباه بود. آستانه بدون کالیبراسیون مجدد قابل استفاده نیست.

مورد 3 - صرفه جویی در زمان با NLP. یک تیم تحقیقاتی به صورت دستی سابقه سیگار کشیدن را از 12000 یادداشت بیمار استخراج می کرد. تقریباً 2 دقیقه برای هر نت، در مجموع 400 ساعت. استخراج به کمک NLP این را به چند ساعت کاهش داد. این تیم فقط یک نمونه اعتبار سنجی انتخاب شده به صورت تصادفی را که مدل «نامشخص» باقی گذاشته بود، به صورت دستی بررسی کردند. مهم، بررسی دقیق نمونه اعتبارسنجی بود.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

یک مدل خطر از داده‌های این بیمار بسازید و نتایج را گزارش کنید.[data]

اعلان قدرتمند:

نقش شما: شما یک دستیار تجزیه و تحلیل داده های بالینی هستید (شما تصمیم نمی گیرید). یک PLAN مدل پیش‌بینی را برای فهرست زیر از متغیرهای ناشناس نقد کنید: - علامت‌گذاری کنید که آیا هر متغیر در زمان پیش‌بینی وجود دارد یا خیر (خطر نشت زمانی).- نامتعادل کلاس و منابع بالقوه سوگیری را فهرست کنید. - پیشنهاد تبعیض + کالیبراسیون + زیرگروه + سودمندی بالینی برای ارزیابی. - بیان کنید که تصمیم با تیم بالینی است. متغیرهای ناشناس و هدف:[list]

چهار قالب قابل کپی

1) بازرسی نشتی:

لیست ویژگی های زیر را به عنوان "در زمان پیش بینی موجود" / "اطلاعات آینده (نشت)" طبقه بندی کنید و آن را توجیه کنید. هدف و لحظه پیش بینی: [تعریف]. ویژگی ها: [لیست]

2) گزارش کیفیت داده ها:

نرخ مقدار گمشده، مقادیر از دست رفته، ناسازگاری واحد و رکورد تکراری برای این جدول ناشناس را بررسی کنید. یک جدول خلاصه کیفیت ظاهر می شود. جدول: [داده]

3) طرح تأیید استنتاج NLP:

یک طرح اعتبارسنجی برای مرحله NLP بنویسید که [متغیر] را از حاشیه‌نویسی‌های متن آزاد استخراج می‌کند: اندازه نمونه تصادفی، برچسب‌گذاری استاندارد طلایی، متریک مناسب، تجزیه و تحلیل خطا.

4) چارچوب ارزیابی:

یک چارچوب ارزیابی پیش نویس برای این مدل بالینی بنویسید: تبعیض (AUC)، منحنی کالیبراسیون، عملکرد زیر گروه، تجزیه و تحلیل منحنی تصمیم. مدل: [توضیحات]

نقش مدل: بر اساس نوع وظیفه

نوع وظیفه

سهم هوش مصنوعی

انتقادی بودن

تایید

تمیز کردن داده ها / اطلاعات پرت

بالا

پایین

چک نقطه ای

استخراج NLP از یادداشت ها

بالا

متوسط

اعتبار سنجی نمونه

امتیازدهی ریسک/پیش بینی

متوسط

بالا

کالیبراسیون + زیر گروه

برنامه ریزی منابع/ظرفیت

متوسط

متوسط

تایید واحد تجاری

تصمیم درمانی

محدود است

بسیار بالا

تاییدیه کامل پزشک

نکته: اگر AUC یک مدل بالینی به طور غیرمنتظره ای بالا است (مثلاً بالای 0.95)، قبل از جشن گرفتن به دنبال نشت موقت باشید. در دنیای واقعی، چنین مقادیر بالایی معمولاً نشانه نشت اطلاعات است.
احتیاط: این مدل ممکن است نابرابری ها را در داده های تاریخی بیاموزد و تقویت کند. دقت کلی بالا ممکن است حاکی از آسیب سیستماتیک در گروه های خاص بیمار باشد. عملکرد باید همیشه در زیر گروه ها گزارش شود.

اشتباهات رایج

  • عدم توجه به نشتی زمانی آگاهی از آینده باعث موفقیت کاذب در آزمایشگاه می شود.
  • از دقت راضی باشید. دقت با داده های نامتعادل گمراه کننده است. حساسیت و کالیبراسیون مورد نیاز است.
  • عدم گزارش زیرگروه ها معیار کلی تعصب و نابرابری را پنهان می کند.
  • رد شدن از کالیبراسیون حتی یک مدل رتبه بندی خوب نیز می تواند در تصمیم گیری های آستانه اشتباه کند.
  • واگذاری تصمیم به مدل خروجی پشتیبانی است. تصمیم درمان بر عهده تیم بالینی است.

به طور خلاصه

  • داده های EHR قدرتمند اما تکه تکه، ناقص و مغرضانه هستند. پاکسازی و کدگذاری مراحل حیاتی هستند.
  • نشت موقت موذیانه ترین خطا است. دانش آینده باعث موفقیت کاذب در آزمایشگاه می شود.
  • عدم تعادل طبقاتی و تعصب، متریک دقت را گمراه کننده می کند.
  • ارزیابی باید شامل تمایز، کالیبراسیون، زیر گروه بندی و سودمندی بالینی باشد.
  • خروجی های پیش بینی پشتیبانی هستند. تصمیمات تشخیص و درمان متعلق به تیم بالینی است.

وظیفه کاربردی

یک هدف پیش‌بینی و فهرستی از ده متغیر بسازید (عمداً شامل یک متغیر «چشم‌انداز»، به‌عنوان مثال تشخیص تخلیه). از اعلان قدرتمند برای بررسی مدل برای نشتی استفاده کنید و ببینید آیا این متغیر را می‌گیرد یا خیر. سپس یک چارچوب ارزیابی برای این مدل در سه مورد شامل تمایز، کالیبراسیون و زیر گروه بندی بنویسید.

چک لیست

  • [ ] من مراحل استخراج، تمیز کردن، کدگذاری و مدل‌سازی کار با داده‌های EHR را می‌دانم.
  • [ ] من می توانم نشت موقت را تشخیص دهم و لیست اموال را بررسی کنم.
  • [ ] متوجه شدم که چگونه عدم تعادل طبقاتی و تعصب دقت را گمراه می کند.
  • [ ] من تفاوت بین تبعیض و کالیبراسیون و ضرورت هر دو را می دانم.
  • [ ] من می توانم خروجی پیش بینی را به عنوان پشتیبانی، نه تصمیم قرار دهم.