سود:
- امکان توضیح مراحل پاکسازی، کدگذاری و تجزیه و تحلیل داده های پرونده الکترونیک سلامت (EHR) با هوش مصنوعی.
- توانایی تشخیص خطرات داده های بالینی مانند داده های از دست رفته، سوگیری، عدم تعادل کلاس و نشت زمانی
- توانایی اعتبارسنجی خروجی های مدل پیش بینی از طریق کالیبراسیون، عملکرد زیرگروه و سودمندی بالینی
حافظه بیمارستانهای مدرن، پرونده الکترونیک سلامت (EHR) است: مجموعهای دیجیتالی از تشخیصها، نتایج آزمایشگاهی، داروها، روشها، یادداشتهای پرستار و مشاهدات پزشک. این داده ها هم گنج و هم میدان مین برای هوش مصنوعی هستند. گنج، زیرا حاوی میلیون ها الگوی بیمار سالانه است. میدان مین زیرا داده های بالینی بهم ریخته، ناقص، مغرضانه و پر از تله های زمانی هستند. این واحد شامل تمیز کردن، کدگذاری و تجزیه و تحلیل داده های EHR با هوش مصنوعی است. موذیانه ترین خطاها (نشت زمانی، تعصب، عدم تعادل کلاس)؛ و خواهیم دید که چگونه خروجی های مدل پیش بینی اعتبار می شوند.
بیایید از ابتدا یادآوری کنیم: یک مدل خطر ممکن است بگوید "این بیمار احتمال بستری مجدد دارد"؛ اما این یک خروجی پشتیبانی تصمیم است، نه یک تصمیم تشخیص یا درمان. هوش مصنوعی تشخیص نمی دهد. تصمیم گیری به عهده پزشک و تیم بالینی است.
مراحل کار با داده های EHR
مرحله 1 - تفریق و ادغام داده ها از سیستم های مختلف (آزمایشگاه، داروخانه، رادیولوژی) می آیند. با شناسه بیمار ترکیب می شود. در این مرحله، محرمانگی بالاترین اولویت است (به بخش 10 مراجعه کنید).
مرحله 2 - تمیز کردن مقادیر از دست رفته، تناقضات واحد (آشفتگی mg/dL و mmol/L)، سوابق تکراری و مقادیر بعید (سن 200، فشار خون 0) حذف می شوند. هوش مصنوعی در اینجا در پرچمگذاری پرت و ساختار متن آزاد قوی است.
مرحله 3 - کدگذاری و استانداردسازی تشخیصها با کدهای استاندارد مانند ICD (طبقهبندی بینالمللی بیماریها) و داروها به فرهنگهای استاندارد نگاشت میشوند. استخراج اطلاعات ساختاریافته از یادداشت های متن آزاد، پردازش زبان طبیعی (NLP) نامیده می شود. هوش مصنوعی در اینجا ارزشمند است، اما خروجی آن نیاز به اعتبارسنجی دارد.
مرحله 4 - مهندسی ویژگی. ورودیهای مدل از دادههای خام تولید میشوند: آخرین ارزش آزمایشگاهی، روند، تعداد داروها، امتیاز همبودی و غیره.
مرحله 5 - مدل سازی و ارزیابی مدل پیشبینی ساخته شده و - حیاتیترین بخش - به روشی دقیق و بدون نشت ارزیابی میشود.
سه اشتباه موذیانه
نشت موقت. قرار دادن اطلاعات در ویژگی که هنوز در زمان پیش بینی وجود ندارد. به عنوان مثال، استفاده از تشخیص ترخیص یا آزمایشات آزمایشگاهی روز آخر برای تخمین خطر مرگ در هنگام پذیرش. این مدل در آزمایشگاه کامل به نظر می رسد، اما در استفاده واقعی خراب می شود زیرا "آینده" را دیده است.
تعصب داده ها منعکس کننده تصمیمات بالینی گذشته است. اگر این تصمیمات قبلاً نابرابر باشند، مدل این را می آموزد و تقویت می کند. برای مثال، اگر گروه خاصی از لحاظ تاریخی کمتر برای آزمایش سفارش داده شده باشد، مدل ممکن است فکر کند که بیماری در آن گروه «پایینتر» است.
عدم تعادل طبقاتی اگر رویداد مورد علاقه (به عنوان مثال یک عارضه نادر) 1٪ از داده ها باشد، مدلی که همیشه می گوید "بدون رویداد" 99٪ دقیق به نظر می رسد اما بی فایده است. به جای دقت، حساسیت، دقت و معیارهای مبتنی بر رویداد مورد نیاز است.
ارزیابی: تبعیض کافی نیست، کالیبراسیون یک الزام است
دو سوال متفاوت وجود دارد. تبعیض (اندازه گیری معمولی AUC): آیا این مدل به درستی بیماران را بر اساس خطر رتبه بندی می کند؟ کالیبراسیون: آیا احتمالات داده شده توسط مدل با فرکانس های واقعی مطابقت دارند؟ آیا تقریباً 20٪ از بیمارانی که می گویند "20٪ خطر" واقعاً یک رویداد دارند؟ از آنجایی که تصمیمات بر اساس آستانه در کلینیک گرفته می شود، یک مدل با رتبه بندی خوب اما کالیبره شده ضعیف منجر به تصمیم گیری های آستانه نادرست می شود. علاوه بر این، عملکرد زیرگروه ها (سن، جنسیت، قومیت، بیمارستان) باید به طور جداگانه گزارش شود و سوال مفید بودن بالینی (آیا استفاده از این مدل واقعا نتایج بهتری ایجاد می کند؟) باید پرسیده شود.
سه مورد کوچک: با اعداد
مورد 1 - موفقیت با نشت متورم شد. یک مدل پذیرش مجدد AUC 0.92 را در آزمایش داخلی به همراه داشت. عالی به نظر می رسید این بررسی نشان داد که ویژگیها شامل «نوبت سرپایی پس از ترخیص» است. این اطلاعات در زمان پیش بینی در دسترس نبود. هنگامی که نشت پاک شد، AUC به 0.71 کاهش یافت - یک مقدار واقعی و قابل استفاده.
مورد 2 - رانش کالیبراسیون. در حالی که نمره هشدار اولیه سپسیس در بیمارستانی که در آن ایجاد شده بود به خوبی کالیبره شده بود، پروفایل بیمار دو برابر نرخ واقعی رویداد را برای همان امتیاز در بیمارستانی دیگر نشان داد. امتیاز به درستی رتبه بندی شد اما احتمالات اشتباه بود. آستانه بدون کالیبراسیون مجدد قابل استفاده نیست.
مورد 3 - صرفه جویی در زمان با NLP. یک تیم تحقیقاتی به صورت دستی سابقه سیگار کشیدن را از 12000 یادداشت بیمار استخراج می کرد. تقریباً 2 دقیقه برای هر نت، در مجموع 400 ساعت. استخراج به کمک NLP این را به چند ساعت کاهش داد. این تیم فقط یک نمونه اعتبار سنجی انتخاب شده به صورت تصادفی را که مدل «نامشخص» باقی گذاشته بود، به صورت دستی بررسی کردند. مهم، بررسی دقیق نمونه اعتبارسنجی بود.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
یک مدل خطر از دادههای این بیمار بسازید و نتایج را گزارش کنید.[data]
اعلان قدرتمند:
نقش شما: شما یک دستیار تجزیه و تحلیل داده های بالینی هستید (شما تصمیم نمی گیرید). یک PLAN مدل پیشبینی را برای فهرست زیر از متغیرهای ناشناس نقد کنید: - علامتگذاری کنید که آیا هر متغیر در زمان پیشبینی وجود دارد یا خیر (خطر نشت زمانی).- نامتعادل کلاس و منابع بالقوه سوگیری را فهرست کنید. - پیشنهاد تبعیض + کالیبراسیون + زیرگروه + سودمندی بالینی برای ارزیابی. - بیان کنید که تصمیم با تیم بالینی است. متغیرهای ناشناس و هدف:[list]
چهار قالب قابل کپی
1) بازرسی نشتی:
لیست ویژگی های زیر را به عنوان "در زمان پیش بینی موجود" / "اطلاعات آینده (نشت)" طبقه بندی کنید و آن را توجیه کنید. هدف و لحظه پیش بینی: [تعریف]. ویژگی ها: [لیست]
2) گزارش کیفیت داده ها:
نرخ مقدار گمشده، مقادیر از دست رفته، ناسازگاری واحد و رکورد تکراری برای این جدول ناشناس را بررسی کنید. یک جدول خلاصه کیفیت ظاهر می شود. جدول: [داده]
3) طرح تأیید استنتاج NLP:
یک طرح اعتبارسنجی برای مرحله NLP بنویسید که [متغیر] را از حاشیهنویسیهای متن آزاد استخراج میکند: اندازه نمونه تصادفی، برچسبگذاری استاندارد طلایی، متریک مناسب، تجزیه و تحلیل خطا.
4) چارچوب ارزیابی:
یک چارچوب ارزیابی پیش نویس برای این مدل بالینی بنویسید: تبعیض (AUC)، منحنی کالیبراسیون، عملکرد زیر گروه، تجزیه و تحلیل منحنی تصمیم. مدل: [توضیحات]
نقش مدل: بر اساس نوع وظیفه
نوع وظیفه
سهم هوش مصنوعی
انتقادی بودن
تایید
تمیز کردن داده ها / اطلاعات پرت
بالا
پایین
چک نقطه ای
استخراج NLP از یادداشت ها
بالا
متوسط
اعتبار سنجی نمونه
امتیازدهی ریسک/پیش بینی
متوسط
بالا
کالیبراسیون + زیر گروه
برنامه ریزی منابع/ظرفیت
متوسط
متوسط
تایید واحد تجاری
تصمیم درمانی
محدود است
بسیار بالا
تاییدیه کامل پزشک
نکته: اگر AUC یک مدل بالینی به طور غیرمنتظره ای بالا است (مثلاً بالای 0.95)، قبل از جشن گرفتن به دنبال نشت موقت باشید. در دنیای واقعی، چنین مقادیر بالایی معمولاً نشانه نشت اطلاعات است.
احتیاط: این مدل ممکن است نابرابری ها را در داده های تاریخی بیاموزد و تقویت کند. دقت کلی بالا ممکن است حاکی از آسیب سیستماتیک در گروه های خاص بیمار باشد. عملکرد باید همیشه در زیر گروه ها گزارش شود.
اشتباهات رایج
- عدم توجه به نشتی زمانی آگاهی از آینده باعث موفقیت کاذب در آزمایشگاه می شود.
- از دقت راضی باشید. دقت با داده های نامتعادل گمراه کننده است. حساسیت و کالیبراسیون مورد نیاز است.
- عدم گزارش زیرگروه ها معیار کلی تعصب و نابرابری را پنهان می کند.
- رد شدن از کالیبراسیون حتی یک مدل رتبه بندی خوب نیز می تواند در تصمیم گیری های آستانه اشتباه کند.
- واگذاری تصمیم به مدل خروجی پشتیبانی است. تصمیم درمان بر عهده تیم بالینی است.
به طور خلاصه
- داده های EHR قدرتمند اما تکه تکه، ناقص و مغرضانه هستند. پاکسازی و کدگذاری مراحل حیاتی هستند.
- نشت موقت موذیانه ترین خطا است. دانش آینده باعث موفقیت کاذب در آزمایشگاه می شود.
- عدم تعادل طبقاتی و تعصب، متریک دقت را گمراه کننده می کند.
- ارزیابی باید شامل تمایز، کالیبراسیون، زیر گروه بندی و سودمندی بالینی باشد.
- خروجی های پیش بینی پشتیبانی هستند. تصمیمات تشخیص و درمان متعلق به تیم بالینی است.
وظیفه کاربردی
یک هدف پیشبینی و فهرستی از ده متغیر بسازید (عمداً شامل یک متغیر «چشمانداز»، بهعنوان مثال تشخیص تخلیه). از اعلان قدرتمند برای بررسی مدل برای نشتی استفاده کنید و ببینید آیا این متغیر را میگیرد یا خیر. سپس یک چارچوب ارزیابی برای این مدل در سه مورد شامل تمایز، کالیبراسیون و زیر گروه بندی بنویسید.
چک لیست
- [ ] من مراحل استخراج، تمیز کردن، کدگذاری و مدلسازی کار با دادههای EHR را میدانم.
- [ ] من می توانم نشت موقت را تشخیص دهم و لیست اموال را بررسی کنم.
- [ ] متوجه شدم که چگونه عدم تعادل طبقاتی و تعصب دقت را گمراه می کند.
- [ ] من تفاوت بین تبعیض و کالیبراسیون و ضرورت هر دو را می دانم.
- [ ] من می توانم خروجی پیش بینی را به عنوان پشتیبانی، نه تصمیم قرار دهم.