กำไร:
- ความสามารถในการอธิบายขั้นตอนในการทำความสะอาด การเขียนโค้ด และการวิเคราะห์ข้อมูลบันทึกสุขภาพอิเล็กทรอนิกส์ (EHR) ด้วยปัญญาประดิษฐ์
- ความสามารถในการรับรู้ความเสี่ยงของข้อมูลทางคลินิก เช่น ข้อมูลที่ขาดหาย อคติ ความไม่สมดุลของคลาส และการรั่วไหลชั่วคราว
- ความสามารถในการตรวจสอบผลลัพธ์ของแบบจำลองการคาดการณ์ผ่านการสอบเทียบ ประสิทธิภาพของกลุ่มย่อย และประโยชน์ทางคลินิก
ความทรงจำของโรงพยาบาลสมัยใหม่คือบันทึกสุขภาพอิเล็กทรอนิกส์ (EHR): คอลเลกชันดิจิทัลของการวินิจฉัย ผลการตรวจทางห้องปฏิบัติการ การใช้ยา หัตถการ บันทึกพยาบาล และการสังเกตของแพทย์ ข้อมูลนี้เป็นทั้งขุมทรัพย์และขุมทรัพย์สำหรับปัญญาประดิษฐ์ สมบัติเพราะมันมีรูปแบบประจำปีที่ป่วยนับล้าน ทุ่นระเบิดเพราะข้อมูลทางคลินิกไม่เป็นระเบียบ ไม่สมบูรณ์ มีอคติ และเต็มไปด้วยกับดักชั่วคราว หน่วยนี้ประกอบด้วยการทำความสะอาด การเขียนโค้ด และการวิเคราะห์ข้อมูล EHR ด้วยปัญญาประดิษฐ์ ข้อผิดพลาดที่ร้ายกาจที่สุด (การรั่วไหลชั่วคราว, อคติ, ความไม่สมดุลของชั้นเรียน); และเราจะดูว่าผลลัพธ์ของแบบจำลองการคาดการณ์ได้รับการตรวจสอบอย่างไร
เรามาเตือนกันตั้งแต่ต้น: แบบจำลองความเสี่ยงอาจบอกว่า "ผู้ป่วยรายนี้มีโอกาสสูงที่จะกลับเข้ารับการรักษาซ้ำ"; แต่นี่เป็นผลลัพธ์ที่สนับสนุนการตัดสินใจ ไม่ใช่การตัดสินใจในการวินิจฉัยหรือการรักษา AI ไม่ได้วินิจฉัย การตัดสินใจขึ้นอยู่กับแพทย์และทีมคลินิก
ขั้นตอนในการทำงานกับข้อมูล EHR
ขั้นตอนที่ 1 — ลบและผสาน ข้อมูลมาจากระบบต่างๆ (ห้องปฏิบัติการ ร้านขายยา รังสีวิทยา) รวมกับรหัสผู้ป่วย ในขั้นตอนนี้ การรักษาความลับเป็นสิ่งสำคัญที่สุด (ดูบทที่ 10)
ขั้นตอนที่ 2 — การทำความสะอาด ค่าที่หายไป ความไม่สอดคล้องกันของหน่วย (ความสับสนของ mg/dL และ mmol/L) บันทึกที่ซ้ำกัน และค่าที่ไม่น่าเป็นไปได้ (อายุ 200 ความดันโลหิต 0) จะถูกกำจัดออกไป AI มีความแข็งแกร่งในด้านการตั้งค่าสถานะค่าผิดปกติและการจัดโครงสร้างข้อความอิสระ
ขั้นตอนที่ 3 — การเข้ารหัสและการสร้างมาตรฐาน การวินิจฉัยจะถูกจับคู่กับรหัสมาตรฐาน เช่น ICD (International Classification of Diseases) และยาจะถูกจับคู่กับพจนานุกรมมาตรฐาน การแยกข้อมูลที่มีโครงสร้างออกจากบันทึกข้อความอิสระเรียกว่าการประมวลผลภาษาธรรมชาติ (NLP) AI มีคุณค่าที่นี่ แต่ผลลัพธ์ของมันต้องมีการตรวจสอบความถูกต้อง
ขั้นตอนที่ 4 — วิศวกรรมคุณลักษณะ ข้อมูลแบบจำลองถูกสร้างขึ้นจากข้อมูลดิบ: มูลค่าห้องปฏิบัติการล่าสุด แนวโน้ม จำนวนยา คะแนนโรคร่วม ฯลฯ
ขั้นตอนที่ 5 — การสร้างแบบจำลองและการประเมินผล แบบจำลองการคาดการณ์ถูกสร้างขึ้นและซึ่งเป็นส่วนที่สำคัญที่สุด ได้รับการประเมินอย่างระมัดระวังและไม่มีการรั่วไหล
ข้อผิดพลาดที่ร้ายกาจที่สุดสามประการ
การรั่วไหลชั่วคราว การใส่ข้อมูลลงในฟีเจอร์ที่ยังไม่มีในขณะคาดการณ์ ตัวอย่างเช่น การใช้การวินิจฉัยการจำหน่ายหรือการทดสอบในห้องปฏิบัติการวันสุดท้ายเพื่อประเมินความเสี่ยงของการเสียชีวิตเมื่อเข้ารับการรักษา แบบจำลองนี้ดูสมบูรณ์แบบในห้องปฏิบัติการ แต่ล้มเหลวในการใช้งานจริงเพราะได้เห็น "อนาคต"
อคติ. ข้อมูลนี้สะท้อนถึงการตัดสินใจทางคลินิกในอดีต หากการตัดสินใจเหล่านี้ไม่เท่าเทียมกันอยู่แล้ว โมเดลจะเรียนรู้และเน้นย้ำสิ่งนี้ ตัวอย่างเช่น หากในอดีตกลุ่มบางกลุ่มได้รับคำสั่งให้ทดสอบน้อยลง แบบจำลองอาจคิดว่าโรคในกลุ่มนั้น "ต่ำกว่า"
ความไม่สมดุลของชั้นเรียน หากเหตุการณ์ที่สนใจ (เช่น ภาวะแทรกซ้อนที่เกิดขึ้นได้ยาก) คือ 1% ของข้อมูล โมเดลที่แจ้งเสมอว่า "ไม่มีเหตุการณ์" จะดูแม่นยำ 99% แต่จะไม่มีประโยชน์ แทนที่จะต้องใช้ความแม่นยำ ความละเอียดอ่อน ความแม่นยำ และการวัดตามเหตุการณ์
การประเมิน: การเลือกปฏิบัติไม่เพียงพอ การสอบเทียบเป็นสิ่งจำเป็น
มีคำถามสองข้อที่แตกต่างกัน การเลือกปฏิบัติ (การวัดทั่วไปของ AUC): แบบจำลองจัดอันดับผู้ป่วยตามความเสี่ยงอย่างถูกต้องหรือไม่ การสอบเทียบ: ความน่าจะเป็นที่กำหนดโดยโมเดลตรงกับความถี่จริงหรือไม่ ผู้ป่วยประมาณ 20% ที่บอกว่า "มีความเสี่ยง 20%" มีเหตุการณ์เกิดขึ้นจริงหรือไม่? เนื่องจากการตัดสินใจจะขึ้นอยู่กับเกณฑ์ในคลินิก แบบจำลองที่มีการจัดอันดับดีแต่มีการสอบเทียบไม่ดีจะนำไปสู่การตัดสินใจเกี่ยวกับเกณฑ์ที่ไม่ถูกต้อง นอกจากนี้ ควรรายงานการปฏิบัติงานของกลุ่มย่อย (อายุ เพศ ชาติพันธุ์ โรงพยาบาล) แยกกัน และควรถามคำถามเกี่ยวกับประโยชน์ทางคลินิก (การใช้แบบจำลองนี้ให้ผลลัพธ์ที่ดีกว่าจริงหรือ)
คดีเล็กๆ สามคดี: ตามตัวเลข
กรณีที่ 1 — ความสำเร็จสูงเกินจริงจากการรั่วไหล แบบจำลองการยอมให้เข้ามาใหม่ให้ค่า AUC เท่ากับ 0.92 ในการทดสอบภายใน มันดูดี การทบทวนพบว่าคุณลักษณะต่างๆ ได้แก่ "การนัดหมายผู้ป่วยนอกหลังออกจากโรงพยาบาล"; ไม่มีข้อมูลนี้ในขณะที่คาดการณ์ เมื่อกำจัดรอยรั่วแล้ว AUC จะลดลงเหลือ 0.71 ซึ่งเป็นค่าที่สมจริงและใช้งานได้
กรณีที่ 2 — การดริฟท์ของการปรับเทียบ ในขณะที่คะแนนการเตือนล่วงหน้าเกี่ยวกับภาวะติดเชื้อในกระแสเลือดได้รับการปรับเทียบอย่างดีที่โรงพยาบาลที่ได้รับการพัฒนา ข้อมูลผู้ป่วยแสดงอัตราการเกิดเหตุการณ์จริงเป็นสองเท่าสำหรับคะแนนเดียวกันในโรงพยาบาลอื่น คะแนนอยู่ในอันดับที่ถูกต้องแต่ความน่าจะเป็นนั้นผิด ไม่สามารถใช้เกณฑ์นี้ได้หากไม่มีการสอบเทียบใหม่
กรณีที่ 3 — ประหยัดเวลาด้วย NLP ทีมวิจัยทีมหนึ่งดึงประวัติการสูบบุหรี่ออกจากบันทึกผู้ป่วย 12,000 รายการด้วยตนเอง ความยาวประมาณ 2 นาทีต่อฉบับ รวม 400 ชั่วโมง การสกัดโดยใช้ NLP ช่วยลดเวลาเหลือเพียงไม่กี่ชั่วโมง ทีมงานตรวจสอบตัวอย่างการตรวจสอบแบบสุ่มที่เลือกด้วยมือเท่านั้นว่าแบบจำลองนั้น "ไม่ชัดเจน" สิ่งสำคัญคือการตรวจสอบตัวอย่างการตรวจสอบอย่างพิถีพิถัน
พรอมต์ที่อ่อนแอ / พรอมต์ที่แข็งแกร่ง
พรอมต์ที่อ่อนแอ:
สร้างแบบจำลองความเสี่ยงจากข้อมูลผู้ป่วยนี้และรายงานผล [ข้อมูล]
พรอมต์อันทรงพลัง:
บทบาทของคุณ: คุณเป็นผู้ช่วยวิเคราะห์ข้อมูลทางคลินิก (คุณไม่ต้องตัดสินใจ) วิจารณ์แบบจำลองการทำนาย PLAN สำหรับรายการตัวแปรที่ไม่ระบุชื่อต่อไปนี้:- ทำเครื่องหมายว่าแต่ละตัวแปรมีอยู่ในขณะที่คาดการณ์หรือไม่ (ความเสี่ยงของการรั่วไหลชั่วคราว)- รายการความไม่สมดุลของคลาสและแหล่งที่มาของอคติที่อาจเกิดขึ้น- เสนอแนะการเลือกปฏิบัติ + การสอบเทียบ + กลุ่มย่อย + ประโยชน์ทางคลินิกสำหรับการประเมิน - ระบุว่าการตัดสินใจขึ้นอยู่กับทีมทางคลินิก ตัวแปรและเป้าหมายที่ไม่ระบุชื่อ:[รายการ]
เทมเพลตที่คัดลอกได้สี่แบบ
1) การตรวจสอบรอยรั่ว:
จำแนกรายการคุณลักษณะต่อไปนี้เป็น "พร้อมใช้งาน ณ เวลาที่คาดการณ์" / "ข้อมูลในอนาคต (รั่วไหล)" และให้เหตุผล ประตูและช่วงเวลาของการทำนาย: [คำจำกัดความ] คุณสมบัติ: [รายการ]
2) รายงานคุณภาพข้อมูล:
ตรวจสอบอัตราค่าที่หายไป ค่าที่หายไป ความไม่สอดคล้องกันของหน่วย และบันทึกที่ซ้ำกันสำหรับตารางที่ไม่ระบุชื่อนี้ ตารางสรุปคุณภาพจะปรากฏขึ้น ตาราง: [ข้อมูล]
3) รูปแบบการตรวจสอบการอนุมาน NLP:
เขียนแผนการตรวจสอบความถูกต้องสำหรับขั้นตอน NLP ที่แยก [ตัวแปร] ออกจากคำอธิบายประกอบแบบข้อความอิสระ ได้แก่ ขนาดตัวอย่างแบบสุ่ม การติดฉลากมาตรฐานทองคำ ตัวชี้วัดที่พอดี การวิเคราะห์ข้อผิดพลาด
4) กรอบการประเมินผล:
เขียนร่างกรอบการประเมินสำหรับแบบจำลองทางคลินิกนี้ ได้แก่ การเลือกปฏิบัติ (AUC) เส้นโค้งการสอบเทียบ ประสิทธิภาพกลุ่มย่อย การวิเคราะห์เส้นโค้งการตัดสินใจ รุ่น: [คำอธิบาย]
บทบาทของโมเดล: ตามประเภทงาน
ประเภทงาน
การมีส่วนร่วมของ AI
การวิพากษ์วิจารณ์
การตรวจสอบ
การล้างข้อมูล/ค่าผิดปกติ
สูง
ต่ำ
ตรวจสอบจุด
การสกัด NLP จากบันทึกย่อ
สูง
ปานกลาง
การตรวจสอบตัวอย่าง
การให้คะแนนความเสี่ยง/การคาดการณ์
ปานกลาง
สูง
การสอบเทียบ + กลุ่มย่อย
การวางแผนทรัพยากร/กำลังการผลิต
ปานกลาง
ปานกลาง
การอนุมัติหน่วยธุรกิจ
การตัดสินใจในการรักษา
จำกัด
สูงมาก
ได้รับการอนุมัติจากแพทย์เต็มรูปแบบ
เคล็ดลับ: หาก AUC ของแบบจำลองทางคลินิกสูงอย่างไม่คาดคิด (เช่น สูงกว่า 0.95) ให้มองหาการรั่วไหลชั่วคราวก่อนที่จะเฉลิมฉลอง ในโลกแห่งความเป็นจริง ค่าที่สูงเช่นนี้มักเป็นสัญญาณของการรั่วไหลของข้อมูล
ข้อควรระวัง: โมเดลอาจเรียนรู้และเสริมความไม่เท่าเทียมกันในข้อมูลประวัติ ความแม่นยำโดยรวมที่สูงอาจบ่งบอกถึงอันตรายอย่างเป็นระบบในผู้ป่วยบางกลุ่ม ควรรายงานผลการปฏิบัติงานในกลุ่มย่อยเสมอ
ข้อผิดพลาดทั่วไป
- ไม่สังเกตเห็นการรั่วไหลชั่วขณะ ความรู้เกี่ยวกับอนาคตก่อให้เกิดความสำเร็จที่ผิดพลาดในห้องปฏิบัติการ
- พึงพอใจกับความถูกต้อง ความแม่นยำทำให้เข้าใจผิดด้วยข้อมูลที่ไม่สมดุล ต้องมีความไวและการสอบเทียบ
- ไม่รายงานกลุ่มย่อย ตัวชี้วัดโดยรวมซ่อนอคติและความไม่เท่าเทียมกัน
- กำลังข้ามการสอบเทียบ แม้แต่โมเดลการจัดอันดับที่ดีก็อาจทำผิดพลาดในการตัดสินใจตามเกณฑ์ได้
- ทิ้งการตัดสินใจไว้กับตัวแบบ เอาต์พุตรองรับ การตัดสินใจในการรักษาขึ้นอยู่กับทีมงานทางคลินิก
โดยสรุป
- ข้อมูล EHR มีประสิทธิภาพแต่เป็นแพตช์ ไม่สมบูรณ์ และลำเอียง การทำความสะอาดและการเขียนโค้ดถือเป็นขั้นตอนสำคัญ
- การรั่วไหลชั่วคราวเป็นข้อผิดพลาดที่ร้ายกาจที่สุด ความรู้ในอนาคตก่อให้เกิดความสำเร็จที่ผิดพลาดในห้องปฏิบัติการ
- ความไม่สมดุลและอคติของชั้นเรียนทำให้การวัดความแม่นยำทำให้เข้าใจผิด
- การประเมินควรรวมถึงการเลือกปฏิบัติ การสอบเทียบ การจัดกลุ่มย่อย และประโยชน์ทางคลินิก
- รองรับผลลัพธ์การคาดการณ์ การตัดสินใจในการวินิจฉัยและการรักษาเป็นของทีมแพทย์
งานสมัคร
สร้างเป้าหมายการทำนายและรายการตัวแปร 10 รายการ (จงใจรวมตัวแปร “ผู้มีโอกาสเป็นลูกค้า” เช่น การวินิจฉัยการจำหน่าย) ใช้ข้อความแจ้งที่มีประสิทธิภาพเพื่อตรวจสอบการรั่วไหลของโมเดล และดูว่าโมเดลจับตัวแปรนี้หรือไม่ จากนั้นเขียนกรอบการประเมินสำหรับแบบจำลองนี้ออกเป็น 3 รายการ ได้แก่ การเลือกปฏิบัติ การสอบเทียบ และการจัดกลุ่มย่อย
รายการตรวจสอบ
- [ ] ฉันเข้าใจขั้นตอนการแยก การล้าง การเขียนโค้ด และการสร้างแบบจำลองของการทำงานกับข้อมูล EHR
- [ ] ฉันสามารถรับรู้ถึงการรั่วไหลชั่วคราวและตรวจสอบรายการทรัพย์สินได้
- [ ] ฉันตระหนักได้ว่าความไม่สมดุลและอคติในชั้นเรียนทำให้ความแม่นยำเข้าใจผิดได้อย่างไร
- [ ] ฉันรู้ถึงความแตกต่างระหว่างการเลือกปฏิบัติและการสอบเทียบ และความจำเป็นของทั้งสองอย่าง
- [ ] ฉันสามารถวางตำแหน่งผลลัพธ์เชิงทำนายเป็นแนวสนับสนุน ไม่ใช่การตัดสินใจ