المكاسب:
- القدرة على التعرف على أنواع الهلوسة (مصدر ملفق، جرعة خاطئة، دراسة خيالية) في مخرجات الذكاء الاصطناعي الطبية
- القدرة على ربط كل مطالبة سريرية بالإرشادات الحالية والمصدر الأساسي من خلال التحقق متعدد الطبقات
- القدرة على إدارة عدم اليقين في النموذج، وأن بيان الثقة ليس دليلاً على الصحة، وخطر الخطأ الذي يبدو مؤكدًا
إن الخطر الأكبر الذي يشكله الذكاء الاصطناعي في الطب ليس أنه يرتكب الأخطاء، بل أنه يرتكب الأخطاء بثقة كبيرة. تنتج نماذج اللغة نصًا بطلاقة ومقنعًا؛ الجملة تبدو بنفس النغمة الواثقة سواء كانت صحيحة أو خاطئة. وهذا ما يسمى "الهلوسة": عندما ينتج النموذج معلومات غير موجودة في الواقع (مصدر ملفق، جرعة خاطئة، دراسة خيالية، مادة إرشادية غير موجودة) كما لو كانت حقيقية. وفي مناطق أخرى، تعتبر الهلوسة اضطرابًا؛ إنها مسألة السلامة في الطب. ستتعلم في هذه الوحدة كيفية التعرف على أنواع الهلوسة، والتحقق متعدد الطبقات، وإدارة عدم اليقين في النموذج. المبدأ الأساسي: بيان الثقة ليس دليلاً على الحقيقة؛ لا يمكن استخدام كل مطالبة سريرية دون ربطها بالمصدر الأساسي والتوجيهات الحالية.
ما الذي يسبب الهلوسة؟
الذكاء الاصطناعي هو نظام يتنبأ بـ "الكلمة التالية الأكثر احتمالاً"؛ لا يقرأ من قاعدة بيانات الواقع. وحتى لو لم يعرف إجابة سؤال ما، فإنه ينتج إجابة معقولة "مشابهة" للنصوص التي تدرب عليها. ولهذا السبب يمكنه تقديم مقالة غير موجودة مع اقتباس مكتمل، وجرعة غير صحيحة برقم واضح، وتوصية قديمة بلغة دقيقة. يميل النموذج إلى ملء الفراغ بدلاً من قول "لا أعرف". بالإضافة إلى ذلك، يتم تجميد بيانات التدريب في تاريخ ما؛ قد لا يكون هو/هي على علم بالمبادئ التوجيهية التي تغيرت منذ ذلك الحين.
تلميح: اسأل الذكاء الاصطناعي "هل أنت متأكد؟" السؤال ليس اختبارًا موثوقًا به؛ يمكن للنموذج أن يقول بسهولة "نعم، أنا متأكد" أو، على العكس من ذلك، يبتعد عن الإجابة الصحيحة. الاختبار الحقيقي هو البحث عن المطالبة في المصدر الأساسي المستقل.
أنواع الهلوسة الطبية
النوع
مثال
خطر
مصدر مكون
مقالة/DOI غير موجودة
سلسلة أدلة كاذبة
جرعة/وحدة غير صحيحة
ملغ أو وحدة غير صحيحة
الأذى المباشر للمريض
عمل/نتيجة خيالية
"أدلة" غير معشاة ذات شواهد مضبوطة
قرار سريري خاطئ
توصية عفا عليها الزمن
مقالة إرشادية قديمة
علاج عفا عليه الزمن
إسناد خاطئ
مقال حقيقي واستنتاج خاطئ
معلومات مشوهة
الإفراط في التعميم
تخطي الاستثناء
سوء التطبيق
مصادقة متعددة الطبقات
الدفاع الوحيد ضد الهلوسة هو التحقق المنهجي. خمس طبقات:
- النزول إلى المصدر. افتح وتأكد من كل جرعة ومعيار وتوصية من الإرشادات الحالية أو نشرة الحزمة أو المقالة الأساسية.
- فحص متقاطع. هل يقول مصدران مستقلان موثوقان نفس الشيء؟
- موضوعية. ما التاريخ الذي تنتمي إليه المعلومات؟ هل تغير منذ ذلك الحين؟
- الاتساق السريري. هل يتناسب الادعاء مع واقع المريض والمنطق السريري العام؟
- عين خبيرة. استشر الفرع المعني في أي شك أو نقطة حرجة.
ثلاث حالات صغيرة
الحالة 1 – جرعة خاطئة تبدو آمنة. طبيب يسأل الذكاء الاصطناعي عن جرعة دواء نادر الاستخدام. الذكاء الاصطناعي يعطي رقمًا واضحًا جدًا. ينظر الطبيب إلى النشرة؛ الجرعة الفعلية هي ثلث ما يقوله الذكاء الاصطناعي. لم تشير النغمة الدقيقة للذكاء الاصطناعي إلى الدقة؛ لقد حال التأكيد دون حدوث خطأ فادح.
الحالة الثانية – العمل الوهمي. يستشهد الذكاء الاصطناعي بـ "تجربة معشاة ذات شواهد متعددة المراكز تضم 1200 مريض تم نشرها في عام 2020" لدعم العلاج. الطبيب يبحث عن هذه الدراسة؛ لا يوجد مثل هذه الدراسة. وقد اختلقت منظمة العفو الدولية أرقامًا وتفاصيل لإضفاء المصداقية على ادعائها.
الحالة 3 - توصية قديمة. يوصي الذكاء الاصطناعي باستخدام دواء قديم لم يعد يوصى به أولاً في علاج المرض. ينظر الطبيب إلى الدليل الحالي؛ لقد تغير النهج، وجاء وكيل جديد أولا. تم تجميد معرفة الذكاء الاصطناعي في العصر السابق؛ التوجيه الحالي يصحح القرار.
خطوة بخطوة: التحقق من المطالبة
- تقليل المطالبة إلى جملة واحدة. مثل "يوصى باستخدام دواء X في جرعة Y."
- تحديد نوع المورد. جرعة أم معيار أم دليل؟
- فتح المصدر الأساسي. نشرة الإصدار، دليل، PubMed.
- التحقق من المصدرين.
- التحقق من التحديث.
- إذا لم يكن مناسبًا، ارفضه؛ إذا كنت في شك، استشارة خبير.
أربعة قوالب قابلة للنسخ
المهمة: قم بإدراج كل مطالبة يمكن التحقق منها (الجرعة، معايير التشخيص، المصدر، النتيجة الرقمية، التوصية التوجيهية) في مخرجات الذكاء الاصطناعي أدناه في أسطر منفصلة. أضف عمودًا "من المصدر الأساسي الذي يجب التأكيد عليه" لكل منها. التحقق الذاتي؛ قم بإخراج النقاط المراد فحصها فقط. الإخراج: [...]
المهمة: اذكر الشروط التي يجب استيفاؤها حتى يكون الادعاء التالي صحيحًا وتحت أي ظروف قد يكون كاذبًا. حتى أتمكن من رؤية المكان الذي أحتاج إلى التأكيد فيه. المطالبة: [...]
المهمة: في النص التالي، ضع علامة على العبارات الرقمية أو المطلقة التي تم إجراؤها دون ذكر المصدر (على سبيل المثال، "فعال بنسبة 80٪"، "500 ملغ في اليوم"). قم بتسمية كل منها بـ "بدون مصدر - التأكيد مطلوب". النص: [...]
المهمة: اطلب مني تقييم المخاطر الحالية لهذه التوصية السريرية: ما هو المبدأ التوجيهي الذي يمكن أن تستند إليه، ومتى تم تحديثها آخر مرة، وهل هناك أي احتمال لتغييرات في هذا المجال في السنوات الأخيرة؟ لا تشكل النص التوجيهي؛ توليد أسئلة التحكم.اقتراح: [...]
موجه ضعيف / موجه قوي
ضعيف: "هل هذا صحيح؟" (يقول الذكاء الاصطناعي "نعم" بسهولة.)
Strong: "أدرج كل جرعة ومصدر وتوصية توجيهية في نسخة الذكاء الاصطناعي أدناه على سطر منفصل واكتب من أي مصدر أساسي (إدراج الحزمة/الدليل الإرشادي/PubMed) الذي يجب أن أؤكد عليه لكل منها. ضع علامة على البيانات التي تبدو بدون مصدر أو نهائية على أنها "مطلوب التحقق". تحقق من نفسك؛ ما عليك سوى إنتاج قائمة مرجعية."
في الموجه القوي، يمكنك وضع الذكاء الاصطناعي في دور لا "يتحقق" بل "يجعل مخرجاته قابلة للتدقيق".
الأخطاء الشائعة
- الخلط بين النغمة الواثقة للتأكد من دقتها. بيان الثقة ليس دليلا.
- "هل أنت متأكد؟" اختبار مع. ينزلق النموذج بسهولة في كلا الاتجاهين.
- الاكتفاء بمصدر واحد. التحقق المتبادل أمر لا بد منه.
- تخطي التحديث. يتم تجميد معلومات النموذج في تاريخ ما.
- عدم استشارة خبير في لحظة حرجة. وينبغي طلب رأي ثان في القرارات المشكوك فيها.
التحيز الآلي: فخ المرء نفسه
الهلوسة هي خطأ النموذج. ولكن هناك أيضًا الخطأ البشري: التحيز الآلي. هذا هو ميل الإنسان إلى قبول الإجابة على أنها صحيحة دون التشكيك عندما تعطي الآلة إجابة. ولمجرد أن الآلة الحاسبة موثوقة، فقد اعتدنا عليها؛ نحن نضع نفس الثقة عن غير قصد في نموذج اللغة. ومع ذلك، فإن نموذج اللغة ليس دقيقًا مثل الآلة الحاسبة؛ هو احتمالي وغير معصوم من الخطأ.
يعد تحيز الأتمتة خطيرًا بشكل خاص عند التعب، وتحت ضغط الوقت، وفي المهام الروتينية. في نهاية نوبة الصرع، من السهل استبعاد مخرجات الذكاء الاصطناعي التي تبدو سلسة وسلسة باعتبارها "صحيحة على أي حال". ويتمثل الترياق في جعل التحقق عادة ونظاما: ربطه بخطوة مكتوبة لتسجيل الوصول، وليس باهتمام الفرد المباشر. إن عبارة "أنا متعب، ولكن هذا ما تقوله القائمة المرجعية" هي أفضل دفاع ضد تحيز الأتمتة.
تحذير: الخطر الأكبر ليس أن الذكاء الاصطناعي سوف يرتكب الأخطاء؛ هذا يعني أنك تقبل هذا الخطأ دون التشكيك فيه عندما تكون متعباً. ربط التحقق بنظام مكتوب، وليس بالاعتبار الشخصي.
في ملخص
الهلوسة هي أخطر مخاطر الذكاء الاصطناعي في الطب: فالنموذج ينتج الباطل والحقيقة بنفس النبرة الواثقة. المصدر الملفق، والجرعة غير الصحيحة، والدراسة الوهمية، والتوصيات القديمة هي الأنواع الأكثر شيوعًا. والدفاع الوحيد هو التحقق متعدد الطبقات: اختبار كل مطالبة مقابل المصدر الأساسي والتوجيهات الحالية، والتحقق من العملة واختبارها؛ استشارة خبير في النقاط الحرجة. لا تأخذ أبدًا بيان الثقة كدليل على الحقيقة.
مهمة التطبيق
اطرح على الذكاء الاصطناعي سؤالًا سريريًا يمثل تحديًا متعمدًا (جرعة نادرة أو علاج حالي). تحقق من كل جرعة ومصدر وتوصية يقدمها مع المصدر الأساسي. كم عدد الادعاءات التي تبين أنها صحيحة وكم منها كانت كاذبة أو ملفقة؟ قم بمطابقة الجدول مع نوع الهلوسة التي تقع فيها الأخطاء ولاحظ كيف يمكن أن تضللك النبرة الواثقة.
قائمة مرجعية
- [ ] لقد اختزلت كل مطالبة في جملة واحدة.
- [ ] لقد قمت بتأكيد الجرعة/المعايير/المصدر/التوصية من المصدر الأساسي.
- [ ] لقد قمت بالتحقق من الأمر مع مصدرين مستقلين.
- [ ] لقد تأكدت من أن المعلومات محدثة.
- [ ] لقد اختبرت المطالبة بالاتساق السريري.
- [ ] لقد استشرت خبيرًا بشأن النقطة المشكوك فيها/الحرجة.
- [ ] لم أعتبر النبرة الواثقة دليلاً على الدقة.