Unit 8 / 12

Halusinasi, Kebolehpercayaan, dan Pengesahan Berasaskan Bukti

Keuntungan:

  • Keupayaan untuk mengenali jenis halusinasi (sumber rekaan, dos yang salah, kajian khayalan) dalam keluaran AI perubatan
  • Keupayaan untuk memautkan setiap tuntutan klinikal kepada panduan semasa dan sumber utama dengan pengesahan berbilang lapisan
  • Keupayaan untuk mengurus ketidakpastian model, bahawa pernyataan keyakinan bukan bukti ketepatan, dan risiko ralat yang kelihatan pasti

Bahaya terbesar kecerdasan buatan (AI) dalam perubatan bukanlah kerana ia membuat kesilapan, tetapi ia membuat kesilapan dengan penuh keyakinan. Model bahasa menghasilkan teks yang fasih dan persuasif; Satu ayat membunyikan nada yakin yang sama sama ada benar atau salah. Ini dipanggil "halusinasi": apabila model menghasilkan maklumat yang sebenarnya tidak wujud (sumber rekaan, dos yang salah, kajian khayalan, bahan panduan yang tidak wujud) seolah-olah ia adalah benar. Di kawasan lain, halusinasi adalah gangguan; Ia adalah isu keselamatan dalam perubatan. Dalam unit ini anda akan belajar mengenali jenis halusinasi, pengesahan berbilang lapisan dan mengurus ketidakpastian model. Prinsip asas: Pernyataan keyakinan bukanlah bukti kebenaran; Tidak setiap tuntutan klinikal boleh digunakan tanpa memautkan kepada sumber utama dan panduan semasa.

Apakah yang menyebabkan halusinasi?

AI ialah sistem yang meramalkan "perkataan kemungkinan besar seterusnya"; ia tidak membaca daripada pangkalan data realiti. Walaupun dia tidak tahu jawapan kepada soalan, dia menghasilkan jawapan yang munasabah yang "serupa" dengan teks yang dia telah dilatih. Itulah sebabnya dia boleh memberikan artikel yang tidak wujud dengan petikan yang lengkap, dos yang salah dengan nombor yang jelas, pengesyoran yang sudah lapuk dengan bahasa yang tepat. Model cenderung untuk mengisi tempat kosong daripada berkata "Saya tidak tahu." Selain itu, data latihan dibekukan pada satu tarikh; Dia mungkin tidak menyedari garis panduan yang telah berubah sejak itu.

Petunjuk: Tanya AI "adakah anda pasti?" bertanya bukanlah ujian yang boleh dipercayai; Model boleh dengan mudah berkata "ya, saya pasti" atau, sebaliknya, terpengaruh daripada jawapan yang betul. Ujian sebenar adalah untuk mencari tuntutan dalam sumber utama bebas.

Jenis halusinasi perubatan

Genre

contoh

bahaya

sumber yang dibuat-buat

Artikel/DOI tidak wujud

Rangkaian bukti palsu

Dos/unit yang salah

mg atau unit yang salah

Kemudaratan pesakit langsung

Kerja/hasil khayalan

"Bukti" bukan RCT

Keputusan klinikal yang salah

Cadangan lapuk

Artikel panduan lama

rawatan yang ketinggalan zaman

salah atribusi

Artikel sebenar, kesimpulan yang salah

maklumat yang diputarbelitkan

terlalu generalisasi

Langkau pengecualian

Salah guna

Pengesahan berbilang lapisan

Satu-satunya pertahanan terhadap halusinasi adalah pengesahan sistematik. Lima lapisan:

  1. Pergi ke sumber. Buka dan sahkan setiap dos, kriteria dan cadangan daripada garis panduan semasa, sisipan pakej atau artikel utama.
  2. Semak silang. Adakah dua sumber bebas yang boleh dipercayai mengatakan perkara yang sama?
  3. Topikal. Apakah tarikh maklumat itu milik? Adakah ia berubah sejak itu?
  4. Konsistensi klinikal. Adakah tuntutan itu sesuai dengan realiti pesakit dan logik klinikal am?
  5. Mata pakar. Rujuk cawangan yang berkaitan pada sebarang keraguan atau titik kritikal.

tiga kes mini

Kes 1 — Dos yang salah yang nampaknya selamat. Seorang doktor bertanya kepada AI tentang dos ubat yang jarang digunakan. AI memberikan nombor yang sangat jelas. Doktor melihat prospektus; dos sebenar adalah satu pertiga daripada apa yang dikatakan oleh AI. Nada tepat AI tidak menunjukkan ketepatan; Pengesahan itu menghalang kesilapan yang membawa maut.

Kes 2 — Kerja hantu. AI memetik "RCT berbilang pusat 1,200 pesakit yang diterbitkan pada tahun 2020" untuk menyokong rawatan. Doktor sedang mencari kajian ini; Tiada kajian sedemikian. AI telah membuat nombor dan butiran untuk membuat tuntutannya boleh dipercayai.

Kes 3 — Syor lapuk. AI mengesyorkan ubat lama yang tidak lagi disyorkan dahulu dalam rawatan penyakit. Doktor melihat panduan semasa; Pendekatan telah berubah, ejen baru didahulukan. Pengetahuan AI telah dibekukan pada era sebelumnya; Panduan semasa membetulkan keputusan.

Langkah demi langkah: mengesahkan tuntutan

  1. Kurangkan tuntutan kepada satu ayat. Seperti "Ubat X disyorkan dalam dos Y."
  2. Tentukan jenis sumber. Dos, kriteria atau bukti?
  3. Sumber utama terbuka. Prospektus, manual, PubMed.
  4. Semak silang dengan dua sumber.
  5. Sahkan yang terkini.
  6. Jika ia tidak sesuai, tolak; Jika ragu-ragu, berunding dengan pakar.

Empat templat yang boleh disalin

Tugas: Senaraikan SETIAP tuntutan yang boleh disahkan (dos, kriteria diagnostik, sumber, hasil berangka, cadangan garis panduan) dalam output AI di bawah pada baris berasingan. Tambahkan lajur "daripada sumber utama mana yang harus disahkan" untuk setiap lajur. Pengesahan diri; hanya keluarkan mata untuk diperiksa. Keluaran: [...]

Tugas: Senaraikan syarat yang mesti dipenuhi untuk tuntutan berikut sebagai BENAR dan dalam keadaan apa ia mungkin SALAH. Supaya saya dapat melihat di mana saya perlu mengesahkan. Tuntutan: [...]

Tugas: Dalam teks berikut, tandakan pernyataan berangka atau mutlak yang dibuat tanpa memetik sumbernya (cth. "80% berkesan", "500 mg sehari"). Labelkan setiap satu dengan "tidak bersumber - pengesahan diperlukan". Teks: [...]

Tugasan: Minta saya menilai risiko SEMASA pengesyoran klinikal ini: garis panduan apakah yang mungkin berdasarkan, bila kali terakhir dikemas kini, adakah terdapat sebarang kemungkinan perubahan dalam bidang ini dalam beberapa tahun kebelakangan ini? Jangan buat teks garis panduan; menjana soalan kawalan.Cadangan: [...]

Gesaan lemah / Gesaan kuat

Lemah: "Adakah ini benar?" (AI dengan mudah berkata "ya.")

Kuat: "Senaraikan setiap pengesyoran dos, sumber dan garis panduan dalam cetakan AI di bawah pada baris yang berasingan dan tulis daripada sumber utama (sisipan pakej/garis panduan/PubMed) yang harus saya sahkan untuk setiap satu. Tandakan penyataan yang kelihatan tidak bersumber atau muktamad sebagai 'pengesahan diperlukan'. Sahkan diri anda; cuma buat senarai semak."

Dalam gesaan yang kuat, anda meletakkan AI dalam peranan yang tidak "mengesahkan" sebaliknya "membuat outputnya sendiri boleh diaudit."

Kesilapan biasa

  • Tersilap nada yakin untuk ketepatan. Kenyataan yakin bukan bukti.
  • "Awak pasti?" Menguji dengan. Model meluncur dengan mudah dalam kedua-dua arah.
  • Berpuas hati dengan satu sumber. Semakan silang adalah satu kemestian.
  • Melangkau kemas kini. Maklumat model dibekukan pada satu tarikh.
  • Tidak berunding dengan pakar pada titik kritikal. Pendapat kedua harus dicari dalam keputusan yang boleh dipersoalkan.

Bias automasi: perangkap sendiri

Halusinasi adalah kesilapan model; Tetapi terdapat juga kesilapan manusia: bias automasi. Ini adalah kecenderungan manusia untuk menerima jawapan sebagai betul tanpa menyoal apabila mesin memberikan jawapan. Hanya kerana kalkulator boleh dipercayai, kita menjadi terbiasa dengannya; Kami secara tidak sengaja meletakkan kepercayaan yang sama pada model bahasa. Walau bagaimanapun, model bahasa tidak tepat seperti kalkulator; adalah kebarangkalian dan boleh salah.

Bias automasi amat berbahaya apabila letih, di bawah tekanan masa dan dalam tugas rutin. Pada penghujung penyitaan, mudah untuk mengetepikan output AI yang kelihatan lancar dan lancar sebagai "itu juga benar." Penawarnya ialah menjadikan pengesahan sebagai tabiat dan sistem: mengikatnya pada langkah daftar masuk bertulis, bukan dengan perhatian segera seseorang. "Saya penat, tetapi itulah yang dikatakan senarai semak" adalah pertahanan terbaik terhadap kecenderungan automasi.

Awas: Risiko terbesar bukanlah AI akan membuat kesilapan; Ini bermakna anda menerima kesilapan itu tanpa mempersoalkannya apabila anda letih. Pautkan pengesahan kepada sistem bertulis, bukan kepada pertimbangan peribadi.

Secara ringkasnya

Halusinasi ialah risiko AI yang paling serius dalam bidang perubatan: model tersebut menghasilkan kepalsuan dan kebenaran dalam nada yakin yang sama. Sumber yang direka, dos yang salah, kajian rekaan dan pengesyoran yang sudah lapuk ialah jenis yang paling biasa. Satu-satunya pertahanan ialah pengesahan berbilang lapisan: uji setiap tuntutan terhadap sumber utama dan panduan semasa, semakan silang dan ujian untuk mata wang; Rujuk pakar pada titik kritikal. Jangan sekali-kali mengambil pernyataan keyakinan sebagai bukti kebenaran.

Tugasan permohonan

Tanya AI soalan klinikal yang sengaja mencabar (dos yang jarang berlaku atau rawatan semasa). Sahkan setiap dos, sumber dan pengesyoran yang dia buat dengan sumber utama. Berapa banyak dakwaan yang ternyata benar dan berapa banyak yang palsu atau rekaan? Padankan jadual dengan jenis halusinasi yang mana ralat berlaku dan perhatikan bagaimana nada yakin boleh mengelirukan anda.

senarai semak

  • [ ] Saya mengurangkan setiap tuntutan kepada satu ayat.
  • [ ] Saya telah mengesahkan dos/kriteria/sumber/syor daripada sumber utama.
  • [ ] Saya menyemak silang dengan dua sumber bebas.
  • [ ] Saya telah mengesahkan bahawa maklumat adalah terkini.
  • [ ] Saya menguji tuntutan dengan konsistensi klinikal.
  • [ ] Saya berunding dengan pakar mengenai perkara yang dipersoalkan/kritikal.
  • [ ] Saya tidak menganggap nada yakin sebagai bukti ketepatan.