Yunit 8 / 12

Hallucination, Reliability, at Evidence-Based Validation

Mga nadagdag:

  • Kakayahang kilalanin ang mga uri ng guni-guni (fabricated source, maling dosis, haka-haka na pag-aaral) sa medikal na output ng AI
  • Kakayahang i-link ang bawat klinikal na claim sa kasalukuyang patnubay at pangunahing pinagmumulan na may multi-layered na pag-verify
  • Kakayahang pamahalaan ang kawalan ng katiyakan ng modelo, na ang isang pahayag ng kumpiyansa ay hindi katibayan ng kawastuhan, at ang panganib ng pagkakamali na tila tiyak

Ang pinakamalaking panganib ng artificial intelligence (AI) sa medisina ay hindi na ito ay nagkakamali, ngunit ito ay nagkakamali nang may malaking pagtitiwala. Ang mga modelo ng wika ay gumagawa ng tekstong matatas at mapanghikayat; Ang isang pangungusap ay tunog ng parehong kumpiyansa na tono kung ito ay totoo o mali. Ito ay tinatawag na "hallucination": kapag ang modelo ay gumagawa ng impormasyon na hindi aktwal na umiiral (fabricated source, maling dosis, haka-haka na pag-aaral, hindi umiiral na gabay na materyal) na parang ito ay totoo. Sa ibang mga lugar, ang guni-guni ay isang karamdaman; Ito ay isang isyu sa kaligtasan sa medisina. Sa unit na ito matututunan mong kilalanin ang mga uri ng hallucination, multi-layer validation, at pamahalaan ang kawalan ng katiyakan ng modelo. Pangunahing prinsipyo: Ang pahayag ng pagtitiwala ay hindi katibayan ng katotohanan; Hindi lahat ng klinikal na paghahabol ay magagamit nang hindi nagli-link sa pangunahing pinagmumulan at kasalukuyang patnubay.

Ano ang nagiging sanhi ng hallucinations?

Ang AI ay isang sistema na hinuhulaan ang "susunod na pinaka-malamang na salita"; hindi ito nagbabasa mula sa isang database ng katotohanan. Kahit na hindi niya alam ang sagot sa isang tanong, gumagawa siya ng isang makatwirang sagot na "katulad" sa mga teksto kung saan siya sinanay. Iyon ang dahilan kung bakit maaari siyang magbigay ng isang hindi umiiral na artikulo na may ganap na nabuong pagsipi, isang maling dosis na may malinaw na numero, isang hindi napapanahong rekomendasyon na may tumpak na wika. Ang modelo ay may posibilidad na punan ang blangko sa halip na sabihing "Hindi ko alam." Bukod pa rito, ang data ng pagsasanay ay nagyelo sa isang petsa; Maaaring hindi niya alam ang mga alituntunin na nagbago mula noon.

Hint: Tanungin ang AI "sigurado ka ba?" ang pagtatanong ay hindi maaasahang pagsubok; Ang modelo ay madaling magsabi ng "oo, sigurado ako" o, sa kabaligtaran, ay ma-sway mula sa tamang sagot. Ang tunay na pagsubok ay ang hanapin ang claim sa independiyenteng pangunahing pinagmulan.

Mga uri ng medikal na guni-guni

Genre

halimbawa

Panganib

gawang pinagmulan

Hindi umiiral na artikulo/DOI

Maling chain of evidence

Maling dosis/unit

Maling mg o unit

Direktang pinsala sa pasyente

Imaginary work/resulta

"Ebidensya" na hindi RCT

Maling klinikal na desisyon

Hindi napapanahong rekomendasyon

Lumang gabay na artikulo

hindi napapanahong paggamot

maling tribusyon

Tunay na artikulo, maling konklusyon

baluktot na impormasyon

overgeneralization

Laktawan ang exception

Maling paggamit

Multi-layer na pagpapatotoo

Ang tanging depensa laban sa guni-guni ay sistematikong pag-verify. Limang layer:

  1. Bumaba sa pinanggalingan. Buksan at kumpirmahin ang bawat dosis, pamantayan at rekomendasyon mula sa kasalukuyang patnubay, insert ng package o pangunahing artikulo.
  2. Cross check. Pareho ba ang sinasabi ng dalawang independiyenteng mapagkakatiwalaang mapagkukunan?
  3. Topicality. Sa anong petsa nabibilang ang impormasyon? Nagbago na ba ito mula noon?
  4. Klinikal na pagkakapare-pareho. Ang pag-aangkin ba ay angkop sa katotohanan ng pasyente at pangkalahatang klinikal na lohika?
  5. Matang eksperto. Kumonsulta sa nauugnay na sangay sa anumang pagdududa o kritikal na punto.

tatlong mini case

Kaso 1 — Maling dosis na tila ligtas. Ang isang manggagamot ay nagtatanong sa AI tungkol sa dosis ng isang bihirang ginagamit na gamot. Nagbibigay ang AI ng napakalinaw na numero. Tinitingnan ng manggagamot ang prospektus; ang aktwal na dosis ay isang ikatlong bahagi ng sinasabi ng AI. Ang tumpak na tono ng AI ay hindi nagpahiwatig ng katumpakan; Pinigilan ng kumpirmasyon ang isang nakamamatay na pagkakamali.

Case 2 — Phantom work. Binanggit ng AI ang isang "1,200-patient multicenter RCT na inilathala noong 2020" upang suportahan ang isang paggamot. Hinahanap ng manggagamot ang pag-aaral na ito; Walang ganoong pag-aaral. Ang AI ay gumawa ng mga numero at detalye para gawing kapani-paniwala ang claim nito.

Kaso 3 — Hindi napapanahong rekomendasyon. Inirerekomenda ng AI ang isang lumang gamot na hindi na inirerekomenda muna sa paggamot ng isang sakit. Tinitingnan ng manggagamot ang kasalukuyang gabay; Ang diskarte ay nagbago, isang bagong ahente ang nauna. Ang kaalaman ng AI ay nagyelo sa nakaraang panahon; Itinutuwid ng kasalukuyang patnubay ang desisyon.

Hakbang-hakbang: pag-verify ng claim

  1. Bawasan ang claim sa isang pangungusap. Tulad ng "X na gamot ay inirerekomenda sa Y dosis."
  2. Tukuyin ang uri ng mapagkukunan. Dosis, pamantayan o ebidensya?
  3. Buksan ang pangunahing mapagkukunan. Prospectus, manual, PubMed.
  4. Cross check gamit ang dalawang source.
  5. I-verify ang napapanahon.
  6. Kung hindi ito akma, tanggihan ito; Kung may pagdududa, kumunsulta sa isang eksperto.

Apat na maaaring kopyahin na mga template

Gawain: Ilista ang BAWAT nabe-verify na claim (dosis, pamantayan sa diagnostic, pinagmulan, resulta ng numero, rekomendasyon sa gabay) sa output ng AI sa ibaba sa magkakahiwalay na linya. Magdagdag ng column na "mula kung saan dapat kumpirmahin ang pangunahing pinagmulan" para sa bawat isa. Pagpapatunay sa sarili; output lamang ang mga puntos na susuriin. Output: [...]

Gawain: Ilista kung anong mga kundisyon ang dapat matugunan para ang sumusunod na pag-aangkin ay TAMA at sa ilalim ng kung anong mga pangyayari ito ay maaaring MALI. Para makita ko kung saan ko kailangan magconfirm. Claim: [...]

Gawain: Sa sumusunod na teksto, markahan ang numerical o absolute statement na ginawa nang hindi binabanggit ang pinagmulan (hal. "80% effective", "500 mg bawat araw"). Lagyan ng label ang bawat isa ng "unsourced - kailangan ng kumpirmasyon". Teksto: [...]

Gawain: Hilingin sa akin na tasahin ang KASALUKUYANG panganib ng klinikal na rekomendasyong ito: anong patnubay ang maaaring batayan nito, kailan ito huling na-update, mayroon bang anumang posibilidad ng mga pagbabago sa lugar na ito sa mga nakaraang taon? Huwag gumawa ng text ng guideline; bumuo ng mga tanong sa pagkontrol. Mungkahi: [...]

Mahinang prompt / Malakas na prompt

Mahina: "Totoo ba ito?" (Ang AI ay madaling magsabi ng "oo.")

Strong: "Ilista ang bawat dosis, pinagmulan, at rekomendasyon sa alituntunin sa AI printout sa ibaba sa isang hiwalay na linya at isulat mula sa kung aling pangunahing pinagmulan (package insert/guideline/PubMed) ang dapat kong kumpirmahin para sa bawat isa. Markahan ang mga pahayag na lumalabas na hindi pinagkunan o tiyak bilang 'kinakailangan ang pag-verify.' I-verify ang iyong sarili; gumawa lang ng checklist."

Sa malakas na prompt, inilalagay mo ang AI sa isang papel na hindi "nagpapatunay" ngunit sa halip ay "ginagawa ang sarili nitong output na naa-audit."

Mga karaniwang pagkakamali

  • Napagkamalan ang isang tiwala na tono para sa katumpakan. Ang pahayag ng pagtitiwala ay hindi katibayan.
  • "Sigurado ka ba?" Pagsubok sa. Madaling dumudulas ang modelo sa magkabilang direksyon.
  • Ang pagiging nasiyahan sa isang solong pinagmulan. Kinakailangan ang cross-checking.
  • Nilaktawan ang pag-update. Ang impormasyon ng modelo ay naka-freeze sa isang petsa.
  • Hindi kumukunsulta sa isang eksperto sa isang kritikal na punto. Ang pangalawang opinyon ay dapat humingi sa mga kaduda-dudang desisyon.

Automation bias: sariling bitag

Ang hallucination ay ang pagkakamali ng modelo; Ngunit mayroon ding pagkakamali ng tao: bias ng automation. Ito ang ugali ng tao na tanggapin ang sagot bilang tama nang hindi nagtatanong kapag ang isang makina ay nagbibigay ng sagot. Dahil lamang sa mapagkakatiwalaan ang isang calculator, nakasanayan na natin ito; Hindi sinasadyang naglalagay kami ng parehong tiwala sa modelo ng wika. Gayunpaman, ang modelo ng wika ay hindi tumpak tulad ng isang calculator; ay probabilistic at mali.

Lalo na mapanganib ang bias sa pag-automate kapag pagod, nasa ilalim ng presyon ng oras, at sa mga nakagawiang gawain. Sa pagtatapos ng isang seizure, madaling i-dismiss ang output ng AI na mukhang makinis at makinis bilang "totoo pa rin." Ang antidote ay gawing ugali at sistema ang pagpapatunay: itali ito sa isang nakasulat na hakbang sa pag-check-in, hindi sa agarang atensyon ng isa. "Pagod na ako, ngunit iyon ang sinasabi ng checklist" ay ang pinakamahusay na depensa laban sa pagkiling sa automation.

Babala: Ang pinakamalaking panganib ay hindi ang AI ay magkakamali; Ibig sabihin, tinatanggap mo ang pagkakamaling iyon nang hindi nagtatanong kapag pagod ka. I-link ang pagpapatunay sa isang nakasulat na sistema, hindi sa personal na pagsasaalang-alang.

Sa buod

Ang hallucination ay ang pinakaseryosong panganib ng AI sa medisina: ang modelo ay gumagawa ng kasinungalingan at katotohanan sa parehong tono ng kumpiyansa. Ang gawa-gawang pinagmulan, maling dosis, kathang-isip na pag-aaral, at hindi napapanahong rekomendasyon ay ang pinakakaraniwang uri. Ang tanging depensa ay multi-layered na pag-verify: subukan ang bawat claim laban sa pangunahing pinagmumulan at kasalukuyang gabay, cross-checking at pagsubok para sa pera; Kumonsulta sa isang eksperto sa mga kritikal na punto. Huwag kailanman kunin ang pahayag ng pagtitiwala bilang katibayan ng katotohanan.

Gawain ng aplikasyon

Magtanong sa AI ng isang sadyang mapaghamong klinikal na tanong (isang bihirang dosis o isang kasalukuyang paggamot). I-verify ang bawat dosis, pinagmulan, at rekomendasyong ginagawa niya gamit ang pangunahing pinagmulan. Ilang claim ang naging totoo at ilan ang mali o gawa-gawa? Itugma ang talahanayan kung saang uri ng hallucination nahuhulog ang mga error at tandaan kung paano ka maaaring iligaw ng tono ng kumpiyansa.

checklist

  • [ ] Binawasan ko ang bawat paghahabol sa isang pangungusap.
  • [ ] Nakumpirma ko ang dosis/pamantayan/pinagmulan/rekomendasyon mula sa pangunahing pinagmulan.
  • [ ] Nag-cross-check ako sa dalawang independiyenteng mapagkukunan.
  • [ ] Na-verify ko na ang impormasyon ay napapanahon.
  • [ ] Sinubukan ko ang claim nang may klinikal na pagkakapare-pareho.
  • [ ] Kumonsulta ako sa isang eksperto sa kaduda-dudang/kritikal na punto.
  • [ ] Hindi ko itinuring ang tiwala na tono bilang katibayan ng katumpakan.