Unit 3 / 11

Pengesahan Output dan Pemeriksaan Manusia

Keuntungan:

  • Keupayaan untuk mewujudkan lapisan pengesahan keluaran skema dan berasaskan peraturan
  • Keupayaan untuk memerlukan manusia-dalam-gelung secara bermakna dalam keputusan berimpak tinggi
  • Keupayaan untuk mereka bentuk pengesahan dan penghalaan berasaskan ambang kepercayaan dengan model kedua

Model bahasa menghasilkan lancar, persuasif dan selalunya tepat—tetapi "persuasif" tidak sama dengan "betul." Model boleh memuatkan amaun, tarikh atau medan JSON secara senyap; Ini dipanggil halusinasi (model dengan yakin menghasilkan maklumat yang tidak wujud dalam realiti). Dalam sistem perusahaan, jika output itu mengalir ke langkah seterusnya — pembayaran, e-mel, penulisan pangkalan data — ralat itu merebak ke dunia nyata. Dalam unit ini, kita akan belajar untuk menapis output dengan lapisan pengesahan sebelum ia memasuki sistem dan memerlukan manusia-dalam-gelung dalam keputusan berimpak tinggi.

Mengapa Pengesahan Output Diperlukan?

Output model boleh rosak dalam dua cara utama: format (tidak mematuhi skema JSON yang dijangkakan, medan tiada/lebihan) dan kandungan (format betul tetapi nilainya salah — kod produk yang tidak wujud, tarikh yang tidak logik). Terdapat dimensi ketiga dari segi keselamatan: output berniat jahat (arahan jahat yang dihasilkan akibat suntikan atau kebocoran). Sistem pepejal menghentikan ketiga-tiganya di pintu.

Awas: "Model secara amnya tepat" bukanlah kriteria pengeluaran. Dalam sistem tanpa pengesahan, walaupun satu ralat dalam seribu bermakna 100 transaksi yang salah setiap hari dalam 100,000 permintaan setiap hari.

Lapisan Pengesahan: Langkah demi Langkah

  1. Pengesahan skema. Semak dengan mesin bahawa output mematuhi struktur yang dijangkakan: adakah medan hadir, adakah jenisnya betul, adakah medan yang diperlukan diisi?
  2. Pengesahan logik peraturan/perniagaan. Adakah nilai sepadan dengan peraturan perniagaan? (Jumlah > 0, tarikh bukan pada masa hadapan, kod produk tergolong dalam katalog.)
  3. Kawalan rujukan/sumber. Jika model itu menghasilkan penegasan, bolehkah ia dikaitkan dengan sumber? (Adakah petikan RAG sebenarnya dalam dokumen?)
  4. Pengesahan dengan model kedua (LLM-sebagai-hakim). Model bebas menilai output sebagai "betul/tidak lengkap/berisiko".
  5. Ambang kepercayaan dan orientasi. Jika model atau pengesah melaporkan keyakinan rendah, output tidak lulus secara automatik; ditujukan kepada manusia.
  6. Kawalan manusia. Hasil yang berpotensi tinggi atau rendah selamat bergantung pada kelulusan pakar.

Empat Templat Boleh Disalin

Skim + "buat-buat jika anda tidak tahu" bersama-sama:

Kembalikan respons dalam skema JSON berikut SAHAJA: Tulis "rendah". JANGAN sekali-kali menulis anggaran seolah-olah ia tepat.

Pengesahan dengan model kedua (gesaan hakim):

Anda adalah pengesah bebas. Di bawah ialah teks <sumber> dan <tuntutan>. Semak untuk melihat sama ada SETIAP nombor dan tarikh dalam tuntutan berlaku secara verbatim dalam sumber. Untuk setiap satu, sebut: "disahkan | bukan dalam sumber | bercanggah dengan sumber." Jika walaupun salah satu daripada mereka 'tidak hadir/bercanggah', tandakan hasilnya sebagai "SEMAK MANUSIA DIPERLUKAN".<sumber>{{ text }}</source><claim>{{ model_output }}</claim>

Peraturan penghalaan ambang amanah:

Peraturan penghalaan:- emin_misin = "tinggi" DAN amaun < 10,000 TL -> pemprosesan automatik- emin_misin = "sederhana" ATAU amaun 10,000-100,000 TL -> pengesahan model kedua- emin_misin = "rendah" ATAU amaun > 100,000 TL -> kelulusan manusia diperlukan

Kad ringkasan audit manusia (mempercepatkan semakan):

Apabila membentangkan keputusan kepada seseorang, kemukakan kad ini:- Apakah yang dicadangkan? (satu ayat)- Ia berdasarkan sumber apa? (rujukan artikel/dokumen)- Apakah 2 andaian yang paling lemah?- Jika diluluskan, bolehkah ia diterbalikkan? (ya/tidak)

Gesaan Lemah / Gesaan Kuat

pendekatan yang lemah

Pendekatan yang kuat

"Tolak amaun daripada invois" (teks percuma)

Skema JSON yang ketat + null + medan amanah

Menulis output terus ke sistem pembayaran

Skema → peraturan → kelulusan manusia (jika perlu)

Hanya memberitahu model "pastikan"

Pengesahan nombor/tarikh dengan model kedua

Memproses setiap output dengan keyakinan yang sama

Penghalaan berdasarkan pengaruh dan kepercayaan

Pendekatan yang kuat tidak berharap bahawa model itu betul; Ia mencipta pintu yang akan menangkap anda apabila anda salah.

Tiga Kes Mini

Kes 1 — Skim sahaja tidak mencukupi. Automasi perakaunan sedang mengekstrak amaun daripada invois sebagai JSON. Skim itu betul, tetapi model menghasilkan "125,000" dan bukannya "1,250.00" pada invois (anjakan perpuluhan). Skim ini gagal menangkap ini; pengesahan peraturan ("amaun mesti selaras dengan jumlah item invois sebanyak ±1%") telah ditangkap dan rakaman 112,500 TL yang salah telah dihalang.

Kes 2 — Model kedua menangkap halusinasi. "Notis penamatan 30 hari," kata pembantu sokongan undang-undang dalam ringkasan kontrak; Walau bagaimanapun, dalam kontrak ia adalah 90 hari. Apabila hakim bebas membenderakan model sebagai "bercanggah dengan sumber", output telah dimajukan kepada manusia dan diperbetulkan. Jika ia automatik, pelanggan akan memberitahu pembatalan berdasarkan tarikh yang salah.

Kes 3 — Penghalaan mengurangkan beban sebanyak 70%. Sistem tuntutan insurans secara automatik meluluskan tuntutan jumlah rendah dan keselamatan tinggi dan menghantar hanya ambang atas/rendah selamat kepada pakar. Daripada 3,200 permintaan harian, hanya 950 jatuh kepada manusia; pakar menumpukan masa mereka kepada 30% yang benar-benar berisiko, dengan purata masa transaksi menurun daripada 4 jam kepada 40 minit.

Petua: Jangan sediakan kawalan manusia supaya "orang boleh melihat segala-galanya" — ini akan meletihkan orang dan kelulusan akan menjadi setem. Sebaliknya, hanya jalankan output berimpak tinggi dan berkeyakinan rendah kepada manusia; Ini menumpukan perhatian kepada perkara yang benar-benar penting.

Menjadikan Kawalan Manusia Bermakna

Human-in-the-loop bukanlah tentang meletakkan kotak pilihan di atas kertas. Penyemak mesti mempunyai (1) konteks untuk memahami keputusan, (2) akses kepada sumber, dan (3) kuasa untuk mengatakan "tidak." Jika tidak, kawalan kekal kosmetik. Kad ulasan (templat keempat di atas) bertujuan untuk menyediakan konteks itu sahaja.

Kesilapan biasa

  • Hanya melakukan pengesahan skema dan melangkau ralat kandungan/nilai.
  • Berfikir bahawa dengan memberitahu model "pastikan" anda melakukan pengesahan sebenar.
  • Laksanakan secara automatik keputusan berimpak tinggi dan tidak boleh diubah.
  • Meletakkan kawalan manusia pada setiap keluaran dan menukar kelulusan menjadi setem getah yang tidak bermakna.
  • Menyebut "luluskan" kepada pengulas tanpa memberikan sumber dan konteks.
  • Memproses semua output dengan risiko yang sama tanpa menetapkan ambang amanah dan penghalaan.

Secara ringkasnya

  • Output rosak dalam tiga cara: bentuk, kandungan dan niat jahat; sistem pepejal menghentikan ketiga-tiga di pintu.
  • Lapisan: pengesahan skema, logik peraturan/perniagaan, kawalan sumber, model kedua (LLM-sebagai-hakim) dan penghalaan ambang amanah.
  • Human-in-the-loop harus diwajibkan untuk output berimpak tinggi dan rendah keselamatan.
  • Semakan manusia mestilah bermakna: penyemak mesti mempunyai konteks, akses sumber dan kuasa untuk mengatakan "tidak."
  • Kedua-dua keselamatan dan kecekapan diperoleh dengan mengarahkan hanya yang berisiko kepada manusia, bukan setiap output.

Tugasan permohonan

Ambil contoh daripada keluaran AI anda sendiri. Mula-mula tentukan skema JSON dan paksa output kepadanya. Kemudian tulis sekurang-kurangnya dua peraturan perniagaan (contohnya, "jumlah sepadan dengan jumlah item"). Akhir sekali, sediakan jadual penghalaan: gabungan kepercayaan/pengaruh yang manakah pergi secara automatik, yang pergi ke model kedua, yang mana pergi ke manusia? Hasilkan sampel yang rosak dan perhatikan di mana setiap lapisan menangkapnya.

senarai semak

  • [ ] Saya mentakrifkan skema yang ketat untuk output dan mengesahkannya dengan mesin.
  • [ ] Saya menambah sekurang-kurangnya satu pengesahan perniagaan/peraturan (logik nilai).
  • [ ] Saya boleh memautkan pernyataan kepada sumber dan menyemaknya.
  • [ ] Model kedua atau pengesahan manusia tersedia untuk hasil keselamatan berimpak tinggi/rendah.
  • [ ] Peraturan laluan ditakrifkan berdasarkan kepercayaan dan pengaruh.
  • [ ] Penyemak diberikan konteks, sumber dan kuasa untuk menolak.