Unit 8 / 11

Eval dan Pemantauan: Mengetahui Apa Yang Model Sebenarnya Lakukan dalam Pengeluaran

Keuntungan:

  • Keupayaan untuk mengenali punca senyap kemerosotan model (hanyut data, drift konsep, ralat huluan) dan mewujudkan pemantauan tiga lapisan (operasi, input, output)
  • Keupayaan untuk menilai sistem LLM dalam berbilang lapisan dengan semakan peraturan, LLM-pengadil dan penilaian manusia, dan menentukur dengan sauh manusia pengadil LLM
  • Keupayaan untuk mereka bentuk set eval yang mengandungi kes tepi dan keselamatan dan menukar setiap ralat yang ditangkap menjadi kes ujian kekal

Sebaik sahaja model masuk ke dalam pengeluaran, kerja anda tidak selesai; Tanggungjawab sebenar baru bermula. Kerana model itu boleh rosak secara senyap apabila tiada siapa yang melihat. Dalam unit ini, kami merangkumi dua disiplin pelengkap: penilaian (mengukur kualiti model secara sistematik) dan pemantauan (pemantauan berterusan model dalam pengeluaran). Terutama dalam sistem LLM, eval lebih sukar dan memerlukan lebih penjagaan daripada ML klasik.

Mengapa model pengeluaran secara senyap-senyap rosak

Pepijat ranap, log dicetak, penggera berbunyi. Model ML, sebaliknya, boleh menjadi salah tanpa menyebabkan ralat. Tiga punca utama kemerosotan:

  • Hanyutan data: Pengedaran data input berubah dari semasa ke semasa (produk baharu, perubahan tingkah laku pengguna, kemusim). Modelnya tetap sama tetapi dunia berubah.
  • Hanyutan konsep: Perhubungan input-output berubah. Taktik penipuan dan corak spam berkembang; Apa yang betul semalam akan menjadi salah hari ini.
  • Rasuah huluan: Sumber data menukar format, kawasan menjadi bebas; Model terliur secara senyap dengan input rosak.

Pengesanan menjadikan herotan senyap ini boleh didengari.

Perkara yang perlu ditonton: tiga lapisan

Pemantauan yang baik meliputi tiga lapisan:

  1. Metrik operasi: Latensi, kadar ralat, volum permintaan, penggunaan sumber. "Adakah sistem itu berdiri?"
  2. Metrik data/input: Adakah pengagihan input serupa dengan latihan? Adakah kadar nilai hilang meningkat? Adakah kategori baharu tiba? "Adakah model melihat data biasa?"
  3. Metrik model/output: Log pengedaran ramalan? Adakah markah keyakinan menurun? Dan jika boleh, apakah ketepatannya berbanding kebenaran asas? "Adakah model itu masih tepat?"

Lapisan ketiga adalah yang paling berharga tetapi paling sukar; kerana keputusan sebenar biasanya datang dengan kelewatan (ia menjadi jelas selepas berbulan-bulan sama ada pinjaman akan dibayar atau tidak).

Petua: Jika keputusan sebenar ditangguhkan, pantau input dan pengedaran ramalan terlebih dahulu. Peralihan pengagihan input adalah tanda awal kemerosotan ketepatan dan boleh menimbulkan penggera tanpa menunggu keputusan sebenar.

Menilai sistem LLM: cabaran istimewa

Dalam ML klasik, "jawapan betul" adalah jelas (kelas 0 atau 1). Hasil LLM, sebaliknya, adalah terbuka: mungkin terdapat banyak jawapan yang betul untuk soalan yang sama, "ketepatan" tidak sesuai dengan satu nombor. Pendekatan eval LLM:

  • Metrik yang dirujuk: Membandingkan output dengan jawapan yang ideal. Terhad; kerana ia mungkin menganggap jawapan yang betul dinyatakan secara berbeza sebagai "salah".
  • Semakan berasaskan peraturan: Adakah output JSON sah? Adakah terdapat perkataan yang dilarang? Adakah ia mengandungi medan yang dikehendaki? Murah, boleh dipercayai, ketat.
  • LLM-hakim (LLM-sebagai-hakim): Jangan buat model bertanya "adakah jawapan ini bagus mengikut kriteria ini?" Ia berskala, tetapi pengadil itu sendiri mesti disahkan.
  • Kajian manusia: Standard emas tetapi mahal dan perlahan. Ia digunakan pada sampel.

Dalam amalan ini digunakan bersama: pemeriksaan peraturan murah pada setiap output, LLM-hakim pada sampel yang besar, penilaian manusia pada sampel yang kecil tetapi ketat.

Pendekatan yang lemah / Pendekatan yang kuat

Lemah: "LLM-Saya bertanya kepada pengadil, 92% daripada jawapan kami adalah baik. Sistemnya hebat."

Güçlü: "Kami mula-mula melabelkan 100 cetakan manusia. Kami menjalankan hakim LLM pada 100 cetakan yang sama dan mengukur perjanjian manusia-hakim — 85% persetujuan, boleh diterima. Kami mendokumentasikan di mana hakim itu silap secara sistematik (kecenderungan untuk mencari jawapan yang panjang dengan tidak adil) dan membetulkan gesaannya. Selepas itu barulah kami mempercayai markah hakim."

Perbezaannya: pendekatan yang kuat mengesahkan pengadil dengan sauh manusia, bukan secara membabi buta. Pengadil LLM yang tidak disahkan memberikan keyakinan yang tampan tetapi palsu.

Perhatian: LLM-pengadil juga merupakan model; halusinogenik, berat sebelah (memihak kepada jawapan yang panjang/yakin), boleh menjadi tidak konsisten. Kalibrasi markah pengadil dengan tag manusia sebelum membuat keputusan pengeluaran.

Set penilaian: direka dengan teliti

Set eval yang baik mewakili kepelbagaian penggunaan sebenar dan kes yang sukar. Eval yang diisi dengan contoh mudah sahaja akan membuatkan anda dalam keyakinan palsu. Pastikan untuk meletakkannya dalam kelompok eval:

  • Kes tepi: Input kosong, input sangat panjang, format luar biasa.
  • Kes sukar yang diketahui: Contoh di mana model telah membuat kesilapan pada masa lalu (sebagai ujian regresi).
  • Insiden keselamatan: Percubaan suntikan segera, permintaan berniat jahat, perangkap pelanggaran privasi.

Kelompok eval berkembang dari semasa ke semasa: setiap pepijat baharu yang anda tangkap dalam pengeluaran menjadi kes ujian untuk penilaian seterusnya.

Penggera dan campur tangan

Pemantauan masih tidak lengkap tanpa penggera. Perlu ada ambang dan pelan tindak balas untuk setiap metrik penting: "Beritahu jurutera jika hanyut input melebihi X", "Autobalik semula jika kadar ralat melebihi Y". Pastikan penggera bermakna — terlalu banyak penggera palsu menghilangkan kepekaan pasukan dan membuatkan mereka terlepas penggera sebenar.

tiga kes mini

Kes 1 - Amaran awal. Ketepatan sebenar model ramalan permintaan hanya menjadi jelas pada penghujung minggu. Pasukan itu memantau pengedaran input dan melihat peningkatan mendadak kategori produk baharu pada hari Selasa — sesuatu yang model itu tidak pernah lihat. Mereka mengemas kini model tanpa menunggu penurunan ketepatan. Pemantauan input disimpan hari.

Kes 2 - Pengadil yang tidak disahkan. Satu pasukan melaporkan "kualiti kami sangat baik" berdasarkan penyemak LLM. Apabila aduan pelanggan meningkat, pemantauan manusia diperkenalkan: pengadil mengira jawapan yakin tetapi salah sebagai "baik." Sebaik sahaja pengadil ditentukur dengan tag manusia, kualiti sebenar telah didedahkan dan jauh lebih rendah. Pengajaran: jangan percaya pengadil tanpa mengesahkannya.

Kes 3 - Ujian regresi. Perubahan segera menyelesaikan satu isu sambil memecahkan isu lain secara senyap. Tetapi pasukan itu mengekalkan pepijat melepasi dalam baldi eval; Apabila perubahan baharu telah diuji pada kluster ini, sarung yang rosak telah ditangkap serta-merta dan perubahan itu telah diperbaiki. Pengajaran: setiap pepijat tetap harus menjadi kes ujian kekal.

Templat yang boleh disalin

Hasilkan pelan penjejakan untuk model pengeluaran ini. Meliputi tiga lapisan:1) Operasi (latensi, kadar ralat, volum)2) Input/data (anjakan pengedaran, nilai hilang, kategori baharu)3) Model/output (pengedaran ramalan, keyakinan, ketepatan jika boleh)Model: [penerangan]. Berapa lama masa yang diambil untuk keputusan sebenar tiba: [duration]Tambahkan ambang dan pengesyoran intervensi untuk setiap metrik.

Cadangkan strategi penilaian (eval) untuk sistem LLM ini.Tugas: [penerangan]Tentukan lapisan:- Semakan berasaskan peraturan manakah yang harus dijalankan pada setiap output?- Apakah kriteria yang harus dinilai oleh penimbang tara LLM dan bagaimana ia harus disahkan (manusia anchor)?- Dalam sampel manakah penilaian manusia harus dilakukan? Senaraikan kelebihan dan kes keselamatan yang harus saya letakkan dalam set eval.

Semak gesaan pengadil LLM ini:- Adakah kriteria penilaian jelas atau subjektif?- Adakah ia terdedah kepada berat sebelah panjang/keyakinan?- Bagaimanakah cara saya menentukur pengadil dengan tag manusia? Gesaan pengadil: [prompt]

Tulis buku panduan tindak balas untuk penggera pemantauan ini. Penggera: [cth. ambang hanyut input melebihi]Mesti mengandungi: langkah kawalan awal, punca yang mungkin, kriteria rollback, siapa yang perlu dimaklumkan.

Jadual punca kemerosotan

penyelewengan

gejala

Cara untuk pengesanan awal

hanyut data

Perubahan pengagihan input

Pemantauan pengagihan input

peralihan konsep

Kebenaran jatuh senyap

Ramalan + perbandingan sebenar

kesilapan huluan

Medan menjadi kosong/perubahan format

Pengesahan skema + kadar tiada

Model tidak konsisten

Peralihan pengedaran output

Pemantauan pengagihan output

Kesilapan biasa

  • Tidak mewujudkan pemantauan. Model itu rosak secara senyap, tiada siapa yang melihatnya.
  • Jejaki metrik operasi sahaja. Sistem sudah siap, tetapi ramalan mungkin salah.
  • Menggunakan LLM tanpa mengesahkan pengadil. Ia memberikan keyakinan palsu.
  • Eval dengan contoh mudah. Ia tidak menunjukkan kesukaran sebenar.
  • Tidak termasuk kesilapan lalu dalam eval. Ralat yang sama kembali lagi.
  • Penggera yang kuat. Pasukan menjadi tidak peka, kehilangan penggera sebenar.

Secara ringkasnya

Model boleh menjadi tidak tepat tanpa menyebabkan ralat dalam pengeluaran; jadi eval dan pemantauan adalah sama penting dengan pembangunan. Wujudkan pemantauan pada tiga lapisan (operasi, input, output); Gunakan drift input sebagai amaran awal jika keputusan sebenar ditangguhkan. Dalam sistem LLM, eval bersifat terbuka; Gunakan semakan peraturan, pengadil LLM dan penilaian manusia bersama-sama — tetapi pastikan anda mengesahkan pengadil LLM dengan sauh manusia. Perkayakan kluster Eval anda dengan kes tepi dan keselamatan dan tukar setiap ralat yang ditangkap menjadi kes ujian kekal.

Tugasan permohonan

Tulis pelan pemantauan tiga lapisan untuk model pengeluaran (atau hampir pengeluaran) dan tentukan ambang + penggera untuk sekurang-kurangnya satu metrik pengedaran input. Jika anda mempunyai sistem LLM: tag 30 output dengan manusia, jalankan pengadil LLM pada output yang sama, dan ukur perjanjian pengadil manusia; Perhatikan berat sebelah sistematik pengadil. Tambahkan sekurang-kurangnya 3 tepi dan 2 kes keselamatan pada kelompok eval anda.

senarai semak

  • [ ] Pemantauan meliputi ketiga-tiga lapisan (operasi, input, output).
  • [ ] Saya menggunakan drift input sebagai amaran awal jika keputusan sebenar ditangguhkan.
  • [ ] Saya menentukur penimbang tara LLM dengan label manusia.
  • [ ] Kelompok Eval mengandungi kes tepi dan keselamatan.
  • [ ] Saya menukar setiap pepijat yang saya tangkap menjadi kes ujian kekal.
  • [ ] Setiap metrik penting mempunyai ambang dan pelan tindak balas.