Satuan 8 / 11

Evaluasi dan Pemantauan RAG

Keuntungan:

  • Mendefinisikan metrik yang mengukur retensi dan kualitas generasi secara terpisah
  • Siapkan kumpulan pertanyaan emas dan jalankan evaluasi otomatis dengan LLM sebagai juri
  • Menjaga kualitas melalui umpan balik, pemantauan dan pengujian regresi dalam produksi

Kalimat "Saya memasang asisten, sepertinya berfungsi dengan baik" bukanlah pernyataan teknis. Sistem RAG rusak secara diam-diam: tipe dokumen baru mengelabui pengambilan, perubahan yang cepat mengurangi akurasi, indeks menjadi basi. Satu-satunya cara untuk mewujudkan hal ini adalah dengan mengukur. Pada unit ini, kami membahas cara mengukur kualitas RAG (pengambilan dan pembuatan secara terpisah), evaluasi otomatis (LLM sebagai juri) dan menjaga kualitas dalam produksi (pemantauan, regresi). “Anda tidak dapat meningkatkan apa yang tidak Anda ukur” adalah motto unit ini.

Ukur Dua Hal Terpisah

RAG memiliki dua kaki dan harus diukur secara terpisah karena masalahnya mungkin ada pada salah satu kaki tersebut:

  1. Kualitas pengambilan: Apakah komponen yang benar telah tiba?
  2. Kualitas generasi: Apakah jawaban yang benar dihasilkan dari karya yang masuk?

Jika jawabannya buruk, Anda perlu mengetahui kaki mana yang buruk terlebih dahulu. Jika bagian yang tepat tidak pernah sampai, bahkan prompt terbaik pun tidak dapat disimpan (masalah pengambilan). Jika bagian yang benar telah tiba tetapi model salah membacanya, meningkatkan pengambilan akan sia-sia (masalah pembangkitan).

Metrik Pengambilan

Pengambilan adalah masalah penyortiran/akses; diukur dengan metrik pengambilan informasi klasik. Untuk ini, Anda harus memiliki kelompok emas: pengetahuan tentang bagian mana yang "benar" untuk setiap pertanyaan.

metrik

Tindakan apa

Definisi sederhana

Ingat @k

Apakah bagian yang benar di k atas?

Tingkat pengambilan bagian yang benar

presisi@k

Berapa banyak k buah yang dikembalikan yang relevan?

Membersihkan apa yang dibawa

MRR (Berarti Peringkat Timbal Balik)

Di manakah urutan potongan yang benar?

Hadiah berada di peringkat teratas

Tingkat hit

Apakah setidaknya satu bagian yang benar telah tiba?

Ukuran kesuksesan yang paling mendasar

Komentar praktis: Jika Recall@k rendah, strategi chunking atau pencarian (hybrid, k, re-ranking) harus dikerjakan ulang. Jika presisi rendah tetapi perolehan tinggi, menambahkan pemeringkatan ulang adalah langkah yang baik.

Metrik Generasi

Ketika bagian yang benar tiba, kami mengukur kualitas respons yang dihasilkan oleh model. Tiga dimensi dasar:

  • Kesetiaan: Apakah setiap klaim dalam jawaban didukung oleh konteks? Apakah ada yang cocok? Ini adalah ukuran langsung dari halusinasi.
  • Relevansi jawaban: Apakah jawabannya benar-benar menjawab pertanyaan atau di luar topik?
  • Kelengkapan: Apakah semua informasi yang relevan dalam konteks telah digunakan atau hilang?

Skor ini sering kali diberi skor berdasarkan tingkatan (misalnya 1-5), bukan biner seperti “benar/salah”.

Tip: Lacak Kesetiaan sebagai metrik terpisah. Jika kesetiaan menurun seiring menurunnya akurasi, masalahnya adalah pembangkitan; Jika kesetiaannya tinggi tetapi jawabannya salah, masalahnya adalah bagian yang salah (retrieval). Bersama-sama, kedua metrik ini adalah kompas yang menunjukkan lokasi kesalahan.

Membangun Kumpulan Pertanyaan Emas

Setiap pengukuran memerlukan kumpulan emas/dataset evaluasi: pertanyaan realistis + jawaban benar yang diharapkan + potongan sumber yang benar. Memulai dengan 30-50 pertanyaan yang dipilih dengan baik lebih baik daripada 500 pertanyaan acak. Sertakan yang berikut ini dalam set: pertanyaan nyata yang sering diajukan, pertanyaan sulit yang diketahui, pertanyaan jebakan yang tidak memiliki jawaban (seseorang harus mengatakan "Saya tidak tahu"), pertanyaan dengan sumber yang kontradiktif.

# Contoh klaster emas (konseptual)[ {"question": "Berapa hari cuti tahunan?", "expected_answer": "14 hari untuk 1-5 tahun senioritas", "true_part_id": "two-part-3", "category": "cuti"}, {"question": "Di mana kantor Mars perusahaan?", "expected_answer": "NO_INFORMATION", # trap: Saya tidak tahu "true_part_id": null, "kategori": "perangkap"}]

LLM-sebagai-Juri: Penilaian Otomatis

Mencetak ratusan jawaban dengan tangan memang melelahkan. Model LLM sebagai juri adalah ketika satu model menilai dan membenarkan jawaban model lain berdasarkan kriteria tertentu. Perintah hakim yang baik dengan jelas mendefinisikan kriteria, memberikan contoh, dan meminta pembenaran.

# Perintah LLM sebagai hakim (konseptual) Anda adalah evaluator yang tidak memihak. Evaluasilah JAWABAN di bawah ini sesuai dengan KONTEKS yang diberikan dan JAWABAN YANG DIHARAPKAN. Beri skor (1-5) dan justifikasi: - kesetiaan: apakah setiap klaim dalam jawaban didukung dalam konteks? - akurasi: apakah jawaban sesuai dengan jawaban yang diharapkan? - kelengkapan: apakah informasi yang relevan sudah lengkap? Khususnya: jika jawaban mengandung informasi yang tidak sesuai konteks, berikan kesetiaan1 dan tunjukkan klaim mana yang dibuat-buat. KONTEKS: {konteks} DIHARAPKAN: {diharapkan}JAWABAN: {answer}Output: {kesetiaan, keakuratan, kelengkapan, pembenaran}

Perhatian: LLM sebagai juri tidaklah sempurna; Mereka mungkin memiliki biasnya sendiri (jawaban panjang, lebih memilih gayanya sendiri). Verifikasi juga Hakim: dapatkan beberapa jawaban yang dinilai oleh hakim dan manusia dan ukur kesepakatan di antara mereka. Jika Hakim konsisten dengan skor manusia, Anda bisa mempercayainya.

Peringkat Lemah/Kuat

Lemah ("itu baik untuk saya"):

Saya mengajukan beberapa pertanyaan dan jawabannya sepertinya bagus. Saya sudah mendapatkannya secara langsung.# Masalah: tidak ada pengukuran, regresi tidak terlihat, perbaikan buta.

Kuat (kluster emas + metrik diskrit + penilaian otomatis + regresi):

Kelompok emas berisi 40 pertanyaan. Dengan setiap perubahan, recall@5, kesetiaan dan akurasi diukur secara otomatis. Jika skor turun, perubahan dibatalkan. Dalam produksi, umpan balik pengguna dikumpulkan dan ditambahkan ke set.

Pemantauan dan Regresi Produksi

Evaluasi tidak dilakukan sekali dan selesai. Tiga praktik konstan:

  • Pengujian regresi: Cluster emas dijalankan secara otomatis pada setiap perubahan prompt/pengambilan/model. Jika skornya dikurangi, perubahannya dibalik. Hal ini mencegah "merusaknya saat mencoba membuatnya lebih baik".
  • Pemantauan produksi: Nilai "Saya tidak dapat menemukan informasi" dalam pertanyaan sebenarnya, penundaan rata-rata, biaya, masukan pengguna (👍/👎) dipantau. Peningkatan mendadak pada "Saya tidak tahu" sering kali merupakan tanda pertama dari kerusakan indeks atau pengambilan.
  • Putaran umpan balik: Pertanyaan sebenarnya yang diberikan oleh pengguna 👎 ditinjau dan ditambahkan ke tumpukan emas; Dengan demikian, himpunan tersebut menjadi lebih kaya seiring berjalannya waktu dan titik-titik buta dari sistem ditutup.

Tiga Kasus Mini

Kasus 1 — Regresi senyap. Sebuah tim memodifikasi perintah untuk "meningkatkannya"; Akurasi umum meningkat, tetapi kesetiaan menurun sebesar 30% pada pertanyaan jebakan (model mulai lebih sesuai). Itu tidak akan diperhatikan jika bukan karena pertanyaan jebakan di kelompok emas; Pengujian regresi mengembalikan perubahan.

Kasus 2 — Meluruskan kaki yang salah. Pada salah satu asisten, jawabannya buruk; Tim mengerjakan perintah tersebut selama berminggu-minggu. Saat kami mengukur metrik pengambilan, recall@5 hanya sebesar 48% — masalahnya ada pada pengambilan, bukan pembuatan. Ketika hybrid + re-ranking ditambahkan, recall meningkat menjadi 89% dan akurasi juga meningkat.

Kasus 3 — Peringatan produksi. Suatu hari, tingkat "Saya tidak dapat menemukan informasi" untuk asisten dukungan melonjak dari 6% menjadi 34%. Trackpad memperingatkan; Penyebabnya adalah pekerjaan pengindeksan yang berjalan pada malam hari diam-diam gagal dan tidak ada artikel baru yang diunggah. Tanpa pemantauan, pernyataan “Saya tidak tahu” yang salah akan terus berlanjut selama berhari-hari.

Kesalahan umum

  • Merasa puas dengan “ini berhasil dengan baik bagi saya”: Tanpa pengukuran, regresi tidak akan diketahui.
  • Tidak memisahkan pengambilan dan pembuatan: Anda akan memperbaiki langkah yang salah dan membuang waktu.
  • Tidak mengajukan pertanyaan jebakan: Kecenderungan mengada-ada tidak muncul dalam kelompok emas.
  • Tidak memverifikasi Hakim: Juri yang bias memberikan kepercayaan yang salah.
  • Tidak memantau produksi: Kegagalan indeks, ledakan biaya terus berlanjut secara diam-diam.

Singkatnya

  • Dalam RAG, kualitas pengambilan dan pembuatan diukur secara terpisah; Harus ditentukan dulu kaki mana yang rusak.
  • recall@k, presisi@k, MRR untuk Pengambilan; Kesetiaan, kesesuaian, kelengkapan digunakan untuk generasi.
  • Setiap pengukuran memerlukan cluster emas; Masukkan pertanyaan-pertanyaan yang nyata, sulit, menjebak dan kontradiktif di dalamnya.
  • LLM sebagai juri menetapkan skor otomatis dalam jumlah besar; tetapi hakim sendiri harus dibenarkan terhadap manusia.
  • Pengujian regresi, pemantauan produksi, dan putaran umpan balik menjaga kualitas dari waktu ke waktu.

Tugas aplikasi

(1) Buatlah kumpulan emas yang terdiri dari minimal 15 pertanyaan untuk asisten Anda sendiri: sertakan setidaknya 3 jebakan (tidak ada jawaban), 3 pertanyaan sulit, 2 pertanyaan sumber yang kontradiktif. Tuliskan jawaban yang diharapkan dan bagian yang benar untuk setiap pertanyaan. (2) Bandingkan secara manual dua versi prompt yang berbeda dengan set ini; Berikan setiap jawaban 1-5 poin untuk kesetiaan dan keakuratan. (3) Sesuaikan perintah LLM sebagai juri di atas dengan kriteria Anda sendiri. (4) Identifikasi 3 metrik yang akan Anda lacak dalam produksi dan untuk setiap metrik tersebut tanyakan “pada ambang batas berapa saya harus khawatir?” tulis nilainya.

daftar periksa

  • [ ] Saya dapat mengukur retensi dan kualitas generasi dengan metrik terpisah.
  • [ ] Saya tahu apa arti metrik seperti recall@k, kesetiaan.
  • [ ] Saya dapat membangun kelompok emas yang mencakup pertanyaan-pertanyaan nyata, sulit, menjebak, dan kontradiktif.
  • [ ] Saya dapat mengatur evaluasi otomatis dan memverifikasi juri dengan LLM sebagai juri.
  • [ ] Saya dapat mengoperasikan pengujian regresi, pemantauan produksi, dan putaran umpan balik.