Keuntungan:
- Mentakrifkan metrik yang mengukur pengekalan dan kualiti penjanaan secara berasingan
- Sediakan set soalan emas dan jalankan penilaian automatik dengan LLM-sebagai-hakim
- Mengekalkan kualiti melalui maklum balas, pemantauan dan ujian regresi dalam pengeluaran
Ayat "Saya memasang pembantu, nampaknya berfungsi dengan baik" bukanlah pernyataan kejuruteraan. Sistem RAG rosak secara senyap: jenis dokumen baharu menipu pengambilan semula, perubahan segera mengurangkan ketepatan, indeks menjadi basi. Satu-satunya cara untuk menyedari ini adalah dengan mengukur. Dalam unit ini, kami merangkumi cara mengukur kualiti RAG (pendapatan semula dan penjanaan secara berasingan), penilaian automatik (LLM-sebagai-hakim) dan mengekalkan kualiti dalam pengeluaran (pemantauan, regresi). "Anda tidak boleh menambah baik apa yang anda tidak ukur" adalah moto unit ini.
Ukur Dua Perkara Berasingan
RAG mempunyai dua kaki dan mesti diukur secara berasingan kerana masalahnya mungkin pada salah satu daripadanya:
- Kualiti perolehan semula: Adakah bahagian yang betul tiba?
- Kualiti penjanaan: Adakah jawapan yang betul dihasilkan daripada bahagian yang masuk?
Jika jawapannya buruk, anda perlu tahu kaki mana yang buruk dahulu. Jika bahagian yang betul tidak pernah sampai, gesaan terbaik pun tidak dapat disimpan (masalah pengambilan semula). Jika bahagian yang betul tiba tetapi model salah membacanya, menambah baik pengambilan adalah sia-sia (masalah penjanaan).
Metrik Pendapatan semula
Pengambilan semula ialah masalah pengisihan/akses; diukur dengan metrik pencarian maklumat klasik. Untuk ini, anda mesti mempunyai gugusan emas: pengetahuan tentang bahagian mana yang "betul" untuk setiap soalan.
metrik
Apa ukuran
Takrifan mudah
Ingat@k
Adakah bahagian yang betul di bahagian atas k?
Kadar tangkapan bahagian yang betul
ketepatan@k
Berapakah bilangan k yang dipulangkan adalah relevan?
Membersihkan apa yang dibawa
MRR (Min Kedudukan Timbal Balik)
Dalam susunan yang manakah bahagian yang betul?
Ganjaran berada di kedudukan teratas
Kadar pukulan
Adakah sekurang-kurangnya satu bahagian yang betul tiba?
Ukuran kejayaan yang paling asas
Ulasan praktikal: Jika Recall@k adalah rendah, strategi chunking atau carian (hibrid, k, kedudukan semula) harus diolah semula. Jika ketepatan rendah tetapi ingat kembali tinggi, menambah kedudukan semula adalah langkah yang baik.
Metrik Penjanaan
Apabila bahagian yang betul tiba, kami mengukur kualiti tindak balas yang dihasilkan oleh model. Tiga dimensi asas:
- Kesetiaan: Adakah setiap tuntutan dalam jawapan disokong oleh konteks? Adakah terdapat apa-apa yang sesuai? Ia adalah ukuran langsung halusinasi.
- Perkaitan jawapan: Adakah jawapan sebenarnya menjawab soalan atau adakah ia di luar topik?
- Kesempurnaan: Adakah semua maklumat yang berkaitan dalam konteks telah digunakan atau adakah ia tiada?
Ini selalunya diberi markah berdasarkan gred (mis. 1-5), dan bukannya binari seperti "benar/salah."
Petua: Jejaki Kesetiaan sebagai metrik yang berasingan. Jika kesetiaan berkurangan apabila ketepatan berkurangan, masalahnya ialah generasi; Jika kesetiaan tinggi tetapi jawapannya salah, masalahnya adalah salah sekeping (retrieval). Bersama-sama, kedua-dua metrik ini ialah kompas yang menunjukkan lokasi kerosakan.
Mewujudkan Set Soalan Emas
Setiap ukuran memerlukan set emas / set data penilaian: soalan realistik + jawapan betul yang dijangka + potongan sumber yang betul. Bermula dengan 30-50 soalan yang dipilih dengan baik adalah lebih baik daripada 500 soalan rawak. Sertakan perkara berikut dalam set: soalan sebenar yang sering ditanya, soalan sukar yang diketahui, soalan perangkap tanpa jawapan (seseorang harus berkata "Saya tidak tahu"), soalan dengan sumber yang bercanggah.
# Contoh gugusan emas (konseptual)[ {"soalan": "Berapa hari cuti tahunan?", "jangkaan_jawapan": "14 hari untuk 1-5 tahun kekananan", "correct_part_id": "two-part-3", "category": "cuti"}, {"question": "Di manakah pejabat #expected_INFORM", "Jawapan_Jawapan syarikat?" tidak tahu "correct_part_id": null, "category": "trap"}]
LLM-sebagai-Hakim: Penilaian Automatik
Menjaringkan ratusan jawapan dengan tangan memang memenatkan. Model LLM-sebagai-hakim ialah apabila satu model menskor dan membenarkan jawapan model lain berdasarkan kriteria tertentu. Penghakiman yang baik dengan jelas mentakrifkan kriteria, memberikan contoh dan meminta justifikasi.
# LLM-sebagai-hakim gesaan (konseptual)Anda seorang penilai yang tidak berat sebelah. Nilaikan JAWAPAN di bawah mengikut KONTEKS yang diberikan dan JAWAPAN YANG DIJANGKA. Skor (1-5) dan justifikasikan:- kesetiaan: adakah setiap tuntutan dalam jawapan disokong dalam konteks?- ketepatan: adakah jawapan sepadan dengan jawapan yang dijangkakan?- kesempurnaan: adakah maklumat yang berkaitan lengkap? Terutamanya: jika jawapan mengandungi maklumat yang bukan dalam konteks, berikan kesetiaan1 dan nyatakan dakwaan yang dibuat. KONTEKS: {context}JANGKAAN: {expected}JAWAPAN: {answer}Output: {kesetiaan, ketepatan, kesempurnaan, justifikasi}
Awas: LLM-sebagai-hakim tidak sempurna; Mereka mungkin mempunyai berat sebelah mereka sendiri (jawapan panjang, lebih suka gaya mereka sendiri). Juga sahkan Hakim: dapatkan beberapa jawapan yang dijaringkan oleh kedua-dua hakim dan manusia dan ukur persetujuan antara mereka. Jika Hakim konsisten dengan markah manusia, anda boleh mempercayainya.
Penilaian Lemah/Kuat
Lemah ("ia bagus untuk saya"):
Saya bertanya beberapa soalan dan jawapannya kelihatan baik. Saya telah mendapatkannya secara langsung.# Masalah: tiada ukuran, regresi tidak dapat dilihat, penambahbaikan buta.
Berkuasa (kelompok emas + metrik diskret + pertimbangan automatik + regresi):
Kelompok emas 40 soalan. Dengan setiap perubahan, ingat@5, kesetiaan dan ketepatan diukur secara automatik. Jika markah jatuh, perubahan akan digulingkan semula. Dalam pengeluaran, maklum balas pengguna dikumpul dan ditambah pada set.
Pemantauan dan Regresi dalam Pengeluaran
Penilaian tidak dilakukan sekali dan selesai. Tiga amalan berterusan:
- Ujian regresi: Auto-jalankan gugusan emas pada setiap perubahan segera/pendapatan/model. Jika markah dikurangkan, perubahan akan diterbalikkan. Ini menghalang "memecahkannya semasa cuba menjadikannya lebih baik".
- Pemantauan pengeluaran: Kadar "Saya tidak dapat mencari maklumat" dalam soalan sebenar, kelewatan purata, kos, maklum balas pengguna (👍/👎) dipantau. Peningkatan mendadak dalam "Saya tidak tahu" selalunya merupakan tanda pertama indeks atau kerosakan pengambilan semula.
- Gelung maklum balas: Soalan sebenar yang disediakan oleh pengguna 👎 disemak dan ditambah pada longgokan emas; Oleh itu, set menjadi lebih kaya dari semasa ke semasa dan titik buta sistem ditutup.
Tiga Kes Mini
Kes 1 — Regresi senyap. Pasukan mengubah suai gesaan untuk "memperbaiki"nya; Ketepatan am meningkat, tetapi kesetiaan menurun sebanyak 30% dalam soalan perangkap (model mula lebih sesuai). Ia tidak akan disedari jika bukan kerana soalan perangkap dalam kelompok emas; Ujian regresi mengembalikan perubahan itu.
Kes 2 — Meluruskan kaki yang salah. Dalam satu pembantu jawapannya adalah buruk; Pasukan itu bekerja dengan segera selama berminggu-minggu. Apabila kami mengukur metrik perolehan semula, ingat@5 hanya 48% — masalahnya ialah dalam mendapatkan semula, bukan penjanaan. Apabila hibrid + kedudukan semula ditambah, ingatan meningkat kepada 89% dan ketepatan juga meningkat.
Kes 3 — Makluman pengeluaran. Pada suatu hari, kadar "Saya tidak dapat mencari maklumat" untuk pembantu sokongan melonjak daripada 6% kepada 34%. Pad jejak memberi amaran; Sebabnya ialah kerja pengindeksan, yang berjalan pada waktu malam, gagal secara senyap dan artikel baharu tidak dimuat naik. Tanpa pemantauan, kenyataan "Saya tidak tahu" yang salah akan berterusan selama beberapa hari.
Kesilapan biasa
- Berpuas hati dengan "ia berfungsi dengan baik untuk saya": Tanpa pengukuran, regresi tidak disedari.
- Tidak memisahkan pengambilan dan penjanaan: Anda akan membetulkan kaki yang salah dan membuang masa.
- Tidak bertanya soalan perangkap: Kecenderungan untuk mengada-adakan perkara tidak muncul dalam kelompok emas.
- Tidak mengesahkan Hakim: Juri yang berat sebelah memberikan keyakinan palsu.
- Tidak memantau pengeluaran: Kegagalan indeks, letupan kos berterusan secara senyap.
Secara ringkasnya
- Dalam RAG, kualiti perolehan dan penjanaan diukur secara berasingan; Ia mesti ditentukan dahulu kaki mana yang rosak.
- ingat semula@k, ketepatan@k, MRR untuk Retrieval; Kesetiaan, kesesuaian, kesempurnaan digunakan untuk generasi.
- Setiap ukuran memerlukan gugusan emas; Letakkan soalan sebenar, sukar, perangkap dan bercanggah di dalamnya.
- LLM-sebagai-hakim set besar auto-skor; tetapi hakim itu sendiri mesti dibenarkan terhadap manusia.
- Ujian regresi, pemantauan pengeluaran dan gelung maklum balas mengekalkan kualiti dari semasa ke semasa.
Tugasan permohonan
(1) Buat set emas sekurang-kurangnya 15 soalan untuk pembantu anda sendiri: masukkan sekurang-kurangnya 3 perangkap (tiada jawapan), 3 soalan sukar, 2 soalan sumber bercanggah. Tulis jawapan yang dijangkakan dan bahagian yang betul bagi setiap soalan. (2) Bandingkan dua versi segera yang berbeza secara manual dengan set ini; Beri setiap jawapan 1-5 mata untuk kesetiaan dan ketepatan. (3) Sesuaikan gesaan LLM-sebagai-hakim di atas dengan kriteria anda sendiri. (4) Kenal pasti 3 metrik yang akan anda jejaki dalam pengeluaran dan bagi setiap soalan "pada ambang apakah yang saya maklumkan?" tulis nilainya.
senarai semak
- [ ] Saya boleh mengukur kualiti pengekalan dan penjanaan dengan metrik yang berasingan.
- [ ] Saya tahu maksud metrik seperti ingat@k, kesetiaan.
- [ ] Saya boleh membina gugusan emas yang merangkumi soalan sebenar, sukar, perangkap dan bercanggah.
- [ ] Saya boleh menyediakan penilaian automatik dan mengesahkan hakim dengan LLM-sebagai-hakim.
- [ ] Saya boleh mengendalikan ujian regresi, pemantauan pengeluaran dan gelung maklum balas.