Daromadlar:
- Saqlash va ishlab chiqarish sifatini alohida o'lchaydigan ko'rsatkichlarni aniqlash
- Oltin savollar to'plamini o'rnating va LLM-as-hakim bilan avtomatik baholashni ishga tushiring
- Teskari aloqa, monitoring va ishlab chiqarishda regressiya sinovlari orqali sifatni saqlab qolish
"Men yordamchini o'rnatdim, u yaxshi ishlayotganga o'xshaydi" jumlasi muhandislik bayonoti emas. RAG tizimlari jimgina buziladi: yangi hujjat turi qidirishni aldaydi, tezkor o'zgartirish aniqlikni pasaytiradi, indeks eskiradi. Buni tushunishning yagona yo'li o'lchashdir. Ushbu bo'limda biz RAG sifatini qanday o'lchashni (qidiruv va ishlab chiqarishni alohida), avtomatik baholashni (LLM-hakim sifatida) va ishlab chiqarishda sifatni saqlab qolishni (monitoring, regressiya) ko'rib chiqamiz. "Siz o'lchamagan narsani yaxshilay olmaysiz" - bu birlik shiori.
Ikkita alohida narsani o'lchang
RAGning ikkita oyog'i bor va ularni alohida o'lchash kerak, chunki muammo ularning birida bo'lishi mumkin:
- Qayta olish sifati: to'g'ri qism keldimi?
- Avlod sifati: To'g'ri javob kelgan qismdan ishlab chiqarilganmi?
Agar javob yomon bo'lsa, birinchi navbatda qaysi oyog'i yomon ekanligini bilishingiz kerak. Agar to'g'ri qism hech qachon kelmasa, hatto eng yaxshi taklif ham saqlay olmaydi (qidiruv muammosi). Agar to'g'ri qism kelgan bo'lsa, lekin model uni noto'g'ri o'qigan bo'lsa, qidirishni yaxshilash befoyda (avlod muammosi).
Qidiruv ko'rsatkichlari
Qidiruv - saralash/kirish muammosi; Klassik ma'lumotni qidirish ko'rsatkichlari bilan o'lchanadi. Buning uchun sizda oltin klaster bo'lishi kerak: har bir savol uchun qaysi qism "to'g'ri" ekanligini bilish.
metrik
Qanday choralar
Oddiy ta'rif
Recall@k
To'g'ri bo'lak yuqoridagi k?
To'g'ri qismni suratga olish tezligi
precision@k
Qaytarilgan k donadan nechtasi tegishli?
Olingan narsalarni tozalash
MRR (o'rtacha o'zaro daraja)
To'g'ri bo'lak qaysi tartibda?
Mukofotlar yuqori o'rinlarda bo'lish
Dars tezligi
Kamida bitta to'g'ri bo'lak keldimi?
Muvaffaqiyatning eng asosiy mezoni
Amaliy izoh: Recall@k past bo'lsa, bo'linish yoki qidirish strategiyasi (gibrid, k, qayta tartiblash) qayta ishlanishi kerak. Agar aniqlik past bo'lsa, lekin eslab qolish yuqori bo'lsa, qayta reyting qo'shish yaxshi harakatdir.
Avlod ko'rsatkichlari
To'g'ri qism kelganda, biz model tomonidan ishlab chiqarilgan javob sifatini o'lchaymiz. Uch asosiy o'lchov:
- Sodiqlik: Javobdagi har bir da'vo kontekst bilan tasdiqlanadimi? Har qanday moslashuv bormi? Bu gallyutsinatsiyaning bevosita o'lchovidir.
- Javobning dolzarbligi: Javob aslida savolga javob beradimi yoki mavzudan tashqarimi?
- To'liqlik: Kontekstdagi barcha tegishli ma'lumotlardan foydalanilganmi yoki ular etishmayaptimi?
Bular ko'pincha "to'g'ri/noto'g'ri" kabi ikkilik emas, balki reyting asosida (masalan, 1-5) baholanadi.
Maslahat: Sodiqlikni alohida koʻrsatkich sifatida kuzatib boring. Agar aniqlik pasaygan sari sodiqlik pasaysa, muammo avloddir; Agar sodiqlik yuqori bo'lsa, lekin javob noto'g'ri bo'lsa, muammo noto'g'ri parcha (qidiruv). Birgalikda bu ikki ko'rsatkich nosozlik joyini ko'rsatadigan kompasdir.
Oltin savollar to'plamini yaratish
Har bir o'lchov oltin to'plamni / baholash ma'lumotlar to'plamini talab qiladi: real savollar + kutilgan to'g'ri javoblar + to'g'ri manba qismlari. 500 ta tasodifiy savoldan ko'ra, 30-50 ta yaxshi tanlangan savoldan boshlash yaxshiroqdir. To'plamga quyidagilarni qo'shing: tez-tez so'raladigan haqiqiy savollar, ma'lum qiyin savollar, javobsiz tuzoq savollari ("bilmayman" deyish kerak), qarama-qarshi manbalarga ega savollar.
# Oltin klaster misoli (kontseptual)[ {"savol": "Yillik ta'til necha kun?", "kutilayotgan_javob": "1-5 yillik ish stajiga 14 kun", "to'g'ri_qism_id": "ikki qism-3", "kategoriya": "ketmoq"}, {"savol": "kompaniya qayerda?" "NO_INFORMATION", # trap: "to'g'ri_qism_id" ni bilmayman: null, "category": "trap"}]
Sudya sifatida LLM: Avtomatik baholash
Yuzlab javoblarni qo'lda to'plash charchatadi. Sudya sifatida LLM modeli - bir model boshqa modelning javobini ma'lum mezonlar asosida baholaydi va asoslaydi. Yaxshi sudya mezonlarni aniq belgilaydi, misollar keltiradi va asoslashni so'raydi.
# LLM-hukmchi sifatida tezkor (kontseptual) Siz xolis baholovchisiz. Quyidagi JAVOBni berilgan kontekst va KUTILAN JAVOBga ko'ra baholang. Bal (1-5) va asoslang:- sodiqlik: javobdagi har bir daʼvo kontekstda qoʻllab-quvvatlanadimi?- aniqlik: javob kutilgan javobga mos keladimi?- toʻliqlik: tegishli maʼlumot toʻliqmi? Xususan: agar javobda kontekstda boʻlmagan maʼlumotlar boʻlsa, sodiqlikni1 kiriting va qaysi daʼvo uydirma ekanligini koʻrsating. MONTAJ: {kontekst}KUTILGAN: {kutilayotgan}JAVOB: {javob}Xisobot: {sodiqlik, aniqlik, toʻliqlik, asoslash}
Diqqat: LLM-as-hudya mukammal emas; Ularning o'ziga xos tomonlari bo'lishi mumkin (uzoq javob, o'z uslubini afzal ko'radi). Shuningdek, hakamni tekshirib ko'ring: sudya va inson tomonidan berilgan ba'zi javoblarga ega bo'ling va ular o'rtasidagi kelishuvni o'lchang. Agar hakam inson baholariga mos kelsa, unga ishonishingiz mumkin.
Zaif/Kuchli reyting
Zaif ("bu men uchun yaxshi edi"):
Men bir nechta savol berdim va javoblar yaxshi tuyuldi. Men uni jonli ravishda oldim.# Muammo: o'lchovlar yo'q, regressiya sezilmaydi, yaxshilanish ko'r.
Kuchli (oltin klaster + diskret ko'rsatkichlar + avtomatik hukm + regressiya):
40 ta savoldan iborat oltin klaster. Har bir o'zgartirish bilan, recall@5, sodiqlik va aniqlik avtomatik ravishda o'lchanadi. Agar ball tushib qolsa, o'zgarish orqaga qaytariladi. Ishlab chiqarishda foydalanuvchilarning fikr-mulohazalari yig'iladi va to'plamga qo'shiladi.
Ishlab chiqarishda monitoring va regressiya
Baholash bir marta bajarilmaydi va tugallanadi. Uchta doimiy amaliyot:
- Regressiya testi: har bir taklif/qidiruv/model o'zgarishida oltin klasterni avtomatik ishga tushirish. Agar ball kamaytirilsa, o'zgarish teskari hisoblanadi. Bu "yaxshiroq qilish uchun uni buzish" oldini oladi.
- Ishlab chiqarish monitoringi: real savollarda "ma'lumot topa olmadim" darajasi, o'rtacha kechikish, narx, foydalanuvchi fikr-mulohazalari (👍/👎) nazorat qilinadi. "Bilmayman" ning keskin o'sishi ko'pincha indeks yoki qidirishning noto'g'ri ishlashining birinchi belgisidir.
- Fikr-mulohaza zanjiri: Foydalanuvchi tomonidan taqdim etilgan haqiqiy savollar 👎 ko'rib chiqiladi va oltin qoziqqa qo'shiladi; Shunday qilib, to'plam vaqt o'tishi bilan boyib boradi va tizimning ko'r joylari yopiladi.
Uchta mini korpus
1-holat - Ovozsiz regressiya. Jamoa uni "yaxshilash" uchun taklifni o'zgartirdi; Umumiy aniqlik oshdi, ammo tuzoq savollarida sodiqlik 30% ga kamaydi (model ko'proq mos kela boshladi). Agar oltin klasterdagi tuzoq savollari bo‘lmaganida, bu sezilmasdi; Regressiya testi o'zgarishni qaytardi.
2-holat - noto'g'ri oyoqni tekislash. Bir yordamchida javoblar yomon edi; Jamoa haftalar davomida tezkor ishladi. Qidiruv ko'rsatkichlarini o'lchaganimizda, qayta chaqirish@5 atigi 48% ni tashkil etdi - muammo yaratishda emas, balki qidirishda edi. Gibrid + qayta tartiblash qo'shilganda, eslab qolish 89% gacha oshdi va aniqlik ham oshdi.
3-holat - ishlab chiqarish haqida ogohlantirish. Bir kuni, yordamchi yordamchi uchun "Men ma'lumot topa olmadim" darajasi 6% dan 34% gacha ko'tarildi. Trackpad ogohlantirdi; Sababi, tunda ishlaydigan indekslash ishi jimgina muvaffaqiyatsizlikka uchragan va yangi maqolalar yuklanmagan. Monitoring bo‘lmaganida, “bilmayman” degan noto‘g‘ri gaplar bir necha kun davom etaverardi.
Umumiy xatolar
- "Bu men uchun yaxshi ishladi" bilan qoniqish: o'lchovsiz regressiya sezilmaydi.
- Qabul qilish va avlodni ajratmaslik: Siz noto'g'ri oyog'ingizni tuzatasiz va vaqtni behuda sarflaysiz.
- Tuzoq savollarini so'ramaslik: narsalarni yaratishga moyillik oltin klasterda ko'rinmaydi.
- Hakamni tasdiqlamaydi: noxolis hakamlar hay'ati yolg'on ishonch beradi.
- Ishlab chiqarishni kuzatib bormaslik: indeks muvaffaqiyatsizligi, xarajat portlashi jimgina davom etmoqda.
Xulosa
- RAGda olish va ishlab chiqarish sifati alohida o'lchanadi; Avval qaysi oyog'i shikastlanganligini aniqlash kerak.
- recall@k, precision@k, Qidiruv uchun MRR; Nasl uchun sodiqlik, moslik, to'liqlik ishlatiladi.
- Har bir o'lchov oltin klasterni talab qiladi; Unga haqiqiy, qiyin, tuzoq va qarama-qarshi savollarni qo'ying.
- LLM-hukmchi sifatida katta to'plamlar avtomatik ball; lekin sudyaning o'zi insonga nisbatan oqlanishi kerak.
- Regressiya testi, ishlab chiqarish monitoringi va qayta aloqa halqasi vaqt o'tishi bilan sifatni saqlab qoladi.
Ilova vazifasi
(1) O'zingizning yordamchingiz uchun kamida 15 ta savoldan iborat oltin to'plamni yarating: kamida 3 ta tuzoq (javoblar yo'q), 3 ta qiyin, 2 ta qarama-qarshi manba savollarini qo'shing. Har bir savol uchun kutilgan javobni va to'g'ri qismini yozing. (2) Ushbu to'plam bilan ikki xil tezkor versiyani qo'lda solishtiring; Har bir javobga sodiqlik va aniqlik uchun 1-5 ball bering. (3) Yuqoridagi LLM-sudyaviy so'rovni o'zingizning mezoningizga moslang. (4) Ishlab chiqarishda kuzatadigan 3 ta koʻrsatkichni aniqlang va har biri uchun “qaysi chegarada ogohlantiraman?” deb soʻrang. qiymatini yozing.
nazorat ro'yxati
- [ ] Saqlash va ishlab chiqarish sifatini alohida koʻrsatkichlar bilan oʻlchashim mumkin.
- [ ] Men recall@k, sodiqlik kabi ko'rsatkichlar nimani anglatishini bilaman.
- [ ] Men haqiqiy, qiyin, tuzoq va qarama-qarshi savollarni o'z ichiga olgan oltin klaster qura olaman.
- [ ] Men avtomatik baholashni oʻrnatishim va sudyani LLM-as-hakim bilan tekshirishim mumkin.
- [ ] Men regressiya testi, ishlab chiqarish monitoringi va fikr-mulohazalarni boshqarishim mumkin.