Qazanclar:
- Saxlama və istehsal keyfiyyətini ayrıca ölçən metriklərin müəyyən edilməsi
- Qızıl sual dəstini qurun və LLM-as-hakim ilə avtomatik qiymətləndirmə aparın
- İstehsalda əks əlaqə, monitorinq və reqressiya testi vasitəsilə keyfiyyətin qorunması
“Mən köməkçi quraşdırdım, deyəsən yaxşı işləyir” cümləsi mühəndislik ifadəsi deyil. RAG sistemləri səssizcə pozulur: yeni sənəd növü axtarışı aldadır, operativ dəyişiklik dəqiqliyi azaldır, indeks köhnəlir. Bunu həyata keçirməyin yeganə yolu ölçməkdir. Bu bölmədə biz RAG keyfiyyətinin necə ölçüləcəyini (alma və generasiya ayrı-ayrılıqda), avtomatik qiymətləndirmənin (LLM-hakim kimi) və istehsalda keyfiyyətin necə qorunacağını (monitorinq, reqressiya) əhatə edirik. "Ölçmədiyinizi təkmilləşdirə bilməzsiniz" bu bölmənin şüarıdır.
İki ayrı şeyi ölçün
RAG-ın iki ayağı var və ayrıca ölçülməlidir, çünki problem onların hər birində ola bilər:
- Axtarış keyfiyyəti: Düzgün hissə gəldimi?
- Nəsil keyfiyyəti: Gələn parçadan düzgün cavab verilibmi?
Cavab pisdirsə, əvvəlcə hansı ayağın pis olduğunu bilməlisiniz. Doğru hissə heç vaxt gəlmirsə, hətta ən yaxşı əmr də saxlaya bilməz (alma problemi). Düzgün hissə gəlibsə, lakin model onu səhv oxuyubsa, axtarışı təkmilləşdirmək əbəsdir (nəsil problemi).
Axtarış Metrikləri
Axtarış çeşidləmə/giriş problemidir; klassik məlumat axtarış göstəriciləri ilə ölçülür. Bunun üçün qızıl klasterə sahib olmalısınız: hər bir sual üçün hansı parçanın "düzgün" olduğunu bilmək.
metrik
Nə tədbirlər
Sadə tərif
Recall@k
Üst k-də düzgün parça varmı?
Düzgün hissə tutma dərəcəsi
precision@k
Qaytarılan k ədəddən neçəsi müvafiqdir?
Gətirilənlərin təmizlənməsi
MRR (Orta Qarşılıqlı Rank)
Düzgün parça hansı sıradadır?
Mükafatlar üst sıralarda olmaq
Vuruş dərəcəsi
Ən azı bir düzgün parça gəldi?
Uğurun ən əsas ölçüsü
Praktiki şərh: Əgər Recall@k aşağıdırsa, parçalanma və ya axtarış strategiyası (hibrid, k, yenidən sıralama) yenidən işlənməlidir. Dəqiqlik aşağıdırsa, lakin geri çağırma yüksəkdirsə, yenidən sıralama əlavə etmək yaxşı bir addımdır.
Nəsil Metrikləri
Düzgün hissə gəldikdə, model tərəfindən istehsal olunan cavabın keyfiyyətini ölçürük. Üç əsas ölçü:
- Sədaqət: Cavabdakı hər bir iddia kontekstlə dəstəklənirmi? Uyğunluq varmı? Bu, hallüsinasiyanın birbaşa ölçüsüdür.
- Cavabın aktuallığı: Cavab əslində suala cavab verir, yoxsa mövzudan kənardır?
- Tamlıq: Kontekstdəki bütün müvafiq məlumatlardan istifadə edilibmi və ya yoxdur?
Bunlar çox vaxt “doğru/yanlış” kimi ikili deyil, pilləli əsasda (məsələn, 1-5) qiymətləndirilir.
İpucu: Sadiqliyi ayrıca metrik olaraq izləyin. Dəqiqlik azaldıqca sadiqlik azalırsa, problem nəsildir; Sədaqət yüksəkdirsə, lakin cavab səhvdirsə, problem səhv parçadır (alınma). Bu iki göstərici birlikdə nasazlığın yerini göstərən kompasdır.
Qızıl sual dəstinin yaradılması
Hər bir ölçmə qızıl dəst/qiymətləndirmə verilənlər bazası tələb edir: real suallar + gözlənilən düzgün cavablar + düzgün mənbə parçaları. 30-50 yaxşı seçilmiş sualla başlamaq 500 təsadüfi sualdan daha yaxşıdır. Dəstəyə aşağıdakıları daxil edin: tez-tez verilən real suallar, məlum çətin suallar, cavabı olmayan tələ suallar (“bilmirəm” demək lazımdır), ziddiyyətli mənbələri olan suallar.
# Qızıl klaster nümunəsi (konseptual)[ {"sual": "İllik məzuniyyət neçə gündür?", "gözlənilən_cavab": "1-5 il iş stajı üçün 14 gün", "düzgün_hissə_id": "iki hissə-3", "kateqoriya": "buraxmaq"}, {"sual": "gözlənilən_cavab": "şirkət haradadır?" "NO_MƏLUMAT", # tələ: "doğru_hissə_id"ini bilmirəm: null, "kateqoriya": "tələ"}]
Hakim kimi LLM: Avtomatik Qiymətləndirmə
Yüzlərlə cavabı əl ilə hesablamaq yorucudur. LLM-hakim kimi modeli, bir modelin müəyyən meyarlar əsasında digər modelin cavabını qiymətləndirməsi və əsaslandırmasıdır. Yaxşı hakim meyarları aydın şəkildə müəyyənləşdirir, misallar gətirir və əsaslandırma tələb edir.
# LLM-hakim kimi tez (konseptual) Siz qərəzsiz qiymətləndiricisiniz. Aşağıdakı CAVabı verilmiş kontekstə və GÖZLƏNİLƏN CAVABA görə qiymətləndirin. Bal (1-5) və əsaslandırın:- sadiqlik: cavabdakı hər bir iddia kontekstdə dəstəklənirmi?- dəqiqlik: cavab gözlənilən cavaba uyğun gəlirmi?- tamlıq: müvafiq məlumat tamdırmı? Xüsusilə: əgər cavab kontekstdə olmayan məlumatı ehtiva edirsə, sədaqəti1 göstərin və hansı iddianın uydurma olduğunu göstərin. KONtekst: {kontekst}Gözlənilən: {gözlənilən}CAVAB: {cavab}Nəticə: {sədaqət, dəqiqlik, tamlıq, əsaslandırma}
Diqqət: LLM hakim kimi mükəmməl deyil; Onların öz qərəzləri ola bilər (uzun cavab, öz üslubuna üstünlük verir). Həmçinin Hakimi yoxlayın: həm hakim, həm də insan tərəfindən verilən bəzi cavablara sahib olun və aralarındakı razılığı ölçün. Hakim insan xallarına uyğundursa, ona etibar edə bilərsiniz.
Zəif/Güclü Reytinq
Zəif ("mənim üçün yaxşı idi"):
Bir neçə sual verdim və cavablar yaxşı görünürdü. Mən onu canlı əldə etdim. # Problem: ölçmə yoxdur, reqressiya hiss olunmur, yaxşılaşma kordur.
Güclü (qızıl klaster + diskret ölçülər + avtomatik mühakimə + reqressiya):
40 sualdan ibarət qızıl klaster. Hər dəyişikliklə, recall@5, sədaqət və dəqiqlik avtomatik olaraq ölçülür. Hesab aşağı düşərsə, dəyişiklik geri qaytarılır. İstehsalda istifadəçi rəyləri toplanır və setə əlavə edilir.
İstehsalda Monitorinq və Reqressiya
Qiymətləndirmə bir dəfə aparılmır və bitmir. Üç daimi təcrübə:
- Reqressiya testi: Hər sorğuda/istiqamətdə/model dəyişikliyində avtomatik işə salınan qızıl klaster. Əgər xal azalarsa, dəyişiklik əks olunur. Bu, "daha yaxşılaşdırmağa çalışarkən onu pozmağın" qarşısını alır.
- İstehsalın monitorinqi: Real suallarda "məlumat tapa bilmədim" dərəcəsi, orta gecikmə, xərc, istifadəçi rəyi (👍/👎) izlənilir. "Bilmirəm" ifadəsinin qəfil artması tez-tez indeksin və ya axtarışın nasazlığının ilk əlamətidir.
- Geribildirim döngəsi: İstifadəçi tərəfindən verilən real suallar 👎 nəzərdən keçirilir və qızıl yığına əlavə olunur; Beləliklə, dəst zaman keçdikcə zənginləşir və sistemin kor nöqtələri bağlanır.
Üç mini qutu
1-ci hal – Səssiz reqressiya. Komanda onu "təkmilləşdirmək" üçün əmri dəyişdirdi; Ümumi dəqiqlik artdı, lakin tələ suallarında sədaqət 30% azaldı (model daha çox uyğunlaşmağa başladı). Qızıl salxımdakı tələ sualları olmasaydı, buna diqqət yetirilməzdi; Reqressiya testi dəyişikliyi geri qaytardı.
2-ci hal - yanlış ayağın düzəldilməsi. Bir köməkçidə cavablar pis idi; Komanda həftələrlə tez çalışdı. Axtarış göstəricilərini ölçəndə geri çağırma@5 cəmi 48% idi - problem nəsil deyil, axtarışda idi. Hibrid + yenidən sıralama əlavə edildikdə, geri çağırma 89%-ə yüksəldi və dəqiqlik də artdı.
Hal 3 - İstehsal xəbərdarlığı. Bir gün dəstək köməkçisi üçün "məlumat tapa bilmədim" dərəcəsi 6%-dən 34%-ə yüksəldi. Trackpad xəbərdarlıq etdi; Səbəb isə gecələr işləyən indeksləşdirmə işinin səssizcə uğursuz olması və yeni məqalələrin yüklənməməsi olub. Monitorinq olmasaydı, günlərlə yanlış “bilmirəm” ifadələri davam edərdi.
Ümumi səhvlər
- “Mənim üçün yaxşı işlədi” ilə kifayətlənmək: Ölçmə olmadan, reqressiya diqqətdən kənarda qalır.
- Axtarış və nəsil ayırma: Siz səhv ayağı düzəldəcək və vaxt itirəcəksiniz.
- Tələ suallar verməmək: Hər şeyi düzəltmək meyli qızıl çoxluqda görünmür.
- Hakimin yoxlanılması: Qərəzli münsiflər heyəti saxta etimad verir.
- İstehsalın yoxlanılması: İndeks uğursuzluğu, xərc partlayışı səssizcə davam edir.
Xülasə
- RAG-da axtarış və generasiya keyfiyyəti ayrıca ölçülür; Əvvəlcə hansı ayağın zədələndiyi müəyyən edilməlidir.
- recall@k, precision@k, Axtarış üçün MRR; Nəsil üçün sadiqlik, uyğunluq, tamlıq istifadə olunur.
- Hər bir ölçmə qızıl klaster tələb edir; İçinə real, çətin, tələ və ziddiyyətli suallar qoyun.
- LLM-hakim kimi böyük dəstlər avtomatik xallar; lakin hakimin özü insana qarşı haqlı olmalıdır.
- Reqressiya testi, istehsalın monitorinqi və geribildirim döngəsi zamanla keyfiyyəti qoruyur.
Tətbiq tapşırığı
(1) Öz köməkçiniz üçün ən azı 15 sualdan ibarət qızıl dəst yaradın: ən azı 3 tələ (cavab yoxdur), 3 çətin, 2 ziddiyyətli mənbə sualı daxil edin. Hər sual üçün gözlənilən cavabı və düzgün hissəsini yazın. (2) Bu dəstlə iki müxtəlif xəbərdar versiyanı əl ilə müqayisə edin; Sədaqət və dəqiqlik üçün hər cavaba 1-5 xal verin. (3) Yuxarıdakı hakim kimi LLM əmrini öz kriteriyalarınıza uyğunlaşdırın. (4) İstehsalda izləyəcəyiniz 3 göstəricini müəyyənləşdirin və hər biri üçün “mən hansı həddə həyəcan verirəm?” sualını verin. dəyərini yazın.
yoxlama siyahısı
- [ ] Mən saxlama və istehsal keyfiyyətini ayrı-ayrı ölçülərlə ölçə bilərəm.
- [ ] Mən recall@k, sadiqlik kimi göstəricilərin nə demək olduğunu bilirəm.
- [ ] Mən real, çətin, tələ və ziddiyyətli suallardan ibarət qızıl klaster qura bilərəm.
- [ ] Mən avtomatik qiymətləndirmə qura və hakimi hakim kimi LLM ilə yoxlaya bilərəm.
- [ ] Mən reqressiya testini, istehsalın monitorinqini və əks əlaqəni idarə edə bilərəm.