Ieguvumi:
- Metrikas definēšana, kas atsevišķi mēra saglabāšanas un ģenerēšanas kvalitāti
- Iestatiet zelta jautājumu kopu un palaidiet automātisko novērtēšanu ar LLM-as-judge
- Kvalitātes uzturēšana, izmantojot atgriezenisko saiti, uzraudzību un regresijas testēšanu ražošanā
Teikums "Es uzstādīju palīgu, šķiet, ka tas darbojas labi" nav inženiertehnisks paziņojums. RAG sistēmas sabojājas klusi: jauns dokumenta veids apmāna izguvi, tūlītējas izmaiņas samazina precizitāti, indekss kļūst novecojis. Vienīgais veids, kā to saprast, ir izmērīt. Šajā nodaļā mēs aplūkojam RAG kvalitātes mērīšanu (atsevišķi izguve un ģenerēšana), automātisko novērtēšanu (LLM-as-judge) un ražošanas kvalitātes uzturēšanu (uzraudzība, regresija). “Tu nevari uzlabot to, ko nemēri” ir šīs vienības devīze.
Izmēriet divas atsevišķas lietas
RAG ir divas kājas, un tās jāmēra atsevišķi, jo problēma var būt vienā no tām:
- Izguves kvalitāte: vai tika saņemta pareizā daļa?
- Paaudzes kvalitāte: vai pareizā atbilde tika iegūta no ienākošā gabala?
Ja atbilde ir slikta, vispirms ir jāzina, kura kāja ir slikta. Ja īstā daļa nekad netiek saņemta, pat vislabāko uzvedni nevar saglabāt (izguves problēma). Ja ir saņemta pareizā daļa, bet modelis to nepareizi nolasīja, izguves uzlabošana ir veltīga (paaudzes problēma).
Izguves metrika
Atgūšana ir šķirošanas/piekļuves problēma; mēra ar klasisko informācijas izguves metriku. Šim nolūkam jums ir jābūt zelta klasterim: zināšanām par to, kurš gabals ir "pareizs" katram jautājumam.
metriska
Kādi pasākumi
Vienkārša definīcija
Atsaukt @k
Vai pareizais gabals ir augšējā k?
Pareizs detaļu uztveršanas ātrums
precizitāte@k
Cik no k gabaliem, kas atgriezti, ir atbilstoši?
Atnestā tīrīšana
MRR (vidējais savstarpējais rangs)
Kādā secībā ir pareizais gabals?
Atalgojums augstākajās rindās
Rezultātu līmenis
Vai ieradās vismaz viens pareizais gabals?
Visvienkāršākā veiksmes mēraukla
Praktisks komentārs: ja Recall@k ir zems, gabalos vai meklēšanas stratēģija (hibrīds, k, pārkārtošana) ir jāpārstrādā. Ja precizitāte ir zema, bet atsaukšana ir augsta, pārkārtošanas pievienošana ir labs solis.
Paaudzes metrika
Kad tiek saņemta pareizā daļa, mēs izmērām modeļa radītās atbildes kvalitāti. Trīs pamata izmēri:
- Uzticība: vai katrs atbildes apgalvojums ir pamatots ar kontekstu? Vai ir kāds stiprinājums? Tas ir tiešs halucinācijas rādītājs.
- Atbildes atbilstība: vai atbilde patiešām atbild uz jautājumu vai arī tā ir ārpus tēmas?
- Pilnīgums: vai visa kontekstā esošā informācija ir izmantota vai arī tās trūkst?
Tie bieži tiek vērtēti pēc atzīmes (piemēram, 1–5), nevis bināri, piemēram, “patiess/nepatiess”.
Padoms. Izsekojiet uzticību kā atsevišķu metriku. Ja uzticība samazinās, precizitātei samazinoties, problēma ir ģenerēšana; Ja uzticība ir augsta, bet atbilde ir nepareiza, problēma ir nepareizā gabalā (atgūšana). Šie divi rādītāji kopā ir kompass, kas parāda bojājuma vietu.
Zelta jautājumu kopas izveide
Katram mērījumam ir nepieciešama zelta kopa / novērtējuma datu kopa: reālistiski jautājumi + paredzamās pareizās atbildes + pareizie avota gabali. Sākt ar 30–50 labi izvēlētiem jautājumiem ir labāk nekā 500 nejauši izvēlētiem jautājumiem. Komplektā iekļaujiet: bieži uzdotos reālos jautājumus, zināmos sarežģītos jautājumus, slazdu jautājumus, kuriem nav atbildes (jāsaka "es nezinu"), jautājumus ar pretrunīgiem avotiem.
# Zelta klastera piemērs (konceptuāls)[ {"question": "Cik dienas ir ikgadējā atvaļinājuma?", "expected_answer": "14 dienas par 1-5 gadu darba stāžu", "correct_part_id": "two-part-3", "category": "atvaļinājums"}, {"question": "Kur atrodas uzņēmuma birojs", "saredzams_atbilde?" "NO_INFORMATION", # trap: es nezinu "correct_part_id": null, "category": "trap"}]
LLM-as-Judge: automātiskais novērtējums
Vērtēt simtiem atbilžu ar roku ir nogurdinoši. LLM-as-Judge modelis ir tad, kad viens modelis novērtē un pamato cita modeļa atbildi, pamatojoties uz noteiktiem kritērijiem. Labs tiesnesis skaidri definē kritērijus, sniedz piemērus un lūdz pamatojumu.
# LLM kā tiesneša uzvedne (konceptuāla) Jūs esat objektīvs vērtētājs. Novērtējiet tālāk sniegto ATBILDI saskaņā ar doto KONTEKSTU un GAIDĀTO ATBILDI. Vērtējums (1-5) un pamatojums:- patiesums: vai katrs atbildes apgalvojums ir pamatots kontekstā?- precizitāte: vai atbilde atbilst gaidītajai atbildei?- pilnība: vai attiecīgā informācija ir pilnīga? Jo īpaši: ja atbilde satur informāciju, kas nav kontekstā, norādiet patiesumu1 un norādiet, kurš apgalvojums ir izdomāts.KONTEKSTS: {konteksts}GAIDĀTS: {expected}ATBILDE: {atbilde}Izvade: {uzticība, precizitāte, pilnīgums, pamatojums}
Uzmanību: LLM kā tiesnesis nav ideāls; Viņiem var būt savi aizspriedumi (gara atbilde, dodot priekšroku savam stilam). Pārbaudiet arī tiesnesi: palūdziet, lai gan tiesnesis, gan cilvēks novērtē dažas atbildes, un novērtējiet vienošanos starp viņiem. Ja tiesnesis atbilst cilvēku rezultātiem, varat viņam uzticēties.
Vājš/Spēcīgs vērtējums
Vāji ("tas man bija labs"):
Es uzdevu dažus jautājumus, un atbildes šķita labas. Man tas ir tiešraidē.# Problēma: nav mērījumu, regresija nemanāma, uzlabojumi akli.
Jaudīgi (zelta kopa + diskrēta metrika + automātisks spriedums + regresija):
Zelta 40 jautājumu kopa. Ar katru izmaiņu, atsaukšanu@5, uzticība un precizitāte tiek mērīta automātiski. Ja rezultāts samazinās, izmaiņas tiek atceltas. Ražošanā lietotāju atsauksmes tiek apkopotas un pievienotas komplektam.
Uzraudzība un regresija ražošanā
Novērtēšana netiek veikta vienreiz un pabeigta. Trīs pastāvīgas prakses:
- Regresijas pārbaude: automātiski palaist zelta kopu katrā uzvednē/izguves/modeļa maiņas reizē. Ja rezultāts tiek samazināts, izmaiņas tiek apgrieztas. Tas novērš to "salauzt, mēģinot to uzlabot".
- Ražošanas uzraudzība: "Nevarēju atrast informāciju" likme reālos jautājumos, tiek uzraudzīta vidējā kavēšanās, izmaksas, lietotāju atsauksmes (👍/👎). Pēkšņs "es nezinu" pieaugums bieži vien ir pirmā indeksa vai izguves darbības traucējumu pazīme.
- Atsauksmju cilpa: reālie lietotāja sniegtie jautājumi 👎 tiek pārskatīti un pievienoti zelta kaudzītei; Tādējādi komplekts laika gaitā kļūst bagātāks un sistēmas aklās zonas tiek aizvērtas.
Trīs mini futrāļi
1. gadījums — klusā regresija. Komanda mainīja uzvedni, lai to "uzlabotu"; Vispārējā precizitāte palielinājās, bet uzticība samazinājās par 30% lamatas jautājumos (modelis sāka vairāk atbilst). Tas nebūtu pamanīts, ja nebūtu slazdu jautājumi zelta klasterī; Regresijas testēšana mainīja izmaiņas.
2. gadījums — nepareizās kājas iztaisnošana. Vienam palīgam atbildes bija sliktas; Komanda strādāja pie uzvednes nedēļām ilgi. Kad mēs mērījām izguves metriku, atsaukšana@5 bija tikai 48% — problēma bija izguvē, nevis ģenerēšanā. Kad tika pievienota hibrīda + pārkārtošana, atsaukšana palielinājās līdz 89%, kā arī palielinājās precizitāte.
3. gadījums — ražošanas brīdinājums. Kādu dienu atbalsta asistenta rādītājs "Es nevarēju atrast informāciju" uzlēca no 6% līdz 34%. Skārienpaliktnis brīdināja; Iemesls bija tāds, ka indeksēšanas darbs, kas darbojas naktī, klusi neizdevās un jauni raksti netika augšupielādēti. Bez uzraudzības aplami "nezinu" paziņojumi būtu turpinājušies dienām ilgi.
Biežas kļūdas
- Būt apmierinātam ar “tas man darbojās labi”: bez mērījumiem regresija paliek nepamanīta.
- Nenošķirt izgūšanu un ģenerēšanu: jūs izlabosit nepareizo kāju un tērēsit laiku.
- Neuzdot lamatas jautājumus: tieksme kaut ko izdomāt neparādās zelta klasterī.
- Nepārbauda tiesnesi: neobjektīva žūrija sniedz nepatiesu pārliecību.
- Nepārrauga ražošanu: indeksa kļūme, izmaksu eksplozija turpinās klusi.
Rezumējot
- RAG izguves un ģenerēšanas kvalitāti mēra atsevišķi; Vispirms ir jānosaka, kura kāja ir bojāta.
- atsaukšana@k, precizitāte@k, MRR izguvei; Paaudzei tiek izmantota uzticība, piemērotība, pabeigtība.
- Katram mērījumam ir nepieciešams zelta klasteris; Ievietojiet tajā reālus, sarežģītus, slazdošus un pretrunīgus jautājumus.
- LLM-as-tiesnesis lielu komplektu auto-scores; bet tiesnesim pašam ir jābūt attaisnotam pret cilvēku.
- Regresijas pārbaude, ražošanas uzraudzība un atgriezeniskās saites cilpa saglabā kvalitāti laika gaitā.
Lietojumprogrammas uzdevums
(1) Izveidojiet savam palīgam zelta komplektu ar vismaz 15 jautājumiem: iekļaujiet vismaz 3 slazdus (nav atbilžu), 3 sarežģītus, 2 pretrunīgus avota jautājumus. Katram jautājumam uzrakstiet sagaidāmo atbildi un pareizo daļu. (2) Manuāli salīdziniet divas dažādas uzvednes versijas ar šo komplektu; Katrai atbildei piešķiriet 1-5 punktus par uzticamību un precizitāti. (3) Pielāgojiet iepriekš minēto uzvedni LLM kā tiesnesis atbilstoši saviem kritērijiem. (4) Identificējiet 3 metriku, ko izsekosit ražošanas procesā, un katram jautājiet: “Pie kāda sliekšņa man jāraida trauksme?” uzrakstiet vērtību.
kontrolsaraksts
- [ ] Es varu izmērīt saglabāšanas un ģenerēšanas kvalitāti, izmantojot atsevišķus rādītājus.
- [ ] Es zinu, ko nozīmē tādi rādītāji kā atsaukšana@k, uzticība.
- [ ] Es varu izveidot zelta kopu, kas ietver reālus, sarežģītus, lamatas un pretrunīgus jautājumus.
- [ ] Es varu iestatīt automātisku novērtēšanu un pārbaudīt tiesnesi ar LLM-as-judge.
- [ ] Es varu veikt regresijas testēšanu, ražošanas uzraudzību un atgriezeniskās saites cilpu.