Gevinster:
- Definition af metrics, der måler fastholdelse og generationskvalitet separat
- Opsæt et guldspørgsmål og kør automatisk evaluering med LLM-as-judge
- Vedligeholdelse af kvalitet gennem feedback, overvågning og regressionstest i produktionen
Sætningen "Jeg har installeret assistenten, det ser ud til at fungere fint" er ikke en teknisk erklæring. RAG-systemer går lydløst i stykker: en ny dokumenttype narrer hentning, en hurtig ændring reducerer nøjagtigheden, indekset bliver forældet. Den eneste måde at indse dette på er at måle. I denne enhed dækker vi, hvordan man måler RAG-kvalitet (hentning og generering separat), automatisk evaluering (LLM-as-judge) og opretholder kvalitet i produktionen (monitorering, regression). "Du kan ikke forbedre det, du ikke måler" er mottoet for denne enhed.
Mål to separate ting
RAG har to ben og skal måles separat, fordi problemet kan være i en af dem:
- Hentekvalitet: Ankom den rigtige del?
- Generationskvalitet: Blev det rigtige svar produceret fra det indgående stykke?
Hvis svaret er dårligt, skal du først vide, hvilket ben der er dårligt. Hvis den rigtige del aldrig når frem, kan selv den bedste prompt ikke gemme (hentningsproblem). Hvis den korrekte del ankom, men modellen fejllæste den, er det nytteløst at forbedre genfindingen (generationsproblem).
Hentningsmål
Hentning er et sorterings-/adgangsproblem; målt ved klassiske informationssøgningsmetrikker. Til dette skal du have den gyldne klynge: viden om, hvilken brik der er "korrekt" for hvert spørgsmål.
metrisk
Hvilke foranstaltninger
Simpel definition
Recall@k
Er det rigtige stykke i toppen k?
Korrekt delfangsthastighed
præcision@k
Hvor mange af de k returnerede stykker er relevante?
Rengøring af det medbragte
MRR (gennemsnitlig gensidig rang)
I hvilken rækkefølge er det rigtige stykke?
Belønninger at være i de øverste rækker
Hit rate
Ankom der mindst et korrekt stykke?
Det mest grundlæggende mål for succes
Praktisk kommentar: Hvis Recall@k er lav, bør chunking- eller søgestrategi (hybrid, k, omrangering) omarbejdes. Hvis præcisionen er lav, men tilbagekaldelsen er høj, er det et godt træk at tilføje omplacering.
Generationsmålinger
Når den rigtige del ankommer, måler vi kvaliteten af den respons, som modellen producerer. Tre grundlæggende dimensioner:
- Trofasthed: Er hver påstand i svaret understøttet af kontekst? Er der noget passende? Det er et direkte mål for hallucination.
- Svarrelevans: Besvarer svaret rent faktisk spørgsmålet, eller er det off-topic?
- Fuldstændighed: Er alle relevante oplysninger i sammenhængen blevet brugt, eller mangler de?
Disse bedømmes ofte på et graderet grundlag (f.eks. 1-5), snarere end binære som "sandt/falskt".
Tip: Spor trofasthed som en separat metrik. Hvis trofastheden falder, efterhånden som nøjagtigheden falder, er problemet generation; Hvis trofastheden er høj, men svaret er forkert, er problemet den forkerte brik (hentning). Tilsammen er disse to målinger et kompas, der viser placeringen af fejlen.
Etablering af et gyldent spørgsmålssæt
Hver måling kræver et gyldent sæt / evalueringsdatasæt: realistiske spørgsmål + forventede rigtige svar + korrekte kildestykker. At starte med 30-50 velvalgte spørgsmål er bedre end 500 tilfældige spørgsmål. Inkluder følgende i sættet: ofte stillede rigtige spørgsmål, kendte vanskelige spørgsmål, fældespørgsmål uden svar (man bør sige "Jeg ved det ikke"), spørgsmål med modstridende kilder.
# Gyldne klyngeeksempel (konceptuelt)[ {"question": "Hvor mange dages årlig orlov?", "expected_answer": "14 dage for 1-5 års anciennitet", "correct_part_id": "two-part-3", "category": "orlov"}, {"question": "Hvor er virksomheden": fælden_NOT:IN?", "forventede virksomhedens Mars-kontor:IN?" Jeg kender ikke "correct_part_id": null, "category": "trap"}]
LLM-as-Judge: Automatisk vurdering
At score hundredvis af svar i hånden er trættende. LLM-as-judge model er, når en model scorer og begrunder en anden models svar ud fra bestemte kriterier. En god dommerprompt definerer klart kriterierne, giver eksempler og beder om begrundelse.
# LLM-som-dommer-prompt (konceptuel) Du er en upartisk evaluator. Vurder nedenstående SVAR i henhold til den givne KONTEKST og FORVENTEDE SVAR. Score (1-5) og begrund:- trofasthed: understøttes hver påstand i svaret i sammenhæng?- nøjagtighed: stemmer svaret overens med det forventede svar?- fuldstændighed: er de relevante oplysninger fuldstændige? Især: hvis svaret indeholder oplysninger, der ikke er i sammenhængen, giv trofasthed1 og angiv, hvilken påstand der er opdigtet. KONTEKST: {kontekst} FORVENTET: {forventet}SVAR: {svar}Output: {trofasthed, nøjagtighed, fuldstændighed, begrundelse}
Forsigtig: LLM-som-dommer er ikke perfekt; De kan have deres egne skævheder (langt svar, foretrækker deres egen stil). Bekræft også dommer: få nogle svar scoret af både dommeren og mennesket, og mål overensstemmelsen mellem dem. Hvis Judge er i overensstemmelse med menneskelige scoringer, kan du stole på ham.
Svag/stærk vurdering
Svag ("det var godt for mig"):
Jeg stillede et par spørgsmål, og svarene virkede gode. Jeg har det live.# Problem: ingen målinger, regression umærkelig, forbedring blind.
Kraftfuld (guldklynge + diskrete metrics + automatisk bedømmelse + regression):
Gyldne klynge med 40 spørgsmål. Med hver ændring, recall@5, måles trofasthed og nøjagtighed automatisk. Hvis scoren falder, rulles ændringen tilbage. I produktionen indsamles brugerfeedback og tilføjes sættet.
Overvågning og regression i produktionen
Evaluering foretages ikke én gang og afsluttes. Tre konstante øvelser:
- Regressionstest: Kør automatisk gylden klynge ved hver prompt/hentning/modelændring. Hvis scoren reduceres, vendes ændringen. Dette forhindrer "at bryde det, mens du prøver at gøre det bedre".
- Produktionsovervågning: "Jeg kunne ikke finde information" rate i rigtige spørgsmål, gennemsnitlig forsinkelse, omkostninger, brugerfeedback (👍/👎) overvåges. En pludselig stigning i "Jeg ved det ikke" er ofte det første tegn på en indeks- eller genfindingsfejl.
- Feedback loop: De rigtige spørgsmål stillet af brugeren 👎 gennemgås og føjes til den gyldne bunke; Dermed bliver sættet rigere med tiden, og systemets blinde vinkler lukkes.
Tre mini etuier
Case 1 - Silent regression. Et team ændrede prompten for at "forbedre" den; Den generelle nøjagtighed steg, men trofastheden faldt med 30 % i fældespørgsmål (modellen begyndte at passe mere). Det ville ikke være blevet bemærket, hvis det ikke var for fældespørgsmålene i den gyldne klynge; Regressionstest vendte ændringen tilbage.
Tilfælde 2 — Retning af det forkerte ben. Hos en assistent var svarene dårlige; Holdet arbejdede på prompten i uger. Da vi målte genfindingsmålingerne, var recall@5 kun 48 % - problemet var i genfinding, ikke generation. Da hybrid + omrangering blev tilføjet, steg tilbagekaldelsen til 89 %, og nøjagtigheden steg også.
Case 3 — Produktionsadvarsel. En dag steg "Jeg kunne ikke finde information"-raten for en supportassistent fra 6 % til 34 %. Pegefeltet advarede; Årsagen var, at indekseringsjobbet, der kører om natten, stille og roligt mislykkedes, og nye artikler blev ikke uploadet. Uden overvågning ville forkerte "Jeg ved det ikke"-udsagn have fortsat i dagevis.
Almindelige fejl
- At være tilfreds med "det fungerede godt for mig": Uden måling går regression ubemærket hen.
- Ikke adskille hentning og generation: Du vil rette det forkerte ben og spilde tid.
- Ikke at stille fældespørgsmål: Tendensen til at finde på ting optræder ikke i den gyldne klynge.
- Ikke verificerende dommer: En forudindtaget jury giver falsk tillid.
- Overvåger ikke produktionen: Indeksfejl, omkostningseksplosion fortsætter lydløst.
Sammenfattende
- I RAG måles genfinding og generationskvalitet separat; Det skal først fastslås, hvilket ben der er beskadiget.
- recall@k, precision@k, MRR for Retrieval; Trofasthed, egnethed, fuldstændighed bruges til generation.
- Hver måling kræver en guldklynge; Sæt rigtige, svære, fælde og modstridende spørgsmål i det.
- LLM-som-dommer store sæt auto-scores; men dommeren selv skal retfærdiggøres mod mennesket.
- Regressionstest, produktionsovervågning og en feedback-loop opretholder kvaliteten over tid.
Ansøgningsopgave
(1) Lav et gyldent sæt med mindst 15 spørgsmål til din egen assistent: medtag mindst 3 fælder (ingen svar), 3 svære, 2 modstridende kildespørgsmål. Skriv det forventede svar og den rigtige del til hvert spørgsmål. (2) Sammenlign manuelt to forskellige promptversioner med dette sæt; Giv hvert svar 1-5 point for trofasthed og nøjagtighed. (3) Tilpas LLM-as-dommer-prompten ovenfor til dine egne kriterier. (4) Identificer 3 målinger, du vil spore i produktionen, og spørg for hver "ved hvilken tærskel alarmerer jeg?" skriv værdien.
tjekliste
- [ ] Jeg kan måle retention og generationskvalitet med separate metrics.
- [ ] Jeg ved, hvad målinger som recall@k, trofasthed betyder.
- [ ] Jeg kan bygge en gylden klynge, der inkluderer rigtige, svære, fælder og modstridende spørgsmål.
- [ ] Jeg kan opsætte automatisk evaluering og verificere dommeren med LLM-som-dommer.
- [ ] Jeg kan betjene regressionstest, produktionsovervågning og feedback-loop.