Gewinne:
- Definieren von Metriken, die die Aufbewahrungs- und Generierungsqualität getrennt messen
- Richten Sie einen Gold-Fragensatz ein und führen Sie eine automatische Bewertung mit LLM als Richter durch
- Aufrechterhaltung der Qualität durch Feedback, Überwachung und Regressionstests in der Produktion
Der Satz „Ich habe den Assistenten installiert, er scheint einwandfrei zu funktionieren“ ist keine technische Aussage. RAG-Systeme brechen geräuschlos zusammen: Ein neuer Dokumenttyp verfälscht den Abruf, eine sofortige Änderung verringert die Genauigkeit, der Index wird veraltet. Der einzige Weg, dies zu erkennen, ist das Messen. In dieser Einheit behandeln wir die Messung der RAG-Qualität (getrennter Abruf und Generierung), die automatische Bewertung (LLM-as-Judge) und die Aufrechterhaltung der Qualität in der Produktion (Überwachung, Regression). „Was man nicht misst, kann man nicht verbessern“, lautet das Motto dieser Einheit.
Messen Sie zwei verschiedene Dinge
RAG hat zwei Zweige und muss separat gemessen werden, da das Problem in einem von beiden liegen kann:
- Abrufqualität: Ist das richtige Teil angekommen?
- Generierungsqualität: Wurde aus dem eingehenden Stück die richtige Antwort generiert?
Wenn die Antwort schlecht ist, müssen Sie zuerst wissen, welches Bein schlecht ist. Wenn das richtige Teil nie ankommt, kann selbst die beste Eingabeaufforderung nicht speichern (Abrufproblem). Wenn das richtige Teil angekommen ist, das Modell es aber falsch gelesen hat, ist eine Verbesserung des Abrufs zwecklos (Generierungsproblem).
Abrufmetriken
Das Abrufen ist ein Sortier-/Zugriffsproblem. gemessen anhand klassischer Information-Retrieval-Metriken. Dafür müssen Sie über den goldenen Cluster verfügen: das Wissen darüber, welcher Teil für jede Frage „richtig“ ist.
metrisch
Welche Maßnahmen
Einfache Definition
Rückruf@k
Ist das richtige Teil im oberen K?
Korrekte Teileerfassungsrate
Präzision@k
Wie viele der zurückgegebenen k Teile sind relevant?
Reinigung des Mitgebrachten
MRR (mittlerer reziproker Rang)
In welcher Reihenfolge ist das richtige Teil?
Belohnungen liegen in den oberen Rängen
Trefferquote
Ist mindestens ein richtiges Stück angekommen?
Der grundlegendste Maßstab für Erfolg
Praktischer Kommentar: Wenn Recall@k niedrig ist, sollte die Chunking- oder Suchstrategie (Hybrid, k, Re-Ranking) überarbeitet werden. Wenn die Präzision gering, die Erinnerung aber hoch ist, ist das Hinzufügen einer Neubewertung ein guter Schachzug.
Generationsmetriken
Wenn das richtige Teil eintrifft, messen wir die Qualität der vom Modell erzeugten Antwort. Drei Grunddimensionen:
- Treue: Wird jede Behauptung in der Antwort durch den Kontext gestützt? Gibt es eine passende? Es ist ein direktes Maß für Halluzinationen.
- Antwortrelevanz: Beantwortet die Antwort tatsächlich die Frage oder ist sie nicht thematisch?
- Vollständigkeit: Wurden alle relevanten Informationen im Kontext verwendet oder fehlen sie?
Diese werden häufig auf einer abgestuften Basis (z. B. 1–5) und nicht binär wie „wahr/falsch“ bewertet.
Tipp: Verfolgen Sie die Treue als separate Metrik. Wenn die Treue mit abnehmender Genauigkeit abnimmt, liegt das Problem in der Generierung; Wenn die Treue hoch ist, aber die Antwort falsch ist, liegt das Problem am falschen Teil (Abruf). Zusammen bilden diese beiden Metriken einen Kompass, der den Ort des Fehlers anzeigt.
Erstellen eines goldenen Fragensatzes
Für jede Messung ist ein Golden Set/Bewertungsdatensatz erforderlich: realistische Fragen + erwartete richtige Antworten + korrekte Quellteile. Es ist besser, mit 30–50 gut ausgewählten Fragen zu beginnen, als mit 500 zufälligen Fragen. Nehmen Sie Folgendes in den Satz auf: häufig gestellte echte Fragen, bekanntermaßen schwierige Fragen, Fallfragen ohne Antworten (man sollte „Ich weiß nicht“ sagen) und Fragen mit widersprüchlichen Quellen.
# Golden-Cluster-Beispiel (konzeptionell)[ {"question": "Wie viele Tage Jahresurlaub?", "expected_answer": "14 Tage für 1-5 Jahre Betriebszugehörigkeit", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Wo ist das Mars-Büro des Unternehmens?", "expected_answer": "NO_INFORMATION", # trap: Nein know „correct_part_id“: null, „category“: „trap“}]
LLM-as-Judge: Automatische Bewertung
Es ist ermüdend, Hunderte von Antworten per Hand zu bewerten. Beim LLM-as-Judge-Modell bewertet und begründet ein Modell die Antwort eines anderen Modells anhand bestimmter Kriterien. Eine gute Richteraufforderung definiert klar die Kriterien, nennt Beispiele und bittet um Begründung.
# LLM-als-Richter-Eingabeaufforderung (konzeptionell) Sie sind ein unparteiischer Bewerter. Bewerten Sie die ANTWORT unten anhand des angegebenen KONTEXTS und der ERWARTETEN ANTWORT. Bewerten Sie (1–5) und begründen Sie: – Glaubwürdigkeit: Wird jede Behauptung in der Antwort im Kontext gestützt? – Genauigkeit: Entspricht die Antwort der erwarteten Antwort? – Vollständigkeit: Sind die relevanten Informationen vollständig? Insbesondere: Wenn die Antwort Informationen enthält, die nicht im Kontext stehen, geben Sie Treue1 an und geben Sie an, welche Behauptung erfunden ist.CONTEXT: {context}ERWARTET: {erwartet}ANTWORT: {answer}Ausgabe: {Treue, Genauigkeit, Vollständigkeit, Rechtfertigung}
Achtung: LLM-als-Richter ist nicht perfekt; Sie haben möglicherweise ihre eigenen Vorurteile (lange Antwort, bevorzugen ihren eigenen Stil). Überprüfen Sie auch den Richter: Lassen Sie einige Antworten sowohl vom Richter als auch vom Menschen bewerten und messen Sie die Übereinstimmung zwischen ihnen. Wenn Judge mit menschlichen Bewertungen übereinstimmt, können Sie ihm vertrauen.
Schwache/starke Bewertung
Schwach („es war gut für mich“):
Ich habe ein paar Fragen gestellt und die Antworten schienen gut zu sein. Ich habe es live.# Problem: keine Messungen, Regression nicht wahrnehmbar, Verbesserung blind.
Leistungsstark (Goldcluster + diskrete Metriken + automatische Beurteilung + Regression):
Goldener Cluster mit 40 Fragen. Bei jeder Änderung werden Recall@5, Treue und Genauigkeit automatisch gemessen. Sinkt die Punktzahl, wird die Änderung rückgängig gemacht. In der Produktion wird das Feedback der Benutzer gesammelt und dem Set hinzugefügt.
Überwachung und Regression in der Produktion
Die Auswertung erfolgt nicht einmalig und abgeschlossen. Drei ständige Praktiken:
- Regressionstests: Golden Cluster automatisch bei jeder Eingabeaufforderung/jedem Abruf/Modellwechsel ausführen. Bei einer Reduzierung der Punktzahl wird die Änderung rückgängig gemacht. Dadurch wird verhindert, dass man „es kaputt macht, während man versucht, es besser zu machen“.
- Produktionsüberwachung: „Ich konnte keine Informationen finden“-Rate bei echten Fragen, durchschnittliche Verzögerung, Kosten, Benutzer-Feedback (👍/👎) werden überwacht. Ein plötzlicher Anstieg von „Ich weiß nicht“ ist oft das erste Anzeichen einer Index- oder Abrufstörung.
- Feedback-Schleife: Die echten Fragen des Benutzers 👎 werden überprüft und dem goldenen Stapel hinzugefügt; Dadurch wird die Menge mit der Zeit reicher und die blinden Flecken des Systems werden geschlossen.
Drei Mini-Hüllen
Fall 1 – Stille Regression. Ein Team hat die Eingabeaufforderung geändert, um sie zu „verbessern“. Die allgemeine Genauigkeit nahm zu, aber die Treue nahm bei Fallenfragen um 30 % ab (das Modell begann besser zu passen). Ohne die Fallenfragen im goldenen Cluster wäre es nicht aufgefallen; Durch Regressionstests wurde die Änderung rückgängig gemacht.
Fall 2 – Strecken des falschen Beins. Bei einem Assistenten waren die Antworten schlecht; Das Team arbeitete wochenlang an der Aufforderung. Als wir die Abrufmetriken gemessen haben, betrug Recall@5 nur 48 % – das Problem lag beim Abruf, nicht bei der Generierung. Als Hybrid + Re-Ranking hinzugefügt wurde, stieg die Erinnerung auf 89 % und auch die Genauigkeit erhöhte sich.
Fall 3 – Produktionsalarm. Eines Tages stieg die Rate „Ich konnte keine Informationen finden“ für einen Support-Assistenten von 6 % auf 34 %. Das Trackpad warnte; Der Grund dafür war, dass der Indizierungsjob, der nachts läuft, stillschweigend fehlschlug und neue Artikel nicht hochgeladen wurden. Ohne Überwachung hätten die falschen „Ich weiß nicht“-Aussagen noch tagelang stattgefunden.
Häufige Fehler
- Zufrieden sein mit „Es hat bei mir gut geklappt“: Ohne Messung bleibt die Regression unbemerkt.
- Wenn Sie das Abrufen und Generieren nicht trennen: Sie korrigieren das falsche Bein und verschwenden Zeit.
- Keine Fallenfragen stellen: Die Tendenz, Dinge zu erfinden, erscheint nicht im goldenen Cluster.
- Nicht überprüfender Richter: Eine voreingenommene Jury vermittelt falsches Vertrauen.
- Produktion nicht überwacht: Indexausfall, Kostenexplosion geht geräuschlos weiter.
Zusammenfassend
- Bei RAG werden Abruf- und Generierungsqualität getrennt gemessen; Zunächst muss festgestellt werden, welches Bein beschädigt ist.
- Recall@k, Precision@k, MRR für Retrieval; Treue, Eignung, Vollständigkeit werden zur Erzeugung herangezogen.
- Für jede Messung ist ein Goldcluster erforderlich. Stellen Sie darin echte, schwierige, Fallstricke und widersprüchliche Fragen.
- LLM-as-Judge Large legt automatische Punkte fest; aber der Richter selbst muss gegenüber dem Menschen gerechtfertigt sein.
- Regressionstests, Produktionsüberwachung und eine Feedbackschleife sorgen für die langfristige Qualitätssicherung.
Anwendungsaufgabe
(1) Erstellen Sie einen goldenen Satz von mindestens 15 Fragen für Ihren eigenen Assistenten: Fügen Sie mindestens 3 Fallstricke (keine Antworten), 3 schwierige und 2 widersprüchliche Quellfragen hinzu. Schreiben Sie die erwartete Antwort und den richtigen Teil für jede Frage. (2) Vergleichen Sie manuell zwei verschiedene Eingabeaufforderungsversionen mit diesem Satz. Geben Sie jeder Antwort 1-5 Punkte für Treue und Genauigkeit. (3) Passen Sie die obige LLM-als-Richter-Eingabeaufforderung an Ihre eigenen Kriterien an. (4) Identifizieren Sie 3 Metriken, die Sie in der Produktion verfolgen werden, und fragen Sie für jede: „Bei welchem Schwellenwert gebe ich einen Alarm aus?“ schreibe den Wert.
Checkliste
- [ ] Ich kann die Bindungs- und Generierungsqualität mit separaten Metriken messen.
- [ ] Ich weiß, was Kennzahlen wie Recall@k und Treue bedeuten.
- [ ] Ich kann einen goldenen Cluster bilden, der echte, schwierige, Fallstrick- und widersprüchliche Fragen umfasst.
- [ ] Ich kann eine automatische Bewertung einrichten und den Richter mit LLM-als-Richter verifizieren.
- [ ] Ich kann Regressionstests, Produktionsüberwachung und Feedbackschleife durchführen.