Unità 8 / 11

Valutazione e monitoraggio RAG

Guadagni:

  • Definizione di metriche che misurino separatamente la conservazione e la qualità della generazione
  • Imposta una serie di domande d'oro ed esegui la valutazione automatica con LLM come giudice
  • Mantenimento della qualità attraverso feedback, monitoraggio e test di regressione in produzione

La frase "Ho installato l'assistente, sembra che funzioni bene" non è una dichiarazione tecnica. I sistemi RAG si guastano silenziosamente: un nuovo tipo di documento inganna il recupero, una modifica tempestiva riduce la precisione, l'indice diventa obsoleto. L’unico modo per rendersene conto è misurare. In questa unità, spiegheremo come misurare la qualità RAG (recupero e generazione separatamente), la valutazione automatica (LLM-as-judge) e come mantenere la qualità nella produzione (monitoraggio, regressione). "Non puoi migliorare ciò che non misuri" è il motto di questa unità.

Misura due cose separate

RAG ha due gambe e deve essere misurata separatamente perché il problema potrebbe risiedere in una delle due:

  1. Qualità del recupero: è arrivata la parte corretta?
  2. Qualità della generazione: la risposta corretta è stata prodotta dal pezzo in arrivo?

Se la risposta è negativa, devi prima sapere quale gamba è negativa. Se la parte giusta non arriva mai, anche il miglior suggerimento non può essere salvato (problema di recupero). Se è arrivata la parte corretta ma il modello l'ha letta erroneamente, migliorare il recupero è inutile (problema di generazione).

Metriche di recupero

Il recupero è un problema di ordinamento/accesso; misurato mediante metriche classiche di recupero delle informazioni. Per questo è necessario avere il grappolo d'oro: la conoscenza di quale pezzo è "corretto" per ogni domanda.

metrico

Quali misure

Definizione semplice

Richiamo@k

Il pezzo corretto è nella parte superiore k?

Correggere la velocità di acquisizione delle parti

precisione@k

Quanti dei k pezzi restituiti sono rilevanti?

Pulizia di quanto portato

MRR (rango reciproco medio)

In quale ordine è il pezzo corretto?

I premi sono nelle prime posizioni

Tasso di successo

È arrivato almeno un pezzo corretto?

La misura più elementare del successo

Commento pratico: se Recall@k è basso, la strategia di suddivisione in blocchi o di ricerca (ibrida, k, riclassificazione) dovrebbe essere rielaborata. Se la precisione è bassa ma il ricordo è alto, aggiungere la riclassificazione è una buona mossa.

Metriche di generazione

Quando arriva la parte corretta, misuriamo la qualità della risposta prodotta dal modello. Tre dimensioni fondamentali:

  • Fedeltà: ciascuna affermazione nella risposta è supportata dal contesto? C'è qualche raccordo? È una misura diretta dell'allucinazione.
  • Pertinenza della risposta: la risposta risponde effettivamente alla domanda o è fuori tema?
  • Completezza: sono state utilizzate tutte le informazioni rilevanti nel contesto o mancano?

Questi vengono spesso valutati su base graduata (ad esempio 1-5), piuttosto che su base binaria come "vero/falso".

Suggerimento: monitora la fedeltà come metrica separata. Se la fedeltà diminuisce al diminuire della precisione, il problema è la generazione; Se la fedeltà è alta ma la risposta è sbagliata, il problema è il pezzo sbagliato (recupero). Insieme, questi due parametri costituiscono una bussola che mostra la posizione del guasto.

Stabilire una serie di domande d'oro

Ogni misurazione richiede un golden set/set di dati di valutazione: domande realistiche + risposte corrette previste + elementi sorgente corretti. Iniziare con 30-50 domande ben scelte è meglio che 500 domande casuali. Includi quanto segue nell'insieme: domande vere e frequenti, domande difficili note, domande trappola senza risposta (si dovrebbe dire "non lo so"), domande con fonti contraddittorie.

# Esempio di cluster dorato (concettuale)[ {"question": "Quanti giorni di ferie annuali?", "expected_answer": "14 giorni per 1-5 anni di anzianità", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Dov'è l'ufficio su Marte dell'azienda?", "expected_answer": "NO_INFORMATION", # trap: Non lo so "correct_part_id": null, "category": "trap"}]

LLM-come-giudice: valutazione automatica

Segnare centinaia di risposte a mano è stancante. Il modello LLM come giudice si verifica quando un modello ottiene un punteggio e giustifica la risposta di un altro modello in base a determinati criteri. Un buon giudice definisce chiaramente i criteri, fornisce esempi e chiede giustificazioni.

# Prompt LLM come giudice (concettuale) Sei un valutatore imparziale. Valutare la RISPOSTA seguente in base al CONTESTO fornito e alla RISPOSTA ATTESA. Assegnare un punteggio (1-5) e giustificare:- fedeltà: ciascuna affermazione nella risposta è supportata nel contesto?- accuratezza: la risposta corrisponde alla risposta attesa?- completezza: le informazioni pertinenti sono complete? In particolare: se la risposta contiene informazioni non presenti nel contesto, fornire fedeltà1 e indicare quale affermazione è inventata.CONTESTO: {contesto}ATTENUTO: {previsto}RISPOSTA: {risposta}Risultato: {fedeltà, accuratezza, completezza, giustificazione}

Attenzione: LLM come giudice non è perfetto; Potrebbero avere i propri pregiudizi (risposta lunga, preferendo il proprio stile). Verifica anche il giudice: chiedi ad alcune risposte di valutare sia il giudice che l'umano e misura l'accordo tra loro. Se il giudice è coerente con i punteggi umani, puoi fidarti di lui.

Valutazione debole/forte

Debole ("mi ha fatto bene"):

Ho fatto alcune domande e le risposte sembravano buone. Ce l'ho dal vivo.# Problema: nessuna misurazione, regressione impercettibile, miglioramento cieco.

Potente (cluster aureo + metriche discrete + giudizio automatico + regressione):

Cluster d'oro di 40 domande. Ad ogni modifica,call@5,fedeltà e precisione vengono misurate automaticamente. Se il punteggio scende, la modifica viene annullata. Nella produzione, il feedback degli utenti viene raccolto e aggiunto al set.

Monitoraggio e regressione nella produzione

La valutazione non viene effettuata una volta e finita. Tre pratiche costanti:

  • Test di regressione: cluster dorato eseguito automaticamente a ogni modifica di prompt/recupero/modello. Se il punteggio viene ridotto, la modifica viene annullata. Ciò impedisce di "romperlo mentre si cerca di migliorarlo".
  • Monitoraggio della produzione: vengono monitorati il ​​tasso di "non sono riuscito a trovare informazioni" nelle domande reali, il ritardo medio, il costo, il feedback degli utenti (👍/👎). Un aumento improvviso di "Non so" è spesso il primo segno di un malfunzionamento dell'indice o del recupero.
  • Ciclo di feedback: le domande reali fornite dall'utente 👎 vengono esaminate e aggiunte alla pila d'oro; In questo modo l’insieme si arricchisce nel tempo e i punti ciechi del sistema si chiudono.

Tre mini custodie

Caso 1 – Regressione silenziosa. Un team ha modificato il prompt per "migliorarlo"; L'accuratezza generale è aumentata, ma la fedeltà è diminuita del 30% nelle domande trappola (il modello ha iniziato ad adattarsi di più). Non sarebbe stato notato se non fosse stato per le domande trappola nel grappolo dorato; I test di regressione hanno annullato la modifica.

Caso 2: raddrizzare la gamba sbagliata. In un assistente le risposte erano pessime; Il team ha lavorato sulla richiesta per settimane. Quando abbiamo misurato i parametri di recupero, il ricordo@5 era solo del 48%: il problema era nel recupero, non nella generazione. Quando è stato aggiunto l'ibrido + riclassificazione, il ricordo è aumentato all'89% e anche la precisione è aumentata.

Caso 3 — Avviso di produzione. Un giorno, la percentuale di "Non sono riuscito a trovare informazioni" per un assistente di supporto è balzata dal 6% al 34%. Il trackpad avvisava; Il motivo era che il processo di indicizzazione, che veniva eseguito di notte, falliva silenziosamente e i nuovi articoli non venivano caricati. Senza il monitoraggio, le affermazioni errate del "non so" sarebbero continuate per giorni.

Errori comuni

  • Essere soddisfatti di “ha funzionato bene per me”: senza misurazione, la regressione passa inosservata.
  • Non separare recupero e generazione: correggeresti la gamba sbagliata e perderai tempo.
  • Non fare domande trappola: la tendenza a inventare cose non appare nel cluster dorato.
  • Giudice non verificante: una giuria parziale dà falsa fiducia.
  • Non monitorare la produzione: il fallimento dell’indice, l’esplosione dei costi continua silenziosamente.

In sintesi

  • In RAG, la qualità del recupero e della generazione vengono misurate separatamente; Bisogna prima determinare quale gamba è danneggiata.
  • richiamo@k, precisione@k, MRR per recupero; Fedeltà, idoneità, completezza servono per la generazione.
  • Ogni misurazione richiede un grappolo d'oro; Metti dentro domande vere, difficili, trappole e contraddittorie.
  • LLM-come-giudice set di grandi dimensioni punteggi automatici; ma il giudice stesso deve essere giustificato contro l'uomo.
  • I test di regressione, il monitoraggio della produzione e un ciclo di feedback mantengono la qualità nel tempo.

Compito dell'applicazione

(1) Crea un set di almeno 15 domande per il tuo assistente: includi almeno 3 trappole (nessuna risposta), 3 domande difficili e 2 domande sulla fonte contraddittorie. Scrivi la risposta attesa e la parte corretta per ogni domanda. (2) Confrontare manualmente due diverse versioni di prompt con questo set; Assegna a ciascuna risposta da 1 a 5 punti per fedeltà e accuratezza. (3) Adattare il suggerimento LLM come giudice sopra ai propri criteri. (4) Identifica 3 parametri che monitorerai in produzione e per ciascuno chiedi "a quale soglia allarmare?" scrivere il valore.

lista di controllo

  • [ ] Posso misurare la qualità della fidelizzazione e della generazione con parametri separati.
  • [ ] So cosa significano metriche come ricordo@k, fedeltà.
  • [ ] Posso costruire un cluster dorato che includa domande reali, difficili, trappole e contraddittorie.
  • [ ] Posso impostare la valutazione automatica e verificare il giudice con LLM-come-giudice.
  • [ ] Posso eseguire test di regressione, monitoraggio della produzione e ciclo di feedback.