Ganancias:
- Definir métricas que midan la calidad de retención y generación por separado.
- Configure un conjunto de preguntas de oro y ejecute una evaluación automática con LLM-as-juez
- Mantener la calidad a través de retroalimentación, monitoreo y pruebas de regresión en producción.
La frase "Instalé el asistente, parece estar funcionando bien" no es una declaración de ingeniería. Los sistemas RAG fallan silenciosamente: un nuevo tipo de documento engaña la recuperación, un cambio rápido reduce la precisión, el índice se vuelve obsoleto. La única manera de darse cuenta de esto es medir. En esta unidad, cubrimos cómo medir la calidad de RAG (recuperación y generación por separado), evaluación automática (LLM-as-juez) y mantener la calidad en la producción (monitoreo, regresión). "No se puede mejorar lo que no se mide" es el lema de esta unidad.
Mida dos cosas separadas
RAG tiene dos patas y se debe medir por separado porque el problema puede estar en cualquiera de ellas:
- Calidad de recuperación: ¿Llegó la pieza correcta?
- Calidad de generación: ¿Se produjo la respuesta correcta a partir de la pieza entrante?
Si la respuesta es mala, primero debes saber qué pierna está mal. Si la pieza correcta nunca llega, ni siquiera el mejor aviso se podrá guardar (problema de recuperación). Si llegó la pieza correcta pero el modelo la leyó mal, mejorar la recuperación es inútil (problema de generación).
Métricas de recuperación
La recuperación es un problema de clasificación/acceso; medido por métricas clásicas de recuperación de información. Para ello debes tener el cúmulo de oro: el conocimiento de qué pieza es la “correcta” para cada pregunta.
métrico
que medidas
Definición sencilla
recordar@k
¿Está la pieza correcta en la k superior?
Tasa de captura de piezas correcta
precision@k
¿Cuántas de las k piezas devueltas son relevantes?
Limpieza de lo que se trae.
MRR (rango recíproco medio)
¿En qué orden está la pieza correcta?
Recompensas por estar en los primeros puestos
Tasa de aciertos
¿Llegó al menos una pieza correcta?
La medida más básica del éxito.
Comentario práctico: si Recall@k es bajo, se debe reelaborar la estrategia de búsqueda o fragmentación (híbrida, k, reclasificación). Si la precisión es baja pero la recuperación es alta, agregar una nueva clasificación es una buena medida.
Métricas de generación
Cuando llega la pieza correcta, medimos la calidad de la respuesta producida por el modelo. Tres dimensiones básicas:
- Fidelidad: ¿Cada afirmación de la respuesta está respaldada por el contexto? ¿Hay algún ajuste? Es una medida directa de la alucinación.
- Relevancia de la respuesta: ¿La respuesta realmente responde a la pregunta o está fuera de tema?
- Integridad: ¿Se ha utilizado toda la información relevante en el contexto o falta?
Estos a menudo se califican según una calificación (por ejemplo, del 1 al 5), en lugar de hacerlo de forma binaria, como “verdadero/falso”.
Consejo: Realice un seguimiento de la fidelidad como una métrica independiente. Si la fidelidad disminuye a medida que disminuye la precisión, el problema es la generación; Si la fidelidad es alta pero la respuesta es incorrecta, el problema es la pieza equivocada (recuperación). Juntas, estas dos métricas son una brújula que muestra la ubicación de la falla.
Establecer un conjunto de preguntas de oro
Cada medición requiere un conjunto de datos de evaluación/conjunto de oro: preguntas realistas + respuestas correctas esperadas + piezas fuente correctas. Comenzar con entre 30 y 50 preguntas bien elegidas es mejor que 500 preguntas aleatorias. Incluya lo siguiente en el conjunto: preguntas reales frecuentes, preguntas difíciles conocidas, preguntas trampa sin respuesta (uno debería decir "No sé"), preguntas con fuentes contradictorias.
# Ejemplo de grupo dorado (conceptual)[ {"question": "¿Cuántos días de vacaciones anuales?", "expected_answer": "14 días por 1 a 5 años de antigüedad", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "¿Dónde está la oficina de la empresa en Mars?", "expected_answer": "NO_INFORMATION", # trampa: No sé "correct_part_id": nulo, "categoría": "trampa"}]
LLM como juez: evaluación automática
Anotar cientos de respuestas a mano es agotador. El modelo LLM como juez es cuando un modelo califica y justifica la respuesta de otro modelo en función de ciertos criterios. Un buen juez define claramente los criterios, da ejemplos y pide justificación.
# Mensaje de LLM como juez (conceptual) Eres un evaluador imparcial. Evalúe la RESPUESTA a continuación de acuerdo con el CONTEXTO dado y la RESPUESTA ESPERADA. Califique (1-5) y justifique: - fidelidad: ¿cada afirmación de la respuesta está respaldada en contexto? - precisión: ¿la respuesta coincide con la respuesta esperada? - integridad: ¿está completa la información relevante? En particular: si la respuesta contiene información que no está en el contexto, proporcione fidelidad1 e indique qué afirmación es falsa.CONTEXTO: {context}ESPERADO: {esperado}RESPUESTA: {respuesta}Resultado: {fidelidad, precisión, integridad, justificación}
Precaución: LLM como juez no es perfecto; Pueden tener sus propios prejuicios (respuesta larga, prefiriendo su propio estilo). Verifique también Juez: haga que algunas respuestas sean puntuadas tanto por el juez como por el humano y mida el acuerdo entre ellos. Si Judge es consistente con las puntuaciones humanas, puedes confiar en él.
Calificación débil/fuerte
Débil ("fue bueno para mí"):
Hice algunas preguntas y las respuestas parecieron buenas. Lo tengo en vivo.# Problema: no hay mediciones, la regresión es imperceptible, la mejora es ciega.
Potente (grupo dorado + métricas discretas + juicio automático + regresión):
Clúster dorado de 40 preguntas. Con cada cambio, recuerda@5, la fidelidad y la precisión se miden automáticamente. Si la puntuación baja, el cambio se revierte. En producción, los comentarios de los usuarios se recopilan y se agregan al conjunto.
Monitoreo y Regresión en Producción
La evaluación no se hace una vez y termina. Tres prácticas constantes:
- Pruebas de regresión: ejecución automática del grupo dorado en cada solicitud/recuperación/cambio de modelo. Si se reduce la puntuación, el cambio se revierte. Esto evita "romperlo mientras intentamos mejorarlo".
- Monitoreo de producción: Se monitorea la tasa "No pude encontrar información" en preguntas reales, demora promedio, costo, comentarios de los usuarios (👍/👎). Un aumento repentino de "No sé" suele ser el primer signo de un mal funcionamiento del índice o de la recuperación.
- Bucle de retroalimentación: las preguntas reales proporcionadas por el usuario 👎 se revisan y se agregan a la pila dorada; Así, el conjunto se enriquece con el tiempo y los puntos ciegos del sistema se cierran.
Tres mini estuches
Caso 1: Regresión silenciosa. Un equipo modificó el mensaje para "mejorarlo"; La precisión general aumentó, pero la fidelidad disminuyó en un 30 % en las preguntas trampa (el modelo empezó a ajustarse más). No se habría dado cuenta si no fuera por las preguntas trampa en el grupo dorado; Las pruebas de regresión revirtieron el cambio.
Caso 2: Enderezar la pierna equivocada. En un asistente las respuestas fueron malas; El equipo trabajó en el mensaje durante semanas. Cuando medimos las métricas de recuperación, la recuperación@5 fue solo del 48 %; el problema estaba en la recuperación, no en la generación. Cuando se agregó la reclasificación híbrida +, la recuperación aumentó al 89 % y la precisión también aumentó.
Caso 3: Alerta de producción. Un día, la tasa de "no pude encontrar información" de un asistente de soporte saltó del 6% al 34%. El trackpad advirtió; La razón fue que el trabajo de indexación, que se ejecuta por la noche, falló silenciosamente y no se cargaron nuevos artículos. Sin seguimiento, las declaraciones incorrectas de "no sé" habrían continuado durante días.
Errores comunes
- Estar satisfecho con “me funcionó bien”: Sin medición, la regresión pasa desapercibida.
- No separar recuperación y generación: corregirás la pierna equivocada y perderás tiempo.
- No hacer preguntas trampa: La tendencia a inventar cosas no aparece en el cúmulo dorado.
- Juez no verificador: Un jurado parcial da falsa confianza.
- No monitorear la producción: la falla del índice y la explosión de costos continúan silenciosamente.
En resumen
- En RAG, la calidad de recuperación y generación se miden por separado; Primero se debe determinar qué pierna está dañada.
- recordar@k, precisión@k, MRR para recuperación; La fidelidad, la idoneidad y la integridad se utilizan para la generación.
- Cada medida requiere un racimo de oro; Ponle preguntas reales, difíciles, trampa y contradictorias.
- LLM como juez de puntuaciones automáticas de conjuntos grandes; pero el juez mismo debe justificarse contra el hombre.
- Las pruebas de regresión, el seguimiento de la producción y un circuito de retroalimentación mantienen la calidad a lo largo del tiempo.
Tarea de aplicación
(1) Cree un conjunto dorado de al menos 15 preguntas para su propio asistente: incluya al menos 3 trampas (sin respuestas), 3 preguntas difíciles y 2 preguntas fuente contradictorias. Escribe la respuesta esperada y la parte correcta de cada pregunta. (2) Compare manualmente dos versiones de mensajes diferentes con este conjunto; Dé a cada respuesta de 1 a 5 puntos por fidelidad y precisión. (3) Adapte el mensaje LLM como juez anterior a sus propios criterios. (4) Identifique 3 métricas que realizará un seguimiento en producción y, para cada una, pregunte "¿en qué umbral doy la alarma?" escribe el valor.
lista de verificación
- [] Puedo medir la calidad de retención y generación con métricas separadas.
- [] Sé lo que significan métricas como recordar@k, fidelidad.
- [ ] Puedo construir un grupo dorado que incluya preguntas reales, difíciles, trampa y contradictorias.
- [] Puedo configurar una evaluación automática y verificar al juez con LLM-as-juez.
- [] Puedo operar pruebas de regresión, monitoreo de producción y ciclo de retroalimentación.