Unidad 8 / 11

Evaluación y seguimiento: saber qué hace realmente el modelo en producción

Ganancias:

  • Capacidad para reconocer causas silenciosas de degradación del modelo (derivación de datos, deriva de conceptos, error ascendente) y establecer un monitoreo de tres capas (operacional, de entrada, de salida)
  • Capacidad para evaluar sistemas LLM en múltiples capas con verificaciones de reglas, evaluación humana y de árbitro de LLM, y calibrar con anclaje humano de árbitro de LLM
  • Capacidad para diseñar un conjunto de evaluación que contenga casos extremos y de seguridad y convertir cada error detectado en un caso de prueba permanente.

Una vez que un modelo entra en producción, el trabajo no termina; La verdadera responsabilidad apenas comienza. Porque el modelo puede averiarse silenciosamente cuando nadie está mirando. En esta unidad cubrimos dos disciplinas complementarias: evaluación (medición sistemática de la calidad del modelo) y seguimiento (seguimiento constante del modelo en producción). Especialmente en los sistemas LLM, la evaluación es más difícil y requiere más cuidado que el ML clásico.

Por qué el modelo de producción se está desmoronando silenciosamente

Un error falla, el registro se imprime y suena la alarma. Un modelo de ML, por otro lado, puede ser incorrecto sin provocar errores. Tres causas principales de degradación:

  • Deriva de datos: la distribución de los datos de entrada cambia con el tiempo (nuevos productos, cambios en el comportamiento de los usuarios, estacionalidad). El modelo sigue siendo el mismo pero el mundo cambia.
  • Deriva del concepto: la relación entrada-salida cambia. Las tácticas de fraude y los patrones de spam evolucionan; Lo que ayer estuvo bien, hoy estará mal.
  • Corrupción ascendente: una fuente de datos cambia de formato, un área queda libre; El modelo babea silenciosamente con información corrupta.

El rastreo es hacer audibles estas distorsiones silenciosas.

Qué mirar: tres capas

Un buen seguimiento abarca tres capas:

  1. Métricas operativas: latencia, tasa de error, volumen de solicitudes, uso de recursos. "¿Está el sistema en pie?"
  2. Métricas de datos/entradas: ¿La distribución de entradas es similar a la del entrenamiento? ¿Ha aumentado la tasa de valor faltante? ¿Han llegado nuevas categorías? "¿El modelo está viendo datos familiares?"
  3. Modelo/métricas de salida: ¿registro de distribución de predicciones? ¿Han bajado los puntajes de confianza? Y si es posible, ¿cuál es la precisión en comparación con la verdad básica? "¿El modelo sigue siendo exacto?"

La tercera capa es la más valiosa pero la más difícil; porque el resultado real suele llegar con retraso (después de meses queda claro si el préstamo se reembolsará o no).

Consejo: si el resultado real se retrasa, primero supervise la distribución de entrada y predicción. El cambio de la distribución de entrada es una señal temprana de degradación de la precisión y puede generar una alarma sin esperar el resultado real.

Evaluación de sistemas LLM: el desafío especial

En ML clásico, la "respuesta correcta" es clara (clase 0 o 1). El resultado del LLM, por otro lado, es abierto: puede haber muchas respuestas correctas a la misma pregunta, "corrección" no cabe en un solo número. Enfoques de evaluación de LLM:

  • Métricas referenciadas: comparar el resultado con la respuesta ideal. Limitado; porque puede considerar la respuesta correcta expresada de otra manera como "incorrecta".
  • Comprobaciones basadas en reglas: ¿La salida es JSON válida? ¿Hay palabras prohibidas? ¿Contiene los campos deseados? Barato, confiable, ajustado.
  • Juez-LLM (LLM-as-juez): No haga que un modelo pregunte "¿esta respuesta es buena según este criterio?" Escala, pero hay que verificar al propio árbitro.
  • Revisión humana: estándar de oro pero caro y lento. Se utiliza en la muestra.

En la práctica, estos se utilizan juntos: controles de reglas baratos en cada resultado, jueces de LLM en una muestra grande, evaluación humana en una muestra pequeña pero rigurosa.

Enfoque débil / Enfoque fuerte

Débil: "LLM: le pregunté al árbitro, el 92% de nuestras respuestas fueron buenas. El sistema es excelente".

Güçlü: "Primero etiquetamos 100 impresiones humanas. Ejecutamos el juez LLM en las mismas 100 impresiones y medimos la concordancia entre el juez humano y el 85% de acuerdo, aceptable. Documentamos dónde el juez se equivocó sistemáticamente (una tendencia a encontrar respuestas largas injustamente buenas) y arreglamos su mensaje. Sólo entonces confiamos en las puntuaciones del juez".

La diferencia: el enfoque fuerte verifica al árbitro con un ancla humana, no a ciegas. Un árbitro de LLM no verificado da una confianza atractiva pero falsa.

Atención: el árbitro de LLM también es un modelo; alucinógeno, sesgado (favorece respuestas largas/seguras), puede ser inconsistente. Calibre las puntuaciones de los árbitros con etiquetas humanas antes de tomar decisiones de producción.

Conjunto de evaluación: cuidadosamente diseñado

Un buen conjunto de evaluación representa la variedad de usos reales y casos difíciles. Una evaluación llena de ejemplos sencillos le dejará en una falsa confianza. Asegúrese de ponerlo en el grupo de evaluación:

  • Casos extremos: entrada vacía, entrada muy larga, formato inusual.
  • Casos difíciles conocidos: ejemplos en los que el modelo ha cometido errores en el pasado (como prueba de regresión).
  • Incidentes de seguridad: intentos de inyección rápida, solicitudes maliciosas, trampas de violación de la privacidad.

El grupo de evaluación crece con el tiempo: cada nuevo error que detecta en producción se convierte en un caso de prueba para la siguiente evaluación.

Alarma e intervención

La monitorización permanece incompleta sin una alarma. Debe haber un umbral y un plan de respuesta para cada métrica importante: "Notificar al ingeniero si la desviación de entrada excede X", "Revertir automáticamente si la tasa de error excede Y". Mantenga las alarmas significativas: demasiadas falsas alarmas insensibilizan al equipo y les hacen perder la alarma real.

tres mini casos

Caso 1 - Alerta temprana. La verdadera precisión de un modelo de previsión de la demanda sólo se hizo evidente al final de la semana. El equipo estaba monitoreando la distribución de insumos y vio el repentino aumento de una nueva categoría de producto un martes, algo que el modelo nunca había visto. Actualizaron el modelo sin esperar a que disminuyera la precisión. El monitoreo de entrada ahorró días.

Caso 2 - Árbitro no verificado. Un equipo informó que "nuestra calidad es excelente" según un revisor de LLM. Cuando aumentaron las quejas de los clientes, se introdujo el control humano: el árbitro consideraba "buenas" las respuestas seguras pero incorrectas. Una vez que el árbitro fue calibrado con etiquetas humanas, la verdadera calidad quedó revelada y fue mucho menor. Lección: no te fíes del árbitro sin verificarlo.

Caso 3 - Pruebas de regresión. Un cambio rápido resolvió un problema mientras solucionaba silenciosamente otro. Pero el equipo mantuvo los errores anteriores en el grupo de evaluación; Cuando se probó el nuevo cambio en este clúster, se detectó inmediatamente el caso roto y se solucionó el cambio. Lección: cada error solucionado debería convertirse en un caso de prueba permanente.

Plantillas copiables

Elaborar un plan de seguimiento para este modelo de producción. Cubre tres capas: 1) Operacional (latencia, tasa de error, volumen) 2) Entrada/datos (cambio de distribución, valor faltante, nueva categoría) 3) Modelo/salida (distribución de predicción, confianza, precisión si es posible) Modelo: [descripción]. ¿Cuánto tiempo tarda en llegar el resultado real? [duración]Agregue umbral y recomendación de intervención para cada métrica.

Proponer una estrategia de evaluación (evaluación) para este sistema LLM. Tarea: [descripción] Determinar capas: - ¿Qué verificaciones basadas en reglas deben ejecutarse en cada salida? - ¿Qué criterios debe evaluar el árbitro de LLM y cómo deben validarse (ancla humana)?

Consulte este mensaje del árbitro de LLM: - ¿Los criterios de evaluación son claros o subjetivos? - ¿Es propenso al sesgo de longitud/confianza? - ¿Cómo calibro al árbitro con etiquetas humanas? Mensaje del árbitro: [mensaje]

Escriba un runbook de respuesta para esta alarma de monitoreo. Alarma: [p. ej. umbral de deriva de entrada superado] Debe contener: pasos de control iniciales, posibles causas, criterios de reversión, a quién informar.

Tabla de causas de deterioro

distorsión

síntoma

Camino a la detección temprana

deriva de datos

Cambios en la distribución de entradas

Monitoreo de distribución de entrada

cambio de concepto

La justicia cae en silencio

Predicción + comparación real

error ascendente

Los campos quedan vacantes/cambios de formato

Validación de esquema + tasa faltante

Inconsistencia del modelo

Cambios en la distribución de la producción

Monitoreo de distribución de salida

Errores comunes

  • No establecer seguimiento. El modelo se estropea silenciosamente, nadie lo ve.
  • Realice un seguimiento únicamente de las métricas operativas. El sistema está funcionando, pero las predicciones pueden estar equivocadas.
  • Usar LLM sin verificar al árbitro. Da una falsa confianza.
  • Evaluar con ejemplos sencillos. No indica dificultad real.
  • Sin incluir errores pasados ​​en eval. El mismo error vuelve a aparecer.
  • Alarmas fuertes. El equipo se vuelve insensible y se pierde la verdadera alarma.

En resumen

El modelo puede ser inexacto sin provocar errores en la producción; por lo que la evaluación y el seguimiento son tan importantes como el desarrollo. Establecer un seguimiento en tres niveles (operativo, de entrada y de salida); Utilice la deriva de entrada como advertencia temprana si el resultado real se retrasa. En los sistemas LLM, la evaluación es abierta; Utilice verificaciones de reglas, árbitro de LLM y evaluación humana juntas, pero asegúrese de validar al árbitro de LLM con un ancla humana. Enriquezca su clúster de Eval con casos de seguridad y de vanguardia y convierta cada error detectado en un caso de prueba permanente.

Tarea de aplicación

Escriba un plan de monitoreo de tres capas para un modelo de producción (o casi producción) y defina un umbral + alarma para al menos una métrica de distribución de insumos. Si tiene un sistema LLM: etiquete 30 resultados con humanos, ejecute un árbitro de LLM en los mismos resultados y mida el acuerdo entre humano y árbitro; Nótese el sesgo sistemático del árbitro. Agregue al menos 3 aristas y 2 casos de seguridad a su clúster de evaluación.

lista de verificación

  • [ ] El monitoreo cubre las tres capas (operacional, de entrada, de salida).
  • [] Utilizo la deriva de entrada como advertencia temprana si el resultado real se retrasa.
  • [ ] Calibré el árbitro LLM con etiquetas humanas.
  • [] El clúster Eval contiene casos extremos y de seguridad.
  • [] Convertí cada error que detecté en un caso de prueba permanente.
  • [] Cada métrica importante tiene un umbral y un plan de respuesta.