Unidad 3 / 11

Capacitación y evaluación de modelos: métricas precisas, evaluación comparativa honesta

Ganancias:

  • Capacidad para elegir la métrica apropiada para el tipo de problema y el contexto empresarial (PR-AUC/recuperación en datos no balanceados, MAE/RMSE en regresión) y reconocer el aprendizaje excesivo o insuficiente
  • Capacidad para interpretar cada métrica frente a una línea de base y medir la desviación y separar el ruido del progreso con validación cruzada.
  • Capacidad para informar resultados no optimistas ajustando los hiperparámetros con el conjunto de validación y usando el conjunto de prueba solo al final

El entrenamiento de modelos (entrenamiento: el proceso de aprender patrones a partir de datos) es el paso más visible pero más engañoso de la ingeniería de ML. Aparece porque produce un número satisfactorio como "precisión del 95%". Engañoso porque ese número suele ser la respuesta correcta a la pregunta equivocada. En esta unidad, la educación y la evaluación se analizan con la disciplina de ingeniería; Utilizamos la inteligencia artificial como socio en el diseño experimental y basamos la decisión en la medición.

Lógica del ciclo formativo.

Un modelo aprende el patrón en los datos minimizando una función de pérdida: una función que mide numéricamente el error del modelo. El algoritmo de optimización (por ejemplo, descenso de gradiente) reduce la pérdida ajustando los parámetros paso a paso. El objetivo no es memorizar los datos de entrenamiento, sino generalizarlos a datos sin precedentes.

Dos peligros principales:

  • Sobreajuste: el modelo memoriza los datos de entrenamiento y falla con los datos nuevos. El éxito de la capacitación es alto, el éxito de la verificación es bajo.
  • Desajuste: el modelo no puede capturar el patrón; Tanto el éxito de la formación como el de la validación son bajos.

Encontrar el equilibrio es el arte de la educación. El conjunto de validación está ahí para monitorear este equilibrio: si el éxito de la validación comienza a disminuir mientras el éxito del entrenamiento aumenta, ha comenzado el sobreaprendizaje.

Consejo: Traza la pérdida de entrenamiento y validación juntas en cada paso. El punto en el que las dos curvas comienzan a divergir es donde comienza el sobreaprendizaje y es el momento adecuado para "detenerse anticipadamente".

Selección de métricas: la decisión más crítica

Una métrica incorrecta hace que un buen modelo parezca malo y un mal modelo parezca bueno. El problema determina la métrica:

  • Clasificación desequilibrada (una clase es muy rara, por ejemplo, fraude): la precisión es engañosa. Un modelo que dice "llamar a todo normal" obtendrá un 99% de precisión pero no detectará ni un solo fraude. En cambio, se utilizan la precisión (cuánto de lo que capturé es realmente positivo), el recuerdo (cuánto de lo que capturé es realmente positivo) y su equilibrio F1 o PR-AUC.
  • Clasificación equilibrada: la precisión y ROC-AUC pueden ser apropiados.
  • Regresión (estimación numérica): MAE (error absoluto medio), RMSE (penaliza errores grandes), MAPE (error porcentual).
  • Clasificación/recomendación: NDCG, MRR, Recall@K.

La importancia de la precisión o la recuperación depende del contexto empresarial. Recordar (no perder ningún paciente) es una prioridad en la detección del cáncer; La precisión en el filtro de spam (no enviar correos electrónicos importantes al spam) es importante. Esta es una decisión comercial, no técnica, y la toman conjuntamente el ingeniero y el propietario.

Aviso débil / Aviso fuerte

Mensaje débil: "Evaluar el rendimiento de mi modelo, precisión 0,97".

Mensaje potente: "Tengo un modelo de detección de fraude; la tasa de clase positiva es del 1,5 %. La precisión se informa como 0,97. Explique por qué esta métrica podría ser engañosa, dígame qué métricas (precisión, recuperación, PR-AUC) debo preferir y por qué. También calcule qué tan preciso sería un modelo de referencia 'llamar a todo negativo' en estos datos, para que pueda ver el valor agregado real".

Diferencia: un mensaje poderoso brinda proporción de clases y contexto comercial; también solicita una comparación del modelo de referencia; este es el ancla más importante para determinar si una métrica es significativa.

Línea de base: la métrica sin comparación no tiene sentido

Una métrica no es buena ni mala por sí sola; Es bueno o malo según un modelo básico. El modelo básico es la solución más simple que me viene a la mente: "dígale siempre a la clase mayoritaria", "repita el valor de la semana pasada", "adivine la media". Si su modelo no puede superar claramente esta solución simple, toda la complejidad es en vano.

Precaución: La frase "Mi modelo tiene una precisión del 85%" por sí sola no dice nada. Si el modelo base ya obtiene el 84%, su modelo casi no tiene valor; Si el modelo base obtiene el 50%, su modelo es perfecto. Habla siempre en términos del modelo básico.

Validación cruzada y confianza

Una única división entre entrenamiento y pruebas puede deberse al azar. Validación cruzada: dividir los datos en k partes y probar cada parte secuencialmente muestra qué tan estable es el rendimiento. En la validación cruzada quíntuple se obtienen cinco puntuaciones diferentes; Su media y desviación estándar son importantes. Si el promedio es 80% pero la desviación es ±12%, su modelo es inestable; puede comportarse de manera muy diferente en el siguiente lote de datos.

Esto también es fundamental para la "comparación de dos modelos". Si el modelo A obtuvo el 81% y el modelo B obtuvo el 82%, ¿es B realmente mejor? Si la desviación es ±3%, esta diferencia puede ser ruido. Considere si la diferencia es significativa antes de decidir.

Ajuste de hiperparámetros: con validación, sin pruebas

Los hiperparámetros (configuraciones determinadas manualmente antes del entrenamiento: tasa de aprendizaje, profundidad del árbol, etc.) se configuran con el conjunto de validación. El conjunto de prueba se utiliza sólo al final, una vez. Si selecciona hiperparámetros observando el conjunto de pruebas, el conjunto de pruebas se contaminará y el rendimiento que informe será optimista, lo que no es el caso en la realidad.

La inteligencia artificial es una buena ayuda para diseñar el espacio de búsqueda de hiperparámetros y escribir el código de búsqueda (búsqueda en cuadrícula, búsqueda aleatoria, optimización bayesiana). Pero aún así decides "¿qué métrica optimizaremos?"

tres mini casos

Caso 1: Trampa de precisión. Un equipo médico estaba orgulloso de un modelo que detectaba una enfermedad rara: 98% de precisión. Cuando se hizo la comparación del modelo básico, surgió la verdad: dado que la tasa de enfermedad era del 2%, el modelo que decía "llamar a todos sanos" también recibió el 98%. El recuerdo del modelo fue sólo del 11% y omitió a la mayoría de los pacientes. Una vez que la métrica se convirtió a PR-AUC, se midió el desempeño real y se rediseñó el modelo.

Caso 2: Confundir ruido con progreso. Un equipo pasó meses mejorando el modelo del 86,2% al 86,9%. La validación cruzada mostró que el sesgo era de ±1,4%, por lo que la “mejora” de 0,7 puntos fue ruido estadístico. El equipo había desperdiciado tres semanas con ganancias irreales. Lección: no cantes victoria sin comprobar que la mejora es mayor que la desviación.

Caso 3: Contaminación del equipo de prueba. Un ingeniero examinó repetidamente el conjunto de prueba para elegir los mejores hiperparámetros. Del 91% que reportó bajó al 83% en producción. Por qué: sin saberlo, había seleccionado el modelo en consecuencia al mirar el conjunto de prueba una y otra vez (sobreaprendizaje en el conjunto de prueba). El rendimiento informado y el real se superpusieron cuando se utilizó un conjunto de validación separado.

Plantillas copiables

Ayúdame a elegir la métrica correcta para este problema de clasificación. Problema: [lo que se predice] Distribución de clases: [tasa positiva

Evalúe la comparación de los dos modelos siguientes. Validación cruzada del modelo A: [lista de puntuaciones] Validación cruzada del modelo B: [lista de puntuaciones] Calcule la media y la desviación estándar. ¿Es la diferencia estadísticamente significativa o es simplemente ruido dentro de la desviación? ¿Cuál me recomendarías que eligiera y por qué?

Consulte este código de entrenamiento para ver lo siguiente: 1) ¿Se seleccionan los hiperparámetros con el conjunto de prueba o el conjunto de validación? 2) ¿Se monitorea la parada anticipada con el conjunto correcto? 3) ¿Hay signos de sobreaprendizaje (diferencia de pérdida de entrenamiento/validación)? Código: [código]

¿Cuál de los MAE, RMSE y MAPE debo informar para este problema de regresión? Escala de la variable objetivo: [rango] ¿Los errores grandes son desproporcionadamente malos (RMSE), o son todos iguales (MAE)? ¿Hay valores cercanos a cero (distorsionan el MAPE)? Sugerir con una breve justificación.

Tabla de selección de métricas

tipo de problema

Métrica apropiada

Para ser evitado

¿Por qué?

Clasificación desequilibrada

PR-AUC, F1, retirada

Precisión

La clase mayoritaria infla la métrica

Clasificación equilibrada

Precisión, ROC-AUC

Fiable en datos equilibrados

Regresión (valor atípico significativo)

RMSE

MAPE (si es cero)

Castiga los errores mayores

Regresión (igual peso)

MAE

Fácil de interpretar

Clasificación/recomendación

NDCG, Recall@K

Precisión

El orden es importante

Errores comunes

  • Usar precisión en datos desequilibrados. El error métrico más común.
  • No hacer comparaciones de modelos base. Hace que la métrica pierda su significado.
  • Mirando el conjunto de pruebas para hiperparámetros. Resultado optimista y poco realista.
  • Apoyándose en un solo compartimento. Sin validación cruzada no verá el sesgo.
  • Confundir el ruido con el progreso. Las pequeñas "mejoras" derivadas de la desviación son en su mayoría cuestión de suerte.
  • Ignorando el contexto empresarial. La balanza de precisión/recuperación es una decisión comercial.

En resumen

La verdadera habilidad en el entrenamiento de modelos no es producir un número alto, sino saber qué significa ese número. El problema y el contexto empresarial determinan la métrica correcta; interpretar cada métrica según un modelo de referencia; mida el sesgo con validación cruzada y no confunda el ruido con el progreso; Utilice el equipo de prueba sólo al final, una vez. La IA es su socia en el diseño de experimentos, pero la decisión de si es "suficientemente bueno" depende de usted y los suyos.

Tarea de aplicación

Para un modelo de clasificación: (1) escriba la distribución de clases, (2) cree un modelo base apropiado y mida su puntuación, (3) evalúe su modelo con validación cruzada quíntuple e informe la media y la desviación estándar, (4) calcule la métrica apropiada para el problema (por ejemplo, PR-AUC) en lugar de la precisión. Escriba si su modelo supera al modelo de referencia por un amplio margen sin sesgos.

lista de verificación

  • [] Elegí la métrica según el tipo de problema y el contexto empresarial.
  • [] Construí un modelo base y lo comparé.
  • [] Informé la media y la desviación con validación cruzada.
  • [ ] Confirmé que la mejora es mayor que la desviación.
  • [] Seleccioné los hiperparámetros con el conjunto de validación.
  • [] Solo usé el conjunto de prueba una vez, al final.