Unidad 7 / 11

Evaluación de modelos: métricas, validación cruzada y aprendizaje extremo

Ganancias:

  • Capacidad para seleccionar e interpretar métricas de clasificación y regresión (matriz de confusión, precisión/recuperación/F1, MAE/RMSE/R²) según el propósito del trabajo.
  • Capacidad para detectar el sobreaprendizaje comparando puntuaciones de entrenamiento y pruebas y obtener un rendimiento confiable con validación cruzada
  • Capacidad para evaluar si cada modelo agrega valor real comparándolo con una línea de base.

Es fácil configurar un modelo; Es difícil medir honestamente si realmente funciona. El tema de esta unidad es la habilidad más crítica de un científico de datos: evaluar el modelo con las métricas correctas, lograr un rendimiento predictivo confiable y atrapar la trampa más insidiosa: el sobreaprendizaje (memorización). La IA calcula, interpreta y compara métricas; pero depende del ser humano decidir qué métrica es adecuada para su negocio y si un modelo es "suficientemente bueno". Un equipo que analiza la métrica incorrecta puede confundir un mal modelo durante meses con un "éxito".

Por qué la precisión no es suficiente: matriz de confusión

La primera métrica que me viene a la mente en la clasificación es la precisión (exactitud: la proporción total de predicciones correctas). Pero como vimos en la Unidad 6, la precisión es engañosa con datos no balanceados. Un mejor comienzo es la matriz de confusión, una tabla que divide las predicciones en cuatro grupos:

  • Verdadero positivo (TP): Llamamos falso a lo que es realmente falso. (bueno)
  • Verdadero negativo (TN): Dijimos realmente limpio. (bueno)
  • Falso positivo (FP): Dijimos erróneamente que el limpio era falso. (Falsa alarma)
  • Falso negativo (FN): Pasamos por alto la falsificación y la consideramos limpia. (Amenaza perdida)

De estos cuatro recuadros se derivan dos métricas clave. Precisión: "¿Cuánto de lo que yo llamo falso es realmente falso?" — importante si los costos de las falsas alarmas son altos. Sensibilidad (recuerde en inglés): "¿Cuántas falsificaciones reales capté?" – importante cuando pasar por alto una amenaza es costoso. Los dos a menudo están en desacuerdo entre sí: si bajas el umbral y dices más "falso", la recuperación aumenta pero la precisión disminuye. La puntuación F1 es el promedio equilibrado (media armónica) de estos dos.

Atención: La respuesta a la pregunta "¿Qué métrica es importante?" es una decisión empresarial, no técnica. Pasar por alto un caso (poco recuerdo) en la detección del cáncer es desastroso; Es molesto enviar un correo electrónico importante a spam (baja precisión) en el filtro de spam. El costo determina la métrica.

Métricas de regresión

Si el resultado son números, se utilizan diferentes métricas. MAE (Error absoluto medio): cuánto se desvían las estimaciones del promedio real, en la misma unidad (por ejemplo, "nos equivocamos en 4200 TL en promedio"). RMSE (Root Mean Squared Error): penaliza más severamente los errores mayores y es sensible a los valores atípicos. R² (R cuadrado - coeficiente de determinación): qué parte de la variabilidad en el objetivo explica el modelo (cerca de 1 es bueno, 0 es tan malo como predecir la media, negativo es incluso peor).

La trampa más insidiosa: el sobreaprendizaje

El sobreajuste (donde el modelo memoriza datos de entrenamiento pero falla con datos nuevos) es el error más común en la ciencia de datos. El síntoma es claro: el modelo es excelente en el conjunto de entrenamiento (98%), malo en el conjunto de prueba (72%). El modelo ha memorizado el ruido de esa muestra en particular, no el patrón real de los datos. También existe lo contrario: desajuste: el modelo es malo tanto en el entrenamiento como en las pruebas porque es demasiado simple para capturar el patrón.

Formas de combatir el sobreaprendizaje: simplificar el modelo, más datos, regularización (el freno matemático que evita que el modelo se vuelva demasiado complejo) y, lo más importante, validación cruzada.

Validación cruzada: no confíe en el panel único

Un solo grupo de entrenamiento/prueba puede traer suerte o mala suerte; Puede obtener altas calificaciones para el conjunto de prueba solo porque esa muestra es fácil. La validación cruzada (CV para abreviar) resuelve este problema. La forma más común es CV k veces: los datos se dividen en k partes (por ejemplo, 5); En cada ronda, una parte es prueba y el resto es entrenamiento; esto se tira 5 veces y se promedian las 5 puntuaciones. Así verás que el rendimiento se basa en el promedio de múltiples divisiones, no en una única división afortunada. La distribución de las puntuaciones también es informativa: puntuaciones muy volátiles (85% en un piso, 62% en el otro) indican que el modelo es inestable.

El k-fold normal no se utiliza en series temporales (se filtra el futuro); En su lugar, se realiza un "encadenamiento hacia adelante" (división de series temporales): siempre entrenando con el pasado y probando el futuro.

métrico

tipo de problema

¿Cuándo importa?

Precisión

Clasificación

Si las clases están equilibradas

Precisión

Clasificación

Las falsas alarmas son caras

Sensibilidad (recuerdo)

Clasificación

Si es caro perderse

F1

Clasificación

Si se necesita equilibrio

MAE

regresión

error interpretable

RMSE

regresión

Si los grandes errores son críticos

regresión

poder explicativo

tres mini casos

Caso 1: La ilusión de una alta precisión. Un modelo de fraude mostró una precisión del 99,2 % y el equipo lo celebró. Si observamos la matriz de confusión, la tasa real:falsa en los datos fue del 0,8%; la modelo casi no detectó falsificaciones, solo dijo "todo claro". La recuperación fue del 6%. Lección: mire las métricas, no la precisión.

Caso 2: Sobreaprendizaje latente. Un equipo entregó e impulsó XGBoost al 97 % en el conjunto de entrenamiento. El conjunto de prueba era del 69%, pero nadie había mirado. El modelo colapsó en producción. Si se hubiera realizado una validación cruzada, la gran diferencia entre pliegues (sobreaprendizaje) habría sido visible desde el principio. Lección: confíe en el CV y ​​el puntaje de las pruebas, no en el puntaje educativo.

Caso 3: División afortunada. Un analista estaba encantado de obtener el 88% en una sola división. Cuando su colega hizo un CV quíntuple, las puntuaciones fueron 88%, 71%, 83%, 64%, 79%; el promedio es 77%, pero es muy volátil. El modelo era inestable; El compartimento único era engañoso. Lección: observe la media y la distribución del CV, no el contenedor individual.

Cuatro plantillas copiables

1) Informe de clasificación completo:

He entrenado el modelo y el conjunto de prueba. Generar: matriz de confusión, precisión, recuperación, F1 (para cada clase) y recuentos de soporte. Estoy infiriendo, pero depende de mí: te diré qué métrica es importante. Tenga en cuenta que la precisión puede ser engañosa con datos desequilibrados.

2) Control de sobreaprendizaje:

Imprime las puntuaciones de mi modelo en los conjuntos de ENTRENAMIENTO y PRUEBA, uno al lado del otro. Calcula la diferencia entre ellos y advierte que una gran diferencia es señal de sobreaprendizaje. Si la diferencia es grande, sugiera regularización o simplificación.

3) Validación cruzada:

Realice una validación cruzada quíntuple (para clasificación estratificada). Imprima la puntuación, la media y la desviación estándar de cada pliegue. Si las puntuaciones son muy volátiles (estándar alto), indique que el modelo es inestable. Utilice canalizaciones para que las transformaciones se aprendan únicamente de la pieza de entrenamiento en cada capa.

4) Comparación de referencia:

Coloque la métrica de mi modelo al lado de una línea de base de DummyClassifier. ¿El modelo supera significativamente la línea de base? Si no se aprueba, deje en claro que el modelo no agrega ningún valor real.

Aviso débil / Aviso fuerte

Aviso débil:

¿Mi modelo es bueno?

"Bueno" no está definido; No está claro qué métrica, qué umbral, qué línea de base. La IA puede dar un único número de precisión y engañar.

Potente mensaje:

Su función: asistente de evaluación. Clasificación, datos desequilibrados (12% positivos). Prioridad: recordar (no perderse lo positivo). Tarea: (1) matriz de confusión, (2) precisión/recuperación/F1, (3) media y estándar CV estratificadas 5 veces, (4) comparación de referencia de DummyClassifier. Concéntrese en el recuerdo y la diferencia inicial, no en la precisión. Comenta, pero yo tomo la decisión final.

Aquí, la prioridad de la métrica, el CV y ​​la condición de referencia son claros.

Errores comunes

  • Confiar en la precisión de los datos desequilibrados. Es posible que una precisión del 99% no capture en absoluto a la clase minoritaria; Mire la matriz de confusión.
  • Simplemente mirando su puntaje educativo. Educación alta, puntaje bajo en las pruebas es sobreaprendizaje; Compara siempre dos puntuaciones.
  • Apoyándose en un solo compartimento. La división afortunada es engañosa; Mire la media y la distribución con validación cruzada.
  • No se compara con la línea de base. No se puede decir "bueno" sin saber si el modelo supera a un predictor estúpido.
  • Usando k-fold normal en series de tiempo. Se filtra el futuro; Se requiere división de series de tiempo.
Consejo: escriba tres números al lado de cada modelo: puntuación de entrenamiento, promedio de validación cruzada y puntuación de referencia. Este trío revela de un vistazo el sobreaprendizaje (formación >> CV) y la infravaloración (CV ≈ base).

En resumen

Construir un modelo es fácil, pero evaluarlo honestamente es difícil. En clasificación, la matriz de confusión, la precisión y el recuerdo son mucho más informativos que la exactitud; El costo del trabajo determina cuál es importante. MAE, RMSE y R² se utilizan en regresión. La trampa más insidiosa es el aprendizaje excesivo: compare siempre la formación y la puntuación de los exámenes. Confíe en la media y la distribución de la validación cruzada, no en una sola división; Compare todo con una línea de base. La IA calcula todo esto, pero depende del ser humano decidir qué métrica usar.

Tarea de aplicación

Extraer matriz de confusión, precisión, recuperación y F1 para un modelo de clasificación; Luego, realice una validación cruzada de 5 veces y observe la distribución de la puntuación en todos los pliegues. Finalmente, escriba el puntaje de entrenamiento, el promedio de CV y ​​un puntaje de referencia uno al lado del otro. Comente en una oración si su modelo está sobreaprendiendo y pasando la línea de base.

lista de verificación

  • [] ¿He mirado la métrica real del trabajo (precisión/recuperación/F1, etc.) en lugar de la precisión?
  • [] ¿He examinado la matriz de confusión?
  • [ ] ¿He comparado la puntuación de la formación y de las pruebas y he comprobado si hay sobreaprendizaje?
  • [] ¿He analizado la media y la distribución con validación cruzada?
  • [] ¿He comparado el modelo con una línea base?