Unidad 11 / 11

Fundación MLOps, Ética, Privacidad y Análisis Responsable

Ganancias:

  • Capacidad para comprender las fases de MLOps (lanzamiento, implementación, monitoreo, reentrenamiento, reversión) y la deriva del modelo y planificar una implementación monitoreada.
  • Capacidad para aplicar los principios de equidad, transparencia y responsabilidad del modelo y distinguir la precisión estadística de la aceptabilidad ética.
  • Capacidad para proteger datos personales con los principios KVKK/GDPR y asignar la responsabilidad final a un ser humano en decisiones de alto impacto.

Entrenar un modelo y obtener una puntuación alta no es el final, sino el medio. El valor real surge cuando el modelo se pone en producción y funciona de manera confiable, se monitorea a lo largo del tiempo sin deterioro y todo el proceso se lleva a cabo dentro de los límites éticos y legales. Esta unidad de cierre combina tres temas: MLOps (la disciplina de poner en marcha, monitorear y mantener modelos), ética (imparcialidad, transparencia, no maleficencia) y privacidad (protección de datos personales). La IA produce códigos, listas de verificación y planos en estas áreas; Pero los humanos deciden si un modelo se pone en marcha, quiénes se verán afectados y qué datos se pueden utilizar. Estas decisiones no son técnicas, sino de responsabilidad.

MLOps: el modelo vive como un producto

MLOps (Operaciones de aprendizaje automático: la práctica de ejecutar, monitorear y actualizar modelos de aprendizaje automático en producción) es la adaptación de DevOps en el desarrollo de software a la ciencia de datos. La idea básica: un modelo no es un archivo que se entrena una vez y se olvida, sino un producto vivo que requiere un mantenimiento constante. Etapas principales:

1. Versionado: el código (Git), los datos y el modelo se versionan juntos; Se registra qué modelo se produjo con qué datos y código.

2. Implementación: el modelo se pone en marcha como una API o un trabajo por lotes. Por lo general, se administra primero a una audiencia pequeña (distribución de sombra/canario).

3. Monitoreo: El desempeño del modelo y los datos de entrada se monitorean constantemente.

4. Reentrenamiento: cuando el rendimiento disminuye, el modelo se reentrena con datos actualizados.

Cambio de patrón: distorsión silenciosa

El mayor peligro en la producción es la deriva del modelo (derivación del modelo/derivación de datos). El mundo cambia; Las condiciones en las que entrenó su modelo (comportamiento del cliente, precios, temporada, legislación) cambian con el tiempo y el modelo comienza a quedar obsoleto. Por ejemplo, un modelo de demanda entrenado antes de la pandemia es completamente incorrecto durante la pandemia. La deriva se produce de dos formas: deriva de datos (la distribución de los cambios en los datos de entrada) y deriva de conceptos (la relación entre los cambios de entrada y de destino). La forma de capturarlos es el monitoreo: realizar un seguimiento constante de la distribución de entrada, la distribución de predicción y (si es posible) el rendimiento en comparación con el resultado real.

Precaución: Un modelo puesto en producción se deteriorará por sí solo; No es una cuestión de "si" sino de "cuándo". Implementar modelos sin configurar el monitoreo es como conducir un automóvil sin controlar su motor; Un día se queda ahí quieto y no te das cuenta.

Elemento MLOps

Propósito

si se descuida

Versionado

Saber lo que se produce

No reproducible, no rastreable

Monitoreo

Ver el desliz temprano

El modelo se desmorona silenciosamente.

reentrenamiento

mantente al día

Las predicciones envejecen

Revertir

volver al mal modelo

El modelo defectuoso permanece activo

Documentación

transparencia, facturación

La información se queda atrapada en una sola persona.

Ética: las decisiones modelo afectan a las personas

Los modelos de datos se utilizan cada vez más en decisiones que afectan la vida de las personas: crédito, contratación, seguros, justicia. Este poder conlleva responsabilidad. Principales riesgos éticos:

Sesgo y discriminación: el modelo puede aprender y perpetuar injusticias en datos históricos. Si a un determinado grupo se le ha dado menos crédito en el pasado, el modelo asume que se trata de una "regla" y automatiza la discriminación. Por eso es esencial el análisis de equidad, es decir, verificar si el modelo funciona de manera similar para diferentes grupos (género, edad, región).

Transparencia y explicabilidad: deberías poder explicar por qué un modelo rechazó a una persona. “La caja negra lo dice” es ética y a menudo legalmente inaceptable. Es por eso que las herramientas de explicabilidad (importancia de las características, valores SHAP) son valiosas.

Responsabilidad: ¿Quién es responsable si el modelo toma la decisión equivocada? La respuesta es siempre una persona/institución, no un modelo. La supervisión humana (human-in-the-loop, un ser humano que aprueba la decisión final) debe preservarse en las decisiones de alto impacto.

Precaución: un modelo puede ser estadísticamente "correcto" pero éticamente inaceptable. Un modelo muy preciso que sistemáticamente pone en desventaja a un grupo no es un buen modelo. La honestidad no sustituye a la justicia.

Privacidad: los datos personales están cuidadosamente protegidos

La materia prima de la ciencia de datos son a menudo datos personales, y estos datos están protegidos por la ley: KVKK en Türkiye, GDPR en Europa. Los principios básicos son: limitación de finalidad (los datos no se utilizan para fines distintos del propósito para el que fueron recopilados), minimización de datos (no se recopilan/retienen más datos de los necesarios), anonimización (se elimina información de identificación) y seguridad (los datos se mantienen cifrados y el acceso restringido). Regla fundamental al trabajar con herramientas de IA: nunca pegue datos personales reales en una herramienta de IA pública. La mayoría de las veces, un diagrama y una muestra anónima/sintética son suficientes para el análisis.

Un énfasis adicional en el contexto de la seguridad de la información: utilice herramientas y técnicas de ciencia de datos solo en datos y sistemas sobre los cuales tiene autoridad, con fines de análisis defensivo y legítimo. El acceso no autorizado a los datos de otra persona, la reidentificación de personas (extracción de identidad a partir de datos anónimos) o la elaboración de perfiles no autorizados son ilegales y poco éticos.

tres mini casos

Caso 1: colapso sin seguimiento. Una empresa de comercio electrónico puso en marcha su modelo de recomendación y no configuró el seguimiento. Después de 4 meses el catálogo de productos ha cambiado mucho; el modelo siguió recomendando productos obsoletos y la tasa de conversión cayó silenciosamente en un 30%. Nadie se dio cuenta durante meses. Lección: la implementación sin monitoreo se vuelve ciega.

Caso 2: Discriminación oculta. Un modelo de selección de contratación aprendió sobre el desequilibrio de género en datos históricos y subestimó sistemáticamente a las candidatas. No se notó porque no hubo un análisis de equidad; Se reveló en una auditoría y la institución enfrentó un grave riesgo legal/de reputación. Lección: el control de equidad grupal es esencial en los modelos de alto impacto.

Caso 3: Violación de la confidencialidad. Un analista cargó un archivo que contenía correos electrónicos de clientes reales e historial de compras en una herramienta pública de inteligencia artificial y dijo: "resuma segmentos". Los datos personales han salido de la institución; El proceso KVKK ha comenzado. La forma correcta era eliminar los campos de identidad y compartir solo propiedades anónimas. Lección: los datos personales reales no entran en la herramienta abierta.

Cuatro plantillas copiables

1) Lista de verificación previa al despliegue:

Su función: consultor de MLOps. Enumere las cosas que necesito verificar antes de poner un modelo en producción: control de versiones, métricas de monitoreo, plan de reversión, umbral de rendimiento, alerta de deriva de datos, persona responsable. Agregue una explicación de una oración sobre "por qué es importante" para cada elemento. Yo decidiré.

2) Diseño de seguimiento de cambios de modelo:

Sugiera un plan de monitoreo de deriva para un modelo de clasificación en producción: (1) qué distribuciones de entrada debo monitorear, (2) qué alarma para la distribución de predicción, (3) cómo comparar el rendimiento cuando llega el resultado real, (4) en qué umbral se debe activar el reentrenamiento. También proporcione un esqueleto de código.

3) Control de equidad:

Escribir código que compare el rendimiento de mi modelo para diferentes grupos (por ejemplo, grupo de edad, región): recuerdo/precisión y tasa de decisión positiva para cada grupo. Advertir si hay una diferencia significativa entre grupos. Hacer interpretaciones causales/políticas; Sólo muéstrame las diferencias y consideraré la decisión.

4) Verificación previa de privacidad:

Antes de proporcionar datos a una herramienta de inteligencia artificial, verifique: ¿hay datos personales/de identidad (nombre, correo electrónico, identificación, teléfono, dirección, IP) en la lista de columnas a continuación? Si es así, indique cuáles deben eliminarse o anonimizarse. Columnas: [lista]. Propósito: compartir únicamente un esquema anónimo.

Aviso débil / Aviso fuerte

Aviso débil:

Mi modelo está listo, en marcha.

La implementación no es un solo paso; Lanzarse sin monitoreo, reversión, equidad y control de privacidad es una invitación silenciosa al desastre.

Potente mensaje:

Su función: consultor responsable de MLOps. Mi modelo ha sido entrenado, quiero una preparación completa antes de publicarlo. Genere: (1) lista de verificación previa a la implementación, (2) plan de monitoreo de deriva, (3) código de verificación de equidad basado en grupo, (4) verificación de privacidad (hay datos personales). Sugiera también cómo proteger el consentimiento humano en decisiones de alto impacto. Las decisiones finales son mías.

Aquí la distribución, el seguimiento, la equidad y la privacidad se tratan como un único proceso responsable.

Errores comunes

  • Implementar un modelo sin configurar el monitoreo. El modelo se desliza y se distorsiona silenciosamente; Pueden pasar meses hasta que se dé cuenta.
  • Pasando por alto el control de la justicia. Un modelo de alta fidelidad puede poner sistemáticamente en desventaja a un grupo.
  • Tomar una decisión de caja negra inexplicable. Las decisiones de alto impacto deben ser explicables; "El modelo lo dijo" no es suficiente.
  • Proporcionar datos personales reales para abrir la herramienta de IA. violación de KVKK/GDPR; El diagrama y el ejemplo anónimo son suficientes.
  • Delegar la decisión al modelo. La responsabilidad siempre recae en una persona; Se mantiene una vigilancia humana de alto impacto.
Consejo: antes de poner en marcha cada modelo, haga una pregunta en voz alta: "Si este modelo se rompe silenciosamente mañana o penaliza injustamente a un grupo, ¿cómo me daré cuenta y lo revertiré?" Si no tiene una respuesta clara a esta pregunta, el modelo aún no está listo para producción.

En resumen

El trabajo de un modelo no termina con una puntuación alta, sino con trabajar de forma fiable y responsable en producción. MLOps es la disciplina de poner en marcha, monitorear la deriva, reentrenar y revertir el modelo; La implementación sin seguimiento es un colapso silencioso. La ética requiere equidad, transparencia y rendición de cuentas del modelo; La precisión estadística no sustituye a la aceptabilidad ética. Privacidad significa proteger los datos personales con los principios KVKK/GDPR y mantener los datos reales alejados de las herramientas abiertas. Todas estas decisiones no son técnicas sino de responsabilidad y siempre pertenecen a un ser humano.

Tarea de aplicación

Piense en ello como si fuera a poner en producción un modelo que ha creado (o hipotético) y completar cuatro listas: (1) lista de verificación previa a la implementación, (2) métricas de deriva que rastreará, (3) plan de control de equidad basado en grupos, (4) control de privacidad. Luego escribe una respuesta concreta a la pregunta "¿Cómo me daré cuenta si mañana se rompe silenciosamente y lo recuperaré?"

lista de verificación

  • [] ¿Estoy implementando el modelo con un plan de monitoreo (alerta de deslizamiento) y reversión?
  • [ ] ¿He verificado la brecha de equidad/desempeño para diferentes grupos?
  • [] ¿Me he mantenido al tanto de las decisiones de alto impacto?
  • [ ] ¿He protegido los datos personales con los principios KVKK/GDPR y los he mantenido alejados de las herramientas abiertas?
  • [] ¿He puesto la responsabilidad final en un ser humano, no en el modelo?

Examen del módulo

1. Un científico de datos pregunta a la inteligencia artificial: "¿Qué tan preciso es el bosque aleatorio en estos datos?" sin entrenar el modelo en absoluto y coloca directamente la respuesta "89%" en la presentación. ¿Cuál es el error fundamental de este enfoque?

  • A) Esperar métricas sin dar datos y modelos a la inteligencia artificial; Ignorar que el número que produce es falso y que la métrica real solo se puede encontrar mediante entrenamiento y pruebas ✔
  • B) Debe utilizar regresión logística en lugar de bosque aleatorio
  • C) El índice de precisión debe ser siempre superior al 90%.
  • D) Está estrictamente prohibido incluir métricas en la presentación.

Explicación: La inteligencia artificial no puede producir una métrica sin acceder al modelo y a los datos; El número que da es una alucinación (inventada). La métrica se obtiene mediante el cálculo del propio científico de datos solo después de que el modelo haya sido entrenado y probado. La salida no verificada es como un informe sin firmar.

2. La columna "motivo del cierre de la cuenta" se incluye al recopilar datos para una previsión de abandono; Esta columna se llena sólo después de que el cliente se marcha. El modelo da un 97% en el conjunto de prueba, pero no funciona en producción. ¿Cuál es el nombre y la causa de esta condición?

  • A) Sobreaprendizaje; El modelo es demasiado complejo.
  • B) Fuga de datos; ✔ Usar información que no estará disponible en el momento de la predicción, pero que es el resultado del objetivo, como característica
  • C) Aprendizaje insuficiente; El modelo es demasiado simple.
  • D) Sesgo de selección; tamaño de muestra pequeño

Explicación: Esta es una filtración de datos clásica: el 'motivo de cierre' es el resultado del objetivo y todavía está vacío en el momento de la predicción. El modelo funciona con este conocimiento futuro, se ve muy bien en el conjunto de prueba pero falla en producción porque esa columna está vacía. La pregunta "¿lo tengo en el momento de la predicción?" debe formularse en cada columna.

3. Un analista completa los valores faltantes en la columna de ingresos con la media; pero las personas desaparecidas en realidad pertenecen al segmento de bajos ingresos que nunca ha declarado ingresos (desaparecidos sistemáticos). ¿Por qué este relleno es incorrecto?

  • A) La media siempre es mayor que la mediana, por lo que es incorrecta.
  • B) Los valores faltantes nunca deben completarse, siempre deben eliminarse
  • C) Llenar el vacío sistemático con la media distorsiona los datos al representar artificialmente a ese grupo; El llenado se realizó sin preguntar "¿por qué está vacío?" ✔
  • D) Calcular el promedio crea un problema de rendimiento porque es demasiado lento

Explicación: La causa de la deficiencia determina la solución. Cuando la falta sistemática (la brecha concentrada en un determinado grupo) se llena con el promedio, ese grupo se convierte artificialmente en "ingreso promedio" y los datos se distorsionan. Antes de llenarlo se debe plantear la pregunta 'por qué está vacío'; La media faltante sistemática/significativa no debe completarse.

4. Un equipo encuentra una correlación de 0,78 entre "inversión publicitaria" y "ventas" y duplica el presupuesto; Sin embargo, lo que realmente desencadena ambas son las campañas estacionales. ¿Qué principio de estadística explica este error?

  • A) La correlación no es causalidad; Una tercera variable oculta puede estar afectando a ambas variables ✔
  • B) Dado que la correlación de 0,78 es demasiado baja, la relación debe ignorarse
  • C) La correlación siempre prueba la causalidad, el equipo lo hizo bien
  • D) La correlación entre publicidad y ventas no se puede calcular matemáticamente.

Explicación: La correlación no es causalidad. Las dos variables pueden actuar juntas porque una tercera variable oculta (en este caso, las campañas estacionales) las afecta a ambas. La conclusión de que uno causa el otro sólo puede establecerse mediante experimentos y conocimiento de campo; El número de correlaciones por sí solo no es prueba de causalidad.

5. Un modelo de detección de fraude muestra una precisión del 99,2 % y el equipo lo celebra; Sin embargo, la tasa de transacciones falsas en los datos es sólo del 0,8% y la recuperación del modelo es del 6%. ¿Qué muestra esta tabla?

  • A) El modelo es perfecto porque la precisión es superior al 99%.
  • B) La precisión es engañosa con datos desequilibrados; El modelo pasa por alto casi todas las falsificaciones (baja recuperación), se debe observar la métrica apropiada ✔
  • C) No hay problema ya que la recuperación del modelo es alta.
  • D) No hubo necesidad de construir un modelo porque la tasa de falsificación era baja

Explicación: La 'exactitud' es engañosa en datos desequilibrados. Cuando el modelo considera que casi todas las transacciones son "limpias", obtiene una alta precisión porque las falsificaciones son muy pocas, pero no logra detectarlas, que es su objetivo principal (recuerde el 6%). Por lo tanto, en problemas desequilibrados, la atención no se centra en la precisión, sino en la matriz de confusión y las métricas adecuadas para el propósito del trabajo, como la recuperación/precisión.

6. En un proyecto de previsión de la demanda, los datos dependientes del tiempo se dividen aleatoriamente en formación/pruebas. El modelo ofrece una precisión del 93% pero falla en producción. ¿Cuál debería ser el enfoque de división correcto?

  • A) Ampliar el conjunto de prueba, p.e. dividir 50%/50%
  • B) Usando un modelo más complejo
  • C) Eliminar completamente la partición y entrenar con todos los datos.
  • D) División cronológica: entrenar con el período anterior y probar con el nuevo período, evitando así que el modelo vea el futuro ✔

Explicación: si se realiza una división aleatoria en los datos de series de tiempo, el modelo ve el futuro y predice el pasado durante el entrenamiento; es una fuga y produce un éxito que en realidad no existe. El enfoque correcto es la división cronológica: entrenar con el período anterior y probar con el nuevo período, imitando la situación real en producción (prediciendo del pasado al futuro).

7. ¿A partir de qué datos se deben calcular los parámetros de escala (StandardScaler) en la ingeniería de características y cómo se deben aplicar?

  • A) Debe calcularse a partir de todos los datos (entrenamiento + pruebas juntos) para que sea más preciso
  • B) Debe calcularse por separado para cada fila, a partir del valor propio de esa fila.
  • C) Debe calcularse únicamente a partir de datos de prueba.
  • D) Debe calcularse únicamente a partir de los datos de entrenamiento, luego se deben aplicar los mismos parámetros a los datos de prueba; de lo contrario se filtrará ✔

Explicación: Los parámetros de todas las transformaciones (media, desviación estándar, etc.), como escala, codificación y relleno, deben aprenderse únicamente de los datos de entrenamiento y luego se deben aplicar los mismos a los datos de prueba. Tener en cuenta los datos de la prueba también hace que la información de la prueba interfiera con el entrenamiento, es decir, fugas, y hace que el modelo se vea mejor de lo que es. El uso de Pipeline garantiza esto.

8. Un modelo proporciona un 98 % de precisión en el conjunto de entrenamiento y un 72 % de precisión en el conjunto de prueba. ¿Qué indica este síntoma y qué se debe hacer?

  • A) Aprendizaje insuficiente; el modelo debería hacerse más complejo
  • B) Fuga de datos; el equipo de prueba debe cambiarse
  • C) Sobreajuste; se debe simplificar el modelo, se debe aplicar regularización y validación cruzada ✔
  • D) Una situación normal; El puntaje educativo siempre es más alto de todos modos, las precauciones son innecesarias

Explicación: Una puntuación muy alta en el entrenamiento y una puntuación significativamente baja en las pruebas es un síntoma clásico de sobreajuste: el modelo ha memorizado el ruido de los datos de entrenamiento en lugar del patrón real. Las soluciones incluyen simplificar el modelo, más datos, regularización y verificar el estado con validación cruzada. Depender únicamente del puntaje educativo oculta este escollo.

9. En una presentación de gestión, el eje y de un gráfico de barras en el que las ventas aumentan de 1000 a 1020 comienza en 980 para que el aumento parezca enorme. El aumento real es del 2%. ¿Por qué es esto una cuestión ética?

  • A) Un eje y truncado exagera visualmente una pequeña diferencia y engaña al espectador; Para ser justos, el eje en las barras de comparación debe comenzar desde 0 ✔
  • B) Los gráficos de barras nunca se pueden utilizar para datos de ventas.
  • C) No hay ningún problema; Siempre es bueno hacer que el gráfico luzca impresionante.
  • D) El eje Y siempre debe comenzar desde el valor más grande de los datos.

Explicación: En los gráficos de barras con fines comparativos, el eje y generalmente debe comenzar en 0. Cortar el eje y comenzar en 980 hace que una pequeña diferencia del 2 % parezca visualmente enorme y confunda al espectador. La responsabilidad ética del profesional de datos es dibujar gráficos honestos que no exageren ni subestimen los datos.

10. Un analista encuentra la facturación total 3 veces después de UNIR los pedidos con la tabla de productos; El número de líneas aumentó de 240 mil a 690 mil. ¿Qué se debería haber hecho para evitar este error silencioso?

  • A) Dividir la facturación total por 3
  • B) Utilice siempre consultas separadas en lugar de UNIRSE
  • C) Eliminar la tabla de productos por completo
  • D) Verificar el número de filas después de fusionar/UNIRSE y verificar que estén unidas mediante la clave correcta; Detectar la replicación temprana ✔

Explicación: Cuando hay varias filas para cada producto (color diferente, por ejemplo) en la tabla de productos, JOIN mediante la clave incorrecta duplicará cada pedido e inflará los totales. El código se ejecuta sin errores pero el resultado es incorrecto. La forma de evitar esto es verificar el número de filas después de cada combinación/UNIRSE y combinar con la clave correcta.

11. Un modelo de selección de contratación aprende sobre el desequilibrio de género en datos históricos y subestima sistemáticamente a las candidatas, pero su precisión general es alta. ¿Qué quiere decir esto?

  • A) No hay problema porque el modelo tiene alta precisión.
  • B) La precisión estadística no sustituye a la aceptabilidad ética; El modelo ha aprendido sobre discriminación en el pasado, se requiere una verificación de equidad grupal ✔
  • C) Aumentar aún más la precisión del modelo resuelve el problema.
  • D) La equidad está fuera del alcance de la ciencia de datos

Explicación: Incluso si un modelo es estadísticamente correcto, puede ser éticamente inaceptable. El modelo aprende la injusticia de los datos pasados ​​y automatiza la discriminación. La alta integridad no sustituye a la justicia; En los modelos de alto impacto, el control de equidad, que mide la diferencia entre desempeño y decisión para diferentes grupos, es esencial y la responsabilidad final recae en el ser humano.

12. Un empleado carga un archivo que contiene correos electrónicos de clientes reales e historial de compras en una herramienta pública de inteligencia artificial y dice "resumir segmentos". ¿Por qué es esto un grave error y cuál es el camino correcto?

  • A) No hay ningún problema; Las herramientas de IA nunca almacenan datos
  • B) El error es que el archivo es demasiado grande; debería haberse reducido
  • C) Proporcionar datos personales reales a una herramienta abierta es una violación de KVKK/GDPR; Los campos de identidad deberían haberse eliminado y solo se debería haber compartido el esquema/propiedad anónimo ✔
  • D) Se debería haber utilizado CSV en lugar de solo Excel

Explicación: Cuando se proporcionan datos personales reales (como correo electrónico, nombre, etc.) a una herramienta de inteligencia artificial disponible públicamente, se producirá una violación de la privacidad dentro del alcance de KVKK/RGPD; los datos salen de la organización. La mayoría de las veces, un diagrama y una muestra anónima/sintética son suficientes para el análisis. La forma correcta es eliminar los campos de identidad y compartir solo propiedades anónimas.

13. Se pone en producción un modelo de recomendación pero no se establece seguimiento; Cuando el catálogo de productos cambia después de 4 meses, el modelo continúa recomendando productos antiguos y la tasa de conversión cae silenciosamente en un 30%. ¿Cómo se llama este fenómeno?

  • A) Sobreaprendizaje; El modelo memoriza el conjunto de entrenamiento.
  • B) Deriva del modelo; A medida que el mundo cambia, el modelo se vuelve obsoleto silenciosamente, desapercibido porque no se establece un seguimiento ✔
  • C) Sesgo de selección; sesgo de muestra
  • D) Violación de minimización de datos

Explicación: Esto es la deriva del modelo (desviación del modelo/datos): cuando el mundo cambia (catálogo, comportamiento, estación), las condiciones bajo las cuales se entrenó el modelo cambian y el modelo colapsa silenciosamente. Un modelo puesto en producción se deteriora por sí solo; Es una cuestión de "cuándo". La implementación sin monitoreo (seguimiento de las entradas y el rendimiento) hace imposible detectar la degradación.

14. Un modelo que obtiene un 88% de precisión en una única división de entrenamiento/prueba tiene puntuaciones de validación cruzada quíntuples de 88%, 71%, 83%, 64%, 79%. ¿Qué indica esto y por qué es importante la validación cruzada?

  • A) El modelo es estable; 88% es rendimiento real
  • B) La validación cruzada es innecesaria; Un compartimento es suficiente
  • C) La gran volatilidad de las puntuaciones indica que el modelo es inestable; la validación cruzada basa el rendimiento en el promedio y la distribución de múltiples contenedores, no en un solo contenedor afortunado ✔
  • D) Lo mejor es informar la puntuación más alta (88%)

Explicación: Un solo compartimento puede traer suerte o mala suerte; El 88% fue sólo el resultado de esa fácil división. La validación cruzada divide los datos varias veces, basa el rendimiento en la media (aquí ~77%) y muestra la volatilidad de las puntuaciones. La alta volatilidad aquí sugiere que el modelo es inestable; Confiar en un solo compartimento es engañoso.