Unidad 11 / 11

Integración de extremo a extremo, MLOps y responsabilidad del ingeniero

Ganancias:

  • Capacidad para diseñar un proyecto automotriz respaldado por IA desde el concepto hasta la producción y mantenerlo con un ciclo de monitoreo.
  • Capacidad para evaluar la gestión de versiones del modelo, la deriva de datos y las necesidades de reentrenamiento.
  • Capacidad para escalar la IA de forma segura manteniendo la responsabilidad, la trazabilidad y la documentación durante todo el proyecto.

En la última unidad de este módulo, reunimos todas las piezas. Hemos visto cómo se utiliza la inteligencia artificial en unidades individuales, desde el diseño hasta la producción, desde las pruebas hasta la cadena de suministro. Pero en un proyecto real, estos no son pasos aislados, sino un ciclo de vida: se recopilan datos, se construye el modelo, se pone en producción, se monitorea y, cuando envejece, se renueva. La disciplina de mantener este ciclo se llama MLOps (Machine Learning Operations). Esta unidad cubre la configuración, el mantenimiento y la responsabilidad de un proyecto automotriz impulsado por IA de principio a fin.

Ciclo de vida de un proyecto de IA

Un flujo típico de un extremo a otro en un contexto automotriz:

  1. Definición de problema y valor: ¿Qué problema empresarial estamos resolviendo? ¿Cómo se mide el éxito? ¿Es esta una función crítica para la seguridad?
  2. Recogida de datos y etiquetado: Fuentes (CAN, ensayos, producción, telemática), calidad, confidencialidad.
  3. Desarrollo de modelos: Atributo, modelo, verificación (control de fugas, consistencia unitaria).
  4. Verificación y evaluación de seguridad: Pruebas independientes si se requiere ISO 26262/SOTIF.
  5. Implementación: Implementación del modelo en el dispositivo, en línea o en la nube.
  6. Monitoreo: rendimiento, deriva de datos, precisión de alarmas.
  7. Reentrenamiento: Actualización del modelo cuando envejece.
  8. Documentación y trazabilidad: Registro de cada paso; quién, cuándo, por qué.

Este ciclo no termina de una vez por todas; gira constantemente. En automoción, es peligroso "configurar y olvidar" un modelo.

Consejo: Al iniciar el proyecto, "¿quién monitoreará este modelo una vez que esté en el campo, con qué métrica y con qué frecuencia?" Si no puede responder la pregunta, el modelo aún no está listo para producción.

Gestión y trazabilidad de versiones de modelos.

La trazabilidad en el sector del automóvil no es un lujo, sino a menudo una obligación legal. Cuando surge un problema, debería poder responder la pregunta "¿qué versión del modelo, con qué datos se entrenó, quién lo aprobó?" Buenas prácticas:

  • Versionado del modelo: se registran el número de cada modelo, los datos de entrenamiento y la fecha.
  • Control de versiones de datos: los datos con los que se entrenó están congelados.
  • Registro de decisiones: la aprobación fue dada por quién y con qué evidencia.
  • Plan de reversión: si el nuevo modelo resulta ser malo, puedes volver al anterior.

artículo

¿Por qué es necesario?

Riesgo si falta

Versión del modelo

¿Qué versión hay en el campo?

El problema no se puede rastrear.

Versión de datos

¿Con qué fue entrenado?

no reproducible

Registro de aprobación

¿Quién es responsable?

no se puede responsabilizar

deshacer

Regreso de una mala versión

Largo tiempo de inactividad en el campo

Deriva de datos y deterioro del modelo

Un modelo es una instantánea del mundo en el que se entrena. Pero el mundo cambia: un nuevo proveedor de repuestos trae una tolerancia de sensor diferente, sale un nuevo modelo de vehículo, cambian las estaciones, cambian los hábitos de conducción. El rendimiento del modelo disminuye silenciosamente a medida que la distribución de los datos de entrada se aleja del tiempo de entrenamiento. Esta desviación de los datos y la consiguiente disminución del rendimiento se denomina deterioro del modelo.

El peligro es que este declive sea silencioso: el modelo no colapsa, no comete errores, simplemente se equivoca cada vez más. Por lo tanto:

  • Monitorear la distribución de entrada (detección de deriva).
  • Supervise las métricas de rendimiento con resultados reales (¿fueron precisas las alarmas?).
  • Activar el reentrenamiento cuando se excede el umbral.
Precaución: La suposición de que "una vez que se entrena el modelo, ofrece el mismo rendimiento para siempre" es errónea y arriesgada en el sector automovilístico. Un modelo puesto en producción sin control de deriva puede, sin saberlo, volverse poco fiable.

Escenario de ejemplo de extremo a extremo: flota de mantenimiento predictivo

Hagámoslo concreto. Está instalando un sistema de alerta temprana de fallas del turbo para una flota de carga:

  1. Valor: Reduzca el tiempo de inactividad y los costos de remolque; éxito = fallo real/equilibrio de falsa alarma capturado.
  2. Datos: señales CAN de 40 vehículos, registros históricos de fallas; VIN es anónimo.
  3. Modelo: Anomalía + RUL; se evitó la fuga de series temporales; Se presenta el rango de incertidumbre.
  4. Verificación: Backtesting sobre fallas pasadas; Se sopesó el coste de las falsas alarmas.
  5. Producción: Puntuación diaria en la nube; panel al técnico.
  6. Monitoreo: control de deriva cuando se agrega un nuevo modelo de vehículo; precisión de la alarma semanalmente.
  7. Reciclaje: actualización trimestral con nuevos tipos de vehículos y nuevos ejemplos de fallas.
  8. Documentación: Versión del modelo, versión de datos, ingeniero certificador registrado.

Ningún paso en este flujo dice "La IA decidió, listo"; Una persona es responsable de cada etapa.

Mini estudios de casos

Caso 1 - Decadencia silenciosa. Un modelo de control de calidad funciona bien durante un año y luego la tasa de fuga aumenta lentamente. Causa raíz: cuando el proveedor cambió, la textura de la superficie de la pieza se volvió ligeramente diferente (deriva) y el modelo comenzó a pensar que esto era "normal". Se establece el monitoreo de la deriva y se vuelve a entrenar el modelo. Resultado: sin seguimiento, la vulnerabilidad habría pasado desapercibida durante meses.

Caso 2 - Trazabilidad guardada. Una denuncia de falsa alarma llega desde el campo. A partir del registro de decisiones, el equipo descubre qué versión del modelo funciona con qué datos; Detecta que el problema proviene de la configuración del umbral en una versión particular y revierte esa versión. Resultado: si no había ningún registro de versión ni de decisión, no se podía rastrear el problema.

Caso 3 - Disciplina de reciclaje. Cuando un nuevo modelo eléctrico se suma a la flota, el modelo de mantenimiento predictivo existente genera muchas falsas alarmas en este vehículo (un tren motriz que nunca ha visto). Antes de poner en marcha el nuevo modelo, el equipo captura la advertencia de deriva y amplía el modelo con nuevos datos del vehículo. Resultado: el monitoreo de la deriva detectó tempranamente la degradación que acompañaba al nuevo producto.

plantillas de mensajes

Plantilla 1 - Borrador del plan de proyecto:

Rol: Líder de proyecto de IA (automotriz). Tarea: Ayúdame a planificar un proyecto impulsado por IA de principio a fin. Contexto: Mantenimiento predictivo; Flota de 40 vehículos; El VIN es anónimo. Restricción: Considere los pasos de definición de valor, datos, modelo, verificación, producción, monitoreo, reentrenamiento y documentación por separado; indique quién es responsable de cada paso. Salida: Paso | salida | responsable | tabla de riesgo.

Plantilla 2 - Plan de seguimiento:

Rol: Eres un ingeniero de MLOps. Tarea: Recomendar un plan de monitoreo para un modelo que se está implementando. Contexto: La distribución de insumos puede cambiar con el tiempo (nuevo proveedor, nueva herramienta); el rendimiento se puede medir mediante resultados reales. Salida: Métrica a seguir | umbral | acción a desencadenar.

Plantilla 3 - Clasificación de deriva:

Rol: Científico de datos. Tarea: Explique cómo detectar la desviación de datos y cuándo es necesario volver a capacitarse. Contexto: Modelo de inspección visual de línea de producción; Puede haber un cambio de proveedor. Salida: Señal | medición | gatillo de reentrenamiento.

Plantilla 4 - Lista de verificación de trazabilidad:

Rol: Usted es un auditor de calidad/cumplimiento. Tarea: Crear una lista de verificación de trazabilidad para un modelo. Contexto: Automotriz; Cuando ocurre un problema, se debe responder la pregunta "qué versión, qué datos, quién los aprobó". Salida: Artículo | por qué es necesario | cómo guardar el gráfico.

Aviso débil / Aviso fuerte

Aviso débil:

Poner el modelo en producción.

Sin seguimiento, sin control de versiones, sin responsabilidad y sin reversiones; La decadencia silenciosa y los problemas imposibles de rastrear son inevitables.

Potente mensaje:

Rol: Usted es consultor de MLOps y calidad automotriz. Tarea: Crear la lista de verificación que necesito para poner en producción un modelo de manera responsable. Contexto: Flota de mantenimiento predictivo; Con el tiempo se añaden nuevos tipos de vehículos; VIN anónimo.Restricción: Incluye monitoreo, detección de deriva, registro de versión/datos, confirmación y plan de reversión; Indique quién es el responsable de cada artículo; Proposición 'configúralo y olvídalo'. Salida: Etapa | necesidad | responsable | tabla de riesgo.

Errores comunes

  • Enfoque de “configúralo y olvídalo”. Sin seguimiento, el modelo decae silenciosamente.
  • No mantener registros de versión/datos. El problema no se puede rastrear ni reproducir.
  • Sin plan de reversión. Si la recuperación de una mala versión lleva mucho tiempo, habrá fallas prolongadas en el campo.
  • Sin esperar a Drift. Un nuevo proveedor/herramienta/temporada altera el modelo; el seguimiento es esencial.
  • Dejando la responsabilidad poco clara. La respuesta a "quién es responsable" debe quedar clara en cada paso.

En resumen

  • Un proyecto automotriz impulsado por IA no es un ciclo de vida único sino continuo (MLOps).
  • El control de versiones de modelos y datos, el registro de decisiones y la planificación de reversión son esenciales para la trazabilidad.
  • La deriva de datos refuta silenciosamente el modelo; Los aportes y el desempeño deben ser monitoreados y reentrenados según sea necesario.
  • En el ejemplo de un extremo a otro, cada paso tiene un responsable humano; No hay un "AI decidido, se acabó".
  • “Configúralo y olvídalo” es arriesgado en el sector automovilístico; El seguimiento, la documentación y la rendición de cuentas se mantienen durante todo el proyecto.

Tarea de aplicación

Combine lo que aprendió en este módulo en un solo proyecto (por ejemplo, inspección visual de la línea de producción o mantenimiento predictivo). (1) Redactar un plan de proyecto de principio a fin con la Plantilla 1; Anota la persona responsable de cada paso. (2) Defina un plan de monitoreo y desencadenantes de deriva con la Plantilla 2. (3) Prepare una lista de verificación de trazabilidad con la Plantilla 4. (4) Resuma en un párrafo cómo aplicó las tres disciplinas ancla desde el comienzo del módulo a este proyecto.

lista de verificación

  • [ ] Planifiqué el proyecto como un ciclo de vida de principio a fin.
  • [ ] Definí el registro de decisión con versionado de modelo y datos.
  • [] Establezco un plan de seguimiento y activadores de deriva.
  • [] Preparé un plan de reversión.
  • [ ] He aclarado quién es responsable de cada paso.
  • [] Mantuve las tres disciplinas de validación de anclaje y la validación crítica para la seguridad humana.

Examen del módulo

1. ¿Cuál es el papel de la producción de IA en una decisión crítica para la seguridad del automóvil (por ejemplo, verificación del software de frenos)?

  • A) Acelera el análisis, pero la aprobación final y la responsabilidad quedan en manos del ingeniero competente ✔
  • B) Si hay suficientes datos, se pueden poner en producción sin la aprobación del ingeniero.
  • C) La IA no se puede utilizar en ningún momento en sistemas críticos como los frenos
  • D) Si la precisión del modelo supera el 99%, la verificación humana no es necesaria

Descripción: La inteligencia artificial acelera el análisis, genera soluciones candidatas y resúmenes; Sin embargo, la decisión crítica para la seguridad y la aprobación final son responsabilidad del ingeniero competente. La IA no reemplaza la validación de ingenieros.

2. ¿Cuáles son las tres comprobaciones independientes que se utilizan para probar el resultado de una IA en las tres disciplinas de validación de anclaje?

  • A) Longitud, idioma y formato del mensaje
  • B) Evidencia de orden de magnitud, razonabilidad de ingeniería y pruebas/mediciones independientes ✔
  • C) Tamaño del modelo, tiempo de entrenamiento y número de GPU.
  • D) Marca del proveedor, precio y tiempo de entrega.

Descripción: Tres anclas; orden de magnitud (verificación de pedido), plausibilidad de ingeniería (física/experiencia) y validación cruzada con evidencia de prueba/medición independiente. Estos tres brindan confianza en la evidencia, no confianza en la IA.

3. ¿Cuál es la verificación más crítica para el resultado de un 'modelo sustituto' que acelere la simulación CFD o FEA?

  • A) El modelo sustituto siempre es más preciso que el solucionador real
  • B) Basta con hacer que el renderizado luzca estéticamente agradable
  • C) Comparación con la solución de referencia y aceptación de la falta de fiabilidad al desplazarse fuera del espacio de formación ✔
  • D) No es necesario considerar la independencia de la red si una sola ejecución converge

Descripción: el modelo sustituto produce predicciones rápidas en lugar del solucionador real; pero no es confiable fuera del espacio de diseño en el que fue entrenado. El resultado debe verificarse marcando la región de extrapolación con simulación de alta fidelidad de referencia y condiciones de contorno físicas.

4. ¿Cuál es la expresión correcta para el Nivel 2 (automatización parcial) en los niveles de automatización SAE?

  • A) El vehículo puede circular sin conductor en todas las condiciones.
  • B) El sistema no realiza ninguna tarea de conducción, solo da advertencias.
  • C) Está bien si no está sentado en el asiento del conductor.
  • D) El sistema apoya la dirección y la velocidad, pero el conductor mantiene una supervisión y responsabilidad constantes ✔

Descripción: En el nivel 2, el sistema admite dirección y velocidad/distancia simultáneamente, pero el conductor mantiene una supervisión constante y está listo para tomar el control en cualquier momento; La responsabilidad es del conductor. A partir del nivel 3, el sistema asume las tareas de conducción en determinadas condiciones.

5. ¿Por qué la 'tasa de escape' es una métrica crítica en la detección visual de defectos en la línea de producción?

  • A) Aprobar la pieza defectuosa y enviarla al campo plantea un riesgo de seguridad y retirada ✔
  • B) Es importante sólo porque ralentiza la velocidad de la línea.
  • C) La tasa de fuga es válida sólo para defectos de pintura.
  • D) La tasa de fuga mide el tiempo de entrenamiento del modelo.

Descripción: Ilegal; Una pieza defectuosa se considera perfecta y pasa por la línea (falso negativo). Para una pieza de seguridad automotriz, la fuga es mucho más costosa que el falso rechazo, ya que puede provocar fallas o retiros en el campo; El umbral se ajusta en consecuencia.

6. ¿Cuál es el uso más preciso de la estimación de la 'vida útil restante' (RUL) en el mantenimiento predictivo?

  • A) RUL se calcula solo para aceite de motor
  • B) Debe presentarse con un rango de incertidumbre e interpretarse según la ventana de mantenimiento y el margen de seguridad ✔
  • C) Se debe tomar como un valor de día único y preciso y no se deben realizar comprobaciones hasta ese día.
  • D) Los sensores se pueden apagar si RUL es alto

Descripción: RUL es el tiempo de funcionamiento restante estimado de un componente hasta que falle; Debe presentarse con el rango de incertidumbre e interpretarse de acuerdo con el plan de mantenimiento y el margen de seguridad. En lugar de confiar ciegamente en una estimación puntual única, se tienen en cuenta el intervalo de confianza y el coste de las falsas alarmas.

7. ¿Qué debe hacer un ingeniero cuando la IA señala una anomalía en el registro de una prueba en carretera en el análisis de datos de la prueba?

  • A) Cuando vea la anomalía, la prueba automáticamente se considerará fallida.
  • B) La IA no debería mirar los datos en absoluto si no los ha marcado
  • C) Verificar la anomalía con datos brutos, incertidumbre de medición y repetibilidad ✔
  • D) Eliminar anomalías y borrar el informe.

Explicación: La anomalía que la IA señala es una pista, no una conclusión. El ingeniero debe verificar la incertidumbre de la medición, la posibilidad de falla del sensor y la repetibilidad y verificar la anomalía con datos sin procesar y criterios de aceptación. La aceptación o el rechazo automático no es apropiado.

8. ¿Qué verificación es obligatoria para un cambio de material sugerido por AI en un estudio de aligeramiento?

  • A) Sólo necesita ser más ligero
  • B) Una sola fila en la base de datos de materiales puede tomarse como evidencia.
  • C) El comportamiento en caso de colisión no es importante en materiales ligeros.
  • D) Los requisitos mecánicos, de fatiga, de colisión, de capacidad de fabricación y de costos deben probarse juntos ✔

Observación: La recomendación del material no se puede aceptar basándose únicamente en la relación densidad/resistencia; Las propiedades mecánicas, la fatiga, el comportamiento en caso de colisión, la capacidad de fabricación, la corrosión, el coste y los requisitos de seguridad deben verificarse conjuntamente y confirmarse mediante pruebas físicas.

9. ¿Por qué el "riesgo de fuente única" en la cadena de suministro automotriz requiere una atención especial en las recomendaciones de IA?

  • A) Una interrupción en un único proveedor puede detener toda la producción; Se deben evaluar la segunda fuente y el búfer ✔
  • B) Una sola fuente es siempre la opción más segura
  • C) El análisis de riesgos es innecesario si la IA lo sugiere.
  • D) El riesgo de fuente única se aplica únicamente al neumático.

Explicación: Si una pieza proviene de un único proveedor, la producción se detiene cuando hay un problema con ese proveedor. La IA puede recomendar una única fuente de optimización de costos; El ingeniero/planificador debe equilibrar esto con recursos secundarios, existencias y análisis de escenarios. El costo no es el único criterio.

10. ¿Qué significa 'fuga de datos' al realizar análisis de telemetría con Python y por qué es peligroso?

  • A) Los datos se filtran del disco y se eliminan
  • B) El modelo ve en el entrenamiento información que no se puede conocer en el momento de la predicción; Se infla el marcador, se desploma en el campo ✔
  • C) Mezcla de colores gráficos
  • D) Sólo ocurre en datos de imagen.

Descripción: Fuga de datos; Esto es cuando el modelo ve en el entrenamiento información que en realidad no se puede conocer en el momento de la predicción (por ejemplo, valor futuro o atributo relacionado con el objetivo). Esto aumenta artificialmente la puntuación de la prueba pero perjudica el rendimiento en el campo. La distinción pasado/futuro debe mantenerse meticulosamente en las series temporales.

11. ¿Qué determina la clasificación ASIL en el contexto de la seguridad funcional ISO 26262?

  • A) Velocidad máxima del vehículo
  • B) Tamaño del conjunto de datos de entrenamiento del modelo.
  • C) ✔ El nivel de seguridad requerido según la gravedad, exposición y controlabilidad del peligro.
  • D) Calificación crediticia del proveedor

Descripción: ASIL (Nivel de integridad de seguridad automotriz) determina el nivel de precauciones de seguridad (de A a D, D es el más alto) que requiere un peligro en función de su evaluación de gravedad, exposición y controlabilidad. Un alto ASIL requiere un desarrollo, verificación y documentación más estrictos.

12. ¿En qué se diferencia la norma ISO 21448 (SOTIF) de la seguridad funcional clásica (ISO 26262)?

  • A) Solo maneja fallas de hardware
  • B) Regula únicamente las licencias de software
  • C) SOTIF es el antiguo nombre de ISO 26262
  • D) Aborda los riesgos que surgen de una funcionalidad inadecuada y escenarios no reconocidos, incluso en ausencia de falla ✔

Descripción: Mientras que ISO 26262 aborda los riesgos que surgen de mal funcionamiento/errores de hardware-software, SOTIF (Seguridad de la funcionalidad prevista) aborda los riesgos que surgen de una detección inadecuada, escenarios no reconocidos y límites funcionales, incluso si el sistema no funciona mal en absoluto; es particularmente crítico en la detección basada en IA.

13. ¿Cuál es el mejor enfoque en términos de privacidad cuando se trabaja con datos de telemetría de conductores y vehículos?

  • A) Cumplimiento de KVKK/GDPR con anonimización, minimización de datos y limitación de finalidad ✔
  • B) Envío de todos los datos sin procesar al modelo público junto con el VIN
  • C) La privacidad solo se aplica a los datos de marketing
  • D) Los datos de ubicación nunca se consideran datos personales

Descripción: Datos como la ubicación, el comportamiento de conducción y el número de chasis (VIN) pueden identificar a una persona. El enfoque más correcto; anonimizar/seudonimizar datos, recopilar solo lo necesario (minimización de datos), limitación de finalidad y cumplimiento de KVKK/GDPR. Enviar VIN sin formato o ubicación a herramientas de terceros es arriesgado.

14. ¿Por qué es necesario monitorear la "desviación de datos" en un modelo de IA puesto en producción?

  • A) Una vez entrenado el modelo, ofrece el mismo rendimiento de forma indefinida.
  • B) El rendimiento disminuye silenciosamente a medida que la distribución de los insumos cambia con el tiempo; se debe activar el reentrenamiento ✔
  • C) La deriva es solo una vibración física del hardware.
  • D) El seguimiento es innecesario porque el modelo se actualiza automáticamente

Explicación: El mundo real cambia (nuevo proveedor de repuestos, temporada, nuevo modelo de vehículo); El rendimiento del modelo disminuye silenciosamente a medida que la distribución de entrada se aleja del tiempo de entrenamiento. El reentrenamiento se activa mediante el seguimiento de la deriva y las métricas de rendimiento. El enfoque de "configúrelo y olvídese" es arriesgado en el sector del automóvil.