Unidad 3 / 12

Predicción de características y relaciones estructura-proceso-propiedad (aprendizaje automático)

Ganancias:

  • Capacidad para construir con precisión el problema de aprendizaje automático con IA para la predicción de propiedades mecánicas a partir de parámetros de composición y proceso.
  • Capacidad para leer críticamente el resultado de un modelo reconociendo los riesgos de calidad de los datos, sobreajuste y extrapolación.
  • Capacidad para probar los resultados del modelo de predicción con plausibilidad física, intervalo de confianza y experimento de verificación.

La ley más básica de la metalurgia se resume en "el proceso determina la estructura; la estructura determina la propiedad". El límite elástico de un acero depende no sólo de la composición; Surge de cómo se procesa (forja, laminación, tratamiento térmico) y de la microestructura resultante (tamaño de grano, relación de fases, precipitados). La inteligencia artificial, y especialmente el aprendizaje automático (ML: métodos que aprenden y hacen predicciones a partir de patrones en los datos), es poderoso para extraer estas relaciones composición-proceso-propiedad de miles de puntos de datos y predecir las propiedades de una nueva aleación. Pero este poder depende completamente de la calidad de los datos y de saber dónde es confiable el modelo. En esta unidad, aprenderá cómo construir una predicción de características basada en ML y cómo leer críticamente su resultado.

Configurar correctamente el problema de aprendizaje automático

Antes de volcar un problema de predicción de características en ML, aclare tres cosas:

  • Entrada (atributos): Variables que se utilizarán en la predicción. Por ejemplo, porcentajes de composición (C, Mn, Cr, Ni...), temperatura y tiempo del tratamiento térmico, tamaño de grano.
  • Salida (objetivo): la característica que se va a predecir. Por ejemplo, límite elástico, alargamiento, dureza.
  • Datos: una tabla de pares de entrada-salida. Cada fila es una muestra, cada columna es un atributo u objetivo.

El modelo aprende una "función" de estos datos: toma entradas y predice la salida. Son comunes métodos como la regresión lineal (suma ponderada simple), el bosque aleatorio o el aumento de gradiente. La IA es útil para sugerir qué método es adecuado, escribir el código e interpretar el resultado; pero compruebas si el modelo es válido o no.

Calidad de los datos: techo del modelo

Un modelo de ML no puede ser mejor que los datos con los que se entrena. El principio de "basura entra, basura sale" es muy fuerte en la metalurgia porque los datos de prueba son caros y escasos. Cuidado con estas trampas:

  • Pocos datos: no se pueden construir modelos complejos con 30 muestras; El modelo memoriza los datos.
  • Datos desequilibrados: si la mayoría de los datos son aceros con bajo contenido de carbono, la predicción será pobre en una aleación con alto contenido de carbono.
  • Ruido de medición: La dureza de la misma muestra puede variar con diferentes operadores; Este ruido se refleja en el modelo.
  • Variable faltante: si no ha medido el tamaño del grano, el modelo que intenta predecir la resistencia únicamente por la composición perderá una razón importante.
Atención: El hecho de que un modelo tenga un gran éxito en el entrenamiento de datos no significa que también lo tendrá en nuevas muestras. Esto puede ser un sobreajuste: el modelo ha memorizado el ruido en los datos de entrenamiento, no la verdadera relación. El éxito real se mide a partir de “datos de prueba” que el modelo nunca antes había visto.

Extrapolación: el límite más peligroso

Los modelos de ML funcionan razonablemente dentro del rango cubierto por los datos de entrenamiento (interpolación). Cuando están fuera de este rango (extrapolación), las predicciones se vuelven poco confiables y el modelo a menudo no lo muestra; continúa produciendo un número seguro. Por ejemplo, un modelo entrenado en aceros con un contenido de carbono en el rango de 0,2 a 0,6% puede mostrar su valor para una aleación con 1,2% de carbono como "seguro", pero este valor es completamente infundado. Para cada predicción, "¿esta muestra está dentro de la distribución de datos de entrenamiento?" Es imperativo hacer la pregunta.

Paso a paso: creación de un flujo de predicción con IA

  1. Defina el objetivo y los insumos: ¿Qué predecirá y a partir de qué variables?
  2. Prepare los datos: limpie, arregle unidades, marque los valores faltantes. (AI: escribe código Python).
  3. Divida los datos: separe los conjuntos de entrenamiento y prueba para poder medir el éxito con precisión.
  4. Seleccione y entrene el modelo: comience de manera simple (lineal), pase a basado en árbol si es necesario.
  5. Evaluar: observe las métricas de error en el conjunto de prueba (por ejemplo, RMSE, R²).
  6. Comentario: ¿Qué variable es qué tan efectiva? ¿Tiene sentido físicamente?
  7. Verificar: probar una predicción crítica con experimentación real; Verifique la extrapolación.

concepto

Significado

¿Por qué es importante en metalurgia?

Sobreajuste

Modelo memorizando el ruido.

Es muy fácil con pocos datos de prueba.

interpolación

Predicción dentro del rango de entrenamiento

Región relativamente segura

extrapolación

Predicción fuera del rango de entrenamiento

poco confiable; se requiere experimento

Proporción de varianza explicada por el modelo.

Indicador de calidad de ajuste

Importancia de la característica

La magnitud del impacto de un insumo.

Verificación de razonabilidad física

tres mini casos

Caso 1: modelo de memorización. Un equipo construye un modelo complejo que predice el límite elástico con 45 muestras de acero; Los datos del entrenamiento resultan ser R² = 0,99 y se alegran. Sin embargo, en los datos de la prueba cae a R² = 0,42. El modelo está sobreajustado. Cuando cambian a un modelo más simple y aumentan los datos, el éxito de la prueba aumenta a 0,80. Lección: el éxito educativo es engañoso; La decisión se toma con datos de prueba.

Caso 2: trampa de extrapolación. Un ingeniero aplica un modelo entrenado en aceros de baja aleación a una composición de acero inoxidable con alto contenido de Cr. El modelo dice "alrededor de 620 MPa". La prueba de tracción real resulta de 410 MPa. La composición está completamente fuera de la distribución educativa. Lección: antes de la predicción es imperativo comprobar si la entrada está dentro del rango de entrenamiento.

Caso 3: Uso correcto. Un equipo de I+D modela el efecto de la temperatura de templado sobre la dureza con miles de registros en una familia de aleaciones. El modelo reproduce la tendencia física conocida (la dureza disminuye al aumentar la temperatura de templado) y limita en qué rango de composición se alcanzará la dureza objetivo. El equipo utiliza el modelo para reducir el número de experimentos: alcanzar la meta con 8 experimentos en lugar de 40 y validar cada paso con mediciones. Lección: ML reduce de forma inteligente la planificación de experimentos con buenos datos y comprobaciones de plausibilidad física.

Plantillas de avisos copiables

PLANTILLA DE CONFIGURACIÓN DE PROBLEMAS DE ML "Rol: usted es un asistente científico de datos materiales. Objetivo: [característica que se va a predecir]. Entradas: [atributos]. Tengo [n] muestras. Para este problema: (1) sugerir opciones de modelo simples y avanzadas apropiadas, (2) explicar la división de entrenamiento/prueba y la métrica de evaluación, (3) interpretar los riesgos de sobreajuste y extrapolación basándose en estos datos. No prometa un éxito definitivo; escriba los límites claramente".

PLANTILLA DE AUDITORÍA DE CALIDAD DE DATOS"Compruebe la calidad de la siguiente tabla de datos: [pegue columnas y filas de muestra]. Marca: valores faltantes, valores atípicos, inconsistencias de unidades, distribución desequilibrada. Para cada problema, sugiera cómo manejarlo. Enumere las comprobaciones que debo hacer antes de modelar".

PLANTILLA DE CONTROL DE EXTRAPOLACIÓN "El rango mínimo-máximo de cada entrada en mi rendimiento de entrenamiento es: [escribir rangos]. La nueva muestra que quiero predecir es: [escribir valores]. ¿Esta muestra está dentro o fuera del rango de entrenamiento en cada atributo? Si está fuera, explique en qué variables y por qué la predicción no sería confiable. Sugiera verificación mediante experimento".

PLANTILLA DE plausibilidad FÍSICA "El orden de importancia de las características del modelo es [ordenar]. ¿Es este orden consistente con relaciones metalúrgicas conocidas (por ejemplo, Hall-Petch, endurecimiento por precipitado, efecto de carbono)? Si hay un efecto físicamente inesperado, márquelo y explique el posible problema de datos/modelo".

Aviso débil / Aviso fuerte

INDICACIÓN DÉBIL: "Prediga el límite elástico en función de esta composición".

INDICACIÓN FUERTE: "Rol: usted es el asistente científico de datos de materiales. Tengo 800 líneas de datos de acero de baja aleación (C, Mn, Cr, Ni, temperatura de templado -> límite elástico). Nueva muestra: C=0,38, Mn=0,8, Cr=1,0, Ni=0,2, temple=550 °C. Primero verifique si esta muestra está dentro del rango de entrenamiento. Si es apropiado, ajuste el enfoque de predicción y la incertidumbre. Explique; si no es adecuado, sugiera experimento Verifique la plausibilidad física con Hall-Petch y el efecto de temperatura. No proporcione un valor exacto de un solo punto.

El mensaje fuerte solicita una verificación de extrapolación antes de hacer una predicción, elimina la incertidumbre y compara el resultado con las leyes físicas. Esto proporciona una base de decisión mucho más confiable que un número bruto.

Errores comunes

  • Confundir el éxito educativo con el éxito real (omitiendo el sobreajuste).
  • Evaluar el modelo sin realizar una división de entrenamiento/prueba.
  • Aceptar como segura la estimación producida en la región de extrapolación.
  • Construyendo modelos complejos con pocos datos y desequilibrados.
  • No comparar la importancia de las características con la plausibilidad física.
  • Poner una suposición crítica en el diseño sin verificarla mediante experimentos.

En resumen

El aprendizaje automático captura poderosamente las relaciones composición-proceso-propiedad con buenos datos y reduce de manera inteligente la planificación de experimentos. Pero un modelo es tan bueno como sus datos; Los logros de la capacitación pueden ser engañosos (sobreajuste) y las estimaciones fuera del rango de capacitación (extrapolación) no son confiables. Pruebe cada predicción con datos de prueba exitosos, control de extrapolación, plausibilidad física y, en casos críticos, experimentación real.

Tarea de aplicación

Defina un problema de predicción de propiedades con un conjunto de datos de materiales existente (o ficticio): escriba el objetivo y las entradas. Solicite un enfoque de AI con la plantilla “CIFRA DEL PROBLEMA DE ML”. Luego defina una "nueva muestra" y verifique si esta muestra está dentro del rango de entrenamiento con la plantilla "VERIFICACIÓN DE EXTRAPOLACIÓN". Finalmente, describe en un párrafo con qué experimento verificarás un resultado del modelo.

lista de verificación

  • [ ] Definí claramente el objetivo y los insumos.
  • [] Verifiqué la calidad de los datos (faltantes, valores atípicos, unidades, saldos).
  • [] Medí el éxito honesto con la división entre entrenamiento y prueba.
  • [] Verifiqué el riesgo de extrapolación para cada estimación.
  • [] Comparé la importancia de las características con la plausibilidad física.
  • [] Hice un plan para verificar la predicción crítica con experimentación real.