Unidade 3 / 12

Previsão de recursos e relacionamentos estrutura-processo-propriedade (aprendizado de máquina)

Ganhos:

  • Capacidade de construir com precisão o problema de aprendizado de máquina com IA para previsão de propriedades mecânicas a partir de parâmetros de composição e processo
  • Capacidade de ler criticamente a saída de um modelo, reconhecendo riscos de qualidade de dados, ajuste excessivo e extrapolação
  • Capacidade de testar resultados de modelos de previsão com plausibilidade física, intervalo de confiança e experimento de verificação

A lei mais básica da metalurgia é resumida como “o processo determina a estrutura; a estrutura determina a propriedade”. A resistência ao escoamento de um aço não depende apenas da composição; Surge da forma como é processado (forjamento, laminação, tratamento térmico) e da microestrutura resultante (tamanho de grão, proporção de fases, precipitados). A inteligência artificial, e especialmente o aprendizado de máquina (ML: métodos que aprendem e fazem previsões a partir de padrões em dados), são poderosos na extração dessas relações composição-processo-propriedade de milhares de pontos de dados e na previsão das propriedades de uma nova liga. Mas esse poder depende totalmente da qualidade dos dados e do conhecimento de onde o modelo é confiável. Nesta unidade, você aprenderá como construir previsão de recursos baseada em ML e como ler criticamente sua saída.

Configurando o problema de aprendizado de máquina corretamente

Antes de despejar um problema de previsão de recursos no ML, deixe três coisas claras:

  • Entrada (atributos): Variáveis ​​a serem usadas na previsão. Por exemplo, percentagens de composição (C, Mn, Cr, Ni...), temperatura e tempo de tratamento térmico, tamanho de grão.
  • Saída (alvo): O recurso a ser previsto. Por exemplo, resistência ao escoamento, alongamento, dureza.
  • Dados: uma tabela de pares de entrada-saída. Cada linha é uma amostra, cada coluna é um atributo ou destino.

O modelo aprende uma “função” com esses dados: ele recebe entradas e prevê a saída. Métodos como regressão linear (soma ponderada simples), floresta aleatória ou aumento de gradiente são comuns. A IA é útil para sugerir qual método é adequado, escrever o código e interpretar o resultado; mas você verifica se o modelo é válido ou não.

Qualidade dos dados: teto do modelo

Um modelo de ML não pode ser melhor do que os dados nos quais foi treinado. O princípio de “entra lixo, sai lixo” é muito forte na metalurgia porque os dados de teste são caros e escassos. Cuidado com essas armadilhas:

  • Poucos dados: não é possível construir modelos complexos com 30 amostras; O modelo memoriza os dados.
  • Dados desequilibrados: Se a maioria dos dados for de aços com baixo teor de carbono, a previsão será fraca em uma liga com alto teor de carbono.
  • Ruído de medição: A dureza da mesma amostra pode variar com diferentes operadores; Esse ruído é refletido no modelo.
  • Variável ausente: Se você não mediu o tamanho do grão, o modelo que tenta prever a resistência apenas pela composição perderá um motivo importante.
Atenção: Só porque um modelo tem alto sucesso no treinamento de dados não significa que ele também terá sucesso em novas amostras. Isso pode ser um ajuste excessivo: o modelo memorizou o ruído nos dados de treinamento, não o verdadeiro relacionamento. O verdadeiro sucesso é medido em “dados de teste” que o modelo nunca viu antes.

Extrapolação: o limite mais perigoso

Os modelos de ML funcionam razoavelmente dentro da faixa coberta pelos dados de treinamento (interpolação). Quando fora deste intervalo (extrapolação), as previsões tornam-se pouco fiáveis ​​e o modelo muitas vezes não mostra isso; continua a produzir um número confiante. Por exemplo, um modelo treinado em aços com teor de carbono na faixa de 0,2-0,6% pode mostrar o seu valor para uma liga com 1,2% de carbono como “segura”, mas este valor é completamente infundado. Para cada previsão, “esta amostra está dentro da distribuição de dados de treinamento?” É imperativo fazer a pergunta.

Passo a passo: Construindo um fluxo de previsão com IA

  1. Defina o objetivo e os insumos: o que você irá prever e a partir de quais variáveis?
  2. Prepare os dados: limpe, corrija unidades, sinalize valores ausentes. (AI: escreve código Python.)
  3. Divida os dados: separe os conjuntos de treinamento e teste para poder medir o sucesso com precisão.
  4. Selecione e treine o modelo: comece simples (linear), passe para baseado em árvore, se necessário.
  5. Avaliar: observe as métricas de erro no conjunto de teste (por exemplo, RMSE, R²).
  6. Comentário: Qual variável é quão eficaz? Faz sentido fisicamente?
  7. Verificar: Teste uma previsão crítica com experimentação real; Verifique se há extrapolação.

conceito

Significado

Por que é importante na metalurgia?

Sobreajuste

Modelo memorizando o ruído

É muito fácil com poucos dados de teste

interpolação

Previsão dentro do intervalo de treinamento

Região relativamente segura

extrapolação

Previsão fora do intervalo de treinamento

não confiável; experimento é necessário

Proporção de variância explicada pelo modelo

Indicador de qualidade de ajuste

Importância do recurso

A magnitude do impacto de uma entrada

Verificação de razoabilidade física

três mini cases

Caso 1 — Modelo de memorização. Uma equipe constrói um modelo complexo que prevê o limite de escoamento com 45 amostras de aço; Os dados de treinamento são R² = 0,99 e eles se alegram. Porém, nos dados de teste cai para R² = 0,42. O modelo está superajustado. Quando eles mudam para um modelo mais simples e aumentam os dados, o sucesso do teste aumenta para 0,80. Lição: o sucesso educacional é enganoso; A decisão é tomada com dados de teste.

Caso 2 — Armadilha de extrapolação. Um engenheiro aplica um modelo treinado em aços de baixa liga a uma composição inoxidável com alto teor de Cr. O modelo diz “cerca de 620 MPa”. O teste de tração real chega a 410 MPa. A composição está completamente fora da distribuição educacional. Lição: antes da previsão é fundamental verificar se a entrada está dentro da faixa de treinamento.

Caso 3 — Uso correto. Uma equipe de P&D modela o efeito da temperatura de revenido na dureza com milhares de registros em uma família de ligas. O modelo reproduz a tendência física conhecida (a dureza diminui com o aumento da temperatura de revenido) e restringe em qual faixa de composição a dureza alvo será alcançada. A equipe usa o modelo para reduzir o número de experimentos: atingir a meta com 8 experimentos em vez de 40 e validar cada etapa com medições. Lição: O ML restringe de forma inteligente o planejamento de experimentos com bons dados e verificações de plausibilidade física.

Modelos de prompt copiáveis

MODELO DE DEFINIÇÃO DE PROBLEMAS DE ML "Função: Você é um assistente de ciência de dados de materiais. Objetivo: [recurso a ser previsto]. Entradas: [atributos]. Tenho [n] amostras. Para este problema: (1) sugerir opções de modelo simples e avançadas apropriadas, (2) explicar a divisão de treinamento/teste e métrica de avaliação, (3) interpretar os riscos de overfitting e extrapolação com base nesses dados. Não prometa sucesso definitivo; escreva os limites claramente. "

MODELO DE AUDITORIA DE QUALIDADE DE DADOS"Verifique a qualidade da seguinte tabela de dados: [colar colunas e linhas de amostra]. Sinalizador: valores ausentes, valores discrepantes, inconsistências de unidade, distribuição desequilibrada. Para cada problema, sugira como lidar com isso. Liste quais verificações devo fazer antes da modelagem."

MODELO DE CONTROLE DE EXTRAPOLAÇÃO "O intervalo mínimo-máximo de cada entrada no meu rendimento de treinamento é: [escrever intervalos]. A nova amostra que desejo prever é: [escrever valores]. Esta amostra está dentro ou fora do intervalo de treinamento em cada atributo? Se estiver fora, explique em quais variáveis ​​e por que a previsão não seria confiável. Sugira verificação por experimento."

Plausibilidade FÍSICA MODELO "A ordem de importância do recurso do modelo é [classificação]. Esta ordem é consistente com as relações metalúrgicas conhecidas (por exemplo, Hall-Petch, endurecimento precipitado, efeito carbono)? Se houver um efeito fisicamente inesperado, marque-o e explique o possível problema de dados/modelo."

Alerta fraco / Alerta forte

PROMPT FRACO: "Preveja o limite de escoamento com base nesta composição."

PROMPT FORTE:"Função: Você é o assistente de ciência de dados de materiais. Tenho 800 linhas de dados de aço de baixa liga (C, Mn, Cr, Ni, temperatura de revenido -> resistência ao escoamento). Nova amostra: C = 0,38, Mn = 0,8, Cr = 1,0, Ni = 0,2, têmpera = 550 ° C. Primeiro verifique se esta amostra está dentro da faixa de treinamento. Se apropriado, ajuste a abordagem de previsão e incerteza Explique; se não for adequado, sugira experimento. Verifique a plausibilidade física com Hall-Petch e efeito de temperatura. Não forneça um valor exato de um único ponto.

A solicitação forte pede uma verificação de extrapolação antes de fazer uma previsão, remove a incerteza e testa o resultado em relação às leis físicas. Isto proporciona uma base de decisão muito mais confiável do que um número bruto.

Erros comuns

  • Confundir sucesso educacional com sucesso real (ignorando o overfitting).
  • Avaliando o modelo sem fazer uma divisão de treinamento/teste.
  • Aceitar a estimativa produzida na região de extrapolação como segura.
  • Construindo modelos complexos com poucos dados e desequilibrados.
  • Não comparar a importância do recurso com a plausibilidade física.
  • Colocar uma suposição crítica no projeto sem verificá-lo por meio de experimentos.

Em resumo

O aprendizado de máquina captura poderosamente as relações composição-processo-propriedade com bons dados e restringe de forma inteligente o planejamento de experimentos. Mas um modelo é tão bom quanto os seus dados; O desempenho do treinamento pode ser enganoso (overfitting) e as estimativas fora da faixa de treinamento (extrapolação) não são confiáveis. Teste cada previsão com sucesso nos dados de teste, controle de extrapolação, plausibilidade física e, em casos críticos, experimentação real.

Tarefa de aplicativo

Defina um problema de previsão de propriedade com um conjunto de dados de materiais existente (ou fictício): anote o alvo e as entradas. Solicite uma abordagem da IA ​​com o modelo “ML PROBLEM FIGURE”. Em seguida, defina uma “nova amostra” e verifique se esta amostra está dentro da faixa de treinamento com o modelo “EXTRAPOLATION CHECK”. Por fim, descreva em um parágrafo com qual experimento você verificará uma saída do modelo.

lista de verificação

  • [ ] Defini claramente o objetivo e os insumos.
  • [] Verifiquei a qualidade dos dados (ausente, outlier, unidade, equilíbrio).
  • [] Medi o sucesso honesto com a divisão treinamento/teste.
  • [ ] Verifiquei o risco de extrapolação para cada estimativa.
  • [] Comparei a importância do recurso com a plausibilidade física.
  • [] Fiz um plano para verificar a previsão crítica com experimentação real.