Unidade 7 / 11

Avaliação de modelo: métricas, validação cruzada e aprendizado extremo

Ganhos:

  • Capacidade de selecionar e interpretar métricas de classificação e regressão (matriz de confusão, precisão/recall/F1, MAE/RMSE/R²) de acordo com o objetivo do trabalho
  • Capacidade de detectar superaprendizagem comparando pontuações de treinamento e teste e obter desempenho confiável com validação cruzada
  • Capacidade de avaliar se cada modelo agrega valor real comparando-o com uma linha de base

É fácil configurar um modelo; É difícil medir honestamente se realmente funciona. O tema desta unidade é a habilidade mais crítica de um cientista de dados: avaliar o modelo com as métricas corretas, alcançar um desempenho preditivo confiável e capturar a armadilha mais insidiosa: o superaprendizado (memorização). A IA calcula, interpreta e compara métricas; mas cabe ao ser humano decidir qual métrica é adequada para o seu negócio e se um modelo é “bom o suficiente”. Uma equipe que olha para a métrica errada pode confundir um modelo ruim durante meses com um “sucesso”.

Por que a precisão não é suficiente: matriz de confusão

A primeira métrica que vem à mente na classificação é a precisão (precisão — a proporção total de previsões corretas). Mas, como vimos na Unidade 6, a precisão é enganosa com dados desequilibrados. Um começo melhor é a matriz de confusão – uma tabela que divide as previsões em quatro categorias:

  • Verdadeiro positivo (TP): Chamamos de falso o que é realmente falso. (Bom)
  • Verdadeiro negativo (TN): Dissemos muito limpo. (Bom)
  • Falso positivo (FP): Dissemos erroneamente que o limpo era falso. (Falso alarme)
  • Falso negativo (FN): Perdemos a falsificação e a chamamos de limpa. (Ameaça perdida)

Duas métricas principais derivam dessas quatro caixas. Precisão: "Quanto do que chamo de falso é realmente falso?" — importante se os custos de alarmes falsos forem elevados. Sensibilidade (recall em inglês): "Quantas falsificações reais eu peguei?" — importante quando ignorar uma ameaça custa caro. Os dois estão frequentemente em desacordo: se você diminuir o limite e disser mais “falso”, a recordação aumenta, mas a precisão diminui. A pontuação F1 é a média balanceada (média harmônica) desses dois.

Atenção: A resposta à pergunta “Qual métrica é importante” é uma decisão de negócios, não técnica. Perder um caso (baixa recordação) no rastreio do cancro é desastroso; É chato enviar um e-mail importante para spam (baixa precisão) no filtro de spam. O custo determina a métrica.

Métricas de regressão

Se a saída for números, diferentes métricas serão usadas. MAE (Erro Médio Absoluto): quanto as estimativas se desviam da média real, na mesma unidade (por exemplo, “estamos errados em 4.200 TL em média”). RMSE (Root Mean Squared Error): penaliza erros maiores de forma mais severa e é sensível a outliers. R² (R-quadrado — coeficiente de determinação): quanto da variabilidade na meta o modelo explica (perto de 1 é bom, 0 é tão ruim quanto prever a média, negativo é ainda pior).

A armadilha mais insidiosa: superaprendizado

Overfitting – onde o modelo memoriza dados de treinamento, mas falha em novos dados – é o erro mais comum na ciência de dados. O sintoma é claro: o modelo é ótimo no conjunto de treinamento (98%), ruim no conjunto de testes (72%). O modelo memorizou o ruído daquela amostra específica, não o padrão real nos dados. Há também o oposto: underfitting – o modelo é ruim tanto no treinamento quanto no teste porque é muito simples para capturar o padrão.

Maneiras de combater o superaprendizado: simplificação do modelo, mais dados, regularização — o freio matemático que evita que o modelo se torne muito complexo — e o mais importante, validação cruzada.

Validação cruzada: não confie em painel único

Um único pod de treinamento/teste pode dar sorte ou azar; Você pode obter notas altas no conjunto de testes só porque essa amostra é fácil. A validação cruzada (CV, para abreviar) resolve isso. A forma mais comum é CV k-fold: os dados são divididos em k partes (por exemplo, 5); Em cada rodada, uma parte é teste e o restante é treinamento; isso rola 5 vezes e as 5 pontuações são calculadas. Então você verá que o desempenho é baseado na média de múltiplas divisões, e não em uma única divisão de sorte. A distribuição das pontuações também é informativa: pontuações muito voláteis (85% num piso, 62% no outro) indicam que o modelo é instável.

A dobra k normal não é usada em séries temporais (vaza o futuro); Em vez disso, você faz "encadeamento direto" (divisão de série temporal): sempre treinando com o passado e testando o futuro.

métrica

Tipo de problema

Quando isso importa?

Precisão

Classificação

Se as aulas forem equilibradas

Precisão

Classificação

Alarme falso é caro

Sensibilidade (recall)

Classificação

Se é caro perder

F1

Classificação

Se o equilíbrio for necessário

MAE

regressão

Erro interpretável

REQM

regressão

Se grandes erros são críticos

regressão

poder explicativo

três mini cases

Caso 1 — A ilusão de alta precisão. Um modelo de fraude mostrou 99,2% de precisão e a equipe comemorou. Olhando para a matriz de confusão, a taxa real:falsificação nos dados foi de 0,8%; a modelo quase não detectou falsificações, apenas dizendo "tudo limpo". A recuperação foi de 6%. Lição: observe as métricas, não a precisão.

Caso 2 — Sobreaprendizagem latente. Uma equipe entregou e aumentou o XGBoost para 97% no conjunto de treinamento. O conjunto de teste foi de 69%, mas ninguém olhou. O modelo entrou em colapso na produção. Se a validação cruzada tivesse sido feita, a grande diferença entre as dobras (overlearning) teria sido visível desde o início. Lição: confie no currículo e na pontuação do teste, não na pontuação educacional.

Caso 3 — Divisão de sorte. Um analista ficou encantado ao obter 88% em uma única divisão. Quando seu colega fez um currículo 5 vezes, as pontuações foram 88%, 71%, 83%, 64%, 79% — a média é 77%, mas é muito volátil. O modelo era instável; O único compartimento era enganoso. Lição: observe a média e a distribuição do CV, não o compartimento individual.

Quatro modelos copiáveis

1) Relatório de classificação completo:

Eu treinei o modelo e o conjunto de testes. Gerar: matriz de confusão, precisão, recall, F1 (para cada classe) e contagens de suporte. Estou inferindo, mas cabe a mim: direi qual métrica é importante. Observe que a precisão pode ser enganosa com dados desequilibrados.

2) Controle de superaprendizagem:

Imprima as pontuações do meu modelo nos conjuntos de TREINAMENTO e TESTE lado a lado. Calcule a diferença entre eles e avise, pois uma grande diferença é sinal de superaprendizado. Se a diferença for grande, sugira regularização ou simplificação.

3) Validação cruzada:

Execute a validação cruzada de 5 vezes (para classificação estratificada). Imprima a pontuação, média e desvio padrão de cada dobra. Se as pontuações forem muito voláteis (padrão alto), indique que o modelo é instável. Use pipelines para que as transformações sejam aprendidas apenas com o treinamento em cada camada.

4) Comparação da linha de base:

Coloque a métrica do meu modelo lado a lado com uma linha de base DummyClassifier. O modelo supera significativamente a linha de base? Se não for aprovado, deixe claro que o modelo não agrega nenhum valor real.

Alerta fraco / Alerta forte

Alerta fraco:

Meu modelo é bom?

“Bom” é indefinido; Não está claro qual métrica, qual limite, qual linha de base. A IA pode fornecer um único número de precisão e enganar.

Alerta poderoso:

Sua função: assistente de avaliação. Classificação, dados desequilibrados (12% positivos). Prioridade: recall (sem perder os aspectos positivos). Tarefa: (1) matriz de confusão, (2) precisão/recall/F1, (3) média e padrão de CV estratificados em 5 vezes, (4) comparação de linha de base do DummyClassifier. Concentre-se na recuperação e na diferença da linha de base, não na precisão. Comente, mas eu tomo a decisão final.

Aqui, a prioridade da métrica, o CV e a condição inicial são claros.

Erros comuns

  • Confiar na precisão em dados desequilibrados. Uma precisão de 99% pode não abranger de todo a classe minoritária; Veja a matriz de confusão.
  • Basta olhar para sua pontuação de escolaridade. Alta escolaridade e baixa pontuação em testes são superaprendizagem; Sempre compare duas pontuações.
  • Contando com um único compartimento. A divisão da sorte é enganosa; Observe a média e a distribuição com validação cruzada.
  • Não comparando com a linha de base. Você não pode dizer “bom” sem saber se o modelo supera um preditor estúpido.
  • Usando k-fold normal em séries temporais. Vaza o futuro; a divisão da série temporal é necessária.
Dica: Escreva três números ao lado de cada modelo: pontuação de treinamento, média de validação cruzada e pontuação de linha de base. Este trio revela, à primeira vista, superaprendizagem (treinamento >> CV) e subvalorização (CV ≈ linha de base).

Em resumo

Construir um modelo é fácil, mas avaliá-lo honestamente é difícil. Na classificação, a matriz de confusão, a precisão e a recordação são muito mais informativas do que a exatidão; O custo do trabalho determina qual deles é importante. MAE, RMSE e R² são usados ​​na regressão. A armadilha mais insidiosa é o aprendizado excessivo: sempre compare o treinamento e a pontuação do teste. Confie na média e na distribuição da validação cruzada, não em uma única divisão; Compare tudo com uma linha de base. A IA calcula tudo isso, mas cabe ao ser humano decidir qual métrica usar.

Tarefa de aplicativo

Extrair matriz de confusão, precisão, recall e F1 para um modelo de classificação; Em seguida, faça a validação cruzada de 5 vezes e observe a distribuição da pontuação entre as dobras. Por fim, anote a pontuação do treinamento, a média do CV e uma pontuação básica lado a lado. Comente em uma frase se o seu modelo está aprendendo demais e ultrapassando a linha de base.

lista de verificação

  • [] Observei a métrica real do trabalho (precisão/recuperação/F1 etc.) em vez de precisão?
  • [] Examinei a matriz de confusão?
  • [ ] Comparei a pontuação do treinamento e do teste e verifiquei o excesso de aprendizagem?
  • [] Observei a média e a distribuição com validação cruzada?
  • [] Comparei o modelo com uma linha de base?