Unità 7 / 11

Valutazione del modello: metriche, convalida incrociata e apprendimento estremo

Guadagni:

  • Capacità di selezionare e interpretare le metriche di classificazione e regressione (matrice di confusione, precisione/richiamo/F1, MAE/RMSE/R²) in base allo scopo del lavoro
  • Capacità di rilevare l'overlearning confrontando i punteggi di formazione e test e ottenere prestazioni affidabili con la convalida incrociata
  • Capacità di valutare se ciascun modello aggiunge valore reale confrontandolo con una baseline

È facile impostare un modello; È difficile misurare onestamente se funziona davvero. L'oggetto di questa unità è l'abilità più critica di un data scientist: valutare il modello con le giuste metriche, ottenere prestazioni predittive affidabili e catturare la trappola più insidiosa: l'overlearning (memorizzazione). L’intelligenza artificiale calcola, interpreta e confronta le metriche; ma spetta all'essere umano decidere quale metrica è giusta per la tua attività e se un modello è "abbastanza buono". Un team che osserva la metrica sbagliata può confondere per mesi un cattivo modello con un “successo”.

Perché la precisione non è sufficiente: matrice di confusione

La prima metrica che viene in mente nella classificazione è l'accuratezza (accuratezza, ovvero il rapporto totale delle previsioni corrette). Ma come abbiamo visto nell’Unità 6, la precisione è fuorviante in caso di dati non bilanciati. Un inizio migliore è la matrice di confusione, una tabella che divide le previsioni in quattro contenitori:

  • Vero positivo (TP): abbiamo chiamato falso ciò che è veramente falso. (Buono)
  • Vero negativo (TN): abbiamo detto davvero pulito. (Buono)
  • Falso positivo (FP): Abbiamo erroneamente detto che quello pulito era falso. (falso allarme)
  • Falso negativo (FN): abbiamo mancato il falso e lo abbiamo definito pulito. (Minaccia mancata)

Da questi quattro riquadri derivano due parametri chiave. Precisione: "Quanto di ciò che chiamo falso è in realtà falso?" – importante se i costi dei falsi allarmi sono elevati. Sensibilità (richiamo in inglese): "Quanti veri falsi ho catturato?" – importante quando perdere una minaccia è costoso. Le due cose sono spesso in contrasto tra loro: se si abbassa la soglia e si dice di più “falso”, la memoria aumenta ma la precisione diminuisce. Il punteggio F1 è la media bilanciata (media armonica) di questi due.

Attenzione: la risposta alla domanda "Quale metrica è importante" è una decisione aziendale, non tecnica. Mancare un caso (basso ricordo) nello screening del cancro è disastroso; È fastidioso inviare un'e-mail importante allo spam (bassa precisione) nel filtro antispam. Il costo determina la metrica.

Metriche di regressione

Se l'output è costituito da numeri, vengono utilizzate metriche diverse. MAE (Errore Medio Assoluto): quanto le stime si discostano dalla media effettiva, nella stessa unità (es. "sbagliamo di 4.200 TL in media"). RMSE (Root Mean Squared Error): penalizza più severamente gli errori maggiori ed è sensibile ai valori anomali. R² (R quadrato — coefficiente di determinazione): quanta variabilità nel target spiega il modello (vicino a 1 è buono, 0 è tanto negativo quanto prevedere la media, negativo è anche peggio).

La trappola più insidiosa: l’overlearning

L'overfitting, ovvero il modello che memorizza i dati di addestramento ma fallisce sui nuovi dati, è l'errore più comune nella scienza dei dati. Il sintomo è chiaro: il modello è ottimo sul set di addestramento (98%), pessimo sul set di test (72%). Il modello ha memorizzato il rumore di quel particolare campione, non il modello effettivo nei dati. Esiste anche il contrario: underfitting: il modello è pessimo sia nell’addestramento che nel test perché è troppo semplice catturarne il modello.

Modi per combattere l’overlearning: semplificazione del modello, più dati, regolarizzazione (il freno matematico che impedisce al modello di diventare troppo complesso) e, soprattutto, convalida incrociata.

Convalida incrociata: non fidarsi del riquadro singolo

Un singolo pod di addestramento/test può essere fortunato o sfortunato; Puoi ottenere un punteggio elevato per il set di test solo perché il campione è facile. La convalida incrociata (CV in breve) risolve questo problema. La forma più comune è k-fold CV: i dati sono divisi in k parti (es. 5); In ogni round, una parte è test e il resto è allenamento; questo lancia 5 volte e viene calcolata la media dei 5 punteggi. Quindi vedrai che la performance si basa sulla media di più split, non su un singolo split fortunato. Anche la distribuzione dei punteggi è informativa: punteggi molto volatili (85% su un piano, 62% sull'altro) indicano che il modello è instabile.

Il k-fold normale non viene utilizzato nelle serie temporali (fa trapelare il futuro); Invece, fai il "concatenamento in avanti" (divisione delle serie temporali): allenandoti sempre con il passato e testando il futuro.

metrico

Tipo di problema

Quando è importante?

Precisione

Classificazione

Se le lezioni sono equilibrate

Precisione

Classificazione

Il falso allarme costa caro

Sensibilità (richiamo)

Classificazione

Se è costoso perderlo

F1

Classificazione

Se serve equilibrio

MAE

regressione

Errore interpretabile

RMSE

regressione

Se i grandi errori sono critici

regressione

potere esplicativo

tre mini custodie

Caso 1 — L'illusione di un'elevata precisione. Un modello di frode ha mostrato un’accuratezza del 99,2% e il team ha festeggiato. Osservando la matrice di confusione, il tasso reale: il tasso di falsità nei dati era dello 0,8%; la modella non ha catturato quasi nessun falso, ha solo detto "tutto a posto". Il ricordo è stato del 6%. Lezione: guarda le metriche, non la precisione.

Caso 2 – Iperapprendimento latente. Un team ha fornito e potenziato XGBoost al 97% durante il set di allenamento. Il set di test era del 69%, ma nessuno aveva guardato. Il modello è crollato in produzione. Se fosse stata effettuata la convalida incrociata, la grande differenza tra le pieghe (overlearning) sarebbe stata visibile fin dall'inizio. Lezione: fidati del CV e del punteggio del test, non del punteggio di istruzione.

Caso 3 – Divisione fortunata. Un analista è stato felice di ottenere l'88% in un unico frazionamento. Quando il suo collega ha compilato un CV di 5 volte, i punteggi erano 88%, 71%, 83%, 64%, 79% - la media è del 77%, ma è molto volatile. Il modello era instabile; Lo scomparto unico era ingannevole. Lezione: guardare la media e la distribuzione dei CV, non il contenitore individuale.

Quattro modelli copiabili

1) Rapporto di classificazione completo:

Ho addestrato il modello e il set di test. Genera: matrice di confusione, precisione, richiamo, F1 (per ogni classe) e conteggi di supporto. Sto deducendo, ma dipende da me: ti dirò quale metrica è importante. Tieni presente che la precisione può essere fuorviante con dati non bilanciati.

2) Controllo dell'overlearning:

Stampa i punteggi del mio modello in entrambi i set TRAINING e TEST fianco a fianco. Calcola la differenza tra loro e avverti che una grande differenza è un segno di apprendimento eccessivo. Se la differenza è ampia, suggerire una regolarizzazione o una semplificazione.

3) Convalida incrociata:

Eseguire una convalida incrociata 5 volte (per stratificazione, classificazione). Stampa il punteggio, la media e la deviazione standard di ogni piega. Se i punteggi sono molto volatili (std elevati), indicano che il modello è instabile. Utilizza le pipeline in modo che le trasformazioni vengano apprese solo dalla parte di formazione a ogni livello.

4) Confronto di base:

Affianca la metrica del mio modello a una linea di base DummyClassifier. Il modello supera significativamente la linea di base? Se non passa, chiarisci che il modello non aggiunge alcun valore reale.

Prompt debole / Prompt forte

Suggerimento debole:

Il mio modello è buono?

"Buono" non è definito; Non è chiaro quale parametro, quale soglia, quale riferimento. L’intelligenza artificiale può fornire un unico numero di precisione e indurre in errore.

Suggerimento potente:

Il tuo ruolo: assistente alla valutazione. Classificazione, dati sbilanciati (12% positivi). Priorità: ricordare (non perdere gli aspetti positivi). Compito: (1) matrice di confusione, (2) precisione/richiamo/F1, (3) media CV stratificata 5 volte e std, (4) confronto della linea di base DummyClassifier. Concentrarsi sul ricordo e sulla differenza di base, non sull'accuratezza. Commentate, ma la decisione finale la prendo io.

Qui la priorità metrica, il CV e la condizione di base sono chiari.

Errori comuni

  • Confidare nell’accuratezza dei dati sbilanciati. Una precisione del 99% potrebbe non catturare affatto la classe minoritaria; Osserva la matrice di confusione.
  • Sto solo guardando il tuo punteggio di istruzione. L’istruzione elevata, il punteggio basso nei test significa apprendimento eccessivo; Confronta sempre due punteggi.
  • Basandosi su un unico compartimento. La divisione fortunata è fuorviante; Guarda la media e la distribuzione con la convalida incrociata.
  • Nessun confronto con il riferimento. Non puoi dire "buono" senza sapere se il modello batte uno stupido predittore.
  • Utilizzo del k-fold normale sulle serie temporali. Fa trapelare il futuro; è richiesta la suddivisione delle serie temporali.
Suggerimento: scrivere tre numeri accanto a ciascun modello: punteggio di addestramento, media di convalida incrociata e punteggio di base. Questo trio rivela a colpo d'occhio un eccesso di apprendimento (formazione >> CV) e una sottovalutazione (CV ≈ baseline).

In sintesi

Costruire un modello è facile, ma valutarlo onestamente è difficile. Nella classificazione, la matrice di confusione, la precisione e il ricordo sono molto più informativi dell'accuratezza; Il costo del lavoro determina quale è importante. MAE, RMSE e R² vengono utilizzati nella regressione. La trappola più insidiosa è l’overlearning: confrontare sempre la formazione e il punteggio del test. Affidarsi alla media e alla distribuzione della convalida incrociata, non a una singola suddivisione; Confronta tutto con una linea di base. L'intelligenza artificiale calcola tutti questi parametri, ma spetta all'essere umano decidere quale metrica utilizzare.

Compito dell'applicazione

Estrarre matrice di confusione, precisione, richiamo e F1 per un modello di classificazione; Quindi esegui una convalida incrociata 5 volte e osserva la distribuzione del punteggio tra le pieghe. Infine, annota fianco a fianco il punteggio di formazione, la media CV e il punteggio di base. Commenta in una frase se il tuo modello sta imparando troppo e sta superando la linea di base.

lista di controllo

  • [ ] Ho considerato la metrica effettiva del lavoro (precisione/richiamo/F1 ecc.) anziché l'accuratezza?
  • [ ] Ho esaminato la matrice di confusione?
  • [ ] Ho confrontato il punteggio della formazione e del test e controllato l'overlearning?
  • [ ] Ho esaminato la media e la distribuzione con la convalida incrociata?
  • [ ] Ho confrontato il modello con una linea di base?