Unità 3 / 11

Formazione e valutazione dei modelli: metriche accurate, benchmarking onesto

Guadagni:

  • Capacità di scegliere la metrica adeguata al tipo di problema e al contesto aziendale (PR-AUC/recall in dati sbilanciati, MAE/RMSE in regressione) e riconoscere il sovra/sottoapprendimento
  • Capacità di interpretare ogni metrica rispetto a una linea di base e misurare la deviazione e separare il rumore dal progresso con la convalida incrociata
  • Possibilità di riportare risultati non ottimistici ottimizzando gli iperparametri con il set di validazione e utilizzando il set di test solo alla fine

L'addestramento del modello (addestramento: il processo di apprendimento di modelli dai dati) è il passaggio più visibile ma più fuorviante dell'ingegneria ML. Appare perché produce un numero soddisfacente come "precisione 95%". Fuorviante perché quel numero spesso è la risposta giusta alla domanda sbagliata. In questa unità, la formazione e la valutazione vengono discusse con la disciplina dell'ingegneria; Utilizziamo l'intelligenza artificiale come partner nella progettazione sperimentale e basiamo la decisione sulla misurazione.

Logica del ciclo formativo

Un modello apprende lo schema dei dati minimizzando una funzione di perdita: una funzione che misura numericamente l'errore del modello. L'algoritmo di ottimizzazione (ad esempio la discesa del gradiente) riduce la perdita regolando i parametri passo dopo passo. Lo scopo non è memorizzare i dati di allenamento, ma generalizzarli a dati senza precedenti.

Due pericoli principali:

  • Overfitting: il modello memorizza i dati di addestramento e fallisce sui nuovi dati. Il successo della formazione è elevato, il successo della verifica è basso.
  • Underfitting: il modello non può catturare il modello; Sia il successo della formazione che quello della convalida sono bassi.

Trovare l’equilibrio è l’arte dell’educazione. Il set di validazione è lì per monitorare questo equilibrio: se il successo della validazione inizia a diminuire mentre il successo della formazione aumenta, è iniziato l’overlearning.

Suggerimento: tracciare insieme la perdita di addestramento e quella di convalida in ogni passaggio. Il punto in cui le due curve iniziano a divergere è dove inizia l'overlearning ed è il momento giusto per "fermarsi presto".

Selezione metrica: la decisione più critica

La metrica sbagliata fa sì che un buon modello sembri cattivo e un modello cattivo sembri buono. Il problema determina la metrica:

  • Classificazione sbilanciata (una classe è molto rara, ad esempio la frode): la precisione è fuorviante. Un modello che dice "chiama tutto normale" otterrà una precisione del 99% ma non rileverà una singola frode. Vengono invece utilizzati la precisione (quanto di ciò che ho catturato è effettivamente positivo), il ricordo (quanto di ciò che ho catturato è effettivamente positivo) e il loro equilibrio F1 o PR-AUC.
  • Classificazione bilanciata: l'accuratezza e il ROC-AUC possono essere appropriati.
  • Regressione (stima numerica): MAE (errore medio assoluto), RMSE (penalizza errori grandi), MAPE (errore percentuale).
  • Classifica/raccomandazione: NDCG, MRR, Recall@K.

L'importanza della precisione o del richiamo dipende dal contesto aziendale. Il richiamo (non perdere nessun paziente) è una priorità nello screening del cancro; La precisione nel filtro antispam (non inviare e-mail importanti allo spam) è importante. Questa è una decisione commerciale, non tecnica, e viene presa insieme dall'ingegnere e dal proprietario.

Prompt debole / Prompt forte

Prompt debole: "Valuta le prestazioni del mio modello, precisione 0,97."

Suggerimento potente: "Ho un modello di rilevamento delle frodi; il tasso di classe positiva è 1,5%. L'accuratezza è riportata come 0,97. Spiega perché questa metrica potrebbe essere fuorviante, dimmi quali metriche (precisione, ricordo, PR-AUC) dovrei preferire e perché. Calcola anche quanto accurato otterrebbe un modello di base "chiama tutto negativo" su questi dati, in modo da poter vedere il reale valore aggiunto."

Differenza: un potente suggerimento fornisce il rapporto di classe e il contesto aziendale; richiede anche un confronto del modello di base: questo è l'ancora più importante per stabilire se una metrica è significativa.

Baseline: la metrica senza confronto non ha senso

Una metrica non è buona o cattiva di per sé; È buono o cattivo secondo un modello base. Il modello base è la soluzione più semplice che mi viene in mente: "dillo sempre alla classe maggioritaria", "ripeti il ​​valore della settimana scorsa", "indovina la media". Se il tuo modello non riesce a superare chiaramente questa semplice soluzione, tutta la complessità è vana.

Attenzione: la frase "Il mio modello è accurato all'85%" di per sé non dice nulla. Se il modello base ottiene già l'84%, il tuo modello è quasi inutile; Se il modello base ottiene il 50%, il tuo modello è perfetto. Parla sempre in termini di modello base.

Convalida incrociata e fiducia

Una singola suddivisione tra formazione e test può essere dovuta al caso. Convalida incrociata: dividere i dati in k parti e testare ciascuna parte in sequenza mostra quanto siano stabili le prestazioni. Nella convalida incrociata 5 volte ottieni cinque punteggi diversi; La loro media e deviazione standard sono importanti. Se la media è dell'80% ma la deviazione è del ±12%, il tuo modello è instabile: potrebbe comportarsi in modo molto diverso nel successivo batch di dati.

Ciò è fondamentale anche per il "confronto tra due modelli". Se il modello A ottiene l’81% e il modello B l’82%, B è davvero migliore? Se la deviazione è ±3%, questa differenza potrebbe essere causata da rumore. Considera se la differenza è significativa prima di decidere.

Ottimizzazione degli iperparametri: con convalida, non test

Gli iperparametri (impostazioni determinate manualmente prima dell'addestramento: velocità di apprendimento, profondità dell'albero e così via) vengono impostati con il set di convalida. Il set di prova viene utilizzato solo alla fine, una volta. Se selezioni gli iperparametri osservando il set di test, il set di test sarà contaminato e le prestazioni riportate saranno ottimistiche, il che non è il caso nella realtà.

L'intelligenza artificiale è un valido aiuto nella progettazione dello spazio di ricerca degli iperparametri e nella scrittura del codice di ricerca (ricerca su griglia, ricerca casuale, ottimizzazione bayesiana). Ma sei ancora tu a decidere "quale metrica ottimizzeremo?"

tre mini custodie

Caso 1 – Trappola di precisione. Un team medico era orgoglioso di un modello in grado di rilevare una malattia rara: precisione del 98%. Quando è stato effettuato il confronto tra i modelli di base, è emersa la verità: poiché il tasso di malattia era del 2%, anche il modello che diceva "chiamate tutti sani" ha ricevuto il 98%. Il ricordo del modello è stato solo dell'11%, mancando la maggior parte dei pazienti. Una volta convertita la metrica in PR-AUC, è stata misurata la prestazione effettiva e il modello è stato riprogettato.

Caso 2 – Confondere il rumore con il progresso. Un team ha trascorso mesi a migliorare il modello dall'86,2% all'86,9%. La validazione incrociata ha mostrato che il bias era ±1,4%, quindi il “miglioramento” di 0,7 punti era un rumore statistico. La squadra aveva sprecato tre settimane con guadagni irreali. Lezione: non dichiarare vittoria senza verificare che il miglioramento sia maggiore dello scostamento.

Caso 3 - Contaminazione del set di prova. Un ingegnere ha esaminato ripetutamente il set di test per scegliere gli iperparametri migliori. Il 91% riportato è sceso all'83% nella produzione. Perché: aveva inconsapevolmente selezionato il modello di conseguenza guardando il set di test più e più volte (apprendimento eccessivo sul set di test). Le prestazioni riportate e quelle effettive si sovrapponevano quando veniva utilizzato un set di convalida separato.

Modelli copiabili

Aiutami a scegliere la metrica giusta per questo problema di classificazione. Problema: [cosa è previsto] Distribuzione delle classi: [tasso positivo

Valutare il confronto dei due modelli seguenti. Validazione incrociata del modello A: [elenco dei punteggi] Validazione incrociata del modello B: [elenco dei punteggi] Calcolare la media e la deviazione standard. La differenza è statisticamente significativa o è solo rumore all'interno della deviazione? Quale mi consiglieresti di scegliere e perché?

Controllare questo codice di training per quanto segue:1) Gli iperparametri sono selezionati con il set di test o il set di validazione?2) L'arresto anticipato è monitorato con il set corretto?3) Ci sono segni di overlearning (differenza di perdita di training/convalida)?Codice: [codice]

Quale tra MAE, RMSE e MAPE dovrei segnalare per questo problema di regressione? Scala della variabile target: [intervallo] Gli errori di grandi dimensioni sono sproporzionatamente gravi (RMSE) o sono tutti uguali (MAE)? Sono presenti valori prossimi allo zero (distorcono MAPE)? Suggerire con una breve giustificazione.

Tabella di selezione metrica

Tipo di problema

Metrica appropriata

Da evitare

Perché

Classificazione sbilanciata

PR-AUC, F1, richiamo

Precisione

La classe di maggioranza gonfia la metrica

Classificazione equilibrata

Precisione, ROC-AUC

Affidabile nei dati bilanciati

Regressione (valore anomalo significativo)

RMSE

MAPE (se zero)

Punisce gli errori maggiori

Regressione (uguale peso)

MAE

Facile da interpretare

Classifica/raccomandazione

NDCG, Recall@K

Precisione

L'ordine è importante

Errori comuni

  • Utilizzo dell'accuratezza su dati sbilanciati. L'errore metrico più comune.
  • Non fare confronti con i modelli base. Fa sì che la metrica perda il suo significato.
  • Osservando il set di test per gli iperparametri. Risultato ottimistico e irrealistico.
  • Basandosi su un unico compartimento. Senza la convalida incrociata non vedrai il bias.
  • Confondere il rumore con il progresso. Piccoli "miglioramenti" derivanti dalla deviazione sono per lo più fortuna.
  • Ignorando il contesto aziendale. La bilancia di precisione/richiamo è una decisione aziendale.

In sintesi

La vera abilità nell'addestramento del modello non è produrre un numero elevato, ma sapere cosa significa quel numero. Il problema e il contesto aziendale determinano la metrica giusta; interpretare ogni metrica secondo un modello di base; misurare i bias con la convalida incrociata e non confondere il rumore con il progresso; Utilizzare il set di prova solo alla fine, una volta. L'intelligenza artificiale è il tuo partner nella progettazione degli esperimenti, ma la decisione "abbastanza buono" spetta a te e ai tuoi cari.

Compito dell'applicazione

Per un modello di classificazione: (1) scrivere la distribuzione delle classi, (2) costruire un modello base appropriato e misurarne il punteggio, (3) valutare il modello con una convalida incrociata di 5 volte e riportare la media e la deviazione standard, (4) calcolare la metrica appropriata al problema (ad esempio PR-AUC) anziché l'accuratezza. Annota se il tuo modello batte il modello di base con un ampio margine senza pregiudizi.

lista di controllo

  • [ ] Ho scelto la metrica in base al tipo di problema e al contesto aziendale.
  • [] Ho costruito un modello base e l'ho confrontato.
  • [ ] Ho riportato la media e la deviazione con la convalida incrociata.
  • [ ] Ho confermato che il miglioramento è maggiore della deviazione.
  • [] Ho selezionato gli iperparametri con il set di convalida.
  • [ ] Ho utilizzato il set di prova solo una volta, proprio alla fine.