Guadagni:
- Capacità di comprendere le fasi di MLOps (rilascio, distribuzione, monitoraggio, riqualificazione, rollback) e la deriva del modello e pianificare una distribuzione monitorata
- Capacità di applicare i principi di equità, trasparenza e responsabilità del modello e di distinguere l'accuratezza statistica dall'accettabilità etica
- Capacità di proteggere i dati personali con i principi KVKK/GDPR e di assegnare la responsabilità finale a un essere umano nelle decisioni ad alto impatto
Addestrare un modello e ottenere un punteggio elevato non è la fine, ma la metà. Il vero valore arriva quando il modello viene messo in produzione e funziona in modo affidabile, viene monitorato nel tempo senza deteriorarsi e l'intero processo viene eseguito entro limiti etici e legali. Questa unità di chiusura combina tre argomenti: MLOps (la disciplina del go live, del monitoraggio e del mantenimento dei modelli), etica (equità, trasparenza, non maleficenza) e privacy (protezione dei dati personali). L’intelligenza artificiale produce codici, liste di controllo e progetti in queste aree; Ma gli esseri umani decidono se un modello diventa operativo, chi ne sarà interessato e quali dati possono essere utilizzati. Queste decisioni non sono tecniche, ma decisioni di responsabilità.
MLOps: il modello vive come un prodotto
MLOps (Machine Learning Operations - la pratica di esecuzione, monitoraggio e aggiornamento di modelli di machine learning in produzione) è l'adattamento di DevOps nello sviluppo di software alla scienza dei dati. L'idea di base: un modello non è un file che viene formato una volta e dimenticato, ma un prodotto vivo che richiede una manutenzione costante. Fasi principali:
1. Versioning: codice (Git), dati e modello vengono versionati insieme; Viene registrato quale modello è stato prodotto con quali dati e codice.
2. Distribuzione: il modello viene reso attivo come API o lavoro batch. Di solito viene dato prima a un piccolo pubblico (distribuzione ombra/canarino).
3. Monitoraggio: le prestazioni del modello e i dati di input sono costantemente monitorati.
4. Riqualificazione: quando le prestazioni diminuiscono, il modello viene riqualificato con dati aggiornati.
Spostamento del modello: distorsione silenziosa
Il pericolo più grande nella produzione è la deriva del modello (deriva del modello/deriva dei dati). Il mondo cambia; Le condizioni su cui hai addestrato il tuo modello (comportamento del cliente, prezzi, stagione, legislazione) cambiano nel tempo e il modello inizia a diventare obsoleto. Ad esempio, un modello di domanda elaborato prima della pandemia è completamente sbagliato durante la pandemia. La deriva si presenta in due forme: deriva dei dati (la distribuzione dei dati di input cambia) e deriva dei concetti (la relazione tra input e target cambia). Il modo per catturarli è il monitoraggio: monitorare costantemente la distribuzione degli input, la distribuzione delle previsioni e (se possibile) le prestazioni rispetto al risultato effettivo.
Attenzione: un modello messo in produzione si deteriorerà da solo; Non è una questione di "se" ma di "quando". Distribuire modelli senza impostare il monitoraggio è come guidare un'auto senza mai controllarne il motore; Un giorno resta lì in silenzio e tu non te ne accorgi.
Elemento MLOps
Scopo
Se trascurato
Controllo delle versioni
Sapere cosa viene prodotto
Non riproducibile, non tracciabile
Monitoraggio
Vedere presto lo scivolone
Il modello si rompe silenziosamente
riqualificazione
rimani aggiornato
Le previsioni invecchiano
Rollback
tornare al cattivo modello
Il modello difettoso rimane attivo
Documentazione
trasparenza, fatturato
Le informazioni rimangono bloccate in una persona
Etica: le decisioni modello influenzano le persone
I modelli di dati sono sempre più utilizzati nelle decisioni che riguardano la vita delle persone: credito, assunzioni, assicurazioni, giustizia. Con questo potere arriva la responsabilità. Principali rischi etici:
Pregiudizi e discriminazioni: il modello può apprendere e perpetuare le ingiustizie nei dati storici. Se a un certo gruppo è stato dato meno credito in passato, il modello presuppone che questa sia una “regola” e automatizza la discriminazione. Ecco perché l’analisi dell’equità, ovvero verificare se il modello funziona in modo simile per diversi gruppi (genere, età, regione), è essenziale.
Trasparenza e spiegabilità: dovresti essere in grado di spiegare perché un modello ha rifiutato una persona. “L’ha detto la scatola nera” è eticamente e spesso legalmente inaccettabile. Ecco perché gli strumenti di spiegabilità (importanza delle caratteristiche, valori SHAP) sono preziosi.
Responsabilità: chi è responsabile se il modello prende la decisione sbagliata? La risposta è sempre una persona/istituzione, non un modello. Il controllo umano (human-in-the-loop – un essere umano che approva la decisione finale) dovrebbe essere preservato nelle decisioni ad alto impatto.
Attenzione: un modello può essere statisticamente "corretto" ma eticamente inaccettabile. Un modello altamente accurato che svantaggia sistematicamente un gruppo non è un buon modello. L’onestà non può sostituire la giustizia.
Privacy: i dati personali sono attentamente protetti
La materia prima della scienza dei dati sono spesso i dati personali e questi dati sono protetti dalla legge: KVKK in Türkiye, GDPR in Europa. I principi di base sono: limitazione delle finalità (i dati non vengono utilizzati per scopi diversi da quello per cui sono stati raccolti), minimizzazione dei dati (non vengono raccolti/conservati più dati del necessario), anonimizzazione (le informazioni identificative vengono rimosse) e sicurezza (i dati vengono mantenuti crittografati e l'accesso è limitato). Regola fondamentale quando si lavora con strumenti di intelligenza artificiale: non incollare mai dati personali reali in uno strumento di intelligenza artificiale pubblico. Nella maggior parte dei casi, per l'analisi sono sufficienti un diagramma e un campione anonimo/sintetico.
Un'ulteriore enfasi nel contesto della sicurezza delle informazioni: utilizzare strumenti e tecniche di data science solo su dati e sistemi per i quali si ha autorità, per scopi di analisi difensivi e legittimi. L'accesso non autorizzato ai dati di qualcun altro, la reidentificazione degli individui (estraendo l'identità da dati anonimi) o la profilazione non autorizzata sono sia illegali che non etici.
tre mini custodie
Caso 1 – Crollo non tracciato. Una società di e-commerce ha avviato il suo modello di raccomandazione e non ha impostato il monitoraggio. Dopo 4 mesi il catalogo prodotti è cambiato molto; il modello ha continuato a consigliare prodotti obsoleti e il tasso di conversione è sceso silenziosamente del 30%. Nessuno se ne accorse per mesi. Lezione: l'implementazione senza monitoraggio diventa cieca.
Caso 2 – Discriminazione nascosta. Un modello di screening delle assunzioni ha scoperto lo squilibrio di genere nei dati storici e ha sistematicamente sottovalutato le candidate donne. Non è stato notato perché non è stata effettuata alcuna analisi di equità; È stato rivelato in un audit e l’istituzione ha dovuto affrontare un grave rischio reputazionale/legale. Lezione: il controllo dell’equità basato sul gruppo è essenziale nei modelli ad alto impatto.
Caso 3 — Violazione della riservatezza. Un analista ha caricato un file contenente le e-mail dei clienti reali e la cronologia degli acquisti in uno strumento pubblico di intelligenza artificiale e ha detto: "riepiloga i segmenti". I dati personali hanno lasciato l'istituzione; Il processo KVKK è iniziato. Il modo corretto era rimuovere i campi identità e condividere solo proprietà anonime. Lezione: i dati personali reali non entrano nello strumento aperto.
Quattro modelli copiabili
1) Elenco di controllo pre-implementazione:
Il tuo ruolo: consulente MLOps. Elenca le cose che devo controllare prima di mettere in produzione un modello: controllo delle versioni, metriche di monitoraggio, piano di rollback, soglia prestazionale, avviso di deriva dei dati, persona responsabile. Aggiungi una frase che spiega "perché è importante" per ogni elemento. Deciderò.
2) Progettazione del monitoraggio dello spostamento del modello:
Suggerire un piano di monitoraggio della deriva per un modello di classificazione in produzione: (1) quali distribuzioni di input dovrei monitorare, (2) quale allarme per la distribuzione di previsione, (3) come confrontare le prestazioni quando arriva il risultato reale, (4) a quale soglia dovrebbe essere attivata la riqualificazione. Fornire anche uno scheletro di codice.
3) Controllo di equità:
Scrivi il codice che confronta le prestazioni del mio modello per diversi gruppi (ad esempio fascia di età, regione): richiamo/precisione e tasso di decisione positiva per ciascun gruppo. Avvisa se c'è una differenza significativa tra i gruppi. Fare interpretazioni causali/politiche; Mostrami solo le differenze e prenderò in considerazione la decisione.
4) Pre-controllo della privacy:
Prima di fornire dati a uno strumento di intelligenza artificiale, controlla: sono presenti dati personali/di identità (nome, email, ID, telefono, indirizzo, IP) nell'elenco delle colonne seguenti? In tal caso, elenca quali dovrebbero essere rimossi o resi anonimi. Colonne: [elenco]. Scopo: condividere solo lo schema anonimo.
Prompt debole / Prompt forte
Suggerimento debole:
Il mio modello è pronto, vai in diretta.
La distribuzione non è un singolo passaggio; Andare in diretta senza monitoraggio, rollback, equità e controllo della privacy è un silenzioso invito al disastro.
Suggerimento potente:
Il tuo ruolo: consulente responsabile MLOps. Il mio modello è stato addestrato, voglio una preparazione completa prima di andare in diretta. Generare: (1) elenco di controllo pre-implementazione, (2) piano di monitoraggio della deriva, (3) codice di controllo dell'equità basato sul gruppo, (4) controllo della privacy (sono presenti dati personali). Suggerire anche come proteggere il consenso umano nelle decisioni ad alto impatto. Le decisioni finali sono mie.
Qui la distribuzione, il monitoraggio, l'equità e la privacy sono trattati come un unico processo responsabile.
Errori comuni
- Distribuzione di un modello senza impostare il monitoraggio. Il modello scivola e si deforma silenziosamente; Potrebbero volerci mesi per accorgersene.
- Aggirare il controllo della giustizia. Un modello ad alta fedeltà può sistematicamente svantaggiare un gruppo.
- Prendere una decisione inspiegabile come una scatola nera. Le decisioni ad alto impatto devono essere spiegabili; "L'ha detto il modello" non basta.
- Fornire dati personali reali per aprire lo strumento AI. Violazione KVKK/GDPR; Sono sufficienti lo schema e l'esempio anonimo.
- Delegare la decisione al modello. La responsabilità spetta sempre a una persona; Viene mantenuta la sorveglianza umana ad alto impatto.
Suggerimento: prima di pubblicare ciascun modello, fai una domanda ad alta voce: "Se questo modello si rompe silenziosamente domani o penalizza ingiustamente un gruppo, come potrò notarlo e ripristinarlo?" Se non hai una risposta chiara a questa domanda, il modello non è ancora pronto per la produzione.
In sintesi
Il lavoro di un modello non termina con un punteggio elevato, ma con un lavoro affidabile e responsabile nella produzione. MLOps è la disciplina che consente di attivare, monitorare eventuali derive, riqualificare e ripristinare il modello; La distribuzione senza tracciamento è un collasso silenzioso. L'etica richiede equità, trasparenza e responsabilità del modello; l’accuratezza statistica non può sostituire l’accettabilità etica. Privacy significa proteggere i dati personali con i principi KVKK/GDPR e tenere i dati reali lontani da strumenti aperti. Tutte queste decisioni non sono decisioni tecniche ma di responsabilità e appartengono sempre a un essere umano.
Compito dell'applicazione
Pensalo come se dovessi mettere in produzione un modello che hai costruito (o ipotetico) e compilare quattro elenchi: (1) elenco di controllo pre-implementazione, (2) metriche di deriva che monitorerai, (3) piano di controllo dell'equità basato sul gruppo, (4) controllo della privacy. Quindi scrivi una risposta concreta alla domanda "Come mi accorgerò se domani si rompe silenziosamente e lo riprenderò?"
lista di controllo
- [ ] Sto implementando il modello con un piano di monitoraggio (avviso di scivolamento) e di ripristino?
- [ ] Ho verificato il divario equità/prestazioni per i diversi gruppi?
- [ ] Ho mantenuto la partecipazione umana nel processo decisionale ad alto impatto?
- [ ] Ho protetto i dati personali con i principi KVKK/GDPR e li ho tenuti lontani da strumenti aperti?
- [ ] Ho attribuito la responsabilità ultima a un essere umano e non al modello?
Esame del modulo
1. Uno scienziato dei dati chiede all'intelligenza artificiale: "Quanto è precisa la foresta casuale su questi dati?" senza addestrare affatto il modello e inserisce direttamente la risposta "89%" nella presentazione. Qual è l’errore fondamentale in questo approccio?
- A) Aspettare le metriche senza dare dati e modelli all’intelligenza artificiale; Ignorando che il numero che produce è falso e che la vera metrica può essere trovata solo attraverso formazione e test ✔
- B) È necessario utilizzare la regressione logistica anziché la foresta casuale
- C) Il tasso di precisione deve essere sempre superiore al 90%.
- D) È severamente vietato includere metriche nella presentazione
Spiegazione: l'intelligenza artificiale non può produrre una metrica senza accedere al modello e ai dati; Il numero che fornisce è un'allucinazione (fabbricata). La metrica viene ottenuta dai calcoli dello scienziato dei dati solo dopo che il modello è stato effettivamente addestrato e testato. L'output non verificato è come un rapporto non firmato.
2. La colonna "motivo della chiusura dell'account" è inclusa quando si raccolgono dati per una previsione di abbandono; Questa colonna viene riempita solo dopo che il cliente se ne va. Il modello dà il 97% sul set di prova, ma non funziona in produzione. Qual è il nome e la causa di questa condizione?
- A) Apprendimento eccessivo; Il modello è troppo complesso
- B) Fuga di dati; ✔ Utilizzare come caratteristica informazioni che non saranno disponibili al momento della previsione, ma che sono il risultato dell'obiettivo
- C) Apprendimento insufficiente; Il modello è troppo semplice
- D) Distorsione da selezione; piccola dimensione del campione
Spiegazione: Si tratta di una classica fuga di dati: il "motivo di chiusura" è il risultato dell'obiettivo ed è ancora vuoto al momento della previsione. Il modello funziona con questa conoscenza futura, sembra fantastico sul set di test ma si blocca in produzione perché la colonna è vuota. La domanda "ce l'ho al momento della previsione" dovrebbe essere posta in ciascuna colonna.
3. Un analista riempie i valori mancanti nella colonna delle entrate con la media; ma le persone scomparse appartengono in realtà alla fascia a basso reddito che non ha mai dichiarato il reddito (disperse sistematiche). Perché questo riempimento non è corretto?
- A) La media è sempre maggiore della mediana, quindi non è corretta
- B) I valori mancanti non devono mai essere compilati, vanno sempre cancellati
- C) Colmare il divario sistematico con la media distorce i dati rappresentando artificialmente quel gruppo; Il riempimento è stato effettuato senza porre la domanda "perché è vuoto?" ✔
- D) Il calcolo della media crea un problema di prestazioni perché è troppo lento
Spiegazione: La causa della carenza determina la soluzione. Quando la mancanza sistematica (divario concentrato in un certo gruppo) viene colmata con la media, quel gruppo diventa artificialmente un “reddito medio” e i dati vengono distorti. Prima di riempirlo bisognerebbe porsi la domanda “perché è vuoto”; la media mancante sistematica/significativa non deve essere compilata.
4. Un team trova una correlazione di 0,78 tra "spesa pubblicitaria" e "vendite" e raddoppia il budget; Tuttavia, ciò che effettivamente attiva entrambe sono le campagne stagionali. Quale principio statistico spiega questo errore?
- A) La correlazione non è causalità; Una terza variabile nascosta potrebbe influenzare entrambe le variabili ✔
- B) Poiché la correlazione di 0,78 è troppo bassa, la relazione dovrebbe essere ignorata
- C) La correlazione dimostra sempre la causalità, il team ha capito bene
- D) La correlazione tra pubblicità e vendite non può essere calcolata matematicamente.
Spiegazione: La correlazione non è causalità. Le due variabili possono agire insieme perché una terza variabile nascosta (qui le campagne stagionali) le influenza entrambe. La conclusione che l'uno causa l'altro può essere stabilita solo attraverso l'esperimento e la conoscenza sul campo; Il solo numero di correlazioni non è una prova di causalità.
5. Un modello di rilevamento delle frodi mostra un'accuratezza del 99,2% e il team festeggia; Tuttavia, il tasso di transazioni false nei dati è solo dello 0,8% e il ricordo del modello è del 6%. Cosa mostra questa tabella?
- A) Il modello è perfetto perché la precisione è superiore al 99%
- B) L'accuratezza è fuorviante con dati sbilanciati; Il modello non rileva quasi tutti i falsi (basso richiamo), è necessario considerare la metrica appropriata ✔
- C) Non c'è problema poiché il richiamo del modello è elevato
- D) Non c'era bisogno di costruire un modello perché il tasso di falsi era basso
Spiegazione: la "precisione" è fuorviante nei dati non bilanciati. Quando il modello definisce "pulite" quasi tutte le transazioni, ottiene un'elevata precisione perché i falsi sono molto pochi, ma non riesce a rilevarli, che è il suo scopo principale (ricordo 6%). Pertanto, nei problemi sbilanciati, il focus non è sull’accuratezza, ma sulla matrice di confusione e sulle metriche adatte allo scopo del lavoro, come richiamo/precisione.
6. In un progetto di previsione della domanda, i dati dipendenti dal tempo vengono suddivisi casualmente in training/test. Il modello fornisce una precisione del 93% ma si blocca in produzione. Quale dovrebbe essere l’approccio corretto alla divisione?
- A) Ampliare il set di test, ad es. suddivisione 50%/50%
- B) Utilizzando un modello più complesso
- C) Rimuovere completamente la partizione ed eseguire il training con tutti i dati
- D) Suddivisione cronologica: training con il vecchio periodo e testing con il nuovo periodo, impedendo così al modello di vedere il futuro ✔
Spiegazione: se viene eseguita una divisione casuale nei dati delle serie temporali, il modello vede il futuro e prevede il passato durante l'addestramento; è una fuga di notizie e produce un successo che in realtà non esiste. L'approccio corretto è la suddivisione cronologica: allenarsi con il vecchio periodo e testare con il nuovo periodo, imitando la situazione reale nella produzione (prevedere dal passato al futuro).
7. Da quali dati dovrebbero essere calcolati i parametri di ridimensionamento (StandardScaler) nell'ingegneria delle funzionalità e come dovrebbero essere applicati?
- R) Dovrebbe essere calcolato da tutti i dati (allenamento + test insieme) in modo che sia più accurato
- B) Dovrebbe essere calcolato separatamente per ciascuna riga, dal valore di quella riga
- C) Dovrebbe essere calcolato solo a partire dai dati di test
- D) Dovrebbe essere calcolato solo dai dati di allenamento, poi gli stessi parametri dovrebbero essere applicati ai dati di test; altrimenti perderà ✔
Spiegazione: i parametri di tutte le trasformazioni (media, deviazione standard, ecc.) come ridimensionamento, codifica e riempimento dovrebbero essere appresi solo dai dati di training, quindi lo stesso dovrebbe essere applicato ai dati di test. Prendere in considerazione i dati del test causa anche l'interferenza delle informazioni del test con l'addestramento, ovvero perdite, e fa sembrare il modello migliore di quanto non sia. L'uso di Pipeline garantisce questo.
8. Un modello fornisce una precisione del 98% sul set di addestramento e un'accuratezza del 72% sul set di test. Cosa indica questo sintomo e cosa si dovrebbe fare?
- A) Apprendimento insufficiente; il modello dovrebbe essere reso più complesso
- B) Fuga di dati; il set di prova deve essere cambiato
- C) Sovraadattamento; il modello dovrebbe essere semplificato, si dovrebbero applicare la regolarizzazione e la convalida incrociata ✔
- D) Una situazione normale; Il punteggio dell’istruzione è comunque sempre più alto, le precauzioni non sono necessarie
Spiegazione: un punteggio molto alto nell'addestramento e un punteggio significativamente basso nei test è un classico sintomo di overfitting: il modello ha memorizzato il rumore dei dati di addestramento piuttosto che il modello reale. Le soluzioni includono la semplificazione del modello, più dati, la regolarizzazione e la verifica dello stato con convalida incrociata. Affidarsi esclusivamente al punteggio di istruzione nasconde questa trappola.
9. In una presentazione del management, l'asse y di un grafico a barre in cui le vendite aumentano da 1.000 a 1.020 inizia da 980 per far sembrare l'aumento enorme. L'aumento effettivo è del 2%. Perché è una questione etica?
- A) Un asse y troncato esagera visivamente una piccola differenza e fuorvia lo spettatore; Per correttezza, l'asse nelle barre di confronto dovrebbe iniziare da 0 ✔
- B) I grafici a barre non possono mai essere utilizzati per i dati di vendita
- C) Non c'è nessun problema; È sempre bene rendere il grafico impressionante
- D) L'asse Y dovrebbe sempre iniziare dal valore più grande dei dati
Spiegazione: nei grafici a barre per scopi comparativi, l'asse y dovrebbe generalmente iniziare da 0. Tagliare l'asse e iniziare da 980 fa sì che una piccola differenza del 2% sembri visivamente enorme e fuorvia lo spettatore. La responsabilità etica del professionista dei dati è quella di tracciare grafici onesti che non sopravvalutino o sottovalutino i dati.
10. Un analista trova il fatturato totale 3 volte dopo aver UNITO gli ordini con la tabella dei prodotti; Il numero delle linee è passato da 240mila a 690mila. Cosa si sarebbe dovuto fare per evitare questo errore silenzioso?
- A) Dividere il fatturato totale per 3
- B) Utilizza sempre query separate invece di JOIN
- C) Eliminazione completa della tabella prodotti
- D) Controllare il numero di righe dopo la fusione/JOIN e verificare che siano unite tramite la chiave corretta; Catturare la replica in anticipo ✔
Spiegazione: quando sono presenti più righe per ciascun prodotto (colore diverso, ad esempio) nella tabella dei prodotti, ISCRIVITI tramite la chiave sbagliata duplicherà ogni ordine e aumenterà i totali. Il codice viene eseguito senza errori ma il risultato è sbagliato. Il modo per evitarlo è controllare il numero di righe dopo ogni unione/JOIN e unirle con la chiave corretta.
11. Un modello di screening delle assunzioni rileva lo squilibrio di genere nei dati storici e sistematicamente sotto i punteggi delle candidate donne, ma la sua precisione complessiva è elevata. Cosa significa questo?
- R) Non ci sono problemi perché il modello ha un'elevata precisione
- B) L'accuratezza statistica non sostituisce l'accettabilità etica; il modello ha appreso di discriminazioni passate, è richiesto un controllo di equità basato sul gruppo ✔
- C) Aumentando ulteriormente la precisione del modello si risolve il problema
- D) L’equità esula dall’ambito della scienza dei dati
Spiegazione: anche se un modello è statisticamente corretto, potrebbe essere eticamente inaccettabile. Il modello apprende l’ingiustizia presente nei dati passati e automatizza la discriminazione. Un’elevata integrità non può sostituire la giustizia; Nei modelli ad alto impatto, il controllo dell’equità, che misura la differenza di performance/decisione per diversi gruppi, è essenziale e la responsabilità ultima spetta all’essere umano.
12. Un dipendente carica un file contenente le e-mail reali dei clienti e la cronologia degli acquisti in uno strumento pubblico di intelligenza artificiale e dice "riepiloga segmenti". Perché è un errore grave e qual è la strada giusta?
- R) Non c'è nessun problema; Gli strumenti di intelligenza artificiale non memorizzano mai i dati
- B) L'errore è che il file è troppo grande; avrebbe dovuto essere ridotto
- C) Fornire dati personali reali a uno strumento aperto costituisce una violazione del KVKK/GDPR; i campi di identità avrebbero dovuto essere rimossi e condiviso solo lo schema/proprietà anonimo ✔
- D) Si sarebbe dovuto utilizzare CSV anziché solo Excel
Spiegazione: quando dati personali reali (come e-mail, nome, ecc.) vengono forniti a uno strumento di intelligenza artificiale disponibile al pubblico, si verificherà una violazione della privacy nell'ambito di KVKK / GDPR; i dati lasciano l'organizzazione. Nella maggior parte dei casi, per l'analisi sono sufficienti un diagramma e un campione anonimo/sintetico. Il modo corretto è rimuovere i campi identità e condividere solo proprietà anonime.
13. Viene messo in produzione un modello di raccomandazione ma non viene stabilito il monitoraggio; Quando il catalogo prodotti cambia dopo 4 mesi, il modello continua a consigliare i vecchi prodotti e il tasso di conversione diminuisce silenziosamente del 30%. Qual è il nome di questo fenomeno?
- A) Apprendimento eccessivo; Il modello memorizza il set di addestramento
- B) Deriva del modello; Man mano che il mondo cambia, il modello diventa obsoleto silenziosamente, inosservato perché non viene stabilito il monitoraggio ✔
- C) Distorsione da selezione; bias del campione
- D) Violazione della minimizzazione dei dati
Spiegazione: Questa è la deriva del modello (deriva del modello/dati): quando il mondo cambia (catalogo, comportamento, stagione) le condizioni in cui il modello è stato addestrato cambiano e il modello si rompe silenziosamente. Un modello messo in produzione si deteriora da solo; È una questione di "quando". La distribuzione senza monitoraggio (tracciamento di input e prestazioni) rende impossibile rilevare il degrado.
14. Un modello che ottiene una precisione dell'88% in una singola suddivisione di training/test ha punteggi di convalida incrociata 5 volte pari a 88%, 71%, 83%, 64%, 79%. Cosa indica questo e perché è importante la convalida incrociata?
- A) Il modello è stabile; L'88% è prestazione reale
- B) La convalida incrociata non è necessaria; È sufficiente uno scomparto
- C) L’ampia volatilità dei punteggi indica che il modello è instabile; la convalida incrociata basa le prestazioni sulla media e sulla distribuzione di più contenitori, non su un singolo contenitore fortunato ✔
- D) È meglio riportare il punteggio più alto (88%)
Spiegazione: un singolo compartimento può essere fortunato o sfortunato; L'88% era proprio il risultato di quella facile divisione. La convalida incrociata suddivide i dati più volte, basando le prestazioni sulla media (qui ~77%) e mostrando la volatilità dei punteggi. L’elevata volatilità in questo caso suggerisce che il modello è instabile; Affidarsi ad un unico compartimento è fuorviante.