Enhed 3 / 11

Modeltræning og evaluering: Nøjagtige målinger, ærlig benchmarking

Gevinster:

  • Evne til at vælge den metrik, der passer til problemtypen og forretningskonteksten (PR-AUC/genkaldelse i ubalancerede data, MAE/RMSE i regression) og genkende over-/underlæring
  • Evne til at fortolke hver metrik mod en basislinje og måle afvigelse og adskille støj fra fremskridt med krydsvalidering
  • Evne til at rapportere ikke-optimistiske resultater ved at tune hyperparametre med valideringssættet og kun bruge testsættet til sidst

Modeltræning (træning: processen med at lære mønstre fra data) er det mest synlige, men mest vildledende trin i ML-teknologi. Det vises, fordi det giver et tilfredsstillende tal som "nøjagtighed 95%". Vildledende, fordi det tal ofte er det rigtige svar på det forkerte spørgsmål. I denne enhed diskuteres uddannelse og evaluering med ingeniørfaget; Vi bruger kunstig intelligens som partner i eksperimentelt design og baserer beslutningen på måling.

Logik i træningscyklussen

En model lærer mønsteret i dataene ved at minimere en tabsfunktion: en funktion, der numerisk måler modellens fejl. Optimeringsalgoritmen (f.eks. gradientnedstigning) reducerer tabet ved at justere parametrene trin for trin. Målet er ikke at huske træningsdataene, men at generalisere dem til hidtil usete data.

To hovedfarer:

  • Overfitting: Modellen husker træningsdataene og fejler på nye data. Træningssuccesen er høj, verifikationssuccesen er lav.
  • Undertilpasning: Modellen kan ikke fange mønsteret; Både trænings- og valideringssuccesen er lav.

At finde balancen er uddannelsens kunst. Valideringssættet er der for at overvåge denne balance: Hvis valideringssuccesen begynder at falde, mens træningssuccesen øges, er overlæring begyndt.

Tip: Plot trænings- og valideringstabet sammen på hvert trin. Det punkt, hvor de to kurver begynder at divergere, er der, hvor overlæring begynder og er det rigtige tidspunkt til at "stoppe tidligt".

Metrisk valg: den mest kritiske beslutning

Den forkerte metrik får en god model til at se dårlig ud, og en dårlig model ser godt ud. Problemet bestemmer metrikken:

  • Ubalanceret klassificering (én klasse er meget sjælden, f.eks. svindel): Nøjagtighed er vildledende. En model, der siger "kald alt normalt", vil få 99% nøjagtighed, men vil ikke fange en eneste svindel. I stedet bruges præcision (hvor meget af det, jeg fangede, er faktisk positivt), tilbagekaldelse (hvor meget af det, jeg fangede, er sandt positivt) og deres balance F1 eller PR-AUC.
  • Afbalanceret klassificering: Nøjagtighed og ROC-AUC kan være passende.
  • Regression (antal estimering): MAE (gennemsnitlig absolut fejl), RMSE (straffer store fejl), MAPE (fejl i procent).
  • Placering/anbefaling: NDCG, MRR, Recall@K.

Hvorvidt præcision eller tilbagekaldelse er vigtig afhænger af forretningskonteksten. Tilbagekaldelse (mangler ingen patienter) er en prioritet i kræftscreening; Præcision i spamfilter (ikke at sende vigtige e-mails til spam) er vigtigt. Dette er en forretningsbeslutning, ikke en teknisk, og træffes sammen af ​​ingeniøren og ejeren.

Svag prompt / Stærk prompt

Svag prompt: "Evaluer min models ydeevne, nøjagtighed 0,97."

Kraftfuld prompt: "Jeg har en model for opdagelse af bedrageri; positiv klasserate er 1,5%. Nøjagtighed rapporteres som 0,97. Forklar, hvorfor denne metrik kan være vildledende, fortæl mig, hvilke metrics (præcision, tilbagekaldelse, PR-AUC) jeg bør foretrække og hvorfor. Beregn også, hvor nøjagtig en baselinemodel "kald alt negativt" vil få en reel merværdi på disse data."

Forskel: kraftfuld prompt giver klasseforhold og forretningskontekst; den beder også om en sammenligning af basismodeller - dette er det vigtigste anker for, om en metrik er meningsfuld.

Baseline: metrisk uden sammenligning er meningsløs

En metrik er ikke god eller dårlig i sig selv; Det er godt eller dårligt efter en grundmodel. Grundmodellen er den enkleste løsning, der kommer til at tænke på: "fortæl altid majoritetsklassen", "gentag sidste uges værdi", "gæt gennemsnittet". Hvis din model ikke klart kan klare denne enkle løsning, er al kompleksiteten for ingenting.

Forsigtig: Sætningen "Min model er 85% nøjagtig" siger i sig selv ikke noget. Hvis basismodellen allerede får 84%, er din model næsten værdiløs; Hvis basismodellen får 50 %, er din model perfekt. Tal altid i forhold til grundmodellen.

Krydsvalidering og tillid

En enkelt trænings-/testdeling kan skyldes tilfældigheder. Krydsvalidering: opdeling af data i k dele og test af hver del sekventielt viser, hvor stabil ydeevnen er. I 5-fold krydsvalidering får du fem forskellige scores; Deres middelværdi og standardafvigelse er vigtige. Hvis gennemsnittet er 80 %, men afvigelsen er ±12 %, er din model ustabil - den kan opføre sig meget anderledes i den næste batch af data.

Dette er også kritisk for "to model sammenligning". Hvis model A fik 81 % og model B fik 82 %, er B så virkelig bedre? Hvis afvigelsen er ±3 %, kan denne forskel være støj. Overvej, om forskellen er signifikant, før du beslutter dig.

Hyperparameter tuning: med validering, ikke test

Hyperparametre (indstillinger, der bestemmes manuelt før træning – indlæringshastighed, trædybde osv.) indstilles med valideringssættet. Testsættet bruges kun til sidst én gang. Hvis du vælger hyperparametre ved at se på testsættet, vil testsættet blive forurenet, og den ydelse du rapporterer vil være optimistisk, hvilket ikke er tilfældet i virkeligheden.

Kunstig intelligens er en god hjælper til at designe hyperparametersøgerummet og skrive søgekoden (gittersøgning, tilfældig søgning, Bayesiansk optimering). Men du bestemmer stadig "hvilken metric vil vi optimere?"

tre minisager

Case 1 - Nøjagtighedsfælde. Et medicinsk team var stolte af en model, der opdagede en sjælden sygdom: 98 % nøjagtighed. Da den grundlæggende modelsammenligning blev foretaget, kom sandheden frem: Da sygdomsraten var 2 %, fik modellen, der sagde "kald alle sunde" også 98 %. Modellens tilbagekaldelse var kun 11% - savnede de fleste patienter. Når metrikken blev konverteret til PR-AUC, blev den faktiske ydeevne målt, og modellen blev redesignet.

Case 2 - Misforståelig støj for fremskridt. Et team brugte måneder på at forbedre modellen fra 86,2 % til 86,9 %. Krydsvalidering viste, at bias var ±1,4% - så 0,7 point "forbedringen" var statistisk støj. Holdet havde spildt tre uger på uvirkelig indtjening. Lektion: Erklær ikke sejr uden at bekræfte, at forbedringen er større end afvigelsen.

Tilfælde 3 - Forurening af testsættet. En ingeniør kiggede gentagne gange på testsættet for at vælge de bedste hyperparametre. De 91%, det rapporterede, faldt til 83% i produktionen. Hvorfor: han havde ubevidst valgt modellen i overensstemmelse hermed ved at se på testsættet igen og igen (overlæring på testsættet). Rapporteret og faktisk ydeevne overlappede, når et separat valideringssæt blev brugt.

Kopierbare skabeloner

Hjælp mig med at vælge den rigtige metrik til dette klassificeringsproblem. Problem: [hvad er forudsagt] Klassefordeling: [positiv rate

Evaluer sammenligningen af følgende to modeller.Model A krydsvalidering: [liste over scorer]Model B krydsvalidering: [liste over scorer]Beregn gennemsnittet og standardafvigelsen. Er forskellen statistisk signifikant eller er det bare støj inden for afvigelsen? Hvilken vil du anbefale jeg vælger og hvorfor?

Tjek denne træningskode for følgende:1) Er hyperparametrene valgt med testsættet eller valideringssættet?2) Overvåges tidligt stop med det korrekte sæt?3) Er der tegn på overlæring (forskel i trænings-/valideringstab)?Kode: [kode]

Hvilken af MAE, RMSE og MAPE skal jeg rapportere for dette regressionsproblem?Skala for målvariablen: [range]Er store fejl uforholdsmæssigt dårlige (RMSE), eller er de alle ens (MAE)?Er der værdier tæt på nul (forvrænger de MAPE)?Foreslå med kort begrundelse.

Metrisk valgtabel

Problemtype

Passende metrik

Skal undgås

Hvorfor

Ubalanceret klassificering

PR-AUC, F1, tilbagekaldelse

Nøjagtighed

Majoritetsklasse puster metrikken op

Afbalanceret klassifikation

Nøjagtighed, ROC-AUC

Pålidelig i balancerede data

Regression (signifikant outlier)

RMSE

MAPE (hvis nul)

Straffer store fejl

Regression (lige vægt)

MAE

Let at fortolke

Rangordning/anbefaling

NDCG, Recall@K

Nøjagtighed

Orden er vigtig

Almindelige fejl

  • Brug af nøjagtighed på ubalancerede data. Den mest almindelige metriske fejl.
  • Foretager ikke sammenligning af basismodeller. Det får metrikken til at miste sin betydning.
  • Ser på testsættet for hyperparametre. Optimistisk, urealistisk resultat.
  • Stoler på et enkelt rum. Uden krydsvalidering vil du ikke se bias.
  • Forkert støj for fremskridt. Små "forbedringer" fra afvigelse er for det meste held.
  • Ignorerer den forretningsmæssige kontekst. Præcisions-/genkaldelsesbalancen er en forretningsbeslutning.

Sammenfattende

Den virkelige færdighed i modeltræning er ikke at producere et højt tal, men at vide, hvad det tal betyder. Problemet og forretningskonteksten bestemmer den rigtige metrik; fortolke hver metrik i henhold til en basismodel; mål bias med krydsvalidering og forveksle ikke støj med fremskridt; Brug kun testsættet til sidst, én gang. AI er din partner i eksperimentdesign, men beslutningen om "god nok" er op til dig og dine.

Ansøgningsopgave

For en klassifikationsmodel: (1) skriv klassefordelingen, (2) opbyg en passende basismodel og mål dens score, (3) evaluer din model med 5-dobbelt krydsvalidering og rapporter middelværdien og standardafvigelsen, (4) beregn den metrik, der passer til problemet (f.eks. PR-AUC) i stedet for nøjagtighed. Skriv ned, om din model slår basismodellen med stor margen uden bias.

tjekliste

  • [ ] Jeg valgte metrikken ud fra problemtypen og forretningskonteksten.
  • [ ] Jeg byggede en basismodel og sammenlignede med den.
  • [ ] Jeg rapporterede gennemsnittet og afvigelsen med krydsvalidering.
  • [ ] Jeg bekræftede, at forbedringen er større end afvigelsen.
  • [ ] Jeg valgte hyperparametrene med valideringssættet.
  • [ ] Jeg brugte kun testsættet én gang, til allersidst.