Jedinica 3 / 11

Obuka modela i evaluacija: točna metrika, poštena usporedna analiza

Dobici:

  • Sposobnost odabira metrike koja odgovara vrsti problema i poslovnom kontekstu (PR-AUC/poziv u neuravnoteženim podacima, MAE/RMSE u regresiji) i prepoznavanje prekomjernog/nedovoljnog učenja
  • Sposobnost tumačenja svake metrike u odnosu na osnovnu vrijednost i mjerenje odstupanja i odvajanje buke od napretka uz unakrsnu provjeru
  • Sposobnost izvješćivanja o neoptimističnim rezultatima podešavanjem hiperparametara s validacijskim skupom i korištenjem testnog skupa samo na kraju

Obuka modela (obuka: proces učenja uzoraka iz podataka) je najvidljiviji, ali najpogrešniji korak ML inženjerstva. Čini se jer daje zadovoljavajući broj kao što je "točnost 95%". Zavaravajuće jer je taj broj često pravi odgovor na krivo pitanje. U ovoj se jedinici raspravlja o obrazovanju i evaluaciji s inženjerskom disciplinom; Umjetnu inteligenciju koristimo kao partnera u eksperimentalnom dizajnu i odluku temeljimo na mjerenju.

Logika ciklusa treninga

Model uči obrazac u podacima minimiziranjem funkcije gubitka: funkcije koja numerički mjeri pogrešku modela. Optimizacijski algoritam (npr. gradijentni spust) smanjuje gubitak podešavanjem parametara korak po korak. Cilj nije zapamtiti podatke o obuci, već ih generalizirati na podatke bez presedana.

Dvije glavne opasnosti:

  • Overfitting: Model pamti podatke o vježbanju i ne uspijeva na novim podacima. Uspješnost obuke je visoka, uspješnost verifikacije niska.
  • Nedovoljno uklapanje: Model ne može uhvatiti uzorak; Uspjeh i obuke i validacije je nizak.

Pronalaženje ravnoteže je umjetnost obrazovanja. Skup za provjeru valjanosti je tu da prati ovu ravnotežu: ako se uspješnost provjere počne smanjivati ​​dok se uspješnost obuke povećava, počelo je prekomjerno učenje.

Savjet: iscrtajte gubitak obuke i validacije zajedno na svakom koraku. Točka u kojoj se dvije krivulje počinju razilaziti je mjesto gdje počinje prekomjerno učenje i pravi je trenutak za "rano zaustavljanje".

Odabir metrike: najkritičnija odluka

Pogrešna metrika čini da dobar model izgleda loše, a loš model izgleda dobro. Problem određuje metriku:

  • Neuravnotežena klasifikacija (jedna klasa je vrlo rijetka, npr. prijevara): Točnost dovodi u zabludu. Model koji kaže "nazovi sve normalnim" dobit će 99% točnosti, ali neće uhvatiti niti jednu prijevaru. Umjesto toga, koristi se preciznost (koliko je od onoga što sam uhvatio stvarno pozitivno), opoziv (koliko je od onoga što sam uhvatio stvarno pozitivno) i njihova ravnoteža F1 ili PR-AUC.
  • Uravnotežena klasifikacija: Točnost i ROC-AUC mogu biti prikladni.
  • Regresija (procjena broja): MAE (srednja apsolutna pogreška), RMSE (kažnjava velike pogreške), MAPE (postotna pogreška).
  • Rangiranje/preporuka: NDCG, MRR, Recall@K.

Je li preciznost ili opoziv važan ovisi o poslovnom kontekstu. Opoziv (nepropuštanje pacijenata) je prioritet u probiru raka; Važna je preciznost filtera neželjene pošte (ne slanje važnih e-poruka u neželjenu poštu). Ovo je poslovna, a ne tehnička odluka, a donose je zajedno inženjer i vlasnik.

Slab upit / Jak upit

Slab upit: "Ocijeni izvedbu mog modela, točnost 0,97."

Snažan upit: "Imam model za otkrivanje prijevare; stopa pozitivne klase je 1,5%. Točnost je prijavljena kao 0,97. Objasnite zašto bi ova metrika mogla dovesti u zabludu, recite mi koju metriku (preciznost, opoziv, PR-AUC) bih trebao preferirati i zašto. Također izračunajte koliko bi točan osnovni model 'nazovi sve negativno' dobio na ovim podacima, tako da mogu vidjeti stvarnu dodanu vrijednost."

Razlika: snažan prompt daje omjer klase i poslovni kontekst; također traži usporedbu osnovnog modela — ovo je najvažnije sidro za to ima li metrika smisla.

Polazna vrijednost: metrika bez usporedbe je besmislena

Mjerni podatak nije dobar ili loš sam po sebi; Dobar je ili loš prema osnovnom modelu. Osnovni model je najjednostavnije rješenje koje vam padne na pamet: "uvijek reci većinskoj klasi", "ponovi prošlotjednu vrijednost", "pogodi srednju vrijednost". Ako vaš model ne može jasno proći ovo jednostavno rješenje, sva složenost je uzalud.

Oprez: Rečenica "Moj model je 85% točan" sama po sebi ne govori ništa. Ako osnovni model već dobiva 84%, vaš model je gotovo bezvrijedan; Ako osnovni model dobije 50%, vaš model je savršen. Uvijek govorite u terminima osnovnog modela.

Unakrsna provjera i povjerenje

Jedna podjela obuke/testiranja može biti slučajna. Unakrsna provjera valjanosti: dijeljenje podataka na k dijelova i uzastopno testiranje svakog dijela pokazuje koliko je izvedba stabilna. U 5-strukoj unakrsnoj provjeri dobivate pet različitih rezultata; Njihova srednja vrijednost i standardna devijacija su važni. Ako je prosjek 80%, ali je odstupanje ±12%, vaš model je nestabilan — može se ponašati sasvim drugačije u sljedećoj seriji podataka.

Ovo je također kritično za "usporedbu dva modela". Ako je model A dobio 81%, a model B 82%, je li B stvarno bolji? Ako je odstupanje ±3%, ta razlika može biti šum. Prije odluke razmislite je li razlika značajna.

Podešavanje hiperparametara: s provjerom valjanosti, bez testiranja

Hiperparametri (postavke koje su ručno određene prije treninga—stopa učenja, dubina stabla itd.) postavljaju se skupom za provjeru valjanosti. Testni set se koristi samo na kraju, jednom. Ako odaberete hiperparametre gledajući testni skup, testni skup će biti kontaminiran, a izvedba koju izvješćujete bit će optimistična, što u stvarnosti nije slučaj.

Umjetna inteligencija je dobar pomoćnik u dizajniranju hiperparametarskog prostora za pretraživanje i pisanju koda za pretraživanje (grid search, random search, Bayesian optimizacija). Ali ipak odlučujete "koju ćemo metriku optimizirati?"

tri mini kućišta

Slučaj 1 - Zamka točnosti. Medicinski tim bio je ponosan na model koji je otkrio rijetku bolest: 98% točnost. Kada je napravljena usporedba osnovnog modela, istina je izašla na vidjelo: budući da je stopa bolesti bila 2%, model koji je rekao "nazovite sve zdravima" također je dobio 98%. Opoziv modela iznosio je samo 11% — nedostaje većina pacijenata. Nakon što je metrika pretvorena u PR-AUC, izmjerena je stvarna izvedba i model je redizajniran.

Slučaj 2 - Zamjena buke za napredak. Tim je proveo mjesece poboljšavajući model sa 86,2% na 86,9%. Unakrsna provjera pokazala je da je pristranost bila ±1,4% — tako da je "poboljšanje" od 0,7 bodova bio statistički šum. Tim je protratio tri tjedna na nestvarnu zaradu. Pouka: ne proglašavajte pobjedu bez provjere da je napredak veći od odstupanja.

Slučaj 3 - Kontaminacija ispitnog seta. Inženjer je više puta pogledao testni set kako bi odabrao najbolje hiperparametre. 91% koliko je izvijestio palo je na 83% u proizvodnji. Zašto: on je nesvjesno odabrao model u skladu s tim gledajući ispitni set iznova i iznova (pretjerano učenje na ispitnom skupu). Prijavljena i stvarna izvedba preklapale su se kada je korišten zasebni skup za provjeru valjanosti.

Predlošci koji se mogu kopirati

Pomozite mi odabrati pravu metriku za ovaj problem klasifikacije. Problem: [što se predviđa] Raspodjela razreda: [pozitivna stopa

Ocijenite usporedbu sljedeća dva modela. Unakrsna provjera modela A: [popis rezultata] Unakrsna provjera modela B: [popis rezultata] Izračunajte srednju vrijednost i standardnu devijaciju. Je li razlika statistički značajna ili je to samo šum unutar odstupanja? Koju biste mi preporučili da izaberem i zašto?

Provjerite ovaj kod za obuku za sljedeće: 1) Jesu li hiperparametri odabrani s testnim skupom ili skupom za provjeru valjanosti? 2) Prati li se rano zaustavljanje s ispravnim skupom? 3) Postoje li znakovi prekomjernog učenja (razlika u gubitku treninga/validacije)? Šifra: [kod]

Koji od MAE, RMSE i MAPE trebam prijaviti za ovaj regresijski problem? Ljestvica ciljne varijable: [raspon] Jesu li velike pogreške neproporcionalno loše (RMSE) ili su sve jednake (MAE)? Postoje li vrijednosti blizu nule (iskrivljuju li MAPE)? Predložite s kratkim obrazloženjem.

Tablica odabira metrike

Vrsta problema

Prikladna metrika

Za izbjegavanje

zašto

Neuravnotežena klasifikacija

PR-AUC, F1, opoziv

Točnost

Većinska klasa napuhuje metriku

Uravnotežena klasifikacija

Točnost, ROC-AUC

Pouzdan u uravnoteženim podacima

Regresija (značajno odstupanje)

RMSE

MAPE (ako je nula)

Kažnjava velike pogreške

Regresija (jednaka težina)

MAE

Lako za tumačenje

Rangiranje/preporuka

NDCG, Opoziv@K

Točnost

Red je važan

Uobičajene greške

  • Korištenje točnosti na neuravnoteženim podacima. Najčešća metrička pogreška.
  • Bez usporedbe osnovnih modela. Time metrika gubi svoje značenje.
  • Gledajući testni skup za hiperparametre. Optimističan, nerealan rezultat.
  • Oslanjajući se na jedan odjeljak. Bez unakrsne provjere nećete vidjeti pristranost.
  • Miješajući buku s napretkom. Mala "poboljšanja" od odstupanja uglavnom su sreća.
  • Ignoriranje poslovnog konteksta. Ravnoteža preciznosti/opoziva poslovna je odluka.

Ukratko

Prava vještina u obuci modela nije proizvesti veliki broj, već znati što taj broj znači. Problem i poslovni kontekst određuju pravu metriku; interpretirati svaku metriku prema osnovnom modelu; mjerite pristranost s unakrsnom provjerom i nemojte pogrešno zamijeniti šum s napretkom; Test set koristite samo na kraju, jednom. AI je vaš partner u dizajnu eksperimenta, ali odluka o "dovoljno dobrom" ovisi o vama i vama.

Zadatak aplikacije

Za model klasifikacije: (1) napišite distribuciju klase, (2) izgradite odgovarajući osnovni model i izmjerite njegov rezultat, (3) procijenite svoj model peterostrukom unakrsnom provjerom i prijavite srednju vrijednost i standardnu devijaciju, (4) izračunajte metriku koja odgovara problemu (npr. PR-AUC) umjesto točnosti. Zapišite je li vaš model veći od osnovnog modela bez pristranosti.

popis za provjeru

  • [ ] Odabrao sam metriku na temelju vrste problema i poslovnog konteksta.
  • [ ] Napravio sam osnovni model i usporedio ga s njim.
  • [] Prijavio sam srednju vrijednost i odstupanje s unakrsnom provjerom.
  • [ ] Potvrdio sam da je poboljšanje veće od odstupanja.
  • [ ] Odabrao sam hiperparametre sa skupom za provjeru valjanosti.
  • [ ] Testni set sam upotrijebio samo jednom, na samom kraju.