Dobički:
- Sposobnost izbire in interpretacije klasifikacijskih in regresijskih metrik (matrika zmede, natančnost/priklic/F1, MAE/RMSE/R²) glede na namen delovnega mesta
- Sposobnost zaznavanja prekomernega učenja s primerjavo rezultatov usposabljanja in testov ter pridobitev zanesljive učinkovitosti z navzkrižno validacijo
- Sposobnost ovrednotenja, ali vsak model doda resnično vrednost, tako da ga primerjamo z izhodiščem
Nastavitev modela je preprosta; Težko je pošteno izmeriti, ali dejansko deluje. Predmet te enote je najbolj kritična veščina podatkovnega znanstvenika: vrednotenje modela s pravimi metrikami, doseganje zanesljive napovedne učinkovitosti in ulov najbolj zahrbtne pasti: prekomernega učenja (pomnjenja). AI izračunava, interpretira in primerja meritve; vendar je stvar človeka, da se odloči, katera meritev je prava za vaše podjetje in ali je model "dovolj dober". Ekipa, ki gleda na napačno metriko, lahko slab model več mesecev zamenjuje kot "uspeh".
Zakaj natančnost ni dovolj: matrika zmede
Prva metrika, ki pride na misel pri klasifikaciji, je natančnost (natančnost — skupno razmerje pravilnih napovedi). Toda kot smo videli v 6. enoti, je natančnost zavajajoča zaradi neuravnoteženih podatkov. Boljši začetek je matrika zmede – tabela, ki deli napovedi v štiri zaboje:
- True positive (TP): ponaredek smo imenovali tisto, kar je res ponaredek. (dobro)
- Resnično negativno (TN): Rekli smo, da je res čisto. (dobro)
- Lažno pozitivno (FP): pomotoma smo rekli, da je čisti ponaredek. (Lažni alarm)
- Lažno negativno (FN): Zgrešili smo ponaredek in ga označili za čistega. (Zgrešena grožnja)
Dve ključni meritvi izhajata iz teh štirih polj. Natančnost: "Koliko tega, kar imenujem ponaredek, je dejansko ponaredek?" — pomembno, če so stroški lažnega alarma visoki. Občutljivost (odpoklic v angleščini): "Koliko pravih ponaredkov sem ujel?" — pomembno, ko je zamuda grožnje draga. Oboje je pogosto v nasprotju drug z drugim: če znižate prag in izgovorite več "fake", se priklic poveča, natančnost pa zmanjša. Rezultat F1 je uravnoteženo povprečje (harmonična sredina) teh dveh.
Pozor: Odgovor na vprašanje "Katera metrika je pomembna" je poslovna odločitev, ne tehnična. Pogrešanje primera (nizka zapomnitev) pri presejanju raka je katastrofalno; Moteče je poslati pomembno e-pošto med neželeno pošto (nizka natančnost) v filtru za neželeno pošto. Stroški določajo meritev.
Regresijska metrika
Če so izhod številke, se uporabijo različne metrike. MAE (povprečna absolutna napaka): koliko ocene odstopajo od dejanskega povprečja v isti enoti (npr. "v povprečju se motimo za 4200 TL"). RMSE (povprečna kvadratna napaka): strožje kaznuje večje napake in je občutljiv na odstopanja. R² (R-kvadrat — koeficient determinacije): kolikšen del variabilnosti cilja pojasnjuje model (blizu 1 je dobro, 0 je tako slabo kot napoved povprečja, negativno je še slabše).
Najbolj zahrbtna past: prekomerno učenje
Prekomerno opremljanje – kjer si model zapomni podatke o usposabljanju, vendar ne uspe pri novih podatkih – je najpogostejša napaka v podatkovni znanosti. Simptom je jasen: model je odličen na vadbenem nizu (98 %), slab na testnem nizu (72 %). Model si je zapomnil šum tega določenega vzorca, ne dejanskega vzorca v podatkih. Obstaja tudi nasprotno: premajhno prileganje – model je slab tako pri usposabljanju kot pri testiranju, ker je preveč preprost za zajemanje vzorca.
Načini boja proti čezmernemu učenju: poenostavitev modela, več podatkov, ureditev – matematična zavora, ki preprečuje, da bi model postal preveč zapleten – in kar je najpomembneje, navzkrižna validacija.
Navzkrižno preverjanje: ne zaupajte enemu podoknu
Posamezen vadbeni/testni pod je lahko srečen ali nesrečen; Za testni niz lahko dobite visoke ocene samo zato, ker je vzorec enostaven. Navzkrižna validacija (na kratko CV) to reši. Najpogostejša oblika je k-kratni CV: podatki so razdeljeni na k delov (npr. 5); V vsakem krogu je en del testiranje, ostalo pa trening; to se vrže 5-krat in 5 rezultatov je povprečje. Tako boste videli, da uspešnost temelji na povprečju več delitev, ne na eni sami srečni delitvi. Porazdelitev rezultatov je prav tako informativna: zelo nestanovitni rezultati (85 % na enem nadstropju, 62 % na drugem) kažejo, da je model nestabilen.
Normalni k-kratnik se ne uporablja v časovni vrsti (pušča prihodnost); Namesto tega izvajate "naprejšnje veriženje" (razdelitev časovne serije): vedno trenirate s preteklostjo in preizkušate prihodnost.
metrika
Vrsta težave
Kdaj je pomembno?
Natančnost
Razvrstitev
Če so razredi uravnoteženi
Natančnost
Razvrstitev
Lažni alarm je drag
Občutljivost (priklic)
Razvrstitev
Če je drago zamuditi
F1
Razvrstitev
Če je potrebno ravnotežje
MAE
regresija
Razlagalna napaka
RMSE
regresija
Če so velike napake kritične
R²
regresija
razlagalno moč
trije mini kovčki
Primer 1 – Iluzija visoke natančnosti. En model goljufije je pokazal 99,2-odstotno natančnost in ekipa je slavila. Če pogledamo matriko zmede, je bila dejanska: lažna stopnja v podatkih 0,8 %; model ni ujel skoraj nobenega ponaredka, le rekel je "vse jasno". Odpoklic je bil 6-odstoten. Nauk: glejte meritve, ne natančnosti.
Primer 2 – Latentno prekomerno učenje. Ena ekipa je zagotovila in povečala XGBoost na 97 % na kompletu za usposabljanje. Testni niz je bil 69 %, vendar nihče ni pogledal. Model je propadel v proizvodnji. Če bi bila opravljena navzkrižna validacija, bi bila velika razlika med gubami (overlearning) vidna že na začetku. Nauk: zaupajte življenjepisu in rezultatu testa, ne rezultatu izobrazbe.
Primer 3 – Lucky split. En analitik je bil vesel, da je dobil 88 % v eni delitvi. Ko je njegov kolega naredil 5-kratni življenjepis, so bili rezultati 88 %, 71 %, 83 %, 64 %, 79 % — povprečje je 77 %, vendar je zelo spremenljivo. Model je bil nestabilen; En sam predelek je bil zavajajoč. Nauk: glejte povprečje življenjepisa in porazdelitev, ne posameznega koša.
Štiri predloge za kopiranje
1) Celotno poročilo o razvrstitvi:
Imam usposobljen model in testni niz. Ustvarite: matriko zmede, natančnost, priklic, F1 (za vsak razred) in število podpor. Sklepam, vendar je odvisno od mene: povedal vam bom, katera metrika je pomembna. Upoštevajte, da je natančnost lahko zavajajoča zaradi neuravnoteženih podatkov.
2) Nadzor čezmernega učenja:
Natisnite rezultate mojega modela v kompletih USPOSABLJANJE in TEST drug poleg drugega. Izračunajte razliko med njima in opozorite, saj je velika razlika znak preučenosti. Če je razlika velika, predlagajte ureditev ali poenostavitev.
3) Navzkrižno preverjanje:
Izvedite 5-kratno navzkrižno validacijo (za stratificirano, klasifikacijo). Natisnite rezultat, povprečje in standardno odstopanje vsakega pregiba. Če so rezultati zelo spremenljivi (visoki std), pomeni, da je model nestabilen. Uporabite cevovode, tako da se transformacije naučijo samo iz učnega dela na vsaki plasti.
4) Osnovna primerjava:
Postavite metriko mojega modela ob bok osnovni liniji DummyClassifier. Ali model bistveno presega osnovno linijo? Če ne uspe, jasno povejte, da model ne doda nobene prave vrednosti.
Šibek poziv/močan poziv
Šibek poziv:
Je moj model dober?
"Dobro" je nedefinirano; Ni jasno, katera metrika, kateri prag, katera osnovna vrednost. AI lahko poda enotno natančno številko in zavede.
Močan poziv:
Vaša vloga: pomočnik pri ocenjevanju. Razvrstitev, neuravnoteženi podatki (12 % pozitivnih). Prednost: odpoklic (ne zamudite pozitivnih stvari). Naloga: (1) matrika zmede, (2) natančnost/priklic/F1, (3) 5-kratno stratificirano povprečje CV in std, (4) primerjava osnovne vrednosti DummyClassifier. Osredotočite se na priklic in osnovno razliko, ne na natančnost. Komentirajte, a končno odločitev sprejmem jaz.
Tu so prioriteta metrike, CV in osnovni pogoj jasni.
Pogoste napake
- Zaupanje v točnost neuravnoteženih podatkov. 99-odstotna natančnost morda sploh ne zajame manjšinskega razreda; Poglejte matriko zmede.
- Če samo pogledam vaš rezultat izobrazbe. Visoka izobrazba, nizek testni rezultat je prekomerno učenje; Vedno primerjajte dva rezultata.
- Zanašanje na en sam prekat. Srečna delitev je zavajajoča; Poglejte srednjo vrednost in porazdelitev z navzkrižno validacijo.
- Brez primerjave z izhodiščem. Ne morete reči "dobro", ne da bi vedeli, ali model premaga neumnega napovedovalca.
- Uporaba običajnega k-kratnika na časovni vrsti. Pušča prihodnost; potrebna je razdelitev časovne vrste.
Namig: poleg vsakega modela napišite tri številke: rezultat usposabljanja, povprečje navzkrižne validacije in osnovni rezultat. Ta trojica na prvi pogled razkriva prekomerno učenje (usposabljanje >> CV) in podcenjevanje (CV ≈ izhodišče).
Če povzamem
Sestaviti model je enostavno, težko pa ga je pošteno oceniti. Pri klasifikaciji so matrika zmede, natančnost in priklic veliko bolj informativni kot točnost; Stroški dela določajo, katera je pomembna. V regresiji se uporabljajo MAE, RMSE in R². Najbolj zahrbtna past je prekomerno učenje: vedno primerjajte rezultat treninga in testa. Zanašajte se na povprečje in porazdelitev navzkrižne validacije, ne na eno samo delitev; Primerjajte vse z izhodiščem. AI izračuna vse to, vendar se mora človek odločiti, katero metriko bo uporabil.
Aplikacijska naloga
Izvleček matrike zmede, natančnosti, priklica in F1 za klasifikacijski model; Nato izvedite 5-kratno navzkrižno preverjanje in si oglejte porazdelitev rezultatov po pregibih. Nazadnje zapišite rezultat treninga, povprečje življenjepisa in izhodiščni rezultat enega ob drugem. V enem stavku komentirajte, ali se vaš model preveč uči in ali presega osnovno linijo.
kontrolni seznam
- [ ] Ali sem namesto natančnosti pogledal dejansko metriko opravila (natančnost/priklic/F1 itd.)?
- [ ] Ali sem preučil matriko zmede?
- [ ] Ali sem primerjal rezultat treninga in testa ter preveril, ali sem se preveč naučil?
- [ ] Ali sem pogledal povprečje in porazdelitev z navzkrižno validacijo?
- [ ] Ali sem primerjal model z izhodiščem?