Dobici:
- Sposobnost odabira i tumačenja metrike klasifikacije i regresije (matrica konfuzije, preciznost/poziv/F1, MAE/RMSE/R²) u skladu sa svrhom posla
- Sposobnost otkrivanja prekomjernog učenja upoređivanjem rezultata treninga i testova i dobijanja pouzdanih performansi uz unakrsnu validaciju
- Sposobnost da se proceni da li svaki model dodaje stvarnu vrednost upoređujući ga sa osnovnom linijom
Lako je postaviti model; Teško je iskreno izmjeriti da li zaista funkcionira. Predmet ove jedinice je najkritičnija vještina naučnika podataka: procjena modela s pravom metrikom, postizanje pouzdanih prediktivnih performansi i hvatanje najpodmuklije zamke: prekomjerno učenje (pamćenje). AI izračunava, tumači i upoređuje metriku; ali na čovjeku je da odluči koja je metrika ispravna za vaše poslovanje i da li je model "dovoljno dobar". Tim koji gleda na pogrešnu metriku može mjesecima pogrešno shvatiti loš model kao "uspjeh".
Zašto tačnost nije dovoljna: matrica konfuzije
Prva metrika koja pada na pamet u klasifikaciji je tačnost (tačnost — ukupan omjer tačnih predviđanja). Ali, kao što smo vidjeli u Jedinici 6, tačnost dovodi u zabludu neuravnoteženim podacima. Bolji početak je matrica konfuzije - tabela koja predviđa predviđanja dijeli u četiri korpe:
- Pravo pozitivno (TP): Lažnim smo nazvali ono što je stvarno lažno. (dobro)
- Pravo negativno (TN): Rekli smo zaista čisto. (dobro)
- Lažno pozitivan (FP): Pogrešno smo rekli da je čista lažna. (lažna uzbuna)
- Lažno negativan (FN): Promašili smo lažno i nazvali ga čistim. (Propuštena prijetnja)
Dvije ključne metrike proizlaze iz ova četiri polja. Preciznost: "Koliko je onoga što ja nazivam lažnim zapravo lažno?" — važno ako su troškovi lažnog alarma visoki. Osjetljivost (podsjećanje na engleskom): "Koliko sam pravih lažnjaka uhvatio?" — važno kada je propuštanje prijetnje skupo. To dvoje su često u suprotnosti jedno s drugim: ako spustite prag i više kažete "lažno", prisjećanje se povećava, ali se preciznost smanjuje. F1 rezultat je izbalansirani prosjek (harmonična sredina) ova dva.
Pažnja: Odgovor na pitanje "Koja metrika je važna" je poslovna odluka, a ne tehnička. Propuštanje slučaja (malo pamćenje) u skriningu raka je katastrofalno; Iritantno je slati važnu e-poštu u neželjenu poštu (niska preciznost) u filteru za neželjenu poštu. Trošak određuje metriku.
Regresijska metrika
Ako su izlaz brojevi, koriste se različite metrike. MAE (srednja apsolutna greška): koliko procjene odstupaju od stvarnog prosjeka, u istoj jedinici (npr. "griješimo u prosjeku za 4.200 TL"). RMSE (korijenska srednja kvadratna greška): strože kažnjava velike greške i osjetljiv je na odstupanja. R² (R-kvadrat — koeficijent determinacije): koliki dio varijabilnosti u cilju objašnjava model (blizu 1 je dobro, 0 je jednako loše kao predviđanje srednje vrijednosti, negativno je još gore).
Najpodmukla zamka: preučenje
Preopterećenje – gdje model pamti podatke o obuci, ali ne uspijeva na novim podacima – najčešća je greška u nauci o podacima. Simptom je jasan: model je odličan na setu za obuku (98%), loš na test setu (72%). Model je upamtio šum tog konkretnog uzorka, a ne stvarni obrazac u podacima. Postoji i suprotno: nedovoljna oprema - model je loš i u obuci i u testiranju jer je previše jednostavan da bi se uhvatio obrazac.
Načini borbe protiv prekomjernog učenja: pojednostavljivanje modela, više podataka, regularizacija — matematička kočnica koja sprječava da model postane previše složen — i što je najvažnije, unakrsna validacija.
Unakrsna provjera: nemojte vjerovati jednom oknu
Jedna jedinica za obuku/testiranje može biti srećna ili nesrećna; Možete dobiti visoke ocjene za set za testiranje samo zato što je taj uzorak lak. Unakrsna validacija (skraćeno CV) rješava ovo. Najčešći oblik je k-fold CV: podaci su podijeljeni na k dijelova (npr. 5); U svakoj rundi jedan dio je testiranje, a ostalo je trening; ovo se kotrlja 5 puta i 5 bodova se prosječuju. Tako ćete vidjeti da se performanse zasnivaju na prosjeku višestrukih podjela, a ne na jednom srećnom udjelu. Raspodjela bodova je također informativna: vrlo promjenjivi rezultati (85% na jednom spratu, 62% na drugom) ukazuju da je model nestabilan.
Normalni k-fold se ne koristi u vremenskim serijama (propušta budućnost); Umjesto toga, radite "ulančavanje naprijed" (podjela vremenskih serija): uvijek trenirate s prošlošću i testirate budućnost.
metrički
Vrsta problema
Kada je to bitno?
Preciznost
Klasifikacija
Ako su časovi uravnoteženi
Preciznost
Klasifikacija
Lažni alarm je skup
Osjetljivost (prisjećanje)
Klasifikacija
Ako je skupo propustiti
F1
Klasifikacija
Ako je potrebna ravnoteža
MAE
regresija
Tumačiva greška
RMSE
regresija
Ako su velike greške kritične
R²
regresija
moć objašnjenja
tri mini kofera
Slučaj 1 — Iluzija visoke preciznosti. Jedan model prevare pokazao je 99,2% tačnosti i tim je slavio. Gledajući matricu konfuzije, stvarna: stopa lažnih podataka u podacima bila je 0,8%; model nije uhvatio gotovo nijedan lažnjak, samo je rekao "sve jasno". Opoziv je bio 6%. Lekcija: gledajte na metriku, a ne na tačnost.
Slučaj 2 — Latentno preučenje. Jedan tim je isporučio i povećao XGBoost na 97% na setu za obuku. Testni set je bio 69%, ali niko nije pogledao. Model je propao u proizvodnji. Da je urađena unakrsna validacija, velika razlika između nabora (preučenosti) bila bi vidljiva od početka. Lekcija: vjerujte CV-u i rezultatu testa, a ne rezultatu obrazovanja.
Slučaj 3 — Lucky split. Jedan analitičar je bio oduševljen što je dobio 88% u jednoj podjeli. Kada je njegov kolega uradio petostruki CV, rezultati su bili 88%, 71%, 83%, 64%, 79% — prosek je 77%, ali je veoma promenljiv. Model je bio nestabilan; Jedini pretinac je zavaravao. Lekcija: pogledajte srednju vrijednost CV-a i distribuciju, a ne pojedinačnu kantu.
Četiri šablona za kopiranje
1) Potpuni izvještaj o klasifikaciji:
Imam obučeni model i set za testiranje. Generirajte: matricu konfuzije, preciznost, opoziv, F1 (za svaku klasu) i broj podrške. Ja zaključujem, ali na meni je: reći ću vam koja je metrika važna. Imajte na umu da tačnost može dovesti u zabludu sa neuravnoteženim podacima.
2) Kontrola prekomjernog učenja:
Odštampajte rezultate mog modela u setu TRAINING i TEST jedan pored drugog. Izračunajte razliku između njih i upozorite jer je velika razlika znak preteranog učenja. Ako je razlika velika, predložite regularizaciju ili pojednostavljenje.
3) Unakrsna validacija:
Izvršite 5-struku unakrsnu validaciju (za stratifikovanu, klasifikaciju). Ispišite rezultat, srednju vrijednost i standardnu devijaciju svakog pregiba. Ako su rezultati vrlo promjenjivi (visoki std), naznačite da je model nestabilan. Koristite cjevovode tako da se transformacije uče samo iz dijela za obuku na svakom sloju.
4) Poređenje osnovnog stanja:
Stavite metriku mog modela rame uz rame sa osnovnom linijom DummyClassifier. Da li model značajno nadmašuje osnovnu liniju? Ako ne prođe, jasno stavite do znanja da model ne dodaje nikakvu stvarnu vrijednost.
Slaba prompt / Jaka prompt
Slab upit:
Je li moj model dobar?
"Dobro" je nedefinisano; Nije jasno koja metrika, koji prag, koja osnovna linija. AI može dati jedan broj tačnosti i dovesti u zabludu.
Snažan upit:
Vaša uloga: asistent pri ocjenjivanju. Klasifikacija, neuravnoteženi podaci (12% pozitivnih). Prioritet: opoziv (ne propustiti pozitivne). Zadatak: (1) matrica konfuzije, (2) preciznost/poziv/F1, (3) 5-struka stratificirana CV srednja vrijednost i std, (4) DummyClassifier poređenje osnovne linije. Fokusirajte se na pamćenje i osnovnu razliku, a ne na preciznost. Komentirajte, ali ja donosim konačnu odluku.
Ovdje su metrički prioritet, CV i osnovno stanje jasni.
Uobičajene greške
- Pouzdanje u tačnost neuravnoteženih podataka. Preciznost od 99% možda uopšte neće obuhvatiti manjinsku klasu; Pogledajte matricu konfuzije.
- Samo gledam tvoj obrazovni rezultat. Visoko obrazovanje, nizak rezultat na testu je preučenje; Uvijek uporedite dva rezultata.
- Oslanjajući se na jedan pretinac. Srećna podjela dovodi u zabludu; Pogledajte srednju vrijednost i distribuciju s unakrsnom validacijom.
- Ne porediti sa osnovnom linijom. Ne možete reći "dobro" a da ne znate da li model nadmašuje glupog prediktora.
- Korištenje normalnog k-folda na vremenskoj seriji. Propušta budućnost; potrebna je podjela vremenske serije.
Savjet: Napišite tri broja pored svakog modela: rezultat treninga, prosjek unakrsne validacije i osnovni rezultat. Ovaj trio na prvi pogled otkriva pretjerano učenje (obuka >> CV) i podcjenjivanje (CV ≈ početna vrijednost).
Ukratko
Izgraditi model je lako, ali je teško procijeniti ga iskreno. U klasifikaciji, matrica konfuzije, preciznost i opoziv su mnogo informativniji od tačnosti; Cijena posla određuje koji je važan. MAE, RMSE i R² se koriste u regresiji. Najpodmukla zamka je prekomjerno učenje: uvijek uporedite trening i rezultat testa. Oslonite se na srednju vrijednost i distribuciju unakrsne validacije, a ne na jednu podjelu; Uporedite sve sa osnovnom linijom. AI sve to izračunava, ali na čovjeku je da odluči koju će metriku koristiti.
Zadatak aplikacije
Izdvojite matricu konfuzije, preciznost, opoziv i F1 za model klasifikacije; Zatim izvršite peterostruku unakrsnu validaciju i pogledajte distribuciju rezultata po preklopima. Na kraju, zapišite rezultat treninga, CV prosjek i osnovni rezultat jedan pored drugog. Komentirajte u jednoj rečenici da li vaš model preuči i da li prolazi osnovnu liniju.
kontrolna lista
- [ ] Da li sam pogledao stvarnu metriku posla (preciznost/poziv/F1 itd.) umjesto tačnosti?
- [ ] Jesam li ispitao matricu konfuzije?
- [ ] Da li sam uporedio rezultate treninga i testa i proverio da li sam preučen?
- [ ] Jesam li pogledao srednju vrijednost i distribuciju s unakrsnom validacijom?
- [ ] Da li sam uporedio model sa osnovnom linijom?