zisky:
- Schopnosť vybrať a interpretovať klasifikačné a regresné metriky (zámenná matica, presnosť/odvolanie/F1, MAE/RMSE/R²) podľa účelu práce
- Schopnosť odhaliť preučenie porovnaním výsledkov školenia a testov a získať spoľahlivý výkon pomocou krížovej validácie
- Schopnosť vyhodnotiť, či každý model prináša skutočnú hodnotu porovnaním so základnou líniou
Je ľahké nastaviť model; Je ťažké poctivo zmerať, či to skutočne funguje. Predmetom tejto jednotky je najdôležitejšia zručnosť dátového vedca: vyhodnotenie modelu pomocou správnych metrík, dosiahnutie spoľahlivého prediktívneho výkonu a chytenie najzákernejšej pasce: preučenie (zapamätanie). AI počíta, interpretuje a porovnáva metriky; ale je na človeku, aby sa rozhodol, ktorá metrika je pre vaše podnikanie správna a či je model „dosť dobrý“. Tím, ktorý sa pozerá na nesprávnu metriku, si môže mýliť zlý model celé mesiace ako „úspech“.
Prečo presnosť nestačí: matica zmätku
Prvá metrika, ktorá príde na myseľ pri klasifikácii, je presnosť (presnosť — celkový pomer správnych predpovedí). Ako sme však videli v 6. bloku, presnosť pri nevyvážených údajoch zavádza. Lepším začiatkom je matica zmätku – tabuľka, ktorá rozdeľuje predpovede do štyroch priehradiek:
- True positive (TP): Falošné sme nazývali to, čo je skutočne falošné. (dobre)
- Pravda negatívne (TN): Povedali sme naozaj čisté. (dobre)
- Falošne pozitívny (FP): Omylom sme povedali, že ten čistý je falošný. (Falošný poplach)
- Falošne negatívne (FN): Zmeškali sme falošný a nazvali sme ho čistým. (Zmeškaná hrozba)
Z týchto štyroch polí sú odvodené dve kľúčové metriky. Presnosť: "Koľko z toho, čo nazývam falošné, je v skutočnosti falošné?" — dôležité, ak sú náklady na falošný poplach vysoké. Citlivosť (pripomeňme v angličtine): "Koľko skutočných falzifikátov som zachytil?" — dôležité, keď zmeškanie hrozby je drahé. Tieto dve veci sú často vo vzájomnom rozpore: ak znížite prahovú hodnotu a viac poviete „falošné“, zapamätanie sa zvýši, ale presnosť sa zníži. Skóre F1 je vyrovnaný priemer (harmonický priemer) týchto dvoch.
Pozor: Odpoveď na otázku „Ktorá metrika je dôležitá“ je obchodné rozhodnutie, nie technické. Chýbajúci prípad (nízke vybavovanie) pri skríningu rakoviny je katastrofálny; Je nepríjemné posielať dôležitý e-mail do spamu (nízka presnosť) vo filtri nevyžiadanej pošty. Cena určuje metriku.
Regresné metriky
Ak sú výstupom čísla, použijú sa rôzne metriky. MAE (stredná absolútna chyba): o koľko sa odhady odchyľujú od skutočného priemeru v rovnakej jednotke (napr. „v priemere sa mýlime o 4 200 TL“). RMSE (Root Mean Squared Error): Prísnejšie penalizuje veľké chyby a je citlivý na odľahlé hodnoty. R² (R-squared – koeficient determinácie): koľko variability v cieli model vysvetľuje (blízka 1 je dobrá, 0 je taká zlá ako predpovedanie priemeru, záporná je ešte horšia).
Najzákernejšia pasca: preučenie
Prepracovanie – kde si model zapamätá tréningové údaje, ale zlyhá na nových údajoch – je najčastejšou chybou vo vede o údajoch. Symptóm je jasný: model je skvelý na tréningovej súprave (98 %), zlý na testovacej súprave (72 %). Model si zapamätal šum tejto konkrétnej vzorky, nie skutočný vzor v údajoch. Existuje aj opak: nedostatočná výbava – model je zlý v tréningu aj testovaní, pretože je príliš jednoduché zachytiť vzor.
Spôsoby boja proti nadmernému učenia sa: zjednodušenie modelu, viac údajov, regularizácia – matematická brzda, ktorá zabraňuje tomu, aby bol model príliš zložitý – a čo je najdôležitejšie, krížová validácia.
Krížová validácia: neverte jednému panelu
Jeden tréningový/testovací modul môže mať šťastie alebo smolu; Môžete získať vysoké známky za testovaciu sadu len preto, že vzorka je jednoduchá. Krížová validácia (skrátene CV) to rieši. Najbežnejšou formou je k-násobný CV: údaje sú rozdelené na k častí (napr. 5); V každom kole je jedna časť testovacia a zvyšok tréning; toto sa hodí 5-krát a 5 skóre sa spriemeruje. Uvidíte teda, že výkon je založený na priemere viacerých rozdelení, nie na jednom šťastnom rozdelení. Rozdelenie skóre je tiež informatívne: veľmi nestále skóre (85 % na jednom poschodí, 62 % na druhom poschodí) naznačuje, že model je nestabilný.
Normálny k-násobok sa v časových radoch nepoužíva (úniky do budúcnosti); Namiesto toho robíte „forward chaining“ (rozdelenie časových radov): vždy trénujete s minulosťou a testujete budúcnosť.
metrický
Typ problému
Kedy na tom záleží?
Presnosť
Klasifikácia
Ak sú triedy vyrovnané
Presnosť
Klasifikácia
Falošný poplach je drahý
Citlivosť (vyvolanie)
Klasifikácia
Ak je to drahé minúť
F1
Klasifikácia
Ak je potrebná rovnováha
MAE
regresia
Interpretovateľná chyba
RMSE
regresia
Ak sú veľké chyby kritické
R²
regresia
vysvetľovacia schopnosť
tri mini prípady
Prípad 1 – Ilúzia vysokej presnosti. Jeden model podvodu ukázal presnosť 99,2 % a tím oslavoval. Pri pohľade na maticu zmätku bola skutočná: falošná miera v údajoch 0,8 %; model nezachytil takmer žiadne falzifikáty, len povedal „všetko jasné“. Spätnosť bola 6 %. Ponaučenie: pozerajte sa na metriky, nie na presnosť.
Prípad 2 – Latentné preučenie. Jeden tím dodal a zvýšil XGBoost na 97 % na tréningovej súprave. Testovací súbor bol 69%, ale nikto sa nepozrel. Model vo výrobe skolaboval. Ak by sa vykonala krížová validácia, veľký rozdiel medzi záhybmi (overlearning) by bol viditeľný od začiatku. Lekcia: dôverujte životopisu a skóre testu, nie skóre vzdelania.
Prípad 3 – Šťastný rozchod. Jeden analytik bol potešený, že získal 88 % v jednom rozdelení. Keď jeho kolega urobil 5-násobný životopis, skóre bolo 88 %, 71 %, 83 %, 64 %, 79 % – priemer je 77 %, ale je veľmi nestály. Model bol nestabilný; Jediná priehradka bola zavádzajúca. Ponaučenie: pozrite sa na priemer a distribúciu CV, nie na jednotlivé zásobníky.
Štyri kopírovateľné šablóny
1) Úplná klasifikačná správa:
Mám natrénovaný model a testovaciu sadu. Generovanie: matice zmätku, presnosti, odvolania, F1 (pre každú triedu) a podpory. Usudzujem, ale je to na mne: poviem vám, ktorá metrika je dôležitá. Upozorňujeme, že presnosť môže byť pri nevyvážených údajoch zavádzajúca.
2) Kontrola preučenia:
Vytlačte si skóre môjho modelu v súprave TRÉNING a TEST vedľa seba. Vypočítajte rozdiel medzi nimi a varujte, pretože veľký rozdiel je znakom preučenia. Ak je rozdiel veľký, navrhnite úpravu alebo zjednodušenie.
3) Krížová validácia:
Vykonajte 5-násobnú krížovú validáciu (pre stratifikovanú klasifikáciu). Vytlačte skóre, priemer a štandardnú odchýlku každého záhybu. Ak sú skóre veľmi volatilné (vysoká štandardná hodnota), označte, že model je nestabilný. Použite potrubia tak, aby sa transformácie naučili iba z tréningovej časti v každej vrstve.
4) Porovnanie základnej línie:
Položte metriku môjho modelu vedľa seba so základnou líniou DummyClassifier. Prekračuje model výrazne základnú líniu? Ak to neprejde, dajte jasne najavo, že model neprináša žiadnu skutočnú hodnotu.
Slabá výzva / Silná výzva
Slabá výzva:
Je môj model dobrý?
"Dobré" nie je definované; Nie je jasné, ktorá metrika, ktorá hranica, ktorá základná línia. AI môže poskytnúť jediné číslo presnosti a zavádzať.
Výkonná výzva:
Vaša úloha: asistent hodnotenia. Klasifikácia, nevyvážené údaje (12 % pozitívnych). Priorita: odvolanie (nevynechávajúc pozitíva). Úloha: (1) matica zmätku, (2) presnosť/vyvolanie/F1, (3) 5-násobný stratifikovaný priemer CV a std, (4) porovnanie základnej línie DummyClassifier. Zamerajte sa na zapamätanie a rozdiel základnej línie, nie na presnosť. Komentujte, ale konečné rozhodnutie robím ja.
Tu je jasná priorita metriky, CV a základná podmienka.
Časté chyby
- Dôverovať presnosti v nevyvážených údajoch. 99% presnosť nemusí vôbec zachytiť menšinovú triedu; Pozrite sa na maticu zmätku.
- Stačí sa pozrieť na svoje vzdelanie. Vysoké vzdelanie, nízke skóre v testoch znamená preučenie; Vždy porovnávajte dve skóre.
- Spoliehanie sa na jednu priehradku. Šťastné rozdelenie je zavádzajúce; Pozrite sa na priemer a rozdelenie pomocou krížovej validácie.
- Neporovnáva sa so základnou líniou. Nemôžete povedať „dobré“ bez toho, aby ste vedeli, či model porazí hlúpy prediktor.
- Použitie normálneho k-násobku na časových radoch. Uniká budúcnosť; vyžaduje sa rozdelenie časových radov.
Tip: Napíšte tri čísla vedľa každého modelu: tréningové skóre, krížový overovací priemer a základné skóre. Táto trojica na prvý pohľad odhalí preučenie (tréning >> CV) a podhodnotenie (CV ≈ základná línia).
V súhrne
Postaviť model je jednoduché, ale úprimne ho zhodnotiť je ťažké. Pri klasifikácii je matica zmätku, presnosť a vybavovanie oveľa informatívnejšie ako presnosť; Cena práce určuje, ktorá z nich je dôležitá. V regresii sa používajú MAE, RMSE a R2. Najzákernejšou pascou je preučenie: vždy porovnávajte tréningové a testovacie skóre. Spoľahnite sa na priemer a rozdelenie krížovej validácie, nie na jedno rozdelenie; Porovnajte všetko so základnou líniou. AI to všetko vypočíta, ale je na človeku, aby sa rozhodol, ktorú metriku použije.
Aplikačná úloha
Extrahujte zmätočnú maticu, presnosť, vyvolanie a F1 pre model klasifikácie; Potom vykonajte 5-násobnú krížovú validáciu a pozrite sa na rozdelenie skóre medzi záhybmi. Nakoniec si vedľa seba zapíšte tréningové skóre, priemer CV a základné skóre. Okomentujte jednou vetou, či sa váš model preučuje a prekračuje základnú líniu.
kontrolný zoznam
- [ ] Pozrel som sa na skutočnú metriku úlohy (presnosť/vyvolanie/F1 atď.) namiesto presnosti?
- [ ] Preskúmal som maticu zmätku?
- [ ] Porovnal som skóre školenia a testov a skontroloval som, či sa nepreučujem?
- [ ] Pozrel som sa na priemer a distribúciu s krížovou validáciou?
- [ ] Porovnal som model so základnou líniou?