Jednotka 7 / 11

Hodnocení modelu: metriky, křížová validace a extrémní učení

zisky:

  • Schopnost vybrat a interpretovat klasifikační a regresní metriky (záměnná matice, přesnost/odvolání/F1, MAE/RMSE/R²) podle účelu práce
  • Schopnost odhalit přeučení porovnáním výsledků školení a testů a získat spolehlivý výkon pomocí křížové validace
  • Schopnost vyhodnotit, zda každý model přináší skutečnou hodnotu porovnáním se základní linií

Je snadné nastavit model; Je těžké poctivě změřit, zda to skutečně funguje. Předmětem této jednotky je nejdůležitější dovednost datového vědce: vyhodnocování modelu pomocí správných metrik, dosahování spolehlivého prediktivního výkonu a chycení nejzáludnější pasti: přeučení (memorování). AI počítá, interpretuje a porovnává metriky; ale je na člověku, aby rozhodl, která metrika je pro vaše podnikání správná a zda je model „dost dobrý“. Tým, který se dívá na špatnou metriku, může špatný model celé měsíce mylně považovat za „úspěch“.

Proč přesnost nestačí: matoucí matice

První metrikou, která mě při klasifikaci napadne, je přesnost (přesnost — celkový poměr správných předpovědí). Ale jak jsme viděli v Unit 6, přesnost je zavádějící s nevyváženými údaji. Lepším začátkem je matoucí matice — tabulka, která rozděluje předpovědi do čtyř přihrádek:

  • True positive (TP): Nazvali jsme fake to, co je skutečně fake. (dobré)
  • Pravda negativní (TN): Řekli jsme opravdu čisté. (dobré)
  • Falešně pozitivní (FP): Omylem jsme řekli, že ten čistý je falešný. (Falešný poplach)
  • Falešně negativní (FN): Chyběl nám falešný a nazvali jsme ho čistým. (Zmeškaná hrozba)

Z těchto čtyř polí se odvíjejí dvě klíčové metriky. Přesnost: "Kolik z toho, co nazývám falešným, je ve skutečnosti falešné?" — důležité, pokud jsou náklady na falešný poplach vysoké. Citlivost (připomenutí v angličtině): "Kolik skutečných padělků jsem chytil?" — důležité, když přehlédnutí hrozby je drahé. Tyto dva jsou často ve vzájemném rozporu: pokud snížíte práh a řeknete více „falešný“, zapamatování se zvýší, ale přesnost se sníží. Skóre F1 je vyrovnaný průměr (harmonický průměr) těchto dvou.

Pozor: Odpověď na otázku „Která metrika je důležitá“ je obchodní rozhodnutí, nikoli technické. Vynechání případu (nízká paměť) při screeningu rakoviny je katastrofální; Je nepříjemné poslat důležitý e-mail do spamu (nízká přesnost) ve spamovém filtru. Metriku určuje cena.

Regresní metriky

Pokud jsou výstupem čísla, použijí se různé metriky. MAE (střední absolutní chyba): jak moc se odhady odchylují od skutečného průměru ve stejné jednotce (např. „v průměru se mýlíme o 4 200 TL“). RMSE (Root Mean Squared Error): tvrději penalizuje velké chyby a je citlivý na odlehlé hodnoty. R² (R-squared — koeficient determinace): kolik variability v cíli model vysvětluje (blízká 1 je dobrá, 0 je stejně špatná jako předpovídání průměru, záporná je ještě horší).

Nejzákeřnější past: přeučení

Overfitting – kdy si model zapamatuje trénovací data, ale selže na nových datech – je nejčastější chybou ve vědě o datech. Symptom je jasný: model je skvělý na tréninkové sadě (98 %), špatný na testovací sadě (72 %). Model si zapamatoval šum tohoto konkrétního vzorku, nikoli skutečný vzor v datech. Existuje také opak: nedostatečná výbava – model je špatný jak v tréninku, tak při testování, protože je příliš jednoduché zachytit vzor.

Způsoby, jak bojovat proti přeučení: zjednodušení modelu, více dat, regularizace – matematická brzda, která brání tomu, aby se model stal příliš složitým – a co je nejdůležitější, křížová validace.

Křížové ověření: nedůvěřujte jednomu panelu

Jediný tréninkový/testovací modul může mít štěstí nebo smůlu; Můžete získat vysoké známky za testovací sadu jen proto, že vzorek je snadný. Křížová validace (zkráceně CV) to řeší. Nejběžnější forma je k-fold CV: data jsou rozdělena do k částí (např. 5); V každém kole je jedna část testovací a zbytek trénink; to se hodí 5krát a 5 skóre se zprůměruje. Uvidíte tedy, že výkon je založen na průměru více rozdělení, nikoli na jediném šťastném rozdělení. Rozdělení skóre je také informativní: velmi volatilní skóre (85 % na jednom patře, 62 % na druhém) naznačují, že model je nestabilní.

Normální k-násobek se v časových řadách nepoužívá (uniká budoucnost); Místo toho děláte „forward chaining“ (rozdělení časových řad): vždy trénujete s minulostí a testujete budoucnost.

metrický

Typ problému

Kdy na tom záleží?

Přesnost

Klasifikace

Pokud jsou třídy vyrovnané

Přesnost

Klasifikace

Falešný poplach je drahý

Citlivost (vyvolání)

Klasifikace

Pokud je to drahé minout

F1

Klasifikace

Pokud je potřeba rovnováha

MAE

regrese

Interpretovatelná chyba

RMSE

regrese

Pokud jsou velké chyby kritické

regrese

vysvětlovací schopnost

tři mini pouzdra

Případ 1 — Iluze vysoké přesnosti. Jeden model podvodu ukázal 99,2% přesnost a tým slavil. Když se podíváme na matici zmatků, skutečná: míra falešných údajů v datech byla 0,8 %; model nezachytil téměř žádné padělky, jen řekl "vše jasné". Odvolání bylo 6 %. Ponaučení: Dívejte se na metriky, ne na přesnost.

Případ 2 – Latentní přeučení. Jeden tým dodal a zvýšil XGBoost na 97 % v tréninkové sadě. Testovací soubor byl 69 %, ale nikdo se nedíval. Model se zhroutil ve výrobě. Pokud by byla provedena křížová validace, velký rozdíl mezi foldy (overlearning) by byl viditelný od začátku. Lekce: důvěřujte CV a skóre testu, ne skóre vzdělání.

Případ 3 – Šťastné rozdělení. Jeden analytik byl potěšen, že získal 88 % v jediném rozdělení. Když jeho kolega udělal pětinásobný životopis, skóre bylo 88 %, 71 %, 83 %, 64 %, 79 % — průměr je 77 %, ale je velmi kolísavý. Model byl nestabilní; Jediný oddíl byl zavádějící. Ponaučení: podívejte se na průměr CV a distribuci, ne na jednotlivé přihrádky.

Čtyři kopírovatelné šablony

1) Úplná klasifikační zpráva:

Mám natrénovaný model a testovací sadu. Generovat: matoucí matici, přesnost, odvolání, F1 (pro každou třídu) a počty podpory. Vyvozuji, ale je to na mně: řeknu vám, která metrika je důležitá. Pamatujte, že přesnost může být zavádějící s nevyváženými údaji.

2) Ovládání přeučení:

Vytiskněte si skóre mého modelu v sadě TRÉNING a TEST vedle sebe. Vypočítejte rozdíl mezi nimi a varujte, protože velký rozdíl je známkou přeučení. Pokud je rozdíl velký, navrhněte regularizaci nebo zjednodušení.

3) Křížové ověření:

Proveďte 5násobnou křížovou validaci (pro stratifikovanou klasifikaci). Vytiskněte skóre, průměr a standardní odchylku každého záhybu. Pokud jsou skóre velmi volatilní (vysoká std), označte, že model je nestabilní. Použijte potrubí tak, aby se transformace učily pouze z tréninkového kusu v každé vrstvě.

4) Porovnání výchozího stavu:

Položte metriku mého modelu vedle sebe se základní linií DummyClassifier. Překonává model výrazně základní linii? Pokud neprojde, dejte jasně najevo, že model nepřináší žádnou skutečnou hodnotu.

Slabá výzva / Silná výzva

Slabá výzva:

Je můj model dobrý?

"Dobrý" není definován; Není jasné, která metrika, jaká prahová hodnota, jaká základní linie. Umělá inteligence může poskytnout jediné číslo přesnosti a uvést v omyl.

Výkonná výzva:

Vaše role: asistent hodnocení. Klasifikace, nevyvážené údaje (12 % pozitivních). Priorita: odvolání (nechybějí pozitiva). Úkol: (1) matoucí matice, (2) přesnost/vyvolání/F1, (3) 5násobný stratifikovaný průměr CV a std, (4) srovnání základní linie DummyClassifier. Zaměřte se na zapamatování a základní rozdíl, nikoli na přesnost. Komentář, ale konečné rozhodnutí dělám já.

Zde je jasná priorita metriky, CV a základní podmínka.

Časté chyby

  • Důvěřovat přesnosti v nevyvážených datech. 99% přesnost nemusí vůbec zachytit menšinovou třídu; Podívejte se na matici zmatků.
  • Stačí se podívat na vaše vzdělání. Vysoké vzdělání, nízké skóre v testech znamená přeučení; Vždy porovnávejte dvě skóre.
  • Spoléhání na jeden oddíl. Šťastné rozdělení je zavádějící; Podívejte se na průměr a distribuci s křížovou validací.
  • Nesrovnává se se základní linií. Nemůžete říci „dobré“, aniž byste věděli, zda model překonává hloupý prediktor.
  • Použití normálního k-násobku na časové řadě. Uniká budoucnost; je vyžadováno rozdělení časové řady.
Tip: Napište tři čísla vedle každého modelu: tréninkové skóre, křížový ověřovací průměr a základní skóre. Tato trojice na první pohled odhalí přeučení (trénink >> CV) a podhodnocení (CV ≈ základní linie).

V souhrnu

Sestavit model je snadné, ale poctivě jej vyhodnotit je obtížné. V klasifikaci jsou matoucí matice, přesnost a zapamatovatelnost mnohem informativnější než přesnost; Cena práce určuje, která z nich je důležitá. V regresi se používají MAE, RMSE a R². Nejzákeřnější pastí je přeučení: vždy porovnávejte výsledky tréninku a testu. Spolehněte se na průměr a rozložení křížové validace, nikoli na jediné rozdělení; Porovnejte vše se základní linií. Umělá inteligence počítá všechny tyto hodnoty, ale je na člověku, aby se rozhodl, kterou metriku použije.

Aplikační úkol

Extrahujte matoucí matici, přesnost, vyvolání a F1 pro klasifikační model; Poté proveďte 5násobnou křížovou validaci a podívejte se na rozložení skóre mezi záhyby. Nakonec si vedle sebe zapište tréninkové skóre, průměr CV a základní skóre. Okomentujte jednou větou, zda se váš model přeučí a projde základní linií.

kontrolní seznam

  • [ ] Podíval jsem se na skutečnou metriku úlohy (přesnost/odvolání/F1 atd.) místo přesnosti?
  • [ ] Zkoumal jsem maturitní matici?
  • [ ] Porovnal jsem skóre školení a testů a zkontroloval(a) jsem přeučení?
  • [ ] Podíval jsem se na průměr a distribuci s křížovou validací?
  • [ ] Porovnal jsem model se základní linií?