zisky:
- Schopnost vybrat si metriku vhodnou pro typ problému a obchodní kontext (PR-AUC/vyvolání v nevyvážených datech, MAE/RMSE v regresi) a rozpoznat nadměrné/nedostatečné učení
- Schopnost interpretovat každou metriku proti základní linii a měřit odchylky a oddělit šum od pokroku pomocí křížové validace
- Schopnost hlásit neoptimistické výsledky vyladěním hyperparametrů s validační sadou a použitím testovací sady pouze na konci
Modelový trénink (trénink: proces učení vzorů z dat) je nejviditelnější, ale nejvíce zavádějící krok inženýrství ML. Zdá se, že poskytuje uspokojivé číslo jako „přesnost 95 %“. Zavádějící, protože toto číslo je často správnou odpovědí na špatnou otázku. V tomto bloku jsou vzdělávání a hodnocení diskutovány s inženýrskou disciplínou; Umělou inteligenci využíváme jako partnera v experimentálním designu a rozhodnutí zakládáme na měření.
Logika tréninkového cyklu
Model se učí vzor v datech minimalizací ztrátové funkce: funkce, která numericky měří chybu modelu. Optimalizační algoritmus (např. gradientní klesání) snižuje ztráty tím, že upravuje parametry krok za krokem. Cílem není zapamatovat si trénovací data, ale zobecnit je na bezprecedentní data.
Dvě hlavní nebezpečí:
- Overfitting: Model si zapamatuje tréninková data a na nových datech selže. Úspěšnost tréninku je vysoká, úspěšnost ověření nízká.
- Underfitting: Model nemůže zachytit vzor; Úspěšnost školení i ověřování je nízká.
Najít rovnováhu je uměním výchovy. Validační sada je zde proto, aby monitorovala tuto rovnováhu: pokud úspěšnost validace začne klesat, zatímco úspěšnost tréninku roste, začalo přeučení.
Tip: Zakreslete ztrátu školení a ověřování společně v každém kroku. Bod, ve kterém se obě křivky začnou rozcházet, je místem, kde začíná přeučení a je tím správným okamžikem „předčasného zastavení“.
Metrický výběr: nejkritičtější rozhodnutí
Nesprávná metrika způsobuje, že dobrý model vypadá špatně a špatný model vypadá dobře. Problém určuje metriku:
- Nevyvážená klasifikace (jedna třída je velmi vzácná, např. podvod): Přesnost je zavádějící. Model, který říká „nazývejte vše normální“, získá 99% přesnost, ale nezachytí jediný podvod. Místo toho se používá přesnost (kolik z toho, co jsem chytil, je skutečně pozitivní), zapamatování (kolik z toho, co jsem chytil, je skutečně pozitivní) a jejich vyvážení F1 nebo PR-AUC.
- Vyvážená klasifikace: Přesnost a ROC-AUC mohou být vhodné.
- Regrese (odhad počtu): MAE (střední absolutní chyba), RMSE (penalizuje velké chyby), MAPE (procentuální chyba).
- Hodnocení/doporučení: NDCG, MRR, Recall@K.
Zda je důležitá přesnost nebo vyvolání, závisí na obchodním kontextu. Při screeningu rakoviny je prioritou stažení (nepostrádat žádného pacienta); Důležitá je přesnost ve spamovém filtru (nezasílání důležitých e-mailů do spamu). Toto je obchodní rozhodnutí, nikoli technické, a je učiněno společně inženýrem a vlastníkem.
Slabá výzva / Silná výzva
Slabá výzva: "Vyhodnoťte výkon mého modelu, přesnost 0,97."
Výkonná výzva: "Mám model detekce podvodů; kladná třída je 1,5 %. Přesnost je hlášena jako 0,97. Vysvětlete, proč může být tato metrika zavádějící, řekněte mi, které metriky (přesnost, zapamatování, PR-AUC) bych měl preferovat a proč. Také si spočítejte, jak přesný by na těchto datech byl základní model ‚volej vše negativní‘, abych mohl vidět skutečnou přidanou hodnotu."
Rozdíl: výkonná výzva dává poměr třídy a obchodní kontext; také požaduje srovnání základního modelu – to je nejdůležitější kotva pro to, zda je metrika smysluplná.
Baseline: metrika bez srovnání nemá smysl
Metrika sama o sobě není dobrá nebo špatná; Je to dobré nebo špatné podle základního modelu. Základní model je nejjednodušší řešení, které mě napadá: „vždy řekni většinové třídě“, „zopakuj hodnotu z minulého týdne“, „uhádni průměr“. Pokud váš model nemůže jasně projít tímto jednoduchým řešením, veškerá složitost je k ničemu.
Pozor: Věta "Můj model je 85% přesný" sama o sobě nic neříká. Pokud již základní model získá 84 %, váš model je téměř bezcenný; Pokud základní model získá 50 %, váš model je perfektní. Vždy mluvte o základním modelu.
Křížová validace a důvěra
Jediný trénink/testovací rozdělení může být způsobeno náhodou. Křížová validace: rozdělení dat do k částí a následné testování každé části ukazuje, jak stabilní je výkon. V 5násobném křížovém ověření získáte pět různých skóre; Důležitý je jejich průměr a směrodatná odchylka. Pokud je průměr 80 %, ale odchylka je ±12 %, váš model je nestabilní – v další dávce dat se může chovat velmi odlišně.
To je také důležité pro „srovnání dvou modelů“. Pokud Model A získal 81 % a Model B 82 %, je B skutečně lepší? Pokud je odchylka ±3 %, může tento rozdíl představovat šum. Před rozhodnutím zvažte, zda je rozdíl významný.
Ladění hyperparametrů: s ověřováním, ne testováním
Hyperparametry (nastavení ručně určená před tréninkem – rychlost učení, hloubka stromu atd.) se nastavují pomocí ověřovací sady. Testovací sada se použije pouze na konci, jednou. Pokud vyberete hyperparametry pohledem na testovací sadu, testovací sada bude kontaminovaná a výkon, který uvádíte, bude optimistický, což ve skutečnosti není pravda.
Umělá inteligence je dobrým pomocníkem při návrhu vyhledávacího prostoru hyperparametrů a psaní vyhledávacího kódu (grid search, náhodné vyhledávání, Bayesovská optimalizace). Ale stále rozhodujete, "kterou metriku budeme optimalizovat?"
tři mini pouzdra
Případ 1 – Past přesnosti. Lékařský tým byl hrdý na model, který detekoval vzácné onemocnění: 98% přesnost. Když bylo provedeno srovnání základního modelu, ukázala se pravda: protože míra onemocnění byla 2 %, model, který říkal, že „všechny jsou zdravé“, získal také 98 %. Model si vzpomněl pouze na 11 % – chybí většina pacientů. Jakmile byla metrika převedena na PR-AUC, byl změřen skutečný výkon a model byl přepracován.
Případ 2 – Záměna hluku za pokrok. Tým strávil měsíce vylepšováním modelu z 86,2 % na 86,9 %. Křížová validace ukázala, že zkreslení bylo ±1,4 % – takže „zlepšení“ o 0,7 bodu bylo statistickým šumem. Tým promarnil tři týdny neskutečnými výdělky. Ponaučení: nevyhlašujte vítězství, aniž byste si ověřili, že zlepšení je větší než odchylka.
Případ 3 – Kontaminace testovací sady. Inženýr opakovaně prohlížel testovací sadu, aby vybral nejlepší hyperparametry. Těch 91 %, které uvedla, kleslo na 83 % ve výrobě. Proč: nevědomky si podle toho vybral model tak, že se znovu a znovu díval na testovací sadu (přeučení na testovací sadě). Při použití samostatné ověřovací sady se hlášený a skutečný výkon překrývaly.
Kopírovatelné šablony
Pomozte mi vybrat správnou metriku pro tento klasifikační problém. Problém: [co se předpovídá] Rozdělení tříd: [kladná míra
Vyhodnoťte srovnání následujících dvou modelů. Křížová validace modelu A: [seznam skóre] Křížová validace modelu B: [seznam skóre] Vypočítejte průměr a směrodatnou odchylku. Je rozdíl statisticky významný nebo je to jen šum v rámci odchylky? Kterou byste mi doporučili vybrat a proč?
Zkontrolujte tento tréninkový kód pro následující: 1) Jsou hyperparametry vybrány pomocí testovací sady nebo validační sady?2) Je včasné zastavení monitorováno se správnou sadou?3) Existují nějaké známky přeučení (rozdíl mezi tréninkem/ztrátou validace)?Kód: [kód]
Které z MAE, RMSE a MAPE bych měl hlásit pro tento regresní problém?Měřítko cílové proměnné: [rozsah]Jsou velké chyby nepřiměřeně špatné (RMSE), nebo jsou všechny stejné (MAE)?Existují hodnoty blízké nule (zkreslují MAPE)?Navrhněte se stručným odůvodněním.
Metrická výběrová tabulka
Typ problému
Vhodná metrika
Aby se tomu zabránilo
Proč?
Nevyvážená klasifikace
PR-AUC, F1, odvolání
Přesnost
Většinová třída navyšuje metriku
Vyvážená klasifikace
Přesnost, ROC-AUC
—
Spolehlivý ve vyvážených datech
Regrese (významná odlehlá hodnota)
RMSE
MAPE (pokud je nula)
Trestá velké chyby
Regrese (stejná váha)
MAE
—
Snadno interpretovatelné
Hodnocení/doporučení
NDCG, Recall@K
Přesnost
Pořádek je důležitý
Časté chyby
- Použití přesnosti na nevyvážených datech. Nejčastější metrická chyba.
- Neprovádím srovnání základních modelů. Tím ztrácí metrika svůj význam.
- Při pohledu na testovací sadu hyperparametrů. Optimistický, nereálný výsledek.
- Spoléhání na jeden oddíl. Bez křížového ověření neuvidíte zkreslení.
- Záměna hluku za pokrok. Malá „vylepšení“ z deviace jsou většinou štěstí.
- Ignorování obchodního kontextu. Váha přesnosti/stažení je obchodní rozhodnutí.
V souhrnu
Skutečnou dovedností v modelovém tréninku není vytvořit vysoké číslo, ale vědět, co to číslo znamená. Problém a obchodní kontext určují správnou metriku; interpretovat každou metriku podle základního modelu; změřte zkreslení pomocí křížové validace a nezaměňujte šum za pokrok; Testovací sadu použijte pouze na konci, jednou. Umělá inteligence je vaším partnerem při navrhování experimentů, ale rozhodnutí „dost dobré“ je na vás a vás.
Aplikační úkol
Pro model klasifikace: (1) napište rozdělení tříd, (2) vytvořte vhodný základní model a změřte jeho skóre, (3) vyhodnoťte svůj model pomocí 5násobné křížové validace a uveďte průměr a směrodatnou odchylku, (4) místo přesnosti vypočtěte metriku vhodnou pro daný problém (např. PR-AUC). Zapište si, zda váš model překonává základní model s velkým náskokem bez zkreslení.
kontrolní seznam
- [ ] Metriku jsem zvolil na základě typu problému a obchodního kontextu.
- [ ] Postavil jsem základní model a porovnal s ním.
- [ ] Uvedl jsem průměr a odchylku s křížovou validací.
- [ ] Potvrdil jsem, že zlepšení je větší než odchylka.
- [ ] Vybral jsem hyperparametry s validační sadou.
- [ ] Testovací sadu jsem použil pouze jednou, úplně na konci.