Jednotka 3 / 11

Školenie a hodnotenie modelov: presné metriky, čestné porovnávanie

zisky:

  • Schopnosť vybrať si metriku vhodnú pre typ problému a obchodný kontext (PR-AUC/vyvolanie v nevyvážených údajoch, MAE/RMSE v regresii) a rozpoznať nadmerné/nedostatočné vzdelávanie
  • Schopnosť interpretovať každú metriku oproti základnej línii a merať odchýlky a oddeliť šum od pokroku pomocou krížovej validácie
  • Schopnosť hlásiť neoptimistické výsledky vyladením hyperparametrov s validačnou sadou a použitím testovacej sady až na konci

Modelový tréning (tréning: proces učenia sa vzorov z údajov) je najviditeľnejším, ale najviac zavádzajúcim krokom inžinierstva ML. Zdá sa, že poskytuje uspokojivé číslo ako „presnosť 95 %“. Zavádzajúce, pretože toto číslo je často správnou odpoveďou na nesprávnu otázku. V tejto časti sa o vzdelávaní a hodnotení diskutuje s inžinierskou disciplínou; Umelú inteligenciu využívame ako partnera v experimentálnom dizajne a rozhodnutie zakladáme na meraní.

Logika tréningového cyklu

Model sa učí vzor v údajoch minimalizovaním stratovej funkcie: funkcie, ktorá numericky meria chybu modelu. Optimalizačný algoritmus (napr. gradientový zostup) znižuje stratu úpravou parametrov krok za krokom. Cieľom nie je zapamätať si tréningové dáta, ale zovšeobecniť ich na bezprecedentné dáta.

Dve hlavné nebezpečenstvá:

  • Overfitting: Model si zapamätá tréningové dáta a na nových dátach zlyhá. Úspešnosť tréningu je vysoká, úspešnosť overovania nízka.
  • Underfiting: Model nedokáže zachytiť vzor; Úspešnosť školenia aj overovania je nízka.

Nájsť rovnováhu je umenie výchovy. Validačná sada je tu na to, aby monitorovala túto rovnováhu: ak úspešnosť validácie začína klesať, zatiaľ čo úspešnosť tréningu rastie, začalo sa preučenie.

Tip: Zaznamenajte stratu tréningu a overenia spolu v každom kroku. Bod, v ktorom sa tieto dve krivky začínajú rozchádzať, je miesto, kde začína preučenie a je tým správnym momentom na „skoré zastavenie“.

Metrický výber: najdôležitejšie rozhodnutie

Nesprávna metrika spôsobuje, že dobrý model vyzerá zle a zlý model vyzerá dobre. Problém určuje metriku:

  • Nevyvážená klasifikácia (jedna trieda je veľmi zriedkavá, napr. podvod): Presnosť je zavádzajúca. Model, ktorý hovorí „nazývajte všetko normálne“, získa presnosť 99 %, ale nezachytí ani jeden podvod. Namiesto toho sa používa presnosť (koľko z toho, čo som ulovil, je skutočne pozitívne), pripomenutie (koľko z toho, čo som chytil, je skutočne pozitívne) a ich vyváženie F1 alebo PR-AUC.
  • Vyvážená klasifikácia: Presnosť a ROC-AUC môžu byť vhodné.
  • Regresia (odhad počtu): MAE (priemerná absolútna chyba), RMSE (penalizuje veľké chyby), MAPE (percentuálna chyba).
  • Poradie/odporúčanie: NDCG, MRR, Recall@K.

Či je dôležitá presnosť alebo zapamätanie závisí od obchodného kontextu. Prioritou pri skríningu rakoviny je odvolanie (nevynechanie žiadneho pacienta); Dôležitá je presnosť v spamovom filtri (neodosielanie dôležitých e-mailov do spamu). Toto je obchodné rozhodnutie, nie technické, a robia ho spoločne inžinier a vlastník.

Slabá výzva / Silná výzva

Slabá výzva: "Vyhodnoťte výkon môjho modelu, presnosť 0,97."

Výkonná výzva: "Mám model detekcie podvodov; miera pozitívnej triedy je 1,5 %. Presnosť je hlásená ako 0,97. Vysvetlite, prečo môže byť táto metrika zavádzajúca, povedzte mi, ktoré metriky (presnosť, zapamätanie, PR-AUC) by som mal uprednostniť a prečo. Vypočítajte si tiež, s akou presnosťou by bol základný model 'zavolať všetko negatívne' na tieto údaje, aby som mohol vidieť skutočnú pridanú hodnotu."

Rozdiel: výkonná výzva dáva pomer triedy a obchodný kontext; požaduje tiež porovnanie základného modelu – to je najdôležitejšia kotva pre to, či je metrika zmysluplná.

Východiskový stav: metrika bez porovnania nemá zmysel

Metrika sama o sebe nie je dobrá alebo zlá; Je to dobré alebo zlé podľa základného modelu. Základným modelom je najjednoduchšie riešenie, ktoré vás napadne: „vždy povedzte väčšinovej triede“, „zopakujte hodnotu z minulého týždňa“, „uhádnite priemer“. Ak váš model nemôže jednoznačne prejsť týmto jednoduchým riešením, všetka zložitosť je zbytočná.

Pozor: Veta „Môj model má 85% presnosť“ sama o sebe nič nehovorí. Ak už základný model získa 84 %, váš model je takmer bezcenný; Ak základný model získa 50 %, váš model je dokonalý. Vždy hovorte o základnom modeli.

Krížová validácia a dôvera

Jediný tréning/testovanie môže byť spôsobené náhodou. Krížová validácia: rozdelenie údajov do k častí a postupné testovanie každej časti ukazuje, ako stabilný je výkon. Pri 5-násobnom krížovom overení získate päť rôznych skóre; Dôležitý je ich priemer a štandardná odchýlka. Ak je priemer 80 %, ale odchýlka je ±12 %, váš model je nestabilný – v ďalšej dávke údajov sa môže správať veľmi odlišne.

To je dôležité aj pre „porovnanie dvoch modelov“. Ak Model A získal 81 % a Model B 82 %, je B naozaj lepší? Ak je odchýlka ±3 %, tento rozdiel môže predstavovať šum. Pred rozhodnutím zvážte, či je rozdiel významný.

Ladenie hyperparametrov: s validáciou, nie testovaním

Hyperparametre (nastavenia manuálne určené pred tréningom – rýchlosť učenia, hĺbka stromu atď.) sa nastavujú pomocou overovacej sady. Testovacia súprava sa použije iba na konci, raz. Ak vyberiete hyperparametre pri pohľade na testovaciu sadu, testovacia sada bude kontaminovaná a výkon, ktorý uvádzate, bude optimistický, čo v skutočnosti neplatí.

Umelá inteligencia je dobrým pomocníkom pri návrhu vyhľadávacieho priestoru hyperparametrov a písaní vyhľadávacieho kódu (vyhľadávanie v mriežke, náhodné vyhľadávanie, bayesovská optimalizácia). Ale stále rozhodujete o tom, "ktorú metriku budeme optimalizovať?"

tri mini prípady

Prípad 1 – Pasca na presnosť. Lekársky tím bol hrdý na model, ktorý odhalil zriedkavé ochorenie: presnosť 98 %. Keď sa uskutočnilo porovnanie základného modelu, ukázala sa pravda: keďže miera ochorenia bola 2 %, model, ktorý hovoril, že „všetci sú zdraví“, tiež získal 98 %. Model si spomínal len na 11 % – chýbala väčšina pacientov. Po konverzii metriky na PR-AUC sa zmeral skutočný výkon a model sa prepracoval.

Prípad 2 – Chybný zvuk za pokrok. Tím strávil mesiace zlepšovaním modelu z 86,2 % na 86,9 %. Krížová validácia ukázala, že odchýlka bola ± 1,4 % – takže „zlepšenie“ o 0,7 bodu bolo štatistickým šumom. Tým premrhali tri týždne na neskutočných zárobkoch. Ponaučenie: nevyhlasujte víťazstvo bez toho, aby ste si overili, že zlepšenie je väčšie ako odchýlka.

Prípad 3 – Kontaminácia testovacej súpravy. Inžinier sa opakovane pozrel na testovaciu súpravu, aby vybral najlepšie hyperparametre. 91%, ktoré uviedla, kleslo na 83% vo výrobe. Prečo: nevedomky si podľa toho vybral model tak, že sa znova a znova pozeral na testovaciu sadu (preučenie sa na testovacej sade). Hlásený a skutočný výkon sa prekrývali, keď sa použila samostatná overovacia sada.

Kopírovateľné šablóny

Pomôžte mi vybrať správnu metriku pre tento problém klasifikácie. Problém: [čo sa predpovedá] Rozdelenie tried: [kladná miera

Vyhodnoťte porovnanie nasledujúcich dvoch modelov.Krížová validácia modelu A: [zoznam skóre]Krížová validácia modelu B: [zoznam skóre]Vypočítajte priemer a štandardnú odchýlku. Je rozdiel štatisticky významný alebo je to len šum v rámci odchýlky? Ktorý by ste mi odporučili vybrať a prečo?

Skontrolujte tento tréningový kód, či neobsahuje nasledovné: 1) Sú hyperparametre vybrané pomocou testovacej sady alebo sady validácie?2) Monitoruje sa včasné zastavenie pomocou správnej sady?3) Existujú nejaké známky preučenia (rozdiel medzi tréningom a stratou validácie)? Kód: [kód]

Ktoré z MAE, RMSE a MAPE by som mal nahlásiť pre tento regresný problém?Mierka cieľovej premennej: [rozsah]Sú veľké chyby neprimerane zlé (RMSE) alebo sú všetky rovnaké (MAE)?Existujú hodnoty blízke nule (skresľujú MAPE)?Navrhnite so stručným odôvodnením.

Tabuľka výberu metrík

Typ problému

Vhodná metrika

Aby sa tomu zabránilo

Prečo?

Nevyvážená klasifikácia

PR-AUC, F1, odvolanie

Presnosť

Trieda väčšiny zvyšuje metriku

Vyvážená klasifikácia

Presnosť, ROC-AUC

Spoľahlivý vo vyvážených údajoch

Regresia (významná odľahlá hodnota)

RMSE

MAPE (ak je nula)

Trestá veľké chyby

Regresia (rovnaká hmotnosť)

MAE

Ľahko interpretovateľné

Hodnotenie/odporúčanie

NDCG, Recall@K

Presnosť

Poriadok je dôležitý

Časté chyby

  • Použitie presnosti na nevyvážené údaje. Najčastejšia metrická chyba.
  • Neporovnávanie základných modelov. Metrika tým stráca svoj význam.
  • Pri pohľade na testovaciu množinu hyperparametrov. Optimistický, nereálny výsledok.
  • Spoliehanie sa na jednu priehradku. Bez krížovej validácie neuvidíte zaujatosť.
  • Zámena hluku za pokrok. Malé „vylepšenia“ z deviácie sú väčšinou šťastím.
  • Ignorovanie obchodného kontextu. Váha presnosti/stiahnutia je obchodným rozhodnutím.

V súhrne

Skutočnou zručnosťou v modelovom tréningu nie je vyprodukovať vysoké číslo, ale vedieť, čo to číslo znamená. Problém a obchodný kontext určujú správnu metriku; interpretovať každú metriku podľa základného modelu; zmerajte odchýlku krížovým overením a nezamieňajte šum za pokrok; Testovaciu súpravu použite iba na konci, raz. Umelá inteligencia je vaším partnerom pri navrhovaní experimentov, ale rozhodnutie „dosť dobré“ je na vás a vás.

Aplikačná úloha

Pre model klasifikácie: (1) napíšte rozdelenie tried, (2) vytvorte vhodný základný model a zmerajte jeho skóre, (3) vyhodnoťte svoj model pomocou 5-násobnej krížovej validácie a uveďte priemer a štandardnú odchýlku, (4) namiesto presnosti vypočítajte metriku vhodnú pre daný problém (napr. PR-AUC). Zapíšte si, či váš model prevyšuje základný model s veľkým náskokom bez zaujatosti.

kontrolný zoznam

  • [ ] Metriku som zvolil na základe typu problému a obchodného kontextu.
  • [ ] Postavil som základný model a porovnal som ho s ním.
  • [ ] Uviedol som priemer a odchýlku s krížovou validáciou.
  • [ ] Potvrdil som, že zlepšenie je väčšie ako odchýlka.
  • [ ] Vybral som hyperparametre s overovacím súborom.
  • [ ] Testovaciu sadu som použil iba raz, úplne na konci.