Nyereség:
- Képes a probléma típusának és üzleti környezetének megfelelő mérőszám kiválasztására (PR-AUC/visszahívás kiegyensúlyozatlan adatokban, MAE/RMSE regresszióban), és felismeri a túl/alul tanulást
- Lehetőség az egyes mutatók egy alapvonalhoz viszonyított értelmezésére, az eltérés mérésére, valamint a zaj és a haladás szétválasztására keresztellenőrzéssel
- Nem optimista eredmények jelentésének lehetősége a hiperparaméterek érvényesítési készlettel történő hangolásával és a tesztkészlet csak a végén történő használatával
A modellképzés (tréning: az adatokból minták megtanulásának folyamata) az ML tervezés leglátványosabb, de leginkább félrevezető lépése. Úgy tűnik, mert kielégítő számot ad, például "95%-os pontosság". Félrevezető, mert ez a szám gyakran a megfelelő válasz a rossz kérdésre. Ebben az egységben az oktatást és az értékelést tárgyalják a mérnöki tudományággal; A mesterséges intelligenciát partnerként használjuk a kísérleti tervezésben, és a döntést mérésre alapozzuk.
A képzési ciklus logikája
A modell egy veszteségfüggvény minimalizálásával tanulja meg az adatok mintáját: egy olyan függvény, amely numerikusan méri a modell hibáját. Az optimalizáló algoritmus (pl. gradiens süllyedés) a paraméterek lépésről lépésre történő beállításával csökkenti a veszteséget. Nem a képzési adatok memorizálása a cél, hanem példátlan adatokra történő általánosítás.
Két fő veszély:
- Túlillesztés: A modell megjegyzi a képzési adatokat, és sikertelen lesz az új adatokon. A képzési siker magas, az ellenőrzési siker alacsony.
- Alulillesztés: A modell nem tudja rögzíteni a mintát; Mind a képzés, mind az érvényesítés sikere alacsony.
Az egyensúly megtalálása a nevelés művészete. Az érvényesítési készlet ezt az egyensúlyt figyeli: ha az érvényesítés sikere csökkenni kezd, miközben a képzési siker növekszik, akkor megkezdődött a túltanulás.
Tipp: Minden lépésnél ábrázolja a képzési és érvényesítési veszteséget. Az a pont, ahol a két görbe kezd eltérni, ott kezdődik az áttanulás, és ez a megfelelő pillanat a „korai leállításhoz”.
A metrika kiválasztása: a legkritikusabb döntés
A rossz mérőszám miatt a jó modell rosszul, a rossz pedig jól néz ki. A probléma határozza meg a mérőszámot:
- Kiegyensúlyozatlan osztályozás (egy osztály nagyon ritka, pl. csalás): A pontosság félrevezető. A „mindent normálisnak hívjon” feliratú modell 99%-os pontosságot ér el, de egyetlen csalást sem fog el. Ehelyett a precíziót (amiből mennyi pozitív valójában), a felidézést (amelyből mennyi az igazi pozitív) és az F1 vagy PR-AUC egyenlegét használják.
- Kiegyensúlyozott osztályozás: A pontosság és a ROC-AUC megfelelő lehet.
- Regresszió (számbecslés): MAE (átlagos abszolút hiba), RMSE (bünteti a nagy hibákat), MAPE (százalékos hiba).
- Rangsor/ajánlás: NDCG, MRR, Recall@K.
Az, hogy a pontosság vagy a visszahívás fontos-e, az üzleti környezettől függ. A rákszűrés során a visszahívás (nem hiányzik egyetlen beteg sem) prioritás; Fontos a levélszemétszűrő pontossága (a fontos e-mailek nem spambe küldése). Ez nem műszaki, hanem üzleti döntés, amelyet a mérnök és a tulajdonos közösen hozzák meg.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás: "A modellem teljesítményének értékelése, pontosság 0,97."
Hatékony felszólítás: "Van egy csalásészlelési modellem; a pozitív osztályarány 1,5%. A pontosság jelentése 0,97. Magyarázza el, miért lehet ez a mérőszám félrevezető, mondja meg, melyik mérőszámot (precíziós, visszahívási, PR-AUC) részesítsem előnyben, és miért. Számolja ki azt is, hogy egy „mindent negatívnak hívjon” alapmodell mennyire pontos, így valós hozzáadott értéket látnék ezeken az adatokon."
Különbség: erőteljes felszólítás osztályarányt és üzleti környezetet ad; az alapmodell-összehasonlítást is kéri – ez a legfontosabb eleme annak, hogy egy metrika értelmes-e.
Alaphelyzet: a metrika összehasonlítás nélkül értelmetlen
Egy mérőszám önmagában nem jó vagy rossz; Alapmodell szerint jó vagy rossz. Az alapmodell a legegyszerűbb megoldás, ami eszünkbe jut: "mindig mondd el a többségi osztálynak", "ismételd meg a múlt heti értéket", "találd ki az átlagot". Ha az Ön modellje nem tudja egyértelműen átadni ezt az egyszerű megoldást, akkor a bonyolultság hiábavaló.
Figyelem: A „Modellem 85%-ban pontos” mondat önmagában nem mond semmit. Ha az alapmodell már 84%-ot kap, a modellje szinte értéktelen; Ha az alapmodell 50%-ot kap, a modelled tökéletes. Mindig az alapmodellről beszéljen.
Keresztellenőrzés és bizalom
Az egyetlen képzési/tesztelési felosztás a véletlennek köszönhető. Keresztellenőrzés: az adatok k részre osztása és az egyes részek szekvenciális tesztelése megmutatja, mennyire stabil a teljesítmény. Az 5-szörös keresztellenőrzés során öt különböző pontszámot kap; Ezek átlaga és szórása fontos. Ha az átlag 80%, de az eltérés ±12%, akkor a modell instabil – a következő adatkötegben nagyon eltérően viselkedhet.
Ez a "két modell összehasonlítása" szempontjából is kritikus. Ha az A-modell 81%-ot, a B-modell pedig 82%-ot kap, valóban jobb a B? Ha az eltérés ±3%, ez a különbség zaj lehet. Döntés előtt fontolja meg, hogy jelentős-e a különbség.
Hiperparaméter hangolás: érvényesítéssel, nem teszteléssel
A hiperparaméterek (az edzés előtt manuálisan meghatározott beállítások – tanulási sebesség, famélység stb.) az érvényesítési készlettel vannak beállítva. A tesztkészlet csak a végén, egyszer használatos. Ha hiperparamétereket választ ki a tesztkészletre nézve, a tesztkészlet szennyezett lesz, és a jelentésben szereplő teljesítmény optimista lesz, ami a valóságban nem így van.
A mesterséges intelligencia jó segítőtárs a hiperparaméteres keresési tér kialakításában és a keresési kód megírásában (rácskeresés, véletlenszerű keresés, Bayes-i optimalizálás). De továbbra is Ön dönti el, hogy "melyik mutatót optimalizáljuk?"
három mini tok
1. eset – Pontossági csapda. Egy orvoscsoport büszke volt egy modellre, amely egy ritka betegséget észlelt: 98%-os pontossággal. Az alapmodell-összehasonlítás során kiderült az igazság: mivel a megbetegedések aránya 2% volt, a "mindenkit egészségesnek" mondó modell is 98%-ot kapott. A modell visszahívása mindössze 11% volt – a legtöbb beteg hiányzott. Miután a mérőszámot PR-AUC-ra konvertálták, megmérték a tényleges teljesítményt, és újratervezték a modellt.
2. eset – A zaj összetévesztése az előrehaladással. Egy csapat hónapokat töltött a modell javításával 86,2%-ról 86,9%-ra. A keresztellenőrzés azt mutatta, hogy a torzítás ±1,4% volt – tehát a 0,7 pontos „javulás” statisztikai zaj volt. A csapat három hetet vesztegetett irreális bevételekre. Tanulság: ne nyilváníts győzelmet anélkül, hogy ellenőriznéd, hogy a javulás nagyobb, mint az eltérés.
3. eset – A tesztkészlet szennyeződése. Egy mérnök többször is megnézte a tesztkészletet, hogy kiválassza a legjobb hiperparamétereket. A bejelentett 91%-os termelés 83%-ra esett vissza. Miért: tudtán kívül ennek megfelelően választotta ki a modellt azáltal, hogy újra és újra megnézte a tesztkészletet (túltanulva a tesztkészleten). A jelentett és a tényleges teljesítmény átfedésben volt, ha külön érvényesítési készletet használtak.
Másolható sablonok
Segítsen kiválasztani a megfelelő mérőszámot ehhez az osztályozási problémához. Probléma: [mi várható] Osztályeloszlás: [pozitív arány
Értékelje a következő két modell összehasonlítását.A modell keresztellenőrzése: [pontszámok listája]B modell keresztellenőrzése: [pontszámok listája]Számítsa ki az átlagot és a szórást. Statisztikailag szignifikáns a különbség, vagy csak zaj az eltérésen belül? Melyiket ajánlanátok és miért?
Ellenőrizze ezt a képzési kódot a következőkre vonatkozóan:1) A hiperparaméterek a tesztkészlettel vagy az érvényesítési készlettel vannak kiválasztva?2) A korai leállást a megfelelő készlettel figyelik?3) Vannak-e a túltanulás jelei (a képzési/érvényesítési veszteség különbsége)? Kód: [kód]
A MAE, RMSE és MAPE közül melyiket kell jelentenem ennél a regressziós problémánál?A célváltozó skálája: [tartomány]A nagy hibák aránytalanul rosszak (RMSE), vagy mind egyenlőek (MAE)?Nulához közeli értékek (torzítják-e a MAPE-t)?Javaslat rövid indoklással.
Metrikus kiválasztási táblázat
A probléma típusa
Megfelelő mérőszám
Elkerülendő
Miért
Kiegyensúlyozatlan osztályozás
PR-AUC, F1, visszahívás
Pontosság
A többségi osztály felfújja a mérőszámot
Kiegyensúlyozott osztályozás
Pontosság, ROC-AUC
—
Megbízható a kiegyensúlyozott adatokban
Regresszió (jelentős kiugró érték)
RMSE
MAPE (ha nulla)
Megbünteti a nagyobb hibákat
Regresszió (egyenlő súlyú)
MAE
—
Könnyen értelmezhető
Rangsor/ajánlás
NDCG, Recall@K
Pontosság
A sorrend fontos
Gyakori hibák
- Pontosság használata kiegyensúlyozatlan adatok esetén. A leggyakoribb metrikus hiba.
- Nem kell összehasonlítani az alapmodelleket. Ettől a mérőszám elveszti értelmét.
- A hiperparaméterek tesztkészletét tekintve. Optimista, irreális eredmény.
- Egyetlen rekeszre támaszkodva. Keresztellenőrzés nélkül nem fogja látni az elfogultságot.
- A zaj összetévesztése a haladással. Az eltéréstől való kis "javítások" többnyire szerencse.
- Az üzleti környezet figyelmen kívül hagyása. A pontosság/visszahívás mérleg üzleti döntés.
Összefoglalva
A modellképzésben az igazi készség nem az, hogy magas számot produkáljunk, hanem az, hogy tudjuk, mit jelent ez a szám. A probléma és az üzleti környezet határozza meg a megfelelő mérőszámot; minden mérőszámot egy alapmodell szerint értelmezni; mérje a torzítást keresztellenőrzéssel, és ne keverje össze a zajt a haladással; A tesztkészletet csak a végén használja, egyszer. A mesterséges intelligencia az Ön partnere a kísérlettervezésben, de az „elég jó” döntés Önön és az Önön múlik.
Pályázati feladat
Osztályozási modellhez: (1) írja meg az osztályeloszlást, (2) készítsen megfelelő alapmodellt és mérje meg a pontszámát, (3) értékelje ki a modelljét 5-szörös keresztellenőrzéssel, és jelentse az átlagot és a szórást, (4) a pontosság helyett számítsa ki a problémának megfelelő mérőszámot (pl. PR-AUC). Írja le, hogy a modellje túlszárnyalja-e nagy különbséggel az alapmodellt, torzítás nélkül.
ellenőrző lista
- [ ] A mérőszámot a probléma típusa és az üzleti környezet alapján választottam.
- [ ] Megépítettem egy alapmodellt és összehasonlítottam vele.
- [ ] Az átlagot és az eltérést keresztellenőrzéssel jelentettem.
- [ ] Megerősítettem, hogy a javulás nagyobb, mint az eltérés.
- [ ] A hiperparamétereket az érvényesítési készlettel választottam ki.
- [ ] A tesztkészletet csak egyszer használtam, a legvégén.