Jednostka 7 / 11

Ocena modelu: metryki, weryfikacja krzyżowa i ekstremalne uczenie się

Zyski:

  • Umiejętność wyboru i interpretacji metryk klasyfikacji i regresji (macierz zamieszania, precyzja/przypomnienie/F1, MAE/RMSE/R²) zgodnie z celem pracy
  • Możliwość wykrywania nadmiernego uczenia się poprzez porównywanie wyników szkoleń i testów oraz uzyskiwanie wiarygodnych wyników dzięki walidacji krzyżowej
  • Możliwość oceny, czy każdy model dodaje rzeczywistą wartość poprzez porównanie go z wartością bazową

Skonfigurowanie modelu jest łatwe; Trudno uczciwie zmierzyć, czy to rzeczywiście działa. Tematem tej jednostki jest najważniejsza umiejętność analityka danych: ocena modelu za pomocą odpowiednich metryk, osiągnięcie niezawodnej wydajności predykcyjnej i złapanie najbardziej podstępnej pułapki: nadmiernego uczenia się (zapamiętywania). AI oblicza, interpretuje i porównuje metryki; ale to człowiek decyduje, który wskaźnik jest odpowiedni dla Twojej firmy i czy model jest „wystarczająco dobry”. Zespół patrzący na niewłaściwe wskaźniki może przez wiele miesięcy uważać zły model za „sukces”.

Dlaczego dokładność nie wystarczy: matryca zamieszania

Pierwszą metryką, która przychodzi na myśl w klasyfikacji, jest dokładność (dokładność — całkowity współczynnik poprawnych przewidywań). Ale jak widzieliśmy w części 6, dokładność jest myląca w przypadku niezrównoważonych danych. Lepszym początkiem jest macierz zamieszania — tabela dzieląca przewidywania na cztery przedziały:

  • Prawdziwie pozytywne (TP): To, co jest naprawdę fałszywe, nazywamy fałszywym. (Dobrze)
  • Prawdziwie negatywny (TN): Powiedzieliśmy, że jest naprawdę czysty. (Dobrze)
  • Fałszywie pozytywny (FP): błędnie powiedzieliśmy, że czysty był fałszywy. (fałszywy alarm)
  • Fałszywie negatywny (FN): Przeoczyliśmy podróbkę i nazwaliśmy ją czystą. (Przegapione zagrożenie)

Z tych czterech ramek wynikają dwa kluczowe wskaźniki. Precyzja: „Jak wiele z tego, co nazywam podróbką, jest w rzeczywistości fałszywe?” — ważne, jeśli koszty fałszywych alarmów są wysokie. Wrażliwość (przypomnienie po angielsku): „Ile prawdziwych podróbek złapałem?” — ważne, gdy przeoczenie zagrożenia jest kosztowne. Jedno i drugie często jest ze sobą sprzeczne: jeśli obniżysz próg i częściej będziesz mówić „fałszywie”, zapamiętywanie wzrośnie, ale precyzja spadnie. Wynik F1 jest średnią zrównoważoną (średnią harmoniczną) tych dwóch.

Uwaga: Odpowiedź na pytanie „Który wskaźnik jest ważny” jest decyzją biznesową, a nie techniczną. Pominięcie przypadku (mała liczba wycofań) w badaniach przesiewowych w kierunku raka jest katastrofalne; Wysyłanie ważnej wiadomości e-mail do spamu (o niskiej precyzji) w filtrze spamu jest denerwujące. Koszt określa metrykę.

Metryki regresji

Jeśli wynikiem są liczby, używane są różne metryki. MAE (średni błąd bezwzględny): o ile szacunki odbiegają od rzeczywistej średniej w tej samej jednostce (np. „mylimy się średnio o 4200 TL”). RMSE (średniokwadratowy błąd): poważniej karze główne błędy i jest wrażliwy na wartości odstające. R² (R-kwadrat — współczynnik determinacji): jaką część zmienności celu wyjaśnia model (blisko 1 oznacza dobrze, 0 jest tak samo złe jak przewidywanie średniej, wartość ujemna jest jeszcze gorsza).

Najbardziej podstępna pułapka: nadmierne uczenie się

Nadmierne dopasowanie — gdy model zapamiętuje dane szkoleniowe, ale nie radzi sobie z nowymi danymi — jest najczęstszym błędem w nauce danych. Symptom jest jasny: model jest świetny na zbiorze uczącym (98%), źle na zbiorze testowym (72%). Model zapamiętał szum tej konkretnej próbki, a nie rzeczywisty wzór w danych. Jest też sytuacja odwrotna: niedopasowanie — model jest kiepski zarówno w trenowaniu, jak i testowaniu, ponieważ uchwycenie wzorca jest zbyt proste.

Sposoby zwalczania nadmiernego uczenia się: upraszczanie modelu, więcej danych, regularyzacja — hamulec matematyczny, który zapobiega zbytniemu złożoności modelu — i co najważniejsze, weryfikacja krzyżowa.

Walidacja krzyżowa: nie ufaj pojedynczemu okienku

Pojedyncza kapsuła szkoleniowa/testowa może przynosić szczęście lub pecha; Za zestaw testowy można uzyskać wysokie oceny tylko dlatego, że próbka jest łatwa. Walidacja krzyżowa (w skrócie CV) rozwiązuje ten problem. Najbardziej powszechną formą jest k-krotne CV: dane są dzielone na k części (np. 5); W każdej rundzie jedna część to testowanie, a reszta to szkolenie; rzuca to 5 razy, a 5 wyników jest uśrednianych. Zobaczysz więc, że skuteczność opiera się na średniej z wielu podziałów, a nie na pojedynczym szczęśliwym podziale. Rozkład wyników ma również charakter informacyjny: bardzo zmienne wyniki (85% na jednym piętrze, 62% na drugim) wskazują, że model jest niestabilny.

Normalne k-fold nie jest używane w szeregach czasowych (wyciek przyszłości); Zamiast tego stosujesz „łączenie w przód” (podział szeregów czasowych): zawsze trenując przeszłość i testując przyszłość.

metryczny

Typ problemu

Kiedy to ma znaczenie?

Dokładność

Klasyfikacja

Jeśli zajęcia są zrównoważone

Precyzja

Klasyfikacja

Fałszywy alarm jest drogi

Wrażliwość (przypomnienie)

Klasyfikacja

Jeśli przegapienie jest drogie

F1

Klasyfikacja

Jeśli potrzebna jest równowaga

MAE

regresja

Interpretowalny błąd

RMSE

regresja

Jeśli duże błędy są krytyczne

regresja

moc wyjaśniająca

trzy mini etui

Przypadek 1 — Złudzenie dużej dokładności. Jeden z modeli oszustwa wykazał się dokładnością na poziomie 99,2%, a zespół świętował. Patrząc na matrycę zamieszania, rzeczywisty odsetek fałszywych danych wyniósł 0,8%; modelka prawie nie złapała podróbek, po prostu powiedziała „wszystko jasne”. Przypomnienie wynosiło 6%. Lekcja: spójrz na wskaźniki, a nie na dokładność.

Przypadek 2 — Utajone nadmierne uczenie się. Jeden zespół dostarczył i zwiększył wydajność XGBoost do 97% na zestawie treningowym. Zestaw testowy wyniósł 69%, ale nikt nie sprawdzał. Model upadł w produkcji. Gdyby przeprowadzono walidację krzyżową, duża różnica między fałdami (nadmierne uczenie się) byłaby widoczna od początku. Lekcja: ufaj CV i wynikowi testu, a nie wynikowi wykształcenia.

Przypadek 3 – Szczęśliwy podział. Jeden z analityków był zachwycony uzyskaniem 88% w jednym splicie. Kiedy jego kolega zrobił 5-krotne CV, wyniki wynosiły 88%, 71%, 83%, 64%, 79% — średnia wynosi 77%, ale jest bardzo zmienna. Model był niestabilny; Pojedynczy przedział wprowadzał w błąd. Lekcja: spójrz na średnią i rozkład CV, a nie na pojedynczy przedział.

Cztery szablony do kopiowania

1) Pełny raport klasyfikacyjny:

Wyszkoliłem model i zestaw testowy. Generuj: macierz zamieszania, precyzję, przywołanie, F1 (dla każdej klasy) i liczbę wsparcia. Wnioskuję, ale to zależy ode mnie: powiem ci, który wskaźnik jest ważny. Należy pamiętać, że dokładność może wprowadzać w błąd w przypadku niezrównoważonych danych.

2) Kontrola uczenia się:

Wydrukuj obok siebie wyniki mojego modela w zestawie TRENING i TEST. Oblicz różnicę między nimi i ostrzeż, ponieważ duża różnica jest oznaką nadmiernego uczenia się. Jeśli różnica jest duża, zasugeruj uregulowanie lub uproszczenie.

3) Walidacja krzyżowa:

Wykonaj 5-krotną walidację krzyżową (dla warstwowej, klasyfikacja). Wydrukuj wynik, średnią i odchylenie standardowe każdego zagięcia. Jeśli wyniki są bardzo zmienne (wysoki standard), oznacza to, że model jest niestabilny. Użyj potoków, aby przekształcenia były uczone tylko z elementu szkoleniowego w każdej warstwie.

4) Porównanie bazowe:

Umieść metrykę mojego modelu obok linii bazowej DummyClassifier. Czy model znacząco przewyższa linię bazową? Jeśli się nie powiedzie, wyjaśnij, że model nie wnosi żadnej rzeczywistej wartości.

Słaba zachęta/silna zachęta

Słaba zachęta:

Czy mój model jest dobry?

„Dobry” jest nieokreślony; Nie jest jasne, który wskaźnik, jaki próg i jaka wartość bazowa. Sztuczna inteligencja może podać jedną liczbę dokładności i wprowadzić w błąd.

Potężny monit:

Twoja rola: asystent oceny. Klasyfikacja, dane niezbilansowane (12% pozytywnych). Priorytet: przypomnienie (nie tracąc pozytywów). Zadanie: (1) macierz pomyłek, (2) precyzja/przypomnienie/F1, (3) 5-krotnie stratyfikowana średnia CV i std, (4) Porównanie linii bazowej DummyClassifier. Skoncentruj się na przypominaniu sobie i różnicy bazowej, a nie na dokładności. Komentujcie, ale to ja podejmuję ostateczną decyzję.

Tutaj priorytet metryki, CV i warunek bazowy są jasne.

Typowe błędy

  • Ufanie dokładności niezrównoważonych danych. Dokładność na poziomie 99% może w ogóle nie uwzględniać klasy mniejszości; Spójrz na macierz zamieszania.
  • Patrzę tylko na twoje wyniki w nauce. Wysokie wykształcenie, niski wynik testu oznacza nadmierne uczenie się; Zawsze porównuj dwa wyniki.
  • Opierając się na jednej komorze. Szczęśliwy podział wprowadza w błąd; Spójrz na średnią i rozkład za pomocą walidacji krzyżowej.
  • Bez porównania z wartością bazową. Nie można powiedzieć „dobrze”, nie wiedząc, czy model przebije głupi predyktor.
  • Używanie normalnego k-krotności w szeregach czasowych. Wycieka przyszłość; wymagany jest podział szeregów czasowych.
Wskazówka: obok każdego modelu wpisz trzy liczby: wynik treningu, średnią z walidacji krzyżowej i wynik bazowy. To trio na pierwszy rzut oka ujawnia nadmierne uczenie się (szkolenie >> CV) i niedocenianie (CV ≈ poziom bazowy).

Podsumowując

Zbudowanie modelu jest łatwe, ale rzetelna jego ocena jest trudna. W klasyfikacji macierz zamieszania, precyzja i przypominanie mają znacznie więcej informacji niż dokładność; Koszt pracy określa, która z nich jest ważna. W regresji wykorzystuje się MAE, RMSE i R². Najbardziej podstępną pułapką jest nadmierne uczenie się: zawsze porównuj wyniki treningu i testu. Opieraj się na średniej i rozkładzie walidacji krzyżowej, a nie na pojedynczym podziale; Porównaj wszystko z wartością bazową. Sztuczna inteligencja oblicza to wszystko, ale to człowiek decyduje, którego wskaźnika użyć.

Zadanie aplikacji

Wyodrębnij macierz zamieszania, precyzję, przypominanie i F1 dla modelu klasyfikacji; Następnie wykonaj 5-krotną weryfikację krzyżową i przyjrzyj się rozkładowi wyników w poszczególnych zakładkach. Na koniec zapisz obok siebie wynik szkolenia, średnią CV i wynik bazowy. Skomentuj jednym zdaniem, czy Twój model uczy się nadmiernie i przekracza linię bazową.

lista kontrolna

  • [ ] Czy spojrzałem na rzeczywistą metrykę zadania (precyzja/przypomnienie/F1 itp.) zamiast na dokładność?
  • [ ] Czy sprawdziłem matrycę zamieszania?
  • [ ] Czy porównałem wyniki szkolenia i testu i sprawdziłem, czy nie doszło do nadmiernego uczenia się?
  • [ ] Czy przyjrzałem się średniej i rozkładowi za pomocą walidacji krzyżowej?
  • [ ] Czy porównałem model z wartością bazową?