Yksikkö 7 / 11

Mallin arviointi: mittarit, ristiinvalidointi ja äärimmäinen oppiminen

Voitot:

  • Kyky valita ja tulkita luokittelu- ja regressiomittareita (sekoitusmatriisi, tarkkuus/palautus/F1, MAE/RMSE/R²) työn tarkoituksen mukaan
  • Kyky havaita ylioppiminen vertaamalla koulutus- ja testituloksia ja saada luotettava suorituskyky ristiinvalidoinnin avulla
  • Kyky arvioida, tuoko kukin malli todellista lisäarvoa vertaamalla sitä perustilaan

Mallin määrittäminen on helppoa; On vaikea rehellisesti mitata, toimiiko se todella. Tämän yksikön aiheena on datatieteilijän kriittisin taito: mallin arvioiminen oikeilla mittareilla, luotettavan ennustussuorituskyvyn saavuttaminen ja salakavalimman ansa: ylioppimisen (muistamisen) saaminen kiinni. AI laskee, tulkitsee ja vertaa mittareita; mutta ihmisen on päätettävä, mikä mittari on oikea yrityksellesi ja onko malli "riittävän hyvä". Väärää mittaria tarkasteleva tiimi voi pitää huonoa mallia kuukausia "menestyksenä".

Miksi tarkkuus ei riitä: sekaannusmatriisi

Ensimmäinen mittari, joka tulee mieleen luokittelussa, on tarkkuus (tarkkuus - oikeiden ennusteiden kokonaissuhde). Mutta kuten näimme yksikössä 6, tarkkuus on harhaanjohtavaa epätasapainoisilla tiedoilla. Parempi alku on hämmennysmatriisi – taulukko, joka jakaa ennusteet neljään laatikkoon:

  • Tosi positiivinen (TP): Kutsuimme väärennökseksi sitä, mikä on todella väärennettyä. (Hyvä)
  • Todellinen negatiivinen (TN): Sanoimme todella puhdasta. (Hyvä)
  • Väärä positiivinen (FP): Sanoimme virheellisesti, että puhdas oli väärennös. (Väärä hälytys)
  • Väärä negatiivinen (FN): Missimme väärennöksen ja kutsuimme sitä puhtaaksi. (Unohtunut uhkaus)

Näistä neljästä laatikosta saadaan kaksi keskeistä mittaria. Tarkkuus: "Kuinka paljon siitä, mitä kutsun väärennökseksi, on todella väärennös?" — tärkeää, jos väärien hälytysten kustannukset ovat korkeat. Herkkyys (muistaa englanniksi): "Kuinka monta oikeaa väärennöstä sain kiinni?" — tärkeää, kun uhkaamatta jättäminen on kallista. Nämä kaksi ovat usein ristiriidassa keskenään: jos lasket kynnystä ja sanot "fake" enemmän, muistaminen lisääntyy, mutta tarkkuus heikkenee. F1-pisteet on näiden kahden tasapainoinen keskiarvo (harmoninen keskiarvo).

Huomio: Vastaus kysymykseen "Mikä mittari on tärkeä" on liiketoimintapäätös, ei tekninen. Tapauksen puuttuminen (alhainen muistaminen) syöpäseulonnassa on tuhoisaa; On ärsyttävää lähettää tärkeä sähköposti roskapostiin (alhainen tarkkuus) roskapostisuodattimessa. Hinta määrää mittarin.

Regressiometriikka

Jos tulos on numeroita, käytetään erilaisia ​​mittareita. MAE (Mean Absolute Error): kuinka paljon arviot poikkeavat todellisesta keskiarvosta samassa yksikössä (esim. "olemme väärässä keskimäärin 4 200 TL"). RMSE (Root Mean Squared Error): rankaisee suuria virheitä ankarammin ja on herkkä poikkeaville arvoille. R² (R-neliö — determinaatiokerroin): kuinka suuren osan kohteen vaihtelusta malli selittää (lähes 1 on hyvä, 0 on yhtä huono kuin keskiarvon ennustaminen, negatiivinen on vielä huonompi).

Kaikkein salakavalin ansa: ylioppiminen

Ylisovitus – jossa malli muistaa harjoitustiedot mutta epäonnistuu uudessa datassa – on yleisin virhe datatieteessä. Oire on selvä: malli on loistava harjoitussarjassa (98 %), huono testisarjassa (72 %). Malli on muistanut kyseisen näytteen kohinan, ei datan todellista kuviota. On myös päinvastainen: alisovitus – malli on huono sekä harjoittelussa että testauksessa, koska kuvion vangitseminen on liian helppoa.

Tapoja taistella ylioppimista vastaan: mallin yksinkertaistaminen, enemmän dataa, regularisointi – matemaattinen jarru, joka estää mallista muodostumasta liian monimutkaiseksi – ja mikä tärkeintä, ristiinvalidointi.

Ristiinvahvistus: älä luota yhteen ruutuun

Yksittäinen harjoitus-/testikotelo voi olla onnekas tai epäonninen; Voit saada korkeat arvosanat testisarjasta vain siksi, että näyte on helppo. Ristivalidointi (lyhyesti CV) ratkaisee tämän. Yleisin muoto on k-kertainen CV: tiedot jaetaan k osaan (esim. 5); Jokaisella kierroksella yksi osa on testausta ja loput harjoittelua; tämä heitetään 5 kertaa ja 5 pisteestä lasketaan keskiarvo. Joten näet, että suorituskyky perustuu useiden jakojen keskiarvoon, ei yhteen onnelliseen jakoon. Pisteiden jakauma on myös informatiivinen: erittäin epävakaat pisteet (85 % toisessa kerroksessa, 62 % toisessa) osoittavat, että malli on epävakaa.

Normaalia k-kertaa ei käytetä aikasarjoissa (vuotoja tulevaisuuteen); Sen sijaan teet "eteenpäin ketjutusta" (aikasarjan jako): harjoittelet aina menneisyyden kanssa ja testaat tulevaisuutta.

metristä

Ongelman tyyppi

Milloin sillä on väliä?

Tarkkuus

Luokittelu

Jos luokat ovat tasaisia

Tarkkuus

Luokittelu

Väärä hälytys on kallista

Herkkyys (muistaa)

Luokittelu

Jos väliin jääminen on kallista

F1

Luokittelu

Jos tasapainoa tarvitaan

MAE

regressio

Tulkittava virhe

RMSE

regressio

Jos suuret virheet ovat kriittisiä

regressio

selittävä voima

kolme minilaukkua

Tapaus 1 – illuusio suuresta tarkkuudesta. Yksi petosmalli osoitti 99,2 prosentin tarkkuutta ja tiimi juhli. Sekaannusmatriisia tarkasteltaessa todellinen: väärennösten määrä tiedoissa oli 0,8 %; Malli ei saanut juuri mitään väärennöksiä, sanoi vain "kaikki selvä". Palautusprosentti oli 6 %. Oppitunti: katso mittareita, älä tarkkuutta.

Tapaus 2 – Piilevä ylioppiminen. Yksi tiimi toimitti ja nosti XGBoostin 97 prosenttiin harjoitussarjassa. Testisarja oli 69%, mutta kukaan ei ollut katsonut. Malli romahti tuotannossa. Jos ristiinvalidointi olisi tehty, suuri ero laskosten välillä (ylioppiminen) olisi näkynyt alusta alkaen. Oppitunti: luota CV:hen ja koetulokseen, älä koulutustuloksiin.

Tapaus 3 – Lucky split. Eräs analyytikko oli iloinen saadessaan 88 % yhdellä splitillä. Kun hänen kollegansa teki viisinkertaisen CV:n, pisteet olivat 88%, 71%, 83%, 64%, 79% – keskiarvo on 77%, mutta se on erittäin epävakaa. Malli oli epävakaa; Yksittäinen lokero oli harhaanjohtava. Oppitunti: katso CV:n keskiarvoa ja jakautumista, älä yksittäistä roskakoria.

Neljä kopioitavaa mallia

1) Täydellinen luokitusraportti:

Olen kouluttanut mallin ja testisarjan. Luo: hämmennysmatriisi, tarkkuus, palautus, F1 (jokaiselle luokalle) ja tukimäärät. Päättelen, mutta se on minusta kiinni: kerron sinulle, mikä mittari on tärkeä. Huomaa, että tarkkuus voi olla harhaanjohtava epätasapainoisilla tiedoilla.

2) Ylioppimisen ohjaus:

Tulosta mallini pisteet sekä TRAINING- että TEST-sarjoissa vierekkäin. Laske niiden välinen ero ja varoita, koska suuri ero on merkki ylioppimisesta. Jos ero on suuri, ehdota laillistamista tai yksinkertaistamista.

3) Ristivahvistus:

Suorita 5-kertainen ristiinvalidointi (ositus, luokittelu). Tulosta kunkin taitoksen pisteet, keskiarvo ja keskihajonnan. Jos pisteet ovat erittäin epävakaat (korkea std), osoita, että malli on epävakaa. Käytä liukuputkia niin, että muunnokset opitaan vain harjoituskappaleesta kullakin tasolla.

4) Perustason vertailu:

Aseta mallini metriikka vierekkäin DummyClassifier-perusviivan kanssa. Ylittääkö malli merkittävästi perusviivaa? Jos se ei mene läpi, tee selväksi, että malli ei lisää todellista arvoa.

Heikko kehote / Vahva kehote

Heikko kehote:

Onko mallini hyvä?

"Hyvä" on määrittelemätön; Ei ole selvää, mikä mittari, mikä kynnysarvo, mikä lähtötaso. Tekoäly voi antaa yhden tarkkuuden numeron ja johtaa harhaan.

Tehokas kehotus:

Tehtäväsi: arviointiavustaja. Luokitus, epätasapainoinen data (12 % positiivinen). Prioriteetti: muistaminen (positiivisia puolia ei puututa). Tehtävä: (1) sekavuusmatriisi, (2) tarkkuus/palautus/F1, (3) 5-kertainen kerrostettu CV-keskiarvo ja std, (4) DummyClassifier-perustason vertailu. Keskity muistamiseen ja lähtötilanteen eroon, älä tarkkuuteen. Kommentoi, mutta minä teen lopullisen päätöksen.

Tässä metrien prioriteetti, CV ja lähtötilanne ovat selvät.

Yleisiä virheitä

  • Luotetaan epätasapainoisten tietojen tarkkuuteen. 99 %:n tarkkuus ei välttämättä kata vähemmistöluokkaa ollenkaan; Katso hämmennysmatriisia.
  • Kun katsot koulutuspisteitäsi. Korkea koulutus, alhainen testitulos on ylioppimista; Vertaa aina kahta pistettä.
  • Luotetaan yhteen lokeroon. Lucky-jako on harhaanjohtava; Katso keskiarvoa ja jakaumaa ristiinvalidoinnin avulla.
  • Ei verrata perustilaan. Et voi sanoa "hyvä" tietämättä, voittaako malli tyhmän ennustajan.
  • Normaalia k-kertaa käytetään aikasarjoissa. Se vuotaa tulevaisuutta; aikasarjan jako vaaditaan.
Vinkki: Kirjoita kunkin mallin viereen kolme numeroa: harjoituspisteet, ristiinvalidoinnin keskiarvo ja peruspisteet. Tämä kolmikko paljastaa yhdellä silmäyksellä ylioppimisen (koulutus >> CV) ja aliarvostuksen (CV ≈ lähtötaso).

Yhteenvetona

Mallin rakentaminen on helppoa, mutta sen rehellinen arviointi on vaikeaa. Luokittelussa hämmennysmatriisi, tarkkuus ja muistaminen ovat paljon informatiivisempia kuin tarkkuus; Työn hinta määrää, kumpi on tärkeä. MAE, RMSE ja R² käytetään regressiossa. Kaikkein salakavalin ansa on ylioppiminen: vertaa aina koulutusta ja testituloksia. Luota ristiinvalidoinnin keskiarvoon ja jakaumaan, älä yhteen jakoon; Vertaa kaikkea perustilaan. Tekoäly laskee nämä kaikki, mutta on ihmisen päätettävissä, mitä mittaria käyttää.

Sovellustehtävä

Pura hämmennysmatriisi, tarkkuus, palautus ja F1 luokittelumallia varten; Tee sitten 5-kertainen ristiinvalidointi ja katso tulosjakaumaa laskoksissa. Kirjoita lopuksi muistiin koulutuspisteet, CV:n keskiarvo ja peruspisteet vierekkäin. Kommentoi yhdellä lauseella, onko mallisi ylioppiva ja ylittääkö se perusviivan.

tarkistuslista

  • [ ] Olenko katsonut työn todellista mittaria (tarkkuus/palautus/F1 jne.) tarkkuuden sijaan?
  • [ ] Olenko tutkinut hämmennysmatriisia?
  • [ ] Olenko vertaillut koulutusta ja kokeen tuloksia ja tarkistanut ylioppimisen?
  • [ ] Olenko katsonut keskiarvoa ja jakaumaa ristiinvalidoinnin kanssa?
  • [ ] Olenko vertannut mallia perustilaan?