Voitot:
- Kyky valita ongelman tyyppiin ja liiketoimintakontekstiin sopiva mittari (PR-AUC/recall epätasapainoisissa tiedoissa, MAE/RMSE regressiossa) ja tunnistaa yli/ali-oppiminen
- Kyky tulkita kutakin mittaria perusviivaa vasten ja mitata poikkeamaa ja erottaa kohina edistymisestä ristiinvalidoinnin avulla
- Mahdollisuus raportoida ei-optimistisista tuloksista säätämällä hyperparametreja validointijoukolla ja käyttämällä testijoukkoa vain lopussa
Mallikoulutus (koulutus: mallien oppimisprosessi datasta) on ML-tekniikan näkyvin, mutta harhaanjohtavin vaihe. Se näkyy, koska se tuottaa tyydyttävän luvun, kuten "tarkkuus 95 %". Harhaanjohtava, koska tämä numero on usein oikea vastaus väärään kysymykseen. Tässä yksikössä koulutuksesta ja arvioinnista keskustellaan tekniikan alan kanssa; Käytämme tekoälyä kumppanina kokeellisessa suunnittelussa ja teemme päätöksen mittauksen perusteella.
Harjoitussyklin logiikka
Malli oppii datassa olevan kuvion minimoimalla häviöfunktion: funktion, joka mittaa numeerisesti mallin virhettä. Optimointialgoritmi (esim. gradienttilasku) vähentää häviötä säätämällä parametreja askel askeleelta. Tarkoituksena ei ole opetella harjoitustietoja ulkoa, vaan yleistää se ennennäkemättömään dataan.
Kaksi tärkeintä vaaraa:
- Ylisovitus: Malli muistaa harjoitustiedot ja epäonnistuu uusissa tiedoissa. Koulutuksen menestys on korkea, todentamisen menestys on heikko.
- Alasovitus: Malli ei pysty kaappaamaan kuviota; Sekä koulutuksen että validoinnin onnistuminen on heikkoa.
Tasapainon löytäminen on kasvatuksen taidetta. Validointisarja valvoo tätä tasapainoa: jos validoinnin onnistuminen alkaa heikentyä samalla kun harjoittelun menestys kasvaa, ylioppiminen on alkanut.
Vinkki: Piirrä koulutuksen ja validoinnin menetys yhdessä jokaisessa vaiheessa. Kohta, jossa nämä kaksi käyrää alkavat erota toisistaan, alkaa ylioppiminen ja on oikea hetki "varhaiseen lopettamiseen".
Mittarin valinta: kriittisin päätös
Väärä mittari saa hyvän mallin näyttämään huonolta ja huonolta hyvältä. Ongelma määrittää mittarin:
- Epätasapainoinen luokitus (yksi luokka on hyvin harvinainen, esim. petos): Tarkkuus on harhaanjohtavaa. Malli, joka sanoo "soita kaikkea normaaliksi", saa 99 % tarkkuuden, mutta ei saa kiinni yhtäkään petosta. Sen sijaan käytetään tarkkuutta (kuinka paljon siitä, mitä sain, on todella positiivista), muistamista (kuinka paljon siitä, mitä sain on todella positiivista) ja niiden saldoa F1 tai PR-AUC.
- Tasapainoinen luokitus: Tarkkuus ja ROC-AUC voivat olla sopivia.
- Regressio (lukuarviointi): MAE (keskimääräinen absoluuttinen virhe), RMSE (rangaa suurista virheistä), MAPE (prosenttivirhe).
- Sijoitus/suositus: NDCG, MRR, Recall@K.
Se, onko tarkkuus tai muistaminen tärkeää, riippuu liiketoimintaympäristöstä. Syövän seulonnan ensisijainen tavoite on palauttaminen (ei potilasta puuttuu); Roskapostisuodattimen tarkkuus (ei lähetä tärkeitä sähköposteja roskapostiin) on tärkeää. Tämä on liiketoiminnallinen päätös, ei tekninen, ja sen tekevät yhdessä insinööri ja omistaja.
Heikko kehote / Vahva kehote
Heikko kehote: "Arvioi mallini suorituskyky, tarkkuus 0,97."
Tehokas kehote: "Minulla on petosten havaitsemismalli; positiivinen luokkaprosentti on 1,5%. Tarkkuuden raportoidaan olevan 0,97. Selitä, miksi tämä mittari saattaa olla harhaanjohtava, kerro minulle, mitkä mittarit (tarkkuus, muistaminen, PR-AUC) minun pitäisi suosia ja miksi. Laske myös, kuinka tarkasti "soita kaikki negatiiviseksi" -perusmalli voisi nähdä nämä tiedot, jotta todellista lisäarvoa voisi saada.
Ero: tehokas kehote antaa luokkasuhteen ja liiketoimintakontekstin; se pyytää myös perusmallin vertailua – tämä on tärkein ankkuri sille, onko mittari mielekästä.
Perustaso: mittari ilman vertailua on merkityksetöntä
Mittari ei ole sinänsä hyvä tai huono; Se on hyvä tai huono perusmallin mukaan. Perusmalli on yksinkertaisin mieleen tuleva ratkaisu: "kerro aina enemmistölle", "toista viime viikon arvo", "arvaa keskiarvo". Jos mallisi ei selviä selvästi tästä yksinkertaisesta ratkaisusta, kaikki monimutkaisuus on turhaa.
Varoitus: Lause "Mallini on 85 % tarkka" ei sinänsä kerro mitään. Jos perusmalli saa jo 84 %, mallisi on lähes arvoton; Jos perusmalli saa 50%, mallisi on täydellinen. Puhu aina perusmallista.
Ristiinvalidointi ja luottamus
Yksittäinen koulutus-/testausjakso voi johtua sattumasta. Ristiinvalidointi: tietojen jakaminen k osaan ja jokaisen osan testaus peräkkäin osoittaa, kuinka vakaa suorituskyky on. 5-kertaisessa ristiinvalidaatiossa saat viisi eri pistettä; Niiden keskiarvo ja keskihajonta ovat tärkeitä. Jos keskiarvo on 80 %, mutta poikkeama on ±12 %, mallisi on epävakaa – se voi käyttäytyä hyvin eri tavalla seuraavassa tietoerässä.
Tämä on myös kriittinen "kahden mallin vertailussa". Jos Model A sai 81 % ja Model B 82 %, onko B todella parempi? Jos poikkeama on ±3 %, tämä ero voi olla kohinaa. Mieti, onko ero merkittävä, ennen kuin teet päätöksen.
Hyperparametrien viritys: validoinnilla, ei testauksella
Hyperparametrit (asetukset määritetään manuaalisesti ennen harjoittelua – oppimisnopeus, puun syvyys jne.) asetetaan vahvistussarjalla. Testisarjaa käytetään vain lopussa, kerran. Jos valitset hyperparametrit tarkastelemalla testisarjaa, testisarja on saastunut ja raportoimasi suorituskyky on optimistinen, mikä ei pidä paikkaansa todellisuudessa.
Tekoäly on hyvä apulainen hyperparametrihakutilan suunnittelussa ja hakukoodin kirjoittamisessa (ruudukkohaku, satunnaishaku, Bayesin optimointi). Mutta sinä päätät silti "mitä mittaria optimoimme?"
kolme minilaukkua
Tapaus 1 - Tarkkuusloukku. Lääkäriryhmä oli ylpeä mallista, joka havaitsi harvinaisen sairauden: 98 %:n tarkkuus. Kun perusmallivertailu tehtiin, totuus paljastui: koska sairastuvuus oli 2%, malli, jossa sanottiin "soita kaikki terveiksi", sai myös 98%. Mallin muistaminen oli vain 11 % – useimmat potilaat puuttuivat. Kun mittari muutettiin PR-AUC:ksi, todellinen suorituskyky mitattiin ja malli suunniteltiin uudelleen.
Tapaus 2 - Ääni sekoittaa edistymisen. Tiimi käytti kuukausia parantaakseen mallia 86,2 prosentista 86,9 prosenttiin. Ristiinvalidointi osoitti, että harha oli ±1,4 % – joten 0,7 pisteen "parannus" oli tilastollista kohinaa. Joukkue oli tuhlannut kolme viikkoa epätodellisiin tuloihin. Oppitunti: älä julista voittoa varmistamatta, että parannus on suurempi kuin poikkeama.
Tapaus 3 - Testisarjan kontaminaatio. Insinööri katsoi toistuvasti testisarjaa valitakseen parhaat hyperparametrit. Sen ilmoittama 91 % tuotannosta putosi 83 prosenttiin. Miksi: hän oli tietämättään valinnut mallin sen mukaan katsomalla testisarjaa yhä uudelleen ja uudelleen (testisarjan ylioppiminen). Raportoitu ja todellinen suorituskyky olivat päällekkäisiä, kun käytettiin erillistä validointisarjaa.
Kopioitavat mallit
Auta minua valitsemaan oikea mittari tälle luokitusongelmalle. Ongelma: [mitä ennustetaan] Luokkajakauma: [positiivinen korko
Arvioi kahden seuraavan mallin vertailu. Mallin A ristiinvalidointi: [pisteiden luettelo]Mallin B ristiinvalidointi: [pisteiden luettelo]Laske keskiarvo ja keskihajonta. Onko ero tilastollisesti merkitsevä vai onko se vain melua poikkeaman sisällä? Kumman suosittelisit valitsemaan ja miksi?
Tarkista tästä harjoituskoodista seuraavat tiedot:1) Onko hyperparametrit valittu testisarjalla tai validointisarjalla?2) Valvotaanko varhaista lopettamista oikealla sarjalla?3) Onko merkkejä ylioppimisesta (harjoittelun/validointihäviön ero)?Koodi: [koodi]
Mikä MAE-, RMSE- ja MAPE-arvoista minun pitäisi raportoida tämän regressio-ongelman vuoksi?Kohdemuuttujan asteikko: [alue]Ovatko suuret virheet suhteettoman huonoja (RMSE) vai ovatko ne kaikki yhtä suuria (MAE)?Ovatko arvot lähellä nollaa (vääristävätkö ne MAPE:a)? Ehdota lyhyellä perustelulla.
Mittarin valintataulukko
Ongelman tyyppi
Sopiva mittari
Vältettävä
Miksi?
Epätasapainoinen luokittelu
PR-AUC, F1, muista
Tarkkuus
Enemmistöluokka paisuttaa mittarin
Tasapainoinen luokitus
Tarkkuus, ROC-AUC
—
Luotettava tasapainotetuissa tiedoissa
Regressio (merkittävä poikkeava)
RMSE
MAPE (jos nolla)
Rangaistaa suurista virheistä
Regressio (sama paino)
MAE
—
Helppo tulkita
Ranking/suositus
NDCG, Recall@K
Tarkkuus
Järjestys on tärkeä
Yleisiä virheitä
- Tarkkuuden käyttäminen epätasapainoisissa tiedoissa. Yleisin metrivirhe.
- Ei tehdä perusmallivertailuja. Se saa mittarin menettämään merkityksensä.
- Tarkastellaan hyperparametrien testijoukkoa. Optimistinen, epärealistinen tulos.
- Luotetaan yhteen lokeroon. Ilman ristiintarkistusta et näe harhaa.
- Ymmärtää ääntä edistymiseen. Pienet "parannukset" poikkeamasta ovat enimmäkseen onnea.
- Liiketoiminnan kontekstin huomioiminen. Tarkkuus/palautustase on liiketoimintapäätös.
Yhteenvetona
Todellinen taito mallikoulutuksessa ei ole tuottaa suurta numeroa, vaan tietää, mitä se numero tarkoittaa. Ongelma ja liiketoimintaympäristö määrittävät oikean mittarin; tulkitse jokainen mittari perusmallin mukaan; mittaa harhaa ristiinvalidoinnin avulla äläkä sekoita melua edistymiseen; Käytä testisarjaa vain lopussa, kerran. Tekoäly on kumppanisi kokeilusuunnittelussa, mutta "riittävän hyvä" -päätös on sinun ja sinun.
Sovellustehtävä
Luokittelumallia varten: (1) kirjoita luokkajakauma, (2) rakenna sopiva perusmalli ja mittaa sen pisteet, (3) arvioi mallisi 5-kertaisella ristiinvalidaatiolla ja ilmoita keskiarvo ja keskihajonta, (4) laske ongelmaan sopiva mittari (esim. PR-AUC) tarkkuuden sijaan. Kirjoita muistiin, ylittääkö mallisi perusmallin suurella marginaalilla ilman harhaa.
tarkistuslista
- [ ] Valitsin mittarin ongelman tyypin ja liiketoimintakontekstin perusteella.
- [ ] Rakensin perusmallin ja vertasin sitä.
- [ ] Ilmoitin keskiarvon ja poikkeaman ristiinvalidaatiolla.
- [ ] Vahvistin, että parannus on suurempi kuin poikkeama.
- [ ] Valitsin hyperparametrit validointijoukon kanssa.
- [ ] Käytin testisarjaa vain kerran, aivan lopussa.