Vienība 3 / 11

Modeļu apmācība un novērtēšana: precīza metrika, godīga salīdzinošā novērtēšana

Ieguvumi:

  • Spēja izvēlēties metriku, kas atbilst problēmas veidam un biznesa kontekstam (PR-AUC/atsaukt nelīdzsvarotos datos, MAE/RMSE regresijā) un atpazīt pār/nepietiekamu mācīšanos
  • Spēja interpretēt katru metriku salīdzinājumā ar bāzes līniju un izmērīt novirzi un atdalīt troksni no norises, izmantojot savstarpējo validāciju
  • Iespēja ziņot par neoptimistiskiem rezultātiem, noregulējot hiperparametrus ar validācijas kopu un izmantojot testa kopu tikai beigās

Modeļu apmācība (apmācība: modeļu apguves process no datiem) ir visredzamākais, bet maldinošākais ML inženierijas solis. Šķiet, ka tas rada apmierinošu skaitli, piemēram, "precizitāte 95%. Maldinoši, jo šis skaitlis bieži vien ir pareizā atbilde uz nepareizo jautājumu. Šajā nodaļā izglītība un vērtēšana tiek apspriesta ar inženierzinātņu disciplīnu; Mēs izmantojam mākslīgo intelektu kā partneri eksperimentālajā projektēšanā un pamatojam lēmumu ar mērījumiem.

Treniņu cikla loģika

Modelis apgūst datu modeli, samazinot zaudējumu funkciju: funkcija, kas skaitliski mēra modeļa kļūdu. Optimizācijas algoritms (piemēram, gradienta nolaišanās) samazina zaudējumus, soli pa solim pielāgojot parametrus. Mērķis nav iegaumēt treniņu datus, bet gan vispārināt tos līdz nepieredzētiem datiem.

Divas galvenās briesmas:

  • Pārmērīga uzstādīšana: modelis iegaumē apmācības datus un neizdodas iegūt jaunus datus. Apmācības panākumi ir augsti, pārbaudes panākumi ir zemi.
  • Nepiemērots: modelis nevar uztvert modeli; Gan apmācības, gan apstiprināšanas panākumi ir zemi.

Līdzsvara atrašana ir izglītības māksla. Validācijas komplekts ir paredzēts, lai uzraudzītu šo līdzsvaru: ja validācijas panākumi sāk samazināties, bet apmācības panākumi palielinās, ir sākusies pārmācība.

Padoms. Katrā darbībā uzzīmējiet apmācības un apstiprināšanas zaudējumus kopā. Punkts, kurā abas līknes sāk atšķirties, ir vieta, kur sākas pārmācība, un ir īstais brīdis "agri apstāties".

Metrikas izvēle: vissvarīgākais lēmums

Nepareiza metrika liek labam modelim izskatīties slikti, bet sliktam modelim izskatīties labi. Problēma nosaka metriku:

  • Nelīdzsvarota klasifikācija (viena klase ir ļoti reta, piemēram, krāpšana): precizitāte ir maldinoša. Modelis, kas saka "sauc visu par normālu", iegūs 99% precizitāti, taču neuztvers nevienu krāpšanu. Tā vietā tiek izmantota precizitāte (cik daudz no tā, ko es nozvejoju, patiesībā ir pozitīvs), atsaukšana (cik daudz no nozvejotā ir patiesi pozitīva) un to bilance F1 vai PR-AUC.
  • Līdzsvarota klasifikācija: var būt piemērota precizitāte un ROC-AUC.
  • Regresija (skaitļa novērtējums): MAE (vidējā absolūtā kļūda), RMSE (soda par lielām kļūdām), MAPE (procentuālā kļūda).
  • Reitings/ieteikums: NDCG, MRR, Recall@K.

Tas, vai precizitāte vai atsaukšana ir svarīga, ir atkarīgs no uzņēmējdarbības konteksta. Vēža skrīninga prioritāte ir atsaukšana (nepalaižot garām nevienu pacientu); Surogātpasta filtra precizitāte (svarīgu e-pastu nenosūtīšana uz surogātpastu) ir svarīga. Tas ir biznesa, nevis tehnisks lēmums, un to kopīgi pieņem inženieris un īpašnieks.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne: "Novērtējiet mana modeļa veiktspēju, precizitāte 0,97."

Spēcīga uzvedne: "Man ir krāpšanas atklāšanas modelis; pozitīvās klases rādītājs ir 1,5%. Precizitāte ir norādīta kā 0,97. Paskaidrojiet, kāpēc šī metrika varētu būt maldinoša, pastāstiet man, kurām metrikām (precizitātei, atsaukšanai, PR-AUC) man vajadzētu dot priekšroku un kāpēc. Aprēķiniet arī, cik precīzs bāzes modelis "izsaukt visu negatīvo" varētu iegūt šos datus, lai pievienotu vērtību."

Atšķirība: spēcīga uzvedne sniedz klases attiecību un biznesa kontekstu; tas arī prasa bāzes modeļa salīdzinājumu — tas ir vissvarīgākais enkurs, lai noteiktu, vai metrika ir jēgpilna.

Sākums: metrika bez salīdzināšanas ir bezjēdzīga

Metrika pati par sevi nav laba vai slikta; Tas ir labs vai slikts saskaņā ar pamata modeli. Pamatmodelis ir vienkāršākais risinājums, kas ienāk prātā: "vienmēr pastāstiet vairākuma šķirai", "atkārtojiet pagājušās nedēļas vērtību", "uzmini vidējo". Ja jūsu modelis nevar skaidri izturēt šo vienkāršo risinājumu, visa sarežģītība ir veltīga.

Uzmanību: teikums "Mans modelis ir 85% precīzs" pats par sevi neko neizsaka. Ja bāzes modelis jau iegūst 84%, jūsu modelis ir gandrīz bezvērtīgs; Ja bāzes modelis iegūst 50%, jūsu modelis ir ideāls. Vienmēr runājiet par pamata modeli.

Savstarpēja apstiprināšana un uzticēšanās

Viens treniņu/pārbaudījumu sadalījums var būt nejaušs. Savstarpēja validācija: datu sadalīšana k daļās un katras daļas pārbaude secīgi parāda, cik stabila ir veiktspēja. Pieckārtīgā savstarpējā validācijā jūs saņemat piecus dažādus punktus; To vidējā un standarta novirze ir svarīga. Ja vidējais rādītājs ir 80%, bet novirze ir ±12%, jūsu modelis ir nestabils — nākamajā datu paketē tas var darboties ļoti atšķirīgi.

Tas ir ļoti svarīgi arī "divu modeļu salīdzinājumam". Ja modelis A ieguva 81% un modelis B ieguva 82%, vai B tiešām ir labāks? Ja novirze ir ±3%, šī atšķirība var būt troksnis. Pirms lēmuma pieņemšanas apsveriet, vai atšķirība ir būtiska.

Hiperparametru regulēšana: ar validāciju, nevis testēšanu

Hiperparametri (iestatījumi, kas noteikti manuāli pirms apmācības — mācīšanās ātrums, koka dziļums utt.) tiek iestatīti ar validācijas komplektu. Testa komplekts tiek izmantots tikai beigās, vienu reizi. Ja izvēlaties hiperparametrus, aplūkojot testa komplektu, testa komplekts būs piesārņots un jūsu ziņotā veiktspēja būs optimistiska, kas patiesībā tā nav.

Mākslīgais intelekts ir labs palīgs hiperparametru meklēšanas telpas projektēšanā un meklēšanas koda rakstīšanā (režģa meklēšana, izlases veida meklēšana, Bajesa optimizācija). Bet jūs joprojām izlemjat, "kuru rādītāju mēs optimizēsim?"

trīs mini futrāļi

1. gadījums — precizitātes slazds. Medicīnas komanda lepojās ar modeli, kas atklāja retu slimību: 98% precizitāte. Kad tika veikts pamata modeļu salīdzinājums, atklājās patiesība: tā kā saslimstība bija 2%, modelis, kas teica "sauc visus veselus", arī saņēma 98%. Modeļa atsaukšana bija tikai 11% — pazuda lielākā daļa pacientu. Kad metrika tika pārveidota par PR-AUC, tika izmērīta faktiskā veiktspēja un modelis tika pārveidots.

2. gadījums — troksnis tiek sajaukts ar progresu. Komanda pavadīja mēnešus, lai uzlabotu modeli no 86,2% līdz 86,9%. Savstarpējā validācija parādīja, ka novirze bija ±1,4% — tātad 0,7 punktu “uzlabojums” bija statistisks troksnis. Komanda bija izniekojusi trīs nedēļas, lai gūtu nereālus ienākumus. Mācība: nepasludiniet uzvaru, nepārbaudot, vai uzlabojums ir lielāks par novirzi.

3. gadījums – testa komplekta piesārņojums. Inženieris atkārtoti apskatīja testa komplektu, lai izvēlētos labākos hiperparametrus. Tā ziņotais 91% ražošanas apjoms samazinājās līdz 83%. Kāpēc: viņš bija neapzināti izvēlējies modeli, atkal un atkal aplūkojot testa komplektu (pārmācības par testa komplektu). Kad tika izmantota atsevišķa validācijas kopa, ziņotā un faktiskā veiktspēja pārklājās.

Kopējamas veidnes

Palīdziet man izvēlēties pareizo metriku šai klasifikācijas problēmai. Problēma: [kas tiek prognozēts] Klašu sadalījums: [pozitīvs rādītājs

Novērtējiet šādu divu modeļu salīdzinājumu.Modeļa A savstarpējā validācija: [punktu saraksts]B modeļa savstarpējā validācija: [punktu saraksts]Aprēķiniet vidējo un standartnovirzi. Vai atšķirība ir statistiski nozīmīga vai tas ir tikai troksnis novirzes robežās? Kuru jūs ieteiktu izvēlēties un kāpēc?

Pārbaudiet šo apmācības kodu, lai noskaidrotu, vai:1) vai hiperparametri ir atlasīti ar testa komplektu vai validācijas komplektu?2) Vai agrīna apstāšanās tiek uzraudzīta ar pareizo komplektu?3) Vai ir pārmācības pazīmes (apmācības/validācijas zuduma atšķirība)?Kods: [kods]

Kurš no MAE, RMSE un MAPE ir jāziņo par šo regresijas problēmu?Mērķa mainīgā skala: [diapazons]Vai lielas kļūdas ir nesamērīgi sliktas (RMSE), vai tās visas ir vienādas (MAE)?Vai ir vērtības, kas ir tuvu nullei (vai tās izkropļo MAPE)?Ieteikt ar īsu pamatojumu.

Metrikas atlases tabula

Problēmas veids

Atbilstoša metrika

Jāizvairās

Kāpēc

Nesabalansēta klasifikācija

PR-AUC, F1, atsaukt

Precizitāte

Vairākuma klase palielina metriku

Līdzsvarota klasifikācija

Precizitāte, ROC-AUC

Uzticams līdzsvarotos datos

Regresija (nozīmīga novirze)

RMSE

MAPE (ja nulle)

Soda par lielām kļūdām

Regresija (vienāds svars)

MAE

Viegli interpretējams

Reitings/ieteikums

NDCG, Recall@K

Precizitāte

Kārtība ir svarīga

Biežas kļūdas

  • Nelīdzsvarotu datu precizitātes izmantošana. Visizplatītākā metrikas kļūda.
  • Neveicot bāzes modeļu salīdzinājumus. Tas liek metrikai zaudēt savu nozīmi.
  • Aplūkojot hiperparametru testu komplektu. Optimistisks, nereāls rezultāts.
  • Paļaujoties uz vienu nodalījumu. Bez savstarpējas validācijas jūs neredzēsit novirzi.
  • Sajauc troksni ar progresu. Nelieli "uzlabojumi" no novirzes galvenokārt ir veiksme.
  • Biznesa konteksta ignorēšana. Precizitātes / atsaukšanas līdzsvars ir biznesa lēmums.

Rezumējot

Īstā iemaņa modeļu apmācībā ir nevis radīt lielu skaitu, bet gan zināt, ko šis skaitlis nozīmē. Problēma un biznesa konteksts nosaka pareizo metriku; interpretēt katru metriku saskaņā ar bāzes modeli; izmērīt novirzi, izmantojot savstarpēju apstiprinājumu, un nesajaukt troksni ar progresu; Izmantojiet testa komplektu tikai beigās, vienu reizi. AI ir jūsu partneris eksperimentu izstrādē, taču lēmums “pietiekami labs” ir atkarīgs no jums un jūsu.

Lietojumprogrammas uzdevums

Klasifikācijas modelim: (1) uzrakstiet klases sadalījumu, (2) izveidojiet atbilstošu bāzes modeli un izmēriet tā punktu skaitu, (3) novērtējiet savu modeli ar 5 kārtīgu savstarpējo validāciju un ziņojiet par vidējo un standarta novirzi, (4) aprēķiniet problēmai atbilstošo metriku (piemēram, PR-AUC), nevis precizitāti. Pierakstiet, vai jūsu modelis pārspēj bāzes modeli ar lielu rezervi bez novirzēm.

kontrolsaraksts

  • [ ] Es izvēlējos metriku, pamatojoties uz problēmas veidu un uzņēmējdarbības kontekstu.
  • [ ] Es izveidoju bāzes modeli un salīdzināju ar to.
  • [ ] Es ziņoju vidējo un novirzi ar savstarpēju apstiprinājumu.
  • [ ] Es apstiprināju, ka uzlabojums ir lielāks par novirzi.
  • [ ] Es atlasīju hiperparametrus ar validācijas kopu.
  • [ ] Testa komplektu izmantoju tikai vienu reizi, pašās beigās.