Ieguvumi:
- Spēja atlasīt un interpretēt klasifikācijas un regresijas metriku (apjukuma matrica, precizitāte/atsaukt/F1, MAE/RMSE/R²) atbilstoši darba mērķim
- Spēja noteikt pārmācīšanos, salīdzinot apmācības un pārbaudes rezultātus, un iegūt uzticamu veiktspēju ar savstarpēju validāciju
- Spēja novērtēt, vai katrs modelis rada reālu pievienoto vērtību, salīdzinot to ar bāzes līniju
Ir viegli izveidot modeli; Ir grūti godīgi izmērīt, vai tas patiešām darbojas. Šīs nodaļas priekšmets ir datu zinātnieka vissvarīgākā prasme: modeļa novērtējums ar pareizo metriku, uzticamas paredzamās veiktspējas sasniegšana un vismānīgākā slazda tveršana: pārmācība (iegaumēšana). AI aprēķina, interpretē un salīdzina metriku; taču cilvēka ziņā ir izlemt, kurš rādītājs ir piemērots jūsu uzņēmumam un vai modelis ir "pietiekami labs". Komanda, kas meklē nepareizu metriku, var vairākus mēnešus uzskatīt sliktu modeli par “veiksmi”.
Kāpēc ar precizitāti nepietiek: neskaidrības matrica
Pirmā metrika, kas nāk prātā klasifikācijā, ir precizitāte (precizitāte — pareizo prognožu kopējā attiecība). Bet, kā mēs redzējām 6. nodaļā, nelīdzsvarotu datu precizitāte ir maldinoša. Labāks sākums ir neskaidrības matrica — tabula, kurā prognozes ir sadalītas četrās tvertnēs:
- Patiesi pozitīvs (TP): mēs saucām par viltotu to, kas patiešām ir viltots. (labi)
- Patiess negatīvs (TN): mēs teicām, ka tiešām tīrs. (labi)
- Viltus pozitīvs (FP): mēs kļūdaini teicām, ka tīrais ir viltots. (viltus trauksme)
- Viltus negatīvs (FN): mēs palaidām garām viltojumu un nosaucām to par tīru. (Nokavēti draudi)
No šiem četriem lodziņiem tiek iegūti divi galvenie rādītāji. Precizitāte: "Cik liela daļa no tā, ko es saucu par viltotu, patiesībā ir viltota?" — svarīgi, ja viltus trauksmes izmaksas ir augstas. Jutīgums (atgādināt angļu valodā): "Cik īstu viltojumu es noķēru?" — svarīgi, ja draudu palaišana ir dārga. Abi bieži vien ir pretrunā viens ar otru: ja pazemināt slieksni un vairāk sakāt "viltots", atsaukšana palielinās, bet precizitāte samazinās. F1 rezultāts ir sabalansēts vidējais (harmoniskais vidējais) no šiem diviem rādītājiem.
Uzmanību: atbilde uz jautājumu "Kura metrika ir svarīga" ir biznesa, nevis tehnisks lēmums. Vēža skrīninga gadījuma izlaišana (zema atsaukšana) ir postoša; Ir nepatīkami nosūtīt svarīgu e-pastu uz surogātpastu (zema precizitāte) surogātpasta filtrā. Maksa nosaka metriku.
Regresijas metrika
Ja izvade ir skaitļi, tiek izmantoti dažādi rādītāji. MAE (vidējā absolūtā kļūda): cik lielā mērā aprēķini atšķiras no faktiskā vidējā vienā un tajā pašā vienībā (piemēram, "mēs kļūdāmies vidēji par 4200 TL"). RMSE (Root Mean Squared Error): nopietnāk soda par lielām kļūdām un ir jutīga pret novirzēm. R² (R kvadrāts — determinācijas koeficients): cik lielu daļu mērķa mainīguma modelis izskaidro (tuvu 1 ir labi, 0 ir tikpat slikti kā vidējā prognozēšana, negatīvais ir vēl sliktāks).
Vismānīgākais lamatas: pārmācība
Pārmērīga pielāgošana — kad modelis iegaumē apmācības datus, bet neizdodas iegūt jaunus datus — ir visizplatītākā kļūda datu zinātnē. Simptoms ir skaidrs: modelis ir lielisks treniņu komplektā (98%), slikts testa komplektā (72%). Modelis ir iegaumējis konkrētā parauga troksni, nevis faktisko datu modeli. Ir arī pretējais: nepietiekama atbilstība — modelis ir slikts gan apmācībā, gan testēšanā, jo ir pārāk vienkārši tvert modeli.
Veidi, kā cīnīties pret pārmērīgu mācīšanos: modeļa vienkāršošana, vairāk datu, regularizācija — matemātiskā bremze, kas neļauj modelim kļūt pārāk sarežģītam — un vissvarīgāk, savstarpēja validācija.
Savstarpēja validācija: neuzticieties vienai rūtij
Atsevišķs treniņu/pārbaudes komplekts var būt laimīgs vai neveiksmīgs; Jūs varat iegūt augstas atzīmes par testa komplektu tikai tāpēc, ka šis paraugs ir vienkāršs. Savstarpējā validācija (īsumā CV) to atrisina. Visizplatītākā forma ir k-reize CV: dati ir sadalīti k daļās (piem., 5); Katrā kārtā viena daļa ir testēšana, bet pārējā – treniņi; tas tiek izmests 5 reizes, un 5 reitingi tiek aprēķināti vidēji. Tātad jūs redzēsit, ka veiktspēja ir balstīta uz vairāku sadalījumu vidējo, nevis vienu laimīgo sadalījumu. Informatīvs ir arī punktu sadalījums: ļoti nepastāvīgi rādītāji (85% vienā stāvā, 62% otrā) liecina, ka modelis ir nestabils.
Normālā k-reize netiek izmantota laika rindās (noplūde nākotnē); Tā vietā jūs veicat "uz priekšu ķēdi" (laikrindu sadalīšanu): vienmēr trenējieties ar pagātni un pārbaudiet nākotni.
metriska
Problēmas veids
Kad tam ir nozīme?
Precizitāte
Klasifikācija
Ja nodarbības ir līdzsvarotas
Precizitāte
Klasifikācija
Viltus trauksme ir dārga
Jutība (atgādināšana)
Klasifikācija
Ja palaist garām ir dārgi
F1
Klasifikācija
Ja nepieciešams līdzsvars
MAE
regresija
Interpretējama kļūda
RMSE
regresija
Ja lielas kļūdas ir kritiskas
R²
regresija
skaidrojošais spēks
trīs mini futrāļi
1. gadījums — augstas precizitātes ilūzija. Viens krāpšanas modelis uzrādīja 99,2% precizitāti, un komanda svinēja svētkus. Aplūkojot neskaidrību matricu, patiesais: viltojumu līmenis datos bija 0,8%; modele gandrīz neķēra viltojumus, tikai teica "viss skaidrs". Atsaukt bija 6%. Nodarbība: skatieties metriku, nevis precizitāti.
2. gadījums — latenta pārmācība. Viena komanda apmācību komplektā nodrošināja un palielināja XGBoost līdz 97%. Testa komplekts bija 69%, bet neviens nebija skatījies. Modelis sabruka ražošanā. Ja būtu veikta savstarpēja pārbaude, lielā atšķirība starp ielocēm (pārmācīšanās) būtu redzama jau no paša sākuma. Nodarbība: uzticieties CV un testa rezultātam, nevis izglītības rezultātam.
3. gadījums — laimīgā šķiršanās. Viens analītiķis bija priecīgs iegūt 88% vienā sadalē. Kad viņa kolēģis veidoja 5 kārtīgu CV, rezultāti bija 88%, 71%, 83%, 64%, 79% — vidējais rādītājs ir 77%, taču tas ir ļoti nepastāvīgs. Modelis bija nestabils; Viens nodalījums bija maldinošs. Nodarbība: skatiet CV vidējo vērtību un sadalījumu, nevis individuālo atkritumu tvertni.
Četras kopējamas veidnes
1) Pilns klasifikācijas ziņojums:
Esmu apmācījis modeli un testa komplektu. Ģenerējiet: neskaidrības matricu, precizitāti, atsaukšanu, F1 (katrai klasei) un atbalsta skaitu. Es secinu, bet tas ir atkarīgs no manis: es jums pateikšu, kurš rādītājs ir svarīgs. Ņemiet vērā, ka nelīdzsvarotu datu precizitāte var būt maldinoša.
2) Apmācības kontrole:
Drukājiet mana modeļa rezultātus gan komplektā TRENIŅA, gan TESTS blakus. Aprēķiniet atšķirību starp tām un brīdiniet, jo liela atšķirība liecina par pārmācīšanos. Ja atšķirība ir liela, iesakiet to regulēt vai vienkāršot.
3) Savstarpēja validācija:
Veiciet 5 kārtīgu savstarpēju pārbaudi (slāņošanai, klasifikācijai). Izdrukājiet katra locījuma punktu skaitu, vidējo un standarta novirzi. Ja rādītāji ir ļoti nepastāvīgi (augsta std), norādiet, ka modelis ir nestabils. Izmantojiet konveijerus, lai transformācijas tiktu apgūtas tikai no mācību daļas katrā slānī.
4) Bāzes salīdzinājums:
Novietojiet mana modeļa metriku blakus ar DummyClassifier bāzes līniju. Vai modelis ievērojami pārspēj bāzes līniju? Ja tas neizdodas, skaidri norādiet, ka modelis nepievieno nekādu reālu vērtību.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Vai mans modelis ir labs?
"Labs" ir nedefinēts; Nav skaidrs, kura metrika, kurš slieksnis, kura bāzes līnija. AI var sniegt vienu precizitātes skaitli un maldināt.
Spēcīga uzvedne:
Jūsu loma: novērtēšanas asistents. Klasifikācija, nesabalansēti dati (12% pozitīvi). Prioritāte: atsaukšana (nepalaid garām pozitīvos punktus). Uzdevums: (1) apjukuma matrica, (2) precizitāte/atgādināšana/F1, (3) 5 reizes stratificēts CV vidējais un std, (4) DummyClassifier bāzes līnijas salīdzinājums. Koncentrējieties uz atsaukšanu un sākotnējo atšķirību, nevis uz precizitāti. Komentējiet, bet es pieņemu galīgo lēmumu.
Šeit ir skaidra metrikas prioritāte, CV un bāzes stāvoklis.
Biežas kļūdas
- Uzticoties nelīdzsvarotu datu precizitātei. 99% precizitāte var vispār nenotvert mazākuma klasi; Paskatieties uz neskaidrības matricu.
- Paskatoties tikai uz jūsu izglītības rezultātu. Augsta izglītība, zems pārbaudes rezultāts ir pārāk augsts; Vienmēr salīdziniet divus punktus.
- Paļaujoties uz vienu nodalījumu. Laimīgā dalīšana ir maldinoša; Apskatiet vidējo un sadalījumu ar savstarpēju apstiprinājumu.
- Nesalīdzinot ar bāzes līniju. Jūs nevarat teikt "labi", ja nezināt, vai modelis pārspēj stulbu prognozētāju.
- Izmantojot parasto k-reizi laika rindās. Tas izplūst nākotnē; ir nepieciešams laika rindu sadalījums.
Padoms. Blakus katram modelim ierakstiet trīs skaitļus: treniņu rezultāts, savstarpējās validācijas vidējais rādītājs un bāzes rādītājs. Šis trio vienā mirklī atklāj pārmācīšanos (apmācība >> CV) un nepietiekamu novērtēšanu (CV ≈ bāzes līnija).
Rezumējot
Izveidot modeli ir viegli, bet godīgi novērtēt to ir grūti. Klasifikācijā neskaidrības matrica, precizitāte un atsaukšana ir daudz informatīvāka nekā precizitāte; Darba izmaksas nosaka, kurš no tiem ir svarīgs. MAE, RMSE un R² izmanto regresijā. Vismānīgākais slazds ir pārmācīšanās: vienmēr salīdziniet apmācību un pārbaudes rezultātu. Paļauties uz savstarpējās validācijas vidējo vērtību un sadalījumu, nevis uz vienu sadalījumu; Salīdziniet visu ar bāzes līniju. AI aprēķina tos visus, taču cilvēka ziņā ir izlemt, kuru metriku izmantot.
Lietojumprogrammas uzdevums
Klasifikācijas modelim izvilkt neskaidrības matricu, precizitāti, atsaukšanu un F1; Pēc tam veiciet 5 kārtīgu savstarpēju apstiprinājumu un skatiet punktu sadalījumu krokās. Visbeidzot pierakstiet blakus mācību rezultātu, CV vidējo rādītāju un sākotnējo rezultātu. Vienā teikumā komentējiet, vai jūsu modelis mācās pārāk daudz un iztur bāzes līniju.
kontrolsaraksts
- [ ] Vai precizitātes vietā esmu apskatījis faktisko darba metriku (precizitāte/atsaucība/F1 utt.)?
- [ ] Vai esmu pārbaudījis neskaidrības matricu?
- [ ] Vai esmu salīdzinājis apmācību un ieskaites rezultātu un pārbaudījis, vai nav mācības?
- [ ] Vai esmu apskatījis vidējo un sadalījumu ar savstarpēju apstiprinājumu?
- [ ] Vai esmu salīdzinājis modeli ar bāzes līniju?