Câștiguri:
- Abilitatea de a selecta și interpreta valorile de clasificare și regresie (matrice de confuzie, precizie/rechemare/F1, MAE/RMSE/R²) în funcție de scopul postului
- Capacitatea de a detecta supraînvățarea prin compararea scorurilor de instruire și test și de a obține performanțe de încredere cu validare încrucișată
- Abilitatea de a evalua dacă fiecare model adaugă valoare reală comparându-l cu o linie de bază
Este ușor să configurați un model; Este dificil să măsori sincer dacă funcționează cu adevărat. Subiectul acestei unități este cea mai critică abilitate a unui cercetător de date: evaluarea modelului cu valorile potrivite, obținerea unor performanțe predictive fiabile și prinderea celei mai insidioase capcane: supraînvățarea (memorizarea). AI calculează, interpretează și compară valorile; dar depinde de om să decidă ce măsură este potrivită pentru afacerea ta și dacă un model este „suficient de bun”. O echipă care se uită la o valoare greșită poate confunda un model prost luni de zile drept un „succes”.
De ce acuratețea nu este suficientă: matricea confuziei
Prima măsurătoare care îmi vine în minte în clasificare este acuratețea (acuratețea — raportul total al predicțiilor corecte). Dar, așa cum am văzut în Unitatea 6, acuratețea este înșelătoare în cazul datelor dezechilibrate. Un început mai bun este matricea de confuzie - un tabel care împarte predicțiile în patru casete:
- Adevărat pozitiv (TP): Am numit fals ceea ce este cu adevărat fals. (Bine)
- Adevărat negativ (TN): Am spus cu adevărat curat. (Bine)
- Fals pozitiv (FP): Am spus în mod eronat că cel curat este fals. (Alarma falsa)
- Fals negativ (FN): Am ratat falsul și l-am numit curat. (amenințare ratată)
Două valori cheie derivă din aceste patru casete. Precizie: „Cât din ceea ce eu numesc fals este de fapt fals?” — important dacă costurile cu alarmele false sunt mari. Sensibilitate (rechemare în engleză): „Câte falsuri reale am prins?” — important atunci când ratarea unei amenințări este costisitoare. Cei doi sunt adesea în dezacord unul cu celălalt: dacă cobori pragul și spui mai mult „fals”, amintirea crește, dar precizia scade. Scorul F1 este media echilibrată (media armonică) a acestor două.
Atenție: Răspunsul la întrebarea „Ce metrică este importantă” este o decizie de afaceri, nu una tehnică. Lipsa unui caz (reamintire scăzută) în screening-ul cancerului este dezastruoasă; Este enervant să trimiți un e-mail important către spam (precizie scăzută) în filtrul de spam. Costul determină valoarea.
Valori de regresie
Dacă rezultatul sunt numere, sunt utilizate valori diferite. MAE (Eroare absolută medie): cât de mult se abat estimările de la media reală, în aceeași unitate (de exemplu, „ne înșelăm cu 4.200 TL în medie”). RMSE (Root Mean Squared Error): penalizează erorile majore mai sever și este sensibil la valori aberante. R² (R-pătrat — coeficient de determinare): cât de mult din variabilitatea țintei explică modelul (aproape de 1 este bun, 0 este la fel de rău ca predicția mediei, negativ este și mai rău).
Cea mai insidioasă capcană: supraînvățarea
Supraadaptarea – în cazul în care modelul memorează datele de antrenament, dar eșuează cu datele noi – este cea mai frecventă greșeală în știința datelor. Simptomul este clar: modelul este grozav pe setul de antrenament (98%), prost pe setul de testare (72%). Modelul a memorat zgomotul acelui eșantion, nu modelul real din date. Există, de asemenea, opusul: underfitting — modelul este prost atât la antrenament, cât și la testare, deoarece este prea simplu să captezi modelul.
Modalități de a combate supraînvățarea: simplificarea modelului, mai multe date, regularizarea — frâna matematică care împiedică modelul să devină prea complex — și, cel mai important, validarea încrucișată.
Validare încrucișată: nu aveți încredere în un singur panou
Un singur pod de antrenament/test poate fi norocos sau ghinionist; Puteți obține note mari pentru setul de test doar pentru că acea probă este ușoară. Validarea încrucișată (pe scurt CV) rezolvă acest lucru. Cea mai comună formă este CV-ul k-fold: datele sunt împărțite în k părți (de exemplu, 5); În fiecare rundă, o parte este testarea, iar restul antrenamentele; aceasta se rostogolește de 5 ori și se face media celor 5 scoruri. Deci, veți vedea că performanța se bazează pe media mai multor împărțiri, nu pe o singură împărțire norocoasă. Distribuția scorurilor este de asemenea informativă: scorurile foarte volatile (85% la un etaj, 62% la celălalt) indică faptul că modelul este instabil.
K-fold normal nu este folosit în serii de timp (scurge viitorul); În schimb, faci „înlănțuire înainte” (serii de timp împărțite): antrenează-te mereu cu trecutul și testează viitorul.
metrica
Tipul problemei
Când contează?
Precizie
Clasificare
Dacă orele sunt echilibrate
Precizie
Clasificare
Alarma falsă este scumpă
Sensibilitate (rechemare)
Clasificare
Dacă este scump să ratezi
F1
Clasificare
Dacă este nevoie de echilibru
MAE
regresie
Eroare interpretabilă
RMSE
regresie
Dacă greșelile mari sunt critice
R²
regresie
putere explicativă
trei mini cutii
Cazul 1 – Iluzia de înaltă precizie. Un model de fraudă a arătat o acuratețe de 99,2%, iar echipa a sărbătorit. Privind matricea de confuzie, rata reală: fals în date a fost de 0,8%; modelul nu a prins aproape niciun fals, spunând doar „totul clar”. Reamintirea a fost de 6%. Lecție: uită-te la valori, nu la acuratețe.
Cazul 2 – Supraînvățare latentă. O echipă a oferit și a crescut XGBoost la 97% pe setul de antrenament. Setul de testare a fost de 69%, dar nimeni nu se uitase. Modelul s-a prăbușit în producție. Dacă s-ar fi făcut validarea încrucișată, diferența mare dintre pliuri (supraînvățare) ar fi fost vizibilă de la început. Lecție: aveți încredere în CV și în scorul testului, nu în scorul educației.
Cazul 3 – Diviziunea norocoasă. Un analist a fost încântat să obțină 88% într-o singură împărțire. Când colegul său a făcut un CV de 5 ori, scorurile au fost de 88%, 71%, 83%, 64%, 79% — media este de 77%, dar este foarte volatilă. Modelul era instabil; Unicul compartiment era înșelător. Lecție: uitați-vă la media și distribuția CV-ului, nu la coșul individual.
Patru șabloane copiabile
1) Raport complet de clasificare:
Am antrenat model și set de testare. Generați: matrice de confuzie, precizie, reamintire, F1 (pentru fiecare clasă) și număr de suport. Deduc, dar depinde de mine: vă voi spune ce măsură este importantă. Rețineți că acuratețea poate fi înșelătoare în cazul datelor dezechilibrate.
2) Controlul supraînvățarii:
Tipăriți unul lângă altul scorurile modelului meu în ambele seturi de ANTRENARE și TEST. Calculați diferența dintre ele și avertizați, deoarece o diferență mare este un semn de supraînvățare. Dacă diferența este mare, sugerați regularizare sau simplificare.
3) Validare încrucișată:
Efectuați validarea încrucișată de 5 ori (pentru stratificat, clasificare). Tipăriți scorul, media și deviația standard pentru fiecare pliu. Dacă scorurile sunt foarte volatile (std ridicat), indicați că modelul este instabil. Utilizați conducte astfel încât transformările să fie învățate numai din piesa de antrenament la fiecare strat.
4) Comparație de referință:
Puneți metrica modelului meu una lângă alta cu o linie de bază DummyClassifier. Modelul depășește semnificativ linia de bază? Dacă nu trece, clarificați că modelul nu adaugă nicio valoare reală.
Prompt slab / Prompt puternic
Prompt slab:
Modelul meu este bun?
„Bine” este nedefinit; Nu este clar ce măsură, ce prag, ce linie de bază. AI poate da un singur număr de precizie și poate induce în eroare.
Solicitare puternică:
Rolul dumneavoastră: asistent de evaluare. Clasificare, date dezechilibrate (12% pozitive). Prioritate: rechemare (nu lipsesc aspectele pozitive). Sarcină: (1) matrice de confuzie, (2) precizie/rechemare/F1, (3) medie CV stratificată de 5 ori și std, (4) comparație de bază DummyClassifier. Concentrați-vă pe reamintire și diferența de bază, nu pe acuratețe. Comentează, dar eu iau decizia finală.
Aici, prioritatea metricii, CV-ul și condiția de referință sunt clare.
Greșeli comune
- Încredere în acuratețea datelor dezechilibrate. Este posibil ca o precizie de 99% să nu captureze deloc clasa minoritară; Uită-te la matricea de confuzie.
- Mă uit doar la scorul tău de educație. Educație înaltă, scor scăzut la test este supraînvățare; Comparați întotdeauna două scoruri.
- Bazându-se pe un singur compartiment. Diviziunea norocoasă este înșelătoare; Priviți media și distribuția cu validare încrucișată.
- Nu se compară cu valoarea inițială. Nu poți spune „bine” fără să știi dacă modelul bate un predictor stupid.
- Folosind k-fold normal pe serii de timp. Se scurge viitorul; este necesară împărțirea în serie de timp.
Sfat: scrieți trei numere lângă fiecare model: scorul de antrenament, media de validare încrucișată și scorul de referință. Acest trio dezvăluie dintr-o privire supraînvățare (formare >> CV) și subevaluare (CV ≈ linia de bază).
Pe scurt
Construirea unui model este ușoară, dar a-l evalua sincer este dificilă. În clasificare, matricea de confuzie, precizia și amintirea sunt mult mai informative decât acuratețea; Costul jobului determină care dintre ele este importantă. MAE, RMSE și R² sunt utilizate în regresie. Cea mai insidioasă capcană este supraînvățarea: comparați întotdeauna antrenamentul și scorul la test. Bazați-vă pe media și distribuția validării încrucișate, nu pe o singură împărțire; Comparați totul cu o linie de bază. AI calculează toate acestea, dar depinde de om să decidă ce măsură să folosească.
Sarcina de aplicare
Extrageți matricea de confuzie, precizie, reamintire și F1 pentru un model de clasificare; Apoi faceți o validare încrucișată de 5 ori și uitați-vă la distribuția scorului în pliuri. În cele din urmă, notați scorul de antrenament, media CV și un scor de bază unul lângă altul. Comentați într-o propoziție dacă modelul dvs. supraînvăța și trece de linia de bază.
lista de verificare
- [ ] M-am uitat la valoarea reală a sarcinii (precizie/rechemare/F1 etc.) în loc de acuratețe?
- [ ] Am examinat matricea de confuzie?
- [ ] Am comparat formarea și scorul la test și am verificat dacă există supraînvățare?
- [ ] Am analizat media și distribuția cu validare încrucișată?
- [ ] Am comparat modelul cu o linie de bază?