Fitimet:
- Aftësia për të zgjedhur dhe interpretuar metrikat e klasifikimit dhe regresionit (matrica e konfuzionit, saktësia/kujtesa/F1, MAE/RMSE/R²) sipas qëllimit të punës
- Aftësia për të zbuluar mbi-mësimin duke krahasuar rezultatet e trajnimit dhe testimit dhe për të marrë performancë të besueshme me verifikim të kryqëzuar
- Aftësia për të vlerësuar nëse çdo model shton vlerë reale duke e krahasuar atë me një bazë
Është e lehtë të vendosësh një model; Është e vështirë të matet sinqerisht nëse funksionon vërtet. Subjekti i kësaj njësie është aftësia më kritike e një shkencëtari të të dhënave: vlerësimi i modelit me matjet e duhura, arritja e performancës parashikuese të besueshme dhe kapja e kurthit më tinëzar: të mësuarit e tepërt (memorizimi). AI llogarit, interpreton dhe krahason metrikat; por i takon njeriut të vendosë se cila metrikë është e duhura për biznesin tuaj dhe nëse një model është "mjaft i mirë". Një ekip që shikon metrikën e gabuar mund të gabojë një model të keq për muaj të tërë si "sukses".
Pse nuk mjafton saktësia: matrica e konfuzionit
Metrika e parë që vjen në mendje në klasifikim është saktësia (saktësia - raporti total i parashikimeve të sakta). Por siç e pamë në Njësinë 6, saktësia është mashtruese me të dhëna të pabalancuara. Një fillim më i mirë është matrica e konfuzionit - një tabelë që ndan parashikimet në katër kosha:
- Pozitive e vërtetë (TP): Ne e quajtëm të rreme atë që është me të vërtetë false. (Mirë)
- Negativ i vërtetë (TN): Ne thamë vërtet të pastër. (Mirë)
- Pozitive e rreme (FP): Gabimisht thamë se e pastra ishte e rreme. (Alarmi i rremë)
- Negativ i rremë (FN): Na humbi falsifikimin dhe e quajtëm të pastër. (Kërcënimi i humbur)
Dy metrika kryesore rrjedhin nga këto katër kuti. Saktësia: "Sa pjesë e asaj që unë e quaj false është në të vërtetë false?" — e rëndësishme nëse kostot e alarmit të rremë janë të larta. Ndjeshmëria (kujtoni në anglisht): "Sa falsifikime të vërteta kam kapur?" — e rëndësishme kur humbja e një kërcënimi është e shtrenjtë. Të dyja janë shpesh në kundërshtim me njëra-tjetrën: nëse ulni pragun dhe thoni më shumë "fake", kujtesa rritet, por saktësia zvogëlohet. Rezultati F1 është mesatarja e balancuar (mesatarja harmonike) e këtyre të dyjave.
Kujdes: Përgjigja në pyetjen "Cila metrikë është e rëndësishme" është një vendim biznesi, jo teknik. Mungesa e një rasti (kujtesa e ulët) në depistimin e kancerit është katastrofike; Është e bezdisshme të dërgosh një email të rëndësishëm në spam (precizion të ulët) në filtrin e spamit. Kostoja përcakton metrikën.
Metrika e regresionit
Nëse prodhimi është numra, përdoren metrika të ndryshme. MAE (Mean Absolute Error): sa devijojnë vlerësimet nga mesatarja aktuale, në të njëjtën njësi (p.sh. "gabojmë mesatarisht me 4200 TL"). RMSE (Root Mean Squared Error): penalizon më rëndë gabimet e mëdha dhe është i ndjeshëm ndaj ekstrave. R² (R-katror — koeficienti i përcaktimit): sa nga ndryshueshmëria në objektiv shpjegon modeli (afër 1 është e mirë, 0 është aq e keqe sa parashikimi i mesatares, negative është edhe më keq).
Kurthi më tinëzar: të mësuarit e tepërt
Mbi përshtatja - ku modeli memorizon të dhënat e trajnimit, por dështon në të dhëna të reja - është gabimi më i zakonshëm në shkencën e të dhënave. Simptoma është e qartë: modeli është i shkëlqyeshëm në grupin e stërvitjes (98%), i keq në grupin e testimit (72%). Modeli ka memorizuar zhurmën e atij kampioni të veçantë, jo modelin aktual në të dhëna. Ekziston edhe e kundërta: mospërshtatja - modeli është i keq si në stërvitje ashtu edhe në testim, sepse është shumë e thjeshtë për të kapur modelin.
Mënyrat për të luftuar mbimësimin: thjeshtimi i modelit, më shumë të dhëna, rregullimi - frena matematikore që e mban modelin të mos bëhet shumë kompleks - dhe më e rëndësishmja, verifikimi i kryqëzuar.
Vërtetimi i kryqëzuar: mos i besoni panelit të vetëm
Një grup i vetëm trajnimi/testimi mund të jetë me fat ose i pafat; Ju mund të merrni nota të larta për grupin e testit vetëm sepse ai mostër është i lehtë. Vërtetimi i kryqëzuar (shkurt CV) e zgjidh këtë. Forma më e zakonshme është CV-ja me k-fish: të dhënat ndahen në k pjesë (p.sh. 5); Në çdo raund, një pjesë është testim dhe pjesa tjetër është stërvitje; kjo rrotullohet 5 herë dhe 5 pikët janë mesatare. Pra, do të shihni se performanca bazohet në mesataren e ndarjeve të shumta, jo në një ndarje të vetme me fat. Shpërndarja e pikëve është gjithashtu informuese: rezultatet shumë të paqëndrueshme (85% në një kat, 62% në tjetrin) tregojnë se modeli është i paqëndrueshëm.
K-palosje normale nuk përdoret në seritë kohore (rrjedh të ardhmen); Në vend të kësaj, ju bëni "zinxhirim përpara" (ndarja e serive kohore): gjithmonë stërviteni me të kaluarën dhe testoni të ardhmen.
metrikë
Lloji i problemit
Kur ka rëndësi?
Saktësia
Klasifikimi
Nëse klasat janë të balancuara
Preciziteti
Klasifikimi
Alarmi i rremë është i shtrenjtë
Ndjeshmëria (kujtesa)
Klasifikimi
Nëse është e shtrenjtë për të humbur
F1
Klasifikimi
Nëse nevojitet ekuilibri
MAE
regresioni
Gabim i interpretueshëm
RMSE
regresioni
Nëse gabimet e mëdha janë kritike
R²
regresioni
fuqi shpjeguese
tre mini kuti
Rasti 1 - Iluzioni i saktësisë së lartë. Një model mashtrimi tregoi saktësi 99.2% dhe ekipi festoi. Duke parë matricën e konfuzionit, shkalla reale: e rreme në të dhëna ishte 0.8%; Modelja nuk kapi thuajse asnjë falsifikim, vetëm duke thënë "të gjitha të qarta". Kujtesa ishte 6%. Mësimi: shikoni metrikën, jo saktësinë.
Rasti 2 - Mbimësimi latent. Një ekip dorëzoi dhe rriti XGBoost në 97% në grupin e trajnimit. Seti i testimit ishte 69%, por askush nuk e kishte parë. Modeli u rrëzua në prodhim. Nëse do të ishte bërë verifikimi i kryqëzuar, ndryshimi i madh midis palosjeve (mbimësimit) do të ishte i dukshëm që në fillim. Mësimi: besoni CV-së dhe rezultatit të testit, jo rezultatit të arsimit.
Rasti 3 - Ndarja me fat. Një analist ishte i kënaqur që mori 88% në një ndarje të vetme. Kur kolegu i tij bëri një CV 5-fish, rezultatet ishin 88%, 71%, 83%, 64%, 79% - mesatarja është 77%, por është shumë e paqëndrueshme. Modeli ishte i paqëndrueshëm; Ndarja e vetme ishte mashtruese. Mësimi: shikoni mesataren dhe shpërndarjen e CV-së, jo koshin individual.
Katër shabllone të kopjueshëm
1) Raporti i plotë i klasifikimit:
Kam trajnuar model dhe grup testimi. Gjeneroni: matricën e konfuzionit, saktësinë, rikujtimin, F1 (për secilën klasë) dhe numërimin e mbështetjes. Unë po konkludoj, por varet nga unë: do t'ju them se cila metrikë është e rëndësishme. Vini re se saktësia mund të jetë mashtruese me të dhëna të pabalancuara.
2) Kontrolli i mbimësimit:
Printoni rezultatet e modelit tim në grupet TRAINING dhe TEST krah për krah. Llogaritni ndryshimin midis tyre dhe paralajmëroni pasi një ndryshim i madh është një shenjë e mbimësimit. Nëse ndryshimi është i madh, sugjeroni rregullim ose thjeshtim.
3) Vërtetimi i kryqëzuar:
Kryeni verifikimin e kryqëzuar 5-fish (për klasifikim të shtresuar). Shtypni rezultatin, mesataren dhe devijimin standard të secilës dele. Nëse rezultatet janë shumë të paqëndrueshme (std i lartë), tregoni se modeli është i paqëndrueshëm. Përdorni tubacione në mënyrë që transformimet të mësohen vetëm nga pjesa e trajnimit në secilën shtresë.
4) Krahasimi bazë:
Vendos metrikën e modelit tim krah për krah me një linjë bazë DummyClassifier. A e mposht modelin ndjeshëm bazën? Nëse nuk kalon, bëni të qartë se modeli nuk shton ndonjë vlerë reale.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
A është modeli im i mirë?
"Mirë" është e papërcaktuar; Nuk është e qartë se cila metrikë, cili prag, cili bazë. AI mund të japë një numër të vetëm saktësie dhe të mashtrojë.
Njoftim i fuqishëm:
Roli juaj: asistent vlerësimi. Klasifikimi, të dhëna të pabalancuara (12% pozitive). Prioriteti: rikujtoni (duke mos humbur anët pozitive). Detyra: (1) matrica e konfuzionit, (2) saktësia/kujtesa/F1, (3) mesatarja dhe std e shtresuar e CV-së 5-fish, (4) Krahasimi bazë i DummyClassifier. Përqendrohuni në kujtesën dhe ndryshimin bazë, jo në saktësinë. Komentoni, por unë e marr vendimin përfundimtar.
Këtu, përparësia metrike, CV dhe gjendja bazë janë të qarta.
Gabimet e zakonshme
- Besimi i saktësisë në të dhënat e pabalancuara. Saktësia 99% mund të mos kap fare klasën e pakicës; Shikoni matricën e konfuzionit.
- Vetëm duke parë rezultatin tuaj të arsimit. Arsimi i lartë, rezultati i ulët i testit është mbimësim; Krahasoni gjithmonë dy pikë.
- Duke u mbështetur në një ndarje të vetme. Ndarja me fat është mashtruese; Shikoni mesataren dhe shpërndarjen me verifikim të kryqëzuar.
- Nuk krahasohet me bazën. Nuk mund të thuash "mirë" pa e ditur nëse modelja mund një parashikues budalla.
- Përdorimi i k-palosjes normale në seritë kohore. Rrjedh të ardhmen; kërkohet ndarja e serive kohore.
Këshillë: Shkruani tre numra pranë secilit model: rezultati i trajnimit, mesatarja e vlerësimit të kryqëzuar dhe rezultati bazë. Kjo treshe zbulon me një shikim mbimësimin (trajnim >> CV) dhe nënvlerësim (CV ≈ bazë).
Në përmbledhje
Të ndërtosh një model është e lehtë, por ta vlerësosh me ndershmëri është e vështirë. Në klasifikim, matrica e konfuzionit, saktësia dhe rikujtimi janë shumë më informuese sesa saktësia; Kostoja e punës përcakton se cila është e rëndësishme. MAE, RMSE dhe R² përdoren në regresion. Kurthi më tinëzar është të mësuarit e tepërt: krahasoni gjithmonë rezultatin e stërvitjes dhe testit. Mbështetuni në mesataren dhe shpërndarjen e verifikimit të kryqëzuar, jo në një ndarje të vetme; Krahasoni gjithçka me një bazë. Inteligjenca artificiale i llogarit të gjitha këto, por i takon njeriut të vendosë se cilën metrikë të përdorë.
Detyra e aplikimit
Ekstraktoni matricën e konfuzionit, saktësinë, rikujtimin dhe F1 për një model klasifikimi; Më pas bëni verifikimin e kryqëzuar 5-fish dhe shikoni shpërndarjen e pikëve nëpër dele. Së fundi, shkruani rezultatin e trajnimit, mesataren e CV-së dhe një rezultat bazë krah për krah. Komentoni me një fjali nëse modeli juaj po mëson dhe e kalon bazën.
listë kontrolli
- [ ] A e kam shikuar metrikën aktuale të punës (precizion/tërheqje/F1 etj.) në vend të saktësisë?
- [ ] A e kam ekzaminuar matricën e konfuzionit?
- [ ] A e kam krahasuar rezultatin e trajnimit dhe testit dhe a kam kontrolluar për mbimësim?
- [ ] A e kam shikuar mesataren dhe shpërndarjen me verifikim të kryqëzuar?
- [ ] A e kam krahasuar modelin me një bazë?