Mga nadagdag:
- Kakayahang pumili at bigyang-kahulugan ang mga sukatan ng klasipikasyon at regression (confusion matrix, precision/recall/F1, MAE/RMSE/R²) ayon sa layunin ng trabaho
- Kakayahang makakita ng labis na pagkatuto sa pamamagitan ng paghahambing ng mga marka ng pagsasanay at pagsusulit at makakuha ng maaasahang pagganap na may cross-validation
- Kakayahang suriin kung ang bawat modelo ay nagdaragdag ng tunay na halaga sa pamamagitan ng paghahambing nito sa isang baseline
Madaling mag-set up ng modelo; Mahirap matapat na sukatin kung ito ay talagang gumagana. Ang paksa ng unit na ito ay ang pinaka-kritikal na kasanayan ng isang data scientist: pagsusuri sa modelo gamit ang mga tamang sukatan, pagkamit ng maaasahang predictive na pagganap, at paghuli sa pinaka-nakapanghimasok na bitag: overlearning (memorization). Kinakalkula, binibigyang-kahulugan at pinagkukumpara ng AI ang mga sukatan; ngunit nasa tao ang magpasya kung aling sukatan ang tama para sa iyong negosyo at kung ang isang modelo ay "sapat na mabuti." Ang isang pangkat na tumitingin sa maling sukatan ay maaaring mapagkamalang isang "tagumpay" ang isang masamang modelo sa loob ng maraming buwan.
Bakit hindi sapat ang katumpakan: confusion matrix
Ang unang sukatan na naiisip sa pag-uuri ay ang katumpakan (katumpakan — ang kabuuang ratio ng mga tamang hula). Ngunit tulad ng nakita natin sa Unit 6, ang katumpakan ay nakakapanlinlang sa hindi balanseng data. Ang isang mas mahusay na simula ay ang confusion matrix — isang talahanayan na naghahati sa mga hula sa apat na bin:
- True positive (TP): Tinawag namin ang peke kung ano ang talagang peke. (Mabuti)
- True negative (TN): Sabi namin malinis talaga. (Mabuti)
- False positive (FP): Nagkamali kami ng sinabi na ang malinis ay peke. (False alarm)
- False negative (FN): Na-miss namin ang peke at tinawag itong malinis. (Na-miss na pagbabanta)
Dalawang pangunahing sukatan ang nakukuha sa apat na kahon na ito. Katumpakan: "Gaano karami sa tinatawag kong peke ang talagang peke?" — mahalaga kung mataas ang halaga ng maling alarma. Sensitivity (recall in English): "Ilang tunay na peke ang nahuli ko?" — mahalaga kapag ang nawawalang banta ay mahal. Ang dalawa ay madalas na magkasalungat sa isa't isa: kung ibababa mo ang threshold at magsasabi ng "pekeng" higit pa, tataas ang recall ngunit bababa ang katumpakan. Ang marka ng F1 ay ang balanseng average (harmonic mean) ng dalawang ito.
Pansin: Ang sagot sa tanong na "Aling sukatan ang mahalaga" ay isang desisyon sa negosyo, hindi isang teknikal. Ang pagkawala ng isang kaso (mababang recall) sa screening ng kanser ay nakapipinsala; Nakakainis na magpadala ng mahalagang email sa spam (mababa ang katumpakan) sa filter ng spam. Tinutukoy ng gastos ang sukatan.
Mga sukatan ng regression
Kung numero ang output, iba't ibang sukatan ang ginagamit. MAE (Mean Absolute Error): kung gaano ang paglihis ng mga pagtatantya mula sa aktwal na average, sa parehong unit (hal. "mali tayo ng 4,200 TL sa average"). RMSE (Root Mean Squared Error): pinaparusahan ang malalaking error nang mas matindi at sensitibo sa mga outlier. R² (R-squared — coefficient of determination): kung gaano kalaki ang pagkakaiba-iba sa target na ipinapaliwanag ng modelo (malapit sa 1 ay mabuti, 0 ay kasingsama ng hula sa mean, negatibo ay mas malala pa).
Ang pinaka mapanlinlang na bitag: overlearning
Ang overfitting — kung saan isinasaulo ng modelo ang data ng pagsasanay ngunit nabigo sa bagong data — ay ang pinakakaraniwang pagkakamali sa data science. Ang sintomas ay malinaw: ang modelo ay mahusay sa set ng pagsasanay (98%), masama sa set ng pagsubok (72%). Kabisado ng modelo ang ingay ng partikular na sample na iyon, hindi ang aktwal na pattern sa data. Mayroon ding kabaligtaran: underfitting-ang modelo ay masama sa parehong pagsasanay at pagsubok dahil ito ay masyadong simple upang makuha ang pattern.
Mga paraan upang labanan ang labis na pagkatuto: pagpapasimple sa modelo, higit pang data, regularisasyon — ang mathematical brake na pumipigil sa modelo na maging masyadong kumplikado — at higit sa lahat, cross-validation.
Cross-validation: huwag magtiwala sa solong pane
Ang nag-iisang training/test pod ay maaaring mapalad o malas; Maaari kang makakuha ng matataas na marka para sa set ng pagsubok dahil lang sa madali ang sample na iyon. Malulutas ito ng cross-validation (CV para sa maikli). Ang pinakakaraniwang anyo ay k-fold CV: ang data ay nahahati sa k bahagi (hal. 5); Sa bawat round, isang bahagi ang pagsubok at ang natitira ay pagsasanay; ito ay gumulong ng 5 beses at ang 5 mga marka ay na-average. Kaya makikita mo na ang pagganap ay nakabatay sa average ng maraming hati, hindi isang masuwerteng hati. Ang pamamahagi ng mga marka ay nagbibigay-kaalaman din: ang mga napaka-pabagu-bagong marka (85% sa isang palapag, 62% sa kabilang palapag) ay nagpapahiwatig na ang modelo ay hindi matatag.
Ang normal na k-fold ay hindi ginagamit sa mga serye ng oras (tagalabas ang hinaharap); Sa halip, gagawin mo ang "forward chaining" (time series split): palaging nagsasanay sa nakaraan at sinusubukan ang hinaharap.
panukat
Uri ng problema
Kailan ito mahalaga?
Katumpakan
Pag-uuri
Kung ang mga klase ay balanse
Katumpakan
Pag-uuri
Mahal ang false alarm
Sensitivity (recall)
Pag-uuri
Kung mahal ang makaligtaan
F1
Pag-uuri
Kung kailangan ang balanse
MAE
regression
Naipaliwanag na pagkakamali
RMSE
regression
Kung ang malalaking pagkakamali ay kritikal
R²
regression
kapangyarihang makapagpaliwanag
tatlong mini case
Case 1 — Ang ilusyon ng mataas na katumpakan. Isang modelo ng pandaraya ang nagpakita ng 99.2% na katumpakan at ang koponan ay nagdiwang. Sa pagtingin sa confusion matrix, ang tunay: pekeng rate sa data ay 0.8%; halos walang pekeng nahuli ang modelo, sinasabi lang ang "all clear". Ang recall ay 6%. Aralin: tingnan ang mga sukatan, hindi ang katumpakan.
Case 2 — Latent overlearning. Isang koponan ang naghatid at nagpalakas ng XGBoost sa 97% sa set ng pagsasanay. Ang set ng pagsubok ay 69%, ngunit walang tumingin. Ang modelo ay bumagsak sa produksyon. Kung ang cross-validation ay ginawa, ang malaking pagkakaiba sa pagitan ng mga fold (overlearning) ay makikita na sa simula. Lesson: magtiwala sa CV at test score, hindi education score.
Case 3 — Lucky split. Isang analyst ang natuwa na makakuha ng 88% sa isang split. Nang gumawa ng 5-fold CV ang kanyang kasamahan, ang mga score ay 88%, 71%, 83%, 64%, 79% — ang average ay 77%, ngunit napakabagu-bago nito. Ang modelo ay hindi matatag; Ang nag-iisang kompartimento ay nakaliligaw. Lesson: tingnan ang CV mean at distribution, hindi ang individual bin.
Apat na maaaring kopyahin na mga template
1) Buong ulat ng pag-uuri:
Mayroon akong sinanay na modelo at set ng pagsubok. Bumuo ng: confusion matrix, precision, recall, F1 (para sa bawat klase) at mga bilang ng suporta. Naghihinuha ako, ngunit nasa akin ito: Sasabihin ko sa iyo kung aling sukatan ang mahalaga. Tandaan na ang katumpakan ay maaaring mapanlinlang sa hindi balanseng data.
2) Overlearning control:
I-print ang mga marka ng aking modelo sa parehong hanay ng PAGSASANAY at PAGSUBOK. Kalkulahin ang pagkakaiba sa pagitan ng mga ito at bigyan ng babala dahil ang malaking pagkakaiba ay tanda ng labis na pagkatuto. Kung malaki ang pagkakaiba, magmungkahi ng regularisasyon o pagpapasimple.
3) Cross validation:
Magsagawa ng 5-fold cross-validation (para sa stratified, classification). I-print ang score, mean at standard deviation ng bawat fold. Kung ang mga marka ay masyadong pabagu-bago (high std), ipahiwatig na ang modelo ay hindi matatag. Gumamit ng mga pipeline upang ang mga pagbabago ay matutunan lamang mula sa piraso ng pagsasanay sa bawat layer.
4) Paghahambing ng baseline:
Ilagay ang sukatan ng aking modelo sa tabi ng isang DummyClassifier baseline. Malaki ba ang tinalo ng modelo sa baseline? Kung hindi ito pumasa, gawing malinaw na ang modelo ay hindi nagdaragdag ng anumang tunay na halaga.
Mahinang prompt / Malakas na prompt
Mahinang prompt:
Maganda ba ang model ko?
"Mabuti" ay hindi natukoy; Hindi malinaw kung aling sukatan, aling threshold, aling baseline. Maaaring magbigay ang AI ng isang numero ng katumpakan at manligaw.
Napakahusay na prompt:
Ang iyong tungkulin: katulong sa pagtatasa. Pag-uuri, hindi balanseng data (12% positibo). Priyoridad: alalahanin (hindi nawawala ang mga positibo). Gawain: (1) confusion matrix,(2) precision/recall/F1, (3) 5-fold stratified CV mean and std,(4) DummyClassifier baseline comparison. Tumutok sa recall at pagkakaiba sa baseline, hindi sa katumpakan. Magkomento, ngunit ako ang gumagawa ng pangwakas na desisyon.
Dito, malinaw ang metric priority, CV at baseline condition.
Mga karaniwang pagkakamali
- Pagtitiwala sa katumpakan sa hindi balanseng data. Maaaring hindi makuha ng 99% katumpakan ang klase ng minorya; Tingnan ang confusion matrix.
- Tinitingnan lang ang iyong marka ng edukasyon. Ang mataas na edukasyon, mababang marka ng pagsusulit ay labis na pagkatuto; Palaging ihambing ang dalawang puntos.
- Umaasa sa iisang compartment. Ang masuwerteng dibisyon ay nakaliligaw; Tingnan ang mean at distribution na may cross-validation.
- Hindi inihahambing sa baseline. Hindi mo masasabing "mabuti" nang hindi nalalaman kung ang modelo ay nakakatalo sa isang hangal na predictor.
- Paggamit ng normal na k-fold sa time series. Ito ay tumutulo sa hinaharap; kailangan ng time series split.
Tip: Sumulat ng tatlong numero sa tabi ng bawat modelo: marka ng pagsasanay, average ng cross-validation, at marka ng baseline. Ang trio na ito ay nagpapakita sa isang sulyap na overlearning (pagsasanay >> CV) at undervaluing (CV ≈ baseline).
Sa buod
Ang pagbuo ng isang modelo ay madali, ngunit ang tapat na pagsusuri nito ay mahirap. Sa pag-uuri, ang confusion matrix, precision, at recall ay higit na nagbibigay-kaalaman kaysa sa katumpakan; Tinutukoy ng halaga ng trabaho kung alin ang mahalaga. Ang MAE, RMSE at R² ay ginagamit sa regression. Ang pinaka mapanlinlang na bitag ay ang labis na pagkatuto: palaging ihambing ang pagsasanay at marka ng pagsusulit. Umasa sa ibig sabihin at pamamahagi ng cross-validation, hindi isang split; Ihambing ang lahat sa isang baseline. Kinakalkula ng AI ang lahat ng ito, ngunit nasa tao ang pagpapasya kung aling sukatan ang gagamitin.
Gawain ng aplikasyon
I-extract ang confusion matrix, precision, recall at F1 para sa isang classification model; Pagkatapos ay gawin ang 5-tiklop na cross-validation at tingnan ang pamamahagi ng marka sa mga fold. Panghuli, isulat ang marka ng pagsasanay, average ng CV, at isang marka ng baseline nang magkatabi. Magkomento sa isang pangungusap kung ang iyong modelo ay overlearning at pumasa sa baseline.
checklist
- [ ] Tiningnan ko ba ang aktwal na sukatan ng trabaho (precision/recall/F1 atbp.) sa halip na katumpakan?
- [ ] Nasuri ko na ba ang confusion matrix?
- [ ] Inihambing ko ba ang marka ng pagsasanay at pagsusulit at sinuri ko kung may labis na pagkatuto?
- [ ] Tiningnan ko ba ang mean at distribution na may cross-validation?
- [ ] Inihambing ko ba ang modelo sa isang baseline?