Qazanclar:
- İşin məqsədinə uyğun olaraq təsnifat və reqressiya ölçülərini (qarışıqlıq matrisi, dəqiqlik/xatırlatma/F1, MAE/RMSE/R²) seçmək və şərh etmək bacarığı
- Təlim və test xallarını müqayisə etməklə həddən artıq öyrənməni aşkar etmək və çarpaz doğrulama ilə etibarlı performans əldə etmək bacarığı
- Hər bir modeli baza ilə müqayisə edərək real dəyər əlavə edib-etmədiyini qiymətləndirmək bacarığı
Model qurmaq asandır; Onun həqiqətən işlədiyini dəqiq ölçmək çətindir. Bu bölmənin mövzusu məlumat aliminin ən kritik bacarığıdır: modeli düzgün ölçülərlə qiymətləndirmək, etibarlı proqnozlaşdırıcı performansa nail olmaq və ən məkrli tələni tutmaq: həddən artıq öyrənmək (yadda saxlamaq). Süni intellekt göstəriciləri hesablayır, şərh edir və müqayisə edir; lakin hansı metrikanın biznesiniz üçün uyğun olduğuna və modelin “kifayət qədər yaxşı” olub-olmamasına qərar vermək insandan asılıdır. Səhv metrikaya baxan bir komanda, aylar ərzində pis modeli “uğur” kimi səhv sala bilər.
Niyə dəqiqlik kifayət deyil: qarışıqlıq matrisi
Təsnifat zamanı ağla gələn ilk metrik dəqiqlikdir (dəqiqlik — düzgün proqnozların ümumi nisbəti). Lakin 6-cı bölmədə gördüyümüz kimi, balanssız məlumatlarla dəqiqlik yanıltıcıdır. Daha yaxşı bir başlanğıc qarışıqlıq matrisidir - proqnozları dörd qutuya bölən cədvəl:
- Əsl müsbət (TP): Biz əslində saxta olanı saxta adlandırdıq. (Yaxşı)
- Əsl mənfi (TN): Həqiqətən təmiz dedik. (Yaxşı)
- Yanlış müsbət (FP): Biz səhvən təmiz olanın saxta olduğunu söylədik. (Yanlış həyəcan)
- Yanlış mənfi (FN): Biz saxtanı əldən verdik və onu təmiz adlandırdıq. (Qaçırılmış təhlükə)
Bu dörd qutudan iki əsas ölçü götürülür. Dəqiqlik: "Saxta dediyim şeylərin nə qədəri əslində saxtadır?" — yanlış siqnalın qiyməti yüksək olduqda vacibdir. Həssaslıq (ingiliscə xatırlayın): "Mən neçə real saxta tutdum?" — təhlükəni qaçırmaq baha olduqda vacibdir. Bu ikisi çox vaxt bir-biri ilə ziddiyyət təşkil edir: həddi aşağı salıb daha çox “saxta” desəniz, geri çağırma artır, lakin dəqiqlik azalır. F1 balı bu ikisinin balanslaşdırılmış ortasıdır (harmonik orta).
Diqqət: "Hansı metrik vacibdir" sualının cavabı texniki deyil, biznes qərarıdır. Xərçəng skrininqində bir işi (aşağı geri çağırma) qaçırmaq fəlakətlidir; Spam filtrində spama (aşağı dəqiqliklə) vacib e-poçt göndərmək qıcıqlandırıcıdır. Xərc metrikanı müəyyənləşdirir.
Reqressiya ölçüləri
Çıxış rəqəmlərdirsə, müxtəlif ölçülərdən istifadə olunur. MAE (Orta Mütləq Səhv): eyni vahiddə təxminlərin faktiki ortadan nə qədər kənara çıxması (məsələn, "orta hesabla 4,200 TL səhv edirik"). RMSE (Root Mean Squared Error): əsas səhvləri daha ciddi şəkildə cəzalandırır və kənar göstəricilərə həssasdır. R² (R-kvadrat — təyinetmə əmsalı): model hədəfdəki dəyişkənliyin nə qədərini izah edir (1-ə yaxın yaxşıdır, 0 orta göstəricini proqnozlaşdırmaq qədər pisdir, mənfi daha da pisdir).
Ən məkrli tələ: həddən artıq öyrənmək
Həddindən artıq uyğunlaşma - modelin təlim məlumatlarını yadda saxladığı, lakin yeni məlumatlarda uğursuzluğu - məlumat elmində ən çox yayılmış səhvdir. Simptom aydındır: model məşq dəstində əladır (98%), test dəstində pisdir (72%). Model verilənlərdəki faktiki nümunəni deyil, həmin xüsusi nümunənin səs-küyünü yadda saxlamışdır. Bunun əksi də var: uyğunsuzluq — model həm təlimdə, həm də sınaqda pisdir, çünki nümunəni çəkmək çox sadədir.
Həddindən artıq öyrənmə ilə mübarizə yolları: modeli sadələşdirmək, daha çox məlumat, nizamlama – modeli çox mürəkkəbləşdirməyə mane olan riyazi əyləc – və ən əsası, çarpaz doğrulama.
Çarpaz doğrulama: tək panelə etibar etməyin
Tək məşq/test podu şanslı və ya uğursuz ola bilər; Sınaq dəsti üçün yüksək qiymətlər ala bilərsiniz, çünki bu nümunə asandır. Çapraz doğrulama (qısaca CV) bunu həll edir. Ən çox yayılmış forma k-qat CV-dir: məlumatlar k hissəyə bölünür (məsələn, 5); Hər turda bir hissə sınaqdan keçir, qalan hissəsi isə məşqdir; bu 5 dəfə yuvarlanır və 5 xal orta hesablanır. Beləliklə, performansın bir şanslı bölünmə deyil, çoxlu bölünmənin ortasına əsaslandığını görəcəksiniz. Balların paylanması da informativdir: çox dəyişkən ballar (bir mərtəbədə 85%, digər mərtəbədə 62%) modelin qeyri-sabit olduğunu göstərir.
Zaman sıralarında normal k-qat istifadə edilmir (gələcəyi sızdırır); Bunun əvəzinə siz "irəli zəncirləmə" (zaman seriyalarının bölünməsi) edirsiniz: həmişə keçmişlə məşq edirsiniz və gələcəyi sınaqdan keçirirsiniz.
metrik
Problem növü
Nə vaxt əhəmiyyət kəsb edir?
Dəqiqlik
Təsnifat
Əgər dərslər balanslaşdırılmışdırsa
Dəqiqlik
Təsnifat
Yanlış siqnal bahadır
Həssaslıq (xatırlamaq)
Təsnifat
Darıxmaq bahadırsa
F1
Təsnifat
Balans lazımdırsa
MAE
reqressiya
Şərh edilə bilən xəta
RMSE
reqressiya
Böyük səhvlər kritikdirsə
R²
reqressiya
izahedici güc
üç mini qutu
1-ci hal - Yüksək dəqiqlik illüziyası. Bir saxtakarlıq modeli 99,2% dəqiqlik göstərdi və komanda bunu qeyd etdi. Qarışıqlıq matrisinə baxsaq, real: məlumatlarda saxta nisbət 0,8% idi; model demək olar ki, heç bir saxtakarlıq tutmadı, sadəcə "hər şey aydındır" dedi. Geri çağırma 6% idi. Dərs: dəqiqliyə deyil, ölçülərə baxın.
2-ci hal – Gizli həddən artıq öyrənmə. Bir komanda təlim dəstində XGBoost-u 97%-ə çatdırdı və artırdı. Test dəsti 69% idi, amma heç kim baxmadı. Model istehsal zamanı çökdü. Çapraz doğrulama aparılsaydı, qatlar arasındakı böyük fərq (həddindən artıq öyrənmə) əvvəldən görünəcəkdi. Dərs: CV və test balına etibar edin, təhsil balına yox.
3-cü hal - Şanslı bölünmə. Bir analitik bir bölünmədə 88% əldə etməkdən məmnun idi. Onun həmkarı 5 qat CV hazırlayanda ballar 88%, 71%, 83%, 64%, 79% idi — orta hesabla 77%, lakin çox dəyişkəndir. Model qeyri-sabit idi; Tək kupe aldadıcı idi. Dərs: fərdi qutuya deyil, CV-nin orta və paylanmasına baxın.
Dörd kopyalana bilən şablon
1) Tam təsnifat hesabatı:
Model və test dəstini öyrətmişəm. Yaradın: qarışıqlıq matrisi, dəqiqlik, geri çağırma, F1 (hər sinif üçün) və dəstək sayları. Mən nəticə çıxarıram, amma bu məndən asılıdır: hansı metrikanın vacib olduğunu sizə deyəcəyəm. Nəzərə alın ki, dəqiqlik balanssız məlumatlarla yanıltıcı ola bilər.
2) Əlavə öyrənmə nəzarəti:
Modelimin həm TƏLİM, həm də TEST dəstlərindəki xallarını yan-yana çap edin. Aralarındakı fərqi hesablayın və xəbərdarlıq edin, çünki böyük fərq həddindən artıq öyrənmə əlamətidir. Fərq böyükdürsə, nizamlanma və ya sadələşdirmə təklif edin.
3) Çarpaz doğrulama:
5-qat çarpaz doğrulama həyata keçirin (stratifikasiya, təsnifat üçün). Hər qatın hesabını, orta və standart kənarlaşmasını çap edin. Əgər ballar çox dəyişkəndirsə (yüksək std), modelin qeyri-sabit olduğunu göstərin. Boru kəmərlərindən istifadə edin ki, transformasiyalar yalnız hər bir təbəqədə təlim parçasından öyrənilsin.
4) İlkin müqayisə:
Modelimin metrikasını DummyClassifier bazası ilə yan-yana qoyun. Model əsas xətti əhəmiyyətli dərəcədə üstələyirmi? Əgər keçmirsə, modelin heç bir real dəyər əlavə etmədiyini aydınlaşdırın.
Zəif məlumat / Güclü göstəriş
Zəif çağırış:
Modelim yaxşıdır?
"Yaxşı" qeyri-müəyyəndir; Hansı metrik, hansı həddi, hansı baza xətti olduğu aydın deyil. Süni intellekt tək bir dəqiqlik nömrəsini verə bilər və səhv sala bilər.
Güclü göstəriş:
Rolunuz: qiymətləndirmə köməkçisi. Təsnifat, balanssız məlumatlar (12% müsbət). Prioritet: geri çağırmaq (pozitivləri qaçırmamaq). Tapşırıq: (1) çaşqınlıq matrisi, (2) dəqiqlik/xatırlatma/F1, (3) 5-qat təbəqəli CV orta və std, (4) DummyClassifier baza müqayisəsi. Dəqiqliyə deyil, geri çağırma və əsas fərqə diqqət yetirin. Şərh edin, amma son qərarı mən verirəm.
Burada metrik prioritet, CV və ilkin vəziyyət aydındır.
Ümumi səhvlər
- Balanssız məlumatlarda dəqiqliyə inanmaq. 99% dəqiqlik azlıq sinfini ümumiyyətlə tutmaya bilər; Qarışıqlıq matrisinə baxın.
- Sadəcə təhsil balınıza baxırsınız. Yüksək təhsil, aşağı test balı həddən artıq öyrənmə; Həmişə iki balı müqayisə edin.
- Tək bir bölməyə güvənmək. Xoşbəxt bölgü aldadıcıdır; Çarpaz doğrulama ilə orta və paylamaya baxın.
- Baza ilə müqayisə olunmur. Modelin axmaq bir proqnozlaşdırıcını məğlub edib-etmədiyini bilmədən "yaxşı" deyə bilməzsiniz.
- Zaman sıralarında normal k-qatdan istifadə. Gələcəyi sızdırır; zaman sıralarının bölünməsi tələb olunur.
İpucu: Hər bir modelin yanında üç rəqəm yazın: təlim balı, çarpaz doğrulama ortası və əsas xal. Bu üçlük bir baxışda həddən artıq öyrənmə (təlim >> CV) və aşağı qiymət verməyi (CV ≈ baza səviyyəsi) aşkar edir.
Xülasə
Model yaratmaq asandır, amma onu vicdanla qiymətləndirmək çətindir. Təsnifatda çaşqınlıq matrisi, dəqiqlik və geri çağırma dəqiqlikdən daha çox informativdir; İşin dəyəri hansının vacib olduğunu müəyyənləşdirir. Reqressiyada MAE, RMSE və R² istifadə olunur. Ən məkrli tələ həddən artıq öyrənməkdir: həmişə məşq və test xalını müqayisə edin. Tək bölünmə deyil, çarpaz doğrulamanın orta və paylanmasına etibar edin; Hər şeyi bir baza ilə müqayisə edin. Süni intellekt bütün bunları hesablayır, lakin hansı metrikanı istifadə edəcəyinə insan özü qərar verir.
Tətbiq tapşırığı
Təsnifat modeli üçün qarışıqlıq matrisini, dəqiqliyi, geri çağırma və F1 çıxarın; Sonra 5-qat çarpaz doğrulama aparın və qatlar üzrə xalların paylanmasına baxın. Nəhayət, təlim balını, CV ortasını və əsas xalını yan-yana yazın. Modelinizin həddən artıq öyrəndiyini və əsas xətti keçib-keçmədiyini bir cümlə ilə şərh edin.
yoxlama siyahısı
- [ ] Dəqiqlik əvəzinə işin faktiki ölçüsünə (dəqiqlik/xatırlatma/F1 və s.) baxdımmı?
- [ ] Mən qarışıqlıq matrisini araşdırdımmı?
- [ ] Təlim və test xalını müqayisə edib, həddən artıq öyrənməni yoxladımmı?
- [ ] Çapraz doğrulama ilə orta və paylamaya baxmışammı?
- [ ] Mən modeli baza ilə müqayisə etmişəmmi?