Vahid 3 / 11

Model Təlimi və Qiymətləndirmə: Dəqiq Metriklər, Dürüst müqayisə

Qazanclar:

  • Problem növünə və biznes kontekstinə uyğun olan metrikanı seçmək bacarığı (balanssız məlumatlarda PR-AUC/xatırlatma, reqressiyada MAE/RMSE) və artıq/az öyrənməni tanımaq bacarığı
  • Hər bir metrikanı bazaya uyğun şərh etmək və kənarlaşmanı ölçmək və çarpaz doğrulama ilə səs-küyü irəliləyişdən ayırmaq bacarığı
  • Hiperparametrləri doğrulama dəsti ilə tənzimləmək və test dəstindən yalnız sonunda istifadə etməklə qeyri-optimist nəticələri bildirmək imkanı

Model təlimi (təlim: verilənlərdən nümunələrin öyrənilməsi prosesi) ML mühəndisliyinin ən görünən, lakin ən yanlış addımıdır. "Dəqiqlik 95%" kimi qənaətbəxş bir rəqəm çıxardığı üçün görünür. Yanlışdır, çünki bu rəqəm çox vaxt yanlış suala düzgün cavabdır. Bu bölmədə təhsil və qiymətləndirmə mühəndislik fənni ilə müzakirə edilir; Biz eksperimental dizaynda tərəfdaş kimi süni intellektdən istifadə edirik və qərarı ölçməyə əsas veririk.

Təlim dövrünün məntiqi

Model, itki funksiyasını minimuma endirməklə verilənlərdəki nümunəni öyrənir: modelin səhvini ədədi olaraq ölçən funksiya. Optimallaşdırma alqoritmi (məsələn, qradiyent enmə) parametrləri addım-addım tənzimləməklə itkini azaldır. Məqsəd təlim məlumatlarını yadda saxlamaq deyil, onu misli görünməmiş məlumatlara ümumiləşdirməkdir.

İki əsas təhlükə:

  • Həddindən artıq uyğunlaşma: Model təlim məlumatlarını yadda saxlayır və yeni məlumatlarda uğursuz olur. Təlim müvəffəqiyyəti yüksəkdir, yoxlama uğuru aşağıdır.
  • Uyğunsuzluq: Model nümunəni çəkə bilmir; Həm təlim, həm də doğrulama müvəffəqiyyəti aşağıdır.

Balans tapmaq təhsil sənətidir. Doğrulama dəsti bu tarazlığa nəzarət etmək üçün oradadır: əgər təlim müvəffəqiyyəti artdıqca doğrulama müvəffəqiyyəti azalmağa başlayırsa, artıq öyrənmə başlanmışdır.

İpucu: Təlim və doğrulama itkisini hər addımda birlikdə çəkin. İki əyrinin bir-birindən ayrılmağa başladığı nöqtə həddən artıq öyrənmənin başladığı yerdir və "erkən dayandırmaq" üçün doğru andır.

Metrik seçim: ən kritik qərar

Səhv metrik yaxşı modeli pis, pis modeli isə yaxşı göstərir. Problem metrikanı müəyyənləşdirir:

  • Balanssız təsnifat (bir sinif çox nadirdir, məsələn, fırıldaqçılıq): Dəqiqlik aldadıcıdır. "Hər şeyi normal adlandırın" deyən bir model 99% dəqiqlik əldə edəcək, lakin heç bir saxtakarlığı tutmayacaq. Bunun əvəzinə dəqiqlik (tutduğum şeyin nə qədəri əslində müsbətdir), xatırlama (tutduğum şeyin nə qədəri həqiqi müsbətdir) və onların balansı F1 və ya PR-AUC istifadə olunur.
  • Balanslaşdırılmış təsnifat: Dəqiqlik və ROC-AUC uyğun ola bilər.
  • Reqressiya (sayın qiymətləndirilməsi): MAE (orta mütləq səhv), RMSE (böyük səhvləri cəzalandırır), MAPE (faiz xətası).
  • Reytinq/tövsiyə: NDCG, MRR, Recall@K.

Dəqiqliyin və ya geri çağırmanın vacib olub-olmaması biznes kontekstindən asılıdır. Xərçəng müayinəsində geri çağırma (heç bir xəstəni qaçırmamaq) prioritetdir; Spam filtrində dəqiqlik (vacib e-poçtları spama göndərməmək) vacibdir. Bu, texniki deyil, biznes qərarıdır və mühəndis və sahibi tərəfindən birlikdə qəbul edilir.

Zəif məlumat / Güclü göstəriş

Zəif göstəriş: "Modelinin performansını qiymətləndirin, dəqiqliyi 0,97."

Güclü xəbərdarlıq: "Məndə fırıldaqçılığın aşkarlanması modeli var; müsbət sinif nisbəti 1,5%. Dəqiqlik 0,97 olaraq bildirilir. Bu metrikanın niyə yanıltıcı ola biləcəyini izah edin, mənə hansı metriklərə (dəqiqlik, geri çağırma, PR-AUC) üstünlük verməli olduğumu və nəyə görə olduğunu deyin. Həmçinin "hər şeyə mənfi zəng et"in nə qədər dəqiq olduğunu hesablayın, ona görə də bu verilənlər bazası modelində real əlavə dəyər əldə edə bilərəm."

Fərq: güclü sorğu sinif nisbətini və biznes kontekstini verir; o, həmçinin baza modelinin müqayisəsini tələb edir – bu, metrikanın mənalı olub-olmaması üçün ən vacib lövbərdir.

Baza: müqayisəsiz metrik mənasızdır

Metrik özbaşına yaxşı və ya pis deyil; Əsas modelə görə yaxşı və ya pisdir. Əsas model ağla gələn ən sadə həll yoludur: “həmişə əksəriyyət sinfinə deyin”, “keçən həftənin dəyərini təkrarlayın”, “ortanı təxmin edin”. Modeliniz bu sadə həlli aydın şəkildə keçə bilmirsə, bütün mürəkkəblik boş yerədir.

Diqqət: "Mənim modelim 85% dəqiqdir" cümləsi özü heç nə demir. Baza model artıq 84% alırsa, modeliniz demək olar ki, dəyərsizdir; Əsas model 50% alırsa, modeliniz mükəmməldir. Həmişə əsas model baxımından danışın.

Çapraz doğrulama və etibar

Tək təlim/sınaq bölgüsü təsadüf nəticəsində ola bilər. Çarpaz doğrulama: verilənləri k hissəyə bölmək və hər bir hissəni ardıcıl olaraq sınaqdan keçirmək performansın nə qədər sabit olduğunu göstərir. 5-qat çarpaz doğrulamada siz beş fərqli xal alırsınız; Onların orta və standart sapması vacibdir. Orta 80%, lakin sapma ±12% olarsa, modeliniz qeyri-sabitdir - o, növbəti məlumat partiyasında çox fərqli davrana bilər.

Bu, "iki model müqayisəsi" üçün də vacibdir. Model A 81% və Model B 82% aldısa, B həqiqətən yaxşıdır? Əgər sapma ±3% olarsa, bu fərq səs-küy ola bilər. Qərar verməzdən əvvəl fərqin əhəmiyyətli olub olmadığını düşünün.

Hiperparametr tənzimləməsi: yoxlama ilə yox, yoxlama ilə

Hiperparametrlər (təlimdən əvvəl əl ilə müəyyən edilən parametrlər—öyrənmə dərəcəsi, ağacın dərinliyi və s.) doğrulama dəsti ilə müəyyən edilir. Test dəsti yalnız sonunda, bir dəfə istifadə olunur. Test dəstinə baxaraq hiperparametrləri seçsəniz, test dəsti çirklənəcək və bildirdiyiniz performans reallıqda belə olmayan optimist olacaq.

Süni intellekt hiperparametr axtarış məkanının layihələndirilməsində və axtarış kodunun yazılmasında yaxşı köməkçidir (torlu axtarış, təsadüfi axtarış, Bayesian optimallaşdırma). Ancaq yenə də "hansı metrikanı optimallaşdıracağıq?"

üç mini qutu

Case 1 - Dəqiqlik tələsi. Tibb komandası nadir bir xəstəliyi aşkar edən modellə fəxr edirdi: 98% dəqiqlik. Əsas model müqayisəsi aparıldıqda həqiqət üzə çıxdı: xəstəlik nisbəti 2% olduğu üçün "hər kəsə sağlam zəng edin" deyən model də 98% aldı. Modelin geri çağırılması yalnız 11% idi - əksər xəstələr itkin düşdü. Metrik PR-AUC-a çevrildikdən sonra faktiki performans ölçüldü və model yenidən dizayn edildi.

2-ci hal - səs-küyü tərəqqi ilə səhv salmaq. Komanda modeli 86,2%-dən 86,9%-ə qədər təkmilləşdirmək üçün aylar sərf etdi. Çarpaz doğrulama göstərdi ki, qərəz ±1,4% təşkil edib - beləliklə, 0,7 ballıq "yaxşılaşma" statistik səs-küy idi. Komanda üç həftəni qeyri-real qazanclara sərf etmişdi. Dərs: təkmilləşmənin sapmadan daha böyük olduğunu yoxlamadan qələbənizi elan etməyin.

3-cü hal - Test dəstinin çirklənməsi. Mühəndis ən yaxşı hiperparametrləri seçmək üçün sınaq dəstinə dəfələrlə baxdı. Onun bildirdiyi 91% istehsalda 83%-ə düşüb. Niyə: o, özü də bilmədən test dəstinə təkrar-təkrar baxaraq (test toplusunu həddən artıq öyrənərək) modeli buna uyğun seçmişdi. Ayrı-ayrı doğrulama dəsti istifadə edildikdə hesabat verilmiş və faktiki performans üst-üstə düşür.

Kopyalana bilən şablonlar

Bu təsnifat problemi üçün düzgün metrik seçməyimə kömək edin. Problem: [nə proqnozlaşdırılır] Sinif bölgüsü: [müsbət nisbət

Aşağıdakı iki modelin müqayisəsini qiymətləndirin. Model A çarpaz doğrulama: [balların siyahısı]Model B çarpaz doğrulama: [balların siyahısı]Orta və standart kənarlaşmanı hesablayın. Fərq statistik cəhətdən əhəmiyyətlidir, yoxsa sadəcə sapma daxilində səs-küydür? Hansını seçməyimi tövsiyə edərdiniz və niyə?

Aşağıdakılar üçün bu təlim kodunu yoxlayın: 1) Hiperparametrlər test dəsti və ya doğrulama dəsti ilə seçilibmi?2) Erkən dayandırma düzgün dəstlə monitorinq edilirmi?3) Həddindən artıq öyrənmə əlamətləri varmı (təlim/validasiya itkisi fərqi)? Kod: [kod]

Bu reqressiya problemi üçün MAE, RMSE və MAPE-dən hansını bildirməliyəm?Hədəf dəyişənin miqyası: [aralıq]Böyük xətalar qeyri-mütənasib dərəcədə pisdir (RMSE) və ya hamısı bərabərdir (MAE)?Sıfıra yaxın dəyərlər varmı (onlar MAPE-ni təhrif edir)?Qısa əsaslandırma ilə təklif edin.

Metrik seçim cədvəli

Problem növü

Müvafiq metrik

Qarşısını almaq üçün

Niyə

Balanssız təsnifat

PR-AUC, F1, geri çağırın

Dəqiqlik

Çoxluq sinfi metrikanı şişirdir

Balanslaşdırılmış təsnifat

Dəqiqlik, ROC-AUC

Balanslaşdırılmış məlumatlarda etibarlıdır

Reqressiya (əhəmiyyətli kənar)

RMSE

MAPE (sıfır olduqda)

Böyük səhvləri cəzalandırır

Reqressiya (bərabər çəki)

MAE

Təfsir etmək asandır

Reytinq/tövsiyə

NDCG, Recall@K

Dəqiqlik

Sifariş vacibdir

Ümumi səhvlər

  • Balanssız məlumatlarda dəqiqlikdən istifadə. Ən çox görülən metrik xəta.
  • Baza modeli müqayisə etməmək. Bu, metrikanın mənasını itirməsinə səbəb olur.
  • Hiperparametrlər üçün test dəstinə baxırıq. Optimist, qeyri-real nəticə.
  • Tək bir bölməyə güvənmək. Çapraz doğrulama olmadan siz qərəzliyi görməyəcəksiniz.
  • Səs-küyü irəliləyişlə səhv salmaq. Sapmadan kiçik "təkmilləşdirmələr" əsasən şansdır.
  • Biznes kontekstinə məhəl qoymamaq. Dəqiqlik/geri çağırma balansı biznes qərarıdır.

Xülasə

Model təlimində əsl bacarıq yüksək rəqəm çıxarmaq deyil, bu rəqəmin nə demək olduğunu bilməkdir. Problem və biznes konteksti düzgün metrikanı müəyyən edir; hər bir metrikanı baza modelinə uyğun şərh etmək; çarpaz doğrulama ilə qərəzliyi ölçün və səs-küyü tərəqqi ilə səhv salmayın; Test dəstini yalnız sonunda, bir dəfə istifadə edin. Süni intellekt təcrübə dizaynında tərəfdaşınızdır, lakin “kifayət qədər yaxşı” qərarı sizin və sizin ixtiyarınızdadır.

Tətbiq tapşırığı

Təsnifat modeli üçün: (1) sinif paylanmasını yazın, (2) müvafiq əsas modeli qurun və onun xalını ölçün, (3) modelinizi 5 qat çarpaz doğrulama ilə qiymətləndirin və orta və standart kənarlaşmanı bildirin, (4) dəqiqlik əvəzinə problemə uyğun olan metrikanı (məsələn, PR-AUC) hesablayın. Modelinizin əsas modeli qərəzsiz böyük fərqlə üstələdiyini yazın.

yoxlama siyahısı

  • [ ] Problem növü və biznes kontekstinə əsaslanaraq metrikanı seçdim.
  • [ ] Mən əsas model qurdum və onunla müqayisə etdim.
  • [ ] Mən çarpaz doğrulama ilə orta və sapmanı bildirdim.
  • [ ] Təkmilləşdirmənin sapmadan daha böyük olduğunu təsdiqlədim.
  • [ ] Doğrulama dəsti ilə hiperparametrləri seçdim.
  • [ ] Mən test dəstindən yalnız bir dəfə, ən sonunda istifadə etdim.