Birlik 3 / 11

Modelni o'qitish va baholash: To'g'ri ko'rsatkichlar, halol taqqoslash

Daromadlar:

  • Muammo turiga va biznes kontekstiga mos keladigan ko'rsatkichni tanlash qobiliyati (balanssiz ma'lumotlarda PR-AUC / eslab qolish, regressiyada MAE / RMSE) va o'rganilgandan ko'ra / kamligini tan olish
  • Har bir ko'rsatkichni asosiy ko'rsatkichga nisbatan talqin qilish va og'ishlarni o'lchash va o'zaro tasdiqlash bilan shovqinni progressdan ajratish qobiliyati
  • Giperparametrlarni tekshirish to'plami bilan sozlash va sinov to'plamidan faqat oxirida foydalanish orqali optimistik bo'lmagan natijalar haqida xabar berish imkoniyati

Modelli trening (trening: ma'lumotlardan naqshlarni o'rganish jarayoni) ML muhandisligining eng ko'zga ko'ringan, ammo eng chalg'ituvchi bosqichidir. Bu "aniqlik 95%" kabi qoniqarli raqamni ishlab chiqargani uchun paydo bo'ladi. Adashgan, chunki bu raqam ko'pincha noto'g'ri savolga to'g'ri javobdir. Ushbu bo'limda ta'lim va baholash muhandislik intizomi bilan muhokama qilinadi; Biz sun'iy intellektdan eksperimental dizaynda sherik sifatida foydalanamiz va qarorni o'lchovga asoslaymiz.

Trening tsiklining mantiqiyligi

Model yo'qotish funktsiyasini minimallashtirish orqali ma'lumotlardagi naqshni o'rganadi: model xatosini raqamli o'lchaydigan funktsiya. Optimallashtirish algoritmi (masalan, gradient tushishi) parametrlarni bosqichma-bosqich sozlash orqali yo'qotishni kamaytiradi. Maqsad o'quv ma'lumotlarini yodlash emas, balki uni misli ko'rilmagan ma'lumotlarga umumlashtirishdir.

Ikki asosiy xavf:

  • Haddan tashqari moslashish: Model mashg'ulot ma'lumotlarini yodlaydi va yangi ma'lumotlarda muvaffaqiyatsizlikka uchraydi. Trening muvaffaqiyati yuqori, tekshirish muvaffaqiyati past.
  • Underfitting: Model naqshni ushlay olmaydi; Trening va tasdiqlash muvaffaqiyati ham past.

Muvozanatni topish ta'lim san'atidir. Tasdiqlash to'plami ushbu muvozanatni kuzatish uchun mavjud: agar tekshirish muvaffaqiyati pasaysa, trening muvaffaqiyati ortib borayotgan bo'lsa, ortiqcha o'rganish boshlandi.

Maslahat: Har bir bosqichda trening va tekshirish yo'qotilishini birgalikda belgilang. Ikki egri chiziq ajralib chiqa boshlagan nuqta - bu ortiqcha o'rganish boshlanadi va "erta to'xtash" uchun to'g'ri vaqtdir.

Metrik tanlov: eng muhim qaror

Noto'g'ri ko'rsatkich yaxshi modelni yomon ko'rsatadi, yomon model esa yaxshi ko'rinadi. Muammo ko'rsatkichni aniqlaydi:

  • Balanssiz tasnif (bir sinf juda kam uchraydi, masalan, firibgarlik): Aniqlik noto'g'ri. "Hamma narsani normal deb nomlang" degan model 99% aniqlikka erishadi, lekin birorta ham firibgarlikni ushlamaydi. Buning o'rniga, aniqlik (men tutgan narsamning qanchasi haqiqatda ijobiy), eslab qolish (men tutgan narsamning qanchasi haqiqiy ijobiy) va ularning balansi F1 yoki PR-AUC ishlatiladi.
  • Balanslangan tasnif: Aniqlik va ROC-AUC mos kelishi mumkin.
  • Regressiya (raqamni baholash): MAE (o'rtacha mutlaq xato), RMSE (katta xatolarni jazolaydi), MAPE (foiz xatosi).
  • Reyting/tavsiya: NDCG, MRR, Recall@K.

Aniqlik yoki eslab qolish muhimmi, biznes kontekstiga bog'liq. Eslab qolish (hech qanday bemorni o'tkazib yubormaslik) saraton skriningida ustuvor ahamiyatga ega; Spam filtrida aniqlik (muhim elektron xatlarni spamga yubormaslik) muhim. Bu texnik qaror emas, balki biznes qaroridir va muhandis va egasi tomonidan birgalikda qabul qilinadi.

Zaif taklif / Kuchli taklif

Zaif taklif: "Modelimning ishlashini baholang, aniqligi 0,97."

Kuchli maslahat: "Menda firibgarlikni aniqlash modeli bor; musbat sinf darajasi 1,5%. Aniqlik 0,97 sifatida qayd etilgan. Bu ko‘rsatkich nima uchun chalg‘ituvchi bo‘lishi mumkinligini tushuntiring, menga qaysi ko‘rsatkichlarni (aniqlik, eslab qolish, PR-AUC) afzal ko‘rishim kerakligini va nima uchun ekanligini ayting. Shuningdek, “hamma narsani salbiy deb chaqirish” qanchalik to‘g‘riligini hisoblab chiqing, shuning uchun men ushbu asosiy ma’lumotlarning haqiqiy qo‘shilgan qiymatini ko‘ra olaman.”

Farqi: kuchli taklif sinf nisbati va biznes kontekstini beradi; u shuningdek, asosiy modelni taqqoslashni so'raydi - bu metrikaning mazmunli yoki yo'qligi uchun eng muhim langar.

Boshlang'ich: taqqoslashsiz ko'rsatkich ma'nosiz

Ko'rsatkich o'z-o'zidan yaxshi yoki yomon emas; Asosiy modelga ko'ra yaxshi yoki yomon. Asosiy model aqlga kelgan eng oddiy yechimdir: "har doim ko'pchilik sinfiga ayting", "o'tgan haftaning qiymatini takrorlang", "o'rtachani taxmin qiling". Agar sizning modelingiz ushbu oddiy echimdan aniq o'tolmasa, barcha murakkabliklar behuda.

Diqqat: "Mening modelim 85% aniq" jumlasi o'z-o'zidan hech narsa demaydi. Agar asosiy model allaqachon 84% olgan bo'lsa, sizning modelingiz deyarli qadrsizdir; Agar asosiy model 50% ni olsa, sizning modelingiz mukammaldir. Har doim asosiy model nuqtai nazaridan gapiring.

O'zaro tasdiqlash va ishonch

Bitta trening/sinov bo'linishi tasodif tufayli bo'lishi mumkin. O'zaro tekshirish: ma'lumotlarni k qismga bo'lish va har bir qismni ketma-ket sinovdan o'tkazish ishlashning qanchalik barqarorligini ko'rsatadi. 5 marta o'zaro tekshirishda siz besh xil ball olasiz; Ularning o'rtacha va standart og'ishlari muhim ahamiyatga ega. Agar o'rtacha 80% bo'lsa, lekin og'ish ±12% bo'lsa, sizning modelingiz beqaror - keyingi ma'lumotlar to'plamida u juda boshqacha harakat qilishi mumkin.

Bu "ikki modelni taqqoslash" uchun ham juda muhimdir. Agar A modeli 81% va B modeli 82% olgan bo'lsa, B haqiqatdan ham yaxshiroqmi? Agar og'ish ± 3% bo'lsa, bu farq shovqin bo'lishi mumkin. Qaror qabul qilishdan oldin farq muhimmi yoki yo'qligini ko'rib chiqing.

Giperparametrni sozlash: tekshirish bilan emas, balki tekshirish bilan

Giperparametrlar (mashqdan oldin qo'lda aniqlangan sozlamalar - o'rganish tezligi, daraxt chuqurligi va boshqalar) tekshirish to'plami bilan o'rnatiladi. Sinov to'plami faqat oxirida, bir marta ishlatiladi. Agar siz test to'plamiga qarab giperparametrlarni tanlasangiz, test to'plami ifloslangan bo'ladi va siz hisobot bergan ishlash optimistik bo'ladi, bu haqiqatda bunday emas.

Sun'iy intellekt giperparametrli qidiruv maydonini loyihalashda va qidiruv kodini yozishda yaxshi yordamchi hisoblanadi (tarmoqli qidiruv, tasodifiy qidiruv, Bayesian optimallashtirish). Lekin siz hali ham "qaysi ko'rsatkichni optimallashtiramiz?"

uchta mini holat

1-holat - Aniqlik tuzog'i. Tibbiy guruh noyob kasallikni aniqlagan model bilan faxrlanishdi: 98% aniqlik. Asosiy modelni taqqoslash amalga oshirilganda, haqiqat paydo bo'ldi: kasallik darajasi 2% bo'lganligi sababli, "hammani sog'lom deb chaqiring" degan model ham 98% ni oldi. Modelni chaqirib olish atigi 11% ni tashkil etdi - ko'pchilik bemorlarni yo'qotdi. Ko'rsatkich PR-AUC ga aylantirilgandan so'ng, haqiqiy ishlash o'lchandi va model qayta ishlab chiqildi.

2-holat - shovqinni taraqqiyot deb xato qilish. Jamoa modelni 86,2% dan 86,9% gacha yaxshilash uchun bir necha oy vaqt sarfladi. O'zaro tekshirish shuni ko'rsatdiki, tarafkashlik ± 1,4% edi - shuning uchun 0,7 ball "yaxshilanish" statistik shovqin edi. Jamoa uch haftani noreal daromadga sarflagan edi. Dars: yaxshilanish og'ishdan kattaroq ekanligini tekshirmasdan g'alabani e'lon qilmang.

3-holat - sinov majmuasining ifloslanishi. Muhandis eng yaxshi giperparametrlarni tanlash uchun test majmuasiga qayta-qayta qaradi. U bildirgan 91% ishlab chiqarishda 83% ga kamaydi. Nima uchun: u bilmagan holda test to'plamini qayta-qayta ko'rib, shunga mos ravishda modelni tanlagan (test to'plamini o'rganish). Alohida tekshirish to'plami ishlatilganda hisobot qilingan va haqiqiy ishlash bir-biriga mos tushdi.

Nusxalanadigan shablonlar

Ushbu tasniflash muammosi uchun to'g'ri ko'rsatkichni tanlashga yordam bering. Muammo: [prognoz qilingan] Sinf taqsimoti: [ijobiy ko'rsatkich

Quyidagi ikkita modelni solishtirishni baholang. Model A o‘zaro tekshirish: [ballar ro‘yxati]B modeli o‘zaro tasdiqlash: [ballar ro‘yxati]O‘rtacha va standart og‘ishlarni hisoblang. Farq statistik jihatdan ahamiyatlimi yoki bu og'ish ichidagi shovqinmi? Qaysi birini tanlashni tavsiya qilasiz va nima uchun?

Quyidagilar uchun ushbu oʻquv kodini tekshiring: 1) Giperparametrlar test toʻplami yoki tekshirish toʻplami bilan tanlanganmi?2) Erta toʻxtatish toʻgʻri toʻplam bilan nazorat qilinadimi?3) Haddan tashqari oʻrganish belgilari bormi (trening/validatsiya yoʻqotish farqi)? Kod: [kod]

Ushbu regressiya muammosi uchun MAE, RMSE va MAPE dan qaysi biri haqida xabar berishim kerak? Maqsadli o‘zgaruvchining shkalasi: [diapazon]Katta xatolar nomutanosib darajada yomonmi (RMSE) yoki ularning barchasi tengmi (MAE)? Nolga yaqin qiymatlar bormi (ular MAPEni buzadimi)?Qisqa asoslash bilan taklif qiling.

Metrik tanlash jadvali

Muammo turi

Tegishli ko'rsatkich

Oldini olish uchun

Nima uchun

Balanssiz tasnif

PR-AUC, F1, eslang

Aniqlik

Ko'pchilik sinf metrikani oshiradi

Balanslangan tasnif

Aniqlik, ROC-AUC

Balanslangan ma'lumotlarda ishonchli

Regressiya (muhim chetga chiqish)

RMSE

MAPE (agar nol bo'lsa)

Katta xatolarni jazolaydi

Regressiya (teng og'irlik)

MAE

Talqin qilish oson

Reyting/tavsiya

NDCG, Recall@K

Aniqlik

Buyurtma muhim

Umumiy xatolar

  • Balanssiz ma'lumotlarda aniqlikdan foydalanish. Eng keng tarqalgan metrik xato.
  • Asosiy modelni taqqoslash emas. Bu metrikani o'z ma'nosini yo'qotadi.
  • Giperparametrlar uchun test to'plamiga qarash. Optimistik, haqiqiy bo'lmagan natija.
  • Bitta bo'limga tayanish. O'zaro tasdiqlashsiz siz tarafkashlikni ko'rmaysiz.
  • Taraqqiyot uchun shovqinni xato qilish. Og'ishlardan kichik "yaxshilanishlar" asosan omaddir.
  • Biznes kontekstiga e'tibor bermaslik. Aniqlik/eslab qolish balansi biznes qaroridir.

Xulosa

Modelni o'qitishdagi haqiqiy mahorat yuqori raqamni ishlab chiqarish emas, balki bu raqam nimani anglatishini bilishdir. Muammo va biznes konteksti to'g'ri ko'rsatkichni aniqlaydi; har bir ko'rsatkichni asosiy modelga muvofiq talqin qilish; noto'g'rilikni o'zaro tasdiqlash bilan o'lchang va shovqinni progress deb hisoblamang; Sinov to'plamini faqat oxirida, bir marta foydalaning. AI tajriba dizaynidagi hamkoringizdir, ammo "etarlicha yaxshi" qarori sizga va siznikiga bog'liq.

Ilova vazifasi

Tasniflash modeli uchun: (1) sinf taqsimotini yozing, (2) tegishli bazaviy modelni tuzing va uning ballini o'lchang, (3) modelingizni 5 marta o'zaro tekshirish bilan baholang va o'rtacha va standart og'ish haqida xabar bering, (4) aniqlik o'rniga muammoga mos keladigan ko'rsatkichni (masalan, PR-AUC) hisoblang. Sizning modelingiz asosiy modeldan katta farq bilan ustunlik qiladimi yoki yo'qligini yozing.

nazorat ro'yxati

  • [ ] Men muammo turi va biznes konteksti asosida ko‘rsatkichni tanladim.
  • [ ] Men asosiy modelni yaratdim va u bilan solishtirdim.
  • [ ] Men o'rtacha va og'ishlarni o'zaro tekshirish bilan xabar qildim.
  • [ ] Men yaxshilanish og'ishdan kattaroq ekanligini tasdiqladim.
  • [ ] Men tekshirish to'plami bilan giperparametrlarni tanladim.
  • [ ] Men sinov to'plamini faqat bir marta, eng oxirida ishlatganman.