Бірлік 3 / 11

Модельді оқыту және бағалау: дәл өлшемдер, адал салыстыру

Табыстар:

  • Мәселе түріне және бизнес контекстіне сәйкес метриканы таңдау мүмкіндігі (теңгерімсіз деректерде PR-AUC/қайта шақыру, регрессияда MAE/RMSE) және артық/төмен оқуды тану
  • Әрбір көрсеткішті базалық мәнге сәйкес түсіндіру және ауытқуды өлшеу және кросс-валидация арқылы шуды прогресстен бөлу мүмкіндігі
  • Гиперпараметрлерді валидация жинағымен баптау және сынақ жиынын тек соңында пайдалану арқылы оптимистік емес нәтижелерді хабарлау мүмкіндігі

Модельдік оқыту (тренинг: деректерден үлгілерді үйрену процесі) ML инженериясының ең көрінетін, бірақ ең жаңылыстыратын қадамы болып табылады. Бұл «дәлдік 95%» сияқты қанағаттанарлық санды шығаратындықтан пайда болады. Жаңылыстырады, өйткені бұл сан жиі қате сұраққа дұрыс жауап береді. Бұл бөлімде білім беру және бағалау инженерлік пәнмен талқыланады; Біз жасанды интеллектті тәжірибелік дизайндағы серіктес ретінде қолданамыз және шешімді өлшеуге негіздейміз.

Жаттығу циклінің логикасы

Модель деректердегі үлгіні жоғалту функциясын азайту арқылы үйренеді: модель қатесін сандық түрде өлшейтін функция. Оңтайландыру алгоритмі (мысалы, градиенттің төмендеуі) параметрлерді кезең-кезеңмен реттеу арқылы жоғалтуды азайтады. Мұндағы мақсат оқу деректерін есте сақтау емес, оны бұрын-соңды болмаған деректерге жалпылау.

Екі негізгі қауіп:

  • Шамадан тыс орнату: үлгі жаттығу деректерін есте сақтайды және жаңа деректерде сәтсіздікке ұшырайды. Жаттығу табысы жоғары, тексеру табысы төмен.
  • Underfitting: Үлгі үлгіні түсіре алмайды; Жаттығудың да, валидацияның сәттілігі де төмен.

Тепе-теңдікті табу – білім беру өнері. Валидация жинағы осы тепе-теңдікті бақылау үшін бар: егер жаттығу сәттілігі артқан кезде валидация сәттілігі төмендей бастаса, қосымша оқыту басталды.

Кеңес: Әр қадамда жаттығу мен тексеру жоғалуын бірге сызыңыз. Екі қисық бір-бірінен алшақтай бастайтын нүкте - артық оқудың басталуы және «ерте тоқтаудың» дұрыс сәті.

Метрикалық таңдау: ең маңызды шешім

Қате метрика жақсы үлгіні нашар, ал нашар үлгіні жақсы көрсетеді. Мәселе метриканы анықтайды:

  • Теңгерімсіз жіктеу (бір класс өте сирек кездеседі, мысалы, алаяқтық): Дәлдік жаңылыстырады. «Бәрін қалыпты деп атаңыз» деп айтатын модель 99% дәлдікке ие болады, бірақ бірде-бір алаяқтықты ұстамайды. Оның орнына дәлдік (мен ұстағанымның қаншасы шын мәнінде оң), еске түсіру (ұстағанымның қаншасы шын оң) және олардың балансы F1 немесе PR-AUC пайдаланылады.
  • Теңгерімді жіктеу: дәлдік және ROC-AUC сәйкес болуы мүмкін.
  • Регрессия (санды бағалау): MAE (орташа абсолютті қате), RMSE (үлкен қателерді жазалайды), MAPE (пайыздық қате).
  • Рейтинг/ұсыныс: NDCG, MRR, Recall@K.

Дәлдік немесе еске түсіру маңызды ма, бизнес контекстіне байланысты. Естеріңізге салау (бірде-бір пациентті жіберіп алмау) қатерлі ісік скринингіндегі басымдық болып табылады; Спам сүзгісінің дәлдігі (маңызды электрондық хаттарды спамға жібермеу) маңызды. Бұл техникалық емес, іскерлік шешім және оны инженер мен иесі бірге қабылдайды.

Әлсіз шақыру / Күшті шақыру

Әлсіз нұсқау: «Менің үлгімнің өнімділігін бағалаңыз, дәлдігі 0,97».

Күшті нұсқау: "Менде алаяқтықты анықтау үлгісі бар; оң класс көрсеткіші 1,5%. Дәлдік 0,97 деп есептелді. Бұл көрсеткіш неліктен жаңылыс болуы мүмкін екенін түсіндіріңіз, маған қандай көрсеткіштерді (дәлдік, қайта шақыру, PR-AUC) таңдау керек екенін және неліктен екенін айтыңыз. Сондай-ақ, "бәріне теріс қоңырау шалу" қаншалықты дәл екенін есептеңіз, осылайша мен осы деректердің нақты қосылған мәнін көре аламын."

Айырмашылық: күшті шақыру сынып қатынасы мен бизнес контекстін береді; ол сондай-ақ базалық үлгіні салыстыруды сұрайды — бұл метриканың мағыналы болуы үшін ең маңызды тірек.

Базалық: салыстырусыз көрсеткіш мағынасыз

Көрсеткіш өздігінен жақсы немесе жаман емес; Бұл негізгі үлгіге сәйкес жақсы немесе жаман. Негізгі үлгі - бұл ойға келетін ең қарапайым шешім: «әрқашан көпшілікке айт», «өткен аптаның мәнін қайталаңыз», «орташа мәнді болжаңыз». Егер сіздің үлгіңіз осы қарапайым шешімді анық өткізе алмаса, барлық күрделілік бекер.

Абайлаңыз: «Менің үлгісім 85% дәл» деген сөйлем өздігінен ештеңе айтпайды. Егер негізгі үлгі 84% алса, сіздің үлгіңіз дерлік түкке тұрғысыз болады; Негізгі үлгі 50% алса, сіздің үлгіңіз мінсіз. Әрқашан негізгі үлгі бойынша сөйлеңіз.

Айқас валидация және сенім

Жаттығудың/тесттің бір бөлінуі кездейсоқтыққа байланысты болуы мүмкін. Айқас тексеру: деректерді k бөлікке бөлу және әрбір бөлікті дәйекті түрде тексеру өнімділіктің қаншалықты тұрақты екенін көрсетеді. 5 еселік кросс-валидацияда сіз бес түрлі ұпай аласыз; Олардың орташа мәні мен стандартты ауытқуы маңызды. Орташа 80% болса, бірақ ауытқу ±12% болса, сіздің үлгіңіз тұрақсыз — деректердің келесі топтамасында ол мүлдем басқаша әрекет етуі мүмкін.

Бұл «екі модельді салыстыру» үшін де маңызды. Егер А үлгісі 81%, ал В үлгісі 82% алса, В шынымен жақсы ма? Егер ауытқу ±3% болса, бұл айырмашылық шу болуы мүмкін. Шешім қабылдамас бұрын айырмашылықтың маңыздылығын қарастырыңыз.

Гиперпараметрді баптау: тексерумен емес, валидациямен

Гиперпараметрлер (жаттығу алдында қолмен анықталған параметрлер — оқу жылдамдығы, ағаш тереңдігі және т.б.) валидация жиынымен орнатылады. Сынақ жинағы тек соңында бір рет пайдаланылады. Сынақ жинағына қарап гиперпараметрлерді таңдасаңыз, сынақ жинағы ластанған болады және сіз хабарлаған өнімділік оптимистік болады, бұл шын мәнінде ондай емес.

Жасанды интеллект гиперпараметрлік іздеу кеңістігін жобалауда және іздеу кодын жазуда жақсы көмекші болып табылады (торды іздеу, кездейсоқ іздеу, Байестік оңтайландыру). Бірақ сіз әлі де "қай метриканы оңтайландырамыз?"

үш шағын іс

1-жағдай - Дәлдік қақпағы. Медициналық топ сирек кездесетін ауруды анықтаған модельді мақтан тұтты: 98% дәлдік. Негізгі модельді салыстыру кезінде шындық анықталды: ауру деңгейі 2% болғандықтан, «барлығын сау деп атаңыз» деген модель де 98% алды. Модельді еске түсіру бар болғаны 11% болды - пациенттердің көпшілігін жоғалтты. Көрсеткіш PR-AUC мәніне түрлендіруден кейін нақты өнімділік өлшенді және үлгі қайта жасалды.

2-жағдай - шуды ілгерілету деп қателесу. Бір топ айлар бойы модельді 86,2%-дан 86,9%-ға дейін жетілдірді. Кросс-валидация қиғаштық ±1,4% екенін көрсетті, сондықтан 0,7 баллдық «жақсарту» статистикалық шу болды. Команда үш аптаны нақты емес табысқа жұмсады. Сабақ: жақсартудың ауытқудан үлкен екенін тексермей, жеңісті жарияламау.

3-жағдай – Сынақ жинағының ластануы. Ең жақсы гиперпараметрлерді таңдау үшін инженер бірнеше рет сынақ жинағын қарап шықты. Ол хабарлаған 91% өндірісте 83% дейін төмендеді. Неліктен: ол тест жинағына қайта-қайта қарап, үлгіні сәйкесінше таңдап алған (тест жинағы бойынша қосымша білім алу). Бөлек тексеру жинағы пайдаланылған кезде есеп берілген және нақты өнімділік қабаттасады.

Көшіретін үлгілер

Осы жіктеу мәселесі үшін дұрыс көрсеткішті таңдауға көмектесіңіз. Мәселе: [болжамды] Класстың таралуы: [оң мөлшерлеме

Төмендегі екі үлгінің салыстыруын бағалаңыз. А үлгісінің кросс-валидациясы: [балдар тізімі]В үлгісінің кросс-валидациясы: [балдар тізімі]Орташа және стандартты ауытқуды есептеңіз. Айырмашылық статистикалық тұрғыдан маңызды ма, әлде ауытқу ішіндегі шу ғана ма? Маған қайсысын таңдауға кеңес берер едіңіз және неге?

Төмендегілер үшін осы жаттығу кодын тексеріңіз: 1) Гиперпараметрлер сынақ жинағымен немесе валидация жинағымен таңдалған ба?2) Ерте тоқтату дұрыс жиынтықпен бақыланады ма?3) Шамадан тыс оқытудың қандай да бір белгілері бар ма (жаттығу/тексеру жоғалту айырмашылығы)? Код: [код]

Осы регрессия мәселесі үшін MAE, RMSE және MAPE қайсысын хабарлауым керек? Мақсатты айнымалының шкаласы: [ауқым]Үлкен қателер пропорционалды түрде нашар ма (RMSE) немесе олардың барлығы бірдей (MAE)?Нөлге жақын мәндер бар ма (олар MAPE-ді бұрмалайды ма)?Қысқа негіздемемен ұсыныңыз.

Метрикалық таңдау кестесі

Мәселе түрі

Сәйкес метрика

Алдын алу үшін

Неліктен

Теңгерімсіз классификация

PR-AUC, F1, еске түсіріңіз

Дәлдік

Көпшілік класы метриканы көбейтеді

Теңгерімді классификация

Дәлдік, ROC-AUC

Теңгерілген деректерде сенімді

Регрессия (маңызды ауытқу)

RMSE

MAPE (нөл болса)

Үлкен қателіктерді жазалайды

Регрессия (бірдей салмақ)

MAE

Түсіндіру оңай

Рейтинг/ұсыныс

NDCG, Recall@K

Дәлдік

Тапсырыс маңызды

Жалпы қателер

  • Теңгерімсіз деректерде дәлдікті пайдалану. Ең жиі кездесетін метрикалық қате.
  • Негізгі үлгіні салыстырмау. Бұл метриканың мағынасын жоғалтады.
  • Гиперпараметрлерге арналған сынақ жинағына қарау. Оптимистік, шынайы емес нәтиже.
  • Бір бөлікке сүйену. Айқас растаусыз сіз біржақтылықты көре алмайсыз.
  • Шуды ілгерілету деп санау. Ауытқудан кішігірім «жақсартулар» негізінен сәттілік.
  • Іскерлік контекстті елемеу. Дәлдік/қайта шақыру балансы бизнес шешімі болып табылады.

Қысқаша айтқанда

Модельді оқытудағы нағыз шеберлік жоғары сан шығару емес, бұл санның нені білдіретінін білу. Мәселе және бизнес контекст дұрыс көрсеткішті анықтайды; әрбір көрсеткішті базалық үлгіге сәйкес түсіндіру; қиылысуды кросс-валидациямен өлшеңіз және шуды прогресс деп қателеспеңіз; Сынақ жинағын тек соңында бір рет пайдаланыңыз. AI - сіздің тәжірибелік дизайндағы серіктесіңіз, бірақ «жеткілікті жақсы» деген шешім сізге және сізге байланысты.

Қолданбалы тапсырма

Жіктеу моделі үшін: (1) сыныптың таралуын жазыңыз, (2) сәйкес базалық модельді құрыңыз және оның ұпайын өлшеңіз, (3) 5 еселік айқас валидация арқылы үлгіңізді бағалаңыз және орташа және стандартты ауытқуды хабарлаңыз, (4) дәлдіктің орнына мәселеге сәйкес метриканы есептеңіз (мысалы, PR-AUC). Модельіңіз негізгі үлгіден үлкен маржаға қиғаштықсыз жеңетінін жазыңыз.

бақылау парағы

  • [ ] Мен метриканы мәселе түріне және бизнес контекстіне негізделген таңдадым.
  • [ ] Мен негізгі үлгіні құрастырып, онымен салыстырдым.
  • [ ] Мен орташа және ауытқуды айқаспалы тексерумен хабарладым.
  • [ ] Мен жақсартудың ауытқудан жоғары екенін растадым.
  • [ ] Гиперпараметрлерді тексеру жиынымен таңдадым.
  • [ ] Мен сынақ жинағын тек бір рет, ең соңында қолдандым.