бирдиги 3 / 11

Моделди окутуу жана баалоо: Так метрика, чынчыл салыштыруу

Пайдалар:

  • Көйгөйдүн түрүнө жана бизнес контекстине ылайыктуу метриканы тандап алуу (PR-AUC/салмаксыз маалыматтарда, MAE/RMSE регрессияда) жана ашыкча/азыраак үйрөнүүнү таануу
  • Ар бир метриканы базалык көрсөткүчкө каршы чечмелөө жана четтөөлөрдү өлчөө жана ызы-чууну прогресстен бөлүү жөндөмү.
  • Гиперпараметрлерди валидация топтому менен тууралоо жана сыноо топтомун аягында гана колдонуу менен оптимисттик эмес жыйынтыктарды билдирүү мүмкүнчүлүгү

Моделдик окутуу (тренинг: маалыматтардан үлгүлөрдү үйрөнүү процесси) ML инженериясынын эң көрүнүктүү, бирок эң жаңылыштыруучу кадамы. Бул "тактык 95%" сыяктуу канааттандырарлык санды чыгаргандыктан пайда болот. Адаштыруучу, анткени бул сан көбүнчө туура эмес суроого туура жооп. Бул бөлүмдө билим берүү жана баалоо инженердик дисциплина менен талкууланат; Биз эксперименталдык долбоордо өнөктөш катары жасалма интеллектти колдонобуз жана чечимди өлчөөгө негиздейбиз.

Тренинг циклинин логикасы

Модель жоготуу функциясын минималдаштыруу аркылуу берилиштердеги үлгүнү үйрөнөт: моделдин катасын сандык өлчөөчү функция. Оптималдаштыруу алгоритми (мисалы, градиенттин түшүүсү) параметрлерди кадам сайын тууралоо аркылуу жоготууну азайтат. Максаты окуу маалыматтарын жаттоо эмес, аны болуп көрбөгөндөй маалыматтарга жалпылоо.

Эки негизги коркунуч:

  • Overfitting: Модель машыгуу маалыматтарын жаттап алат жана жаңы маалыматтарда иштебей калат. Машыгуунун ийгилиги жогору, текшерүүнүн ийгилиги төмөн.
  • Underfitting: модель үлгү түшүрө албайт; Окутуунун да, валидациянын да ийгилиги төмөн.

Тең салмактуулукту табуу - бул билим берүү искусствосу. Валидация топтому бул тең салмактуулукту көзөмөлдөө үчүн бар: эгер валидация ийгилиги азайып, машыгуунун ийгилиги жогорулап бара жатса, ашыкча үйрөнүү башталды.

Кеңеш: Ар бир кадамда машыгуу жана валидация жоготууларын чогуу планыңыз. Эки ийри сызык бири-биринен ажырай баштаган чекит - бул ашыкча окуу башталат жана "эрте токтотууга" ылайыктуу учур.

Метрикалык тандоо: эң маанилүү чечим

Туура эмес метрика жакшы моделди жаман, ал эми жаман модель жакшы көрүнөт. Маселе метриканы аныктайт:

  • Баланссыз классификация (бир класс өтө сейрек кездешет, мисалы, алдамчылык): Тактык адаштыруучу. "Баарын нормалдуу деп ата" деген модель 99% тактыкка ээ болот, бирок бир дагы алдамчылыкты кармабайт. Анын ордуна, тактык (мен кармаганымдын канчасы чындыгында позитивдүү), эстеп калуу (мен кармаганымдын канчасы чыныгы оң) жана алардын балансы F1 же PR-AUC колдонулат.
  • Салмактуу классификация: Тактык жана ROC-AUC ылайыктуу болушу мүмкүн.
  • Регрессия (санды баалоо): MAE (абсолюттук катаны билдирет), RMSE (чоң каталарды жазалайт), MAPE (пайыздык ката).
  • Рейтинг/сунуш: NDCG, MRR, Recall@K.

Тактык же кайра чакыртып алуу маанилүүбү бизнес контексттен көз каранды. Эстөө (эч кандай бейтаптарды калтырбоо) рак скринингинде артыкчылыктуу болуп саналат; Спам чыпкасындагы тактык (маанилүү электрондук каттарды спамга жөнөтпөө) маанилүү. Бул техникалык эмес, бизнес чечими жана инженер менен менчик ээси бирге кабыл алат.

Алсыз тездик / Күчтүү тездик

Алсыз эскертүү: "Менин моделимдин иштешин баалаңыз, тактыгы 0,97."

Күчтүү кеңеш: "Менде алдамчылыкты аныктоо модели бар; класстын оң көрсөткүчү 1,5%. Тактык 0,97 деп билдирилди. Бул метрика эмне үчүн адаштыруучу болушу мүмкүн экенин түшүндүрүп бериңиз, мага кайсы метрикага (тактык, кайра чакырып алуу, PR-AUC) артыкчылык беришим керектигин жана эмне үчүн айтыңыз. Ошондой эле "баарын терс деп атаңыз" канчалык так эсептеп көрсөңүз, бул базалык маалыматтардын чыныгы кошумча маанисин көрө алам."

Айырмасы: күчтүү тездик класстын катышын жана бизнес контекстти берет; ал ошондой эле базалык моделди салыштырууну сурайт — бул метрика мааниге ээ же жокпу үчүн эң маанилүү казык.

Базалык көрсөткүч: салыштыруусуз метрика маанисиз

Метрика өзүнөн өзү жакшы же жаман эмес; Бул негизги моделге ылайык жакшы же жаман. Негизги модель - бул эң жөнөкөй чечим: "ар дайым көпчүлүк класска айтыңыз", "өткөн жуманын баасын кайталаңыз", "орточо баалаңыз". Эгерде сиздин моделиңиз бул жөнөкөй чечимди так аткара албаса, анда бардык татаалдык бекер.

Абайлаңыз: "Менин моделим 85% так" деген сүйлөм өзү эч нерсе айтпайт. Эгерде базалык модель буга чейин 84% алса, сиздин моделиңиз дээрлик эч нерсеге арзыбайт; Эгерде базалык модель 50% алса, сиздин моделиңиз идеалдуу. Дайыма негизги үлгү боюнча сүйлө.

Кайчылаш текшерүү жана ишеним

Бир окуу/тесттик бөлүнүү кокустуктан улам болушу мүмкүн. Кайчылаш текшерүү: маалыматтарды k бөлүккө бөлүү жана ар бир бөлүктүн ырааттуу түрдө сыналышы аткаруунун канчалык туруктуу экенин көрсөтөт. 5 эселенген кайчылаш текшерүүдө сиз беш түрдүү упай аласыз; Алардын орточо жана стандарттык четтөө маанилүү. Эгерде орточо көрсөткүч 80% болсо, бирок четтөө ±12% болсо, сиздин моделиңиз туруксуз болуп саналат — ал маалыматтардын кийинки партиясында такыр башкача болушу мүмкүн.

Бул "эки моделди салыштыруу" үчүн да маанилүү. А модели 81% жана В модели 82% алса, В чындап эле жакшыбы? Эгерде четтөө ±3% болсо, бул айырма ызы-чуу болушу мүмкүн. Чечүүдөн мурун айырмачылыктын маанилүүлүгүн карап көрүңүз.

Hyperparameter тюнинг: текшерүү менен эмес, текшерүү менен

Гиперпараметрлер (машыгуу алдында кол менен аныкталган орнотуулар — үйрөнүү ылдамдыгы, дарактын тереңдиги ж.б.) валидация топтому менен орнотулат. Сыноо топтому аягында бир жолу гана колдонулат. Эгер сиз тест топтомун карап гиперпараметрлерди тандасаңыз, тест топтому булганып калат жана сиз билдирген көрсөткүч оптимисттик болот, бул чындыгында андай эмес.

Жасалма интеллект гиперпараметрдик издөө мейкиндигин долбоорлоодо жана издөө кодун жазууда жакшы жардамчы болуп саналат (тордон издөө, кокус издөө, Байес оптимизациясы). Бирок сиз дагы эле "кайсы метриканы оптималдаштырабыз?"

үч мини учурлар

1-жагдай - тактык капкан. Медициналык топ сейрек кездешүүчү ооруну аныктаган модель менен сыймыктанды: 98% тактык. Негизги моделди салыштырганда, чындык ачыкка чыкты: оорунун деңгээли 2% болгондуктан, "баарын дени сак деп чакыр" деген модель да 98% алды. Модельди кайра чакыртып алуу 11% гана түздү - бейтаптардын көбү жок. Метрика PR-AUCке айландырылгандан кийин, иш жүзүндөгү аткаруу өлчөнгөн жана модель кайра иштелип чыккан.

2-жагдай - ызы-чууну прогресс деп жаңылыштык. Команда моделди 86,2% дан 86,9% га чейин жакшыртуу үчүн айларды өткөрдү. Кайчылаш текшерүү ±1,4% калыс экенин көрсөттү - ошондуктан 0,7 пунктка "жакшыртуу" статистикалык ызы-чуу болду. Команда үч жуманы реалдуу эмес кирешеге короткон. Сабак: жакшыруу четтөөдөн чоң экенин текшербей туруп, жеңишти жарыялабаңыз.

3-жагдай – Сыноолордун комплектинин булганышы. Инженер мыкты гиперпараметрлерди тандоо үчүн тесттик топтомду бир нече жолу карап чыкты. Ал билдирген 91% өндүрүштө 83% га чейин төмөндөдү. Эмне үчүн: ал билбестен тесттик топтомду кайра-кайра карап, ошого жараша моделди тандап алган (тест топтомун ашыкча үйрөнүү). Өзүнчө валидация топтому колдонулганда кабарланган жана анык өндүрүмдүүлүк кайталанган.

Көчүрмө шаблондор

Бул классификация маселеси үчүн туура метриканы тандоого жардам бериңиз. Маселе: [болжолдонгон нерсе] Класстын бөлүштүрүлүшү: [оң көрсөткүч

Төмөнкү эки моделдин салыштыруусун баалаңыз. А модели кайчылаш текшерүү: [упайлардын тизмеси]Б модели кайчылаш текшерүү: [упайлардын тизмеси]Орто жана стандарттык четтөөнү эсептеңиз. Айырма статистикалык жактан маанилүүбү же бул четтөөнүн ичиндеги ызы-чуубу? Сиз мага кайсынысын тандоону сунуштайсыз жана эмне үчүн?

Төмөнкүлөр үчүн бул окуу кодун текшериңиз: 1) Гиперпараметрлер тест топтому же валидация топтому менен тандалдыбы? 2) Эрте токтотуу туура топтом менен көзөмөлдөнөбү? 3) Ашыкча үйрөнүүнүн белгилери барбы (тренинг/валидация жоготуу айырмасы)? Код: [код]

Бул регрессия көйгөйү үчүн MAE, RMSE жана MAPEдин кайсынысын кабарлашым керек? Максаттуу өзгөрмөнүн масштабы: [аралыгы]Чоң каталар пропорционалдуу начарбы (RMSE) же алардын баары бирдейби (MAE)? Нөлгө жакын маанилер барбы (алар MAPEди бурмалайбы)?Кыска негиздеме менен сунуштаңыз.

Метрикалык тандоо таблицасы

Көйгөйдүн түрү

Тиешелүү метрика

качуу үчүн

Эмне үчүн

Баланссыз классификация

PR-AUC, F1, кайра чакыртып алуу

Тактык

Көпчүлүк класс метриканы жогорулатат

Балансталган классификация

Тактык, ROC-AUC

салмактуу маалыматтарда ишенимдүү

Регрессия (маанилүү чектен чыгуу)

RMSE

MAPE (нөл болсо)

Чоң каталарды жазалайт

Регрессия (бирдей салмак)

MAE

Чечмелөө оңой

Рейтинг/сунуштоо

NDCG, Recall@K

Тактык

Тартип маанилүү

Жалпы каталар

  • Теңдештирилбеген маалыматтар боюнча тактыкты колдонуу. Эң кеңири таралган метрикалык ката.
  • Негизги моделди салыштыруу. Бул көрсөткүчтүн маанисин жоготот.
  • Гиперпараметрлер үчүн тест топтомун карап. Оптимисттик, реалдуу эмес жыйынтык.
  • Бир отсекке таянуу. Кайчылаш валидациясыз сиз бир тараптуулукту көрө албайсыз.
  • Прогресс үчүн ызы-чууну жаңылыштык. Четтөөдөн кичинекей "жакшыртуулар" көбүнчө ийгилик.
  • Бизнес контексти этибарга албоо. Тактык/чакыртып алуу балансы бизнес чечими болуп саналат.

Кыскача айтканда

Моделдик окутуудагы чыныгы чеберчилик - бул көп санды чыгаруу эмес, бул сан эмнени билдирерин билүү. Көйгөй жана бизнес контекст туура метриканы аныктайт; ар бир метриканы базалык моделге ылайык чечмелөө; кайчылаш валидация менен бир жактуулукту өлчөө жана ызы-чууну прогресс деп жаңылыштырбоо; Сыноо топтомун аягында бир жолу гана колдонуңуз. AI - эксперимент дизайнындагы өнөктөшүңүз, бирок "жетиштүү жакшы" чечим сизден жана сиздики.

Колдонмо тапшырмасы

Классификация модели үчүн: (1) класстын бөлүштүрүлүшүн жазыңыз, (2) ылайыктуу базалык моделди түзүңүз жана анын упайын өлчөңүз, (3) 5 эселенген кайчылаш валидация менен өзүңүздүн моделиңизге баа бериңиз жана орточо жана стандарттык четтөөнү билдириңиз, (4) тактыктын ордуна маселеге ылайыктуу метриканы эсептеңиз (мисалы, PR-AUC). Сиздин моделиңиз базалык моделден чоң айырма менен жеңеби же жокпу жазыңыз.

текшерүү тизмеси

  • [ ] Мен метриканы көйгөйдүн түрүнө жана бизнес контекстинин негизинде тандадым.
  • [ ] Мен базалык үлгү куруп, аны менен салыштырдым.
  • [ ] Мен кайчылаш текшерүү менен орточо жана четтөөнү билдирдим.
  • [ ] Мен жакшыруу четтөөдөн көбүрөөк экенин тастыктадым.
  • [ ] Мен валидация топтому менен гиперпараметрлерди тандадым.
  • [ ] Мен сыноо топтомун бир гана жолу колдондум, эң аягында.