Единици
1. Вовед во вештачката интелигенција во науката за податоци и аналитика: Работен тек, улоги, граници, валидација и етика 2. Собирање податоци и разбирање на изворите: шема, земање примероци, квалитет и свесност за истекување 3. Чистење и претходна обработка на податоци: Недостасува вредност, оддалеченост и конверзија на типови 4. Истражувачка анализа на податоци (EDA): дистрибуции, врски и првични сознанија 5. Инженерство на карактеристики: генерирање варијанти, кодирање, скалирање и избегнување истекување 6. Изградба на модел: дефиниција на проблем, избор на алгоритам и поделба на обука/тест 7. Евалуација на моделот: метрика, вкрстена валидација и екстремно учење 8. Визуелизација и раскажување приказни: точна графика, искрена графика 9. Генерирање кодови: Анализа со помош на AI со Python (панди) и SQL 10. Протекување податоци и репродуктивност: Тивки катастрофи и дисциплина 11. Фондација MLOps, етика, приватност и одговорна анализа
Единица 7 / 11

Евалуација на моделот: метрика, вкрстена валидација и екстремно учење

Добивки:

  • Способност за избор и интерпретација на метрика на класификација и регресија (матрица за конфузија, прецизност/повикување/F1, MAE/RMSE/R²) според целта на работата
  • Способност да се открие прекумерно учење со споредување на резултатите од обуката и тестовите и да се добијат сигурни перформанси со вкрстена валидација
  • Способност да се оцени дали секој модел додава вистинска вредност со споредување со основната линија

Лесно е да се постави модел; Тешко е искрено да се измери дали навистина функционира. Предмет на оваа единица е најкритичната вештина на научникот за податоци: оценување на моделот со правилна метрика, постигнување сигурна предиктивна изведба и фаќање на најподмолната замка: прекумерно учење (меморирање). ВИ пресметува, интерпретира и споредува метрика; но на човекот е да одлучи која метрика е соодветна за вашиот бизнис и дали моделот е „доволно добар“. Тим кој гледа на погрешна метрика може да погреши лошиот модел со месеци како „успех“.

Зошто точноста не е доволна: матрица на конфузија

Првата метрика што ми доаѓа на ум во класификацијата е точноста (точност - вкупниот сооднос на точните предвидувања). Но, како што видовме во Одделението 6, точноста е погрешна со неизбалансирани податоци. Подобар почеток е матрицата за конфузија - табела што ги дели предвидувањата во четири канти:

  • Вистински позитивен (ТП): Ние го нарековме лажното она што е навистина лажно. (Добро)
  • Вистински негативен (TN): Рековме навистина чист. (Добро)
  • Лажно позитивно (ФП): По грешка рековме дека чистиот е лажен. (Лажна тревога)
  • Лажно негативно (FN): Го пропуштивме лажниот и го нарековме чист. (Пропуштена закана)

Две клучни метрики произлегуваат од овие четири полиња. Прецизност: „Колку од она што јас го нарекувам лажно е всушност лажно? — важно ако трошоците за лажна тревога се високи. Чувствителност (се потсетиме на англиски): "Колку вистински фалсификати фатив?" - важно е кога пропуштањето закана е скапо. Двете често се спротивставени еден со друг: ако го спуштите прагот и повеќе кажете „лажно“, отповикувањето се зголемува, но прецизноста се намалува. Ф1 резултатот е избалансиран просек (хармонична средина) на овие двајца.

Внимание: Одговорот на прашањето „Која метрика е важна“ е деловна, а не техничка одлука. Испуштањето на случај (низок отповик) при скрининг за рак е катастрофално; Досадно е да се испрати важна е-пошта до спам (ниска прецизност) во филтерот за спам. Трошокот ја одредува метриката.

Метрика на регресија

Ако излезот е бројки, се користат различни метрики. MAE (средна апсолутна грешка): колку проценките отстапуваат од вистинскиот просек, во истата единица (на пр. „грешиме во просек за 4.200 TL“). RMSE (Root Mean Squared Error): построго ги казнува големите грешки и е чувствителен на оддалечените. R² (R-квадрат - коефициент на определување): колкав дел од варијабилноста во целта објаснува моделот (близу до 1 е добро, 0 е исто толку лошо како и предвидувањето на средната вредност, негативното е уште полошо).

Најподмолната стапица: прекумерно учење

Прекумерното поставување - каде што моделот ги меморира податоците за обуката, но не успева на новите податоци - е најчеста грешка во науката за податоци. Симптомот е јасен: моделот е одличен на сетот за обука (98%), лош на тест сет (72%). Моделот го меморирал шумот на тој конкретен примерок, а не вистинската шема во податоците. Постои и спротивното: недоволно вклопување - моделот е лош и во обука и во тестирање затоа што е премногу едноставен за да се долови шемата.

Начини за борба против прекумерното учење: поедноставување на моделот, повеќе податоци, регулација - математичка сопирачка што го спречува моделот да стане премногу сложен - и што е најважно, вкрстена валидација.

Вкрстена валидација: не верувајте во едно окно

Еден тренинг/тест-под може да биде среќен или несреќен; Можете да добиете високи оценки за тест сет само затоа што тој примерок е лесен. Вкрстена валидација (кратко CV) го решава ова. Најчестата форма е к-пати CV: податоците се поделени на k делови (на пр. 5); Во секој круг, еден дел е тестирање, а остатокот е тренинг; ова се тркала 5 пати и 5-те резултати се просечни. Така, ќе видите дека перформансите се засноваат на просекот на повеќекратни поделби, а не на еден среќен дел. Дистрибуцијата на оценките е исто така информативна: многу нестабилните резултати (85% на еден кат, 62% на другиот) покажуваат дека моделот е нестабилен.

Нормално k-fold не се користи во временски серии (протекување на иднината); Наместо тоа, правите „синџирирање нанапред“ (поделба на временски серии): секогаш тренирате со минатото и ја тестирате иднината.

метрички

Тип на проблем

Кога е важно?

Точност

Класификација

Ако часовите се избалансирани

Прецизност

Класификација

Лажниот аларм е скап

Чувствителност (потсетување)

Класификација

Ако е скапо да се пропушти

Ф1

Класификација

Доколку е потребна рамнотежа

MAE

регресија

Толкувачка грешка

RMSE

регресија

Ако големите грешки се критични

регресија

објаснувачка моќ

три мини футроли

Случај 1 - Илузија на висока точност. Еден модел на измама покажа 99,2% точност и тимот прослави. Гледајќи ја матрицата за конфузија, вистинската: лажна стапка во податоците беше 0,8%; Манекенката не фати речиси никакви фалсификати, само велејќи „сè е јасно“. Потсетиме беше 6%. Поука: погледнете ја метриката, а не точноста.

Случај 2 - Латентно прекумерно учење. Еден тим испорача и го зголеми XGBoost до 97% на сетот за обука. Тест сет беше 69%, но никој не погледнал. Моделот пропадна во производството. Ако беше направена вкрстена валидација, големата разлика помеѓу наборите (преучување) ќе беше видлива од самиот почеток. Лекција: верувајте им на CV и на резултатот од тестот, а не на резултатот од образованието.

Случај 3 - Среќна поделба. Еден аналитичар беше воодушевен што доби 88% во една поделба. Кога неговиот колега направи 5-кратно CV, резултатите беа 88%, 71%, 83%, 64%, 79% - просекот е 77%, но тоа е многу нестабилно. Моделот беше нестабилен; Единечната преграда беше погрешна. Поука: погледнете ја средната вредност и дистрибуцијата на CV, а не индивидуалната корпа.

Четири шаблони за копирање

1) Целосен извештај за класификација:

Имам обучено модел и тест сет. Генерирајте: матрица за конфузија, прецизност, потсетување, F1 (за секоја класа) и брои за поддршка. Заклучувам, но зависи од мене: ќе ви кажам која метрика е важна. Забележете дека точноста може да доведе до заблуда со неурамнотежени податоци.

2) Контрола на прекумерно учење:

Испечатете ги резултатите на мојот модел и во сетови за ОБУКА и ТЕСТ рамо до рамо. Пресметајте ја разликата меѓу нив и предупредете бидејќи големата разлика е знак за преучување. Ако разликата е голема, предложете регулација или поедноставување.

3) Вкрстена валидација:

Изведете 5-кратна вкрстена валидација (за стратификувана, класификација). Отпечатете го резултатот, средната вредност и стандардното отстапување на секое превиткување. Ако оценките се многу испарливи (висока std), означете дека моделот е нестабилен. Користете цевководи така што трансформациите се учат само од делот за обука на секој слој.

4) Споредба на основната линија:

Ставете ја метриката на мојот модел рамо до рамо со основната линија на DummyClassifier. Дали моделот значително ја надминува основната линија? Ако не помине, разјаснете дека моделот не додава вистинска вредност.

Слаб промпт / Силен промпт

Слаба навестување:

Дали мојот модел е добар?

„Добро“ е недефинирано; Не е јасно која метрика, кој праг, која основна линија. ВИ може да даде единствен број за точност и да доведе во заблуда.

Моќен потсетник:

Вашата улога: асистент за оценување. Класификација, неизбалансирани податоци (12% позитивни). Приоритет: потсетиме (не пропуштајќи ги позитивните страни). Задача: (1) матрица за конфузија, (2) прецизност/потсетување/F1, (3) 5-кратна стратификувана средна вредност на CV и std, (4) споредба на основната линија на DummyClassifier. Фокусирајте се на отповикувањето и основната разлика, а не на точноста. Коментирајте, но јас ја носам конечната одлука.

Овде, метричкиот приоритет, CV и основната состојба се јасни.

Вообичаени грешки

  • Доверба на точноста на неурамнотежените податоци. Точноста од 99% може воопшто да не ја опфати класата на малцинствата; Погледнете ја матрицата за конфузија.
  • Само гледајќи го вашиот резултат за образование. Високото образование, нискиот резултат на тестовите е прекумерно учење; Секогаш споредувајте две оценки.
  • Потпирајќи се на една преграда. Среќната поделба е погрешна; Погледнете ја средната вредност и дистрибуцијата со вкрстена валидација.
  • Не се споредува со основната линија. Не можете да кажете „добро“ без да знаете дали моделот победува глупав прогнозер.
  • Користење на нормално k-преклопување на временските серии. Ја протекува иднината; Потребна е поделба на временските серии.
Совет: напишете три броја до секој модел: резултат за обука, просек за вкрстена валидација и основен резултат. Ова трио на прв поглед открива прекумерно учење (обука >> CV) и потценување (CV ≈ основна линија).

Сумирано

Да се изгради модел е лесно, но да се оцени искрено е тешко. Во класификацијата, матрицата на конфузија, прецизноста и потсетувањето се многу поинформативни отколку точноста; Цената на работата одредува која е важна. MAE, RMSE и R² се користат во регресија. Најподмолната замка е прекумерното учење: секогаш споредувајте ги резултатите од обуката и тестовите. Потпрете се на средната вредност и дистрибуцијата на вкрстена валидација, а не на ниту еден дел; Споредете сè со основната линија. Вештачката интелигенција ги пресметува сите овие, но зависи од човекот да одлучи која метрика да ја користи.

Задача за апликација

Извлечете матрица за конфузија, прецизност, отповикување и F1 за класификациски модел; Потоа направете 5-кратна вкрстена валидација и погледнете ја распределбата на бодовите низ наборите. Конечно, запишете го резултатот од обуката, просекот на CV и основниот резултат рамо до рамо. Коментирајте во една реченица дали вашиот модел премногу учи и ја поминува основната линија.

листа за проверка

  • [ ] Дали ја погледнав вистинската метрика на работата (прецизност/повикување/F1 итн.) наместо точност?
  • [ ] Дали ја испитав матрицата за конфузија?
  • [ ] Дали сум го споредил резултатот од обуката и тестот и дали сум проверил дали имам прекумерно учење?
  • [ ] Дали ја разгледав средната вредност и дистрибуцијата со вкрстено валидирање?
  • [ ] Дали го споредив моделот со основната линија?