Јединице
1. Увод у вештачку интелигенцију у науци о подацима и аналитици: ток посла, улоге, границе, валидација и етика 2. Прикупљање података и разумевање извора: шема, узорковање, квалитет и свест о цурењу 3. Чишћење података и претходна обрада: Недостајућа вредност, Оутлиер и конверзија типа 4. Истраживачка анализа података (ЕДА): дистрибуције, односи и почетни увиди 5. Инжењеринг карактеристика: генерисање варијанти, кодирање, скалирање и избегавање цурења 6. Изградња модела: дефиниција проблема, избор алгоритма и подела обуке/тестирања 7. Евалуација модела: метрика, унакрсна валидација и екстремно учење 8. Визуелизација и приповедање: тачна графика, искрена графика 9. Генерисање кода: Анализа уз помоћ вештачке интелигенције са Питхон-ом (панде) и СКЛ-ом 10. Цурење података и репродуктивност: тихе катастрофе и дисциплина 11. МЛОпс фондација, етика, приватност и одговорна аналитика
Јединица 7 / 11

Евалуација модела: метрика, унакрсна валидација и екстремно учење

Добици:

  • Способност одабира и тумачења метрике класификације и регресије (матрица конфузије, прецизност/позив/Ф1, МАЕ/РМСЕ/Р²) у складу са сврхом посла
  • Способност откривања прекомерног учења упоређивањем резултата тренинга и тестова и добијања поузданих перформанси уз унакрсну валидацију
  • Способност да се процени да ли сваки модел додаје стварну вредност упоређивањем са основном линијом

Лако је поставити модел; Тешко је искрено измерити да ли заиста функционише. Предмет ове јединице је најкритичнија вештина научника података: процена модела са правом метриком, постизање поузданих предиктивних перформанси и хватање најподмуклије замке: прекомерно учење (меморисање). АИ израчунава, тумачи и упоређује метрику; али на човеку је да одлучи која метрика је исправна за ваше пословање и да ли је модел „довољно добар“. Тим који посматра погрешну метрику може месецима грешити лош модел као „успех“.

Зашто тачност није довољна: матрица конфузије

Прва метрика која пада на памет у класификацији је тачност (тачност — укупан однос тачних предвиђања). Али као што смо видели у јединици 6, тачност је заваравајућа са неуравнотеженим подацима. Бољи почетак је матрица конфузије - табела која дели предвиђања у четири корпе:

  • Право позитивно (ТП): Лажним смо назвали оно што је заиста лажно. (добро)
  • Право негативно (ТН): Рекли смо заиста чисто. (добро)
  • Лажно позитиван (ФП): Погрешно смо рекли да је чиста лажна. (лажна узбуна)
  • Лажно негативан (ФН): Промашили смо лажно и назвали га чистим. (Пропуштена претња)

Два кључна показатеља произилазе из ова четири поља. Прецизност: „Колико је оно што ја називам лажним заправо лажно?“ — важно ако су трошкови лажног аларма високи. Осетљивост (сећање на енглеском): "Колико сам правих лажњака ухватио?" — важно када је пропуштање претње скупо. То двоје су често у супротности једно са другим: ако спустите праг и више кажете „лажно“, присећање се повећава, али се прецизност смањује. Ф1 резултат је балансирани просек (хармонична средина) ова два.

Пажња: Одговор на питање „Која метрика је важна“ је пословна одлука, а не техничка. Недостатак случаја (низак опозив) у скринингу рака је катастрофалан; Нервирајуће је слати важну е-пошту у нежељену пошту (ниска прецизност) у филтеру за нежељену пошту. Трошак одређује метрику.

Регресијска метрика

Ако су излаз бројеви, користе се различите метрике. МАЕ (средња апсолутна грешка): колико процене одступају од стварног просека, у истој јединици (нпр. „грешимо у просеку за 4.200 ТЛ“). РМСЕ (основна средња квадратна грешка): строже кажњава велике грешке и осетљив је на одступања. Р² (Р-квадрат — коефицијент детерминације): колики део варијабилности у циљу објашњава модел (близу 1 је добро, 0 је једнако лоше као предвиђање средње вредности, негативно је још горе).

Најподмукла замка: преучење

Претеривање – где модел памти податке о обуци, али не успева на новим подацима – је најчешћа грешка у науци о подацима. Симптом је јасан: модел је одличан на сету за обуку (98%), лош на тест сету (72%). Модел је упамтио шум тог конкретног узорка, а не стварни образац у подацима. Постоји и супротно: недовољна опрема — модел је лош и у обуци и у тестирању јер је превише једноставан да би се ухватио образац.

Начини за борбу против претераног учења: поједностављивање модела, више података, регуларизација — математичка кочница која спречава да модел постане превише сложен — и што је најважније, унакрсна валидација.

Унакрсна провера: немојте веровати једном окну

Једна јединица за обуку/тестирање може бити срећна или несрећна; Можете добити високе оцене за сет за тестирање само зато што је тај узорак лак. Унакрсна валидација (скраћено ЦВ) решава ово. Најчешћи облик је к-фолд ЦВ: подаци су подељени на к делова (нпр. 5); У свакој рунди један део је тестирање, а остатак тренинг; ово се котрља 5 пута и 5 поена се вреднују. Дакле, видећете да се учинак заснива на просеку вишеструких подела, а не на једном срећном поделу. Расподела резултата је такође информативна: веома променљиви резултати (85% на једном спрату, 62% на другом) указују на то да је модел нестабилан.

Нормалан к-фолд се не користи у временским серијама (пропушта будућност); Уместо тога, радите „уланчавање унапред“ (подела временских серија): увек тренирате са прошлошћу и тестирате будућност.

метрички

Тип проблема

Када је то битно?

Прецизност

Класификација

Ако су часови уравнотежени

Прецизност

Класификација

Лажни аларм је скуп

Осетљивост (сећање)

Класификација

Ако је скупо пропустити

Ф1

Класификација

Ако је потребна равнотежа

МАЕ

регресија

Интерпретабле еррор

РМСЕ

регресија

Ако су велике грешке критичне

Р²

регресија

објашњавајућа моћ

три мини кофера

Случај 1 — Илузија високе тачности. Један модел преваре показао је 99,2% тачности и тим је славио. Гледајући матрицу конфузије, стварна: стопа лажних података у подацима била је 0,8%; модел није ухватио скоро ниједан лажњак, само је рекао "све је јасно". Опозив је био 6%. Лекција: гледајте на метрику, а не на тачност.

Случај 2 — Латентно прекомерно учење. Један тим је испоручио и повећао КСГБоост на 97% на сету за обуку. Тестни сет је био 69%, али нико није погледао. Модел је пропао у производњи. Да је урађена унакрсна валидација, велика разлика између набора (преучености) би била видљива од почетка. Лекција: верујте ЦВ-у и резултату теста, а не резултату образовања.

Случај 3 — Луцки сплит. Један аналитичар је био одушевљен што је добио 88% у једној подели. Када је његов колега урадио петоструки ЦВ, резултати су били 88%, 71%, 83%, 64%, 79% — просек је 77%, али је веома променљив. Модел је био нестабилан; Један одељак је био заваравајући. Лекција: погледајте средњу вредност ЦВ-а и дистрибуцију, а не појединачну канту.

Четири шаблона за копирање

1) Комплетан извештај о класификацији:

Имам обучени модел и сет за тестирање. Генеришите: матрицу конфузије, прецизност, опозив, Ф1 (за сваку класу) и број подршке. Ја закључујем, али на мени је: рећи ћу вам која је метрика важна. Имајте на уму да тачност може да завара са неуравнотеженим подацима.

2) Контрола прекомерног учења:

Одштампајте резултате мог модела у сету ТРАИНИНГ и ТЕСТ један поред другог. Израчунајте разлику између њих и упозорите јер је велика разлика знак претераног учења. Ако је разлика велика, предложите регуларизацију или поједностављење.

3) Унакрсна валидација:

Извршите 5-струку унакрсну валидацију (за стратификовану, класификацију). Одштампајте резултат, средњу вредност и стандардну девијацију сваког прегиба. Ако су резултати веома променљиви (високи стд), назначите да је модел нестабилан. Користите цевоводе тако да се трансформације уче само из дела за обуку на сваком слоју.

4) Поређење основног стања:

Ставите метрику мог модела раме уз раме са основном линијом ДуммиЦлассифиер-а. Да ли модел значајно надмашује основну линију? Ако не прође, јасно ставите до знања да модел не додаје никакву стварну вредност.

Слаби промпт / Јаки промпт

Слабо обавештење:

Да ли је мој модел добар?

„Добро“ је недефинисано; Није јасно која метрика, који праг, која основна линија. АИ може дати један број тачности и довести у заблуду.

Снажан упит:

Ваша улога: помоћник у процени. Класификација, неуравнотежени подаци (12% позитивних). Приоритет: опозив (не пропуштајући позитивне). Задатак: (1) матрица конфузије, (2) прецизност/позив/Ф1, (3) 5-струка стратификована ЦВ средња вредност и стд, (4) ДуммиЦлассифиер поређење основне линије. Фокусирајте се на памћење и основну разлику, а не на тачност. Коментар, али ја доносим коначну одлуку.

Овде су јасни приоритет метрике, ЦВ и основно стање.

Уобичајене грешке

  • Поверење у тачност у неуравнотеженим подацима. 99% тачности можда уопште не обухвата класу мањине; Погледајте матрицу конфузије.
  • Само гледам ваш образовни резултат. Високо образовање, низак резултат на тесту је претерано учење; Увек упоредите два резултата.
  • Ослањајући се на један одељак. Срећна подела доводи у заблуду; Погледајте средњу вредност и дистрибуцију са унакрсном провером.
  • Не поредити са основном линијом. Не можете рећи "добро" а да не знате да ли модел надмашује глупог предиктора.
  • Коришћење нормалног к-фолда на временској серији. Пропушта будућност; потребна је подела временске серије.
Савет: Напишите три броја поред сваког модела: резултат обуке, просек унакрсне валидације и основни резултат. Овај трио на први поглед открива претерано учење (обука >> ЦВ) и потцењивање (ЦВ ≈ основна линија).

Укратко

Изградити модел је лако, али је тешко проценити га искрено. У класификацији, матрица конфузије, прецизност и присећање су много информативнији од тачности; Цена посла одређује који је важан. МАЕ, РМСЕ и Р² се користе у регресији. Најподмукла замка је претерано учење: увек упоредите тренинг и резултат теста. Ослоните се на средњу вредност и дистрибуцију унакрсне провере, а не на један поделе; Упоредите све са основном линијом. АИ све ово израчунава, али на човеку је да одлучи коју метрику ће користити.

Задатак апликације

Издвоји матрицу конфузије, прецизност, опозив и Ф1 за модел класификације; Затим урадите петоструку унакрсну валидацију и погледајте дистрибуцију резултата по преклопима. На крају, запишите резултат тренинга, просек ЦВ-а и основни резултат један поред другог. Прокоментаришите у једној реченици да ли ваш модел преучи и да ли пролази основну линију.

контролна листа

  • [ ] Да ли сам погледао стварну метрику посла (прецизност/позив/Ф1 итд.) уместо тачности?
  • [ ] Да ли сам испитао матрицу конфузије?
  • [ ] Да ли сам упоредио резултате тренинга и теста и проверио да ли сам преучен?
  • [ ] Да ли сам погледао средњу вредност и дистрибуцију са унакрсном провером?
  • [ ] Да ли сам упоредио модел са основном линијом?