Единицы
1. Введение в искусственный интеллект в науке о данных и аналитике: рабочий процесс, роли, границы, проверка и этика 2. Сбор данных и понимание источников: схема, выборка, качество и осведомленность об утечках 3. Очистка и предварительная обработка данных: отсутствующее значение, выбросы и преобразование типов 4. Исследовательский анализ данных (EDA): распределения, взаимосвязи и первоначальные выводы 5. Разработка функций: создание вариантов, кодирование, масштабирование и предотвращение утечек 6. Построение модели: постановка задачи, выбор алгоритма и разделение обучения/тестирования 7. Оценка модели: метрики, перекрестная проверка и экстремальное обучение 8. Визуализация и рассказывание историй: точная графика, честная графика 9. Генерация кода: анализ с помощью искусственного интеллекта с помощью Python (Pandas) и SQL 10. Утечка данных и воспроизводимость: тихие катастрофы и дисциплина 11. Фонд MLOps, этика, конфиденциальность и ответственная аналитика
Единица 7 / 11

Оценка модели: метрики, перекрестная проверка и экстремальное обучение

Прибыль:

  • Способность выбирать и интерпретировать метрики классификации и регрессии (матрица неточностей, точность/отзыв/F1, MAE/RMSE/R²) в соответствии с целью работы.
  • Возможность обнаружить переобучение путем сравнения результатов обучения и тестов и получить надежные результаты с помощью перекрестной проверки.
  • Возможность оценить, добавляет ли каждая модель реальную ценность, сравнивая ее с базовым уровнем.

Настроить модель легко; Трудно честно оценить, действительно ли это работает. Предметом этого модуля является наиболее важный навык специалиста по обработке данных: оценка модели с использованием правильных показателей, достижение надежных прогнозных показателей и ловушка самой коварной ловушки: чрезмерного обучения (запоминания). ИИ рассчитывает, интерпретирует и сравнивает показатели; но человек должен решить, какая метрика подходит для вашего бизнеса и является ли модель «достаточно хорошей». Команда, рассматривающая неправильные показатели, может месяцами принимать плохую модель за «успех».

Почему точности недостаточно: матрица путаницы

Первая метрика, которая приходит на ум при классификации, — это точность (точность — общее соотношение правильных прогнозов). Но, как мы видели в Главе 6, точность несбалансированных данных вводит в заблуждение. Лучшее начало — матрица путаницы — таблица, которая делит прогнозы на четыре ячейки:

  • Истинно позитивный (TP): Мы назвали фейком то, что на самом деле фейк. (Хорошо)
  • Истинно отрицательный (TN): Мы сказали «очень чистый». (Хорошо)
  • Ложное срабатывание (FP): Мы ошибочно сказали, что чистый — подделка. (Ложная тревога)
  • Ложноотрицательный результат (ЛН): Мы пропустили подделку и назвали ее чистой. (Пропущенная угроза)

Из этих четырех блоков вытекают два ключевых показателя. Точность: «Какая часть того, что я называю фальшивкой, на самом деле является фальшивкой?» — важно, если затраты на ложную тревогу высоки. Чувствительность (напомним на английском языке): «Сколько настоящих фейков я поймал?» — важно, когда пропустить угрозу дорого. Эти два понятия часто противоречат друг другу: если вы снижаете порог и чаще говорите «фальшивка», запоминаемость увеличивается, но точность снижается. Оценка F1 представляет собой сбалансированное среднее (среднее гармоническое) этих двух показателей.

Внимание: ответ на вопрос «Какая метрика важна» — это бизнес-решение, а не техническое. Пропуск случая (низкий уровень отзыва) при скрининге рака является катастрофой; Раздражает отправка важного письма в спам (низкая точность) в спам-фильтре. Стоимость определяет метрику.

Метрики регрессии

Если выходные данные представляют собой числа, используются другие метрики. MAE (средняя абсолютная ошибка): насколько оценки отклоняются от фактического среднего значения в той же единице (например, «мы ошибаемся в среднем на 4200 турецких лир»). RMSE (среднеквадратическая ошибка): более строго наказывается за серьезные ошибки и чувствителен к выбросам. R² (R-квадрат — коэффициент детерминации): какую часть изменчивости цели объясняет модель (близко к 1 — хорошо, 0 — так же плохо, как прогнозирование среднего значения, отрицательное — еще хуже).

Самая коварная ловушка: переобучение

Переоснащение — когда модель запоминает обучающие данные, но терпит неудачу на новых данных — является наиболее распространенной ошибкой в науке о данных. Симптом ясен: модель отлично работает на обучающем наборе (98%), плохо на тестовом наборе (72%). Модель запомнила шум этой конкретной выборки, а не фактическую закономерность в данных. Есть и обратная ситуация: недостаточная подгонка: модель плоха как при обучении, так и при тестировании, поскольку в ней слишком просто уловить закономерность.

Способы борьбы с переобучением: упрощение модели, увеличение объема данных, регуляризация — математический тормоз, который не дает модели стать слишком сложной — и самое главное — перекрестная проверка.

Перекрестная проверка: не доверяйте одной панели

Один модуль обучения/тестирования может оказаться удачным или неудачным; Вы можете получить высокие оценки за тестовый набор только потому, что этот образец прост. Перекрестная проверка (сокращенно CV) решает эту проблему. Наиболее распространенной формой является k-кратное CV: данные делятся на k частей (например, 5); В каждом раунде одна часть — тестирование, а остальная часть — тренировка; это бросается 5 раз, и 5 очков усредняются. Итак, вы увидите, что производительность основана на среднем значении нескольких сплитов, а не на одном удачном сплите. Распределение оценок также информативно: очень волатильные оценки (85% на одном этаже, 62% на другом) указывают на нестабильность модели.

Обычный k-крат не используется во временных рядах (утечка будущего); Вместо этого вы выполняете «прямую цепочку» (разделение временных рядов): всегда тренируетесь с прошлым и проверяете будущее.

метрика

Тип проблемы

Когда это имеет значение?

Точность

Классификация

Если классы сбалансированы

Точность

Классификация

Ложная тревога стоит дорого

Чувствительность (напоминание)

Классификация

Если пропустить дорого

Ф1

Классификация

Если нужен баланс

МАЭ

регресс

Интерпретируемая ошибка

RMSE

регресс

Если большие ошибки имеют решающее значение

Р²

регресс

объяснительная сила

три мини-кейса

Случай 1 — Иллюзия высокой точности. Одна из моделей мошенничества показала точность 99,2%, и команда это праздновала. Глядя на матрицу путаницы, можно увидеть, что реальная доля фейков в данных составила 0,8%; Модель почти не ловила фейков, просто сказала «все ясно». Отзыв составил 6%. Урок: смотрите на показатели, а не на точность.

Случай 2 — Скрытое переобучение. Одна команда реализовала и увеличила XGBoost до 97 % на тренировочном наборе. Тестовый набор был 69%, но никто не смотрел. Модель развалилась на производстве. Если бы была проведена перекрестная проверка, большая разница между сгибами (переобучением) была бы видна с самого начала. Урок: доверяйте резюме и результатам тестов, а не оценкам образования.

Случай 3 — Удачный сплит. Один аналитик был рад получить 88% за одно разделение. Когда его коллега составил 5-кратное резюме, баллы были 88%, 71%, 83%, 64%, 79% — средний показатель 77%, но он очень изменчив. Модель была нестабильной; Единственное купе вводило в заблуждение. Урок: смотрите на среднее значение CV и распределение, а не на отдельную корзину.

Четыре копируемых шаблона

1) Полный отчет о классификации:

У меня есть обученная модель и тестовый набор. Сгенерируйте: матрицу путаницы, точность, отзыв, F1 (для каждого класса) и количество поддержки. Я делаю выводы, но решать мне: я вам скажу, какая метрика важна. Обратите внимание, что точность может ввести в заблуждение при использовании несбалансированных данных.

2) Контроль переобучения:

Распечатайте рядом результаты моей модели в наборах TRAINING и TEST. Подсчитайте разницу между ними и предупредите, так как большая разница — признак переобучения. Если разница велика, предложите регуляризацию или упрощение.

3) Перекрестная проверка:

Выполните 5-кратную перекрестную проверку (для стратифицированной классификации). Распечатайте оценку, среднее значение и стандартное отклонение каждой складки. Если оценки очень изменчивы (высокое стандартное значение), это означает, что модель нестабильна. Используйте конвейеры, чтобы преобразования изучались только из обучающей части на каждом уровне.

4) Базовое сравнение:

Поместите метрику моей модели рядом с базовой линией DummyClassifier. Значительно ли модель превосходит базовый уровень? Если он не пройдет, дайте понять, что модель не добавляет никакой реальной ценности.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Моя модель хороша?

«Хорошо» не определено; Непонятно, какой показатель, какой порог, какой базовый уровень. ИИ может дать единый показатель точности и ввести в заблуждение.

Мощная подсказка:

Ваша роль: помощник по оценке. Классификация, несбалансированные данные (12% положительных). Приоритет: вспомнить (не упустить позитива). Задача: (1) матрица путаницы, (2) точность/отзыв/F1, (3) 5-кратное стратифицированное среднее и стандартное значение CV, (4) сравнение базовых показателей DummyClassifier. Сосредоточьтесь на разнице в отзывах и базовых данных, а не на точности. Комментируйте, но окончательное решение принимаю я.

Здесь приоритет метрики, CV и базовое состояние ясны.

Распространенные ошибки

  • Доверие к точности несбалансированных данных. Точность 99% может вообще не отражать класс меньшинства; Посмотрите на матрицу путаницы.
  • Просто смотрю на ваш балл образования. Высокое образование, низкий балл по тестам – это переобучение; Всегда сравнивайте два результата.
  • Опираясь на одно отделение. Счастливое разделение вводит в заблуждение; Посмотрите на среднее значение и распределение с помощью перекрестной проверки.
  • Не сравнивая с базовым. Вы не можете сказать «хорошо», не зная, превосходит ли модель глупый предсказатель.
  • Использование обычного k-кратного изменения временных рядов. Это утечка будущего; Требуется разделение временных рядов.
Совет: Напишите три числа рядом с каждой моделью: оценка обучения, среднее значение перекрестной проверки и базовая оценка. Это трио с первого взгляда демонстрирует переобучение (обучение >> CV) и недооценку (CV ≈ базовый уровень).

В заключение

Построить модель легко, но оценить ее честно сложно. В классификации матрица путаницы, точность и полнота гораздо более информативны, чем точность; Стоимость работы определяет, какая из них важна. MAE, RMSE и R² используются в регрессии. Самая коварная ловушка — это переобучение: всегда сравнивайте результаты обучения и тестов. Полагайтесь на среднее значение и распределение перекрестной проверки, а не на единое разделение; Сравните все с базовым уровнем. ИИ рассчитывает все это, но человек сам решает, какой показатель использовать.

Задача приложения

Извлеките матрицу путаницы, точность, отзыв и F1 для модели классификации; Затем выполните 5-кратную перекрестную проверку и посмотрите на распределение оценок по сгибам. Наконец, запишите рядом друг с другом балл за тренировку, среднее CV и базовый балл. Прокомментируйте в одном предложении, переобучается ли ваша модель и достигает ли базовый уровень.

контрольный список

  • [ ] Смотрел ли я на фактические показатели работы (точность/отзыв/F1 и т. д.), а не на точность?
  • [ ] Изучил ли я матрицу путаницы?
  • [ ] Сравнил ли я результаты обучения и теста и проверил ли я переобучение?
  • [ ] Посмотрел ли я среднее значение и распределение с помощью перекрестной проверки?
  • [ ] Сравнил ли я модель с базовым уровнем?