Единицы
1. Введение в искусственный интеллект в науке о данных и аналитике: рабочий процесс, роли, границы, проверка и этика 2. Сбор данных и понимание источников: схема, выборка, качество и осведомленность об утечках 3. Очистка и предварительная обработка данных: отсутствующее значение, выбросы и преобразование типов 4. Исследовательский анализ данных (EDA): распределения, взаимосвязи и первоначальные выводы 5. Разработка функций: создание вариантов, кодирование, масштабирование и предотвращение утечек 6. Построение модели: постановка задачи, выбор алгоритма и разделение обучения/тестирования 7. Оценка модели: метрики, перекрестная проверка и экстремальное обучение 8. Визуализация и рассказывание историй: точная графика, честная графика 9. Генерация кода: анализ с помощью искусственного интеллекта с помощью Python (Pandas) и SQL 10. Утечка данных и воспроизводимость: тихие катастрофы и дисциплина 11. Фонд MLOps, этика, конфиденциальность и ответственная аналитика
Единица 4 / 11

Исследовательский анализ данных (EDA): распределения, взаимосвязи и первоначальные выводы

Прибыль:

  • Возможность исследовать распределение, центр, разброс и аномалии переменных с помощью соответствующих графиков (гистограмма, ящичная диаграмма, диаграмма рассеяния).
  • Умение правильно интерпретировать корреляцию и читать ее вместе с диаграммой рассеяния, не путая ее с причинно-следственной связью.
  • Умение понимать, что сводная статистика может вводить в заблуждение (урок Анскомба), и вырабатывать гипотезы, определяющие направление моделирования.

Прежде чем строить модель, необходимо знать данные. Точно так же, как врач не прописывает лекарства, не осмотрев пациента, специалист по обработке данных не строит модель, не «изучив» данные. Это исследование называется исследовательским анализом данных (сокращенно EDA): это этап обнаружения распределения, взаимосвязей, сюрпризов и ловушек данных визуально и графически. Цель EDA — генерировать гипотезы, выявлять ошибки и определять направление моделирования. Искусственный интеллект — очень мощный помощник на этом этапе: он подсказывает, какой график подойдет, пишет его код, интерпретирует распределение. Но человек решает, исходя из своих полевых знаний, реален ли увиденный им образец или это совпадение.

Что ищет EDA?

EDA ищет ответы на четыре вопроса. Распределение: как распределяется каждая переменная — симметрична ли она, асимметрична или имеет два пика? Центральная тенденция и распространение: каковы среднее, медианное и стандартное отклонение? Отношения: Как переменные связаны друг с другом? Аномалии: есть ли неожиданные значения, пробелы, группировки? Эти четыре вопроса определяют, какая функция будет работать и какая модель подойдет.

Давайте определим некоторые основные понятия. Гистограмма — это график, который делит значения числовой переменной на интервалы и показывает, сколько наблюдений находится в каждом интервале; Это самый быстрый способ увидеть распределение. Асимметрия — это сдвиг распределения в одну сторону; Такие переменные, как доход, смещены вправо (большинство низкие, некоторые очень высокие). На коробчатой ​​диаграмме можно сразу увидеть медиану, квартили и выбросы. Диаграмма рассеяния показывает взаимосвязь двух числовых переменных с облаком точек.

Корреляция: связь есть, но будьте осторожны.

Корреляция — мера того, как две переменные движутся вместе; число от -1 до +1 — наиболее используемый и наиболее неправильно понимаемый инструмент EDA. +1 означает идеальное совместное увеличение, -1 означает идеальную обратную зависимость, 0 означает отсутствие линейной зависимости. Есть две большие ловушки. Во-первых, знаменитое правило: корреляция не является причинно-следственной связью. С ростом продаж мороженого увеличивается число случаев удушья; не потому, что одно ведет к другому, а потому, что лето (скрытая третья переменная) запускает оба. Во-вторых, корреляция измеряет только линейную связь; Это может указывать на сильную, но криволинейную связь, близкую к 0. Поэтому, глядя на корреляцию, обязательно обратите внимание также на диаграмму рассеяния.

Внимание: когда ИИ выдает число корреляции, он может перейти на причинно-следственный язык вроде «А увеличивает Б». Это опасно. Корреляция лишь указывает на совместное движение; Только опыт, знание предметной области и тщательные выводы позволяют установить причину.

Квартет Анскомба: почему бы просто не посмотреть на цифру

В статистике есть известный пример: квартет Анскомб. Четыре разных набора данных имеют почти одинаковое среднее значение, одинаковую дисперсию и одинаковую корреляцию (0,82); Но на графике они выглядят совершенно по-разному: одна прямая линия, другая изогнутая, третья — облако, вытянутое одним выбросом. Урок ясен: сводная статистика вводит в заблуждение, смотреть на график просто необходимо. ИИ может дать вам средние значения и корреляции, но доверять этим цифрам, не видя графика, — значит попасть в ловушку Анскомба.

В таблице ниже показано, какая диаграмма соответствует какому вопросу:

Вопрос

подходящий рисунок

Что показывает

Распределение одной переменной

Гистограмма / KDE

Форма, асимметрия, количество вершин

Центр и выбросы

Коробочный сюжет

Медиана, квартили, выбросы

Связь двух чисел

точечная диаграмма

Направление, сила, кривизна

Сравнение категорий

гистограмма

Разница между группами

меняться со временем

линейный график

Тренд, сезонность

Многомерные отношения

Тепловая карта корреляции

Общая матрица отношений

Парадокс Симпсона: агрегированные данные могут лгать

Коварная ловушка в EDA, о которой следует знать, — это парадокс Симпсона: закономерность может показывать одно направление, когда все данные рассматриваются вместе, и обратное, когда данные разделены на значимые подгруппы. Классический пример: общий уровень приема абитуриентов-женщин в университет ниже, чем мужчин; Но если посмотреть на отдел за отделом, то в большинстве отделов процент приема женщин выше, чем мужчин. Откуда? Женщины подали заявки на более конкурентоспособные (более низкие показатели приема) факультеты; Комбинированное число хранит эту скрытую переменную. Урок ясен: глядя на общее или среднее значение, обязательно проверьте, рассказывает ли это число ту же историю, если оно разбито на значимые подгруппы (сегмент, период, канал). Когда ИИ дает вам комбинированную оценку, вопрос «действительна ли она по-прежнему при ее сегментировании» на раннем этапе выявляет большинство вводящих в заблуждение результатов.

три мини-кейса

Случай 1. Два скрытых холма. Один аналитик обнаружил, что средний возраст клиентов составляет 41 год, и назвал его «толпой среднего возраста». Но гистограмма показала два пика: возрастные группы 22–28 и 55–62 года. Средний 41 человек на самом деле никого не представлял. Урок: постройте распределение, прежде чем доверять среднему значению.

Случай 2 — Ложная корреляция. Одна команда обнаружила корреляцию 0,78 между «расходами на рекламу» и «продажами» и удвоила бюджет. Однако то, что спровоцировало обе эти кампании, было сезонными кампаниями; в период вне кампании соотношение упало до 0,10. Дополнительная реклама на 340 тысяч турецких лир не принесла ожидаемого дохода. Урок: ошибочное принятие корреляции за причинно-следственную связь обходится дорого.

Случай 3. Линия, проведенная одиноким противником. Анализ недвижимости показал сильную связь между площадью и ценой (r=0,80). Когда был построен точечный график, почти вся связь была создана одной роскошной виллой стоимостью 12 миллионов турецких лир; Когда эту точку удалили, корреляция упала до 0,31. Урок: всегда читайте корреляцию вместе с диаграммой рассеяния.

Четыре копируемых шаблона

1) Автоматическая сводка EDA:

У меня есть панды df. Напишите код, который создает: (1) df.info() и df.describe(), (2) гистограмму для каждого числового столбца, (3) счетчик для каждого категориального столбца. Не комментируйте, просто сгенерируйте код обнаружения; Я интерпретирую закономерности.

2) Корреляция + наглядность (с оговоркой причинно-следственной связи):

Напишите код, который рисует корреляционную матрицу и тепловую карту для числовых столбцов. Также нарисуйте диаграмму рассеяния трех пар с наибольшей корреляцией. Добавьте к выводу строку комментария, напоминающую вам, что корреляция не подразумевает причинно-следственную связь. Не предъявляйте причинно-следственных претензий.

3) Диагностика распределения:

Для столбца «income_tl»: напишите код, который создает гистограмму, ящичную диаграмму, значение асимметрии и сравнение медианы и среднего значения. Я буду интерпретировать, искажено ли распределение или нет; просто дайте код.

4) Сравнение сегментов:

Сравните клиентов по «каналам» (веб/мобильные устройства): напишите код, который создает диаграмму средней суммы, медианной суммы, количества заказов и распределения сумм для каждого канала. Предложите, какой тест подходит для определения статистической значимости разницы между двумя каналами, но решение остается за мной.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Найдите что-нибудь интересное в этих данных.

«Интересно» не определено; ИИ не видит данных, поэтому либо выдумывает их, либо делает общие утверждения. Нет направления, нет переменных, нет цели.

Мощная подсказка:

Ваша роль: ассистент EDA. Столбцы df: возраст (целое), доход_tl (с плавающей запятой), город (категория), канал (веб/мобильный), сумма (с плавающей запятой). Цель: раскрыть факторы, влияющие на «количество». Задача: (1) код, отображающий распределение суммы, (2) графики распределения между суммой, возрастом и доходом_tl, (3) ящичковая диаграмма суммы в разбивке по каналам. Установление причинно-следственной претензии; Просто сгенерируйте код обнаружения, и я интерпретирую шаблон.

Здесь цель, переменные и предел «утверждения причинности» ясны.

Распространенные ошибки

  • Опираясь исключительно на сводную статистику. Как показывает квартет Анскомба, за одним и тем же средним скрываются очень разные распределения; см. график.
  • Принятие корреляции за причинно-следственную связь. Совместное действие не означает, что одно ведет к другому; Остерегайтесь скрытых переменных.
  • Глядя на корреляцию без диаграммы рассеяния. Одиночный выброс или криволинейность вводят в заблуждение.
  • Суммирование двухпикового/перекошенного распределения со средним значением. Среднее значение может не отражать никого.
  • Пропускаем EDA и сразу переходим к модели. Нераспознанные данные означают слепую модель.
Совет: с каждым новым набором данных первые 30 минут тратьте на рисование графиков: гистограмму каждого числа, диаграмму рассеяния значимых пар, гистограмму категорий. Эти 30 минут предотвратят будущие ошибки моделирования на долгие дни.

В заключение

EDA — это этап изучения данных перед построением модели, на котором ищут ответы на четыре вопроса: распределение, разброс по центрам, взаимосвязи и аномалии. Сводная статистика может вводить в заблуждение; смотреть на график просто необходимо (лекция в Анскомбе). Корреляция — мощный инструмент, а причинно-следственная связь — нет, и ее обязательно следует рассматривать в сочетании с диаграммой рассеяния. ИИ — отличный ускоритель для создания графики и написания кода; Но люди, опираясь на свои полевые знания, интерпретируют, реальна ли картина, которую они видят, или это совпадение.

Задача приложения

Выберите набор данных и просто выполните EDA: извлеките гистограмму как минимум из трех числовых переменных, диаграмму рассеяния двух пар переменных и тепловую карту корреляции. Найдите хотя бы один «сюрприз» (например, распределение с двумя пиками, кандидат на ложную корреляцию, связь, привлекаемую одним выбросом) и объясните его в одном предложении. Пишите, не делая никаких причинно-следственных претензий.

контрольный список

  • [ ] Построил ли я график распределения каждой числовой переменной?
  • [ ] Смотрел ли я на корреляции с диаграммой рассеяния?
  • [ ] Разделил ли я причинно-следственную связь и корреляцию?
  • [ ] Разве я не заметил асимметричных или двухпиковых распределений и не слепо доверял среднему значению?
  • [ ] Вывел ли я хотя бы один аспект/гипотезу моделирования на основе результатов EDA?