Прибыль:
- Возможность создавать описательную статистику и диаграммы распределения/связи с поддержкой искусственного интеллекта и выбирать правильный тип диаграммы в соответствии с данными и вопросом.
- Способность распознавать ошибочные варианты (пунктирная ось, неподходящий масштаб, чрезмерное сглаживание) в изображениях, созданных искусственным интеллектом, и применять принципы честной визуализации.
- Умение отличить, что исследовательский анализ предназначен для генерации гипотез и ловушки открытия и подтверждения с использованием одних и тех же данных (что открывает дверь для p-хакинга).
После очистки данных первая задача исследователя-эмпирика — изучить их. Этот этап называется исследовательским анализом данных (EDA — Exploratory Data Analysis): это процесс изучения данных с помощью графиков и сводной статистики и просмотра их структуры, закономерностей и сюрпризов. Цель — пока не проверить гипотезу, а познакомиться с данными, сформулировать вопросы и заложить основу для модели, которую вы построите в будущем. В этом модуле мы увидим, как искусственный интеллект (ИИ) ускоряет EDA и визуализацию, но почему создаваемая им графика должна подвергаться тщательному аудиту.
Давайте сначала сделаем два основных различия. Во-первых, описательная статистика (числа, которые суммируют данные, такие как среднее значение, медиана, стандартное отклонение, квартили) и визуализация (отображение одной и той же информации в графическом виде) дополняют друг друга; Вместе они описывают данные. Второе, и самое важное: необходимо различать открытие и подтверждение. Исследовательский анализ предназначен для генерации гипотез; Исследование гипотезы с теми же данными и высказывание: «Я проверил ее и нашел ее значимой» открывает дверь для p-хакинга, который мы увидим в следующем разделе. Вы можете бесплатно просмотреть данные и увидеть закономерность; Но объявлять эту закономерность «доказанным открытием» в одних и тех же данных — заблуждение.
Пошаговый исследовательский анализ
1. Одномерный взгляд. Исследуйте каждую переменную индивидуально: является ли ее распределение симметричным или асимметричным; сколько здесь холмов; Где выбросы? Для числовых переменных — гистограмма (график, показывающий частоту путем деления значений на диапазоны) и boxplot (boxplot — диаграмма, показывающая медианные, квартильные и экстремальные значения); Для категориальных переменных используйте таблицы частот и гистограммы.
2. Двумерный вид. Посмотрите взаимосвязь между двумя переменными: диаграмма рассеяния для двух числовых переменных (показывает каждое наблюдение как точку на плоскости xy), сгруппированная ящичная диаграмма для числово-категориальных переменных, перекрестная таблица для двух категориальных переменных. Прежде чем смотреть на коэффициент корреляции, обязательно посмотрите на график рассеяния: одна и та же корреляция может показывать очень разные закономерности (это демонстрирует знаменитый квартет Анскомба; четыре набора данных имеют почти одинаковую статистику, но при построении графика они оказываются совершенно разными).
3. Выберите правильный тип диаграммы. Тип диаграммы зависит от вашего вопроса и типа данных. Гистограмма распределения; рассеяние для отношений; линейный график изменений с течением времени; гистограмма для сравнения категорий; (тщательно) сложенная полоса соотношения частей к целому. ИИ быстро генерирует для вас код, но решение «какой график для какого вопроса» остается за вами.
4. Отмечайте закономерности, не объявляйте результаты. Запишите любую интересную закономерность, которую вы видите, как «заметку открытия», но не считайте ее подтвержденной находкой. Подтверждение выполняется отдельным этапом, желательно с отдельными данными или по заранее определенному графику.
Честные принципы визуализации
Графика убеждает; Следовательно, его вводящая в заблуждение сила также высока. ИИ может делать эстетичный, но иногда вводящий в заблуждение выбор. Проверьте эти правила:
- В гистограммах ось Y должна начинаться с нуля. Пунктирная ось показывает небольшие различия как большие.
- Масштаб должен быть последовательным. Если сравниваются две диаграммы, используйте один и тот же диапазон осей.
- Чрезмерное сглаживание может скрыть истинную картину. Линия тренда выглядит красиво, но если она слишком сильно «сглаживает» данные, это может ввести в заблуждение.
- Цвет и трехмерное оформление искажают внимание, а не данные. Выбирайте простоту.
- Отсутствующие данные и размер выборки должны быть видны. «n=12» и «n=12 000» не должны выглядеть одинаково.
Внимание: графика, созданная ИИ, красива только потому, что она не соответствует действительности. Самая распространенная ошибка, которую он допускает, — это не начинать ось с нуля на гистограмме и преувеличивать разницу между двумя группами. Всегда проверяйте ось.
Сравнительная таблица: вопрос → таблица
Спросить
правильный график
Распространенная ошибка
Как распределяется эта переменная?
Гистограмма/ящичная диаграмма
используйте круговую диаграмму
Связаны ли две числовые переменные?
График рассеяния
Просто глядя на количество корреляций
Как оно изменилось с течением времени?
линейный график
Определение тренда с помощью гистограммы
В чем разница между группами?
Сгруппированный блок/бар (с нуля)
Усеченный стержень оси
Соотношение части и целого?
Штанга с накоплением (с осторожностью)
Многосрезовая круговая диаграмма
Четыре копируемых подсказки
1. Код автоматического обнаружения:
Ваша роль: ассистент EDA. Я не делюсь данными, мне нужен код R (ggplot2). В кадре данных «данные» имеются числовые (доходы, возраст, расходы) и категориальные (регион, образование) переменные. Задача: написать код, который создает гистограмму для каждого числа, гистограмму для каждой категории и диаграмму рассеяния для дохода~возраста. На гистограммах пусть ось Y начинается с НУЛЯ. Добавьте строку комментария.
2. Корреляционный обзор (корреляция + визуал вместе):
Напишите код, который одновременно вычисляет корреляцию Пирсона для доходов и расходов и строит диаграмму рассеяния + линейный тренд. Добавьте строку комментария, напоминающую мне о необходимости изучить график, прежде чем ДОВЕРЯТЬ счетчику корреляции (предупреждение Анскомба). Не сглаживайте линию тренда слишком сильно.
3. Аудит добросовестности:
Проверьте следующий код ggplot для честной визуализации: [код]. Проверьте и исправьте следующее: начинается ли ось Y с нуля, согласован ли масштаб, виден ли размер выборки, нет ли чрезмерного сглаживания? Объясните обоснование каждого сделанного вами исправления.
4. Составление заметки об открытии (не заключения):
На основе составленных мной графиков запишите НАБЛЮДЕНИЯ как «открытую заметку»; напишите каждый пункт на языке «гипотезы, которую необходимо проверить», а не «убедительного открытия». Пример: «Доход в сфере высшего образования КАЖЕТСЯ более распределенным; следует проверять на отдельных данных». Избегайте причинно-следственных и однозначных утверждений.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Постройте красивые графики доходности и расскажите мне, что они означают.
Эта подсказка приводит к вводящему в заблуждение выводу: слово «красиво» фокусируется на эстетике, а «что это значит» подталкивает ИИ к переходу от открытия к окончательному выводу. Далее следуют причинные, преувеличенные комментарии.
Мощная подсказка:
Ваша роль: честный помощник EDA. Задача: (1) выбрать тип диаграммы, которая соответствует моему вопросу, и написать обоснование, (2) начать ось с нуля в гистограммах, (3) интерпретировать выходные данные на языке DISCOVERY ПРИМЕЧАНИЕ: никаких окончательных/причинных утверждений предложить гипотезу на языке «необходимо проверить», (4) предупредить меня, если выборка мала (n <30). Я запущу диаграмму в своей собственной среде и проверю ее.
Отличие: сильная воля оправдывает тип карты, налагает правила честности и не путает открытие с подтверждением.
три мини-кейса
Случай 1 — Преувеличение дискретной оси. Аналитик показал оценки удовлетворенности двух филиалов (7,8 и 8,0 из 10) на гистограмме. При запуске оси YZ от 7,5 вторая ветвь оказалась почти в два раза выше первой; тогда как разница составила всего 2,5%. Руководство собиралось наградить филиал под неправильным впечатлением. Когда я запускал ось с нуля, разница была практически незаметна. Урок: сам выбор оси меняет восприятие.
Случай 2 — Доверие к корреляции и пропуск графика. Исследователь увидел r = 0,81 между двумя переменными и написал «сильная линейная связь». Когда его консультант запросил диаграмму рассеяния, выяснилось, что связь на самом деле обусловлена одним крайним наблюдением, а когда эту точку удалили, корреляция упала до 0,12. Урок: подсчет корреляций не заменяет график; всегда смотрите на разброс.
Случай 3 — Сбивающее с толку открытие с подтверждением. Один студент просмотрел все парные корреляции в наборе данных из 40 переменных, выбрал самую высокую (r=0,52) и написал: «Мы обнаружили значительную связь между образованием и сбережениями (p=0,004)». Однако пар по 40 переменным были сотни; выбор самого высокого был ошибочным и случайным открытием. Урок: обнаруженную закономерность нельзя «проверить и объявить значимой» на одних и тех же данных; Требуется отдельное подтверждение.
Распространенные ошибки
- Не начинать ось с нуля на гистограмме. Это преувеличивает небольшую разницу; Самая распространенная визуальная ложь. Всегда проверяйте.
- Смотрим на корреляцию и пропускаем график. Одна и та же корреляция возникает из совершенно разных моделей; может соответствовать выбросным отношениям. Во-первых, рассеяние.
- Рассматривая закономерность, обнаруженную в ходе открытия, как «доказательство» в тех же данных. Это путь к p-хакерству; Подтверждение осуществляется отдельно.
- Неправильный тип диаграммы. Такие совпадения, как полоса тренда и круговая диаграмма распределения, вводят в заблуждение. Выберите жанр в зависимости от вопроса.
- Сокрытие размера выборки. n=8 и n=8000 не должны выглядеть одинаково на одном графике; необходимо показать неуверенность.
Совет: Прежде чем публиковать диаграмму, спросите себя: «Изменится ли история, если я поменяю ось?» Если ответ положительный, возможно, вы начали разворот с нечестного места.
В итоге
Исследовательский анализ данных — это этап знакомства с данными, выявления закономерностей и выработки гипотез; Это не подтверждение. ИИ быстро генерирует описательную статистику и код графика, но вы выбираете тип графика на основе вашего вопроса и контролируете принципы справедливости (нулевая ось, последовательный масштаб, кажущаяся неопределенность). Посмотрите на разброс, прежде чем доверять корреляционному числу; Не объявляйте закономерность, которую вы обнаружили при открытии, «доказательством» в тех же данных. Красивый график ИИ не означает правильный график.
Задача приложения
Выберите не менее трех переменных в наборе данных. Попросите ИИ и запустите код, который создает исследовательские графики (гистограммы, разбросы, прямоугольники) с подсказкой, обеспечивающей соблюдение правил честности. Для каждой диаграммы: проверьте (1) соответствие типа диаграммы вопросу, (2) честность оси, (3) видимость размера выборки. Напишите хотя бы одну «открытую заметку» на языке гипотез («…кажется, проверяется отдельно»). Изучите корреляцию как с подсчетом, так и с разбросом, и сообщите, есть ли между ними несоответствие.
контрольный список
- [ ] Я выбрал тип диаграммы в зависимости от моего вопроса и типа данных.
- [ ] На гистограммах я начинаю ось Y с нуля; Проверил честность оси.
- [ ] Прежде чем поверить в корреляцию, я посмотрел на диаграмму рассеяния.
- [ ] Я отразил размер выборки и неопределенность на графике.
- [ ] Я описал закономерности, которые обнаружил в ходе исследования, как «гипотезу, которую необходимо проверить», а не как «доказательства».
- [ ] Я отметил, что не буду использовать одни и те же данные для подтверждения и что требуется отдельный шаг.