Единицы
1. Искусственный интеллект в эконометрике и статистике: роли, границы, аутентификация и конфиденциальность 2. Очистка и подготовка данных: недостающие данные, выбросы и кодирование 3. Исследовательский анализ и визуализация данных: построение графиков и интерпретация с помощью искусственного интеллекта 4. Линейная регрессия: построение модели, интерпретация коэффициентов и предположения 5. Регрессионная диагностика и нарушения: коллинеарность, гетероскедастичность, автокорреляция 6. Проверка гипотез и значение p: значимость, мощность и множественные сравнения 7. p-хакинг, HARKing и статистическая достоверность: подводные камни в эпоху искусственного интеллекта 8. Анализ временных рядов: стационарность, ARIMA и прогнозирование 9. Причинно-следственная связь и анализ политики: DiD, IV, RDD и искусственный интеллект 10. Генерация кода и воспроизводимость: R/Python, управление версиями и воспроизводимость 11. Написание отчета, общение и этика: представление результатов и границы сообщения
Единица 6 / 11

Проверка гипотез и значение p: значимость, мощность и множественные сравнения

Прибыль:

  • Способность правильно определять нулевую гипотезу, значение p, доверительный интервал и статистическую мощность, а также использовать искусственный интеллект при выборе и интерпретации тестов.
  • Способность различать, что является p-значением, а что нет (не размер эффекта, не вероятность точности) и понимать, почему необходима коррекция множественного сравнения.
  • Способность распознавать комментарии искусственного интеллекта, которые путают значимость с существенностью, и сообщать о них с размером эффекта и неопределенностью.

Наиболее используемым и наиболее неправильно понимаемым инструментом статистики является проверка гипотез. Основная идея проста: у нас есть утверждение (например, «среднее значение этих двух групп различно») и его противоположность, нулевая гипотеза (H0 — «на самом деле разницы нет»). Тест измеряет, насколько хорошо данные согласуются с нулевой гипотезой. В этом разделе мы увидим, как искусственный интеллект (ИИ) упрощает выбор и интерпретацию тестов, но почему ошибки, связанные с значением p, настолько распространены и опасны. Начнем с самого начала: ИИ знает, какой синтаксис тестов писать; но ваша задача — интерпретировать, выполняется ли предположение теста и что на самом деле означает результат.

Что на самом деле представляет собой значение p?

Значение p — это вероятность того, что наблюдаемый вами результат или более экстремальный результат возникнет случайно, когда нулевая гипотеза верна (т. Е. На самом деле эффекта нет). Небольшое значение p (0,05 — традиционный порог) означает, что «было бы удивительно увидеть такие данные, если бы эффекта действительно не было»; Это считается доказательством против нулевой гипотезы.

Теперь проясним, чем не является p-значение — что ИИ часто путает:

  • Значение p не является вероятностью того, что нулевая гипотеза верна. p=0,03 не означает, что «вероятность отсутствия эффекта составляет 3%».
  • Значение p не указывает на размер эффекта. Очень небольшой эффект может привести к крошечному значению p в большой выборке.
  • Значение p не доказывает, что результат является значимым или реальным. «Значительный» — это статистический термин, «значительный» — это суждение.
  • р>0,05 не означает «отсутствие эффекта»; Это значит «мы не смогли показать эффект с этими данными». Отсутствие доказательств не является доказательством отсутствия.
Внимание: наиболее распространенной ошибкой интерпретации ИИ является представление слова «значительный» как «значительное/сильное/значительное воздействие». Статистическая значимость и практическая значимость — две разные вещи; Всегда сообщайте об этих двух случаях отдельно.

Доверительный интервал и размер эффекта: более подробная информация

Вместо одного значения p гораздо более информативен доверительный интервал: он дает вероятный диапазон значений для вашей оценки. Предложение «Эффект 1200, 95% доверительный интервал [300, 2100]» показывает как направление, величину, так и неопределенность; «p<0,05» просто означает «далеко от нуля». Современная статистическая практика использует не только значение p; рекомендует составлять отчеты с использованием трио: размер эффекта + доверительный интервал + значение p.

Статистическая мощность и выборка

Статистическая мощность — это вероятность обнаружения эффекта, который действительно существует (1 минус вероятность ошибки второго рода, т. е. «упущения реального эффекта»). Исследование с недостаточной статистикой подвержено двум рискам: (1) оно упускает истинные эффекты (ложноотрицательный результат); (2) те немногие результаты, которые действительно оказываются значимыми, имеют завышенные величины — так называемое проклятие победителя, поскольку только завышенные прогнозы могут преодолеть порог. Поэтому перед анализом рекомендуется рассчитывать мощность/пробу. ИИ генерирует код для этой учетной записи; Вы определяете целевой размер эффекта с помощью теории.

Проблема множественного сравнения

При проведении теста порог 0,05 означает «5% риск ложноположительных результатов». Но если вы проведете 20 тестов, в среднем можно ожидать, что один из них случайно даст p<0,05, даже если все они на самом деле неэффективны. Это называется проблемой множественного сравнения. Вероятность ложноположительных результатов быстро возрастает при тестировании большого количества переменных, подгрупп или переменных результатов. Решение — скорректировать порог: методы Бонферрони (деление порога на количество тестов — строгое), Холма или методы Бенджамини-Хохберга, контролирующие уровень ложных обнаружений (FDR). Этот риск становится еще больше в эпоху ИИ, поскольку ИИ может производить десятки тестов за секунды — это непосредственная тема следующего раздела (п-хакинг).

Сравнительная таблица: о чем говорит значение p и о чем не говорит

выражение

Это правда?

Описание

«p=0,02, вероятность отсутствия эффекта 2%»

неправильно

p не является вероятностью H0

«p<0,05, эффект большой»

неправильно

p не указывает размер

«p=0,20, эффекта нет»

неправильно

Неспособность показать — это не отсутствие.

«p<0,05, есть данные против H0»

Правда

Осторожно и по делу

«Эффект 1,200 [300;2,100], p=0,01»

лучший

Размер + неопределенность + доказательства

Четыре копируемых подсказки

1. Выбор правильного теста:

Ваша роль: помощник по статистическому тестированию. Я хочу сравнить среднее значение двух независимых групп (непрерывная переменная). Дайте мне: какой тест подходит (с его предположениями: нормальность, равенство дисперсий), альтернативу, если предположение не выполняется (например, Уэлч, Манн-Уитни), и код R. Я прогоню результат и проверю предположения.

2. Правильно сообщать значение p:

Сообщите о результатах теста ниже, но ПРАВИЛА: - НЕ ПРЕДСТАВЛЯЙТЕ значение p как «вероятность H0» или «размер эффекта», - обязательно укажите размер эффекта и 95% доверительный интервал, - напишите «значительный» и «значительный» отдельно, - если p>0,05, НЕ говорите «нет эффекта», скажите «мы не смогли показать». Вывод: [вставить]

3. Расчет мощности/выборки:

Планирую эксперимент: две группы, ожидаемая величина эффекта (d Коэна) ~0,4, мощность 0,80, альфа 0,05. Напишите код R, который рассчитывает необходимый размер выборки (пакет PWR) и объясняет риски маломощного исследования («проклятие победителя»).

4. Коррекция множественного сравнения:

Я провел 15 отдельных проверок гипотез и получил значения p. Напишите код R, который применяет поправки Бонферрони и Бенджамина-Хохберга (FDR), объясните разницу между двумя методами и суммируйте в одном предложении, почему я не должен доверять голому p<0,05.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Имеет ли смысл результат этого теста? Прокомментируйте результат.

Это утверждение заключает ИИ в бинарную систему «значимое/бессмысленное»; скорее всего, получается предложение, в котором величина путается со значимостью, например: «да, это важно, эффект сильный».

Мощная подсказка:

Ваша роль: внимательный статистический помощник. Интерпретируйте результат, но: (1) укажите размер эффекта + 95% доверительный интервал + значение p вместе, (2) отделите значимость от значимости, (3) p>0,05 в «не удалось показать», (4) спросите, сколько тестов я сделал; Если их больше одного, предложите коррекцию множественного сравнения, (5) напомните, что предположения теста должны быть проверены.

Отличие: сильная подсказка обеспечивает расширенную отчетность и защищает от ловушек p-значения.

три мини-кейса

Случай 1 — Незначительная «значимость» в большой выборке. Один аналитик обнаружил, что средняя разница между двумя группами «весьма значима» при p<0,001 по данным 500 000 наблюдений. Но разница составила всего 0,3 балла (из 100) и была практически бессмысленной. Огромная выборка сделала даже крошечную разницу «значительной». Когда сообщалось о размере эффекта, результат оказался незначительным. Урок: значимость — это не величина; Если n велико, каждое различие значимо.

Случай 2. Иллюзия множественного тестирования. Одна команда протестировала 22 переменных результата; Один из них показал p=0,04 и был объявлен как «мы нашли эффект». С поправкой Бонферрони порог снизился до 0,05/22 = 0,0023; 0,04 не преодолел этот порог. Единственный «значимый» результат был бы случайным из 22 испытаний. Урок: при большом тестировании необходима коррекция.

Случай 3 — Недостаток сил и проклятие победителя. Небольшое пилотное исследование (n=15 на группу) выявило очень большой (d=0,9) и значимый эффект. Большое повторное исследование снизило эффект до d = 0,2. Небольшая выборка позволила завышенной оценке лишь преодолеть порог. Урок: нельзя доверять значительным размерам эффекта при малой мощности.

Распространенные ошибки

  • Путаница значимости с важностью/величиной. Эффект невелик только потому, что p мало; О величине эффекта сообщайте отдельно.
  • Ошибочное значение p за вероятность H0. p не является «вероятностью отсутствия эффекта»; концептуально отличается.
  • Значение p>0,05 означает «нет эффекта». Неявка не является доказательством отсутствия; Укажите неопределенность.
  • Без поправки на многократное тестирование. Слишком много тестов дают ложноположительные результаты; Примените Бонферрони/ФДР.
  • Игнорирование власти. Значительный эффект в небольшой выборке преувеличен; Рассчитайте мощность перед анализом.
Совет: Прежде чем списывать результат на «значительный», задайте два вопроса: «Является ли эффект практически значимым (величиной)?» и «Сколько тестов я сдал, прежде чем нашел этот результат?» Второй вопрос – это лакмусовая бумажка честности.

В итоге

Проверка гипотез и p-значение — мощные, но неправильно понимаемые инструменты. Значение p — это вероятность увидеть данные, когда нулевая гипотеза верна; Вероятность H0 не является величиной эффекта или значимостью открытия. Всегда сообщайте о значимости вместе с размером эффекта и доверительным интервалом; Не читайте p>0,05 как «нет эффекта»; примените коррекцию множественного сравнения, если вы провели много тестов; Помните о риске преувеличенных эффектов маломощных исследований. ИИ создает тестовый код и схему; Вы обязаны различать значимость и существенность и проверять предположения.

Задача приложения

Сделайте сравнение средних значений между двумя группами в наборе данных. Попросите у ИИ соответствующий тест (с его предположениями) и код, запустите его и проверьте предположения. Сообщите результат с тремя компонентами: размер эффекта, 95% доверительный интервал, значение p. Затем подумайте, сколько разных сравнений вы можете провести с одними и теми же данными; Если вы выполнили несколько тестов, примените поправку Бонферрони или FDR и сообщите, сохраняется ли результат. Наконец, напишите приблизительную оценку мощности для вашего анализа.

контрольный список

  • [ ] Я выбрал тест с его предположениями и проверил предположения.
  • [ ] Я представил результат как размер эффекта + доверительный интервал + значение p.
  • [ ] Я разделил «значительное» и «важное»; Я не думал, что p — это вероятность H0.
  • [ ] Я написал p>0,05 как «мы не смогли это показать», а не как «нет эффекта».
  • [ ] Я применил коррекцию множественного сравнения, если провел несколько тестов.
  • [ ] Я оценил мощность выборки; Я был осторожен в отношении размера эффекта при низкой мощности.