Прибыль:
- Способность правильно определять нулевую гипотезу, значение p, доверительный интервал и статистическую мощность, а также использовать искусственный интеллект при выборе и интерпретации тестов.
- Способность различать, что является p-значением, а что нет (не размер эффекта, не вероятность точности) и понимать, почему необходима коррекция множественного сравнения.
- Способность распознавать комментарии искусственного интеллекта, которые путают значимость с существенностью, и сообщать о них с размером эффекта и неопределенностью.
Наиболее используемым и наиболее неправильно понимаемым инструментом статистики является проверка гипотез. Основная идея проста: у нас есть утверждение (например, «среднее значение этих двух групп различно») и его противоположность, нулевая гипотеза (H0 — «на самом деле разницы нет»). Тест измеряет, насколько хорошо данные согласуются с нулевой гипотезой. В этом разделе мы увидим, как искусственный интеллект (ИИ) упрощает выбор и интерпретацию тестов, но почему ошибки, связанные с значением p, настолько распространены и опасны. Начнем с самого начала: ИИ знает, какой синтаксис тестов писать; но ваша задача — интерпретировать, выполняется ли предположение теста и что на самом деле означает результат.
Что на самом деле представляет собой значение p?
Значение p — это вероятность того, что наблюдаемый вами результат или более экстремальный результат возникнет случайно, когда нулевая гипотеза верна (т. Е. На самом деле эффекта нет). Небольшое значение p (0,05 — традиционный порог) означает, что «было бы удивительно увидеть такие данные, если бы эффекта действительно не было»; Это считается доказательством против нулевой гипотезы.
Теперь проясним, чем не является p-значение — что ИИ часто путает:
- Значение p не является вероятностью того, что нулевая гипотеза верна. p=0,03 не означает, что «вероятность отсутствия эффекта составляет 3%».
- Значение p не указывает на размер эффекта. Очень небольшой эффект может привести к крошечному значению p в большой выборке.
- Значение p не доказывает, что результат является значимым или реальным. «Значительный» — это статистический термин, «значительный» — это суждение.
- р>0,05 не означает «отсутствие эффекта»; Это значит «мы не смогли показать эффект с этими данными». Отсутствие доказательств не является доказательством отсутствия.
Внимание: наиболее распространенной ошибкой интерпретации ИИ является представление слова «значительный» как «значительное/сильное/значительное воздействие». Статистическая значимость и практическая значимость — две разные вещи; Всегда сообщайте об этих двух случаях отдельно.
Доверительный интервал и размер эффекта: более подробная информация
Вместо одного значения p гораздо более информативен доверительный интервал: он дает вероятный диапазон значений для вашей оценки. Предложение «Эффект 1200, 95% доверительный интервал [300, 2100]» показывает как направление, величину, так и неопределенность; «p<0,05» просто означает «далеко от нуля». Современная статистическая практика использует не только значение p; рекомендует составлять отчеты с использованием трио: размер эффекта + доверительный интервал + значение p.
Статистическая мощность и выборка
Статистическая мощность — это вероятность обнаружения эффекта, который действительно существует (1 минус вероятность ошибки второго рода, т. е. «упущения реального эффекта»). Исследование с недостаточной статистикой подвержено двум рискам: (1) оно упускает истинные эффекты (ложноотрицательный результат); (2) те немногие результаты, которые действительно оказываются значимыми, имеют завышенные величины — так называемое проклятие победителя, поскольку только завышенные прогнозы могут преодолеть порог. Поэтому перед анализом рекомендуется рассчитывать мощность/пробу. ИИ генерирует код для этой учетной записи; Вы определяете целевой размер эффекта с помощью теории.
Проблема множественного сравнения
При проведении теста порог 0,05 означает «5% риск ложноположительных результатов». Но если вы проведете 20 тестов, в среднем можно ожидать, что один из них случайно даст p<0,05, даже если все они на самом деле неэффективны. Это называется проблемой множественного сравнения. Вероятность ложноположительных результатов быстро возрастает при тестировании большого количества переменных, подгрупп или переменных результатов. Решение — скорректировать порог: методы Бонферрони (деление порога на количество тестов — строгое), Холма или методы Бенджамини-Хохберга, контролирующие уровень ложных обнаружений (FDR). Этот риск становится еще больше в эпоху ИИ, поскольку ИИ может производить десятки тестов за секунды — это непосредственная тема следующего раздела (п-хакинг).
Сравнительная таблица: о чем говорит значение p и о чем не говорит
выражение
Это правда?
Описание
«p=0,02, вероятность отсутствия эффекта 2%»
неправильно
p не является вероятностью H0
«p<0,05, эффект большой»
неправильно
p не указывает размер
«p=0,20, эффекта нет»
неправильно
Неспособность показать — это не отсутствие.
«p<0,05, есть данные против H0»
Правда
Осторожно и по делу
«Эффект 1,200 [300;2,100], p=0,01»
лучший
Размер + неопределенность + доказательства
Четыре копируемых подсказки
1. Выбор правильного теста:
Ваша роль: помощник по статистическому тестированию. Я хочу сравнить среднее значение двух независимых групп (непрерывная переменная). Дайте мне: какой тест подходит (с его предположениями: нормальность, равенство дисперсий), альтернативу, если предположение не выполняется (например, Уэлч, Манн-Уитни), и код R. Я прогоню результат и проверю предположения.
2. Правильно сообщать значение p:
Сообщите о результатах теста ниже, но ПРАВИЛА: - НЕ ПРЕДСТАВЛЯЙТЕ значение p как «вероятность H0» или «размер эффекта», - обязательно укажите размер эффекта и 95% доверительный интервал, - напишите «значительный» и «значительный» отдельно, - если p>0,05, НЕ говорите «нет эффекта», скажите «мы не смогли показать». Вывод: [вставить]
3. Расчет мощности/выборки:
Планирую эксперимент: две группы, ожидаемая величина эффекта (d Коэна) ~0,4, мощность 0,80, альфа 0,05. Напишите код R, который рассчитывает необходимый размер выборки (пакет PWR) и объясняет риски маломощного исследования («проклятие победителя»).
4. Коррекция множественного сравнения:
Я провел 15 отдельных проверок гипотез и получил значения p. Напишите код R, который применяет поправки Бонферрони и Бенджамина-Хохберга (FDR), объясните разницу между двумя методами и суммируйте в одном предложении, почему я не должен доверять голому p<0,05.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Имеет ли смысл результат этого теста? Прокомментируйте результат.
Это утверждение заключает ИИ в бинарную систему «значимое/бессмысленное»; скорее всего, получается предложение, в котором величина путается со значимостью, например: «да, это важно, эффект сильный».
Мощная подсказка:
Ваша роль: внимательный статистический помощник. Интерпретируйте результат, но: (1) укажите размер эффекта + 95% доверительный интервал + значение p вместе, (2) отделите значимость от значимости, (3) p>0,05 в «не удалось показать», (4) спросите, сколько тестов я сделал; Если их больше одного, предложите коррекцию множественного сравнения, (5) напомните, что предположения теста должны быть проверены.
Отличие: сильная подсказка обеспечивает расширенную отчетность и защищает от ловушек p-значения.
три мини-кейса
Случай 1 — Незначительная «значимость» в большой выборке. Один аналитик обнаружил, что средняя разница между двумя группами «весьма значима» при p<0,001 по данным 500 000 наблюдений. Но разница составила всего 0,3 балла (из 100) и была практически бессмысленной. Огромная выборка сделала даже крошечную разницу «значительной». Когда сообщалось о размере эффекта, результат оказался незначительным. Урок: значимость — это не величина; Если n велико, каждое различие значимо.
Случай 2. Иллюзия множественного тестирования. Одна команда протестировала 22 переменных результата; Один из них показал p=0,04 и был объявлен как «мы нашли эффект». С поправкой Бонферрони порог снизился до 0,05/22 = 0,0023; 0,04 не преодолел этот порог. Единственный «значимый» результат был бы случайным из 22 испытаний. Урок: при большом тестировании необходима коррекция.
Случай 3 — Недостаток сил и проклятие победителя. Небольшое пилотное исследование (n=15 на группу) выявило очень большой (d=0,9) и значимый эффект. Большое повторное исследование снизило эффект до d = 0,2. Небольшая выборка позволила завышенной оценке лишь преодолеть порог. Урок: нельзя доверять значительным размерам эффекта при малой мощности.
Распространенные ошибки
- Путаница значимости с важностью/величиной. Эффект невелик только потому, что p мало; О величине эффекта сообщайте отдельно.
- Ошибочное значение p за вероятность H0. p не является «вероятностью отсутствия эффекта»; концептуально отличается.
- Значение p>0,05 означает «нет эффекта». Неявка не является доказательством отсутствия; Укажите неопределенность.
- Без поправки на многократное тестирование. Слишком много тестов дают ложноположительные результаты; Примените Бонферрони/ФДР.
- Игнорирование власти. Значительный эффект в небольшой выборке преувеличен; Рассчитайте мощность перед анализом.
Совет: Прежде чем списывать результат на «значительный», задайте два вопроса: «Является ли эффект практически значимым (величиной)?» и «Сколько тестов я сдал, прежде чем нашел этот результат?» Второй вопрос – это лакмусовая бумажка честности.
В итоге
Проверка гипотез и p-значение — мощные, но неправильно понимаемые инструменты. Значение p — это вероятность увидеть данные, когда нулевая гипотеза верна; Вероятность H0 не является величиной эффекта или значимостью открытия. Всегда сообщайте о значимости вместе с размером эффекта и доверительным интервалом; Не читайте p>0,05 как «нет эффекта»; примените коррекцию множественного сравнения, если вы провели много тестов; Помните о риске преувеличенных эффектов маломощных исследований. ИИ создает тестовый код и схему; Вы обязаны различать значимость и существенность и проверять предположения.
Задача приложения
Сделайте сравнение средних значений между двумя группами в наборе данных. Попросите у ИИ соответствующий тест (с его предположениями) и код, запустите его и проверьте предположения. Сообщите результат с тремя компонентами: размер эффекта, 95% доверительный интервал, значение p. Затем подумайте, сколько разных сравнений вы можете провести с одними и теми же данными; Если вы выполнили несколько тестов, примените поправку Бонферрони или FDR и сообщите, сохраняется ли результат. Наконец, напишите приблизительную оценку мощности для вашего анализа.
контрольный список
- [ ] Я выбрал тест с его предположениями и проверил предположения.
- [ ] Я представил результат как размер эффекта + доверительный интервал + значение p.
- [ ] Я разделил «значительное» и «важное»; Я не думал, что p — это вероятность H0.
- [ ] Я написал p>0,05 как «мы не смогли это показать», а не как «нет эффекта».
- [ ] Я применил коррекцию множественного сравнения, если провел несколько тестов.
- [ ] Я оценил мощность выборки; Я был осторожен в отношении размера эффекта при низкой мощности.