Прибыль:
- Поймите, что p-хакинг, HARKing, выборочная отчетность и сад разветвлений приводят к ложным выводам, и узнайте, как искусственный интеллект может ускорить эти ловушки.
- Возможность установить защиту, такую как предварительная регистрация, план анализа, дисциплина множественного сравнения и анализ чувствительности с поддержкой искусственного интеллекта.
- Возможность усвоить честный дизайн запроса, который позволит искусственному интеллекту отклонять запросы типа «найти значимый результат», и что окончательная ответственность лежит на исследователе.
В предыдущем разделе мы увидели, что такое p-значение, а что нет. В этом разделе мы рассмотрим более темную тему — систематические ловушки, угрожающие статистической достоверности. Большинство из них не являются преднамеренным мошенничеством; Это коварные механизмы, в которые попадают даже благонамеренные исследователи, даже не осознавая этого. А искусственный интеллект (ИИ) упрощает и ускоряет эти ловушки, поскольку позволяет проводить десятки анализов за секунды. Цель этого модуля — создать дисциплину, которая превратит ИИ из «машины для получения значимых результатов» в честного помощника.
Основные подводные камни
p-хакинг (поиск p-значения): анализ повторяется разными способами до тех пор, пока не будет получен значимый результат (p<0,05). Добавление и удаление переменных, выбор подвыборок, изменение определения выбросов, попытка различных преобразований, использование разных результирующих переменных, остановка сбора данных, когда это становится значимым... Каждая попытка дает новый «шанс»; Если вы очень постараетесь, один из них окажется значимым, даже если на самом деле он не имеет никакого эффекта. Результат: ложные результаты, которые были опубликованы, но не воспроизводимы.
HARKing (выдвижение гипотез после того, как результаты стали известны): выдвижение гипотезы после просмотра результатов и представление ее так: «Я предсказал это с самого начала». Вы смотрите на данные и находите наиболее поразительную взаимосвязь, а затем пишете статью так, как если бы она была создана для проверки этой гипотезы. Это вводит читателя в заблуждение, делая открытие похожим на подтверждение.
Выборочная отчетность (выбор вишни): отчетность только о «хороших» результатах из десятков анализов и молчание о остальных. Это также известно как «проблема ящика с файлами»: в ящике остаются бессмысленные результаты, что делает литературу систематически предвзятой.
Сад расходящихся троп: термин Эндрю Гельмана. Даже без единого преднамеренного р-хакинга исследователь делает множество разумных выборов на основе данных (какая переменная, какой порог, какая подгруппа, какое преобразование). Эти следственные степени свободы настолько многочисленны, что вы фактически выбираете значимую из множества анализов — даже без какого-либо злого умысла. Результатом снова является рост числа ложноположительных результатов.
Внимание: большинство этих ловушек не являются преднамеренными уловками. Сумма, казалось бы, невинных шагов, таких как «Я только что попробовал еще несколько моделей», «Когда я удалил выброс, стало чище», «Эффект более очевиден в этой подгруппе», может привести к ложному результату. Честность — это вопрос метода, а не намерения.
Почему ИИ увеличивает эти ловушки?
Примерка трех моделей вручную требует времени; YZ производит 50 вариантов моделей, 10 различных модификаций, 8 подгрупп за считанные минуты. Эта сила губительна без честного плана: запрос типа «найти значимую взаимосвязь в этих данных» или «построить модель, поддерживающую эту гипотезу» превращает ИИ напрямую в механизм р-хакинга. ИИ тоже хочет быть полезным; стремится найти «значимый» результат, который вас удовлетворит. Вот почему ваш быстрый дизайн — это первая линия защиты честности.
Защита: честный ход бизнеса
1. Предварительная регистрация. Это означает запись вашей гипотезы, переменных, модели и тестов в письменном виде (возможно, на платформе с отметкой времени) перед выполнением анализа. Таким образом, открытие отделено от подтверждения; все, что вы измените впоследствии, помечается как «проводник».
2. План анализа. Даже если вы не можете сделать предварительную запись, напишите план анализа, прежде чем углубляться в данные: основная гипотеза, основная переменная результата, основная модель. С самого начала установите различие между «основным анализом» и «дополнительным/исследовательским анализом» и сохраните его в отчете.
3. Сообщайте обо всем: не скрывайте модели, которые вы опробовали. В разделе «Анализ чувствительности» (проверка устойчивости) покажите, как различные спецификации меняют результат. Этот вывод является убедительным только в том случае, если он подтверждается многими правдоподобными вариантами выбора.
4. Дисциплина множественных сравнений: если вы провели слишком много тестов, исправьте их (блок 6). Ответьте на вопрос «Сколько тестов я сдал?» честно.
5. Анализ чувствительности. Повторите основной результат с другим образцом, другим контрольным набором и другим преобразованием. Если результат изменится, не скрывайте его, сообщите об этом.
Сравнительная таблица: честный против ловушки
Приложение
форма ловушки
Честный эквивалент
Выбор модели
Попытка, пока это не обретет смысл (п-хакерство)
Предварительно запланированная мастер-модель
гипотеза
Примерка постфактум (ВНИМАНИЕ)
Предварительно записанные, перед данными
Отчетность
Не показывайте только красивых
Все характеристики + чувствительность
подгруппа
Выбираем самое яркое
Предопределенный, корректируемый
сбор данных
Остановитесь, когда это имеет смысл
заранее определенный образец
Четыре копируемых подсказки
1. Честная система претензий:
Ваша роль: честный помощник по статистике. Моя цель НЕ найти значимый результат, а найти правильный результат. ПРАВИЛА: - НЕ давайте мне предложений типа «попробуйте модели, пока это не станет иметь смысл», - сообщите мне, если вы предлагаете несколько спецификаций, о которых необходимо сообщить, - предупредите меня о любых шагах, которые могут привести к p-хакерству. Помогите мне сначала прояснить мою основную модель, отделив открытие от подтверждения.
2. Проект плана анализа:
Помогите мне составить предварительный план анализа исследования: основная гипотеза, основная переменная результата, основная спецификация модели, заранее определенные подгруппы, стратегия множественного сравнения. Вынесите «исследовательский» и «подтверждающий» анализы в отдельные заголовки. Напомните мне заполнить это, НЕ ПРОСМОТРЯ на данные.
3. Анализ чувствительности:
Мой главный вывод — написать код анализа чувствительности (R). Моя цель — ВИДЕТЬ, насколько надежен результат, а НЕ выбрать лучший; показать все результаты.
4. Самоконтроль:
Я объясню процесс моего анализа; Дайте мне контрольный список для взлома/подслушивания/выборочного сообщения и отметьте, какие из моих шагов являются рискованными. Спросите меня, сколько моделей/тестов я опробовал и о каких из них планирую сообщить.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Какие переменные показывают значимые связи в этих данных, найдите лучшую модель.
Эта подсказка представляет собой прямую инструкцию по взлому: ИИ пробует десятки комбинаций и представляет ту, которая «имеет наибольший смысл». Результатом почти наверняка будет ложное открытие, которое невозможно воспроизвести.
Мощная подсказка:
Ваша роль: честный помощник. ГЛАВНАЯ модель, которую я предопределил: Y ~ X + элементы управления. Напишите код, который предсказывает эту модель. НЕ ищите другую «более содержательную» модель. Также предложите провести анализ чувствительности, чтобы я мог увидеть надежность результата, но знайте, что я сообщу ВСЕ результаты, а не выберу лучший. Не позволяйте мне списывать любые результаты исследований как «подтвержденные».
Отличие: сильная воля фиксирует основную модель, запрещает поиск и требует сообщать обо всех результатах.
три мини-кейса
Случай 1 — Поиск подгрупп. Один исследователь не обнаружил никакого эффекта во всей выборке; Он спросил у ИИ «в какой подгруппе это значимо?» YZ просканировал комбинации возраста, пола и региона и обнаружил «p = 0,03 у городских женщин в возрасте 35–44 лет». Статья была основана на этой подгруппе. Его повторение не дало никакого эффекта: это было результатом случайности десятков подгрупп. Урок: выбранная подгруппа после того, как данные являются HARKing, а не подтверждением.
Случай 2 — Охота за конверсиями. Отношения, которые оказываются бессмысленными на студенческом уровне; попробовал это в логарифмической, квадратной, квадратной и лаговой формах; Он нашел p=0,048 в логарифмической форме и сообщил только об этом. К счастью, одна из пяти попыток перешагнула порог. Правильный путь был: заранее выбрать форму с теорией и показать результат всех форм в таблице чувствительности. Урок: выборочное освещение событий приводит к ложному значению.
Случай 3. Как работает честный подход. Одна команда предварительно зарегистрировалась перед анализом: одна первичная гипотеза, одна основная модель, две заранее определенные подгруппы, коррекция Бонферрони. Основной эффект был незначительным, но команда честно сообщила о нем; Исследователь отметил один результат как «необходимый для проверки в будущем». Исследование было воспроизводимым и надежным. Урок: честное планирование оправдывает даже «неудачный» результат.
Распространенные ошибки
- Приказать ИИ «найти значимые результаты». Это настоящий хакинг; Поставьте ИИ в честные рамки, требуя точности, а не результатов.
- Представление открытия как подтверждения (HARKing). Ошибочно записывать гипотезу, выдвинутую после получения данных, как «Я предсказал ее с самого начала»; Обозначьте исследовательскую находку.
- Просто сообщаю о хороших результатах. Показать все протестированные характеристики; Сокрытие анализа настроений ставит под угрозу честность.
- Скрининг подгрупп/конверсий. Выбор наиболее значимой из десятков подгрупп или преобразований приводит к ложным выводам; определите и исправьте заранее.
- Забыв, сколько тестов ты сделал. Следите за общим количеством попыток; Ни одно значение p нельзя честно интерпретировать, не зная этого числа.
Совет: прежде чем записать результат, спросите себя: «Сколько способов я молча попробовал, пока не нашел этот результат, и обо всех ли я сообщаю?» Если некоторые эссе останутся в ящике стола, ваш отчет будет выглядеть сильнее, чем есть на самом деле.
В заключение
p-хакинг, HARKing, выборочные репортажи и сад расходящихся троп; Многие из них представляют собой ловушки, которые действуют непреднамеренно, но дают ложные, невоспроизводимые результаты. ИИ ускоряет эти ловушки, потому что он может мгновенно провести десятки анализов; Запросы типа «найти значимые результаты» превращают ИИ в механизм р-хакинга. Оборона; отделение открытия от подтверждения с помощью плана предварительной регистрации и анализа, отчета обо всех спецификациях и анализа чувствительности, корректировки множественных сравнений и помещения ИИ в честную структуру, требующую «правильного результата». Окончательная ответственность всегда лежит на исследователе.
Задача приложения
Выберите вопрос исследования и напишите краткий план анализа, прежде чем просматривать данные: основная гипотеза, основная модель, основная переменная результата, заранее определенные подгруппы, стратегия множественного сравнения. Затем оцените основную модель. Затем выполните анализ чувствительности (различные элементы управления, включенные/исключенные выбросы, разные формы функций) и покажите все результаты в одной таблице. В одном абзаце оцените, какие шаги представляют риск взлома и как ваша честная система ограничивает их.
контрольный список
- [ ] Прежде чем углубиться в данные, я написал план анализа/основную модель.
- [ ] Я обозначил исследовательский и подтверждающий анализы отдельно; Я не ВНИМАЛ.
- [ ] Я сообщил обо всех характеристиках, которые пробовал; Я не просто выбрала красивую.
- [ ] Подгруппы и преобразования я определил заранее, не сканировал их после данных.
- [ ] Я отслеживал, сколько тестов я провел, и вносил необходимые исправления.
- [ ] Я использовал ИИ в контексте «найти истину», а не «найти в ней смысл»; Я взял на себя ответственность.