Печалби:
- Разберете, че p-хакерството, HARKing, селективното докладване и градината на разклоняващите се пътища произвеждат фалшиви открития и вижте как изкуственият интелект може да ускори тези капани
- Възможност за установяване на защити като предварителна регистрация, план за анализ, дисциплина за множество сравнения и анализ на чувствителността с поддръжка на изкуствен интелект
- Възможност за интернализиране на дизайна на честни заявки, който ще позволи на изкуствения интелект да отхвърля заявки от типа „намиране на смислен резултат“ и че крайната отговорност е на изследователя.
В предишната част видяхме какво е p-стойност и какво не е. В тази част ще разгледаме по-тъмна тема, систематичните капани, които застрашават статистическата цялост. Повечето от тях не са умишлена измама; Това са коварни механизми, в които дори добронамерените изследователи попадат, без да го осъзнават. А изкуственият интелект (AI) прави тези клопки както по-лесни, така и по-бързи, тъй като прави възможно извършването на десетки анализи за секунди. Целта на това звено е да установи дисциплината, която ще превърне ИИ от „машина за намиране на смислени резултати“ в честен помощник.
Основни клопки
p-хакване (търсене на p-стойност): Опитва се анализът отново по различни начини, докато се получи значим резултат (p<0,05). Добавяне и премахване на променливи, избиране на подпроби, промяна на дефиницията на извънредни стойности, опитване на различни трансформации, използване на различни променливи на резултата, спиране на събирането на данни, когато стане значимо... Всеки опит дава нов "шанс"; Ако се постараете достатъчно, едно от тях ще се окаже смислено, дори ако всъщност няма ефект. Резултатът: фалшиви открития, които са публикувани, но не могат да бъдат възпроизведени.
HARKing (изготвяне на хипотеза след като резултатите са известни): Създаване на хипотеза, след като видите резултатите и представянето й като „Предсказах го така от самото начало“. Разглеждате данните и намирате най-удивителната връзка, след което пишете статията, сякаш е предназначена да тества тази хипотеза. Това подвежда читателя, като прави откритието да изглежда като потвърждение.
Селективно докладване (избиране на череши): Докладване само на „добрите“ от десетки анализи и безмълвно погребване на останалите. Това е известно още като „проблем с чекмеджето на файла“: безсмислени резултати остават в чекмеджето, което прави литературата систематично предубедена.
Градина от разклоняващи се пътеки: Терминът на Андрю Гелман. Дори без нито едно умишлено p-хакване, изследователят прави много разумни избори въз основа на данните (коя променлива, кой праг, коя подгрупа, коя трансформация). Тези степени на свобода на разследване са толкова многобройни, че вие на практика избирате значимата от множество анализи – дори без злонамереност. Резултатът отново е нарастващ процент фалшиви положителни резултати.
Внимание: Повечето от тези капани не са умишлени трикове. Сборът от привидно невинни стъпки като „току-що пробвах още няколко модела“, „беше по-чисто, когато премахнах отклонението“, „ефектът е по-ясен в тази подгрупа“ може да доведе до фалшива констатация. Честността е въпрос на метод, а не на намерение.
Защо AI увеличава тези капани?
Изпробването на 3 модела на ръка отнема време; YZ произвежда 50 моделни варианта, 10 различни конверсии, 8 подгрупи за минути. Тази сила е катастрофална без честен план: искане като „намерете смислена връзка в тези данни“ или „изградете модел, който подкрепя тази хипотеза“ превръща AI директно в p-hacking машина. AI също иска да бъде полезен; има тенденция да намери „смислен“ резултат, който ще ви удовлетвори. Ето защо вашият бърз дизайн е първата линия на защита на честността.
Защити: справедлив курс на работа
1. Предварителна регистрация: Това означава записване на вашата хипотеза, променливи, модел и тестове в писмена форма (възможно на платформа с времеви печат) преди извършване на анализа. Така откритието е отделено от потвърждението; всичко, което промените след това, се маркира като "изследовател".
2. План за анализ: Дори и да не можете да запишете предварително, напишете план за анализ, преди да се потопите в данните: първична хипотеза, първична променлива на резултата, основен модел. Установете разграничението между „основен анализ“ и „допълнителен/проучвателен анализ“ от самото начало и го поддържайте в доклада.
3. Докладвайте всичко: Не крийте моделите, които сте пробвали. В раздела „анализ на чувствителността“ (проверка на устойчивостта) покажете как различните спецификации променят резултата. Констатацията е силна само ако се поддържа при много правдоподобни избори.
4. Дисциплина за множествено сравнение: Ако сте направили твърде много тестове, коригирайте ги (раздел 6). Отговорете на въпроса "Колко теста съм направил?" честно казано.
5. Анализ на чувствителността: Повторете основното си откритие с различна проба, различен контролен набор и различна трансформация. Ако резултатът се промени, не го крийте, а докладвайте.
Сравнителна таблица: честен срещу капан
Приложение
форма на капан
Честен еквивалент
Избор на модел
Опитвам, докато има смисъл (p-хакване)
Предварително планиран главен модел
хипотеза
Поставяне след факта (HARKing)
Предварително записан, преди данните
Докладване
Не показвайте само красивите
Всички спецификации + чувствителност
подгрупа
Избор на най-впечатляващите
Предварително зададени, коригираеми
събиране на данни
Спрете, когато има смисъл
предварително определена проба
Четири подкани за копиране
1. Рамка за честни искове:
Вашата роля: честен асистент по статистика. Моята цел НЕ е да намеря смислен резултат, а да намеря правилния резултат. ПРАВИЛА: - НЕ ми давайте предложения от типа "пробвайте модели, докато има смисъл", - кажете ми, ако предлагате множество спецификации, всички те трябва да бъдат докладвани, - предупредете ме за всякакви стъпки, които могат да доведат до p-хакване. Помогнете ми първо да изясня моя основен модел, отделете откритието от потвърждението.
2. Проект на план за анализ:
Помогнете ми да съставя предварителен план за анализ на изследване: първична хипотеза, първична променлива на резултата, основна спецификация на модела, предварително дефинирани подгрупи, стратегия за множество сравнения. Поставете „проучвателни“ и „потвърждаващи“ анализи в отделни заглавия. Напомнете ми да попълня това, БЕЗ да преглеждам данните.
3. Анализ на чувствителността:
Моята основна констатация е да напиша код за анализ на чувствителността (R) за Моята цел е да ВИДЯ колко солиден е резултатът, НЕ да избера най-добрия; покажи всички резултати.
4. Самонаблюдение:
Ще обясня моя процес на анализ; Дайте ми контролен списък за p-hacking / HARKing / селективно докладване и отбележете кои от стъпките ми са рискови. Попитайте ме колко модела/тестове съм пробвал и кои планирам да докладвам.
Слаба подкана / Силна подкана
Слаба подкана:
Кои променливи показват значителни връзки в тези данни, намерете най-добрия модел.
Тази подкана е директна инструкция за р-хакване: AI изпробва десетки комбинации и представя тази, която „има най-голям смисъл“. Резултатът почти със сигурност е фалшива находка, която не може да бъде възпроизведена.
Мощна подкана:
Вашата роля: честен помощник. Основният модел, който предварително съм определил, е: Y ~ X + контроли. Напишете код, който предвижда този модел. НЕ търсете друг "по-смислен" модел. Предложете също анализ на чувствителността, за да мога да видя надеждността на резултата, но знайте, че ще докладвам ВСИЧКИ резултати, а не да избера най-добрия. Не ми позволявайте да отпиша каквито и да било изследователски открития като „потвърдени“.
Разлика: силната воля коригира основния модел, забранява търсенето и изисква всички резултати да бъдат докладвани.
три мини калъфа
Случай 1 — Подгрупов лов. Един изследовател не откри ефект в общата проба; Той попита AI "в коя подгрупа е значим?" YZ сканира комбинациите от възраст, пол и регион и откри "p = 0,03 при градски жени на възраст 35-44 години". Статията се основава на тази подгрупа. Репликацията му не намери ефект: това беше резултат от случайност от десетки подгрупи. Урок: избраната подгрупа след данни е HARKing, а не потвърждение.
Случай 2 — Лов на преобразуване. Връзката, която се оказва безсмислена във формата на ниво студент; пробвах го във форми на дневник, квадратен корен, квадрат и изоставане; Той намери р=0,048 в логаритмична форма и съобщи само това. За щастие една от 5-те пробвани форми прекрачи прага. Правилният начин беше: предварително да изберете формата с теория и да покажете резултата от всички форми в таблицата за чувствителност. Поука: селективното докладване произвежда фалшива значимост.
Случай 3 — Как работи честното рамкиране. Един екип, предварително регистриран преди анализа: единична първична хипотеза, един основен модел, две предварително дефинирани подгрупи, корекция на Bonferroni. Основният ефект не беше значителен, но екипът го отчете честно; Изследователят маркира едно откритие като „трябва да бъде тествано в бъдеще“. Проучването е възпроизводимо и надеждно. Урок: честното планиране прави дори резултата „провал“ си струва.
Често срещани грешки
- Казване на AI да „намери смислени резултати“. Това е направо p-хакване; Поставете AI в честна рамка, изисквайки точност, а не резултати.
- Представяне на откритието като потвърждение (HARKing). Подвеждащо е хипотезата, установена след данните, да се напише като „предвидих го от самото начало“; Обозначете изследователската находка.
- Само отчитане на добри резултати. Показване на всички тествани спецификации; Скриването на анализа на настроенията компрометира почтеността.
- Скрининг на подгрупа/конверсия. Избирането на най-значимата от десетки подгрупи или трансформации води до фалшиви констатации; идентифицирайте и коригирайте предварително.
- Забравяйки колко теста сте направили. Следете общия брой опити; Нито една p-стойност не може да бъде интерпретирана честно, без да се знае това число.
Съвет: Преди да запишете констатация, запитайте се: „Колко начина съм опитал мълчаливо, докато открия този резултат, и докладвам ли за всички?“ Ако някои от есетата останат в чекмеджето, вашият доклад изглежда по-силен, отколкото е.
В обобщение
p-хакване, HARKing, селективно докладване и градината на разклоняващите се пътища; Много от тях са капани, които работят неволно, но произвеждат фалшиви, невъзпроизводими открития. AI ускорява тези капани, защото може да изпробва десетки анализи незабавно; Заявките от типа „намиране на смислени резултати“ превръщат AI в машина за p-хакерство. защита; разделяне на откриването от потвърждението с план за предварителна регистрация и анализ, отчитане на всички спецификации и анализ на чувствителността, коригиране на множество сравнения и поставяне на AI в честна рамка, която изисква „правилния резултат“. Крайната отговорност винаги е на изследователя.
Задача за приложение
Изберете изследователски въпрос и напишете кратък план за анализ, преди да разгледате данните: първична хипотеза, основен модел, първична променлива на резултата, предварително дефинирани подгрупи, стратегия за множество сравнения. След това преценете основния модел. След това направете анализ на чувствителността (различни контроли, включени/изключени отклонения, различна функционална форма) и покажете всички резултати в една таблица. В един параграф преценете кои стъпки представляват риск от p-хакване и как вашата честна рамка ги ограничава.
контролен списък
- [ ] Написах плана за анализ/основния модел, преди да се потопя в данните.
- [ ] Означих отделно проучвателни и потвърдителни анализи; Не съм HARKing.
- [ ] Докладвах всички спецификации, които съм пробвал; Не избрах само красивата.
- [ ] Дефинирах подгрупите и трансформациите предварително, не ги сканирах след данните.
- [ ] Проследих колко теста съм провел и приложих необходимата корекция.
- [ ] Използвах AI в контекста на „намерете истината“, а не „намирайте я за значима“; Поех отговорност.