Прибуток:
- Зрозумійте, що p-hacking, HARKing, вибіркове звітування та сад розгалужених шляхів створюють помилкові висновки, і подивіться, як штучний інтелект може прискорити ці пастки
- Можливість установити засоби захисту, такі як попередня реєстрація, план аналізу, дисципліна множинного порівняння та аналіз чутливості з підтримкою штучного інтелекту
- Можливість засвоїти дизайн чесного запиту, який дозволить штучному інтелекту відхиляти запити типу «знайти значущий результат», і що остаточна відповідальність лежить на досліднику.
У попередньому розділі ми побачили, що таке p-value, а що ні. У цьому розділі ми розглянемо темнішу тему — систематичні пастки, які загрожують цілісності статистики. Більшість із них не є навмисним обманом; Це підступні механізми, на які навіть дослідники з добрими намірами потрапляють, не усвідомлюючи цього. А штучний інтелект (AI) полегшує та пришвидшує ці підводні камені, оскільки дає змогу виконувати десятки аналізів за секунди. Метою цього підрозділу є встановлення дисципліни, яка перетворить ШІ з «машини пошуку значущих результатів» на чесного помічника.
Основні підводні камені
p-hacking (полювання за p-значенням): повторна спроба аналізу різними способами, доки не буде отримано значний результат (p<0,05). Додавання та видалення змінних, вибір підвибірок, зміна визначення викидів, спроба різних перетворень, використання різних змінних результатів, припинення збору даних, коли вони стають значущими... Кожна спроба дає новий «шанс»; Якщо ви досить постараєтесь, один із них виявиться значущим, навіть якщо він насправді не принесе жодного ефекту. Результат: фальшиві знахідки, які були опубліковані, але не відтворені.
HARKing (Hipothesing After the Results Known): Вироблення гіпотези після перегляду результатів і представлення її як «Я передбачив це так із самого початку». Ви дивитесь на дані та знаходите найбільш вражаючий зв’язок, а потім пишете статтю так, ніби вона призначена для перевірки цієї гіпотези. Це вводить читача в оману, роблячи відкриття схожим на підтвердження.
Вибіркове звітування (вибір вишні): звітування лише про «хороші» з десятків аналізів і мовчазне ховання решти. Це також відоме як «проблема шухляди файлів»: безглузді результати залишаються в шухляді, що робить літературу систематично упередженою.
Сад доріжок, що розгалужуються: термін Ендрю Гельмана. Навіть без єдиного навмисного p-хакінгу дослідник робить багато розумних виборів на основі даних (яка змінна, який поріг, яка підгрупа, яке перетворення). Ці ступені свободи дослідження настільки численні, що ви фактично обираєте значущий із безлічі аналізів — навіть без жодного злого наміру. Результатом є знову зростання хибнопозитивних результатів.
Увага: більшість цих пасток не є навмисними трюками. Сума, здавалося б, безневинних кроків, таких як «я щойно спробував ще кілька моделей», «було чистіше, коли я видалив викид», «ефект чіткіший у цій підгрупі» може призвести до помилкового висновку. Чесність - це питання методу, а не наміру.
Чому ШІ збільшує ці пастки?
Спроба 3 моделей вручну потребує часу; YZ виробляє 50 варіантів моделей, 10 різних конверсій, 8 підгруп за лічені хвилини. Ця сила є катастрофічною без чесного плану: запит на кшталт «знайти значущий зв’язок у цих даних» або «побудувати модель, яка підтверджує цю гіпотезу», перетворює штучний інтелект безпосередньо на двигун p-hacking. AI також хоче бути корисним; прагне знайти «значущий» результат, який задовольнить вас. Ось чому ваш оперативний дизайн є першою лінією захисту чесності.
Захист: справедливий курс справи
1. Попередня реєстрація: це означає письмовий запис вашої гіпотези, змінних, моделі та тестів (можливо, на платформі з позначкою часу) перед виконанням аналізу. Таким чином, відкриття відокремлено від підтвердження; все, що ви змінюєте пізніше, позначається тегом "провідник".
2. План аналізу: навіть якщо ви не можете зробити попередній запис, напишіть план аналізу, перш ніж занурюватися в дані: первинна гіпотеза, первинна змінна результату, основна модель. Встановіть різницю між «основним аналізом» і «додатковим/дослідним аналізом» із самого початку та зберігайте його у звіті.
3. Повідомте про все: не приховуйте моделі, які ви пробували. У розділі «аналіз чутливості» (перевірка надійності) покажіть, як різні специфікації змінюють результат. Висновок є вагомим, лише якщо він витримується за багатьох правдоподібних варіантів.
4. Дисципліна множинного порівняння: якщо ви зробили занадто багато тестів, виправте їх (розділ 6). Дайте відповідь на запитання «Скільки тестів я зробив?» чесно.
5. Аналіз чутливості: повторіть свій основний висновок з іншим зразком, іншим контрольним набором і іншим перетворенням. Якщо результат зміниться, не приховуйте, повідомляйте про це.
Порівняльна таблиця: чесний проти пастки
застосування
форма пастки
Чесний еквівалент
Вибір моделі
Намагатися, доки це не матиме сенсу (p-hacking)
Попередньо спланована майстер-модель
гіпотеза
Примірка після факту (HARKing)
Попередньо записані, перед даними
Звітність
Не показуйте лише красиві
Всі характеристики + чутливість
підгрупа
Вибір найяскравіших
Попередньо визначений, виправний
збір даних
Зупиніться, коли це має сенс
заздалегідь визначений зразок
Чотири підказки, які можна копіювати
1. Чесна структура претензій:
Ваша роль: чесний помічник статистики. Моя мета полягає НЕ в тому, щоб знайти значущий результат, а в тому, щоб знайти правильний результат. ПРАВИЛА:- НЕ давайте мені пропозицій типу «пробуйте моделі, доки це не матиме сенсу»,- скажіть мені, якщо ви пропонуєте кілька специфікацій, про які потрібно повідомляти всі,- попередьте мене про будь-які дії, які можуть призвести до p-злому. Допоможіть мені спочатку прояснити мою основну модель, відокремте відкриття від підтвердження.
2. Проект плану аналізу:
Допоможіть мені скласти попередній план аналізу для дослідження: первинна гіпотеза, змінна основного результату, специфікація основної моделі, попередньо визначені підгрупи, стратегія множинного порівняння. Розмістіть «пошуковий» і «підтверджуючий» аналізи в окремих заголовках. Нагадайте мені заповнити це, НЕ ПЕРЕГЛЯДАЮЧИ дані.
3. Аналіз чутливості:
Мій головний висновок — написати код аналізу чутливості (R) для Моя мета — ПОБАЧИТИ, наскільки надійний результат, а НЕ вибрати найкращий; показати всі результати.
4. Самоконтроль:
Я поясню свій процес аналізу; Дайте мені контрольний список для p-hacking / HARKing / вибіркового звітування та позначте, які з моїх кроків є ризикованими. Запитайте мене, скільки моделей/тестів я спробував і про які я планую повідомити.
Слабка підказка / Сильна підказка
Слабка підказка:
Які змінні показують значні зв’язки в цих даних, знайдіть найкращу модель.
Ця підказка є прямою інструкцією p-hacking: ШІ пробує десятки комбінацій і представляє ту, яка «має найбільший сенс». Результат майже напевно є фальшивим висновком, який неможливо відтворити.
Потужна підказка:
Ваша роль: чесний помічник. ОСНОВНА модель, яку я заздалегідь визначив: Y ~ X + елементи керування. Напишіть код, який передбачає цю модель. НЕ шукайте іншу «більш значущу» модель. Також запропонуйте аналіз чутливості, щоб я міг побачити надійність результату, але знайте, що я повідомлятиму ВСІ результати, а не виберу найкращий. Не дозволяйте мені списувати будь-які дослідницькі висновки як «підтверджені».
Відмінність: сильна воля виправляє основну модель, забороняє пошук і вимагає звітувати про всі результати.
три міні-чохла
Кейс 1 — Підгрупове полювання. Один дослідник не виявив ефекту в загальній вибірці; Він запитав ШІ «в якій підгрупі це значуще?» YZ просканував комбінації віку, статі та регіону та виявив "p = 0,03 у міських жінок у віці 35-44 років". На базі цієї підгрупи була написана стаття. Його повторення не виявило ефекту: це був результат випадковості десятків підгруп. Урок: вибрана підгрупа після даних HARKING, а не підтвердження.
Випадок 2 — Полювання на конверсію. Стосунки, які виявляються безглуздими на рівні студента; спробував це у формах журналу, квадратного кореня, квадрата та відставання; Він виявив р=0,048 у логарифмічній формі та повідомив лише про це. На щастя, одна з 5 спробованих форм переступила поріг. Правильним способом було: попередньо вибрати форму з теорією та показати результат усіх форм у таблиці чутливості. Урок: вибіркове звітування створює хибну значущість.
Випадок 3 — Як працює чесне фреймінг. Одна команда попередньо зареєструвалася перед аналізом: одна первинна гіпотеза, одна основна модель, дві попередньо визначені підгрупи, поправка Бонферроні. Основний ефект був незначним, але команда чесно повідомила про це; Дослідник позначив одну знахідку як «потрібну перевірку в майбутньому». Дослідження було відтворюваним і надійним. Урок: чесне планування робить навіть «невдалий» результат вартим уваги.
Поширені помилки
- Наказ ШІ «знаходити значущі результати». Це прямий p-hacking; Помістіть ШІ в чесну рамку, вимагаючи точності, а не результатів.
- Представлення відкриття як підтвердження (HARKing). Було б оманою писати гіпотезу, встановлену після даних, як «я передбачив це з самого початку»; Позначте пошукову знахідку.
- Просто повідомляю про хороші результати. Показати всі перевірені характеристики; Приховування аналізу настроїв ставить під загрозу цілісність.
- Скринінг підгрупи/конверсії. Вибір найбільш значущої з десятків підгруп або перетворень призводить до помилкових висновків; визначити та виправити заздалегідь.
- Забути, скільки тестів ви зробили. Відстежуйте загальну кількість спроб; Жодне значення p не можна чесно інтерпретувати, не знаючи цього числа.
Порада: перш ніж записати знахідку, запитайте себе: «Скільки способів я мовчки спробував, поки не знайшов цей результат, і чи я повідомляю про них усі?» Якщо деякі есе залишаються в ящику, ваш звіт виглядає сильнішим, ніж є.
Підсумовуючи
p-hacking, HARKing, вибіркове звітування та сад розгалужених шляхів; Багато з них є пастками, які спрацьовують ненавмисно, але дають помилкові, невідтворювані результати. AI прискорює ці пастки, оскільки він може миттєво спробувати десятки аналізів; Запити типу «знайти значущі результати» перетворюють ШІ на двигун p-hacking. захист; відокремлюючи відкриття від підтвердження за допомогою плану попередньої реєстрації та аналізу, повідомляючи про всі специфікації та аналіз чутливості, виправляючи численні порівняння та вводячи ШІ в чесну структуру, яка вимагає «правильного результату». Остаточна відповідальність завжди лежить на досліднику.
Аплікаційне завдання
Виберіть дослідницьке питання та напишіть короткий план аналізу, перш ніж переглядати дані: первинна гіпотеза, основна модель, первинна змінна результату, попередньо визначені підгрупи, стратегія множинного порівняння. Потім оцініть основну модель. Потім виконайте аналіз чутливості (різні елементи керування, включені/виключені викиди, інша форма функції) і покажіть усі результати в одній таблиці. В одному параграфі оцініть, які кроки становлять ризик p-злому та як ваша чесна система їх обмежує.
контрольний список
- [ ] Я написав план аналізу/майстер-модель перед тим, як заглибитися в дані.
- [ ] Я позначив пошуковий і підтверджуючий аналізи окремо; Я не ГАРКІВ.
- [ ] Я повідомив про всі специфікації, які я пробував; Я не просто вибрав красиву.
- [ ] Я визначив підгрупи та перетворення заздалегідь, я не сканував їх після даних.
- [ ] Я відстежував, скільки тестів я запустив, і застосував необхідні виправлення.
- [ ] Я використовував штучний інтелект у контексті «знайти правду», а не «вважати її значущою»; Я взяв на себе відповідальність.