Прибуток:
- Здатність правильно визначати нульову гіпотезу, значення p, довірчий інтервал і статистичну потужність, а також використовувати штучний інтелект у виборі та інтерпретації тестів.
- Здатність розрізняти, що є p-значенням, а що ні (не розмір ефекту, не ймовірність точності), і розуміти, чому потрібна корекція множинного порівняння
- Здатність розпізнавати коментарі, зроблені штучним інтелектом, які плутають значущість із суттєвістю, і повідомляти про них із розміром ефекту та невизначеністю
Найбільш використовуваним і найбільш неправильно зрозумілим інструментом статистики є перевірка гіпотез. Основна ідея проста: ми маємо твердження (наприклад, «середнє значення цих двох груп різне») і його протилежність, нульову гіпотезу (H0 — «фактично немає різниці»). Тест визначає, наскільки добре дані узгоджуються з нульовою гіпотезою. У цьому розділі ми побачимо, як штучний інтелект (ШІ) полегшує вибір і інтерпретацію тестів, але чому пастки навколо значення p такі поширені та небезпечні. Почнемо з самого початку: ШІ знає, який синтаксис тесту писати; але це ваша робота - інтерпретувати, чи виконується припущення тесту та що насправді означає результат.
Що насправді таке p-значення?
P-значення — це ймовірність того, що результат, який ви спостерігаєте, або більш екстремальний результат станеться випадково, коли нульова гіпотеза вірна (тобто ефекту насправді немає). Невелике значення p (0,05 — традиційний поріг) означає, що «було б дивно побачити такі дані, якби ефекту справді не було»; Це вважається доказом проти нульової гіпотези.
Тепер давайте з’ясуємо, чим не є p-value, яке ШІ часто плутає:
- P-значення не є ймовірністю того, що нульова гіпотеза вірна. p=0,03 не означає, що "є 3% ймовірність відсутності ефекту".
- P-значення не вказує на розмір ефекту. Дуже малий ефект може призвести до крихітного значення p у великій вибірці.
- P-значення не доводить, що відкриття є значущим або реальним. «Значний» — це статистичний термін, «значний» — це судження.
- p>0,05 не означає «відсутність ефекту»; Це означає, що "ми не змогли показати ефект із цими даними". Відсутність доказів не є доказом відсутності.
Застереження: найпоширеніша помилка інтерпретації штучного інтелекту полягає в тому, що слово «значний» подається як «значний/сильний/значний вплив». Статистична значущість і практична значущість — дві різні речі; Завжди повідомляйте про них окремо.
Довірчий інтервал і розмір ефекту: багатша інформація
Замість одного p-значення набагато більш інформативним є довірчий інтервал: він дає вірогідний діапазон значень для вашої оцінки. Речення «Ефект 1200, 95% довірчий інтервал [300, 2100]» показує як напрямок, величину, так і невизначеність; "p<0,05" просто означає "далеко від нуля". Сучасна статистична практика використовує p-value не тільки; рекомендує звітувати з тріо розмір ефекту + довірчий інтервал + p-значення.
Статистична потужність і вибірка
Статистична потужність — це ймовірність виявлення ефекту, який насправді існує (1 мінус ймовірність помилки типу II, тобто «відсутність реального ефекту»). Дослідження з недостатньою потужністю вразливе до двох ризиків: (1) воно пропускає справжні ефекти (помилково негативні); (2) кілька результатів, які виявляються значущими, мають завищені величини — так зване прокляття переможця, оскільки лише завищені прогнози можуть переступити поріг. Тому перед аналізом рекомендується обчислити потужність/зразок. AI генерує код для цього облікового запису; Ви визначаєте розмір цільового ефекту за допомогою теорії.
Задача множинного порівняння
При виконанні тесту поріг 0,05 означає «5% ризику хибнопозитивних результатів». Але якщо ви зробите 20 тестів, в середньому можна очікувати, що один випадково дасть p<0,05, навіть якщо всі вони фактично неефективні. Це називається проблемою множинного порівняння. Імовірність помилкових позитивних результатів швидко зростає, коли тестується велика кількість змінних, підгруп або змінних результатів. Рішення полягає в тому, щоб виправити поріг: Бонферроні (ділячи поріг на кількість тестів — суворий), методи Холма або Бенджаміні-Хохберга, які контролюють частоту помилкових відкриттів (FDR). Цей ризик стає ще більшим в епоху ШІ, оскільки ШІ може виробляти десятки тестів за секунди — це безпосередній предмет наступного блоку (p-hacking).
Порівняльна таблиця: що говорить значення p, а що ні
вираз
це правда?
опис
"p=0,02, ймовірність відсутності ефекту становить 2%"
неправильно
p не є ймовірністю H0
"p<0,05, ефект великий"
неправильно
p не вказує розмір
"p=0,20, немає ефекту"
неправильно
Неможливість показати це не відсутність
"p<0,05, є докази проти H0"
правда
Обережно і на місці
"Ефект 1,200 [300; 2,100], p=0,01"
найкращий
Розмір + невизначеність + докази
Чотири підказки, які можна копіювати
1. Вибір правильного тесту:
Ваша роль: асистент статистичного тестування. Я хочу порівняти середнє значення двох незалежних груп (безперервна змінна). Дайте мені: який тест підходить (з його припущеннями: нормальність, рівність дисперсії), альтернативний варіант, якщо припущення не виконується (наприклад, Велча, Манна-Уітні), і код R. Я покажу результат і перевірю припущення.
2. Правильне подання p-значення:
Повідомте результати тесту нижче, але ПРАВИЛА:- НЕ представляйте p-значення як «ймовірність H0» або «розмір ефекту»,- обов’язково вкажіть розмір ефекту та 95% довірчий інтервал,- напишіть «значний» і «значний» окремо,- якщо p>0,05, НЕ кажіть «немає ефекту», скажіть «ми не змогли показати». Вихід: [вставити]
3. Розрахунок потужності/вибірки:
Я планую експеримент: дві групи, очікуваний розмір ефекту (d Коена) ~0,4, потужність 0,80, альфа 0,05. Напишіть код R, який розраховує необхідний розмір вибірки (пакет pwr), і поясніть ризики малопотужного дослідження (прокляття переможця).
4. Корекція множинного порівняння:
Я провів 15 окремих перевірок гіпотез і маю р-значення. Напишіть код R, який застосовує поправки Бонферроні та Бенджаміна-Хохберга (FDR), поясніть різницю між цими двома методами та підсумуйте одним реченням, чому я не повинен довіряти голому р<0,05.
Слабка підказка / Сильна підказка
Слабка підказка:
Чи має значення результат цього тесту? Прокоментуйте результат.
Ця претензія фіксує штучний інтелект у двійковому коді «значущий/незначущий»; швидше за все створює речення, яке плутає величину зі значенням, наприклад «так, це суттєво, ефект сильний».
Потужна підказка:
Ваша роль: уважний статистичний помічник. Інтерпретуйте результат, але: (1) дайте розмір ефекту + 95% довірчий інтервал + p-значення разом, (2) відокремте значущість від значущості, (3) p>0,05 у «не вдалося показати», (4) запитайте, скільки тестів я зробив; Якщо їх більше одного, запропонуйте коригування множинного порівняння, (5) нагадайте, що припущення тесту слід перевірити.
Відмінність: сильна підказка забезпечує розширені звіти та захищає від пасток p-значення.
три міні-чохла
Випадок 1 — Незначна «значущість» у великій вибірці. Один аналітик виявив середню різницю між двома групами «високо значущою» на р<0,001 за даними 500 000 спостережень. Але різниця становила лише 0,3 бали (зі 100) і була практично безглуздою. Величезна вибірка зробила навіть крихітну різницю «суттєвою». Коли було повідомлено про розмір ефекту, знахідка була визнана незначною. Урок: значення – це не величина; Якщо n велике, кожна різниця значуща.
Випадок 2 — Ілюзія багаторазового тестування. Одна команда протестувала 22 змінні результату; Один з них показав р=0,04 і був оголошений як «ми знайшли ефект». З поправкою Бонферроні поріг знизився до 0,05/22 = 0,0023; 0,04 не подолав цей поріг. Єдиний «значущий» результат був би випадковий з 22 випробувань. Урок: при багатому тестуванні необхідна корекція.
Випадок 3 — недостатня сила та прокляття переможця. Невелике пілотне дослідження (n=15 на групу) виявило дуже великий (d=0,9) і значний ефект. Велике дослідження реплікації зменшило ефект до d = 0,2. Невелика вибірка лише дозволила переоцінці перетнути поріг. Урок: не можна довіряти значним розмірам ефекту при низькій потужності.
Поширені помилки
- Плутання значущості з важливістю/величиною. Ефект невеликий лише тому, що p мале; Розмір ефекту повідомте окремо.
- Помилково приймаючи значення p за ймовірність H0. p не є «ймовірністю відсутності ефекту»; концептуально відрізняється.
- Показання p>0,05 як «без ефекту». Неявка не є доказом відсутності; Визначте невизначеність.
- Без коригування для мультитестування. Занадто багато тестів дають помилкові позитивні результати; Застосувати Bonferroni/FDR.
- Ігнорування влади. Значний ефект у невеликій вибірці перебільшений; Розрахуйте потужність перед аналізом.
Порада: перш ніж списати результат як «значний», задайте два запитання: «Чи ефект практично значний (масштаб)?» і «Скільки тестів я пройшов, перш ніж отримати цей результат?» Друге питання – лакмусовий папірець чесності.
Підсумовуючи
Перевірка гіпотез і p-value є потужними, але неправильно зрозумілими інструментами. P-значення – це ймовірність побачити дані, коли нульова гіпотеза вірна; Імовірність H0 не є величиною ефекту чи значущістю результату. Завжди повідомляйте про значущість разом із розміром ефекту та довірчим інтервалом; Не читайте p>0,05 як «немає ефекту»; застосувати корекцію множинного порівняння, якщо ви зробили багато тестів; Майте на увазі ризик перебільшених ефектів від малопотужних досліджень. AI створює тестовий код і проект; Ви зобов’язані розрізняти значущість і суттєвість і перевіряти припущення.
Аплікаційне завдання
Порівняйте середні значення між двома групами в наборі даних. Попросіть ШІ відповідний тест (з його припущеннями) і код, запустіть його та перевірте припущення. Повідомте про результат із трьома компонентами: розмір ефекту, 95% довірчий інтервал, p-значення. Потім подумайте, скільки різних порівнянь ви можете зробити на тих же даних; Якщо ви провели кілька тестів, застосуйте корекцію Бонферроні або FDR і повідомте, чи результат залишається актуальним. Нарешті, напишіть приблизну оцінку потужності для аналізу.
контрольний список
- [ ] Я вибрав тест із його припущеннями та перевірив припущення.
- [ ] Я повідомив результат як розмір ефекту + довірчий інтервал + p-значення.
- [ ] Я розділив слова «важливий» і «важливий»; Я не думав, що p — це ймовірність H0.
- [ ] Я написав p>0,05 як «ми не змогли це показати», а не як «немає ефекту».
- [ ] Я застосував корекцію множинного порівняння, якщо запустив кілька тестів.
- [ ] Я оцінив потужність дискретизації; Я був обережним щодо розміру ефекту при низькій потужності.