одиниця 8 / 11

Аналіз даних і статистична перевірка

Прибуток:

  • Здатність вибрати тест, що відповідає типу та розподілу даних, і перевірити припущення (нормальність, дисперсія)
  • Здатність зрозуміти справжнє значення р-значення та повідомити результати з розміром ефекту та довірчим інтервалом
  • Захист від p-злому з розділенням виявлення та перевірки, корекцією множинного порівняння та повним звітуванням

Експеримент закінчено, дані надійшли. Зараз ми знаходимося на найбільш критичному та найбільш помилковому етапі: правильно аналізуємо дані та чесно інтерпретуємо результати. Біологічні дані часто шумні, нестабільні та багатовимірні. Неправильний вибір тесту, неявні порушення припущень і несвідомий р-хакінг (проба аналізу, доки він не дасть бажаного результату) є основними причинами кризи відтворюваності в опублікованій біологічній літературі. AI допоможе вибрати правильний тест, перевірити припущення та написати код аналізу; але статистична цілісність — це ваша відповідальність.

У цьому розділі ми розглянемо загальні статистичні тести, перевірки припущень і способи захисту від p-злому.

Вибір правильного тесту

Вибір тесту залежить від типу та розподілу даних. Штучний інтелект допоможе вам зробити цей вибір, але не варто застосовувати його наосліп:

  • Дві групи, безперервні дані, нормальний розподіл: незалежний t-тест.
  • Дві ненормальні групи: Mann-Whitney U (непараметрична: не вимагає припущення розподілу).
  • Більше двох груп: ANOVA (дисперсійний аналіз) + post-hoc тест.
  • Категоричні дані (підрахунки): хі-квадрат або точний критерій Фішера.
  • Зв'язок: кореляція (Пірсон/Спірмен) або регресія.
Порада: візуалізуйте дані перед вибором тесту. Гістограма або коробковий графік миттєво показує нормальність і викиди, яких вимагає t-тест. «Спочатку побудуйте графік, а потім перевірте» — хороша звичка.

Перевірка припущень

Кожен тест має приховані припущення. t-критерій передбачає нормальний розподіл і рівність дисперсії; Якщо їх порушити, результат буде оманливим. AI пише код, який перевіряє ці припущення:

Посада: Ви асистент біостатистики. Завдання: написати код, який перевіряє припущення t-критерію перед порівнянням двох груп даних: нормальність (Шапіро-Вілк), рівність дисперсії (Левен). Якщо припущення порушено, скажіть мені, до якого альтернативного тесту мені слід перейти. Наведіть код Python із коментарями.

Код перенаправляє вас до Mann-Whitney, якщо нормальність порушена. Цей процес «спочатку перевірте, потім вирішуйте» запобігає виконанню неправильного тесту.

p-hacking і як захистити себе

p-hacking аналізує дані різними способами до p<0,05: випробування різних тестів, вибіркове відкидання викидів, додавання/видалення груп, звітування про те, що є «значним» серед великої кількості змінних. Це основне джерело фейкових відкриттів. Способи захисту:

  1. Заздалегідь зафіксуйте план аналізу (Блок 7).
  2. Повідомляйте про всі тести, а не лише про ті, які показують значущість.
  3. Виправити множинне порівняння (FDR/Bonferroni).
  4. Вкажіть розмір ефекту та довірчий інтервал поруч із значенням p.
  5. Окреме відкриття та перевірка: перевірте те, що ви знайшли в наборі для виявлення, на незалежному наборі.

Крок за кроком: чесний аналіз

  1. Візуалізуйте дані (розкид, викид).
  2. Перевірте припущення.
  3. Виконайте тест, який ви заздалегідь визначили.
  4. Виправити множинне порівняння.
  5. Розмір ефекту звіту + довірчий інтервал.
  6. Чітко напишіть обмеження.

Шаблони підказок, які можна копіювати

Візуалізуйте пропускну здатність: побудуйте гістограми та коробкові діаграми для кожної групи, позначте викиди. Потім інтерпретуйте нормальність. Стовпці даних: [назва]. Наведіть код Python із коментарями.

Я хочу порівняти свої дві групи. Характеристики даних: [тип, N, розподіл]. Який тест підходить? Перевірте припущення, виконайте тест, повідомте про розмір ефекту ТА 95% довірчий інтервал ІЗ p-значенням.

У своєму аналізі я перевірив 15 різних генів. Наведіть код, який застосовує поправку Бонферроні та Бенджаміні-Хохберга, і поясніть різницю між цими двома методами.

Слабка підказка / Сильна підказка

Слабкий: «Чи відрізняються ці дві групи, виконайте t-тест».

Стронг: «У мене є дві групи (контроль n=18, лікування n=20), залежною змінною є активність ферменту (безперервно). Спочатку візуалізуйте розподіл і перевірте нормальність за допомогою Шапіро-Вілка. Якщо нормально, застосуйте t-критерій, якщо ні, Манна-Уітні. Повідомте про результат із значенням p, величиною ефекту (d Коена або ранг-бісерій) і 95% довірчим інтервалом. Поясніть, який тест, який ви вибрали, і чому."

Відмінність: потужна підказка містить тип даних, номери зразків, перевірку припущень і запит на повний звіт. Модель слідує правильним шляхом замість того, щоб сліпо застосовувати t-тест.

три міні-чохла

Випадок 1 — Неправильний тест: студент застосував t-тест до значно спотворених (ненормальних) даних і виявив p=0,048. Коли штучний інтелект додав перевірку нормальності, дані не вийшли нормальними; З Mann-Whitney, р=0,11. Фактичний результат був безглуздим. Урок: тестування без перевірки припущення вводить в оману.

Випадок 2. Вибіркове відхилення викидів: дослідник видалив дві точки «викидів», щоб зробити результат значущим. Модель наголошує на тому, що відкидання викидів має ґрунтуватися на попередньо визначеному правилі (наприклад, метод IQR) і повідомлятися; довільне видалення є p-зломом. Урок: попередньо встановіть правило викиду.

Випадок 3 — Відновлення розміру ефекту: одне дослідження мало р=0,001, але розмір ефекту (d=0,1) був майже нульовим; Велика вибірка показала, що незначна різниця є значною. Коли штучний інтелект повідомив про розмір ефекту, виявилося, що відкриття не має практичної цінності. Урок: те, що p мале, не має значення.

порівняльна таблиця

Статус

правильний підхід

Щоб уникнути

аномальні дані

Непараметричний тест

Примусовий t-тест

мультитест

Застосувати корекцію

Неочищений р<0,05

викид

Попередньо визначене правило

довільне видалення

значний результат

Розмір ефекту + CI

просто стор

відкриття знахідка

Перевірити на незалежному наборі

Завершення в одному комплекті

Поширені помилки

  • Неконтрольоване тестування гіпотези: хибне значення з помилковим тестуванням.
  • p-hacking: спроба аналізу, поки він не дасть бажаного результату.
  • Звітує лише про значення p: без розміру ефекту та довірчого інтервалу.
  • Без коригування для кількох порівнянь: помилкові спрацьовування.
  • Причинно-наслідковий зв’язок: висновок про причинно-наслідковий зв’язок із кореляції.
Застереження: штучний інтелект не «видасть» бажаний результат, але з радістю напише код для неправильного тесту, якщо його введуть в оману. У вас є статистична цілісність: звітуйте про всі випробування, плануйте аналіз заздалегідь, ніколи не пропускайте розмір ефекту. Співпрацюйте з біостатистиком для аналізу, що веде до публікації.

реальне значення р-значення

Найбільш неправильно зрозуміле поняття в біології - це p-value. P-значення не є «ймовірністю того, що гіпотеза вірна»; Це «імовірність побачити різницю більшою або більш екстремальною, ніж те, що ви спостерігаєте, тоді як насправді різниці немає». Ця тонка, але важлива відмінність є ключем до того, щоб не перебільшувати результати. p=0,03 не означає, що «ефект реальний на 97%. Коли AI інтерпретує результат, переконайтеся, що він правильно використовує це визначення; Модель іноді може повторювати поширене неправильне тлумачення.

Довірчий інтервал (ДІ) часто є більш інформативним, ніж р-значення, оскільки він показує величину та невизначеність ефекту разом. «Різниця в 2,4 рази (95% ДІ: 1,8-3,1)» говорить набагато більше, ніж «p<0,05»: як напрямок ефекту, його величина, так і те, наскільки точно він був виміряний. Виділіть GA у своїх звітах.

Використовуйте правильне визначення p-значення під час інтерпретації мого результату. Уникайте неправильних тверджень, таких як «ймовірність того, що ефект є істинним». Натомість поясніть практичне значення з точки зору розміру ефекту та 95% довірчого інтервалу. Результат: [дані]

Кореляція, причинно-наслідковий зв'язок і дані спостережень

Більшість біологічних даних є спостереженнями: ви бачите, як щось змінюється з чимось іншим, але ви не можете побачити, що викликає що. Речення «експресія гена X корелює із захворюванням» не означає, що X викликає захворювання; Хвороба може збільшувати Х, або третій фактор може впливати на обидва. Причинно-наслідковий зв’язок можна встановити лише за допомогою інтервенційних експериментів (зміна X та вимірювання результату). ШІ може несвідомо використовувати причинно-наслідкову мову («причини», «веде до») у ваших текстах; перегляньте кожне заключне речення з цієї точки зору, висловлюючи висновки спостережень кореляційною мовою («співвіднесені», «змінюються разом»).

Розділення парних і незалежних даних

Під час відбору тестів найчастіше не враховують різницю, чи є вибірки незалежними чи парними. Якщо ви проводите вимірювання до і після від однієї особи (наприклад, показники крові тих самих пацієнтів до і після лікування), ці вимірювання не є незалежними; Потрібен парний тест. Використання незалежного двовибіркового t-критерію тут відкидає інформацію про збіг у даних і зменшує потужність; Це може навіть змінити результат. Правило просте: «Чи походять ці два вимірювання з однієї біологічної одиниці?» Якщо відповідь ствердна, використовується парний тест (парний t-критерій або тест Вілкоксона зі знаком рангів), якщо ні, використовується незалежний тест. Коли ви просите штучний інтелект про тести, обов’язково вкажіть структуру відповідності ваших даних; Якщо ви не вкажете, модель часто припускає незалежність і рекомендує неправильний тест.

У мене є два набори вимірювань. Важливо: ці вимірювання проводились до/після ОДНИХ І САМИ осіб (в парі). Виберіть правильний тест, який враховує цей збіг (парний t-тест або Вілкоксона), перевірте свої припущення та повідомте про розмір ефекту. Не припускайте незалежності.

Підсумовуючи

Точний аналіз даних; вибір відповідного тесту для типу даних, перевірка припущень, коригування кількох порівнянь і звіт про розмір ефекту та довірчий інтервал на додаток до p-значення. Найбільшу небезпеку становить р-злом; Протиотрута — це попередній план аналізу, повна звітність і поділ виявлення та перевірки. Штучний інтелект є потужним помічником у виборі тестів і перевірці припущень, але статистична цілісність залежить від людини.

Аплікаційне завдання

Візьміть набір даних (ваші власні дані або зразок) із двома групами. Спочатку напишіть ШІ код, який візуалізує дані та перевіряє їх на нормальність. Залежно від результату застосуйте відповідний тест (t-критерій або Манна-Уітні) і повідомте розмір ефекту та довірчий інтервал разом із значенням p. Потім порівняйте вплив кількох порівнянь без корекції та з корекцією на результат.

контрольний список

  • [ ] Я візуалізував дані перед тестуванням.
  • [ ] Я перевірив припущення тесту (нормальність, дисперсія).
  • [ ] Я вибрав відповідний тест, я не застосовував сліпо t-тест.
  • [ ] Я виправив багаторазове порівняння.
  • Я повідомив про [ ] p-значення, а також розмір ефекту та довірчий інтервал.
  • [ ] Я зафіксував план аналізу заздалегідь і уникнув p-злому.