Единица 8 / 11

Анализ данных и статистическая проверка

Прибыль:

  • Возможность выбрать тест, соответствующий типу и распределению данных, и проверить предположения (нормальность, дисперсия).
  • Способность понимать истинное значение значения p и сообщать о результатах с указанием размера эффекта и доверительного интервала.
  • Защита от взлома с разделением обнаружения и проверки, исправлением множественных сравнений и полной отчетностью.

Эксперимент окончен, данные получены. Сейчас мы находимся на самом критическом и ошибочном этапе: правильно анализировать данные и честно интерпретировать результаты. Биологические данные часто зашумлены, нестабильны и многомерны. Неправильный выбор тестов, неявные нарушения предположений и неосознанный р-хакинг (попытка анализа до тех пор, пока он не даст желаемый результат) являются основными причинами кризиса воспроизводимости в опубликованной биологической литературе. ИИ помогает выбрать правильный тест, проверить предположения и написать код анализа; но статистическая достоверность – это ваша ответственность.

В этом разделе мы рассмотрим распространенные статистические тесты, проверки предположений и способы защиты от взлома.

Выбор правильного теста

Выбор теста зависит от типа и распределения данных. Искусственный интеллект поможет вам сделать этот выбор, но не стоит применять его вслепую:

  • Две группы, непрерывные данные, нормальное распределение: независимый t-критерий.
  • Две ненормальные группы: U Манна-Уитни (непараметрические: не требующие предположения о распределении).
  • Более двух групп: ANOVA (дисперсионный анализ) + апостериорный тест.
  • Категориальные данные (счетчики): Хи-квадрат или точный критерий Фишера.
  • Связь: корреляция (Пирсон/Спирмен) или регрессия.
Совет: Визуализируйте данные перед выбором теста. Гистограмма или коробчатая диаграмма мгновенно показывает нормальность и выбросы, необходимые для t-теста. «Сначала график, потом тест» — хорошая привычка.

Проверка предположений

В каждом тесте есть скрытые предположения. T-критерий предполагает нормальное распределение и равенство дисперсии; Если они будут нарушены, результат будет неверным. ИИ пишет код, который проверяет эти предположения:

Роль: Вы помощник по биостатистике. Задача: Написать код, проверяющий предположения Стьюдента перед сравнением двух групп данных: нормальность (Шапиро-Уилк), равенство дисперсии (Левен). Если предположение нарушается, скажите мне, к какому альтернативному тесту мне следует перейти. Приведите код Python с комментариями.

Код перенаправит вас к Манн-Уитни, если нормальность нарушена. Последовательность действий «сначала проверь, потом принимай решение» убережет вас от проведения неправильного теста.

p-хакерство и как защитить себя

p-хакинг анализирует данные разными способами до p<0,05: пробует разные тесты, выборочно отбрасывает выбросы, добавляет/удаляет группы, сообщает, что является «значимым» среди большого количества переменных. Это основной источник фейковых открытий. Способы защиты:

  1. Заранее зафиксируйте план анализа (Блок 7).
  2. Сообщайте обо всех тестах, а не только о тех, которые показывают значимость.
  3. Исправлено множественное сравнение (FDR/Bonferroni).
  4. Укажите размер эффекта и доверительный интервал рядом со значением p.
  5. Раздельное обнаружение и проверка: проверьте то, что вы найдете в наборе обнаружения, на независимом наборе.

Шаг за шагом: честный анализ

  1. Визуализируйте данные (разброс, выбросы).
  2. Проверьте предположения.
  3. Выполните тест, который вы заранее определили.
  4. Исправлено множественное сравнение.
  5. Размер эффекта отчета + доверительный интервал.
  6. Четко напишите ограничения.

Копируемые шаблоны подсказок

Визуализация пропускной способности: построение гистограмм и коробчатых диаграмм для каждой группы, пометка выбросов. Затем интерпретируйте нормальность. Столбцы данных: [имя]. Приведите код Python с комментариями.

Я хочу сравнить две мои группы. Характеристики данных: [тип, N, распределение]. Какой тест подходит? Проверьте предположения, проведите тест, сообщите о величине эффекта И 95% доверительном интервале С p-значением.

В своем анализе я проверил 15 различных генов. Приведите код, применяющий поправку Бонферрони и Бенджамини-Хохберга, и объясните разницу между этими двумя методами.

Слабая подсказка / Сильная подсказка

Слабый: «Различны ли эти две группы, проведите t-тест».

Стронг: «У меня есть две группы (контроль n = 18, лечение n = 20), зависимой переменной является активность фермента (непрерывная). Сначала визуализируйте распределение и проверьте нормальность с помощью Шапиро-Уилка. Если нормально, примените t-критерий, если нет, Манна-Уитни. Сообщите о результате с помощью значения p, размера эффекта (d Коэна или ранговый бисериал) и 95% доверительного интервала. Объясните, какой тест вы выбрали и почему».

Отличие: мощное приглашение содержит тип данных, количество образцов, проверку предположений и запрос полного отчета. Модель следует правильному пути вместо того, чтобы слепо применять t-критерий.

три мини-кейса

Случай 1 — Неправильный тест: студент применил t-критерий к значительно искаженным (ненормальным) данным и обнаружил p = 0,048. Когда искусственный интеллект добавил проверку на нормальность, данные оказались ненормальными; Для Манна-Уитни р=0,11. Фактический результат был бессмысленным. Урок: тестирование без проверки предположения вводит в заблуждение.

Случай 2. Выборочное отбрасывание выбросов: исследователь удалил две точки «выбросов», чтобы сделать результат значимым. В модели подчеркивалось, что отбрасывание выбросов должно основываться на заранее определенном правиле (например, методе IQR) и сообщаться о нем; произвольное удаление — это р-взлом. Урок: заранее установите правило выбросов.

Случай 3 — Восстановление размера эффекта: в одном исследовании p=0,001, но размер эффекта (d=0,1) был почти нулевым; большая выборка показала, что незначительная разница является значимой. Когда искусственный интеллект сообщил о величине эффекта, оказалось, что это открытие не имеет практической ценности. Урок: То, что p мало, не имеет значения.

сравнительная таблица

Статус

правильный подход

Следует избегать

аномальные данные

Непараметрический тест

Принудительный t-тест

мультитест

Применить коррекцию

Сырой р<0,05

выброс

Предопределенное правило

произвольное удаление

значительный результат

Размер эффекта + CI

просто п

открытие

Проверка на независимом наборе

Завершить в одном наборе

Распространенные ошибки

  • Неконтролируемое тестирование гипотезы: Ложная значимость при ложном тестировании.
  • p-хакинг: Попытка анализа до тех пор, пока он не даст желаемый результат.
  • Сообщается только о значении p: без учета размера эффекта и доверительного интервала.
  • Без поправки на множественные сравнения: ложные срабатывания.
  • Причинно-следственная связь: вывод причинно-следственной связи из корреляции.
Внимание: ИИ не «выдаст» желаемый результат, но с радостью напишет код для неправильного теста, если его введут в заблуждение. У вас есть статистическая достоверность: сообщайте обо всех исследованиях, планируйте анализ заранее, никогда не упускайте из виду величину эффекта. Работайте с биостатистиком для анализа, ведущего к публикации.

реальное значение p-значения

Самым непонятым понятием в биологии является p-значение. Значение p не является «вероятностью того, что гипотеза верна»; Это «вероятность увидеть разницу, большую или более радикальную, чем то, что вы наблюдаете, хотя на самом деле разницы нет». Это тонкое, но важное различие является ключом к тому, чтобы не преувеличивать результаты. p=0,03 не означает, что «эффект реален на 97%». Когда ИИ интерпретирует результат, проверьте, правильно ли он использует это определение; Иногда модель может повторять распространенное неверное толкование.

Доверительный интервал (ДИ) часто более информативен, чем значение p, поскольку он вместе показывает величину и неопределенность эффекта. «Разница в 2,4 раза (95% ДИ: 1,8-3,1)» говорит гораздо больше, чем «р<0,05»: и о направлении эффекта, и о его величине, и о том, насколько точно он был измерен. Выделите GA в своих отчетах.

Используйте правильное определение значения p при интерпретации моего результата. Избегайте неверных утверждений, таких как «вероятность того, что эффект окажется правдой». Вместо этого объясните практическое значение с точки зрения размера эффекта и 95% доверительного интервала. Результат: [данные]

Корреляция, причинно-следственная связь и данные наблюдений

Большинство биологических данных являются наблюдательными: вы видите, как что-то меняется с чем-то другим, но вы не можете увидеть, что является причиной чего. Предложение «экспрессия гена X коррелирует с заболеванием» не означает, что X вызывает заболевание; Заболевание может увеличивать X, или третий фактор может влиять на оба. Причинно-следственную связь можно установить только посредством интервенционного эксперимента (изменения X и измерения результата). ИИ может неосознанно использовать причинный язык («причиняет», «ведёт») в ваших текстах; рассмотрите каждое заключительное предложение с этой точки зрения, выражая результаты наблюдений корреляционным языком («коррелируют», «различаются вместе»).

Разделение парных и независимых данных

Наиболее часто упускаемое из виду различие при выборе тестов заключается в том, являются ли выборки независимыми или парными. Если вы проводите измерения до и после у одного и того же человека (например, показатели крови одних и тех же пациентов до и после лечения), эти измерения не являются независимыми; Требуется парный тест. Использование здесь независимого двухвыборочного t-теста отбрасывает информацию о совпадении в данных и снижает мощность; Это может даже изменить результат. Правило простое: «Происходят ли эти два измерения из одной и той же биологической единицы?» Если ответ «да», используется парный критерий (парный t-критерий или знаковый ранговый критерий Уилкоксона), если нет, используется независимый критерий. Когда вы запрашиваете у искусственного интеллекта тесты, обязательно указывайте структуру соответствия ваших данных; Если вы не укажете, модель часто предполагает независимость и рекомендует неправильный тест.

У меня есть два набора измерений. Важно: эти измерения были сделаны до/после ОДНЫХ и ТАКИХ особей (в паре). Выберите правильный тест, учитывающий это совпадение (парный t-критерий или Уилкоксона), проверьте свои предположения и сообщите о величине эффекта. Не предполагайте независимость.

В итоге

Точный анализ данных; выбор подходящего теста для типа данных, проверка предположений, корректировка множественных сравнений и представление размера эффекта и доверительного интервала в дополнение к значению p. Самая большая опасность — это р-хакерство; Противоядием является план предварительного анализа, полная отчетность и разделение обнаружения и проверки. Искусственный интеллект — мощный помощник в выборе тестов и проверке предположений, но статистическая достоверность лежит на человеке.

Задача приложения

Возьмите набор данных (собственные данные или образец) с двумя группами. Сначала ИИ напишет код, который визуализирует данные и проверяет их на нормальность. В зависимости от результата примените соответствующий тест (t-критерий или Манна-Уитни) и сообщите размер эффекта и доверительный интервал вместе со значением p. Затем сравните влияние множественных сравнений без коррекции и с коррекцией на результат.

контрольный список

  • [ ] Перед тестированием я визуализировал данные.
  • [ ] Я проверил предположения теста (нормальность, дисперсия).
  • [ ] Я выбрал подходящий тест, я не применил t-критерий вслепую.
  • [ ] Я исправил множественное сравнение.
  • Я сообщил о значении p [ ], а также о размере эффекта и доверительном интервале.
  • [ ] Я заранее определил план анализа и избежал п-хакинга.