Печалби:
- Възможност за избор на тест, подходящ за вида и разпространението на данните и проверка на допусканията (нормалност, дисперсия)
- Способност да се разбере истинското значение на p-стойността и да се докладват резултатите с размер на ефекта и доверителен интервал
- Защита от p-хакерство с разделяне на откриване-проверка, корекция на множество сравнения и пълно отчитане
Експериментът приключи, данните са внесени. Сега сме на най-критичния и най-грешен етап: правилно анализиране на данните и честно тълкуване на резултатите. Биологичните данни често са шумни, нестабилни и многовариантни. Неправилен избор на тест, имплицитни нарушения на предположенията и несъзнателно p-хакване (опитване на анализ, докато не даде желания резултат) са основните причини за кризата на възпроизводимостта в публикуваната биологична литература. AI ви помага да изберете правилния тест, да проверите предположенията и да напишете код за анализ; но статистическата цялост е ваша отговорност.
В този раздел ще разгледаме общи статистически тестове, проверки на предположения и начини да се предпазите от p-хакерство.
Избор на правилния тест
Изборът на тест зависи от вида и разпространението на данните. Изкуственият интелект ще ви помогне да направите този избор, но не бива да го прилагате сляпо:
- Две групи, непрекъснати данни, нормално разпределение: независим t-тест.
- Две групи, ненормални: Mann-Whitney U (непараметрична: не изисква предположение за разпределение).
- Повече от две групи: ANOVA (анализ на дисперсия) + post-hoc тест.
- Категорични данни (броене): Хи-квадрат или точен тест на Фишер.
- Връзка: Корелация (Пиърсън/Спирман) или регресия.
Съвет: Визуализирайте данните, преди да изберете теста. Хистограмата или кутията незабавно показва нормалността и отклоненията, които t-тестът изисква. „Първо графика, тест по-късно“ е добър навик.
Проверка на предположенията
Всеки тест има скрити предположения. t-тестът предполага нормално разпределение и равенство на дисперсията; Ако те бъдат нарушени, резултатът ще бъде подвеждащ. AI пише код, който проверява тези предположения:
Роля: Вие сте асистент по биостатистика. Задача: Напишете код, който проверява допусканията на t-тест, преди да сравни две групи от данни: нормалност (Shapiro-Wilk), равенство на дисперсията (Levene). Ако предположението е нарушено, кажете ми кой алтернативен тест трябва да продължа. Дайте код на Python с коментари.
Кодът ви пренасочва към Mann-Whitney, ако нормалното е нарушено. Този поток „първо проверете, решете по-късно“ ви предпазва от извършване на грешен тест.
p-hacking и как да се защитите
p-hacking анализира данни по различни начини до p<0,05: изпробване на различни тестове, селективно отхвърляне на отклонения, добавяне/премахване на групи, отчитане на това, което е „значимо“ сред голям брой променливи. Това е основният източник на фалшиви открития. Начини за защита:
- Коригирайте плана за анализ предварително (Единица 7).
- Докладвайте всички тестове, а не само тези, които показват значимост.
- Коригиране на множествено сравнение (FDR/Bonferroni).
- Дайте размера на ефекта и доверителния интервал до p-стойността.
- Отделно откриване и валидиране: Тествайте това, което намирате в набора за откриване на независим набор.
Стъпка по стъпка: честен анализ
- Визуализирайте данните (разпръскване, отклонение).
- Проверете предположенията.
- Извършете теста, който сте задали предварително.
- Коригирайте многократно сравнение.
- Докладвайте размер на ефекта + доверителен интервал.
- Напишете ясно ограниченията.
Копируеми шаблони за подкана
Визуализирайте пропускателната способност: начертайте хистограми и боксплоти за всяка група, маркирайте извънредни стойности. След това интерпретирайте нормалността. Колони с данни: [име]. Дайте код на Python с коментари.
Искам да сравня моите две групи. Характеристики на данните: [тип, N, разпределение]. Кой тест е подходящ? Проверете предположенията, направете теста, отчетете размера на ефекта И 95% доверителен интервал С p-стойност.
Тествах 15 различни гена в моя анализ. Дайте кода, който прилага корекцията на Bonferroni и Benjamini-Hochberg и обяснете разликата между двата метода.
Слаба подкана / Силна подкана
Слаб: „Тези две групи различни ли са, направете t-тест.“
Силен: „Имам две групи (контрола n=18, лечение n=20), зависимата променлива е ензимната активност (непрекъсната). Първо визуализирайте разпределението и тествайте нормалността с Shapiro-Wilk. Ако е нормално, приложете t-тест, ако не, Mann-Whitney. Отчетете резултата с p-стойност, размер на ефекта (d на Коен или ранг-бисериал) и 95% доверителен интервал. Обяснете кое тест, който сте избрали и защо."
Разлика: Мощната подкана има тип данни, примерни числа, проверка на предположения и пълна заявка за отчитане. Моделът следва правилния път, вместо да прилага сляпо t-тест.
три мини калъфа
Случай 1 — Грешен тест: Студент приложи t-тест към значително изкривени (ненормални) данни и установи p=0,048. Когато изкуственият интелект добави проверката за нормалност, данните не излязоха нормални; С Mann-Whitney, p=0,11. Реалният резултат беше безсмислен. Урок: тестването без проверка на предположението е подвеждащо.
Случай 2 — Селективно отхвърляне на извънредни стойности: Изследовател изтри две „външни“ точки, за да направи резултата значим. Моделът подчертава, че отхвърлянето на извънредни стойности трябва да се основава на предварително дефинирано правило (напр. IQR метод) и да се докладва; произволното изтриване е p-хакване. Урок: задайте правилото за извънредни стойности предварително.
Случай 3 — Възстановяване на размера на ефекта: Едно проучване има p=0,001, но размерът на ефекта (d=0,1) е почти нула; голямата извадка показа, че незначителната разлика е значима. Когато изкуственият интелект съобщи размера на ефекта, се оказа, че откритието няма практическа стойност. Урок: Това, че p е малко, няма значение.
сравнителна диаграма
Статус
правилен подход
Да се избягва
необичайни данни
Непараметричен тест
Принуден t-тест
мулти тест
Приложете корекция
Суров p<0.05
отклонение
Предварително дефинирано правило
произволно изтриване
значителен резултат
Размер на ефекта + CI
просто p
откритие находка
Валидиране на независим комплект
Финализиране в един комплект
Често срещани грешки
- Неконтролирано тестване на хипотези: Фалшиво значение с фалшиво тестване.
- p-hacking: Опитване на анализ, докато даде желания резултат.
- Отчитане само на p-стойност: Пропускане на размера на ефекта и доверителния интервал.
- Без коригиране за множество сравнения: фалшиви положителни резултати.
- Прескачане на причинно-следствената връзка: Извеждане на причинно-следствена връзка от корелация.
Внимание: AI няма да „произведе“ резултата, който искате, но с радост ще напише кода за грешен тест, ако бъде подведен. Имате статистическа достоверност: докладвайте всички опити, планирайте анализа предварително, никога не пропускайте размера на ефекта. Работете с биостатистик за анализи, водещи до публикуване.
реално значение на p-стойността
Най-неразбраната концепция в биологията е p-стойността. P-стойността не е "вероятността хипотезата да е вярна"; Това е „вероятността да видите разликата като голяма или по-екстремна от това, което наблюдавате, когато в действителност няма разлика“. Това фино, но критично разграничение е от ключово значение, за да не се преувеличават резултатите. p=0.03 не означава "ефектът е 97% реален". Когато AI интерпретира резултат, проверете дали използва тази дефиниция правилно; Моделът понякога може да повтаря често срещано погрешно тълкуване.
Доверителният интервал (CI) често е по-информативен от p-стойността, защото показва величината и несигурността на ефекта заедно. „Разлика 2,4 пъти (95% CI: 1,8-3,1)“ казва много повече от „p<0,05“: както посоката на ефекта, неговата величина, така и колко точно е измерен. Маркирайте GA във вашите отчети.
Използвайте правилното определение на p-стойността, когато тълкувате моя резултат. Избягвайте неправилни твърдения като „вероятността ефектът да е верен“. Вместо това обяснете практическото значение по отношение на размера на ефекта и 95% доверителен интервал. Резултат: [данни]
Корелация, причинно-следствена връзка и данни от наблюдения
Повечето биологични данни са наблюдения: виждате как нещо се променя с нещо друго, но не можете да видите какво причинява какво. Изречението „експресията на ген X корелира със заболяване“ не означава, че X причинява заболяване; Болестта може да увеличава X или трети фактор може да засяга и двете. Причинно-следствената връзка може да бъде установена само чрез интервенционално експериментиране (промяна на X и измерване на резултата). AI може несъзнателно да използва причинно-следствен език („причинява“, „води до“) във вашите текстове; прегледайте всяко заключително изречение от тази гледна точка, изразявайки констатациите от наблюденията на корелационен език („свързани“, „вариращи заедно“).
Разделяне на сдвоени и независими данни
Най-често пренебрегваното разграничение при избора на тест е дали пробите са независими или сдвоени. Ако правите измервания преди и след от едно и също лице (например кръвни стойности на едни и същи пациенти преди и след лечението), тези измервания не са независими; Изисква се тест по двойки. Използването на независим t-тест с две извадки тук отхвърля информацията за съвпадение в данните и намалява мощността; Може дори да обърне резултата. Правилото е просто: "Тези две измервания идват ли от една и съща биологична единица?" Ако отговорът е „да“, се използва двоен тест (сдвоен t-тест или Wilcoxon signed rank test), ако не, се използва независим тест. Когато поискате от изкуствения интелект тестове, не забравяйте да посочите структурата на съвпадението на вашите данни; Ако не посочите, моделът често предполага, че е независим и препоръчва грешен тест.
Имам два комплекта измервания. Важно: тези измервания са направени преди/след СЪЩИТЕ индивиди (сдвоени). Изберете правилния тест, който взема предвид това съвпадение (сдвоен t-тест или Wilcoxon), проверете вашите предположения и докладвайте с размера на ефекта. Не предполагайте независимост.
В обобщение
Прецизен анализ на данните; избор на подходящия тест за типа данни, проверка на предположенията, коригиране на множество сравнения и отчитане на размера на ефекта и доверителния интервал в допълнение към p-стойността. Най-голямата опасност е p-хакерството; Противоотровата е предварителен план за анализ, пълно отчитане и разделяне на откритието и проверката. Изкуственият интелект е мощна помощ при избора на тестове и проверката на предположенията, но статистическата цялост е на човека.
Задача за приложение
Вземете набор от данни (ваши собствени данни или извадка) с две групи. Първо накарайте кода за писане на AI, който визуализира данните и тества за нормалност. В зависимост от резултата, приложете подходящия тест (t-тест или Mann-Whitney) и отчетете размера на ефекта и доверителния интервал заедно с p-стойността. След това сравнете ефекта от множество сравнения без корекция и с корекция върху резултата.
контролен списък
- [ ] Визуализирах данните преди тестването.
- [ ] Проверих тестовите допускания (нормалност, дисперсия).
- [ ] Избрах подходящия тест, не приложих сляпо t-теста.
- [ ] Поправих многократно сравнение.
- Отчетох [ ] p-стойността, както и размера на ефекта и доверителния интервал.
- [ ] Фиксирах плана за анализ предварително и избегнах p-хакване.