收益:
- 能够正确定义原假设、p 值、置信区间和统计功效,并在测试选择和解释中使用人工智能。
- 能够区分什么是 p 值,什么不是 p 值(不是效应大小,不是准确概率)并理解为什么需要多重比较校正
- 能够识别人工智能做出的混淆意义与重要性的评论,并报告其影响大小和不确定性
最常用和最容易被误解的统计学工具是假设检验。基本思想很简单:我们有一个主张(例如“这两组的平均值不同”)及其相反的零假设(H0 - “实际上没有差异”)。该检验衡量数据与原假设的吻合程度。在本单元中,我们将了解人工智能 (AI) 如何使测试选择和解释变得更加容易,以及为什么 p 值周围的陷阱如此常见和危险。让我们从头开始:AI 知道要编写哪种测试语法;但你的工作是解释测试的假设是否满足以及结果的真正含义。
p 值实际上是多少?
p 值是当零假设为真(即实际上没有影响)时,您观察到的结果或更极端的结果偶然发生的概率。小 p 值(0.05 是传统阈值)意味着“如果确实没有效果,看到这样的数据将会令人惊讶”;这被认为是反对零假设的证据。
现在让我们澄清一下 p 值不是什么——人工智能经常混淆这一点:
- p 值不是原假设为真的概率。 p=0.03 并不意味着“有 3% 的概率没有效果”。
- p 值并不表示效应的大小。非常小的影响可能会在大样本中产生微小的 p 值。
- p 值并不能证明该发现是显着的或真实的。 “显着”是一个统计术语,“显着”是一个判断。
- p>0.05并不意味着“没有影响”;这意味着“我们无法用这些数据显示效果”。没有证据并不等于不存在的证据。
注意:最常见的人工智能解释错误是将“重大”一词呈现为“重大/强烈/重大影响”。统计意义和实际意义是两个不同的东西;始终分别报告两者。
置信区间和效应大小:更丰富的信息
置信区间比单个 p 值更具信息性:它给出了估计值的合理范围。 “效果 1,200, 95% 置信区间 [300, 2,100]”这句话同时显示了方向、幅度和不确定性; “p<0.05”只是表示“远离零”。现代统计实践不仅仅使用 p 值;建议使用效应大小 + 置信区间 + p 值三重奏进行报告。
统计功效和样本
统计功效是检测到实际存在的效应的概率(1 减去 II 类错误的概率,即“错过真实效应”)。一项动力不足的研究容易受到两种风险的影响:(1)它错过了真实的效果(假阴性); (2) 少数确实具有重要意义的结果带有夸大的幅度——所谓的赢家诅咒,因为只有夸大的预测才能跨越门槛。因此,在分析之前计算功效/样本是一个很好的做法。 AI生成该账户的代码;您可以通过理论确定目标效应大小。
多重比较问题
进行测试时,阈值 0.05 表示“5% 的误报风险”。但如果您进行 20 次测试,平均而言,即使所有测试实际上都无效,预计其中一次会偶然给出 p<0.05。这称为多重比较问题。当测试大量变量、子组或结果变量时,误报的概率会迅速增加。解决方案是修正阈值:控制错误发现率(FDR)的 Bonferroni(将阈值除以测试数量 - 严格)、Holm 或 Benjamini-Hochberg 方法。在人工智能时代,这种风险变得更大,因为人工智能可以在几秒钟内产生数十个测试——这是下一个单元(p-hacking)的直接主题。
比较表:p 值说明了什么和没有说明什么
表达
这是真的吗?
描述
“p=0.02,无效概率为 2%”
错误的
p 不是 H0 的概率
“p<0.05,效果很大”
错误的
p不表示大小
“p=0.20,没有影响”
错误的
无法展现并不代表缺席
“p<0.05,有证据反对 H0”
真实
谨慎且切中要害
“效果 1.200 [300;2.100],p=0.01”
最好的
规模+不确定性+证据
四个可复制的提示
1. 选择正确的测试:
您的角色:统计测试助理。我想比较两个独立组的平均值(连续变量)。请告诉我:哪个检验是合适的(及其假设:正态性、方差齐性)、不满足假设时的替代方案(例如 Welch、Mann-Whitney)以及 R 代码。我将运行结果并检查假设。
2. 正确报告 p 值:
报告下面的测试输出,但规则:- 不要将 p 值表示为“H0 概率”或“效应大小”,- 确保包括效应大小和 95% 置信区间,- 分别写“显着”和“显着”,- 如果 p>0.05,不要说“没有效应”,说“我们无法显示”。输出:[粘贴]
3.功率/样本计算:
我正在计划一个实验:两组,预期效应大小(Cohen's d)~0.4,功效 0.80,alpha 0.05。编写 R 代码来计算所需的样本量(pwr 包)并解释低能力研究的风险(赢家的诅咒)。
4.多重比较校正:
我已经完成了 15 个单独的假设检验,并且有 p 值。编写应用 Bonferroni 和 Benjamin-Hochberg (FDR) 修正的 R 代码,解释两种方法之间的差异,并用一句话总结为什么我不应该相信纯粹的 p<0.05。
弱提示/强提示
弱提示:
这个测试的结果有意义吗?对结果发表评论。
这种说法将人工智能困在“有意义/无意义”的二元论中;最有可能产生一个混淆了重要性和重要性的句子,例如“是的,它很重要,效果很强。”
强力提示:
您的角色:细心的统计助理。解释结果,但:(1) 给出效应量 + 95% 置信区间 + p 值,(2) 将显着性与显着性分开,(3) “无法显示”中的 p>0.05,(4) 询问我做了多少次测试;如果超过一个,建议多重比较修正,(5)提醒检验的假设要进行检查。
差异:强烈的提示强制执行丰富的报告并防止 p 值陷阱。
三个迷你箱子
情况 1——大样本中“显着性”不显着。一位分析师发现,在 500,000 个观察值的数据中,两组之间的平均差异“高度显着”,p<0.001。但差别只有 0.3 分(满分 100 分),几乎没有任何意义。巨大的样本使得即使是微小的差异也变得“显着”。当报告效应大小时,发现这一发现并不显着。教训:重要性不在于大小;而在于重要性。如果 n 很大,则每个差异都很显着。
案例 2 — 多重测试错觉。一个团队测试了 22 个结果变量;其中一项显示 p=0.04,并宣布“我们发现了效果”。经过 Bonferroni 校正,阈值降低至 0.05/22 = 0.0023; 0.04 没有超过这个阈值。唯一“有意义”的结果是 22 次试验中的偶然结果。教训:当进行大量测试时,修正是必要的。
案例 3 — 实力不足和胜利者的诅咒。一项小型试点研究(每组 n=15)发现效果非常大(d=0.9)且显着。一项大型重复研究将效应降低至 d = 0.2。小样本只允许高估超过阈值。教训:低功率下的显着效应大小是不可信的。
常见错误
- 将意义与重要性/重要性混淆。 p 较小,影响并不大;单独报告效应大小。
- 将 p 值误认为是 H0 的概率。 p 不是“无效概率”;在概念上是不同的。
- 读数 p>0.05 为“无影响”。未能出示并不构成缺席的证据;说明不确定性。
- 不纠正多重测试。太多的测试会产生误报;应用 Bonferroni/FDR。
- 无视权力。小样本中的显着效应被夸大;在分析之前计算功率。
提示:在将结果标记为“显着”之前,请先问两个问题:“效果实际上是否显着(大小)?”以及“在得到这个结果之前我做了多少次测试?”第二个问题是诚实的试金石。
总之
假设检验和 p 值是强大但被误解的工具。 p 值是原假设为真时看到数据的概率; H0 的概率不是效应的大小或发现的显着性。始终报告显着性以及效应大小和置信区间;不要将 p>0.05 解读为“无影响”;如果您进行了多次测试,请应用多重比较校正;请注意低能力研究夸大影响的风险。 AI生成测试代码和蓝图;您有责任区分意义和重要性并检查假设。
应用任务
比较数据集中两组之间的平均值。向人工智能询问适当的测试(及其假设)和代码,运行它并检查假设。报告包含三个组成部分的结果:效应大小、95% 置信区间、p 值。然后想想你可以对相同的数据进行多少种不同的比较;如果您运行了多个测试,请应用 Bonferroni 或 FDR 校正并报告结果是否仍然成立。最后,为您的分析编写一个粗略的功率评估。
清单
- [ ] 我选择了带有假设的测试并检查了假设。
- [ ] 我将结果报告为效应量 + 置信区间 + p 值。
- [ ] 我将“重要”和“重要”分开;我不认为p是H0的概率。
- [ ] 我将 p>0.05 写为“我们无法显示它”而不是“没有效果”。
- [ ] 如果我运行多个测试,我会应用多重比较校正。
- [ ] 我评估了采样能力;我对低功率下的效应大小持谨慎态度。