利益:
- 帰無仮説、p 値、信頼区間、統計的検出力を正しく定義し、検定の選択と解釈に人工知能を使用する能力。
- p 値であるものとそうでないもの (効果の大きさや精度の確率ではない) を区別し、多重比較補正が必要な理由を理解する能力
- 意味と重要性を混同する人工知能によるコメントを認識し、効果の大きさと不確実性を考慮して報告する能力
統計で最も使用され、最も誤解されているツールは仮説検定です。基本的な考え方は単純です。主張 (例: 「これら 2 つのグループの平均は異なる」) とその反対の帰無仮説 (H0 - 「実際には差はない」) があります。検定では、データが帰無仮説とどの程度一致するかを測定します。この単元では、人工知能 (AI) によってテストの選択と解釈がどのように容易になっているのかを説明しますが、なぜ p 値に関する落とし穴が非常に一般的で危険なのかを見ていきます。最初から始めましょう。AI はどのテスト構文を書けばよいかを知っています。しかし、テストの前提が満たされているかどうか、そして結果が実際に何を意味するのかを解釈するのはあなたの仕事です。
実際、p 値とは何ですか?
p 値は、帰無仮説が真である (つまり、実際には効果がない) 場合に、観察した結果、またはより極端な結果が偶然に発生する確率です。小さい p 値 (0.05 が従来のしきい値) は、「実際に効果がなかった場合、そのようなデータが表示されることは驚くべきことである」ことを意味します。これは帰無仮説に対する証拠とみなされます。
ここで、AI がよく混乱する p 値ではないものを明確にしましょう。
- p 値は、帰無仮説が真である確率ではありません。 p=0.03 は、「3% の確率で効果がない」という意味ではありません。
- p 値は効果の大きさを示すものではありません。効果が非常に小さい場合、大きなサンプルでは小さな p 値が得られる場合があります。
- p 値は、その結果が有意であるか、または本物であることを証明するものではありません。 「有意」は統計用語であり、「有意」は判断です。
- p>0.05 は「効果がない」ことを意味するものではありません。それは、「このデータでは効果を示すことができなかった」ということです。証拠の不在は不在の証拠ではありません。
注意: 最も一般的な AI 解釈エラーは、「重大」という単語を「重大な/強い/重大な影響」と表現することです。統計的な重要性と実際的な重要性は 2 つの異なるものです。常に 2 つを別々に報告してください。
信頼区間と効果量: より豊富な情報
単一の p 値の代わりに、信頼区間の方がはるかに有益です。これにより、推定値の妥当な範囲が得られます。 「効果 1,200、95% 信頼区間 [300, 2,100]」という文は、方向、大きさ、不確実性の両方を示しています。 「p<0.05」は「ゼロからは程遠い」というだけです。現代の統計実務では、p 値だけが使用されるわけではありません。は、効果量 + 信頼区間 + p 値の 3 つを使用してレポートすることを推奨しています。
統計力とサンプル
統計的検出力は、実際に存在する効果を検出する確率です (1 からタイプ II エラー、つまり「実際の効果を見逃している」確率を引いた値) です。検出力が不十分な研究は、次の 2 つのリスクにさらされます。(1) 真の効果が見逃される (偽陰性)。 (2) 重要であることが判明した少数の結果は、規模が誇張されています。膨らんだ予測のみがしきい値を超えることができるため、いわゆる勝者の呪いです。したがって、分析の前にパワー/サンプルを計算することをお勧めします。 AI がこのアカウントのコードを生成します。理論に基づいて目標の効果量を決定します。
多重比較問題
検査を行う場合、しきい値 0.05 は「偽陽性のリスク 5%」を意味します。しかし、20 回のテストを実行した場合、すべてのテストが実際に効果がない場合でも、平均して 1 回のテストで p<0.05 が偶然得られると予想されます。これを多重比較問題といいます。多数の変数、サブグループ、または結果変数がテストされると、偽陽性の確率が急速に増加します。解決策は、しきい値を修正することです。ボンフェローニ法 (しきい値をテスト数で割る - 厳密)、誤検出率 (FDR) を制御するホルム法またはベンジャミニ-ホッホバーグ法です。 AI は数秒で数十のテストを生成できるため、このリスクは AI の時代にはさらに大きくなります。これは次の単元 (p ハッキング) の直接の主題です。
比較表: p 値で分かることと分からないこと
表現
本当ですか?
説明
「p=0.02、効果がない確率は2%」
間違っています
p は H0 の確率ではありません
「p<0.05、効果は大きい」
間違っています
pはサイズを示すものではありません
「p=0.20、効果なし」
間違っています
見せられないことは不在ではない
「p<0.05、H0 に対する証拠があります。」
本当
慎重かつ的確
「効果 1.200 [300;2.100]、p=0.01」
最高の
サイズ + 不確実性 + 証拠
コピー可能な 4 つのプロンプト
1. 適切なテストの選択:
あなたの役割: 統計テストのアシスタント。 2 つの独立したグループ (連続変数) の平均を比較したいと考えています。教えてください: どの検定が適切であるか (正規性、分散の等価性などの仮定を伴う)、仮定が満たされない場合の代替法 (Welch、Mann-Whitney など)、および R コードを教えてください。結果を実行して仮定を確認します。
2. p 値を正しくレポートする:
以下にテスト出力を報告します。 ただし、ルール: - p 値を「H0 の確率」または「効果の大きさ」として提示しないでください。 - 効果の大きさと 95% 信頼区間を必ず含めてください。 - 「有意」と「有意」を別々に記述してください。 - p>0.05 の場合、「効果なし」とは言わず、「表示できませんでした」と言ってください。出力: [貼り付け]
3. 検出力/サンプルの計算:
実験を計画しています: 2 つのグループ、期待効果サイズ (コーエンの d) ~0.4、検出力 0.80、アルファ 0.05。必要なサンプルサイズを計算する R コード (powr パッケージ) を作成し、検出力の低い研究 (勝者の呪い) のリスクを説明します。
4. 多重比較補正:
15 回の個別の仮説検定を実行し、p 値を取得しました。 Bonferroni および Benjamin-Hochberg (FDR) 補正を適用する R コードを作成し、2 つの方法の違いを説明し、裸の p<0.05 を信頼すべきではない理由を一文で要約してください。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
このテストの結果は意味がありますか?結果についてコメントします。
この主張は、AI を「意味があるかないか」という二元論の中に閉じ込めてしまいます。最も可能性が高いのは、「はい、それは重要です、効果は強いです」など、大きさと重要性を混同した文を生成することです。
強力なプロンプト:
あなたの役割: 気配りのある統計アシスタント。結果を解釈しますが、(1) 効果量 + 95% 信頼区間 + p 値を一緒に与えます、(2) 有意性と有意性を区別します、(3) 「表示できませんでした」の p>0.05、(4) テストの数を尋ねます。複数の場合は、多重比較の修正を提案します。(5) テストの仮定をチェックする必要があることを思い出させます。
違い: 強力なプロンプトにより、豊富なレポートが強制され、p 値のトラップから保護されます。
ミニケース3個
ケース 1 — 大規模なサンプルにおける有意ではない「有意性」。あるアナリストは、500,000 件の観測データにおける 2 つのグループ間の平均差が p<0.001 で「非常に有意」であると発見しました。しかし、その差はわずか0.3点(100点満点)であり、ほとんど意味がありませんでした。膨大なサンプルのおかげで、わずかな違いさえも「重要」になりました。効果量が報告されたとき、その結果は重要ではないことが判明しました。教訓: 重要性は大きさではありません。 n が大きい場合、すべての違いは重要になります。
ケース 2 — 複数のテストの錯覚。あるチームは 22 の結果変数をテストしました。そのうちの 1 件は p=0.04 を示し、「効果が認められた」と発表されました。 Bonferroni 補正により、しきい値は 0.05/22 = 0.0023 に減少しました。 0.04 はこのしきい値を超えませんでした。唯一の「意味のある」結果は、22 回の試行のうち偶然だったでしょう。教訓: たくさんテストするときは修正が必要です。
ケース 3 — 力不足と勝者の呪い。小規模なパイロット研究 (グループあたり n=15) では、効果が非常に大きく (d=0.9)、有意であることがわかりました。大規模な反復研究により、効果は d = 0.2 に減少しました。サンプルが少ないため、過大評価がしきい値を超えることしか許可されていませんでした。教訓: 低電力での大きな効果量は信頼できません。
よくある間違い
- 意味と重要性/大きさを混同している。 p が小さいからといって効果が大きいわけではありません。効果量は別途報告してください。
- p 値を H0 の確率と間違えています。 p は「影響がない確率」ではありません。概念的に異なります。
- p>0.05 を「効果なし」と読みます。提出しないことは欠席の証拠にはなりません。不確実性を述べます。
- マルチテストの修正は行っておりません。検査が多すぎると偽陽性が発生します。ボンフェローニ/FDRを適用します。
- 権力無視。少数のサンプルにおける有意な効果は誇張されています。解析前に検出力を計算します。
ヒント: 結果を「有意」として評価する前に、次の 2 つの質問をしてください。「その効果は実際に有意 (大きさ) ですか?」 「この結果が見つかるまでに何回テストを受けましたか?」 2 番目の質問は、誠実さのリトマス試験紙です。
要約すれば
仮説検定と p 値は強力なツールですが、誤解されています。 p 値は、帰無仮説が真である場合にデータが表示される確率です。 H0 の確率は、効果の大きさや発見の重要性ではありません。効果の大きさと信頼区間とともに有意性を常に報告します。 p>0.05 を「効果なし」と解釈しないでください。多数のテストを行った場合は、多重比較補正を適用します。低検出力の研究による効果が誇張されるリスクに注意してください。 AI はテストコードとブループリントを生成します。意味と重要性を区別し、前提条件を確認するのはあなたの責任です。
アプリケーションタスク
データセット内の 2 つのグループ間の平均を比較します。 AI に適切なテスト (前提条件を含む) とコードを要求し、それを実行して前提条件を確認します。効果の大きさ、95% 信頼区間、p 値の 3 つの要素を使用して結果をレポートします。次に、同じデータに対していくつの異なる比較ができるかを考えます。複数のテストを実行した場合は、ボンフェローニまたは FDR 補正を適用し、結果が依然として維持されるかどうかを報告します。最後に、分析用に大まかな電力評価を作成します。
チェックリスト
- [ ] 前提条件を含むテストを選択し、前提条件を確認しました。
- [ ] 結果を効果量 + 信頼区間 + p 値として報告しました。
- [ ] 私は「重要なこと」と「重要なこと」を分けて考えていました。 pがH0の確率だとは思いませんでした。
- [ ] p>0.05 を「効果なし」ではなく「示せなかった」と書きました。
- [ ] 複数のテストを実行する場合は、多重比較補正を適用しました。
- [ ] サンプリングパワーを評価しました。低電力での効果の大きさに注意しました。