利益:
- データの種類と分布に適した検定を選択し、仮定 (正規性、分散) を確認する能力
- p 値の本当の意味を理解し、効果の大きさと信頼区間を使用して結果を報告する能力
- 発見と検証の分離、多重比較の修正、完全なレポートによるハッキングからの保護
実験は終了し、データが到着しました。現在、私たちはデータを正しく分析し、結果を正直に解釈するという、最も重要かつ最も間違った段階にいます。生物学的データはノイズが多く、不安定で、多変量であることがよくあります。間違った検査の選択、暗黙の仮定違反、無意識の p-ハッキング (望ましい結果が得られるまで分析を試みること) が、出版された生物学文献における再現性危機の主な原因です。 AI は、適切なテストの選択、仮定の確認、分析コードの作成を支援します。ただし、統計的な整合性はユーザーの責任です。
この単元では、一般的な統計テスト、仮定のチェック、および p-hacking から身を守る方法について説明します。
適切なテストの選択
テストの選択は、データの種類と分布によって異なります。人工知能はこの選択を支援しますが、盲目的に適用すべきではありません。
- 2 つのグループ、連続データ、正規分布: 独立した t 検定。
- 2 つのグループ、非正規: Mann-Whitney U (ノンパラメトリック: 分布の仮定を必要としない)。
- 2 つ以上のグループ: ANOVA (分散分析) + 事後検定。
- カテゴリデータ (カウント): カイ二乗検定またはフィッシャー正確検定。
- 関係: 相関関係 (ピアソン/スピアマン) または回帰。
ヒント: テストを選択する前にデータを視覚化します。ヒストグラムまたは箱ひげ図は、t 検定に必要な正規性と外れ値を即座に示します。 「最初にグラフを作成し、後でテストする」は良い習慣です。
前提条件の確認
すべてのテストには隠れた仮定があります。 t 検定は正規分布と分散の等価性を前提としています。これらに違反すると、結果は誤解を招くことになります。 AI は、次の前提をチェックするコードを作成します。
役割: あなたは生物統計アシスタントです。タスク: 2 つのデータ グループ (正規性 (Shapiro-Wilk)、分散の等価性 (Levene)) を比較する前に、t 検定の仮定をチェックするコードを作成します。前提に反する場合は、どの代替テストに進むべきかを教えてください。 Python コードをコメント付きで提供します。
正常性が崩れた場合、コードは Mann-Whitney にリダイレクトします。この「最初に確認し、後で決定する」というフローにより、間違ったテストを実行することがなくなります。
P-ハッキングと自分自身を守る方法
p ハッキングとは、p<0.05 になるまでさまざまな方法でデータを分析することです。さまざまなテストを試し、外れ値を選択的に破棄し、グループを追加または削除し、多数の変数の中で何が「有意」であるかを報告します。これが偽の発見の主な原因です。保護の方法:
- 事前に解析計画を立てておく(Unit 7)。
- 重要性を示したテストだけでなく、すべてのテストを報告します。
- 多重比較 (FDR/Bonferroni) を修正しました。
- p 値の横に効果の大きさと信頼区間を入力します。
- 検出と検証を個別に行う: 検出セットで見つかったものを独立したセットでテストします。
ステップバイステップ: 正直な分析
- データを視覚化します (散布図、外れ値)。
- 前提条件を確認してください。
- あらかじめ決められたテストを実行します。
- 多重比較を修正しました。
- 効果量 + 信頼区間をレポートします。
- 制限事項を明確に書きます。
コピー可能なプロンプトテンプレート
スループットを視覚化: 各グループのヒストグラムと箱ひげ図をプロットし、外れ値にフラグを立てます。次に、normality.Data columns: [name] を解釈します。 Python コードをコメント付きで提供します。
2 つのグループを比較したいと思います。データの特徴: [タイプ、N、分布] どの検定が適切ですか?仮定を確認し、検定を実行し、p 値を使用して効果サイズと 95% 信頼区間をレポートします。
分析では 15 の異なる遺伝子をテストしました。 Bonferroni 補正と Benjamini-Hochberg 補正を適用するコードを示し、2 つの方法の違いを説明してください。
弱いプロンプト / 強いプロンプト
弱者: 「これら 2 つのグループは異なりますか。t 検定を行ってください。」
Strong: 「2 つのグループ (対照 n=18、治療 n=20) があり、従属変数は酵素活性 (連続) です。まず分布を視覚化し、Shapiro-Wilk で正規性を検定します。正常であれば t 検定を適用し、そうでない場合は Mann-Whitney を適用します。結果を p 値、効果量 (コーエンの d またはランクバイシリアル)、および 95% 信頼区間とともに報告します。どの検定を選択したのか、およびその理由を説明してください。」
違い: 強力なプロンプトには、データ タイプ、サンプル番号、仮定のチェック、および完全なレポート要求が含まれています。モデルは、盲目的に t 検定を適用するのではなく、正しいパスに従います。
ミニケース3個
ケース 1 — 間違った検定: 学生が有意に歪んだ (非正規) データに t 検定を適用したところ、p=0.048 が見つかりました。人工知能が正規性チェックを追加したところ、データは正常なものではなくなりました。マンホイットニーでは、p=0.11。実際の結果は無意味でした。教訓: 前提条件を確認せずにテストすることは誤解を招きます。
ケース 2 — 選択的な外れ値の破棄: 研究者は、結果を意味のあるものにするために 2 つの「外れ値」点を削除しました。このモデルは、外れ値の破棄は事前定義されたルール (IQR 法など) に基づいて報告されるべきであることを強調しました。恣意的な削除は p-hacking です。教訓: 外れ値ルールを事前に設定する。
ケース 3 — 効果量の回復: ある研究では p=0.001 でしたが、効果量 (d=0.1) はほぼゼロでした。大規模なサンプルでは、わずかな差が有意であることが示されました。人工知能が効果量を報告したところ、その発見には実用的な価値がないことが判明しました。教訓: p が小さいというだけでは問題ではありません。
比較表
ステータス
正しいアプローチ
避けるべきもの
異常なデータ
ノンパラメトリック検定
強制 t 検定
マルチテスト
補正を適用する
粗製 p<0.05
外れ値
事前定義されたルール
任意の削除
重要な結果
効果量 + CI
ただ、p
発見
独立したセットで検証する
1セットで仕上げる
よくある間違い
- 仮説の管理されていないテスト: 誤ったテストによる偽りの有意性。
- p-ハッキング: 望ましい結果が得られるまで分析を試みます。
- p 値のみをレポートする: 効果の大きさと信頼区間を省略します。
- 複数の比較を修正しない: 偽陽性。
- 因果関係ジャンプ: 相関関係から因果関係を推測します。
注意: AI はあなたが望む結果を「生成」しませんが、誤解されれば喜んで間違ったテストのコードを書きます。統計的整合性を備えています。すべての試験を報告し、事前に分析を計画し、効果の大きさを見逃すことはありません。生物統計学者と協力して、出版につながる分析を行います。
p値の本当の意味
生物学で最も誤解されている概念は p 値です。 p 値は「仮説が真である確率」ではありません。これは、「実際には違いがないにもかかわらず、観察したものと同じくらい大きな違い、またはそれ以上に極端な違いが見られる確率」です。この微妙だが重要な違いが、結果を誇張しないための鍵となります。 p=0.03 は、「効果が 97% 本物である」ことを意味するものではありません。 AI に結果を解釈させるときは、この定義が正しく使用されていることを確認してください。モデルは、よくある誤解を繰り返すことがあります。
信頼区間 (CI) は、効果の大きさと不確実性を同時に示すため、多くの場合、p 値よりも有益です。 「差 2.4 倍 (95% CI: 1.8-3.1)」は、「p<0.05」よりもはるかに多くのことを物語っています。つまり、効果の方向、大きさ、および測定の正確さの両方がわかります。レポートで GA を強調表示します。
結果を解釈するときは、p 値の正しい定義を使用してください。 「効果が真である確率」などの誤った記述は避けてください。代わりに、効果の大きさと 95% 信頼区間の観点から実際の意味を説明します。結果: [データ]
相関関係、因果関係、観察データ
ほとんどの生物学的データは観察的なものです。何かが他の何かとともに変化するのはわかりますが、何が原因なのかはわかりません。 「遺伝子 X の発現は疾患と相関する」という文は、X が疾患を引き起こすことを示しているわけではありません。病気が X を増加させているか、第 3 の要因が両方に影響を与えている可能性があります。因果関係は介入実験 (X を変更して結果を測定する) を通じてのみ確立できます。 AI は無意識のうちにテキスト内で因果関係のある言葉 (「原因」、「~につながる」) を使用する可能性があります。この観点から各結論文をレビューし、観察結果を相関関係のある言語 (「相関する」、「共に変化する」) で表現します。
ペアになったデータと独立したデータを分離する
テストの選択において最も見落とされがちな違いは、サンプルが独立しているかペアになっているかどうかです。同じ個人から前後の測定値を取得している場合 (たとえば、同じ患者の治療前後の血液値)、これらの測定値は独立していません。ペアテストが必要です。ここで独立した 2 サンプルの t 検定を使用すると、データ内の一致情報が破棄され、検出力が削減されます。結果が逆転することもあります。ルールは単純です。「これら 2 つの測定値は同じ生物学的単位に由来するか?」答えが「はい」の場合、対応のある検定 (対応のある t 検定またはウィルコクソンの符号付き順位検定) が使用され、「いいえ」の場合、独立した検定が使用されます。人工知能にテストを依頼するときは、データの一致構造を必ず指定してください。指定しない場合、モデルは多くの場合独立性を前提として、間違ったテストを推奨します。
測定値は2セットあります。重要: これらの測定値は、同じ個体 (ペア) の前後で測定されました。この一致を考慮する適切な検定 (対応のある t 検定またはウィルコクソン) を選択し、仮定を確認して、効果量をレポートします。独立を前提としないでください。
要約すれば
正確なデータ分析。データの種類に適切な検定を選択し、仮定を確認し、多重比較を修正し、p 値に加えて効果の大きさと信頼区間を報告します。最大の危険はハッキングです。解決策は、事前の分析計画、完全なレポート、発見と検証の分離です。人工知能はテストの選択と仮説のチェックに強力に役立ちますが、統計的な整合性は人間にあります。
アプリケーションタスク
2 つのグループからなるデータセット (独自のデータまたはサンプル) を取得します。まず、AI にデータを視覚化し、正規性をテストするコードを作成させます。結果に応じて、適切な検定 (t 検定またはマンホイットニー) を適用し、p 値とともに効果の大きさと信頼区間を報告します。次に、補正なしの場合と補正ありの場合の結果に対する多重比較の影響を比較します。
チェックリスト
- [ ] テスト前にデータを視覚化しました。
- [ ] 検定の仮定 (正規性、分散) を確認しました。
- [ ] 私は適切な検定を選択しました。盲目的に t 検定を適用したわけではありません。
- [ ] 多重比較を修正しました。
- [ ] p 値、効果量、信頼区間を報告しました。
- [ ] 事前に分析計画を修正し、p-ハッキングを回避しました。