ユニット 7 / 11

p-ハッキング、HARKing、統計的整合性: 人工知能時代の落とし穴

利益:

  • ハッキング、ハーキング、選択的報告、分岐の庭が誤った発見を生み出すことを理解し、人工知能がこれらの罠をどのように加速できるかを見てください。
  • 事前登録、分析計画、多重比較規律、人工知能サポートによる感度分析などの防御を確立する能力
  • 正直なリクエスト設計を内部化できることで、人工知能が「意味のある結果を見つける」タイプのリクエストを拒否できるようになり、最終的な責任は研究者にあります。

前の単元では、p 値とは何か、そうでないものについて説明しました。この単元では、より暗いトピック、つまり統計の完全性を脅かす組織的なトラップについて見ていきます。これらのほとんどは意図的な不正行為ではありません。これらは、善意の研究者でも気付かないうちに陥ってしまう陰湿なメカニズムです。そして、人工知能 (AI) は数十件の分析を数秒で実行できるため、これらの落とし穴をより簡単かつ迅速に解決します。この単元の目的は、AI を「意味のある結果を見つける機械」から誠実なアシスタントに変える規律を確立することです。

基本的な落とし穴

p-ハッキング (p 値ハンティング): 有意な結果 (p<0.05) が得られるまで、さまざまな方法で分析を再試行します。変数の追加と削除、サブサンプルの選択、外れ値の定義の変更、さまざまな変換の試行、さまざまな結果変数の使用、意味のあるデータ収集の停止...それぞれの試みが新たな「チャンス」を与えます。十分に努力すれば、実際には効果がなくても、そのうちの1つは意味があることがわかります。その結果、偽の調査結果が公表されたものの、再現性はありませんでした。

ハーキング(結果が分かってから仮説を立てる):結果を見て仮説を​​立て、「最初からこう予測した」と発表すること。データを見て最も顕著な関係を見つけて、その仮説を検証するように設計されたかのように論文を書きます。これは、発見が確認されたかのように見せて、読者を誤解させます。

選択的レポート (厳選): 数十の分析から「良い」ものだけをレポートし、残りは黙って葬り去ります。これは「ファイル引き出し問題」としても知られています。無意味な結果が引き出しの中に残り、文献が体系的に偏ったものになります。

分かれ道の庭:アンドリュー・ゲルマンの用語。意図的な p ハッキングが 1 つも行われていない場合でも、研究者はデータ (どの変数、どのしきい値、どのサブグループ、どの変換) に基づいて多くの合理的な選択を行います。このような調査の自由度は非常に高いため、たとえ悪意がなくても、多数の分析から意味のあるものを効果的に選択することになります。その結果、再び偽陽性率が上昇します。

注意: これらのトラップのほとんどは、意図的なトリックではありません。 「さらにいくつかのモデルを試してみた」、「外れ値を除去したらより明確になった」、「このサブグループでは効果がより明確になった」など、一見無害なステップの合計により、偽の結果が生成される可能性があります。正直さは方法の問題であり、意図の問題ではありません。

なぜAIはこうした罠を拡大するのでしょうか?

3 つのモデルを手作業で試すには時間がかかります。 YZ は、50 のモデル バリアント、10 の異なる変換、8 つのサブグループを数分で生成します。正直な計画がなければ、この力は悲惨なものになります。「このデータから意味のある関係を見つけてください」または「この仮説をサポートするモデルを構築してください」などの要求は、AI を直接ハッキング エンジンに変えます。 AI も役に立ちたいと考えています。自分を満足させる「意味のある」結果を見つける傾向があります。だからこそ、プロンプトデザインが誠実さの第一の防御線となるのです。

防御: 公正な業務の流れ

1. 事前登録: 分析を実行する前に、仮説、変数、モデル、テストを書面で (おそらくタイムスタンプ付きのプラットフォームに) 記録することを意味します。したがって、発見は確認から切り離されます。後で変更したものはすべて「エクスプローラー」としてタグ付けされます。

2. 分析計画: 事前に記録できない場合でも、データに入る前に、主要な仮説、主要な結果変数、主要なモデルなどの分析計画を作成します。 「主な分析」と「追加/探索的分析」の区別を最初から確立し、レポート内で維持します。

3. すべて報告する: 試したモデルを隠さないでください。 「感度分析」(堅牢性チェック)セクションでは、仕様の違いによって結果がどのように変化するかを示します。この発見は、多くのもっともらしい選択肢の下で成り立つ場合にのみ強力です。

4. 多重比較の規律: 実行したテストが多すぎる場合は、修正します (ユニット 6)。 「何回テストをしましたか?」という質問に答えてください。正直に。

5. 感度分析: 別のサンプル、別のコントロール セット、別の変換を使用して主な発見を繰り返します。結果が変わった場合は、隠さずに報告してください。

比較表: 正直者と罠

アプリケーション

トラップの形状

正直な同等品

機種選定

意味が分かるまで試す (p-ハッキング)

事前に計画されたマスターモデル

仮説

事後フィッティング (HARKing)

データの前に録音済み

レポート

美しいものだけを見せるのではなく

全スペック+感度

サブグループ

最も印象的なものを選択する

事前定義済み、修正可能

データ収集

意味があるときはやめてください

所定のサンプル

コピー可能な 4 つのプロンプト

1. 正直な主張の枠組み:

あなたの役割: 正直な統計アシスタント。私の目標は意味のある結果を見つけることではなく、正しい結果を見つけることです。ルール: - 「意味がわかるまでモデルを試してください」というような提案はしないでください。- 複数の仕様を提案する場合は、すべて報告する必要があると教えてください。- ハッキングにつながる可能性のある手順については警告してください。まず、発見と確認を分けて、私の主要なモデルを明確にするのを手伝ってください。

2. 分析計画案:

研究の予備的な分析計画の草案を作成するのに役立ちます。主な仮説、主な結果変数、主なモデル仕様、事前定義されたサブグループ、多重比較戦略などです。 「探索的」分析と「確認的」分析を別々の見出しに入れます。データを見ずにこれに記入するようリマインドします。

3. 感度分析:

私の主な発見は、感度分析コード (R) を作成することです。私の目標は、結果がどの程度確実であるかを確認することであり、最良のものを選択することではありません。すべての結果を表示します。

4. 自己モニタリング:

私の分析プロセスを説明します。 P-ハッキング / HARKing / 選択的報告のチェックリストを提供し、私のステップのどれが危険であるかをマークしてください。私が試したモデル/テストの数と、どのモデル/テストを報告する予定かを尋ねてください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

このデータ内でどの変数が有意な関係を示しているかを確認し、最適なモデルを見つけます。

このプロンプトは直接的なハッキング指示です。AI は数十の組み合わせを試し、「最も意味のある」組み合わせを提示します。その結果はほぼ確実に、再現できない偽の発見です。

強力なプロンプト:

あなたの役割: 正直なアシスタント。私があらかじめ決めたメイン モデルは、Y ~ X + コントロールです。このモデルを予測するコードを作成します。別の「より意味のある」モデルを探さないでください。また、結果の堅牢性を確認できるように感度分析も提案してください。ただし、最良の結果を選択するのではなく、すべての結果を報告することを承知してください。探索的な発見を「確認済み」として無視しないでください。

違い: 強い意志はメインモデルを修正し、検索を禁止し、すべての結果を報告することを要求します。

ミニケース3個

ケース 1 — サブグループのハンティング。ある研究者は、サンプル全体では何の影響も見られませんでした。彼はAIに「どのサブグループで重要ですか?」と尋ねました。 YZ は年齢、性別、地域の組み合わせをスキャンし、「35 ~ 44 歳の都市部女性では p = 0.03」であることがわかりました。この記事はこのサブグループに基づいています。彼の複製には何の効果も見られませんでした。これは数十のサブグループからの偶然の結果でした。教訓: データが HARK された後に選択されたサブグループは確認ではありません。

ケース 2 — コンバージョンハンティング。学生レベルでは無意味であることが判明した関係。対数、平方根、二乗、ラグ形式で試してみました。彼は対数対数形式で p=0.048 を発見し、それのみを報告しました。幸運なことに、試した 5 つのフォームのうち 1 つが閾値を超えました。正しい方法は、理論に基づいてフォームを事前に選択し、すべてのフォームの結果を感度テーブルに表示することでした。教訓: 選択的な報道は誤った重要性を生み出す。

ケース 3 — 正直なフレーミングがどのように機能するか。分析前に 1 つのチームが事前登録: 1 つの主要仮説、1 つの主要モデル、2 つの事前定義されたサブグループ、ボンフェローニ補正。主な効果は顕著ではありませんでしたが、チームはそれを正直に報告しました。探索者は、ある発見に「今後テストする必要がある」とフラグを立てた。この研究には再現性があり、信頼性がありました。教訓: 正直に計画を立てれば、たとえ「失敗」という結果であっても価値のあるものになります。

よくある間違い

  • AI に「意味のある結果を見つける」ように指示します。これはまさにハッキングです。 AI を正直な枠組みに置き、結果ではなく正確さを求めます。
  • 発見を確認として提示します (HARKing)。データの後に立てられた仮説を「最初から予測した」と書くのは誤解を招きます。探索的発見にラベルを付けます。
  • 良い結果を報告するだけです。テストされたすべての仕様を表示します。感情分析を非表示にすると、整合性が損なわれます。
  • サブグループ/変換スクリーニング。数十のサブグループまたは変換のうち最も重要なものを選択すると、誤った結果が生成されます。事前に特定して修正します。
  • 何回検査したか忘れてしまいます。合計試行回数を追跡します。この数値が分からなければ、p 値を正直に解釈することはできません。
ヒント: 結果を書き留める前に、「この結果を見つけるまでに、何通りの方法を黙って試しましたか? そして、それらすべてを報告しているでしょうか?」と自問してください。いくつかのエッセイが引き出しに残っていると、レポートは実際よりも強力に見えます。

要約すると

Pハッキング、HARKing、選択的レポート、そして分岐点の庭。多くは意図せずに動作するトラップですが、偽の再現不可能な結果が得られます。 AI は瞬時に数十の分析を試せるため、こうした落とし穴が加速します。 「意味のある結果を見つける」タイプのリクエストは、AI をハッキング エンジンに変えます。防衛;発見を事前登録および分析計画による確認から分離し、すべての仕様と感度分析を報告し、複数の比較を修正し、「正しい結果」を要求する誠実なフレームワークに AI を導入します。最終的な責任は常に研究者にあります。

アプリケーションタスク

研究課題を選択し、データを確認する前に簡単な分析計画を作成します。主な仮説、主なモデル、主な結果変数、事前定義されたサブグループ、多重比較戦略などです。次に、メインモデルを推定します。次に、感度分析 (さまざまなコントロール、異常値の包含/除外、さまざまな関数形式) を実行し、すべての結果を 1 つの表に表示します。 1 つの段落で、どのステップが p-hacking のリスクを引き起こすか、そして誠実なフレームワークがそれらをどのように制限するかを評価します。

チェックリスト

  • [ ] データに入る前に、分析計画/マスター モデルを作成しました。
  • [ ] 私は探索的分析と確認的分析を別々にラベル付けしました。私はハーキングしていませんでした。
  • [ ] 私が試したすべての仕様を報告しました。ただ美しいものを選んだわけではありません。
  • [ ] サブグループと変換を事前に定義しましたが、データの後にそれらをスキャンしませんでした。
  • [ ] 実行したテストの数を記録し、必要な修正を適用しました。
  • [ ] 私は AI を「意味のあるものを見つける」というよりはむしろ「真実を見つける」という文脈で使用しました。私は責任を負いました。