ユニット 3 / 11

探索的データ分析と視覚化: 人工知能によるグラフ作成と解釈

利益:

  • 人工知能サポートを使用して記述統計および分布/関係グラフを作成し、データと質問に応じて適切なグラフの種類を選択する能力
  • 人工知能によって生成された画像内の誤解を招く選択 (破線の軸、不適切なスケール、過度の平滑化) を認識し、正直な視覚化原則を適用する能力
  • 探索的分析は仮説を生成するためのものであり、同じデータで発見と確認を行うという罠(p-ハッキングへの扉を開く)であることを区別できること。

データを整理した後、実証研究者の最初の仕事は、データを知ることです。この段階は探索的データ分析 (EDA - 探索的データ分析) と呼ばれます。これは、グラフと要約統計量を使用してデータを調査し、その構造、パターン、驚きを確認するプロセスです。目的はまだ仮説をテストすることではなく、データを知り、質問を生成し、将来構築するモデルの基礎を築くことです。この単元では、人工知能 (AI) がどのように EDA と視覚化を加速するのか、また人工知能 (AI) が生成するグラフィックスを慎重に監査する必要がある理由を説明します。

まず 2 つの基本的な区別をしてみましょう。まず、記述統計 (平均、中央値、標準偏差、四分位数などのデータを要約する数値) と視覚化 (同じ情報をグラフで表示する) は相互に補完します。これらは一緒になってデータを説明します。次に、最も重要なことは、発見と確認を区別する必要があるということです。探索的分析は仮説を生成するためのものです。同じデータを使用して仮説を調査し、「テストして重要であることがわかりました」と言うと、p-ハッキングへの扉が開きます。これについては次の単元で説明します。データを見てパターンを確認するのは自由です。しかし、そのパターンを同じデータで「証明された結果」と宣言するのは誤解を招きます。

段階的な探索的分析

1. 単変量ビュー。各変数を個別に調べます。その分布は対称的ですか、それとも歪んでいますか。丘はいくつありますか。外れ値はどこにあるのでしょうか?数値変数の場合、ヒストグラム (値を範囲に分割して頻度を示すプロット) および箱ひげ図 (箱ひげ図 - 中央値、四分位値、および極値を示すグラフ)。カテゴリ変数の場合は、度数表と棒グラフを使用します。

2. 二変量ビュー。 2 つの変数間の関係を確認します。2 つの数値変数の散布図 (各観測値を x-y 平面上の点として表示)、数値カテゴリのグループ化箱ひげ図、2 つのカテゴリのクロス集計です。相関係数を見る前に、必ず散布図を見てください。同じ相関でも大きく異なるパターンが示されることがあります (有名なアンスコム カルテットがこれを実証しています。4 つのデータ セットの統計はほぼ同じですが、プロットするとまったく異なることがわかります)。

3. 正しいグラフの種類を選択します。グラフの種類は、質問とデータの種類によって異なります。分布のヒストグラム。関係のために散在する。時間の経過に伴う変化を表す折れ線グラフ。カテゴリ比較の棒グラフ。全体に対する部分の比率を示す (慎重に) 積み上げ棒グラフ。 AI はすぐにコードを生成しますが、「どの質問にどのグラフを対応させるか」を決定するのはあなたです。

4. パターンに注意し、結果を宣言しないでください。見つかった興味深いパターンを「発見メモ」として記録しますが、それを確認された発見とは考えないでください。確認は別のステップで、できれば別のデータまたは所定のスケジュールで行われます。

正直な視覚化の原則

グラフィックは説得力があります。そのためミスリード力も高い。 AI は美しい選択をすることもありますが、時には誤解を招く選択をすることもあります。次のポリシーを確認してください。

  • 棒グラフでは、Y 軸はゼロから開始する必要があります。破線の軸は、小さな差異を大きな差異として示します。
  • スケールは一貫している必要があります。 2 つのグラフを比較する場合は、同じ軸範囲を使用します。
  • 過剰なスムージングは​​、本当のパターンを隠す可能性があります。傾向線は見栄えがしますが、データを「平滑化」しすぎると誤解を招く可能性があります。
  • データではなく、色と 3D 装飾が注意を歪めます。シンプルさを選択してください。
  • 欠損データとサンプルサイズが表示されるはずです。 「n=12」と「n=12,000」は同じに見えないはずです。
注意: AI によって生成されたグラフィックが美しいからといって、それが真実であるわけではありません。彼が犯す最も一般的な間違いは、棒グラフの軸を 0 から開始しないことと、2 つのグループ間の違いを誇張していることです。常に軸を確認してください。

比較表:質問→表

尋ねる

正しいチャート

よくある間違い

この変数はどのように分散されるのでしょうか?

ヒストグラム/箱ひげ図

円グラフを使用する

2 つの数値変数は関連していますか?

散布図

相関数だけ見てみると

時間の経過とともにどのように変化しましたか?

折れ線グラフ

棒グラフでトレンドを伝える

グループ間の違いは何ですか?

グループ化されたボックス/バー (最初から)

切頭軸ロッド

部分対全体の比率?

積み上げバー (注意)

マルチスライス円グラフ

コピー可能な 4 つのプロンプト

1. 自動検出コード:

あなたの役割: EDA アシスタント。データは共有しません。R (ggplot2) コードが必要です。 「データ」data.frame には、数値 (収入、年齢、支出) 変数とカテゴリ (地域、教育) 変数があります。タスク: 各数値のヒストグラム、各カテゴリの棒グラフ、および収入~年齢の散布図を生成するコードを作成します。棒グラフでは、y 軸をゼロから開始します。コメント行を追加します。

2. 相関関係のレビュー (相関関係とビジュアルを組み合わせたもの):

収入と支出のピアソン相関を計算し、散布図と線形トレンドをプロットするコードを作成します。相関カウントを信頼する前にチャートを調べることを思い出させるコメント行を追加します (Anscombe 警告)。トレンドラインを滑らかにしすぎないでください。

3. 完全性監査:

正直な視覚化については、次の ggplot コードを確認してください:[コード]。次の点を確認して修正してください: Y 軸はゼロから始まっているか、スケールは一貫していますか、サンプル サイズは表示されていますか、過度の平滑化はありませんか?行った各修正の正当性を説明してください。

4. 発見メモの作成 (発見ではありません):

私が作成したグラフに基づいて、「発見メモ」として観察をリストします。各項目は、「決定的な発見」ではなく、「テストされる仮説」という言葉で書きます。例: 「高等教育における収入はさらに分散しているようです。別のデータでテストする必要があります。」因果関係や決定的な発言は避けてください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

収量から素敵なグラフを作成し、それが何を意味するのか教えてください。

このプロンプトは誤解を招く出力を招きます。「美しい」は美学に焦点を当てているのに対し、「それが何を意味するか」は AI を発見から最終的な結論にジャンプさせます。因果関係のある誇張されたコメントが続きます。

強力なプロンプト:

あなたの役割: 正直な EDA アシスタント。タスク: (1) 私の質問に合ったグラフの種類を選択し、その理由を書きます。(2) 棒グラフで軸をゼロから開始します。(3) 出力をディスカバリーノート言語で解釈します。決定的/因果関係の主張はなく、「テストする必要があります」言語で仮説を示唆します。(4) サンプルが小さい場合は警告します (n<30)。私自身の環境でチャートを実行して検証します。

違い: 強い意志はチャートの種類を正当化し、誠実さのルールを課し、発見と確認を混同しません。

ミニケース3個

ケース 1 — 離散軸の誇張。アナリストは 2 つの支店の満足度スコア (10 点満点中 7.8 と 8.0) を棒グラフで示しました。 YZ 軸を 7.5 から開始すると、2 番目のブランチは最初のブランチのほぼ 2 倍の高さに表示されます。一方、その差はわずか 2.5% でした。経営陣は誤った印象を持って支店に報酬を与えようとしていた。軸をゼロから始めたとき、違いはほとんど見えませんでした。教訓: 軸の選択だけで認識が変わります。

ケース 2 — 相関関係を信頼し、チャートをスキップします。研究者は 2 つの変数間の r = 0.81 を見て、「強い線形関係」と書きました。彼のコンサルタントが散布図を要求したところ、その関係は実際には 1 つの極端な観察によるものであることがわかり、その点を取り除くと相関関係は 0.12 に低下しました。教訓: 相関カウントはグラフの代わりにはなりません。常に散布図を見てください。

ケース 3 — 発見と確認が混同されています。ある学生は、40 個の変数データセット内のすべてのペアごとの相関関係を調べ、最も高い相関関係 (r=0.52) を選択し、「教育と貯蓄の間に有意な関係が見つかった (p=0.004)」と書きました。ただし、40 の変数には数百のペアがありました。最も高いものを選択したのは、偶然による誤った発見でした。教訓: 発見されたパターンは、同じデータ内で「テストして重要であると宣言」することはできません。別途ご確認が必要となります。

よくある間違い

  • 棒グラフで軸がゼロから開始されていません。それは小さな違いを誇張しています。最も一般的な視覚的な嘘。常にチェックしてください。
  • 相関関係を見てチャートをスキップします。同じ相関関係がまったく異なるパターンから生じます。外れ値の関係に当てはめることができます。まずは散布。
  • 発見で見つかったパターンを同じデータの「証拠」として考慮します。これは P-ハッキングへの入り口です。確認は別途行います。
  • グラフの種類が間違っています。トレンドのバーや分布のパイなどの一致は誤解を招きます。質問に基づいてジャンルを選択してください。
  • サンプルサイズを非表示にします。 n=8 と n=8,000 は、同じグラフ上で同じように見えてはなりません。不確実性を示す必要があります。
ヒント: グラフを公開する前に、「軸を変更したらストーリーは変わるだろうか?」と自問してください。答えが「はい」の場合は、おそらく不正な場所からピボットを開始したと考えられます。

要約すれば

探索的データ分析は、データを収集し、パターンを確認し、仮説を生成するフェーズです。確認ではありません。 AI は記述統計とグラフ コードを迅速に生成しますが、質問に基づいてグラフの種類を選択し、公平性の原則 (ゼロ軸、一貫したスケール、見かけの不確実性) を制御します。相関数を信頼する前に散布図を見てください。発見時に見つけたパターンを同じデータの「証拠」として宣言しないでください。 AIの美しいグラフが正しいグラフであるとは限りません。

アプリケーションタスク

データセット内で少なくとも 3 つの変数を選択します。 AI に要求して、誠実さのルールを強制するプロンプトとともに探索的なグラフ (ヒストグラム、散布図、ボックス化) を生成するコードを実行します。各グラフについて: (1) 質問に対するグラフの種類の適切性、(2) 軸の誠実さ、(3) サンプル サイズの可視性をチェックします。少なくとも 1 つの「発見メモ」を仮説言語で書きます (「…は個別にテストされているようです」)。カウントと散乱の両方との相関を調べ、それらの間に矛盾がある場合は報告します。

チェックリスト

  • [ ] 質問とデータの種類に基づいてグラフの種類を選択しました。
  • [ ] 棒グラフでは、y 軸を 0 から開始します。軸の正直さを確認してみました。
  • [ ] 相関関係を信頼する前に散布図を調べました。
  • [ ] サンプルサイズと不確実性をグラフに反映させました。
  • [ ] 探索中に見つけたパターンを「証拠」ではなく「検証される仮説」として書きました。
  • [ ] 確認には同じデータを使用しないことと、別の手順が必要であることに注意しました。