ユニット 3 / 11

データ クレンジング、変換、探索的分析 (Python/pandas サポート付き)

利益:

  • 生の経済データ (観測値の欠落、単位の混乱、周波数の不一致) をクリーンアップし、人工知能の助けを借りて分析できるようにする機能
  • 実質名目換算、指数化、成長率、季節調整などの標準的な経済変換をコードとして人工知能に出力し、手動で検証する機能
  • 探索的データ分析 (要約統計量、分布、外れ値、相関関係) を通じてデータを認識し、人工知能の要約を批判的に読み取る能力

経済データがすぐに分析できる状態になることはほとんどありません。 TURKSTAT からダウンロードした表では、いくつかの月が欠落しており、1 つの列は千括弧付きのテキストとして表示され、為替レートは「1.234,56」のようなトルコ語形式で、1 つの系列は月次、もう 1 つは四半期です。経済学者の時間のほとんどは分析ではなく、データを分析できるようにすることに費やされます。ここで AI が真の低リスクのアクセラレーターとなります。AI はクリーンアップ手順を提案し、パンダ (Python のデータ処理ライブラリ) を書き込み、標準的な経済変革を成文化します。しかし、このユニットには不変のルールもあります。それは、人工知能によって書き込まれたすべての変換を読み取り、少なくとも 1 つの観測で手動で検証することです。実質名目サイクルが間違った基盤にある場合、分析全体は静かに衰退します。

掃除:どのような問題があり、どのように解決すればよいでしょうか?

経済データとそのロジックにおける最も一般的な問題:

  • 不完全な観察。 1 か月または四半期が空です。解決策はコンテキストによって異なります。実際に存在しない場合は空白のままにします。技術的なギャップがある場合は、慎重に補間が行われますが、製造の境界線は細いです。
  • 単位と形式の混同。テキスト「12.345.6」は数値に変換する必要があります。 million/billion は一貫性を持つ必要があります。
  • 周波数の不一致。月次シリーズと四半期シリーズを組み合わせるには、一方が集計されます (月次から四半期)。それが平均、合計、期末のいずれであるかは、指標の性質 (ストック/フローの区別) によって決まります。
  • 外れ値 (極端な) 値。観察が大きく逸脱した場合、それは実際の出来事(危機、価格高騰)なのか、それともデータエラーなのか?削除する前にそれを理解してください。
  • 日付の調整。異なるシリーズの日付形式と期間定義が同期されます。
注意: 欠落したデータを埋めるのは無害であるように見えますが、これは経済的な決定です。危機の月を「隣接する月の平均」で埋めるということは、その危機を分析から削除することを意味します。埋める前に、「なぜこのギャップが存在するのか?」と考えてください。質問に答えてください。

標準的な経済変革

経済学者の日常レパートリーにおける変換とその定義:

  • 名目→実質。価格への影響の調整: 実質価値 = 名目価値 / 物価指数 × 100。デフレーター (調整指数) の基準年が結果の基準を決定します。
  • インデックス作成。選択した期間 = 100 になるように系列を再スケーリングします。サイズの異なるシリーズを比較するのに便利です。
  • 成長率。年間: (今期の同期間 / 昨年 − 1) × 100。定期レートと年率は別のものです。混乱するのはよくある間違いです。
  • 季節補正。定期的な季節の影響(夏の観光、休暇)を浄化します。生のシリーズと季節調整されたシリーズでは、異なるストーリーが語られます。
  • 移動平均。ノイズを除去し、傾向を可視化します。
  • 対数と微分。成長のダイナミクスと定常性を調べる(時系列単位で深化します)。
ヒント: 変換するたびに、「ユニットとベースはどうなりましたか?」と尋ねられます。聞く。実数列の基底はデフレーターの基底です。インデックス付きシリーズのベースは、選択した期間です。これを書き留めておくと、将来の間違いを防ぐことができます。

探索的データ分析 (EDA)

データをモデルに入力する前にデータを認識する必要があります。探索的データ分析 (EDA) には、要約統計量 (平均、中央値、標準偏差、最小値と最大値)、分布の形状、時間の経過、外れ値、系列間の相関関係が含まれます。 AI はこれらのステップのコードを迅速に生成します。あなたの仕事は、経済的な観点から出力を読み取ることです。「この平均は妥当ですか? この相関関係は偶然ですか? それとも既知の関係ですか?」

注意: ここでの相関関係は特定の手段にすぎず、因果関係の証明ではありません。 2 つのシリーズが同時に進行するという事実 (例: アイスクリームの販売と溺死、どちらも夏が原因) は、必ずしも一方が他方につながることを示すわけではありません。単元 7 では、この違いをさらに深めていきます。

ミニケース3個

ケース 1 — デフレーター ベースが正しくありません。アナリストは人工知能に賃金シリーズを実現するコードを書かせた。コードは機能し、結果は妥当であるように見えましたが、アナリストが CALCULATE ステップで 2020 年を手動で計算したため、機能しませんでした。問題: 人工知能は 2003 年 = 100 を基準とするデフレーターを使用し、2015 年の価格を使用した賃金シリーズを要求しました。基地は対立していた。コードは 1 行の修正で修復され、一連のコード全体が適切な位置に収まりました。

ケース 2 — サイレントボリュームエラー。ある機関は輸出データを千ドル単位、輸入データを百万ドル単位に削減していました。人工知能が「外国貿易収支」からこの2つを取り除くと、結果は不条理な赤字となった。 EDA の最小-最大ビューでエラーが明らかになりました。2 つの系列の大きさのオーダーが 1000 倍異なりました。単位が均等化されると、バランスは正しくなりました。

ケース 3 — 外れ値を削除しない。シリーズの1か月というのは異例の低さだった。 AIは「外れ値、掃除しましょう」と提案した。アナリストが調査したところ、その月は自然災害により生産が実際に停止していました。値は実数でした。削除すると歴史が歪曲されてしまいます。削除の代わりに脚注が付けられました。 AI の「明確な」推奨は盲目的に従ったわけではありません。

変換検証テーブル

変換

フォーミュラエッセンス

手動チェックポイント

実現

名目 / 物価指数 × 100

デフレーターベース=成果ベース?

年間成長率

(t / t-12month − 1)×100

紙の上で期間を計算する

インデックス作成

シリーズ/基準期間 × 100

基準期間値は100ですか?

月刊→季刊

フロー:回収・在庫:期末

正しい回収方法は?

移動平均

過去 n 期間の平均

窓の長さは合っていますか?

コピー可能な 4 つのテンプレート

1) 清掃計画:

この生データがあります: [列とサンプル行]。分析の準備として、欠損値、単位/形式の問題、日付の調整、頻度の調整、外れ値の可能性などのクリーニング計画を立てます。各ステップがなぜ必要なのかを一文で説明してください。まだコードは書かないでください。まず計画を確認させてください。

2) パンダのクリーンアップ コード:

私が承認した計画に従ってパンダのコードを書きます。各ステップでの動作をコメント行でコードに示します。変換後の行数と欠損値が出力されます。観察を黙って消去しないでください。削除した行をすべて報告します。

3) 実現 (検証可能):

この名目系列を【価格指数】で実現します。デフレーターを使用する場合は、その基準年を明確に記入してください。結果の系列の基数を指定します。アカウントを 1 つの期間にわたって段階的に表示して、手動で確認できるようにします。

4) 探索的分析の概要:

次のクリーンアップされたデータに対する探索的分析コードを作成します: 要約統計量、時系列プロット、外れ値スキャン、および相関行列。結果を解釈するときは、見つかった相関関係が因果関係にないことを明確にし、私にとって顕著な点を 3 つ挙げてください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

このデータをクリアしてください。

AI は何を掃除すべきか分からず、思い込みに基づいて動作します。観測値を削除したり、単位を変更したりしても、気付かないうちに実行できます。

強力なプロンプト:

この毎月の外国貿易データでは、輸出は「千ドル」単位、輸入は「百万ドル」単位で表示されます。 2 つの値を「100 万 USD」単位で等しくし、欠落している月にマークを付けますが、埋めずに、日付を月末に合わせます。各ステップで影響を受ける行数を出力します。サイレントに行を削除しません。次に、手動で確認できる方法で 1 か月の残高を表示します。

よくある間違い

  • 変換コードを読み込まずに実行します。間違った塩基/単位は、分析全体を静かに破壊します。
  • 何も考えずに不足しているデータを埋めること。平均値で危機/災害期間を消去します。
  • 外れ値を自動的に破棄します。実際のイベントをデータエラーと間違える。
  • 季節的成長と年間成長が紛らわしい。二つはサイズが違います。
  • 周波数の組み合わせが間違っている。在庫系列を集めてフローとして処理します。
  • EDA の相関関係を因果関係と誤解します。認識ツールを証拠と間違える。

要約すれば

データのクリーニングと変換は、目に見えないものの、経済分析の 80% を決定づけます。人工知能はこの機械的な作業を劇的にスピードアップします。ただし、すべてのクリーンアップ ステップとすべての変換を読み、少なくとも 1 つの観察結果を手動で検証するのはあなた次第です。デフレーターのベース、単位、周波数、外れ値の決定は経済的な決定であり、やみくもに人工知能に任せることはできません。探索的分析ではデータが導入されますが、そこには相関関係があり、因果関係はありません。

アプリケーションタスク

実際の生のシリーズ (月次 CPI や名目賃金/収入シリーズなど) をダウンロードします。 1 番目のテンプレートで清掃計画を作成し、2 番目のテンプレートでコードを生成し、3 番目のテンプレートでシリーズを実現します。次に、紙上の単一期間の実際の値を計算し、それを人工知能の出力と比較します。不一致が見つかった場合は、そのソース (ベース/ユニット) を診断して修正し、進行状況を記録します。

チェックリスト

  • [ ] コードを作成する前に、クリーンアップ計画を確認して承認しました。
  • [ ] 人工知能によってすべての行が削除/変更されたと報告されました。サイレント削除はありません。
  • [ ] 欠落しているデータを入力するときに、「なぜ空なのか?」と疑問に思うかもしれません。私は質問に答えました。
  • [ ] 外れ値が実際のイベントなのかデータエラーなのかを調査しました。
  • [ ] 実現にあたり、デフレーターベースとアウトカムベースが一致することを確認しました。
  • [ ] 少なくとも 1 つの期間の換算を手動で再計算しました。
  • [ ] 私は EDA における相関関係を因果関係として提示しませんでした。