Unité 3 / 11

Nettoyage, transformation et analyse exploratoire des données (avec support Python/pandas)

Gains :

  • Capacité à nettoyer les données économiques brutes (observations manquantes, confusion des unités, inadéquation de fréquence) et à les préparer à l'analyse à l'aide de l'intelligence artificielle
  • Possibilité d'imprimer des transformations économiques standard telles que la conversion réelle-nominale, l'indexation, le taux de croissance, la désaisonnalisation sous forme de code dans l'intelligence artificielle et de les vérifier manuellement
  • Capacité à reconnaître les données grâce à une analyse exploratoire des données (statistiques récapitulatives, distribution, valeurs aberrantes, corrélation) et à lire de manière critique des résumés d'intelligence artificielle

Les données économiques sont rarement prêtes à être analysées. Dans un tableau que vous avez téléchargé depuis TURKSTAT, certains mois manquent, une colonne est présentée sous forme de texte avec des milliers de parenthèses, le taux de change est au format turc comme "1.234,56", une série est mensuelle et l'autre trimestrielle. La majeure partie du temps de l'économiste n'est pas consacrée à l'analyse, mais à la préparation des données pour l'analyse. C'est là que l'IA constitue un véritable accélérateur à faible risque : elle suggère des étapes de nettoyage, écrit pandas (la bibliothèque de traitement de données de Python), codifie les transformations économiques standards. Mais cette unité a aussi une règle immuable : vous lisez chaque transformation écrite par l’intelligence artificielle et la vérifiez manuellement dans au moins une observation. Si le cycle réel-nominal est sur un mauvais pied, l’ensemble de l’analyse se désintègre progressivement.

Nettoyage : quels problèmes, comment les résoudre ?

Les problèmes les plus courants dans les données économiques et leur logique :

  • Observation incomplète. Un mois/trimestre est vide. La solution dépend du contexte : si elle n’existe pas réellement, elle reste vide ; S'il existe un écart technique, une interpolation minutieuse est effectuée, mais la frontière entre la fabrication est mince.
  • Confusion des unités et des formats. Le texte « 12.345.6 » doit être converti en nombre ; million/milliard devrait devenir cohérent.
  • Inadéquation de fréquence. Pour combiner une série mensuelle et une série trimestrielle, on est agrégée (mensuelle à trimestrielle) — qu'elle soit moyenne, totale ou de fin de période dépend de la nature de l'indicateur (distinction stock/flux).
  • Valeurs aberrantes (extrêmes). Si une observation s’écarte fortement : s’agit-il d’un événement réel (crise, hausse des prix), ou d’une erreur de données ? Il est entendu avant la suppression.
  • Alignement des dates. Les formats de date et les définitions de période des différentes séries sont synchronisés.
Attention : Remplir les données manquantes semble innocent, mais c'est une décision économique. Remplir un mois de crise avec la « moyenne des mois voisins » revient à supprimer cette crise de l'analyse. Avant de remplir, demandez « pourquoi cet écart existe-t-il ? » Répondez à la question.

Transformations économiques standards

Les transformations et leurs définitions dans le répertoire quotidien d'un économiste :

  • Nominal → Réel. Ajustement de l'impact sur les prix : valeur réelle = valeur nominale / indice des prix × 100. L'année de base du déflateur (indice d'ajustement) détermine la base du résultat.
  • Indexage. Redimensionner une série pour qu'une période sélectionnée = 100 ; C’est utile pour comparer des séries de tailles différentes.
  • Taux de croissance. Annuel : (même période cette période / l'année dernière − 1) × 100. Les taux périodiques et annualisés sont des choses différentes ; La confusion est une erreur courante.
  • Correction saisonnière. Purifiant les effets saisonniers réguliers (tourisme estival, vacances) ; Les séries brutes et les séries désaisonnalisées racontent des histoires différentes.
  • Moyenne mobile. Lisser le bruit et rendre visible la tendance.
  • Logarithmes et différenciation. Examiner la dynamique de croissance et la stationnarité (sera approfondi dans l'unité de séries chronologiques).
Astuce : à chaque conversion, il vous sera demandé « qu'est-il arrivé à l'unité et à la base ? » demander. La base de la série réelle est la base du déflateur ; La base des séries indexées est la période que vous choisissez. Garder cela par écrit évite de futures erreurs.

Analyse exploratoire des données (EDA)

Il est nécessaire de reconnaître les données avant de les saisir dans le modèle. L'analyse exploratoire des données (EDA) comprend : des statistiques récapitulatives (moyenne, médiane, écart type, min-max), la forme de la distribution, l'évolution dans le temps, les valeurs aberrantes et la corrélation entre les séries. L'IA génère rapidement le code de ces étapes ; Votre travail consiste à lire les résultats avec un œil économique : « Cette moyenne est-elle raisonnable ? Cette corrélation est-elle une coïncidence ou une relation connue ?

Attention : la corrélation n'est ici qu'un moyen d'identification, pas une preuve de causalité. Le fait que deux séries évoluent ensemble (par exemple, les ventes de glaces et les noyades, toutes deux déclenchées par l’été) n’indique pas nécessairement que l’une mène à l’autre. Nous approfondirons cette distinction dans l’unité 7.

trois mini-cases

Cas 1 — Base de déflateur incorrecte. Un analyste a demandé à l'intelligence artificielle d'écrire du code pour réaliser la série de salaires. Le code a fonctionné, le résultat semblait raisonnable, mais l'analyste a calculé manuellement 2020 à l'étape CALCULER et cela n'a pas fonctionné. Problème : l’intelligence artificielle a utilisé le déflateur avec une base de 2003=100 et a demandé la série des salaires avec les prix de 2015 ; Les bases étaient contradictoires. Le code a été réparé avec une seule ligne, la série entière s'est mise en place.

Cas 2 — Erreur de volume silencieux. Une institution avait réduit les données d'exportation en milliers de dollars et les importations en millions de dollars. Lorsque l’intelligence artificielle a supprimé les deux pour la « balance du commerce extérieur », le résultat a été un déficit absurde. La vue min-max dans EDA a révélé l'erreur : l'ordre de grandeur des deux séries différait d'un facteur 1000. Une fois l'unité égalisée, l'équilibre était correct.

Cas 3 — Ne pas supprimer la valeur aberrante. Un mois dans une série était extraordinairement bas. AI a suggéré "valeur aberrante, nettoyons-la". L'analyste a enquêté : la production avait en fait été arrêtée à cause d'une catastrophe naturelle ce mois-là. La valeur était réelle ; Le supprimer fausserait l’histoire. Au lieu de le supprimer, il a été noté en bas de page. La recommandation « claire » de l’IA n’a pas été suivie aveuglément.

Tableau de validation des conversions

Conversion

essence de formule

point de contrôle manuel

réalisation

nominal / indice des prix × 100

Base du déflateur = base de résultats ?

croissance annuelle

(t / t-12mois − 1)×100

Calculer une période sur papier

indexation

série/période de base × 100

La période de base vaut-elle 100 ?

Mensuel → trimestriel

flux : collecte / stock : fin de période

Bonne méthode de collecte ?

moyenne mobile

moyenne des n dernières périodes

La longueur de la fenêtre est-elle correcte ?

Quatre modèles copiables

1) Plan de nettoyage :

J'ai ces données brutes : [colonnes et exemples de lignes]. Élaborez un plan de nettoyage pour préparer l’analyse : valeur manquante, problème d’unité/format, alignement des dates, alignement des fréquences, valeurs aberrantes possibles. Expliquez en une phrase pourquoi chaque étape est nécessaire. N'écrivez pas encore de code ; laissez-moi d'abord confirmer le plan.

2) code de nettoyage des pandas :

Écrivez le code des pandas selon le plan que j'ai approuvé. Laissez le code indiquer ce qu'il fait à chaque étape avec une ligne de commentaire ; Il imprime le nombre de lignes et les valeurs manquantes après la conversion. N’effacez aucune observation en silence ; Signalez chaque ligne que vous supprimez.

3) Réalisation (vérifiable) :

Réalisez cette série nominale avec [indice des prix]. Écrivez clairement l'année de base du déflateur lorsque vous l'utilisez ; Spécifiez quelle est la base de la série résultante. Montrez-moi le compte étape par étape pour une seule période afin que je puisse le vérifier manuellement.

4) Résumé de l’analyse exploratoire :

Écrivez un code d'analyse exploratoire pour les données nettoyées suivantes : statistiques récapitulatives, tracé de séries chronologiques, analyse des valeurs aberrantes et matrice de corrélation. Lors de l’interprétation des résultats, indiquez clairement que les corrélations que vous trouvez ne sont PAS CAUSALES et énumérez 3 points qui me ressortent.

Invite faible/Invite forte

Invite faible :

Effacez ces données.

L’IA agit avec des hypothèses sans savoir quoi nettoyer ; Vous pouvez supprimer des observations, changer d'unités, vous ne le remarquerez pas.

Invite puissante :

Dans ces données mensuelles du commerce extérieur, les exportations sont en "milliers USD" et les importations en "millions USD". Faites en sorte que les deux soient égaux en "millions USD", marquez les mois manquants mais NE REMPLISSEZ PAS, alignez les dates sur la fin du mois. Imprimez combien de lignes sont affectées à chaque étape ; ne supprimez silencieusement aucune ligne. Affichez ensuite le solde d'un seul mois de manière à ce que je puisse le vérifier manuellement.

Erreurs courantes

  • Exécuter le code de conversion sans le lire. Une mauvaise base/unité corrompt silencieusement toute l’analyse.
  • Remplir les données manquantes sans réfléchir. Effacer la période de crise/catastrophe avec la moyenne.
  • Supprimez automatiquement les valeurs aberrantes. Confondre un événement réel avec une erreur de données.
  • Confondre croissance saisonnière et annuelle. Les deux sont de tailles différentes.
  • Combinaison incorrecte des fréquences. Collecter les séries de stocks et les traiter comme un flux.
  • Confondre la corrélation dans l'EDA avec la causalité. Confondre l'outil de reconnaissance avec une preuve.

En résumé

Le nettoyage et la transformation des données représentent 80 % invisibles mais décisifs de l’analyse économique. L’intelligence artificielle accélère considérablement ce travail mécanique ; mais c'est à vous de lire chaque étape de nettoyage et chaque transformation et de vérifier manuellement au moins une observation. Les décisions relatives à la base, à l’unité, à la fréquence et aux valeurs aberrantes du déflateur sont des décisions économiques et ne peuvent pas être aveuglément laissées à l’intelligence artificielle. L'analyse exploratoire introduit des données, mais il n'y a pas de corrélation, mais pas de causalité.

Tâche de candidature

Téléchargez une série brute réelle (par exemple, l'IPC mensuel et une série sur les salaires/revenus nominaux). Créez un plan de nettoyage avec le 1er modèle, faites générer le code avec le 2ème modèle, et réalisez la série avec le 3ème modèle. Calculez ensuite la valeur réelle d’une seule période sur papier et comparez-la avec les résultats de l’intelligence artificielle. Si vous trouvez une incompatibilité, diagnostiquez et corrigez sa source (base/unité) et notez la progression.

liste de contrôle

  • [ ] J'ai examiné et approuvé le plan de nettoyage avant la rédaction du code.
  • [ ] J'ai fait supprimer/modifier chaque ligne par l'intelligence artificielle ; Pas de suppression silencieuse.
  • [ ] Lorsque vous remplissez des données manquantes, vous pouvez demander « pourquoi est-ce vide ? » J'ai répondu à la question.
  • [ ] J'ai cherché à savoir si la valeur aberrante était un événement réel ou une erreur de données.
  • [ ] Dans la réalisation, j'ai vérifié que la base déflateur et la base résultat correspondent.
  • [ ] J'ai recalculé manuellement la conversion d'au moins une période.
  • [ ] Je n'ai pas présenté de corrélations dans l'EDA comme lien de causalité.