Unité 2 / 11

Collecte de données économiques et vérification des sources : TURKSTAT, EVDS, FMI, Banque mondiale, FRED

Gains :

  • Capacité à comparer les principales sources de données économiques (TURKSTAT, CBRT EVDS, FMI WEO, Banque mondiale, Eurostat, FRED) en fonction de l'objectif, de la portée, de la fréquence de mise à jour et de la fiabilité et à choisir la bonne source
  • Capacité à utiliser l'intelligence artificielle pour trouver des sources de données, faire correspondre le code de série/description et générer du code de téléchargement, et confirmer chaque résultat avec la source officielle.
  • Capacité à voir comment les différences de version (révision), d'année de base, d'unité et de définition perturbent l'analyse et prendre l'habitude de vérifier les métadonnées

Toute analyse économique commence par des données, et la qualité de l’analyse ne peut jamais dépasser la qualité des données. Le principe « garbage in, garbage out » fonctionne inexorablement en économie : même le modèle le plus élégant, basé sur une mauvaise base, une mauvaise définition ou une mauvaise période, est erroné. Dans cette unité, nous utiliserons l'intelligence artificielle pour trouver les bonnes données, faire correspondre les codes de série et écrire le code de téléchargement ; Mais une règle d’or ne changera pas : le chiffre provient de la source primaire officielle, et non de l’intelligence artificielle. L'IA peut vous montrer le chemin vers la source ; vous obtenez les données elles-mêmes à partir de cette source.

Faisons connaissance avec les principales sources

La boussole d'un économiste comprend les ressources suivantes. L’objectif, la portée et le rythme de mise à jour de chacun sont différents.

TURKSTAT (Institut turc de statistique). Autorité statistique officielle de Turquie. Inflation (CPI/PPI), PIB, population active, commerce extérieur, production industrielle, population. Il s'agit de la principale source de chiffres spécifiques à la Turquie.

CBRT EVDS (système de distribution électronique de données). Portail de données de la Banque centrale. Taux de change, intérêts, masse monétaire, balance des paiements, balance courante, réserves, enquêtes sur les attentes. Le premier arrêt pour les données financières et monétaires.

FMI (Fonds monétaire international). En particulier la base de données WEO (World Economic Outlook) : comparaison internationale du PIB, de l'inflation, de la dette, de la balance courante et des projections. Idéal pour une comparaison internationale ; Mais les projections sont des prédictions et non des réalisations.

Banque mondiale (Banque mondiale – WDI). Indicateurs de développement dans le monde : indicateurs de développement, de pauvreté, d'éducation, de santé et d'infrastructure ; de longues séries historiques et des comparaisons entre pays.

Eurostat. Office statistique de l'Union européenne; Données harmonisées (comparables) pour les pays de l’UE. Des séries telles que l’IPCH (inflation harmonisée) sont utilisées dans l’analyse comparative de l’UE.

FRED (Données économiques de la Réserve fédérale). Série massive de la Fed de Saint-Louis ; Offre un accès rapide et programmable (API) aux données macrofinancières américaines et mondiales.

OCDE. Indicateurs comparatifs, indicateurs avancés, séries sur la productivité et le bien-être pour les économies développées.

Astuce : La réponse à la question « source correcte » dépend du but recherché. TURKSTAT pour l'inflation officielle de la Turquie ; Le FMI et la Banque mondiale vont comparer la Turquie avec 30 pays ; FRED pour les intérêts américains. Prendre le même indicateur auprès d’une mauvaise source est une erreur silencieuse.

Sources d'erreurs silencieuses : révision, année de base, unité, description

Les erreurs les plus dangereuses dans les données économiques sont silencieuses. Apprenez à en connaître quatre :

  • Révision (version). De nombreux indicateurs (PIB, balance des paiements) sont révisés des mois après leur première annonce. Le chiffre « provisoire » aujourd’hui, le chiffre « définitif » après trois mois seront différents. Sachez quel millésime (version) vous utilisez.
  • Année de base. Les indices sont établis sur la base d'une année de base (=100). Il est erroné de comparer directement deux séries ayant des années de base différentes.
  • Unité. Millions ou milliards, TL ou dollars, prix courant ou fixe ? La confusion des unités est l’erreur d’analyse la plus courante.
  • Définition/portée. Quelle est la définition du « chômage » ? Quels éléments l’« inflation sous-jacente » exclut-elle ? Deux séries portant le même nom peuvent mesurer des choses différentes.
Attention : Si les chiffres d'un même indicateur provenant de deux sources ne correspondent pas, votre première hypothèse ne doit pas être « quelqu'un ment » mais « il y a une différence de définition/base/portée/révision ». Alignez d'abord les métadonnées (citation des données).

Étape par étape : collecte de données basée sur l'IA

  1. Clarifiez le besoin. Quel indicateur, quel pays/province, quelle période, quelle fréquence (mensuelle/trimestrielle/annuelle), quelle définition ?
  2. Sélectionnez la source. Expliquez le but à l'IA et suggérez la source principale appropriée et le nom complet de la série.
  3. Validez les métadonnées. Confirmez l'unité, l'année de base, la description et la date de mise à jour de la série sélectionnée sur la page officielle.
  4. Générez le code de téléchargement. Pour ceux qui disposent d'une API, comme FRED/Banque mondiale, écrivez du code Python dans l'IA ; Supprimez les étapes de téléchargement pour TURKSTAT/EVDS.
  5. Vérifiez d’abord. Une fois les données arrivées, vérifiez le nombre de lignes/colonnes, les valeurs manquantes, les valeurs aberrantes et la plage de dates.
  6. Confirmation de la source. Comparez au moins quelques observations avec la publication officielle ; Est-ce que ça correspond exactement ?

trois mini-cases

Cas 1 — Piège de l’année de base. Un analyste a obtenu un indice de production industrielle à partir de deux études distinctes ; l’un était basé sur 2015=100 et l’autre était basé sur 2021=100. "Combinez-les", a-t-il dit à l'intelligence artificielle. S'il sautait la vérification des métadonnées, il mettrait les indices côte à côte et verrait un faux saut. Il a saisi la différence de base lors de l'étape de contrôle, a transformé les deux en une base commune, puis les a combinés. Le faux rebond a disparu.

Cas 2 — Sortie API fabriquée. Un chercheur a dit à l'intelligence artificielle : « Tirez le PIB par habitant de la Turquie de la Banque mondiale » ; L'IA a renvoyé à la fois le code et un tableau de nombres comme « exemple de sortie ». Le chercheur n’a pas utilisé le tableau ; je viens d'exécuter le code et de récupérer les données de la véritable API. Puis il s’est rendu compte que les chiffres écrits par l’intelligence artificielle comme « exemples » étaient en réalité inférieurs de 10 à 15 %. Outil de code, pas de numéro ; C'était le bon comportement.

Cas 3 — Différence de révision. Dans une note publiée il y a six mois, une institution écrivait que la croissance trimestrielle était de 4,0 pour cent ; Dans les données actuelles du TÜİK, le même trimestre a été révisé à 3,5 pour cent. Dans le nouveau rapport, l'analyste indique dans une note de bas de page quelle version il a utilisée et explique la différence entre les deux chiffres avec une révision. La transparence a préservé la crédibilité.

Tableau de sélection des sources

Objectif

Source primaire appropriée

Attention

Inflation turque (CPI/PPI)

TURKSTAT

Année de base, distinction principale/titre

Taux de change, intérêts, solde courant, réserves

EVDS CBRT

Révision, définition de série

Comparaison PIB/inflation entre pays

PEM du FMI

Projection ≠ réalisation

Développement/série historique longue

IDM de la Banque mondiale

Couverture, années manquantes

Indicateurs harmonisés de l’UE

Eurostat

Définition de l'IPCH

Macrofinance américaine/mondiale, API

FRÉD

Statut de désaisonnalisation

Quatre modèles copiables

1) Correspondance source et série :

J'ai besoin de l'indicateur suivant : [indicateur, pays/province, période, fréquence, description]. Recommandez la source officielle principale la plus appropriée et le nom complet de la série pour cela. Énumérez les points que je dois vérifier concernant l'unité, l'année de base et la description de la série. Ne donnez pas de chiffres ; Dites-moi simplement où et comment l'acheter.

2) Code de téléchargement FRED/Banque mondiale :

Écrivez un code en Python avec l'API [FRED/World Bank] qui télécharge la série suivante : [code/nom de la série], [plage de dates]. Le code prend les données dans pandasDataFrame, imprime les 5 premières/dernières lignes et le nombre de valeurs manquantes. Ne me donnez pas d'exemple/de chiffre inventé ; donnez simplement du code fonctionnel.

3) Liste de validation des métadonnées :

J'utiliserai la série suivante : [série]. Créez une liste de contrôle des métadonnées que vous devez vérifier avant utilisation : volume, année de base, statut de désaisonnalisation, définition/portée, date de mise à jour, statut de révision. Pour chaque élément, écrivez « quoi et où confirmer » en une phrase.

4) Deux diagnostics d'inadéquation des ressources :

J'ai obtenu le même indicateur de deux sources et les chiffres sont différents : Source A : [valeur, empreinte]. Source B : [valeur, empreinte]. Énumérez les raisons innocentes possibles de cette différence (définition, base, champ d'application, désaisonnalisation, révision, devise) et dites-moi comment vérifier pour chacune. Ne dites pas « on a tort » ; Aidez-moi d’abord à expliquer l’écart.

Invite faible/Invite forte

Invite faible :

Donnez-moi les données de croissance de Türkiye pour les 10 dernières années.

L'IA diffuse une image de sa mémoire, peut-être ancienne et partiellement fabriquée ; Il n'y a ni source ni empreinte.

Invite puissante :

J'utiliserai la croissance annuelle du PIB réel de la Turquie pour la période 2014-2023. Dites-moi la source principale de ceci (TURKSTAT) et le nom complet de la série ; dites-moi si la série est à prix fixe et où chercher pour vérifier l'année de base. Donnez également les étapes/codes pour télécharger ces données. Ne produisez pas les chiffres eux-mêmes.

Erreurs courantes

  • Confondre le tableau « exemple de sortie » de l'intelligence artificielle avec des données réelles. Ces chiffres peuvent être fabriqués ; utilisez simplement le code/ligne directrice.
  • Comparer deux séries sans aligner les métadonnées. La différence de base/unité/définition produit des résultats fallacieux.
  • Confondre une projection avec la réalité. Le chiffre de l'année prochaine dans les PEM du FMI est une estimation.
  • Ignorer la révision. Je ne précise pas quelle version vous utilisez.
  • Inadéquation de fréquence. Combinant une série mensuelle avec une série trimestrielle sans correction.
  • Ne pas citer la source dans les notes de bas de page. Un chiffre qui n’est pas traçable est un chiffre intenable.

En résumé

Le pouvoir de l’analyse est le pouvoir des données. Utilisez l'IA pour trouver la bonne source, faire correspondre la série et écrire un code de téléchargement ; mais obtenez toujours le chiffre de la principale source officielle (TURKSTAT, EVDS, FMI, Banque mondiale, Eurostat, FRED). Neutralisez les sources d’erreurs silencieuses telles que la révision, l’année de base, le volume et la description en alignant les métadonnées. Si deux sources sont en conflit, comparez d’abord l’attribution.

Tâche de candidature

Choisissez un indicateur que vous utilisez fréquemment dans votre entreprise. Demandez à l'IA d'extraire la liste de contrôle des sources et des métadonnées avec les modèles 1 et 3 ci-dessus. Recherchez ensuite le même indicateur provenant de deux sources différentes (par exemple TURKSTAT et Banque mondiale) et comparez les chiffres ; S'il y a une différence, diagnostiquez la cause avec le modèle 4 et notez votre découverte en trois phrases.

liste de contrôle

  • [ ] J'ai choisi la source principale adaptée à mon objectif (j'ai fait la distinction entre la comparaison officielle/internationale de la Turquie).
  • [ ] J'ai vérifié l'unité, l'année de base, la description et la date de mise à jour de la série depuis la page officielle.
  • [ ] J'ai utilisé les données que j'ai extraites de la source réelle, et non les « exemples de chiffres » fournis par l'intelligence artificielle.
  • [ ] J'ai comparé au moins quelques observations textuellement avec la publication officielle.
  • [ ] J'ai vérifié l'état de la révision/version et noté la version que j'utilisais.
  • [ ] J'ai expliqué les deux conflits de sources en alignant les métadonnées.
  • [ ] J'ai fait en sorte que la source de chaque chiffre que j'ai utilisé soit traçable avec une note de bas de page.