Unité 7 / 11

Prise en charge des modèles économétriques : régression, causalité et interprétation

Gains :

  • Capacité à lire avec précision le résultat de la régression (coefficient, erreur type, valeur p, R carré) et à évaluer de manière critique l'interprétation de l'intelligence artificielle
  • Capacité à reconnaître les pièges tels que la distinction corrélation-causalité, l'endogénéité, les variables omises et la régression fallacieuse, et à freiner le langage causal excessif de l'intelligence artificielle
  • Capacité à utiliser l'intelligence artificielle pour la configuration du modèle, la rédaction du code et des tests de diagnostic, laissant la responsabilité de la sélection et de l'interprétation du modèle aux humains.

L'économétrie est la discipline qui consiste à tester la théorie économique avec des données, et la régression est son outil de base. "Dans quelle mesure la consommation augmente-t-elle à mesure que le revenu augmente ?", "Quelle est la relation entre l'intérêt et l'investissement ?" Des questions comme celles-ci sont quantifiées par régression. L’IA est à la fois très utile et très dangereuse dans ce domaine : elle écrit le code du modèle et les tests de diagnostic en quelques secondes, mais elle est souvent trop causale et trop précise lors de l’interprétation des résultats. Prononce couramment la phrase « X augmente Y » ; alors que la plupart des régressions ne mesurent qu’une seule relation. L'essentiel de cette unité est le suivant : Utiliser l'IA pour la configuration du modèle, les tests de code et de diagnostic ; mais laissez la responsabilité de la sélection du modèle, du jugement de causalité et de l’interprétation sur l’humain.

Lecture du résultat de la régression

Le résultat d’une régression simple recherche quatre éléments :

  • Coefficient. Une estimation de l'ampleur de la variation de la variable dépendante lorsque la variable explicative augmente d'une unité. Le signe (plus/moins) et la grandeur doivent avoir une signification économique.
  • Erreur type. L'incertitude de l'estimation du coefficient ; S'il est plus petit, l'estimation est plus précise.
  • valeur p. La probabilité que le coefficient apparaisse aussi grand en supposant qu'il est "en réalité nul". Un petit p (< 0,05) est dit « statistiquement significatif » – mais cela n’implique pas de signification économique ou de causalité.
  • R au carré. Quelle part du changement dans la variable dépendante le modèle explique-t-il. Un R au carré élevé ne signifie pas le « modèle correct » ; Il peut également être élevé dans les régressions parasites.
Conseil : Ne confondez pas signification statistique et signification économique. Même un effet très faible, pratiquement insignifiant, peut s'avérer « significatif » (petit p) dans un échantillon important. Premièrement, « La taille de ce coefficient est-elle économiquement importante ? ', puis recherchez la signification.

La corrélation n’est pas la causalité : les pièges classiques

C’est la mise en garde au cœur de l’économétrie. La relation trouvée par la régression n’est souvent pas une relation de causalité. Pièges majeurs :

  • Variable omise. Un troisième facteur qui affecte à la fois X et Y mais qui n'est pas dans le modèle crée une relation fallacieuse entre X et Y. (Exemple : si « capacité » est omis dans la relation entre l'éducation et le revenu, le coefficient sera trompeur.)
  • Causalité inversée (endogénéité). Bien que l’on pense que X affecte Y, peut-être que Y affecte X ou que les deux sont mutuels. (Nombres de policiers et criminalité : la police a-t-elle augmenté parce que la criminalité a augmenté ?)
  • Pseudo régression. Deux séries non stationnaires (tendance) peuvent produire des coefficients R carrés élevés et significatifs même s'il n'y a pas de relation réelle entre elles. Tout simplement parce qu’ils grandissent tous les deux avec le temps.
  • Biais de sélection. Si l’échantillon n’est pas aléatoire, la relation est mesurée de manière asymétrique.

L’affirmation d’une causalité ne peut être établie qu’avec une conception appropriée (méthodes telles que l’expérience contrôlée, l’expérience naturelle, la variable instrumentale, la différence dans la différence) et des hypothèses claires. L’intelligence artificielle passe souvent à côté de cette subtilité.

Attention : Si l'IA dit "cette variable augmente/diminue cela", freinez immédiatement. Problème : Y a-t-il des variables omises ? Une causalité inverse est-elle possible ? Les séries sont-elles stationnaires ? Aucune phrase causale n’entre dans le rapport tant que ces trois questions ne sont pas posées.

Tests diagnostiques

Pour qu'une régression soit fiable, ses hypothèses sont testées : schéma de résidus (termes d'erreur) (autocorrélation), hétéroscédasticité (hétéroscédasticité), multicolinéarité (les variables explicatives sont très similaires les unes aux autres), distribution normale. L'intelligence artificielle écrit le code de ces tests ; mais c'est le travail de l'économiste d'interpréter les résultats et d'ajuster le modèle en conséquence.

trois mini-cases

Cas 1 — Régression fallacieuse. Un chercheur a régressé deux séries de tendances (une dépense nominale, une nominale, une autre quantité) ; Le R au carré était de 0,98, le coefficient était hautement significatif. L’IA « est une relation solide », a-t-il déclaré. Le chercheur a testé la stationnarité : les deux séries étaient non stationnaires. Une fois séparés, la relation a en grande partie disparu. Le R carré élevé était simplement dû au fait qu’ils ont tous deux augmenté avec le temps. Régression fallacieuse détectée.

Cas 2 — Variable omise. Une analyse a révélé que « les dépenses publicitaires augmentent les ventes ». L'économiste a demandé : y a-t-il un effet saisonnier dans le modèle ? Il n’y en avait pas. La publicité et les ventes augmentaient avant les vacances ; Une partie de la relation était la saisonnalité. Lorsque des variables muettes de saison ont été ajoutées, le coefficient de publicité est devenu plus petit. L’allégation causale a été adoucie.

Cas 3 — Significatif mais insignifiant. Dans un vaste ensemble de microdonnées, un coefficient était p<0,001 ; L’IA a « un fort impact », a-t-il déclaré. Mais l'ampleur du coefficient était pratiquement négligeable (un changement important dans le revenu a modifié le résultat d'un millième). L’économiste l’a qualifié à juste titre de « statistiquement significatif mais économiquement insignifiant ». L’importance ne remplace pas l’importance.

Tableau de modération des commentaires

l'intelligence artificielle dit

L'économiste demande

"X augmente Y"

Variable omise ? Causalité inversée ?

"Le R au carré est élevé, le modèle est bon"

Les séries sont-elles stationnaires ? Fausse régression ?

"p<0,05, significatif"

La taille est-elle importante du point de vue économique ?

"Coefficient 0,3"

Son signe et son unité sont-ils compatibles avec la théorie ?

"La relation est forte"

La sélection de l’échantillon est-elle biaisée ?

Quatre modèles copiables

1) Croquis d'installation du modèle :

J'examinerai la question économique suivante : [question]. Variable dépendante : [Y]. Descripteurs de candidats : [X]. Suggérez-moi une configuration de régression initiale appropriée (code statsmodels). Expliquez quelles variables de contrôle sont nécessaires et pourquoi. NE PAS prétendre à la causalité ; Utilisez un langage relationnel.

2) Tests diagnostiques :

Écrivez en code les tests de diagnostic de la régression que j'ai mise en place : autocorrélation, hétéroscédasticité, multicolinéarité, dispersion des résidus et stationnarité (s'il s'agit d'une série temporelle). Écrivez brièvement comment interpréter chaque résultat de test et que faire en cas de problèmes.

3) Contrôle de causalité :

Interprétez ce résultat de régression, mais vérifiez d'abord ces trois écueils : (1) pourrait-il y avoir une variable omise et laquelle, (2) une causalité inverse est-elle possible, (3) les séries sont-elles stationnaires / y a-t-il un risque de régression parasite ? Indiquez clairement si le résultat doit être interprété comme causal ou simplement relationnel.

4) Distinction signification-importance :

Interprétez le coefficient suivant : valeur [x], erreur standard [y], valeur p [z]. Évaluez séparément la signification statistique et la signification économique séparément : l'ampleur de ce coefficient est-elle un effet pratiquement significatif ? Concrètez l’ampleur de l’impact dans un exemple de scénario.

Invite faible/Invite forte

Invite faible :

Faites une régression avec ces variables et interprétez le résultat.

L’intelligence artificielle l’interprète dans un langage causal, sans effectuer de tests de diagnostic ni vérifier la stationnarité ; une régression parasite ou une variable omise est manquée.

Invite puissante :

La variable dépendante est la consommation, le revenu explicatif ; série mensuelle tendance. Testez d’abord la stationnarité ; obtenez la différence si nécessaire. Mettre en place la régression, réaliser des tests de diagnostic (autocorrélation, hétéroscédasticité). Discuter explicitement des risques liés aux variables omises et à la causalité inversée lors de l'interprétation du résultat ; Utilisez un langage relationnel plutôt que causal. Évaluez séparément l’importance et l’importance économique et donnez le code pour chaque étape.

Erreurs courantes

  • Confondre corrélation et causalité. L'erreur la plus courante et la plus coûteuse.
  • Confondre un R carré élevé avec la qualité. Il est également élevé en régressions parasites.
  • Contourner le contrôle de stase. Les séries tendance produisent de fausses relations.
  • Confondre sens et signification. Un petit p ne signifie pas un grand effet.
  • Sauter les tests de diagnostic. L’hypothèse violée annule toute l’inférence.
  • Accepter le langage causal de l’IA tel quel. Le jugement appartient à l'homme.

En résumé

La régression est un outil puissant mais piégé. Lecture correcte du coefficient, de l'erreur standard, de la valeur p et du R au carré ; faire la distinction entre corrélation et causalité ; vérifier les variables omises, la causalité inverse et les pièges de régression fallacieuse ; Il faut faire la distinction entre importance et importance économique. L’IA accélère dans la génération de codes et de diagnostics, mais elle parle de manière trop causale ; Le choix du modèle et le jugement de la causalité appartiennent à l’économiste.

Tâche de candidature

Mettez en place une régression simple avec les données dont vous disposez (par exemple consommation-revenu). Faites réaliser la configuration avec le 1er modèle et les tests de diagnostic avec le 2ème modèle. Vérifiez ensuite la causalité avec le modèle 3, en nommant au moins une variable omise possible et un scénario de causalité inverse. Traduisez une phrase causale de l’interprétation initiale de l’IA en langage relationnel et notez le changement.

liste de contrôle

  • [ ] J'ai lu correctement le coefficient, l'erreur standard, la valeur p et le R au carré.
  • [ ] J'ai vérifié la stationnarité de la série et éliminé le risque de régression parasite.
  • [ ] J'ai nommé la variable omise et les possibilités de causalité inverse.
  • [ ] J'ai effectué des tests de diagnostic et évalué les violations.
  • [ ] J'ai évalué séparément la signification statistique et la signification économique.
  • [ ] J'ai intégré le langage causal de l'intelligence artificielle dans le langage relationnel.
  • [ ] J'ai soutenu que le choix du modèle et le jugement de causalité m'appartenaient.