Unité 1 / 11

Intelligence artificielle en économétrie et statistiques : rôles, limites, authentification et confidentialité

Gains :

  • Être capable de distinguer où dans le flux de travail empirique (nettoyage des données, code, visualisation, interprétation des projets) l'intelligence artificielle permet de gagner du temps réel et où les décisions telles que la sélection du modèle, l'affirmation de la causalité et la décision de publication sont laissées à l'expert, en fonction du niveau de risque de la tâche.
  • Capacité à appliquer une discipline qui vérifie chaque sortie de l'intelligence artificielle (numéro, coefficient, code, commentaire) à travers les étapes de recalcul, de liaison à la source et de filtrage statistique.
  • Capacité à traiter en toute sécurité des microdonnées et des ensembles de données confidentielles/sous licence dans le cadre du KVKK/GDPR et des accords d'utilisation des données et acquérir l'habitude de choisir les outils appropriés.

Les mêmes questions reviennent chaque jour sur le bureau d'un économètre ou d'un statisticien appliqué : cet ensemble de données est-il fiable ? Que faire de ces valeurs manquantes ? Que dit réellement le coefficient de cette régression ? Cette relation est-elle causale ou simplement corrélationnelle ? Étant donné que cette valeur p est significative, puis-je l’écrire dans l’article ou la note d’orientation ? Certaines de ces questions sont répétitives, gourmandes en code et prennent du temps : nettoyer les données, tracer le même graphique dix fois, déboguer le code R ou Python, enchaîner les résultats dans un tableau. D’autres déterminent directement la validité d’une conclusion, l’honnêteté d’une publication ou l’exactitude d’une décision politique.

L'intelligence artificielle (l'IA en bref, l'IA - des systèmes informatiques capables de produire du texte et du code comme les humains, de reconnaître des modèles, de résumer des données et d'écrire des commentaires ; les formes les plus utilisées aujourd'hui sont les grands modèles de langage, c'est-à-dire les systèmes qui s'entraînent sur un texte volumineux et construisent des phrases en prédisant le mot suivant) se trouve en plein milieu de ce tableau. Lorsqu'il est utilisé correctement, il réduit les heures de code de nettoyage des données à quelques minutes, vous rappelle la syntaxe d'un test statistique complexe ou rédige l'interprétation d'un coefficient. Lorsqu'il est utilisé de manière incorrecte, il présente un nombre apparemment sûr mais complètement fabriqué, une fausse signification ou une relation non causale comme une « découverte ».

Cette première unité n'est pas une introduction au logiciel. Son objectif est de clarifier où placer l’IA dans votre flux de travail empirique et où ne jamais la mettre. L'économétrie est à la fois un domaine « critique en matière de méthode » et indirectement « critique en matière de décision » : le coefficient d'un modèle que vous construisez peut être une contribution à la décision d'une banque centrale en matière de taux d'intérêt, au changement de politique d'un régulateur ou à l'investissement d'un million de dollars d'une entreprise. Posons le principe de base dès le début : l'intelligence artificielle est un assistant d'analyse, pas un chercheur. La responsabilité et l'approbation finale de la sélection du modèle, de la stratégie d'identification, de l'affirmation de la causalité, de la publication et des décisions politiques incombent à l'expert compétent.

Couches du workflow empirique et place de l'IA

Il est utile de diviser une étude empirique en trois niveaux. La couche d'exécution correspond au travail technique quotidien : nettoyage du code des données, dessin de graphiques, formatage des tableaux, débogage de la syntaxe. La couche méthode est la décision analytique : quel modèle, quelle stratégie d’identification, quel test, quelle vérification d’hypothèse. Le niveau d’interprétation et de décision est la signification des résultats : ce que dit le coefficient, est-il causal, qu’est-ce que cela signifie pour la politique, s’il doit être publié. L’IA touche les trois niveaux, mais avec une autorité différente dans chacun. Au niveau de l'exécution, l'IA rédige et génère rapidement du code ; Au niveau de l’interprétation et de la décision, seules les informations sont fournies et l’expert prend la décision.

Définissons dès le début quelques termes de base. L'économétrie est la branche qui analyse les données économiques et sociales avec des méthodes statistiques et mesure les relations. La régression est une méthode qui modélise numériquement la relation entre une variable de résultat (variable dépendante) et une ou plusieurs variables explicatives (variables indépendantes). Le coefficient est le nombre qui montre à combien d’unités de changement en moyenne un changement d’une unité dans une variable explicative est associé dans la variable de résultat. La valeur p est la probabilité que le résultat observé (ou un résultat plus extrême) se produise par hasard alors qu’aucun effet n’existe réellement. Nous expliquerons ces concepts un par un dans les unités suivantes ; Pour l’instant, sachez ceci : dans tout cela, l’IA vous donne le plan, le code et l’explication, mais elle ne prend pas de décisions scientifiques.

Le tableau suivant résume le rôle et le niveau de risque de l’IA par mission :

Quête

Rôle de l'IA

Niveau de risque

Qui approuve

Écrire un code de nettoyage des données

générateur de code

faible

Analyste lui-même (avec tests de code)

Projet de graphique/tableau

générateur de croquis

faible

analyste

Rappel de la syntaxe test/modèle

Assistante de référence

faible-moyen

analyste

Projet d'interprétation des coefficients

rédacteur de brouillon

moyen

économètre

Sélection du modèle/stratégie d’identification

entrée auxiliaire

haut

chercheur expert

Allégation de causalité

Juste un brouillon, jamais le dernier mot

très élevé

Expert + examen par les pairs

Publication/décision politique

saisie uniquement

très élevé

Chercheur/institution responsable

Gardez à l’esprit la seule ligne de ce tableau : à mesure que le risque augmente, le rôle de l’IA diminue et l’approbation des experts augmente.

Pourquoi la « vérification » est au cœur de cette activité

Les modèles de langage semblent confiants dans leur réponse, mais ils n'en sont peut-être pas sûrs. En langage technique, cela s'appelle une hallucination : c'est la fabrication par le modèle d'informations inexistantes dans une phrase fluide, comme si elles étaient vraies. Pour un économètre, c’est un piège mortel. Le modèle peut vous donner un chiffre exact tel que « La corrélation entre le chômage et l'inflation en Turquie entre 2015 et 2020 est de 0,62 » ; Cependant, il n’a jamais vu vos données et ce numéro est entièrement inventé. Ou il pourrait dire : « La valeur p du test blanc était de 0,03 » ; alors qu'il n'a effectué aucun test. Il peut appeler une fonction R avec un argument qui n'existe pas réellement. Il chante les trois avec la même aisance ; La seule chose qui sépare le bien du mal est votre connaissance et votre habitude de vérifier.

La discipline de vérification comprend trois étapes :

  1. Recalculez/exécutez dans votre propre environnement : calculez chaque nombre, rapport, résultat de test et coefficient donné par l'IA dans R/Python avec vos propres données, et non à partir de la mémoire de l'IA. Utilisez l'IA pour écrire le code, sans vous souvenir du résultat. Exécutez le code, vous produisez la sortie.
  2. Lien vers la source : utilisez des manuels, des articles sur les méthodes et des documents officiels pour connaître les règles, les formules et les définitions des méthodes. Confirmez la déclaration de l'IA "l'hypothèse de ce test est" auprès d'une source fiable.
  3. Filtre statistique : testez avec des yeux d'expert si les résultats contredisent la logique statistique (hypothèses, échantillon, taille de l'effet, incertitude). Rejeter un résultat « significatif mais absurde ».
Attention : Mettre un coefficient, un test ou une interprétation généré par l'IA dans un article, une thèse ou une note politique sans le valider équivaut à publier une conclusion non révisée. Ce n’est pas vrai parce que le résultat est fluide ; Ce n’est pas parce que ce chiffre semble certain qu’il est réel.

Confidentialité : les microdonnées et les données sous licence sont protégées de manière privée

Les microdonnées (enregistrements uniques au niveau de l'individu, du ménage, de l'entreprise ou du patient) sont fréquemment utilisées en économétrie. La plupart de ces données sont des données personnelles et sont protégées par le KVKK (loi sur la protection des données personnelles) en Turquie et par le RGPD en Europe. De plus, TurkStat, les banques centrales, les fournisseurs de données de panel et les sources commerciales fournissent souvent des données avec un accord d'utilisation des données ; Ces accords interdisent le transfert de données à des tiers. Coller un tableau contenant des informations d'identité, des revenus, des informations de santé ou des secrets d'entreprise dans un outil de discussion public basé sur l'IA constitue à la fois une violation du KVKK/RGPD et une violation de contrat ; car les données sont transférées vers un serveur externe et peuvent être utilisées dans la formation de modèles dans certains outils.

La règle est simple : conserver les données dans son propre environnement sécurisé, demander à l’IA uniquement le code et les méthodes. Le workflow idéal est le suivant : demandez à l'IA le code d'analyse, vous exécutez le code avec les données réelles sur votre propre ordinateur/serveur d'entreprise. Si vous devez vraiment partager des données, anonymisez (supprimez les champs d'identification), agrégez (moyenne/compte plutôt qu'individuel) et choisissez des outils institutionnels, disposez d'un accord de traitement des données et n'utilisez pas vos données dans l'éducation.

trois mini-cases

Cas 1 — Utilisation sûre et efficace. Un chercheur a d’abord passé 6 heures à nettoyer manuellement 40 000 lignes de données budgétaires des ménages. Sans partager du tout les données, il a simplement décrit les noms et la structure des variables à l'IA et a demandé un code de nettoyage. L'IA a généré un script R ; Le chercheur a exécuté le code dans son propre environnement, vérifié le nombre de lignes et les statistiques récapitulatives de chaque étape et corrigé deux erreurs logiques. Durée : 70 minutes au lieu de 6 heures. Les données n'ont jamais été divulguées ; La responsabilité incombait au chercheur.

Cas 2 — Piège à numéros non vérifié. "Quelle est l'élasticité entre la croissance du PIB et les investissements directs étrangers", a demandé un étudiant diplômé à AI. L'IA a donné avec confiance un chiffre "environ 0,34", même si elle n'avait accès à aucune donnée. L'étudiant a écrit ceci dans le résumé de la littérature ; Lorsque son conseiller lui a demandé quelle était sa source, il s’est avéré que ce numéro n’avait aucun fondement et était complètement fabriqué. Erreur : Attendre des statistiques concrètes de l’IA sans lui donner de données et de ressources.

Cas 3 — Confidentialité et rupture de contrat. Un analyste a téléchargé Excel, qu'il a reçu d'un panel d'entreprises agréées, contenant le nom de l'entreprise et son chiffre d'affaires, vers un outil d'IA accessible au public et a dit "faire une régression du panel". Le contrat du fournisseur de données interdisait le transfert de données vers des systèmes tiers ; L’incident a donné lieu à un examen de conformité. La bonne solution était de remplacer les noms d'entreprise par des codes anonymes ou de ne partager aucune donnée et de demander uniquement le code de régression du panel et de l'exécuter dans son propre environnement.

Invite faible/Invite forte

Invite faible :

Analysez la relation entre l’inflation et le chômage et indiquez le coefficient.

Cette affirmation est fausse : aucune donnée n’a été fournie à l’IA, on ne sait pas quel pays, quelle période, quel modèle. L'IA ne peut répondre qu'avec un coefficient inventé.

Invite puissante :

Votre rôle : vous êtes un assistant d'analyse assistant le chercheur en économétrie. JE NE partage PAS les données avec vous ; Je veux juste du code RUNNABLE R. J'ai un panel annuel : variables pays, année, chômage, inflation (toutes numériques). Tâche : 1) écrire un code de régression de panel à effets fixes pour le chômage ~ l'inflation (package plm), 2) expliquer chaque étape du code avec une ligne de commentaire, 3) noter que le coefficient doit être interprété comme relationnel et non CAUSAL, 4) composer l'argument de fonction dont vous n'êtes pas sûr ; Je vais exécuter et vérifier le résultat dans mon propre environnement.

Dans cette demande, aucune donnée n'est partagée, le rôle, les packages, l'attente de commentaires et l'interdiction de « fabrication » sont clairs. Vous exécutez toujours et vérifiez vous-même le résultat.

Le tableau suivant résume les règles d'une phrase de cette leçon :

principe

Qu'est-ce que ça veut dire

L'IA est un assistant

La décision scientifique et la responsabilité appartiennent à l’expert

Demander le code, produire le résultat

L'IA ne se souvient pas du numéro ; tu l'exécutes et tu calcules

conserver les données

Les données micro/sous licence ne quittent pas l’environnement sécurisé

vérifier

Chaque problème, code, commentaire est vérifié ; la fabrication est rejetée

Erreurs courantes

  • Attendre des statistiques concrètes de l’IA sans fournir de données. Le modèle ne peut pas accéder aux données ; Le coefficient, la corrélation et la valeur p qu'il donne sont faux. Demandez toujours le code et produisez le résultat vous-même.
  • S'appuyer sur des fonctions hallucinatoires. L'IA peut suggérer une fonction ou un argument R/Python qui n'existe pas. N'acceptez pas le code sans l'exécuter et le vérifier.
  • Téléchargement de microdonnées vers un outil public. Il s'agit d'une violation du KVKK/GDPR et de l'accord d'utilisation des données. Anonymisez les données ou ne les partagez pas du tout.
  • Confondre aisance et précision. Une critique bien rédigée peut être inexacte. La beauté de la phrase n’est pas une preuve.
  • Accepter le langage causal sans contrôle. YZ dit souvent « X augmente Y » ; alors que la plupart des régressions ne montrent que des relations. Défendez l’affirmation causale avec du design.
Astuce : lorsque vous travaillez avec l'IA, posez-vous cette question : « Si un arbitre ou un auditeur demande ce résultat, puis-je montrer la source et le compte ? » Si la réponse est non, la sortie n’est pas encore prête à être utilisée.

En résumé

L'IA apporte une accélération réelle et massive dans la couche d'exécution (code, nettoyage, graphique, brouillon) du workflow économétrique et statistique ; cependant, la sélection du modèle, la causalité, l’interprétation, la publication et les décisions politiques appartiennent à l’expert. Trois disciplines de base : ne pas rappeler le numéro à l'IA, demander le code et générer et vérifier vous-même le résultat ; ne supprimez pas les données micro/sous licence de l'environnement sécurisé ; filtre statistique chaque sortie. Une sortie d’IA non vérifiée est tout aussi risquée qu’une découverte non vérifiée.

Tâche de candidature

Considérez votre propre ensemble de données (ou un exemple). Demandez à l'IA du code R ou Python qui produit des statistiques descriptives et un graphique simple en décrivant simplement la structure des variables, sans partager les données. Exécutez le code entrant dans votre propre environnement. Gardez ensuite une liste de contrôle : (1) le code s'est-il exécuté sans erreurs, (2) est le nombre de lignes/observations comme vous l'espériez, (3) laquelle des phrases de commentaires de l'IA utilise un langage causal et doit être corrigée. Dans un paragraphe, écrivez le temps que l'IA vous a fait gagner et au moins un bug que vous avez détecté.

liste de contrôle

  • [ ] Je n'ai pas obligé l'IA à demander des statistiques concrètes ; J'ai demandé le code et produit le résultat moi-même.
  • [ ] J'ai recalculé chaque nombre et résultat de test qu'il donnait dans mon propre environnement.
  • [ ] J'ai vérifié que les fonctions/arguments qu'il utilise existent réellement.
  • [ ] Je n'ai pas téléchargé de données micro/personnelles/sous licence sur un outil public.
  • [ ] J'ai marqué les commentaires contenant un langage causal et les ai déplacés vers un langage relationnel.
  • [ ] Je suis en mesure de montrer la source et la comptabilité des résultats à un auditeur.