Unité 3 / 11

Analyse et visualisation exploratoires des données : représentation graphique et interprétation avec l'intelligence artificielle

Gains :

  • Capacité à produire des statistiques descriptives et des graphiques de distribution/relation avec le support de l'intelligence artificielle et à choisir le bon type de graphique en fonction des données et de la question
  • Capacité à reconnaître des choix trompeurs (axe pointillé, échelle inappropriée, lissage excessif) dans les images produites par l'intelligence artificielle et à appliquer des principes de visualisation honnêtes
  • Être capable de distinguer que l'analyse exploratoire sert à générer des hypothèses et le piège de faire des découvertes et des confirmations avec les mêmes données (ce qui ouvre la porte au p-hacking).

Après avoir nettoyé les données, la première tâche du chercheur empirique est de les connaître. Cette étape est appelée analyse exploratoire des données (EDA - Exploratory Data Analysis) : c'est le processus d'examen des données avec des graphiques et des statistiques récapitulatives et de voir leur structure, leurs modèles et leurs surprises. L’objectif n’est pas encore de tester une hypothèse, mais de se familiariser avec les données, de générer des questions et de jeter les bases du modèle que vous construirez à l’avenir. Dans cette unité, nous verrons comment l'intelligence artificielle (IA) accélère l'EDA et la visualisation, mais pourquoi les graphiques qu'elle produit doivent être soigneusement audités.

Faisons d’abord deux distinctions fondamentales. Premièrement, les statistiques descriptives (chiffres qui résument des données telles que la moyenne, la médiane, l'écart type, les quartiles) et la visualisation (montrant graphiquement les mêmes informations) se complètent ; Ensemble, ils décrivent les données. Deuxièmement, et c’est le plus important : la découverte et la confirmation doivent être distinguées. L'analyse exploratoire sert à générer des hypothèses ; Explorer l'hypothèse avec les mêmes données et dire « Je l'ai testée et je l'ai trouvée significative » ouvre la porte au p-hacking, que nous verrons dans l'unité suivante. Il est libre de regarder les données et de voir une tendance ; Mais déclarer ce modèle comme une « découverte prouvée » dans les mêmes données est trompeur.

Analyse exploratoire étape par étape

1. Vue univariée. Examinez chaque variable individuellement : sa distribution est-elle symétrique ou asymétrique ? combien y a-t-il de collines ; Où sont les valeurs aberrantes ? Pour les variables numériques, histogramme (tracé montrant la fréquence en divisant les valeurs en plages) et boxplot (boxplot — graphique montrant les valeurs médianes, quartiles et extrêmes) ; Pour les variables catégorielles, utilisez des tableaux de fréquence et des graphiques à barres.

2. Vue bivariée. Visualisez la relation entre deux variables : nuage de points pour deux variables numériques (montre chaque observation sous la forme d'un point sur le plan xy), boîte à moustaches groupée pour les variables numériques-catégorielles, tableau croisé pour deux variables catégorielles. Avant de regarder le coefficient de corrélation, assurez-vous de regarder le nuage de points : la même corrélation peut montrer des modèles très différents (le célèbre quatuor d'Anscombe le démontre ; quatre ensembles de données ont des statistiques presque identiques, mais une fois tracées, elles s'avèrent complètement différentes).

3. Choisissez le type de graphique correct. Le type de graphique dépend de votre question et du type de données. Histogramme de distribution ; dispersion pour la relation ; graphique linéaire pour l'évolution au fil du temps ; graphique à barres pour la comparaison des catégories ; (soigneusement) barre empilée pour le rapport des parties au tout. L'IA génère rapidement du code pour vous, mais la décision de « quel graphique pour quelle question » vous appartient.

4. Notez le modèle, ne déclarez pas de résultats. Enregistrez tout motif intéressant que vous voyez comme une « note de découverte », mais ne le considérez pas comme une découverte confirmée. La confirmation est effectuée lors d'une étape distincte, de préférence avec des données distinctes ou un calendrier prédéterminé.

Principes de visualisation honnêtes

Le graphique convainc ; Son pouvoir trompeur est donc également élevé. L’IA peut faire des choix esthétiques mais parfois trompeurs. Vérifiez ces politiques :

  • Dans les graphiques à barres, l'axe des y doit commencer à zéro. L’axe pointillé montre les petites différences aussi grandes.
  • L'échelle doit être cohérente. Si deux graphiques sont comparés, utilisez la même plage d’axes.
  • Un lissage excessif peut masquer le véritable motif. Une ligne de tendance semble jolie, mais si elle « lisse » trop les données, elle peut être trompeuse.
  • La couleur et la décoration 3D déforment l’attention, pas les données. Choisissez la simplicité.
  • Les données manquantes et la taille de l'échantillon doivent être visibles. "n=12" et "n=12 000" ne devraient pas se ressembler.
Attention : ce n’est pas parce que les graphismes produits par l’IA sont beaux qu’ils sont vrais. L'erreur la plus courante qu'il commet est de ne pas démarrer l'axe à partir de zéro dans le graphique à barres et d'exagérer la différence entre les deux groupes. Vérifiez toujours l'axe.

Tableau comparatif : question → tableau

Demander

graphique correct

Erreur courante

Comment cette variable est-elle distribuée ?

Histogramme/boîte à moustaches

utiliser un diagramme circulaire

Deux variables numériques sont-elles liées ?

Nuage de points

Il suffit de regarder le nombre de corrélations

Comment a-t-il évolué au fil du temps ?

graphique linéaire

Tracer une tendance avec un graphique à barres

Quelle est la différence entre les groupes ?

Boîte/barre groupée (à partir de zéro)

Tige à axe tronqué

Rapport partie-total ?

Barre empilée (avec prudence)

Diagramme à secteurs multi-tranches

Quatre invites copiables

1. Code de découverte automatique :

Votre rôle : Assistant EDA. Je ne partage pas les données, je veux le code R (ggplot2). Il existe des variables numériques (revenu, âge, dépenses) et catégorielles (région, éducation) dans la base de données « données ». Tâche : écrire du code qui produit un histogramme pour chaque valeur numérique, un graphique à barres pour chaque catégorie et un nuage de points pour le revenu et l'âge. Dans les graphiques à barres, laissez l’axe des y commencer à ZÉRO. Ajouter une ligne de commentaire.

2. Revue de corrélation (corrélation + visuel ensemble) :

Écrivez du code qui calcule à la fois la corrélation de Pearson pour les revenus et les dépenses et trace un nuage de points + une tendance linéaire. Ajoutez une ligne de commentaire me rappelant d'examiner le graphique avant de FAIRE CONFIANCE au nombre de corrélations (avertissement Anscombe). Ne lissez pas trop la ligne de tendance.

3. Audit d'intégrité :

Vérifiez le code ggplot suivant pour une visualisation honnête :[code]. Vérifiez et corrigez les points suivants : l'axe y part-il de zéro, l'échelle est-elle cohérente, la taille de l'échantillon est-elle visible, y a-t-il un lissage excessif ? Expliquez la justification de chaque correction que vous avez apportée.

4. Produire une note de découverte (pas une constatation) :

Sur la base des graphiques que je produis, listez les OBSERVATIONS comme « note de découverte » ; écrivez chaque élément dans le langage de « hypothèse à tester », et non de « constatation concluante ». Exemple : « Les revenus de l'enseignement supérieur SEMBLENT plus répartis ; doit être testé avec des données distinctes. Évitez les déclarations causales et définitives.

Invite faible/Invite forte

Invite faible :

Faites de jolis graphiques à partir du rendement et dites-moi ce qu'ils signifient.

Cette invite invite à des résultats trompeurs : « beau » se concentre sur l’esthétique, tandis que « ce que cela signifie » pousse l’IA à passer de la découverte à la conclusion définitive. Des commentaires causals et exagérés suivent.

Invite puissante :

Votre rôle : un assistant EDA honnête. Tâche : (1) choisir le type de graphique qui convient à ma question et rédiger la justification, (2) démarrer l'axe à partir de zéro dans les graphiques à barres, (3) interpréter le résultat dans le langage DISCOVERY NOTE : aucune affirmation définitive/causale ne suggère une hypothèse dans un langage "doit être testé", (4) m'avertir si l'échantillon est petit (n <30). Je vais exécuter le graphique dans mon propre environnement et le vérifier.

Différence : une forte volonté justifie le type de thème, impose des règles d'honnêteté et ne confond pas découverte et confirmation.

trois mini-cases

Cas 1 — Exagération des axes discrets. Un analyste a montré les scores de satisfaction de deux branches (7,8 et 8,0 ; sur 10) dans un graphique à barres. En démarrant l'axe YZ à partir de 7,5, la deuxième branche apparaissait presque deux fois plus haute que la première ; alors que la différence n'était que de 2,5%. La direction était sur le point de récompenser une succursale sous une mauvaise impression. Lorsque j'ai démarré l'axe à partir de zéro, la différence était presque invisible. Leçon : le choix de l’axe à lui seul change la perception.

Cas 2 — Faire confiance à la corrélation et ignorer le graphique. Un chercheur a vu r = 0,81 entre deux variables et a écrit « une relation linéaire forte ». Lorsque son consultant lui a demandé le nuage de points, il a constaté que la relation était en réalité due à une seule observation extrême, et lorsque ce point a été supprimé, la corrélation est tombée à 0,12. Leçon : le nombre de corrélations ne remplace pas un graphique ; regardez toujours le scatter.

Cas 3 — Confondre découverte et confirmation. Un étudiant a examiné toutes les corrélations par paires dans un ensemble de données à 40 variables, a sélectionné la plus élevée (r=0,52) et a écrit : « nous avons trouvé une relation significative entre l'éducation et l'épargne (p=0,004). » Cependant, il y avait des centaines de paires dans 40 variables ; choisir le plus élevé était une fausse conclusion due au hasard. Leçon : le modèle découvert ne peut pas être « testé et déclaré significatif » dans les mêmes données ; Une confirmation séparée est requise.

Erreurs courantes

  • Ne pas démarrer l'axe à partir de zéro dans le graphique à barres. Cela exagère la petite différence ; Le mensonge visuel le plus courant. Vérifiez toujours.
  • Regarder la corrélation et sauter le graphique. La même corrélation provient de modèles très différents ; peut correspondre à une relation aberrante. Premièrement, la diffusion.
  • Considérer le modèle trouvé dans la découverte comme une « preuve » dans les mêmes données. C'est la porte d'entrée vers le p-hacking ; La confirmation se fait séparément.
  • Mauvais type de graphique. Les correspondances telles que barre pour tendance et tarte pour distribution sont trompeuses. Choisissez un genre en fonction de la question.
  • Masquer la taille de l'échantillon. n=8 et n=8 000 ne devraient pas se ressembler sur le même graphique ; l’incertitude doit être démontrée.
Astuce : Avant de publier un graphique, posez-vous la question suivante : "L'histoire changerait-elle si je changeais l'axe ?" Si la réponse est oui, vous avez probablement commencé le pivot depuis un endroit malhonnête.

En résumé

L'analyse exploratoire des données est la phase consistant à rencontrer les données, à identifier des modèles et à générer des hypothèses ; Ce n'est pas une confirmation. L'IA génère rapidement des statistiques descriptives et du code graphique, mais vous choisissez le type de graphique en fonction de votre question et contrôlez les principes d'équité (axe zéro, échelle cohérente, incertitude apparente). Regardez le scatter avant de vous fier au nombre de corrélation ; Ne déclarez pas le modèle que vous avez trouvé lors de la découverte comme « preuve » dans les mêmes données. Un beau graphique d’IA ne signifie pas un graphique correct.

Tâche de candidature

Sélectionnez au moins trois variables dans un ensemble de données. Demandez à l'IA et exécutez du code qui produit des graphiques exploratoires (histogramme, nuage de points, encadré) avec une invite qui applique les règles d'honnêteté. Pour chaque graphique : vérifiez (1) l'adéquation du type de graphique à la question, (2) l'honnêteté de l'axe, (3) la visibilité de la taille de l'échantillon. Écrivez au moins une « note de découverte » en langage d’hypothèse (« … semble être testé séparément »). Examinez une corrélation avec le nombre et la dispersion et signalez s'il y a un écart entre eux.

liste de contrôle

  • [ ] J'ai choisi le type de graphique en fonction de ma question et du type de données.
  • [ ] Dans les graphiques à barres, je démarre l'axe des y à partir de zéro ; J'ai vérifié l'honnêteté de l'axe.
  • [ ] J'ai regardé le nuage de points avant de faire confiance à la corrélation.
  • [ ] J'ai reflété la taille de l'échantillon et l'incertitude sur le graphique.
  • [ ] J'ai écrit les modèles que j'ai trouvés lors de l'exploration comme des « hypothèses à tester » plutôt que des « preuves ».
  • [ ] J'ai noté que je n'utiliserais pas les mêmes données pour la confirmation et qu'une étape distincte était nécessaire.