Unité 7 / 11

Décision basée sur les données et analyse des données publiques

Gains :

  • Reconnaît les risques liés à la qualité, à la confidentialité et à l’interprétation liés au travail avec des données et établit un flux d’analyse sécurisé.
  • Il sélectionne le bon indicateur dans un but précis, en faisant la distinction entre les indicateurs uniques trompeurs et les mesures susceptibles d'être manipulées.
  • Il reconnaît les techniques graphiques trompeuses (axe ne partant pas de zéro, plage choisie) et observe une visualisation honnête.

Le public produit chaque jour des données : numéros de dossiers, délais de résolution, postes budgétaires, mouvements de population, demandes de services, résultats d'audits, enquêtes de satisfaction. La plupart de ces données se trouvent dans des feuilles de calcul Excel, des formulaires et des systèmes d'enregistrement, mais ne se traduisent pas en décisions, car leur analyse nécessite de l'expertise et du temps. La prise de décision basée sur les données (une approche d’allocation des ressources et d’élaboration de politiques fondée sur des preuves mesurées, plutôt que sur des opinions ou des habitudes) augmente à la fois l’efficacité et l’équité dans le secteur public : les ressources vont là où elles sont le plus nécessaires, sur la base des chiffres. Ici, l’IA est un assistant puissant pour donner un sens à un tableau, trouver des modèles et des anomalies, extraire des statistiques récapitulatives et traduire les résultats en phrases simples. Dans cette unité, vous verrez comment raccourcir le chemin entre les données publiques brutes et une décision défendable grâce à l'IA et rester discipliné dans l'aspect le plus critique : l'interprétation correcte du chiffre.

Trois dangers liés au travail avec des données

Les données sont puissantes, mais elles comportent trois pièges, et l’IA peut à la fois atténuer et amplifier ces pièges :

  1. Corrélation ≠ causalité. Ce n’est pas parce que deux choses changent ensemble que l’une provoque l’autre. Les ventes de glaces et les noyades sont en augmentation, car elles sont toutes deux liées à la chaleur estivale, et l’une n’entraîne pas l’autre. L’IA construit couramment des phrases « parce que » ; Remettez en question toute affirmation de causalité.
  2. Données biaisées/manquantes. Auprès de qui et comment les données ont-elles été collectées ? Les données sur les plaintes reflètent uniquement ceux qui peuvent se plaindre ; données d'application numérique ceux qui ont accès à Internet. Si vous ne voyez pas le groupe manquant, la décision sera biaisée.
  3. Numéro sans contexte. « Augmenté de 30 % » à lui seul n'a pas de sens : d'après quoi, à quelle période, quel est le nombre absolu ? Demandez le contexte à l'IA.
Attention : Pendant que l'IA analyse le tableau que vous fournissez, elle ajoute parfois des chiffres « raisonnables » mais fictifs provenant de l'extérieur du tableau ou remplit silencieusement les cellules manquantes. Comparez chaque numéro de sortie à la table source ; Donnez à l'IA la règle "utilisez uniquement les valeurs du tableau que je vous donne, si elles manquent, dites 'pas de données'".

Flux d'analyse des données étape par étape

  1. Clarifiez la question. À quelle question cherchons-nous des réponses pour la décision ? (« Dans quel quartier le temps de résolution prend-il le plus de temps ? »)
  2. Connaissez les données. Quelles sont les colonnes, quelle est l'unité, quelle est la période, y a-t-il des valeurs manquantes/incorrectes ?
  3. Extraire des données personnelles. Anonymiser/agréger si l’identification individuelle n’est pas requise pour l’analyse (voir l’unité 11).
  4. Un résumé et un modèle émergent. Demandez à l'IA d'effectuer des statistiques de base, un regroupement et un marquage des anomalies.
  5. Remettez en question le commentaire. Corrélation ou causalité ? Explication alternative ? Groupe manquant ?
  6. Visualisez et simplifiez. Un résumé simple et un graphique que le décideur peut comprendre.
  7. Documentez la décision et son raisonnement. Quelle décision a été prise sur la base de quelles données ? piste d'audit.

trois mini-cases

Cas 1 — La source est allée au bon endroit. Autrefois, une municipalité distribuait son budget d'entretien des parcs « à parts égales à chaque quartier ». Lorsque 18 mois de données sur la demande et l’utilisation ont été analysés avec l’IA, la demande par habitant des trois quartiers était 2,4 fois supérieure à la moyenne. Le budget a été redistribué selon les besoins ; la satisfaction globale a augmenté, sans dépenses supplémentaires.

Cas 2 — Des données biaisées ont été remarquées. Une agence examinerait les données des applications numériques et conclurait que « les citoyens ne viennent plus au péage ». Mais lorsque la répartition par âge a été demandée dans l'analyse, il s'est avéré que les candidatures de plus de 65 ans provenaient encore majoritairement du guichet. Si seules les données numériques étaient examinées, ce groupe serait ignoré ; le service de billetterie a été préservé.

Cas 3 — La causalité artificielle a été arrêtée. En interprétant un tableau, YZ a déclaré : « Les accidents ont diminué parce que le nombre d'inspections a augmenté. » L'analyste a rappelé que le temps a également changé et que le trafic a diminué au cours de la même période ; L’attribuer à une seule cause était trompeur. Le rapport a été corrigé pour dire « il existe une relation mais le lien de causalité n'a pas été prouvé ».

Quatre modèles copiables

1) Connaître le tableau :

Votre rôle : analyste de données. Examinez le tableau ci-dessous et, en vous basant UNIQUEMENT sur les valeurs de ce tableau : (1) résumez ce qu'est chaque colonne, son unité et sa période, (2) toutes les cellules qui semblent manquantes/incorrectes, (3) résumez les 3 principaux modèles qui se démarquent. Ajouter des nombres extérieurs au tableau ; s'il manque, dites « aucune donnée ».TABLE : [coller les données]

2) Statistiques récapitulatives avec contexte :

Répondez à la question suivante à partir du tableau ci-dessous : [question]. DOIT donner le résultat avec le contexte : nombre absolu + taux + période de comparaison. Lorsque vous dites « augmenté de X% », précisez dans quelle mesure et sur quelle période. Utilisez simplement les données données.TABLE : [données] QUESTION : [question]

3) Questionneur de causalité :

Interprétez le résultat suivant, mais ATTENTION : ne confondez pas corrélation et causalité. Générez au moins 3 explications alternatives pour cette relation (troisième variable, sens inverse, coïncidence). Dites-moi quelles données supplémentaires sont nécessaires pour prouver la causalité. CONSTATATION : [relation]

4) Résumé simple pour la décision :

Simplifiez l'analyse suivante pour un décideur qui n'est pas un expert en données : pas plus de 5 éléments, chaque élément étant un constat et une explication « qu'est-ce que cela signifie ». Notez également clairement les incertitudes et les limites des données. Ajout de nouvelles informations.ANALYSE : [texte]

Invite faible/Invite forte

Faible : « Analysez ce graphique et dites-nous ce que nous devons faire. »

Fort : "Votre rôle est celui d'analyste de données. Utilisez UNIQUEMENT le tableau ci-dessous ; n'ajoutez pas de chiffres de l'extérieur, dites "aucune donnée" à la cellule manquante. Tout d'abord, apprenez à connaître les colonnes, les unités et la période. Répondez ensuite à la question "quel quartier a le temps de solution le plus long" avec nombre absolu + rapport + période de comparaison. Si vous trouvez une tendance, proposez 3 explications alternatives avant de l'expliquer avec la causalité. Enfin, énumérez les points et les limites des données (groupe manquant, période courte) qui laissent la décision à nous."

Différence : une invite forte établit ensemble la fidélité des données, le contexte, la discipline de causalité et la limite de décision ; Le résultat est une analyse défendable.

Où peut-on faire confiance à l’IA dans le secteur des données ?

entreprise

Confiance en IA

règle

Tableau récapitulatif, regroupement

haut

Données fournies uniquement

Marquage d’anomalie/motif

moyen

confirmation humaine

Interprétation de la causalité

faible

Une explication alternative est requise

Remplir les données manquantes

trop bas

Ne faites pas en sorte que cela se produise ; "aucune donnée"

Simplification/résumé visuel

haut

Le sens doit être préservé

Conception des indicateurs et piège graphique trompeur

L’étape la plus critique pour prendre des décisions avec des données consiste à choisir le bon indicateur (l’expression numérique qui rend un phénomène mesurable – par exemple, « temps de traitement moyen » ou « coût par demande »). Un mauvais indicateur conduit à une mauvaise décision, même avec des données précises : alors que le « nombre total de réclamations résolues » semble augmenter, le « temps d’attente par citoyen » pourrait s’aggraver. L’IA peut répertorier les indicateurs candidats pour un sujet et ce que chacun mesure et cache ; mais c'est vous qui décidez quel indicateur représente réellement l'intérêt public. Soyez également conscient du risque de visualisation trompeuse (perception déformée avec des techniques telles que l'axe ne partant pas de zéro, échelle disproportionnée, intervalle de temps sélectionné) dans les graphiques que l'IA suggère ou décrit ; un visuel honnête dans les données publiques fait partie de la gouvernance.

Mini-affaire : mauvais signe, mauvaise vantardise. Une unité battait des records dans l'indicateur « nombre de dossiers clôturés par mois » ; mais les plaintes des citoyens se sont multipliées. Si l’on considère l’indicateur précis, le « taux de résolution au premier contact », le taux est passé de 58 % à 44 % – les dossiers ont été fermés et rouverts rapidement. Lorsque l'indicateur a changé, la priorité de gestion a également changé.

Mini boîtier — axe qui ne part pas de zéro. Sur le graphique AI décrit dans une présentation, l'axe vertical commence à 40, une augmentation de 2 % semble être un saut spectaculaire. Lorsque l’axe a été déplacé vers zéro, l’image réelle est apparue et la décision a été éliminée de la perception exagérée.

Modèle prenant en charge la sélection des indicateurs :

Tâche : Proposer 5 indicateurs candidats pour l’objectif suivant. Objectif : [par ex. améliorer la qualité du service aux citoyens]Pour chaque indicateur : ce qu'il mesure | que peut-il cacher | ouverture à la manipulation | fréquence de lecture recommandée. Ensuite : rédigez 3 avertissements (ceux qui sont trompeurs en eux-mêmes) pour lire ces indicateurs ensemble. Règle : Ne produisez pas de chiffres ; suggérez simplement la conception de l’indicateur.

Attention : ne tombez pas dans l’idée fausse selon laquelle « le nombre est objectif ». Le nombre que vous mesurez, la manière dont vous l'affichez et la plage que vous choisissez sont tous une question d'interprétation. Une interprétation publique transparente et honnête est aussi importante que la disponibilité de données exactes.

Erreurs courantes

  • Confondre corrélation et causalité. "Augmenté ensemble" n'est pas la cause ; Recherchez des explications alternatives.
  • Demander à l’IA de remplir les données manquantes. L'analyse s'effondre avec une valeur inventée ; laisser les disparus disparus.
  • Généraliser des données biaisées. Les plaintes/données numériques ne représentent pas tout le monde ; Recherchez le groupe manquant.
  • Présenter le numéro sans contexte. À côté du ratio, il doit y avoir un nombre absolu et une période de comparaison.
  • Analyser inutilement des données personnelles. N’utilisez pas d’identification individuelle si les données agrégées sont suffisantes.
  • Ne pas documenter la décision. Quelle décision a été prise sur la base des données qui doivent être enregistrées pour l'audit.

En résumé

La prise de décision basée sur les données constitue le moyen le plus puissant de répartir les ressources de manière équitable et efficace dans le secteur public ; L'IA est un assistant rapide dans ce secteur qui donne un sens à l'image, trouve des modèles et simplifie les recherches. Mais n'obligez pas l'IA à inventer des chiffres, ne lui faites pas remplir les données manquantes, ne la laissez pas confondre corrélation et causalité et évitez de généraliser des données biaisées/incomplètes. Le nombre fait la force ; La personne qui l’interprète correctement et documente la décision est plus forte.

Tâche de candidature

Obtenez un vrai tableau (sans données personnelles) de votre unité. Introduisez les données avec le modèle « Connaître le tableau », puis obtenez une réponse à une question importante pour la décision avec le modèle « Statistiques récapitulatives contextuelles ». Appliquez le modèle « Questionneur de causalité » à une relation émergente et trouvez au moins une explication alternative. Vérifiez si l'IA ajoute des nombres extérieurs au tableau.

liste de contrôle

  • [ ] L'IA n'a utilisé que la table donnée ; Il n’a pas ajouté de chiffres venant de l’extérieur.
  • [ ] Je n'ai pas renseigné les données manquantes ; Je l'ai laissé comme "pas de données".
  • [ ] J'ai présenté chaque résultat avec son contexte (nombre absolu + taux + période).
  • [ ] J'ai produit une explication alternative aux allégations de causalité.
  • [ ] J'ai évalué le risque de données biaisées/manquantes et le groupe manquant.
  • [ ] J'ai documenté la décision et les données sur lesquelles elle était basée.