Gains :
- Capacité à distinguer le flux de travail en six étapes de la science des données (définition du problème, collecte, nettoyage, découverte, modélisation, communication) et l'autorité sous laquelle l'intelligence artificielle travaille à chaque étape, en fonction du niveau de risque de la tâche.
- Capacité à appliquer une discipline qui vérifie chaque sortie de l'intelligence artificielle en la connectant à la source, en l'exécutant et en la comparant, et en la faisant passer par un filtrage expert.
- Capacité à transformer les principes de reproductibilité et de confidentialité (écriture dans le code, anonymisation) en habitudes d'analyse dès le premier jour
Des données brutes, désordonnées et souvent « mensongères » atterrissent chaque jour sur le bureau d'un data scientist. Dans le tableau des ventes, la colonne date est écrite dans trois formats différents ; les numéros de client sont vides sur certaines lignes ; Le nom d'une colonne est "revenu", mais elle contient à la fois des valeurs TL et USD. Le travail de la science des données consiste à prendre une décision fiable hors de ce chaos : collecter les données, les nettoyer, les explorer, construire un modèle, valider le résultat et en faire une histoire. L'intelligence artificielle (IA, ou IA en abrégé – systèmes informatiques capables de générer du texte et du code, de reconnaître des modèles, de résumer et de faire des prédictions) peut toucher tous les maillons de cette chaîne : écrire du code de nettoyage en quelques minutes, recommander des graphiques pour une analyse exploratoire, interpréter la métrique d'un modèle, corriger une requête SQL. Mais la même IA peut également vous fournir une fabrication fiable telle que la « corrélation 0,72 » pour des données qu'elle n'a jamais vues.
Cette première unité n'est pas une introduction à la bibliothèque. Son objectif est de clarifier où placer l’IA dans le flux de travail de la science des données et où ne jamais la mettre. Posons le principe de base dès le début : l'IA est un assistant, pas un data scientist. La décision quant aux données à collecter, aux mesures à retenir, à la mise en production ou non d'un modèle et à l'endroit où tracer des limites éthiques appartient à l'expert compétent. Une sortie d’IA non vérifiée est risquée, tout comme un rapport d’analyse non signé.
Workflow de science des données : carte de bout en bout
Pour comprendre un projet de données, il est utile de le diviser en six phases. L'ensemble de ce module suit cette carte.
1. Définition du problème : Que mesurons-nous, pourquoi, pour étayer quelle décision ? Cette phase n'est pas déléguée à l'IA ; C'est la personne qui définit le poste.
2. Collecte de données : identification des sources, extraction des données, échantillonnage. (Unité 2)
3. Nettoyage et prétraitement des données : valeur manquante, valeur aberrante, conversion de type. (Unité 3)
4. Analyse exploratoire des données (EDA - Exploratory Data Analysis, l'étape de reconnaissance de la distribution et des relations des données "à l'oeil") : (Unité 4)
5. Ingénierie et modélisation de fonctionnalités : génération de variables, sélection d'algorithmes, formation, évaluation. (Unité 5, 6, 7)
6. Communication et production : Visualisation, story, MLOps (discipline de mise en direct du modèle et de son suivi). (Unité 8, 11)
L’IA opère avec une autorité différente à chacune de ces six étapes. Le tableau ci-dessous résume cette répartition de l'autorité ; Il s’agit du tableau le plus important du module.
Scène
Rôle de l'IA
Niveau de risque
Qui approuve
Définition du problème
partenaire de brainstorming
faible
Data scientist + partie prenante
Écrire un code de nettoyage
Générateur d'esquisses de code
moyen
Data scientist (lit le code)
Commentaire de l'AED
suggéreur de modèle
moyen
scientifique des données
Génération de fonctionnalités
Générateur d'idées et de code
moyen-élevé
Le contrôle des fuites est indispensable
Sélection de modèle/métrique
consultant
haut
scientifique des données
Décision de mise en production
entrée auxiliaire
très élevé
Equipe + chef d'entreprise
Approbation éthique/vie privée
stimulant
très élevé
humain, toujours
Gardez à l’esprit la phrase de ce tableau : à mesure que les enjeux augmentent, le rôle de l’IA diminue et l’approbation humaine augmente.
Pourquoi la vérification est au cœur de cette activité
Les modèles de langage d’IA semblent sûrs, mais ils ne le sont peut-être pas. En langage technique, cela s'appelle une hallucination : c'est la fabrication par le modèle d'informations inexistantes dans une phrase fluide, comme si elles étaient vraies. En science des données, cela se présente sous trois formes. Le premier est un faux numéro : si vous demandez au modèle « quel est le montant moyen de la commande » sans donner aucune donnée, il vous donnera un chiffre en toute confiance, même s'il n'a jamais vu vos données. La seconde est une fonction qui n'existe pas : le modèle peut suggérer une fonction qui n'existe pas du tout, comme pandas.read_excel_fast(). Troisièmement, une interprétation statistique incorrecte : le modèle peut répéter en douceur une erreur statistique classique telle que « la valeur p est de 0,04, donc l'hypothèse est correcte à 96 % ».
La discipline de vérification comprend trois étapes :
- Lien vers la source : chaque chiffre, taux et tendance doit provenir de vos données, et non de la mémoire de l'IA. Utilisez l’IA pour le code qui fonctionne sur les données, et non pour qu’il se souvienne des données.
- Exécuter et comparer : exécutez vous-même chaque morceau de code fourni par l'IA ; Comparez chaque métrique qu’il produit à une référence indépendante.
- Filtre expert : testez par vous-même si le résultat contredit les statistiques et les connaissances du domaine.
Attention : Mettre une analyse rédigée par l'IA dans une présentation sans l'exécuter et la lire, c'est comme présenter un rapport non signé. Ce n’est pas parce que le code fonctionne qu’il est correct ; Un code qui résume la mauvaise colonne fonctionne également sans erreur.
Reproductibilité : pouvoir produire deux fois le même résultat
Le principe silencieux mais essentiel de la science des données est la reproductibilité : lorsque vous réexécutez une analyse six mois plus tard ou sur un autre ordinateur, vous obtenez le même résultat. Ce risque augmente lorsque vous travaillez avec l'IA, car lorsque vous dites à l'IA de "créer ce graphique" et de le lire manuellement, les étapes disparaissent. Règle : chaque étape doit être enregistrée dans le code et le contrôle de version (comme Git) ; Dans les étapes impliquant le caractère aléatoire, la graine aléatoire (la valeur initiale du générateur de nombres aléatoires ; si elle est fixée, le résultat sera reproductible) doit être corrigée. Nous approfondirons ce sujet dans l'unité 10 ; Pour l'instant, prenez cette habitude : "Ne cliquez pas à la main, écrivez en code".
trois mini-cases
Cas 1 — Accélération sûre. Un analyste du commerce électronique passe normalement une demi-journée à nettoyer un tableau de commandes de 240 000 lignes. Il a donné les noms des colonnes et les 5 premières lignes (sans données personnelles) à l'IA et a demandé le code de nettoyage des pandas. L'IA a produit un brouillon en 8 secondes ; L'analyste a lu le code ligne par ligne, corrigé une erreur dans l'analyse des dates et l'a exécuté. Durée : 35 minutes au lieu de 4 heures. L'IA a fourni le code, la vérification est restée avec l'humain.
Cas 2 — Le piège métrique inventé. Un stagiaire a demandé à l'IA : « Quelle est la précision de la forêt aléatoire sur ces données ? » sans entraîner du tout le modèle. "Environ 89%", a déclaré AI. Le stagiaire a mis cela dans la présentation ; Lorsque le modèle réel a été entraîné, la précision était de 71 %. Erreur : attendre des métriques sans fournir de données et de modèles à l'IA.
Cas 3 — Fuite silencieuse. Une équipe a mis en œuvre l’idée suggérée par l’IA consistant à « ajouter la moyenne de la variable cible en tant que caractéristique » sans la remettre en question. Le modèle a fonctionné à 98 % sur l'ensemble de test, mais s'est écrasé en production car la fonctionnalité perdait des informations futures (fuite de données, unité 10). Erreur : Ne pas filtrer statistiquement la recommandation de l'IA.
Invite faible/Invite forte
Invite faible :
Analysez ces données de ventes et dites-moi le revenu moyen.
Cette affirmation est erronée : l’IA n’a pas reçu de données, donc le « revenu moyen » ne peut qu’être compensé. Ni les colonnes, ni la période, ni la devise ne sont claires.
Invite puissante :
Votre rôle : assistant aidant un data scientist. J'ai un DataFrame pandas : df. Colonnes : - order_date (texte, au format "2024-03-01") - montant_tl (décimal, NaN dans certaines lignes) - customer_id (entier) Tâche : (1) écrire le code pandas qui calcule le montant moyen, (2) expliquer comment il gère les valeurs NaN, (3) lister les hypothèses formulées par le code. N'inventez pas le contenu des données ; générez simplement du code et je vais exécuter et vérifier le résultat.
Dans cette demande, le schéma, l'attente et « l'interdiction de fabrication » sont clairs. Vous exécutez toujours et vérifiez vous-même le résultat.
Les débuts de l’éthique et de la vie privée
La science des données travaille souvent avec des données personnelles : dossiers clients, patients, employés. La KVKK (loi sur la protection des données personnelles) en Turquie et le RGPD en Europe protègent ces données. Coller votre vrai nom, votre identifiant, votre adresse e-mail ou votre adresse dans un outil public d'IA constitue une violation. Règle : anonymisez les données avant de les partager, fournissez uniquement un schéma (noms de colonnes, types) et un exemple de ligne factice si nécessaire. Nous approfondirons le thème de l'éthique dans l'unité 11 ; Posons le principe dès le début : pour comprendre la donnée, partager sa structure, et non son contenu, suffit souvent.
Erreurs courantes
- Attendre des chiffres/métriques sans fournir de données à l'IA. Le modèle ne peut pas accéder aux données ; Le numéro qu'il donne est faux. Faites toujours calculer et exécuter le résultat.
- Penser que le code de travail est correct. Le code qui manipule la mauvaise colonne s’exécute également sans erreur ; Ne faites pas confiance sans lire la logique.
- Coller de vraies données personnelles dans l’outil ouvert. Le nom, le numéro d'identification, l'e-mail ne sont jamais partagés ; Le schéma suffit.
- Effectuer les étapes manuellement et ne pas les écrire dans le code. Une analyse non reproductible n’est pas fiable.
- Accepter sans aucun doute l’interprétation des statistiques par l’IA. L’IA peut répéter des erreurs classiques dans des concepts tels que la valeur p et la corrélation.
Astuce : incluez une courte « ligne de règle » dans chacune de vos sessions d'IA : « N'inventez pas le contenu des données ; générez simplement du code/une analyse et j'exécuterai et vérifierai le résultat ; indiquez « pas sûr » là où vous n'êtes pas sûr. » Cette seule phrase réduit considérablement le risque d’hallucinations.
En résumé
L'IA est un assistant puissant en science des données : elle accélère le nettoyage du code, l'interprétation EDA, la recommandation de modèles et la visualisation. Mais la définition des problèmes, la sélection des paramètres, les décisions de production et les limites éthiques appartiennent aux humains. Le flux de travail comporte six étapes et le rôle de l’IA diminue à mesure que le risque augmente. Trois habitudes sont à la base de tout : la liaison des sources (validation), la reproductibilité (codage) et l'anonymisation (confidentialité). Une fois que vous avez internalisé ces trois éléments, chaque outil du reste du module devient un accélérateur sûr pour vous.
Tâche de candidature
Créez simplement un schéma d'une petite table que vous avez (ou une table hypothétique) : noms de colonnes, types et 2-3 lignes d'exemple factices (sans données personnelles réelles). Demandez à l'IA un code de statistiques récapitulatif à l'aide du modèle « Invite puissante » ci-dessus. Exécutez le code, comparez le résultat à une valeur manuelle, vérifiez toute hypothèse fallacieuse et notez vos résultats en 5 puces.
liste de contrôle
- [ ] Est-ce que je viens de donner à l'IA un schéma et un faux échantillon au lieu de vraies données personnelles ?
- [ ] Ai-je lu et exécuté le code produit ligne par ligne ?
- [ ] Ai-je vérifié indépendamment chaque numéro dans le résultat ?
- [ ] Ai-je écrit chaque étape de l'analyse dans le code et l'ai-je rendue reproductible ?
- [ ] Ai-je déterminé le niveau de risque de la mission et confié la décision finale à un humain ?