Unité 7 / 12

Traitement des données, stockage, minimisation et anonymisation

Gains :

  • Appliquer les considérations liées à l'IA à chaque étape du cycle de vie des données
  • Définissez des périodes de conservation et incluez les historiques de discussion de l'IA dans la politique de destruction
  • Appliquer la différence entre anonymisation et pseudonymisation

La partie « après » des données est celle qu’un délégué à la protection des données néglige souvent. Une fois qu’un texte est saisi dans l’IA, il semble que le travail soit terminé ; Cependant, ces données sont stockées quelque part, peut-être utilisées dans la formation du modèle, peut-être s'accumulent-elles dans l'historique des discussions pendant des mois. Dans cette unité, nous aborderons étape par étape le cycle de vie des données personnelles ; Nous en apprendrons plus sur les périodes de conservation, la destruction des historiques de discussion de l'IA et la distinction entre deux techniques critiques : l'anonymisation et la pseudonymisation. L’objectif est de gérer les données tout au long de leur vie, et pas seulement au moment de leur saisie.

Cycle de vie des données et IA

Les données personnelles suivent un cycle de vie ; Chaque étape comporte des points d’attention spécifiques à l’IA.

Scène

Que se passe-t-il ?

Point d'attention de l'IA

collecte

Les données sont obtenues

L’objectif et la base sont-ils clairs ? A-t-il été minimisé ?

Utilisation/traitement

Entré dans l'IA, traité

Le masquage a-t-il été fait ? Véhicule homologué ?

stockage

Les données sont conservées

Combien de temps dure l’historique des discussions ?

transfert

va chez quelqu'un d'autre

Serveur international ? Existe-t-il une assurance appropriée ?

Destruction

Suppression/anonymisation

A-t-il été supprimé une fois l'objectif atteint ? Les pièces de rechange sont-elles incluses ?

Les deux étapes les plus négligées sont le stockage et l’élimination. Les données sont « oubliées » et continuent de s’accumuler dans le système – ce qui viole le principe KVKK et amplifie les dégâts en cas de violation.

Durée de conservation : combien de temps peut-on le conserver ?

Le principe de conservation du KVKK est clair : les données personnelles ne peuvent être conservées plus longtemps que nécessaire aux fins pour lesquelles elles sont traitées. Lorsque la finalité n'est plus disponible, les données doivent être supprimées, détruites ou anonymisées. L'établissement prépare une politique de stockage et d'élimination ; détermine la quantité à conserver pour chaque catégorie de données.

Point critique propre à l’IA : les historiques de discussions de l’IA sont également des données stockées. Si un employé a saisi des données client dans le même chat pendant des mois, cet historique devient un référentiel de données. Pour cela :

  • Configurez les paramètres de conservation des données dans les outils d'IA d'entreprise (supprimez automatiquement l'historique si possible ou désactivez l'utilisation dans la formation du modèle).
  • Incluez l’historique des discussions dans votre calendrier de destruction.
  • Assurez-vous de l'option « Ne pas utiliser dans la formation des modèles » (opt-out) dans le contrat d'entreprise.
Attention : Supprimer des données ne consiste pas simplement à les supprimer de l'écran. Les sauvegardes, journaux et copies sur le serveur du fournisseur doivent également être pris en compte. Lorsque vous dites « supprimé », assurez-vous que ce que vous avez supprimé est réellement irrécupérable.

Anonymisation ou pseudonymisation ?

Ces deux termes sont souvent confondus, mais leurs conséquences juridiques sont diamétralement opposées.

  • Anonymisation : Faire en sorte que les données ne puissent en aucun cas être associées à une personne. Si cela est fait correctement, le résultat ne constitue plus des données personnelles et ne relève pas du champ d'application du KVKK. Exemple : supprimer des lignes individuelles dans un ensemble de données de 10 000 personnes et ne conserver que des statistiques globales telles que "Dépenses moyennes dans la tranche d'âge des 25 à 34 ans à Istanbul".
  • Pseudonymisation : Les informations d'identité sont remplacées par un code/tag, mais peuvent être restituées à la personne avec une « clé ». Exemple : écrire "Client-4471" au lieu de "Ahmet Yılmaz", mais conserver un tableau indiquant quel code appartient à qui. Il s'agit toujours de données personnelles et relèvent du champ d'application du KVKK.

fonctionnalité

Anonymisation

Pseudonymisation

La personne peut-elle être restituée ?

Non (si c'est fait correctement)

Oui, avec la clé

Est-ce toujours des données personnelles ?

non

Oui

Portée KVKK

à l'extérieur

dans

Pour se lancer dans l'IA

Le moyen le plus sûr

Encore une fois, une base/règle est requise

Astuce : « Est-ce réversible ? avant de saisir des données dans l’IA. demander. S'il contient une clé/une correspondance, il s'agit de données pseudonymisées et toujours personnelles. La véritable anonymisation consiste à partager le résultat agrégé, et non les lignes individuelles.

trois mini-cases

Cas 1 — Faux anonymat. Une entreprise de soins de santé donne à l’IA un ensemble de données qu’elle dit avoir « anonymisées » à des fins d’analyse. Mais l’ensemble comprend la date de naissance, le comté et un diagnostic rare ; ce trio peut indiquer une seule personne dans un petit comté. Il ne s’agit pas d’anonymisation ; les données restent personnelles. La bonne méthode : convertir la date de naissance en tranche d’âge, généraliser par comté, regrouper les diagnostics rares, c’est-à-dire une véritable agrégation.

Cas 2 – Les conversations s’accumulent. Dans un centre d'appels, 6 agents saisissent les données clients dans le même compte IA d'entreprise pendant 4 mois. Personne n’efface le passé ; Finalement, plus de 12 000 interactions clients se sont accumulées en un seul endroit. Lors d'un audit, cette accumulation est marquée comme un risque majeur. Solution : paramètre pour supprimer automatiquement l'historique tous les 30 jours, une règle de déconnexion lorsque le travail est terminé et une clause ouverte sur la politique de rétention.

Cas 3 — Pseudonymisation correcte. Lors de l’analyse des performances des employés avec l’IA, une équipe RH code des noms tels que « Employé-001 » et conserve le tableau correspondant dans un fichier séparé à accès restreint. Il s'agit d'une pseudonymisation ; Les données restent personnelles, mais le risque est réduit. L'équipe est consciente qu'il ne s'agit pas d'une anonymisation et détermine en conséquence sa base juridique et sa durée de conservation.

Modèles copiables

MODÈLE 1 — Ligne de politique de conservation et de destruction : « Proposer une ligne de politique de conservation-destruction pour la catégorie de données suivante : [catégorie]. Champs : durée de conservation (justifiée par la finalité), méthode de destruction (suppression/destruction/anonymisation), si l'historique des discussions de l'IA est inclus, rôle responsable. Rappeler s'il existe une obligation légale de conservation.

MODÈLE 2 — Vérification de l'anonymisation : « Évaluez si l'ensemble de données suivant est véritablement anonyme : [lister les champs]. Quelles combinaisons de champs pourraient rendre une personne réidentifiable (par exemple, date de naissance + code postal + caractéristique rare) ? Suggérez une généralisation pour chaque champ de risque (tel que la tranche d'âge, le niveau de la province) pour renforcer l'anonymat.

MODÈLE 3 — Masquage + séparation des touches de retour : "Pseudonymez le texte suivant : encodez les données personnelles (comme [NOM] -> K001), mais donnez-moi une table correspondante SÉPARÉMENT. Ne laissez aucune identité réelle dans le texte lui-même. Notez que la table correspondante est des "données personnelles" et doit être stockée séparément. "

MODÈLE 4 — Audit du stockage des données de l'outil d'IA : "Préparez une liste de questions pour auditer le comportement de stockage des données de l'outil d'IA que nous utilisons : combien de temps l'historique est-il conservé, peut-il être supprimé, est-il utilisé dans la formation du modèle, y a-t-il une désinscription, où les données sont traitées, quelles sont les sauvegardes ? Écrivez la réponse « sécurisée » attendue à chaque question.

Invite faible/Invite forte

FAIBLE : "Anonymisez ces données." (code et laisse les noms) -> Juste des surnoms ; Des risques de réidentification subsistent, comme la date de naissance, un trait rare ; Cela crée l’illusion d’un « anonyme ». GÜÇLÜ : "Trouver des combinaisons de champs dans cet ensemble qui peuvent ré-identifier la personne ; généraliser chacun d'eux (tranche d'âge, niveau de province). Mon objectif n'est pas un enregistrement unique, mais des statistiques agrégées. Par conséquent, personne ne peut être distingué comme une seule personne et vérifier cela." -> Le modèle tend vers une véritable anonymisation, réduisant les risques de ré-identification.

Erreurs courantes

  • Confondre pseudonymisation et anonymisation ; en oubliant que cela reste des données personnelles.
  • Supprimer les noms et laisser des combinaisons descriptives telles que date de naissance + lieu + trait rare.
  • Ne pas soumettre l’historique des discussions de l’IA à une règle de conservation/destruction ; accumuler indéfiniment.
  • Ne pas garantir la clause « Ne pas utiliser dans la formation sur modèle » (opt-out) dans le contrat.
  • Quand je parle de suppression, je veux dire simplement effacer l'écran et oublier les sauvegardes et les journaux.
  • Garder la période de stockage plus longue pour « juste au cas où » plutôt que pour le but recherché.
  • Ignorant que le transfert et le stockage ont également lieu sur le serveur du fournisseur.

En résumé

  • Les données personnelles suivent un cycle de vie ; Les étapes les plus négligées sont le stockage et l’élimination.
  • Les données ne peuvent pas être conservées plus longtemps que nécessaire à la finalité ; L'institution doit établir une politique de stockage et de destruction.
  • Les historiques de discussion de l'IA sont également des données stockées ; doivent être inclus dans le calendrier d’élimination et les paramètres de stockage.
  • L'anonymisation supprime les données de KVKK ; La pseudonymisation laisse toujours les données personnelles.
  • La suppression d’un nom n’est pas une anonymisation ; Toutes les combinaisons présentant un risque de ré-identification doivent être généralisées.

Tâche de candidature

Choisissez une catégorie de données que votre organisation traite avec l'IA (par exemple, les enregistrements de support client). Rédigez une ligne de politique de conservation et de destruction pour cette catégorie : période de conservation (justifiée), méthode de destruction, si l'historique des discussions de l'IA est inclus et rôle responsable. Ensuite, prenez un échantillon d'enregistrement à partir des mêmes données et pseudonymisez-le d'abord (gardez la table de correspondance séparée), puis écrivez quels champs vous généraliserez et comment amener cet enregistrement à une véritable anonymisation. Enfin, préparez cinq questions qui contrôlent le comportement de stockage des données de l'outil d'IA que vous utilisez et ajoutez à chacune la réponse « sécurisée » que vous attendez.

liste de contrôle

  • [ ] J'ai déterminé la durée de conservation et la méthode de destruction de la catégorie de données.
  • [ ] J'ai inclus l'historique des discussions de l'IA dans le calendrier de destruction.
  • [ ] J'ai coché l'élément de désinscription « Ne pas utiliser dans la formation des modèles ».
  • [ ] J'ai mis en œuvre la différence entre la pseudonymisation et l'anonymisation.
  • [ ] J'ai des combinaisons de champs généralisées qui risquent d'être ré-identifiées.
  • [ ] J'ai également inclus les sauvegardes et les journaux dans la portée de la suppression.
  • [ ] J'ai audité le comportement de stockage des données de l'outil d'IA.