Gevinster:
- Anvend AI-overvejelser på alle stadier af datalivscyklussen
- Indstil opbevaringsperioder og medtag AI-chathistorier i destruktionspolitikken
- Anvendelse af forskellen mellem anonymisering og pseudonymisering
"Efter"-delen af dataene er, hvor en databeskyttelsesansvarlig ofte overser. Når en tekst er indtastet i AI, ser det ud til, at jobbet er udført; Men disse data er gemt et sted, måske brugt i modeltræning, måske akkumuleres de i chathistorien i flere måneder. I denne enhed vil vi diskutere persondatas livscyklus trin for trin; Vi lærer om opbevaringsperioder, ødelæggelse af AI-chathistorier og skelner mellem to kritiske teknikker - anonymisering og pseudonymisering. Målet er at administrere data gennem hele dens levetid, ikke kun når de indtastes.
Datalivscyklus og AI
Personlige data gennemgår en livscyklus; Hver fase har AI-specifikke opmærksomhedspunkter.
Scene
Hvad sker der?
AI opmærksomhedspunkt
samling
Data indhentes
Er formålet og grundlaget klart? Er det blevet minimeret?
Brug/bearbejdning
Indgået i AI, behandlet
Er der blevet maskeret? Godkendt køretøj?
opbevaring
Data bevares
Hvor længe varer chathistorik?
overførsel
går til en anden
International server? Er der passende sikkerhed?
Ødelæggelse
Sletning/anonymisering
Blev den slettet efter formålet var fuldført? Er der reservedele med?
De to mest forsømte faser er opbevaring og bortskaffelse. Data "glemmes" og bliver ved med at akkumulere i systemet — hvilket både bryder med KVKK-princippet og forstørrer skaden i tilfælde af et brud.
Opbevaringstid: hvor længe kan du beholde det?
KVKKs opbevaringsprincip er klart: Personoplysninger kan ikke opbevares længere end nødvendigt til det formål, de behandles til. Når formålet ikke længere er tilgængeligt, bør data slettes, destrueres eller anonymiseres. Institutionen udarbejder en opbevarings- og bortskaffelsespolitik; bestemmer, hvor meget der skal beholdes for hver kategori af data.
Kritisk punkt specifikt for AI: AI-chathistorier er også lagrede data. Hvis en medarbejder har indtastet kundedata i den samme chat i flere måneder, bliver denne historie et datalager. Til dette:
- Konfigurer indstillinger for dataopbevaring i virksomhedens AI-værktøjer (slet historik automatisk, hvis det er muligt, eller deaktiver brug i modeltræning).
- Inkluder chathistorik i din ødelæggelsesplan.
- Sørg for muligheden "Brug ikke i modeltræning" (opt-out) i virksomhedskontrakten.
Bemærk: Sletning af data er ikke bare at fjerne dem fra skærmen. Sikkerhedskopier, logfiler og kopier på udbyderens server bør også overvejes. Når du siger "slettet", skal du sørge for, at det, du har slettet, virkelig er uigenkaldeligt.
Anonymisering eller pseudonymisering?
Disse to udtryk forveksles ofte, men deres juridiske konsekvenser er diametralt modsatte.
- Anonymisering: At lave data, så det ikke på nogen måde kan forbindes med en person. Hvis det gøres korrekt, er resultatet ikke længere persondata og falder uden for KVKKs rammer. Eksempel: Sletning af individuelle rækker i et datasæt på 10.000 personer og efterlader kun aggregerede statistikker såsom "Gennemsnitligt forbrug i aldersgruppen 25-34 i Istanbul".
- Pseudonymisering: Identitetsoplysninger erstattes med kode/tag, men kan returneres til personen med "nøgle". Eksempel: At skrive "Customer-4471" i stedet for "Ahmet Yılmaz", men holde en tabel, der viser, hvilken kode der tilhører hvem. Dette er stadig persondata og falder inden for KVKKs anvendelsesområde.
funktion
Anonymisering
Pseudonymisering
Kan personen returneres?
Nej (hvis det gøres korrekt)
Ja, med nøglen
Er det stadig personlige data?
nej
Ja
KVKK omfang
udenfor
ind
For at komme ind i AI
Den sikreste måde
Igen kræves et grundlag/regel
Tip: "Er det reversibelt?" før du indtaster data i AI. spørge. Hvis der er en nøgle/match i det, er det pseudonymiseret og stadig personlige data. Ægte anonymisering er deling af det samlede resultat, ikke individuelle rækker.
tre minisager
Sag 1 — Falsk anonymitet. En sundhedsvirksomhed giver AI et sæt data, som den siger, at den har "anonymiseret" til analyse. Men sættet inkluderer fødselsdato, amt og en sjælden diagnose; denne trio kan indikere en enkelt person i et lille amt. Dette er ikke anonymisering; data er stadig personlige. Den rigtige måde: konvertering af fødselsdato til aldersgruppe, generalisering efter amt, gruppering af sjældne diagnoser - det vil sige ægte aggregering.
Case 2 - Samtalen hober sig op. I et callcenter indtaster 6 agenter kundedata på den samme virksomheds AI-konto i 4 måneder. Ingen rydder fortiden; til sidst akkumulerede mere end 12.000 kundeinteraktioner på ét sted. Ved en revision markeres denne ophobning som en stor risiko. Løsning: indstilling til automatisk at slette historikken hver 30. dag, en regel om at logge ud, når jobbet er færdigt, og en klausul åben for opbevaringspolitikken.
Case 3 — Korrekt pseudonymisering. Når de analyserer medarbejdernes præstationer med AI, koder et HR-team navne som "Employee-001" og opbevarer den matchende tabel i en separat, adgangsbegrænset fil. Dette er pseudonymisering; Dataene er stadig personlige, men risikoen er reduceret. Teamet er klar over, at dette ikke er anonymisering og bestemmer sit juridiske grundlag og opbevaringsperiode i overensstemmelse hermed.
Kopierbare skabeloner
SKABELON 1 — Linje for opbevaring og destruktion: "Foreslå en politiklinje for opbevaring og ødelæggelse for følgende datakategori: [kategori]. Felter: opbevaringsperiode (begrundet af formålet), destruktionsmetode (sletning/destruktion/anonymisering), om AI-chathistorik er inkluderet, ansvarlig rolle. Påmind om der er en lovlig opbevaringsforpligtelse."
SKABELON 2 — Anonymiseringstjek: "Vurder, om følgende datasæt virkelig er anonymt: [listefelter]. Hvilke kombinationer af felter kunne gøre en person genidentificerbar (f.eks. fødselsdato + postnummer + sjældent element)? Foreslå en generalisering for hvert risikofelt (såsom aldersgruppe, provinsniveau) for at styrke anonymiteten."
SKABELON 3 — Maskering + returnøgleadskillelse: "Pseudonym følgende tekst: indkode personlige data (som [NAVN]->K001), men giv mig en matchende tabel SEPARAT. Efterlad ingen reel identitet i selve teksten. Bemærk, at den matchende tabel er 'personlige data' og bør opbevares separat."
SKABELON 4 — AI-værktøjets datalagringsrevision: "Forbered en liste med spørgsmål til at auditere datalagringsadfærden for det AI-værktøj, vi bruger: hvor lang tid opbevares historikken, kan den slettes, bruges den i modeltræning, er der fravalg, hvor behandles dataene, hvad er sikkerhedskopierne? Skriv det forventede 'sikre' svar på hvert spørgsmål."
Svag prompt / Stærk prompt
SWAG: "Anonymiser disse data." (koder og efterlader navnene)-> Bare kaldenavne; Der er fortsat risici for genidentifikation, såsom fødselsdato, sjældent træk; Det skaber illusionen om "anonym". GÜÇLÜ: "Find kombinationer af felter i dette sæt, der kan genidentificere personen; generaliser hver af dem (aldersinterval, provinsniveau). Mit mål er ikke en enkelt post, men aggregeret statistik. Som et resultat kan ingen skelnes som en enkelt person og verificere dette." -> Modellen har en tendens til ægte anonymisering, hvilket reducerer risikoen for genidentifikation.
Almindelige fejl
- Forveksler pseudonymisering med anonymisering; glemmer, at det forbliver personlige data.
- Sletning af navne og efterlader beskrivende kombinationer som fødselsdato + lokation + sjældent træk.
- Ikke underkaste AI-chathistorien en opbevarings-/destruktionsregel; akkumuleres i det uendelige.
- Ikke at sikre "Brug ikke i modeltræning" (opt-out)-klausulen i kontrakten.
- Når jeg siger sletning, mener jeg bare at rydde skærmen og glemme alt om sikkerhedskopier og logfiler.
- Holder opbevaringsperioden længere for "just in case" i stedet for til formålet.
- Ignorerer, at overførslen og lagringen også foregår på udbyderens server.
Sammenfattende
- Personlige data gennemgår en livscyklus; De mest forsømte stadier er opbevaring og bortskaffelse.
- Data må ikke opbevares længere end nødvendigt til formålet; Institutionen bør etablere en opbevarings- og destruktionspolitik.
- AI-chathistorier er også lagrede data; bør inkluderes i bortskaffelsesplanen og opbevaringsindstillingerne.
- Anonymisering tager data ud af KVKK; Pseudonymisering efterlader stadig dataene personlige.
- Sletning af et navn er ikke anonymisering; Alle kombinationer med risiko for genidentifikation bør generaliseres.
Ansøgningsopgave
Vælg en kategori af data, din organisation behandler med AI (f.eks. kundesupportregistreringer). Skriv en politiklinje for opbevaring og destruktion for denne kategori: opbevaringsperiode (begrundet), destruktionsmetode, om AI-chathistorik er inkluderet og ansvarlig rolle. Tag derefter en prøvepost fra de samme data og pseudonymiser den først (hold den matchende tabel adskilt), skriv derefter, hvilke felter du vil generalisere, og hvordan du bringer denne post til ægte anonymisering. Til sidst skal du forberede fem spørgsmål, der styrer datalagringsadfærden for det AI-værktøj, du bruger, og tilføj det "sikre" svar, du forventer, til hver enkelt.
tjekliste
- [ ] Jeg har bestemt opbevaringsperioden og destruktionsmetoden for datakategorien.
- [ ] Jeg har inkluderet AI-chathistorien i destruktionsplanen.
- [ ] Jeg tjekkede fravalgspunktet "Brug ikke i modeltræning".
- [ ] Jeg implementerede forskellen mellem pseudonymisering og anonymisering.
- [ ] Jeg har generaliserede feltkombinationer, der er i risiko for genidentifikation.
- [ ] Jeg inkluderede også sikkerhedskopier og logfiler i omfanget af sletning.
- [ ] Jeg reviderede AI-værktøjets datalagringsadfærd.