Câștiguri:
- Aplicați considerentele AI în fiecare etapă a ciclului de viață a datelor
- Setați perioade de păstrare și includeți istoricul chatului AI în politica de distrugere
- Aplicarea diferenței dintre anonimizare și pseudonimizare
Partea „după” a datelor este locul în care un responsabil cu protecția datelor trece adesea cu vederea. Odată ce un text este introdus în AI, se pare că treaba este gata; Cu toate acestea, acele date sunt stocate undeva, poate folosite în antrenamentul modelului, poate se acumulează în istoricul chat-ului timp de luni de zile. În această unitate, vom discuta pas cu pas ciclul de viață al datelor cu caracter personal; Vom învăța despre perioadele de păstrare, distrugerea istoriilor de chat AI și distingerea între două tehnici critice - anonimizarea și pseudonimizarea. Scopul este de a gestiona datele pe parcursul întregii vieți, nu doar atunci când sunt introduse.
Ciclul de viață al datelor și AI
Datele personale trec printr-un ciclu de viață; Fiecare etapă are puncte de atenție specifice AI.
Scena
Ce se întâmplă?
Punct de atenție AI
colectare
Se obțin date
Sunt clare scopul și baza? A fost minimizat?
Utilizare/prelucrare
Intrat în AI, procesat
S-a făcut mascare? Vehicul omologat?
depozitare
Datele sunt păstrate
Cât durează istoricul chat-urilor?
transfer
merge la altcineva
Server international? Există o asigurare adecvată?
Distrugerea
Ștergere/anonimizare
A fost ștearsă după îndeplinirea scopului? Sunt incluse piesele de schimb?
Cele două etape cele mai neglijate sunt depozitarea și eliminarea. Datele sunt „uitate” și continuă să se acumuleze în sistem – ceea ce încalcă principiul KVKK și amplifica daunele în cazul unei încălcări.
Timp de depozitare: cât timp îl puteți păstra?
Principiul de păstrare al KVKK este clar: datele cu caracter personal nu pot fi păstrate mai mult decât este necesar pentru scopul pentru care sunt prelucrate. Atunci când scopul nu mai este disponibil, datele trebuie șterse, distruse sau anonimizate. Instituția întocmește o politică de depozitare și eliminare; determină cât să păstreze pentru fiecare categorie de date.
Punct critic specific AI: istoriile de chat AI sunt, de asemenea, date stocate. Dacă un angajat a introdus datele clienților în același chat timp de luni de zile, acel istoric devine un depozit de date. Pentru aceasta:
- Configurați setările de păstrare a datelor în instrumentele AI ale întreprinderii (ștergeți automat istoricul, dacă este posibil sau dezactivați utilizarea în formarea modelului).
- Includeți istoricul chatului în programul dvs. de distrugere.
- Asigurați-vă că opțiunea „Nu utilizați în formarea modelului” (opt-out) din contractul corporativ.
Atenție: ștergerea datelor nu înseamnă doar ștergerea lor de pe ecran. Ar trebui luate în considerare și copiile de rezervă, jurnalele și copiile de pe serverul furnizorului. Când spui „șters”, asigură-te că ceea ce ai șters este cu adevărat irecuperabil.
Anonimizare sau pseudonimizare?
Acești doi termeni sunt adesea confundați, dar consecințele lor juridice sunt diametral opuse.
- Anonimizare: Realizarea datelor astfel încât să nu poată fi asociate cu o persoană în niciun fel. Dacă este făcut corect, rezultatul nu mai este date cu caracter personal și nu intră în domeniul de aplicare al KVKK. Exemplu: ștergerea rândurilor individuale dintr-un set de date de 10.000 de persoane și lăsarea doar a statisticilor agregate, cum ar fi „Cheltuieli medii în grupa de vârstă 25-34 de ani în Istanbul”.
- Pseudonimizare: Informațiile de identitate sunt înlocuite cu un cod/etichetă, dar pot fi returnate persoanei cu o „cheie”. Exemplu: scriind „Client-4471” în loc de „Ahmet Yılmaz”, dar păstrând un tabel care arată codul cui aparține. Acestea sunt încă date cu caracter personal și intră în domeniul de aplicare al KVKK.
caracteristică
Anonimizare
Pseudonimizare
Persoana poate fi returnată?
Nu (dacă este făcut corect)
Da, cu cheia
Mai sunt date personale?
nu
Da
domeniul KVKK
afara
in
Pentru a intra în AI
Cel mai sigur mod
Din nou, este necesară o bază/o regulă
Sfat: „Este reversibil?” înainte de a introduce date în AI. intreaba. Dacă există o cheie/potrivire în ea, aceasta este pseudonimizată și totuși date personale. Anonimizarea adevărată înseamnă partajarea rezultatului agregat, nu rândurilor individuale.
trei mini cutii
Cazul 1 – Fals anonimat. O companie de asistență medicală oferă AI un set de date despre care spune că le-a „anonimizat” pentru analiză. Dar setul include data nașterii, județul și un diagnostic rar; acest trio poate indica o singură persoană dintr-un județ mic. Aceasta nu este anonimizare; datele sunt încă personale. Calea corectă: conversia datei nașterii în intervalul de vârstă, generalizarea pe județ, gruparea diagnosticelor rare, adică o agregare adevărată.
Cazul 2 — Conversația se adună. Într-un call center, 6 agenți introduc datele clienților în același cont AI corporativ timp de 4 luni. Nimeni nu curăță trecutul; în cele din urmă, peste 12.000 de interacțiuni cu clienții s-au acumulat într-un singur loc. Într-un audit, această acumulare este marcată ca un risc major. Soluție: setarea pentru ștergerea automată a istoricului la fiecare 30 de zile, o regulă de deconectare când lucrarea este terminată și o clauză deschisă politicii de reținere.
Cazul 3 — Pseudonimizare corectă. Când analizează performanța angajaților cu AI, o echipă de resurse umane codifică nume precum „Angajat-001” și păstrează tabelul de potrivire într-un fișier separat, cu acces restricționat. Aceasta este pseudonimizare; Datele sunt încă personale, dar riscul este redus. Echipa este conștientă că aceasta nu este anonimizare și își determină temeiul legal și perioada de păstrare în consecință.
Șabloane copiabile
MODEL 1 — Linia de politică de reținere și distrugere: „Propuneți o linie de politică de reținere-distrugere pentru următoarea categorie de date: [categorie]. Câmpuri: perioadă de păstrare (justificată prin scop), metodă de distrugere (ștergere/distrugere/anonimizare), dacă este inclus istoricul chatului AI, rol responsabil. Amintiți dacă există o obligație legală de reținere."
ȘABLAN 2 — Verificarea anonimizării: „Evaluați dacă următorul set de date este cu adevărat anonim: [lista câmpuri]. Ce combinații de câmpuri ar putea face o persoană reidentificabilă (de exemplu, data nașterii + cod poștal + caracteristică rară)? Sugerați o generalizare pentru fiecare câmp de risc (cum ar fi intervalul de vârstă, nivelul de provincie) pentru a consolida anonimatul."
ȘABLAN 3 — Mascare + separare cheie de retur: „Pseudonim următorul text: codifică datele personale (cum ar fi [NUME]->K001), dar dă-mi un tabel de potrivire SEPARAT. Nu lăsați identitate reală în textul în sine. Rețineți că tabelul de potrivire este „date cu caracter personal” și ar trebui să fie stocat separat.”
ȘABLAN 4 — Auditul stocării datelor instrumentului AI: „Pregătiți o listă de întrebări pentru a audita comportamentul de stocare a datelor al instrumentului AI pe care îl folosim: cât timp este păstrat istoricul, poate fi șters, este folosit în antrenamentul modelului, există opt-out, unde sunt procesate datele, care sunt copiile de rezervă? Scrieți răspunsul „securizat” așteptat la fiecare întrebare.”
Prompt slab / Prompt puternic
SLAB: „Anonimizați aceste date”. (codifică și lasă numele)-> Doar porecle; Riscurile de reidentificare rămân, cum ar fi data nașterii, trăsături rare; Se creează iluzia de „anonim”. GÜÇLÜ: "Găsiți combinații de câmpuri în acest set care pot reidentifica persoana; generalizați fiecare dintre ele (interval de vârstă, nivel de provincie). Scopul meu nu este o singură înregistrare, ci statistici agregate. Ca urmare, nimeni nu poate fi distins ca o singură persoană și nu poate verifica acest lucru." -> Modelul tinde spre anonimizarea adevărată, reducând riscul de reidentificare.
Greșeli comune
- Confundarea pseudonimizării cu anonimizarea; uitând că rămân date personale.
- Ștergerea numelor și lăsarea combinațiilor descriptive precum data nașterii + locația + trăsătură rară.
- Nu supune istoricul chatului AI unei reguli de păstrare/distrugere; se acumulează la infinit.
- Neasigurarea clauzei „Nu utilizați în formarea modelului” (opt-out) din contract.
- Când spun ștergere, vreau să spun doar ștergeți ecranul și uitați de copiile de siguranță și de jurnalele.
- Păstrarea perioadei de depozitare mai lungă pentru „doar în caz”, mai degrabă decât pentru scop.
- Ignorând faptul că transferul și stocarea au loc și pe serverul furnizorului.
Pe scurt
- Datele personale trec printr-un ciclu de viață; Cele mai neglijate etape sunt depozitarea și eliminarea.
- Datele nu pot fi păstrate mai mult decât este necesar scopului; Instituția ar trebui să stabilească o politică de depozitare și distrugere.
- Istoricile de chat AI sunt, de asemenea, date stocate; ar trebui incluse în programul de eliminare și în setările de depozitare.
- Anonimizarea scoate datele din KVKK; Pseudonimizarea lasă în continuare datele personale.
- Ștergerea unui nume nu este anonimizare; Toate combinațiile cu risc de reidentificare ar trebui generalizate.
Sarcina de aplicare
Alegeți o categorie de date pe care organizația dvs. le prelucrează cu AI (de exemplu, înregistrările de asistență pentru clienți). Scrieți o linie de politică de păstrare și distrugere pentru această categorie: perioada de păstrare (justificată), metoda de distrugere, dacă este inclus istoricul chatului AI și rolul responsabil. Apoi luați un eșantion de înregistrare din aceleași date și mai întâi pseudonimizați-o (păstrați separat tabelul de potrivire), apoi scrieți ce câmpuri veți generaliza și cum să aduceți această înregistrare la anonimizarea adevărată. În cele din urmă, pregătiți cinci întrebări care controlează comportamentul de stocare a datelor al instrumentului AI pe care îl utilizați și adăugați răspunsul „securizat” pe care îl așteptați la fiecare.
lista de verificare
- [ ] Am stabilit perioada de păstrare și metoda de distrugere pentru categoria de date.
- [ ] Am inclus istoricul chatului AI în programul de distrugere.
- [ ] Am bifat elementul de renunțare „Nu utilizați în formarea modelului”.
- [ ] Am implementat diferența dintre pseudonimizare și anonimizare.
- [ ] Am combinații de câmpuri generalizate care riscă să fie reidentificate.
- [ ] Am inclus, de asemenea, copiile de rezervă și jurnalele în domeniul de ștergere.
- [ ] Am auditat comportamentul de stocare a datelor al instrumentului AI.