Enota 7 / 12

Obdelava podatkov, shranjevanje, minimizacija in anonimizacija

Dobički:

  • Uporabite vidike umetne inteligence na vsaki stopnji življenjskega cikla podatkov
  • Nastavite obdobja hrambe in vključite zgodovine klepetov AI v politiko uničenja
  • Uporaba razlike med anonimizacijo in psevdonimizacijo

Pooblaščena oseba za varstvo podatkov pogosto spregleda del podatkov »po tem«. Ko je besedilo vneseno v AI, je videti, kot da je delo opravljeno; Vendar so ti podatki nekje shranjeni, morda uporabljeni pri usposabljanju modela, morda se več mesecev kopičijo v zgodovini klepeta. V tej enoti bomo korak za korakom obravnavali življenjski cikel osebnih podatkov; Spoznali bomo obdobja hrambe, uničenje zgodovine klepetov z umetno inteligenco in razlikovanje med dvema kritičnima tehnikama – anonimizacijo in psevdonimizacijo. Cilj je upravljati podatke skozi celotno življenjsko dobo, ne le ob vnosu.

Življenjski cikel podatkov in AI

Osebni podatki gredo skozi življenjski cikel; Vsaka stopnja ima točke pozornosti, specifične za AI.

Oder

kaj se zgodi

Točka pozornosti AI

zbirka

Podatki so pridobljeni

Sta namen in osnova jasna? Ali je bil zmanjšan?

Uporaba/predelava

Vneseno v AI, obdelano

Je maskiranje opravljeno? Homologirano vozilo?

shranjevanje

Podatki se hranijo

Kako dolgo traja zgodovina klepeta?

prenos

gre nekomu drugemu

Mednarodni strežnik? Ali obstaja ustrezno zagotovilo?

Uničenje

Izbris/anonimizacija

Ali je bil izbrisan, potem ko je bil namen izpolnjen? Ali so rezervni deli vključeni?

Dve najbolj zanemarjeni fazi sta skladiščenje in odlaganje. Podatki so »pozabljeni« in se še naprej kopičijo v sistemu — kar je v nasprotju z načelom KVKK in povečuje škodo v primeru vdora.

Čas shranjevanja: kako dolgo ga lahko hranite?

Načelo hrambe KVKK je jasno: osebnih podatkov ni mogoče hraniti dlje, kot je potrebno za namen, za katerega se obdelujejo. Ko namen ni več na voljo, je treba podatke izbrisati, uničiti ali anonimizirati. Zavod pripravi pravilnik o skladiščenju in odlaganju; določa, koliko hraniti za vsako kategorijo podatkov.

Kritična točka, specifična za AI: zgodovine klepetov AI so tudi shranjeni podatki. Če je zaposleni mesece vnesel podatke o strankah v isti klepet, ta zgodovina postane skladišče podatkov. Za to:

  • Konfigurirajte nastavitve hrambe podatkov v orodjih umetne inteligence podjetja (samodejno izbrišite zgodovino, če je mogoče, ali izklopite uporabo pri usposabljanju modela).
  • V svoj urnik uničenja vključite zgodovino klepetov.
  • V podjetniški pogodbi zagotovite možnost »Ne uporabljaj pri usposabljanju modelov« (opt-out).
Pozor: Brisanje podatkov ni le odstranitev z zaslona. Upoštevati je treba tudi varnostne kopije, dnevnike in kopije na strežniku ponudnika. Ko rečete "izbrisano", se prepričajte, da je tisto, kar ste izbrisali, resnično nepovratno.

Anonimizacija ali psevdonimizacija?

Ta dva pojma se pogosto zamenjuje, vendar so njune pravne posledice diametralno nasprotne.

  • Anonimizacija: Izdelava podatkov tako, da jih ni mogoče na noben način povezati z osebo. Če je opravljen pravilno, rezultat ni več osebni podatek in ne spada v okvir KVKK. Primer: brisanje posameznih vrstic v podatkovnem nizu 10.000 ljudi in pustimo samo združene statistične podatke, kot je »Povprečna poraba v starostni skupini 25–34 let v Istanbulu«.
  • Psevdonimizacija: informacije o identiteti se nadomestijo s kodo/oznako, vendar jih je mogoče vrniti osebi s "ključem". Primer: pisanje "Stranka-4471" namesto "Ahmet Yılmaz", vendar ohranite tabelo, ki prikazuje, katera koda komu pripada. To je še vedno osebni podatek in spada v področje delovanja KVKK.

funkcija

Anonimizacija

Psevdonimizacija

Ali je mogoče osebo vrniti?

Ne (če je opravljeno pravilno)

Da, s ključem

Ali gre še za osebne podatke?

št

ja

Obseg KVKK

zunaj

v

Da vstopim v AI

Najvarnejši način

Spet je potrebna podlaga/pravilo

Nasvet: "Ali je reverzibilno?" preden vnesete podatke v AI. vprašaj. Če je v njem ključ/ujemanje, je psevdonimiziran in še vedno oseben podatek. Prava anonimizacija je deljenje združenega rezultata, ne posameznih vrstic.

trije mini kovčki

1. primer – Lažna anonimnost. Zdravstveno podjetje daje AI niz podatkov, za katere pravi, da jih je "anonimiziralo" za analizo. Toda komplet vključuje datum rojstva, državo in redko diagnozo; ta trio lahko nakazuje eno samo osebo v majhnem okraju. To ni anonimizacija; podatki so še vedno osebni. Pravi način: pretvorba datuma rojstva v starostno skupino, posploševanje po okrožjih, združevanje redkih diagnoz - to je pravo združevanje.

2. primer – Pogovor se kopiči. V klicnem centru 6 agentov 4 mesece vnaša podatke o strankah v isti račun podjetja z umetno inteligenco. Nihče ne čisti preteklosti; na koncu se je na enem mestu zbralo več kot 12.000 interakcij strank. Pri reviziji je to kopičenje označeno kot veliko tveganje. Rešitev: nastavitev za samodejno brisanje zgodovine vsakih 30 dni, pravilo za odjavo, ko je opravilo končano, in odprta klavzula za politiko hrambe.

Primer 3 – Pravilna psevdonimizacija. Pri analizi uspešnosti zaposlenih z umetno inteligenco kadrovska ekipa kodira imena, kot je »Zaposleni-001«, in hrani tabelo ujemanja v ločeni datoteki z omejenim dostopom. To je psevdonimizacija; Podatki so še vedno osebni, vendar je tveganje zmanjšano. Ekipa se zaveda, da ne gre za anonimizacijo in temu primerno določa pravno podlago in rok hrambe.

Kopirane predloge

PREDLOGA 1 — Vrstica pravilnika o hrambi in uničenju: "Predlagajte vrstico pravilnika o hrambi-uničenju za naslednjo kategorijo podatkov: [kategorija]. Polja: obdobje hrambe (utemeljeno z namenom), metoda uničenja (brisanje/uničenje/anonimizacija), ali je vključena zgodovina klepetov AI, odgovorna vloga. Opomnite, ali obstaja zakonska obveznost hrambe."

PREDLOGA 2 — Preverjanje anonimizacije: "Ocenite, ali je naslednji nabor podatkov resnično anonimen: [seznam polj]. Katere kombinacije polj bi lahko omogočile identifikacijo osebe (npr. datum rojstva + poštna številka + redka značilnost)? Predlagajte posplošitev za vsako polje tveganja (kot je starostna skupina, raven province), da okrepite anonimnost."

PREDLOGA 3 — Maskiranje + ločevanje vrnitvenega ključa: "Psevdonim naslednje besedilo: kodirajte osebne podatke (kot je [IME]->K001), vendar mi dajte ujemajočo se tabelo LOČENO. V samem besedilu ne pustite prave identitete. Upoštevajte, da je ujemajoča se tabela 'osebni podatki' in jo je treba shraniti ločeno."

PREDLOGA 4 — Revizija shranjevanja podatkov orodja AI: "Pripravite seznam vprašanj za revizijo vedenja shranjevanja podatkov orodja AI, ki ga uporabljamo: kako dolgo se hrani zgodovina, ali jo je mogoče izbrisati, ali se uporablja pri usposabljanju modela, ali obstaja možnost zavrnitve, kje se obdelujejo podatki, kakšne so varnostne kopije? Na vsako vprašanje napišite pričakovan 'varen' odgovor."

Šibek poziv/močan poziv

WEAK: "Anonimiziraj te podatke." (kodira in pusti imena)-> Samo vzdevki; Tveganja ponovne identifikacije ostajajo, kot so datum rojstva, redka lastnost; Ustvarja iluzijo "anonimnosti". GÜÇLÜ: "Poiščite kombinacije polj v tem nizu, ki lahko ponovno identificirajo osebo; posplošite vsako od njih (starostni razpon, raven province). Moj cilj ni en sam zapis, ampak združena statistika. Posledično nikogar ni mogoče ločiti kot eno osebo in to preveriti." -> Model teži k resnični anonimizaciji, kar zmanjšuje tveganje ponovne identifikacije.

Pogoste napake

  • Zamenjevanje psevdonimizacije za anonimizacijo; pozabljamo, da ostajajo osebni podatki.
  • Brisanje imen in puščanje opisnih kombinacij, kot so datum rojstva + lokacija + redka lastnost.
  • Za zgodovino klepetov AI ne velja pravilo hrambe/uničenja; kopičijo v nedogled.
  • Nezagotavljanje klavzule "Ne uporabljaj pri usposabljanju modelov" (opt-out) v pogodbi.
  • Ko rečem brisanje, mislim samo počistite zaslon in pozabite na varnostne kopije in dnevnike.
  • Daljše obdobje shranjevanja za "za vsak slučaj" in ne za ta namen.
  • Ob tem, da prenos in shranjevanje poteka tudi na strežniku ponudnika.

Če povzamem

  • Osebni podatki gredo skozi življenjski cikel; Najbolj zanemarjeni fazi sta skladiščenje in odlaganje.
  • Podatki se ne smejo hraniti dlje, kot je potrebno za ta namen; Institucija mora vzpostaviti politiko shranjevanja in uničenja.
  • Tudi zgodovine klepetov AI so shranjeni podatki; je treba vključiti v razpored odstranjevanja in nastavitve shranjevanja.
  • Anonimizacija odvzame podatke iz KVKK; Psevdonimizacija še vedno pušča podatke osebne.
  • Brisanje imena ni anonimizacija; Vse kombinacije, pri katerih obstaja tveganje ponovne identifikacije, je treba posplošiti.

Aplikacijska naloga

Izberite kategorijo podatkov, ki jih vaša organizacija obdeluje z AI (na primer zapisi podpore strankam). Napišite vrstico pravilnika o hrambi in uničenju za to kategorijo: obdobje hrambe (utemeljeno), metoda uničenja, ali je vključena zgodovina klepetov AI in odgovorna vloga. Nato iz istih podatkov vzemite vzorčni zapis in ga najprej psevdonimizirajte (tabelo ujemanja imejte ločeno), nato napišite, katera polja boste posplošili in kako ta zapis spraviti v pravo anonimizacijo. Na koncu pripravite pet vprašanj, ki nadzorujejo vedenje orodja AI za shranjevanje podatkov, ki ga uporabljate, in vsakemu dodajte »varen« odgovor, ki ga pričakujete.

kontrolni seznam

  • [ ] Za kategorijo podatkov sem določil obdobje hrambe in način uničenja.
  • [ ] Zgodovino klepetov AI sem vključil v urnik uničenja.
  • [ ] Označil sem možnost zavrnitve »Ne uporabljaj pri usposabljanju modelov«.
  • [ ] Implementiral sem razliko med psevdonimizacijo in anonimizacijo.
  • [ ] Imam splošne kombinacije polj, ki so v nevarnosti ponovne identifikacije.
  • [ ] V obseg brisanja sem vključil tudi varnostne kopije in dnevnike.
  • [ ] Pregledal sem vedenje orodja AI za shranjevanje podatkov.