Vienība 7 / 12

Datu apstrāde, glabāšana, minimizēšana un anonimizācija

Ieguvumi:

  • Pielietojiet AI apsvērumus katrā datu dzīves cikla posmā
  • Iestatiet saglabāšanas periodus un iekļaujiet AI tērzēšanas vēsturi iznīcināšanas politikā
  • Atšķirības piemērošana starp anonimizāciju un pseidonimizāciju

Datu “pēc” daļa ir vieta, kur datu aizsardzības inspektors bieži neievēro. Kad teksts ir ievadīts AI, šķiet, ka darbs ir paveikts; Taču tie dati kaut kur tiek glabāti, varbūt izmantoti modeļu apmācībā, varbūt čata vēsturē krājas mēnešiem ilgi. Šajā nodaļā soli pa solim apspriedīsim personas datu dzīves ciklu; Mēs uzzināsim par saglabāšanas periodiem, mākslīgā intelekta tērzēšanas vēstures iznīcināšanu un divu kritisko metožu atšķiršanu — anonimizāciju un pseidonimizāciju. Mērķis ir pārvaldīt datus visā to dzīves laikā, nevis tikai ievadīšanas laikā.

Datu dzīves cikls un AI

Personas dati iziet cauri dzīves ciklam; Katrā posmā ir AI specifiski uzmanības punkti.

Skatuves

Kas notiek?

AI uzmanības punkts

kolekcija

Dati tiek iegūti

Vai ir skaidrs mērķis un pamats? Vai tas ir samazināts līdz minimumam?

Lietošana/apstrāde

Ievadīts AI, apstrādāts

Vai maskēšana ir veikta? Apstiprināts transportlīdzeklis?

uzglabāšana

Dati tiek saglabāti

Cik ilgi saglabājas tērzēšanas vēsture?

nodošana

aiziet pie kāda cita

Starptautisks serveris? Vai ir atbilstoša garantija?

Iznīcināšana

Dzēšana/anonimizēšana

Vai tas tika izdzēsts pēc mērķa sasniegšanas? Vai ir iekļautas rezerves daļas?

Divi visvairāk atstātie posmi ir uzglabāšana un iznīcināšana. Dati tiek "aizmirsti" un turpina uzkrāties sistēmā, kas gan pārkāpj KVKK principu, gan palielina bojājumus pārkāpuma gadījumā.

Uzglabāšanas laiks: cik ilgi jūs varat to uzglabāt?

KVKK saglabāšanas princips ir skaidrs: personas datus nevar glabāt ilgāk, nekā nepieciešams to apstrādes mērķim. Kad mērķis vairs nav pieejams, dati ir jādzēš, jāiznīcina vai jāanonimizē. Iestāde sagatavo uzglabāšanas un utilizācijas politiku; nosaka, cik daudz saglabāt katrai datu kategorijai.

Kritiskais punkts, kas raksturīgs AI: AI tērzēšanas vēstures arī tiek saglabāti dati. Ja darbinieks vairākus mēnešus ir ievadījis klienta datus vienā tērzēšanā, šī vēsture kļūst par datu krātuvi. Šim nolūkam:

  • Konfigurējiet datu saglabāšanas iestatījumus uzņēmuma AI rīkos (ja iespējams, automātiski dzēsiet vēsturi vai izslēdziet izmantošanu modeļu apmācībā).
  • Iekļaujiet iznīcināšanas grafikā tērzēšanas vēsturi.
  • Korporatīvajā līgumā nodrošiniet opciju "Nelietot modeļu apmācībā" (atteikšanās).
Uzmanību! Datu dzēšana nav tikai to noņemšana no ekrāna. Jāņem vērā arī dublējumkopijas, žurnāli un kopijas pakalpojumu sniedzēja serverī. Kad sakāt "dzēsts", pārliecinieties, vai izdzēstais ir patiešām neatgriezenisks.

Anonimizācija vai pseidonimizācija?

Šie divi termini bieži tiek sajaukti, taču to juridiskās sekas ir diametrāli pretējas.

  • Anonimizācija: datu izveidošana, lai tos nekādā veidā nevarētu saistīt ar personu. Ja tas izdarīts pareizi, rezultāts vairs nav personas dati un neietilpst KVKK darbības jomā. Piemērs: dzēst atsevišķas rindas datu kopā ar 10 000 personām un atstājot tikai apkopotu statistiku, piemēram, "Vidējie tēriņi vecuma grupā no 25 līdz 34 gadiem Stambulā".
  • Pseidonimizācija: identitātes informācija tiek aizstāta ar kodu/birku, bet to var atgriezt personai ar "atslēgu". Piemērs: "Ahmet Yılmaz" vietā ierakstiet "Customer-4471", bet saglabājiet tabulu, kurā norādīts, kurš kods kuram pieder. Tie joprojām ir personas dati un ietilpst KVKK darbības jomā.

funkciju

Anonimizācija

Pseidonimizācija

Vai personu var atgriezt?

Nē (ja izdarīts pareizi)

Jā, ar atslēgu

Vai tie joprojām ir personas dati?

KVKK darbības joma

ārpusē

iekšā

Lai iekļūtu AI

Drošākais veids

Atkal ir nepieciešams pamats/noteikums

Padoms: "Vai tas ir atgriezenisks?" pirms datu ievadīšanas AI. jautāt. Ja tajā ir atslēga/atbilstība, tā ir pseidonimizēta un joprojām ir personas dati. Patiesa anonimizācija ir apkopotā rezultāta, nevis atsevišķu rindu kopīgošana.

trīs mini futrāļi

1. gadījums — viltota anonimitāte. Veselības aprūpes uzņēmums sniedz AI datu kopu, kas, pēc tā teiktā, ir “anonimizēts” analīzei. Bet komplektā ir dzimšanas datums, novads un reta diagnoze; šī trijotne var norādīt uz vienu cilvēku nelielā novadā. Tā nav anonimizācija; dati joprojām ir personiski. Pareizais veids: dzimšanas datuma pārvēršana vecuma diapazonā, vispārināšana pēc apgabaliem, retu diagnozes grupēšana, tas ir, patiesa apkopošana.

2. gadījums — saruna uzkrājas. Zvanu centrā 6 aģenti ievada klientu datus vienā korporatīvajā AI kontā 4 mēnešus. Neviens neiztīra pagātni; galu galā vairāk nekā 12 000 klientu mijiedarbības tika uzkrātas vienuviet. Revīzijā šī uzkrāšanās tiek atzīmēta kā galvenais risks. Risinājums: iestatījums automātiskai vēstures dzēšanai ik pēc 30 dienām, noteikums, lai pēc darba pabeigšanas izietu, un saglabāšanas politikas klauzula.

3. gadījums — pareiza pseidonimizācija. Analizējot darbinieku veiktspēju ar AI, HR komanda kodē tādus nosaukumus kā “Darbinieks-001” un saglabā atbilstības tabulu atsevišķā failā ar ierobežotu piekļuvi. Tā ir pseidonimizācija; Dati joprojām ir personiski, taču risks ir samazināts. Komanda apzinās, ka tā nav anonimizācija, un attiecīgi nosaka tās juridisko pamatu un glabāšanas periodu.

Kopējamas veidnes

1. VEINNE — saglabāšanas un iznīcināšanas politikas rindiņa: "Ierosiniet saglabāšanas-iznīcināšanas politikas rindiņu šādai datu kategorijai: [kategorija]. Lauki: saglabāšanas periods (pamatots ar mērķi), iznīcināšanas metode (dzēšana/iznīcināšana/anonimizācija), vai ir iekļauta AI tērzēšanas vēsture, atbildīgā loma. Atgādināt, ja pastāv juridisks saglabāšanas pienākums."

2. VEINE — anonimizācijas pārbaude: "Novērtējiet, vai šī datu kopa patiešām ir anonīma: [saraksta lauki]. Kādas lauku kombinācijas var padarīt personu atkārtoti identificējamu (piemēram, dzimšanas datums + pasta indekss + reta iezīme)? Ierosiniet vispārinājumu katram riska laukam (piemēram, vecuma diapazonam, provinces līmenim), lai stiprinātu anonimitāti."

3. VEINNE — maskēšana un atgriešanas atslēgas atdalīšana: "Pseidonīms šādam tekstam: kodējiet personas datus (piemēram, [VĀRDS]->K001), bet iedodiet man atbilstības tabulu ATSEVIŠĶI. Pašā tekstā neatstājiet īstu identitāti. Ņemiet vērā, ka atbilstības tabula ir "personas dati", un tā ir jāuzglabā atsevišķi."

4. VEINNE — AI rīka datu glabāšanas audits: "Sagatavojiet jautājumu sarakstu, lai pārbaudītu mūsu izmantotā AI rīka datu glabāšanas darbību: cik ilgi tiek glabāta vēsture, vai to var dzēst, vai to izmanto modeļu apmācībā, vai ir atteikšanās, kur tiek apstrādāti dati, kādi ir dublējumkopijas? Uzrakstiet paredzamo "drošo" atbildi uz katru jautājumu."

Vāja uzvedne / spēcīga uzvedne

VĀJS: "Anonimizēt šos datus." (kodē un atstāj vārdus)-> Tikai segvārdi; Atkārtotas identifikācijas riski saglabājas, piemēram, dzimšanas datums, reta iezīme; Tas rada ilūziju par "anonīmu". GÜÇLÜ: "Atrodiet šajā kopā lauku kombinācijas, kas var atkārtoti identificēt personu; vispāriniet katru no tām (vecuma diapazons, provinces līmenis). Mans mērķis nav atsevišķs ieraksts, bet gan apkopota statistika. Rezultātā nevienu nevar atšķirt kā vienu personu un pārbaudīt to." -> Modelim ir tendence uz patiesu anonimizāciju, samazinot atkārtotas identifikācijas risku.

Biežas kļūdas

  • Kļūdains pseidonimizācija ar anonimizāciju; aizmirstot, ka tie paliek personas dati.
  • Dzēšot vārdus un atstājot aprakstošas ​​kombinācijas, piemēram, dzimšanas datums + atrašanās vieta + reta iezīme.
  • Nepakļauts AI tērzēšanas vēsturei saglabāšanas/iznīcināšanas noteikumam; uzkrāties uz nenoteiktu laiku.
  • Nenodrošinot līgumā punktu "Nelietot modeļu apmācībā" (atteikšanās).
  • Kad es saku dzēšanu, es domāju vienkārši notīrīt ekrānu un aizmirst par dublēšanu un žurnāliem.
  • Glabāšanas periods ilgāks "katram gadījumam", nevis mērķim.
  • Ignorējot, ka pārsūtīšana un uzglabāšana notiek arī pakalpojumu sniedzēja serverī.

Rezumējot

  • Personas dati iziet cauri dzīves ciklam; Visvairāk novārtā atstātie posmi ir uzglabāšana un iznīcināšana.
  • Datus nedrīkst glabāt ilgāk, nekā nepieciešams mērķim; Iestādei jāizveido uzglabāšanas un iznīcināšanas politika.
  • AI tērzēšanas vēsture ir arī saglabāti dati; jāiekļauj utilizācijas grafikā un uzglabāšanas iestatījumos.
  • Anonimizācija izņem datus no KVKK; Pseidonimizācija joprojām atstāj personas datus.
  • Vārda dzēšana nav anonimizācija; Visas kombinācijas, kurām ir atkārtotas identifikācijas risks, ir jāvispārzina.

Lietojumprogrammas uzdevums

Izvēlieties datu kategoriju, ko jūsu organizācija apstrādā ar AI (piemēram, klientu atbalsta ieraksti). Uzrakstiet šīs kategorijas saglabāšanas un iznīcināšanas politikas rindiņu: saglabāšanas periods (attaisnots), iznīcināšanas metode, vai ir iekļauta AI tērzēšanas vēsture un atbildīgā loma. Pēc tam ņemiet ieraksta paraugu no tiem pašiem datiem un vispirms pseidonimizējiet to (atbilstības tabulu turiet atsevišķi), pēc tam ierakstiet, kurus laukus vispārināt un kā panākt šī ieraksta patieso anonimizāciju. Visbeidzot, sagatavojiet piecus jautājumus, kas kontrolē izmantotā AI rīka datu glabāšanas uzvedību, un pievienojiet katram no tiem “drošo” atbildi, kuru gaidāt.

kontrolsaraksts

  • [ ] Esmu noteicis datu kategorijai glabāšanas termiņu un iznīcināšanas metodi.
  • [ ] Esmu iznīcināšanas grafikā iekļāvis AI tērzēšanas vēsturi.
  • [ ] Es atzīmēju atteikšanās vienumu "Nelietot modeļu apmācībā".
  • [ ] Es ieviesu atšķirību starp pseidonimizāciju un anonimizāciju.
  • [ ] Man ir vispārinātas lauku kombinācijas, kuras ir pakļautas atkārtotas identifikācijas riskam.
  • [ ] Es arī iekļāvu dublējumus un žurnālus dzēšanas jomā.
  • [ ] Es pārbaudīju AI rīka datu uzglabāšanas darbību.