Jednotka 7 / 12

Zpracování, ukládání, minimalizace a anonymizace dat

zisky:

  • Aplikujte úvahy AI v každé fázi životního cyklu dat
  • Nastavte doby uchování a zahrňte historii chatů AI do zásad ničení
  • Uplatnění rozdílu mezi anonymizací a pseudonymizací

Část údajů „po“ je místo, kde pověřenec pro ochranu údajů často přehlíží. Jakmile je do AI vložen text, vypadá to, že je úloha hotová; Tato data jsou však někde uložena, možná se používají v modelovém tréninku, možná se hromadí v historii chatu měsíce. V této části probereme životní cyklus osobních údajů krok za krokem; Dozvíme se o dobách uchování, zničení historie chatů AI a rozlišení mezi dvěma kritickými technikami – anonymizací a pseudonymizací. Cílem je spravovat data po celou dobu jejich životnosti, nejen při jejich zadávání.

Životní cyklus dat a AI

Osobní údaje procházejí životním cyklem; Každá fáze má body pozornosti specifické pro AI.

Jeviště

co se stane?

AI bod pozornosti

kolekce

Data jsou získána

Je jasný účel a základ? Byl minimalizován?

Použití/zpracování

Zadáno do AI, zpracováno

Bylo provedeno maskování? Schválené vozidlo?

skladování

Data jsou uchována

Jak dlouho trvá historie chatu?

převod

jde k někomu jinému

Mezinárodní server? Existuje vhodné ujištění?

Zničení

Smazání/anonymizace

Byl smazán po splnění účelu? Jsou součástí dodávky náhradní díly?

Dvě nejvíce opomíjené fáze jsou skladování a likvidace. Data jsou „zapomenuta“ a nadále se hromadí v systému – což jak porušuje princip KVKK, tak zvětšuje škody v případě narušení.

Doba skladování: jak dlouho ji můžete uchovávat?

Zásada uchovávání KVKK je jasná: osobní údaje nelze uchovávat déle, než je nezbytné pro účel, pro který jsou zpracovávány. Když účel již není k dispozici, údaje by měly být vymazány, zničeny nebo anonymizovány. Instituce připravuje politiku skladování a likvidace; určuje, kolik si ponechat pro každou kategorii dat.

Kritický bod specifický pro AI: Historie chatu AI obsahuje také data. Pokud zaměstnanec zadává zákaznická data do stejného chatu po dobu několika měsíců, tato historie se stane úložištěm dat. Pro toto:

  • Nakonfigurujte nastavení uchovávání dat v nástrojích podnikové umělé inteligence (pokud je to možné, automaticky mažte historii nebo vypněte použití v modelovém školení).
  • Zahrňte historii chatu do plánu ničení.
  • Zajistěte ve firemní smlouvě možnost „Nepoužívat v modelovém školení“ (opt-out).
Upozornění: Smazání dat neznamená pouze jejich odstranění z obrazovky. Je třeba vzít v úvahu také zálohy, protokoly a kopie na serveru poskytovatele. Když řeknete „smazáno“, ujistěte se, že to, co jste smazali, je skutečně nenávratné.

Anonymizace nebo pseudonymizace?

Tyto dva pojmy jsou často zaměňovány, ale jejich právní důsledky jsou diametrálně odlišné.

  • Anonymizace: Zhotovování dat tak, aby je nebylo možné jakkoli spojovat s osobou. Pokud se to udělá správně, výsledkem již nejsou osobní údaje a nespadají do působnosti KVKK. Příklad: Odstranění jednotlivých řádků v souboru dat o 10 000 lidech a ponechání pouze souhrnných statistik, jako je „Průměrné výdaje ve věkové skupině 25–34 v Istanbulu“.
  • Pseudonymizace: Informace o identitě jsou nahrazeny kódem/značkou, ale lze je vrátit osobě pomocí „klíče“. Příklad: Psaní "Zákazník-4471" místo "Ahmet Yılmaz", ale ponechat tabulku ukazující, který kód patří komu. Jedná se stále o osobní údaje a spadá do působnosti KVKK.

funkce

anonymizace

Pseudonymizace

Je možné osobu vrátit?

Ne (pokud je provedeno správně)

Ano, s klíčem

Jsou to stále osobní údaje?

ne

Ano

Rozsah KVKK

venku

v

Abych se dostal do AI

Nejbezpečnější způsob

Opět je vyžadován základ/pravidlo

Tip: "Je to reverzibilní?" před zadáním dat do AI. požádat. Pokud je v něm klíč/shoda, jedná se o pseudonymizovaný a stále osobní údaj. Skutečná anonymizace je sdílení agregovaného výsledku, nikoli jednotlivých řádků.

tři mini pouzdra

Případ 1 – Falešná anonymita. Zdravotnická společnost poskytuje AI soubor dat, o kterých tvrdí, že je „anonymizovala“ pro analýzu. Ale soubor obsahuje datum narození, kraj a vzácnou diagnózu; tato trojice může označovat jedinou osobu v malém kraji. Toto není anonymizace; údaje jsou stále osobní. Správná cesta: převod data narození na věkové rozmezí, zobecnění podle okresů, seskupování vzácných diagnóz – tedy opravdová agregace.

Případ 2 – Konverzace se hromadí. V call centru zadává 6 agentů zákaznická data na stejný firemní účet AI po dobu 4 měsíců. Nikdo nečistí minulost; nakonec se na jednom místě nashromáždilo více než 12 000 zákaznických interakcí. Při auditu je toto nahromadění označeno jako hlavní riziko. Řešení: nastavení automatického odstraňování historie každých 30 dní, pravidlo pro odhlášení po dokončení úlohy a klauzule otevřená pro zásady uchovávání.

Případ 3 – Správná pseudonymizace. Při analýze výkonu zaměstnanců pomocí AI tým HR kóduje jména jako „Employee-001“ a uchovává odpovídající tabulku v samostatném souboru s omezeným přístupem. Toto je pseudonymizace; Data jsou stále osobní, ale riziko je sníženo. Tým si je vědom toho, že se nejedná o anonymizaci, a podle toho určuje svůj právní základ a dobu uchovávání.

Kopírovatelné šablony

ŠABLONA 1 — Řádek zásad uchovávání a ničení: "Navrhněte zásadu zásad uchovávání a ničení pro následující kategorii údajů: [kategorie]. Pole: doba uchování (odůvodněná účelem), metoda ničení (smazání/zničení/anonymizace), zda je zahrnuta historie chatu AI, odpovědná role. Připomeňte, pokud existuje zákonná povinnost uchování."

ŠABLONA 2 — Kontrola anonymizace: "Vyhodnoťte, zda je následující datová sada skutečně anonymní: [seznam polí]. Jaké kombinace polí by mohly člověka učinit znovu identifikovatelným (např. datum narození + PSČ + vzácný prvek)? Navrhněte zobecnění pro každé rizikové pole (jako je věkové rozmezí, úroveň provincie), abyste posílili anonymitu.“

ŠABLONA 3 — Maskování + oddělení návratového klíče: "Pseudonymujte následující text: zakódujte osobní údaje (např. [JMÉNO]->K001), ale poskytněte mi odpovídající tabulku SAMOSTATNĚ. V samotném textu neponechejte žádnou skutečnou identitu. Upozorňujeme, že odpovídající tabulka je ‚osobní údaje‘ a měla by být uložena odděleně.“

ŠABLONA 4 — Audit datového úložiště nástroje AI: "Připravte si seznam otázek k auditu chování nástroje AI, který používáme při ukládání dat: jak dlouho je uchovávána historie, lze ji smazat, používá se při školení modelu, existuje možnost odhlášení, kde se data zpracovávají, jaké jsou zálohy? Na každou otázku napište očekávanou ‚bezpečnou‘ odpověď."

Slabá výzva / Silná výzva

SLABÝ: "Anonymizujte tato data." (kóduje a ponechává jména)-> Jen přezdívky; Zůstávají rizika opětovné identifikace, jako je datum narození, vzácný rys; Vytváří iluzi „anonyma“. GÜÇLÜ: "Najděte v této sadě kombinace polí, které mohou osobu znovu identifikovat; zobecněte každé z nich (věkové rozmezí, úroveň provincie). Mým cílem není jeden záznam, ale agregovaná statistika. V důsledku toho nelze nikoho rozlišit jako jednotlivou osobu a ověřit to." -> Model směřuje ke skutečné anonymizaci, čímž se snižuje riziko opětovné identifikace.

Časté chyby

  • Záměna pseudonymizace za anonymizaci; zapomenout, že jde o osobní údaje.
  • Vymazání jmen a ponechání popisných kombinací, jako je datum narození + místo + vzácný rys.
  • Nepodřídit historii chatu AI pravidlu zachování/zničení; hromadit donekonečna.
  • Nezajištění klauzule „Nepoužívat v modelovém školení“ (opt-out) ve smlouvě.
  • Když říkám smazání, mám na mysli jen vyčistit obrazovku a zapomenout na zálohy a protokoly.
  • Uchovávání delší doby skladování pro „pro každý případ“ spíše než pro daný účel.
  • Ignorování toho, že přenos a ukládání probíhá také na serveru poskytovatele.

V souhrnu

  • Osobní údaje procházejí životním cyklem; Nejvíce opomíjené fáze jsou skladování a likvidace.
  • Údaje nesmí být uchovávány déle, než je nezbytné pro daný účel; Instituce by měla zavést politiku skladování a ničení.
  • Historie chatů AI jsou také uložená data; by měly být zahrnuty do plánu likvidace a nastavení skladování.
  • Anonymizace vyjme data z KVKK; Pseudonymizace stále ponechává data osobní.
  • Smazání jména není anonymizace; Všechny kombinace s rizikem opětovné identifikace by měly být zobecněny.

Aplikační úkol

Vyberte kategorii dat, která vaše organizace zpracovává pomocí AI (například záznamy zákaznické podpory). Napište řádek zásad uchovávání a zničení pro tuto kategorii: doba uchování (odůvodněné), metoda zničení, zda je zahrnuta historie chatu AI a odpovědná role. Poté si vezměte vzorový záznam ze stejných dat a nejprve jej pseudonymizujte (oddělenou tabulku ponechejte odděleně), poté napište, která pole budete zobecňovat a jak tento záznam dovést ke skutečné anonymizaci. Nakonec si připravte pět otázek, které řídí chování ukládání dat nástroje AI, který používáte, a ke každé přidejte „bezpečnou“ odpověď, kterou očekáváte.

kontrolní seznam

  • [ ] Stanovil jsem dobu uchování a způsob zničení pro kategorii dat.
  • [ ] Zahrnul jsem historii chatu AI do plánu ničení.
  • [ ] Zaškrtl jsem odhlašovací položku „Nepoužívat v modelovém tréninku“.
  • [ ] Implementoval jsem rozdíl mezi pseudonymizací a anonymizací.
  • [ ] Zobecnil jsem kombinace polí, u kterých existuje riziko opětovné identifikace.
  • [ ] Do rozsahu mazání jsem zahrnul i zálohy a protokoly.
  • [ ] Auditoval jsem chování nástroje AI při ukládání dat.