Zyski:
- Stosuj rozwiązania AI na każdym etapie cyklu życia danych
- Ustaw okresy przechowywania i uwzględnij historię czatów AI w zasadach niszczenia
- Stosowanie różnicy między anonimizacją a pseudonimizacją
Inspektor ochrony danych często przeocza część danych „po”. Po wprowadzeniu tekstu do AI wygląda na to, że zadanie zostało wykonane; Jednak te dane są gdzieś przechowywane, być może wykorzystywane do uczenia modeli, być może gromadzą się w historii czatów miesiącami. W tej jednostce krok po kroku omówimy cykl życia danych osobowych; Dowiemy się o okresach przechowywania, niszczeniu historii czatów AI i rozróżnieniu pomiędzy dwiema krytycznymi technikami — anonimizacją i pseudonimizacją. Celem jest zarządzanie danymi przez cały okres ich życia, a nie tylko w momencie ich wprowadzenia.
Cykl życia danych i sztuczna inteligencja
Dane osobowe przechodzą cykl życia; Na każdym etapie znajdują się punkty uwagi specyficzne dla sztucznej inteligencji.
Scena
Co się dzieje?
Punkt uwagi AI
kolekcja
Dane są uzyskiwane
Czy cel i podstawa są jasne? Czy zostało to zminimalizowane?
Używanie/przetwarzanie
Wprowadzone do AI, przetworzone
Czy wykonano maskowanie? Zatwierdzony pojazd?
przechowywanie
Dane są zachowywane
Jak długo trwa historia czatów?
transfer
idzie do kogoś innego
Międzynarodowy serwer? Czy istnieje odpowiednie zabezpieczenie?
Zniszczenie
Usunięcie/anonimizacja
Czy został usunięty po osiągnięciu celu? Czy części zamienne są wliczone w cenę?
Dwa najbardziej zaniedbywane etapy to przechowywanie i utylizacja. Dane są „zapominane” i w dalszym ciągu gromadzą się w systemie, co zarówno narusza zasadę KVKK, jak i zwiększa szkody w przypadku naruszenia.
Czas przechowywania: jak długo można go przechowywać?
Zasada przechowywania KVKK jest jasna: dane osobowe nie mogą być przechowywane dłużej, niż jest to konieczne do celów, dla których są przetwarzane. Gdy cel nie jest już dostępny, dane powinny zostać usunięte, zniszczone lub zanonimizowane. Instytucja przygotowuje politykę przechowywania i utylizacji; określa, ile zachować dla każdej kategorii danych.
Krytyczny punkt charakterystyczny dla sztucznej inteligencji: historie czatów AI są również przechowywanymi danymi. Jeśli pracownik przez wiele miesięcy wprowadzał dane klientów na tym samym czacie, ta historia staje się repozytorium danych. W tym celu:
- Skonfiguruj ustawienia przechowywania danych w narzędziach sztucznej inteligencji przedsiębiorstwa (w miarę możliwości automatycznie usuwaj historię lub wyłącz używanie w szkoleniu modeli).
- Uwzględnij historię czatów w harmonogramie niszczenia.
- Zadbaj o opcję „Nie używaj w szkoleniach modelek” (rezygnacja) w umowie korporacyjnej.
Uwaga: Usuwanie danych to nie tylko usunięcie ich z ekranu. Należy również wziąć pod uwagę kopie zapasowe, dzienniki i kopie na serwerze dostawcy. Kiedy mówisz „usunięte”, upewnij się, że tego, co usunąłeś, naprawdę nie da się odzyskać.
Anonimizacja czy pseudonimizacja?
Te dwa pojęcia są często mylone, ale ich konsekwencje prawne są diametralnie przeciwne.
- Anonimizacja: Dokonywanie danych w taki sposób, aby nie można było ich w żaden sposób powiązać z konkretną osobą. Jeśli zostanie to wykonane prawidłowo, wynik nie będzie już danymi osobowymi i wykracza poza zakres KVKK. Przykład: usunięcie poszczególnych wierszy w zestawie danych obejmującym 10 000 osób i pozostawienie jedynie statystyk zbiorczych, takich jak „Średnie wydatki w grupie wiekowej 25–34 lata w Stambule”.
- Pseudonimizacja: Informacje dotyczące tożsamości są zastępowane kodem/tagiem, ale można je zwrócić osobie za pomocą „klucza”. Przykład: wpisanie „Klient-4471” zamiast „Ahmet Yılmaz”, ale prowadzenie tabeli pokazującej, który kod należy do kogo. Są to nadal dane osobowe i wchodzą w zakres KVKK.
funkcja
Anonimizacja
Pseudonimizacja
Czy tę osobę można zwrócić?
Nie (jeśli zostało to zrobione poprawnie)
Tak, z kluczem
Czy to nadal dane osobowe?
nie
Tak
Zakres KVKK
na zewnątrz
w
Aby dostać się do AI
Najbezpieczniejszy sposób
Ponownie wymagana jest podstawa/reguła
Wskazówka: „Czy jest to odwracalne?” przed wprowadzeniem danych do AI. zapytać. Jeśli znajduje się w nim klucz/dopasowanie, jest to pseudonimizowane i nadal dane osobowe. Prawdziwa anonimizacja polega na udostępnianiu zbiorczego wyniku, a nie poszczególnych wierszy.
trzy mini etui
Przypadek 1 – Fałszywa anonimowość. Firma z branży opieki zdrowotnej przekazuje sztucznej inteligencji zestaw danych, które według niej „zanonimizowała” do analizy. Ale zestaw zawiera datę urodzenia, hrabstwo i rzadką diagnozę; to trio może wskazywać na jedną osobę w małym hrabstwie. To nie jest anonimizacja; dane są nadal osobiste. Właściwy sposób: przeliczenie daty urodzenia na przedział wiekowy, uogólnienie według powiatów, grupowanie rzadkich diagnoz – czyli prawdziwa agregacja.
Przypadek 2 — Narastanie rozmów. W call center 6 agentów wprowadza dane klientów na to samo korporacyjne konto AI przez 4 miesiące. Nikt nie oczyszcza przeszłości; ostatecznie w jednym miejscu zgromadziło się ponad 12 000 interakcji z klientami. W audycie akumulacja ta jest oznaczona jako główne ryzyko. Rozwiązanie: ustawienie automatycznego usuwania historii co 30 dni, reguła wylogowania po zakończeniu pracy oraz klauzula otwarta na politykę przechowywania.
Przypadek 3 – Prawidłowa pseudonimizacja. Analizując wydajność pracowników za pomocą sztucznej inteligencji, zespół HR koduje nazwy takie jak „Pracownik-001” i przechowuje tabelę dopasowań w oddzielnym pliku o ograniczonym dostępie. To jest pseudonimizacja; Dane są nadal osobiste, ale ryzyko jest zmniejszone. Zespół jest świadomy, że nie jest to anonimizacja i odpowiednio określa jej podstawę prawną i okres przechowywania.
Szablony do kopiowania
SZABLON 1 – Linia polityki przechowywania i niszczenia: „Zaproponuj linię polityki przechowywania-niszczenia dla następującej kategorii danych: [kategoria]. Pola: okres przechowywania (uzasadniony celem), metoda niszczenia (usunięcie/zniszczenie/anonimizacja), czy uwzględniona jest historia czatów AI, odpowiedzialna rola. Przypomnij, czy istnieje prawny obowiązek przechowywania.”
SZABLON 2 – Kontrola anonimizacji: „Oceń, czy następujący zbiór danych jest rzeczywiście anonimowy: [wymień pola]. Jakie kombinacje pól mogą umożliwić ponowną identyfikację osoby (np. data urodzenia + kod pocztowy + rzadka cecha)? Zaproponuj uogólnienie każdego pola ryzyka (takiego jak przedział wiekowy, poziom prowincji) w celu wzmocnienia anonimowości.”
SZABLON 3 — Maskowanie + separacja klawisza powrotu: „Pseudonim następujący tekst: zakoduj dane osobowe (np. [IMIĘ]->K001), ale daj mi pasującą tabelę ODDZIELNIE. Nie zostawiaj prawdziwej tożsamości w samym tekście. Pamiętaj, że pasująca tabela to „dane osobowe” i powinna być przechowywana osobno.
SZABLON 4 — Audyt przechowywania danych narzędzia AI: „Przygotuj listę pytań do audytu zachowania danych narzędzia AI, którego używamy: jak długo przechowywana jest historia, czy można ją usunąć, czy jest wykorzystywana w szkoleniu modeli, czy istnieje możliwość rezygnacji, gdzie przetwarzane są dane, jakie są kopie zapasowe? Na każde pytanie napisz oczekiwaną „bezpieczną” odpowiedź.”
Słaba zachęta/silna zachęta
SŁABY: „Anonimizuj te dane”. (koduje i pozostawia imiona)-> Tylko pseudonimy; Utrzymuje się ryzyko ponownej identyfikacji, takie jak data urodzenia, rzadka cecha; Tworzy iluzję „anonimowości”. GÜÇLÜ: „Znajdź kombinacje pól w tym zestawie, które mogą ponownie zidentyfikować osobę; uogólnij każde z nich (przedział wiekowy, poziom prowincji). Moim celem nie jest pojedynczy rekord, ale zagregowane statystyki. W rezultacie nie można nikogo wyróżnić jako pojedynczej osoby i zweryfikować tego.” -> Model dąży do prawdziwej anonimizacji, zmniejszając ryzyko ponownej identyfikacji.
Typowe błędy
- Mylenie pseudonimizacji z anonimizacją; zapominając, że są to dane osobowe.
- Usuwanie imion i pozostawianie opisowych kombinacji, takich jak data urodzenia + lokalizacja + rzadka cecha.
- Nie poddawać historii czatów AI regule przechowywania/zniszczenia; gromadzić w nieskończoność.
- Niezapewnienie w umowie klauzuli „Nie stosować na modelkach” (opt-out).
- Kiedy mówię o usuwaniu, mam na myśli po prostu wyczyszczenie ekranu i zapomnij o kopiach zapasowych i dziennikach.
- Dłuższy okres przechowywania „na wszelki wypadek”, a nie w określonym celu.
- Ignorowanie faktu, że przesyłanie i przechowywanie odbywa się również na serwerze dostawcy.
Podsumowując
- Dane osobowe przechodzą cykl życia; Najbardziej zaniedbywanymi etapami są składowanie i utylizacja.
- Dane nie mogą być przechowywane dłużej niż jest to konieczne do tego celu; Instytucja powinna ustanowić politykę przechowywania i niszczenia.
- Historie czatów AI są również przechowywanymi danymi; należy uwzględnić w harmonogramie utylizacji i ustawieniach przechowywania.
- Anonimizacja powoduje usunięcie danych z KVKK; Pseudonimizacja w dalszym ciągu pozostawia dane osobowe.
- Usunięcie nazwy nie jest anonimizacją; Wszystkie kombinacje narażone na ryzyko ponownej identyfikacji należy uogólnić.
Zadanie aplikacji
Wybierz kategorię danych, które Twoja organizacja przetwarza za pomocą sztucznej inteligencji (na przykład dane dotyczące obsługi klienta). Napisz zasady przechowywania i niszczenia dla tej kategorii: okres przechowywania (uzasadniony), metoda niszczenia, czy uwzględniona jest historia czatów AI i odpowiedzialna rola. Następnie weź przykładowy rekord z tych samych danych i najpierw go pseudonimizuj (trzymaj tabelę pasującą osobno), a następnie napisz, które pola będziesz uogólniać i jak doprowadzić ten rekord do prawdziwej anonimizacji. Na koniec przygotuj pięć pytań kontrolujących zachowanie danych narzędzia AI, którego używasz, i dodaj do każdego z nich „bezpieczną” odpowiedź, jakiej oczekujesz.
lista kontrolna
- [ ] Ustaliłem okres przechowywania i sposób niszczenia kategorii danych.
- [ ] Uwzględniłem historię czatów AI w harmonogramie niszczenia.
- [ ] Zaznaczyłem opcję rezygnacji „Nie używaj w szkoleniu modelek”.
- [ ] Wdrożyłem różnicę między pseudonimizacją a anonimizacją.
- [ ] Mam uogólnione kombinacje pól, które mogą zostać ponownie zidentyfikowane.
- [ ] W zakres usuwania uwzględniłem także kopie zapasowe i logi.
- [ ] Przeprowadziłem audyt zachowania narzędzia AI w zakresie przechowywania danych.