Jednostka 10 / 11

Prywatność danych, bezpieczny wybór narzędzi i anonimizacja

Zyski:

  • Anonimizacja i ocena konieczności przed przekazaniem danych wrażliwych i finansowych klienta narzędziom sztucznej inteligencji
  • Umiejętność rozróżnienia różnic między korporacyjnymi i publicznymi narzędziami AI w zakresie prywatności, przechowywania danych i wykorzystania w edukacji
  • Możliwość zarządzania naruszeniem danych, okresem przechowywania i ryzykiem udostępniania stronom trzecim w ramach KVKK

Ubezpieczyciele to jeden z zawodów, w których pracuje się z najbardziej wrażliwymi danymi. Akta ubezpieczenia; Może zawierać dane identyfikacyjne, adres, dochody, konto bankowe, historię zdrowia, dokumentację szkód, tablicę rejestracyjną, tytuł własności, a nawet informacje rodzinne. Niektóre z tych danych podlegają najwyższej ochronie jako „dane osobowe o szczególnym charakterze” w KVKK (ustawa o ochronie danych osobowych); Typowymi przykładami są dane dotyczące zdrowia, biometryczne i tym podobne. Niekontrolowane udostępnianie tych danych przy wykorzystaniu narzędzi sztucznej inteligencji (szczególnie tych opartych na chmurze) to poważne ryzyko naruszenia i utraty zaufania. Po wycieku danych nie można odzyskać. W tej części dowiesz się, jak anonimizować dane klientów (usuwając dane osobowe) przed przekazaniem ich sztucznej inteligencji, jakie są różnice w prywatności między narzędziami korporacyjnymi i publicznymi oraz jak zarządzać ryzykiem naruszenia danych, ich przechowywania i udostępniania stronom trzecim w ramach KVKK. Niniejsza jednostka nie stanowi porady prawnej; Wyjaśnia ogólne zasady, w konkretnym przypadku należy skonsultować się z działem ds. zgodności/prawnym.

Dlaczego prywatność jest krytyczna: typy danych

W ubezpieczeniach konieczne jest rozdzielenie danych ze względu na stopień ochrony:

  • Dane identyfikacyjne: Imię, nazwisko, numer TR ID, data urodzenia, kontakt. Bezpośrednio identyfikuje osobę.
  • Dane finansowe: Dochody, konto bankowe, historia płatności. Osobiste i wrażliwe.
  • Specjalne dane jakościowe: Zdrowie, dane biometryczne. Najwyższa ochrona; Do przetwarzania wymagane są bardziej rygorystyczne warunki (wyraźna zgoda lub wyjątek ustawowy).
  • Dane pliku: numer polisy, tablica rejestracyjna, tytuł własności, szczegóły uszkodzenia. W połączeniu z innymi może ujawnić tożsamość.

Największym niebezpieczeństwem jest możliwość identyfikacji, która pojawia się po połączeniu tych danych. O ile „45-letnia kobieta” jest anonimowa, o tyle „45-letnia kobieta + określona tablica rejestracyjna + określony adres” może ujawnić tożsamość.

Uwaga: powiedzenie „usuń” po przekazaniu danych narzędziu sztucznej inteligencji w rzeczywistości ich nie usuwa. Niektóre narzędzia przechowują dane wejściowe, a nawet używają ich do uczenia modelu. Zasada: nigdy nie wysyłaj wrażliwych danych; Anonimizacja następuje przed wysłaniem.

Anonimizacja: jak to zrobić

Anonimizacja polega na usunięciu informacji umożliwiających identyfikację i zastąpieniu ich faktycznymi odpowiednikami; Celem jest uczynienie osoby nierozpoznawalną przy jednoczesnym zachowaniu jakości wydruku. Dobra anonimizacja:

  • Usuwa imię i nazwisko, identyfikator TR, telefon, adres, numer polisy, tablicę rejestracyjną i informacje o tytule własności.
  • Zastępuje je analitycznie wymownym odpowiednikiem: „45 lat, mężczyzna, polisa ubezpieczeniowa, Środkowa Anatolia, zderzenie jednostronne”.
  • Unika rzadkich/charakterystycznych kombinacji: bardzo specyficzny zawód + bardzo mała miejscowość, które same w sobie mogą ujawnić tożsamość.
  • Zachowuje znaczenie medyczne/techniczne, np. „zdrowie uzupełniające, planowana operacja ortopedyczna”.
Wskazówka: po anonimizacji zadaj sobie pytanie: „Czy gdyby nieznajomy przeczytał ten tekst, mógłby znaleźć tę osobę?” Jeśli odpowiedź brzmi tak, uogólniaj dalej. Szczególnie rzadkie kombinacje (mała dzielnica + określone wydarzenie) są niebezpieczne.

Przedsiębiorstwo kontra narzędzia publiczne

Nie wszystkie narzędzia AI zapewniają ten sam poziom prywatności. Różnią się trzema wymiarami:

  1. Zatrzymywanie danych: czy przechowuje dane wejściowe i jak długo?
  2. Użyj w szkoleniu: Czy wykorzystuje dane wejściowe do uczenia modelu?
  3. Lokalizacja i umowa: Gdzie przetwarzane są dane, czy istnieje korporacyjna umowa dotycząca przetwarzania danych?

Narzędzia instytucjonalne (umowy instytucji, gwarancje dotyczące przetwarzania danych) często nakładają ograniczenia na niewykorzystywanie i przechowywanie danych w edukacji. Publiczne, bezpłatne narzędzia mogą przechowywać dane wejściowe i wykorzystywać je w szkoleniach. Zasada: dane wrażliwe są przetwarzane wyłącznie w sposób zatwierdzony przez instytucję i w możliwie najbardziej zanonimizowanej formie. Wprowadzenie danych klienta do niezatwierdzonego narzędzia powoduje, że podmiot przetwarzający dane nie podlega kontroli.

Krok po kroku: bezpieczna praca z poufnymi danymi

  1. Klasyfikuj dane. Tożsamość/finanse/szczególna jakość/dane pliku.
  2. Test konieczności. Czy te dane są naprawdę potrzebne do tego zadania? Jeśli nie, nie używaj go.
  3. Anonimizuj. Usuń identyfikatory, zastąp ich odpowiednikami faktycznymi, uogólnij rzadkie kombinacje.
  4. Wybierz pojazd. Tylko zakontraktowane pojazdy zatwierdzone przez agencję; Żadne wrażliwe dane nie są dostępne dla narzędzia publicznego.
  5. Pracuj z minimalną ilością danych. Udostępnij minimum informacji potrzebnych do wykonania zadania.
  6. Zarządzaj przechowywaniem i udostępnianiem. Gdzie przechowujesz wyniki i komu je udostępniasz; Przestrzegaj okresu przechowywania KVKK i zasad stron trzecich. Zostaw swój ślad.

trzy mini etui

Przypadek 1 – Ochrona danych wrażliwych. Specjalista ds. roszczeń chciał zapytać sztuczną inteligencję o skomplikowaną dokumentację dotyczącą ubezpieczenia zdrowotnego. Zamiast wpisywać imię i nazwisko, dowód osobisty i diagnozę ubezpieczonego, stworzył anonimowy kontekst typu „52 lata, kobieta, uzupełniająca polisa zdrowotna, planowana operacja zastawki serca, kwota sporna”. Jakość wyników nie uległa pogorszeniu; Prywatne dane nie trafiały do ​​żadnej chmury. Dane dotyczące zdrowia podlegają najwyższej ochronie; ten zwyczaj zapobiegł naruszeniu.

Przypadek 2 — Rzadka pułapka kombinowana. „38 lat, kobieta, jedyna farmaceutka w [bardzo małym hrabstwie], zasady odpowiedzialności zawodowej” – napisał jeden z ekspertów. Chociaż technicznie rzecz biorąc, nie zawierało to nazwiska, bezpośrednio ujawniało jego tożsamość, ponieważ był jedynym farmaceutą w tej dzielnicy. Ekspert to zauważył i uogólnił jako „mała osada, zawód służby zdrowia”. Anonimizacja to nie tylko usunięcie nazwiska, to zniszczenie rozpoznawalności.

Przypadek 3 — Zły dobór narzędzia. Aby przyspieszyć proces, pracownik przesyłałby zestawienie roszczeń klientów do bezpłatnego, publicznego narzędzia. Wchodzi w życie polityka zespołu: dane klientów przetwarzane są wyłącznie w zatwierdzonym przez instytucję, zakontraktowanym narzędziu. Pracownik najpierw zanonimizował dane, a następnie uruchomił je w zatwierdzonym narzędziu. W przypadku użycia niezatwierdzonego narzędzia ryzyko przechowywania i wykorzystania danych w edukacji byłoby niekontrolowane.

Cztery kopiowalne podpowiedzi

1) Asystent anonimizacji:

Usuń wszystkie dane osobowe i identyfikacyjne z następującego tekstu: imię, nazwisko, dowód osobisty, data urodzenia, telefon, adres, numer polisy, tablica rejestracyjna, tytuł własności, IBAN. Zastąp je odpowiednikiem merytorycznym o znaczeniu analitycznym (np. „45 lat, mężczyzna, polisa ubezpieczeniowa, kolizja jednostronna”). Uogólnij rzadkie/charakterystyczne kombinacje (małe miejsce + specjalny zawód). Zachowaj znaczenie medyczne/techniczne.Tekst: [wklej]

2) Kontrola rozpoznawalności:

Sprawdź następujący anonimowy tekst w celu rozpoznania: [tekst]Zadaj pytanie: Czy nieznajomy może znaleźć osobę znającą ten tekst? Czy istnieje rzadka kombinacja (mała osada + konkretny zawód/wydarzenie), unikalna data lub kwota? Podkreśl każdy ryzykowny punkt i zasugeruj, jak bezpieczniej generalizować.

3) Wymagania dotyczące danych i klasyfikacja:

Sklasyfikuj i przetestuj wymagania dotyczące danych wymaganych do wykonania następującego zadania:Zadanie: [opis] Dane, które posiadam: [lista]Dla każdej danych: typ (tożsamość/finansowe/specjalne/plik), czy są potrzebne do tego zadania (tak/nie), jeśli to konieczne, jak z nich korzystać anonimowo. Oznacz niepotrzebne dane jako „nie używaj”.

4) Lista kontrolna wyboru pojazdu:

Utwórz listę kontrolną przed użyciem narzędzia AI z danymi ubezpieczeniowymi. Dołącz pytania: Czy pojazd jest zatwierdzony przez instytucję? Czy istnieje umowa przetwarzania danych? Czy przechowuje/wykorzystuje dane wejściowe podczas szkolenia? Gdzie przetwarzane są dane? Dla jakiego typu danych jest odpowiedni/nieodpowiedni? Czy anonimizacja wystarczy?

Słaba zachęta/silna zachęta

Słabe: „Oceń akta klienta Ahmeta Yılmaza (TC 123…, załączono raport medyczny).”
Problem: Dane dotyczące tożsamości i wrażliwe (zdrowia) są udostępniane bezpośrednio; duże ryzyko naruszenia KVKK.
Strong: „Rozważ następujący anonimowy kontekst: wiek 52 lata, kobieta, dodatkowa polityka zdrowotna, planowana operacja, kwestionowana kwota. Brak danych identyfikujących”.
Dlaczego to dobrze: Zachowane zostaje znaczenie analityczne, a dane identyfikacyjne i wrażliwe nie są ujawniane.

tabela porównawcza

Typ danych

Poziom ochrony

Zastosowanie w sztucznej inteligencji

Imię i nazwisko/TC/kontakt

wysoki

Usuń, umieść odpowiednik

Finansowe (dochody/IBAN)

wysoki

Usuń/uogólnij

Zdrowie/specjalne kwalifikacje

najwyższy

Nigdy surowe; anonimowy + zatwierdzony pojazd

Numer polisy/tabliczka/akt własności

średnio-wysoki

Usuń; samotnie jest ryzykowne

Dane zbiorcze/statystyki

niski

Dostępny (w przypadku braku kontaktu)

Typowe błędy

  • Wklejanie surowych danych osobowych/zdrowia. Najczęstsze i najpoważniejsze naruszenie.
  • Myśląc, że wystarczy usunąć nazwę. Rzadkie kombinacje mogą nadal ujawniać tożsamość.
  • Poleganie na powiedzeniu „usuń później”. Narzędzie może przechowywać/wykorzystywać dane podczas szkolenia.
  • Jazda niezatwierdzona/publiczna. Niekontrolowane przetwarzanie danych.
  • Brak zarządzania przechowywaniem i udostępnianiem. Nieograniczone przechowywanie wyników, niekontrolowane udostępnianie osobom trzecim.

Podsumowując

Dane ubezpieczeniowe są bardzo wrażliwe; Dane szczególne, takie jak zdrowie, podlegają najwyższej ochronie w ramach KVKK. Klasyfikuj, podważaj i anonimizuj dane przed przekazaniem ich AI: usuń identyfikatory, wprowadź faktyczne odpowiedniki, uogólnij rzadkie kombinacje. Przetwarzaj wrażliwe dane wyłącznie w zatwierdzonych przez instytucję, zakontraktowanych narzędziach i w minimalnym zakresie. Zarządzaj okresem przechowywania i udostępnianiem osobom trzecim w ramach KVKK i zostaw ślad. Skonsultuj się z kwestiami zgodności/prawa w konkretnym przypadku; Wyciekłych danych nie można odzyskać.

Zadanie aplikacji

Uzyskaj prawdziwy tekst obrażeń/odniesienia (do celów testowych). Zanonimizuj za pomocą podpowiedzi nr 1, a następnie sprawdź rozpoznawanie za pomocą podpowiedzi nr 2: czy w tekście nadal występują rzadkie kombinacje, które mogłyby ujawnić osobę? Uogólnij każde znalezione ryzyko. Oceń także narzędzie AI, którego używasz, korzystając z listy kontrolnej nr 4: czy nadaje się do wrażliwych danych?

lista kontrolna

  • [ ] Sklasyfikowałem dane według ich typów.
  • [ ] Zastosowałem test konieczności; Nie korzystałem z niepotrzebnych danych.
  • [ ] Usunąłem identyfikatory i zastąpiłem je faktycznym odpowiednikiem.
  • [ ] Uogólniłem rzadkie/charakterystyczne kombinacje.
  • [ ] Sprawdziłem rozpoznawalność.
  • [ ] Korzystałem wyłącznie z pojazdów zatwierdzonych przez firmę i zakontraktowanych.
  • [ ] Zarządzałem przechowywaniem i udostępnianiem osobom trzecim zgodnie z KVKK; Zostawiłem ślad.