Jedinica 10 / 11

Privatnost podataka, siguran odabir alata i anonimizacija

Dobici:

  • Anonimizacija i procjena potrebe prije davanja klijentovih osjetljivih i financijskih podataka alatima umjetne inteligencije
  • Sposobnost razlikovanja razlika između korporativnih i javnih AI alata u privatnosti, zadržavanju podataka i upotrebi u obrazovanju
  • Sposobnost upravljanja rizicima povrede podataka, razdoblja zadržavanja i dijeljenja trećih strana u okviru KVKK

Osigurateljstvo je jedna od profesija koja radi s najosjetljivijim podacima. Dosje o osiguranju; Može uključivati ​​podatke o identitetu, adresu, prihod, bankovni račun, povijest zdravlja, evidenciju štete, registarske pločice, vlasnički list, pa čak i podatke o obitelji. Neki od ovih podataka podliježu najvišoj zaštiti kao "osobni podaci posebne prirode" u KVKK (Zakon o zaštiti osobnih podataka); Zdravstveni, biometrijski i slični podaci tipični su primjeri toga. Nekontrolirano dijeljenje ovih podataka pri korištenju alata umjetne inteligencije (osobito onih koji se temelje na oblaku) predstavlja ozbiljan rizik od povrede i gubitka povjerenja. Nakon što procure, podaci se ne mogu dohvatiti. U ovoj ćete jedinici naučiti kako anonimizirati korisničke podatke (uklanjajući osobne podatke) prije nego što ih date umjetnoj inteligenciji, razlike u privatnosti između korporativnih i javnih alata i kako upravljati rizicima povrede podataka, pohrane i dijeljenja s trećim stranama u okviru KVKK. Ova jedinica nije pravni savjet; Objašnjava opća načela, konzultirajte odjel za usklađenost/pravni odjel u konkretnom slučaju.

Zašto je privatnost kritična: vrste podataka

U osiguranju je potrebno razdvojiti podatke prema stupnju zaštite:

  • Podaci o identitetu: Ime, prezime, JMBG, datum rođenja, kontakt. Izravno identificira osobu.
  • Financijski podaci: prihod, bankovni račun, povijest plaćanja. Osobno i osjetljivo.
  • Podaci o posebnoj kvaliteti: Zdravlje, biometrijski podaci. Najviša zaštita; Za obradu su potrebni stroži uvjeti (izričit pristanak ili zakonska iznimka).
  • Podaci datoteke: broj police, registarska pločica, vlasnički list, detalji štete. U kombinaciji s drugima, može otkriti identitet.

Najveća opasnost je identifikacija koja se javlja kada ove podatke spojite zajedno. Dok je "45 godina stara žena" anonimna, "45 godina stara žena + određena registarska oznaka + određena adresa" može otkriti identitet.

Pažnja: Izgovaranje "izbriši" nakon davanja podataka alatu za umjetnu inteligenciju zapravo ih ne briše. Neki alati pohranjuju unos i čak ga koriste za obuku modela. Pravilo: nikada ne šaljite osjetljive podatke; Anonimizacija dolazi prije slanja.

Anonimizacija: kako to učiniti

Anonimizacija je uklanjanje informacija koje se mogu identificirati i zamjena činjeničnim ekvivalentom; Cilj je učiniti osobu neprepoznatljivom uz zadržavanje kvalitete ispisa. Dobra anonimizacija:

  • Uklanja podatke o imenu, TR ID-u, telefonu, adresi, broju police, registarskoj tablici i vlasničkom listu.
  • Zamjenjuje ih analitički smislenim ekvivalentom: "45 godina, muškarac, polica osiguranja, središnja Anatolija, jednostrani sraz".
  • Izbjegava rijetke/karakteristične kombinacije: vrlo specifično zanimanje + vrlo malo mjesto koje jedino može otvoriti identitet.
  • Zadržava medicinsko/tehničko značenje: kao što je "komplementarno zdravlje, planirana ortopedska operacija".
Savjet: Nakon anonimiziranja zapitajte se: "Da je stranac pročitao ovaj tekst, bi li mogao pronaći tu osobu?" Ako je odgovor potvrdan, generalizirajte dalje. Osobito su rijetke kombinacije (mali okrug + određeni događaj) opasne.

Enterprise vs javni alati

Nemaju svi AI alati istu razinu privatnosti. Razlikuju se u tri dimenzije:

  1. Zadržavanje podataka: Zadržava li unos i koliko dugo?
  2. Upotreba u obuci: Koristi li ulaz za obuku modela?
  3. Mjesto i ugovor: Gdje se obrađuju podaci, postoji li korporativni ugovor o obradi podataka?

Institucionalni (ugovorna jamstva ustanove, jamstva obrade podataka) alati često nude ograničenja nekorištenja i pohranjivanja podataka u obrazovanju. Javni, besplatni alati mogu pohraniti unose i koristiti ih u obuci. Pravilo: osjetljivi podaci obrađuju se samo na ugovorene načine odobrene od strane institucije i u što je moguće anonimnijem obliku. Unos korisničkih podataka u neodobreni alat čini procesor podataka nekontroliranim.

Korak po korak: siguran rad s povjerljivim podacima

  1. Klasificirajte podatke. Identitet / financijski / posebna kvaliteta / podaci datoteke.
  2. Test nužnosti. Jesu li ti podaci doista potrebni za ovaj zadatak? Ako nije, nemojte ga koristiti.
  3. Anonimiziraj. Uklonite identifikatore, zamijenite činjenične ekvivalente, generalizirajte rijetke kombinacije.
  4. Odaberite vozilo. Samo vozila odobrena od strane agencija; Nema osjetljivih podataka dostupnih javnom alatu.
  5. Radite s minimalnim podacima. Podijelite minimalne informacije potrebne za zadatak.
  6. Upravljajte pohranom i dijeljenjem. Gdje pohranjujete rezultate, s kim ih dijelite; Pridržavajte se KVKK razdoblja čuvanja i pravila trećih strana. Ostavite svoj trag.

tri mini kućišta

Slučaj 1 — Zaštita osjetljivih podataka. Stručnjak za potraživanja želio je pitati AI o složenom dosjeu zdravstvenog osiguranja. Umjesto imena, osobne iskaznice i dijagnoze osiguranika kreirao je anonimni kontekst tipa "52 godine, žena, dopunska zdravstvena polica, planirana operacija srčanih zalistaka, sporni iznos". Kvaliteta ispisa nije smanjena; Privatni podaci nisu otišli ni u jedan oblak. Zdravstveni podaci podliježu najvišoj zaštiti; ova je navika spriječila kršenje.

Slučaj 2 — Rijetka kombinirana zamka. “38 godina, žena, jedina farmaceutkinja u [vrlo maloj županiji], politika profesionalne odgovornosti”, napisao je jedan stručnjak. Iako to tehnički nije sadržavalo ime, izravno je otkrivalo njegov identitet jer je bio jedini ljekarnik u toj četvrti. Stručnjak je to primijetio i generalizirao kao "malo naselje, zdravstvena struka". Anonimizacija nije samo brisanje imena, ona uništava prepoznatljivost.

Slučaj 3 — Pogrešan odabir alata. Radi brzine, zaposlenik bi prenio raščlambu zahtjeva kupaca na besplatni, javni alat. Politika tima stupa na snagu: podaci o korisnicima obrađuju se samo u ugovorenom alatu koji je odobrila institucija. Zaposlenik je prvo anonimizirao podatke, a zatim ih pokrenuo u odobrenom alatu. Ako bi se koristio neodobreni alat, rizik od pohranjivanja i korištenja podataka u obrazovanju bio bi nekontroliran.

Četiri upita za kopiranje

1) Pomoćnik za anonimizaciju:

Iz sljedećeg teksta uklonite sve osobne i identifikacijske podatke: ime, prezime, osobnu iskaznicu, datum rođenja, telefon, adresu, broj police, registarsku pločicu, vlasnički list, IBAN. Zamijenite ih činjeničnim ekvivalentom s analitičkim značenjem (npr. "45 godina, muškarac, polica osiguranja, jednostrani sudar"). Generalizirati rijetke/izrazite kombinacije (malo mjesto + posebno zanimanje). Zadržati medicinsko/tehničko značenje.Tekst: [zalijepiti]

2) Provjera prepoznatljivosti:

Provjerite sljedeći anonimizirani tekst za prepoznavanje: [text]Pitajte: Može li stranac pronaći osobu s ovim tekstom? Postoji li rijetka kombinacija (malo naselje + određena profesija/događaj), jedinstveni datum ili iznos? Istaknite svaku rizičnu točku i predložite kako sigurnije generalizirati.

3) Zahtjevi podataka i klasifikacija:

Klasificirajte i testirajte zahtjeve podataka potrebnih za sljedeći zadatak: Zadatak: [opis] Podaci koje imam: [popis] Za svaki podatak: vrsta (identitetski/financijski/posebni/datoteka), jesu li potrebni za ovaj zadatak (da/ne), ako je potrebno, kako ih koristiti anonimno. Označite nepotrebne podatke kao "ne koristiti".

4) Kontrolni popis za odabir vozila:

Napravite popis za provjeru prije korištenja AI alata s podacima o osiguranju. Uključite pitanja: Je li vozilo odobrila institucija? Postoji li ugovor o obradi podataka? Pohranjuje li/koristi li unos u obuci? Gdje se podaci obrađuju? Za koju vrstu podataka je prikladan/neprikladan? Je li anonimizacija dovoljna?

Slab upit / Jak upit

Slabo: "Procijenite dosje klijenta Ahmeta Yılmaza (TC 123..., medicinski izvještaj u prilogu)."
Problem: identitet i osjetljivi (zdravstveni) podaci dijele se izravno; veliki rizik od kršenja KVKK.
Jako: "Razmotrite sljedeći anonimizirani kontekst: 52 godine, žena, dopunska zdravstvena politika, planirana operacija, sporni iznos. Nema identifikacijskih podataka."
Zašto je to dobro: Sačuvano je analitičko značenje, ne otkrivaju se identitet i osjetljivi podaci.

usporedna tablica

Vrsta podataka

Razina zaštite

Upotreba u umjetnoj inteligenciji

Ime/TC/kontakt

visoka

Uklonite, stavite ekvivalent

Financijski (prihod/IBAN)

visoka

Ukloni/generaliziraj

Zdravstvene/posebne kvalifikacije

najviši

Nikada sirovo; anonimno + odobreno vozilo

Broj police/pločica/vlasnički list

srednje-visoka

Ukloniti; sama je riskantna

Agregat/statistika

nizak

Dostupan (ako nema kontakta)

Uobičajene greške

  • Lijepljenje neobrađenih osobnih/zdravstvenih podataka. Najčešći i najteži prekršaj.
  • Misleći da je dovoljno samo izbrisati ime. Rijetke kombinacije ipak mogu otkriti identitet.
  • Oslanjajući se na "izbriši kasnije". Alat možda pohranjuje/koristi podatke u obuci.
  • Neodobrena/javna vožnja. Nekontrolirana obrada podataka.
  • Ne upravlja pohranom i dijeljenjem. Neograničeno skladištenje rezultata, nekontrolirano dijeljenje s trećim stranama.

Ukratko

Podaci o osiguranju vrlo su osjetljivi; Posebni podaci poput zdravstvenog stanja podliježu najvišoj zaštiti prema KVKK. Klasificirajte, izazovite i anonimizirajte podatke prije nego što ih date umjetnoj inteligenciji: uklonite identifikatore, uvedite činjenične ekvivalente, generalizirajte rijetke kombinacije. Obrađujte osjetljive podatke samo u ugovorenim alatima koje je odobrila institucija i to u minimalnoj mjeri. Upravljajte razdobljem pohrane i dijeljenjem trećih strana u okviru KVKK i ostavite trag. Posavjetujte se s usklađenošću/pravnim odjelom u konkretnom slučaju; Procurjeli podaci ne mogu se dohvatiti.

Zadatak aplikacije

Nabavite pravi oštećeni/referentni tekst (za potrebe testiranja). Anonimiziraj s upitom #1, a zatim provjeri prepoznavanje s upitom #2: postoje li još rijetke kombinacije u tekstu koje bi mogle otkriti osobu? Generalizirajte svaki rizik koji pronađete. Također procijenite AI alat koji koristite s popisom broj 4: je li prikladan za osjetljive podatke?

popis za provjeru

  • [ ] Klasificirao sam podatke prema njihovim vrstama.
  • [ ] Primijenio sam test nužnosti; Nisam koristio nepotrebne podatke.
  • [ ] Uklonio sam identifikatore i zamijenio ih činjeničnim ekvivalentom.
  • [ ] Generalizirao sam rijetke/karakteristične kombinacije.
  • [ ] Napravio sam provjeru prepoznatljivosti.
  • [ ] Koristio sam samo vozila odobrena od strane tvrtke, ugovorena vozila.
  • [ ] Upravljao sam pohranom i dijeljenjem s trećim stranama u skladu s KVKK; Ostavio sam trag.