Jedinica 10 / 11

Privatnost podataka, siguran odabir alata i anonimizacija

Dobici:

  • Anonimizacija i procena neophodnosti pre davanja osetljivih i finansijskih podataka korisnika alatima veštačke inteligencije
  • Sposobnost razlikovanja razlika između korporativnih i javnih AI alata u privatnosti, zadržavanju podataka i upotrebi u obrazovanju
  • Sposobnost upravljanja rizicima kršenja podataka, perioda čuvanja i dijeljenja trećih strana u okviru KVKK-a

Osiguranje je jedna od profesija koje rade s najosjetljivijim podacima. Dosije osiguranja; Može uključivati ​​podatke o identitetu, adresu, prihod, bankovni račun, zdravstvenu istoriju, evidenciju o oštećenjima, registarske tablice, vlasnički list, pa čak i podatke o porodici. Neki od ovih podataka podležu najvišoj zaštiti kao "lični podaci posebne prirode" u KVKK (Zakon o zaštiti ličnih podataka); Zdravstveni, biometrijski i slični podaci su tipični primjeri za to. Nekontrolirano dijeljenje ovih podataka prilikom korištenja alata umjetne inteligencije (posebno onih koji se temelje na oblaku) predstavlja ozbiljan rizik od kršenja i gubitka povjerenja. Kada jednom procure, podaci se ne mogu povratiti. U ovoj ćete jedinici naučiti kako anonimizirati podatke o klijentima (uklanjanje ličnih podataka) prije nego što ih date umjetnoj inteligenciji, razlike u privatnosti između korporativnih i javnih alata i kako upravljati rizicima povrede podataka, pohranjivanja i dijeljenja trećih strana u okviru KVKK-a. Ova jedinica nije pravni savjet; Objašnjava opšte principe, konsultujte odeljenje za usaglašenost/pravno u konkretnom slučaju.

Zašto je privatnost kritična: tipovi podataka

U osiguranju je potrebno izdvojiti podatke prema stepenu zaštite:

  • Podaci o identitetu: Ime, prezime, TR ID broj, datum rođenja, kontakt. Direktno identifikuje osobu.
  • Finansijski podaci: Prihodi, bankovni račun, istorija plaćanja. Lično i osetljivo.
  • Podaci o posebnom kvalitetu: Zdravlje, biometrijski podaci. Najviša zaštita; Za obradu su potrebni stroži uslovi (eksplicitna saglasnost ili zakonski izuzetak).
  • Podaci o fajlu: broj police, registarska tablica, vlasnički list, detalj o šteti. U kombinaciji s drugima, može otkriti identitet.

Najveća opasnost je uočljivost koja se javlja kada objedinite ove podatke. Dok je "45 godina stara žena" anonimna, "45 godina žena + određena registarska tablica + određena adresa" može otkriti identitet.

Pažnja: Izgovaranje "izbriši" nakon davanja podataka alatu za umjetnu inteligenciju zapravo ih ne briše. Neki alati pohranjuju unos i čak ga koriste za obuku modela. Pravilo: nikada ne šaljite osjetljive podatke; Anonimizacija dolazi prije slanja.

Anonimizacija: kako to učiniti

Anonimizacija je uklanjanje identifikacionih informacija i zamjena činjeničnim ekvivalentom; Cilj je učiniti osobu neprepoznatljivom uz očuvanje kvaliteta izlaza. Dobra anonimizacija:

  • Uklanja ime, TR ID, telefon, adresu, broj polise, registarske tablice i podatke iz vlasničkog lista.
  • On ih zamjenjuje analitički značajnim ekvivalentom: "45 godina, muškarac, polisa osiguranja, Centralna Anadolija, jednostrani sudar".
  • Izbjegava rijetke/izrazite kombinacije: vrlo specifična profesija + vrlo malo mjesto, koje samo može otvoriti identitet.
  • Zadržava medicinsko/tehničko značenje: kao što je "komplementarno zdravlje, planirana ortopedska operacija".
Savjet: Nakon što ste anonimizirali, zapitajte se: "Ako stranac pročita ovaj tekst, može li pronaći tu osobu?" Ako je odgovor da, generalizirajte dalje. Posebno rijetke kombinacije (mali okrug + određeni događaj) su opasne.

Enterprise protiv javnih alata

Nemaju svi AI alati isti nivo privatnosti. Razlikuju se u tri dimenzije:

  1. Zadržavanje podataka: Da li zadržava unos i koliko dugo?
  2. Upotreba u obuci: Da li koristi input za obuku modela?
  3. Lokacija i ugovor: Gdje se obrađuju podaci, postoji li korporativni ugovor o obradi podataka?

Institucionalni alati (ugovorne garancije institucije, garancije za obradu podataka) često nude ograničenja za nekorištenje i pohranjivanje podataka u obrazovanju. Javni, besplatni alati mogu pohraniti input i koristiti ga u obuci. Pravilo: osjetljivi podaci se obrađuju samo na način koji je odobrila institucija, ugovorena sredstva iu što je moguće anonimnijem obliku. Unošenje podataka o korisniku u neodobreni alat čini procesor podataka nekontroliranim.

Korak po korak: siguran rad s povjerljivim podacima

  1. Klasifikujte podatke. Identitet / finansijski / poseban kvalitet / podaci o fajlu.
  2. Test neophodnosti. Jesu li ti podaci zaista potrebni za ovaj zadatak? Ako ne, nemojte ga koristiti.
  3. Anonimiziraj. Uklonite identifikatore, zamijenite činjenične ekvivalente, generalizirajte rijetke kombinacije.
  4. Odaberite vozilo. Samo ugovorena vozila odobrena od strane agencije; Nema osjetljivih podataka dostupnih javnom alatu.
  5. Radite sa minimalnim podacima. Podijelite minimalne informacije potrebne za zadatak.
  6. Upravljajte pohranom i dijeljenjem. Gdje pohranjujete izlaz, s kim ga dijelite; Poštujte KVKK period zadržavanja i pravila treće strane. Ostavite svoj trag.

tri mini kofera

Slučaj 1 — Zaštita osjetljivih podataka. Specijalista za potraživanja želio je pitati AI o složenom dosijeu zdravstvenog osiguranja. Umjesto pisanja imena, lične karte i dijagnoze osiguranika, stvorio je anonimni kontekst kao što je "52 godine života, žena, komplementarna zdravstvena politika, planirana operacija srčanih zalistaka, sporni iznos". Kvalitet rezultata nije smanjen; Privatni podaci nisu otišli ni u jedan oblak. Zdravstveni podaci podliježu najvišoj zaštiti; ova navika je spriječila kršenje.

Slučaj 2 — Rijetka kombinovana zamka. “38 godina, žena, jedini farmaceut u [vrlo malom okrugu], politika profesionalne odgovornosti”, napisao je jedan stručnjak. Iako ovo tehnički nije sadržavalo ime, direktno je otkrivalo njegov identitet jer je bio jedini farmaceut u tom okrugu. Stručnjak je to uočio i generalizovao kao "malo naselje, zdravstvena profesija". Anonimizacija nije samo brisanje imena, već uništavanje prepoznatljivosti.

Slučaj 3 — Pogrešan odabir alata. Radi brzine, zaposlenik bi uploadovao pregled zahtjeva korisnika na besplatni, javni alat. Politika tima stupa na snagu: podaci o klijentima se obrađuju samo u ugovorenom alatu koji je odobrila institucija. Zaposlenik je prvo anonimizirao podatke, a zatim ih pokrenuo u odobrenom alatu. Ako bi se koristio neodobreni alat, rizik od pohranjivanja podataka i korištenja u obrazovanju bio bi nekontrolisan.

Četiri upita za kopiranje

1) Pomoćnik za anonimizaciju:

Uklonite sve lične i identifikacione podatke iz sljedećeg teksta: ime, prezime, lična karta, datum rođenja, telefon, adresa, broj polise, registarske tablice, vlasnički list, IBAN. Zamijenite ih činjeničnim ekvivalentom s analitičkim značenjem (npr. "45 godina, muškarac, polisa osiguranja, jednostrani sudar"). Generalizirajte rijetke/izrazite kombinacije (malo mjesto + posebno zanimanje). Zadržati medicinsko/tehničko značenje. Tekst: [zalijepi]

2) Provjera prepoznatljivosti:

Provjerite sljedeći anonimni tekst za prepoznavanje: [tekst]Pitajte: Može li stranac pronaći osobu sa ovim tekstom? Postoji li rijetka kombinacija (malo naselje + određena profesija/događaj), jedinstveni datum ili iznos? Istaknite svaku rizičnu tačku i predložite kako sigurnije generalizirati.

3) Zahtjevi za podatke i klasifikacija:

Klasifikujte i testirajte podatke potrebne za sledeći zadatak: Zadatak: [opis] Podaci koje imam: [lista]Za svaki podatak: tip (identitet/finansijski/posebni/fajl), da li je potreban za ovaj zadatak (da/ne), ako je potrebno, kako da se koristi anonimno. Označite nepotrebne podatke kao "ne koristiti".

4) Kontrolna lista za odabir vozila:

Napravite kontrolnu listu prije korištenja AI alata s podacima o osiguranju. Uključite pitanja: Da li je vozilo odobreno od strane institucije? Postoji li ugovor o obradi podataka? Da li pohranjuje/koristi ulaz u treningu? Gdje se obrađuju podaci? Za koji tip podataka je prikladan/neprikladan? Da li je anonimizacija dovoljna?

Slaba prompt / Jaka prompt

Slabo: "Procijenite dosije klijenta Ahmeta Yılmaza (TC 123..., medicinski izvještaj u prilogu)."
Problem: Identitet i osjetljivi (zdravstveni) podaci se dijele direktno; veliki rizik od kršenja KVKK.
Snažan: "Uzmite u obzir sljedeći anonimni kontekst: 52 godine, žena, dodatna zdravstvena politika, planirana operacija, sporni iznos. Nema informacija za identifikaciju."
Zašto je to dobro: Analitičko značenje je očuvano, identitet i osjetljivi podaci se ne otkrivaju.

uporedni grafikon

Tip podataka

Nivo zaštite

Upotreba u umjetnoj inteligenciji

Ime/TC/kontakt

visoko

Ukloniti, staviti ekvivalent

Finansijski (prihodi/IBAN)

visoko

Ukloni/generaliziraj

Zdravstvene/specijalne kvalifikacije

najviši

Nikad sirovo; anonimno + odobreno vozilo

Broj/tablica/vlasnički list

srednje visok

Remove; sama je rizična

Agregat/statistika

nisko

Dostupan (ako nema kontakta)

Uobičajene greške

  • Lijepljenje neobrađenih ličnih/zdravstvenih podataka. Najčešći i najteži prekršaj.
  • Misleći da je dovoljno samo brisanje imena. Rijetke kombinacije još uvijek mogu otkriti identitet.
  • Oslanjajući se na izgovaranje "izbriši kasnije". Alat možda pohranjuje/koristi podatke u treningu.
  • Neodobrena/javna vožnja. Nekontrolisana obrada podataka.
  • Ne upravlja pohranom i dijeljenjem. Neograničeno skladištenje rezultata, nekontrolisano deljenje sa trećim licima.

Ukratko

Podaci o osiguranju su vrlo osjetljivi; Posebni podaci kao što je zdravlje podliježu najvišoj zaštiti prema KVKK-u. Klasifikujte, osporite i anonimizirajte podatke prije nego što ih date AI: uklonite identifikatore, uvedite činjenične ekvivalente, generalizirajte rijetke kombinacije. Obrađujte osjetljive podatke samo u alatima koje je odobrila institucija, ugovorenim alatima i to u minimalnoj mjeri. Upravljajte periodom skladištenja i dijeljenjem treće strane u okviru KVKK-a i ostavite trag. Konsultujte usklađenost/pravo u konkretnom slučaju; Procureli podaci se ne mogu dohvatiti.

Zadatak aplikacije

Dobijte stvarnu štetu/referentni tekst (u svrhu testiranja). Anonimizirajte s upitom #1, a zatim provjerite prepoznavanje s upitom #2: postoje li još rijetke kombinacije u tekstu koje bi mogle otkriti osobu? Generalizirajte svaki rizik koji nađete. Takođe procenite AI alat koji koristite sa kontrolnom listom broj 4: da li je pogodan za osetljive podatke?

kontrolna lista

  • [ ] Podatke sam klasifikovao prema njihovim vrstama.
  • [ ] Primijenio sam test nužnosti; Nisam koristio nepotrebne podatke.
  • [ ] Uklonio sam identifikatore i zamijenio ih činjeničnim ekvivalentom.
  • [ ] Generalizirao sam rijetke/izrazite kombinacije.
  • [ ] Provjerio sam prepoznatljivost.
  • [ ] Koristio sam samo ugovorena vozila odobrena od strane kompanije.
  • [ ] Upravljao sam skladištenjem i dijeljenjem treće strane u skladu sa KVKK; Ostavio sam trag.