Enota 10 / 11

Zasebnost podatkov, varna izbira orodij in anonimizacija

Dobički:

  • Anonimizacija in ocena potrebe pred posredovanjem občutljivih in finančnih podatkov stranke orodjem umetne inteligence
  • Sposobnost razlikovanja med korporativnimi in javnimi orodji AI glede zasebnosti, hrambe podatkov in uporabe v izobraževanju
  • Sposobnost obvladovanja tveganj kršitve podatkov, obdobja hrambe in deljenja tretjih oseb v okviru KVKK

Zavarovalništvo je eden izmed poklicev, ki delajo z najbolj občutljivimi podatki. Zavarovalna datoteka; Vključuje lahko podatke o identiteti, naslovu, dohodku, bančnem računu, zdravstveni anamnezi, evidenci škode, registrski tablici, lastniškem listu in celo družinskih podatkih. Nekateri od teh podatkov so predmet najvišjega varstva kot »osebni podatki posebne narave« v KVKK (Zakon o varstvu osebnih podatkov); Značilni primeri tega so zdravstveni, biometrični in podobni podatki. Nenadzorovano deljenje teh podatkov pri uporabi orodij umetne inteligence (zlasti tistih v oblaku) je resno tveganje zloma in izgube zaupanja. Ko podatki uhajajo, jih ni več mogoče pridobiti. V tej enoti se boste naučili, kako anonimizirati podatke o strankah (odstranite podatke, ki omogočajo osebno identifikacijo), preden jih daste umetni inteligenci, razlike v zasebnosti med korporativnimi in javnimi orodji ter kako obvladovati tveganja kršitve podatkov, shranjevanja in deljenja s tretjimi osebami v okviru KVKK. Ta enota ni pravni nasvet; Razloži splošna načela, posvetujte se s skladnostjo/pravnim oddelkom v posebnem primeru.

Zakaj je zasebnost kritična: vrste podatkov

V zavarovalništvu je potrebno ločiti podatke glede na stopnjo zaščite:

  • Osebni podatki: Ime, priimek, ID, datum rojstva, kontakt. Neposredno identificira osebo.
  • Finančni podatki: dohodek, bančni račun, zgodovina plačil. Osebno in občutljivo.
  • Posebni podatki o kakovosti: Zdravje, biometrični podatki. Najvišja zaščita; Za obdelavo so potrebni strožji pogoji (izrecna privolitev ali zakonska izjema).
  • Podatki o datoteki: številka police, registrska tablica, lastniški list, podrobnosti o škodi. V kombinaciji z drugimi lahko razkrije identiteto.

Največja nevarnost je prepoznavnost, ki nastane, ko te podatke združite. Medtem ko je »45-letna ženska« anonimna, lahko »45-letna ženska + določena registrska tablica + določen naslov« razkrije identiteto.

Pozor: Če izgovorite "izbriši", potem ko podatek posredujete orodju umetne inteligence, ga dejansko ne izbrišete. Nekatera orodja shranijo vhodne podatke in jih celo uporabijo za usposabljanje modela. Pravilo: nikoli ne pošiljajte občutljivih podatkov; Anonimizacija pride pred pošiljanjem.

Anonimizacija: kako to storiti

Anonimizacija je odstranitev določljivih informacij in zamenjava z dejanskim ekvivalentom; Cilj je narediti osebo neprepoznavno, hkrati pa ohraniti kakovost izpisa. Dobra anonimizacija:

  • Odstrani podatke o imenu, TR ID, telefonski številki, naslovu, številki police, registrski tablici in lastniškem listu.
  • Zamenja jih z analitično pomenljivo ustreznico: "45 let, moški, zavarovalna polica, osrednja Anatolija, enostranski trk".
  • Izogiba se redkim/izrazitim kombinacijam: zelo specifičen poklic + zelo majhen kraj, ki edini lahko odpre identiteto.
  • Ohranja medicinski/tehnični pomen: na primer "dopolnilno zdravje, načrtovana ortopedska operacija".
Namig: Po anonimiziranju se vprašajte: "Če bi neznanec prebral to besedilo, bi lahko našel osebo?" Če je odgovor pritrdilen, posplošite naprej. Še posebej redke kombinacije (majhno okrožje + določen dogodek) so nevarne.

Enterprise vs javna orodja

Vsa orodja AI nimajo enake ravni zasebnosti. Razlikujejo se v treh dimenzijah:

  1. Hramba podatkov: Ali hrani vnesene podatke in kako dolgo?
  2. Uporaba pri usposabljanju: Ali uporablja vhod za usposabljanje modela?
  3. Lokacija in pogodba: kje se obdelujejo podatki, ali obstaja pogodba o obdelavi podatkov?

Institucionalna (pogodbena in jamstva ustanove za obdelavo podatkov) orodja pogosto ponujajo omejitve glede neuporabe in shranjevanja podatkov v izobraževanju. Javna brezplačna orodja lahko shranijo vnose in jih uporabijo pri usposabljanju. Pravilo: občutljivi podatki se obdelujejo samo na način, ki ga odobri institucija, in v čim bolj anonimizirani obliki. Vnos podatkov o strankah v neodobreno orodje povzroči, da obdelovalec podatkov ni revizijski.

Korak za korakom: varno delo z zaupnimi podatki

  1. Razvrstite podatke. Podatki o identiteti / finančni / posebni kakovosti / datoteki.
  2. Test nujnosti. Ali so ti podatki res potrebni za to nalogo? Če ne, ga ne uporabljajte.
  3. Anonimiziraj. Odstranite identifikatorje, nadomestite dejanske ekvivalente, posplošite redke kombinacije.
  4. Izberite vozilo. Samo s strani agencije odobrena pogodbena vozila; Za javno orodje ni na voljo nobenih občutljivih podatkov.
  5. Delajte z minimalnimi podatki. Delite najmanj informacij, potrebnih za nalogo.
  6. Upravljajte shranjevanje in skupno rabo. Kje shranjujete rezultate, s kom jih delite; Upoštevajte obdobje hrambe KVKK in pravila tretjih oseb. Pusti svoj pečat.

trije mini kovčki

Primer 1 – Zaščita občutljivih podatkov. Strokovnjak za odškodninske zahtevke je želel AI vprašati o zapleteni kartoteki zdravstvenega zavarovanja. Namesto da bi napisal ime, osebno izkaznico in diagnozo zavarovanca, je ustvaril anonimni kontekst, kot je "52 let, ženska, dopolnilna zdravstvena polica, načrtovana operacija srčne zaklopke, sporen znesek". Kakovost izpisa se ni zmanjšala; Zasebni podatki niso šli v noben oblak. Zdravstveni podatki so predmet najvišje zaščite; ta navada preprečila kršitev.

Primer 2 – Redka kombinirana past. »38 let, ženska, edina farmacevtka v [zelo majhnem okrožju], politika poklicne odgovornosti,« je zapisal en strokovnjak. Čeprav to tehnično ni vsebovalo imena, je neposredno razkrilo njegovo identiteto, saj je bil edini farmacevt v tem okrožju. Strokovnjak je to opazil in posplošil kot »majhno naselje, zdravstvena stroka«. Anonimizacija ni samo brisanje imena, je uničevanje prepoznavnosti.

Primer 3 – Napačna izbira orodja. Zaradi hitrosti bi zaposleni naložil razčlenitev zahtevkov strank v brezplačno javno orodje. Politika ekipe stopi v veljavo: podatki o strankah se obdelujejo samo v pogodbenem orodju, ki ga odobri institucija. Zaposleni je podatke najprej anonimiziral in nato zagnal v odobrenem orodju. Če bi uporabili neodobreno orodje, bi bilo tveganje za shranjevanje in uporabo podatkov v izobraževanju neobvladljivo.

Štirje pozivi za kopiranje

1) Pomočnik za anonimizacijo:

Iz besedila odstranite vse osebne in identifikacijske podatke: ime, priimek, osebno izkaznico, datum rojstva, telefon, naslov, številko police, registrsko tablico, lastniški list, IBAN. Zamenjajte jih z dejanskim ekvivalentom z analitičnim pomenom (npr. "45 let, moški, zavarovalna polica, enostranski trk"). Posplošite redke/izrazite kombinacije (majhen kraj + poseben poklic). Ohraniti medicinski/tehnični pomen. Besedilo: [prilepi]

2) Preverjanje prepoznavnosti:

Preverite naslednje anonimizirano besedilo za prepoznavanje: [besedilo]Vprašaj: Ali lahko neznanec najde osebo s tem besedilom? Ali obstaja redka kombinacija (majhno naselje + določen poklic/dogodek), edinstven datum ali znesek? Označite vsako tvegano točko in predlagajte, kako varneje posploševati.

3) Zahteva po podatkih in razvrstitev:

Razvrstite in preizkusite zahteve za podatke, potrebne za naslednjo nalogo: Naloga: [opis] Podatki, ki jih imam: [seznam] Za vsak podatek: vrsta (identiteta/finančni/posebni/datoteka), ali je potreben za to nalogo (da/ne), če je potrebno, kako jo uporabiti anonimno. Nepotrebne podatke označite kot "ne uporabljaj".

4) Kontrolni seznam za izbiro vozila:

Pred uporabo orodja AI s podatki o zavarovanju ustvarite kontrolni seznam. Vključite vprašanja: Ali je vozilo odobrila institucija? Ali obstaja pogodba o obdelavi podatkov? Ali shranjuje/uporablja vnos pri usposabljanju? Kje se podatki obdelujejo? Za kateri tip podatkov je primeren/neprimeren? Je anonimizacija dovolj?

Šibek poziv/močan poziv

Slabo: "Ocenite datoteko stranke Ahmeta Yılmaza (TC 123 ..., priloženo zdravniško poročilo)."
Težava: identiteta in občutljivi (zdravstveni) podatki se delijo neposredno; velika nevarnost kršitve KVKK.
Močno: "Razmislite o naslednjem anonimiziranem kontekstu: starost 52 let, ženska, dodatna zdravstvena politika, načrtovana operacija, sporni znesek. Brez identifikacijskih podatkov."
Zakaj je dobro: Analitični pomen je ohranjen, identiteta in občutljivi podatki niso razkriti.

primerjalna tabela

Vrsta podatkov

Stopnja zaščite

Uporaba v umetni inteligenci

Ime/TC/kontakt

visoka

Odstranite, postavite enakovredno

Finančni (prihodki/IBAN)

visoka

Odstrani/posploši

Zdravstvene/posebne kvalifikacije

najvišja

Nikoli surov; anonimno + odobreno vozilo

Številka police/tablica/lastninska listina

srednje visoka

Odstrani; samo je tvegano

Agregat/statistika

nizka

Na voljo (če ni kontakta)

Pogoste napake

  • Lepljenje neobdelanih osebnih/zdravstvenih podatkov. Najpogostejša in najhujša kršitev.
  • Razmišljanje, da je dovolj samo brisanje imena. Redke kombinacije lahko še vedno razkrijejo identiteto.
  • Zanaša se na besedo »izbriši pozneje«. Orodje morda shranjuje/uporablja podatke pri usposabljanju.
  • Neodobrena/javna vožnja. Nenadzorovana obdelava podatkov.
  • Ne upravljam shranjevanja in skupne rabe. Neomejeno shranjevanje izhodnih podatkov, nenadzorovana deljenja s tretjimi osebami.

Če povzamem

Podatki o zavarovanju so zelo občutljivi; Posebni podatki, kot je zdravje, so predmet najvišjega varstva po KVKK. Razvrstite, izpodbijajte in anonimizirajte podatke, preden jih daste AI: odstranite identifikatorje, uvedite dejanske ekvivalente, posplošite redke kombinacije. Občutljive podatke obdelujte le v orodjih, ki jih odobri institucija, in v minimalnem obsegu. Upravljajte obdobje shranjevanja in skupno rabo tretjih oseb v okviru KVKK in pustite sled. V konkretnem primeru se posvetujte z oddelkom za skladnost/pravno službo; Razkritih podatkov ni mogoče pridobiti.

Aplikacijska naloga

Pridobite pravo škodo/referenčno besedilo (za namene testiranja). Anonimiziraj z pozivom št. 1, nato preveri prepoznavanje z pozivom št. 2: ali so v besedilu še vedno redke kombinacije, ki bi lahko razkrile osebo? Posplošite vsako tveganje, ki ga najdete. Ocenite tudi orodje AI, ki ga uporabljate, s kontrolnim seznamom številka 4: ali je primerno za občutljive podatke?

kontrolni seznam

  • [ ] Podatke sem razvrstil po vrstah.
  • [ ] Uporabil sem preizkus nujnosti; Nisem uporabil nepotrebnih podatkov.
  • [ ] Odstranil sem identifikatorje in jih nadomestil z dejanskim ekvivalentom.
  • [ ] Posplošil sem redke/izrazite kombinacije.
  • [ ] Opravil sem preverjanje prepoznavnosti.
  • [ ] Uporabljal sem samo pogodbena vozila, ki jih je odobrilo podjetje.
  • [ ] Upravljal sem shranjevanje in souporabo tretjih oseb v skladu s KVKK; Pustila sem pečat.