Yunit 7 / 12

Pagproseso ng Data, Imbakan, Pag-minimize at Anonymization

Mga nadagdag:

  • Ilapat ang mga pagsasaalang-alang ng AI sa bawat yugto ng lifecycle ng data
  • Magtakda ng mga panahon ng pagpapanatili at isama ang mga kasaysayan ng chat ng AI sa patakaran sa pagsira
  • Paglalapat ng pagkakaiba sa pagitan ng anonymization at pseudonymization

Ang "pagkatapos" na bahagi ng data ay kung saan madalas na napapansin ng isang opisyal ng proteksyon ng data. Sa sandaling naipasok ang isang text sa AI, mukhang tapos na ang trabaho; Gayunpaman, ang data na iyon ay naka-imbak sa isang lugar, maaaring ginagamit sa pagsasanay ng modelo, marahil ito ay naipon sa kasaysayan ng chat sa loob ng maraming buwan. Sa yunit na ito, tatalakayin natin ang ikot ng buhay ng personal na data nang sunud-sunod; Malalaman natin ang tungkol sa mga panahon ng pagpapanatili, pagkasira ng mga kasaysayan ng chat ng AI, at pagkilala sa pagitan ng dalawang kritikal na diskarte — anonymization at pseudonymization. Ang layunin ay upang pamahalaan ang data sa buong buhay nito, hindi lamang kapag ito ay ipinasok.

Lifecycle ng data at AI

Ang personal na data ay dumadaan sa isang lifecycle; Ang bawat yugto ay may mga punto ng pansin na partikular sa AI.

entablado

Ano ang mangyayari?

AI attention point

koleksyon

Nakuha ang datos

Malinaw ba ang layunin at batayan? Nabawasan ba ito?

Paggamit/pagproseso

Pumasok sa AI, naproseso

Nagawa na ba ang masking? Inaprubahang sasakyan?

imbakan

Pinapanatili ang data

Gaano katagal ang kasaysayan ng chat?

paglipat

napupunta sa iba

Pang-internasyonal na server? Mayroon bang angkop na katiyakan?

Pagkawasak

Pagtanggal/pag-anonymize

Tinanggal ba ito pagkatapos makumpleto ang layunin? Kasama ba ang mga spares?

Ang dalawang pinaka-napapabayaang yugto ay ang pag-iimbak at pagtatapon. Ang data ay "nakalimutan" at patuloy na naiipon sa system — na parehong lumalabag sa prinsipyo ng KVKK at pinalalaki ang pinsala kung sakaling magkaroon ng paglabag.

Oras ng pag-iimbak: gaano katagal mo ito maiimbak?

Ang prinsipyo ng pagpapanatili ng KVKK ay malinaw: ang personal na data ay hindi maaaring panatilihing mas matagal kaysa kinakailangan para sa layunin kung saan ito pinoproseso. Kapag hindi na available ang layunin, dapat tanggalin, sirain o anonymize ang data. Ang institusyon ay naghahanda ng isang patakaran sa imbakan at pagtatapon; tinutukoy kung magkano ang dapat panatilihin para sa bawat kategorya ng data.

Kritikal na puntong partikular sa AI: Ang mga kasaysayan ng chat ng AI ay nakaimbak din ng data. Kung ang isang empleyado ay naglagay ng data ng customer sa parehong chat sa loob ng maraming buwan, ang kasaysayang iyon ay magiging isang imbakan ng data. Para dito:

  • I-configure ang mga setting ng pagpapanatili ng data sa mga enterprise AI tool (auto-delete ang history kung maaari o i-off ang paggamit sa pagsasanay ng modelo).
  • Isama ang kasaysayan ng chat sa iyong iskedyul ng pagsira.
  • Tiyakin ang opsyon na "Huwag gamitin sa pagsasanay sa modelo" (opt-out) sa kontrata ng kumpanya.
Pansin: Ang pagtanggal ng data ay hindi lamang pagtanggal nito sa screen. Dapat ding isaalang-alang ang mga backup, log, at kopya sa server ng provider. Kapag sinabi mong "tinanggal", siguraduhin na ang iyong tinanggal ay talagang hindi na mababawi.

Anonymization o pseudonymization?

Ang dalawang terminong ito ay madalas na nalilito, ngunit ang kanilang mga legal na kahihinatnan ay dyametro na sumasalungat.

  • Anonymization: Paggawa ng data upang hindi ito maiugnay sa isang tao sa anumang paraan. Kung ginawa nang tama, ang resulta ay hindi na personal na data at nasa labas ng saklaw ng KVKK. Halimbawa: Pagtanggal ng mga indibidwal na row sa isang set ng data ng 10,000 tao at nag-iiwan lamang ng mga pinagsama-samang istatistika gaya ng "Average na paggastos sa pangkat ng edad na 25-34 sa Istanbul."
  • Pseudonymization: Ang impormasyon ng pagkakakilanlan ay pinapalitan ng isang code/tag, ngunit maaaring ibalik sa taong may "key". Halimbawa: Pagsusulat ng "Customer-4471" sa halip na "Ahmet Yılmaz", ngunit pinapanatili ang isang talahanayan na nagpapakita kung aling code ang pag-aari. Personal data pa rin ito at nasa saklaw ng KVKK.

tampok

Anonymization

Pseudonymization

Maaari bang ibalik ang tao?

Hindi (kung ginawa nang tama)

Oo, kasama ang susi

Personal data pa rin ba ito?

hindi

Oo

Saklaw ng KVKK

sa labas

sa

Para makapasok sa AI

Ang pinakaligtas na paraan

Muli, kailangan ng batayan/panuntunan

Tip: "Nababaligtad ba ito?" bago magpasok ng data sa AI. magtanong. Kung mayroong isang susi/tugma sa loob nito, ito ay pseudonymised at personal na data pa rin. Ang tunay na anonymization ay ang pagbabahagi ng pinagsama-samang resulta, hindi ang mga indibidwal na row.

tatlong mini case

Case 1 — Pekeng anonymity. Ang isang kumpanya ng pangangalagang pangkalusugan ay nagbibigay sa AI ng isang set ng data na sinasabi nitong "na-anonymize" para sa pagsusuri. Ngunit kasama sa set ang petsa ng kapanganakan, county, at isang bihirang diagnosis; ang trio na ito ay maaaring magpahiwatig ng isang solong tao sa isang maliit na county. Hindi ito anonymization; personal pa rin ang data. Ang tamang paraan: pag-convert ng petsa ng kapanganakan sa hanay ng edad, pag-generalize ayon sa county, pagpapangkat ng mga bihirang diagnosis—iyon ay, totoong pagsasama-sama.

Kaso 2 — Nakatambak ang pag-uusap. Sa isang call center, 6 na ahente ang naglalagay ng data ng customer sa parehong corporate AI account sa loob ng 4 na buwan. Walang naglilinaw sa nakaraan; sa kalaunan higit sa 12,000 mga pakikipag-ugnayan ng customer ang naipon sa isang lugar. Sa isang pag-audit, ang akumulasyon na ito ay minarkahan bilang isang malaking panganib. Solusyon: pagtatakda upang awtomatikong tanggalin ang kasaysayan tuwing 30 araw, isang panuntunan upang mag-log out kapag tapos na ang trabaho, at isang sugnay na bukas sa patakaran sa pagpapanatili.

Case 3 — Tamang pseudonymization. Kapag sinusuri ang performance ng empleyado gamit ang AI, ang isang HR team ay nagko-code ng mga pangalan tulad ng "Employee-001" at pinapanatili ang katugmang talahanayan sa isang hiwalay at pinaghihigpitan ng access na file. Ito ay pseudonymization; Ang data ay personal pa rin, ngunit ang panganib ay nabawasan. Alam ng team na hindi ito anonymization at tinutukoy nito ang legal na batayan at panahon ng pagpapanatili nang naaayon.

Mga nakopyang template

TEMPLATE 1 — Linya ng patakaran sa pagpapanatili at pagsira: "Magmungkahi ng linya ng patakaran sa pagpapanatili-pagsira para sa sumusunod na kategorya ng data: [kategorya]. Mga field: panahon ng pagpapanatili (nabibigyang-katwiran ayon sa layunin), paraan ng pagkasira (pagtanggal/pagsira/anonymization), kung kasama ang kasaysayan ng chat ng AI, responsableng tungkulin. Paalalahanan kung mayroong legal na obligasyon sa pagpapanatili."

TEMPLATE 2 — Anonymization check: "Suriin kung ang sumusunod na dataset ay tunay na anonymous: [listahan ang mga field]. Anong mga kumbinasyon ng mga field ang maaaring gawing muli ang pagkakakilanlan ng isang tao (hal. petsa ng kapanganakan + zip code + bihirang feature)? Magmungkahi ng generalization para sa bawat field ng panganib (gaya ng hanay ng edad, antas ng probinsya) upang palakasin ang pagiging anonymity."

TEMPLATE 3 — Masking + return key separation: "Pseudonym the following text: encode personal data (like [NAME]->K001), but give me a matching table SEPARATELY. Huwag mag-iwan ng tunay na pagkakakilanlan sa text mismo. Tandaan na ang katugmang table ay 'personal data' at dapat na naka-imbak nang hiwalay."

TEMPLATE 4 — AI tool data storage audit: "Maghanda ng listahan ng mga tanong para i-audit ang data storage behavior ng AI ​​tool na ginagamit namin: gaano katagal itinatago ang history, maaari ba itong tanggalin, ginagamit ba ito sa model training, mayroon bang opt-out, saan pinoproseso ang data, ano ang mga backup? Isulat ang inaasahang 'secure' na sagot sa bawat tanong."

Mahinang prompt / Malakas na prompt

MAHINA: "I-anonymize ang data na ito." (nag-code at nag-iiwan ng mga pangalan)-> Mga palayaw lamang; Ang mga panganib sa muling pagkakakilanlan ay nananatili, tulad ng petsa ng kapanganakan, bihirang katangian; Lumilikha ito ng ilusyon ng "anonymous". GÜÇLÜ: "Maghanap ng mga kumbinasyon ng mga field sa set na ito na maaaring muling tukuyin ang tao; i-generalize ang bawat isa sa kanila (hanay ng edad, antas ng lalawigan). -> Ang modelo ay may gawi sa totoong anonymization, na binabawasan ang panganib ng muling pagkakakilanlan.

Mga karaniwang pagkakamali

  • Napagkamalan ang pseudonymization bilang anonymization; nakalimutan na ito ay nananatiling personal na data.
  • Pagtanggal ng mga pangalan at pag-iiwan ng mga mapaglarawang kumbinasyon tulad ng petsa ng kapanganakan + lokasyon + bihirang katangian.
  • Hindi sumasailalim sa AI chat history sa isang panuntunan sa pagpapanatili/pagsira; maipon nang walang katapusan.
  • Hindi tinitiyak ang sugnay na "Huwag gamitin sa pagsasanay sa modelo" (opt-out) sa kontrata.
  • Kapag sinabi kong pagtanggal, ang ibig kong sabihin ay i-clear lang ang screen at kalimutan ang tungkol sa mga backup at log.
  • Pagpapanatiling mas matagal ang panahon ng imbakan para sa "kung sakali" sa halip na para sa layunin.
  • Hindi pinapansin na ang paglilipat at pag-iimbak ay nagaganap din sa server ng provider.

Sa buod

  • Ang personal na data ay dumadaan sa isang lifecycle; Ang pinaka-napapabayaang mga yugto ay ang pag-iimbak at pagtatapon.
  • Ang data ay hindi maaaring itago nang mas mahaba kaysa sa kinakailangan para sa layunin; Ang institusyon ay dapat magtatag ng isang patakaran sa pag-iimbak at pagsira.
  • Ang mga kasaysayan ng AI chat ay naka-imbak din ng data; dapat isama sa iskedyul ng pagtatapon at mga setting ng imbakan.
  • Inaalis ng anonymization ang data sa KVKK; Iniiwan pa rin ng pseudonymization ang data na personal.
  • Ang pagtanggal ng pangalan ay hindi anonymization; Ang lahat ng mga kumbinasyong nasa panganib ng muling pagkakakilanlan ay dapat na pangkalahatan.

Gawain ng aplikasyon

Pumili ng kategorya ng data na pinoproseso ng iyong organisasyon gamit ang AI (halimbawa, mga talaan ng suporta sa customer). Sumulat ng linya ng patakaran sa pagpapanatili at pagsira para sa kategoryang ito: panahon ng pagpapanatili (nabibigyang-katwiran), paraan ng pagkasira, kung kasama ang kasaysayan ng chat ng AI, at responsableng tungkulin. Pagkatapos ay kumuha ng sample na record mula sa parehong data at i-pseudonymize muna ito (panatilihing hiwalay ang katugmang talahanayan), pagkatapos ay isulat kung aling mga field ang iyong i-generalize at kung paano dalhin ang record na ito sa totoong anonymization. Panghuli, maghanda ng limang tanong na kumokontrol sa pag-uugali ng pag-iimbak ng data ng AI tool na ginagamit mo at idagdag ang "secure" na sagot na inaasahan mo sa bawat isa.

checklist

  • [ ] Natukoy ko ang panahon ng pagpapanatili at paraan ng pagkasira para sa kategorya ng data.
  • [ ] Isinama ko ang kasaysayan ng AI chat sa iskedyul ng pagkasira.
  • [ ] Nilagyan ko ng check ang item sa pag-opt out na "Huwag gamitin sa pagsasanay sa modelo."
  • [ ] Ipinatupad ko ang pagkakaiba sa pagitan ng pseudonymization at anonymization.
  • [ ] Mayroon akong mga pangkalahatang kumbinasyon ng field na nasa panganib ng muling pagkakakilanlan.
  • [ ] Isinama ko rin ang mga backup at log sa saklaw ng pagtanggal.
  • [ ] Sinuri ko ang pag-uugali ng pag-iimbak ng data ng tool ng AI.