Keuntungan:
- Gunakan pertimbangan AI pada setiap peringkat kitaran hayat data
- Tetapkan tempoh pengekalan dan sertakan sejarah sembang AI dalam dasar pemusnahan
- Menggunakan perbezaan antara anonimasi dan nama samaran
Bahagian "selepas" data ialah tempat pegawai perlindungan data sering terlepas pandang. Sebaik sahaja teks dimasukkan ke dalam AI, ia kelihatan seperti kerja telah selesai; Walau bagaimanapun, data itu disimpan di suatu tempat, mungkin digunakan dalam latihan model, mungkin ia terkumpul dalam sejarah sembang selama berbulan-bulan. Dalam unit ini, kita akan membincangkan kitaran hayat data peribadi langkah demi langkah; Kita akan belajar tentang tempoh pengekalan, pemusnahan sejarah sembang AI dan membezakan antara dua teknik kritikal — anonimasi dan nama samaran. Matlamatnya adalah untuk mengurus data sepanjang hayatnya, bukan hanya apabila ia dimasukkan.
Kitaran hayat data dan AI
Data peribadi melalui kitaran hayat; Setiap peringkat mempunyai titik perhatian khusus AI.
pentas
Apa yang berlaku?
Titik perhatian AI
koleksi
Data diperolehi
Adakah tujuan dan asasnya jelas? Adakah ia telah diminimumkan?
Penggunaan/pemprosesan
Dimasukkan ke dalam AI, diproses
Adakah topeng telah dilakukan? Kenderaan yang diluluskan?
penyimpanan
Data dikekalkan
Berapa lamakah sejarah sembang bertahan?
pemindahan
pergi kepada orang lain
Pelayan antarabangsa? Adakah terdapat jaminan yang sesuai?
Kemusnahan
Pemadaman/anonimisasi
Adakah ia dipadamkan selepas tujuan selesai? Adakah alat ganti termasuk?
Dua peringkat yang paling diabaikan ialah penyimpanan dan pelupusan. Data "dilupakan" dan terus terkumpul dalam sistem — yang mana kedua-duanya melanggar prinsip KVKK dan memperbesar kerosakan sekiranya berlaku pelanggaran.
Masa penyimpanan: berapa lama anda boleh menyimpannya?
Prinsip pengekalan KVKK adalah jelas: data peribadi tidak boleh disimpan lebih lama daripada yang diperlukan untuk tujuan ia diproses. Apabila tujuannya tidak lagi tersedia, data harus dipadamkan, dimusnahkan atau tanpa nama. Institusi menyediakan dasar penyimpanan dan pelupusan; menentukan jumlah yang perlu disimpan untuk setiap kategori data.
Titik kritikal khusus untuk AI: Sejarah sembang AI juga disimpan data. Jika pekerja telah memasukkan data pelanggan ke dalam sembang yang sama selama berbulan-bulan, sejarah itu menjadi repositori data. Untuk ini:
- Konfigurasikan tetapan pengekalan data dalam alat AI perusahaan (autopadam sejarah jika boleh atau matikan penggunaan dalam latihan model).
- Sertakan sejarah sembang dalam jadual pemusnahan anda.
- Pastikan pilihan "Jangan gunakan dalam latihan model" (pilih keluar) dalam kontrak korporat.
Perhatian: Memadam data bukan sekadar mengalih keluarnya daripada skrin. Sandaran, log dan salinan pada pelayan pembekal juga perlu dipertimbangkan. Apabila anda menyebut "dipadamkan", pastikan bahawa apa yang anda padamkan benar-benar tidak boleh diperolehi semula.
Anonim atau nama samaran?
Kedua-dua istilah ini sering keliru, tetapi akibat undang-undangnya bertentangan secara diametrik.
- Anonimisasi: Membuat data supaya ia tidak boleh dikaitkan dengan seseorang dalam apa cara sekalipun. Jika dilakukan dengan betul, hasilnya bukan lagi data peribadi dan berada di luar skop KVKK. Contoh: Memadamkan baris individu dalam set data 10,000 orang dan hanya meninggalkan statistik agregat seperti "Perbelanjaan purata dalam kumpulan umur 25-34 tahun di Istanbul".
- Nama samaran: Maklumat identiti digantikan dengan kod/teg, tetapi boleh dikembalikan kepada orang yang mempunyai "kunci". Contoh: Menulis "Customer-4471" dan bukannya "Ahmet Yılmaz", tetapi menyimpan jadual yang menunjukkan kod milik siapa. Ini masih data peribadi dan termasuk dalam skop KVKK.
ciri
Anonimisasi
nama samaran
Bolehkah orang itu dikembalikan?
Tidak (jika dilakukan dengan betul)
Ya, dengan kunci
Adakah ia masih data peribadi?
tidak
ya
Skop KVKK
luar
dalam
Untuk masuk ke AI
Cara paling selamat
Sekali lagi, asas/peraturan diperlukan
Petua: "Adakah ia boleh diterbalikkan?" sebelum memasukkan data ke dalam AI. bertanya. Jika terdapat kunci/padanan di dalamnya, ia adalah nama samaran dan masih data peribadi. Anonimisasi sebenar ialah berkongsi hasil agregat, bukan baris individu.
tiga kes mini
Kes 1 — Tanpa nama palsu. Sebuah syarikat penjagaan kesihatan memberikan AI satu set data yang dikatakan telah "dianonimkan" untuk analisis. Tetapi set termasuk tarikh lahir, daerah, dan diagnosis yang jarang berlaku; trio ini mungkin menunjukkan satu orang di daerah kecil. Ini bukan tanpa nama; data masih peribadi. Cara yang betul: menukar tarikh lahir kepada julat umur, membuat generalisasi mengikut daerah, mengumpulkan diagnosis yang jarang berlaku—iaitu, pengagregatan sebenar.
Kes 2 — Perbualan bertimbun. Di pusat panggilan, 6 ejen memasukkan data pelanggan ke dalam akaun AI korporat yang sama selama 4 bulan. Tiada siapa yang membersihkan masa lalu; akhirnya lebih daripada 12,000 interaksi pelanggan terkumpul di satu tempat. Dalam audit, pengumpulan ini ditandakan sebagai risiko utama. Penyelesaian: tetapan untuk memadam sejarah secara automatik setiap 30 hari, peraturan untuk log keluar apabila kerja selesai dan klausa terbuka kepada dasar pengekalan.
Kes 3 — Pemberian nama samaran yang betul. Apabila menganalisis prestasi pekerja dengan AI, pasukan HR mengekodkan nama seperti "Pekerja-001" dan menyimpan jadual padanan dalam fail terhad akses yang berasingan. Ini adalah nama samaran; Data masih peribadi, tetapi risikonya dikurangkan. Pasukan ini sedar bahawa ini bukan pennamaan dan menentukan asas undang-undang dan tempoh pengekalannya dengan sewajarnya.
Templat yang boleh disalin
TEMPLAT 1 — Garis dasar pengekalan dan pemusnahan: "Cadangkan garis dasar pengekalan-pemusnahan untuk kategori data berikut: [kategori]. Medan: tempoh pengekalan (dijustifikasikan oleh tujuan), kaedah pemusnahan (pemadaman/pemusnahan/anonimisasi), sama ada sejarah sembang AI disertakan, peranan yang bertanggungjawab. Ingatkan jika terdapat kewajipan pengekalan undang-undang."
TEMPLAT 2 — Semakan anonimasi: "Nilai sama ada set data berikut benar-benar tanpa nama: [senarai medan]. Apakah kombinasi medan yang boleh menjadikan seseorang itu boleh dikenal pasti semula (cth. tarikh lahir + poskod + ciri jarang)? Cadangkan generalisasi untuk setiap medan risiko (seperti julat umur, peringkat wilayah) untuk mengukuhkan ketaknamaan."
TEMPLAT 3 — Menyamarkan + pemisahan kunci kembali: "Nama samaran teks berikut: mengekod data peribadi (seperti [NAME]->K001), tetapi berikan saya jadual padanan SECARA BERASINGAN. Jangan tinggalkan identiti sebenar dalam teks itu sendiri. Ambil perhatian bahawa jadual padanan ialah 'data peribadi' dan harus disimpan secara berasingan."
TEMPLAT 4 — Audit storan data alat AI: "Sediakan senarai soalan untuk mengaudit gelagat penyimpanan data alat AI yang kami gunakan: berapa lama sejarah disimpan, bolehkah ia dipadam, adakah ia digunakan dalam latihan model, adakah terdapat pilihan untuk tidak ikut serta, di mana data diproses, apakah sandaran? Tulis jawapan 'selamat' yang dijangkakan untuk setiap soalan."
Gesaan lemah / Gesaan kuat
LEMAH: "Tanpa namakan data ini." (kod dan tinggalkan nama)-> Hanya nama panggilan; Risiko pengenalan semula kekal, seperti tarikh lahir, sifat yang jarang berlaku; Ia mencipta ilusi "tanpa nama". GÜÇLÜ: "Cari gabungan medan dalam set ini yang boleh mengenal pasti semula orang itu; umumkan setiap satu daripadanya (julat umur, peringkat wilayah). Matlamat saya bukanlah satu rekod, tetapi statistik agregat. Akibatnya, tiada siapa yang boleh dibezakan sebagai satu orang dan sahkan perkara ini." -> Model ini cenderung ke arah anonimasi sebenar, mengurangkan risiko pengecaman semula.
Kesilapan biasa
- Tersilap nama samaran sebagai anonimasi; lupa bahawa ia kekal sebagai data peribadi.
- Memadamkan nama dan meninggalkan kombinasi deskriptif seperti tarikh lahir + lokasi + sifat jarang berlaku.
- Tidak tertakluk kepada sejarah sembang AI kepada peraturan pengekalan/pemusnahan; terkumpul selama-lamanya.
- Tidak memastikan klausa "Jangan gunakan dalam latihan model" (pilih keluar) dalam kontrak.
- Apabila saya sebut pemadaman, maksud saya cuma kosongkan skrin dan lupakan tentang sandaran dan log.
- Mengekalkan tempoh penyimpanan lebih lama untuk "berjaga-jaga" dan bukannya untuk tujuan tersebut.
- Mengabaikan bahawa pemindahan dan penyimpanan juga berlaku pada pelayan pembekal.
Secara ringkasnya
- Data peribadi melalui kitaran hayat; Peringkat yang paling diabaikan ialah penyimpanan dan pelupusan.
- Data tidak boleh disimpan lebih lama daripada yang diperlukan untuk tujuan tersebut; Institusi harus mewujudkan dasar penyimpanan dan pemusnahan.
- Sejarah sembang AI juga disimpan data; hendaklah disertakan dalam jadual pelupusan dan tetapan penyimpanan.
- Anonimisasi mengeluarkan data daripada KVKK; Nama samaran masih menjadikan data peribadi.
- Memadamkan nama bukan pennamaan; Semua kombinasi yang berisiko pengenalpastian semula harus digeneralisasikan.
Tugasan permohonan
Pilih kategori data yang diproses oleh organisasi anda dengan AI (contohnya, rekod sokongan pelanggan). Tulis garis dasar pengekalan dan pemusnahan untuk kategori ini: tempoh pengekalan (wajar), kaedah pemusnahan, sama ada sejarah sembang AI disertakan dan peranan yang bertanggungjawab. Kemudian ambil rekod sampel daripada data yang sama dan buat nama samaran dahulu (sisihkan jadual padanan berasingan), kemudian tulis medan mana yang akan anda umumkan dan cara membawa rekod ini kepada anonimasi sebenar. Akhir sekali, sediakan lima soalan yang mengawal tingkah laku penyimpanan data alat AI yang anda gunakan dan tambahkan jawapan "selamat" yang anda harapkan untuk setiap satu.
senarai semak
- [ ] Saya telah menentukan tempoh pengekalan dan kaedah pemusnahan untuk kategori data.
- [ ] Saya telah memasukkan sejarah sembang AI dalam jadual pemusnahan.
- [ ] Saya menandai item tarik diri "Jangan gunakan dalam latihan model".
- [ ] Saya melaksanakan perbezaan antara nama samaran dan tanpa nama.
- [ ] Saya mempunyai gabungan medan umum yang berisiko pengecaman semula.
- [ ] Saya juga memasukkan sandaran dan log dalam skop pemadaman.
- [ ] Saya mengaudit kelakuan penyimpanan data alat AI.