Unit 10 / 11

Privasi Data, Pemilihan Alat Selamat dan Anonimisasi

Keuntungan:

  • Anonimisasi dan penilaian keperluan sebelum memberikan data sensitif dan kewangan pelanggan kepada alat kecerdasan buatan
  • Keupayaan untuk membezakan perbezaan antara alat AI korporat dan awam dalam privasi, pengekalan data dan penggunaan dalam pendidikan
  • Keupayaan untuk mengurus pelanggaran data, tempoh pengekalan dan risiko perkongsian pihak ketiga dalam rangka kerja KVKK

Insurans adalah salah satu profesion yang bekerja dengan data paling sensitif. Fail insurans; Ia mungkin termasuk maklumat identiti, alamat, pendapatan, akaun bank, sejarah kesihatan, rekod kerosakan, plat lesen, surat hak milik dan juga maklumat keluarga. Sebahagian daripada data ini tertakluk kepada perlindungan tertinggi sebagai "data peribadi yang bersifat istimewa" dalam KVKK (Undang-undang Perlindungan Data Peribadi); Data kesihatan, biometrik dan yang serupa adalah contoh biasa bagi perkara ini. Perkongsian data ini yang tidak terkawal apabila menggunakan alat kecerdasan buatan (terutamanya berasaskan awan) adalah risiko serius pelanggaran dan kehilangan kepercayaan. Setelah bocor, data tidak boleh diambil semula. Dalam unit ini, anda akan mempelajari cara untuk menamakan data pelanggan (mengalih keluar maklumat yang boleh dikenal pasti secara peribadi) sebelum memberikannya kepada kecerdasan buatan, perbezaan privasi antara alat korporat dan awam, dan cara mengurus risiko pelanggaran data, penyimpanan dan perkongsian pihak ketiga dalam rangka kerja KVKK. Unit ini bukan nasihat undang-undang; Menjelaskan prinsip umum, berunding dengan jabatan pematuhan/undang-undang dalam kes tertentu.

Mengapa privasi adalah penting: jenis data

Dalam insurans, adalah perlu untuk memisahkan data mengikut tahap perlindungan:

  • Data identiti: Nama, nama keluarga, nombor ID TR, tarikh lahir, kenalan. Ia secara langsung mengenal pasti orang itu.
  • Data kewangan: Pendapatan, akaun bank, sejarah pembayaran. Peribadi dan sensitif.
  • Data kualiti khas: Kesihatan, data biometrik. Perlindungan tertinggi; Syarat yang lebih ketat (persetujuan eksplisit atau pengecualian berkanun) diperlukan untuk pemprosesan.
  • Data fail: Nombor polisi, plat lesen, surat hak milik, butiran kerosakan. Apabila digabungkan dengan orang lain, ia boleh mendedahkan identiti.

Bahaya terbesar ialah kebolehcaman yang berlaku apabila anda menggabungkan data ini. Walaupun "wanita berusia 45 tahun" tidak dikenali, "wanita berusia 45 tahun + plat lesen tertentu + alamat tertentu" boleh mendedahkan identiti.

Perhatian: Menyebut "padam" selepas memberikan data kepada alat kecerdasan buatan sebenarnya tidak memadamkannya. Sesetengah alatan menyimpan input dan juga menggunakannya untuk melatih model. Peraturan: jangan sekali-kali menghantar data sensitif; Anonimisasi datang sebelum dihantar.

Anonimisasi: bagaimana untuk melakukannya

Anonimasi ialah penyingkiran maklumat yang boleh dikenal pasti dan penggantian dengan persamaan fakta; Matlamatnya adalah untuk menjadikan orang itu tidak dapat dikenali sambil mengekalkan kualiti keluaran. Anonimisasi yang baik:

  • Mengalih keluar nama, ID TR, telefon, alamat, nombor polisi, plat lesen dan maklumat surat hak milik.
  • Dia menggantikannya dengan persamaan bermakna secara analitikal: "45 tahun, lelaki, polisi insurans, Central Anatolia, perlanggaran berat sebelah".
  • Ia mengelakkan gabungan yang jarang/tersendiri: profesion yang sangat khusus + tempat yang sangat kecil, yang sahaja boleh membuka identiti.
  • Mengekalkan makna perubatan/teknikal: seperti "kesihatan pelengkap, pembedahan ortopedik yang dirancang".
Petua: Selepas tanpa nama, tanya diri anda: "Jika orang yang tidak dikenali membaca teks ini, bolehkah dia mencari orang itu?" Jika jawapannya ya, umumkan lagi. Terutamanya kombinasi yang jarang berlaku (daerah kecil + acara khusus) adalah berbahaya.

Alat perusahaan lwn awam

Tidak semua alatan AI mempunyai tahap privasi yang sama. Mereka berbeza dalam tiga dimensi:

  1. Pengekalan data: Adakah ia mengekalkan input dan untuk berapa lama?
  2. Gunakan dalam latihan: Adakah ia menggunakan input untuk melatih model?
  3. Lokasi dan kontrak: Di manakah data diproses, adakah terdapat perjanjian pemprosesan data korporat?

Alat institusi (kontrak institusi, jaminan pemprosesan data) sering menawarkan had untuk tidak menggunakan dan menyimpan data dalam pendidikan. Alat awam dan percuma boleh menyimpan input dan menggunakannya dalam latihan. Peraturan: data sensitif diproses hanya dalam cara yang diluluskan institusi, dikontrakkan dan dalam bentuk tanpa nama yang mungkin. Memasukkan data pelanggan ke dalam alat yang tidak diluluskan menjadikan pemproses data tidak boleh diaudit.

Langkah demi langkah: Bekerja dengan selamat dengan data sulit

  1. Kelaskan data. Data identiti / kewangan / kualiti khas / fail.
  2. Ujian keperluan. Adakah data ini benar-benar diperlukan untuk tugas ini? Jika tidak, jangan gunakannya.
  3. anonimkan. Alih keluar pengecam, gantikan persamaan fakta, umumkan gabungan jarang.
  4. Pilih kenderaan. Hanya kenderaan kontrak yang diluluskan oleh agensi; Tiada data sensitif tersedia untuk alat awam.
  5. Bekerja dengan data minimum. Kongsi maklumat minimum yang diperlukan untuk tugas itu.
  6. Urus storan dan perkongsian. Di manakah anda menyimpan output, dengan siapa anda berkongsinya; Mematuhi tempoh pengekalan KVKK dan peraturan pihak ketiga. Tinggalkan tanda anda.

tiga kes mini

Kes 1 — Melindungi data sensitif. Seorang pakar tuntutan ingin bertanya kepada AI tentang fail insurans kesihatan yang kompleks. Daripada menulis nama, ID dan diagnosis orang yang diinsuranskan, dia mencipta konteks tanpa nama seperti "52 tahun, wanita, polisi kesihatan pelengkap, pembedahan injap jantung yang dirancang, jumlah yang dipertikaikan". Kualiti keluaran tidak menurun; Data peribadi tidak pergi ke mana-mana awan. Data kesihatan tertakluk kepada perlindungan tertinggi; tabiat ini menghalang pelanggaran.

Kes 2 — Perangkap gabungan yang jarang berlaku. "38 tahun, wanita, satu-satunya ahli farmasi di [daerah yang sangat kecil], dasar liabiliti profesional," tulis seorang pakar. Walaupun secara teknikalnya ini tidak mengandungi nama, ia secara langsung mendedahkan identitinya kerana dia adalah satu-satunya ahli farmasi di daerah itu. Pakar itu menyedari perkara ini dan menggeneralisasikannya sebagai "petempatan kecil, profesion penjagaan kesihatan". Anonimisasi bukan sekadar memadamkan nama, malah memusnahkan kebolehcaman.

Kes 3 — Pemilihan alat yang salah. Untuk kelajuan, pekerja akan memuat naik pecahan tuntutan pelanggan ke alat awam percuma. Dasar pasukan mula berkuat kuasa: data pelanggan diproses hanya dalam alat kontrak yang diluluskan oleh institusi. Pekerja itu mula-mula menamakan data dan kemudian menjalankannya dalam alat yang diluluskan. Jika alat yang tidak diluluskan digunakan, risiko penyimpanan data dan penggunaan dalam pendidikan akan menjadi tidak terkawal.

Empat gesaan yang boleh disalin

1) Pembantu anonimasi:

Alih keluar semua data peribadi dan pengenalan daripada teks berikut: nama, nama keluarga, ID, tarikh lahir, telefon, alamat, nombor polisi, plat lesen, surat hak milik, IBAN. Gantikannya dengan persamaan fakta dengan makna analitikal (cth. "45 tahun, lelaki, polisi insurans, perlanggaran berat sebelah"). Mengitlak gabungan yang jarang/tersendiri (tempat kecil + pekerjaan khas). Kekalkan makna perubatan/teknikal.Teks: [tampal]

2) Semakan kebolehcaman:

Semak teks tanpa nama berikut untuk pengecaman: [teks]Tanya: Bolehkah orang yang tidak dikenali menemui orang yang mempunyai teks ini? Adakah terdapat kombinasi yang jarang berlaku (penempatan kecil + profesion/acara tertentu), tarikh atau jumlah unik? Serlahkan setiap perkara berisiko dan cadangkan cara membuat generalisasi dengan lebih selamat.

3) Keperluan dan klasifikasi data:

Kelaskan dan uji keperluan data yang diperlukan untuk tugasan berikut:Tugas: [penerangan] Data yang saya ada: [senarai]Untuk setiap data: jenis (identiti/kewangan/khas/fail), adakah ia diperlukan untuk tugas ini (ya/tidak), jika perlu, cara menggunakannya tanpa nama. Tandakan data yang tidak diperlukan sebagai "jangan gunakan".

4) Senarai semak pemilihan kenderaan:

Buat senarai semak sebelum menggunakan alat AI dengan data insurans. Sertakan soalan: Adakah kenderaan itu diluluskan oleh institusi? Adakah terdapat perjanjian pemprosesan data? Adakah ia menyimpan/menggunakan input dalam latihan? Di manakah data diproses? Untuk jenis data yang manakah ia sesuai/tidak sesuai? Adakah cukup nama tanpa nama?

Gesaan lemah / Gesaan kuat

Lemah: "Nilai fail pelanggan Ahmet Yılmaz (TC 123..., laporan perubatan dilampirkan)."
Masalah: Identiti dan data sensitif (kesihatan) dikongsi secara langsung; risiko besar pelanggaran KVKK.
Kuat: "Pertimbangkan konteks tanpa nama berikut: umur 52 tahun, wanita, dasar kesihatan tambahan, pembedahan yang dirancang, jumlah yang dipertikaikan. Tiada maklumat mengenal pasti."
Sebab ia bagus: Maksud analitikal dipelihara, identiti dan data sensitif tidak didedahkan.

carta perbandingan

Jenis data

Tahap perlindungan

Gunakan dalam kecerdasan buatan

Nama/TC/kenalan

tinggi

Keluarkan, letak setara

Kewangan (pendapatan/IBAN)

tinggi

Keluarkan / umumkan

Kesihatan/kelayakan khas

tertinggi

Tidak pernah mentah; kenderaan tanpa nama + diluluskan

Nombor polisi/plat/surat hak milik

sederhana tinggi

Keluarkan; bersendirian adalah berisiko

Agregat/statistik

rendah

Tersedia (jika tiada kenalan)

Kesilapan biasa

  • Menampal data peribadi/kesihatan mentah. Pelanggaran yang paling kerap dan paling teruk.
  • Berfikir bahawa hanya memadamkan nama itu sudah memadai. Gabungan yang jarang berlaku mungkin masih mendedahkan identiti.
  • Bergantung pada mengatakan "padam kemudian." Alat ini mungkin menyimpan/menggunakan data dalam latihan.
  • Pemanduan tidak diluluskan/awam. Pemprosesan data yang tidak terkawal.
  • Tidak mengurus storan dan perkongsian. Storan output tanpa had, perkongsian tidak terkawal dengan pihak ketiga.

Secara ringkasnya

Data insurans sangat sensitif; Data khas seperti kesihatan tertakluk kepada perlindungan tertinggi di bawah KVKK. Kelaskan, cabar dan awanamakan data sebelum memberikannya kepada AI: alih keluar pengecam, perkenalkan persamaan fakta, umumkan gabungan yang jarang berlaku. Memproses data sensitif hanya dalam alat yang diluluskan institusi, dikontrakkan dan pada tahap yang minimum. Uruskan tempoh penyimpanan dan perkongsian pihak ketiga dalam rangka kerja KVKK dan tinggalkan jejak. Rujuk pematuhan/perundangan dalam kes tertentu; Data yang bocor tidak boleh diambil semula.

Tugasan permohonan

Dapatkan teks kerosakan/rujukan sebenar (untuk tujuan ujian). Anonimkan dengan gesaan #1, kemudian semak pengecaman dengan gesaan #2: adakah masih terdapat gabungan yang jarang berlaku dalam teks yang boleh mendedahkan orang itu? Umumkan setiap risiko yang anda temui. Juga nilai alat AI yang anda gunakan dengan senarai semak nombor 4: adakah ia sesuai untuk data sensitif?

senarai semak

  • [ ] Saya mengelaskan data mengikut jenisnya.
  • [ ] Saya menggunakan ujian keperluan; Saya tidak menggunakan data yang tidak diperlukan.
  • [ ] Saya mengalih keluar pengecam dan menggantikannya dengan persamaan fakta.
  • [ ] Saya menyamaratakan gabungan yang jarang berlaku/tersendiri.
  • [ ] Saya melakukan semakan kebolehcaman.
  • [ ] Saya hanya menggunakan kenderaan kontrak yang diluluskan oleh syarikat.
  • [ ] Saya menguruskan penyimpanan dan perkongsian pihak ketiga mengikut KVKK; Saya meninggalkan tanda.