Unit 10 / 12

Penggunaan Selamat: Bebas Bocor dan Kerahsiaan

Keuntungan:

  • Keupayaan untuk mengklasifikasikan data yang mengandungi rahsia, data peribadi dan aset perniagaan sulit serta mengenali garis merah
  • Menyamarkan, menamakan dan melindungi dengan data sintetik sebelum memasukkan data
  • Pemilihan alat yang diluluskan, pengecilan konteks dan keupayaan untuk menggunakan refleks putaran kunci sekiranya berlaku kebocoran

Apa-apa sahaja yang anda tampalkan ke dalam pembantu pengekodan berkemungkinan di luar kawalan anda. Kunci API, longgokan pangkalan data pelanggan, kod sumber proprietari yang belum diumumkan, atau rekod pesakit — ini boleh menjadi kebocoran yang tidak dapat dipulihkan sebaik sahaja ia memasuki alat yang tidak diluluskan. Risiko terbesar AI untuk pasukan perisian bukan daripada ralat baris, tetapi daripada salin-tampal yang cuai. Unit ini adalah tentang memastikan salin-tampal itu selamat.

Di sini kami membezakan tiga perkara: data yang mana tidak boleh dimasukkan, alatan yang boleh digunakan dengan perlindungan dan cara untuk melindungi data sebelum memasukkannya (menolong, data sintetik, berfungsi secara tempatan). Ini bukan pilihan "alangkah bagus"; Ia adalah kewajipan kontrak dan undang-undang di kebanyakan institusi.

Mengapa Ia Sangat Kritikal?

Data yang anda hantar ke alat AI; diproses pada pelayan pembekal, kadangkala disimpan untuk tempoh masa, boleh digunakan untuk menambah baik model dalam beberapa tetapan produk. Menyebut "Saya memadamkan sembang" selalunya tidak mencukupi; Sebaik sahaja data meninggalkan rangkaian, risiko timbul. Selain itu, kos kebocoran adalah tinggi: kunci awan yang bocor boleh disalahgunakan dalam beberapa minit, data pelanggan yang bocor boleh mengakibatkan pemberitahuan dan penalti di bawah peraturan seperti KVKK/GDPR, dan kod sumber persendirian yang bocor boleh memusnahkan kelebihan daya saing.

Jadi peraturan praktikalnya mudah: Jangan masukkan apa-apa ke dalam kenderaan yang tidak diluluskan yang anda tidak mampu kehilangannya. Jika ragu-ragu, jangan masuk.

Awas: Mentaliti "sekali sahaja, cepat" adalah punca kebocoran yang paling biasa. Menampal log pengeluaran atau fail konfigurasi semasa menyelesaikan pepijat segera adalah perkara yang berlaku dengan keputusan sedemikian yang dibuat di bawah tekanan. Segera tidak menggantung peraturan kerahsiaan.

Perkara yang Tidak Boleh Dimasukkan (garisan merah)

  • Rahsia: Kunci API, kata laluan, kunci akses awan, sijil peribadi, token, rentetan sambungan.
  • Data peribadi (PII): Nama-nama keluarga, nombor ID TR, e-mel, telefon, alamat, rekod kesihatan/kewangan, data pelanggan.
  • Aset perniagaan sulit: Kod sumber yang tidak didedahkan, algoritma proprietari, rahsia seni bina dalaman, butiran kontrak.
  • Data terkawal: Kategori dilindungi khas seperti penjagaan kesihatan, kad pembayaran (PCI), kewangan peribadi.

Langkah demi Langkah: Aliran Penggunaan Selamat

  1. Kelaskan data. Apakah kategori yang anda ada — awam, dalaman, sulit, terkawal?
  2. Pilih kenderaan mengikut kelas. Data sulit/terkawal diproses hanya dalam alat yang diluluskan institusi yang memberikan jaminan data (tidak digunakan dalam pendidikan, had pengekalan, pemprosesan wilayah).
  3. Selamat sebelum masuk. Strip rahsia, topeng/anonimkan PII, gunakan data sintetik (rekaan tetapi realistik) dan bukannya nyata jika boleh.
  4. Kurangkan konteks. Kurangkan masalah anda kepada contoh terkecil yang boleh dihasilkan semula yang tidak termasuk bahagian sensitif.
  5. Semak juga output. Semak bahawa tiada rahsia berkod keras atau saki baki data anda dalam kod yang dijana oleh AI.

Tiga Kes Mini

Kes 1 — Kunci yang ditampal telah dibatalkan. Seorang pembangun menampal keseluruhan fail konfigurasi ke dalam AI semasa membetulkan pepijat; Fail itu mengandungi kunci API pihak ketiga langsung. Apabila pasukan menyedari, mereka segera membatalkan (memutar) kunci dan menghasilkan yang baru; Tidak ada penyalahgunaan, tetapi ia adalah insiden 'murah'. Pengajaran: keluarkan sayu sebelum melekat—dan putar kunci dengan segera jika ia bocor.

Kes 2 — Data sintetik menyelamatkan perniagaan. Satu pasukan mengalami ralat penghuraian dengan rekod pelanggan sebenar. Daripada memasukkan data sebenar, mereka menghasilkan 20 baris data sintetik dengan struktur yang sama tetapi palsu sepenuhnya, menghasilkan semula ralat dengannya dan menyelesaikannya dengan AI. PII tidak bocor mahupun diagnosis menjadi perlahan; data sintetik adalah selamat dan mencukupi.

Kes 3 — Rahsia tersembunyi dalam cetakan. Apabila menjana konfigurasi sampel, AI membenamkan kunci "sampel" yang kelihatan realistik ke dalamnya dan memasukkannya ke dalam kod tanpa disedari oleh pembangun; Imbasan asas kod (pengimbas rahsia) menangkap ini dan memberi amaran. Rahsia yang tidak boleh diubah sepatutnya tidak pernah dimasukkan ke dalam kod; Cara yang betul ialah menggunakan pembolehubah persekitaran atau pengurus rahsia. Pelajaran: imbas keluaran untuk mencari rahsia juga.

Empat Templat Boleh Disalin

Senarai semak topeng sebelum masuk (diri sendiri):

Sebelum memberikan teks ini kepada AI, pastikan saya mengalih keluar perkara berikut dan menggantikan perkara yang anda temui dengan [MASKED]: kunci API, kata laluan, token, rentetan sambungan, nama keluarga, e-mel, telefon, nombor ID, data pelanggan. Teks:{{teks}}

Penjanaan data ujian sintetik:

Jana data ujian barisan yang direka sepenuhnya (tidak berkaitan dengan orang/institusi sebenar) {{N}} mengikut skema di bawah. Jadikan ia kelihatan realistik, tetapi jangan gunakan sebarang PII sebenar. Skema: {{fields and types}}Termasuk kes tepi (kosong, sempadan, format buruk).

Pemburuan rahsia tetap (dalam kod):

Cari rahsia berkod keras dalam kod/konfigurasi ini: kunci, kata laluan, token, URL tersuai. Jika anda menemuinya, nyatakan lokasinya dan cadangkan kaedah yang betul (pembolehubah persekitaran / pengurus rahsia). Kod:{{kod}}

Penilaian pematuhan kenderaan (mengikut kelas data):

Saya mempunyai jenis data berikut: {{class: public / internal / confidential / regulated}}. Alat yang saya ingin gunakan ialah: {{tool}}. Apakah perlindungan (storan, tidak digunakan dalam pendidikan, wilayah, akses) yang harus saya sahkan sebelum memproses data ini dalam alat ini? Beri senarai semak. Keputusan adalah milik saya; Anda jelaskan kriterianya.

Gesaan lemah / Gesaan kuat

Lemah: (Menampal 200 baris pengguna sebenar yang ditarik daripada pangkalan data pengeluaran) "Mengapa terdapat ralat penghuraian dalam data ini?"
Strong: "Di bawah ialah 15 baris dengan struktur yang sama seperti data sebenar tetapi sintetik sepenuhnya (tiada PII). parse_user() membuang ValueError pada 3, 8 dan 12 baris ini. Apakah corak biasa, bagaimana cara saya membetulkannya?"

Versi kukuh tidak mengandungi data peribadi sebenar sambil mengekalkan struktur yang diperlukan untuk menghasilkan semula pepijat. Diagnosis tetap sama, risiko ditetapkan semula.

Kelas data

Bolehkah ia diproses dalam AI?

Prasyarat

awam

ya

Penggunaan dalaman (tidak ketepatan)

Secara amnya

Mematuhi dasar korporat

Sulit (kod sumber, rahsia perniagaan)

Kenderaan yang diluluskan sahaja

Jaminan korporat + pengurangan

PII / dikawal selia

Sebagai peraturan no

Topeng/anonimkan atau gunakan sintetik

Pematuhan dan Jejak Dasar

Penggunaan selamat adalah lebih daripada sekadar tabiat peribadi, ia adalah sistem korporat: alat mana yang diluluskan, kelas data mana yang boleh pergi ke mana, dan perkara yang perlu dilakukan sekiranya berlaku pelanggaran harus ditakrifkan dalam dasar bertulis. Jika rahsia bocor, langkah pertama yang paling penting ialah tidak panik, tetapi segera mengembalikan (membatalkan dan menjana yang baharu) bukti kelayakan yang bocor dan melaporkan kejadian itu. Jika anda tidak mengetahui senarai alat yang diluluskan dan peraturan klasifikasi data organisasi anda, tugas pertama anda ialah mempelajarinya.

Petua: Tentukan senarai "abaikan" khusus projek (cth. .env, folder tersembunyi, fail identiti) dalam alat Editor/CLI anda supaya fail ini tidak dimasukkan secara tidak sengaja dalam konteks pembantu. Pencegahan sentiasa lebih murah daripada pembersihan.

Kesilapan biasa

  • Menampal data sensitif "sekali sahaja". Segera tidak menggantung garis merah; Kebocoran yang paling biasa berlaku di sini.
  • Berfikir "Saya akan memadamkan perbualan". Sebaik sahaja data meninggalkan rangkaian, risiko timbul; Pemadaman tidak membatalkannya.
  • Memilih kenderaan tanpa melihat kelasnya. Memproses data korporat sulit dengan akaun peribadi adalah pelanggaran yang serius.
  • Tidak mengimbas output. AI boleh membenamkan rahsia yang tidak boleh diubah ke dalam kod; Periksa juga pengeluaran dengan pengimbas rahsia.
  • Tidak mengubahnya apabila rahsia itu bocor. Tidak membatalkan kunci yang bocor mengubah kebocoran menjadi eksploitasi langsung.

Secara ringkasnya

Risiko terbesar AI dalam perisian ialah kebocoran privasi, dan kebanyakannya timbul daripada keputusan salin-tampal yang dibuat di bawah tekanan. Peraturannya jelas: rahsia, data peribadi, aset perniagaan sulit dan data terkawal tidak dimasukkan ke dalam alat yang tidak diluluskan. Kelaskan data sebelum input, pilih ejen mengikut kelas, ekstrak rahsia, tutup PII atau gunakan data sintetik, kurangkan konteks dan imbas output untuk rahsia juga. Jika terdapat kebocoran, perkara pertama: kembalikan bukti kelayakan dan laporkannya.

Tugasan permohonan

Ambil sekeping kod/log/data yang telah anda berikan baru-baru ini (atau sedang mempertimbangkan untuk memberi) kepada AI. Mula-mula, kenal pasti calon rahsia dan PII dalam dengan templat "senarai semak topeng". Kemudian, jika ia mengandungi data sebenar, hasilkan versi yang sama dengan templat "penjanaan data ujian sintetik" tetapi direka sepenuhnya dan jadikan masalah anda boleh diterbitkan semula dengannya. Akhir sekali, cari dan baca senarai alat dan dasar klasifikasi data yang diluluskan oleh institusi anda; Jika tidak, perhatikan peninggalan ini.

senarai semak

  • [ ] Saya mengklasifikasikan data sebelum memasukkannya (terbuka/dalaman/sulit/tertakluk kepada peraturan).
  • [ ] Saya tidak pernah memasukkan rahsia, PII dan aset perniagaan sulit ke dalam alat yang tidak diluluskan.
  • [ ] Saya menggunakan data masking atau sintetik apabila boleh dan bukannya data sebenar.
  • [ ] Saya mengurangkan konteks kepada contoh terkecil yang tidak termasuk bahagian sensitif.
  • [ ] Saya mengimbas keluaran AI untuk mencari rahsia yang terkubur.
  • [ ] Saya tahu bahawa jika rahsia itu bocor, saya akan segera mengembalikan maklumat pengenalan dan melaporkan kejadian itu.