Daromadlar:
- AIga xos hujum yuzalarini tanib olish qobiliyati (tezkor in'ektsiya, ma'lumotlarni zaharlash, maxfiy ma'lumotlarning sizib chiqishi, a'zolikni olib tashlash) va qatlamli himoyani loyihalash
- Maxfiylikni dizayn printsipi sifatida qo'llash qobiliyati: ma'lumotlarni minimallashtirish, maskalash, kirishni boshqarish va saqlash muddati
- Xavfsizlik ishlarini faqat mudofaa maqsadlarida olib borish, zaifliklarni mas'uliyat bilan ochib berish va ruxsatsiz foydalanishdan qochish qobiliyati
Mashinani o'rganish tizimi an'anaviy dasturiy ta'minotning barcha xavfsizlik xavflarini o'z zimmasiga oladi va noyob yangi hujum yuzalarini qo'shadi. Modelni kirish orqali aldash mumkin, o'quv ma'lumotlari zaharlanishi mumkin va maxfiy ma'lumotlar chiqishga tushishi mumkin. Ushbu bo'limda biz AI tizimlarini mudofaa nuqtai nazaridan ko'rib chiqamiz: hujumlarni tan olish, tizimni mustahkamlash, maxfiylikni himoya qilish. Ushbu ma'lumotlar ruxsatsiz kirish yoki hujum uchun emas, balki o'z tizimlaringizni xavfsiz saqlash uchun.
AIga xos hujum sirtlari
Klassik xavfsizlik (autentifikatsiya, avtorizatsiya, shifrlash) bilan bir qatorda, ML tizimlari quyidagilarga nisbatan zaifdir:
- Tezkor kiritish: LLM kiritishda yashiringan ko'rsatma modelni o'tkazib yuboradi. Eng keng tarqalgan va eng amaliy LLM xavfsizligi xavfi.
- Ma'lumotlardan zaharlanish: tajovuzkor o'quv ma'lumotlariga noto'g'ri namunalarni kiritish orqali modelga yashirin orqa eshik yoki tarafkashlik kiritadi.
- Model xulosasi va inversiyasi: tajovuzkor modelga bir nechta so'rovlar yuborish orqali o'quv ma'lumotlarini yoki model xatti-harakatlarini qayta tiklaydi.
- A'zolik xulosasi: Muayyan shaxsning ma'lumotlari ta'limda foydalaniladimi yoki yo'qligini aniqlash - shaxsiy hayotning buzilishi.
- Nozik ma'lumotlarning oqishi: Model chiqishdagi o'quv ma'lumotlaridagi maxfiy ma'lumotlarni (ism, shaxs, sir) ochib beradi.
Ushbu xavflarning har biri uchun himoya vositalari mavjud; Asosiysi, dizayn bosqichida xavfni hisobga olish.
Tezkor in'ektsiya: eng bevosita tahdid
Tezkor in'ektsiyaning ikki turi mavjud:
- To'g'ridan-to'g'ri: foydalanuvchi shaxsan "oldingi ko'rsatmalarga e'tibor bermaslik" kabi matnni kiritadi.
- Bilvosita: noto'g'ri ko'rsatma model ishlov beradigan tashqi kontekstda (veb-sahifa, hujjat, elektron pochta) yashiringan. Agentlar va RAG uchun ayniqsa xavfli, chunki model tashqi tarkibni ishonchli tarzda boshqaradi.
Himoya qatlamlari:
- Parsing: Separate system instruction and user/external data with clear delimiters; tashqi tarkibni "buyruqlar emas, ma'lumotlar" sifatida belgilang.
- Minimal quvvatlar: Model qo'lga olingan taqdirda ham qancha zarar etkazishi mumkinligini cheklang (5-birlikdagi avtomobil quvvati).
- Chiqish nazorati: Modelni ishlatishdan oldin nima ishlab chiqarishini tekshiring - ayniqsa u harakatga aylansa.
- Insonning roziligi: yuqori xavfli harakatlarni tasdiqlash bilan bog'lang.
E'tibor bering: tezkor in'ektsiyani bitta mudofaa bilan to'liq hal qila olmaysiz; Qatlamli mudofaa (chuqurlikdagi mudofaa) talab qilinadi. Tanqidiy taxmin: "Model bir nuqtada aldanib qolishi mumkin; agar u aldangan bo'lsa, eng yomoni nima bo'ladi va buni qanday cheklashim mumkin?"
Zaif yondashuv / Kuchli yondashuv
Zaif: "Men tizim so'rovida "yomon ko'rsatmalarga e'tibor bermang" deb yozdim va biz xavfsizmiz."
Kuchli: "Biz tashqi kontentni <ma'lumotlar> teglari bilan o'rab oldik va "ichidagi ko'rsatmalarga e'tibor bermaslik" dedik. Shuningdek, biz model vositalarini minimal avtorizatsiya bilan cheklab qo'ydik, qaytarib bo'lmaydigan harakatlarni inson ma'qullashiga bog'ladik, barcha asboblar qo'ng'iroqlarini qayd qildik va foydalanishdan oldin chiqishni qoidalar tekshiruvidan o'tkazdik. Biz bitta himoyaga emas, qatlamlarga tayanamiz."
Farqi: kuchli yondashuv bir qatorli ko'rsatma etarli bo'lmasligini biladi va zararni cheklaydigan qatlamlarni quradi.
Maxfiylik: ma'lumotlar boshidan himoyalangan
Maxfiylik keyinroq qo'shilgan xususiyat emas, bu dizayn printsipi (dizayn bo'yicha maxfiylik). Asosiy ilovalar:
- Ma'lumotlarni minimallashtirish: kerak bo'lgandan ko'ra ko'proq shaxsiy ma'lumotlarni to'plamang va saqlamang. Yig'ilmagan ma'lumotlar sizib ketishi mumkin emas.
- Anonimlashtirish va maskalash: Modelga berishdan oldin shaxsiy identifikatorlarni (ism, identifikator, elektron pochta) niqoblang yoki olib tashlang.
- Kirishni boshqarish: Ma'lumotlar va modelga kim kirishini cheklang va jurnalga yozing (4 blokda RAG kirishni boshqarish).
- Saqlash muddati: Siyosat bo'yicha ma'lumotlarni qancha vaqt saqlashingizni aniqlang; Muddati o'tganini o'chiring.
Differensial maxfiylik (trening davomida boshqariladigan shovqinni qo‘shish orqali bir shaxsning ma’lumotlarining chiqishiga sezilarli ta’sir ko‘rsatishiga to‘sqinlik qiluvchi texnika) va federativ ta’lim (ma’lumotlarni markazga ko‘chirmasdan qurilmalarda mashq qiladigan yondashuv) maxfiylikning ilg‘or usullari hisoblanadi; maxfiy ma'lumotlar bilan ishlashda e'tiborga olinishi kerak.
Maslahat: Har qanday ma'lumotlarni qayta ishlashdan oldin: "Agar bu shaxsiy ma'lumotlar sizib chiqsa, kimga qanday zarar yetkaziladi?" Agar zarar jiddiy bo'lsa, ma'lumotlarni umuman yig'mang yoki uni niqoblash orqali qayta ishlang. Eng xavfsiz ma'lumotlar hech qachon yig'ilmagan ma'lumotlardir.
Trening ma'lumotlari va ta'minot zanjiri xavfsizligi modeli
Modelingiz kabi siz foydalanadigan komponentlar ham xavfsizlik muammosidir:
- Ma'lumotlar manbasiga ishonch: o'quv ma'lumotlari ishonchlimi yoki u zaharlanishi mumkinmi? Umumiy ma'lumotlar to'plamini tekshirish.
- Uchinchi tomon modellari va kutubxonalari: Oldindan oʻrgatilgan model yoki siz yuklab olgan qaramlik zararli boʻlishi mumkin. Uning manbasini, imzosini va ma'lum zaifliklarini tekshiring.
- Ta'minot zanjiri: ML liniyangizdagi har bir vosita va paket ishonch rishtasidir; Siz eng zaif bo'g'in kabi xavfsizsiz.
Mas'uliyatni oshkor qilish va axloqiy chegaralar
Zaiflikni topsangiz - o'zingizning tizimingizda yoki sotuvchining tizimida - to'g'ri yo'l mas'uliyatli oshkor qilishdir: zaiflik haqida tegishli tomonga shaxsiy xabar berish va uni tuzatish uchun vaqt berish, undan foydalanmaslik yoki tarqatmaslik. Sun'iy intellektdan yoki siz olgan xavfsizlik ma'lumotlaridan ruxsatsiz kirish, ma'lumotlarning sizib chiqishi yoki birovning tizimiga ruxsatsiz aralashuv uchun foydalanish noqonuniy va kasbiy etikaga ziddir. Ushbu modulning xavfsizlik mazmuni butunlay mudofaa, aniqlash va mustahkamlash uchun mo'ljallangan.
uchta mini holat
1-holat - bilvosita in'ektsiyani cheklash. RAG-ni qo'llab-quvvatlash boti veb-kontentni taqdim etayotgan edi. Yashirin ko'rsatmalar bir sahifaga ko'milgan. Model qisman aldanib qolgan, lekin botda yozish imtiyozlari (minimal imtiyozlar) yo'q edi va natija foydalanuvchiga ko'rsatilishidan oldin qoidalarni tekshirish orqali o'tkazildi; Bu zararli bo'lib chiqdi va qo'lga olindi. Qatlamli mudofaa bitta muvaffaqiyatsizlikning falokatga aylanishining oldini oldi.
2-holat - maxfiy ma'lumotlarning sizib chiqishi. Mijozlarni qo'llab-quvvatlash guruhi ularni niqoblamasdan modelga kiradi (6-birlik). Model ahamiyatsiz savollarda haqiqiy mijozlar nomlarini yaratishni boshladi. A'zolikni olib tashlash xavfi ham bor edi. Model olib tashlandi, maʼlumotlar maskalandi, saqlash siyosati tuzatildi. Dars: maxfiy ma'lumotlar ta'limga kirmasligi kerak.
3-holat - Zaharli ma'lumotlar to'plami. Bitta jamoa ommaga ochiq ma’lumotlar to‘plamini tekshirmasdan mashq qildi. To'plamda ma'lum bir tetik so'zini (orqa eshik) ko'rganida modelni aldab qo'ygan zaharli namunalar bor edi. Audit va anomaliyalarni skanerlashni qo'shgandan so'ng, bu namunalar qo'lga olindi. Dars: ma'lumotlar manbasini tekshiring, ko'r-ko'rona ishonmang.
Nusxalanadigan shablonlar
Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Qatlamli mudofaa kamchiliklarini sanab o'ting.
Maxfiylik uchun ushbu ma'lumotlarni qayta ishlash oqimini tekshirib ko'ring.- Har bir to'plangan shaxsiy maydon haqiqatan ham zarurmi (minimallashtirish)?- Modelga o'tadigan ma'lumotlarda qaysi maydonlar maskalanishi kerak?- Kirish nazorati va jurnallar mavjudmi?- Saqlash muddati aniqlanganmi? Oqim: [tavsif]. Har bir kamchilikni tuzatishni taklif qiling.
Ushbu matnda modelga yuborishdan oldin maskalanishi kerak bo'lgan shaxsiy ma'lumotlarni toping. Maydonlar: ism, elektron pochta, telefon, ID/pasport raqami, manzil, karta raqami, IP. Har bir topilmani turi va tavsiya etilgan niqob bilan sanab bering. Matnning qolgan qismini almashtirmang.Matn: [matn]
Ushbu uchinchi tomon modeli/kutubxonasini ishlab chiqarishga qo‘yishdan oldin xavfsizlik tekshiruvi ro‘yxatini yarating.- Manba va noshir ishonchlimi, imzosi tasdiqlanganmi?- Ma’lum zaifliklar (CVE) skanerlanganmi?- Unga qanday imtiyozlar/kirishlar kerak, uni minimallashtirish mumkinmi? Komponent: [nom/manba]
Xavfdan himoya qilish jadvali
Xavf
mudofaa
qatlam
tezkor in'ektsiya
Tahlil + minimal imtiyoz + chiqish nazorati
Dizayn + ish vaqti
ma'lumotlarning zaharlanishi
Manbani boshqarish + anomaliyalarni skanerlash
ma'lumotlar liniyasi
Maxfiy ma'lumotlarning tarqalishi
Maskalash + ma'lumotlarni minimallashtirish
Ma'lumotlar + trening
A'zolikni chiqarish
Differensial maxfiylik
Ta'lim
haddan tashqari vakolat
Minimal avtorizatsiya + tasdiqlash
agent dizayni
ta'minot zanjiri
Komponentni tekshirish + imzo
giyohvandlik
Umumiy xatolar
- Tez in'ektsiyani bitta chiziq bilan hal qildingiz deb o'ylaysiz. Qatlamli mudofaa shart.
- Maxfiy ma'lumotlarni yashirmasdan qayta ishlash/o'qitish. Modelga doimiy ravishda kirib boradi.
- Tashqi kontentni ishonchli deb hisoblash. Bilvosita in'ektsiya eshigi.
- Ma'lumotlar manbasini tekshirmayapti. Zaharlanish e'tiborga olinmaydi.
- Uchinchi tomon komponentiga ko'r-ko'rona ishonish. Ta'minot zanjiri bo'shlig'i.
- Maxfiylik keyinroq qo'shiladi deb o'ylash. Bu dizayndan boshlanishi kerak.
Xulosa
Klassik xavfsizlik xatarlariga qo'shimcha ravishda, AI tizimlari tezkor kiritish, ma'lumotlarni zaharlash, maxfiy ma'lumotlarning sizib chiqishi va a'zolikni olib tashlash kabi noyob tahdidlarni o'z ichiga oladi. Ularning hech birini bitta o'lchov bilan hal qilib bo'lmaydi; qatlamli himoya vositalari (tahlil qilish, eng kam avtorizatsiya, chiqish nazorati, inson ma'qullashi) talab qilinadi. Maxfiylik - bu dizayn printsipi: ma'lumotlarni minimallashtirish, uni niqoblash, kirishni cheklash, saqlash muddatlarini belgilash. Komponent va ma'lumotlarni etkazib berish zanjirini boshqaring. Bu ma'lumotlarning barchasi mudofaa, aniqlash va mustahkamlash uchun; Zaifliklarni mas'uliyat bilan tushuntiring, hech qachon foydalanmang.
Ilova vazifasi
Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Kamida ikkita himoya qatlamini qo'shing. Alohida, modelga o'tadigan namunaviy ma'lumotlarda maskalanishi kerak bo'lgan har qanday shaxsiy maydonlarni toping va maskalang. Siz foydalanadigan har qanday uchinchi tomon komponentining manbasini va ma'lum zaifliklarini tekshiring.
nazorat ro'yxati
- [ ] System instruction and external/user data are clearly separated.
- [ ] Tashqi kontent buyruqlar emas, maʼlumotlar sifatida belgilangan.
- [ ] Model aldangan bo'lsa ham, zarar minimal vakolat bilan cheklangan.
- [ ] Shaxsiy maʼlumotlar maskalangan/kichiklashtirilgan; saqlash muddati belgilangan.
- [ ] Maʼlumotlar manbai va uchinchi tomon komponentlari tekshirildi.
- [ ] Mening xavfsizlik ishim mudofaa maqsadlarida; Men kamchiliklarni mas'uliyat bilan tushuntiraman.