Добици:
- Способност препознавања површина напада специфичних за вештачку интелигенцију (брзо убризгавање, тровање података, цурење поверљивих података, екстракција чланства) и дизајнирање слојевите одбране
- Способност примене приватности као принципа дизајна: минимизација података, маскирање, контрола приступа и период задржавања
- Способност обављања послова безбедности искључиво у одбрамбене сврхе, одговорног откривања рањивости и избегавања неовлашћене употребе
Систем машинског учења носи све безбедносне ризике традиционалног софтвера и додаје јединствене нове површине напада. Модел се може преварити улазом, подаци о обуци могу бити затровани, а поверљиве информације могу процурити у излаз. У овој јединици разматрамо АИ системе из перспективе одбране: препознавање напада, јачање система, заштита приватности. Ове информације нису за неовлашћени приступ или напад, већ за заштиту сопствених система.
Нападне површине специфичне за АИ
Поред класичне безбедности (аутентификација, ауторизација, шифровање), МЛ системи су рањиви на:
- Брза ињекција: Инструкција скривена у улазу за ЛЛМ пропушта модел. Најчешћи и најпрактичнији безбедносни ризик за ЛЛМ.
- Тровање подацима: Нападач уводи скривена врата или пристрасност у модел уметањем лоших узорака у податке обуке.
- Закључак и инверзија модела: Нападач реконструише податке о обуци или понашање модела слањем више упита моделу.
- Закључак о чланству: Закључак да ли се подаци одређене особе користе у образовању – кршење приватности.
- Цурење осетљивих података: Модел открива поверљиве информације (име, идентитет, тајна) у подацима обуке у излазу.
За сваки од ових ризика постоји одбрана; Кључно је узети у обзир ризик у фази пројектовања.
Брза ињекција: најнепосреднија претња
Постоје две врсте брзе ињекције:
- Директно: Корисник лично уноси текст као што је "игнорирај претходна упутства".
- Индиректно: Лоше упутство је скривено у спољном контексту (веб страница, документ, е-пошта) који модел обрађује. Посебно опасно за агенте и РАГ јер модел поуздано рукује спољним садржајем.
Одбрамбени слојеви:
- Parsing: Separate system instruction and user/external data with clear delimiters; означите спољни садржај као „подаци, а не команде“.
- Минималне снаге: Ограничите колико штете модел може да направи чак и ако је заробљен (снаге возила у јединици 5).
- Контрола излаза: Проверите шта модел производи пре него што га употребите — посебно ако се то претвара у акцију.
- Људско одобрење: Повежите радње високог ризика са одобрењем.
Опрез: Не можете у потпуности решити брзу ињекцију једном одбраном; Потребна је слојевита одбрана (одбрана по дубини). Критичка претпоставка: „Модел би могао бити преварен у неком тренутку; па шта је најгоре што би се догодило да је преварен, и како да то ограничим?“
Слаб приступ / Снажан приступ
Слабо: „Укуцао сам 'игнорирај лоша упутства' у системском одзивнику и безбедни смо.
Снажан: „Обмотали смо спољни садржај ознакама <дата> и рекли 'игноришите упутства унутар'. Такође смо ограничили алате модела на минималну ауторизацију, повезали неповратне радње са људским одобрењем, евидентирали све позиве алата и подвргли излаз проверама правила пре употребе. Ослањамо се на слојеве, а не на једну одбрану.“
Разлика: јак приступ зна да инструкција у једном реду неће бити довољна и гради слојеве који ограничавају штету.
Приватност: подаци су заштићени од самог почетка
Приватност није функција додата касније, то је принцип дизајна (приватност по дизајну). Основне апликације:
- Минимизирање података: Немојте прикупљати и чувати више личних података него што је потребно. Подаци који нису прикупљени не могу да процуре.
- Анонимизација и маскирање: маскирајте или уклоните личне идентификаторе (име, ИД, емаил) пре него што их дате моделу.
- Контрола приступа: Ограничите и евидентирајте ко приступа подацима и моделу (РАГ контрола приступа на јединици 4).
- Период задржавања: Одредите политиком колико дуго ћете чувати податке; Избришите онај који је истекао.
Диференцијална приватност (техника која спречава да подаци једног појединца значајно утичу на излаз додавањем контролисане буке током тренинга) и удружено учење (приступ који тренира на уређајима без премештања података у центар) су напредне технике приватности; треба узети у обзир када радите са осетљивим подацима.
Савет: Пре обраде било каквих података, питајте: „Ако ови лични подаци процуре, ко ће претрпети какву штету?“ Ако је штета озбиљна, или немојте уопште прикупљати податке или их обрадити тако што ћете их маскирати. Најсигурнији подаци су подаци који никада нису прикупљени.
Подаци о обуци и модел безбедности ланца снабдевања
Колико год да је ваш модел, компоненте које користите такође представљају безбедносни проблем:
- Поверење извора података: Да ли су подаци о обуци поуздани или би могли бити затровани? Ревизија јавних скупова података.
- Модели и библиотеке трећих страна: Унапред обучени модел или зависност коју сте преузели могу бити злонамерни. Проверите његов извор, потпис и познате рањивости.
- Ланац снабдевања: Сваки алат и пакет у вашем МЛ цевоводу су карика поверења; Сигурни сте као најслабија карика.
Одговорно откривање и етичке границе
Када пронађете рањивост — на вашем систему или систему добављача — исправан курс је одговорно откривање: приватно пријављивање рањивости релевантној страни и давање јој времена да је поправи, а не искоришћавање или ширење. Коришћење вештачке интелигенције или безбедносних информација које сте добили за неовлашћени приступ, цурење података или неовлашћену интервенцију у туђи систем је незаконито и противно је професионалној етици. Сигурносни садржај овог модула је у потпуности у сврху одбране, откривања и учвршћивања.
три мини кофера
Случај 1 – Ограничење индиректног убризгавања. РАГ бот за подршку је приказивао веб садржај. Скривена упутства била су закопана на једној страници. Модел је делимично преварен, али бот није имао привилегије писања (минималне привилегије) и излаз је прошао кроз проверу правила пре него што је приказан кориснику; Испоставило се да је штетно и ухваћен је. Слојевита одбрана спречила је да један неуспех постане катастрофа.
Случај 2 – Цурење поверљивих података. Тим фино подешене корисничке подршке пријављује се у модел без маскирања (јединица 6). Модел је почео да генерише стварна имена купаца у ирелевантним питањима. Постојао је и ризик од искључења чланства. Модел је повучен, подаци маскирани, политика задржавања исправљена. Поука: поверљиви подаци не би требало да улазе у образовање.
Случај 3 - Скуп података о отровима. Један тим је тренирао на јавно доступном скупу података без ревизије. На сету су били отровни узорци који су преварили модел када је видео одређену реч окидача (бацкдоор). Након додавања ревизије и скенирања аномалија, ови узорци су ухваћени. Поука: проверите извор података, не верујте слепо.
Шаблони који се могу копирати
Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Наведите слојевите дефанзивне недостатке.
Ревизија овог тока обраде података ради поверљивости.- Да ли је свако прикупљено лично поље заиста неопходно (минимизација)?- Која поља треба да буду маскирана у подацима који иду у модел?- Да ли постоји контрола приступа и евидентирање?- Да ли је дефинисан период задржавања? Ток: [опис]. Предложите исправку за сваки недостатак.
У овом тексту пронађите личне податке које је потребно маскирати пре него што их пошаљете моделу. Поља: име, емаил, телефон, број личне карте/пасоша, адреса, број картице, ИП. Наведите сваки налаз са његовом врстом и препорученом маском. Не замењујте остатак текста. Текст: [текст]
Генеришите безбедносну контролну листу пре него што ставите овај модел/библиотеку треће стране у производњу.- Да ли су извор и издавач поуздани, потпис је верификован?- Скениран за познате рањивости (ЦВЕ)?- Које привилегије/приступ су му потребне, може ли се минимизирати? Компонента: [име/извор]
Табела за одбрану од ризика
Ризик
одбрану
слој
брза ињекција
Парсинг + минимална привилегија + контрола излаза
Дизајн + време извођења
тровање подацима
Контрола извора + скенирање аномалија
линија података
Цурење поверљивих података
Маскирање + минимизација података
Подаци + обука
Извлачење чланства
Диференцијална приватност
Образовање
претерани ауторитет
Минимално овлашћење + одобрење
агент дизајн
ланац снабдевања
Преглед компоненти + потпис
зависност
Уобичајене грешке
- Мислећи да сте решили брзу ињекцију са једном линијом. Слојевита одбрана је неопходна.
- Обрада/обука поверљивих података без маскирања. Трајно се инфилтрира у модел.
- Сматрајући спољни садржај поузданим. Индиректна капија за убризгавање.
- Не проверава се извор података. Тровање пролази незапажено.
- Слепо веровати компоненти треће стране. Јаз у ланцу снабдевања.
- Сматрајући да ће приватност бити додата касније. Требало би почети од дизајна.
Укратко
Поред класичних безбедносних ризика, АИ системи носе јединствене претње као што су промптно убризгавање, тровање података, цурење поверљивих података и екстракција чланства. Ниједан од њих се не може решити једном мером; потребна је слојевита одбрана (парсинг, најмање овлашћење, контрола излаза, људско одобрење). Приватност је принцип дизајна: минимизирајте податке, маскирајте их, ограничите приступ, наметните периоде задржавања. Контролишите ланац снабдевања компонентама и подацима. Све ове информације служе за одбрану, откривање и консолидацију; Одговорно објасните рањивости, никада не искоришћавајте.
Задатак апликације
Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Додајте најмање два слоја одбране. Одвојено, пронађите и маскирајте сва лична поља која треба да буду маскирана у узорку података који иду у модел. Проверите извор и познате рањивости било које компоненте треће стране коју користите.
контролна листа
- [ ] System instruction and external/user data are clearly separated.
- [ ] Спољни садржај је означен као подаци, а не команде.
- [ ] Чак и ако је модел преварен, штета је ограничена на минимални ауторитет.
- [ ] Лични подаци маскирани/минимизирани; дефинисан период складиштења.
- [ ] Извор података и компоненте треће стране су проверене.
- [ ] Мој посао обезбеђења је у сврхе одбране; Одговорно објашњавам празнине.