Üksus 9 / 11

Turvalisus ja privaatsus: AI-süsteemide kaitsmine

Kasu:

  • Võime tuvastada tehisintellektile spetsiifilisi ründepindu (kiire süstimine, andmete mürgitamine, konfidentsiaalsete andmete lekkimine, liikmete eemaldamine) ja kujundada kihiline kaitse.
  • Võimalus rakendada privaatsust kui kujunduspõhimõtet: andmete minimeerimine, maskeerimine, juurdepääsu kontroll ja säilitusperiood
  • Võimalus teha turvatööd ainult kaitseotstarbel, avalikustada turvaauke vastutustundlikult ja vältida volitamata kasutamist

Masinõppesüsteem kannab kõiki traditsioonilise tarkvara turvariske ja lisab ainulaadseid uusi ründepindu. Mudelit saab sisendiga petta, treeningandmeid mürgitada ja väljundisse võib lekkida konfidentsiaalne teave. Selles üksuses käsitleme tehisintellekti süsteeme kaitse vaatenurgast: rünnakute äratundmine, süsteemi tugevdamine, privaatsuse kaitsmine. See teave ei ole mõeldud volitamata juurdepääsu või rünnaku jaoks, vaid teie süsteemide turvalisuse tagamiseks.

AI-spetsiifilised ründepinnad

Lisaks klassikalisele turvalisusele (autentimine, autoriseerimine, krüpteerimine) on ML-süsteemid haavatavad:

  • Kiire süstimine: LLM-i sisendis peidetud juhised ei näita mudelit. Kõige tavalisem ja praktilisem LLM-i turvarisk.
  • Andmete mürgitamine: ründaja lisab mudelisse peidetud tagaukse või eelarvamusi, lisades treeningandmetesse halvad näidised.
  • Mudeli järeldamine ja ümberpööramine: ründaja rekonstrueerib koolitusandmed või mudeli käitumise, saates mudelile mitu päringut.
  • Liikmelisuse järeldus: järeldamine, kas konkreetse isiku andmeid kasutatakse hariduses – privaatsuse rikkumine.
  • Tundlike andmete leke: mudel paljastab väljundis koolitusandmetes konfidentsiaalse teabe (nimi, identiteet, saladus).

Iga sellise riski jaoks on olemas kaitsemehhanismid; Peamine on kaaluda riski projekteerimisetapis.

Kiire süstimine: kõige otsesem oht

Kiiret süstimist on kahte tüüpi:

  • Otsene: kasutaja sisestab isiklikult teksti, näiteks "ignoreeri eelmisi juhiseid".
  • Kaudne: halb juhis on peidetud välisesse konteksti (veebileht, dokument, meil), mida mudel töötleb. Eriti ohtlik agentidele ja RAG-ile, kuna mudel käsitleb välist sisu usaldusväärselt.

Kaitsekihid:

  1. Parsing: Separate system instruction and user/external data with clear delimiters; märkige väline sisu kui "andmed, mitte käsud".
  2. Minimaalne võimsus: piirake seda, kui palju kahju mudel võib teha isegi siis, kui see jäädvustada (sõiduki võimsus üksuses 5).
  3. Väljundi juhtimine: enne selle kasutamist kontrollige, mida mudel toodab – eriti kui see muutub toiminguks.
  4. Inimese heakskiit: siduge kõrge riskiga tegevused heakskiiduga.
Ettevaatust: kiiret süstimist ei saa täielikult lahendada ühe kaitsega; Vajalik on kihiline kaitse (sügav kaitse). Kriitiline oletus: "Mudel võib mingil hetkel petta saada; mis on siis halvim, mis juhtuks, kui seda lolliks läheks, ja kuidas seda piirata?"

Nõrk lähenemine / tugev lähenemine

Nõrk: "Tippisin süsteemiviipale "ignoreeri halbu juhiseid" ja oleme kaitstud."

Tugev: "Mähkisime välise sisu märgenditega <data> ja ütlesime, et ignoreerige sees olevaid juhiseid. Samuti piirasime mudeli tööriistad minimaalse autoriseerimisega, sidusime pöördumatud toimingud inimese heakskiiduga, logisime kõik tööriistakutsed ja kontrollisime väljundit enne kasutamist. Loodame kihtidele, mitte ühele kaitsele."

Erinevus: tugev lähenemine teab, et üherealisest juhisest ei piisa, ja ehitab kihte, mis piiravad kahju.

Privaatsus: andmed on algusest peale kaitstud

Privaatsus ei ole hiljem lisatud funktsioon, see on kujunduspõhimõte (privaatsus disaini järgi). Põhirakendused:

  • Andmete minimeerimine: ärge koguge ja säilitage rohkem isikuandmeid kui vaja. Andmeid, mida ei koguta, ei saa lekkida.
  • Anonüümseks muutmine ja maskeerimine: maskeerige või eemaldage isiklikud identifikaatorid (nimi, ID, e-posti aadress) enne nende modellile andmist.
  • Juurdepääsu kontroll: piirata ja logida, kes pääseb juurde andmetele ja mudelile (RAG juurdepääsukontroll seadmel 4).
  • Säilitusperiood: määrake poliitikaga kindlaks, kui kaua te andmeid säilitate; Kustutage aegunud.

Diferentsiaalne privaatsus (tehnika, mis takistab üksikisiku andmetel väljundit oluliselt mõjutada, lisades treeningu ajal kontrollitud müra) ja liitõpe (lähenemine, mis treenib seadmetel ilma andmeid keskusesse liigutamata) on täiustatud privaatsustehnikad; tuleks tundlike andmetega töötamisel arvestada.

Näpunäide. Enne andmete töötlemist küsige: "Kui need isikuandmed lekivad, kes siis millist kahju kannab?" Kui kahju on tõsine, siis ärge koguge andmeid üldse või töödelge neid maskeerides. Kõige turvalisemad andmed on andmed, mida pole kunagi kogutud.

Koolitusandmete ja mudeli tarneahela turvalisus

Nii nagu teie mudel, on ka teie kasutatavad komponendid ohutusprobleemiks:

  • Andmeallika usaldus: kas treeninguandmed on usaldusväärsed või võivad need olla mürgitatud? Avalike andmekogumite auditeerimine.
  • Kolmandate osapoolte mudelid ja teegid: allalaaditud eelkoolitatud mudel või sõltuvus võib olla pahatahtlik. Kontrollige selle allikat, allkirja ja teadaolevaid turvaauke.
  • Tarneahel: iga teie ML-i konveieri tööriist ja pakett on usalduslüli; Oled sama turvaline kui nõrgim lüli.

Vastutustundlik avalikustamine ja eetilised piirid

Kui leiate haavatavuse – oma süsteemis või müüja süsteemis – on õige tegur vastutustundlik avalikustamine: haavatavusest privaatselt teavitamine asjaomasele osapoolele ja aja andmine selle parandamiseks, mitte selle ärakasutamine ega levitamine. Tehisintellekti või omandatud turbeteabe kasutamine volitamata juurdepääsu, andmelekke või kellegi teise süsteemi volitamata sekkumise eesmärgil on ebaseaduslik ja vastuolus kutse-eetikaga. Selle mooduli turvasisu on mõeldud täielikult kaitseks, tuvastamiseks ja tugevdamiseks.

kolm minikarpi

1. juhtum – kaudse süstimise piirang. RAG-i tugibot renderdas veebisisu. Varjatud juhised olid maetud ühele lehele. Mudel sai osaliselt lolliks, kuid robotil ei olnud kirjutamisõigusi (minimaalsed õigused) ja väljund läbis reeglite kontrolli, enne kui see kasutajale kuvati; See osutus kahjulikuks ja saadi kätte. Kihiline kaitse hoidis ära, et ühest ebaõnnestumisest saaks katastroof.

Juhtum 2 – konfidentsiaalsete andmete leke. Peenhäälestatud klienditugi logib mudelisse neid maskeerimata (üksus 6). Mudel hakkas ebaolulistes küsimustes genereerima tõelisi kliendinimesid. Samuti oli oht liikmestaatusest loobuda. Mudel on tagasi võetud, andmed varjatud, säilitamispoliitika parandatud. Õppetund: konfidentsiaalsed andmed ei tohiks haridusse sattuda.

Juhtum 3 – mürgiste andmete kogum. Üks meeskond treenis avalikult kättesaadavat andmekogumit ilma seda auditeerimata. Võtteplatsil leidus mürgiseid proove, mis konkreetset käivitavat sõna (tagauks) nähes modelli lolliks tegid. Pärast auditi ja anomaaliate skaneerimise lisamist need proovid jäädvustati. Õppetund: kontrollige andmeallikat, ärge pimesi usaldage.

Kopeeritavad mallid

Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Loetlege mitmekihilised kaitsepuudused.

Kontrollige seda andmetöötlusvoogu konfidentsiaalsuse tagamiseks.- Kas iga kogutud isiklik väli on tõesti vajalik (minimeerimine)?- Millised väljad tuleks mudelisse minevates andmetes maskeerida?- Kas on olemas juurdepääsukontroll ja logimine?- Kas säilitusperiood on määratletud? Voog: [kirjeldus]. Soovitage iga puuduse korrigeerimist.

Sellest tekstist otsige üles isikuandmed, mis tuleb enne mudelile saatmist maskeerida. Väljad: nimi, email, telefon, ID/passi number, aadress, kaardi number, IP. Loetlege iga leid koos selle tüübi ja soovitatud maskiga. Ärge asendage ülejäänud teksti.Tekst: [tekst]

Enne selle kolmanda osapoole mudeli/teegi tootmisse panemist looge turvalisuse kontroll-loend.- Kas allikas ja väljaandja on usaldusväärsed, allkiri on kinnitatud?- Teadaolevate haavatavuste (CVE) tuvastamiseks on skannitud?- Milliseid õigusi/juurdepääsu see vajab, kas seda saab minimeerida?Komponent: [nimi/allikas]

Riski-kaitse tabel

Risk

kaitse

kiht

kiire süstimine

Parsimine + minimaalne privileeg + väljundi juhtimine

Disain + käitusaeg

andmete mürgitus

Allika juhtimine + anomaaliate skaneerimine

andmeliini

Konfidentsiaalsete andmete leke

Maskeerimine + andmete minimeerimine

Andmed + koolitus

Liikmelisuse väljavõtmine

Diferentsiaalne privaatsus

Haridus

liigne autoriteet

Minimaalne luba + kinnitus

agendi disain

tarneahel

Komponentide kontroll + allkiri

sõltuvus

Levinud vead

  • Arvates, et olete lahendanud kiire süstimise ühe reaga. Kihiline kaitse on kohustuslik.
  • Konfidentsiaalsete andmete töötlemine/koolitamine neid maskeerimata. Imbub jäädavalt mudelisse.
  • Pidades välist sisu usaldusväärseks. Kaudse sissepritse värav.
  • Andmeallikat ei kontrollita. Mürgistus jääb märkamatuks.
  • Kolmanda osapoole komponendi pimesi usaldamine. Tarneahela vahe.
  • Mõeldes, et privaatsus lisandub hiljem. See peaks algama disainist.

Kokkuvõttes

Lisaks klassikalistele turberiskidele kannavad AI-süsteemid unikaalseid ohte, nagu kiire süstimine, andmete mürgitamine, konfidentsiaalsete andmete lekkimine ja liikmete eemaldamine. Ühtegi neist ei saa ühe meetmega lahendada; nõutavad mitmekihilised kaitsemehhanismid (parsimine, vähim luba, väljundi juhtimine, inimese heakskiit). Privaatsus on kujundamise põhimõte: minimeerida andmeid, maskeerida neid, piirata juurdepääsu, kehtestada säilitusperioodid. Kontrollige komponentide ja andmete tarneahelat. Kogu see teave on kaitseks, tuvastamiseks ja konsolideerimiseks; Selgitage haavatavusi vastutustundlikult, ärge kunagi kasutage ära.

Rakenduse ülesanne

Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Lisage vähemalt kaks kaitsekihti. Eraldi otsige üles ja maskeerige kõik isiklikud väljad, mis tuleb mudelile minevates näidisandmetes maskeerida. Kontrollige kõigi kasutatavate kolmandate osapoolte komponentide allikat ja teadaolevaid turvaauke.

kontrollnimekiri

  • [ ] System instruction and external/user data are clearly separated.
  • [ ] Väline sisu on märgitud andmeteks, mitte käskudeks.
  • [ ] Isegi kui modelli petta, piirdub kahju minimaalse autoriteediga.
  • [ ] Isikuandmed on maskeeritud/minimeeritud; määratletud säilitusaeg.
  • [ ] Andmeallikat ja kolmanda osapoole komponente on kontrollitud.
  • [ ] Minu turvatöö on kaitseotstarbeline; Seletan lünki vastutustundlikult.