zisky:
- Schopnosť rozpoznať útočné povrchy špecifické pre AI (okamžitá injekcia, otrava údajov, únik dôverných údajov, extrakcia členstva) a navrhnúť vrstvenú obranu
- Schopnosť uplatniť súkromie ako princíp návrhu: minimalizácia údajov, maskovanie, kontrola prístupu a obdobie uchovávania
- Schopnosť vykonávať bezpečnostnú prácu výlučne na obranné účely, zodpovedne odhaľovať zraniteľné miesta a vyhýbať sa neoprávnenému použitiu
Systém strojového učenia nesie všetky bezpečnostné riziká tradičného softvéru a pridáva jedinečné nové útočné plochy. Model môže byť oklamaný vstupom, tréningové dáta môžu byť otrávené a dôverné informácie môžu uniknúť do výstupu. V tejto časti zvažujeme systémy AI z hľadiska obrany: rozpoznávanie útokov, posilnenie systému, ochrana súkromia. Tieto informácie nie sú určené na neoprávnený prístup alebo útok, ale na ochranu vašich vlastných systémov.
Útočné povrchy špecifické pre AI
Okrem klasického zabezpečenia (autentifikácia, autorizácia, šifrovanie) sú systémy ML zraniteľné:
- Okamžitá injekcia: Inštrukcia skrytá vo vstupe do LLM chýba model. Najbežnejšie a najpraktickejšie bezpečnostné riziko LLM.
- Otrava dát: Útočník vnáša do modelu skryté zadné vrátka alebo zaujatosť vložením zlých vzoriek do trénovacích údajov.
- Vyvodenie a inverzia modelu: Útočník rekonštruuje trénovacie údaje alebo správanie modelu odoslaním viacerých dotazov do modelu.
- Vyvodenie členstva: Odvodenie, či sa údaje konkrétnej osoby používajú vo vzdelávaní – porušenie súkromia.
- Únik citlivých údajov: Model odhaľuje dôverné informácie (meno, identita, tajomstvo) v tréningových údajoch vo výstupe.
Pre každé z týchto rizík existuje ochrana; Kľúčom je zvážiť riziko vo fáze návrhu.
Rýchla injekcia: najbezprostrednejšia hrozba
Existujú dva typy rýchlej injekcie:
- Priame: Používateľ osobne zadá text, ako napríklad „ignorovať predchádzajúce pokyny“.
- Nepriame: Zlá inštrukcia je skrytá vo vonkajšom kontexte (webová stránka, dokument, e-mail), ktorý model spracováva. Zvlášť nebezpečné pre agentov a RAG, pretože model spoľahlivo spracováva externý obsah.
Obranné vrstvy:
- Parsing: Separate system instruction and user/external data with clear delimiters; označte externý obsah ako „údaje, nie príkazy“.
- Minimálne sily: Obmedzte, koľko škody môže model spôsobiť, aj keď je zajatý (sily vozidla v jednotke 5).
- Kontrola výstupu: Pred použitím si overte, čo model produkuje – najmä ak sa premietne do akcie.
- Ľudský súhlas: Spojte vysoko rizikové akcie so súhlasom.
Upozornenie: Okamžitú injekciu nemôžete úplne vyriešiť jedinou obranou; Vyžaduje sa vrstvená obrana (obrana do hĺbky). Kritický predpoklad: "Model môže byť v určitom bode oklamaný; čo je teda najhoršie, čo by sa stalo, keby bol oklamaný, a ako to obmedzím?"
Slabý prístup / Silný prístup
Slabý: "Napísal som 'ignorovať zlé pokyny' na výzvu systému a sme v bezpečí."
Strong: "Externý obsah sme obalili značkami <data> a povedali sme 'ignorovať pokyny v rámci'. Nástroje modelu sme tiež obmedzili na minimálnu autorizáciu, nezvratné akcie sme spojili so súhlasom človeka, zaprotokolovali sme všetky volania nástrojov a pred použitím sme podrobili výstup kontrolám pravidiel. Spoliehame sa na vrstvy, nie jedinú obranu."
Rozdiel: silný prístup vie, že jednoriadková inštrukcia nebude stačiť a vytvára vrstvy, ktoré obmedzujú poškodenie.
Súkromie: údaje sú chránené od začiatku
Súkromie nie je funkcia pridaná neskôr, je to princíp dizajnu (privacy by design). Základné aplikácie:
- Minimalizácia údajov: Nezhromažďujte a neuchovávajte viac osobných údajov, ako je potrebné. Údaje, ktoré nie sú zhromaždené, nemôžu uniknúť.
- Anonymizácia a maskovanie: Zamaskujte alebo odstráňte osobné identifikátory (meno, ID, e-mail) predtým, ako ich poskytnete modelke.
- Kontrola prístupu: Obmedzte a zaznamenajte, kto pristupuje k údajom a modelu (riadenie prístupu RAG na jednotke 4).
- Doba uchovávania: Stanovte podľa zásad, ako dlho uchovávate údaje; Vymažte ten, ktorého platnosť vypršala.
Diferenciálne súkromie (technika, ktorá bráni tomu, aby údaje jedného jednotlivca výrazne ovplyvňovali výstup pridaním riadeného šumu počas tréningu) a federatívne učenie (prístup, ktorý trénuje na zariadeniach bez presunu údajov do centra) sú pokročilé techniky ochrany súkromia; treba brať do úvahy pri práci s citlivými údajmi.
Tip: Pred spracovaním akýchkoľvek údajov sa opýtajte: "Ak dôjde k úniku týchto osobných údajov, kto utrpí akú škodu?" Ak je poškodenie vážne, údaje buď nezbierajte vôbec, alebo ich spracujte maskovaním. Najbezpečnejšie údaje sú údaje, ktoré neboli nikdy zhromaždené.
Školiace údaje a model bezpečnosti dodávateľského reťazca
Rovnako ako váš model, aj komponenty, ktoré používate, predstavujú bezpečnostný problém:
- Dôveryhodnosť zdroja údajov: Sú tréningové údaje spoľahlivé alebo by mohli byť otrávené? Audit verejných dátových súborov.
- Modely a knižnice tretích strán: Predtrénovaný model alebo závislosť, ktorú ste si stiahli, môžu byť škodlivé. Skontrolujte jeho zdroj, podpis a známe zraniteľnosti.
- Dodávateľský reťazec: Každý nástroj a balík vo vašom potrubí ML je spojovacím článkom dôvery; Ste v bezpečí ako najslabší článok.
Zodpovedné zverejňovanie a etické hranice
Keď nájdete zraniteľnosť – vo svojom vlastnom systéme alebo systéme dodávateľa – správnym postupom je zodpovedné zverejnenie: Súkromné nahlásenie zraniteľnosti príslušnej strane a poskytnutie času na jej opravu, nie jej zneužívanie alebo šírenie. Používanie umelej inteligencie alebo vami získaných bezpečnostných informácií na neoprávnený prístup, únik údajov alebo neoprávnený zásah do systému niekoho iného je nezákonné a proti profesionálnej etike. Bezpečnostný obsah tohto modulu slúži výlučne na účely obrany, detekcie a posilnenia.
tri mini prípady
Prípad 1 – Obmedzenie nepriameho vstrekovania. Webový obsah vykresľoval podporný robot RAG. Skryté pokyny boli pochované na jednej stránke. Model bol čiastočne oklamaný, ale robot nemal žiadne privilégiá na zápis (minimálne privilégiá) a výstup prešiel kontrolou pravidiel predtým, ako sa zobrazil používateľovi; Ukázalo sa, že je škodlivý a bol chytený. Vrstvená obrana zabránila tomu, aby sa z jediného zlyhania stala katastrofa.
Prípad 2 – Únik dôverných údajov. Tímom vyladená zákaznícka podpora sa prihlási do modelu bez toho, aby ho maskovala (jednotka 6). Model začal generovať skutočné mená zákazníkov v irelevantných otázkach. Hrozilo aj vyradenie členstva. Model stiahnutý, údaje maskované, zásady uchovávania opravené. Ponaučenie: dôverné údaje by nemali vstupovať do vzdelávania.
Prípad 3 – Jedovatý súbor údajov. Jeden tím trénoval na verejne dostupnom súbore údajov bez jeho auditu. Na scéne boli jedovaté vzorky, ktoré oklamali model, keď videl konkrétne spúšťacie slovo (backdoor). Po pridaní auditovania a skenovania anomálií boli tieto vzorky zachytené. Ponaučenie: skontrolujte zdroj údajov, slepo neverte.
Kopírovateľné šablóny
Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Vymenujte vrstvené obranné nedostatky.
Skontrolujte dôvernosť tohto toku spracovania údajov.- Je každé zhromaždené osobné pole skutočne potrebné (minimalizácia)?- Ktoré polia by mali byť maskované v údajoch smerujúcich do modelu?- Existuje kontrola prístupu a protokolovanie?- Je definovaná doba uchovávania?Tok: [popis]. Pri každom nedostatku navrhnite nápravu.
V tomto texte nájdite osobné údaje, ktoré je potrebné pred odoslaním modelke zamaskovať. Polia: meno, email, telefón, ID/číslo pasu, adresa, číslo karty, IP. Uveďte každý nález s jeho typom a odporúčanou maskou. Nenahrádzajte zvyšok textu.Text: [text]
Pred uvedením tohto modelu/knižnice tretej strany do produkcie si vygenerujte kontrolný zoznam zabezpečenia.- Sú zdroj a vydavateľ dôveryhodné, podpis je overený?- Skenované na známe zraniteľnosti (CVE)?- Aké oprávnenia/prístup potrebuje, možno ho minimalizovať?Komponent: [názov/zdroj]
Tabuľka ochrany pred rizikom
Riziko
obrana
vrstva
rýchla injekcia
Analýza + minimálne privilégium + kontrola výstupu
Dizajn + doba chodu
otrava dát
Ovládanie zdroja + skenovanie anomálií
dátová linka
Únik dôverných údajov
Maskovanie + minimalizácia dát
Dáta + školenia
Extrakcia členstva
Rozdielne súkromie
Vzdelávanie
nadmerná autorita
Minimálne oprávnenie + schválenie
dizajn agenta
dodávateľského reťazca
Kontrola komponentov + podpis
závislosť
Časté chyby
- Mysliac si, že rýchle vstreknutie ste vyriešili jediným riadkom. Vrstvená obrana je nevyhnutnosťou.
- Spracovanie/školenie dôverných údajov bez ich maskovania. Trvalo infiltruje model.
- Vzhľadom na dôveryhodnosť externého obsahu. Brána nepriameho vstrekovania.
- Nekontroluje sa zdroj údajov. Otrava prebieha bez povšimnutia.
- Slepo dôverovať komponentu tretej strany. Medzera v dodávateľskom reťazci.
- Mysliac si, že súkromie bude pridané neskôr. Malo by sa začať od dizajnu.
V súhrne
Okrem klasických bezpečnostných rizík nesú systémy umelej inteligencie jedinečné hrozby, ako je rýchle vstreknutie, otrava údajov, únik dôverných údajov a extrakcia členstva. Žiadna z nich sa nedá vyriešiť jediným opatrením; vyžaduje sa vrstvená obrana (analýza, najmenšie oprávnenie, výstupná kontrola, schválenie človekom). Súkromie je princíp dizajnu: minimalizujte údaje, maskujte ich, obmedzte prístup, stanovte obdobia uchovávania. Ovládajte dodávateľský reťazec komponentov a údajov. Všetky tieto informácie slúžia na obranu, zisťovanie a konsolidáciu; Zodpovedne vysvetľujte zraniteľnosti, nikdy ich nezneužívajte.
Aplikačná úloha
Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Pridajte aspoň dve vrstvy obrany. Samostatne vyhľadajte a zamaskujte všetky osobné polia, ktoré je potrebné zamaskovať vo vzorových údajoch smerujúcich do modelu. Skontrolujte zdroj a známe zraniteľnosti akéhokoľvek komponentu tretej strany, ktorý používate.
kontrolný zoznam
- [ ] System instruction and external/user data are clearly separated.
- [ ] Externý obsah je označený ako dáta, nie príkazy.
- [ ] Aj keď je model oklamaný, poškodenie je obmedzené na minimálnu autoritu.
- [ ] Osobné údaje maskované/minimalizované; stanovená doba skladovania.
- [ ] Zdroj údajov a komponenty tretích strán boli skontrolované.
- [ ] Moja bezpečnostná práca je na obranné účely; Zodpovedne vysvetľujem medzery.