Jednotka 9 / 11

Zabezpečení a soukromí: Obrana systémů umělé inteligence

zisky:

  • Schopnost rozpoznat útočné povrchy specifické pro AI (rychlé vložení, otrava dat, únik důvěrných dat, extrakce členství) a navrhnout vrstvenou obranu
  • Schopnost uplatnit soukromí jako princip návrhu: minimalizace dat, maskování, řízení přístupu a doba uchování
  • Schopnost provádět bezpečnostní práce výhradně pro obranné účely, zodpovědně odhalovat slabá místa a vyhýbat se neoprávněnému použití

Systém strojového učení nese všechna bezpečnostní rizika tradičního softwaru a přidává jedinečné nové útočné plochy. Model může být oklamán vstupem, trénovací data mohou být otrávena a důvěrné informace mohou uniknout do výstupu. V této jednotce zvažujeme systémy umělé inteligence z hlediska obrany: rozpoznání útoků, posílení systému, ochrana soukromí. Tyto informace neslouží k neoprávněnému přístupu nebo útoku, ale k zajištění bezpečnosti vašich vlastních systémů.

Útočné povrchy specifické pro AI

Kromě klasického zabezpečení (autentizace, autorizace, šifrování) jsou systémy ML zranitelné:

  • Prompt injection: Instrukce skrytá ve vstupu do LLM model chybí. Nejběžnější a nejpraktičtější bezpečnostní riziko LLM.
  • Otrava dat: Útočník vnáší do modelu skrytá zadní vrátka nebo předpojatost vložením špatných vzorků do trénovacích dat.
  • Inference a inverze modelu: Útočník rekonstruuje trénovací data nebo chování modelu odesláním více dotazů do modelu.
  • Odvozování členství: Odvozování, zda jsou data konkrétní osoby používána ve vzdělávání – porušení soukromí.
  • Únik citlivých dat: Model odhaluje důvěrné informace (jméno, identitu, tajemství) v trénovacích datech ve výstupu.

Pro každé z těchto rizik existují obrany; Klíčem je zvážit riziko ve fázi návrhu.

Rychlá injekce: nejbezprostřednější hrozba

Existují dva typy rychlé injekce:

  • Přímé: Uživatel osobně zadá text, například „ignorujte předchozí pokyny“.
  • Nepřímé: Špatná instrukce je skryta v externím kontextu (webová stránka, dokument, e-mail), který model zpracovává. Zvláště nebezpečné pro agenty a RAG, protože model spolehlivě zpracovává externí obsah.

Obranné vrstvy:

  1. Parsing: Separate system instruction and user/external data with clear delimiters; označte externí obsah jako „data, nikoli příkazy“.
  2. Minimální síly: Omezte, kolik poškození může model způsobit, i když je zajat (síly vozidla v jednotce 5).
  3. Kontrola výstupu: Ověřte, co model produkuje, než jej použijete – zvláště pokud se to promítne do akce.
  4. Lidský souhlas: Spojte vysoce rizikové akce se souhlasem.
Upozornění: Rychlou injekci nelze zcela vyřešit jedinou obranou; Vyžaduje se vrstvená obrana (obrana do hloubky). Kritický předpoklad: "Model může být v určitém okamžiku oklamán; takže co nejhoršího by se stalo, kdyby byl oklamán, a jak to mohu omezit?"

Slabý přístup / Silný přístup

Slabý: "Napsal jsem 'ignorovat špatné instrukce' na výzvu systému a jsme v bezpečí."

Strong: "Externí obsah jsme obalili značkami <data> a řekli jsme 'ignorovat pokyny uvnitř'. Také jsme omezili nástroje modelu na minimální autorizaci, svázali nevratné akce se souhlasem člověka, zaprotokolovali všechna volání nástrojů a podrobili výstup kontrolám pravidel před použitím. Spoléháme na vrstvy, ne na jedinou obranu."

Rozdíl: silný přístup ví, že jednořádková instrukce nebude stačit a vytváří vrstvy, které omezují poškození.

Soukromí: data jsou chráněna od začátku

Soukromí není funkce přidaná později, je to princip návrhu (privacy by design). Základní aplikace:

  • Minimalizace dat: Neshromažďujte a neuchovávejte více osobních údajů, než je nutné. Data, která nejsou shromážděna, nemohou uniknout.
  • Anonymizace a maskování: Zamaskujte nebo odstraňte osobní identifikátory (jméno, ID, e-mail), než je předáte modelu.
  • Řízení přístupu: Omezte a zaznamenejte, kdo přistupuje k datům a modelu (Řízení přístupu RAG na jednotce 4).
  • Doba uchovávání: Určete podle zásad, jak dlouho data uchováváte; Smažte ten, jehož platnost vypršela.

Diferenciální soukromí (technika, která zabraňuje tomu, aby data jednotlivce významně ovlivňovala výstup přidáním řízeného šumu během tréninku) a federované učení (přístup, který trénuje na zařízeních bez přesunu dat do centra) jsou pokročilé techniky ochrany soukromí; při práci s citlivými údaji je třeba vzít v úvahu.

Tip: Před zpracováním jakýchkoli údajů se zeptejte: "Pokud dojde k úniku těchto osobních údajů, kdo utrpí jakou újmu?" Pokud je poškození vážné, data buď nesbírejte vůbec, nebo je zpracujte maskováním. Nejbezpečnější data jsou data, která nebyla nikdy shromážděna.

Školení dat a model zabezpečení dodavatelského řetězce

Stejně jako váš model jsou bezpečnostním problémem také komponenty, které používáte:

  • Důvěryhodnost zdroje dat: Jsou trénovací data spolehlivá nebo by mohla být otrávená? Audit veřejných datových sad.
  • Modely a knihovny třetích stran: Předtrénovaný model nebo závislost, kterou jste si stáhli, může být škodlivý. Zkontrolujte jeho zdroj, podpis a známá zranitelnost.
  • Dodavatelský řetězec: Každý nástroj a balíček ve vašem ML potrubí je článkem důvěry; Jste v bezpečí jako ten nejslabší článek.

Odpovědné zveřejňování a etické hranice

Když najdete zranitelnost – ve svém vlastním systému nebo systému dodavatele – správným postupem je zodpovědné odhalení: soukromě nahlásit zranitelnost příslušné straně a dát jí čas na její opravu, nikoli ji zneužívat nebo šířit. Používání umělé inteligence nebo informací o zabezpečení, které jste získali, k neoprávněnému přístupu, úniku dat nebo neoprávněnému zásahu do systému někoho jiného je nezákonné a proti profesionální etice. Bezpečnostní obsah tohoto modulu je určen výhradně pro účely obrany, detekce a posílení.

tři mini pouzdra

Případ 1 – Omezení nepřímého vstřikování. Webový obsah vykresloval robot podporující RAG. Skryté instrukce byly pohřbeny na jedné stránce. Model byl částečně oklamán, ale bot neměl žádná oprávnění k zápisu (minimální oprávnění) a výstup před zobrazením uživateli prošel kontrolou pravidel; Ukázalo se, že je škodlivý a byl chycen. Vrstvená obrana zabránila tomu, aby se jediné selhání stalo katastrofou.

Případ 2 – Únik důvěrných dat. Tým vyladěná zákaznická podpora se přihlásí do modelu, aniž by je maskovala (jednotka 6). Model začal generovat skutečná jména zákazníků v irelevantních otázkách. Hrozilo také odebrání členství. Model stažen, data maskována, zásady uchovávání opraveny. Poučení: důvěrná data by neměla vstupovat do vzdělávání.

Případ 3 – Jedovatý soubor dat. Jeden tým trénoval na veřejně dostupné datové sadě, aniž by ji kontroloval. Na natáčení byly jedovaté vzorky, které model oklamaly, když viděl konkrétní spouštěcí slovo (backdoor). Po přidání auditování a skenování anomálií byly tyto vzorky zachyceny. Ponaučení: zkontrolujte zdroj dat, slepě nedůvěřujte.

Kopírovatelné šablony

Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Vyjmenujte vrstvené obranné nedostatky.

Auditujte tento tok zpracování dat z hlediska důvěrnosti.- Je každé shromážděné osobní pole skutečně nutné (minimalizace)?- Která pole by měla být maskována v datech přicházejících do modelu?- Existuje kontrola přístupu a protokolování?- Je definována doba uchovávání? Tok: [popis]. Navrhněte nápravu pro každý nedostatek.

V tomto textu najděte osobní údaje, které je třeba před odesláním do modelu maskovat. Pole: jméno, email, telefon, ID/číslo pasu, adresa, číslo karty, IP. U každého nálezu uveďte jeho typ a doporučenou masku. Nenahrazujte zbytek textu.Text: [text]

Před uvedením tohoto modelu/knihovny třetí strany do produkce vygenerujte kontrolní seznam zabezpečení.- Jsou zdroj a vydavatel důvěryhodné, podpis je ověřen?- Kontrolováno na známé zranitelnosti (CVE)?- Jaká oprávnění/přístup potřebuje, lze jej minimalizovat? Komponenta: [název/zdroj]

Risk-obrana tabulka

Riziko

obrana

vrstva

rychlá injekce

Analýza + minimální oprávnění + kontrola výstupu

Design + runtime

otrava daty

Ovládání zdroje + skenování anomálií

datová linka

Únik důvěrných dat

Maskování + minimalizace dat

Data + školení

Extrakce členství

Diferenciální soukromí

Vzdělávání

přílišná autorita

Minimální oprávnění + schválení

design agenta

dodavatelského řetězce

Kontrola součásti + podpis

závislost

Časté chyby

  • V domnění, že jste vyřešili rychlou injekci jediným řádkem. Vrstvená obrana je nutností.
  • Zpracování/školení důvěrných dat bez jejich maskování. Trvale infiltruje model.
  • S ohledem na důvěryhodnost externího obsahu. Nepřímá vstřikovací brána.
  • Nekontroluje se zdroj dat. Otrava probíhá bez povšimnutí.
  • Slepě důvěřovat komponentě třetí strany. Mezera v dodavatelském řetězci.
  • Myslíme si, že soukromí bude přidáno později. Mělo by se začít od designu.

V souhrnu

Kromě klasických bezpečnostních rizik nesou systémy umělé inteligence jedinečné hrozby, jako je rychlé vložení, otrava dat, únik důvěrných dat a extrakce členství. Žádný z nich nelze vyřešit jediným opatřením; je vyžadována vrstvená obrana (analýza, nejmenší autorizace, výstupní kontrola, lidské schválení). Soukromí je princip návrhu: minimalizujte data, maskujte je, omezte přístup, stanovte doby uchovávání. Kontrolujte dodavatelský řetězec komponent a dat. Všechny tyto informace slouží k obraně, detekci a konsolidaci; Zodpovědně vysvětlujte zranitelnosti, nikdy je nezneužívejte.

Aplikační úkol

Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Přidejte alespoň dvě vrstvy obrany. Samostatně vyhledejte a zamaskujte všechna osobní pole, která je třeba maskovat, ve vzorových datech přicházejících do modelu. Zkontrolujte zdroj a známá zranitelnost jakékoli komponenty třetí strany, kterou používáte.

kontrolní seznam

  • [ ] System instruction and external/user data are clearly separated.
  • [ ] Externí obsah je označen jako data, nikoli jako příkazy.
  • [ ] I když je model oklamán, poškození je omezeno na minimální autoritu.
  • [ ] Osobní údaje maskovány/minimalizovány; definována doba skladování.
  • [ ] Zdroj dat a součásti třetích stran byly zkontrolovány.
  • [ ] Moje bezpečnostní práce je pro obranné účely; Mezery zodpovědně vysvětluji.