Egység 9 / 11

Biztonság és adatvédelem: Az AI-rendszerek védelme

Nyereség:

  • Képes az AI-specifikus támadási felületek felismerésére (azonnali befecskendezés, adatmérgezés, bizalmas adatok kiszivárgása, tagság kivonása) és réteges védelmet tervezni
  • Az adatvédelem mint tervezési elv alkalmazásának képessége: adatminimalizálás, maszkolás, hozzáférés-szabályozás és megőrzési időszak
  • Képes biztonsági munkát kizárólag védelmi célból végezni, a sebezhetőségeket felelősségteljesen felfedni, és elkerülni a jogosulatlan használatot

A gépi tanulási rendszer magában hordozza a hagyományos szoftverek összes biztonsági kockázatát, és egyedi új támadási felületeket ad hozzá. A modell megtéveszthető egy bemenettel, a képzési adatok megmérgezhetők, és bizalmas információk szivároghatnak ki a kimenetbe. Ebben az egységben a mesterséges intelligencia rendszereit védelmi szempontból vizsgáljuk: támadások felismerése, a rendszer keményítése, a magánélet védelme. Ez az információ nem jogosulatlan hozzáférésre vagy támadásra szolgál, hanem saját rendszere biztonságának megőrzésére.

AI-specifikus támadási felületek

A klasszikus biztonságon (hitelesítés, engedélyezés, titkosítás) kívül az ML rendszerek sebezhetőek a következőkre:

  • Prompt injekció: Az LLM bemenetében elrejtett utasítás nem veszi figyelembe a modellt. A leggyakoribb és legpraktikusabb LLM biztonsági kockázat.
  • Adatmérgezés: A támadó rejtett hátsó ajtót vagy torzítást vezet be a modellbe úgy, hogy rossz mintákat szúr be a betanítási adatokba.
  • Modellkövetkeztetés és inverzió: A támadó több lekérdezés elküldésével rekonstruálja a betanítási adatokat vagy a modell viselkedését.
  • Tagsági következtetés: Annak megállapítása, hogy egy adott személy adatait felhasználják-e az oktatásban – adatvédelmi jogsértés.
  • Érzékeny adatszivárgás: A modell bizalmas információkat (név, személyazonosság, titok) tár fel a kimeneti betanítási adatokban.

Mindegyik kockázat ellen létezik védekezés; A legfontosabb az, hogy a tervezési szakaszban figyelembe vegyék a kockázatot.

Azonnali injekció: a legközvetlenebb veszély

Kétféle azonnali injekció létezik:

  • Közvetlen: A felhasználó személyesen ír be olyan szöveget, mint például a „korábbi utasítások figyelmen kívül hagyása”.
  • Közvetett: A rossz utasítás egy külső kontextusban (weboldal, dokumentum, e-mail) van elrejtve, amelyet a modell feldolgoz. Különösen veszélyes az ügynökökre és a RAG-ra, mert a modell megbízhatóan kezeli a külső tartalmat.

Védelmi rétegek:

  1. Parsing: Separate system instruction and user/external data with clear delimiters; jelölje meg a külső tartalmat "adatként, nem parancsként".
  2. Minimális teljesítmény: Korlátozza azt, hogy a modell mekkora kárt okozhat még akkor is, ha rögzítik (a jármű teljesítménye az 5-ös egységben).
  3. Kimenet vezérlése: Ellenőrizze, hogy a modell mit produkál, mielőtt használná – különösen, ha az műveletet eredményez.
  4. Emberi jóváhagyás: Kösd össze a nagy kockázatú tevékenységeket a jóváhagyással.
Figyelem: Az azonnali injekciót nem lehet teljesen megoldani egyetlen védekezéssel; Réteges védekezés (mélységi védekezés) szükséges. Kritikus feltevés: "Előfordulhat, hogy a modellt valamikor becsapják; tehát mi a legrosszabb, ami történne, ha becsapják, és hogyan korlátozhatom ezt?"

Gyenge megközelítés / Erős megközelítés

Gyenge: "Azt írtam be, hogy "figyelmen kívül hagyja a rossz utasításokat" a rendszerkérdésre, és biztonságban vagyunk."

Erős: "A külső tartalmat <data> címkékkel burkoltuk, és azt mondtuk, hogy "figyelmen kívül hagyjuk a belső utasításokat". Ezenkívül a modell eszközeit a minimális jogosultságra korlátoztuk, a visszafordíthatatlan műveleteket emberi jóváhagyáshoz kötöttük, naplóztuk az összes eszközhívást, és a kimenetet használat előtt szabályellenőrzésnek vetettük alá. Rétegekre támaszkodunk, nem egyetlen védelemre."

A különbség: az erős megközelítés tudja, hogy egy egysoros utasítás nem lesz elég, és olyan rétegeket épít fel, amelyek korlátozzák a sebzést.

Adatvédelem: az adatok a kezdetektől védettek

Az adatvédelem nem később hozzáadott szolgáltatás, hanem tervezési elv (privacy by design). Alapvető alkalmazások:

  • Adatminimalizálás: Ne gyűjtsön és tároljon több személyes adatot a szükségesnél. Az össze nem gyűjtött adatok nem szivároghatnak ki.
  • Anonimizálás és maszkolás: Takarja el vagy távolítsa el a személyes azonosítókat (név, azonosító, e-mail), mielőtt megadná őket a modellnek.
  • Hozzáférés-vezérlés: Korlátozza és naplózza, hogy ki fér hozzá az adatokhoz és a modellhez (RAG hozzáférés-vezérlés a 4-es egységen).
  • Megőrzési időszak: Szabályzat szerint határozza meg, hogy mennyi ideig őrizze meg az adatokat; Törölje a lejárt.

A differenciált adatvédelem (olyan technika, amely megakadályozza, hogy egyetlen egyén adatai jelentősen befolyásolják a kimenetet azáltal, hogy az edzés során szabályozott zajt adnak) és az egyesített tanulás (olyan megközelítés, amely az eszközökön oktat anélkül, hogy az adatokat a központba helyezné) fejlett adatvédelmi technikák; figyelembe kell venni, amikor érzékeny adatokkal dolgozik.

Tipp: Bármilyen adat feldolgozása előtt kérdezze meg: "Ha ez a személyes adat kiszivárog, kinek milyen kára lesz?" Ha a kár súlyos, vagy egyáltalán ne gyűjtse az adatokat, vagy maszkolja azokat. A legbiztonságosabb adatok azok az adatok, amelyeket soha nem gyűjtöttek össze.

Képzési adatok és modell ellátási lánc biztonsága

Az Ön modelljéhez hasonlóan az Ön által használt alkatrészek is biztonsági problémát jelentenek:

  • Az adatforrás megbízhatósága: Megbízhatóak-e a képzési adatok, vagy mérgezhető? Nyilvános adatkészletek ellenőrzése.
  • Harmadik féltől származó modellek és könyvtárak: Előfordulhat, hogy az Ön által letöltött előre betanított modell vagy függőség rosszindulatú. Ellenőrizze a forrást, az aláírást és az ismert sebezhetőségeket.
  • Ellátási lánc: Az ML folyamatban lévő minden eszköz és csomag egy bizalmi láncszem; Olyan biztonságban vagy, mint a leggyengébb láncszem.

Felelős nyilvánosságra hozatal és etikai határok

Ha sérülékenységet talál – a saját rendszerén vagy egy szállító rendszerén –, a helyes út a felelősségteljes nyilvánosságra hozatal: a sérülékenység privát bejelentése az érintett félnek, és időt adva a javításra, nem pedig kihasználni vagy terjeszteni. A mesterséges intelligencia vagy az Ön által megszerzett biztonsági információk jogosulatlan hozzáférés, adatszivárgás, vagy valaki más rendszerébe való jogosulatlan beavatkozás céljából történő felhasználása jogellenes és szakmai etikával ellentétes. Ennek a modulnak a biztonsági tartalma teljes mértékben védelmi, felderítési és keményítési célokat szolgál.

három mini tok

1. eset – A közvetett befecskendezés korlátozása. Egy RAG-támogató bot renderelte a webes tartalmat. A rejtett utasításokat egy lapra temették. A modellt részben becsapták, de a botnak nem volt írási jogosultsága (minimális jogosultság), és a kimeneten szabályellenőrzésen ment keresztül, mielőtt megjelent volna a felhasználó számára; Károsnak bizonyult és elkapták. A réteges védekezés megakadályozta, hogy egyetlen kudarc katasztrófává váljon.

2. eset – Bizalmas adatszivárgás. A finomhangolt ügyfélszolgálati csapat anélkül jelentkezik be a modellbe, hogy elfedné azokat (6. egység). A modell valódi vásárlói neveket kezdett generálni irreleváns kérdésekben. Fennállt a tagság megszüntetésének veszélye is. A modell visszavonva, az adatok maszkolva, a megőrzési szabályzat javítva. Tanulság: bizalmas adatok ne kerüljenek be az oktatásba.

3. eset – Mérgező adatsor. Az egyik csapat egy nyilvánosan elérhető adatkészletre oktatott anélkül, hogy azt auditálta volna. Mérgező minták voltak a forgatáson, amelyek megtévesztették a modellt, amikor meglátott egy konkrét kiváltó szót (backdoor). Az auditálás és az anomália szkennelés hozzáadása után ezeket a mintákat rögzítettük. Tanulság: ellenőrizze az adatforrást, ne bízzon vakon.

Másolható sablonok

Check this LLM/agent system for prompt injection.- Are system instructions and user/external data clearly separated?- Is external content marked as "data" or is it handled as a command?- What is the worst that would happen if the model is fooled (authorization limit)?- Are irreversible actions subject to human approval?- Is the output inspected before use?System: [description]. Sorolja fel a réteges védekezési hiányosságokat!

Auditálja ezt az adatfeldolgozási folyamatot a titoktartás érdekében.- Valóban szükséges-e minden egyes összegyűjtött személyes mező (minimalizálás)?- Mely mezőket kell maszkolni a modellbe kerülő adatokban?- Van hozzáférés-szabályozás és naplózás?- Meg van határozva a megőrzési időszak? Folyamat: [leírás]. Javasoljon korrekciót minden hiányosság esetén.

Ebben a szövegben keresse meg azokat a személyes adatokat, amelyeket maszkolni kell, mielőtt elküldi azokat a modellnek. Mezők: név, email, telefon, személyi igazolvány/útlevélszám, cím, kártyaszám, IP. Sorolja fel az egyes leleteket a típusával és az ajánlott maszkkal együtt. Ne cserélje ki a szöveg többi részét.Szöveg: [szöveg]

A harmadik féltől származó modell/könyvtár éles üzembe helyezése előtt készítsen biztonsági ellenőrzőlistát.- Megbízható a forrás és a kiadó, az aláírás ellenőrzött?- Ismert sebezhetőségek (CVE) keresése?- Milyen jogosultságokra/hozzáférésre van szüksége, minimalizálható? Összetevő: [név/forrás]

Kockázat-védelem táblázat

Kockázat

védekezés

réteg

azonnali injekció

Elemzés + minimális jogosultság + kimenet vezérlés

Tervezés + futásidő

adatmérgezés

Forrásvezérlés + anomália szkennelés

adatsor

Bizalmas adatszivárgás

Maszkolás + adatminimalizálás

Adatok + képzés

Tagság kivonása

Differenciált magánélet

Oktatás

túlzott tekintély

Minimális engedély + jóváhagyás

ügynök tervezés

ellátási lánc

Alkatrész ellenőrzése + aláírás

függőség

Gyakori hibák

  • Azt gondolva, hogy egyetlen vonallal megoldotta az azonnali injekciót. A réteges védekezés elengedhetetlen.
  • Bizalmas adatok feldolgozása/képzése azok elfedése nélkül. Véglegesen beszivárog a modellbe.
  • Megbízhatónak tekintve a külső tartalmat. Közvetett befecskendező kapu.
  • Nem ellenőrzi az adatforrást. A mérgezés észrevétlen marad.
  • Vakon bízva a harmadik féltől származó összetevőben. Ellátási lánc rés.
  • Úgy gondolja, hogy az adatvédelem később lesz hozzáadva. A tervezésből kell kiindulni.

Összefoglalva

A klasszikus biztonsági kockázatok mellett az AI-rendszerek olyan egyedi fenyegetéseket is hordoznak, mint az azonnali befecskendezés, az adatmérgezés, a bizalmas adatok kiszivárgása és a tagság kivonása. Egyikük sem oldható meg egyetlen intézkedéssel; réteges védelem (elemzés, legkisebb jogosultság, kimenetvezérlés, emberi jóváhagyás) szükséges. Az adatvédelem tervezési alapelv: minimalizálja az adatokat, takarja el, korlátozza a hozzáférést, írjon elő megőrzési időszakokat. Irányítsd az alkatrész- és adatellátási láncot. Mindezek az információk a védekezést, az észlelést és a konszolidációt szolgálják; Magyarázza el a sebezhetőségeket felelősségteljesen, soha ne használja ki őket.

Pályázati feladat

Check an LLM/agent system (your own project or example) for prompt injection: are system instructions and external data separated, what is the authorization limit if the model is tricked, are irreversible actions confirmed? Adjon hozzá legalább két védelmi réteget. Külön keresse meg és takarja el azokat a személyes mezőket, amelyeket maszkolni kell a modellhez tartozó mintaadatokban. Ellenőrizze az Ön által használt harmadik féltől származó összetevők forrását és ismert sebezhetőségeit.

ellenőrző lista

  • [ ] System instruction and external/user data are clearly separated.
  • [ ] A külső tartalom adatként van megjelölve, nem parancsként.
  • [ ] Még ha a modellt becsapják is, a sebzés minimális autoritásra korlátozódik.
  • [ ] Személyes adatok maszkolva/minimalizálva; tárolási idő meghatározva.
  • [ ] Az adatforrás és a harmadik féltől származó összetevők ellenőrzése megtörtént.
  • [ ] Biztonsági munkám védelmi célokat szolgál; Felelősséggel magyarázom a hiányosságokat.