Egység 6 / 11

Modell kockázatkezelés és Red Team

Nyereség:

  • Képes a használati forgatókönyveket hatás szerint alacsony/közepes/magas kockázati szintbe sorolni
  • Lehetőség a modell szisztematikus tesztelésére a gyártás előtt a red-team segítségével
  • Képes gyártási döntéseket hozni modellkártyával és elfogadóajtóval (go/no-go)

A mesterséges intelligencia nem minden használata jár ugyanakkora kockázattal. A találkozó jegyzetét összefoglaló asszisztens és a hitelkérelmet elbíráló asszisztens nagyon eltérő eredményeket produkál. A vállalatirányítás alapja a felhasználások kockázati szint szerinti osztályozása és az egyes szinteken megfelelő ellenőrzés alkalmazása. Ebben az egységben megismerkedünk a modellkockázat-kezelés keretrendszerével (a modell hibás, elfogult vagy kihasználható volta által okozott kockázat kezelésének tudományága), a modell gyártás előtti tesztelését red-teaming segítségével, valamint a modellkártyát és az elfogadási kritériumokat.

Kockázati osztályozás

Az első lépés mindig ugyanaz: "Mi történik, ha ez a használat rosszul megy?" Három durva szint a hatékonyság és a visszafordíthatóság szerint:

  • Alacsony kockázat: A hiba könnyen észlelhető és visszavonható; Személyi/pénzügyi következmények nincsenek. Példa: belső értekezlet összefoglalója, ötlettervezet generálása.
  • Közepes kockázat: A hiba hatással van az üzleti folyamatra, de áthalad az emberi szemen. Példa: választervezet az ügyfélnek, előzetes jelentés összefoglaló.
  • Magas kockázat: A döntés közvetlenül érint egy személyt/pénzt, nehezen visszafordítható. Példa: hitel-/biztosítási döntés, egészségügyi osztályozás, foglalkoztatási szűrés.

Az ellenőrzés intenzitása a kockázat mértékével nő: alacsony kockázat esetén elegendő a könnyű vezérlés; Magas kockázat esetén kötelező az emberi felügyelet, a szigorú ellenőrzés, a red teaming és az állandó monitorozás.

Figyelem: A kockázati besorolást a felhasználás hatása, ne a neve alapján végezze. Az úgynevezett "csak egy chatbot" rendszer nagy kockázatot jelent, ha fizetést tud kezdeményezni.

Vörös csapat (Red-Teaming)

A Red Teaming szándékosan megpróbál megtörni egy rendszert azzal, hogy rosszindulatú támadónak adja ki magát. Ez az AI-ban van; Tartalmazza a jailbreaket (a modell biztonsági szabályainak megkerülését), az azonnali befecskendezést, az adatok kiszűrését, az elfogult/rosszindulatú kimenetek generálását és a szélső forgatókönyvek tesztelését. A cél a sebezhetőségek megtalálása a valódi támadó előtt.

Lépésről lépésre:

  1. Sorolja fel a fenyegetési forgatókönyveket. Hogyan lehet visszaélni ezzel a rendszerrel?
  2. Készítse elő a támadókészletet. Írjon konkrét belépési példákat minden fenyegetésre.
  3. Próbáld szisztematikusan. Futtassa le az egyes forgatókönyveket, és rögzítse az eredményt.
  4. A megállapítások rangsorolása. Rendezés hatás × valószínűség szerint.
  5. Javítsd ki és teszteld újra. A javítás után próbálkozzon újra ugyanazzal a halmazzal (regresszió).

Modellkártya és elfogadási feltételek

A modellkártya egy olyan dokumentum, amely összefoglalja, hogy egy modell mire alkalmas, korlátait, ismert kockázatait és teljesítményét. Az éles üzembe helyezés előtt rendelkeznie kell az elfogadási döntés kritériumaival: pontossági küszöb, piros csapat átadási aránya, késleltetés, költség és torzítási tesztek.

Négy másolható sablon

Kockázati besorolási felszólítás:

Fontolja meg a következő használati esetet: {{ forgatókönyv }}Kérdések: - Kit/mit érint a hiba? (személy, pénz, hírnév, harmónia)- Visszafordítható? (igen/nem) - Az emberek beavatkozhatnak? Eredmény: "Alacsony / Közepes / Magas kockázat" + a kötelező ellenőrzések listája.

Vörös csapat támadáskészlet generátor:

Ön a vörös csapat specialistája. Generáljon 15 támadási forgatókönyvet a következő asszisztenshez: 5 jailbreak, 5 azonnali befecskendezés (ebből 3 közvetett), 5 adatkiszűrési kísérlet. Mindegyik forgatókönyvhöz: írja meg a célt, a teljes bevezető szöveget és a "sikerkritériumokat" (bármit látok, az sikeresnek számít).

Modelltábla csontváza:

Modellkártya:- Rendeltetésszerű használat / nem rendeltetésszerű használat - Képzés/adatkorlátok és ismert sebezhetőségek - Teljesítmény: pontosság, késleltetés, költség (tesztkészleten) - Biztonság: piros csapat átjutási aránya, ismert jailbreakek - Elfogultsági vizsgálati eredmények - Elfogadási döntés: JÓVÁHAGYÁS / FELTÉTELES / ELUTASÍTÁS + indoklás

Belépőkapu ellenőrzési szabály:

MINDEN feltételnek teljesülnie kell a termelésre való átálláshoz:- >= célküszöb a pontossági tesztkészleten- Vörös csapat kritikus leletek száma = 0- Nagy kockázat esetén: emberi ellenőrzés és megfigyelőtábla Ha egyik sem teljesül: "NO-GO" + hiányzó elem.

Gyenge felszólítás / Erős felszólítás

rossz megközelítés

Erős megközelítés

Minden használat feldolgozása ugyanazzal a vezérléssel

Osztályozás kockázat és léptékszabályozás szerint

"Kipróbáltuk, működik" (boldog módon)

Szándékos törési kísérlet a vörös csapattal

A modell indoklás nélküli gyártásba helyezése

Kártyaminta + elfogadókapu (go/no-go)

A javítás után nem tesztelik újra

Regressziós teszt korrekció után

Három mini tok

1. eset – A téves besorolás költséges volt. Az egyik vállalat a toborzási előszűrést „csak kiegészítésnek” ítélte, és alacsony kockázatúnak ítélte. A modell szisztematikusan kizárta a végzetteket bizonyos iskolákból; ebből diszkriminációs panasz lett. A használatot „nagy kockázatú” kategóriába sorolták át, és hozzáadták a torzítástesztet és az emberi megfigyelést.

2. eset – A Red csapat 3 kritikus biztonsági rést talált. A gyártás megkezdése előtt egy ügyfél-asszisztenst rendeltek a vörös csapathoz. 15 forgatókönyvből 3 sikeres volt: egy másik ügyfél rendelési információi kiszivároghattak közvetett injekció révén. A hézagokat bezártuk és újra teszteltük ugyanazzal a készlettel; A gyártást csak a kritikus megállapítás visszaállítása után folytatták.

3. eset – A modell tisztázta a kártya elfogadására vonatkozó döntést. A két modell közül válogatva egy csapat modellkártyákat helyezett egymás mellé. Az olcsóbb modell elérte a pontosságot, de 2 kritikus jailbreak miatt volt sebezhető a vörös csapatnál. A csapat a drága, de biztonságos modellt választotta az elfogadási kapu "kritikus megállapítás = 0" szabálya miatt, és dokumentálta a döntést.

Tipp: A Red Team nem egyszeri esemény. Futtassa újra a támadáskészletet, amikor a modell, a prompt vagy az eszközök megváltoznak; A biztonság nem állapot, hanem folyamatos gyakorlat.

Gyakori hibák

  • A használatot név szerint osztályozza (nem hatás szerint); összetéveszti a magas kockázatot az alacsonyral.
  • Csak a „boldog út” tesztelése, és egyáltalán nem a bántalmazás.
  • Egyszer megcsinálni a vörös csapatot, és nem megismételni a változtatások után.
  • A modell gyártásba helyezése modellkártya és elfogadási feltételek nélkül.
  • Az elfogultság/megkülönböztetés tesztelésének megkerülése (különösen a nagy téttel járó emberi döntéseknél).
  • Azt jelenti, hogy "zárt" korrekció utáni regressziós teszt nélkül.

Összefoglalva

  • Az első lépés a felhasználások besorolása a hatás szerint alacsony/közepes/magas kockázatú kategóriába; Az ellenőrzés intenzitása a kockázattal nő.
  • A Red teaming szándékosan támadóként próbálja megtörni a rendszert; a sebezhetőséget a valódi támadó előtt találja meg.
  • A modellkártya dokumentálja a modell célját, korlátait és kockázatait; a felvételi döntés alapja.
  • A gyártásra való átállást a go/no-go-hoz kell kötni: pontosság, kritikus megállapítás nulla, szükséges monitorozás.
  • A biztonság folyamatos: a red teaming és a regressziós tesztelés minden változtatásnál megismétlődik.

Pályázati feladat

Válassza ki a mesterséges intelligencia használatát, határozza meg a kockázati szintet a hatás alapján, és írja meg az indoklást. Ezután generáljon legalább 10 támadási forgatókönyvet az adott felhasználáshoz (jailbreak, injekció, adatok kiszűrése), és próbálja ki őket manuálisan. Minden sikeres támadáshoz javasoljon javítást. Végül töltsön ki egy modellkártya-vázat, és hozzon „GO/NO-GO” döntést indoklással.

ellenőrző lista

  • [ ] A felhasználást a hatás szerint kockázati szint szerint osztályoztam.
  • [ ] A kontroll intenzitást a kockázati szinthez illesztettem.
  • [ ] Előkészítettem egy vörös csapat támadókészletét, és szisztematikusan kipróbáltam.
  • [ ] A kritikus megállapításokat rögzítettem és regressziós teszttel igazoltam.
  • [ ] Készítettem egy modellkártyát (cél, limit, teljesítmény, biztonság).
  • [ ] A gyártási döntést a megy/nem megy.