Jednotka 6 / 11

Model riadenia rizík a červený tím

zisky:

  • Schopnosť klasifikovať scenáre použitia na nízke/stredné/vysoké úrovne rizika podľa dopadu
  • Schopnosť systematicky testovať model pred výrobou pomocou red-teamingu
  • Schopnosť robiť výrobné rozhodnutia s modelovou kartou a akceptačnými dverami (go/no-go)

Nie každé použitie AI prináša rovnaké riziko. Asistent zhrňujúci poznámku zo stretnutia a asistent, ktorý hodnotí žiadosť o úver, prinášajú veľmi odlišné výsledky. Základom podnikového riadenia je klasifikovať použitia podľa úrovne rizika a aplikovať primeranú kontrolu na každú úroveň. V tomto bloku sa naučíme rámec riadenia rizika modelu (disciplína riadenia rizika spôsobeného nesprávnym, neobjektívnym alebo zneužiteľným modelom), ako otestovať model pred výrobou pomocou red-teamingu, ako aj modelovú kartu a akceptačné kritériá.

Klasifikácia podľa rizika

Prvý krok je vždy rovnaký: „Čo sa stane, ak sa toto použitie pokazí?“ Tri hrubé úrovne podľa účinnosti a reverzibilnosti:

  • Nízke riziko: Chyba sa dá ľahko zistiť a vrátiť späť; Žiadne osobné/finančné dôsledky. Príklad: zhrnutie interného stretnutia, generovanie konceptu nápadov.
  • Stredné riziko: Chyba ovplyvňuje obchodný proces, ale prechádza ľudským okom. Príklad: návrh odpovede zákazníkovi, súhrn predbežnej správy.
  • Vysoké riziko: Rozhodnutie priamo ovplyvňuje osobu/peniaze, je ťažké ho zvrátiť. Príklad: rozhodnutie o úvere/poistení, triedenie zdravotnej starostlivosti, skríning zamestnania.

Intenzita kontroly sa zvyšuje s úrovňou rizika: pri nízkom riziku postačujú svetelné kontroly; Pri vysokom riziku je ľudský dohľad, prísne overovanie, červený tím a neustále monitorovanie povinné.

Pozor: Klasifikujte riziká podľa účinku použitia, nie podľa názvu. Takzvaný systém „len chatbot“ je vysoko rizikový, ak môže iniciovať platby.

Červený tím (Red-Teaming)

Red teaming sa zámerne snaží prelomiť systém predstieraním, že je zákerný útočník. Toto je v AI; Zahŕňa útek z väzenia (obchádzanie bezpečnostných pravidiel modelu), promptnú injekciu, exfiltráciu dát, generovanie neobjektívneho/škodlivého výstupu a testovanie okrajových scenárov. Cieľom je nájsť zraniteľné miesta pred skutočným útočníkom.

Krok za krokom:

  1. Vymenujte scenáre hrozieb. Ako sa dá tento systém zneužiť?
  2. Pripravte útočnú súpravu. Napíšte konkrétne príklady vstupu pre každú hrozbu.
  3. Skúste systematicky. Spustite každý scenár a zaznamenajte výsledok.
  4. Uprednostnite zistenia. Zoradiť podľa vplyvu × pravdepodobnosti.
  5. Opravte to a znova otestujte. Po náplasti to skúste znova s ​​rovnakou sadou (regresia).

Model karty a akceptačné kritériá

Karta modelu je dokument, ktorý sumarizuje, na čo je model vhodný, jeho obmedzenia, známe riziká a výkon. Pred uvedením do výroby by ste mali mať kritériá pre rozhodnutie o prijatí: prah presnosti, rýchlosť úspešného testovania v tíme, latencia, náklady a testy skreslenia.

Štyri kopírovateľné šablóny

Výzva na klasifikáciu rizika:

Zvážte nasledujúci prípad použitia: {{ scenár }}Otázky:- Koho/čo chyba ovplyvňuje? (osoba, peniaze, povesť, harmónia)- Je to reverzibilné? (áno/nie) - Môžu ľudia zasiahnuť? Výsledok: "Nízke / Stredné / Vysoké riziko" + zoznam povinných kontrol.

Generátor sady útokov červeného tímu:

Ste špecialista na červený tím. Vytvorte 15 scenárov útoku pre nasledujúceho asistenta: 5 útek z väzenia, 5 rýchlych injekcií (z toho 3 nepriame), 5 pokusov o únik údajov. Pre každý scenár: napíšte účel, úplný úvodný text a „kritériá úspechu“ (čokoľvek vidím, útok sa považuje za úspešný).

Kostra modelu dosky:

Karta modelu:- Zamýšľané použitie / neúmyselné použitie- Obmedzenia školení/údajov a známe zraniteľnosti- Výkon: presnosť, latencia, cena (na testovacej sade)- Bezpečnosť: červená tímová úspešnosť, známe útek z väzenia- Výsledky testovania zaujatosti- Rozhodnutie o prijatí: SCHVÁLENIE / PODMIENKY / ODMIETNUTIE + odôvodnenie

Pravidlo kontroly vstupnej brány:

Na prechod do výroby musia byť splnené VŠETKY podmienky:- >= cieľová hranica pre test presnosti- Počet kritických zistení červeného tímu = 0- Ak je vysoké riziko: kontrolná a monitorovacia tabuľa ľuďmi Ak nie sú splnené žiadne: „NO-GO“ + chýbajúca položka.

Slabá výzva / silná výzva

zlý prístup

Silný prístup

Spracovanie každého použitia s rovnakým ovládaním

Klasifikujte podľa rizika a rozsahu

"Otestovali sme to, funguje to" (šťastný spôsob)

Úmyselný pokus o brejk s červeným tímom

Uvedenie modelu do výroby bez opodstatnenia

Modelová karta + akceptačná brána (go/no-go)

Po oprave sa znova netestuje

Regresný test po korekcii

Tri mini puzdrá

Prípad 1 – Nesprávna klasifikácia bola nákladná. Jedna spoločnosť považovala predbežný výber zamestnancov za „len doplnok“ a považovala ho za nízkorizikový. Model systematicky eliminoval absolventov niektorých škôl; to sa zmenilo na sťažnosť na diskrimináciu. Použitie bolo preklasifikované ako „vysoko rizikové“ a bolo pridané testovanie skreslenia a ľudské monitorovanie.

Prípad 2 – Červený tím našiel 3 kritické zraniteľnosti. Pred spustením výroby bol do červeného tímu pridelený asistent zákazníka. 3 z 15 scenárov boli úspešné: prostredníctvom nepriamej injekcie mohli uniknúť informácie o objednávke iného zákazníka. Medzery boli uzavreté a znovu testované s rovnakou sadou; Výroba bola obnovená až po vynulovaní kritického nálezu.

Prípad 3 – Model objasnil rozhodnutie akceptovať kartu. Tím, ktorý si vybral medzi dvoma modelmi, umiestnil karty modelov vedľa seba. Lacnejší model dosiahol presnosť, ale bol zraniteľný voči 2 kritickým útekom z väzenia v červenom tíme. Tím si vybral drahý, ale bezpečný model kvôli pravidlu akceptačnej brány „kritické zistenie = 0“ a zdokumentoval rozhodnutie.

Tip: Červený tím nie je jednorazová akcia. Znova spustite útočnú množinu vždy, keď sa zmení model, výzva alebo nástroje; Bezpečnosť nie je stav, ale trvalá prax.

Časté chyby

  • Klasifikujte použitie podľa názvu (a nie podľa účinku); zamieňať vysoké riziko za nízke.
  • Len testovať „šťastnú cestu“ a vôbec sa nepokúšať o zneužívanie.
  • Urobiť červený tím raz a po zmenách to už neopakovať.
  • Uvedenie modelu do výroby bez modelovej karty a akceptačných kritérií.
  • Obchádzanie testovania zaujatosti/diskriminácie (najmä pri rozhodovaní ľudí vo vysokých stávkach).
  • Znamená to „uzavreté“ bez vykonania post-korekčného regresného testovania.

V súhrne

  • Prvým krokom je klasifikácia použitia ako nízke/stredné/vysoké riziko podľa dopadu; Intenzita kontroly sa zvyšuje s rizikom.
  • Red teaming sa zámerne snaží prelomiť systém ako útočník; nájde zraniteľnosť skôr ako skutočný útočník.
  • Karta modelu dokumentuje účel modelu, obmedzenia a riziká; je základom pre rozhodnutie o prijatí.
  • Prechod do výroby musí byť viazaný na go/no-go: presnosť, kritické zistenie nula, požadované monitorovanie.
  • Bezpečnosť je nepretržitá: červené tímové a regresné testovanie sa opakuje pri každej zmene.

Aplikačná úloha

Vyberte si použitie AI, určte úroveň rizika na základe dopadu a napíšte odôvodnenie. Potom vygenerujte aspoň 10 scenárov útoku pre toto použitie (útek z väzenia, injekcia, exfiltrácia údajov) a vyskúšajte ich manuálne. Pre každý úspešný útok navrhnite opravu. Nakoniec vyplňte modelovú kostru karty a urobte rozhodnutie „GO/NO-GO“ s dôvodmi.

kontrolný zoznam

  • [ ] Použitie som zaradil podľa miery rizika podľa účinku.
  • [ ] Priradil som intenzitu kontroly k úrovni rizika.
  • [ ] Pripravil som si červený tímový útočný set a systematicky som to skúšal.
  • [ ] Opravil som kritické zistenia a overil som ich regresným testovaním.
  • [ ] Pripravil som si vzor karty (účel, limit, výkon, bezpečnosť).
  • [ ] Zviazal som rozhodnutie o produkcii na go/no-go.