zisky:
- Schopnosť klasifikovať scenáre použitia na nízke/stredné/vysoké úrovne rizika podľa dopadu
- Schopnosť systematicky testovať model pred výrobou pomocou red-teamingu
- Schopnosť robiť výrobné rozhodnutia s modelovou kartou a akceptačnými dverami (go/no-go)
Nie každé použitie AI prináša rovnaké riziko. Asistent zhrňujúci poznámku zo stretnutia a asistent, ktorý hodnotí žiadosť o úver, prinášajú veľmi odlišné výsledky. Základom podnikového riadenia je klasifikovať použitia podľa úrovne rizika a aplikovať primeranú kontrolu na každú úroveň. V tomto bloku sa naučíme rámec riadenia rizika modelu (disciplína riadenia rizika spôsobeného nesprávnym, neobjektívnym alebo zneužiteľným modelom), ako otestovať model pred výrobou pomocou red-teamingu, ako aj modelovú kartu a akceptačné kritériá.
Klasifikácia podľa rizika
Prvý krok je vždy rovnaký: „Čo sa stane, ak sa toto použitie pokazí?“ Tri hrubé úrovne podľa účinnosti a reverzibilnosti:
- Nízke riziko: Chyba sa dá ľahko zistiť a vrátiť späť; Žiadne osobné/finančné dôsledky. Príklad: zhrnutie interného stretnutia, generovanie konceptu nápadov.
- Stredné riziko: Chyba ovplyvňuje obchodný proces, ale prechádza ľudským okom. Príklad: návrh odpovede zákazníkovi, súhrn predbežnej správy.
- Vysoké riziko: Rozhodnutie priamo ovplyvňuje osobu/peniaze, je ťažké ho zvrátiť. Príklad: rozhodnutie o úvere/poistení, triedenie zdravotnej starostlivosti, skríning zamestnania.
Intenzita kontroly sa zvyšuje s úrovňou rizika: pri nízkom riziku postačujú svetelné kontroly; Pri vysokom riziku je ľudský dohľad, prísne overovanie, červený tím a neustále monitorovanie povinné.
Pozor: Klasifikujte riziká podľa účinku použitia, nie podľa názvu. Takzvaný systém „len chatbot“ je vysoko rizikový, ak môže iniciovať platby.
Červený tím (Red-Teaming)
Red teaming sa zámerne snaží prelomiť systém predstieraním, že je zákerný útočník. Toto je v AI; Zahŕňa útek z väzenia (obchádzanie bezpečnostných pravidiel modelu), promptnú injekciu, exfiltráciu dát, generovanie neobjektívneho/škodlivého výstupu a testovanie okrajových scenárov. Cieľom je nájsť zraniteľné miesta pred skutočným útočníkom.
Krok za krokom:
- Vymenujte scenáre hrozieb. Ako sa dá tento systém zneužiť?
- Pripravte útočnú súpravu. Napíšte konkrétne príklady vstupu pre každú hrozbu.
- Skúste systematicky. Spustite každý scenár a zaznamenajte výsledok.
- Uprednostnite zistenia. Zoradiť podľa vplyvu × pravdepodobnosti.
- Opravte to a znova otestujte. Po náplasti to skúste znova s rovnakou sadou (regresia).
Model karty a akceptačné kritériá
Karta modelu je dokument, ktorý sumarizuje, na čo je model vhodný, jeho obmedzenia, známe riziká a výkon. Pred uvedením do výroby by ste mali mať kritériá pre rozhodnutie o prijatí: prah presnosti, rýchlosť úspešného testovania v tíme, latencia, náklady a testy skreslenia.
Štyri kopírovateľné šablóny
Výzva na klasifikáciu rizika:
Zvážte nasledujúci prípad použitia: {{ scenár }}Otázky:- Koho/čo chyba ovplyvňuje? (osoba, peniaze, povesť, harmónia)- Je to reverzibilné? (áno/nie) - Môžu ľudia zasiahnuť? Výsledok: "Nízke / Stredné / Vysoké riziko" + zoznam povinných kontrol.
Generátor sady útokov červeného tímu:
Ste špecialista na červený tím. Vytvorte 15 scenárov útoku pre nasledujúceho asistenta: 5 útek z väzenia, 5 rýchlych injekcií (z toho 3 nepriame), 5 pokusov o únik údajov. Pre každý scenár: napíšte účel, úplný úvodný text a „kritériá úspechu“ (čokoľvek vidím, útok sa považuje za úspešný).
Kostra modelu dosky:
Karta modelu:- Zamýšľané použitie / neúmyselné použitie- Obmedzenia školení/údajov a známe zraniteľnosti- Výkon: presnosť, latencia, cena (na testovacej sade)- Bezpečnosť: červená tímová úspešnosť, známe útek z väzenia- Výsledky testovania zaujatosti- Rozhodnutie o prijatí: SCHVÁLENIE / PODMIENKY / ODMIETNUTIE + odôvodnenie
Pravidlo kontroly vstupnej brány:
Na prechod do výroby musia byť splnené VŠETKY podmienky:- >= cieľová hranica pre test presnosti- Počet kritických zistení červeného tímu = 0- Ak je vysoké riziko: kontrolná a monitorovacia tabuľa ľuďmi Ak nie sú splnené žiadne: „NO-GO“ + chýbajúca položka.
Slabá výzva / silná výzva
zlý prístup
Silný prístup
Spracovanie každého použitia s rovnakým ovládaním
Klasifikujte podľa rizika a rozsahu
"Otestovali sme to, funguje to" (šťastný spôsob)
Úmyselný pokus o brejk s červeným tímom
Uvedenie modelu do výroby bez opodstatnenia
Modelová karta + akceptačná brána (go/no-go)
Po oprave sa znova netestuje
Regresný test po korekcii
Tri mini puzdrá
Prípad 1 – Nesprávna klasifikácia bola nákladná. Jedna spoločnosť považovala predbežný výber zamestnancov za „len doplnok“ a považovala ho za nízkorizikový. Model systematicky eliminoval absolventov niektorých škôl; to sa zmenilo na sťažnosť na diskrimináciu. Použitie bolo preklasifikované ako „vysoko rizikové“ a bolo pridané testovanie skreslenia a ľudské monitorovanie.
Prípad 2 – Červený tím našiel 3 kritické zraniteľnosti. Pred spustením výroby bol do červeného tímu pridelený asistent zákazníka. 3 z 15 scenárov boli úspešné: prostredníctvom nepriamej injekcie mohli uniknúť informácie o objednávke iného zákazníka. Medzery boli uzavreté a znovu testované s rovnakou sadou; Výroba bola obnovená až po vynulovaní kritického nálezu.
Prípad 3 – Model objasnil rozhodnutie akceptovať kartu. Tím, ktorý si vybral medzi dvoma modelmi, umiestnil karty modelov vedľa seba. Lacnejší model dosiahol presnosť, ale bol zraniteľný voči 2 kritickým útekom z väzenia v červenom tíme. Tím si vybral drahý, ale bezpečný model kvôli pravidlu akceptačnej brány „kritické zistenie = 0“ a zdokumentoval rozhodnutie.
Tip: Červený tím nie je jednorazová akcia. Znova spustite útočnú množinu vždy, keď sa zmení model, výzva alebo nástroje; Bezpečnosť nie je stav, ale trvalá prax.
Časté chyby
- Klasifikujte použitie podľa názvu (a nie podľa účinku); zamieňať vysoké riziko za nízke.
- Len testovať „šťastnú cestu“ a vôbec sa nepokúšať o zneužívanie.
- Urobiť červený tím raz a po zmenách to už neopakovať.
- Uvedenie modelu do výroby bez modelovej karty a akceptačných kritérií.
- Obchádzanie testovania zaujatosti/diskriminácie (najmä pri rozhodovaní ľudí vo vysokých stávkach).
- Znamená to „uzavreté“ bez vykonania post-korekčného regresného testovania.
V súhrne
- Prvým krokom je klasifikácia použitia ako nízke/stredné/vysoké riziko podľa dopadu; Intenzita kontroly sa zvyšuje s rizikom.
- Red teaming sa zámerne snaží prelomiť systém ako útočník; nájde zraniteľnosť skôr ako skutočný útočník.
- Karta modelu dokumentuje účel modelu, obmedzenia a riziká; je základom pre rozhodnutie o prijatí.
- Prechod do výroby musí byť viazaný na go/no-go: presnosť, kritické zistenie nula, požadované monitorovanie.
- Bezpečnosť je nepretržitá: červené tímové a regresné testovanie sa opakuje pri každej zmene.
Aplikačná úloha
Vyberte si použitie AI, určte úroveň rizika na základe dopadu a napíšte odôvodnenie. Potom vygenerujte aspoň 10 scenárov útoku pre toto použitie (útek z väzenia, injekcia, exfiltrácia údajov) a vyskúšajte ich manuálne. Pre každý úspešný útok navrhnite opravu. Nakoniec vyplňte modelovú kostru karty a urobte rozhodnutie „GO/NO-GO“ s dôvodmi.
kontrolný zoznam
- [ ] Použitie som zaradil podľa miery rizika podľa účinku.
- [ ] Priradil som intenzitu kontroly k úrovni rizika.
- [ ] Pripravil som si červený tímový útočný set a systematicky som to skúšal.
- [ ] Opravil som kritické zistenia a overil som ich regresným testovaním.
- [ ] Pripravil som si vzor karty (účel, limit, výkon, bezpečnosť).
- [ ] Zviazal som rozhodnutie o produkcii na go/no-go.