Jednotka 6 / 11

Model řízení rizik a červený tým

zisky:

  • Schopnost klasifikovat scénáře použití na nízké/střední/vysoké úrovně rizika podle dopadu
  • Schopnost systematicky testovat model před výrobou pomocí red-teamingu
  • Schopnost přijímat rozhodnutí o výrobě s modelovou kartou a akceptačními dvířky (go/no-go)

Ne každé použití AI s sebou nese stejné riziko. Asistent shrnující poznámku ze schůzky a asistent hodnotící žádost o půjčku poskytují velmi odlišné výsledky. Základem corporate governance je klasifikovat použití podle úrovně rizika a aplikovat na každou úroveň vhodnou kontrolu. In this unit, we will learn the framework of model risk management (the discipline of managing the risk caused by a model being incorrect, biased or exploitable), how to test the model before production with red-teaming, and the model card and acceptance criteria.

Klasifikace podle rizika

První krok je vždy stejný: "Co se stane, když se toto použití pokazí?" Tři hrubé úrovně podle účinnosti a reverzibility:

  • Nízké riziko: Chybu lze snadno zjistit a vrátit zpět; Žádné osobní/finanční důsledky. Příklad: shrnutí interní schůzky, vytvoření konceptu nápadu.
  • Střední riziko: Chyba ovlivňuje obchodní proces, ale prochází lidským okem. Příklad: návrh odpovědi zákazníkovi, souhrn předběžné zprávy.
  • Vysoké riziko: Rozhodnutí přímo ovlivňuje osobu/peníze, těžko zvrátit. Příklad: rozhodnutí o úvěru/pojištění, třídění zdravotní péče, prověřování zaměstnání.

Intenzita kontroly se zvyšuje s úrovní rizika: při nízkém riziku postačují světelné kontroly; Při vysokém riziku je povinný lidský dohled, přísné ověřování, červený tým a neustálé sledování.

Pozor: Klasifikujte rizika podle účinku použití, nikoli podle názvu. Takzvaný systém „jen chatbot“ je vysoce rizikový, pokud může iniciovat platby.

Červený tým (Red-Teaming)

Red teaming se záměrně snaží prolomit systém předstíráním, že je zákeřný útočník. Toto je v AI; It includes jailbreaking (bypassing the model's security rules), prompt injection, data exfiltration, generating biased/malicious output, and testing edge scenarios. Cílem je najít zranitelná místa dříve než skutečný útočník.

Krok za krokem:

  1. Vyjmenujte scénáře hrozeb. Jak lze tento systém zneužít?
  2. Připravte útočnou sadu. Napište konkrétní vstupní příklady pro každou hrozbu.
  3. Zkuste to systematicky. Spusťte každý scénář a zaznamenejte výsledek.
  4. Upřednostněte zjištění. Seřadit podle dopadu × pravděpodobnosti.
  5. Opravte to a otestujte znovu. Po opravě to zkuste znovu se stejnou sadou (regrese).

Model karty a kritéria přijetí

Karta modelu je dokument, který shrnuje, k čemu je model vhodný, jeho omezení, známá rizika a výkon. Before you put it into production, you should have criteria for an acceptance decision: accuracy threshold, red team pass rate, latency, cost, and bias tests.

Čtyři kopírovatelné šablony

Výzva ke klasifikaci rizik:

Zvažte následující případ použití: {{ scénář }}Otázky:- Koho/co chyba ovlivňuje? (osoba, peníze, pověst, harmonie)- Je to vratné? (yes/no) - Can humans intervene? Výsledek: "Nízké / Střední / Vysoké riziko" + seznam povinných kontrol.

Generátor sady útoků červeného týmu:

Jste specialista na červený tým. Generate 15 attack scenarios for the following assistant: 5 jailbreaks, 5 prompt injections (3 of which are indirect), 5 data exfiltration attempts. Pro každý scénář: napište účel, úplný úvodní text a „kritéria úspěchu“ (cokoli vidím, útok se považuje za úspěšný).

Kostra modelu desky:

Model Card:- Intended use / unintended use- Training/data limits and known vulnerabilities- Performance: accuracy, latency, cost (on test set)- Security: red team pass rate, known jailbreaks- Bias testing results- Acceptance decision: APPROVAL / CONDITIONAL / REJECTION + justification

Admission gate control rule:

ALL conditions must be met to move to production:- >= target threshold on accuracy test set- Red team critical findings count = 0- If high risk: human inspection and monitoring boardIf none are met: "NO-GO" + missing item.

Slabá výzva / Silná výzva

špatný přístup

Silný přístup

Processing each use with the same control

Classify by risk and scale control

"We tested it, it works" (happy way)

Deliberate breaking attempt with the red team

Uvedení modelu do výroby bez odůvodnění

Model card + acceptance gate (go/no-go)

Not retesting after patching

Regression test after correction

Tři mini pouzdra

Case 1 — Misclassification was costly. Jedna společnost považovala předběžné prověřování náboru za „pouze doplněk“ a považovala jej za málo rizikové. Model systematicky eliminoval absolventy některých škol; this turned into a discrimination complaint. Použití bylo překlasifikováno jako „vysoce rizikové“ a bylo přidáno testování zkreslení a monitorování lidí.

Případ 2 — Červený tým našel 3 kritická zranitelnosti. Před zahájením výroby byl červenému týmu přidělen zákaznický asistent. 3 z 15 scénářů byly úspěšné: informace o objednávce jiného zákazníka mohly uniknout prostřednictvím nepřímé injekce. Mezery byly uzavřeny a znovu testovány se stejnou sadou; Výroba byla obnovena až po vynulování kritického nálezu.

Případ 3 – Model objasnil rozhodnutí přijmout kartu. Tým si vybral mezi dvěma modely a umístil karty modelů vedle sebe. Levnější model dosáhl přesnosti, ale byl zranitelný vůči 2 kritickým útěkům z vězení v červeném týmu. Tým zvolil drahý, ale bezpečný model kvůli pravidlu akceptační brány „kritické zjištění = 0“ a zdokumentoval rozhodnutí.

Tip: Červený tým není jednorázová akce. Znovu spusťte sadu útoků, kdykoli se změní model, výzva nebo nástroje; Bezpečnost není stav, ale trvalá praxe.

Časté chyby

  • Classify use by name (rather than effect); zaměňovat vysoké riziko za nízké.
  • Jen testovat „šťastnou cestu“ a vůbec nezkoušet zneužívání.
  • Udělat červený tým jednou a po změnách to neopakovat.
  • Uvedení modelu do výroby bez modelové karty a akceptačních kritérií.
  • Obcházení testování zkreslení/diskriminace (zejména u vysoce důležitých lidských rozhodnutí).
  • Znamená to "uzavřeno" bez provádění post-korekčního regresního testování.

V souhrnu

  • Prvním krokem je klasifikace použití jako nízké/střední/vysoké riziko podle dopadu; Intenzita kontroly se zvyšuje s rizikem.
  • Red teaming se záměrně snaží rozbít systém jako útočník; najde zranitelnost dříve než skutečný útočník.
  • Karta modelu dokumentuje účel modelu, omezení a rizika; je podkladem pro rozhodnutí o přijetí.
  • Přechod do výroby musí být vázán na go/no-go: přesnost, kritická nula, požadované monitorování.
  • Zabezpečení je nepřetržité: červené týmové a regresní testování se opakuje s každou změnou.

Aplikační úkol

Vyberte si použití AI, určete úroveň rizika na základě dopadu a napište odůvodnění. Poté vygenerujte alespoň 10 scénářů útoku pro toto použití (útěk z vězení, injekce, exfiltrace dat) a vyzkoušejte je ručně. Pro každý úspěšný útok navrhněte opravu. Nakonec vyplňte kostru karty modelu a udělejte rozhodnutí „GO/NO-GO“ s důvody.

kontrolní seznam

  • [ ] Použití jsem zařadil podle míry rizika podle účinku.
  • [ ] Přizpůsobil jsem intenzitu kontroly úrovni rizika.
  • [ ] Připravil jsem si červený týmový útočný set a systematicky to zkusil.
  • [ ] Opravil jsem kritická zjištění a ověřil je regresním testováním.
  • [ ] Připravil jsem vzor karty (účel, limit, výkon, zabezpečení).
  • [ ] Svázal jsem rozhodnutí o produkci na go/no-go.