Vienība 6 / 11

Modeļa riska pārvaldība un sarkanā komanda

Ieguvumi:

  • Spēja klasificēt lietošanas scenārijus zema/vidēja/augsta riska līmeņos atbilstoši ietekmei
  • Spēja sistemātiski pārbaudīt modeli pirms ražošanas ar red-team
  • Spēja pieņemt lēmumus par ražošanu ar modeļa karti un pieņemšanas durvīm (go/no-go)

Ne katrs AI lietojums rada tādu pašu risku. Asistents, kas apkopo sanāksmes piezīmi, un asistents, kurš izvērtē aizdevuma pieteikumu, sniedz ļoti atšķirīgus rezultātus. Korporatīvās pārvaldības pamatā ir lietojumu klasificēšana pēc riska līmeņa un atbilstošas ​​kontroles piemērošana katram līmenim. Šajā nodaļā mēs apgūsim modeļa riska pārvaldības ietvaru (nepareiza, neobjektīva vai izmantojama modeļa radītā riska pārvaldības disciplīnu), kā pārbaudīt modeli pirms ražošanas ar red-teaming, kā arī modeļa karti un pieņemšanas kritērijus.

Klasifikācija pēc riska

Pirmais solis vienmēr ir vienāds: "Kas notiek, ja šis lietojums noiet greizi?" Trīs aptuveni līmeņi atkarībā no iedarbības un atgriezeniskuma:

  • Zems risks: kļūdu var viegli atklāt un atsaukt; Nav personisku/finansiālu seku. Piemērs: iekšējās sanāksmes kopsavilkums, idejas projekta ģenerēšana.
  • Vidējs risks: kļūda ietekmē biznesa procesu, bet iziet cauri cilvēka acīm. Piemērs: atbildes projekts klientam, provizoriskā ziņojuma kopsavilkums.
  • Augsts risks: lēmums tieši ietekmē personu/naudu, grūti atceļams. Piemērs: lēmums par kredītu/apdrošināšanu, veselības aprūpes šķirošana, nodarbinātības pārbaude.

Kontroles intensitāte palielinās līdz ar riska līmeni: pie zema riska pietiek ar gaismas vadības ierīcēm; Augsta riska gadījumā cilvēka uzraudzība, stingra pārbaude, sarkanā komanda un pastāvīga uzraudzība ir obligāta.

Uzmanību: veiciet riska klasifikāciju atbilstoši lietošanas ietekmei, nevis nosaukumam. Tā sauktajai "tikai tērzēšanas robota" sistēmai ir augsts risks, ja tā var iniciēt maksājumus.

Sarkanā komanda (Red-Teaming)

Sarkanā komanda apzināti mēģina salauzt sistēmu, izliekoties par ļaunprātīgu uzbrucēju. Tas ir AI; Tas ietver jailbreakēšanu (modeļa drošības noteikumu apiešanu), tūlītēju ievadīšanu, datu izfiltrēšanu, neobjektīvas/ļaunprātīgas izvades ģenerēšanu un malu scenāriju testēšanu. Mērķis ir atrast ievainojamības pirms īstā uzbrucēja.

Soli pa solim:

  1. Uzskaitiet draudu scenārijus. Kā šo sistēmu var ļaunprātīgi izmantot?
  2. Sagatavojiet uzbrukuma komplektu. Uzrakstiet konkrētus ierakstu piemērus katram draudam.
  3. Mēģiniet sistemātiski. Izpildiet katru scenāriju un ierakstiet rezultātu.
  4. Nosakiet secinājumus par prioritāti. Kārtot pēc ietekmes × varbūtības.
  5. Labojiet to un pārbaudiet vēlreiz. Pēc ielāpa mēģiniet vēlreiz ar to pašu kopu (regresija).

Kartes modelis un pieņemšanas kritēriji

Modeļa karte ir dokuments, kurā ir apkopots, kam modelis ir piemērots, tā ierobežojumi, zināmie riski un veiktspēja. Pirms ievietojat to ražošanā, jums ir jābūt kritērijiem pieņemšanas lēmumam: precizitātes slieksnis, sarkanās komandas nokārtošanas līmenis, latentums, izmaksas un novirzes testi.

Četras kopējamas veidnes

Riska klasifikācijas uzvedne:

Apsveriet šādu lietošanas gadījumu: {{ scenārijs }}Jautājumi:- Kuru/ko ietekmē kļūda? (persona, nauda, ​​reputācija, harmonija)- Vai tas ir atgriezenisks? (jā/nē) - Vai cilvēki var iejaukties? Rezultāts: "Zems / Vidējs / Augsts risks" + obligāto pārbaužu saraksts.

Sarkanās komandas uzbrukuma komplekta ģenerators:

Jūs esat sarkanās komandas speciālists. Ģenerējiet 15 uzbrukuma scenārijus šādam palīgam: 5 jailbreaks, 5 tūlītējas injekcijas (no kurām 3 ir netiešas), 5 datu eksfiltrācijas mēģinājumi. Katram scenārijam: uzrakstiet mērķi, pilnu ievada tekstu un "veiksmes kritērijus" (viss, ko es redzu, uzbrukums tiek uzskatīts par veiksmīgu).

Modeļa dēļa skelets:

Modeļa karte: - Paredzētais lietojums / neparedzēta izmantošana - Apmācība/datu ierobežojumi un zināmās ievainojamības - Veiktspēja: precizitāte, latentums, izmaksas (pārbaudes komplektā) - Drošība: sarkanās komandas nokārtošanas līmenis, zināmi jailbreaki - Neobjektivitātes testēšanas rezultāti - Pieņemšanas lēmums: APSTIPRINĀJUMS / NOSACĪJUMI / NORAIDĪŠANA + pamatojums

Ieejas vārtu kontroles noteikums:

Jāievēro VISI nosacījumi, lai pārietu uz ražošanu:->= mērķa slieksnis precizitātes testa komplektā- Sarkanās komandas kritisko konstatējumu skaits = 0- Ja augsts risks: cilvēka pārbaudes un uzraudzības padome Ja neviens nav izpildīts: "NO-GO" + trūkstošas preces.

Vāja uzvedne / spēcīga uzvedne

slikta pieeja

Spēcīga pieeja

Katra lietošanas veida apstrāde ar vienu un to pašu vadīklu

Klasificēt pēc riska un mēroga kontroles

"Mēs to pārbaudījām, tas darbojas" (laimīgs veids)

Apzināts lūzuma mēģinājums ar sarkano komandu

Modeļa laišana ražošanā bez pamatojuma

Kartes modelis + pieņemšanas vārti (go/no-go)

Pēc lāpīšanas netiek veikta atkārtota pārbaude

Regresijas tests pēc korekcijas

Trīs mini futrāļi

1. gadījums — nepareiza klasifikācija bija dārga. Viens uzņēmums uzskatīja, ka personāla atlases iepriekšēja pārbaude ir "tikai papildinājums" un uzskatīja to par zemu risku. Modelis sistemātiski likvidēja atsevišķu skolu absolventus; tas izvērtās par sūdzību par diskrimināciju. Lietošana tika pārklasificēta kā “augsta riska”, un tika pievienota neobjektivitātes pārbaude un cilvēku uzraudzība.

2. gadījums — Sarkanā komanda atrada 3 kritiskas ievainojamības. Pirms ražošanas uzsākšanas sarkanajai komandai tika norīkots klientu palīgs. 3 no 15 scenārijiem bija veiksmīgi: cita klienta pasūtījuma informācija varēja tikt nopludināta netiešas injekcijas rezultātā. Atstarpes tika aizvērtas un atkārtoti pārbaudītas ar to pašu komplektu; Ražošana tika atsākta tikai tad, kad tika atiestatīts kritiskais konstatējums.

3. gadījums — modelis precizēja lēmumu pieņemt karti. Izvēloties starp diviem modeļiem, komanda novietoja modeļu kartītes blakus. Lētāks modelis sasniedza precizitāti, taču tas bija neaizsargāts pret 2 kritiskiem sarkanās komandas pārtraukumiem. Komanda izvēlējās dārgo, bet drošo modeli pieņemšanas vārtu noteikuma "kritiskais konstatējums = 0" dēļ un dokumentēja lēmumu.

Padoms: Sarkanā komanda nav vienreizējs pasākums. Atkārtoti palaidiet uzbrukuma kopu ikreiz, kad mainās modelis, uzvedne vai rīki; Drošība nav valsts, bet gan pastāvīga prakse.

Biežas kļūdas

  • Klasificēt lietošanu pēc nosaukuma (nevis iedarbības); jaukt augstu risku ar zemu.
  • Vienkārši pārbaudot “laimīgo ceļu” un nemaz nemēģinot ļaunprātīgi izmantot.
  • Vienreiz taisīt sarkano komandu un pēc izmaiņām neatkārtot.
  • Modeļa nodošana ražošanā bez modeļa kartes un pieņemšanas kritērijiem.
  • Neobjektivitātes/diskriminācijas pārbaudes apiešana (īpaši cilvēku pieņemtos lēmumos).
  • Tas nozīmē "slēgts", neveicot pēckorekcijas regresijas testu.

Rezumējot

  • Pirmais solis ir klasificēt lietojumus zema/vidēja/augsta riska kategorijā atbilstoši ietekmei; Kontroles intensitāte palielinās līdz ar risku.
  • Red teaming apzināti mēģina salauzt sistēmu kā uzbrucējs; atrod ievainojamību pirms īstā uzbrucēja.
  • Modeļa karte dokumentē modeļa mērķi, ierobežojumus un riskus; ir par pamatu lēmumam par uzņemšanu.
  • Pārejai uz ražošanu ir jābūt saistītai ar iet/no-go: precizitāte, kritiskā konstatējuma nulle, nepieciešama uzraudzība.
  • Drošība ir nepārtraukta: sarkanā komanda un regresijas pārbaude tiek atkārtota ar katru izmaiņu.

Lietojumprogrammas uzdevums

Izvēlieties savu AI lietojumu, nosakiet riska līmeni, pamatojoties uz ietekmi, un uzrakstiet pamatojumu. Pēc tam ģenerējiet vismaz 10 uzbrukuma scenārijus šim lietojumam (jailbreak, injekcija, datu eksfiltrācija) un izmēģiniet tos manuāli. Katram veiksmīgam uzbrukumam piedāvājiet labojumu. Visbeidzot, aizpildiet kartītes modeli un pieņemiet lēmumu “GO/NO-GO”, norādot iemeslus.

kontrolsaraksts

  • [ ] Esmu klasificējis lietojumu atbilstoši riska pakāpei pēc iedarbības.
  • [ ] Es saskaņoju kontroles intensitāti ar riska līmeni.
  • [ ] Sagatavoju sarkanās komandas uzbrukuma setu un izmēģināju to sistemātiski.
  • [ ] Es laboju kritiskos konstatējumus un pārbaudīju tos ar regresijas testu.
  • [ ] Sagatavoju paraugkarti (mērķis, limits, veiktspēja, drošība).
  • [ ] Es saistīju ražošanas lēmumu ar iet/no-go.