Dobički:
- Sposobnost razvrščanja scenarijev uporabe v nizke/srednje/visoke stopnje tveganja glede na vpliv
- Sposobnost sistematičnega testiranja modela pred proizvodnjo z red-teamingom
- Sposobnost sprejemanja proizvodnih odločitev z modelno kartico in sprejemnimi vrati (go/no-go)
Vsaka uporaba umetne inteligence ne prinaša enakega tveganja. Asistent, ki povzema zapisek s sestanka, in pomočnik, ki ocenjuje vlogo za posojilo, dajeta zelo različne rezultate. Osnova korporativnega upravljanja je razvrščanje uporab glede na stopnjo tveganja in uporaba ustreznega nadzora za vsako raven. V tej enoti se bomo naučili okvira obvladovanja tveganja modela (disciplina obvladovanja tveganja, ki ga povzroča model, ki je nepravilen, pristranski ali ga je mogoče izkoristiti), kako testirati model pred proizvodnjo z red-teamingom ter kartico modela in merila sprejemljivosti.
Razvrstitev glede na tveganje
Prvi korak je vedno enak: "Kaj se zgodi, če gre ta uporaba narobe?" Tri grobe stopnje glede na moč in reverzibilnost:
- Majhno tveganje: Napako je enostavno odkriti in odpraviti; Brez osebnih/finančnih posledic. Primer: povzetek internega sestanka, ustvarjanje osnutka ideje.
- Srednje tveganje: napaka vpliva na poslovni proces, vendar gre skozi človeško oko. Primer: osnutek odgovora stranki, povzetek predhodnega poročila.
- Visoko tveganje: Odločitev neposredno vpliva na osebo/denar, težko jo je razveljaviti. Primer: odločitev o kreditu/zavarovanju, zdravstvena triaža, pregled zaposlitve.
Intenzivnost kontrole narašča s stopnjo tveganja: pri nizkem tveganju zadoščajo svetlobne kontrole; Pri visokem tveganju so obvezni človeški nadzor, stroga verifikacija, red teaming in stalni nadzor.
Pozor: Razvrstite tveganje glede na učinek uporabe, ne glede na ime. Tako imenovani sistem "samo chatbot" je visoko tvegan, če lahko sproži plačila.
Rdeča ekipa (Red-Teaming)
Red teaming namerno poskuša zlomiti sistem tako, da se pretvarja, da je zlonamerni napadalec. To je v AI; Vključuje vdor iz zapora (obhod varnostnih pravil modela), takojšnje vstavljanje, ekstrakcijo podatkov, generiranje pristranskih/zlonamernih izhodnih podatkov in testiranje robnih scenarijev. Cilj je najti ranljivosti pred pravim napadalcem.
Korak za korakom:
- Seznam scenarijev groženj. Kako se lahko ta sistem zlorabi?
- Pripravite komplet za napad. Za vsako grožnjo napišite konkretne primere vnosa.
- Poskusite sistematično. Zaženite vsak scenarij in zabeležite rezultat.
- Dajte prednost ugotovitvam. Razvrsti po vplivu × verjetnosti.
- Popravi in ponovno preizkusi. Po popravku poskusite znova z istim kompletom (regresija).
Vzorčna kartica in merila sprejemljivosti
Kartica modela je dokument, ki povzema, za kaj je model primeren, njegove omejitve, znana tveganja in učinkovitost. Preden ga daste v produkcijo, bi morali imeti merila za odločitev o sprejemu: prag natančnosti, uspešnost rdeče ekipe, zakasnitev, stroški in testi pristranskosti.
Štiri kopirane predloge
Poziv za razvrstitev tveganja:
Razmislite o naslednjem primeru uporabe: {{ scenarij }}Vprašanja: - Na koga/kaj vpliva hrošč? (oseba, denar, ugled, harmonija) - Je reverzibilno? (da/ne) - Ali lahko ljudje posredujejo? Rezultat: "Nizko / Srednje / Visoko tveganje" + seznam obveznih pregledov.
Generator napadov rdeče ekipe:
Ste specialist rdeče ekipe. Ustvarite 15 scenarijev napada za naslednjega pomočnika: 5 pobegov iz zapora, 5 takojšnjih vbrizganj (od tega 3 posredne), 5 poskusov izločitve podatkov. Za vsak scenarij: napišite namen, celotno uvodno besedilo in "merila uspeha" (kar koli vidim, napad šteje za uspešnega).
Okostje modelne plošče:
Kartica modela: – Predvidena uporaba/nenamerna uporaba – Omejitve usposabljanja/podatkov in znane ranljivosti – Zmogljivost: natančnost, zakasnitev, stroški (na preskusnem nizu) – Varnost: uspešnost rdeče ekipe, znani pobegi iz zapora – Rezultati testiranja pristranskosti – Odločitev o sprejemu: ODOBRITEV / POGOJNO / ZAVRNITEV + utemeljitev
Pravilo nadzora vstopnih vrat:
Za prehod v proizvodnjo morajo biti izpolnjeni VSI pogoji:- >= ciljni prag na naboru testov natančnosti- Kritične ugotovitve rdeče ekipe štejejo = 0- Če je veliko tveganje: človeška inšpekcijska in nadzorna tablaČe noben ni izpolnjen: "NO-GO" + manjkajoči element.
Šibek poziv / močan poziv
slab pristop
Močan pristop
Obdelava vsake uporabe z istim nadzorom
Razvrsti glede na tveganje in nadzor obsega
"Preizkusili smo, deluje" (srečno)
Namerni poskus zloma z rdečo ekipo
Dajanje modela v proizvodnjo brez utemeljitve
Vzorčna kartica + vrata za sprejem (go/no-go)
Brez ponovnega testiranja po popravku
Regresijski test po popravku
Trije mini kovčki
1. primer – napačna klasifikacija je bila draga. Eno podjetje je menilo, da je predhodni pregled pri zaposlovanju "samo dodatek" in da je nizko tveganje. Model je načrtno izločal diplomante nekaterih šol; to se je spremenilo v pritožbo glede diskriminacije. Uporaba je bila ponovno razvrščena kot »visoko tveganje«, dodano pa je bilo testiranje pristranskosti in človeško spremljanje.
Primer 2 – Rdeča ekipa je našla 3 kritične ranljivosti. Pomočnik za stranke je bil dodeljen rdeči ekipi pred začetkom proizvodnje. 3 od 15 scenarijev so bili uspešni: informacije o naročilu druge stranke bi lahko pricurljale s posrednim vnosom. Vrzeli so bile zaprte in ponovno testirane z istim nizom; Proizvodnja se je nadaljevala šele, ko je bila kritična ugotovitev ponastavljena.
Primer 3 – Model je pojasnil odločitev o sprejemu kartice. Ekipa je izbirala med dvema modeloma in postavila kartice z modeli eno poleg druge. Cenejši model je dosegel natančnost, vendar je bil ranljiv za 2 kritična bega iz zapora v rdeči ekipi. Ekipa je izbrala drag, a varen model zaradi pravila sprejemljivosti "kritična ugotovitev = 0" in odločitev dokumentirala.
Nasvet: Red team ni enkraten dogodek. Znova zaženite nabor napadov vsakič, ko se spremeni model, poziv ali orodja; Varnost ni stanje, ampak stalna praksa.
Pogoste napake
- Razvrstite uporabo po imenu (namesto po učinku); zamenjava visokega tveganja za nizko.
- Samo preizkušanje »srečne poti« in sploh ne preizkušanje zlorabe.
- Izvedba rdeče ekipe enkrat in je ne ponavlja po spremembah.
- Dajanje modela v proizvodnjo brez modelnega kartona in kriterijev sprejemljivosti.
- Obhod testiranja pristranskosti/diskriminacije (zlasti pri človeških odločitvah z velikimi vložki).
- Pomeni "zaprto", ne da bi opravili regresijsko testiranje po popravku.
Če povzamem
- Prvi korak je razvrstitev uporab kot nizko/srednje/visoko tveganje glede na vpliv; Intenzivnost nadzora narašča s tveganjem.
- Red teaming namerno poskuša zlomiti sistem kot napadalec; najde ranljivost pred pravim napadalcem.
- Kartica modela dokumentira namen, omejitve in tveganja modela; je podlaga za odločitev o sprejemu.
- Prehod v proizvodnjo mora biti vezan na go/no-go: natančnost, nič kritične ugotovitve, potrebno spremljanje.
- Varnost je stalna: rdeče združevanje in regresijsko testiranje se ponavljata ob vsaki spremembi.
Aplikacijska naloga
Izberite uporabo umetne inteligence, določite stopnjo tveganja na podlagi vpliva in napišite utemeljitev. Nato ustvarite vsaj 10 scenarijev napada za to uporabo (beg iz zapora, vbrizgavanje, ekstrakcija podatkov) in jih preizkusite ročno. Za vsak uspešen napad predlagajte popravek. Nazadnje izpolnite model okostja kartice in se odločite "GO/NE-GO" z razlogi.
kontrolni seznam
- [ ] Uporabo sem razvrstil glede na stopnjo tveganja glede na učinek.
- [ ] Intenzivnost nadzora sem uskladil s stopnjo tveganja.
- [ ] Pripravil sem napad rdeče ekipe in ga sistematično preizkusil.
- [ ] Popravil sem kritične ugotovitve in jih preveril z regresijskim testiranjem.
- [ ] Pripravil sem model kartice (namen, limit, zmogljivost, varnost).
- [ ] Odločitev o produkciji sem povezal z grem/ne grem.