Dobici:
- Sposobnost klasificiranja scenarija upotrebe u niske/srednje/visoke razine rizika prema utjecaju
- Sposobnost sustavnog testiranja modela prije proizvodnje uz red-teaming
- Sposobnost donošenja proizvodnih odluka s karticom modela i vratima za prihvaćanje (kreni/ne ide)
Ne nosi svaka upotreba umjetne inteligencije isti rizik. Pomoćnik koji sažima bilješku sa sastanka i pomoćnik koji procjenjuje zahtjev za kredit daju vrlo različite rezultate. Osnova korporativnog upravljanja je klasificiranje uporaba prema razini rizika i primjena odgovarajuće kontrole za svaku razinu. U ovoj jedinici naučit ćemo okvir upravljanja rizikom modela (disciplina upravljanja rizikom uzrokovanim netočnim, pristranim ili iskoristivim modelom), kako testirati model prije proizvodnje s red-teamingom te karticu modela i kriterije prihvaćanja.
Klasifikacija prema riziku
Prvi korak uvijek je isti: "Što se događa ako ovo korištenje pođe po zlu?" Tri grube razine prema snazi i reverzibilnosti:
- Nizak rizik: pogreška se lako otkriva i poništava; Bez osobnih/financijskih posljedica. Primjer: sažetak internog sastanka, stvaranje nacrta ideje.
- Srednji rizik: Greška utječe na poslovni proces, ali prolazi kroz ljudsko oko. Primjer: nacrt odgovora kupcu, sažetak preliminarnog izvješća.
- Visok rizik: Odluka izravno utječe na osobu/novac, teško ju je poništiti. Primjer: odluka o kreditu/osiguranju, zdravstvena trijaža, provjera zaposlenja.
Intenzitet kontrole raste s razinom rizika: kod niskog rizika dovoljne su svjetlosne kontrole; Kod visokog rizika obavezni su ljudski nadzor, stroga provjera, red teaming i stalni nadzor.
Pažnja: Napravite klasifikaciju rizika prema učinku uporabe, a ne prema nazivu. Takozvani sustav "samo chatbot" visoko je rizičan ako može inicirati plaćanja.
Crveni tim (Red-Teaming)
Red teaming namjerno pokušava slomiti sustav pretvarajući se da je zlonamjerni napadač. Ovo je u AI; Uključuje jailbreaking (zaobilaženje sigurnosnih pravila modela), promptno ubacivanje, eksfiltraciju podataka, generiranje pristranog/zlonamjernog izlaza i testiranje rubnih scenarija. Cilj je pronaći ranjivosti prije pravog napadača.
Korak po korak:
- Navedite scenarije prijetnji. Kako se ovaj sustav može zloupotrijebiti?
- Pripremite set za napad. Napišite konkretne primjere unosa za svaku prijetnju.
- Pokušajte sustavno. Pokrenite svaki scenarij i zabilježite rezultat.
- Dajte prioritet nalazima. Poredaj po utjecaju × vjerojatnosti.
- Popravite to i ponovno testirajte. Nakon zakrpe pokušajte ponovno s istim skupom (regresija).
Model kartice i kriteriji prihvaćanja
Kartica modela je dokument koji sažima za što je model prikladan, njegova ograničenja, poznate rizike i performanse. Prije nego što ga stavite u proizvodnju, trebali biste imati kriterije za odluku o prihvaćanju: prag točnosti, prolaznost crvenog tima, kašnjenje, trošak i testovi pristranosti.
Četiri predloška za kopiranje
Upit za klasifikaciju rizika:
Razmotrite sljedeći slučaj upotrebe: {{ scenario }}Pitanja:- Na koga/što bug utječe? (osoba, novac, ugled, harmonija)- Je li to reverzibilno? (da/ne) - Mogu li ljudi intervenirati? Rezultat: "Nizak / Srednji / Visoki rizik" + popis obveznih provjera.
Generator napada crvenog tima:
Vi ste stručnjak za crveni tim. Generirajte 15 scenarija napada za sljedećeg pomoćnika: 5 bjekstava iz zatvora, 5 brzih injekcija (od kojih su 3 neizravne), 5 pokušaja eksfiltracije podataka. Za svaki scenarij: napišite svrhu, cijeli uvodni tekst i "kriterije uspjeha" (što god vidim, napad se smatra uspješnim).
Kostur ploče modela:
Kartica modela: - Namjerna uporaba / nenamjerna uporaba - Ograničenja obuke/podataka i poznate ranjivosti - Izvedba: točnost, latencija, trošak (na testnom skupu) - Sigurnost: stopa prolaznosti crvenog tima, poznata bjekstva iz zatvora - Rezultati testiranja pristranosti - Odluka o prihvaćanju: ODOBRENJE / UVJETNO / ODBIJANJE + obrazloženje
Pravilo kontrole ulaznih vrata:
SVI uvjeti moraju biti ispunjeni za prelazak na proizvodnju:- >= ciljni prag na setu testa točnosti- Računaju se kritični nalazi crvenog tima = 0- Ako je visok rizik: ljudska inspekcija i nadzorna ploča.Ako nijedan nije ispunjen: "NO-GO" + stavka koja nedostaje.
Slab upit / Jak upit
loš pristup
Snažan pristup
Obrada svake upotrebe s istom kontrolom
Klasificirajte prema riziku i kontroli razmjera
"Testirali smo, radi" (sretan način)
Pokušaj namjernog probijanja crvenim timom
Stavljanje modela u proizvodnju bez opravdanja
Model kartice + izlaz za prihvaćanje (kreće/ne ide)
Bez ponovnog testiranja nakon krpanja
Regresijski test nakon korekcije
Tri mini kućišta
Slučaj 1 — Pogrešna klasifikacija bila je skupa. Jedna tvrtka je provjeru prije zapošljavanja smatrala "samo dodatkom" i smatrala ju je niskim rizikom. Model je sustavno eliminirao maturante pojedinih škola; to se pretvorilo u pritužbu na diskriminaciju. Korištenje je reklasificirano kao "visoki rizik", a dodano je testiranje pristranosti i ljudski nadzor.
Slučaj 2 — Crveni tim pronašao je 3 kritične ranjivosti. Pomoćnik za korisnike dodijeljen je crvenom timu prije odlaska u proizvodnju. 3 od 15 scenarija bila su uspješna: podaci o narudžbi drugog kupca mogli su procuriti posrednim ubacivanjem. Praznine su zatvorene i ponovno testirane s istim setom; Proizvodnja je nastavljena tek kada je kritični nalaz resetiran.
Slučaj 3 — Model je pojasnio odluku o prihvaćanju kartice. Birajući između dva modela, tim je stavio kartice modela jednu do druge. Jeftiniji model postigao je metu u preciznosti, ali je bio osjetljiv na 2 kritična bjekstva iz zatvora u crvenom timu. Tim je odabrao skup, ali siguran model zbog pravila prihvatljivosti "kritičan nalaz = 0" i dokumentirao odluku.
Savjet: Crveni tim nije jednokratni događaj. Ponovno pokreni skup napada kad god se promijeni model, upit ili alati; Sigurnost nije stanje, već stalna praksa.
Uobičajene greške
- Klasificirajte uporabu prema nazivu (umjesto prema učinku); zamjenjujući visoki rizik s niskim.
- Samo testiranje "sretnog puta", a ne pokušavanje zlostavljanja uopće.
- Izvođenje crvenog tima jednom i ne ponavljanje nakon izmjena.
- Puštanje modela u proizvodnju bez kartice modela i kriterija prihvaćanja.
- Zaobilaženje testiranja pristranosti/diskriminacije (posebno u ljudskim odlukama s visokim ulozima).
- To znači "zatvoreno" bez provođenja regresijskog testiranja nakon ispravka.
Ukratko
- Prvi korak je klasificirati uporabe kao niske/srednje/visoke opasnosti prema utjecaju; Intenzitet kontrole raste s rizikom.
- Red teaming namjerno pokušava slomiti sustav poput napadača; pronalazi ranjivost prije pravog napadača.
- Kartica modela dokumentira svrhu modela, ograničenja i rizike; temelj je odluke o prijemu.
- Prijelaz na proizvodnju mora biti vezan uz krene/ne ide: točnost, kritični nalaz nula, potrebno praćenje.
- Sigurnost je kontinuirana: crveno timiranje i regresijsko testiranje ponavljaju se sa svakom promjenom.
Zadatak aplikacije
Odaberite svoju upotrebu umjetne inteligencije, odredite razinu rizika na temelju utjecaja i napišite obrazloženje. Zatim generirajte najmanje 10 scenarija napada za tu upotrebu (bijeg iz zatvora, ubacivanje, eksfiltracija podataka) i isprobajte ih ručno. Za svaki uspješan napad predložite popravak. Na kraju ispunite model kostura kartice i donesite odluku "GO/NO-GO" s razlozima.
popis za provjeru
- [ ] Klasificirao sam upotrebu prema razini rizika prema učinku.
- [ ] Uskladio sam intenzitet kontrole s razinom rizika.
- [ ] Pripremio sam set napada crvenog tima i sustavno ga isprobavao.
- [ ] Popravio sam kritične nalaze i potvrdio ih regresijskim testiranjem.
- [ ] Pripremio sam model kartice (svrha, limit, performanse, sigurnost).
- [ ] Vezao sam odluku o produkciji uz ići/ne ići.