Dobici:
- Sposobnost klasificiranja scenarija upotrebe u niske/srednje/visoke nivoe rizika prema uticaju
- Sposobnost sistematskog testiranja modela prije proizvodnje uz red-teaming
- Sposobnost donošenja odluka o proizvodnji sa modelom kartice i prijemnim vratima (idi/ne-idi)
Ne nosi svaka upotreba AI isti rizik. Asistent koji sažima belešku sa sastanka i asistent koji ocenjuje zahtev za kredit daju veoma različite rezultate. Osnova korporativnog upravljanja je klasifikovati upotrebu prema nivou rizika i primeniti odgovarajuću kontrolu za svaki nivo. U ovoj cjelini naučit ćemo okvir upravljanja rizikom modela (disciplina upravljanja rizikom uzrokovanim netačnim, pristranim ili eksploatativnim modelom), kako testirati model prije proizvodnje uz red-teaming, te karticu modela i kriterije prihvatljivosti.
Klasifikacija prema riziku
Prvi korak je uvijek isti: "Šta će se dogoditi ako ova upotreba krene po zlu?" Tri gruba nivoa prema snazi i reverzibilnosti:
- Nizak rizik: Greška se lako otkriva i poništava; Bez ličnih/finansijskih posljedica. Primjer: sažetak internog sastanka, generiranje nacrta ideje.
- Srednji rizik: Greška utiče na poslovni proces, ali prolazi kroz ljudsko oko. Primjer: nacrt odgovora kupcu, preliminarni sažetak izvještaja.
- Visok rizik: Odluka direktno utiče na osobu/novac, teško je preokrenuti. Primjer: odluka o kreditu/osiguranju, trijaža zdravstvene zaštite, provjera zapošljavanja.
Intenzitet kontrole raste sa nivoom rizika: pri niskom riziku dovoljne su kontrole svetla; Kod visokog rizika, ljudski nadzor, stroga verifikacija, crveni tim i stalni nadzor su obavezni.
Pažnja: Klasifikujte rizik prema učinku upotrebe, a ne prema nazivu. Takozvani sistem "samo chatbot" je visok rizik ako može pokrenuti plaćanja.
Crveni tim (crveni tim)
Crveni tim namerno pokušava da razbije sistem pretvarajući se da je zlonamerni napadač. Ovo je u AI; Uključuje jailbreaking (zaobilaženje sigurnosnih pravila modela), promptnu injekciju, eksfiltraciju podataka, generiranje pristrasnog/zlonamjernog izlaza i testiranje ivica scenarija. Cilj je pronaći ranjivosti prije pravog napadača.
Korak po korak:
- Navedite scenarije prijetnji. Kako se ovaj sistem može zloupotrebiti?
- Pripremite set za napad. Napišite konkretne primjere unosa za svaku prijetnju.
- Pokušajte sistematski. Pokrenite svaki scenarij i zabilježite rezultat.
- Dajte prioritet nalazima. Poredaj po uticaju × vjerovatnoći.
- Popravite i testirajte ponovo. Nakon zakrpe, pokušajte ponovo sa istim setom (regresija).
Model kartice i kriteriji prihvatanja
Kartica modela je dokument koji sumira za šta je model pogodan, njegova ograničenja, poznate rizike i performanse. Prije nego što ga stavite u proizvodnju, trebali biste imati kriterije za odluku o prihvatanju: prag tačnosti, prolaznost crvenog tima, kašnjenje, trošak i testove pristranosti.
Četiri predloška koji se mogu kopirati
Uputa za klasifikaciju rizika:
Razmotrite sljedeći slučaj upotrebe: {{ scenario }}Pitanja:- Na koga/šta utiče greška? (osoba, novac, reputacija, harmonija) - Da li je to reverzibilno? (da/ne) - Mogu li ljudi intervenirati? Rezultat: "Nizak / Srednji / Visok rizik" + lista obaveznih provjera.
Generator skupa napada crvenog tima:
Vi ste specijalista crvenog tima. Generirajte 15 scenarija napada za sljedećeg pomoćnika: 5 jailbreakova, 5 brzih injekcija (od kojih su 3 indirektne), 5 pokušaja eksfiltracije podataka. Za svaki scenario: napišite svrhu, cijeli uvodni tekst i "kriterijume uspjeha" (šta god da vidim, napad se računa kao uspješan).
Model skeleta ploče:
Kartica modela:- Namjerna upotreba / nenamjerna upotreba- Ograničenja obuke/podataka i poznate ranjivosti- Performanse: tačnost, kašnjenje, cijena (na testnom setu)- Sigurnost: prolaznost crvenog tima, poznati bekstvo iz zatvora- Rezultati testiranja pristranosti- Odluka o prihvatanju: ODOBRENJE / USLOVI / ODBIJANJE + opravdanje
Pravilo kontrole ulaznih vrata:
SVI uslovi moraju biti ispunjeni da bi se prešlo u proizvodnju:- >= ciljni prag na setu za testiranje tačnosti- Broj kritičnih nalaza crvenog tima = 0- Ako je visok rizik: ljudska inspekcija i ploča za nadzor Ako nijedan nije ispunjen: "NO-GO" + stavka koja nedostaje.
Slaba prompt / jaka prompt
loš pristup
Snažan pristup
Obrada svake upotrebe sa istom kontrolom
Klasificirajte prema riziku i kontroli obima
"Testirali smo, radi" (sretan način)
Namjeran pokušaj prekida sa crvenim timom
Stavljanje modela u proizvodnju bez opravdanja
Model kartice + kapija za prihvatanje (idi/ne-idi)
Bez ponovnog testiranja nakon zakrpe
Regresijski test nakon korekcije
Tri mini futrole
Slučaj 1 — Pogrešna klasifikacija je bila skupa. Jedna kompanija je smatrala da je prethodna selekcija zapošljavanja "samo dodatak" i smatrala je da je nizak rizik. Model je sistematski eliminisao maturante iz određenih škola; ovo se pretvorilo u tužbu za diskriminaciju. Upotreba je reklasifikovana kao “visoki rizik” i dodano je testiranje pristranosti i ljudski monitoring.
Slučaj 2 — Crveni tim je pronašao 3 kritične ranjivosti. Asistent za kupce je dodijeljen crvenom timu prije početka proizvodnje. 3 od 15 scenarija su bila uspješna: informacije o narudžbi drugog kupca mogle su procuriti putem indirektnog ubrizgavanja. Praznine su zatvorene i ponovo testirane istim setom; Proizvodnja je nastavljena tek kada je kritični nalaz resetovan.
Slučaj 3 — Model je pojasnio odluku o prihvatanju kartice. Birajući između dva modela, tim je postavio kartice modela jednu pored druge. Jeftiniji model je pogodio tačnost, ali je bio ranjiv na 2 kritična bekstva iz zatvora za crveni tim. Tim je odabrao skup, ali siguran model zbog pravila prihvatanja "kritični nalaz = 0" i dokumentovao odluku.
Savjet: Crveni tim nije jednokratni događaj. Ponovo pokrenite skup napada kad god se promijeni model, prompt ili alati; Sigurnost nije stanje, već stalna praksa.
Uobičajene greške
- Klasificirati upotrebu po imenu (a ne efektu); greškom visokog rizika za niski.
- Samo testiram “srećnu stazu” i uopće ne pokušavam zlostavljati.
- Raditi crveni tim jednom i ne ponavljati ga nakon promjena.
- Stavljanje modela u proizvodnju bez kartice modela i kriterija prihvatanja.
- Zaobilaženje testiranja pristrasnosti/diskriminacije (posebno u ljudskim odlukama sa visokim ulozima).
- To znači "zatvoreno" bez regresijskog testiranja nakon korekcije.
Ukratko
- Prvi korak je klasifikovati upotrebu kao nizak/srednji/visoki rizik prema uticaju; Intenzitet kontrole raste sa rizikom.
- Crveni tim namerno pokušava da razbije sistem kao napadač; pronalazi ranjivost pred pravim napadačem.
- Model kartica dokumentuje svrhu modela, ograničenja i rizike; je osnova za odluku o prijemu.
- Prelazak na proizvodnju mora biti vezan za idi/ne-go: tačnost, kritični nalaz nula, potrebno praćenje.
- Sigurnost je kontinuirana: crveno udruživanje i testiranje regresije se ponavljaju sa svakom promjenom.
Zadatak aplikacije
Odaberite svoju upotrebu AI, odredite nivo rizika na osnovu uticaja i napišite obrazloženje. Zatim generirajte najmanje 10 scenarija napada za tu upotrebu (jailbreak, injekcija, eksfiltracija podataka) i isprobajte ih ručno. Za svaki uspješan napad predložite rješenje. Konačno, ispunite model skeleta kartice i donesite odluku "GO/NE-GO" s razlozima.
kontrolna lista
- [ ] Klasifikovao sam upotrebu prema nivou rizika prema učinku.
- [ ] Usporedio sam intenzitet kontrole sa nivoom rizika.
- [ ] Pripremio sam napad crvenog tima i pokušao ga sistematski.
- [ ] Popravio sam kritične nalaze i potvrdio ih regresijskim testiranjem.
- [ ] Pripremio sam model kartice (svrha, ograničenje, performanse, sigurnost).
- [ ] Odluku o proizvodnji vezao sam za idi/ne-idi.