Pelnas:
- Galimybė klasifikuoti naudojimo scenarijus į mažos/vidutinės/didelės rizikos lygius pagal poveikį
- Galimybė sistemingai išbandyti modelį prieš pradedant gamybą naudojant raudonąją komandą
- Galimybė priimti gamybos sprendimus su modelio kortele ir priėmimo durelėmis (eiti / ne)
Ne kiekvienas AI naudojimas kelia tą pačią riziką. Asistentas, apibendrinantis susitikimo pastabą, ir padėjėjas, vertinantis paskolos paraišką, duoda labai skirtingus rezultatus. Bendrovės valdymo pagrindas yra klasifikuoti naudojimo būdus pagal rizikos lygį ir kiekvienam lygiui taikyti tinkamą kontrolę. Šiame skyriuje mokysimės modelio rizikos valdymo sistemos (netinkamo, šališko ar išnaudojamo modelio sukeltos rizikos valdymo disciplinos), kaip išbandyti modelį prieš pradedant gamybą naudojant red-teaming, modelio kortelę ir priėmimo kriterijus.
Klasifikavimas pagal riziką
Pirmas žingsnis visada yra tas pats: „Kas nutiks, jei šis naudojimas bus netinkamas? Trys grubūs lygiai pagal stiprumą ir grįžtamumą:
- Maža rizika: klaida lengvai aptinkama ir atšaukiama; Jokių asmeninių/finansinių pasekmių. Pavyzdys: vidinio susitikimo santrauka, idėjos juodraščio generavimas.
- Vidutinė rizika: klaida turi įtakos verslo procesui, bet praeina pro žmogaus akis. Pavyzdys: atsakymo klientui projektas, preliminari ataskaitos santrauka.
- Didelė rizika: sprendimas tiesiogiai veikia asmenį / pinigus, sunku jį atšaukti. Pavyzdys: sprendimas dėl kredito / draudimo, sveikatos priežiūros skirstymas, užimtumo patikra.
Valdymo intensyvumas didėja didėjant rizikos lygiui: esant mažai rizikai, pakanka šviesos valdymo priemonių; Esant didelei rizikai, žmogaus priežiūra, griežta patikra, raudonųjų komandų sudarymas ir nuolatinis stebėjimas yra privalomi.
Dėmesio: klasifikuokite riziką pagal naudojimo poveikį, o ne pavadinimą. Vadinamoji „tiesiog pokalbių roboto“ sistema yra didelė rizika, jei ji gali inicijuoti mokėjimus.
Raudonoji komanda („Red-Teaming“)
Raudonoji komanda tyčia bando sugriauti sistemą, apsimesdama piktavališku užpuoliku. Tai yra AI; Tai apima įsilaužimą į jail (apeiti modelio saugos taisykles), greitą įterpimą, duomenų išfiltravimą, šališkos / kenkėjiškos išvesties generavimą ir pažangių scenarijų testavimą. Tikslas yra rasti pažeidžiamumą prieš tikrąjį užpuoliką.
Žingsnis po žingsnio:
- Išvardykite grėsmių scenarijus. Kaip galima piktnaudžiauti šia sistema?
- Paruoškite puolimo rinkinį. Parašykite konkrečius kiekvienos grėsmės įvedimo pavyzdžius.
- Stenkitės sistemingai. Vykdykite kiekvieną scenarijų ir užrašykite rezultatą.
- Suteikite pirmenybę išvadoms. Rūšiuoti pagal poveikį × tikimybę.
- Pataisykite ir išbandykite dar kartą. Po pataisos bandykite dar kartą su tuo pačiu rinkiniu (regresija).
Modelio kortelė ir priėmimo kriterijai
Modelio kortelė – tai dokumentas, kuriame apibendrinama, kam modelis tinkamas, jo apribojimai, žinomos rizikos ir našumas. Prieš pradėdami gaminti, turėtumėte turėti priėmimo sprendimo kriterijus: tikslumo slenkstį, raudonosios komandos išlaikymo rodiklį, delsą, kainą ir šališkumo testus.
Keturi kopijuojami šablonai
Rizikos klasifikavimo raginimas:
Apsvarstykite šį naudojimo atvejį: {{ scenarijus }}Klausimai: – kam/ką veikia klaida? (asmuo, pinigai, reputacija, harmonija) – ar tai grįžtama? (taip/ne) – Ar žmonės gali įsikišti? Rezultatas: „Maža / Vidutinė / Didelė rizika“ + privalomų patikrų sąrašas.
Raudonosios komandos atakų rinkinio generatorius:
Esate raudonosios komandos specialistas. Sugeneruokite 15 atakų scenarijų šiam asistentui: 5 įsilaužimai į kalėjimą, 5 skubios injekcijos (3 iš jų netiesioginės), 5 bandymai išfiltruoti duomenis. Kiekvienam scenarijui: parašykite tikslą, visą įžangos tekstą ir „sėkmės kriterijus“ (viską, ką matau, ataka laikoma sėkminga).
Modelio lentos skeletas:
Modelio kortelė: - Numatytas naudojimas / nenumatytas naudojimas - Mokymas / duomenų ribos ir žinomi pažeidžiamumai - Našumas: tikslumas, delsa, kaina (bandymo rinkinyje) - Saugumas: raudonos komandos praėjimo rodiklis, žinomi nelaimingi atsitikimai - Šališkumo testavimo rezultatai - Priėmimo sprendimas: PATVIRTINIMAS / SĄLYGOS / ATMETIMAS + pagrindimas
Įėjimo vartų kontrolės taisyklė:
Turi būti įvykdytos VISOS sąlygos, kad būtų galima pereiti prie gamybos:- >= tikslinė tikslumo bandymo slenkstis- Raudonosios komandos kritinių išvadų skaičius = 0- Jei didelė rizika: žmogaus tikrinimo ir stebėjimo lenta Jei neįvykdoma: „NO-GO“ + trūkstamas elementas.
Silpnas raginimas / stiprus raginimas
prastas požiūris
Stiprus požiūris
Apdorojamas kiekvienas naudojimas naudojant tą patį valdiklį
Klasifikuokite pagal riziką ir masto kontrolę
„Išbandėme, tai veikia“ (laimingas būdas)
Sąmoningas bandymas prasiveržti su raudonąja komanda
Modelio paleidimas į gamybą be pagrindo
Kortelės modelio + priėmimo vartai (eiti / ne)
Po pataisymo pakartotinai nebandoma
Regresijos testas po korekcijos
Trys mini dėklai
1 atvejis – neteisingas klasifikavimas kainavo brangiai. Viena įmonė išankstinį įdarbinimo patikrinimą laikė „tik priedu“ ir manė, kad tai yra nedidelė rizika. Modelis sistemingai eliminavo kai kurių mokyklų absolventus; tai virto skundu dėl diskriminacijos. Naudojimas buvo perklasifikuotas kaip „didelės rizikos“, buvo pridėtas šališkumo bandymas ir žmogaus stebėjimas.
2 atvejis – Raudonoji komanda rado 3 svarbius pažeidžiamumus. Prieš pradedant gamybą raudonajai komandai buvo paskirtas klientų padėjėjas. 3 iš 15 scenarijų buvo sėkmingi: kito kliento užsakymo informacija galėjo būti nutekinta per netiesioginę injekciją. Tarpai buvo uždaryti ir pakartotinai išbandyti su tuo pačiu rinkiniu; Gamyba buvo atnaujinta tik tada, kai buvo iš naujo nustatyta kritinė išvada.
3 atvejis. Modelis paaiškino sprendimą priimti kortelę. Pasirinkusi vieną iš dviejų modelių, komanda padėjo modelių korteles vienas šalia kito. Pigesnis modelis pasiekė tikslą, tačiau buvo pažeidžiamas 2 kritiniais raudonosios komandos įsilaužimais. Komanda pasirinko brangų, bet saugų modelį dėl priėmimo vartų taisyklės „kritinis atradimas = 0“ ir dokumentavo sprendimą.
Patarimas: Raudonoji komanda nėra vienkartinis renginys. Iš naujo paleiskite atakų rinkinį, kai pasikeičia modelis, raginimas ar įrankiai; Saugumas – ne valstybė, o nuolatinė praktika.
Dažnos klaidos
- Klasifikuokite naudojimą pagal pavadinimą (o ne poveikį); supainioti didelę riziką su maža.
- Tik išbandyti „laimingą kelią“ ir visai nebandyti piktnaudžiavimo.
- Padaryti raudonąją komandą vieną kartą ir nekartoti po pasikeitimų.
- Modelio paleidimas į gamybą be modelio kortelės ir priėmimo kriterijų.
- Apeiti šališkumo / diskriminacijos testus (ypač priimant didelius žmonių sprendimus).
- Tai reiškia „uždaryta“, neatlikus pokorekcinio regresijos testo.
Apibendrinant
- Pirmas žingsnis yra klasifikuoti naudojimo būdus į mažą/vidutinę/didelę riziką pagal poveikį; Kontrolės intensyvumas didėja didėjant rizikai.
- Raudonoji komanda sąmoningai bando sugriauti sistemą kaip užpuolikas; randa pažeidžiamumą prieš tikrąjį užpuoliką.
- Modelio kortelė dokumentuoja modelio paskirtį, apribojimus ir riziką; yra sprendimo dėl priėmimo pagrindas.
- Perėjimas prie gamybos turi būti susietas su eiti / ne: tikslumas, kritinis radinys nulis, reikalingas stebėjimas.
- Saugumas yra nuolatinis: raudonasis komandų sudarymas ir regresijos testai kartojami su kiekvienu pakeitimu.
Taikymo užduotis
Pasirinkite dirbtinio intelekto naudojimą, pagal poveikį nustatykite rizikos lygį ir parašykite pagrindimą. Tada sugeneruokite bent 10 atakos scenarijų tam naudojimui (įsilaužimas, įpurškimas, duomenų išfiltravimas) ir išbandykite juos rankiniu būdu. Kiekvienai sėkmingai atakai pasiūlykite pataisą. Galiausiai užpildykite modelio kortelės skeletą ir priimkite sprendimą „GO/NO-GO“ su motyvais.
kontrolinis sąrašas
- [ ] Naudojimą klasifikavau pagal rizikos lygį pagal poveikį.
- [ ] Kontrolės intensyvumą pritaikiau prie rizikos lygio.
- [ ] Paruošiau raudonosios komandos puolimo setą ir sistemingai išbandžiau.
- [ ] Ištaisiau kritines išvadas ir patikrinau jas regresijos testu.
- [ ] Parengiau modelio kortelę (paskirtis, limitas, našumas, saugumas).
- [ ] Gamybos sprendimą susiejau su eiti/neeiti.