Fitimet:
- Aftësia për të klasifikuar skenarët e përdorimit në nivele të rrezikut të ulët/mesatar/të lartë sipas ndikimit
- Aftësia për të testuar sistematikisht modelin përpara prodhimit me ekipin e kuq
- Aftësia për të marrë vendime prodhimi me kartën e modelit dhe derën e pranimit (shko/no-shko)
Jo çdo përdorim i AI mbart të njëjtin rrezik. Një asistent që përmbledh një shënim takimi dhe një asistent që vlerëson një aplikim për kredi prodhojnë rezultate shumë të ndryshme. Baza e qeverisjes së korporatës është klasifikimi i përdorimeve sipas nivelit të rrezikut dhe zbatimi i kontrollit të duhur për çdo nivel. Në këtë njësi, ne do të mësojmë kuadrin e menaxhimit të rrezikut të modelit (disiplina e menaxhimit të rrezikut të shkaktuar nga një model i pasaktë, i njëanshëm ose i shfrytëzueshëm), si të testohet modeli përpara prodhimit me red-teaming, dhe kartën e modelit dhe kriteret e pranimit.
Klasifikimi sipas rrezikut
Hapi i parë është gjithmonë i njëjtë: "Çfarë ndodh nëse ky përdorim shkon keq?" Tre nivele të përafërta sipas fuqisë dhe kthyeshmërisë:
- Rrezik i ulët: Gabimi zbulohet dhe zhbëhet lehtësisht; Nuk ka pasoja personale/financiare. Shembull: përmbledhja e takimit të brendshëm, gjenerimi i projekt ideve.
- Rreziku mesatar: Gabimi ndikon në procesin e biznesit, por kalon përmes syrit të njeriut. Shembull: draft përgjigje për klientin, përmbledhje e raportit paraprak.
- Rrezik i lartë: Vendimi prek drejtpërdrejt një person/para, i vështirë për t'u kthyer. Shembull: vendimi i kredisë/sigurimit, vlerësimi i kujdesit shëndetësor, shqyrtimi i punësimit.
Intensiteti i kontrollit rritet me nivelin e rrezikut: në rrezik të ulët, kontrollet e dritës janë të mjaftueshme; Në rrezik të lartë, mbikëqyrja njerëzore, verifikimi i rreptë, grupimi i kuq dhe monitorimi i vazhdueshëm janë të detyrueshëm.
Kujdes: Bëni klasifikimin e rrezikut sipas efektit të përdorimit, jo sipas emrit të tij. Sistemi i ashtuquajtur "vetëm një chatbot" është me rrezik të lartë nëse mund të fillojë pagesat.
Ekipi i Kuq (Skuadra e Kuqe)
Skuadra e kuqe po përpiqet qëllimisht të thyejë një sistem duke pretenduar të jetë një sulmues keqdashës. Kjo është në AI; Ai përfshin jailbreaking (duke anashkaluar rregullat e sigurisë së modelit), injektimin e menjëhershëm, ekfiltrimin e të dhënave, gjenerimin e rezultateve të njëanshme/me qëllim të keq dhe skenarët e testimit. Qëllimi është të gjesh dobësi para sulmuesit të vërtetë.
Hap pas hapi:
- Listoni skenarët e kërcënimit. Si mund të abuzohet me këtë sistem?
- Përgatitni grupin e sulmit. Shkruani shembuj konkretë të hyrjes për çdo kërcënim.
- Provoni në mënyrë sistematike. Drejtoni çdo skenar dhe regjistroni rezultatin.
- Jepni përparësi gjetjeve. Rendit sipas ndikimit × probabilitetit.
- Rregullojeni dhe provoni përsëri. Pas patch-it, provoni përsëri me të njëjtin grup (regresion).
Modeli i kartës dhe kriteret e pranimit
Një kartë model është një dokument që përmbledh se për çfarë është i përshtatshëm një model, kufizimet e tij, rreziqet e njohura dhe performancën. Përpara se ta vendosni në prodhim, duhet të keni kritere për një vendim pranimi: pragu i saktësisë, shkalla e kalimit të ekipit të kuq, vonesa, kostoja dhe testet e paragjykimit.
Katër modele të kopjueshme
Klasifikimi i rrezikut të shpejtë:
Merrni parasysh rastin e mëposhtëm të përdorimit: {{ skenar }}Pyetje:- Kush/çfarë ndikon defekti? (person, para, reputacion, harmoni)- A është e kthyeshme? (po/jo) - A mund të ndërhyjnë njerëzit? Rezultati: "Rrezik i ulët / mesatar / i lartë" + lista e kontrolleve të detyrueshme.
Gjenerator i grupit të sulmit të ekipit të kuq:
Ju jeni një specialist i ekipit të kuq. Gjeneroni 15 skenarë sulmi për asistentin e mëposhtëm: 5 jailbreaks, 5 injeksione të menjëhershme (3 prej të cilave janë indirekte), 5 përpjekje për ekfiltrim të të dhënave. Për secilin skenar: shkruani qëllimin, tekstin e plotë të hyrjes dhe "kriteret e suksesit" (çfarëdo që shoh, e konsideron sulmin si të suksesshëm).
Modeli i skeletit të tabelës:
Karta e modelit:- Përdorim i synuar/përdorim i paqëllimshëm- Kufijtë e trajnimit/të dhënave dhe dobësitë e njohura- Performanca: saktësia, vonesa, kostoja (në grupin e testit)- Siguria: norma e kalimit të ekipit të kuq, jailbreaks të njohura- Rezultatet e testimit të paragjykimeve- Vendimi i pranimit: MIRATI / KUSHT / REFUZIM +
Rregulli i kontrollit të portës së hyrjes:
Duhet të plotësohen TË GJITHA kushtet për të kaluar në prodhim: - >= pragu i objektivit në grupin e testit të saktësisë - Numri i gjetjeve kritike të ekipit të kuq = 0- Nëse rreziku i lartë: bordi i inspektimit dhe monitorimit njerëzor Nëse asnjë nuk plotësohet: "NO-GO" + artikulli që mungon.
Prompt i dobët / Prompt i fortë
qasje e dobët
Qasje e fortë
Përpunimi i çdo përdorimi me të njëjtin kontroll
Klasifikoni sipas rrezikut dhe kontrollit të shkallës
"Ne e testuam atë, funksionon" (mënyrë e lumtur)
Përpjekje e qëllimshme për thyerje me skuadrën e kuqe
Vënia e modelit në prodhim pa arsyetim
Modeli i kartës + porta e pranimit (shko/mos shko)
Nuk ritestohet pas arnimit
Testi i regresionit pas korrigjimit
Tre Mini Rastet
Rasti 1 - Klasifikimi i gabuar ishte i kushtueshëm. Një kompani e konsideroi ekzaminimin paraprak të rekrutimit "thjesht një shtesë" dhe e konsideroi atë me rrezik të ulët. Modeli eliminoi sistematikisht të diplomuarit nga shkolla të caktuara; kjo u kthye në një ankesë diskriminimi. Përdorimi u riklasifikua si "rrezik i lartë" dhe u shtuan testimi i paragjykimit dhe monitorimi njerëzor.
Rasti 2 - Ekipi i Kuq gjeti 3 dobësi kritike. Një ndihmës klienti u caktua në ekipin e kuq përpara se të hynte në prodhim. 3 nga 15 skenarët ishin të suksesshëm: informacioni i porosisë së një klienti tjetër mund të zbulohej përmes një injeksioni indirekt. Boshllëqet u mbyllën dhe u ritestuan me të njëjtin grup; Prodhimi u rifillua vetëm kur gjetja kritike u rivendos.
Rasti 3 — Modeli sqaroi vendimin për pranimin e kartës. Duke zgjedhur midis dy modeleve, një ekip vendosi kartat e modeleve krah për krah. Modeli më i lirë goditi shenjën në saktësi, por ishte i prekshëm ndaj 2 jailbreaks kritike në ekipin e kuq. Ekipi zgjodhi modelin e shtrenjtë, por të sigurt për shkak të rregullit të portës së pranimit "gjetja kritike = 0" dhe dokumentoi vendimin.
Këshillë: Skuadra e kuqe nuk është një ngjarje që ndodh një herë. Ripunoni grupin e sulmeve sa herë që ndryshojnë modeli, kërkesa ose mjetet; Siguria nuk është një shtet, por një praktikë e vazhdueshme.
Gabimet e zakonshme
- Klasifikoni përdorimin sipas emrit (në vend të efektit); ngatërroni rrezikun e lartë me rrezikun e ulët.
- Vetëm duke testuar "rrugën e lumtur" dhe duke mos provuar fare abuzimin.
- Të bësh një herë skuadrën e kuqe dhe të mos e përsërisësh pas ndryshimeve.
- Vënia e modelit në prodhim pa kartë modeli dhe kritere pranimi.
- Anashkalimi i testimit të paragjykimit/diskriminimit (veçanërisht në vendimet njerëzore me aksione të larta).
- Do të thotë "i mbyllur" pa bërë testimin e regresionit pas korrigjimit.
Në përmbledhje
- Hapi i parë është klasifikimi i përdorimeve si me rrezik të ulët/mesatar/të lartë sipas ndikimit; Intensiteti i kontrollit rritet me rrezikun.
- Skuadra e kuqe po përpiqet qëllimisht të thyejë sistemin si një sulmues; gjen cenueshmërinë para sulmuesit të vërtetë.
- Karta e modelit dokumenton qëllimin, kufizimet dhe rreziqet e modelit; është baza për vendimin e pranimit.
- Tranzicioni në prodhim duhet të lidhet me një lëvizje/mos-shko: saktësia, gjetja kritike zero, monitorimi i kërkuar.
- Siguria është e vazhdueshme: ekipi i kuq dhe testimi i regresionit përsëriten me çdo ndryshim.
Detyra e aplikimit
Zgjidhni përdorimin tuaj të një AI, përcaktoni nivelin e rrezikut bazuar në ndikimin dhe shkruani justifikimin. Pastaj gjeneroni të paktën 10 skenarë sulmi për atë përdorim (jailbreak, injeksion, eksfiltrim i të dhënave) dhe provoni ato manualisht. Për çdo sulm të suksesshëm, propozoni një rregullim. Më në fund, plotësoni një skelet modeli të kartës dhe merrni një vendim "SHKO/NO-SHKO" me arsye.
listë kontrolli
- [ ] Unë e kam klasifikuar përdorimin sipas nivelit të rrezikut sipas efektit.
- [ ] Përputha intensitetin e kontrollit me nivelin e rrezikut.
- [ ] Përgatita një grup sulmi të ekipit të kuq dhe e provova në mënyrë sistematike.
- [ ] I rregullova gjetjet kritike dhe i verifikova me testimin e regresionit.
- [ ] Kam përgatitur një kartë model (qëllimi, kufiri, performanca, siguria).
- [ ] Unë e lidha vendimin e prodhimit me një shko/mos-shko.