Njësia 6 / 11

Modeli i Menaxhimit të Riskut dhe Ekipi i Kuq

Fitimet:

  • Aftësia për të klasifikuar skenarët e përdorimit në nivele të rrezikut të ulët/mesatar/të lartë sipas ndikimit
  • Aftësia për të testuar sistematikisht modelin përpara prodhimit me ekipin e kuq
  • Aftësia për të marrë vendime prodhimi me kartën e modelit dhe derën e pranimit (shko/no-shko)

Jo çdo përdorim i AI mbart të njëjtin rrezik. Një asistent që përmbledh një shënim takimi dhe një asistent që vlerëson një aplikim për kredi prodhojnë rezultate shumë të ndryshme. Baza e qeverisjes së korporatës është klasifikimi i përdorimeve sipas nivelit të rrezikut dhe zbatimi i kontrollit të duhur për çdo nivel. Në këtë njësi, ne do të mësojmë kuadrin e menaxhimit të rrezikut të modelit (disiplina e menaxhimit të rrezikut të shkaktuar nga një model i pasaktë, i njëanshëm ose i shfrytëzueshëm), si të testohet modeli përpara prodhimit me red-teaming, dhe kartën e modelit dhe kriteret e pranimit.

Klasifikimi sipas rrezikut

Hapi i parë është gjithmonë i njëjtë: "Çfarë ndodh nëse ky përdorim shkon keq?" Tre nivele të përafërta sipas fuqisë dhe kthyeshmërisë:

  • Rrezik i ulët: Gabimi zbulohet dhe zhbëhet lehtësisht; Nuk ka pasoja personale/financiare. Shembull: përmbledhja e takimit të brendshëm, gjenerimi i projekt ideve.
  • Rreziku mesatar: Gabimi ndikon në procesin e biznesit, por kalon përmes syrit të njeriut. Shembull: draft përgjigje për klientin, përmbledhje e raportit paraprak.
  • Rrezik i lartë: Vendimi prek drejtpërdrejt një person/para, i vështirë për t'u kthyer. Shembull: vendimi i kredisë/sigurimit, vlerësimi i kujdesit shëndetësor, shqyrtimi i punësimit.

Intensiteti i kontrollit rritet me nivelin e rrezikut: në rrezik të ulët, kontrollet e dritës janë të mjaftueshme; Në rrezik të lartë, mbikëqyrja njerëzore, verifikimi i rreptë, grupimi i kuq dhe monitorimi i vazhdueshëm janë të detyrueshëm.

Kujdes: Bëni klasifikimin e rrezikut sipas efektit të përdorimit, jo sipas emrit të tij. Sistemi i ashtuquajtur "vetëm një chatbot" është me rrezik të lartë nëse mund të fillojë pagesat.

Ekipi i Kuq (Skuadra e Kuqe)

Skuadra e kuqe po përpiqet qëllimisht të thyejë një sistem duke pretenduar të jetë një sulmues keqdashës. Kjo është në AI; Ai përfshin jailbreaking (duke anashkaluar rregullat e sigurisë së modelit), injektimin e menjëhershëm, ekfiltrimin e të dhënave, gjenerimin e rezultateve të njëanshme/me qëllim të keq dhe skenarët e testimit. Qëllimi është të gjesh dobësi para sulmuesit të vërtetë.

Hap pas hapi:

  1. Listoni skenarët e kërcënimit. Si mund të abuzohet me këtë sistem?
  2. Përgatitni grupin e sulmit. Shkruani shembuj konkretë të hyrjes për çdo kërcënim.
  3. Provoni në mënyrë sistematike. Drejtoni çdo skenar dhe regjistroni rezultatin.
  4. Jepni përparësi gjetjeve. Rendit sipas ndikimit × probabilitetit.
  5. Rregullojeni dhe provoni përsëri. Pas patch-it, provoni përsëri me të njëjtin grup (regresion).

Modeli i kartës dhe kriteret e pranimit

Një kartë model është një dokument që përmbledh se për çfarë është i përshtatshëm një model, kufizimet e tij, rreziqet e njohura dhe performancën. Përpara se ta vendosni në prodhim, duhet të keni kritere për një vendim pranimi: pragu i saktësisë, shkalla e kalimit të ekipit të kuq, vonesa, kostoja dhe testet e paragjykimit.

Katër modele të kopjueshme

Klasifikimi i rrezikut të shpejtë:

Merrni parasysh rastin e mëposhtëm të përdorimit: {{ skenar }}Pyetje:- Kush/çfarë ndikon defekti? (person, para, reputacion, harmoni)- A është e kthyeshme? (po/jo) - A mund të ndërhyjnë njerëzit? Rezultati: "Rrezik i ulët / mesatar / i lartë" + lista e kontrolleve të detyrueshme.

Gjenerator i grupit të sulmit të ekipit të kuq:

Ju jeni një specialist i ekipit të kuq. Gjeneroni 15 skenarë sulmi për asistentin e mëposhtëm: 5 jailbreaks, 5 injeksione të menjëhershme (3 prej të cilave janë indirekte), 5 përpjekje për ekfiltrim të të dhënave. Për secilin skenar: shkruani qëllimin, tekstin e plotë të hyrjes dhe "kriteret e suksesit" (çfarëdo që shoh, e konsideron sulmin si të suksesshëm).

Modeli i skeletit të tabelës:

Karta e modelit:- Përdorim i synuar/përdorim i paqëllimshëm- Kufijtë e trajnimit/të dhënave dhe dobësitë e njohura- Performanca: saktësia, vonesa, kostoja (në grupin e testit)- Siguria: norma e kalimit të ekipit të kuq, jailbreaks të njohura- Rezultatet e testimit të paragjykimeve- Vendimi i pranimit: MIRATI / KUSHT / REFUZIM +

Rregulli i kontrollit të portës së hyrjes:

Duhet të plotësohen TË GJITHA kushtet për të kaluar në prodhim: - >= pragu i objektivit në grupin e testit të saktësisë - Numri i gjetjeve kritike të ekipit të kuq = 0- Nëse rreziku i lartë: bordi i inspektimit dhe monitorimit njerëzor Nëse asnjë nuk plotësohet: "NO-GO" + artikulli që mungon.

Prompt i dobët / Prompt i fortë

qasje e dobët

Qasje e fortë

Përpunimi i çdo përdorimi me të njëjtin kontroll

Klasifikoni sipas rrezikut dhe kontrollit të shkallës

"Ne e testuam atë, funksionon" (mënyrë e lumtur)

Përpjekje e qëllimshme për thyerje me skuadrën e kuqe

Vënia e modelit në prodhim pa arsyetim

Modeli i kartës + porta e pranimit (shko/mos shko)

Nuk ritestohet pas arnimit

Testi i regresionit pas korrigjimit

Tre Mini Rastet

Rasti 1 - Klasifikimi i gabuar ishte i kushtueshëm. Një kompani e konsideroi ekzaminimin paraprak të rekrutimit "thjesht një shtesë" dhe e konsideroi atë me rrezik të ulët. Modeli eliminoi sistematikisht të diplomuarit nga shkolla të caktuara; kjo u kthye në një ankesë diskriminimi. Përdorimi u riklasifikua si "rrezik i lartë" dhe u shtuan testimi i paragjykimit dhe monitorimi njerëzor.

Rasti 2 - Ekipi i Kuq gjeti 3 dobësi kritike. Një ndihmës klienti u caktua në ekipin e kuq përpara se të hynte në prodhim. 3 nga 15 skenarët ishin të suksesshëm: informacioni i porosisë së një klienti tjetër mund të zbulohej përmes një injeksioni indirekt. Boshllëqet u mbyllën dhe u ritestuan me të njëjtin grup; Prodhimi u rifillua vetëm kur gjetja kritike u rivendos.

Rasti 3 — Modeli sqaroi vendimin për pranimin e kartës. Duke zgjedhur midis dy modeleve, një ekip vendosi kartat e modeleve krah për krah. Modeli më i lirë goditi shenjën në saktësi, por ishte i prekshëm ndaj 2 jailbreaks kritike në ekipin e kuq. Ekipi zgjodhi modelin e shtrenjtë, por të sigurt për shkak të rregullit të portës së pranimit "gjetja kritike = 0" dhe dokumentoi vendimin.

Këshillë: Skuadra e kuqe nuk është një ngjarje që ndodh një herë. Ripunoni grupin e sulmeve sa herë që ndryshojnë modeli, kërkesa ose mjetet; Siguria nuk është një shtet, por një praktikë e vazhdueshme.

Gabimet e zakonshme

  • Klasifikoni përdorimin sipas emrit (në vend të efektit); ngatërroni rrezikun e lartë me rrezikun e ulët.
  • Vetëm duke testuar "rrugën e lumtur" dhe duke mos provuar fare abuzimin.
  • Të bësh një herë skuadrën e kuqe dhe të mos e përsërisësh pas ndryshimeve.
  • Vënia e modelit në prodhim pa kartë modeli dhe kritere pranimi.
  • Anashkalimi i testimit të paragjykimit/diskriminimit (veçanërisht në vendimet njerëzore me aksione të larta).
  • Do të thotë "i mbyllur" pa bërë testimin e regresionit pas korrigjimit.

Në përmbledhje

  • Hapi i parë është klasifikimi i përdorimeve si me rrezik të ulët/mesatar/të lartë sipas ndikimit; Intensiteti i kontrollit rritet me rrezikun.
  • Skuadra e kuqe po përpiqet qëllimisht të thyejë sistemin si një sulmues; gjen cenueshmërinë para sulmuesit të vërtetë.
  • Karta e modelit dokumenton qëllimin, kufizimet dhe rreziqet e modelit; është baza për vendimin e pranimit.
  • Tranzicioni në prodhim duhet të lidhet me një lëvizje/mos-shko: saktësia, gjetja kritike zero, monitorimi i kërkuar.
  • Siguria është e vazhdueshme: ekipi i kuq dhe testimi i regresionit përsëriten me çdo ndryshim.

Detyra e aplikimit

Zgjidhni përdorimin tuaj të një AI, përcaktoni nivelin e rrezikut bazuar në ndikimin dhe shkruani justifikimin. Pastaj gjeneroni të paktën 10 skenarë sulmi për atë përdorim (jailbreak, injeksion, eksfiltrim i të dhënave) dhe provoni ato manualisht. Për çdo sulm të suksesshëm, propozoni një rregullim. Më në fund, plotësoni një skelet modeli të kartës dhe merrni një vendim "SHKO/NO-SHKO" me arsye.

listë kontrolli

  • [ ] Unë e kam klasifikuar përdorimin sipas nivelit të rrezikut sipas efektit.
  • [ ] Përputha intensitetin e kontrollit me nivelin e rrezikut.
  • [ ] Përgatita një grup sulmi të ekipit të kuq dhe e provova në mënyrë sistematike.
  • [ ] I rregullova gjetjet kritike dhe i verifikova me testimin e regresionit.
  • [ ] Kam përgatitur një kartë model (qëllimi, kufiri, performanca, siguria).
  • [ ] Unë e lidha vendimin e prodhimit me një shko/mos-shko.