Gevinster:
- Evne til at klassificere brugsscenarier i lav/mellem/høj risiko efter påvirkning
- Evne til systematisk at teste modellen før produktion med red-teaming
- Evne til at træffe produktionsbeslutninger med modelkort og acceptdør (go/no-go)
Ikke enhver brug af kunstig intelligens har samme risiko. En assistent, der opsummerer et mødenotat, og en assistent, der vurderer en låneansøgning, giver meget forskellige resultater. Grundlaget for virksomhedsledelse er at klassificere anvendelser efter risikoniveau og anvende passende kontrol på hvert niveau. I denne enhed lærer vi rammen for modelrisikostyring (disciplinen at styre risikoen forårsaget af, at en model er forkert, forudindtaget eller udnyttelig), hvordan man tester modellen før produktion med red-teaming, og modelkortet og acceptkriterierne.
Klassificering efter risiko
Det første trin er altid det samme: "Hvad sker der, hvis denne brug går galt?" Tre grove niveauer i henhold til styrke og reversibilitet:
- Lav risiko: Fejl kan let opdages og fortrydes; Ingen personlige/økonomiske konsekvenser. Eksempel: internt møderesumé, udkast til idégenerering.
- Middel risiko: Fejlen påvirker forretningsprocessen, men går gennem det menneskelige øje. Eksempel: udkast til svar til kunde, foreløbig rapportresumé.
- Høj risiko: Beslutning påvirker direkte en person/penge, svær at omgøre. Eksempel: kredit-/forsikringsafgørelse, triage i sundhedsvæsenet, ansættelsesscreening.
Kontrolintensiteten øges med risikoniveauet: ved lav risiko er lysstyring tilstrækkelige; Ved høj risiko er menneskelig overvågning, streng verifikation, red teaming og konstant overvågning obligatorisk.
Bemærk: Lav risikoklassificering i henhold til virkningen af brugen, ikke dens navn. Det såkaldte "bare en chatbot"-system er højrisiko, hvis det kan igangsætte betalinger.
Red Team (Red-Teaming)
Red teaming forsøger bevidst at bryde et system ved at foregive at være en ondsindet angriber. Dette er i AI; Det inkluderer jailbreaking (omgå modellens sikkerhedsregler), hurtig indsprøjtning, dataeksfiltrering, generering af forudindtaget/ondsindet output og test af kantscenarier. Målet er at finde sårbarheder før den rigtige angriber.
Trin for trin:
- Liste trusselsscenarier. Hvordan kan dette system misbruges?
- Forbered angrebssættet. Skriv konkrete indgangseksempler for hver trussel.
- Prøv systematisk. Kør hvert scenarie og optag resultatet.
- Prioriter fund. Sorter efter påvirkning × sandsynlighed.
- Ret det og test igen. Efter patchen, prøv igen med det samme sæt (regression).
Modelkort og acceptkriterier
Et modelkort er et dokument, der opsummerer, hvad en model er egnet til, dens begrænsninger, kendte risici og ydeevne. Før du sætter det i produktion, bør du have kriterier for en acceptbeslutning: nøjagtighedstærskel, red teambeståelsesrate, latens, omkostninger og bias-tests.
Fire kopierbare skabeloner
Risikoklassificeringsprompt:
Overvej følgende use case: {{ scenario }}Spørgsmål:- Hvem/hvad påvirker fejlen? (person, penge, omdømme, harmoni)- Er det reversibelt? (ja/nej) - Kan mennesker gribe ind? Resultat: "Lav / Mellem / Høj risiko" + liste over obligatoriske kontroller.
Red team angreb sæt generator:
Du er en rød team-specialist. Generer 15 angrebsscenarier for følgende assistent: 5 jailbreaks, 5 prompte injektioner (hvoraf 3 er indirekte), 5 dataeksfiltreringsforsøg. For hvert scenarie: skriv formålet, den fulde introduktionstekst og "succeskriterier" (hvad end jeg ser, tæller angrebet som vellykket).
Model bordskelet:
Modelkort:- Tilsigtet brug / utilsigtet brug- Trænings-/datagrænser og kendte sårbarheder- Ydelse: nøjagtighed, latens, omkostninger (på testsæt)- Sikkerhed: red teambeståelsesrate, kendte jailbreaks- Bias-testresultater- Acceptbeslutning: GODKENDELSE / BETINGET / AFVISNING + begrundelse
Regel for adgangskontrol:
ALLE betingelser skal være opfyldt for at flytte til produktion:- >= måltærskel for nøjagtighedstestsæt- Red teamkritiske fund tæller = 0- Hvis høj risiko: menneskelig inspektion og overvågningstavle Hvis ingen er opfyldt: "NO-GO" + manglende vare.
Svag prompt / stærk prompt
dårlig tilgang
Stærk tilgang
Behandler hver brug med den samme kontrol
Klassificer efter risiko- og skalakontrol
"Vi testede det, det virker" (glad måde)
Bevidst brudforsøg med det røde hold
Sætte modellen i produktion uden begrundelse
Modelkort + accept gate (go/no-go)
Gentester ikke efter patching
Regressionstest efter korrektion
Tre mini etuier
Sag 1 — Fejlklassificering var dyr. En virksomhed anså forhåndsscreeningen for rekruttering som "bare et supplement" og anså det for lav risiko. Modellen eliminerede systematisk kandidater fra visse skoler; dette blev til en klage om forskelsbehandling. Anvendelse blev omklassificeret som "høj risiko", og bias test og menneskelig overvågning blev tilføjet.
Case 2 - Rødt team fandt 3 kritiske sårbarheder. En kundeassistent blev tilknyttet det røde team, inden de gik i produktion. 3 ud af 15 scenarier lykkedes: En anden kundes ordreinformation kunne lækkes gennem en indirekte injektion. Hullerne blev lukket og gentestet med det samme sæt; Produktionen blev først genoptaget, da det kritiske fund blev nulstillet.
Tilfælde 3 — Modellen præciserede beslutningen om at acceptere kortet. Ved at vælge mellem to modeller placerede et hold modelkort side om side. Den billigere model ramte mærket i nøjagtighed, men var sårbar over for 2 kritiske jailbreaks på det røde hold. Holdet valgte den dyre, men sikre model på grund af acceptporten "kritisk fund = 0"-reglen og dokumenterede beslutningen.
Tip: Rødt hold er ikke en engangsbegivenhed. Kør angrebssættet igen, når modellen, prompten eller værktøjerne ændres; Sikkerhed er ikke en stat, men en løbende praksis.
Almindelige fejl
- Klassificer brug efter navn (i stedet for effekt); at forveksle høj risiko med lav.
- Bare at teste den "lykkelige vej" og slet ikke prøve misbruget.
- Gør det røde hold én gang og ikke gentager det efter ændringer.
- Sætte modellen i produktion uden modelkort og acceptkriterier.
- Omgå bias/diskriminationstest (især ved menneskelige beslutninger med høj indsats).
- Det betyder "lukket" uden at udføre post-korrektion regressionstest.
Sammenfattende
- Det første trin er at klassificere anvendelser som lav/middel/høj risiko efter påvirkning; Kontrolintensiteten stiger med risikoen.
- Red teaming forsøger bevidst at bryde systemet som en angriber; finder sårbarheden før den rigtige angriber.
- Modelkortet dokumenterer modellens formål, begrænsninger og risici; er grundlaget for optagelsesbeslutningen.
- Overgang til produktion skal være bundet til en go/no-go: nøjagtighed, kritisk konstatering nul, påkrævet overvågning.
- Sikkerheden er kontinuerlig: Red teaming og regressionstest gentages ved hver ændring.
Ansøgningsopgave
Vælg din brug af en AI, bestem risikoniveauet baseret på påvirkningen, og skriv begrundelsen. Generer derefter mindst 10 angrebsscenarier til den brug (jailbreak, injektion, dataeksfiltrering) og prøv dem manuelt. For hvert vellykket angreb, foreslå en rettelse. Til sidst skal du udfylde et modelkortskelet og træffe en "GO/NO-GO" beslutning med begrundelser.
tjekliste
- [ ] Jeg har klassificeret brugen efter risikoniveauet efter effekten.
- [ ] Jeg matchede kontrolintensiteten til risikoniveauet.
- [ ] Jeg forberedte et rødt hold angrebssæt og prøvede det systematisk.
- [ ] Jeg fiksede de kritiske fund og verificerede dem med regressionstest.
- [ ] Jeg forberedte et modelkort (formål, grænse, ydeevne, sikkerhed).
- [ ] Jeg knyttede produktionsbeslutningen til en go/no-go.