Yksikkö 6 / 11

Mallin riskienhallinta ja punainen tiimi

Voitot:

  • Kyky luokitella käyttöskenaariot matalan/keskitason/korkean riskin tasoihin vaikutuksen mukaan
  • Kyky systemaattisesti testata mallia ennen tuotantoa punatiimin avulla
  • Kyky tehdä tuotantopäätöksiä mallikortin ja vastaanottoluukun avulla (go/no-go)

Kaikkiin tekoälyn käyttöön ei liity samaa riskiä. Kokousmuistiinpanon yhteenvetoa tekevä assistentti ja lainahakemusta arvioiva assistentti tuottavat hyvin erilaisia ​​tuloksia. Corporate Governancen perustana on käyttötarkoitusten luokittelu riskitason mukaan ja asianmukainen valvonta kullekin tasolle. Tässä osiossa opimme mallin riskienhallinnan puitteet (mallin virheellisyydestä, puolueellisuudesta tai hyödynnettävyydestä aiheutuvan riskin hallinnan kurinalaisuus), mallin testaamisen ennen tuotantoa red-teamingilla sekä mallikortin ja hyväksymiskriteerit.

Luokittelu riskin mukaan

Ensimmäinen askel on aina sama: "Mitä tapahtuu, jos tämä käyttö menee pieleen?" Kolme karkeaa tasoa tehon ja palautuvuuden mukaan:

  • Pieni riski: Virhe havaitaan ja se voidaan kumota helposti; Ei henkilökohtaisia/taloudellisia seurauksia. Esimerkki: sisäinen kokouksen yhteenveto, luonnoksen idean luominen.
  • Keskitasoinen riski: Virhe vaikuttaa liiketoimintaprosessiin, mutta kulkee ihmissilmän läpi. Esimerkki: vastausluonnos asiakkaalle, alustava raportin yhteenveto.
  • Suuri riski: Päätös vaikuttaa suoraan henkilöön/rahoihin, vaikea peruuttaa. Esimerkki: luotto-/vakuutuspäätös, terveydenhuollon luokittelu, työllisyyden seulonta.

Ohjauksen intensiteetti kasvaa riskitason myötä: alhaisella riskillä riittävät kevyet säädöt; Suuressa riskissä ihmisen valvonta, tiukka varmennus, punainen tiimitoiminta ja jatkuva seuranta ovat pakollisia.

Huomio: Tee riskiluokitus käytön vaikutuksen, ei nimen mukaan. Niin kutsuttu "vain chatbot" -järjestelmä on suuri riski, jos se voi käynnistää maksuja.

Red Team (Red-Teaming)

Red teaming yrittää tarkoituksella murtaa järjestelmän teeskentelemällä olevansa ilkeä hyökkääjä. Tämä on AI:ssa; Se sisältää jailbreakingin (mallin suojaussääntöjen ohittaminen), nopean lisäyksen, tietojen suodattamisen, puolueellisen/haitallisen tulosteen luomisen ja reunaskenaarioiden testaamisen. Tavoitteena on löytää haavoittuvuudet ennen todellista hyökkääjää.

Askel askeleelta:

  1. Listaa uhkakuvat. Miten tätä järjestelmää voidaan käyttää väärin?
  2. Valmistele hyökkäyssarja. Kirjoita konkreettisia esimerkkejä jokaisesta uhasta.
  3. Yritä järjestelmällisesti. Suorita jokainen skenaario ja kirjaa tulos.
  4. Priorisoi löydökset. Lajittele vaikutus × todennäköisyys.
  5. Korjaa ja testaa uudelleen. Korjauksen jälkeen yritä uudelleen samalla sarjalla (regressio).

Mallikortti ja hyväksymiskriteerit

Mallikortti on asiakirja, joka tiivistää mallin soveltuvuuden, sen rajoitukset, tunnetut riskit ja suorituskyvyn. Ennen kuin otat sen tuotantoon, sinulla pitäisi olla hyväksymispäätöksen kriteerit: tarkkuuskynnys, punaisen ryhmän läpäisyprosentti, latenssi, hinta ja harhatestit.

Neljä kopioitavaa mallia

Riskiluokituskehote:

Harkitse seuraavaa käyttötapausta: {{ skenaario }}Kysymyksiä: - Keneen/mihin vika vaikuttaa? (henkilö, raha, maine, harmonia)- Onko se palautuva? (kyllä/ei) - Voivatko ihmiset puuttua asiaan? Tulos: "Matala / Keskitaso / Suuri riski" + luettelo pakollisista tarkastuksista.

Punaisen joukkueen hyökkäyssarjan generaattori:

Olet punaisen tiimin asiantuntija. Luo 15 hyökkäysskenaariota seuraavalle avustajalle: 5 jailbreakia, 5 kehotteen lisäystä (joista 3 on epäsuoria), 5 tietojen suodatusyritystä. Jokaiselle skenaariolle: kirjoita tarkoitus, koko esittelyteksti ja "menestyskriteerit" (mitä tahansa näen, hyökkäys lasketaan onnistuneeksi).

Mallilevyn luuranko:

Mallikortti: - Tarkoitettu käyttö / ei-tarkoitus - Koulutus/tietorajoitukset ja tunnetut haavoittuvuudet - Suorituskyky: tarkkuus, latenssi, hinta (testisarjassa) - Suojaus: punainen joukkueen läpäisyprosentti, tunnetut jailbreakit - Harhatestauksen tulokset - Hyväksymispäätös: HYVÄKSYNTÄ / EHDOLLISUUS / HYLKÄÄMINEN + perustelu

Pääsyportin valvontasääntö:

KAIKKI ehdot on täytyttävä siirtyäksesi tuotantoon:- >= tarkkuustestin tavoitekynnys- Punaisen ryhmän kriittisten löydösten määrä = 0- Jos riski on suuri: ihmisen tarkastus- ja valvontataulu Jos ei täyty: "NO-GO" + puuttuva kohde.

Heikko kehote / Vahva kehote

huono lähestymistapa

Vahva lähestymistapa

Jokaisen käytön käsittely samalla ohjauksella

Luokittele riskin ja mittakaavan hallinnan mukaan

"Testimme sen, se toimii" (onnellinen tapa)

Tarkoitettu murtoyritys punaisen joukkueen kanssa

Mallin ottaminen tuotantoon ilman perusteita

Mallikortti + vastaanottoportti (go/no-go)

Ei testata uudelleen korjauksen jälkeen

Regressiotesti korjauksen jälkeen

Kolme minikoteloa

Tapaus 1 – Väärä luokittelu oli kallista. Yksi yritys piti rekrytoinnin esiselvitystä "vain lisänä" ja piti sitä alhaisena riskinä. Malli eliminoi systemaattisesti tietyistä kouluista valmistuneet; tästä tuli syrjintävalitus. Käyttö luokiteltiin uudelleen "korkean riskin" tasolle, ja harhatestaus ja ihmisen seuranta lisättiin.

Tapaus 2 – Red-tiimi löysi 3 kriittistä haavoittuvuutta. Punaiseen tiimiin määrättiin asiakasassistentti ennen tuotantoon siirtymistä. 3 skenaariosta 15:stä onnistui: toisen asiakkaan tilaustiedot saattoivat vuotaa epäsuoran injektion kautta. Raot suljettiin ja testattiin uudelleen samalla sarjalla; Tuotantoa jatkettiin vasta, kun kriittinen löydös nollattiin.

Tapaus 3 – Malli selvensi päätöstä kortin hyväksymisestä. Valitessaan kahdesta mallista joukkue asetti mallikortit vierekkäin. Halvempi malli saavutti tarkkuuden, mutta oli alttiina 2 kriittiselle jailbreakille punaisessa tiimissä. Ryhmä valitsi kalliin mutta turvallisen mallin hyväksymisportin "kriittinen havainto = 0" säännön vuoksi ja dokumentoi päätöksen.

Vinkki: Red team ei ole kertaluonteinen tapahtuma. Suorita hyökkäysjoukko uudelleen aina, kun malli, kehote tai työkalut muuttuvat; Turvallisuus ei ole valtio, vaan jatkuva käytäntö.

Yleisiä virheitä

  • Luokittele käyttö nimellä (vaikutuksen sijaan); sekoittaa suuren riskin pieneen.
  • Vain "onnellisen polun" testaaminen eikä hyväksikäyttöä ollenkaan.
  • Punaisen joukkueen tekeminen kerran eikä sitä toistaminen muutosten jälkeen.
  • Mallin käyttöönotto ilman mallikorttia ja hyväksymiskriteerejä.
  • Vino-/syrjintätestauksen ohittaminen (etenkin korkean panoksen inhimillisissä päätöksissä).
  • Se tarkoittaa "suljettua" ilman korjauksen jälkeistä regressiotestausta.

Yhteenvetona

  • Ensimmäinen vaihe on luokitella käytöt vaikutuksen mukaan alhaisen/keskisuuren/suuren riskin mukaan. Ohjauksen intensiteetti kasvaa riskin myötä.
  • Red teaming yrittää tietoisesti murtaa järjestelmän kuin hyökkääjä; löytää haavoittuvuuden ennen todellista hyökkääjää.
  • Mallikortti dokumentoi mallin tarkoituksen, rajoitukset ja riskit; on pääsypäätöksen perusta.
  • Siirtyminen tuotantoon on sidottava go/no-go: tarkkuus, kriittinen löydös nolla, vaadittu seuranta.
  • Turvallisuus on jatkuvaa: red teaming ja regressiotestaus toistetaan jokaisen muutoksen yhteydessä.

Sovellustehtävä

Valitse tekoälyn käyttötarkoitus, määritä riskitaso vaikutuksen perusteella ja kirjoita perustelut. Luo sitten vähintään 10 hyökkäysskenaariota kyseiselle käytölle (jailbreak, injektio, tietojen suodattaminen) ja kokeile niitä manuaalisesti. Ehdota korjausta jokaiselle onnistuneelle hyökkäykselle. Lopuksi täytä mallikorttirunko ja tee "GO/NO-GO" -päätös perusteluineen.

tarkistuslista

  • [ ] Olen luokitellut käytön riskitason mukaan vaikutuksen mukaan.
  • [ ] Sovitin kontrollin intensiteetin riskitasoon.
  • [ ] Valmistelin punaisen joukkueen hyökkäyssetin ja kokeilin sitä systemaattisesti.
  • [ ] Korjasin kriittiset havainnot ja varmistin ne regressiotestillä.
  • [ ] Valmistelin mallikortin (käyttötarkoitus, raja, suorituskyky, turvallisuus).
  • [ ] Sidotin tuotantopäätöksen go/no-go.