Добици:
- Способност да се сценарији коришћења класификују на ниске/средње/високе нивое ризика према утицају
- Способност систематског тестирања модела пре производње уз ред-тиминг
- Способност доношења одлука о производњи са моделом картице и пријемним вратима (иди/не-иди)
Не носи свака употреба вештачке интелигенције исти ризик. Асистент који резимира белешку са састанка и асистент који оцењује захтев за кредит дају веома различите резултате. Основа корпоративног управљања је класификовати коришћење према нивоу ризика и применити одговарајућу контролу за сваки ниво. У овој јединици ћемо научити оквир управљања ризиком модела (дисциплина управљања ризиком узрокованим нетачним, пристрасним или експлоатационим моделом), како тестирати модел пре производње са ред-тимингом, као и картицу модела и критеријуме прихватања.
Класификација према ризику
Први корак је увек исти: „Шта се дешава ако ова употреба крене наопако?“ Три груба нивоа према снази и реверзибилности:
- Низак ризик: Грешка се лако открива и поништава; Без личних/финансијских последица. Пример: резиме интерног састанка, генерисање нацрта идеје.
- Средњи ризик: Грешка утиче на пословни процес, али пролази кроз људско око. Пример: нацрт одговора купцу, прелиминарни сажетак извештаја.
- Висок ризик: Одлука директно утиче на особу/новац, тешко је преокренути. Пример: одлука о кредиту/осигурању, тријажа здравствене заштите, скрининг запошљавања.
Интензитет контроле се повећава са нивоом ризика: при ниском ризику довољне су контроле светла; Код високог ризика, људски надзор, строга верификација, црвени тим и стално праћење су обавезни.
Пажња: Класификујте ризик према ефекту употребе, а не према називу. Такозвани систем "само цхатбот" је висок ризик ако може да покрене плаћања.
Црвени тим (црвени тим)
Црвени тим намерно покушава да разбије систем претварајући се да је злонамерни нападач. Ово је у АИ; Укључује јаилбреакинг (заобилажење безбедносних правила модела), промптну ињекцију, ексфилтрацију података, генерисање пристрасног/злонамерног излаза и тестирање ивица сценарија. Циљ је пронаћи рањивости пред правим нападачем.
корак по корак:
- Наведите сценарије претњи. Како се овај систем може злоупотребити?
- Припремите сет за напад. Напишите конкретне примере уноса за сваку претњу.
- Покушајте систематски. Покрените сваки сценарио и забележите резултат.
- Дајте приоритет налазима. Сортирај према утицају × вероватноћи.
- Поправите и тестирајте поново. Након закрпе, покушајте поново са истим сетом (регресија).
Модел картице и критеријуми прихватања
Картица модела је документ који резимира за шта је модел погодан, његова ограничења, познате ризике и перформансе. Пре него што га ставите у производњу, требало би да имате критеријуме за одлуку о прихватању: праг тачности, пролазност црвеног тима, кашњење, цену и тестове пристрасности.
Четири шаблона за копирање
Упозорење за класификацију ризика:
Размотрите следећи случај употребе: {{ сценарио }}Питања:- На кога/шта утиче грешка? (особа, новац, углед, хармонија)- Да ли је то реверзибилно? (да/не) - Могу ли људи да интервенишу? Резултат: "Низак / Средњи / Висок ризик" + листа обавезних провера.
Генератор скупа напада црвеног тима:
Ви сте специјалиста црвеног тима. Генеришите 15 сценарија напада за следећег помоћника: 5 бекства из затвора, 5 брзих ињекција (од којих су 3 индиректне), 5 покушаја ексфилтрације података. За сваки сценарио: напишите сврху, цео уводни текст и „критеријуме успеха“ (шта год да видим, напад се рачуна као успешан).
Модел скелета плоче:
Картица модела: - Наменска употреба / ненаменска употреба - Ограничења за обуку/податке и познате рањивости - Перформансе: тачност, кашњење, цена (на тест сету) - Безбедност: пролазност црвеног тима, познато бекство из затвора - Резултати тестирања пристрасности - Одлука о прихватању: ОДОБРЕЊЕ / УСЛОВИ / ОДБИЈАЊЕ + оправдање
Правило контроле улазне капије:
СВИ услови морају бити испуњени да би се прешло у производњу:- >= циљни праг на сету за тестирање тачности- Број критичних налаза црвеног тима = 0- Ако је висок ризик: одбор за инспекцију и надзор од стране људи Ако ниједан није испуњен: "НЕ-ГО" + ставка која недостаје.
Слаба порука / јака промпт
лош приступ
Снажан приступ
Обрада сваке употребе са истом контролом
Класификујте према ризику и контроли обима
"Тестирали смо, ради" (срећан начин)
Намеран покушај брејка са црвеним тимом
Стављање модела у производњу без оправдања
Модел картице + капија за прихватање (иди/не-иди)
Без поновног тестирања након закрпе
Регресиони тест након корекције
Три мини кућишта
Случај 1 — Погрешна класификација је била скупа. Једна компанија је сматрала да је претходна селекција запошљавања „само помоћна” и сматрала је да је низак ризик. Модел је систематски елиминисао матуранте из одређених школа; ово се претворило у тужбу за дискриминацију. Употреба је рекласификована као „високо ризична“ и додато је тестирање пристрасности и праћење људи.
Случај 2 — Црвени тим је пронашао 3 критичне рањивости. Асистент за купце је додељен црвеном тиму пре него што је кренуо у производњу. 3 од 15 сценарија су била успешна: информације о поруџбини другог купца могле су да процуре кроз индиректно убризгавање. Празнине су затворене и поново тестиране истим сетом; Производња је настављена тек када је критични налаз ресетован.
Случај 3 — Модел је појаснио одлуку о прихватању картице. Бирајући између два модела, тим је поставио картице модела једну поред друге. Јефтинији модел је погодио тачност, али је био рањив на 2 критична бекства из затвора за црвени тим. Тим је изабрао скуп, али безбедан модел због правила прихватања „критични налаз = 0“ и документовао одлуку.
Савет: Црвени тим није једнократни догађај. Поново покрените скуп напада кад год се промени модел, промпт или алати; Безбедност није стање, већ стална пракса.
Уобичајене грешке
- Класификовати употребу по имену (а не по ефекту); грешком високог ризика за низак.
- Само тестирам „срећну стазу“ и уопште не покушавам злостављање.
- Радити црвени тим једном и не понављати га након промена.
- Пуштање модела у производњу без картице модела и критеријума прихватања.
- Заобилажење тестирања пристрасности/дискриминације (нарочито у људским одлукама са високим улозима).
- То значи "затворено" без вршења регресионог тестирања након корекције.
Укратко
- Први корак је класификовати употребу као низак/средњи/високи ризик према утицају; Интензитет контроле расте са ризиком.
- Црвени тим намерно покушава да разбије систем као нападач; проналази рањивост пред правим нападачем.
- Картица модела документује сврху модела, ограничења и ризике; је основ за одлуку о пријему.
- Прелазак на производњу мора бити везан за иди/не-иди: тачност, критични налаз нула, потребно праћење.
- Сигурност је континуирана: црвено удруживање и тестирање регресије се понављају са сваком променом.
Задатак апликације
Изаберите своју употребу АИ, одредите ниво ризика на основу утицаја и напишите образложење. Затим генеришете најмање 10 сценарија напада за ту употребу (бекство из затвора, убризгавање, ексфилтрација података) и испробајте их ручно. За сваки успешан напад предложите решење. Коначно, попуните модел скелета картице и донесите одлуку „ГО/НЕ-ГО“ са разлозима.
контролна листа
- [ ] Класификовао сам употребу према нивоу ризика према ефекту.
- [ ] Упарио сам интензитет контроле са нивоом ризика.
- [ ] Припремио сам напад црвеног тима и покушао га систематски.
- [ ] Поправио сам критичне налазе и верификовао их регресионим тестирањем.
- [ ] Припремио сам модел картице (сврха, ограничење, перформансе, безбедност).
- [ ] Одлуку о производњи везао сам за иди/не-иди.