Mga nadagdag:
- Kakayahang pag-uri-uriin ang mga sitwasyon ng paggamit sa mababang/katamtaman/mataas na antas ng panganib ayon sa epekto
- Kakayahang sistematikong subukan ang modelo bago ang produksyon na may red-teaming
- Kakayahang gumawa ng mga desisyon sa produksyon gamit ang model card at acceptance door (go/no-go)
Hindi lahat ng paggamit ng AI ay nagdadala ng parehong panganib. Ang isang katulong na nagbubuod ng isang tala sa pagpupulong at isang katulong na nagsusuri ng isang loan application ay nagbubunga ng ibang mga resulta. Ang batayan ng corporate governance ay ang pag-uuri ng mga gamit ayon sa antas ng panganib at ilapat ang naaangkop na kontrol sa bawat antas. Sa unit na ito, malalaman natin ang balangkas ng pamamahala sa panganib ng modelo (ang disiplina sa pamamahala sa panganib na dulot ng pagiging mali, bias o mapagsamantalang modelo), kung paano subukan ang modelo bago ang produksyon na may red-teaming, at ang modelong card at pamantayan sa pagtanggap.
Pag-uuri ayon sa Panganib
Ang unang hakbang ay palaging pareho: "Ano ang mangyayari kung mali ang paggamit na ito?" Tatlong magaspang na antas ayon sa potency at reversibility:
- Mababang panganib: Ang error ay madaling matukoy at maaalis; Walang personal/pinansyal na kahihinatnan. Halimbawa: buod ng panloob na pulong, pagbuo ng draft ng ideya.
- Katamtamang panganib: Ang error ay nakakaapekto sa proseso ng negosyo ngunit dumadaan sa mata ng tao. Halimbawa: draft na tugon sa customer, paunang buod ng ulat.
- Mataas na panganib: Ang desisyon ay direktang nakakaapekto sa isang tao/pera, mahirap baligtarin. Halimbawa: desisyon sa kredito/insurance, triage sa pangangalagang pangkalusugan, pagsusuri sa trabaho.
Ang intensity ng kontrol ay tumataas sa antas ng panganib: sa mababang panganib, ang mga kontrol sa liwanag ay sapat; Sa mataas na panganib, ang pangangasiwa ng tao, mahigpit na pag-verify, red teaming at patuloy na pagsubaybay ay sapilitan.
Pansin: Gumawa ng pag-uuri ng panganib ayon sa epekto ng paggamit, hindi ang pangalan nito. Ang tinatawag na "just a chatbot" system ay mataas ang panganib kung ito ay makapagpasimula ng mga pagbabayad.
Red Team (Red-Teaming)
Sadyang sinusubukan ng Red teaming na sirain ang isang sistema sa pamamagitan ng pagpapanggap na isang malisyosong umaatake. Ito ay nasa AI; Kabilang dito ang jailbreaking (pag-bypass sa mga panuntunang panseguridad ng modelo), agarang pag-iniksyon, pag-exfiltrate ng data, pagbuo ng bias/malisyosong output, at mga pagsubok sa gilid ng mga sitwasyon. Ang layunin ay upang mahanap ang mga kahinaan bago ang tunay na umaatake.
Hakbang-hakbang:
- Maglista ng mga senaryo ng pagbabanta. Paano maaabuso ang sistemang ito?
- Ihanda ang set ng pag-atake. Sumulat ng mga halimbawa ng konkretong entry para sa bawat pagbabanta.
- Subukang sistematiko. Patakbuhin ang bawat senaryo at itala ang resulta.
- Unahin ang mga natuklasan. Pagbukud-bukurin ayon sa epekto × posibilidad.
- Ayusin ito at subukan muli. Pagkatapos ng patch, subukang muli gamit ang parehong set (regression).
Model Card at Pamantayan sa Pagtanggap
Ang modelong card ay isang dokumentong nagbubuod kung para saan ang isang modelo, mga limitasyon nito, alam na mga panganib at pagganap. Bago mo ito ilagay sa produksyon, dapat ay mayroon kang pamantayan para sa isang desisyon sa pagtanggap: threshold ng katumpakan, rate ng pagpasa ng red team, latency, gastos, at mga pagsubok sa bias.
Apat na Nakokopyang Template
Prompt sa pag-uuri ng panganib:
Isaalang-alang ang sumusunod na kaso ng paggamit: {{ senaryo }}Mga Tanong:- Sino/ano ang naaapektuhan ng bug? (tao, pera, reputasyon, pagkakaisa)- Nababaligtad ba ito? (oo/hindi) - Maaari bang makialam ang mga tao? Resulta: "Mababa / Katamtaman / Mataas na panganib" + listahan ng mga mandatoryong pagsusuri.
Generator ng set ng pag-atake ng Red team:
Isa kang espesyalista sa red team. Bumuo ng 15 na sitwasyon ng pag-atake para sa sumusunod na assistant: 5 jailbreak, 5 agarang iniksyon (3 sa mga ito ay hindi direkta), 5 pagtatangka sa pag-exfiltrate ng data. Para sa bawat senaryo: isulat ang layunin, ang buong teksto ng panimula, at "pamantayan sa tagumpay" (anuman ang nakikita ko ay binibilang ang pag-atake bilang matagumpay).
Modelong board skeleton:
Model Card:- Sinadya na paggamit / hindi sinasadyang paggamit- Mga limitasyon sa pagsasanay/data at alam na mga kahinaan- Pagganap: katumpakan, latency, gastos (sa set ng pagsubok)- Seguridad: rate ng pagpasa ng red team, kilalang mga jailbreak- Mga resulta ng pagsubok sa bias- Pagpapasya sa pagtanggap: APPROVAL / CONDITIONAL / REJECTION + justification
Panuntunan sa kontrol ng gate ng pagpasok:
LAHAT ng kundisyon ay dapat matugunan upang lumipat sa produksyon:- >= target na threshold sa accuracy test set- Bilang ng kritikal na natuklasan ng Red team = 0- Kung mataas ang panganib: human inspection at monitoring boardKung walang natugunan: "NO-GO" + nawawalang item.
Mahina Prompt / Malakas na Prompt
mahinang diskarte
Malakas na diskarte
Pinoproseso ang bawat paggamit na may parehong kontrol
Pag-uuri ayon sa panganib at kontrol sa sukat
"Sinubukan namin ito, gumagana ito" (masayang paraan)
Ang sinadyang pagtatangka sa pagsira sa pulang koponan
Ang paglalagay ng modelo sa produksyon nang walang katwiran
Model card + acceptance gate (go/no-go)
Hindi muling nagsusuri pagkatapos mag-patch
Pagsusuri ng regression pagkatapos ng pagwawasto
Tatlong Mini Case
Kaso 1 — Nagkakahalaga ang maling pag-uuri. Itinuring ng isang kumpanya ang recruitment prescreening "isang pandagdag lamang" at itinuring itong mababang panganib. Ang modelo ay sistematikong inalis ang mga nagtapos mula sa ilang mga paaralan; ito ay naging isang reklamo sa diskriminasyon. Ang paggamit ay muling inuri bilang "mataas na panganib" at idinagdag ang bias testing at pagsubaybay ng tao.
Kaso 2 — Nakakita ang Red team ng 3 kritikal na kahinaan. Isang customer assistant ang itinalaga sa red team bago pumunta sa production. 3 sa 15 na sitwasyon ang matagumpay: ang impormasyon ng order ng isa pang customer ay maaaring ma-leak sa pamamagitan ng hindi direktang iniksyon. Ang mga puwang ay sarado at muling nasubok sa parehong hanay; Ipinagpatuloy lamang ang produksyon kapag na-reset ang kritikal na paghahanap.
Case 3 — Nilinaw ng modelo ang desisyon na tanggapin ang card. Sa pagpili sa pagitan ng dalawang modelo, isang team ang naglagay ng mga model card na magkatabi. Ang mas murang modelo ay tumama sa marka sa katumpakan, ngunit mahina sa 2 kritikal na jailbreak sa pulang koponan. Pinili ng team ang mahal ngunit ligtas na modelo dahil sa tuntunin ng acceptance gate na "critical finding = 0" at naidokumento ang desisyon.
Tip: Ang Red team ay hindi isang beses na kaganapan. Patakbuhin muli ang set ng pag-atake sa tuwing nagbabago ang modelo, prompt, o mga tool; Ang seguridad ay hindi isang estado, ngunit isang patuloy na kasanayan.
Mga karaniwang pagkakamali
- Uriin ang paggamit ayon sa pangalan (sa halip na epekto); napagkakamalang mababa ang mataas na panganib.
- Sinusubukan lamang ang "masayang landas" at hindi sinusubukan ang pang-aabuso.
- Ginagawa ang pulang koponan nang isang beses at hindi na ulitin ito pagkatapos ng mga pagbabago.
- Paglalagay ng modelo sa produksyon nang walang modelong card at pamantayan sa pagtanggap.
- Pag-bypass sa pagsubok ng bias/diskriminasyon (lalo na sa mga desisyon ng tao na may mataas na stake).
- Nangangahulugan ito na "sarado" nang hindi gumagawa ng pagsubok sa pagbabalik ng post-correction.
Sa buod
- Ang unang hakbang ay ang pag-uuri ng mga gamit bilang mababa/katamtaman/mataas na panganib ayon sa epekto; Ang intensity ng kontrol ay tumataas nang may panganib.
- Ang red teaming ay sadyang sinusubukang sirain ang sistema tulad ng isang umaatake; hinahanap ang kahinaan bago ang tunay na umaatake.
- Ang model card ay nagdodokumento ng layunin, limitasyon, at panganib ng modelo; ay ang batayan para sa desisyon ng pagpasok.
- Ang paglipat sa produksyon ay dapat na nauugnay sa isang go/no-go: katumpakan, kritikal na paghahanap ng zero, kinakailangang pagsubaybay.
- Ang seguridad ay tuloy-tuloy: ang red teaming at regression testing ay inuulit sa bawat pagbabago.
Gawain ng aplikasyon
Piliin ang iyong paggamit ng AI, tukuyin ang antas ng panganib batay sa epekto, at isulat ang katwiran. Pagkatapos ay bumuo ng hindi bababa sa 10 mga sitwasyon ng pag-atake para sa paggamit na iyon (jailbreak, injection, data exfiltration) at subukan ang mga ito nang manu-mano. Para sa bawat matagumpay na pag-atake, magmungkahi ng pag-aayos. Panghuli, punan ang isang modelong balangkas ng card at gumawa ng desisyon na "GO/NO-GO" na may mga dahilan.
checklist
- [ ] Inuri ko ang paggamit ayon sa antas ng panganib ayon sa epekto.
- [ ] Itinugma ko ang intensity ng kontrol sa antas ng panganib.
- [ ] Naghanda ako ng red team attack set at sinubukan ito nang sistematikong.
- [ ] Inayos ko ang mga kritikal na natuklasan at na-verify ang mga ito sa pagsubok ng regression.
- [ ] Naghanda ako ng modelong card (layunin, limitasyon, pagganap, seguridad).
- [ ] Itinali ko ang desisyon sa produksyon sa isang go/no-go.