इकाई 6 / 11

मॉडल जोखिम प्रबंधन और रेड टीम

लाभ:

  • प्रभाव के अनुसार उपयोग परिदृश्यों को निम्न/मध्यम/उच्च जोखिम स्तरों में वर्गीकृत करने की क्षमता
  • रेड-टीमिंग के साथ उत्पादन से पहले मॉडल का व्यवस्थित रूप से परीक्षण करने की क्षमता
  • मॉडल कार्ड और स्वीकृति द्वार (गो/नो-गो) के साथ उत्पादन निर्णय लेने की क्षमता

एआई के प्रत्येक उपयोग में समान जोखिम नहीं होता है। मीटिंग नोट का सारांश बताने वाला एक सहायक और ऋण आवेदन का मूल्यांकन करने वाला सहायक बहुत अलग-अलग परिणाम देते हैं। कॉर्पोरेट प्रशासन का आधार जोखिम स्तर के अनुसार उपयोगों को वर्गीकृत करना और प्रत्येक स्तर पर उचित नियंत्रण लागू करना है। इस इकाई में, हम मॉडल जोखिम प्रबंधन की रूपरेखा (किसी मॉडल के गलत, पक्षपाती या शोषक होने के कारण होने वाले जोखिम को प्रबंधित करने का अनुशासन), रेड-टीमिंग के साथ उत्पादन से पहले मॉडल का परीक्षण कैसे करें, और मॉडल कार्ड और स्वीकृति मानदंड सीखेंगे।

जोखिम द्वारा वर्गीकरण

पहला चरण हमेशा एक ही होता है: "यदि यह उपयोग गलत हो जाता है तो क्या होगा?" सामर्थ्य और उत्क्रमणीयता के अनुसार तीन मोटे स्तर:

  • कम जोखिम: त्रुटि का आसानी से पता लगाया जा सकता है और उसे ठीक किया जा सकता है; कोई व्यक्तिगत/वित्तीय परिणाम नहीं. उदाहरण: आंतरिक बैठक सारांश, मसौदा विचार निर्माण।
  • मध्यम जोखिम: त्रुटि व्यावसायिक प्रक्रिया को प्रभावित करती है लेकिन मानवीय आंखों से होकर गुजरती है। उदाहरण: ग्राहक को मसौदा प्रतिक्रिया, प्रारंभिक रिपोर्ट सारांश।
  • उच्च जोखिम: निर्णय सीधे किसी व्यक्ति/धन को प्रभावित करता है, जिसे उलटना मुश्किल है। उदाहरण: क्रेडिट/बीमा निर्णय, स्वास्थ्य देखभाल ट्राइएज, रोजगार स्क्रीनिंग।

जोखिम के स्तर के साथ नियंत्रण की तीव्रता बढ़ती है: कम जोखिम पर, प्रकाश नियंत्रण पर्याप्त होते हैं; उच्च जोखिम पर, मानव पर्यवेक्षण, सख्त सत्यापन, रेड टीमिंग और निरंतर निगरानी अनिवार्य है।

ध्यान दें: जोखिम का वर्गीकरण उपयोग के प्रभाव के अनुसार करें, उसके नाम के अनुसार नहीं। तथाकथित "सिर्फ एक चैटबॉट" प्रणाली उच्च जोखिम वाली है यदि यह भुगतान शुरू कर सकती है।

रेड टीम (रेड-टीमिंग)

रेड टीमिंग जानबूझकर एक दुर्भावनापूर्ण हमलावर होने का नाटक करके एक सिस्टम को तोड़ने की कोशिश कर रही है। यह एआई में है; इसमें जेलब्रेकिंग (मॉडल के सुरक्षा नियमों को दरकिनार करना), शीघ्र इंजेक्शन, डेटा एक्सफिल्टरेशन, पक्षपातपूर्ण/दुर्भावनापूर्ण आउटपुट उत्पन्न करना और किनारे परिदृश्यों का परीक्षण करना शामिल है। लक्ष्य वास्तविक हमलावर से पहले कमजोरियों का पता लगाना है।

चरण दर चरण:

  1. खतरे के परिदृश्यों की सूची बनाएं. इस व्यवस्था का दुरुपयोग कैसे किया जा सकता है?
  2. आक्रमण सेट तैयार करें. प्रत्येक खतरे के लिए ठोस प्रवेश उदाहरण लिखें।
  3. व्यवस्थित रूप से प्रयास करें. प्रत्येक परिदृश्य को चलाएँ और परिणाम रिकॉर्ड करें।
  4. निष्कर्षों को प्राथमिकता दें. प्रभाव × संभावना के आधार पर क्रमबद्ध करें।
  5. इसे ठीक करें और दोबारा परीक्षण करें. पैच के बाद, उसी सेट (रिग्रेशन) के साथ पुनः प्रयास करें।

मॉडल कार्ड और स्वीकृति मानदंड

एक मॉडल कार्ड एक दस्तावेज़ है जो संक्षेप में बताता है कि एक मॉडल किसके लिए उपयुक्त है, इसकी सीमाएँ, ज्ञात जोखिम और प्रदर्शन। इससे पहले कि आप इसे उत्पादन में डालें, आपके पास स्वीकृति निर्णय के लिए मानदंड होने चाहिए: सटीकता सीमा, रेड टीम पास दर, विलंबता, लागत और पूर्वाग्रह परीक्षण।

चार प्रतिलिपि योग्य टेम्पलेट

जोखिम वर्गीकरण संकेत:

निम्नलिखित उपयोग के मामले पर विचार करें: {{परिदृश्य }}प्रश्न:- बग किसे/क्या प्रभावित करता है? (व्यक्ति, धन, प्रतिष्ठा, सद्भाव) - क्या यह प्रतिवर्ती है? (हाँ/नहीं) - क्या मनुष्य हस्तक्षेप कर सकते हैं? परिणाम: "निम्न/मध्यम/उच्च जोखिम" + अनिवार्य जांचों की सूची।

रेड टीम आक्रमण सेट जनरेटर:

आप रेड टीम विशेषज्ञ हैं. निम्नलिखित सहायक के लिए 15 आक्रमण परिदृश्य उत्पन्न करें: 5 जेलब्रेक, 5 त्वरित इंजेक्शन (जिनमें से 3 अप्रत्यक्ष हैं), 5 डेटा घुसपैठ के प्रयास। प्रत्येक परिदृश्य के लिए: उद्देश्य, पूर्ण परिचय पाठ और "सफलता मानदंड" लिखें (जो कुछ भी मैं देखता हूं वह हमले को सफल मानता है)।

मॉडल बोर्ड कंकाल:

मॉडल कार्ड: - इच्छित उपयोग / अनपेक्षित उपयोग - प्रशिक्षण / डेटा सीमाएं और ज्ञात कमजोरियां - प्रदर्शन: सटीकता, विलंबता, लागत (परीक्षण सेट पर) - सुरक्षा: रेड टीम पास दर, ज्ञात जेलब्रेक - पूर्वाग्रह परीक्षण परिणाम - स्वीकृति निर्णय: अनुमोदन / सशर्त / अस्वीकृति + औचित्य

प्रवेश द्वार नियंत्रण नियम:

उत्पादन में जाने के लिए सभी शर्तों को पूरा किया जाना चाहिए: -> = सटीकता परीक्षण सेट पर लक्ष्य सीमा - रेड टीम महत्वपूर्ण निष्कर्ष गिनती = 0 - यदि उच्च जोखिम: मानव निरीक्षण और निगरानी बोर्ड यदि कोई भी पूरा नहीं होता है: "नो-गो" + लापता आइटम।

कमजोर संकेत/मजबूत संकेत

ख़राब दृष्टिकोण

मजबूत दृष्टिकोण

प्रत्येक उपयोग को समान नियंत्रण से संसाधित करना

जोखिम और पैमाने पर नियंत्रण के आधार पर वर्गीकृत करें

"हमने इसका परीक्षण किया, यह काम करता है" (खुशी का तरीका)

रेड टीम के साथ जानबूझकर तोड़ने का प्रयास

बिना किसी औचित्य के मॉडल को उत्पादन में लाना

मॉडल कार्ड + स्वीकृति गेट (गो/नो-गो)

पैचिंग के बाद पुनः परीक्षण नहीं करना

सुधार के बाद प्रतिगमन परीक्षण

तीन मिनी मामले

केस 1 - ग़लत वर्गीकरण महँगा था। एक कंपनी ने भर्ती पूर्व-स्क्रीनिंग को "सिर्फ एक सहायक" माना और इसे कम जोखिम वाला माना। मॉडल ने कुछ स्कूलों से स्नातकों को व्यवस्थित रूप से समाप्त कर दिया; यह भेदभाव की शिकायत में बदल गया। उपयोग को "उच्च जोखिम" के रूप में पुनः वर्गीकृत किया गया और पूर्वाग्रह परीक्षण और मानव निगरानी को जोड़ा गया।

केस 2 - रेड टीम को 3 गंभीर कमजोरियाँ मिलीं। उत्पादन में जाने से पहले एक ग्राहक सहायक को रेड टीम को सौंपा गया था। 15 में से 3 परिदृश्य सफल रहे: किसी अन्य ग्राहक की ऑर्डर जानकारी अप्रत्यक्ष इंजेक्शन के माध्यम से लीक हो सकती है। अंतरालों को बंद कर दिया गया और उसी सेट के साथ पुनः परीक्षण किया गया; उत्पादन तभी फिर से शुरू किया गया जब महत्वपूर्ण खोज को रीसेट कर दिया गया।

केस 3 - मॉडल ने कार्ड स्वीकार करने के निर्णय को स्पष्ट किया। दो मॉडलों के बीच चयन करते हुए, एक टीम ने मॉडल कार्ड को एक साथ रखा। सस्ते मॉडल ने सटीकता में सफलता हासिल की, लेकिन रेड टीम पर 2 गंभीर जेलब्रेक का खतरा था। टीम ने स्वीकृति गेट "महत्वपूर्ण खोज = 0" नियम के कारण महंगा लेकिन सुरक्षित मॉडल चुना और निर्णय का दस्तावेजीकरण किया।

युक्ति: रेड टीम एक बार की घटना नहीं है। जब भी मॉडल, प्रॉम्प्ट, या उपकरण बदलते हैं तो आक्रमण सेट को फिर से चलाएँ; सुरक्षा एक राज्य नहीं है, बल्कि एक सतत अभ्यास है।

सामान्य गलतियाँ

  • उपयोग को नाम के आधार पर वर्गीकृत करें (प्रभाव के बजाय); उच्च जोखिम को कम जोखिम समझना।
  • बस "खुशहाल रास्ते" का परीक्षण कर रहे हैं और दुरुपयोग का बिल्कुल भी प्रयास नहीं कर रहे हैं।
  • रेड टीम को एक बार करना और परिवर्तन के बाद इसे दोहराना नहीं।
  • मॉडल कार्ड और स्वीकृति मानदंड के बिना मॉडल को उत्पादन में लाना।
  • पूर्वाग्रह/भेदभाव परीक्षण को दरकिनार करना (विशेषकर उच्च जोखिम वाले मानवीय निर्णयों में)।
  • इसका अर्थ है सुधारोत्तर प्रतिगमन परीक्षण किए बिना "बंद"।

संक्षेप में

  • पहला कदम प्रभाव के अनुसार उपयोगों को निम्न/मध्यम/उच्च जोखिम के रूप में वर्गीकृत करना है; जोखिम के साथ नियंत्रण की तीव्रता बढ़ती है।
  • रेड टीमिंग जानबूझकर एक हमलावर की तरह सिस्टम को तोड़ने की कोशिश कर रही है; असली हमलावर के सामने भेद्यता का पता लगाता है।
  • मॉडल कार्ड मॉडल के उद्देश्य, सीमाओं और जोखिमों का दस्तावेजीकरण करता है; प्रवेश निर्णय का आधार है।
  • उत्पादन में परिवर्तन को गो/नो-गो से जोड़ा जाना चाहिए: सटीकता, महत्वपूर्ण खोज शून्य, आवश्यक निगरानी।
  • सुरक्षा निरंतर है: प्रत्येक परिवर्तन के साथ रेड टीमिंग और रिग्रेशन परीक्षण दोहराया जाता है।

आवेदन कार्य

एआई का अपना उपयोग चुनें, प्रभाव के आधार पर जोखिम स्तर निर्धारित करें और औचित्य लिखें। फिर उस उपयोग के लिए कम से कम 10 हमले परिदृश्य उत्पन्न करें (जेलब्रेक, इंजेक्शन, डेटा एक्सफ़िल्ट्रेशन) और उन्हें मैन्युअल रूप से आज़माएं। प्रत्येक सफल हमले के लिए, एक समाधान प्रस्तावित करें। अंत में, एक मॉडल कार्ड स्केलेटन भरें और कारणों के साथ "गो/नो-गो" निर्णय लें।

चेकलिस्ट

  • [ ] मैंने प्रभाव के अनुसार जोखिम स्तर के अनुसार उपयोग को वर्गीकृत किया है।
  • [ ] मैंने नियंत्रण तीव्रता का जोखिम स्तर से मिलान किया।
  • [ ] मैंने एक रेड टीम आक्रमण सेट तैयार किया और इसे व्यवस्थित रूप से आज़माया।
  • [ ] मैंने महत्वपूर्ण निष्कर्षों को ठीक किया और उन्हें प्रतिगमन परीक्षण के साथ सत्यापित किया।
  • [ ] मैंने एक मॉडल कार्ड (उद्देश्य, सीमा, प्रदर्शन, सुरक्षा) तैयार किया।
  • [ ] मैंने उत्पादन निर्णय को 'गो/नो-गो' से जोड़ा है।