लाभ:
- प्रभाव के अनुसार उपयोग परिदृश्यों को निम्न/मध्यम/उच्च जोखिम स्तरों में वर्गीकृत करने की क्षमता
- रेड-टीमिंग के साथ उत्पादन से पहले मॉडल का व्यवस्थित रूप से परीक्षण करने की क्षमता
- मॉडल कार्ड और स्वीकृति द्वार (गो/नो-गो) के साथ उत्पादन निर्णय लेने की क्षमता
एआई के प्रत्येक उपयोग में समान जोखिम नहीं होता है। मीटिंग नोट का सारांश बताने वाला एक सहायक और ऋण आवेदन का मूल्यांकन करने वाला सहायक बहुत अलग-अलग परिणाम देते हैं। कॉर्पोरेट प्रशासन का आधार जोखिम स्तर के अनुसार उपयोगों को वर्गीकृत करना और प्रत्येक स्तर पर उचित नियंत्रण लागू करना है। इस इकाई में, हम मॉडल जोखिम प्रबंधन की रूपरेखा (किसी मॉडल के गलत, पक्षपाती या शोषक होने के कारण होने वाले जोखिम को प्रबंधित करने का अनुशासन), रेड-टीमिंग के साथ उत्पादन से पहले मॉडल का परीक्षण कैसे करें, और मॉडल कार्ड और स्वीकृति मानदंड सीखेंगे।
जोखिम द्वारा वर्गीकरण
पहला चरण हमेशा एक ही होता है: "यदि यह उपयोग गलत हो जाता है तो क्या होगा?" सामर्थ्य और उत्क्रमणीयता के अनुसार तीन मोटे स्तर:
- कम जोखिम: त्रुटि का आसानी से पता लगाया जा सकता है और उसे ठीक किया जा सकता है; कोई व्यक्तिगत/वित्तीय परिणाम नहीं. उदाहरण: आंतरिक बैठक सारांश, मसौदा विचार निर्माण।
- मध्यम जोखिम: त्रुटि व्यावसायिक प्रक्रिया को प्रभावित करती है लेकिन मानवीय आंखों से होकर गुजरती है। उदाहरण: ग्राहक को मसौदा प्रतिक्रिया, प्रारंभिक रिपोर्ट सारांश।
- उच्च जोखिम: निर्णय सीधे किसी व्यक्ति/धन को प्रभावित करता है, जिसे उलटना मुश्किल है। उदाहरण: क्रेडिट/बीमा निर्णय, स्वास्थ्य देखभाल ट्राइएज, रोजगार स्क्रीनिंग।
जोखिम के स्तर के साथ नियंत्रण की तीव्रता बढ़ती है: कम जोखिम पर, प्रकाश नियंत्रण पर्याप्त होते हैं; उच्च जोखिम पर, मानव पर्यवेक्षण, सख्त सत्यापन, रेड टीमिंग और निरंतर निगरानी अनिवार्य है।
ध्यान दें: जोखिम का वर्गीकरण उपयोग के प्रभाव के अनुसार करें, उसके नाम के अनुसार नहीं। तथाकथित "सिर्फ एक चैटबॉट" प्रणाली उच्च जोखिम वाली है यदि यह भुगतान शुरू कर सकती है।
रेड टीम (रेड-टीमिंग)
रेड टीमिंग जानबूझकर एक दुर्भावनापूर्ण हमलावर होने का नाटक करके एक सिस्टम को तोड़ने की कोशिश कर रही है। यह एआई में है; इसमें जेलब्रेकिंग (मॉडल के सुरक्षा नियमों को दरकिनार करना), शीघ्र इंजेक्शन, डेटा एक्सफिल्टरेशन, पक्षपातपूर्ण/दुर्भावनापूर्ण आउटपुट उत्पन्न करना और किनारे परिदृश्यों का परीक्षण करना शामिल है। लक्ष्य वास्तविक हमलावर से पहले कमजोरियों का पता लगाना है।
चरण दर चरण:
- खतरे के परिदृश्यों की सूची बनाएं. इस व्यवस्था का दुरुपयोग कैसे किया जा सकता है?
- आक्रमण सेट तैयार करें. प्रत्येक खतरे के लिए ठोस प्रवेश उदाहरण लिखें।
- व्यवस्थित रूप से प्रयास करें. प्रत्येक परिदृश्य को चलाएँ और परिणाम रिकॉर्ड करें।
- निष्कर्षों को प्राथमिकता दें. प्रभाव × संभावना के आधार पर क्रमबद्ध करें।
- इसे ठीक करें और दोबारा परीक्षण करें. पैच के बाद, उसी सेट (रिग्रेशन) के साथ पुनः प्रयास करें।
मॉडल कार्ड और स्वीकृति मानदंड
एक मॉडल कार्ड एक दस्तावेज़ है जो संक्षेप में बताता है कि एक मॉडल किसके लिए उपयुक्त है, इसकी सीमाएँ, ज्ञात जोखिम और प्रदर्शन। इससे पहले कि आप इसे उत्पादन में डालें, आपके पास स्वीकृति निर्णय के लिए मानदंड होने चाहिए: सटीकता सीमा, रेड टीम पास दर, विलंबता, लागत और पूर्वाग्रह परीक्षण।
चार प्रतिलिपि योग्य टेम्पलेट
जोखिम वर्गीकरण संकेत:
निम्नलिखित उपयोग के मामले पर विचार करें: {{परिदृश्य }}प्रश्न:- बग किसे/क्या प्रभावित करता है? (व्यक्ति, धन, प्रतिष्ठा, सद्भाव) - क्या यह प्रतिवर्ती है? (हाँ/नहीं) - क्या मनुष्य हस्तक्षेप कर सकते हैं? परिणाम: "निम्न/मध्यम/उच्च जोखिम" + अनिवार्य जांचों की सूची।
रेड टीम आक्रमण सेट जनरेटर:
आप रेड टीम विशेषज्ञ हैं. निम्नलिखित सहायक के लिए 15 आक्रमण परिदृश्य उत्पन्न करें: 5 जेलब्रेक, 5 त्वरित इंजेक्शन (जिनमें से 3 अप्रत्यक्ष हैं), 5 डेटा घुसपैठ के प्रयास। प्रत्येक परिदृश्य के लिए: उद्देश्य, पूर्ण परिचय पाठ और "सफलता मानदंड" लिखें (जो कुछ भी मैं देखता हूं वह हमले को सफल मानता है)।
मॉडल बोर्ड कंकाल:
मॉडल कार्ड: - इच्छित उपयोग / अनपेक्षित उपयोग - प्रशिक्षण / डेटा सीमाएं और ज्ञात कमजोरियां - प्रदर्शन: सटीकता, विलंबता, लागत (परीक्षण सेट पर) - सुरक्षा: रेड टीम पास दर, ज्ञात जेलब्रेक - पूर्वाग्रह परीक्षण परिणाम - स्वीकृति निर्णय: अनुमोदन / सशर्त / अस्वीकृति + औचित्य
प्रवेश द्वार नियंत्रण नियम:
उत्पादन में जाने के लिए सभी शर्तों को पूरा किया जाना चाहिए: -> = सटीकता परीक्षण सेट पर लक्ष्य सीमा - रेड टीम महत्वपूर्ण निष्कर्ष गिनती = 0 - यदि उच्च जोखिम: मानव निरीक्षण और निगरानी बोर्ड यदि कोई भी पूरा नहीं होता है: "नो-गो" + लापता आइटम।
कमजोर संकेत/मजबूत संकेत
ख़राब दृष्टिकोण
मजबूत दृष्टिकोण
प्रत्येक उपयोग को समान नियंत्रण से संसाधित करना
जोखिम और पैमाने पर नियंत्रण के आधार पर वर्गीकृत करें
"हमने इसका परीक्षण किया, यह काम करता है" (खुशी का तरीका)
रेड टीम के साथ जानबूझकर तोड़ने का प्रयास
बिना किसी औचित्य के मॉडल को उत्पादन में लाना
मॉडल कार्ड + स्वीकृति गेट (गो/नो-गो)
पैचिंग के बाद पुनः परीक्षण नहीं करना
सुधार के बाद प्रतिगमन परीक्षण
तीन मिनी मामले
केस 1 - ग़लत वर्गीकरण महँगा था। एक कंपनी ने भर्ती पूर्व-स्क्रीनिंग को "सिर्फ एक सहायक" माना और इसे कम जोखिम वाला माना। मॉडल ने कुछ स्कूलों से स्नातकों को व्यवस्थित रूप से समाप्त कर दिया; यह भेदभाव की शिकायत में बदल गया। उपयोग को "उच्च जोखिम" के रूप में पुनः वर्गीकृत किया गया और पूर्वाग्रह परीक्षण और मानव निगरानी को जोड़ा गया।
केस 2 - रेड टीम को 3 गंभीर कमजोरियाँ मिलीं। उत्पादन में जाने से पहले एक ग्राहक सहायक को रेड टीम को सौंपा गया था। 15 में से 3 परिदृश्य सफल रहे: किसी अन्य ग्राहक की ऑर्डर जानकारी अप्रत्यक्ष इंजेक्शन के माध्यम से लीक हो सकती है। अंतरालों को बंद कर दिया गया और उसी सेट के साथ पुनः परीक्षण किया गया; उत्पादन तभी फिर से शुरू किया गया जब महत्वपूर्ण खोज को रीसेट कर दिया गया।
केस 3 - मॉडल ने कार्ड स्वीकार करने के निर्णय को स्पष्ट किया। दो मॉडलों के बीच चयन करते हुए, एक टीम ने मॉडल कार्ड को एक साथ रखा। सस्ते मॉडल ने सटीकता में सफलता हासिल की, लेकिन रेड टीम पर 2 गंभीर जेलब्रेक का खतरा था। टीम ने स्वीकृति गेट "महत्वपूर्ण खोज = 0" नियम के कारण महंगा लेकिन सुरक्षित मॉडल चुना और निर्णय का दस्तावेजीकरण किया।
युक्ति: रेड टीम एक बार की घटना नहीं है। जब भी मॉडल, प्रॉम्प्ट, या उपकरण बदलते हैं तो आक्रमण सेट को फिर से चलाएँ; सुरक्षा एक राज्य नहीं है, बल्कि एक सतत अभ्यास है।
सामान्य गलतियाँ
- उपयोग को नाम के आधार पर वर्गीकृत करें (प्रभाव के बजाय); उच्च जोखिम को कम जोखिम समझना।
- बस "खुशहाल रास्ते" का परीक्षण कर रहे हैं और दुरुपयोग का बिल्कुल भी प्रयास नहीं कर रहे हैं।
- रेड टीम को एक बार करना और परिवर्तन के बाद इसे दोहराना नहीं।
- मॉडल कार्ड और स्वीकृति मानदंड के बिना मॉडल को उत्पादन में लाना।
- पूर्वाग्रह/भेदभाव परीक्षण को दरकिनार करना (विशेषकर उच्च जोखिम वाले मानवीय निर्णयों में)।
- इसका अर्थ है सुधारोत्तर प्रतिगमन परीक्षण किए बिना "बंद"।
संक्षेप में
- पहला कदम प्रभाव के अनुसार उपयोगों को निम्न/मध्यम/उच्च जोखिम के रूप में वर्गीकृत करना है; जोखिम के साथ नियंत्रण की तीव्रता बढ़ती है।
- रेड टीमिंग जानबूझकर एक हमलावर की तरह सिस्टम को तोड़ने की कोशिश कर रही है; असली हमलावर के सामने भेद्यता का पता लगाता है।
- मॉडल कार्ड मॉडल के उद्देश्य, सीमाओं और जोखिमों का दस्तावेजीकरण करता है; प्रवेश निर्णय का आधार है।
- उत्पादन में परिवर्तन को गो/नो-गो से जोड़ा जाना चाहिए: सटीकता, महत्वपूर्ण खोज शून्य, आवश्यक निगरानी।
- सुरक्षा निरंतर है: प्रत्येक परिवर्तन के साथ रेड टीमिंग और रिग्रेशन परीक्षण दोहराया जाता है।
आवेदन कार्य
एआई का अपना उपयोग चुनें, प्रभाव के आधार पर जोखिम स्तर निर्धारित करें और औचित्य लिखें। फिर उस उपयोग के लिए कम से कम 10 हमले परिदृश्य उत्पन्न करें (जेलब्रेक, इंजेक्शन, डेटा एक्सफ़िल्ट्रेशन) और उन्हें मैन्युअल रूप से आज़माएं। प्रत्येक सफल हमले के लिए, एक समाधान प्रस्तावित करें। अंत में, एक मॉडल कार्ड स्केलेटन भरें और कारणों के साथ "गो/नो-गो" निर्णय लें।
चेकलिस्ट
- [ ] मैंने प्रभाव के अनुसार जोखिम स्तर के अनुसार उपयोग को वर्गीकृत किया है।
- [ ] मैंने नियंत्रण तीव्रता का जोखिम स्तर से मिलान किया।
- [ ] मैंने एक रेड टीम आक्रमण सेट तैयार किया और इसे व्यवस्थित रूप से आज़माया।
- [ ] मैंने महत्वपूर्ण निष्कर्षों को ठीक किया और उन्हें प्रतिगमन परीक्षण के साथ सत्यापित किया।
- [ ] मैंने एक मॉडल कार्ड (उद्देश्य, सीमा, प्रदर्शन, सुरक्षा) तैयार किया।
- [ ] मैंने उत्पादन निर्णय को 'गो/नो-गो' से जोड़ा है।