एकाइ 6 / 11

मोडेल जोखिम व्यवस्थापन र रातो टोली

लाभ:

  • प्रभाव अनुसार कम/मध्यम/उच्च जोखिम स्तरहरूमा उपयोग परिदृश्यहरू वर्गीकरण गर्ने क्षमता
  • रेड-टीमिङको साथ उत्पादन गर्नु अघि मोडेललाई व्यवस्थित रूपमा परीक्षण गर्ने क्षमता
  • मोडेल कार्ड र स्वीकृति ढोका (go/no-go) को साथ उत्पादन निर्णयहरू गर्ने क्षमता

AI को हरेक प्रयोगले समान जोखिम बोक्दैन। एक सहायकले बैठक नोटको सारांश र ऋण आवेदन मूल्याङ्कन गर्ने सहायकले धेरै फरक परिणामहरू उत्पादन गर्दछ। कर्पोरेट गभर्नेन्सको आधार जोखिमको स्तर अनुसार प्रयोगको वर्गीकरण गर्नु र प्रत्येक तहमा उपयुक्त नियन्त्रण लागू गर्नु हो। यस इकाईमा, हामी मोडेल जोखिम व्यवस्थापनको ढाँचा (मोडल गलत, पक्षपाती वा शोषणयोग्य भएको कारणले हुने जोखिम व्यवस्थापन गर्ने अनुशासन), रेड-टीमिङको साथ उत्पादन अघि मोडेलको परीक्षण कसरी गर्ने, र मोडेल कार्ड र स्वीकृति मापदण्ड सिक्नेछौं।

जोखिम द्वारा वर्गीकरण

पहिलो चरण सधैं समान हुन्छ: "यदि यो प्रयोग गलत भयो भने के हुन्छ?" शक्ति र उल्टोपन अनुसार तीन नराम्रो स्तरहरू:

  • कम जोखिम: त्रुटि सजिलै पत्ता लगाइन्छ र पूर्ववत हुन्छ; कुनै व्यक्तिगत/आर्थिक परिणामहरू छैनन्। उदाहरण: आन्तरिक बैठक सारांश, मस्यौदा विचार उत्पादन।
  • मध्यम जोखिम: त्रुटिले व्यापार प्रक्रियालाई असर गर्छ तर मानव आँखाबाट जान्छ। उदाहरण: ग्राहकलाई मस्यौदा प्रतिक्रिया, प्रारम्भिक रिपोर्ट सारांश।
  • उच्च जोखिम: निर्णयले प्रत्यक्ष रूपमा व्यक्ति/पैसालाई असर गर्छ, उल्टाउन गाह्रो हुन्छ। उदाहरण: क्रेडिट/बीमा निर्णय, स्वास्थ्य सेवा ट्राइएज, रोजगारी जाँच।

जोखिमको स्तरसँगै नियन्त्रण तीव्रता बढ्छ: कम जोखिममा, प्रकाश नियन्त्रणहरू पर्याप्त छन्; उच्च जोखिममा, मानव पर्यवेक्षण, कडा प्रमाणीकरण, रातो टोली र निरन्तर निगरानी अनिवार्य छ।

ध्यान दिनुहोस्: प्रयोगको प्रभाव अनुसार जोखिम वर्गीकरण गर्नुहोस्, यसको नाम होइन। तथाकथित "केवल एक च्याटबोट" प्रणाली उच्च जोखिम हो यदि यसले भुक्तानीहरू सुरु गर्न सक्छ।

रातो टोली (रातो टोली)

रातो टोलीले जानाजानी दुर्भावनापूर्ण आक्रमणकारी भएको नाटक गरेर प्रणाली तोड्न खोजिरहेको छ। यो AI मा छ; यसले जेलब्रेकिङ (मोडेलको सुरक्षा नियमहरू बाइपास गर्दै), प्रम्प्ट इन्जेक्सन, डाटा एक्सफिल्ट्रेसन, पक्षपाती/दुर्भावनापूर्ण आउटपुट उत्पन्न गर्ने, र किनारा परिदृश्यहरू परीक्षण गर्ने समावेश गर्दछ। लक्ष्य वास्तविक आक्रमणकारी भन्दा पहिले कमजोरीहरू फेला पार्नु हो।

चरणबद्ध रूपमा:

  1. खतरा परिदृश्यहरू सूचीबद्ध गर्नुहोस्। यो प्रणाली कसरी दुरुपयोग गर्न सकिन्छ?
  2. आक्रमण सेट तयार गर्नुहोस्। प्रत्येक खतराको लागि ठोस प्रविष्टि उदाहरणहरू लेख्नुहोस्।
  3. व्यवस्थित रूपमा प्रयास गर्नुहोस्। प्रत्येक परिदृश्य चलाउनुहोस् र परिणाम रेकर्ड गर्नुहोस्।
  4. निष्कर्षलाई प्राथमिकता दिनुहोस्। प्रभाव × सम्भाव्यता अनुसार क्रमबद्ध गर्नुहोस्।
  5. यसलाई ठीक गर्नुहोस् र फेरि परीक्षण गर्नुहोस्। प्याच पछि, उही सेट (रिग्रेसन) संग पुन: प्रयास गर्नुहोस्।

मोडेल कार्ड र स्वीकृति मापदण्ड

मोडेल कार्ड भनेको एउटा कागजात हो जसले मोडेलको लागि उपयुक्त के हो, यसको सीमितताहरू, ज्ञात जोखिमहरू र कार्यसम्पादनको सारांश दिन्छ। तपाईंले यसलाई उत्पादनमा राख्नु अघि, तपाईंसँग स्वीकृति निर्णयको मापदण्ड हुनुपर्दछ: सटीकता थ्रेसहोल्ड, रातो टोली पास दर, विलम्बता, लागत, र पूर्वाग्रह परीक्षणहरू।

चार प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

जोखिम वर्गीकरण प्रम्प्ट:

निम्न प्रयोग केसलाई विचार गर्नुहोस्: {{ परिदृश्य }}प्रश्नहरू:- कसलाई/केलाई बगले असर गर्छ? (व्यक्ति, पैसा, प्रतिष्ठा, सद्भाव) - के यो उल्टाउन मिल्छ? (हो/होइन) - के मानिसहरूले हस्तक्षेप गर्न सक्छन्? नतिजा: "कम / मध्यम / उच्च जोखिम" + अनिवार्य जाँचहरूको सूची।

रातो टोली आक्रमण सेट जेनरेटर:

तपाईं रातो टोली विशेषज्ञ हुनुहुन्छ। निम्न सहायकका लागि 15 आक्रमण परिदृश्यहरू उत्पन्न गर्नुहोस्: 5 जेलब्रेकहरू, 5 प्रम्प्ट इंजेक्शनहरू (जसमध्ये 3 अप्रत्यक्ष छन्), 5 डेटा निष्कासन प्रयासहरू। प्रत्येक परिदृश्यको लागि: उद्देश्य, पूर्ण परिचय पाठ, र "सफलताको मापदण्ड" लेख्नुहोस् (जे मैले देखेको छु त्यसले आक्रमणलाई सफल मान्दछ)।

मोडेल बोर्ड कंकाल:

मोडेल कार्ड:- अभिप्रेत प्रयोग/अनपेक्षित प्रयोग- प्रशिक्षण/डेटा सीमा र ज्ञात कमजोरीहरू- प्रदर्शन: शुद्धता, विलम्बता, लागत (परीक्षण सेटमा)- सुरक्षा: रातो टोली पास दर, ज्ञात जेलब्रेकहरू- पूर्वाग्रह परीक्षण परिणाम- स्वीकृति निर्णय: स्वीकृति / सर्त / अस्वीकार + औचित्य

प्रवेश द्वार नियन्त्रण नियम:

उत्पादनमा सार्नको लागि सबै सर्तहरू पूरा गर्नुपर्छ:->= सटीकता परीक्षण सेटमा लक्ष्य थ्रेसहोल्ड- रातो टोली महत्वपूर्ण निष्कर्ष गणना = ०- यदि उच्च जोखिम: मानव निरीक्षण र अनुगमन बोर्ड कुनै पनि भेटिएन भने: "NO-GO" + हराएको वस्तु।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

गरीब दृष्टिकोण

बलियो दृष्टिकोण

एउटै नियन्त्रण संग प्रत्येक प्रयोग प्रशोधन

जोखिम र मापन नियन्त्रण द्वारा वर्गीकृत

"हामीले यसलाई परीक्षण गर्यौं, यसले काम गर्दछ" (खुशी तरिका)

रातो टोलीसँग जानाजानी तोड्ने प्रयास

औचित्य बिना मोडेल उत्पादनमा राख्दै

मोडेल कार्ड + स्वीकृति गेट (go/no-go)

प्याचिंग पछि पुन: परीक्षण गर्दैन

सुधार पछि रिग्रेसन परीक्षण

तीन मिनी केसहरू

केस 1 - गलत वर्गीकरण महँगो थियो। एउटा कम्पनीले भर्ती प्रिस्क्रिनिङलाई "केवल एक सहायक" मानेको छ र यसलाई कम जोखिम मानेको छ। मोडेलले निश्चित विद्यालयहरूबाट स्नातकहरूलाई व्यवस्थित रूपमा हटायो; यो भेदभावको गुनासोमा परिणत भयो। प्रयोगलाई "उच्च जोखिम" को रूपमा पुन: वर्गीकृत गरियो र पूर्वाग्रह परीक्षण र मानव निगरानी थपियो।

केस 2 - रातो टोलीले 3 महत्वपूर्ण कमजोरीहरू फेला पारे। उत्पादनमा जानु अघि रातो टोलीमा ग्राहक सहायक नियुक्त गरिएको थियो। 15 मध्ये 3 परिदृश्यहरू सफल थिए: अर्को ग्राहकको अर्डर जानकारी अप्रत्यक्ष इंजेक्शन मार्फत लीक हुन सक्छ। खाली ठाउँहरू बन्द गरियो र एउटै सेटको साथ पुन: परीक्षण गरियो; महत्वपूर्ण खोज रिसेट भएपछि मात्र उत्पादन पुन: सुरु गरिएको थियो।

केस 3 - मोडेलले कार्ड स्वीकार गर्ने निर्णयलाई स्पष्ट गर्यो। दुई मोडेलहरू बीच छनौट गर्दै, एउटा टोलीले मोडेल कार्डहरू छेउछाउमा राख्यो। सस्तो मोडेलले सटीकतामा मार्क हिट गर्यो, तर रातो टोलीमा २ महत्वपूर्ण जेलब्रेकहरूको लागि कमजोर थियो। टोलीले स्वीकृति गेट "क्रिटिकल फाइन्डिंग = ०" नियमको कारणले महँगो तर सुरक्षित मोडेल छनोट गर्‍यो र निर्णयलाई दस्तावेजीकरण गर्‍यो।

सुझाव: रातो टोली एक पटकको घटना होइन। मोडेल, प्रम्प्ट, वा उपकरणहरू परिवर्तन हुँदा आक्रमण सेट पुन: चलाउनुहोस्; सुरक्षा राज्य होइन, चलिरहेको अभ्यास हो।

सामान्य गल्तीहरू

  • नाम द्वारा प्रयोग वर्गीकृत (प्रभाव को सट्टा); कमको लागि उच्च जोखिम गलत।
  • केवल "खुशी मार्ग" को परीक्षण गर्दै र दुर्व्यवहारको प्रयास नगर्नुहोस्।
  • रातो टोली एक पटक गर्ने र परिवर्तन पछि यसलाई दोहोर्याउँदैन।
  • मोडेल कार्ड र स्वीकृति मापदण्ड बिना उत्पादन मा मोडेल राख्दै।
  • पूर्वाग्रह/भेदभाव परीक्षणलाई बाइपास गर्दै (विशेष गरी उच्च-दण्ड मानव निर्णयहरूमा)।
  • यसको अर्थ पोस्ट-करेक्शन रिग्रेसन परीक्षण नगरी "बन्द" हुन्छ।

संक्षेपमा

  • पहिलो चरण प्रभाव अनुसार कम/मध्यम/उच्च जोखिमको रूपमा प्रयोगहरू वर्गीकरण गर्नु हो। नियन्त्रण तीव्रता जोखिम संग बढ्छ।
  • रातो टोलीले जानाजानी आक्रमणकारी जस्तै प्रणाली तोड्न खोजिरहेको छ; वास्तविक आक्रमणकारी अघि जोखिम फेला पार्छ।
  • मोडेल कार्डले मोडेलको उद्देश्य, सीमितता र जोखिमहरू दस्तावेज गर्दछ; भर्ना निर्णयको आधार हो।
  • उत्पादनमा ट्रान्जिसन गो/नो-गोसँग जोडिएको हुनुपर्छ: शुद्धता, महत्वपूर्ण खोजी शून्य, आवश्यक निगरानी।
  • सुरक्षा निरन्तर छ: रातो टोली र प्रतिगमन परीक्षण प्रत्येक परिवर्तन संग दोहोर्याइएको छ।

आवेदन कार्य

आफ्नो AI को प्रयोग छनौट गर्नुहोस्, प्रभावको आधारमा जोखिम स्तर निर्धारण गर्नुहोस्, र औचित्य लेख्नुहोस्। त्यसपछि त्यो प्रयोगको लागि कम्तिमा 10 आक्रमण परिदृश्यहरू उत्पन्न गर्नुहोस् (जेलब्रेक, इंजेक्शन, डेटा एक्सफिल्ट्रेसन) र तिनीहरूलाई म्यानुअल रूपमा प्रयास गर्नुहोस्। प्रत्येक सफल आक्रमणको लागि, समाधान प्रस्ताव गर्नुहोस्। अन्तमा, एउटा मोडेल कार्ड कंकाल भर्नुहोस् र कारणहरू सहित "GO/NO-GO" निर्णय गर्नुहोस्।

चेकलिस्ट

  • [ ] मैले प्रभावको आधारमा जोखिम स्तर अनुसार प्रयोगको वर्गीकरण गरेको छु।
  • [ ] मैले जोखिम स्तरसँग नियन्त्रण तीव्रतासँग मेल खाएँ।
  • [ ] मैले रातो टोली आक्रमण सेट तयार गरें र यसलाई व्यवस्थित रूपमा प्रयास गरें।
  • [ ] मैले महत्वपूर्ण निष्कर्षहरू फिक्स गरें र तिनीहरूलाई रिग्रेसन परीक्षणको साथ प्रमाणित गरें।
  • मैले एउटा मोडेल कार्ड (उद्देश्य, सीमा, कार्यसम्पादन, सुरक्षा) तयार गरें।
  • [ ] मैले उत्पादन निर्णयलाई go/no-go मा बाँधें।