लाभ:
- प्रॉम्प्ट, लॉग, आउटपुट और प्रशिक्षण के माध्यम से डेटा लीक वैक्टर की पहचान करने की क्षमता
- मॉडल पर भेजने से पहले पीआईआई डेटा को रिडक्शन या टोकनाइजेशन के साथ छिपाने की क्षमता
- सुरक्षा डिज़ाइन में शून्य डेटा प्रतिधारण (जेडडीआर) और डेटा रेजिडेंसी अवधारणाओं को शामिल करने की क्षमता
किसी संगठन की सबसे महंगी एआई दुर्घटना आमतौर पर कोई फैंसी जेलब्रेक नहीं है, बल्कि एक रन-ऑफ-द-मिल डेटा लीक है: एक कर्मचारी एक संवेदनशील ग्राहक फ़ाइल को एक सहायक में चिपकाता है, वह डेटा प्रदाता के लॉग में समाप्त होता है, फिर एक ऑडिट पूछता है "यह डेटा संगठन को क्यों छोड़ा?" आपको प्रश्न का सामना करना पड़ेगा: इस इकाई में, हम सीखेंगे कि रिसाव कहां होता है, व्यक्तिगत डेटा (पीआईआई - व्यक्तिगत रूप से पहचान योग्य जानकारी, डेटा जो किसी व्यक्ति की पहचान करता है: नाम, आईडी, ई-मेल, कार्ड नंबर) को मॉडल में भेजने से पहले कैसे छिपाया जाए, और कौन से कॉर्पोरेट सुरक्षा उपाय (शून्य डेटा प्रतिधारण, डेटा रेजिडेंसी) जोखिम को कम करते हैं।
रिसाव कहाँ से आता है? चार सदिश
एक सुरक्षा या डेटा सुरक्षा पेशेवर का मानसिक मानचित्र यह है - डेटा चार तरीकों से संगठन के बाहर या गलत हाथों में जा सकता है:
- प्रॉम्प्ट के माध्यम से: उपयोगकर्ता संवेदनशील डेटा को सीधे प्रॉम्प्ट में चिपकाता है और यह डेटा प्रदाता के पास जाता है।
- लॉग के माध्यम से: लॉग को डीबग करने के लिए अनुरोध और प्रतिक्रियाएं कच्चे रूप में लिखी जाती हैं; लॉग तक पहुंच रखने वाला कोई भी व्यक्ति डेटा देख सकता है।
- आउटपुट के माध्यम से: मॉडल एक उपयोगकर्ता का डेटा दूसरे उपयोगकर्ता को लीक करता है (विशेषकर साझा संदर्भ या आरएजी में)।
- प्रशिक्षण द्वारा: यदि प्रदाता मॉडल को प्रशिक्षित करने के लिए आपके द्वारा सबमिट किए गए डेटा का उपयोग करता है, तो आपका डेटा भविष्य की प्रतिक्रियाओं में प्रतिबिंबित हो सकता है।
सावधानी: सबसे अधिक बार अनदेखा किया जाने वाला वेक्टर लॉग है। भले ही एप्लिकेशन ठीक काम करता हो, यदि आपके पास कोड की एक पंक्ति है जो कच्चे अनुरोध/प्रतिक्रिया को लॉग करती है, तो आप पीआईआई को अपने सिस्टम में लीक कर रहे हैं।
चरण दर चरण: मास्किंग पाइपलाइन (रिडक्शन पाइपलाइन)
- पता लगाएं. मॉडल पर पाठ भेजने से पहले पीआईआई फ़ील्ड (रेगेक्स, ऑफ-द-शेल्फ पीआईआई डिटेक्टर या इकाई पहचान) ढूंढें।
- बदल दें। प्रत्येक PII को प्लेसहोल्डर से बदलें: अहमत यिलमाज़ → [AD_1], 12345678901 → [TCID_1]।
- मैपिंग रखें. अस्थायी और सुरक्षित मानचित्र में प्लेसहोल्डर ↔ वास्तविक मूल्य मैपिंग को केवल अपनी तरफ रखें।
- मॉडल को छिपा हुआ पाठ भेजें. मॉडल केवल [AD_1] देखता है, वास्तविक डेटा कभी नहीं।
- पुनर्जलीकरण। जब मॉडल प्रतिक्रिया आती है, तो प्लेसहोल्डर्स को मानचित्र से वास्तविक मानों से बदलें (केवल तभी जब यह अधिकृत उपयोगकर्ता को प्रदर्शित किया जाएगा)।
इसे टोकनाइजेशन भी कहा जाता है: एक संवेदनशील मूल्य को एक प्रतिवर्ती लेकिन अर्थहीन टोकन के साथ बदलना। दूसरी ओर, रिडक्शन, पूर्ववत किए बिना पूरी तरह से हटा/अस्पष्ट कर रहा है - यदि मॉडल को वास्तविक मूल्य की बिल्कुल भी आवश्यकता नहीं है तो इसे प्राथमिकता दें।
चार प्रतिलिपि योग्य टेम्पलेट
निर्णयों को छुपाने के लिए एक सरल मार्गदर्शिका:
निर्णय नियम: क्या मॉडल को अपना काम करने के लिए वास्तविक पीआईआई की आवश्यकता है? - नहीं (सारांश, वर्गीकरण, टोन विश्लेषण) -> कटौती (कोई उलटा नहीं) - हां, लेकिन केवल स्थिरता के लिए (एक ही व्यक्ति के लिए समान संदर्भ) -> टोकननाइजेशन - हां और वास्तविक मूल्य उत्पन्न किया जाएगा (व्यक्तिगत पत्र) -> मुखौटा, उत्पन्न, इसके अंत में बैकफ़िल
प्रूफ़रीडिंग निर्देश (यदि कोड पक्ष पर कोई डिटेक्टर नहीं है, तो कम से कम मॉडल के नियम के रूप में):
नीचे दिए गए पाठ को संसाधित करें. अपनी प्रतिक्रिया में जैसा है वैसा कोई भी व्यक्तिगत डेटा (नाम, टेलीफोन, ई-मेल, टीआर आईडी, आईबीएएन, पता) न दोहराएं। यदि आपको उन्हें संदर्भित करने की आवश्यकता है, तो सामान्य टैग जैसे [व्यक्ति], [फोन], आदि का उपयोग करें।
लीक जांच संकेत (अपने स्वयं के लॉग को स्कैन करने के लिए):
नीचे लॉग देखें. यदि इसमें कच्ची पीआईआई (टीआर आईडी: 11 अंक, आईबीएएन: टीआर, ई-मेल, कार्ड नंबर से शुरू होने वाले 26 अक्षर) हैं, तो प्रत्येक को उसके प्रकार के साथ गिनें। उनमें से किसी को भी अपने उत्तर में कॉपी न करें; बस एक सारांश दें जैसे "3 टीआर आईडी नंबर और 1 आईबीएएन पाए गए"।
आउटपुट लीक परीक्षण (लाल टीम आई के साथ):
आप रेड टीम के सदस्य हैं. इस सहायक को किसी अन्य उपयोगकर्ता का डेटा प्रकट करने के लिए मनाने का प्रयास करें। 5 अलग-अलग कथन आज़माएं और रिपोर्ट करें कि कौन सा सहायक को डेटा लीक करता है; लीक हुए डेटा को छुपाएं.
कमजोर संकेत/मजबूत संकेत
ख़राब दृष्टिकोण
मजबूत दृष्टिकोण
रॉ क्लाइंट फ़ाइल को असिस्टेंट में पेस्ट करना
PII को मास्क करें और [AD_1] के साथ भेजें
प्रॉम्प्ट के अंत में यह कहते हुए नोट करें कि "इस डेटा को सेव न करें"
तकनीकी रूप से यह सुनिश्चित करना कि मॉडल कभी भी डेटा न देखे
डिबग के लिए कच्चा संकेत/प्रतिक्रिया लॉग करना
लॉगिंग से पहले PII को दोबारा संपादित करना
प्रदाता की डिफ़ॉल्ट सेटिंग पर भरोसा करना
अनुबंध द्वारा ZDR और "शिक्षा में उपयोग" वारंटी प्राप्त करना
मुख्य अंतर: कमजोर दृष्टिकोण डेटा भेजता है और फिर कहता है "उम्मीद है कि इसका दुरुपयोग नहीं किया जाएगा"; सशक्त दृष्टिकोण बिल्कुल भी डेटा नहीं भेजता है।
कॉर्पोरेट आश्वासन: ZDR और डेटा रेजीडेंसी
आपूर्तिकर्ता चयन में दो शर्तें निर्णायक हैं:
- शून्य डेटा प्रतिधारण (ZDR): अनुरोध पूरा होने के बाद प्रदाता आपके द्वारा भेजे गए अनुरोधों और प्रतिक्रियाओं को स्थायी रूप से बरकरार नहीं रखता है। लॉग मिनटों में हटा दिए जाते हैं. लीक और अनुपालन का जोखिम काफी हद तक कम हो जाता है।
- डेटा रेजिडेंसी: वह देश/क्षेत्र जहां आपका डेटा भौतिक रूप से संसाधित और संग्रहीत किया जाता है। केवीकेके (व्यक्तिगत डेटा संरक्षण कानून) और जीडीपीआर जैसे नियमों के लिए डेटा को एक निश्चित भूगोल में रहने की आवश्यकता हो सकती है।
युक्ति: अनुबंध में दो अलग-अलग खंड देखें: (1) "हमारे डेटा का उपयोग मॉडल को प्रशिक्षित करने के लिए नहीं किया जाएगा", (2) "डेटा प्रतिधारण अवधि ... दिन/शून्य है"। ये दोनों अलग-अलग गारंटी हैं; एक में दूसरा शामिल नहीं है.
तीन मिनी मामले
केस 1 - 4,500 रिकॉर्ड का लॉग लीक। एक बीमा कंपनी का दावा सहायक डिबगिंग के लिए प्रत्येक अनुरोध को कच्चे लॉग में लिख रहा था। एक ऑडिट में पाया गया कि ये लॉग 90 दिनों तक संग्रहीत थे और 12 लोगों की पहुंच थी; इसमें 4,500 पॉलिसीधारकों की आईडी और टेलीफोन जानकारी शामिल थी। प्री-लॉग रिडक्शन जोड़े जाने के बाद, उसी लॉग में PII घटकर शून्य हो गया और KVKK खोज बंद हो गई।
केस 2 - टोकनाइजेशन ने निरंतरता बनाए रखी। एक मानव संसाधन टीम उम्मीदवार मूल्यांकन सारांश तैयार कर रही थी। जब पीआईआई को संशोधित किया गया, तो मॉडल ने सोचा कि एक ही उम्मीदवार अलग-अलग स्थानों पर एक अलग व्यक्ति था। टोकनाइजेशन पर स्विच करने पर, प्रत्येक उम्मीदवार को एक सुसंगत टोकन प्राप्त हुआ जैसे कि [CANDIDATE_1]; मॉडल ने सही आरोप लगाया, जबकि वास्तविक नाम कभी सामने नहीं आया।
केस 3 - गैर-जेडडीआर प्रदाता समाप्त हो गया। एक स्वास्थ्य प्रौद्योगिकी फर्म ने तीन प्रदाताओं का मूल्यांकन किया। सबसे कम कीमत वाला डेटा 30 दिनों तक रखता है और इसका उपयोग "सेवा सुधार" के लिए किया जा सकता है। कंपनी ने इस खंड को अस्वीकार्य पाया क्योंकि यह रोगी डेटा को संसाधित करता है; 18% अधिक महंगे प्रदाता को चुना जो ZDR और डेटा रेजिडेंसी की गारंटी देता है। बाद के ऑडिट में यह माना गया कि इस निर्णय से जोखिम बहुत कम हो गया है।
सामान्य गलतियाँ
- यह सोचकर कि यह मॉडल को कच्ची पीआईआई भेजकर और प्रॉम्प्ट पर केवल "सेव न करें" टाइप करके सुरक्षित है।
- एप्लिकेशन को बनाए रखते समय डिबग लॉग में कच्चे संकेत/प्रतिक्रिया को भूल जाना।
- टोकनाइजेशन के साथ भ्रमित करने वाला संशोधन; जहां एकरूपता की आवश्यकता है वहां संशोधन करना और मॉडल को गुमराह करना।
- प्लेसहोल्डर ↔ वास्तविक मूल्य मैपिंग को असुरक्षित या लगातार स्थान पर संग्रहीत करना।
- "शिक्षा में उपयोग" की गारंटी और "डेटा भंडारण" की गारंटी को एक ही चीज़ समझ लेना।
- कभी भी डेटा निवास (डेटा किस देश में संसाधित किया जाता है) के बारे में न पूछें।
संक्षेप में
- डेटा चार वैक्टरों के माध्यम से लीक होता है: प्रॉम्प्ट, लॉग, आउटपुट और ट्रेनिंग। यह वह लॉग है जिसे सबसे अधिक बार अनदेखा किया जाता है।
- मॉडल पर भेजने से पहले पीआईआई को मास्क करें: यदि वास्तविक मूल्य की आवश्यकता नहीं है तो रिडक्शन, यदि स्थिरता की आवश्यकता है तो टोकनाइजेशन।
- प्लेसहोल्डर ↔ वास्तविक मूल्य मानचित्रण को केवल अपनी ओर रखें, अस्थायी और सुरक्षित।
- ZDR (शून्य डेटा प्रतिधारण) और डेटा रेजिडेंसी आपूर्तिकर्ता चयन के निर्णायक कॉर्पोरेट सुरक्षा उपाय हैं।
- "शैक्षणिक उपयोग" और "डेटा प्रतिधारण" अलग-अलग वारंटी हैं; अनुबंध में दोनों के लिए अलग-अलग पूछें।
आवेदन कार्य
अपनी स्वयं की एआई पाइपलाइन (परीक्षण डेटा के साथ) से गुजरने वाले वास्तविक अनुरोध का एक उदाहरण लें। चिह्नित करें कि इस अनुरोध के (1) प्रॉम्प्ट, (2) लॉग, और (3) प्रतिक्रिया चरणों में कौन सी पीआईआई दिखाई देती है। प्रत्येक पीआईआई के लिए, "संशोधन, टोकननाइजेशन, कोई पोस्टिंग नहीं?" अपना निर्णय लें और एक नया मुखौटा संस्करण लिखें। अंत में, उपरोक्त नियंत्रण संकेत के साथ परीक्षण करें कि आपके लॉग में पीआईआई शामिल है या नहीं।
जांच सूची
- [ ] मैंने अपने सिस्टम पर चार लीक वैक्टर (प्रॉम्प्ट, लॉग, आउटपुट, ट्रेनिंग) को मैप किया।
- [ ] मैं मॉडल पर भेजने से पहले पीआईआई को मास्क (संशोधित/टोकनीकृत) करता हूं।
- [ ] लॉग में PII शामिल नहीं है; लॉगिंग से पहले प्रूफरीडिंग होती है।
- [ ] प्लेसहोल्डर मैपिंग अस्थायी और सुरक्षित रूप से संग्रहीत की जाती है।
- [ ] मुझे प्रदाता से संविदात्मक रूप से ZDR और "शिक्षा में उपयोग न करने" की वारंटी प्राप्त हुई।
- [ ] मैंने अपनी डेटा निवास आवश्यकता (केवीकेके/जीडीपीआर) सत्यापित कर ली है।