लाभ:
- डेटा जीवनचक्र के प्रत्येक चरण में AI विचार लागू करें
- अवधारण अवधि निर्धारित करें और विनाश नीति में एआई चैट इतिहास शामिल करें
- गुमनामीकरण और छद्मनामकरण के बीच अंतर को लागू करना
डेटा का "बाद वाला" भाग वह है जहां डेटा सुरक्षा अधिकारी अक्सर नज़रअंदाज़ कर देते हैं। एक बार जब कोई टेक्स्ट एआई में दर्ज हो जाता है, तो ऐसा लगता है कि काम पूरा हो गया है; हालाँकि, वह डेटा कहीं संग्रहीत किया जाता है, शायद मॉडल प्रशिक्षण में उपयोग किया जाता है, हो सकता है कि यह महीनों तक चैट इतिहास में जमा रहता हो। इस इकाई में, हम व्यक्तिगत डेटा के जीवन चक्र पर चरण दर चरण चर्चा करेंगे; हम अवधारण अवधि, एआई चैट इतिहास को नष्ट करने और दो महत्वपूर्ण तकनीकों - गुमनामीकरण और छद्मनामीकरण के बीच अंतर करना सीखेंगे। लक्ष्य डेटा को उसके पूरे जीवनकाल के दौरान प्रबंधित करना है, न कि केवल उसे दर्ज करने के दौरान।
डेटा जीवनचक्र और एआई
व्यक्तिगत डेटा एक जीवनचक्र से गुजरता है; प्रत्येक चरण में एआई-विशिष्ट ध्यान बिंदु होते हैं।
मंच
क्या होता है?
ऐ ध्यान बिंदु
संग्रह
डेटा प्राप्त होता है
क्या उद्देश्य और आधार स्पष्ट हैं? क्या इसे कम किया गया है?
उपयोग/प्रसंस्करण
एआई में दर्ज किया गया, संसाधित किया गया
क्या मास्किंग हो गई है? स्वीकृत वाहन?
भण्डारण
डेटा बरकरार रखा जाता है
चैट इतिहास कितने समय तक चलता है?
स्थानांतरण
किसी और के पास जाता है
अंतर्राष्ट्रीय सर्वर? क्या कोई उचित आश्वासन है?
विनाश
हटाना/गुमनाम करना
क्या उद्देश्य पूरा होने के बाद इसे हटा दिया गया? क्या अतिरिक्त हिस्से शामिल हैं?
दो सबसे उपेक्षित चरण भंडारण और निपटान हैं। डेटा "भूल गया" है और सिस्टम में जमा होता रहता है - जो केवीकेके सिद्धांत का उल्लंघन करता है और उल्लंघन की स्थिति में क्षति को बढ़ाता है।
भंडारण का समय: आप इसे कितने समय तक रख सकते हैं?
केवीकेके का प्रतिधारण सिद्धांत स्पष्ट है: व्यक्तिगत डेटा को उस उद्देश्य के लिए आवश्यकता से अधिक समय तक नहीं रखा जा सकता जिसके लिए इसे संसाधित किया जाता है। जब उद्देश्य उपलब्ध नहीं रह जाता है, तो डेटा को हटा दिया जाना चाहिए, नष्ट कर दिया जाना चाहिए या गुमनाम कर दिया जाना चाहिए। संस्था भंडारण और निपटान नीति तैयार करती है; यह निर्धारित करता है कि प्रत्येक श्रेणी के डेटा के लिए कितना रखना है।
एआई के लिए विशिष्ट महत्वपूर्ण बिंदु: एआई चैट इतिहास भी संग्रहीत डेटा है। यदि किसी कर्मचारी ने महीनों तक एक ही चैट में ग्राहक डेटा दर्ज किया है, तो वह इतिहास डेटा भंडार बन जाता है। इसके लिए:
- एंटरप्राइज़ AI टूल में डेटा प्रतिधारण सेटिंग्स कॉन्फ़िगर करें (यदि संभव हो तो इतिहास को स्वचालित रूप से हटाएं या मॉडल प्रशिक्षण में उपयोग बंद करें)।
- अपने विनाश कार्यक्रम में चैट इतिहास शामिल करें।
- कॉर्पोरेट अनुबंध में "मॉडल प्रशिक्षण में उपयोग न करें" (ऑप्ट-आउट) विकल्प सुनिश्चित करें।
ध्यान दें: डेटा को हटाना केवल उसे स्क्रीन से हटाना नहीं है। प्रदाता के सर्वर पर बैकअप, लॉग और प्रतियों पर भी विचार किया जाना चाहिए। जब आप "हटाया गया" कहते हैं, तो सुनिश्चित करें कि आपने जो हटाया है वह वास्तव में पुनर्प्राप्त करने योग्य नहीं है।
गुमनामीकरण या छद्मनामकरण?
ये दोनों शब्द अक्सर भ्रमित होते हैं, लेकिन उनके कानूनी परिणाम बिल्कुल विपरीत होते हैं।
- गुमनामीकरण: डेटा बनाना ताकि इसे किसी भी तरह से किसी व्यक्ति के साथ जोड़ा न जा सके। यदि सही ढंग से किया जाता है, तो परिणाम अब व्यक्तिगत डेटा नहीं है और केवीकेके के दायरे से बाहर है। उदाहरण: 10,000 लोगों के डेटा सेट में व्यक्तिगत पंक्तियों को हटाना और केवल समग्र आँकड़े छोड़ना जैसे "इस्तांबुल में 25-34 आयु वर्ग में औसत खर्च"।
- छद्मनामीकरण: पहचान की जानकारी को एक कोड/टैग से बदल दिया जाता है, लेकिन इसे "कुंजी" वाले व्यक्ति को वापस किया जा सकता है। उदाहरण: "अहमत यिलमाज़" के स्थान पर "ग्राहक-4471" लिखना, लेकिन एक तालिका रखना जिसमें यह दर्शाया जाए कि कौन सा कोड किसका है। यह अभी भी व्यक्तिगत डेटा है और KVKK के दायरे में आता है।
सुविधा
गुमनामीकरण
छद्म नामकरण
क्या उस व्यक्ति को वापस किया जा सकता है?
नहीं (यदि सही ढंग से किया गया हो)
हाँ, कुंजी के साथ
क्या यह अभी भी व्यक्तिगत डेटा है?
नहीं
हाँ
केवीकेके दायरा
बाहर
में
एआई में जाने के लिए
सबसे सुरक्षित तरीका
पुनः, एक आधार/नियम की आवश्यकता है
युक्ति: "क्या यह प्रतिवर्ती है?" एआई में डेटा दर्ज करने से पहले। पूछना। यदि इसमें कोई कुंजी/मिलान है, तो यह छद्म नाम है और फिर भी व्यक्तिगत डेटा है। वास्तविक गुमनामीकरण समग्र परिणाम को साझा करना है, व्यक्तिगत पंक्तियों को नहीं।
तीन मिनी मामले
केस 1 - नकली गुमनामी। एक हेल्थकेयर कंपनी एआई को डेटा का एक सेट देती है और कहती है कि इसे विश्लेषण के लिए "अनाम" रखा गया है। लेकिन सेट में जन्म तिथि, काउंटी और एक दुर्लभ निदान शामिल है; यह तिकड़ी एक छोटे से काउंटी में एक ही व्यक्ति को इंगित कर सकती है। यह गुमनामीकरण नहीं है; डेटा अभी भी व्यक्तिगत है. सही तरीका: जन्मतिथि को आयु सीमा में बदलना, काउंटी के आधार पर सामान्यीकरण करना, दुर्लभ निदानों को समूहीकृत करना-अर्थात, सच्चा एकत्रीकरण।
केस 2 - बातचीत का ढेर लगना। एक कॉल सेंटर में, 6 एजेंट 4 महीने के लिए एक ही कॉर्पोरेट AI खाते में ग्राहक डेटा दर्ज करते हैं। अतीत को कोई साफ़ नहीं करता; अंततः 12,000 से अधिक ग्राहक इंटरैक्शन एक ही स्थान पर जमा हो गए। एक ऑडिट में इस संचय को एक बड़े जोखिम के रूप में चिह्नित किया गया है। समाधान: हर 30 दिनों में इतिहास को स्वचालित रूप से हटाने की सेटिंग, कार्य समाप्त होने पर लॉग आउट करने का नियम और अवधारण नीति के लिए खुला एक खंड।
केस 3 - सही छद्मनामकरण। एआई के साथ कर्मचारी के प्रदर्शन का विश्लेषण करते समय, एक एचआर टीम "कर्मचारी-001" जैसे नामों को कोड करती है और मिलान तालिका को एक अलग, पहुंच-प्रतिबंधित फ़ाइल में रखती है। यह छद्मनामकरण है; डेटा अभी भी व्यक्तिगत है, लेकिन जोखिम कम हो गया है। टीम को पता है कि यह गुमनामीकरण नहीं है और तदनुसार इसका कानूनी आधार और प्रतिधारण अवधि निर्धारित करती है।
कॉपी करने योग्य टेम्पलेट
टेम्प्लेट 1 - प्रतिधारण और विनाश नीति पंक्ति: "निम्नलिखित डेटा श्रेणी के लिए एक प्रतिधारण-विनाश नीति पंक्ति का प्रस्ताव करें: [श्रेणी]। फ़ील्ड: प्रतिधारण अवधि (उद्देश्य द्वारा उचित), विनाश विधि (हटाना/विनाश/गुमनामीकरण), क्या एआई चैट इतिहास शामिल है, जिम्मेदार भूमिका। यदि कोई कानूनी प्रतिधारण दायित्व है तो याद दिलाएं।"
टेम्प्लेट 2 - गुमनामीकरण जाँच: "मूल्यांकन करें कि क्या निम्नलिखित डेटासेट वास्तव में गुमनाम है: [सूची फ़ील्ड]। फ़ील्ड का कौन सा संयोजन किसी व्यक्ति को फिर से पहचानने योग्य बना सकता है (उदाहरण के लिए जन्म तिथि + ज़िप कोड + दुर्लभ सुविधा)? गुमनामी को मजबूत करने के लिए प्रत्येक जोखिम क्षेत्र (जैसे आयु सीमा, प्रांत स्तर) के लिए एक सामान्यीकरण का सुझाव दें।"
टेम्प्लेट 3 - मास्किंग + रिटर्न कुंजी पृथक्करण: "निम्न पाठ को छद्म नाम दें: व्यक्तिगत डेटा को एन्कोड करें (जैसे [नाम] -> K001), लेकिन मुझे एक मिलान तालिका अलग से दें। पाठ में कोई वास्तविक पहचान न छोड़ें। ध्यान दें कि मिलान तालिका 'व्यक्तिगत डेटा' है और इसे अलग से संग्रहीत किया जाना चाहिए।"
टेम्प्लेट 4 - एआई टूल डेटा स्टोरेज ऑडिट: "हमारे द्वारा उपयोग किए जाने वाले एआई टूल के डेटा स्टोरेज व्यवहार का ऑडिट करने के लिए प्रश्नों की एक सूची तैयार करें: इतिहास कितने समय तक रखा जाता है, क्या इसे हटाया जा सकता है, क्या इसका उपयोग मॉडल प्रशिक्षण में किया जाता है, क्या ऑप्ट-आउट है, डेटा कहां संसाधित किया जाता है, बैकअप क्या हैं? प्रत्येक प्रश्न के लिए अपेक्षित 'सुरक्षित' उत्तर लिखें।"
कमजोर संकेत/मजबूत संकेत
कमजोर: "इस डेटा को अज्ञात करें।" (कोड और नाम छोड़ देता है)-> सिर्फ उपनाम; पुन: पहचान के जोखिम बने रहते हैं, जैसे जन्म तिथि, दुर्लभ लक्षण; यह "गुमनाम" का भ्रम पैदा करता है। गुलु: "इस सेट में फ़ील्ड के संयोजन ढूंढें जो व्यक्ति को फिर से पहचान सकते हैं; उनमें से प्रत्येक (आयु सीमा, प्रांत स्तर) को सामान्यीकृत करें। मेरा लक्ष्य एक एकल रिकॉर्ड नहीं है, बल्कि एकत्रित आँकड़े हैं। परिणामस्वरूप, किसी को भी एक व्यक्ति के रूप में प्रतिष्ठित नहीं किया जा सकता है और इसे सत्यापित नहीं किया जा सकता है।" -> मॉडल वास्तविक गुमनामी की ओर प्रवृत्त होता है, जिससे पुनः पहचान का जोखिम कम हो जाता है।
सामान्य गलतियाँ
- गुमनामी के लिए छद्मनामीकरण को गलत समझना; यह भूल जाना कि यह व्यक्तिगत डेटा है।
- नाम हटाना और जन्म तिथि + स्थान + दुर्लभ लक्षण जैसे वर्णनात्मक संयोजन छोड़ना।
- एआई चैट इतिहास को अवधारण/विनाश नियम के अधीन न करें; अनिश्चित काल तक संचय करें.
- अनुबंध में "मॉडल प्रशिक्षण में उपयोग न करें" (ऑप्ट-आउट) खंड को सुनिश्चित नहीं करना।
- जब मैं हटाने की बात कहता हूं, तो मेरा मतलब है कि बस स्क्रीन साफ़ करें और बैकअप और लॉग के बारे में भूल जाएं।
- भंडारण अवधि को उद्देश्य के बजाय "बस मामले में" के लिए लंबा रखना।
- इस बात को नजरअंदाज करते हुए कि स्थानांतरण और भंडारण भी प्रदाता के सर्वर पर होता है।
संक्षेप में
- व्यक्तिगत डेटा एक जीवनचक्र से गुजरता है; सबसे उपेक्षित चरण भंडारण और निपटान हैं।
- इस उद्देश्य के लिए डेटा को आवश्यकता से अधिक समय तक नहीं रखा जा सकता है; संस्था को भंडारण एवं विनाश नीति स्थापित करनी चाहिए।
- एआई चैट इतिहास भी संग्रहीत डेटा है; निपटान अनुसूची और भंडारण सेटिंग्स में शामिल किया जाना चाहिए।
- गुमनामीकरण केवीकेके से डेटा निकाल लेता है; छद्मनामकरण अभी भी डेटा को व्यक्तिगत छोड़ देता है।
- किसी नाम को हटाना गुमनामीकरण नहीं है; पुनः पहचान के जोखिम वाले सभी संयोजनों को सामान्यीकृत किया जाना चाहिए।
आवेदन कार्य
डेटा की एक श्रेणी चुनें जिसे आपका संगठन AI के साथ संसाधित करता है (उदाहरण के लिए, ग्राहक सहायता रिकॉर्ड)। इस श्रेणी के लिए एक अवधारण और विनाश नीति पंक्ति लिखें: अवधारण अवधि (उचित), विनाश विधि, क्या एआई चैट इतिहास शामिल है, और जिम्मेदार भूमिका। फिर उसी डेटा से एक नमूना रिकॉर्ड लें और पहले इसे छद्म नाम दें (मिलान तालिका को अलग रखें), फिर लिखें कि आप किन क्षेत्रों को सामान्यीकृत करेंगे और इस रिकॉर्ड को वास्तविक अज्ञातकरण में कैसे लाएंगे। अंत में, पांच प्रश्न तैयार करें जो आपके द्वारा उपयोग किए जाने वाले एआई टूल के डेटा भंडारण व्यवहार को नियंत्रित करते हैं और प्रत्येक के लिए आपके द्वारा अपेक्षित "सुरक्षित" उत्तर जोड़ें।
चेकलिस्ट
- [ ] मैंने डेटा श्रेणी के लिए अवधारण अवधि और विनाश विधि निर्धारित की है।
- [ ] मैंने एआई चैट इतिहास को विनाश कार्यक्रम में शामिल किया है।
- [ ] मैंने "मॉडल प्रशिक्षण में उपयोग न करें" ऑप्ट-आउट आइटम की जांच की।
- [ ] मैंने छद्मनामीकरण और गुमनामीकरण के बीच अंतर को लागू किया।
- [ ] मेरे पास सामान्यीकृत फ़ील्ड संयोजन हैं जिनकी पुन: पहचान का खतरा है।
- [ ] मैंने हटाने के दायरे में बैकअप और लॉग भी शामिल किए हैं।
- [ ] मैंने एआई टूल के डेटा स्टोरेज व्यवहार का ऑडिट किया।