युनिट्स
1. Enterprise AI धोरण का? फाऊंडेशन ऑफ गव्हर्नन्स आणि शॅडो एआय 2. कॉर्पोरेट एआय वापर धोरण कसे लिहावे 3. KVKK मूलभूत तत्त्वे, सामान्य तत्त्वे आणि VERBIS 4. कायदेशीर आधार, माहिती देण्याचे बंधन आणि स्पष्ट संमती 5. EU AI कायदा आणि जोखीम वर्ग 6. GDPR, स्वयंचलित निर्णय आणि क्रॉस-बॉर्डर डेटा ट्रान्सफर 7. डेटा प्रोसेसिंग, स्टोरेज, मिनिमायझेशन आणि अनामीकरण 8. कॉपीराइट, बौद्धिक संपदा आणि AI परिणाम 9. पुरवठादार आणि साधन मूल्यांकन: मंजूर एआय टूल सूची 10. डेटा प्रोटेक्शन इम्पॅक्ट असेसमेंट (DPIA) आणि जोखीम व्यवस्थापन 11. मानवी नियंत्रण, पारदर्शकता, पूर्वाग्रह आणि नैतिकता 12. एआय गव्हर्नन्स फ्रेमवर्क: भूमिका, मान्यता, ऑडिट आणि घटना प्रतिसाद
युनिट 7 / 12

डेटा प्रोसेसिंग, स्टोरेज, मिनिमायझेशन आणि अनामीकरण

नफा:

  • डेटा लाइफसायकलच्या प्रत्येक टप्प्यावर AI विचार लागू करा
  • धारणा कालावधी सेट करा आणि विनाश धोरणामध्ये AI चॅट इतिहास समाविष्ट करा
  • निनावीकरण आणि छद्मनामकरण मधील फरक लागू करणे

डेटाचा “नंतरचा” भाग असा असतो जिथे डेटा संरक्षण अधिकारी सहसा दुर्लक्ष करतो. एआयमध्ये मजकूर टाकला की, काम पूर्ण झाल्यासारखे दिसते; तथापि, तो डेटा कुठेतरी संग्रहित केला जातो, कदाचित मॉडेल प्रशिक्षणात वापरला जातो, कदाचित तो अनेक महिन्यांच्या चॅट इतिहासामध्ये जमा होतो. या युनिटमध्ये, आम्ही वैयक्तिक डेटाच्या जीवन चक्राची चरण-दर-चरण चर्चा करू; आम्ही धारणा कालावधी, AI चॅट इतिहास नष्ट करणे आणि दोन गंभीर तंत्रांमधील फरक - अनामीकरण आणि छद्म नाव देणे याबद्दल शिकू. डेटा एंटर केल्यावरच नव्हे तर संपूर्ण आयुष्यभर डेटा व्यवस्थापित करणे हे ध्येय आहे.

डेटा लाइफसायकल आणि AI

वैयक्तिक डेटा जीवनचक्रातून जातो; प्रत्येक टप्प्यात AI-विशिष्ट लक्ष बिंदू असतात.

स्टेज

काय होते?

AI लक्ष बिंदू

संकलन

डेटा मिळतो

उद्देश आणि आधार स्पष्ट आहे का? ते कमी केले आहे का?

वापर/प्रक्रिया करणे

AI मध्ये प्रवेश केला, प्रक्रिया केली

मास्किंग केले आहे का? मान्यताप्राप्त वाहन?

स्टोरेज

डेटा राखून ठेवला आहे

चॅट इतिहास किती काळ टिकतो?

हस्तांतरण

दुसऱ्याकडे जातो

आंतरराष्ट्रीय सर्व्हर? योग्य आश्वासन आहे का?

नाश

हटवणे/निनावीकरण

उद्देश पूर्ण झाल्यानंतर तो हटवला गेला का? सुटे समाविष्ट आहेत का?

साठवण आणि विल्हेवाट हे दोन सर्वात दुर्लक्षित टप्पे आहेत. डेटा "विसरलेला" आहे आणि सिस्टममध्ये जमा होत राहतो - जे दोन्ही KVKK तत्त्वाचे उल्लंघन करते आणि उल्लंघन झाल्यास नुकसान वाढवते.

स्टोरेज वेळ: तुम्ही ते किती काळ ठेवू शकता?

KVKK चे धारणा तत्व स्पष्ट आहे: वैयक्तिक डेटा आवश्यकतेपेक्षा जास्त काळ ठेवला जाऊ शकत नाही ज्या उद्देशासाठी प्रक्रिया केली जाते. जेव्हा उद्देश यापुढे उपलब्ध नसेल, तेव्हा डेटा हटवला जावा, नष्ट केला जावा किंवा अनामित केला जावा. संस्था स्टोरेज आणि विल्हेवाट धोरण तयार करते; डेटाच्या प्रत्येक श्रेणीसाठी किती ठेवावे हे ठरवते.

AI साठी विशिष्ट महत्त्वाचा मुद्दा: AI चॅट इतिहास देखील डेटा संग्रहित केला जातो. जर एखाद्या कर्मचाऱ्याने ग्राहकांचा डेटा महिन्यांसाठी एकाच चॅटमध्ये एंटर केला असेल, तर तो इतिहास डेटा रिपॉझिटरी बनतो. यासाठी:

  • एंटरप्राइझ एआय टूल्समध्ये डेटा रिटेन्शन सेटिंग्ज कॉन्फिगर करा (शक्य असल्यास इतिहास ऑटो-डिलीट करा किंवा मॉडेल ट्रेनिंगमध्ये वापर बंद करा).
  • तुमच्या विनाश शेड्यूलमध्ये चॅट इतिहास समाविष्ट करा.
  • कॉर्पोरेट करारामध्ये "मॉडेल ट्रेनिंगमध्ये वापरू नका" (निवड रद्द) पर्यायाची खात्री करा.
लक्ष द्या: डेटा हटवणे म्हणजे तो स्क्रीनवरून काढून टाकणे नव्हे. प्रदात्याच्या सर्व्हरवरील बॅकअप, लॉग आणि प्रती देखील विचारात घेतल्या पाहिजेत. जेव्हा तुम्ही "हटवले" म्हणता, तेव्हा तुम्ही जे हटवले आहे ते खरोखर अपरिवर्तनीय आहे याची खात्री करा.

अनामिकरण किंवा छद्म नाव?

या दोन संज्ञा बऱ्याचदा गोंधळात टाकल्या जातात, परंतु त्यांचे कायदेशीर परिणाम भिन्न आहेत.

  • अनामिकरण: डेटा तयार करणे जेणेकरुन ते कोणत्याही प्रकारे एखाद्या व्यक्तीशी संबद्ध केले जाऊ शकत नाही. योग्यरित्या केले असल्यास, परिणाम यापुढे वैयक्तिक डेटा राहणार नाही आणि KVKK च्या कार्यक्षेत्राबाहेर येतो. उदाहरण: 10,000 लोकांच्या डेटा सेटमधील वैयक्तिक पंक्ती हटवणे आणि "इस्तंबूलमधील 25-34 वयोगटातील सरासरी खर्च" यासारखी केवळ एकूण आकडेवारी सोडणे.
  • छद्मनामकरण: ओळख माहिती कोड/टॅगने बदलली जाते, परंतु "की" असलेल्या व्यक्तीला परत केली जाऊ शकते. उदाहरण: "Ahmet Yılmaz" ऐवजी "Customer-4471" लिहिणे, परंतु कोणता कोड कोणाचा आहे हे दर्शविणारा तक्ता ठेवणे. हा अजूनही वैयक्तिक डेटा आहे आणि KVKK च्या कार्यक्षेत्रात येतो.

वैशिष्ट्य

अनामिकरण

छद्मनामकरण

व्यक्ती परत करता येईल का?

नाही (योग्यरित्या केले असल्यास)

होय, किल्लीसह

तो अजूनही वैयक्तिक डेटा आहे?

नाही

होय

KVKK व्याप्ती

बाहेर

मध्ये

AI मध्ये जाण्यासाठी

सर्वात सुरक्षित मार्ग

पुन्हा, एक आधार/नियम आवश्यक आहे

टीप: "ते उलट करता येण्यासारखे आहे का?" AI मध्ये डेटा प्रविष्ट करण्यापूर्वी. विचारा त्यात एक की/जुळणी असल्यास, तो छद्मनाव आहे आणि तरीही वैयक्तिक डेटा आहे. खरे निनावीकरण हे एकत्रित परिणाम शेअर करत आहे, वैयक्तिक पंक्ती नाही.

तीन लहान प्रकरणे

केस 1 - बनावट निनावीपणा. हेल्थकेअर कंपनी AI ला डेटाचा एक संच देते ती म्हणते की ते विश्लेषणासाठी "अनामित" आहे. परंतु संचामध्ये जन्मतारीख, काउंटी आणि दुर्मिळ निदान समाविष्ट आहे; हे त्रिकूट एका छोट्या परगण्यात एकच व्यक्ती सूचित करू शकते. हे अनामिकरण नाही; डेटा अजूनही वैयक्तिक आहे. योग्य मार्ग: जन्मतारीख वयोमर्यादेत रूपांतरित करणे, काउन्टीनुसार सामान्यीकरण करणे, दुर्मिळ निदानांचे गट करणे—म्हणजेच खरे एकत्रीकरण.

केस 2 - संभाषण जमा होत आहे. कॉल सेंटरमध्ये, 6 एजंट ग्राहकांचा डेटा एकाच कॉर्पोरेट AI खात्यात 4 महिन्यांसाठी प्रविष्ट करतात. भूतकाळ कोणी साफ करत नाही; शेवटी 12,000 पेक्षा जास्त ग्राहक संवाद एकाच ठिकाणी जमा झाले. ऑडिटमध्ये, हे संचय एक प्रमुख धोका म्हणून चिन्हांकित केले आहे. उपाय: दर ३० दिवसांनी इतिहास आपोआप हटवण्याची सेटिंग, जॉब पूर्ण झाल्यावर लॉग आउट करण्याचा नियम आणि धारणा धोरणासाठी एक खंड खुला आहे.

केस 3 - योग्य छद्मनावीकरण. AI सह कर्मचाऱ्यांच्या कामगिरीचे विश्लेषण करताना, HR टीम "Employee-001" सारखी नावे कोड करते आणि जुळणारे टेबल वेगळ्या, प्रवेश-प्रतिबंधित फाइलमध्ये ठेवते. हे छद्मनामकरण आहे; डेटा अद्याप वैयक्तिक आहे, परंतु धोका कमी झाला आहे. संघाला याची जाणीव आहे की हे अनामिकरण नाही आणि त्यानुसार त्याचा कायदेशीर आधार आणि धारणा कालावधी निर्धारित करते.

कॉपी करण्यायोग्य टेम्पलेट्स

टेम्प्लेट 1 — धारणा आणि नाश धोरण ओळ: "खालील डेटा श्रेणीसाठी धारणा-विनाश धोरण ओळ प्रस्तावित करा: [श्रेणी]. फील्ड: धारणा कालावधी (उद्देशानुसार न्याय्य), विनाश पद्धत (हटवणे/विनाश/अनामित करणे), AI चॅट इतिहास समाविष्ट आहे की नाही, जबाबदार भूमिका. कायदेशीर बंधन असल्यास लक्षात ठेवा."

टेम्प्लेट 2 — निनावीपणा तपासा: "खालील डेटासेट खरोखर निनावी आहे की नाही याचे मूल्यमापन करा: [सूची फील्ड]. फील्डचे कोणते संयोजन एखाद्या व्यक्तीला ओळखण्यायोग्य बनवू शकते (उदा. जन्मतारीख + पिन कोड + दुर्मिळ वैशिष्ट्य)? प्रत्येक जोखीम फील्डसाठी सामान्यीकरण सुचवा (जसे की वयोमर्यादा, प्रांताची पातळी) मजबूत करण्यासाठी.

टेम्प्लेट 3 — मास्किंग + रिटर्न की वेगळे करणे: "खालील मजकूर टोपणनाव: वैयक्तिक डेटा एन्कोड करा (जसे [नाम]->K001), परंतु मला स्वतंत्रपणे जुळणारे सारणी द्या. मजकूरातच कोणतीही खरी ओळख सोडू नका. लक्षात ठेवा की जुळणारे सारणी 'वैयक्तिक डेटा' आहे आणि ते स्वतंत्रपणे संग्रहित केले पाहिजे."

टेम्प्लेट 4 — AI टूल डेटा स्टोरेज ऑडिट: "आम्ही वापरत असलेल्या AI टूलच्या डेटा स्टोरेज वर्तनाचे ऑडिट करण्यासाठी प्रश्नांची सूची तयार करा: इतिहास किती काळ ठेवला आहे, तो हटवला जाऊ शकतो, मॉडेल प्रशिक्षणात वापरला जातो का, निवड रद्द करा, डेटावर प्रक्रिया कुठे केली जाते, बॅकअप काय आहेत? प्रत्येक प्रश्नाचे अपेक्षित 'सुरक्षित' उत्तर लिहा."

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमजोर: "हा डेटा अनामित करा." (नावे कोड आणि पाने)-> फक्त टोपणनावे; जन्मतारीख, दुर्मिळ वैशिष्ट्य यासारखे पुन्हा ओळखण्याचे धोके कायम आहेत; त्यातून ‘अनामिक’चा भ्रम निर्माण होतो. GÜÇLÜ: "या संचामध्ये फील्डचे संयोजन शोधा जे त्या व्यक्तीला पुन्हा ओळखू शकतील; त्या प्रत्येकाचे सामान्यीकरण करा (वय श्रेणी, प्रांत स्तर). माझे ध्येय एकल रेकॉर्ड नाही, परंतु एकत्रित आकडेवारी आहे. परिणामी, कोणीही एक व्यक्ती म्हणून ओळखले जाऊ शकत नाही आणि हे सत्यापित करा." -> मॉडेल खऱ्या निनावीपणाकडे झुकते, पुन्हा ओळखण्याचा धोका कमी करते.

सामान्य चुका

  • निनावीपणासाठी चुकीचे छद्मनामकरण; तो वैयक्तिक डेटा राहतो हे विसरणे.
  • नावे हटवणे आणि वर्णनात्मक संयोजन जसे की जन्मतारीख + स्थान + दुर्मिळ गुणधर्म सोडणे.
  • AI चॅट इतिहास धारणा/नाश नियमाच्या अधीन नाही; अनिश्चित काळासाठी जमा करा.
  • करारातील "मॉडेल ट्रेनिंगमध्ये वापरू नका" (निवड रद्द) कलमाची खात्री न करणे.
  • जेव्हा मी हटवायचे म्हणतो, तेव्हा माझा अर्थ फक्त स्क्रीन साफ ​​करा आणि बॅकअप आणि लॉग विसरा.
  • स्टोरेज कालावधी हेतूसाठी न ठेवता "फक्त बाबतीत" साठी जास्त ठेवणे.
  • प्रदात्याच्या सर्व्हरवर हस्तांतरण आणि संचयन देखील होते याकडे दुर्लक्ष करून.

सारांशात

  • वैयक्तिक डेटा जीवनचक्रातून जातो; सर्वात दुर्लक्षित टप्पे म्हणजे साठवण आणि विल्हेवाट.
  • हेतूसाठी आवश्यकतेपेक्षा जास्त काळ डेटा ठेवला जाऊ शकत नाही; संस्थेने स्टोरेज आणि डिस्ट्रक्शन पॉलिसी स्थापन करावी.
  • एआय चॅट इतिहास देखील संग्रहित डेटा आहेत; विल्हेवाट शेड्यूल आणि स्टोरेज सेटिंग्जमध्ये समाविष्ट केले पाहिजे.
  • अनामिकरण KVKK मधून डेटा घेते; छद्मनामकरण अजूनही डेटा वैयक्तिक सोडतो.
  • नाव हटवणे म्हणजे अनामिकरण नव्हे; पुन्हा-ओळखण्याचा धोका असलेले सर्व संयोजन सामान्यीकृत केले पाहिजेत.

अर्ज कार्य

तुमची संस्था AI सह प्रक्रिया करत असलेल्या डेटाची श्रेणी निवडा (उदाहरणार्थ, ग्राहक समर्थन रेकॉर्ड). या श्रेणीसाठी एक धारणा आणि विनाश धोरण ओळ लिहा: धारणा कालावधी (न्याय्य), विनाश पद्धत, AI चॅट इतिहास समाविष्ट आहे की नाही, आणि जबाबदार भूमिका. नंतर त्याच डेटामधून नमुना रेकॉर्ड घ्या आणि प्रथम त्याचे छद्म नाव द्या (जुळणारे सारणी वेगळे ठेवा), नंतर तुम्ही कोणत्या फील्डचे सामान्यीकरण कराल आणि हे रेकॉर्ड खरे अनामिकरण कसे आणायचे ते लिहा. शेवटी, पाच प्रश्न तयार करा जे तुम्ही वापरत असलेल्या AI टूलच्या डेटा स्टोरेज वर्तनावर नियंत्रण ठेवतात आणि तुम्हाला प्रत्येकाला अपेक्षित असलेले “सुरक्षित” उत्तर जोडा.

चेकलिस्ट

  • [ ] मी डेटा श्रेणीसाठी धारणा कालावधी आणि नष्ट करण्याची पद्धत निर्धारित केली आहे.
  • [] मी विनाश शेड्यूलमध्ये एआय चॅट इतिहास समाविष्ट केला आहे.
  • [ ] मी "मॉडेल प्रशिक्षणात वापरू नका" निवड रद्द आयटम तपासला.
  • [ ] मी छद्म नाव आणि निनावीकरण यातील फरक लागू केला आहे.
  • माझ्याकडे सामान्यीकृत फील्ड कॉम्बिनेशन आहेत ज्यांना पुन्हा ओळखण्याचा धोका आहे.
  • [ ] मी हटविण्याच्या व्याप्तीमध्ये बॅकअप आणि लॉग देखील समाविष्ट केले आहेत.
  • [] मी एआय टूलच्या डेटा स्टोरेज वर्तनाचे ऑडिट केले.