નફો:
- ડેટા જીવનચક્રના દરેક તબક્કે AI વિચારણાઓ લાગુ કરો
- રીટેન્શન પીરિયડ્સ સેટ કરો અને વિનાશ નીતિમાં AI ચેટ ઇતિહાસનો સમાવેશ કરો
- અનામીકરણ અને ઉપનામીકરણ વચ્ચેનો તફાવત લાગુ કરવો
ડેટાનો "પછી" ભાગ એ છે જ્યાં ડેટા પ્રોટેક્શન ઓફિસર વારંવાર નજરઅંદાજ કરે છે. એકવાર AI માં ટેક્સ્ટ દાખલ થઈ જાય, એવું લાગે છે કે કામ થઈ ગયું છે; જો કે, તે ડેટા ક્યાંક સંગ્રહિત છે, કદાચ તેનો ઉપયોગ મોડેલ તાલીમમાં થાય છે, કદાચ તે મહિનાઓ સુધી ચેટ ઇતિહાસમાં એકઠા થાય છે. આ એકમમાં, અમે વ્યક્તિગત ડેટાના જીવન ચક્રની તબક્કાવાર ચર્ચા કરીશું; અમે રીટેન્શન પીરિયડ્સ, AI ચેટ ઇતિહાસના વિનાશ અને બે જટિલ તકનીકો વચ્ચે તફાવત - અનામીકરણ અને છદ્મ નામકરણ વિશે શીખીશું. ધ્યેય તેના સમગ્ર જીવન દરમિયાન ડેટાને મેનેજ કરવાનો છે, માત્ર જ્યારે તે દાખલ કરવામાં આવે ત્યારે નહીં.
ડેટા જીવનચક્ર અને AI
વ્યક્તિગત ડેટા જીવનચક્રમાંથી પસાર થાય છે; દરેક તબક્કામાં AI-વિશિષ્ટ ધ્યાન બિંદુઓ છે.
સ્ટેજ
શું થાય છે?
AI ધ્યાન બિંદુ
સંગ્રહ
ડેટા પ્રાપ્ત થાય છે
શું હેતુ અને આધાર સ્પષ્ટ છે? શું તે ઓછું કરવામાં આવ્યું છે?
ઉપયોગ/પ્રક્રિયા
AI માં દાખલ, પ્રક્રિયા
શું માસ્કીંગ કરવામાં આવ્યું છે? મંજૂર વાહન?
સંગ્રહ
ડેટા જાળવવામાં આવે છે
ચેટ ઇતિહાસ કેટલો સમય ચાલે છે?
ટ્રાન્સફર
કોઈ બીજા પાસે જાય છે
આંતરરાષ્ટ્રીય સર્વર? શું ત્યાં યોગ્ય ખાતરી છે?
વિનાશ
કાઢી નાખવું/અનામીકરણ
શું હેતુ પૂરો થયા પછી તેને કાઢી નાખવામાં આવ્યો હતો? શું ફાજલ વસ્તુઓ શામેલ છે?
બે સૌથી ઉપેક્ષિત તબક્કાઓ સંગ્રહ અને નિકાલ છે. ડેટા "ભૂલી ગયેલો" છે અને સિસ્ટમમાં એકઠા થવાનું ચાલુ રાખે છે - જે બંને KVKK સિદ્ધાંતનું ઉલ્લંઘન કરે છે અને ઉલ્લંઘનની સ્થિતિમાં નુકસાનને વધારે છે.
સંગ્રહ સમય: તમે તેને કેટલો સમય રાખી શકો છો?
KVKK ના રીટેન્શન સિદ્ધાંત સ્પષ્ટ છે: વ્યક્તિગત ડેટા જે હેતુ માટે પ્રક્રિયા કરવામાં આવે છે તેના માટે જરૂરી કરતાં વધુ સમય સુધી રાખી શકાતો નથી. જ્યારે હેતુ હવે ઉપલબ્ધ ન હોય, ત્યારે ડેટા કાઢી નાખવો, નાશ કરવો અથવા અનામી રાખવો જોઈએ. સંસ્થા સંગ્રહ અને નિકાલ નીતિ તૈયાર કરે છે; ડેટાની દરેક શ્રેણી માટે કેટલું રાખવું તે નક્કી કરે છે.
AI માટે નિર્ણાયક બિંદુ: AI ચેટ ઇતિહાસ પણ સંગ્રહિત ડેટા છે. જો કોઈ કર્મચારીએ મહિનાઓ સુધી સમાન ચેટમાં ગ્રાહકનો ડેટા દાખલ કર્યો હોય, તો તે ઇતિહાસ ડેટા રિપોઝીટરી બની જાય છે. આ માટે:
- એન્ટરપ્રાઇઝ AI ટૂલ્સમાં ડેટા રીટેન્શન સેટિંગ્સને ગોઠવો (જો શક્ય હોય તો ઇતિહાસ સ્વતઃ કાઢી નાખો અથવા મોડેલ તાલીમમાં ઉપયોગ બંધ કરો).
- તમારા વિનાશ શેડ્યૂલમાં ચેટ ઇતિહાસ શામેલ કરો.
- કોર્પોરેટ કોન્ટ્રાક્ટમાં "મોડલ તાલીમમાં ઉપયોગ કરશો નહીં" (ઓપ્ટ-આઉટ) વિકલ્પની ખાતરી કરો.
ધ્યાન આપો: ડેટા કાઢી નાખવો એ ફક્ત તેને સ્ક્રીન પરથી દૂર કરવાનો નથી. પ્રદાતાના સર્વર પરના બેકઅપ્સ, લોગ્સ અને નકલોને પણ ધ્યાનમાં લેવા જોઈએ. જ્યારે તમે "કાઢી નાખેલ" કહો છો, ત્યારે ખાતરી કરો કે તમે જે કાઢી નાખ્યું છે તે ખરેખર પુનઃપ્રાપ્ત કરી શકાય તેવું છે.
અનામીકરણ અથવા ઉપનામીકરણ?
આ બે શબ્દો ઘણીવાર મૂંઝવણમાં હોય છે, પરંતુ તેમના કાનૂની પરિણામોનો વિરોધ થાય છે.
- અનામીકરણ: ડેટા બનાવવો જેથી કરીને તેને કોઈ પણ રીતે વ્યક્તિ સાથે સાંકળી ન શકાય. જો યોગ્ય રીતે કરવામાં આવે તો, પરિણામ હવે વ્યક્તિગત ડેટા નથી અને KVKK ના કાર્યક્ષેત્રની બહાર આવે છે. ઉદાહરણ: 10,000 લોકોના ડેટા સેટમાંથી વ્યક્તિગત પંક્તિઓ કાઢી નાખવી અને "ઇસ્તાંબુલમાં 25-34 વય જૂથમાં સરેરાશ ખર્ચ" જેવા માત્ર એકંદર આંકડા જ છોડવા.
- ઉપનામીકરણ: ઓળખની માહિતીને કોડ/ટેગથી બદલવામાં આવે છે, પરંતુ તે વ્યક્તિને "કી" સાથે પરત કરી શકાય છે. ઉદાહરણ: "Ahmet Yılmaz" ને બદલે "Customer-4471" લખવું, પરંતુ કયો કોડ કોનો છે તે દર્શાવતું ટેબલ રાખવું. આ હજુ પણ વ્યક્તિગત ડેટા છે અને KVKK ના કાર્યક્ષેત્રમાં આવે છે.
લક્ષણ
અનામીકરણ
ઉપનામીકરણ
શું વ્યક્તિને પરત કરી શકાય છે?
ના (જો યોગ્ય રીતે કરવામાં આવે તો)
હા, ચાવી સાથે
શું તે હજી પણ વ્યક્તિગત ડેટા છે?
ના
હા
KVKK અવકાશ
બહાર
માં
AI માં પ્રવેશ મેળવવા માટે
સૌથી સલામત રસ્તો
ફરીથી, એક આધાર/નિયમ જરૂરી છે
ટીપ: "શું તે ઉલટાવી શકાય તેવું છે?" AI માં ડેટા દાખલ કરતા પહેલા. પૂછો જો તેમાં કોઈ કી/મેચ હોય, તો તે છદ્નામી અને હજુ પણ વ્યક્તિગત ડેટા છે. સાચું અનામીકરણ એ એકંદર પરિણામ શેર કરે છે, વ્યક્તિગત પંક્તિઓ નહીં.
ત્રણ નાના કેસો
કેસ 1 - નકલી અનામી. હેલ્થકેર કંપની એઆઈને ડેટાનો એક સેટ આપે છે જે કહે છે કે તેની પાસે વિશ્લેષણ માટે "અનામી" છે. પરંતુ સમૂહમાં જન્મ તારીખ, કાઉન્ટી અને દુર્લભ નિદાનનો સમાવેશ થાય છે; આ ત્રણેય નાના કાઉન્ટીમાં એક જ વ્યક્તિનો સંકેત આપી શકે છે. આ અનામી નથી; ડેટા હજુ પણ વ્યક્તિગત છે. સાચો રસ્તો: જન્મતારીખને વય શ્રેણીમાં રૂપાંતરિત કરવી, કાઉન્ટી દ્વારા સામાન્યીકરણ, દુર્લભ નિદાનને જૂથબદ્ધ કરવું-એટલે કે, સાચું એકત્રીકરણ.
કેસ 2 - વાતચીતનો ઢગલો. કોલ સેન્ટરમાં, 6 એજન્ટો 4 મહિના માટે એક જ કોર્પોરેટ AI ખાતામાં ગ્રાહકનો ડેટા દાખલ કરે છે. ભૂતકાળને કોઈ સાફ કરતું નથી; આખરે 12,000 થી વધુ ગ્રાહક ક્રિયાપ્રતિક્રિયાઓ એક જગ્યાએ એકઠા થઈ. ઓડિટમાં, આ સંચયને મોટા જોખમ તરીકે ચિહ્નિત કરવામાં આવે છે. ઉકેલ: દર 30 દિવસે ઈતિહાસને આપમેળે કાઢી નાખવાનું સેટિંગ, કામ પૂરું થાય ત્યારે લૉગ આઉટ કરવાનો નિયમ અને રીટેન્શન પૉલિસી માટે ખુલ્લી કલમ.
કેસ 3 - યોગ્ય ઉપનામીકરણ. AI સાથે કર્મચારીની કામગીરીનું વિશ્લેષણ કરતી વખતે, HR ટીમ “Employee-001” જેવા નામો કોડ કરે છે અને મેચિંગ ટેબલને અલગ, ઍક્સેસ-પ્રતિબંધિત ફાઇલમાં રાખે છે. આ ઉપનામીકરણ છે; ડેટા હજી પણ વ્યક્તિગત છે, પરંતુ જોખમ ઓછું થયું છે. ટીમ વાકેફ છે કે આ અનામી નથી અને તે મુજબ તેનો કાનૂની આધાર અને રીટેન્શન અવધિ નક્કી કરે છે.
નકલ કરી શકાય તેવા નમૂનાઓ
નમૂનો 1 — રીટેન્શન અને ડિસ્ટ્રક્શન પોલિસી લાઇન: "નીચેની ડેટા કેટેગરી માટે રીટેન્શન-ડિસ્ટ્રક્શન પોલિસી લાઇનનો પ્રસ્તાવ કરો: [કેટેગરી]. ફીલ્ડ્સ: રીટેન્શન પીરિયડ (હેતુ દ્વારા વાજબી), વિનાશ પદ્ધતિ (કાઢી નાખવું/વિનાશ/અનામીકરણ), શું AI ચેટ ઇતિહાસ શામેલ છે, જવાબદાર ભૂમિકા. યાદ કરાવો કે જો કોઈ કાનૂની પ્રતિબંધ છે.
નમૂનો 2 — અનામી તપાસ: "નીચેના ડેટાસેટ ખરેખર અનામી છે કે કેમ તેનું મૂલ્યાંકન કરો: [સૂચિ ક્ષેત્રો]. ક્ષેત્રોના કયા સંયોજનો વ્યક્તિને ઓળખી શકાય તેવું બનાવી શકે છે (દા.ત. જન્મ તારીખ + પિન કોડ + દુર્લભ વિશેષતા)? દરેક જોખમ ક્ષેત્ર (જેમ કે વય શ્રેણી, પ્રાંત સ્તર) માટે સામાન્યીકરણ સૂચવો.
નમૂનો 3 — માસ્કિંગ + રીટર્ન કી અલગ: "નીચેનું લખાણ ઉપનામ: વ્યક્તિગત ડેટાને એન્કોડ કરો (જેમ કે [NAME]->K001), પરંતુ મને અલગથી એક મેળ ખાતું ટેબલ આપો. ટેક્સ્ટમાં જ કોઈ વાસ્તવિક ઓળખ છોડશો નહીં. નોંધ કરો કે મેળ ખાતું કોષ્ટક 'વ્યક્તિગત ડેટા' છે અને તેને અલગથી સંગ્રહિત કરવું જોઈએ."
ટેમ્પલેટ 4 — AI ટૂલ ડેટા સ્ટોરેજ ઑડિટ: "અમે ઉપયોગ કરીએ છીએ તે AI ટૂલના ડેટા સ્ટોરેજ વર્તણૂકનું ઑડિટ કરવા માટે પ્રશ્નોની સૂચિ તૈયાર કરો: ઇતિહાસ કેટલો સમય રાખવામાં આવે છે, શું તેને કાઢી શકાય છે, શું તેનો ઉપયોગ મોડલ તાલીમમાં થાય છે, શું ત્યાં નાપસંદ થાય છે, ડેટાની પ્રક્રિયા ક્યાં થાય છે, બેકઅપ શું છે? દરેક પ્રશ્નનો અપેક્ષિત 'સુરક્ષિત' જવાબ લખો."
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
WEAK: "આ ડેટાને અનામી કરો." (કોડ અને નામો)-> માત્ર ઉપનામો; ફરીથી ઓળખના જોખમો રહે છે, જેમ કે જન્મ તારીખ, દુર્લભ લક્ષણ; તે "અનામી" નો ભ્રમ બનાવે છે. GÜÇLÜ: "આ સમૂહમાં એવા ક્ષેત્રોના સંયોજનો શોધો જે વ્યક્તિને ફરીથી ઓળખી શકે; તેમાંથી દરેકને સામાન્ય બનાવો (વય શ્રેણી, પ્રાંત સ્તર). મારો ધ્યેય એકલ રેકોર્ડ નથી, પરંતુ એકંદર આંકડા છે. પરિણામે, કોઈ એક વ્યક્તિ તરીકે ઓળખી શકાતું નથી અને આને ચકાસો." -> મોડેલ સાચા અનામીકરણ તરફ વલણ ધરાવે છે, પુનઃ ઓળખનું જોખમ ઘટાડે છે.
સામાન્ય ભૂલો
- અનામીકરણ માટે ભૂલથી છદ્મનામીકરણ; ભૂલી જવું કે તે વ્યક્તિગત ડેટા રહે છે.
- નામો કાઢી નાખવું અને જન્મતારીખ + સ્થાન + દુર્લભ લક્ષણ જેવા વર્ણનાત્મક સંયોજનો છોડી દેવા.
- AI ચેટ ઇતિહાસને જાળવી રાખવા/વિનાશના નિયમને આધીન નથી; અનિશ્ચિત રૂપે એકઠા કરો.
- કરારમાં "મોડલ તાલીમમાં ઉપયોગ કરશો નહીં" (ઓપ્ટ-આઉટ) કલમની ખાતરી ન કરવી.
- જ્યારે હું ડિલીટ કરવાનું કહું છું, ત્યારે મારો મતલબ છે કે સ્ક્રીન સાફ કરો અને બેકઅપ અને લોગ ભૂલી જાઓ.
- સંગ્રહનો સમયગાળો હેતુને બદલે "માત્ર કિસ્સામાં" માટે લાંબો રાખવો.
- અવગણવું કે ટ્રાન્સફર અને સ્ટોરેજ પણ પ્રદાતાના સર્વર પર થાય છે.
સારાંશમાં
- વ્યક્તિગત ડેટા જીવનચક્રમાંથી પસાર થાય છે; સૌથી ઉપેક્ષિત તબક્કાઓ સંગ્રહ અને નિકાલ છે.
- હેતુ માટે જરૂરી કરતાં વધુ સમય સુધી ડેટા રાખી શકાશે નહીં; સંસ્થાએ સંગ્રહ અને વિનાશની નીતિ સ્થાપિત કરવી જોઈએ.
- AI ચેટ ઇતિહાસ પણ સંગ્રહિત ડેટા છે; નિકાલ શેડ્યૂલ અને સ્ટોરેજ સેટિંગ્સમાં શામેલ હોવું જોઈએ.
- અનામીકરણ KVKK માંથી ડેટા લે છે; ઉપનામીકરણ હજી પણ ડેટાને વ્યક્તિગત છોડી દે છે.
- નામ કાઢી નાખવું એ અનામીકરણ નથી; પુનઃ-ઓળખના જોખમમાં રહેલા તમામ સંયોજનો સામાન્યકૃત હોવા જોઈએ.
એપ્લિકેશન કાર્ય
તમારી સંસ્થા એઆઈ (ઉદાહરણ તરીકે, ગ્રાહક સપોર્ટ રેકોર્ડ્સ) સાથે પ્રક્રિયા કરે છે તે ડેટાની શ્રેણી પસંદ કરો. આ કેટેગરી માટે રીટેન્શન અને ડિસ્ટ્રક્શન પોલિસી લાઇન લખો: રીટેન્શન પીરિયડ (વાજબી), વિનાશ પદ્ધતિ, AI ચેટ ઇતિહાસ શામેલ છે કે કેમ અને જવાબદાર ભૂમિકા. પછી તે જ ડેટામાંથી નમૂનાનો રેકોર્ડ લો અને પ્રથમ તેનું ઉપનામીકરણ કરો (મેળ ખાતા કોષ્ટકને અલગ રાખો), પછી લખો કે તમે કયા ક્ષેત્રોને સામાન્ય બનાવશો અને આ રેકોર્ડને સાચા અનામીમાં કેવી રીતે લાવવો. છેલ્લે, પાંચ પ્રશ્નો તૈયાર કરો કે જે તમે ઉપયોગ કરો છો તે AI ટૂલના ડેટા સ્ટોરેજ વર્તણૂકને નિયંત્રિત કરે છે અને દરેક માટે તમે અપેક્ષા રાખતા હોય તે “સુરક્ષિત” જવાબ ઉમેરો.
ચેકલિસ્ટ
- [ ] મેં ડેટા કેટેગરી માટે જાળવી રાખવાનો સમયગાળો અને વિનાશ પદ્ધતિ નક્કી કરી છે.
- [] મેં વિનાશ શેડ્યૂલમાં AI ચેટ ઇતિહાસનો સમાવેશ કર્યો છે.
- [ ] મેં "મૉડલ તાલીમમાં ઉપયોગ કરશો નહીં" ઑપ્ટ-આઉટ આઇટમ તપાસી.
- [ ] મેં છદ્મનામીકરણ અને અનામીકરણ વચ્ચેનો તફાવત અમલમાં મૂક્યો છે.
- [ ] મારી પાસે સામાન્યકૃત ક્ષેત્ર સંયોજનો છે જે ફરીથી ઓળખના જોખમમાં છે.
- [ ] મેં કાઢી નાખવાના અવકાશમાં બેકઅપ્સ અને લોગ્સનો પણ સમાવેશ કર્યો છે.
- [ ] મેં AI ટૂલના ડેટા સ્ટોરેજ વર્તનનું ઓડિટ કર્યું.