એકમ 10 / 12

સલામત ઉપયોગ: લીક-મુક્ત અને ગોપનીયતા

નફો:

  • રહસ્યો, અંગત ડેટા અને ગોપનીય વ્યવસાયિક અસ્કયામતો ધરાવતા ડેટાને વર્ગીકૃત કરવાની અને લાલ રેખાઓને ઓળખવાની ક્ષમતા
  • ડેટા દાખલ કરતા પહેલા સિન્થેટિક ડેટા વડે માસ્કિંગ, અનામી અને સુરક્ષિત કરવું
  • મંજૂર સાધન પસંદગી, સંદર્ભ લઘુત્તમીકરણ અને લીકેજના કિસ્સામાં કી રોટેશન રીફ્લેક્સ લાગુ કરવાની ક્ષમતા

કોડિંગ સહાયકમાં તમે જે કંઈપણ પેસ્ટ કરો છો તે સંભવિતપણે તમારા નિયંત્રણની બહાર છે. એક API કી, ગ્રાહક ડેટાબેઝ ડમ્પ, હજુ સુધી જાહેર કરાયેલ માલિકીનો સ્રોત કોડ, અથવા દર્દીનો રેકોર્ડ - એકવાર તેઓ અપ્રુવ્ડ ટૂલમાં પ્રવેશ મેળવે તે પછી આ એક બદલી ન શકાય તેવી લીક બની શકે છે. સોફ્ટવેર ટીમો માટે AI નું સૌથી મોટું જોખમ લાઇનની ભૂલથી નહીં, પરંતુ બેદરકાર કોપી-પેસ્ટથી આવે છે. આ એકમ તે કોપી-પેસ્ટને સુરક્ષિત બનાવવા વિશે છે.

અહીં આપણે ત્રણ બાબતોને અલગ પાડીએ છીએ: કયો ડેટા ક્યારેય દાખલ કરવો જોઈએ નહીં, કયા સાધનોનો ઉપયોગ કયા સેફગાર્ડ્સ સાથે થઈ શકે છે, અને ડેટા દાખલ કરતા પહેલા તેને કેવી રીતે સુરક્ષિત કરવો (માસ્કિંગ, સિન્થેટિક ડેટા, સ્થાનિક રીતે કામ કરવું). આ વૈકલ્પિક નથી "તે સરસ હશે"; મોટાભાગની સંસ્થાઓમાં તે કરાર આધારિત અને કાનૂની જવાબદારી છે.

શા માટે તે આટલું જટિલ છે?

તમે AI ટૂલને મોકલો છો તે ડેટા; પ્રદાતાના સર્વર પર પ્રક્રિયા કરવામાં આવે છે, કેટલીકવાર અમુક સમયગાળા માટે સંગ્રહિત થાય છે, તેનો ઉપયોગ અમુક ઉત્પાદન સેટિંગ્સમાં મોડેલને સુધારવા માટે થઈ શકે છે. "મેં ચેટ કાઢી નાખી" એમ કહેવું ઘણીવાર પૂરતું નથી; જે ક્ષણે ડેટા નેટવર્ક છોડી દે છે, જોખમ ઊભું થાય છે. વધુમાં, લીકેજની કિંમત વધારે છે: લીક થયેલી ક્લાઉડ કીનો મિનિટોમાં દુરુપયોગ થઈ શકે છે, લીક થયેલ ગ્રાહક ડેટા KVKK/GDPR જેવા નિયમો હેઠળ સૂચના અને દંડમાં પરિણમી શકે છે અને લીક થયેલ ખાનગી સ્ત્રોત કોડ સ્પર્ધાત્મક લાભને નષ્ટ કરી શકે છે.

તેથી અંગૂઠાનો નિયમ સરળ છે: બિન-મંજૂર વાહનમાં એવું કંઈપણ દાખલ કરશો નહીં જે તમને ગુમાવવાનું પરવડે નહીં. જો શંકા હોય, તો દાખલ કરશો નહીં.

સાવધાન: "ફક્ત એકવાર, ઝડપથી" માનસિકતા લીક થવાનું સૌથી સામાન્ય કારણ છે. પ્રોડક્શન લોગ અથવા રૂપરેખાંકન ફાઇલને પેસ્ટ કરવું જ્યારે તાત્કાલિક બગનું નિરાકરણ કરવામાં આવે છે ત્યારે દબાણ હેઠળ લીધેલા આવા નિર્ણયો સાથે બરાબર થાય છે. તાકીદ ગોપનીયતાના નિયમને સ્થગિત કરતી નથી.

શું ક્યારેય દાખલ ન કરવું જોઈએ (લાલ રેખા)

  • રહસ્યો: API કી, પાસવર્ડ્સ, ક્લાઉડ એક્સેસ કી, ખાનગી પ્રમાણપત્રો, ટોકન્સ, કનેક્શન સ્ટ્રિંગ્સ.
  • વ્યક્તિગત ડેટા (PII): નામ-અટક, TR ID નંબર, ઈ-મેલ, ટેલિફોન, સરનામું, આરોગ્ય/નાણાકીય રેકોર્ડ્સ, ગ્રાહક ડેટા.
  • ગોપનીય વ્યવસાય સંપત્તિ: અપ્રગટ સ્ત્રોત કોડ, માલિકીનું ગાણિતીક નિયમો, આંતરિક સ્થાપત્ય રહસ્યો, કરાર વિગતો.
  • રેગ્યુલેટેડ ડેટા: હેલ્થકેર, પેમેન્ટ કાર્ડ (PCI), પર્સનલ ફાઇનાન્સ જેવી વિશેષ સુરક્ષિત કેટેગરીઝ.

પગલું દ્વારા પગલું: સલામત વપરાશ પ્રવાહ

  1. ડેટાનું વર્ગીકરણ કરો. તમારી પાસે કઈ શ્રેણી છે — સાર્વજનિક, આંતરિક, ગોપનીય, નિયમન?
  2. વર્ગ પ્રમાણે વાહન પસંદ કરો. ગોપનીય/નિયમિત ડેટાની પ્રક્રિયા માત્ર સંસ્થાકીય રીતે મંજૂર સાધનોમાં કરવામાં આવે છે જે ડેટા ખાતરી પૂરી પાડે છે (શિક્ષણમાં બિન-ઉપયોગ, રીટેન્શન મર્યાદા, પ્રાદેશિક પ્રક્રિયા).
  3. પ્રવેશતા પહેલા સુરક્ષિત. સ્ટ્રીપ સિક્રેટ, માસ્ક/અનામી PII, જો શક્ય હોય તો વાસ્તવિકને બદલે સિન્થેટીક (બનાવટી પરંતુ વાસ્તવિક) ડેટાનો ઉપયોગ કરો.
  4. સંદર્ભ ઓછો કરો. તમારી સમસ્યાને નાનામાં નાના પુનઃઉત્પાદન કરી શકાય તેવા ઉદાહરણ સુધી ઘટાડી દો જેમાં સંવેદનશીલ ભાગોનો સમાવેશ થતો નથી.
  5. આઉટપુટ પણ તપાસો. તપાસો કે AI દ્વારા જનરેટ કરવામાં આવેલ કોડમાં કોઈ હાર્ડકોડેડ સિક્રેટ અથવા તમારા ડેટાનો કોઈ અવશેષ નથી.

ત્રણ મિની કેસ

કેસ 1 - પેસ્ટ કરેલી કી રદ કરવામાં આવી હતી. એક ડેવલપરે બગ ફિક્સ કરતી વખતે આખી રૂપરેખાંકન ફાઇલને AI માં પેસ્ટ કરી; ફાઇલમાં જીવંત તૃતીય-પક્ષ API કી છે. જ્યારે ટીમે જોયું, ત્યારે તેઓએ તરત જ કીને રદ કરી (ફેરવી) અને એક નવી બનાવી; કોઈ દુરુપયોગ ન હતો, પરંતુ તે એક 'સસ્તી' ઘટના હતી. પાઠ: ગ્લુઇંગ કરતા પહેલા ગ્લેઝ દૂર કરો - અને જો તે લીક થઈ જાય તો તરત જ ચાવી ફેરવો.

કેસ 2 — સિન્થેટિક ડેટાએ ધંધાને સાચવ્યો. એક ટીમ વાસ્તવિક ગ્રાહક રેકોર્ડ્સ સાથે પાર્સિંગ ભૂલ અનુભવી રહી હતી. વાસ્તવિક ડેટા દાખલ કરવાને બદલે, તેઓએ સમાન માળખા સાથે સિન્થેટિક ડેટાની 20 લીટીઓ બનાવી પરંતુ સંપૂર્ણપણે નકલી, તેની સાથે ભૂલનું પુનઃઉત્પાદન કર્યું અને તેને AI વડે હલ કરી. ન તો PII લીક થયું કે ન તો નિદાન ધીમું થયું; કૃત્રિમ ડેટા સલામત અને પૂરતો હતો.

કેસ 3 - પ્રિન્ટઆઉટમાં છુપાયેલ રહસ્ય. સેમ્પલ કન્ફિગરેશન જનરેટ કરતી વખતે, AI એ તેમાં વાસ્તવિક દેખાતી "સેમ્પલ" કી એમ્બેડ કરી અને ડેવલપરની નોંધ લીધા વિના તેને કોડમાં સામેલ કરી; કોડ બેઝ સ્કેન (ગુપ્ત સ્કેનર)એ આને પકડીને ચેતવણી આપી. અપરિવર્તનશીલ રહસ્યને ક્યારેય કોડમાં બનાવવું જોઈએ નહીં; પર્યાવરણ વેરીએબલ અથવા સિક્રેટ મેનેજરનો ઉપયોગ કરવાનો સાચો રસ્તો હતો. પાઠ: રહસ્યો માટે પણ આઉટપુટ સ્કેન કરો.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

દાખલ કરતા પહેલા માસ્કીંગ ચેકલિસ્ટ (સ્વ):

AI ને આ ટેક્સ્ટ આપતા પહેલા, ખાતરી કરો કે હું નીચેનાને દૂર કરું છું અને તમને [MASKED] સાથે જે મળે છે તેને બદલું છું: API કી, પાસવર્ડ, ટોકન, કનેક્શન સ્ટ્રિંગ, નામ-અટક, ઇમેઇલ, ફોન, ID નંબર, ગ્રાહક ડેટા. ટેક્સ્ટ:{{text}}

સિન્થેટિક ટેસ્ટ ડેટા જનરેશન:

નીચેની યોજના અનુસાર સંપૂર્ણ રીતે બનાવટી (વાસ્તવિક વ્યક્તિ/સંસ્થા સાથે અસંબંધિત) {{N}}પંક્તિ પરીક્ષણ ડેટા બનાવો. તેને વાસ્તવિક બનાવો, પરંતુ કોઈપણ વાસ્તવિક PII નો ઉપયોગ કરશો નહીં. સ્કીમા: {{ક્ષેત્રો અને પ્રકારો}}એજ કેસનો સમાવેશ થાય છે (ખાલી, સીમા, ખરાબ ફોર્મેટ).

સ્થિર ગુપ્ત શિકાર (કોડમાં):

આ કોડ/રૂપરેખાંકનમાં હાર્ડકોડેડ રહસ્ય શોધો: કી, પાસવર્ડ, ટોકન, કસ્ટમ URL. જો તમને તે મળે, તો તેનું સ્થાન સ્પષ્ટ કરો અને સાચી પદ્ધતિ સૂચવો (પર્યાવરણ વેરીએબલ / ગુપ્ત વ્યવસ્થાપક). કોડ:{{code}}

વાહન અનુરૂપતા આકારણી (ડેટા વર્ગ દ્વારા):

મારી પાસે નીચેના પ્રકારનો ડેટા છે: {{વર્ગ: સાર્વજનિક / આંતરિક / ગોપનીય / નિયમન કરેલ}}. હું જે સાધનનો ઉપયોગ કરવા ઈચ્છું છું તે છે: {{tool}}. આ ટૂલમાં આ ડેટાની પ્રક્રિયા કરતા પહેલા મારે કયા સલામતી (સંગ્રહ, શિક્ષણમાં બિન-ઉપયોગ, પ્રદેશ, ઍક્સેસ)ની પુષ્ટિ કરવી જોઈએ? એક ચેકલિસ્ટ આપો. નિર્ણય મારો છે; તમે માપદંડ સ્પષ્ટ કરો.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા: (ઉત્પાદન ડેટાબેઝમાંથી ખેંચાયેલી 200 વાસ્તવિક વપરાશકર્તા પંક્તિઓ પેસ્ટ કરી રહ્યા છીએ) "આ ડેટામાં પાર્સિંગ ભૂલ શા માટે છે?"
મજબૂત: "નીચે 15 પંક્તિઓ છે જેમાં વાસ્તવિક ડેટાની સમાન રચના છે પરંતુ સંપૂર્ણપણે સિન્થેટિક (કોઈ PII નથી). parse_user() આ પંક્તિઓમાંથી 3, 8 અને 12 પર ValueError ફેંકે છે. સામાન્ય પેટર્ન શું હોઈ શકે, હું તેને કેવી રીતે ઠીક કરી શકું?"

બગને પુનઃઉત્પાદિત કરવા માટે જરૂરી માળખાને સાચવતી વખતે મજબૂત સંસ્કરણમાં કોઈ વાસ્તવિક વ્યક્તિગત ડેટા નથી. નિદાન એ જ રહે છે, જોખમ ફરીથી સેટ થાય છે.

ડેટા વર્ગ

શું તે AI માં પ્રક્રિયા કરી શકાય છે?

પૂર્વશરત

જાહેર

હા

-

આંતરિક ઉપયોગ (બિન-ચોકસાઇ)

સામાન્ય રીતે

કોર્પોરેટ નીતિનું પાલન કરો

ગોપનીય (સોર્સ કોડ, બિઝનેસ સિક્રેટ)

માત્ર માન્ય વાહન

કોર્પોરેટ ખાતરી + લઘુત્તમીકરણ

PII / નિયમન કરેલ

નિયમ પ્રમાણે નં

માસ્ક/અનામી અથવા સિન્થેટિકનો ઉપયોગ કરો

નીતિ પાલન અને ટ્રેસ

સુરક્ષિત ઉપયોગ એ માત્ર એક વ્યક્તિગત આદત કરતાં વધુ છે, તે કોર્પોરેટ સિસ્ટમ છે: કયા ટૂલ્સ મંજૂર છે, કયા ડેટા ક્લાસ ક્યાં જઈ શકે છે અને ઉલ્લંઘનના કિસ્સામાં શું કરવું તે લેખિત નીતિમાં વ્યાખ્યાયિત થવી જોઈએ. જો કોઈ રહસ્ય લીક થઈ જાય, તો સૌથી મહત્વપૂર્ણ પહેલું પગલું એ ગભરાવાનું નથી, પરંતુ લીક થયેલ ઓળખપત્રને તરત જ પાછું ફેરવવું (રદ કરો અને નવું જનરેટ કરો) અને ઘટનાની જાણ કરો. જો તમે તમારી સંસ્થાના માન્ય સાધનો અને ડેટા વર્ગીકરણ નિયમોની સૂચિ જાણતા નથી, તો તમારું પ્રથમ કાર્ય તેમને શીખવાનું છે.

ટીપ: તમારા એડિટર/CLI ટૂલમાં પ્રોજેક્ટ-વિશિષ્ટ "અવગણો" સૂચિ (દા.ત. env, છુપાયેલા ફોલ્ડર્સ, ઓળખ ફાઇલો) વ્યાખ્યાયિત કરો જેથી આ ફાઇલો આસિસ્ટન્ટના સંદર્ભમાં આકસ્મિક રીતે સમાવિષ્ટ ન થાય. નિવારણ હંમેશા સફાઈ કરતા સસ્તું હોય છે.

સામાન્ય ભૂલો

  • સંવેદનશીલ ડેટા "ફક્ત એક વાર" પેસ્ટ કરી રહ્યાં છીએ. તાકીદ લાલ રેખાને સ્થગિત કરતી નથી; સૌથી સામાન્ય લીક અહીં થાય છે.
  • "હું વાતચીત કાઢી નાખીશ" એવું વિચારીને. જે ક્ષણે ડેટા નેટવર્ક છોડી દે છે, જોખમ ઊભું થાય છે; કાઢી નાખવાથી તે પૂર્વવત્ થતું નથી.
  • વાહનનો વર્ગ જોયા વિના તેની પસંદગી કરવી. વ્યક્તિગત ખાતા સાથે ગોપનીય કોર્પોરેટ ડેટા પર પ્રક્રિયા કરવી એ ગંભીર ઉલ્લંઘન છે.
  • આઉટપુટ સ્કેન નથી. AI કોડમાં અપરિવર્તનશીલ રહસ્યને એમ્બેડ કરી શકે છે; ગુપ્ત સ્કેનર સાથે ઉત્પાદનનું પણ નિરીક્ષણ કરો.
  • જ્યારે ગુપ્ત લીક થાય ત્યારે તેને ફેરવવું નહીં. લીક કરેલી કીને રદ ન કરવાથી લીક જીવંત શોષણમાં ફેરવાય છે.

સારાંશમાં

સૉફ્ટવેરમાં AI નું સૌથી મોટું જોખમ ગોપનીયતા લિકેજ છે, અને તેમાંથી મોટા ભાગના દબાણ હેઠળ લેવામાં આવેલા કૉપિ-પેસ્ટ નિર્ણયથી ઉદ્ભવે છે. નિયમ સ્પષ્ટ છે: રહસ્યો, વ્યક્તિગત ડેટા, ગોપનીય વ્યાપાર સંપત્તિ અને નિયમન કરેલ ડેટા અસ્વીકૃત સાધનોમાં દાખલ કરવામાં આવતા નથી. ઇનપુટ પહેલાં ડેટાનું વર્ગીકરણ કરો, વર્ગ દ્વારા એજન્ટ પસંદ કરો, રહસ્યો બહાર કાઢો, PII માસ્ક કરો અથવા સિન્થેટિક ડેટાનો ઉપયોગ કરો, સંદર્ભ ઓછો કરો અને રહસ્યો માટે આઉટપુટ સ્કેન કરો. જો કોઈ લીક હોય, તો પ્રથમ વસ્તુ: ઓળખપત્ર પરત કરો અને તેની જાણ કરો.

એપ્લિકેશન કાર્ય

કોડ/લોગ/ડેટાનો એક ભાગ લો જે તમે તાજેતરમાં AI ને આપેલ છે (અથવા આપવાનું વિચારી રહ્યા છો). પ્રથમ, "માસ્કીંગ ચેકલિસ્ટ" ટેમ્પલેટ વડે ગુપ્ત અને PII ઉમેદવારોને ઓળખો. પછી, જો તેમાં વાસ્તવિક ડેટા હોય, તો "સિન્થેટીક ટેસ્ટ ડેટા જનરેશન" ટેમ્પલેટ જેવું જ સંસ્કરણ બનાવો પરંતુ સંપૂર્ણ રીતે બનેલું હોય, અને તેની સાથે તમારી સમસ્યાને પુનઃઉત્પાદન કરી શકાય તેવું બનાવો. છેલ્લે, તમારી સંસ્થાની માન્ય સાધન સૂચિ અને ડેટા વર્ગીકરણ નીતિ શોધો અને વાંચો; નહિંતર, આ અવગણનાની નોંધ લો.

ચેકલિસ્ટ

  • [ ] ડેટા દાખલ કરતા પહેલા હું તેને વર્ગીકૃત કરું છું (ખુલ્લો/આંતરિક/ગોપનીય/નિયમનને આધીન).
  • [ ] હું ક્યારેય રહસ્યો, PII અને ગોપનીય વ્યાપારી અસ્કયામતોને અપ્રુવ્ડ ટૂલ્સમાં દાખલ કરતો નથી.
  • જ્યારે પણ શક્ય હોય ત્યારે વાસ્તવિક ડેટાને બદલે હું માસ્કિંગ અથવા સિન્થેટિક ડેટાનો ઉપયોગ કરું છું.
  • [ ] હું સંદર્ભને નાનામાં નાના ઉદાહરણ સુધી ઘટાડું છું જેમાં સંવેદનશીલ ભાગોનો સમાવેશ થતો નથી.
  • [ ] હું સખત દફનાવવામાં આવેલા રહસ્ય માટે AI આઉટપુટને સ્કેન કરું છું.
  • [ ] હું જાણું છું કે જો રહસ્ય લીક થશે, તો હું તરત જ ઓળખની માહિતી પરત કરીશ અને ઘટનાની જાણ કરીશ.