નફો:
- MLOps તબક્કાઓ (પ્રકાશન, જમાવટ, દેખરેખ, પુનઃપ્રશિક્ષણ, રોલબેક) અને મોડેલ ડ્રિફ્ટને સમજવાની ક્ષમતા અને મોનિટર કરેલ જમાવટની યોજના
- મોડેલ ઔચિત્ય, પારદર્શિતા અને જવાબદારીના સિદ્ધાંતોને લાગુ કરવાની ક્ષમતા અને નૈતિક સ્વીકાર્યતાથી આંકડાકીય ચોકસાઈને અલગ પાડવાની ક્ષમતા
- KVKK/GDPR સિદ્ધાંતો સાથે વ્યક્તિગત ડેટાને સુરક્ષિત કરવાની ક્ષમતા અને ઉચ્ચ પ્રભાવવાળા નિર્ણયોમાં માનવીને અંતિમ જવાબદારી સોંપવાની ક્ષમતા
મોડેલને તાલીમ આપવી અને ઉચ્ચ સ્કોર મેળવવો એ અંત નથી, પરંતુ મધ્યમ છે. વાસ્તવિક મૂલ્ય ત્યારે આવે છે જ્યારે મોડેલ ઉત્પાદનમાં મૂકવામાં આવે છે અને વિશ્વસનીય રીતે કાર્ય કરે છે, સમય જતાં બગાડ વિના તેનું નિરીક્ષણ કરવામાં આવે છે, અને સમગ્ર પ્રક્રિયા નૈતિક અને કાનૂની સીમાઓની અંદર હાથ ધરવામાં આવે છે. આ બંધ એકમ ત્રણ વિષયોને જોડે છે: MLOps (મૉડલને લાઇવ કરવા, દેખરેખ રાખવા અને જાળવવાની શિસ્ત), નીતિશાસ્ત્ર (ન્યાયીતા, પારદર્શિતા, બિન-દુષ્ટતા) અને ગોપનીયતા (વ્યક્તિગત ડેટાનું રક્ષણ). AI આ વિસ્તારોમાં કોડ, ચેકલિસ્ટ અને બ્લુપ્રિન્ટ્સ બનાવે છે; પરંતુ માણસો નક્કી કરે છે કે શું મોડેલ લાઇવ થાય છે, કોને અસર થશે અને કયા ડેટાનો ઉપયોગ કરી શકાય છે. આ નિર્ણયો તકનીકી નથી, પરંતુ જવાબદારીના નિર્ણયો છે.
MLOps: મોડેલ ઉત્પાદનની જેમ જીવે છે
MLOps (મશીન લર્નિંગ ઑપરેશન્સ - ઉત્પાદનમાં મશીન લર્નિંગ મૉડલ્સને ચલાવવા, દેખરેખ રાખવા અને અપડેટ કરવાની પ્રથા) એ ડેટા વિજ્ઞાનમાં સૉફ્ટવેર ડેવલપમેન્ટમાં DevOps નું અનુકૂલન છે. મૂળભૂત વિચાર: મોડેલ એ એક ફાઇલ નથી કે જેને એકવાર તાલીમ આપવામાં આવે અને ભૂલી જાય, પરંતુ જીવંત ઉત્પાદન કે જેને સતત જાળવણીની જરૂર હોય. મુખ્ય તબક્કાઓ:
1. વર્ઝનિંગ: કોડ (Git), ડેટા અને મોડેલ એકસાથે વર્ઝન કરવામાં આવે છે; તે રેકોર્ડ કરવામાં આવે છે કે કયા મોડેલનું ઉત્પાદન કયા ડેટા અને કોડ સાથે કરવામાં આવ્યું હતું.
2. જમાવટ: મોડેલને API અથવા બેચ જોબ તરીકે લાઇવ મૂકવામાં આવે છે. તે સામાન્ય રીતે પહેલા નાના પ્રેક્ષકોને આપવામાં આવે છે (શેડ/કેનેરી વિતરણ).
3. મોનીટરીંગ: મોડેલ અને ઇનપુટ ડેટાની કામગીરીનું સતત નિરીક્ષણ કરવામાં આવે છે.
4. પુનઃપ્રશિક્ષણ: જ્યારે કામગીરીમાં ઘટાડો થાય છે, ત્યારે મોડલને અપડેટ કરેલા ડેટા સાથે ફરીથી તાલીમ આપવામાં આવે છે.
પેટર્ન શિફ્ટ: શાંત વિકૃતિ
ઉત્પાદનમાં સૌથી મોટો ભય મોડેલ ડ્રિફ્ટ (મોડલ ડ્રિફ્ટ/ડેટા ડ્રિફ્ટ) છે. વિશ્વ બદલાય છે; જે શરતો પર તમે તમારા મોડલને તાલીમ આપી છે (ગ્રાહકની વર્તણૂક, કિંમતો, મોસમ, કાયદો) સમય જતાં બદલાય છે અને મોડલ અપ્રચલિત થવાનું શરૂ કરે છે. ઉદાહરણ તરીકે, રોગચાળા પહેલાં પ્રશિક્ષિત માંગ મોડેલ રોગચાળા દરમિયાન સંપૂર્ણપણે ખોટું છે. ડ્રિફ્ટ બે સ્વરૂપોમાં થાય છે: ડેટા ડ્રિફ્ટ (ઇનપુટ ડેટા ફેરફારોનું વિતરણ) અને કોન્સેપ્ટ ડ્રિફ્ટ (ઇનપુટ અને લક્ષ્ય ફેરફારો વચ્ચેનો સંબંધ). આને કેપ્ચર કરવાની રીત મોનિટરિંગ છે: ઇનપુટ વિતરણ, આગાહી વિતરણ અને (જો શક્ય હોય તો) વાસ્તવિક પરિણામની તુલનામાં પ્રદર્શનને સતત ટ્રૅક કરો.
સાવધાની: ઉત્પાદનમાં મૂકવામાં આવેલ મોડેલ તેના પોતાના પર બગડશે; તે "જો" પરંતુ "ક્યારે" ની બાબત નથી. મોનિટરિંગ સેટ કર્યા વિના મૉડલ ગોઠવવું એ તેના એન્જિનને ક્યારેય નિયંત્રિત કર્યા વિના કાર ચલાવવા જેવું છે; એક દિવસ તે ત્યાં શાંતિથી બેસે છે અને તમે ધ્યાન આપતા નથી.
MLOps તત્વ
હેતુ
જો ઉપેક્ષા કરવામાં આવે છે
વર્ઝનીંગ
શું ઉત્પન્ન થાય છે તે જાણીને
બિન-પ્રજનનક્ષમ, બિન-ટ્રેસેબલ
મોનીટરીંગ
કાપલી વહેલી જોઈ
મોડેલ શાંતિથી તૂટી જાય છે
પુનઃપ્રશિક્ષણ
અદ્યતન રહો
આગાહીઓ જૂની થાય છે
રોલબેક
ખરાબ મોડેલ પર પાછા ફરો
ખામીયુક્ત મોડેલ જીવંત રહે છે
દસ્તાવેજીકરણ
પારદર્શિતા, ટર્નઓવર
માહિતી એક વ્યક્તિમાં અટકી જાય છે
નીતિશાસ્ત્ર: મોડેલ નિર્ણયો લોકોને અસર કરે છે
લોકોના જીવનને અસર કરતા નિર્ણયોમાં ડેટા મોડલનો વધુને વધુ ઉપયોગ થાય છે: ક્રેડિટ, ભરતી, વીમો, ન્યાય. આ શક્તિ સાથે જવાબદારી આવે છે. મુખ્ય નૈતિક જોખમો:
પૂર્વગ્રહ અને ભેદભાવ: મોડેલ ઐતિહાસિક ડેટામાં અન્યાય શીખી શકે છે અને તેને કાયમી બનાવી શકે છે. જો કોઈ ચોક્કસ જૂથને ભૂતકાળમાં ઓછી ક્રેડિટ આપવામાં આવી હોય, તો મોડેલ ધારે છે કે આ એક "નિયમ" છે અને ભેદભાવને સ્વચાલિત કરે છે. એટલા માટે ઔચિત્યનું વિશ્લેષણ - મોડેલ વિવિધ જૂથો (લિંગ, ઉંમર, પ્રદેશ) માટે સમાન કાર્ય કરે છે કે કેમ તે તપાસવું - આવશ્યક છે.
પારદર્શિતા અને સ્પષ્ટતા: તમે સમજાવવા માટે સમર્થ હોવા જોઈએ કે શા માટે મોડેલે વ્યક્તિને નકારી કાઢી. "બ્લેક બોક્સે આમ કહ્યું" એ નૈતિક રીતે અને ઘણીવાર કાયદેસર રીતે અસ્વીકાર્ય છે. એટલા માટે સમજાવી શકાય તેવા સાધનો (સુવિધાનું મહત્વ, SHAP મૂલ્યો) મૂલ્યવાન છે.
જવાબદારી: જો મોડલ ખોટો નિર્ણય લે તો જવાબદાર કોણ? જવાબ હંમેશા વ્યક્તિ/સંસ્થા હોય છે, મોડેલ નહીં. માનવીય દેખરેખ (હ્યુમન-ઇન-ધ-લૂપ - અંતિમ નિર્ણયને મંજૂર કરનાર માનવ) ઉચ્ચ અસરવાળા નિર્ણયોમાં સાચવવામાં આવવી જોઈએ.
સાવધાન: મોડેલ આંકડાકીય રીતે "સાચો" હોઈ શકે છે પરંતુ નૈતિક રીતે અસ્વીકાર્ય છે. એક અત્યંત સચોટ મોડલ કે જે વ્યવસ્થિત રીતે એક જૂથને ગેરલાભ પહોંચાડે તે સારું મોડલ નથી. પ્રામાણિકતા ન્યાયનો વિકલ્પ નથી.
ગોપનીયતા: વ્યક્તિગત ડેટા કાળજીપૂર્વક સુરક્ષિત છે
ડેટા સાયન્સનો કાચો માલ ઘણીવાર વ્યક્તિગત ડેટા હોય છે, અને આ ડેટા કાયદા દ્વારા સુરક્ષિત છે: Türkiye માં KVKK, યુરોપમાં GDPR. મૂળભૂત સિદ્ધાંતો છે: હેતુ મર્યાદા (ડેટા જે હેતુ માટે એકત્રિત કરવામાં આવ્યો હતો તે હેતુ સિવાયના હેતુઓ માટે ઉપયોગમાં લેવાતો નથી), ડેટા ન્યૂનતમ (જરૂરી કરતાં વધુ ડેટા એકત્રિત/જાળવવામાં આવતો નથી), અનામીકરણ (માહિતી ઓળખી કાઢવામાં આવે છે) અને સુરક્ષા (ડેટા એન્ક્રિપ્ટેડ રાખવામાં આવે છે અને ઍક્સેસ પ્રતિબંધિત છે). AI ટૂલ્સ સાથે કામ કરતી વખતે મહત્વપૂર્ણ નિયમ: સાર્વજનિક AI ટૂલમાં વાસ્તવિક વ્યક્તિગત ડેટા ક્યારેય પેસ્ટ કરશો નહીં. મોટાભાગે, ડાયાગ્રામ અને અનામી/કૃત્રિમ નમૂના વિશ્લેષણ માટે પૂરતા હોય છે.
માહિતી સુરક્ષાના સંદર્ભમાં એક વધારાનો ભાર: રક્ષણાત્મક અને કાયદેસર વિશ્લેષણ હેતુઓ માટે માત્ર ડેટા અને સિસ્ટમ્સ પર ડેટા સાયન્સ ટૂલ્સ અને તકનીકોનો ઉપયોગ કરો જેના માટે તમારી પાસે સત્તા છે. અન્ય કોઈના ડેટાની અનધિકૃત ઍક્સેસ, વ્યક્તિઓની ફરીથી ઓળખ (અનામી ડેટામાંથી ઓળખ કાઢવા) અથવા અનધિકૃત પ્રોફાઇલિંગ બંને ગેરકાયદેસર અને અનૈતિક છે.
ત્રણ નાના કેસો
કેસ 1 — ટ્રેક ન કરાયેલ પતન. એક ઈ-કોમર્સ કંપની તેના ભલામણ મોડલ સાથે લાઈવ થઈ ગઈ અને તેણે ટ્રેકિંગ સેટ કર્યું નહીં. 4 મહિના પછી ઉત્પાદન સૂચિ મોટા પ્રમાણમાં બદલાઈ ગઈ છે; મોડલ જૂના ઉત્પાદનોની ભલામણ કરવાનું ચાલુ રાખ્યું, અને રૂપાંતરણ દર શાંતિથી 30% જેટલો ઘટી ગયો. મહિનાઓ સુધી કોઈએ ધ્યાન ન આપ્યું. પાઠ: દેખરેખ વિના જમાવટ અંધ બની રહી છે.
કેસ 2 - છુપાયેલ ભેદભાવ. હાયરિંગ સ્ક્રિનિંગ મોડેલે ઐતિહાસિક ડેટામાં લિંગ અસંતુલન અને વ્યવસ્થિત રીતે અન્ડરરેટેડ મહિલા ઉમેદવારો વિશે શીખ્યા. તે ધ્યાનમાં આવ્યું ન હતું કારણ કે ત્યાં કોઈ વાજબી વિશ્લેષણ ન હતું; તે ઓડિટમાં બહાર આવ્યું હતું અને સંસ્થાને ગંભીર પ્રતિષ્ઠા/કાનૂની જોખમનો સામનો કરવો પડ્યો હતો. પાઠ: ઉચ્ચ પ્રભાવવાળા મોડલ્સમાં જૂથ-આધારિત ઔચિત્ય નિયંત્રણ આવશ્યક છે.
કેસ 3 - ગોપનીયતાનો ભંગ. એક વિશ્લેષકે સાર્વજનિક AI ટૂલમાં વાસ્તવિક ગ્રાહક ઇમેઇલ્સ અને ખરીદી ઇતિહાસ ધરાવતી ફાઇલ લોડ કરી અને કહ્યું, "સેગમેન્ટ્સનો સારાંશ આપો." વ્યક્તિગત ડેટા સંસ્થા છોડી ગયો છે; KVKK પ્રક્રિયા શરૂ થઈ ગઈ છે. સાચો રસ્તો ઓળખના ક્ષેત્રોને દૂર કરવાનો હતો અને ફક્ત અનામી ગુણધર્મોને શેર કરવાનો હતો. પાઠ: વાસ્તવિક વ્યક્તિગત ડેટા ઓપન ટૂલમાં દાખલ થતો નથી.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) પ્રી-ડિપ્લોયમેન્ટ ચેકલિસ્ટ:
તમારી ભૂમિકા: MLOps સલાહકાર. ઉત્પાદનમાં મોડેલ મૂકતા પહેલા મારે જે વસ્તુઓની તપાસ કરવાની જરૂર છે તેની સૂચિ બનાવો: વર્ઝનિંગ, મોનિટરિંગ મેટ્રિક્સ, રોલબેક પ્લાન, પ્રદર્શન થ્રેશોલ્ડ, ડેટા ડ્રિફ્ટ ચેતવણી, જવાબદાર વ્યક્તિ. દરેક આઇટમ માટે એક-વાક્ય "તે કેમ મહત્વનું છે" સમજૂતી ઉમેરો. હું નક્કી કરીશ.
2) મોડલ શિફ્ટ ટ્રેકિંગ ડિઝાઇન:
ઉત્પાદનમાં વર્ગીકરણ મોડલ માટે ડ્રિફ્ટ મોનિટરિંગ પ્લાન સૂચવો: (1) મારે કયા ઇનપુટ વિતરણોનું નિરીક્ષણ કરવું જોઈએ, (2) આગાહી વિતરણ માટે કયા એલાર્મ, (3) વાસ્તવિક પરિણામ આવે ત્યારે પ્રદર્શનની તુલના કેવી રીતે કરવી, (4) કયા થ્રેશોલ્ડ પર ફરીથી તાલીમ શરૂ કરવી જોઈએ. કોડ હાડપિંજર પણ પ્રદાન કરો.
3) નિષ્પક્ષતા નિયંત્રણ:
કોડ લખો જે વિવિધ જૂથો માટે મારા મોડેલના પ્રદર્શનની તુલના કરે છે (દા.ત. વય બેન્ડ, પ્રદેશ): દરેક જૂથ માટે રિકોલ/ચોકસાઇ અને હકારાત્મક નિર્ણય દર. જો જૂથો વચ્ચે નોંધપાત્ર તફાવત હોય તો ચેતવણી આપો. કાર્યકારણ/રાજકીય અર્થઘટન કરવું; ફક્ત મને તફાવતો બતાવો અને હું નિર્ણય પર વિચાર કરીશ.
4) ગોપનીયતા પૂર્વ-તપાસ:
AI ટૂલને ડેટા આપતા પહેલા, તપાસો: શું નીચેની કૉલમ સૂચિમાં વ્યક્તિગત/ઓળખનો ડેટા (નામ, ઇમેઇલ, ID, ફોન, સરનામું, IP) છે? જો એમ હોય, તો સૂચિબદ્ધ કરો કે કયાને દૂર કરવા અથવા અનામી રાખવા જોઈએ. કૉલમ્સ: [સૂચિ]. હેતુ: માત્ર અનામી સ્કીમા શેર કરવા માટે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
મારું મોડેલ તૈયાર છે, લાઇવ જાઓ.
જમાવટ એક પગલું નથી; મોનિટરિંગ, રોલબેક, ઔચિત્ય અને ગોપનીયતા નિયંત્રણ વિના લાઇવ થવું એ આપત્તિ માટેનું મૌન આમંત્રણ છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: જવાબદાર MLOps સલાહકાર. મારા મોડેલને તાલીમ આપવામાં આવી છે, હું લાઇવ કરતા પહેલા સંપૂર્ણ તૈયારી કરવા માંગુ છું. જનરેટ કરો: (1) પ્રી-ડિપ્લોયમેન્ટ ચેકલિસ્ટ, (2) ડ્રિફ્ટ મોનિટરિંગ પ્લાન, (3) ગ્રુપ-આધારિત ફેરનેસ ચેક કોડ, (4) ગોપનીયતા તપાસ (વ્યક્તિગત ડેટા છે). ઉચ્ચ અસરવાળા નિર્ણયોમાં માનવ સંમતિનું રક્ષણ કેવી રીતે કરવું તે પણ સૂચવો. અંતિમ નિર્ણયો મારા છે.
અહીં વિતરણ, દેખરેખ, વાજબીતા અને ગોપનીયતાને એક જવાબદાર પ્રક્રિયા તરીકે ગણવામાં આવે છે.
સામાન્ય ભૂલો
- મોનિટરિંગ સેટ કર્યા વિના મોડેલનો ઉપયોગ. મોડેલ ચુપચાપ સ્લિપ અને વિકૃત; નોટિસ કરવામાં મહિનાઓ લાગી શકે છે.
- ન્યાય તપાસ બાયપાસ. ઉચ્ચ-વફાદારી મોડેલ વ્યવસ્થિત રીતે જૂથને નુકસાન પહોંચાડી શકે છે.
- એક અસ્પષ્ટ બ્લેક બોક્સ નિર્ણય લેવો. ઉચ્ચ અસરવાળા નિર્ણયો સમજાવી શકાય તેવા હોવા જોઈએ; "મોડેલે આમ કહ્યું" પૂરતું નથી.
- AI ટૂલ ખોલવા માટે વાસ્તવિક વ્યક્તિગત ડેટા આપવો. KVKK/GDPR ઉલ્લંઘન; આકૃતિ અને અનામી ઉદાહરણ પૂરતું છે.
- મોડેલને નિર્ણય સોંપવો. જવાબદારી હંમેશા વ્યક્તિ સાથે રહે છે; ઉચ્ચ અસર માનવ દેખરેખ રાખવામાં આવે છે.
ટિપ: તમે દરેક મૉડલ સાથે લાઇવ જાઓ તે પહેલાં, મોટેથી એક પ્રશ્ન પૂછો: "જો આ મૉડલ કાલે શાંતિથી તૂટી જાય છે અથવા જૂથને અન્યાયી રીતે દંડ કરે છે, તો હું તેને કેવી રીતે નોટિસ કરીશ અને તેને પાછું ફેરવીશ?" જો તમારી પાસે આ પ્રશ્નનો સ્પષ્ટ જવાબ નથી, તો મોડેલ હજી ઉત્પાદન માટે તૈયાર નથી.
સારાંશમાં
મોડેલનું કામ ઉચ્ચ સ્કોર સાથે સમાપ્ત થતું નથી, પરંતુ ઉત્પાદનમાં વિશ્વસનીય અને જવાબદારીપૂર્વક કામ કરવા સાથે. MLOps એ લાઇવ જવાની, ડ્રિફ્ટ માટે દેખરેખ રાખવાની, ફરીથી તાલીમ આપવા અને મોડલને પાછું ફેરવવાની શિસ્ત છે; ટ્રેકિંગ વિના જમાવટ એ શાંત પતન છે. નૈતિકતા માટે મોડેલની નિષ્પક્ષતા, પારદર્શિતા અને જવાબદારી જરૂરી છે; આંકડાકીય ચોકસાઈ એ નૈતિક સ્વીકાર્યતા માટે કોઈ વિકલ્પ નથી. ગોપનીયતાનો અર્થ છે કેવીકેકે/જીડીપીઆર સિદ્ધાંતો સાથે વ્યક્તિગત ડેટાનું રક્ષણ કરવું અને વાસ્તવિક ડેટાને ખુલ્લા સાધનોથી દૂર રાખવો. આ તમામ નિર્ણયો ટેકનિકલ નથી પરંતુ જવાબદારીના નિર્ણયો છે અને હંમેશા માનવીના છે.
એપ્લિકેશન કાર્ય
એવું વિચારો કે તમે ઉત્પાદનમાં તમે બનાવેલ (અથવા કાલ્પનિક) મોડેલ મૂકવા જઈ રહ્યા છો અને ચાર સૂચિઓ ભરો: (1) પ્રી-ડિપ્લોયમેન્ટ ચેકલિસ્ટ, (2) ડ્રિફ્ટ મેટ્રિક્સ તમે ટ્રૅક કરશો, (3) જૂથ-આધારિત ઔચિત્ય નિયંત્રણ યોજના, (4) ગોપનીયતા નિયંત્રણ. પછી પ્રશ્નનો નક્કર જવાબ લખો "જો કાલે તે શાંતિપૂર્વક તૂટી જશે અને તેને પાછું મેળવશે તો હું કેવી રીતે નોટિસ કરીશ?"
ચેકલિસ્ટ
- [ ] શું હું મોનિટરિંગ (સ્લિપ એલર્ટ) અને રોલબેક પ્લાન સાથે મોડલનો ઉપયોગ કરી રહ્યો છું?
- [ ] શું મેં જુદા જુદા જૂથો માટે નિષ્પક્ષતા/પ્રદર્શન તફાવતની તપાસ કરી છે?
- [ ] શું મેં ઉચ્ચ પ્રભાવવાળા નિર્ણયો પર માનવ-ઇન-ધ-લૂપ જાળવી રાખ્યો છે?
- [ ] શું મેં KVKK/GDPR સિદ્ધાંતો સાથે વ્યક્તિગત ડેટાને સુરક્ષિત રાખ્યો છે અને તેને ખુલ્લા સાધનોથી દૂર રાખ્યો છે?
- [ ] શું મેં આખરી જવાબદારી માણસ પર મૂકી છે, મોડેલ પર નહીં?
મોડ્યુલ પરીક્ષા
1. એક ડેટા સાયન્ટિસ્ટ આર્ટિફિશિયલ ઈન્ટેલિજન્સને પૂછે છે, "આ ડેટા પર રેન્ડમ ફોરેસ્ટ કેટલું સચોટ છે?" મોડેલને બિલકુલ તાલીમ આપ્યા વિના, અને સીધા જ પ્રસ્તુતિમાં "89%" નો જવાબ મૂકે છે. આ અભિગમમાં મૂળભૂત ભૂલ શું છે?
- એ) કૃત્રિમ બુદ્ધિમત્તાને ડેટા અને મોડેલ આપ્યા વિના મેટ્રિક્સની રાહ જોવી; અવગણવું કે તે જે નંબર બનાવે છે તે નકલી છે અને વાસ્તવિક મેટ્રિક ફક્ત તાલીમ અને પરીક્ષણ દ્વારા જ શોધી શકાય છે ✔
- બી) રેન્ડમ ફોરેસ્ટને બદલે લોજિસ્ટિક રીગ્રેશનનો ઉપયોગ કરવો જોઈએ
- C) ચોકસાઈ દર હંમેશા 90% થી ઉપર હોવો જોઈએ.
- ડી) પ્રસ્તુતિમાં મેટ્રિક્સ શામેલ કરવા માટે સખત પ્રતિબંધિત છે
સમજૂતી: આર્ટિફિશિયલ ઇન્ટેલિજન્સ મોડેલ અને ડેટાને એક્સેસ કર્યા વિના મેટ્રિક પેદા કરી શકતું નથી; તે જે નંબર આપે છે તે આભાસ (બનાવટ) છે. મોડલને ખરેખર પ્રશિક્ષિત અને પરીક્ષણ કર્યા પછી જ ડેટા વૈજ્ઞાનિકની પોતાની ગણતરી દ્વારા મેટ્રિક મેળવવામાં આવે છે. વણચકાસાયેલ આઉટપુટ સહી વિનાના અહેવાલ જેવું છે.
2. મંથન આગાહી માટે ડેટા એકત્રિત કરતી વખતે 'એકાઉન્ટ બંધ થવાનું કારણ' કૉલમનો સમાવેશ થાય છે; ગ્રાહક ગયા પછી જ આ કોલમ ભરાય છે. મોડેલ ટેસ્ટ સેટ પર 97% આપે છે, પરંતુ ઉત્પાદનમાં કામ કરતું નથી. આ સ્થિતિનું નામ અને કારણ શું છે?
- એ) ઓવરલર્નિંગ; મોડેલ ખૂબ જટિલ છે
- બી) ડેટા લીક; ✔ એવી માહિતીનો ઉપયોગ કરવો જે અનુમાન સમયે ઉપલબ્ધ નહીં હોય, પરંતુ એક લક્ષણ તરીકે લક્ષ્યનું પરિણામ છે
- સી) અપર્યાપ્ત શિક્ષણ; મોડેલ ખૂબ સરળ છે
- ડી) પસંદગી પૂર્વગ્રહ; નાના નમૂનાનું કદ
સમજૂતી: આ ક્લાસિક ડેટા લીક છે: 'બંધ થવાનું કારણ' લક્ષ્યનું પરિણામ છે અને આગાહીના સમયે હજુ પણ ખાલી છે. મોડેલ આ ભાવિ જ્ઞાન સાથે યુક્તિ કરે છે, તે ટેસ્ટ સેટ પર સરસ લાગે છે પરંતુ ઉત્પાદનમાં ક્રેશ થાય છે કારણ કે તે કૉલમ ખાલી છે. દરેક કૉલમને 'શું આગાહી સમયે મારી પાસે તે છે' એવો પ્રશ્ન પૂછવો જોઈએ.
3. એક વિશ્લેષક સરેરાશ સાથે આવક કૉલમમાં ખૂટતા મૂલ્યો ભરે છે; પરંતુ ગુમ થયેલા લોકો વાસ્તવમાં ઓછી આવક ધરાવતા વર્ગના છે જેમણે ક્યારેય આવક જાહેર કરી નથી (વ્યવસ્થિત રીતે ખૂટે છે). શા માટે આ ભરણ ખોટું છે?
- A) સરેરાશ હંમેશા મધ્યક કરતા વધારે હોય છે, તેથી તે ખોટું છે
- બી) ખૂટતા મૂલ્યો ક્યારેય ભરવા જોઈએ નહીં, તે હંમેશા કાઢી નાખવા જોઈએ
- સી) સરેરાશ સાથે વ્યવસ્થિત અંતર ભરવાથી તે જૂથને કૃત્રિમ રીતે રજૂ કરીને ડેટા વિકૃત થાય છે; 'કેમ ખાલી છે?' એવો પ્રશ્ન પૂછ્યા વગર ભરવાનું કામ કરવામાં આવ્યું હતું. ✔
- ડી) સરેરાશની ગણતરી કરવાથી કામગીરીની સમસ્યા સર્જાય છે કારણ કે તે ખૂબ ધીમું છે
સમજૂતી: ઉણપનું કારણ ઉકેલ નક્કી કરે છે. જ્યારે વ્યવસ્થિત રીતે ખૂટે છે (ચોક્કસ જૂથમાં કેન્દ્રિત ગેપ) સરેરાશથી ભરવામાં આવે છે, ત્યારે તે જૂથ કૃત્રિમ રીતે 'સરેરાશ આવક' બની જાય છે અને ડેટા વિકૃત થાય છે. તેને ભરતાં પહેલાં 'કેમ ખાલી છે' એવો પ્રશ્ન પૂછવો જોઈએ; વ્યવસ્થિત/નોંધપાત્ર ખૂટતો સરેરાશ ભરવો જોઈએ નહીં.
4. એક ટીમ 'જાહેરાત ખર્ચ' અને 'વેચાણ' વચ્ચે 0.78 સહસંબંધ શોધે છે અને બજેટને બમણું કરે છે; જો કે, જે વાસ્તવમાં બંનેને ટ્રિગર કરે છે તે મોસમી ઝુંબેશ છે. આંકડાઓમાં કયો સિદ્ધાંત આ ભૂલને સમજાવે છે?
- એ) સહસંબંધ કારણભૂત નથી; છુપાયેલ ત્રીજું ચલ બંને ચલોને અસર કરી શકે છે ✔
- બી) 0.78 નો સહસંબંધ ખૂબ ઓછો હોવાથી, સંબંધને અવગણવો જોઈએ
- સી) સહસંબંધ હંમેશા કારણને સાબિત કરે છે, ટીમને તે બરાબર મળ્યું
- ડી) જાહેરાત અને વેચાણ વચ્ચેના સહસંબંધની ગણતરી ગાણિતિક રીતે કરી શકાતી નથી.
સમજૂતી: સહસંબંધ એ કારણ નથી. બે ચલો એકસાથે કાર્ય કરી શકે છે કારણ કે છુપાયેલ ત્રીજું ચલ (અહીં મોસમી ઝુંબેશ) બંનેને અસર કરે છે. નિષ્કર્ષ કે એક અન્ય કારણ બને છે તે માત્ર પ્રયોગ અને ક્ષેત્ર જ્ઞાન દ્વારા સ્થાપિત કરી શકાય છે; એકલા સહસંબંધોની સંખ્યા જ કાર્યકારણનો પુરાવો નથી.
5. છેતરપિંડી શોધ મોડલ 99.2% ચોકસાઈ દર્શાવે છે અને ટીમ ઉજવણી કરે છે; જો કે, ડેટામાં નકલી વ્યવહારનો દર માત્ર 0.8% છે અને મોડલનો રિકોલ 6% છે. આ ટેબલ શું બતાવે છે?
- A) મોડેલ સંપૂર્ણ છે કારણ કે ચોકસાઈ 99% થી વધુ છે
- બી) અસંતુલિત ડેટા સાથે ચોકસાઈ ભ્રામક છે; મોડેલ લગભગ તમામ બનાવટી (ઓછી યાદ) ચૂકી જાય છે, યોગ્ય મેટ્રિક ✔ પર જોવું જોઈએ
- C) મોડલનું રિકોલ વધારે હોવાથી કોઈ સમસ્યા નથી
- ડી) નકલી દર ઓછો હોવાથી મોડેલ બનાવવાની જરૂર નહોતી
સમજૂતી: અસંતુલિત ડેટામાં 'ચોક્કસતા' ગેરમાર્ગે દોરનારી છે. જ્યારે મોડેલ લગભગ દરેક ટ્રાન્ઝેક્શનને 'ક્લિન' કહે છે, ત્યારે તે ઉચ્ચ ચોકસાઈ મેળવે છે કારણ કે નકલી ખૂબ ઓછી હોય છે, પરંતુ તે નકલી પકડવામાં નિષ્ફળ જાય છે, જે તેનો મુખ્ય હેતુ છે (6% યાદ કરો). તેથી, અસંતુલિત સમસ્યાઓમાં, ધ્યાન ચોકસાઈ પર નથી, પરંતુ કામના હેતુ માટે યોગ્ય મૂંઝવણ મેટ્રિક્સ અને મેટ્રિક્સ પર છે, જેમ કે યાદ/ચોક્કસતા.
6. ડિમાન્ડ ફોરકાસ્ટિંગ પ્રોજેક્ટમાં, સમય-આધારિત ડેટા રેન્ડમ રીતે તાલીમ/પરીક્ષણમાં વિભાજિત થાય છે. મોડેલ 93% ચોકસાઈ આપે છે પરંતુ ઉત્પાદનમાં ક્રેશ થાય છે. યોગ્ય વિભાજન અભિગમ શું હોવો જોઈએ?
- A) ટેસ્ટ સેટને મોટું કરવું, દા.ત. વિભાજન 50%/50%
- બી) વધુ જટિલ મોડેલનો ઉપયોગ કરીને
- C) પાર્ટીશનને સંપૂર્ણપણે દૂર કરો અને તમામ ડેટા સાથે ટ્રેન કરો
- ડી) કાલક્રમિક વિભાજન: જૂના સમયગાળા સાથે તાલીમ અને નવા સમયગાળા સાથે પરીક્ષણ, આમ મોડેલને ભવિષ્ય જોવાથી અટકાવે છે ✔
સમજૂતી: જો સમય શ્રેણીના ડેટામાં રેન્ડમ વિભાજન કરવામાં આવે, તો મોડેલ ભવિષ્ય જુએ છે અને તાલીમમાં ભૂતકાળની આગાહી કરે છે; તે એક લીક છે અને સફળતા ઉત્પન્ન કરે છે જે વાસ્તવમાં અસ્તિત્વમાં નથી. સાચો અભિગમ કાલક્રમિક વિભાજન છે: જૂના સમયગાળા સાથે તાલીમ અને નવા સમયગાળા સાથે પરીક્ષણ, ઉત્પાદનમાં વાસ્તવિક પરિસ્થિતિનું અનુકરણ (ભૂતકાળથી ભવિષ્યની આગાહી).
7. ફીચર એન્જિનિયરિંગમાં કયા ડેટામાંથી સ્કેલિંગ (સ્ટાન્ડર્ડસ્કેલર) પરિમાણોની ગણતરી કરવી જોઈએ અને તેને કેવી રીતે લાગુ કરવી જોઈએ?
- A) તે બધા ડેટા (તાલીમ + પરીક્ષણ એકસાથે) માંથી ગણતરી કરવી જોઈએ જેથી તે વધુ સચોટ હોય
- બી) દરેક પંક્તિ માટે તે પંક્તિના પોતાના મૂલ્યથી અલગથી ગણતરી કરવી જોઈએ
- C) માત્ર ટેસ્ટ ડેટા પરથી જ ગણતરી કરવી જોઈએ
- ડી) તેની ગણતરી ફક્ત તાલીમ ડેટામાંથી જ થવી જોઈએ, પછી તે જ પરિમાણો પરીક્ષણ ડેટા પર લાગુ કરવા જોઈએ; અન્યથા તે લીક થશે ✔
સમજૂતી: સ્કેલિંગ, એન્કોડિંગ અને પેડિંગ જેવા તમામ રૂપાંતરણોના પરિમાણો (માર્ગ, પ્રમાણભૂત વિચલન, વગેરે) ફક્ત તાલીમ ડેટામાંથી જ શીખવા જોઈએ, પછી તે જ પરીક્ષણ ડેટા પર લાગુ થવું જોઈએ. કસોટીના ડેટાને ધ્યાનમાં લેવાથી પણ પરીક્ષણની માહિતી તાલીમમાં દખલ થાય છે, એટલે કે લીકેજ, અને મોડલ તેના કરતાં વધુ સારું દેખાય છે. પાઇપલાઇનનો ઉપયોગ આની ખાતરી કરે છે.
8. એક મોડેલ પ્રશિક્ષણ સેટ પર 98% અને ટેસ્ટ સેટ પર 72% ચોકસાઈ આપે છે. આ લક્ષણ શું સૂચવે છે અને શું કરવું જોઈએ?
- એ) અપર્યાપ્ત શિક્ષણ; મોડેલ વધુ જટિલ બનાવવું જોઈએ
- બી) ડેટા લીક; ટેસ્ટ સેટ બદલવો આવશ્યક છે
- સી) ઓવરફિટિંગ; મોડેલને સરળ બનાવવું જોઈએ, નિયમિતકરણ અને ક્રોસ-વેલિડેશન લાગુ કરવું જોઈએ ✔
- ડી) એક સામાન્ય પરિસ્થિતિ; કોઈપણ રીતે શિક્ષણનો સ્કોર હંમેશા ઊંચો હોય છે, સાવચેતીઓ બિનજરૂરી છે
સમજૂતી: તાલીમમાં ખૂબ જ ઊંચો સ્કોર અને પરીક્ષણમાં નોંધપાત્ર રીતે ઓછો સ્કોર એ ઓવરફિટિંગનું ઉત્તમ લક્ષણ છે: મોડેલે વાસ્તવિક પેટર્નને બદલે તાલીમ ડેટાનો અવાજ યાદ રાખ્યો છે. સોલ્યુશન્સમાં મોડેલને સરળ બનાવવા, વધુ ડેટા, નિયમિતકરણ અને ક્રોસ-વેલિડેશન સાથે રાજ્યની ચકાસણીનો સમાવેશ થાય છે. માત્ર એજ્યુકેશન સ્કોર પર આધાર રાખવાથી આ ખામી છુપાવે છે.
9. મેનેજમેન્ટ પ્રેઝન્ટેશનમાં, બાર ચાર્ટનો વાય-અક્ષ કે જેમાં વેચાણ 1,000 થી 1,020 સુધી વધે છે તે વધારો વિશાળ દેખાય તે માટે 980 થી શરૂ થાય છે. વાસ્તવિક વધારો 2% છે. શા માટે આ એક નૈતિક મુદ્દો છે?
- A) એક કપાયેલ y-અક્ષ દૃષ્ટિની રીતે નાના તફાવતને અતિશયોક્તિ કરે છે અને દર્શકને ગેરમાર્ગે દોરે છે; વાજબીતા માટે, સરખામણી બારમાં ધરી 0 ✔ થી શરૂ થવી જોઈએ
- બી) બાર ચાર્ટનો ક્યારેય વેચાણ ડેટા માટે ઉપયોગ કરી શકાતો નથી
- સી) કોઈ સમસ્યા નથી; ચાર્ટને પ્રભાવશાળી બનાવવો હંમેશા સારું છે
- ડી) Y-અક્ષ હંમેશા ડેટાના સૌથી મોટા મૂલ્યથી શરૂ થવું જોઈએ
સમજૂતી: તુલનાત્મક હેતુઓ માટે બાર ચાર્ટમાં, y-અક્ષ સામાન્ય રીતે 0 થી શરૂ થવો જોઈએ. ધરીને કાપીને 980 થી શરૂ થવાથી 2% નાનો તફાવત દૃષ્ટિની રીતે વિશાળ લાગે છે અને દર્શકને ગેરમાર્ગે દોરે છે. ડેટા પ્રોફેશનલની નૈતિક જવાબદારી એ પ્રામાણિક આલેખ દોરવાની છે કે જે ડેટાને વધારે પડતો કે ઓછો આંકતો નથી.
10. એક વિશ્લેષક ઉત્પાદન કોષ્ટક સાથે ઓર્ડરમાં જોડાયા પછી કુલ ટર્નઓવર 3 વખત શોધે છે; લાઇનોની સંખ્યા 240 હજારથી વધીને 690 હજાર થઈ. આ મૌન ભૂલને રોકવા માટે શું કરવું જોઈએ?
- A) કુલ ટર્નઓવરને 3 વડે વિભાજીત કરો
- B) હંમેશા JOIN ને બદલે અલગ ક્વેરીનો ઉપયોગ કરો
- સી) ઉત્પાદન કોષ્ટકને સંપૂર્ણપણે કાઢી નાખવું
- ડી) મર્જ/જોઈન પછી પંક્તિઓની સંખ્યા તપાસવી અને તે સાચી કી દ્વારા જોડાઈ છે તેની ચકાસણી કરવી; નકલ વહેલી પકડવી ✔
સમજૂતી: જ્યારે ઉત્પાદન કોષ્ટકમાં દરેક ઉત્પાદન (ઉદાહરણ તરીકે, અલગ રંગ) માટે બહુવિધ પંક્તિઓ હોય, ત્યારે ખોટી કી દ્વારા જોડાઓ દરેક ઓર્ડરની નકલ કરશે અને કુલ સંખ્યાને વધારી દેશે. કોડ ભૂલો વિના ચાલે છે પરંતુ પરિણામ ખોટું છે. આને ટાળવાનો માર્ગ એ છે કે દરેક મર્જ/જોઇન પછી પંક્તિઓની સંખ્યા તપાસો અને સાચી કી વડે મર્જ કરો.
11. હાયરિંગ સ્ક્રિનિંગ મોડલ ઐતિહાસિક ડેટામાં લિંગ અસંતુલન વિશે શીખે છે અને વ્યવસ્થિત રીતે સ્કોર્સ મહિલા ઉમેદવારો હેઠળ, પરંતુ તેની એકંદર સચોટતા વધારે છે. આનો અર્થ શું છે?
- એ) કોઈ સમસ્યા નથી કારણ કે મોડેલમાં ઉચ્ચ ચોકસાઈ છે
- બી) આંકડાકીય ચોકસાઈ એ નૈતિક સ્વીકાર્યતાનો વિકલ્પ નથી; મોડેલે ભૂતકાળના ભેદભાવ વિશે શીખ્યા છે, જૂથ-આધારિત ઔચિત્યની તપાસ જરૂરી છે ✔
- સી) મોડલની ચોકસાઈમાં વધુ વધારો કરવાથી સમસ્યા હલ થાય છે
- ડી) નિષ્પક્ષતા ડેટા વિજ્ઞાનના અવકાશની બહાર છે
સમજૂતી: જો મોડેલ આંકડાકીય રીતે સાચું હોય, તો પણ તે નૈતિક રીતે અસ્વીકાર્ય હોઈ શકે છે. મોડેલ ભૂતકાળના ડેટામાં અન્યાય શીખે છે અને ભેદભાવને સ્વચાલિત કરે છે. ઉચ્ચ પ્રામાણિકતા ન્યાય માટે કોઈ વિકલ્પ નથી; ઉચ્ચ-અસરવાળા મોડેલોમાં, ઔચિત્ય નિયંત્રણ, જે વિવિધ જૂથો માટે પ્રદર્શન/નિર્ણયના તફાવતને માપે છે, તે આવશ્યક છે અને અંતિમ જવાબદારી મનુષ્યની છે.
12. એક કર્મચારી સાર્વજનિક AI ટૂલમાં વાસ્તવિક ગ્રાહક ઇમેઇલ્સ અને ખરીદીનો ઇતિહાસ ધરાવતી ફાઇલ અપલોડ કરે છે અને 'સેગમેન્ટ્સનો સારાંશ' કહે છે. શા માટે આ ગંભીર ભૂલ છે અને સાચો રસ્તો શું છે?
- એ) કોઈ સમસ્યા નથી; AI સાધનો ક્યારેય ડેટા સ્ટોર કરતા નથી
- બી) ભૂલ એ છે કે ફાઇલ ખૂબ મોટી છે; ઘટાડો કરવો જોઈએ
- સી) ખુલ્લા સાધનને વાસ્તવિક વ્યક્તિગત ડેટા પ્રદાન કરવો એ KVKK/GDPRનું ઉલ્લંઘન છે; ઓળખના ક્ષેત્રો દૂર કરવા જોઈએ અને માત્ર અનામી સ્કીમા/પ્રોપર્ટી શેર કરવી જોઈએ ✔
- ડી) એક્સેલને બદલે CSV નો ઉપયોગ થવો જોઈએ
સમજૂતી: જ્યારે સાર્વજનિક રીતે ઉપલબ્ધ આર્ટિફિશિયલ ઇન્ટેલિજન્સ ટૂલને વાસ્તવિક વ્યક્તિગત ડેટા (જેમ કે ઈ-મેલ, નામ, વગેરે) આપવામાં આવે છે, ત્યારે KVKK/GDPRના કાર્યક્ષેત્રમાં ગોપનીયતાનું ઉલ્લંઘન થશે; ડેટા સંસ્થા છોડી દે છે. મોટાભાગે, ડાયાગ્રામ અને અનામી/કૃત્રિમ નમૂના વિશ્લેષણ માટે પૂરતા હોય છે. સાચી રીત એ છે કે ઓળખના ક્ષેત્રો દૂર કરો અને ફક્ત અનામી પ્રોપર્ટીઝ શેર કરો.
13. એક ભલામણ મોડેલ ઉત્પાદનમાં મૂકવામાં આવે છે પરંતુ ટ્રેકિંગ સ્થાપિત કરવામાં આવતું નથી; જ્યારે ઉત્પાદન સૂચિ 4 મહિના પછી બદલાય છે, ત્યારે મોડેલ જૂના ઉત્પાદનોની ભલામણ કરવાનું ચાલુ રાખે છે અને રૂપાંતરણ દર શાંતિપૂર્વક 30% જેટલો ઘટી જાય છે. આ ઘટનાનું નામ શું છે?
- એ) ઓવરલર્નિંગ; મોડેલ તાલીમ સમૂહને યાદ કરે છે
- બી) મોડેલ ડ્રિફ્ટ; જેમ જેમ વિશ્વ બદલાય છે તેમ, મોડલ ચુપચાપ અપ્રચલિત થઈ જાય છે, કોઈનું ધ્યાન નથી કારણ કે મોનિટરિંગ સ્થાપિત નથી ✔
- સી) પસંદગી પૂર્વગ્રહ; નમૂના પૂર્વગ્રહ
- ડી) ડેટા મિનિમાઇઝેશન ઉલ્લંઘન
સમજૂતી: આ મોડેલ ડ્રિફ્ટ છે (મોડલ/ડેટા ડ્રિફ્ટ): જ્યારે વિશ્વ બદલાય છે (કેટલોગ, વર્તણૂક, મોસમ) તે પરિસ્થિતિઓ કે જેના હેઠળ મોડેલને તાલીમ આપવામાં આવી હતી અને મોડલ શાંતિથી તૂટી જાય છે. ઉત્પાદનમાં મૂકવામાં આવેલ મોડેલ તેના પોતાના પર બગડે છે; 'ક્યારે'ની વાત છે. મોનિટરિંગ (ઇનપુટ અને પ્રદર્શનને ટ્રેકિંગ) વિના જમાવટથી અધોગતિ શોધવાનું અશક્ય બને છે.
14. એક મોડેલ કે જે એક જ તાલીમ/પરીક્ષણ વિભાજનમાં 88% ચોકસાઈ મેળવે છે તેમાં 88%, 71%, 83%, 64%, 79%ના 5-ગણા ક્રોસ-વેલિડેશન સ્કોર છે. આ શું સૂચવે છે અને શા માટે ક્રોસ-વેલિડેશન મહત્વનું છે?
- એ) મોડેલ સ્થિર છે; 88% વાસ્તવિક કામગીરી છે
- બી) ક્રોસ-વેલિડેશન બિનજરૂરી છે; એક ડબ્બો પૂરતો છે
- સી) સ્કોર્સની મોટી અસ્થિરતા સૂચવે છે કે મોડેલ અસ્થિર છે; ક્રોસ-વેલિડેશન બેઝ પરફોર્મન્સને સરેરાશ અને બહુવિધ ડબ્બાનું વિતરણ કરે છે, એક પણ લકી ડબ્બા નહીં ✔
- ડી) સૌથી વધુ સ્કોરની જાણ કરવી શ્રેષ્ઠ છે (88%)
સમજૂતી: એક ડબ્બો ભાગ્યશાળી અથવા કમનસીબ હોઈ શકે છે; 88% એ સરળ ભાગલાનું પરિણામ હતું. ક્રોસ-વેલિડેશન ડેટાને ઘણી વખત વિભાજિત કરે છે, સરેરાશ (અહીં ~77%) પર પ્રદર્શનને આધારે અને સ્કોર્સની અસ્થિરતા દર્શાવે છે. ઉચ્ચ અસ્થિરતા અહીં સૂચવે છે કે મોડેલ અસ્થિર છે; એક જ કમ્પાર્ટમેન્ટ પર આધાર રાખવો ભ્રામક છે.