નફો:
- ગુમ થયેલ ડેટા પ્રકારો (MCAR/MAR/MNAR), આઉટલાયર્સ અને કોડિંગ ભૂલોને ઓળખવાની ક્ષમતા અને ક્લીનઅપ કોડ અને ડાયગ્નોસ્ટિક્સ બનાવવા માટે સાચા ડેટા સાથે AI નો ઉપયોગ કરવાની ક્ષમતા
- આર્ટિફિશિયલ ઇન્ટેલિજન્સ દ્વારા સૂચવવામાં આવેલ દરેક સફાઈ પગલું (કાઢી નાખવું, સોંપણી, રૂપાંતર) કેવી રીતે વિશ્લેષણ પરિણામને અસર કરશે અને ઉલટાવી શકાય તેવું અને દસ્તાવેજીકૃત વર્કફ્લો સ્થાપિત કરશે તે જોવાની ક્ષમતા
- સફાઈના નિર્ણયો ડેટા જનરેટ કરતી પ્રક્રિયાના જ્ઞાન પર આધારિત હોય છે અને તે કૃત્રિમ બુદ્ધિ એ દેખરેખ રાખેલ સહાયક છે, અંધ ઓટોમેટન નથી
દરેક અનુભવી વિશ્લેષક એક સત્ય જાણે છે: પ્રયોગમૂલક પ્રોજેક્ટનો મોટાભાગનો સમય મોડેલિંગ નથી, પરંતુ ડેટા ક્લિનિંગ (ડેટામાં ભૂલો, ભૂલો અને અસંગતતાઓને સુધારવાનું અને વિશ્લેષણ માટે તૈયાર કરવાનું કામ). અંગૂઠાના ખરબચડા નિયમ તરીકે, લગભગ 70-80% સમય ડેટાને સમજવા, સાફ કરવામાં અને રૂપાંતરિત કરવામાં જાય છે; વાસ્તવિક વિશ્લેષણ માટે માત્ર 20-30% બાકી છે. આ એકમમાં, અમે પગલું-દર-પગલાં જોઈશું કે આર્ટિફિશિયલ ઈન્ટેલિજન્સ (AI) આ ભારે બોજને કેવી રીતે હળવો કરે છે, પરંતુ કયા નિર્ણયો હજુ પણ તમારી સાથે રહેવા જોઈએ અને શા માટે.
ચાલો પહેલા બે મૂળભૂત હકીકતો મૂકીએ. પ્રથમ, સફાઈના નિર્ણયો ડેટા ઉત્પન્ન કરતી પ્રક્રિયાના તમારા જ્ઞાન પર આધારિત છે: માત્ર તમે જ જાણો છો કે મૂલ્ય શા માટે ખૂટે છે, શા માટે સંખ્યા વધારે પડતી મોટી છે. AI ડેટા જોતો નથી, સંદર્ભ જાણતો નથી; કોડ લખે છે, નિર્ણય લેતો નથી. બીજું, દરેક સફાઈ પગલું વિશ્લેષણ પરિણામ બદલી શકે છે. આઉટલાયરને કાઢી નાખવાથી ગુણાંક ઉલટાવી શકાય છે; ખોવાયેલાને સરેરાશ સાથે ભરવાથી કૃત્રિમ રીતે તફાવત ઘટાડી શકાય છે. તેથી સફાઈ ઉલટાવી શકાય તેવું અને દસ્તાવેજીકૃત હોવું જોઈએ: કાચા ડેટાને ક્યારેય સ્પર્શ કરશો નહીં, કોડમાં દરેક પગલું કરો, દરેક પગલાની અસર રેકોર્ડ કરો.
પગલું દ્વારા પગલું સફાઈ વર્કફ્લો
1. ડેટા જાણો. પ્રથમ માળખું જુઓ: પંક્તિઓની સંખ્યા (અવલોકનો) અને કૉલમ (ચલ), દરેક ચલનો પ્રકાર (સંખ્યાત્મક, સ્પષ્ટ, તારીખ), સારાંશ આંકડા, ગુમ થયેલ સંખ્યા. તમે આ "ડેટા પ્રોફાઇલ" કોડ માટે AI ને પૂછી શકો છો; પરંતુ તમે આઉટપુટ વાંચો અને પ્રશ્નો પૂછો જેમ કે "આ વેરીએબલ ટેક્સ્ટ તરીકે શા માટે આવ્યું?"
2. ગુમ થયેલ ડેટાને સમજો અને વર્ગીકૃત કરો. ખૂટતો ડેટા ત્રણ પ્રકારમાં વહેંચાયેલો છે. MCAR (કમ્પ્લીટલી મિસિંગ એટ રેન્ડમ): ગુમ થવાનું કારણ કંઈપણ નથી, ઉદાહરણ તરીકે સેન્સર રેન્ડમ રીતે નિષ્ફળ થયું. MAR (રેન્ડમમાં ખૂટે છે): ગુમ થવું એ અન્ય અવલોકન કરેલ ચલો પર આધાર રાખે છે, ઉદાહરણ તરીકે વૃદ્ધ લોકો વધુ વખત પ્રશ્ન ખાલી છોડી દે છે, પરંતુ તમે ઉંમર જાણો છો. MNAR (રૅન્ડમમાં ખૂટે છે): ગુમ થવું એ અવલોકન ન કરાયેલ મૂલ્ય પર આધાર રાખે છે, ઉદાહરણ તરીકે ઉચ્ચ કમાણી કરનારાઓ તેમની આવકની જાણ કરતા નથી. આ તફાવત મહત્વપૂર્ણ છે કારણ કે તે ઉકેલની પદ્ધતિ નક્કી કરે છે અને AI તમારા માટે આ નક્કી કરી શકતું નથી.
3. ઉણપનો સામનો કરો. વિકલ્પો: સૂચિ મુજબ કાઢી નાખવું, સરેરાશ/મધ્યમ આરોપણ, મોડેલ-આધારિત બહુવિધ આરોપણ. MCAR માં કાઢી નાખવું પ્રમાણમાં સલામત છે પરંતુ નમૂનાનું કદ ઘટાડે છે. MAR માં બહુવિધ અસાઇનમેન્ટ વધુ યોગ્ય છે. કોઈ સરળ પદ્ધતિ MNAR માં નિષ્પક્ષતાની ખાતરી આપતી નથી; ઉણપ મિકેનિઝમનું મોડેલ બનાવવું જોઈએ અથવા ઓછામાં ઓછું સંવેદનશીલતા વિશ્લેષણ કરવું જોઈએ. મીન-ફિલિંગ સરળ પણ ખતરનાક છે: તે ભિન્નતા ઘટાડે છે, સંબંધોને નબળા બનાવે છે અને અનિશ્ચિતતાને છુપાવે છે.
4. બહારના લોકોની તપાસ કરો. આઉટલીયર એ એક અવલોકન છે જે અન્ય લોકોથી ખૂબ દૂર રહે છે. બે પ્રશ્નોને અલગ કરો: શું આ એક ભૂલ છે (ડેટા એન્ટ્રીમાં વય 999 લખવામાં આવી હતી) અથવા તે વાસ્તવિક પરંતુ બહારની કિંમત છે (એક અબજોપતિની આવક)? ભૂલો ઠીક કરો; સાચા આઉટલાયર્સને ડિલીટ કરશો નહીં કારણ કે તેઓ ડેટાનું પ્રતિનિધિત્વ કરે છે. "કારણ કે તે પરેશાન કરે છે" આઉટલીયર કાઢી નાખવાથી તમે ડેટાને પરિણામ તરફ ખેંચી રહ્યા છો.
5. કોડિંગ અને સુસંગતતા. શ્રેણીઓને પ્રમાણિત કરો ("પુરુષ", "પુરુષ", "ઇ" બધા એક કોડમાં), તારીખોને એક ફોર્મેટમાં, એકમોને એક સ્કેલમાં લાવો, ડુપ્લિકેટ પંક્તિઓ શોધો. આ સૌથી ઓછો જોખમી તબક્કો છે જ્યાં AI શ્રેષ્ઠ મદદ કરે છે.
6. દસ્તાવેજ અને ફ્રીઝ. કાચા અને સાફ કરેલા ડેટાને અલગ રાખીને કોડ અને કોમેન્ટ લાઇન સાથે દરેક પગલાને રેકોર્ડ કરો. તેથી જ્યારે રેફરી પૂછે છે કે "આ અવલોકનો કેમ છોડવામાં આવ્યા?" તમારી પાસે તમારો જવાબ તૈયાર છે.
સાવધાન: પરિણામોના આધારે સફાઈના નિર્ણયો ન લો. "જ્યારે તમે આ લાઇન કાઢી નાખો છો, ત્યારે ગુણાંક નોંધપાત્ર બની જાય છે" કહેતી લાઇન કાઢી નાખવી એ પી-હેકિંગનું સૌથી કપટી સ્વરૂપ છે, જે આપણે આગામી એકમમાં જોઈશું.
સરખામણી કોષ્ટક: ગુમ થયેલ ડેટા પદ્ધતિઓ
પદ્ધતિ
તે ક્યારે યોગ્ય છે?
જોખમ
AI ની ભૂમિકા
એક પંક્તિ કાઢી નાખો
MCAR, ઓછો ખૂટતો દર
નમૂના નાનો બને છે, MAR/MNAR માં પૂર્વગ્રહ
કોડ લખે છે; તમે નક્કી કરો
સરેરાશ/મધ્યમ સોંપણી
ઝડપી પ્રારંભિક વિશ્લેષણ
ભિન્નતા ઘટાડે છે, સંબંધ છુપાવે છે
તે સરળ છે પરંતુ તેની ભલામણ કરતું નથી; ચેતવણી આપવી જોઈએ
બહુવિધ સોંપણી (MI)
MAR, મહત્વપૂર્ણ ચલો
જો યોગ્ય રીતે ઇન્સ્ટોલ કરેલ નથી, તો તે ગેરમાર્ગે દોરશે
કોડ અને પેકેજની ભલામણ કરે છે (ઉંદર)
મિકેનિઝમ મોડેલિંગ
MNAR
જટિલ, ધારણા-સઘન
માત્ર ડ્રાફ્ટ; નિષ્ણાત જરૂરી છે
ચાર નકલ કરી શકાય તેવા સંકેતો
1. ડેટા પ્રોફાઇલિંગ:
તમારી ભૂમિકા: ડેટા સફાઇ સહાયક. હું ડેટા શેર કરતો નથી, મને આર કોડ જોઈએ છે. મારી પાસે 'અંક' નામની ડેટા ફ્રેમ છે; ચલો: id, ઉંમર (સંખ્યાત્મક), આવક (સંખ્યાત્મક), શિક્ષણ (ચોક્કસ), પ્રદેશ (ચોક્કસ), તારીખ (તારીખ). કાર્ય: કોડ લખો જે દરેક ચલ માટે પ્રકાર, ખૂટતી સંખ્યા અને દર બનાવે છે, સંખ્યાત્મક માટે સારાંશ આંકડાઓ અને વર્ગીકૃત લોકો માટે આવર્તન કોષ્ટક. ટિપ્પણી લાઇન ઉમેરો.
2. ખોવાયેલ ડેટા નિદાન:
કોડ લખો જે ઉપરના 'અંક' ડેટા માટે ગુમ થયેલ પેટર્નની તપાસ કરે છે: - દરેક ચલનો ખૂટતો દર, - અન્ય ચલો સાથે ગુમ થવાનો સંબંધ દર્શાવતો એક સરળ કોષ્ટક/ગ્રાફ. હું કોડના આઉટપુટને જોઈશ અને MCAR/MAR/MNAR ભેદ કરીશ; તમે માત્ર ડાયગ્નોસ્ટિક ટૂલનું ઉત્પાદન કરો છો, સોંપણીની પદ્ધતિ નક્કી કરશો નહીં.
3. બાહ્ય નિરીક્ષણ (કાઢી નાખવું નહીં):
ચલ 'આવક' માટે કોડ લખો કે જે કાઢી નાખ્યા વિના આઉટલાયર્સની તપાસ કરે છે: બોક્સપ્લોટ, IQR-આધારિત બાઉન્ડ્સ અને ટેબલ લિસ્ટિંગ આઉટલાયર અવલોકનો + મૂલ્યો. હું જોઈશ કે આ ભૂલો છે કે વાસ્તવિક. આપોઆપ કાઢી નાખવું ઉમેરો.
4. કોડિંગ માનકીકરણ:
'શિક્ષણ' ચલમાં, મૂલ્યો મિશ્ર લખવામાં આવે છે: "પ્રાથમિક શાળા","પ્રાથમિક શાળા","પ્રાયમરી","હાઈ સ્કૂલ","હાઈ સ્કૂલ","યુનિવર્સિટી","યુનિવ". R કોડ લખો જે આને સુસંગત શ્રેણીઓમાં ફરીથી કોડ કરે છે; મેપિંગ કોષ્ટક સ્પષ્ટ રીતે બતાવો જેથી હું દરેક રૂપાંતરણની પુષ્ટિ કરી શકું. તમે ઓળખતા નથી તે મૂલ્યને "UNKNOWN" પર સેટ કરો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
ડેટા સાફ કરો, ખાલી જગ્યાઓ ભરો, આઉટલિયર્સને કાઢી નાખો.
આ માંગ ખતરનાક છે: તે AI ને અંધ સત્તા આપે છે. કયા પ્રકારનું ખૂટે છે, કેવું ભરણ છે, કેવું વિરોધાભાસી સત્ય - તેમાંથી કંઈ સ્પષ્ટ નથી. પરિણામ ગુપ્ત રીતે પક્ષપાતી ડેટા સેટ હોઈ શકે છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: સફાઈ સહાયક, તમે નિર્ણય લેનાર નથી. સ્ટેપ બાય સ્ટેપ જાઓ અને કોડ લખો જે દરેક પગલાની અસરની જાણ કરે છે: 1) ગુમ થયેલ પેટર્ન બતાવો (કાઢી નાખો/ભરો નહીં), 2) આઉટલીયર ઉમેદવારોની યાદી આપો (કાઢી નાખશો નહીં), 3) મેપિંગ કોષ્ટક સાથે શ્રેણીની અસંગતતાઓને ઠીક કરો. દરેક પગલા પછી પંક્તિની ગણતરી અને સારાંશના આંકડા છાપો જેથી હું ફેરફાર જોઈ શકું અને પુષ્ટિ કરી શકું. આપોઆપ સોંપણી/કાઢી નાખવાની નિવેશ.
તફાવત સ્પષ્ટ છે: મજબૂત ઇચ્છા AI ને દેખરેખ સહાયક તરીકે સ્થાન આપે છે, જે ઉલટાવી શકાય તેવા અને દસ્તાવેજીકૃત પગલાઓનું ઉત્પાદન કરે છે.
ત્રણ નાના કેસો
કેસ 1 - સરેરાશ સોંપણી છટકું. એક વિશ્લેષકની 5,000 લોકોની આવકનો ડેટા 18% ખૂટે છે. તેણે AI ને "ખાલીઓ ભરવા" કહ્યું; AI એ બધાની સરેરાશ કરી. પરિણામ: આવકના તફાવતમાં 22% ઘટાડો થયો છે, અને શિક્ષણ-આવક સંબંધનો ગુણાંક તેના કરતા નબળો હોવાનું બહાર આવ્યું છે. સાચી રીત: ઉણપ MAR (શિક્ષણને કારણે) હતી, જે બહુવિધ અસાઇનમેન્ટ (ઉંદર) દ્વારા ભરવાની હતી. પાઠ: ભરવાની પદ્ધતિ પદ્ધતિ પર આધારિત છે.
કેસ 2 - બહારની સફાઈ શોધને ઉલટાવે છે. એક પેઢીના ડેટામાં 3 ખૂબ મોટી કંપનીઓ (કુલ અવલોકનના 0.6%) હતી. આને AI ના "સફાઈ" સૂચન દ્વારા કાઢી નાખવામાં આવ્યા હતા; સ્કેલ ગુણાંકની અર્થવ્યવસ્થા સકારાત્મકમાંથી નકારાત્મકમાં ફેરવાઈ. જો કે, તે 3 કંપનીઓ વાસ્તવિક અને ઉદ્યોગનો મહત્વપૂર્ણ ભાગ હતી. સાચો રસ્તો કાઢી નાખવાને બદલે સંપૂર્ણ અને મજબૂત અંદાજ સાથે રિપોર્ટ કરવાનો હતો. પાઠ: વાસ્તવિક આઉટલાયર્સ ડેટા છે, અવાજ નથી.
કેસ 3 - સાયલન્ટ કોડિંગ ભૂલ. એક પેનલમાં, તારીખ ચલ બે અલગ-અલગ ફોર્મેટમાં આવે છે ("2020-03-01" અને "01/03/2020"). જ્યારે AI દ્વારા ઉત્પાદિત કોમ્બિનેશન કોડ તેમને અલગ-અલગ મૂલ્યો માટે ભૂલતો હતો, ત્યારે 1,400 અવલોકનો મેળ ખાતી ન હતી અને વૃદ્ધિ દર હાસ્યાસ્પદ બન્યો હતો. જો વિશ્લેષકે પંક્તિની સંખ્યા તપાસી ન હોય તો કોઈ વાંધો નથી. પાઠ: દરેક પગલા પછી અવલોકન ગણતરીઓ અને સેનિટી ચેક્સ આવશ્યક છે.
સામાન્ય ભૂલો
- આંધળાપણે એવરેજ સાથે ગેપ ભરવા. તે ભિન્નતા ઘટાડે છે, અનિશ્ચિતતાને છુપાવે છે અને MAR/MNAR માં પૂર્વગ્રહ બનાવે છે. પ્રથમ મિકેનિઝમનું વર્ગીકરણ કરો.
- આઉટલીયર કાઢી નાખવું "કારણ કે તે હેરાન કરે છે". સાચા આઉટલાયર્સ ડેટાનું પ્રતિનિધિત્વ કરે છે; કાઢી નાખવું પરિણામને વળાંક આપે છે. જે ખોટું છે તેને ઠીક કરો, જે વાસ્તવિક છે તે રાખો.
- કાચો ડેટા ટેપ કરી રહ્યા છીએ. કાચા ડેટાને ક્યારેય સંશોધિત કરશો નહીં; કોડ સાથેની બધી સફાઈ એક અલગ નકલમાં કરો જેથી કરીને તેને પાછું લઈ શકાય.
- પગલાંની અસરને માપતા નથી. જો દરેક પગલા પછી પંક્તિની ગણતરી અને સારાંશના આંકડા તપાસવામાં ન આવે તો, સાયલન્ટ ભૂલો એકઠા થશે.
- પરિણામે સફાઈ. "જ્યારે તમે આ લાઇન ઉમેરો છો, ત્યારે પરિણામ વધુ સારું બને છે" નો તર્ક પી-હેકિંગ છે; વિશ્લેષણના પરિણામ પહેલાં અને સ્વતંત્ર રીતે સફાઈનું આયોજન કરવું જોઈએ.
ટીપ: "પહેલાં/પછી" કોષ્ટક રાખો કે જે સફાઈ પહેલાં અને પછી સમાન મૂળભૂત આંકડાઓ (મધ્ય, સરેરાશ, અવલોકનોની સંખ્યા, થોડા સહસંબંધો) સાથે રાખે છે. અણધારી કૂદકો એ છુપાયેલી ભૂલનો શ્રેષ્ઠ આશ્રયસ્થાન છે.
સારાંશમાં
ડેટા ક્લિનિંગ એ પ્રયોગમૂલક કાર્યનો સૌથી વધુ સમય માંગી લેતો અને નિર્ણય-જરૂરી તબક્કો છે. AI આમાં એક શક્તિશાળી કોડ જનરેટર છે, પરંતુ તે શોટ્સને કૉલ કરી શકતું નથી: તમે ગુમ થયેલ ડેટા પ્રકાર (MCAR/MAR/MNAR) ને વર્ગીકૃત કરો, નિર્ધારિત કરો કે આઉટલાયર ભૂલ છે કે વાસ્તવિક, દરેક પગલાને ઉલટાવી શકાય તેવું અને દસ્તાવેજીકૃત રાખો. AI અંધ "સ્પષ્ટ" સત્તા આપવાને બદલે, એક પગલું-દર-પગલાં વર્કફ્લો સ્થાપિત કરો જેની અસર માપવામાં આવે અને માન્ય કરવામાં આવે. દરેક પગલા પછી અવલોકનો અને સારાંશના આંકડાઓની સંખ્યા તપાસવી એ સાયલન્ટ ભૂલો માટે શ્રેષ્ઠ મારણ છે.
એપ્લિકેશન કાર્ય
ડેટા સેટ (તમારો પોતાનો ડેટા અથવા સેમ્પલ સેટ) માં ખૂટતા અને આઉટલીયર ધરાવતા ઓછામાં ઓછા બે ચલ પસંદ કરો. ઉપરના "સ્ટેપ બાય સ્ટેપ, ડિલીટ/ભરો નહીં" પ્રોમ્પ્ટ દ્વારા AI થી ડાયગ્નોસ્ટિક કોડની વિનંતી કરો અને તેને ચલાવો. ઉણપને MCAR/MAR/MNAR તરીકે વર્ગીકૃત કરો અને એક વાક્યમાં તમારું સમર્થન લખો. વિરોધાભાસી ઉમેદવારોને એક પછી એક તપાસો અને નક્કી કરો કે કઈ ભૂલ છે અને કઈ સાચી છે. છેલ્લે, સફાઈ પહેલાં/પછી એક "પહેલાં-પછી" કોષ્ટક બનાવો અને જો કોઈ અણધાર્યા ફેરફારો હોય તો તેની જાણ કરો.
ચેકલિસ્ટ
- [ ] મેં કાચા ડેટાને બદલ્યા વિના અલગ નકલમાં સાફ કર્યા.
- [ ] મેં ઉણપને MCAR/MAR/MNAR તરીકે વર્ગીકૃત કરી અને તે મુજબ પદ્ધતિ પસંદ કરી.
- [ ] મેં એક પછી એક આઉટલીયરની તપાસ કરી કે તેઓ ભૂલો છે કે વાસ્તવિક; મેં તેને આંખ આડા કાન કર્યા નથી.
- [ ] મેં દરેક સફાઈ પગલા પછી અવલોકનોની સંખ્યા અને સારાંશના આંકડા તપાસ્યા.
- [ ] મેં કોડ અને કોમેન્ટ લાઇન સાથે તમામ પગલાઓનું દસ્તાવેજીકરણ કર્યું છે; ઉલટાવી શકાય તેવું
- [ ] મેં વિશ્લેષણના પરિણામ પર નહીં પણ ડેટા ઉત્પન્ન કરતી પ્રક્રિયાના જ્ઞાન પર સફાઈનો આધાર રાખ્યો છે.