लाभ:
- लापता डेटा प्रकारों (एमसीएआर/एमएआर/एमएनएआर), आउटलेर्स और कोडिंग त्रुटियों को पहचानने और क्लीनअप कोड और डायग्नोस्टिक्स का उत्पादन करने के लिए सही डेटा के साथ एआई का उपयोग करने की क्षमता
- यह देखने की क्षमता कि कृत्रिम बुद्धिमत्ता द्वारा सुझाया गया प्रत्येक सफाई चरण (हटाना, असाइनमेंट, परिवर्तन) विश्लेषण परिणाम को कैसे प्रभावित करेगा और एक प्रतिवर्ती और दस्तावेजी वर्कफ़्लो स्थापित करेगा
- यह बनाए रखना कि सफ़ाई संबंधी निर्णय उस प्रक्रिया के ज्ञान पर आधारित होते हैं जो डेटा उत्पन्न करती है, और यह कि कृत्रिम बुद्धिमत्ता एक पर्यवेक्षित सहायक है, न कि एक अंध स्वचालित मशीन
प्रत्येक अनुभवी विश्लेषक एक सच्चाई जानता है: एक अनुभवजन्य परियोजना का अधिकांश समय मॉडलिंग नहीं, बल्कि डेटा सफाई (डेटा में त्रुटियों, चूक और विसंगतियों को ठीक करने और इसे विश्लेषण के लिए तैयार करने का काम) है। एक मोटे नियम के अनुसार, लगभग 70-80% समय डेटा को समझने, साफ़ करने और बदलने में चला जाता है; वास्तविक विश्लेषण के लिए केवल 20-30% ही बचा है। इस इकाई में, हम चरण दर चरण देखेंगे कि कृत्रिम बुद्धिमत्ता (एआई) इस भारी बोझ को कैसे कम करती है, लेकिन कौन से निर्णय अभी भी आपके पास रहने चाहिए और क्यों।
आइए पहले दो बुनियादी तथ्य रखें। सबसे पहले, सफ़ाई संबंधी निर्णय डेटा तैयार करने वाली प्रक्रिया के बारे में आपके ज्ञान पर आधारित होते हैं: केवल आप ही जानते हैं कि कोई मान गायब क्यों है, कोई संख्या अत्यधिक बड़ी क्यों है। एआई डेटा नहीं देखता, संदर्भ नहीं जानता; कोड लिखता है, निर्णय नहीं लेता. दूसरा, सफाई का प्रत्येक चरण विश्लेषण परिणाम को बदल सकता है। किसी बाह्य को हटाने से गुणांक उलट सकता है; लुप्त को माध्य से भरने से विचरण को कृत्रिम रूप से कम किया जा सकता है। इसलिए सफ़ाई प्रतिवर्ती और प्रलेखित होनी चाहिए: कच्चे डेटा को कभी न छुएं, प्रत्येक चरण को कोड में करें, प्रत्येक चरण के प्रभाव को रिकॉर्ड करें।
चरण-दर-चरण सफ़ाई कार्यप्रवाह
1. डेटा जानें. पहले संरचना देखें: पंक्तियों की संख्या (अवलोकन) और स्तंभ (चर), प्रत्येक चर का प्रकार (संख्यात्मक, श्रेणीबद्ध, दिनांक), सारांश आँकड़े, गायब की संख्या। आप एआई से इस "डेटा प्रोफ़ाइल" कोड के लिए पूछ सकते हैं; लेकिन आप आउटपुट पढ़ते हैं और प्रश्न पूछते हैं जैसे "यह वेरिएबल टेक्स्ट के रूप में क्यों आया?"
2. लुप्त डेटा को समझें और वर्गीकृत करें। लुप्त डेटा को तीन प्रकारों में विभाजित किया गया है। MCAR (रैंडम पर पूरी तरह से गायब): गायब होना किसी भी चीज़ के कारण नहीं है, उदाहरण के लिए एक सेंसर रैंडम रूप से विफल हो गया। मार्च (यादृच्छिक रूप से गुम): चूक अन्य देखे गए चर पर निर्भर करती है, उदाहरण के लिए वृद्ध लोग अक्सर प्रश्न को खाली छोड़ देते हैं, लेकिन आप उम्र जानते हैं। एमएनएआर (मिसिंग नॉट एट रैंडम): गायब होना अनदेखे मूल्य पर ही निर्भर करता है, उदाहरण के लिए अधिक कमाई करने वाले अपनी आय की रिपोर्ट नहीं करते हैं। यह अंतर महत्वपूर्ण है क्योंकि यह समाधान विधि निर्धारित करता है और एआई आपके लिए यह तय नहीं कर सकता है।
3. कमी से निपटें. विकल्प: सूचीवार विलोपन, माध्य/माध्यिका प्रतिरूपण, मॉडल-आधारित एकाधिक प्रतिरूपण। MCAR में विलोपन अपेक्षाकृत सुरक्षित है लेकिन नमूना आकार कम कर देता है। मार्च में एकाधिक असाइनमेंट अधिक उपयुक्त है। कोई भी सरल विधि एमएनएआर में निष्पक्षता की गारंटी नहीं देती; कमी तंत्र को मॉडल किया जाना चाहिए या कम से कम एक संवेदनशीलता विश्लेषण किया जाना चाहिए। मतलब भरना आसान है लेकिन खतरनाक है: यह भिन्नता को कम करता है, रिश्तों को कमजोर करता है और अनिश्चितता को छुपाता है।
4. आउटलेर्स की जांच करें. बाह्य वह अवलोकन है जो दूसरों से बहुत दूर खड़ा होता है। दोनों प्रश्नों को अलग करें: क्या यह एक त्रुटि है (डेटा प्रविष्टि में आयु 999 लिखी गई थी) या क्या यह वास्तविक लेकिन बाहरी मूल्य (एक अरबपति की आय) है? बग का समाधान करें; वास्तविक आउटलेर्स को न हटाएं क्योंकि वे डेटा का प्रतिनिधित्व करते हैं। बाहरी हिस्से को "क्योंकि यह परेशान करता है" को हटाकर आप डेटा को परिणाम की ओर झुका रहे हैं।
5. कोडिंग और स्थिरता. श्रेणियों को मानकीकृत करें ("पुरुष", "पुरुष", "ई" सभी को एक कोड में), तिथियों को एक प्रारूप में, इकाइयों को एक पैमाने में लाएं, डुप्लिकेट पंक्तियों का पता लगाएं। यह सबसे कम जोखिम भरा चरण है जहां एआई सबसे अच्छी मदद करता है।
6. दस्तावेज़ और फ्रीज. प्रत्येक चरण को कोड और एक टिप्पणी पंक्ति के साथ रिकॉर्ड करें, कच्चे और साफ किए गए डेटा को अलग रखें। तो जब एक रेफरी पूछता है "ये अवलोकन क्यों हटा दिए गए?" आपका उत्तर तैयार है.
सावधानी: परिणामों के आधार पर सफ़ाई संबंधी निर्णय न लें। "जब आप इस पंक्ति को हटाते हैं, तो गुणांक महत्वपूर्ण हो जाता है" कहने वाली पंक्ति को हटाना पी-हैकिंग का सबसे घातक रूप है, जिसे हम अगली इकाई में देखेंगे।
तुलना तालिका: अनुपलब्ध डेटा विधियाँ
विधि
यह कब उचित है?
जोखिम
एआई की भूमिका
एक पंक्ति हटाएँ
एमसीएआर, कम लापता दर
नमूना छोटा हो जाता है, MAR/MNAR में पूर्वाग्रह
कोड लिखता है; आप निर्णय करें
माध्य/माध्यिका असाइनमेंट
त्वरित प्रारंभिक विश्लेषण
विचरण कम करता है, संबंध छुपाता है
यह आसान है लेकिन इसकी अनुशंसा नहीं करता; चेतावनी देनी चाहिए
एकाधिक असाइनमेंट (एमआई)
मार्च, महत्वपूर्ण चर
यदि सही ढंग से स्थापित नहीं किया गया तो यह भ्रामक होगा
कोड और पैकेज की अनुशंसा करता है (चूहे)
तंत्र मॉडलिंग
एमएनएआर
जटिल, धारणा-गहन
केवल ड्राफ्ट; विशेषज्ञ की आवश्यकता है
चार प्रतिलिपि योग्य संकेत
1. डेटा प्रोफाइलिंग:
आपकी भूमिका: डेटा सफ़ाई सहायक। मैं डेटा साझा नहीं करता, मुझे आर कोड चाहिए। मेरे पास 'अंक' नामक एक डेटा.फ़्रेम है; चर: आईडी, आयु (संख्यात्मक), आय (संख्यात्मक), शिक्षा (श्रेणीबद्ध), क्षेत्र (श्रेणीबद्ध), तिथि (तारीख)। कार्य: कोड लिखें जो प्रत्येक चर के लिए प्रकार, लुप्त संख्या और दर, संख्यात्मक चर के लिए सारांश आँकड़े और श्रेणीबद्ध चर के लिए आवृत्ति तालिका उत्पन्न करता है। टिप्पणी पंक्ति जोड़ें.
2. गुम डेटा निदान:
कोड लिखें जो उपरोक्त 'अंक' डेटा के लिए लुप्त पैटर्न की जांच करता है: - प्रत्येक चर की लुप्त दर, - अन्य चर के साथ लुप्तता के संबंध को दर्शाने वाली एक सरल तालिका/ग्राफ़। मैं कोड के आउटपुट को देखूंगा और MCAR/MAR/MNAR में अंतर बताऊंगा; आप केवल डायग्नोस्टिक टूल तैयार करें, असाइनमेंट विधि पर निर्णय न लें।
3. बाहरी निरीक्षण (हटाना नहीं):
वेरिएबल 'आय' के लिए कोड लिखें जो हटाए बिना आउटलेर्स की जांच करता है: बॉक्सप्लॉट, आईक्यूआर-आधारित सीमाएं, और टेबल लिस्टिंग आउटलेयर अवलोकन + मान। मैं देखूंगा कि ये ग़लतियां हैं या असली. स्वचालित विलोपन जोड़ें.
4. कोडिंग मानकीकरण:
'शिक्षा' चर में, मान मिश्रित लिखे गए हैं: "प्राथमिक विद्यालय", "प्राथमिक विद्यालय", "प्राथमिक", "उच्च विद्यालय", "उच्च विद्यालय", "विश्वविद्यालय", "विश्वविद्यालय"। आर कोड लिखें जो इन्हें लगातार श्रेणियों में रिकोड करता है; मैपिंग तालिका स्पष्ट रूप से दिखाएं ताकि मैं प्रत्येक रूपांतरण की पुष्टि कर सकूं। जिस मान को आप नहीं पहचानते उसे "अज्ञात" पर सेट करें।
कमजोर संकेत/मजबूत संकेत
कमजोर संकेत:
डेटा साफ़ करें, अंतराल भरें, आउटलेर्स को हटा दें।
यह मांग खतरनाक है: यह एआई को अंधा अधिकार देती है। किस प्रकार की कमी, किस प्रकार की पूर्ति, किस प्रकार का विरोधाभासी सत्य - यह कुछ भी स्पष्ट नहीं है। परिणाम गुप्त रूप से पक्षपाती डेटा सेट हो सकता है।
शक्तिशाली संकेत:
आपकी भूमिका: सफाई सहायक, आप निर्णय निर्माता नहीं हैं। चरण दर चरण आगे बढ़ें और कोड लिखें जो प्रत्येक चरण के प्रभाव की रिपोर्ट करता है: 1) लापता पैटर्न दिखाएं (हटाएं/भरें नहीं), 2) बाहरी उम्मीदवारों की सूची बनाएं (हटाएं नहीं), 3) मैपिंग तालिका के साथ श्रेणी विसंगतियों को ठीक करें। प्रत्येक चरण के बाद पंक्ति गणना और सारांश आँकड़ा प्रिंट करें ताकि मैं परिवर्तन देख सकूं और पुष्टि कर सकूं। स्वचालित असाइनमेंट/विलोपन प्रविष्टि।
अंतर स्पष्ट है: मजबूत इच्छाशक्ति एआई को एक पर्यवेक्षित सहायक के रूप में स्थापित करती है, जो प्रतिवर्ती और दस्तावेजी कदम उठाती है।
तीन मिनी मामले
केस 1 - औसत असाइनमेंट ट्रैप। एक विश्लेषक के 5,000 लोगों के आय डेटा में 18% की कमी थी। उन्होंने एआई को "अंतराल भरने" के लिए कहा; एआई ने उन सभी का औसत निकाला। परिणाम: आय का अंतर 22% कम हो गया, और शिक्षा-आय संबंध का गुणांक पहले की तुलना में कमज़ोर हो गया। सही तरीका: कमी MAR (शिक्षा के कारण) थी, इसे कई असाइनमेंट (चूहों) से भरना पड़ा। पाठ: भरने की विधि तंत्र पर निर्भर करती है।
केस 2 - बाहरी सफाई से निष्कर्ष उलट जाता है। एक फर्म डेटा में 3 बहुत बड़ी फर्में (कुल अवलोकन का 0.6%) थीं। इन्हें एआई के "सफाई" सुझाव द्वारा हटा दिया गया था; पैमाने गुणांक की अर्थव्यवस्थाएं सकारात्मक से नकारात्मक हो गईं। हालाँकि, वे 3 कंपनियाँ वास्तविक थीं और उद्योग का एक महत्वपूर्ण हिस्सा थीं। सही तरीका हटाने के बजाय पूर्ण और मजबूत अनुमान के साथ रिपोर्ट करना था। पाठ: वास्तविक आउटलेयर डेटा हैं, शोर नहीं।
केस 3 - साइलेंट कोडिंग त्रुटि। एक पैनल में, दिनांक चर दो अलग-अलग प्रारूपों ("2020-03-01" और "01/03/2020") में आया। जब एआई द्वारा निर्मित संयोजन कोड ने उन्हें अलग-अलग मूल्यों के लिए गलत समझा, तो 1,400 अवलोकन बेमेल हो गए और विकास दर हास्यास्पद हो गई। इससे कोई फर्क नहीं पड़ता अगर विश्लेषक ने पंक्ति संख्या की जांच नहीं की। पाठ: प्रत्येक चरण के बाद अवलोकन गणना और विवेक जांच आवश्यक है।
सामान्य गलतियाँ
- आँख मूँद कर अंतर को औसत से भरना। यह भिन्नता को कम करता है, अनिश्चितता को छुपाता है, और MAR/MNAR में पूर्वाग्रह पैदा करता है। सबसे पहले तंत्र को वर्गीकृत करें.
- बाहरी को हटाना "क्योंकि यह परेशान करता है"। सच्चे आउटलेयर डेटा का प्रतिनिधित्व करते हैं; हटाना परिणाम को मोड़ना है. जो ग़लत है उसे सुधारो, जो वास्तविक है उसे रखो।
- कच्चे डेटा का दोहन. कच्चे डेटा को कभी संशोधित न करें; कोड के साथ सभी सफ़ाई एक अलग प्रतिलिपि में करें ताकि इसे वापस लाया जा सके।
- कदमों के प्रभाव को मापना नहीं. यदि प्रत्येक चरण के बाद पंक्ति गणना और सारांश आँकड़ों की जाँच नहीं की जाती है, तो मौन त्रुटियाँ जमा हो जाएँगी।
- परिणामस्वरूप सफाई। "जब आप इस लाइन को जोड़ते हैं, तो परिणाम बेहतर हो जाता है" का तर्क पी-हैकिंग है; विश्लेषण परिणाम से पहले और स्वतंत्र रूप से सफाई की योजना बनाई जानी चाहिए।
युक्ति: एक "पहले/बाद" तालिका रखें जिसमें सफ़ाई से पहले और बाद में समान बुनियादी आँकड़े (माध्य, माध्यिका, अवलोकनों की संख्या, कुछ सहसंबंध) एक साथ रखे जाएँ। एक अप्रत्याशित छलांग छिपी हुई त्रुटि का सबसे अच्छा अग्रदूत है।
संक्षेप में
डेटा सफ़ाई अनुभवजन्य कार्य का सबसे अधिक समय लेने वाला और निर्णय लेने वाला चरण है। एआई इस पर एक शक्तिशाली कोड जनरेटर है, लेकिन यह शॉट्स को कॉल नहीं कर सकता है: आप लापता डेटा प्रकार (एमसीएआर/एमएआर/एमएनएआर) को वर्गीकृत करते हैं, यह निर्धारित करते हैं कि आउटलायर एक त्रुटि है या वास्तविक है, प्रत्येक चरण को प्रतिवर्ती और दस्तावेजित रखें। एआई को अंधा "स्पष्ट" अधिकार देने के बजाय, एक चरण-दर-चरण वर्कफ़्लो स्थापित करें जिसका प्रभाव मापा और मान्य किया गया हो। प्रत्येक चरण के बाद अवलोकनों की संख्या और सारांश आँकड़ों की जाँच करना मौन त्रुटियों के लिए सबसे अच्छा उपाय है।
आवेदन कार्य
कम से कम दो वेरिएबल का चयन करें जिनमें डेटा सेट (आपका अपना डेटा या नमूना सेट) में लापता और आउटलेर शामिल हैं। ऊपर दिए गए संकेत "चरण दर चरण, हटाएं/भरें नहीं" के माध्यम से एआई से डायग्नोस्टिक कोड का अनुरोध करें और इसे चलाएं। कमी को MCAR/MAR/MNAR के रूप में वर्गीकृत करें और अपना औचित्य एक वाक्य में लिखें। एक-एक करके विरोधाभासी उम्मीदवारों की जांच करें और निर्णय लें कि कौन सी गलती है और कौन सी वास्तविक है। अंत में, सफाई से पहले/बाद में एक "पहले-बाद" तालिका तैयार करें और यदि कोई अप्रत्याशित परिवर्तन हो तो रिपोर्ट करें।
चेकलिस्ट
- [ ] मैंने कच्चे डेटा को बिना बदले एक अलग कॉपी में साफ़ कर दिया।
- [ ] मैंने कमी को MCAR/MAR/MNAR के रूप में वर्गीकृत किया और तदनुसार विधि चुनी।
- [ ] मैंने एक-एक करके आउटलेर्स की जांच की कि क्या वे त्रुटियां थीं या वास्तविक; मैंने आँख मूँद कर इसे नहीं हटाया।
- [ ] मैंने प्रत्येक सफ़ाई चरण के बाद अवलोकनों की संख्या और सारांश आँकड़ों की जाँच की।
- [ ] मैंने कोड और एक टिप्पणी पंक्ति के साथ सभी चरणों का दस्तावेजीकरण किया; प्रतिवर्ती.
- [ ] मैंने सफाई को उस प्रक्रिया के ज्ञान पर आधारित किया जो डेटा उत्पन्न करती है, न कि विश्लेषण परिणाम पर।