एकाइहरू
1. इकोनोमेट्रिक्स र तथ्याङ्कमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र गोपनीयता 2. डाटा क्लिनिङ र तयारी: हराएको डाटा, आउटलियर्स, र कोडिङ 3. अन्वेषक डाटा विश्लेषण र भिजुअलाइजेसन: आर्टिफिसियल इन्टेलिजेन्सको साथ ग्राफिङ र व्याख्या 4. रैखिक प्रतिगमन: मोडेल निर्माण, गुणांक व्याख्या र अनुमानहरू 5. प्रतिगमन निदान र उल्लङ्घनहरू: कोलिनियरिटी, हेटेरोसेडेस्टिकिटी, स्वत: सहसंबंध 6. परिकल्पना परीक्षण र p-मान: महत्व, शक्ति, र बहु तुलनाहरू 7. पी-ह्याकिंग, हार्किङ र तथ्याङ्कीय अखण्डता: आर्टिफिसियल इन्टेलिजेन्सको युगमा समस्याहरू 8. समय श्रृंखला विश्लेषण: स्थिरता, ARIMA र पूर्वानुमान 9. कारण र नीति विश्लेषण: DiD, IV, RDD र कृत्रिम बुद्धिमत्ता 10. कोड जेनेरेसन र प्रजनन योग्यता: R/Python, Versioning र Reproducibility 11. रिपोर्ट लेखन, संचार, र नैतिकता: प्रस्तुत परिणाम र संचार सीमाहरू
एकाइ 2 / 11

डाटा क्लिनिङ र तयारी: हराएको डाटा, आउटलियर्स, र कोडिङ

लाभ:

  • छुटेको डेटा प्रकारहरू (MCAR/MAR/MNAR), आउटलियरहरू, र कोडिङ त्रुटिहरू पहिचान गर्ने क्षमता र सफा कोड र निदानहरू उत्पादन गर्न सही डाटाको साथ AI प्रयोग गर्ने क्षमता।
  • कृत्रिम बुद्धिमत्ता द्वारा सुझाव गरिएको प्रत्येक सफाई चरण (मेटाउने, असाइनमेन्ट, रूपान्तरण) ले विश्लेषण परिणामलाई कसरी असर गर्छ र उल्ट्याउन सकिने र कागजात गरिएको कार्यप्रवाह स्थापना गर्दछ भनेर हेर्नको क्षमता।
  • सफा गर्ने निर्णयहरू डाटा उत्पन्न गर्ने प्रक्रियाको ज्ञानमा आधारित हुन्छन् भन्ने कुरालाई कायम राख्दै, र त्यो कृत्रिम बुद्धिमत्ता एक पर्यवेक्षित सहायक हो, अन्धा अटोमेटन होइन।

प्रत्येक अनुभवी विश्लेषकलाई एउटा सत्य थाहा छ: अनुभवजन्य परियोजनाको धेरैजसो समय मोडलिङ होइन, तर डाटा क्लिनिङ (डेटामा भएका त्रुटिहरू, गल्तीहरू र विसंगतिहरूलाई सच्याउने र विश्लेषणको लागि तयार पार्ने काम)। सामान्य नियमको रूपमा, लगभग 70-80% समय डेटा बुझ्न, सफाई र रूपान्तरणमा जान्छ; वास्तविक विश्लेषणका लागि २०-३०% मात्र बाँकी छ। यस इकाईमा, हामी चरण-दर-चरण देख्नेछौं कि कसरी कृत्रिम बुद्धिमत्ता (AI) ले यो भारी बोझ कम गर्छ, तर कुन निर्णयहरू अझै पनि तपाईंसँग र किन रहनुपर्छ।

पहिले दुईवटा आधारभूत तथ्यहरू राखौं। पहिलो, सफाई निर्णयहरू डाटा उत्पादन गर्ने प्रक्रियाको तपाईंको ज्ञानमा आधारित हुन्छन्: केवल तपाईंलाई थाहा छ किन मान हराइरहेको छ, किन संख्या धेरै ठूलो छ। AI ले डाटा देख्दैन, सन्दर्भ थाहा छैन; कोड लेख्छ, निर्णय गर्दैन। दोस्रो, प्रत्येक सफाई चरणले विश्लेषण परिणाम परिवर्तन गर्न सक्छ। आउटलायर मेटाउँदा गुणांक उल्टाउन सक्छ; माध्यको साथ हराइरहेको भर्नुले कृत्रिम रूपमा भिन्नता कम गर्न सक्छ। त्यसैले क्लिनअप उल्टाउन मिल्ने र कागजातित हुनुपर्छ: कच्चा डाटालाई कहिल्यै नछुनुहोस्, प्रत्येक चरण कोडमा गर्नुहोस्, प्रत्येक चरणको प्रभाव रेकर्ड गर्नुहोस्।

चरण-दर-चरण सफाई कार्यप्रवाह

1. डाटा जान्नुहोस्। पहिले संरचना हेर्नुहोस्: पङ्क्तिहरू (अवलोकनहरू) र स्तम्भहरू (चर), प्रत्येक चरको प्रकार (संख्यात्मक, वर्गीकृत, मिति), सारांश तथ्याङ्क, हराएको संख्या। तपाईं यस "डेटा प्रोफाइल" कोडको लागि AI लाई सोध्न सक्नुहुन्छ; तर तपाईले आउटपुट पढ्नुहुन्छ र "यो चर पाठको रूपमा किन आयो?" जस्ता प्रश्नहरू सोध्नुहोस्।

2. छुटेको डाटा बुझ्नुहोस् र वर्गीकृत गर्नुहोस्। छुटेको डाटालाई तीन प्रकारमा विभाजन गरिएको छ। MCAR (यादृच्छिक रूपमा पूर्ण रूपमा हराइरहेको): हराइरहेको कुनै पनि कारणले होइन, उदाहरणका लागि सेन्सर अनियमित रूपमा असफल भयो। MAR (यादृच्छिक रूपमा हराइरहेको): बेपत्ता अन्य अवलोकन गरिएका चरहरूमा निर्भर गर्दछ, उदाहरणका लागि वृद्ध व्यक्तिहरूले प्रायः प्रश्न खाली छोड्छन्, तर तपाईंलाई उमेर थाहा छ। MNAR (यादृच्छिक रूपमा हराइरहेको छैन): हराइरहेको अवस्था आफैंमा ननिरीक्षण मूल्यमा निर्भर गर्दछ, उदाहरणका लागि उच्च कमाउनेहरूले आफ्नो आय रिपोर्ट गर्दैनन्। यो भिन्नता महत्वपूर्ण छ किनभने यसले समाधान विधि निर्धारण गर्दछ र AI ले तपाईंको लागि यो निर्णय गर्न सक्दैन।

3. कमीसँग व्यवहार गर्नुहोस्। विकल्पहरू: सूची अनुसार मेटाउने, माध्य/माध्यक अभियोग, मोडेलमा आधारित बहु अभियोग। MCAR मा मेटाउनु अपेक्षाकृत सुरक्षित छ तर नमूना आकार घटाउँछ। धेरै असाइनमेन्ट MAR मा अधिक उपयुक्त छ। कुनै सरल विधिले MNAR मा निष्पक्षताको ग्यारेन्टी गर्दैन; कमजोरी संयन्त्रलाई मोडेल गरिनुपर्दछ वा कम्तिमा एक संवेदनशीलता विश्लेषण गरिनु पर्छ। मीन-फिलिंग सजिलो तर खतरनाक छ: यसले भिन्नता घटाउँछ, सम्बन्ध कमजोर बनाउँछ, र अनिश्चितता लुकाउँछ।

4. बाहिरीहरूको जाँच गर्नुहोस्। एक आउटलियर एक अवलोकन हो जुन अरूबाट धेरै टाढा खडा हुन्छ। दुई प्रश्नहरू अलग गर्नुहोस्: के यो त्रुटि हो (डाटा प्रविष्टिमा उमेर 999 लेखिएको थियो) वा यो वास्तविक तर बाहिरी मूल्य (अरबपतिको आय) हो? बगहरू ठीक गर्नुहोस्; साँचो आउटलियरहरू नमेट्नुहोस् किनभने तिनीहरू डेटा प्रतिनिधित्व गर्छन्। आउटलियर मेटाउँदै "किनकि यसले कष्ट दिन्छ" तपाईले परिणाम तिर डेटा स्किभ गर्दै हुनुहुन्छ।

5. कोडिङ र स्थिरता। कोटिहरू मानकीकृत गर्नुहोस् ("पुरुष", "पुरुष", "ई" सबै एउटै कोडमा), मितिहरू एक ढाँचामा ल्याउनुहोस्, एकाइहरू एक स्केलमा, डुप्लिकेट पङ्क्तिहरू पत्ता लगाउनुहोस्। यो सबैभन्दा कम जोखिमपूर्ण चरण हो जहाँ AI ले मद्दत गर्दछ।

6. कागजात र फ्रिज गर्नुहोस्। कच्चा र सफा डाटा अलग राखेर, कोड र एक टिप्पणी लाइन संग प्रत्येक चरण रेकर्ड गर्नुहोस्। त्यसोभए जब एक रेफरीले सोध्छन् "किन यी अवलोकनहरू छोडियो?" तपाईं आफ्नो जवाफ तयार छ।

सावधानी: परिणामहरूमा आधारित सफाई निर्णयहरू नगर्नुहोस्। "जब तपाइँ यो रेखा मेटाउनुहुन्छ, गुणांक महत्त्वपूर्ण हुन्छ" भनिएको लाइन मेटाउनु पी-ह्याकिंगको सबैभन्दा कपटी रूप हो, जुन हामी अर्को एकाइमा देख्नेछौं।

तुलना तालिका: हराएको डेटा विधिहरू

विधि

यो कहिले उपयुक्त छ?

जोखिम

AI को भूमिका

पङ्क्ति मेटाउनुहोस्

MCAR, कम छुटेको दर

नमूना सानो हुन्छ, MAR/MNAR मा पूर्वाग्रह

कोड लेख्छ; तपाईं निर्णय गर्नुहोस्

माध्य/माध्यक असाइनमेन्ट

द्रुत प्रारम्भिक विश्लेषण

भिन्नता घटाउँछ, सम्बन्ध लुकाउँछ

यो सजिलो छ तर यो सिफारिस गर्दैन; चेतावनी दिनु पर्छ

मल्टिपल असाइनमेन्ट (MI)

MAR, महत्त्वपूर्ण चर

यदि सही रूपमा स्थापना गरिएको छैन भने यो भ्रामक हुनेछ

कोड र प्याकेज सिफारिस गर्दछ (मुसा)

मेकानिज्म मोडलिङ

MNAR

जटिल, अनुमान-गहन

मस्यौदा मात्र; विशेषज्ञ आवश्यक छ

चार प्रतिलिपि योग्य प्रम्प्टहरू

1. डाटा प्रोफाइलिङ:

तपाईंको भूमिका: डाटा सफा गर्ने सहायक। म डाटा साझा गर्दिन, म आर कोड चाहन्छु। मसँग 'अंक' भनिने डेटा फ्रेम छ; चर: आईडी, उमेर (संख्यात्मक), आय (संख्यात्मक), शिक्षा (वर्ग), क्षेत्र (वर्ग), मिति (मिति)। कार्य: कोड लेख्नुहोस् जसले प्रकार, हराएको संख्या र प्रत्येक चरको लागि दर, संख्यात्मकहरूका लागि सारांश तथ्याङ्कहरू, र वर्गीकृतहरूका लागि फ्रिक्वेन्सी तालिका उत्पादन गर्दछ। टिप्पणी लाइन थप्नुहोस्।

2. छुटेको डाटा निदान:

माथिको 'अंक' डेटाको लागि छुटेको ढाँचाको जाँच गर्ने कोड लेख्नुहोस्: - प्रत्येक चरको छुटेको दर, - अन्य चरहरूसँग हराएको सम्बन्ध देखाउने सरल तालिका/ग्राफ। म कोडको आउटपुट हेर्नेछु र MCAR/MAR/MNAR भिन्नता बनाउनेछु; तपाईले मात्र डायग्नोस्टिक उपकरण उत्पादन गर्नुहुन्छ, असाइनमेन्ट विधिमा निर्णय नगर्नुहोस्।

3. बाहिरी निरीक्षण (मेटिने होइन):

चल 'आय' को लागि कोड लेख्नुहोस् जसले मेटाउन बिना आउटलियरहरू जाँच गर्दछ: बक्सप्लट, IQR-आधारित सीमाहरू, र तालिका सूची आउटलियर अवलोकन + मानहरू। म हेर्नेछु कि यी गल्ती वा वास्तविक हो। स्वचालित मेटाउने थप्नुहोस्।

4. कोडिङ मानकीकरण:

'शिक्षा' चरमा, मानहरू मिश्रित लेखिएका छन्: "प्राथमिक विद्यालय", "प्राथमिक विद्यालय","प्राथमिक","उच्च विद्यालय","उच्च विद्यालय","विश्वविद्यालय","विश्वविद्यालय"। R कोड लेख्नुहोस् जसले तिनीहरूलाई सुसंगत कोटीहरूमा पुन: कोड गर्दछ; म्यापिङ तालिका स्पष्ट रूपमा देखाउनुहोस् ताकि म प्रत्येक रूपान्तरण पुष्टि गर्न सकूँ। तपाईंले नचिनेको मानलाई "UNKNOWN" मा सेट गर्नुहोस्।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट:

डाटा सफा गर्नुहोस्, खाली ठाउँहरू भर्नुहोस्, बाहिरीहरूलाई खारेज गर्नुहोस्।

यो माग खतरनाक छ: यसले AI लाई अन्धो अधिकार दिन्छ। कुन किसिमको हराइरहेको छ, कस्तो भरिएको छ, कस्तो विरोधाभासपूर्ण सत्य–कुनै पनि स्पष्ट छैन । परिणाम एक गोप्य पक्षपाती डेटा सेट हुन सक्छ।

शक्तिशाली प्रम्प्ट:

तपाईंको भूमिका: सफाई सहायक, तपाईं निर्णय निर्माता हुनुहुन्न। चरण-दर-चरण जानुहोस् र कोड लेख्नुहोस् जसले प्रत्येक चरणको प्रभाव रिपोर्ट गर्दछ: 1) छुटेको ढाँचा देखाउनुहोस् (मेट्नुहोस्/भर्नुहोस्), 2) सूची बाहिरका उम्मेद्वारहरू (मेटाउनुहोस्), 3) म्यापिङ तालिकासँग श्रेणी असंगतिहरू ठीक गर्नुहोस्। प्रत्येक चरण पछि पङ्क्ति गणना र सारांश तथ्याङ्क छाप्नुहोस् ताकि म परिवर्तन देख्न र पुष्टि गर्न सकूँ। स्वचालित असाइनमेन्ट/मेटाउने सम्मिलन।

भिन्नता स्पष्ट छ: बलियो इच्छाले AI लाई पर्यवेक्षित सहायकको रूपमा राख्छ, उल्टाउन मिल्ने र दस्तावेज गरिएका चरणहरू उत्पादन गर्दछ।

तीन मिनी केसहरू

केस १ — औसत असाइनमेन्ट ट्र्याप। एक विश्लेषकको 5,000 मानिसहरूको आय डेटा 18% हराइरहेको थियो। उनले AI लाई "खाली ठाउँहरू भर्न" भने; AI ले ती सबैलाई औसत गर्यो। परिणाम: आयको भिन्नता 22% ले घट्यो, र शिक्षा-आय सम्बन्धको गुणांक यो भन्दा कमजोर भयो। सही तरिका: कमी MAR (शिक्षाको कारणले) थियो, धेरै असाइनमेन्ट (मुसा) द्वारा भर्नुपर्ने थियो। पाठ: भर्ने विधि संयन्त्रमा निर्भर गर्दछ।

केस 2 - आउटलियर सफाईले खोजलाई उल्टाउँछ। एउटा फर्म डाटामा 3 धेरै ठूला फर्महरू (कुल अवलोकनको ०.६%) थिए। यी AI को "सफाई" सुझाव द्वारा मेटाइयो; मापन गुणांकको अर्थतन्त्र सकारात्मकबाट नकारात्मकमा परिणत भयो। यद्यपि, ती 3 कम्पनीहरू वास्तविक र उद्योगको महत्त्वपूर्ण भाग थिए। सही तरिका भनेको मेटाउनुको सट्टा पूर्ण र बलियो अनुमानका साथ रिपोर्ट गर्नु थियो। पाठ: वास्तविक आउटलियरहरू डेटा हुन्, शोर होइन।

केस 3 - मौन कोडिङ त्रुटि। एउटा प्यानलमा, मिति चर दुई फरक ढाँचाहरूमा आयो ("2020-03-01" र "01/03/2020")। जब AI द्वारा उत्पादित संयोजन कोडले तिनीहरूलाई विभिन्न मानहरूको लागि गलत मान्‍यो, 1,400 अवलोकनहरू मेल खाएनन् र वृद्धि दर हास्यास्पद भयो। विश्लेषकले पङ्क्ति गणना जाँच गरेन भने फरक पर्दैन। पाठ: प्रत्येक चरण पछि अवलोकन गणना र सेनिटी जाँचहरू अनिवार्य छन्।

सामान्य गल्तीहरू

  • अन्धाधुन्ध औसतको साथ खाली ठाउँ भर्दै। यसले भिन्नता घटाउँछ, अनिश्चितता लुकाउँछ, र MAR/MNAR मा पूर्वाग्रह सिर्जना गर्दछ। पहिले संयन्त्रको वर्गीकरण गर्नुहोस्।
  • आउटलियर मेटाउँदै "किनकि यसले कष्ट दिन्छ"। साँचो outliers डाटा प्रतिनिधित्व; मेटाउनु परिणामलाई झुकाउँदैछ। जे गलत छ त्यसलाई सच्याउनुहोस्, यथार्थलाई राख्नुहोस्।
  • कच्चा डाटा ट्याप गर्दै। कच्चा डाटा कहिल्यै परिमार्जन नगर्नुहोस्; एक अलग प्रतिलिपिमा कोडको साथ सबै सफाई गर्नुहोस् ताकि यसलाई फर्काउन सकिन्छ।
  • चरणहरूको प्रभाव मापन गर्दैन। यदि पङ्क्ति गणना र सारांश तथ्याङ्कहरू प्रत्येक चरण पछि जाँच गरिएन भने, मौन त्रुटिहरू जम्मा हुनेछन्।
  • फलस्वरूप सफाई। "जब तपाइँ यो लाइन थप्नुहुन्छ, परिणाम राम्रो हुन्छ" को तर्क पी-ह्याकिंग हो; विश्लेषण परिणाम भन्दा पहिले र स्वतन्त्र रूपमा सफाई योजना हुनुपर्छ।
सुझाव: सफा गर्नु अघि र पछि एउटै आधारभूत तथ्याङ्कहरू (अर्थ, मध्य, अवलोकन संख्या, केही सहसम्बन्धहरू) सँगसँगै राख्ने "पहिले/पछि" तालिका राख्नुहोस्। एक अप्रत्याशित जम्प लुकेको त्रुटि को सबै भन्दा राम्रो हार्बिंगर हो।

संक्षेपमा

डाटा क्लिनिङ अनुभवजन्य कार्यको सबैभन्दा समय-उपभोग र निर्णय-आवश्यक चरण हो। AI यसमा एक शक्तिशाली कोड जेनेरेटर हो, तर यसले शटहरू कल गर्न सक्दैन: तपाईंले छुटेको डेटा प्रकार (MCAR/MAR/MNAR) वर्गीकृत गर्नुहोस्, आउटलायर त्रुटि हो वा वास्तविक हो कि भनेर निर्धारण गर्नुहोस्, प्रत्येक चरणलाई उल्टाउन मिल्ने र कागजात राख्नुहोस्। AI अन्धा "स्पष्ट" अधिकार दिनुको सट्टा, एक चरण-दर-चरण कार्यप्रवाह स्थापना गर्नुहोस् जसको प्रभाव मापन र मान्य हुन्छ। प्रत्येक चरण पछि अवलोकन र सारांश तथ्याङ्कहरूको संख्या जाँच गर्दै मौन त्रुटिहरूको लागि उत्तम एन्टिडोट हो।

आवेदन कार्य

डेटा सेट (तपाईंको आफ्नै डेटा वा नमूना सेट) मा हराइरहेको र आउटलियरहरू समावेश गर्ने कम्तीमा दुई चरहरू चयन गर्नुहोस्। माथिको "चरणबाट चरण, नमेट्नुहोस्/भर्नुहोस्" प्रोम्प्ट मार्फत AI बाट डायग्नोस्टिक कोड अनुरोध गर्नुहोस् र यसलाई चलाउनुहोस्। कमीलाई MCAR/MAR/MNAR को रूपमा वर्गीकृत गर्नुहोस् र तपाईंको औचित्य एक वाक्यमा लेख्नुहोस्। एक एक गरी विरोधाभासी उम्मेदवारहरू जाँच गर्नुहोस् र निर्णय गर्नुहोस् कि कुन गल्ती हो र कुन वास्तविक हो। अन्तमा, सफा गर्नु अघि/पछी "पहिले पछि" तालिका उत्पादन गर्नुहोस् र यदि कुनै अप्रत्याशित परिवर्तनहरू छन् भने रिपोर्ट गर्नुहोस्।

चेकलिस्ट

  • [ ] मैले कच्चा डाटालाई यसलाई परिवर्तन नगरी छुट्टै प्रतिलिपिमा सफा गरें।
  • [ ] मैले कमीलाई MCAR/MAR/MNAR को रूपमा वर्गीकृत गरें र तदनुसार विधि छनोट गरें।
  • [ ] मैले बाहिरीहरूलाई एक एक गरेर जाँचें कि तिनीहरू त्रुटिहरू थिए वा वास्तविक थिए। मैले आँखा चिम्लिएर मेटाएको होइन।
  • [ ] मैले प्रत्येक सफाई चरण पछि अवलोकन संख्या र सारांश तथ्याङ्कहरू जाँच गरें।
  • [ ] मैले कोड र टिप्पणी रेखाको साथ सबै चरणहरू दस्तावेज गरें; उल्टाउन मिल्ने।
  • [ ] मैले डाटा उत्पादन गर्ने प्रक्रियाको ज्ञानमा आधारित छु, विश्लेषण नतिजामा होइन।