युनिट्स
1. अर्थमिती आणि सांख्यिकीमधील कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि गोपनीयता 2. डेटा क्लीनिंग आणि तयारी: गहाळ डेटा, आउटलियर्स आणि कोडिंग 3. एक्सप्लोरेटरी डेटा ॲनालिसिस आणि व्हिज्युअलायझेशन: आर्टिफिशियल इंटेलिजन्ससह आलेख आणि व्याख्या 4. रेखीय प्रतिगमन: मॉडेल बिल्डिंग, गुणांक व्याख्या आणि अनुमान 5. रीग्रेशन डायग्नोस्टिक्स आणि उल्लंघने: समरूपता, विषमता, ऑटोकॉरिलेशन 6. गृहीतक चाचणी आणि p-मूल्य: महत्त्व, शक्ती आणि एकाधिक तुलना 7. पी-हॅकिंग, हार्किंग आणि सांख्यिकीय अखंडता: कृत्रिम बुद्धिमत्तेच्या युगातील नुकसान 8. वेळ मालिका विश्लेषण: स्थिरता, ARIMA आणि अंदाज 9. कारण आणि धोरण विश्लेषण: DiD, IV, RDD आणि कृत्रिम बुद्धिमत्ता 10. कोड निर्मिती आणि पुनरुत्पादकता: आर/पायथन, आवृत्ती आणि पुनरुत्पादनक्षमता 11. अहवाल लेखन, संप्रेषण आणि नैतिकता: सादरीकरण परिणाम आणि संप्रेषण सीमा
युनिट 2 / 11

डेटा क्लीनिंग आणि तयारी: गहाळ डेटा, आउटलियर्स आणि कोडिंग

नफा:

  • गहाळ डेटा प्रकार (MCAR/MAR/MNAR), आउटलियर आणि कोडिंग त्रुटी ओळखण्याची क्षमता आणि क्लीनअप कोड आणि डायग्नोस्टिक्स तयार करण्यासाठी योग्य डेटासह AI वापरण्याची क्षमता
  • आर्टिफिशियल इंटेलिजन्सद्वारे सुचविलेली प्रत्येक साफसफाईची पायरी (हटवणे, असाइनमेंट, ट्रान्सफॉर्मेशन) विश्लेषण परिणामांवर कसा परिणाम करेल आणि उलट करता येणारा आणि दस्तऐवजीकरण केलेला वर्कफ्लो कसा स्थापित करेल हे पाहण्याची क्षमता
  • साफसफाईचे निर्णय डेटा व्युत्पन्न करणाऱ्या प्रक्रियेच्या ज्ञानावर आधारित आहेत आणि कृत्रिम बुद्धिमत्ता हा एक पर्यवेक्षी सहाय्यक आहे, अंध ऑटोमॅटन नाही हे लक्षात ठेवणे

प्रत्येक अनुभवी विश्लेषकाला एक सत्य माहित आहे: अनुभवजन्य प्रकल्पाचा बहुतेक वेळ मॉडेलिंग नसून डेटा क्लिनिंग (डेटामधील चुका, चुका आणि विसंगती दुरुस्त करण्याचे आणि विश्लेषणासाठी तयार करण्याचे काम). सामान्य नियमानुसार, सुमारे 70-80% वेळ डेटा समजून घेणे, साफ करणे आणि बदलण्यात जातो; वास्तविक विश्लेषणासाठी फक्त 20-30% शिल्लक आहे. या युनिटमध्ये, आम्ही कृत्रिम बुद्धिमत्ता (AI) हे जड ओझे कसे हलके करते ते टप्प्याटप्प्याने पाहू, परंतु तरीही कोणते निर्णय तुमच्याकडे असावेत आणि का.

प्रथम दोन मूलभूत तथ्ये ठेवूया. प्रथम, साफसफाईचे निर्णय डेटा तयार करणाऱ्या प्रक्रियेच्या तुमच्या ज्ञानावर आधारित असतात: मूल्य का गहाळ आहे, संख्या जास्त का आहे हे फक्त तुम्हालाच माहीत आहे. एआय डेटा पाहत नाही, संदर्भ माहित नाही; कोड लिहितो, निर्णय घेत नाही. दुसरे, प्रत्येक साफसफाईची पायरी विश्लेषण परिणाम बदलू शकते. आउटलायर हटवल्याने गुणांक उलटू शकतो; क्षुद्र सह भरणे कृत्रिमरित्या भिन्नता कमी करू शकते. म्हणून क्लीनअप उलट करता येण्याजोगे आणि दस्तऐवजीकरण केले पाहिजे: कच्च्या डेटाला कधीही स्पर्श करू नका, प्रत्येक चरण कोडमध्ये करा, प्रत्येक चरणाचा प्रभाव रेकॉर्ड करा.

चरण-दर-चरण स्वच्छता कार्यप्रवाह

1. डेटा जाणून घ्या. प्रथम रचना पहा: पंक्तींची संख्या (निरीक्षण) आणि स्तंभ (व्हेरिएबल्स), प्रत्येक व्हेरिएबलचा प्रकार (संख्यात्मक, स्पष्ट, तारीख), सारांश आकडेवारी, गहाळांची संख्या. तुम्ही AI ला या "डेटा प्रोफाइल" कोडसाठी विचारू शकता; पण तुम्ही आउटपुट वाचता आणि "हे व्हेरिएबल टेक्स्ट म्हणून का आले?" असे प्रश्न विचारता.

2. गहाळ डेटा समजून घ्या आणि वर्गीकृत करा. गहाळ डेटा तीन प्रकारांमध्ये विभागलेला आहे. MCAR (यादृच्छिकपणे पूर्णपणे गहाळ): गहाळ हे कोणत्याही कारणामुळे नाही, उदाहरणार्थ सेन्सर यादृच्छिकपणे अयशस्वी झाला. MAR (यादृच्छिकपणे गहाळ होणे): गहाळपणा इतर निरीक्षण केलेल्या चलांवर अवलंबून असते, उदाहरणार्थ वृद्ध लोक प्रश्न अधिक वेळा रिक्त सोडतात, परंतु तुम्हाला वय माहित आहे. MNAR (यादृच्छिकपणे गहाळ नाही): गहाळपणा स्वतःच निरीक्षण न केलेल्या मूल्यावर अवलंबून असतो, उदाहरणार्थ उच्च कमाई करणारे त्यांच्या उत्पन्नाची तक्रार करत नाहीत. हा फरक गंभीर आहे कारण तो उपाय पद्धत ठरवतो आणि AI तुमच्यासाठी हे ठरवू शकत नाही.

3. कमतरता हाताळा. पर्याय: सूचीनुसार हटवणे, सरासरी/मध्यवर्ती आरोप, मॉडेल-आधारित एकाधिक आरोप. MCAR मध्ये हटवणे तुलनेने सुरक्षित आहे परंतु नमुना आकार कमी करते. MAR मध्ये एकाधिक असाइनमेंट अधिक योग्य आहे. कोणतीही साधी पद्धत MNAR मध्ये निःपक्षपातीपणाची हमी देत ​​नाही; कमतरतेची यंत्रणा मॉडेल केली पाहिजे किंवा किमान संवेदनशीलता विश्लेषण केले पाहिजे. मीन-फिलिंग करणे सोपे आहे परंतु धोकादायक आहे: ते भिन्नता कमी करते, नातेसंबंध कमकुवत करते आणि अनिश्चितता लपवते.

4. बाहेरील व्यक्तींचे परीक्षण करा. आउटलियर हे एक निरीक्षण आहे जे इतरांपासून खूप दूर आहे. दोन प्रश्न वेगळे करा: ही एक त्रुटी आहे (डेटा एंट्रीमध्ये वय 999 लिहिले होते) किंवा ते वास्तविक परंतु जास्त मूल्य (अब्जाधीशांचे उत्पन्न) आहे? दोषांचे निराकरण करा; खरे आउटलियर हटवू नका कारण ते डेटाचे प्रतिनिधित्व करतात. आउटलायर हटवणे "कारण ते त्रासदायक आहे" तुम्ही डेटा निकालाकडे वळवत आहात.

5. कोडिंग आणि सातत्य. श्रेणी मानकीकृत करा ("पुरुष", "पुरुष", "ई" सर्व एका कोडमध्ये), तारखा एका स्वरूपात आणा, एकके एका स्केलमध्ये, डुप्लिकेट पंक्ती शोधा. हा सर्वात कमी जोखमीचा टप्पा आहे जिथे AI सर्वोत्तम मदत करते.

6. दस्तऐवज आणि फ्रीज. कच्चा आणि साफ केलेला डेटा वेगळा ठेवून कोड आणि टिप्पणी लाइनसह प्रत्येक चरण रेकॉर्ड करा. त्यामुळे जेव्हा रेफरी "ही निरीक्षणे का वगळली?" तुमचे उत्तर तयार आहे.

खबरदारी: निकालांवर आधारित साफसफाईचे निर्णय घेऊ नका. "जेव्हा तुम्ही ही ओळ हटवता तेव्हा गुणांक लक्षणीय बनतो" अशी ओळ हटवणे हा पी-हॅकिंगचा सर्वात कपटी प्रकार आहे, जो आपण पुढील युनिटमध्ये पाहू.

तुलना सारणी: गहाळ डेटा पद्धती

पद्धत

ते केव्हा योग्य आहे?

धोका

AI ची भूमिका

एक पंक्ती हटवा

MCAR, कमी गहाळ दर

नमुना लहान होतो, MAR/MNAR मध्ये पूर्वाग्रह

कोड लिहितो; तुम्ही ठरवा

मीन/मध्यम असाइनमेंट

द्रुत प्राथमिक विश्लेषण

भिन्नता कमी करते, संबंध लपवते

हे सोपे आहे परंतु शिफारस करत नाही; चेतावणी दिली पाहिजे

एकाधिक असाइनमेंट (MI)

MAR, महत्त्वाचे चल

योग्यरित्या स्थापित न केल्यास ते दिशाभूल होईल

कोड आणि पॅकेजची शिफारस करतो (उंदीर)

यंत्रणा मॉडेलिंग

MNAR

जटिल, गृहीतक-गहन

फक्त मसुदा; तज्ञ आवश्यक आहे

चार कॉपी करण्यायोग्य प्रॉम्प्ट

1. डेटा प्रोफाइलिंग:

तुमची भूमिका: डेटा साफ करणारे सहाय्यक. मी डेटा शेअर करत नाही, मला आर कोड हवा आहे. माझ्याकडे 'अंक' नावाची डेटा फ्रेम आहे; चल: id, वय (संख्यात्मक), उत्पन्न (संख्यात्मक), शिक्षण (वर्गीय), प्रदेश (वर्गीय), तारीख (तारीख). कार्य: कोड लिहा जो प्रत्येक व्हेरिएबलसाठी प्रकार, गहाळ संख्या आणि दर तयार करतो, अंकीयांसाठी सारांश आकडेवारी आणि श्रेणीबद्धसाठी वारंवारता सारणी. टिप्पणी ओळ जोडा.

2. गहाळ डेटा निदान:

वरील 'अंक' डेटासाठी गहाळ पॅटर्नचे परीक्षण करणारा कोड लिहा: - प्रत्येक व्हेरिएबलचा गहाळ दर, - इतर व्हेरिएबल्सशी गहाळपणाचा संबंध दर्शविणारा एक साधा तक्ता/ आलेख. मी कोडचे आउटपुट पाहीन आणि MCAR/MAR/MNAR वेगळे करेन; तुम्ही फक्त डायग्नोस्टिक टूल तयार करा, असाइनमेंट पद्धतीवर निर्णय घेऊ नका.

3. बाह्य तपासणी (हटवणे नाही):

व्हेरिएबल 'उत्पन्न' साठी कोड लिहा जे न हटवता आउटलायर्सचे परीक्षण करते: बॉक्सप्लॉट, आयक्यूआर-आधारित सीमा आणि सारणी सूची बाह्य निरीक्षण + मूल्ये. या चुका आहेत की खऱ्या आहेत ते मी बघेन. स्वयंचलित हटवणे जोडा.

4. कोडिंग मानकीकरण:

'शिक्षण' व्हेरिएबलमध्ये, मूल्ये मिश्रित लिहिली जातात: "प्राथमिक शाळा", "प्राथमिक शाळा","प्राथमिक","हायस्कूल", "हायस्कूल","विद्यापीठ","विश्वविद्यालय". R कोड लिहा जो त्यांना सुसंगत श्रेणींमध्ये पुन्हा कोड करतो; मॅपिंग सारणी स्पष्टपणे दर्शवा जेणेकरून मी प्रत्येक रूपांतरणाची पुष्टी करू शकेन. तुम्ही ओळखत नसलेले मूल्य "UNKNOWN" वर सेट करा.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

डेटा साफ करा, अंतर भरा, आउटलियर टाकून द्या.

ही मागणी धोकादायक आहे: ती AI ला अंध अधिकार देते. कोणत्या प्रकारची उणीव आहे, कोणत्या प्रकारचे भरणे आहे, कोणते विरोधाभासी सत्य - यापैकी काहीही स्पष्ट नाही. परिणाम गुप्तपणे पक्षपाती डेटा सेट असू शकते.

शक्तिशाली सूचना:

तुमची भूमिका: सफाई सहाय्यक, तुम्ही निर्णय घेणारे नाही. स्टेप बाय स्टेप जा आणि कोड लिहा जो प्रत्येक पायरीच्या प्रभावाचा अहवाल देतो: 1) गहाळ पॅटर्न दाखवा (हटवू नका/भरू नका), 2) आउटलायर उमेदवारांची यादी करा (हटवू नका), 3) मॅपिंग टेबलसह श्रेणीतील विसंगती दूर करा. प्रत्येक पायरीनंतर पंक्ती संख्या आणि सारांश आकडेवारी मुद्रित करा जेणेकरून मी बदल पाहू आणि पुष्टी करू शकेन. स्वयंचलित असाइनमेंट/हटवणे समाविष्ट करणे.

फरक स्पष्ट आहे: मजबूत इच्छाशक्ती AI ला पर्यवेक्षी सहाय्यक म्हणून स्थान देते, उलट करता येण्याजोगे आणि दस्तऐवजीकरण पावले तयार करते.

तीन लहान प्रकरणे

केस 1 - सरासरी असाइनमेंट ट्रॅप. एका विश्लेषकाचा 5,000 लोकांच्या उत्पन्नाचा डेटा 18% गहाळ होता. त्याने एआयला "अंतर भरण्यासाठी" सांगितले; AI ने त्या सर्वांची सरासरी काढली. परिणाम: उत्पन्नातील फरक 22% ने कमी झाला आणि शिक्षण-उत्पन्न संबंधाचे गुणांक त्याच्यापेक्षा कमकुवत असल्याचे दिसून आले. योग्य मार्ग: कमतरता MAR (शिक्षणामुळे) होती, ती एकाधिक असाइनमेंट (उंदीर) द्वारे भरून काढावी लागली. धडा: भरण्याची पद्धत यंत्रणेवर अवलंबून असते.

केस 2 - बाह्य साफ करणे निष्कर्ष उलट करते. एका फर्म डेटामध्ये 3 खूप मोठ्या कंपन्या (एकूण निरीक्षणाच्या 0.6%) होत्या. हे AI च्या "स्वच्छता" सूचनेद्वारे हटविले गेले; स्केल गुणांकाची अर्थव्यवस्था सकारात्मक ते नकारात्मककडे वळली. तथापि, त्या 3 कंपन्या वास्तविक आणि उद्योगाचा एक महत्त्वाचा भाग होत्या. हटवण्याऐवजी पूर्ण आणि मजबूत अंदाजाने अहवाल देणे हा योग्य मार्ग होता. धडा: वास्तविक आउटलायर्स डेटा आहेत, आवाज नाही.

केस 3 - मूक कोडिंग त्रुटी. एका पॅनलमध्ये, तारीख व्हेरिएबल दोन वेगवेगळ्या फॉरमॅटमध्ये आले ("2020-03-01" आणि "01/03/2020"). जेव्हा AI द्वारे निर्मित संयोजन कोड त्यांना भिन्न मूल्यांसाठी चुकीचे समजले तेव्हा 1,400 निरीक्षणे जुळत नाहीत आणि वाढीचा दर हास्यास्पद बनला. विश्लेषकाने पंक्तीची संख्या तपासली नाही तर काही फरक पडणार नाही. धडा: प्रत्येक पायरीनंतर निरीक्षण संख्या आणि शुद्धता तपासणे आवश्यक आहे.

सामान्य चुका

  • आंधळेपणाने सरासरीसह अंतर भरणे. हे भिन्नता कमी करते, अनिश्चितता लपवते आणि MAR/MNAR मध्ये पूर्वाग्रह निर्माण करते. प्रथम यंत्रणेचे वर्गीकरण करा.
  • आउटलायर हटवत आहे "कारण ते त्रास देते". खरे आउटलायर्स डेटाचे प्रतिनिधित्व करतात; हटवणे परिणाम वाकणे आहे. जे चुकीचे आहे ते दुरुस्त करा, जे खरे आहे ते ठेवा.
  • कच्चा डेटा टॅप करणे. कच्चा डेटा कधीही सुधारू नका; कोडसह सर्व साफसफाई एका वेगळ्या कॉपीमध्ये करा जेणेकरून ते परत केले जाऊ शकेल.
  • पायऱ्यांचा प्रभाव मोजत नाही. प्रत्येक पायरीनंतर पंक्तीची संख्या आणि सारांश आकडेवारी तपासली नसल्यास, मूक त्रुटी जमा होतील.
  • परिणामी साफसफाई. "जेव्हा तुम्ही ही ओळ जोडता तेव्हा परिणाम चांगला होतो" हे तर्क पी-हॅकिंग आहे; विश्लेषणाच्या निकालापूर्वी आणि स्वतंत्रपणे साफसफाईचे नियोजन केले पाहिजे.
टीप: एक "आधी/नंतर" सारणी ठेवा जी क्लीनअपच्या आधी आणि नंतर समान मूलभूत आकडेवारी (मध्य, मध्य, निरीक्षणांची संख्या, काही परस्परसंबंध) शेजारी ठेवते. अनपेक्षित उडी ही लपलेल्या त्रुटीचा सर्वोत्तम आश्रयदाता आहे.

सारांशात

डेटा क्लीनिंग हा अनुभवजन्य कामाचा सर्वात जास्त वेळ घेणारा आणि निर्णय-आवश्यक टप्पा आहे. एआय हा एक शक्तिशाली कोड जनरेटर आहे, परंतु तो शॉट्स कॉल करू शकत नाही: आपण गहाळ डेटा प्रकार (MCAR/MAR/MNAR) वर्गीकृत करा, आउटलायर त्रुटी आहे की वास्तविक आहे हे निर्धारित करा, प्रत्येक चरण उलट करता येण्याजोगे आणि दस्तऐवजीकरण ठेवा. AI अंधांना "स्पष्ट" अधिकार देण्याऐवजी, एक चरण-दर-चरण कार्यप्रवाह स्थापित करा ज्याचा प्रभाव मोजला जातो आणि प्रमाणित केला जातो. प्रत्येक पायरीनंतर निरीक्षणांची संख्या आणि सारांश आकडेवारी तपासणे हा मूक त्रुटींसाठी सर्वोत्तम उतारा आहे.

अर्ज कार्य

डेटा सेटमध्ये (तुमचा स्वतःचा डेटा किंवा नमुना संच) गहाळ आणि आउटलियर असलेले किमान दोन व्हेरिएबल्स निवडा. वरील "स्टेप बाय स्टेप, डिलीट/फिल करू नका" प्रॉम्प्टद्वारे AI कडून डायग्नोस्टिक कोडची विनंती करा आणि तो चालवा. कमतरतेचे MCAR/MAR/MNAR असे वर्गीकरण करा आणि तुमचे समर्थन एका वाक्यात लिहा. परस्परविरोधी उमेदवारांची एक-एक करून तपासणी करा आणि कोणती चूक आणि कोणती खरी आहे ते ठरवा. शेवटी, साफसफाईच्या आधी/नंतर एक "आधी-नंतर" सारणी तयार करा आणि काही अनपेक्षित बदल असल्यास कळवा.

चेकलिस्ट

  • [ ] मी कच्चा डेटा न बदलता वेगळ्या कॉपीमध्ये साफ केला.
  • मी कमतरतेचे MCAR/MAR/MNAR असे वर्गीकरण केले आणि त्यानुसार पद्धत निवडली.
  • [ ] मी एक-एक करून आउटलायर्स तपासले की ते चुका आहेत की वास्तविक; मी ते आंधळेपणाने हटवले नाही.
  • [ ] मी प्रत्येक साफसफाईच्या चरणानंतर निरीक्षणांची संख्या आणि सारांश आकडेवारी तपासली.
  • [ ] मी कोड आणि टिप्पणी लाइनसह सर्व चरणांचे दस्तऐवजीकरण केले आहे; उलट करण्यायोग्य
  • [] मी डेटा तयार करणाऱ्या प्रक्रियेच्या ज्ञानावर आधारित आहे, विश्लेषण परिणामांवर नाही.