युनिट्स
1. डेटा विज्ञान आणि विश्लेषणातील कृत्रिम बुद्धिमत्तेचा परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. डेटा संकलन आणि स्त्रोत समजून घेणे: स्कीमा, सॅम्पलिंग, गुणवत्ता आणि लीक जागरूकता 3. डेटा क्लीनिंग आणि प्रीप्रोसेसिंग: गहाळ मूल्य, बाह्य आणि प्रकार रूपांतरण 4. एक्सप्लोरेटरी डेटा ॲनालिसिस (EDA): वितरण, संबंध आणि प्रारंभिक अंतर्दृष्टी 5. वैशिष्ट्य अभियांत्रिकी: रूपे निर्माण करणे, कोडिंग, स्केलिंग आणि गळती टाळणे 6. मॉडेल बिल्डिंग: समस्या व्याख्या, अल्गोरिदम निवड आणि प्रशिक्षण/चाचणी विभाजन 7. मॉडेल मूल्यांकन: मेट्रिक्स, क्रॉस-व्हॅलिडेशन आणि एक्सट्रीम लर्निंग 8. व्हिज्युअलायझेशन आणि स्टोरीटेलिंग: अचूक ग्राफिक्स, प्रामाणिक ग्राफिक्स 9. कोड जनरेशन: पायथन (पांडा) आणि SQL सह AI-सहाय्यित विश्लेषण 10. डेटा लीकेज आणि पुनरुत्पादनक्षमता: मूक आपत्ती आणि शिस्त 11. MLOps फाउंडेशन, नैतिकता, गोपनीयता आणि जबाबदार विश्लेषण
युनिट 4 / 11

एक्सप्लोरेटरी डेटा ॲनालिसिस (EDA): वितरण, संबंध आणि प्रारंभिक अंतर्दृष्टी

नफा:

  • वितरण, केंद्र, प्रसार आणि व्हेरिएबल्सचे योग्य आलेख (हिस्टोग्राम, बॉक्स प्लॉट, स्कॅटर प्लॉट) सह विसंगती एक्सप्लोर करण्याची क्षमता.
  • सहसंबंधाचा अचूक अर्थ लावण्याची आणि कार्यकारणभावात गोंधळ न घालता स्कॅटर प्लॉटसह एकत्र वाचण्याची क्षमता
  • सारांश आकडेवारी दिशाभूल करणारी असू शकते हे समजून घेण्याची क्षमता (अँसकॉम्बे धडा) आणि मॉडेलिंगची दिशा ठरवणारी गृहितके विकसित करणे.

मॉडेल तयार करण्यापूर्वी, डेटा जाणून घेणे आवश्यक आहे. ज्याप्रमाणे डॉक्टर रुग्णाची तपासणी केल्याशिवाय औषध लिहून देत नाही, त्याचप्रमाणे डेटा सायंटिस्ट डेटाची "तपासणी" केल्याशिवाय मॉडेल तयार करत नाही. या परीक्षेला एक्सप्लोरेटरी डेटा ॲनालिसिस (थोडक्यात EDA) असे म्हणतात: डेटाचे वितरण, नातेसंबंध, आश्चर्य आणि सापळे दृश्य आणि ग्राफिक पद्धतीने शोधण्याचा हा टप्पा आहे. EDA चा उद्देश गृहीतके निर्माण करणे, चुका पकडणे आणि मॉडेलिंगची दिशा ठरवणे हा आहे. या टप्प्यावर कृत्रिम बुद्धिमत्ता एक अतिशय शक्तिशाली सहाय्यक आहे: कोणता चार्ट योग्य आहे हे सूचित करते, त्याचा कोड लिहितो, वितरणाचा अर्थ लावतो. परंतु एखादी व्यक्ती त्याच्या/तिच्या क्षेत्रीय ज्ञानाने ठरवते की, त्याला दिसणारा नमुना खरा आहे की योगायोग.

EDA काय शोधते?

ईडीए चार प्रश्नांची उत्तरे शोधते. वितरण: प्रत्येक व्हेरिएबल कसे वितरित केले जाते - ते सममितीय, तिरपे किंवा दोन-शिखर आहे? मध्यवर्ती प्रवृत्ती आणि प्रसार: सरासरी, मध्य, मानक विचलन काय आहेत? नातेसंबंध: चल एकमेकांशी कसे संबंधित आहेत? विसंगती: अनपेक्षित मूल्ये, अंतर, गट आहेत का? कोणते वैशिष्ट्य कार्य करेल आणि कोणते मॉडेल योग्य आहे हे हे चार प्रश्न ठरवतात.

चला काही मूलभूत संकल्पना परिभाषित करूया. हिस्टोग्राम हा एक आलेख आहे जो अंकीय चलच्या मूल्यांना मध्यांतरांमध्ये विभाजित करतो आणि प्रत्येक मध्यांतरामध्ये किती निरीक्षणे आहेत हे दर्शवितो; वितरण पाहण्याचा हा सर्वात जलद मार्ग आहे. तिरकसपणा म्हणजे एका दिशेने वितरणाचे स्थलांतर; उत्पन्नासारखे चल उजवीकडे वळवले जातात (बहुसंख्य कमी, काही खूप जास्त). बॉक्स प्लॉट एका दृष्टीक्षेपात मध्यक, चतुर्थांश आणि आउटलियर दर्शवितो. स्कॅटर प्लॉट बिंदूंच्या ढगासह दोन संख्यात्मक चलांचा संबंध दर्शवितो.

परस्परसंबंध: एक संबंध आहे परंतु सावधगिरी बाळगा

सहसंबंध - दोन चल एकत्र कसे जातात याचे मोजमाप; -1 आणि +1 मधील संख्या — हे EDA चे सर्वाधिक वापरलेले आणि सर्वात गैरसमजलेले साधन आहे. +1 म्हणजे परिपूर्ण सह-वाढ, -1 म्हणजे परिपूर्ण व्यस्त संबंध, 0 म्हणजे रेखीय संबंध नाही. दोन मोठे सापळे आहेत. प्रथम, प्रसिद्ध नियम: सहसंबंध म्हणजे कार्यकारणभाव नाही. आईस्क्रीमच्या विक्रीत गुदमरल्याच्या घटनांमध्ये वाढ; एक दुसऱ्याकडे नेतो म्हणून नाही, तर उन्हाळा (लपलेले तिसरे व्हेरिएबल) दोघांना चालना देतो म्हणून. दुसरे, सहसंबंध केवळ रेषीय संबंध मोजतात; हे 0 च्या जवळचे मजबूत परंतु वक्र संबंध दर्शवू शकते. त्यामुळे सहसंबंध पाहताना, स्कॅटर प्लॉट देखील पहा.

खबरदारी: जेव्हा AI सहसंबंध क्रमांक देते, तेव्हा ते "A वाढवते B" सारख्या कारणात्मक भाषेत सरकते. हे धोकादायक आहे. सहसंबंध फक्त एकत्र हालचाली सूचित करते; केवळ अनुभव, डोमेनचे ज्ञान आणि काळजीपूर्वक अनुमान हे कारण स्थापित करतात.

Anscombe चौकडी: फक्त संख्या का पाहू नये

सांख्यिकी मध्ये एक प्रसिद्ध उदाहरण आहे: Anscombe चौकडी. चार भिन्न डेटा सेटमध्ये जवळजवळ समान मध्य, समान भिन्नता आणि समान सहसंबंध (0.82); पण आलेख केल्यावर ते पूर्णपणे वेगळे दिसतात — एक सरळ रेषा, एक वक्र, एक ढग एकाच आउटलायरने ओढला. धडा स्पष्ट आहे: सारांश आकडेवारी दिशाभूल करणारी आहे, आलेख पाहणे आवश्यक आहे. AI तुम्हाला सरासरी आणि परस्परसंबंध देऊ शकते, परंतु आलेख न पाहता त्या संख्यांवर विश्वास ठेवणे हे Anscombe सापळ्यात अडकत आहे.

खालील सारणी सारांशित करते की कोणता चार्ट कोणत्या प्रश्नाशी जुळतो:

प्रश्न

योग्य ग्राफिक

काय दाखवते

एकाच व्हेरिएबलचे वितरण

हिस्टोग्राम / KDE

आकार, तिरकसपणा, शिरोबिंदूंची संख्या

केंद्र आणि outliers

बॉक्स प्लॉट

मध्यक, चतुर्थांश, बाह्य

दोन संख्यांचा संबंध

स्कॅटर चार्ट

दिशा, ताकद, वक्रता

श्रेणी तुलना

बार चार्ट

गटांमधील फरक

काळानुसार बदल

रेखा चार्ट

कल, हंगामी

बहुविध संबंध

सहसंबंध उष्णता नकाशा

सामान्य संबंध मॅट्रिक्स

सिम्पसनचा विरोधाभास: एकत्रित डेटा खोटे बोलू शकतो

EDA मधील एक गुप्त सापळा म्हणजे सिम्पसनचा विरोधाभास: जेव्हा सर्व डेटा एकत्रितपणे तपासला जातो तेव्हा नमुना एक दिशा दर्शवू शकतो, परंतु जेव्हा डेटा अर्थपूर्ण उपसमूहांमध्ये विभागला जातो तेव्हा उलट. उत्कृष्ट उदाहरण: विद्यापीठातील महिला अर्जदारांसाठी एकूण स्वीकृती दर पुरुषांपेक्षा कमी असल्याचे दिसते; परंतु विभागानुसार विभाग पाहिल्यास, बहुतेक विभागांमध्ये पुरुषांपेक्षा महिलांचा स्वीकार दर जास्त आहे. कुठून? महिलांनी अधिक स्पर्धात्मक (कमी स्वीकृती दर) विभागांमध्ये अर्ज केला; एकत्रित संख्या हे लपविलेले चल संचयित करते. धडा स्पष्ट आहे: एकूण किंवा सरासरी पाहताना, अर्थपूर्ण उपसमूह (विभाग, कालावधी, चॅनेल) मध्ये विभाजित केल्यावर ती संख्या समान कथा सांगते किंवा नाही हे तपासण्याची खात्री करा. जेव्हा AI तुम्हाला एकत्रित दर देते, तेव्हा "तुम्ही त्याचे विभाजन करता तेव्हाही ते वैध आहे का" असे विचारल्यास सर्वात दिशाभूल करणारे परिणाम लवकर मिळतील.

तीन लहान प्रकरणे

केस 1 - दोन लपलेल्या टेकड्या. एका विश्लेषकाने ग्राहकाचे सरासरी वय 41 असल्याचे आढळले आणि ते "मध्यमवर्गीय जमाव" म्हणून नोंदवले. परंतु हिस्टोग्रामने दोन शिखरे दर्शविली: 22-28 आणि 55-62 वयोगट. सरासरी 41 ने प्रत्यक्षात कोणाचेही प्रतिनिधित्व केले नाही. धडा: सरासरीवर विश्वास ठेवण्यापूर्वी वितरणाचे प्लॉट करा.

केस 2 - बनावट सहसंबंध. एका संघाला "जाहिरात खर्च" आणि "विक्री" मधील 0.78 सहसंबंध आढळला आणि बजेट दुप्पट केले. तथापि, दोन्ही हंगामी मोहिमा कशामुळे सुरू झाल्या; मोहिमेबाहेरील कालावधीत, संबंध 0.10 पर्यंत घसरले. 340 हजार TL अतिरिक्त जाहिरातींनी अपेक्षित परतावा दिला नाही. धडा: कारणासाठी चुकीचा सहसंबंध महाग आहे.

प्रकरण 3 - एकट्या विरोधकाने काढलेली रेषा. रिअल इस्टेट विश्लेषणाने चौरस फुटेज आणि किंमत (r=0.80) यांच्यातील मजबूत संबंध दर्शविला. जेव्हा स्कॅटर प्लॉट काढला गेला तेव्हा जवळजवळ संपूर्ण संबंध एकाच 12 दशलक्ष टीएल लक्झरी व्हिलाद्वारे तयार केला गेला; तो बिंदू काढून टाकल्यावर, सहसंबंध 0.31 वर घसरला. धडा: नेहमी स्कॅटर प्लॉटसह परस्परसंबंध वाचा.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) स्वयंचलित EDA सारांश:

माझ्याकडे पांडा डीएफ आहेत. तयार करणारा कोड लिहा: (1) df.info() आणि df.describe(), (2) प्रत्येक अंकीय स्तंभासाठी हिस्टोग्राम, (3) प्रत्येक वर्गीय स्तंभासाठी गणना. टिप्पणी करू नका, फक्त शोध कोड व्युत्पन्न करा; मी नमुन्यांची व्याख्या करतो.

२) सहसंबंध + दृश्य (कार्यकारणाच्या चेतावणीसह):

अंकीय स्तंभांसाठी सहसंबंध मॅट्रिक्स आणि उष्णता नकाशा काढणारा कोड लिहा. 3 सर्वोच्च सहसंबंधित जोड्यांचा स्कॅटर प्लॉट देखील काढा. आउटपुटमध्ये एक टिप्पणी ओळ जोडा तुम्हाला स्मरण करून देईल की सहसंबंध कार्यकारणभाव दर्शवत नाही. कारणात्मक दावे करू नका.

3) वितरण निदान:

"income_tl" स्तंभासाठी: कोड लिहा जो हिस्टोग्राम, बॉक्स प्लॉट, स्क्युनेस व्हॅल्यू आणि मध्य/मध्य तुलना तयार करतो. वितरण तिरकस आहे की नाही याचा मी अर्थ लावेन; फक्त कोड द्या.

4) विभाग तुलना:

"चॅनेल" (वेब/मोबाइल) द्वारे ग्राहकांची तुलना करा: प्रत्येक चॅनेलसाठी सरासरी रक्कम, सरासरी रक्कम, ऑर्डरची संख्या आणि रक्कम वितरणाचा बॉक्सप्लॉट तयार करणारा कोड लिहा. दोन चॅनेलमधील फरकाच्या सांख्यिकीय महत्त्वासाठी कोणती चाचणी योग्य आहे ते सुचवा, परंतु निर्णय माझ्यावर अवलंबून आहे.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

या डेटामध्ये काहीतरी मनोरंजक शोधा.

"रंजक" अपरिभाषित आहे; AI डेटा पाहत नाही, म्हणून तो एकतर तयार करतो किंवा सामान्य विधाने करतो. दिशा नाही, चल नाही, उद्देश नाही.

शक्तिशाली सूचना:

तुमची भूमिका: EDA सहाय्यक. df स्तंभ: वय (इंट), इन्कम_टीएल (फ्लोट), शहर (श्रेणी), चॅनल (वेब/मोबाइल), रक्कम (फ्लोट). उद्देशः "रक्कम" वर परिणाम करणारे घटक शोधणे. कार्य: (1) रकमेच्या वितरणाचे प्लॉटिंग कोड, (2) रक्कम आणि वय आणि उत्पन्न_tl मधील वितरण आलेख, (3) चॅनेल ब्रेकडाउनमधील रकमेचा बॉक्स प्लॉट. कारणात्मक दावा स्थापित करणे; फक्त शोध कोड व्युत्पन्न करा आणि मी पॅटर्नचा अर्थ लावेन.

येथे, उद्देश, चल आणि "कार्यकारणभावाचा दावा" ची मर्यादा स्पष्ट आहे.

सामान्य चुका

  • केवळ सारांश आकडेवारीवर अवलंबून. Anscombe चौकडी दाखवल्याप्रमाणे, समान मध्य खूप भिन्न वितरणे लपवते; चार्ट पहा.
  • कारणासाठी चुकीचा सहसंबंध. सह-क्रिया हे सूचित करत नाही की एक दुसऱ्याकडे नेतो; लपलेल्या चलांपासून सावध रहा.
  • स्कॅटर प्लॉटशिवाय सहसंबंध पाहणे. एकल आउटलियर किंवा वक्रता क्रमांकाची दिशाभूल करते.
  • सरासरीसह दोन-पीक/स्क्युड वितरणाचा सारांश. सरासरी कोणाचेही प्रतिनिधित्व करू शकत नाही.
  • EDA वगळणे आणि थेट मॉडेलवर जाणे. अपरिचित डेटा म्हणजे अंध मॉडेल.
टीप: प्रत्येक नवीन डेटा सेटसह, पहिली 30 मिनिटे फक्त आलेख काढण्यासाठी घालवा: प्रत्येक अंकाचा हिस्टोग्राम, महत्त्वपूर्ण जोड्यांचा स्कॅटर प्लॉट, श्रेणींचा बार चार्ट. हे 30 मिनिटे भविष्यातील मॉडेलिंग त्रुटींना पुढील दिवसांसाठी प्रतिबंधित करतात.

सारांशात

EDA हा मॉडेल तयार करण्यापूर्वी डेटा जाणून घेण्याचा टप्पा आहे आणि चार प्रश्नांची उत्तरे शोधतो: वितरण, केंद्र-स्प्रेड, संबंध आणि विसंगती. सारांश आकडेवारी दिशाभूल करणारी असू शकते; आलेख पाहणे अत्यावश्यक आहे (Anscombe व्याख्यान). सहसंबंध हे एक शक्तिशाली साधन आहे, परंतु कार्यकारणभाव नाही आणि निश्चितपणे स्कॅटर प्लॉटच्या संयोगाने वाचले पाहिजे. ग्राफिक्स आणि कोड लिहिण्यासाठी AI हा एक उत्तम प्रवेगक आहे; परंतु लोक त्यांच्या क्षेत्रीय ज्ञानाने अर्थ लावतात की त्यांना दिसणारा नमुना वास्तविक आहे की योगायोग आहे.

अर्ज कार्य

डेटासेट निवडा आणि फक्त EDA करा: किमान तीन संख्यात्मक व्हेरिएबल्सचा हिस्टोग्राम काढा, व्हेरिएबल्सच्या दोन जोड्यांचा स्कॅटर प्लॉट आणि एक परस्परसंबंध उष्णता नकाशा. कमीतकमी एक "आश्चर्य" शोधा (जसे की दोन शिखरांसह वितरण, बनावट सहसंबंधासाठी उमेदवार, एकल आउटलायरद्वारे आकर्षित केलेले नाते) आणि एका वाक्यात ते स्पष्ट करा. कोणतेही कारणात्मक दावे न करता लिहा.

चेकलिस्ट

  • मी प्रत्येक संख्यात्मक व्हेरिएबलच्या वितरणाचा आलेख तयार केला आहे का?
  • [ ] मी स्कॅटरप्लॉटशी सहसंबंध पाहिला का?
  • मी कार्यकारणभाव आणि सहसंबंध वेगळे ठेवले आहेत का?
  • [ ] मला तिरकस किंवा दोन-पीक वितरण लक्षात आले नाही आणि मी आंधळेपणाने मीनवर विश्वास ठेवला नाही?
  • [ ] मी माझ्या EDA निष्कर्षांमधून किमान एक मॉडेलिंग पैलू/ गृहीतक घेतले आहे का?