इकाइयाँ
1. डेटा साइंस और एनालिटिक्स में आर्टिफिशियल इंटेलिजेंस का परिचय: वर्कफ़्लो, भूमिकाएँ, सीमाएँ, मान्यता और नैतिकता 2. डेटा संग्रह और स्रोत समझ: स्कीमा, नमूनाकरण, गुणवत्ता और रिसाव जागरूकता 3. डेटा सफ़ाई और प्रीप्रोसेसिंग: गुम मूल्य, बाहरी और प्रकार रूपांतरण 4. खोजपूर्ण डेटा विश्लेषण (ईडीए): वितरण, संबंध और प्रारंभिक अंतर्दृष्टि 5. फ़ीचर इंजीनियरिंग: वेरिएंट तैयार करना, कोडिंग, स्केलिंग और रिसाव से बचना 6. मॉडल निर्माण: समस्या परिभाषा, एल्गोरिथम चयन, और प्रशिक्षण/परीक्षण विभाजन 7. मॉडल मूल्यांकन: मेट्रिक्स, क्रॉस-वैलिडेशन और एक्सट्रीम लर्निंग 8. विज़ुअलाइज़ेशन और कहानी सुनाना: सटीक ग्राफ़िक्स, ईमानदार ग्राफ़िक्स 9. कोड जनरेशन: पायथन (पांडा) और एसक्यूएल के साथ एआई-सहायता प्राप्त विश्लेषण 10. डेटा रिसाव और प्रतिलिपि प्रस्तुत करने योग्यता: मूक आपदाएँ और अनुशासन 11. एमएलओपीएस फाउंडेशन, नैतिकता, गोपनीयता और जिम्मेदार विश्लेषण
इकाई 4 / 11

खोजपूर्ण डेटा विश्लेषण (ईडीए): वितरण, संबंध और प्रारंभिक अंतर्दृष्टि

लाभ:

  • उपयुक्त ग्राफ़ (हिस्टोग्राम, बॉक्स प्लॉट, स्कैटर प्लॉट) के साथ चर के वितरण, केंद्र, प्रसार और विसंगतियों का पता लगाने की क्षमता।
  • सहसंबंध की सही ढंग से व्याख्या करने और इसे कार्य-कारण के साथ भ्रमित किए बिना, बिखराव कथानक के साथ पढ़ने की क्षमता
  • यह समझने की क्षमता कि सारांश आँकड़े भ्रामक हो सकते हैं (Anscombe पाठ) और ऐसी परिकल्पनाएँ विकसित करने की क्षमता जो मॉडलिंग की दिशा निर्धारित करती हैं।

मॉडल बनाने से पहले डेटा जानना जरूरी है. जिस तरह एक डॉक्टर मरीज की जांच किए बिना दवा नहीं लिखता, उसी तरह एक डेटा वैज्ञानिक डेटा की "जांच" किए बिना एक मॉडल नहीं बनाता है। इस परीक्षा को खोजपूर्ण डेटा विश्लेषण (संक्षेप में ईडीए) कहा जाता है: यह दृश्य और ग्राफिक रूप से डेटा के वितरण, संबंधों, आश्चर्य और जाल की खोज करने का चरण है। ईडीए का उद्देश्य परिकल्पना उत्पन्न करना, त्रुटियों को पकड़ना और मॉडलिंग की दिशा निर्धारित करना है। इस स्तर पर आर्टिफिशियल इंटेलिजेंस एक बहुत शक्तिशाली सहायक है: यह सुझाव देता है कि कौन सा चार्ट उपयुक्त है, उसका कोड लिखता है, वितरण की व्याख्या करता है। लेकिन एक व्यक्ति अपने क्षेत्र के ज्ञान से यह निर्णय लेता है कि जो पैटर्न वह देख रहा है वह वास्तविक है या एक संयोग है।

ईडीए क्या तलाशता है?

ईडीए ने चार सवालों के जवाब मांगे। वितरण: प्रत्येक चर को कैसे वितरित किया जाता है - क्या यह सममित, तिरछा या दो-शिखर वाला है? केंद्रीय प्रवृत्ति और प्रसार: माध्य, माध्यिका, मानक विचलन क्या हैं? रिश्ते: चर एक दूसरे से कैसे संबंधित हैं? विसंगतियाँ: क्या अप्रत्याशित मूल्य, अंतराल, समूह हैं? ये चार प्रश्न निर्धारित करते हैं कि कौन सी सुविधा काम करेगी और कौन सा मॉडल उपयुक्त है।

आइए कुछ बुनियादी अवधारणाओं को परिभाषित करें। हिस्टोग्राम एक ग्राफ है जो एक संख्यात्मक चर के मानों को अंतरालों में विभाजित करता है और दिखाता है कि प्रत्येक अंतराल में कितने अवलोकन हैं; यह वितरण देखने का सबसे तेज़ तरीका है। तिरछापन वितरण का एक दिशा में बदलाव है; आय जैसे चर दाहिनी ओर झुके हुए हैं (बहुमत कम, कुछ बहुत अधिक)। एक बॉक्स प्लॉट एक नज़र में माध्यिका, चतुर्थक और आउटलेयर दिखाता है। एक स्कैटर प्लॉट बिंदुओं के बादल के साथ दो संख्यात्मक चर के संबंध को दर्शाता है।

सहसंबंध: रिश्ता है लेकिन सावधान रहें

सहसंबंध - दो चर एक साथ कैसे चलते हैं इसका एक माप; -1 और +1 के बीच की संख्या - ईडीए का सबसे अधिक इस्तेमाल किया जाने वाला और सबसे गलत समझा जाने वाला उपकरण है। +1 का अर्थ है पूर्ण सह-वृद्धि, -1 का अर्थ है पूर्ण व्युत्क्रम संबंध, 0 का अर्थ है कोई रैखिक संबंध नहीं। दो बड़े जाल हैं. पहला, प्रसिद्ध नियम: सहसंबंध कार्य-कारण नहीं है। आइसक्रीम की बिक्री से दम घुटने के मामले बढ़े; इसलिए नहीं कि एक दूसरे की ओर ले जाता है, बल्कि इसलिए कि गर्मी (छिपा हुआ तीसरा चर) दोनों को ट्रिगर करता है। दूसरा, सहसंबंध केवल रैखिक संबंध को मापता है; यह 0 के करीब एक मजबूत लेकिन वक्ररेखीय संबंध का संकेत दे सकता है। इसलिए सहसंबंध को देखते समय, स्कैटर प्लॉट को भी देखना सुनिश्चित करें।

सावधानी: जब एआई एक सहसंबंध संख्या देता है, तो यह कारण भाषा में फिसल सकता है जैसे "ए बी को बढ़ाता है।" यह ख़तरनाक है। सहसंबंध केवल एक साथ गति को इंगित करता है; केवल अनुभव, डोमेन ज्ञान और सावधानीपूर्वक अनुमान ही कारण स्थापित करते हैं।

Anscombe चौकड़ी: क्यों न केवल संख्या को देखें

सांख्यिकी में एक प्रसिद्ध उदाहरण है: एन्स्कोम्बे चौकड़ी। चार अलग-अलग डेटा सेटों का लगभग समान माध्य, समान विचरण और समान सहसंबंध (0.82) है; लेकिन जब रेखांकन किया जाता है, तो वे पूरी तरह से अलग दिखते हैं - एक सीधी रेखा, एक घुमावदार, एक एकल बाहरी द्वारा खींचा गया बादल। सबक स्पष्ट है: सारांश आँकड़े भ्रामक हैं, ग्राफ़ को देखना ज़रूरी है। एआई आपको औसत और सहसंबंध दे सकता है, लेकिन ग्राफ़ देखे बिना उन संख्याओं पर भरोसा करना एन्स्कोम्बे जाल में फंसना है।

नीचे दी गई तालिका संक्षेप में बताती है कि कौन सा चार्ट किस प्रश्न पर फिट बैठता है:

प्रश्न

उपयुक्त ग्राफ़िक

क्या दिखाता है

एकल चर का वितरण

हिस्टोग्राम / केडीई

आकार, तिरछापन, शीर्षों की संख्या

केंद्र और आउटलाइर्स

बॉक्स प्लॉट

माध्यिका, चतुर्थक, आउटलेयर

दो संख्याओं का संबंध

स्कैटर चार्ट

दिशा, शक्ति, वक्रता

श्रेणी तुलना

बार चार्ट

समूहों के बीच अंतर

समय के साथ परिवर्तन

लाइन चार्ट

प्रवृत्ति, मौसमी

बहुभिन्नरूपी संबंध

सहसंबंध ऊष्मा मानचित्र

सामान्य संबंध मैट्रिक्स

सिम्पसन का विरोधाभास: एकत्रित डेटा झूठ बोल सकता है

ईडीए में एक गुप्त जाल के बारे में जागरूक होना सिम्पसन का विरोधाभास है: जब सभी डेटा की एक साथ जांच की जाती है तो एक पैटर्न एक दिशा दिखा सकता है, लेकिन जब डेटा को सार्थक उपसमूहों में विभाजित किया जाता है तो यह उलट जाता है। उत्कृष्ट उदाहरण: किसी विश्वविद्यालय में महिला आवेदकों के लिए समग्र स्वीकृति दर पुरुषों की तुलना में कम प्रतीत होती है; लेकिन जब विभाग दर विभाग देखा गया तो अधिकांश विभागों में महिलाओं की स्वीकृति दर पुरुषों की तुलना में अधिक है। कहां से? महिलाओं ने अधिक प्रतिस्पर्धी (कम स्वीकृति दर) विभागों में आवेदन किया; संयुक्त संख्या इस छिपे हुए चर को संग्रहीत करती है। सबक स्पष्ट है: कुल या औसत को देखते समय, यह जांचना सुनिश्चित करें कि क्या वह संख्या सार्थक उपसमूहों (खंड, अवधि, चैनल) में विभाजित होने पर वही कहानी बताती है। जब एआई आपको एक संयुक्त दर देता है, तो यह पूछना कि "जब आप इसे विभाजित करते हैं तो क्या यह अभी भी वैध है" सबसे भ्रामक परिणामों को जल्दी ही पकड़ लेगा।

तीन मिनी मामले

केस 1 - दो छिपी हुई पहाड़ियाँ। एक विश्लेषक ने ग्राहक की औसत आयु 41 पाई और इसे "मध्यम आयु वर्ग की भीड़" के रूप में रिपोर्ट किया। लेकिन हिस्टोग्राम ने दो शिखर दिखाए: 22-28 और 55-62 आयु समूह। औसत 41 वास्तव में किसी का प्रतिनिधित्व नहीं करता था। पाठ: माध्य पर भरोसा करने से पहले वितरण की योजना बनाएं।

केस 2 - नकली सहसंबंध। एक टीम ने "विज्ञापन व्यय" और "बिक्री" के बीच 0.78 सहसंबंध पाया और बजट दोगुना कर दिया। हालाँकि, जिस चीज़ ने दोनों को प्रेरित किया वह मौसमी अभियान थे; अभियान से बाहर की अवधि के दौरान, संबंध गिरकर 0.10 हो गया। 340 हजार टीएल अतिरिक्त विज्ञापन से अपेक्षित रिटर्न नहीं मिला। सबक: सहसंबंध को कार्य-कारण समझना महंगा है।

केस 3 - अकेले प्रतिपक्षी द्वारा खींची गई रेखा। एक रियल एस्टेट विश्लेषण ने वर्ग फुटेज और कीमत (आर = 0.80) के बीच एक मजबूत संबंध दिखाया। जब बिखराव की साजिश रची गई, तो लगभग पूरा रिश्ता एक 12 मिलियन टीएल लक्जरी विला द्वारा बनाया गया था; जब वह बिंदु हटा दिया गया, तो सहसंबंध घटकर 0.31 रह गया। पाठ: सहसंबंध को हमेशा बिखराव कथानक के साथ पढ़ें।

चार प्रतिलिपि योग्य टेम्पलेट

1) स्वचालित ईडीए सारांश:

मेरे पास पांडा डीएफ हैं। वह कोड लिखें जो उत्पन्न करता है: (1) df.info() और df.describe(), (2) प्रत्येक संख्यात्मक कॉलम के लिए हिस्टोग्राम, (3) प्रत्येक श्रेणीबद्ध कॉलम के लिए गिनती। टिप्पणी न करें, बस खोज कोड उत्पन्न करें; मैं पैटर्न की व्याख्या करता हूं।

2) सहसंबंध + दृश्य (कारण-कारण की चेतावनी के साथ):

वह कोड लिखें जो संख्यात्मक स्तंभों के लिए सहसंबंध मैट्रिक्स और हीट मैप बनाता है। 3 उच्चतम सहसंबद्ध जोड़ियों का एक स्कैटर प्लॉट भी बनाएं। आउटपुट में एक टिप्पणी पंक्ति जोड़ें जो आपको याद दिलाए कि सहसंबंध का अर्थ कार्य-कारण नहीं है। अकारण दावे न करें.

3) वितरण निदान:

"आय_टीएल" कॉलम के लिए: वह कोड लिखें जो हिस्टोग्राम, बॉक्स प्लॉट, तिरछापन मान और माध्य/माध्य तुलना उत्पन्न करता है। मैं व्याख्या करूंगा कि वितरण विषम है या नहीं; बस कोड दीजिए.

4) खंड तुलना:

"चैनल" (वेब/मोबाइल) द्वारा ग्राहकों की तुलना करें: कोड लिखें जो प्रत्येक चैनल के लिए औसत राशि, औसत राशि, ऑर्डर की संख्या और राशि वितरण का एक बॉक्सप्लॉट तैयार करता है। सुझाव दें कि दोनों चैनलों के बीच अंतर के सांख्यिकीय महत्व के लिए कौन सा परीक्षण उपयुक्त है, लेकिन निर्णय मुझ पर निर्भर है।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

इस डेटा में कुछ दिलचस्प खोजें.

"दिलचस्प" अपरिभाषित है; एआई डेटा नहीं देखता है, इसलिए यह या तो इसे बनाता है या सामान्य बयान देता है। कोई दिशा नहीं, कोई चर नहीं, कोई उद्देश्य नहीं।

शक्तिशाली संकेत:

आपकी भूमिका: ईडीए सहायक। डीएफ कॉलम: आयु (इंट), आय_टीएल (फ्लोट), शहर (श्रेणी), चैनल (वेब/मोबाइल), राशि (फ्लोट)। उद्देश्य: "राशि" को प्रभावित करने वाले कारकों की खोज करना। कार्य: (1) राशि के वितरण की साजिश रचने वाला कोड, (2) राशि और उम्र और आय_टीएल के बीच वितरण ग्राफ, (3) चैनल ब्रेकडाउन में राशि का बॉक्स प्लॉट। एक कारणात्मक दावा स्थापित करना; बस डिस्कवरी कोड जनरेट करें और मैं पैटर्न की व्याख्या करूंगा।

यहां, "कारण-कारण का दावा" का उद्देश्य, चर और सीमा स्पष्ट है।

सामान्य गलतियाँ

  • केवल सारांश आँकड़ों पर निर्भर रहना। जैसा कि एन्स्कोम्बे चौकड़ी से पता चलता है, एक ही माध्य बहुत भिन्न वितरण छुपाता है; चार्ट देखें.
  • सहसंबंध को कार्य-कारण समझने की भूल करना। सह-कार्य यह संकेत नहीं देता कि एक दूसरे की ओर ले जाता है; छुपे हुए चर से सावधान रहें.
  • बिखराव की साजिश के बिना सहसंबंध को देखना। एक एकल बाह्यता या वक्रता संख्या को गुमराह करती है।
  • माध्य के साथ दो-शिखर/तिरछा वितरण का सारांश। औसत किसी का प्रतिनिधित्व नहीं कर सकता.
  • ईडीए को छोड़कर सीधे मॉडल पर जा रहे हैं। अपरिचित डेटा का अर्थ है ब्लाइंड मॉडल।
युक्ति: प्रत्येक नए डेटा सेट के साथ, पहले 30 मिनट केवल ग्राफ़ बनाने में व्यतीत करें: प्रत्येक संख्या का हिस्टोग्राम, महत्वपूर्ण जोड़ियों का स्कैटर प्लॉट, श्रेणियों का बार चार्ट। ये 30 मिनट आने वाले दिनों के लिए भविष्य की मॉडलिंग त्रुटियों को रोकते हैं।

संक्षेप में

ईडीए एक मॉडल बनाने से पहले डेटा को जानने का चरण है और चार सवालों के जवाब तलाशता है: वितरण, केंद्र-प्रसार, रिश्ते और विसंगतियां। सारांश आँकड़े भ्रामक हो सकते हैं; ग्राफ़ को देखना आवश्यक है (Anscombe व्याख्यान)। सहसंबंध एक शक्तिशाली उपकरण है, लेकिन कार्य-कारण ऐसा नहीं है और इसे निश्चित रूप से एक बिखरे हुए कथानक के साथ पढ़ा जाना चाहिए। ग्राफिक्स का सुझाव देने और कोड लिखने के लिए एआई एक बेहतरीन त्वरक है; लेकिन लोग अपने क्षेत्र के ज्ञान से इसकी व्याख्या करते हैं कि जो पैटर्न वे देख रहे हैं वह वास्तविक है या एक संयोग है।

आवेदन कार्य

एक डेटासेट चुनें और बस ईडीए करें: कम से कम तीन संख्यात्मक चर का एक हिस्टोग्राम, दो जोड़े चर का एक स्कैटर प्लॉट और एक सहसंबंध ताप मानचित्र निकालें। कम से कम एक "आश्चर्य" ढूंढें (जैसे कि दो चोटियों वाला वितरण, नकली सहसंबंध के लिए एक उम्मीदवार, एक एकल बाह्य द्वारा आकर्षित संबंध) और इसे एक वाक्य में समझाएं। बिना कोई कारणात्मक दावा किए लिखें।

चेकलिस्ट

  • [ ] क्या मैंने प्रत्येक संख्यात्मक चर के वितरण का रेखांकन किया है?
  • [ ] क्या मैंने स्कैटरप्लॉट के साथ सहसंबंधों को देखा?
  • [ ] क्या मैंने कार्य-कारण और सहसंबंध को अलग रखा है?
  • [ ] क्या मैंने विषम या दो-शिखर वाले वितरणों पर ध्यान नहीं दिया और आँख मूँद कर माध्य पर भरोसा नहीं किया?
  • [ ] क्या मैंने अपने ईडीए निष्कर्षों से कम से कम एक मॉडलिंग पहलू/परिकल्पना प्राप्त की है?