एकाइहरू
1. डाटा विज्ञान र विश्लेषणमा कृत्रिम बुद्धिमत्ताको परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण र नैतिकता 2. डाटा सङ्कलन र स्रोत बुझाइ: योजना, नमूना, गुणस्तर र चुहावट जागरूकता 3. डाटा क्लिनिङ र प्रिप्रोसेसिङ: छुटेको मान, आउटलियर र प्रकार रूपान्तरण 4. अन्वेषण डेटा विश्लेषण (EDA): वितरण, सम्बन्ध, र प्रारम्भिक अन्तर्दृष्टि 5. सुविधा ईन्जिनियरिङ्: भेरिएन्टहरू उत्पन्न गर्दै, कोडिङ, स्केलिङ, र चुहावट बेवास्ता गर्दै 6. मोडेल निर्माण: समस्या परिभाषा, एल्गोरिथ्म चयन, र प्रशिक्षण/परीक्षण विभाजन 7. मोडेल मूल्याङ्कन: मेट्रिक्स, क्रस-प्रमाणीकरण, र चरम शिक्षा 8. भिजुअलाइजेशन र स्टोरीटेलिङ: सटीक ग्राफिक्स, इमानदार ग्राफिक्स 9. कोड जेनेरेसन: पाइथन (पान्डा) र SQL को साथ एआई-सहायता विश्लेषण 10. डाटा चुहावट र पुन: उत्पादनशीलता: मौन आपदा र अनुशासन 11. MLOps फाउन्डेशन, नैतिकता, गोपनीयता र जिम्मेवार विश्लेषण
एकाइ 4 / 11

अन्वेषण डेटा विश्लेषण (EDA): वितरण, सम्बन्ध, र प्रारम्भिक अन्तर्दृष्टि

लाभ:

  • उपयुक्त ग्राफहरू (हिस्टोग्राम, बक्स प्लट, स्क्याटर प्लट) सँग चरहरूको वितरण, केन्द्र, फैलावट र विसंगतिहरू अन्वेषण गर्ने क्षमता।
  • सहसम्बन्धलाई सही रूपमा व्याख्या गर्ने क्षमता र स्क्याटर प्लटसँग सँगै पढ्ने क्षमता, यसलाई कारणको साथ भ्रमित नगरी
  • सारांश तथ्याङ्कहरू भ्रामक (Anscombe पाठ) हुन सक्छ भनेर बुझ्ने क्षमता र मोडलिङको दिशा निर्धारण गर्ने परिकल्पनाहरू विकास गर्नुहोस्।

मोडेल निर्माण गर्नु अघि, डाटा जान्न आवश्यक छ। जसरी डाक्टरले बिरामीको जाँच नगरी औषधि लेख्दैनन्, त्यसरी नै डाटा वैज्ञानिकले डाटालाई "जाँच" नगरी मोडेल बनाउँदैनन्। यस परीक्षालाई अन्वेषण डेटा विश्लेषण भनिन्छ (छोटोको लागि EDA): यो दृश्य र ग्राफिक रूपमा डाटाको वितरण, सम्बन्ध, आश्चर्य र पासोहरू पत्ता लगाउने चरण हो। EDA को उद्देश्य परिकल्पनाहरू उत्पन्न गर्नु, त्रुटिहरू समात्नु, र मोडलिङ दिशा निर्धारण गर्नु हो। यस चरणमा कृत्रिम बुद्धिमत्ता एक धेरै शक्तिशाली सहायक हो: यसले कुन चार्ट उपयुक्त छ भनेर सुझाव दिन्छ, यसको कोड लेख्छ, वितरणको व्याख्या गर्दछ। तर एक व्यक्तिले आफ्नो क्षेत्रको ज्ञानले निर्णय गर्छ कि उसले देखेको ढाँचा वास्तविक हो वा संयोग।

EDA के खोज्छ?

EDA ले चार प्रश्नहरूको जवाफ खोज्छ। वितरण: प्रत्येक चर कसरी वितरण गरिन्छ - के यो सममित, स्क्युड, वा दुई-पीक गरिएको छ? केन्द्रीय प्रवृत्ति र फैलावट: मतलब, मध्य, मानक विचलन के हो? सम्बन्धहरू: चरहरू कसरी एकअर्कासँग सम्बन्धित छन्? विसंगतिहरू: के त्यहाँ अप्रत्याशित मानहरू, अन्तरहरू, समूहहरू छन्? यी चार प्रश्नहरूले कुन सुविधाले काम गर्नेछ र कुन मोडेल उपयुक्त छ भनेर निर्धारण गर्दछ।

केही आधारभूत अवधारणाहरू परिभाषित गरौं। हिस्टोग्राम एउटा ग्राफ हो जसले संख्यात्मक चरका मानहरूलाई अन्तरालहरूमा विभाजन गर्छ र प्रत्येक अन्तरालमा कतिवटा अवलोकनहरू छन् भनेर देखाउँछ; यो वितरण हेर्न को लागी सबै भन्दा छिटो तरिका हो। Skewness एक दिशामा वितरण को परिवर्तन हो; आय जस्ता चरहरू दायाँतिर टाँसिएका छन् (बहुमत कम, थोरै धेरै उच्च)। बक्स प्लटले एक नजरमा मध्य, चतुर्थक र आउटलियरहरू देखाउँछ। स्क्याटर प्लटले बिन्दुहरूको क्लाउडसँग दुई संख्यात्मक चरहरूको सम्बन्ध देखाउँछ।

सम्बन्ध: सम्बन्ध छ तर सावधान रहनुहोस्

सहसंबंध - दुई चरहरू कसरी एकसाथ चल्छन् भन्ने मापन; -1 र +1 बीचको संख्या — EDA को सबैभन्दा धेरै प्रयोग गरिएको र सबैभन्दा गलत बुझिने उपकरण हो। +1 को अर्थ पूर्ण सह-बृद्धि हो, -1 को अर्थ पूर्ण व्युत्क्रम सम्बन्ध हो, 0 को अर्थ कुनै रेखीय सम्बन्ध छैन। त्यहाँ दुई ठूला जालहरू छन्। पहिलो, प्रसिद्ध नियम: सहसंबंध कारण होइन। आइसक्रिमको बिक्रीसँगै चोकिङका घटना बढ्दै; एउटाले अर्कोतिर लैजान्छ भनेर होइन, तर गर्मी (लुकेको तेस्रो चर) दुवैलाई ट्रिगर गर्ने भएकोले। दोस्रो, सहसम्बन्धले मात्र रेखीय सम्बन्धलाई मापन गर्छ; यसले ० को नजिकको बलियो तर वक्र सम्बन्धलाई संकेत गर्न सक्छ। त्यसैले सहसम्बन्ध हेर्दा, स्क्याटर प्लटलाई पनि हेर्न निश्चित हुनुहोस्।

सावधानी: जब AI ले सहसंबंध नम्बर दिन्छ, यो "A बढ्छ B" जस्तै कारणात्मक भाषामा चिप्लन सक्छ। यो खतरनाक छ। सहसम्बन्धले मात्र एकसाथ आन्दोलनलाई संकेत गर्दछ; केवल अनुभव, डोमेन ज्ञान, र सावधान अनुमानले कारण स्थापित गर्दछ।

Anscombe क्वार्टेट: किन नम्बर मात्र हेर्नुहुन्न

त्यहाँ तथ्याङ्क मा एक प्रसिद्ध उदाहरण छ: Anscombe चौकडी। चार फरक डेटा सेटहरू लगभग समान अर्थ, समान भिन्नता, र उही सहसंबंध (0.82); तर रेखांकन गर्दा, तिनीहरू पूर्णतया फरक देखिन्छन् - एक सीधा रेखा, एक घुमाउरो, एक एकल आउटलियर द्वारा तानिएको बादल। पाठ स्पष्ट छ: सारांश तथ्याङ्कहरू भ्रामक छन्, ग्राफ हेरेर एक अनिवार्य छ। AI ले तपाईंलाई औसत र सहसंबंध दिन सक्छ, तर ग्राफ नदेखी ती संख्याहरूमा विश्वास गर्नु Anscombe जालमा पर्दैछ।

तलको तालिकाले कुन चार्ट कुन प्रश्नमा फिट हुन्छ भनेर संक्षेप गर्दछ:

प्रश्न

उपयुक्त ग्राफिक

के देखाउँछ

एकल चरको वितरण

हिस्टोग्राम / केडीई

आकार, स्क्युनेस, ठाडो संख्या

केन्द्र र बाहिरीहरू

बक्स प्लट

माध्य, चतुर्थक, आउटलियर

दुई संख्याको सम्बन्ध

स्क्याटर चार्ट

दिशा, बल, वक्रता

श्रेणी तुलना

बार चार्ट

समूहहरू बीचको भिन्नता

समय संग परिवर्तन

रेखा चार्ट

प्रवृत्ति, मौसमीता

बहुविध सम्बन्ध

सहसंबंध गर्मी नक्शा

सामान्य सम्बन्ध म्याट्रिक्स

सिम्पसनको विरोधाभास: एकत्रित डाटा झूट हुन सक्छ

EDA मा एक डरलाग्दो जाल बारे सचेत हुन सिम्पसनको विरोधाभास हो: सबै डेटा सँगै जाँच गर्दा ढाँचाले एक दिशा देखाउन सक्छ, तर जब डेटा अर्थपूर्ण उपसमूहहरूमा विभाजित हुन्छ तब उल्टो। उत्कृष्ट उदाहरण: विश्वविद्यालयमा महिला आवेदकहरूको लागि समग्र स्वीकृति दर पुरुषहरूको तुलनामा कम देखिन्छ; तर विभाग अनुसार हेर्ने हो भने अधिकांश विभागमा पुरुषको तुलनामा महिलाको स्वीकृति दर बढी छ । कहाँबाट ? महिलाहरूले अधिक प्रतिस्पर्धी (कम स्वीकृति दर) विभागहरूमा आवेदन दिए; संयुक्त संख्याले यो लुकेको चर भण्डारण गर्दछ। पाठ स्पष्ट छ: कुल वा औसत हेर्दा, अर्थपूर्ण उपसमूह (खण्ड, अवधि, च्यानल) मा विभाजित हुँदा त्यो संख्याले उही कथा बताउँछ कि भनेर जाँच गर्न निश्चित हुनुहोस्। जब AI ले तपाईंलाई एक संयुक्त दर दिन्छ, "के यो अझै पनि मान्य छ जब तपाइँ यसलाई खण्ड गर्नुहुन्छ" सोध्दा धेरै भ्रामक परिणामहरू प्रारम्भमा समात्नेछ।

तीन मिनी केसहरू

केस 1 - दुई लुकेका पहाडहरू। एक विश्लेषकले औसत ग्राहकको उमेर ४१ वर्ष भएको भेट्टाए र यसलाई "मध्यम उमेरका भीड" भनेर रिपोर्ट गरे। तर हिस्टोग्रामले दुई चोटी देखाएको छ: 22-28 र 55-62 उमेर समूह। औसत ४१ ले वास्तवमा कसैको प्रतिनिधित्व गर्दैन। पाठ: मतलबलाई विश्वास गर्नु अघि वितरणको प्लट गर्नुहोस्।

केस 2 - नकली सहसंबंध। एउटा टोलीले "विज्ञापन खर्च" र "बिक्री" बीचको ०.७८ सम्बन्ध फेला पार्यो र बजेट दोब्बर गर्यो। जे होस्, दुबैलाई उत्प्रेरित गर्ने कुराहरू मौसमी अभियानहरू थिए; अफ-अभियान अवधिमा, सम्बन्ध ०.१० मा झर्यो। 340 हजार TL अतिरिक्त विज्ञापनले अपेक्षित प्रतिफल दिन सकेन। पाठ: कारणको लागि गलत सहसंबंध महँगो छ।

केस ३ - एक्लो विरोधाभासले कोरेको रेखा। एक घर जग्गा विश्लेषणले वर्ग फुटेज र मूल्य (r=0.80) बीचको बलियो सम्बन्ध देखायो। जब स्क्याटर प्लट कोरिएको थियो, लगभग सम्पूर्ण सम्बन्ध एकल 12 मिलियन TL लक्जरी विला द्वारा सिर्जना गरिएको थियो; जब त्यो बिन्दु हटाइयो, सहसंबंध ०.३१ मा खस्यो। पाठ: जहिले पनि स्क्याटर प्लटको साथमा सहसंबंध पढ्नुहोस्।

चार प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

1) स्वचालित EDA सारांश:

मसँग पाण्डा df छ। उत्पादन गर्ने कोड लेख्नुहोस्: (1) df.info() र df.describe(), (2) प्रत्येक संख्यात्मक स्तम्भको लागि हिस्टोग्राम, (3) प्रत्येक वर्गीय स्तम्भको लागि गणना। टिप्पणी नगर्नुहोस्, केवल खोज कोड उत्पन्न गर्नुहोस्; म ढाँचाहरू व्याख्या गर्छु।

2) सहसंबंध + दृश्य (कार्यकारणको चेतावनी सहित):

सङ्ख्यात्मक स्तम्भहरूको लागि सहसम्बन्ध म्याट्रिक्स र तातो नक्सा कोर्ने कोड लेख्नुहोस्। 3 उच्चतम सहसंबद्ध जोडीहरूको स्क्याटर प्लट पनि कोर्नुहोस्। आउटपुटमा एक टिप्पणी रेखा थप्नुहोस् कि सहसम्बन्धले कारणलाई संकेत गर्दैन। कारण दावी नगर्नुहोस्।

3) वितरण निदान:

"income_tl" स्तम्भको लागि: कोड लेख्नुहोस् जसले हिस्टोग्राम, बक्स प्लट, स्क्युनेस मान र मध्य/माध्य तुलना उत्पादन गर्छ। म वितरण बेकार छ वा छैन भनेर व्याख्या गर्नेछु; केवल कोड दिनुहोस्।

4) खण्ड तुलना:

"च्यानल" (वेब/मोबाइल) द्वारा ग्राहकहरू तुलना गर्नुहोस्: कोड लेख्नुहोस् जसले प्रत्येक च्यानलको लागि औसत रकम, औसत रकम, अर्डरहरूको संख्या, र रकम वितरणको बक्सप्लट उत्पादन गर्दछ। दुई च्यानलहरू बीचको भिन्नताको सांख्यिकीय महत्त्वको लागि कुन परीक्षण उपयुक्त छ सुझाव दिनुहोस्, तर निर्णय मेरो हो।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट:

यस डेटामा केहि रोचक खोज्नुहोस्।

"रोचक" अपरिभाषित छ; AI ले डाटा देख्दैन, त्यसैले यसले यसलाई बनाउँछ वा सामान्य कथनहरू बनाउँछ। त्यहाँ कुनै दिशा छैन, कुनै चर, कुनै उद्देश्य छैन।

शक्तिशाली प्रम्प्ट:

तपाईंको भूमिका: EDA सहायक। df स्तम्भहरू: उमेर (int), Income_tl (फ्लोट), शहर (श्रेणी), च्यानल (वेब/मोबाइल), रकम (फ्लोट)। उद्देश्य: "राशि" लाई असर गर्ने कारकहरू पत्ता लगाउन। कार्य: (१) रकमको वितरण प्लट गर्ने कोड, (२) रकम र उमेर र आय_tl बीचको वितरण ग्राफ, (३) च्यानल ब्रेकडाउनमा रकमको बक्स प्लट। कारण दावी स्थापना गर्दै; केवल खोज कोड उत्पन्न गर्नुहोस् र म ढाँचा व्याख्या गर्नेछु।

यहाँ, उद्देश्य, चर र "दावी कारण" को सीमा स्पष्ट छ।

सामान्य गल्तीहरू

  • सारांश तथ्याङ्कहरूमा मात्र भर पर्दै। Anscombe क्वार्टेटले देखाउँदछ, एउटै अर्थले धेरै फरक वितरणहरू लुकाउँछ; चार्ट हेर्नुहोस्।
  • कारणको लागि गलत सहसंबंध। सह-कार्यले एउटाले अर्कोतर्फ लैजान्छ भन्ने संकेत गर्दैन; लुकेका चरहरूबाट सावधान रहनुहोस्।
  • स्क्याटर प्लट बिना सहसंबंध हेर्दै। एकल आउटलियर वा वक्रताले संख्यालाई गलत बनाउँछ।
  • माध्यको साथमा दुई-चरम/स्क्युड वितरण संक्षेप गर्दै। औसत कसैको प्रतिनिधित्व नहुन सक्छ।
  • EDA छोड्दै र सीधा मोडेलमा जाँदै। अपरिचित डाटा भनेको अन्धा मोडेल हो।
सुझाव: प्रत्येक नयाँ डेटा सेटको साथ, पहिलो 30 मिनेट मात्र ग्राफहरू कोर्नुहोस्: प्रत्येक संख्याको हिस्टोग्राम, महत्त्वपूर्ण जोडीहरूको स्क्याटर प्लट, कोटीहरूको बार चार्ट। यी ३० मिनेटले भविष्यका दिनहरूमा मोडलिङ त्रुटिहरूलाई रोक्छ।

संक्षेपमा

EDA मोडेल निर्माण गर्नु अघि डाटा थाहा पाउने चरण हो र चार प्रश्नहरूको जवाफ खोज्छ: वितरण, केन्द्र-स्प्रेड, सम्बन्ध र विसंगतिहरू। सारांश तथ्याङ्क भ्रामक हुन सक्छ; ग्राफ हेर्नु अनिवार्य छ (Anscombe लेक्चर)। सहसंबंध एक शक्तिशाली उपकरण हो, तर कारण होइन र निश्चित रूपमा स्क्याटर प्लटसँग संयोजनमा पढ्नु पर्छ। AI ग्राफिक्स र कोड लेखन सुझाव को लागी एक महान गतिवर्धक हो; तर मानिसहरूले आफ्नो क्षेत्रको ज्ञानबाट व्याख्या गर्छन् कि तिनीहरूले देखेको ढाँचा वास्तविक हो वा संयोग।

आवेदन कार्य

डेटासेट छान्नुहोस् र केवल EDA गर्नुहोस्: कम्तिमा तीन संख्यात्मक चरहरूको हिस्टोग्राम निकाल्नुहोस्, दुई जोडी चरहरूको स्क्याटर प्लट, र एक सहसंबंध ताप नक्सा। कम्तिमा एउटा "आश्चर्य" फेला पार्नुहोस् (जस्तै दुई चुचुराहरूको साथ वितरण, नकली सहसम्बन्धको लागि उम्मेद्वार, एकल आउटलियरले आकर्षित गरेको सम्बन्ध) र यसलाई एक वाक्यमा व्याख्या गर्नुहोस्। कुनै पनि कारण दावी नगरी लेख्नुहोस्।

चेकलिस्ट

  • [ ] के मैले प्रत्येक संख्यात्मक चरको वितरण ग्राफ गरेको छु?
  • के मैले स्क्याटरप्लटसँगको सम्बन्धलाई हेरेँ?
  • के मैले कारण र सहसम्बन्धलाई अलग राखेको छु?
  • [ ] के मैले तिरछा वा दुई-चुचो वितरणहरू देखेको छैन र मतलबलाई अन्धाधुन्ध विश्वास गरेको छैन?
  • [ ] के मैले मेरो EDA निष्कर्षबाट कम्तिमा एउटा मोडलिङ पक्ष/परिकल्पना व्युत्पन्न गरेको छु?