इकाइयाँ
1. अर्थमिति और सांख्यिकी में कृत्रिम बुद्धिमत्ता: भूमिकाएँ, सीमाएँ, प्रमाणीकरण और गोपनीयता 2. डेटा सफ़ाई और तैयारी: गुम डेटा, आउटलेयर और कोडिंग 3. खोजपूर्ण डेटा विश्लेषण और विज़ुअलाइज़ेशन: आर्टिफिशियल इंटेलिजेंस के साथ रेखांकन और व्याख्या 4. रेखीय प्रतिगमन: मॉडल निर्माण, गुणांक व्याख्या और धारणाएँ 5. प्रतिगमन निदान और उल्लंघन: संरेखता, विषमलैंगिकता, स्वसहसंबंध 6. परिकल्पना परीक्षण और पी-वैल्यू: महत्व, शक्ति और एकाधिक तुलनाएँ 7. पी-हैकिंग, हार्किंग और सांख्यिकीय अखंडता: आर्टिफिशियल इंटेलिजेंस के युग में नुकसान 8. समय श्रृंखला विश्लेषण: स्थिरता, ARIMA और पूर्वानुमान 9. कारण और नीति विश्लेषण: DiD, IV, RDD और आर्टिफिशियल इंटेलिजेंस 10. कोड जनरेशन और प्रतिलिपि प्रस्तुत करने योग्यता: आर/पायथन, संस्करण और प्रतिलिपि प्रस्तुत करने योग्यता 11. रिपोर्ट लेखन, संचार और नैतिकता: परिणाम प्रस्तुत करना और संचार सीमाएँ
इकाई 3 / 11

खोजपूर्ण डेटा विश्लेषण और विज़ुअलाइज़ेशन: आर्टिफिशियल इंटेलिजेंस के साथ रेखांकन और व्याख्या

लाभ:

  • कृत्रिम बुद्धिमत्ता समर्थन के साथ वर्णनात्मक आँकड़े और वितरण/संबंध चार्ट तैयार करने और डेटा और प्रश्न के अनुसार सही चार्ट प्रकार चुनने की क्षमता
  • कृत्रिम बुद्धिमत्ता द्वारा निर्मित छवियों में भ्रामक विकल्पों (धराशायी अक्ष, अनुचित पैमाने, अत्यधिक स्मूथिंग) को पहचानने और ईमानदार विज़ुअलाइज़ेशन सिद्धांतों को लागू करने की क्षमता
  • यह भेद करने में सक्षम होना कि खोजपूर्ण विश्लेषण परिकल्पना उत्पन्न करने और उसी डेटा के साथ खोज और पुष्टि करने के जाल के लिए है (जो पी-हैकिंग का द्वार खोलता है)।

डेटा को साफ करने के बाद, अनुभवजन्य शोधकर्ता का पहला काम इसे जानना है। इस चरण को खोजपूर्ण डेटा विश्लेषण (ईडीए - खोजपूर्ण डेटा विश्लेषण) कहा जाता है: यह ग्राफ़ और सारांश आंकड़ों के साथ डेटा की जांच करने और इसकी संरचना, पैटर्न और आश्चर्य को देखने की प्रक्रिया है। इसका उद्देश्य अभी किसी परिकल्पना का परीक्षण करना नहीं है, बल्कि डेटा से परिचित होना, प्रश्न उत्पन्न करना और भविष्य में आपके द्वारा बनाए जाने वाले मॉडल के लिए आधार तैयार करना है। इस इकाई में, हम देखेंगे कि कृत्रिम बुद्धिमत्ता (एआई) ईडीए और विज़ुअलाइज़ेशन को कैसे तेज करती है, लेकिन इसके द्वारा उत्पादित ग्राफिक्स का सावधानीपूर्वक ऑडिट क्यों किया जाना चाहिए।

आइए पहले दो बुनियादी भेद करें। सबसे पहले, वर्णनात्मक आँकड़े (संख्याएँ जो माध्य, माध्यिका, मानक विचलन, चतुर्थक जैसे डेटा को सारांशित करती हैं) और विज़ुअलाइज़ेशन (समान जानकारी को ग्राफिक रूप से दिखाती हैं) एक दूसरे के पूरक हैं; साथ में वे डेटा का वर्णन करते हैं। दूसरा, और सबसे महत्वपूर्ण: खोज और पुष्टि को अलग किया जाना चाहिए। खोजपूर्ण विश्लेषण परिकल्पना उत्पन्न करने के लिए है; उसी डेटा के साथ परिकल्पना की खोज करना और यह कहना कि "मैंने इसका परीक्षण किया और इसे महत्वपूर्ण पाया" पी-हैकिंग का द्वार खोलता है, जिसे हम अगली इकाई में देखेंगे। डेटा को देखना और पैटर्न देखना मुफ़्त है; लेकिन उसी डेटा में उस पैटर्न को "सिद्ध खोज" घोषित करना भ्रामक है।

चरण दर चरण खोजपूर्ण विश्लेषण

1. अविभाज्य दृश्य। प्रत्येक चर की व्यक्तिगत रूप से जाँच करें: क्या इसका वितरण सममित है या विषम है; वहाँ कितनी पहाड़ियाँ हैं; आउटलाइर्स कहां हैं? संख्यात्मक चर के लिए, हिस्टोग्राम (मानों को श्रेणियों में विभाजित करके आवृत्ति दिखाने वाला प्लॉट) और बॉक्सप्लॉट (बॉक्सप्लॉट - माध्यिका, चतुर्थक और चरम मान दिखाने वाला चार्ट); श्रेणीबद्ध चर के लिए, आवृत्ति तालिकाओं और बार चार्ट का उपयोग करें।

2. द्विचर दृश्य. दो चर के बीच संबंध देखें: दो संख्यात्मक चर के लिए स्कैटर प्लॉट (प्रत्येक अवलोकन को एक्स-वाई विमान पर एक बिंदु के रूप में दिखाता है), संख्यात्मक-श्रेणीबद्ध के लिए समूहीकृत बॉक्स प्लॉट, दो श्रेणीबद्ध के लिए क्रॉसस्टैब। सहसंबंध गुणांक को देखने से पहले, स्कैटर प्लॉट को देखना सुनिश्चित करें: एक ही सहसंबंध बहुत अलग पैटर्न दिखा सकता है (प्रसिद्ध एन्स्कोम्ब चौकड़ी इसे प्रदर्शित करती है; चार डेटा सेटों में लगभग समान आँकड़े होते हैं, लेकिन जब प्लॉट किया जाता है तो वे पूरी तरह से अलग हो जाते हैं)।

3. सही चार्ट प्रकार चुनें. चार्ट प्रकार आपके प्रश्न और डेटा प्रकार पर निर्भर करता है। वितरण के लिए हिस्टोग्राम; रिश्ते के लिए बिखराव; समय के साथ परिवर्तन के लिए लाइन चार्ट; श्रेणी तुलना के लिए बार चार्ट; (सावधानीपूर्वक) भागों और संपूर्ण के अनुपात के लिए स्टैक्ड बार। AI आपके लिए तुरंत कोड तैयार करता है, लेकिन "किस प्रश्न के लिए कौन सा ग्राफ़" का निर्णय आपका है।

4. पैटर्न पर ध्यान दें, नतीजे घोषित न करें. आपके द्वारा देखे गए किसी भी दिलचस्प पैटर्न को "खोज नोट" के रूप में रिकॉर्ड करें, लेकिन इसे एक पुष्टि की गई खोज न मानें। पुष्टिकरण एक अलग चरण में किया जाता है, अधिमानतः अलग डेटा या पूर्व निर्धारित कार्यक्रम के साथ।

ईमानदार विज़ुअलाइज़ेशन सिद्धांत

ग्राफिक आश्वस्त करता है; अतः इसकी भ्रामक शक्ति भी अधिक होती है। एआई सौंदर्यपूर्ण लेकिन कभी-कभी भ्रामक विकल्प चुन सकता है। इन नीतियों की जाँच करें:

  • बार चार्ट में, y-अक्ष शून्य से शुरू होना चाहिए। धराशायी अक्ष छोटे अंतर को बड़े के रूप में दिखाता है।
  • पैमाना सुसंगत होना चाहिए. यदि दो चार्ट की तुलना की जा रही है, तो समान अक्ष सीमा का उपयोग करें।
  • अत्यधिक स्मूथिंग वास्तविक पैटर्न को छिपा सकती है। एक ट्रेंड लाइन अच्छी लगती है, लेकिन अगर यह डेटा को बहुत अधिक "सुचारू" करती है, तो यह भ्रामक हो सकती है।
  • रंग और 3डी सजावट ध्यान बिगाड़ते हैं, डेटा नहीं। सादगी चुनें.
  • गुम डेटा और नमूना आकार दिखाई देना चाहिए। "n=12" और "n=12,000" एक जैसे नहीं दिखने चाहिए।
ध्यान दें: सिर्फ इसलिए कि एआई द्वारा निर्मित ग्राफिक्स सुंदर हैं, वे सच नहीं हैं। सबसे आम गलती जो वह करता है वह है बार चार्ट में अक्ष को शून्य से शुरू न करना और दोनों समूहों के बीच के अंतर को बढ़ा-चढ़ाकर बताना। हमेशा अक्ष की जाँच करें.

तुलना चार्ट: प्रश्न → चार्ट

पूछो

सही चार्ट

सामान्य गलती

यह चर कैसे वितरित किया जाता है?

हिस्टोग्राम/बॉक्स प्लॉट

पाई चार्ट का उपयोग करें

क्या दो संख्यात्मक चर संबंधित हैं?

बिखराव की साजिश

बस सहसंबंधों की संख्या देख रहे हैं

समय के साथ यह कैसे बदल गया है?

लाइन चार्ट

एक बार चार्ट के साथ एक रुझान बताना

समूहों में क्या अंतर है?

समूहीकृत बॉक्स/बार (स्क्रैच से)

छिन्नित अक्ष छड़

अंश-से-संपूर्ण अनुपात?

स्टैक्ड बार (सावधानी के साथ)

मल्टी-स्लाइस पाई चार्ट

चार प्रतिलिपि योग्य संकेत

1. ऑटो डिस्कवरी कोड:

आपकी भूमिका: ईडीए सहायक। मैं डेटा साझा नहीं करता, मुझे R (ggplot2) कोड चाहिए। 'डेटा' डेटा.फ़्रेम में संख्यात्मक (आय, आयु, व्यय) और श्रेणीबद्ध (क्षेत्र, शिक्षा) चर हैं। कार्य: कोड लिखें जो प्रत्येक संख्या के लिए एक हिस्टोग्राम, प्रत्येक श्रेणी के लिए एक बार चार्ट और आय~आयु के लिए एक स्कैटर प्लॉट तैयार करता है। बार चार्ट में, y-अक्ष को शून्य से प्रारंभ होने दें। टिप्पणी पंक्ति जोड़ें.

2. सहसंबंध समीक्षा (सहसंबंध + दृश्य एक साथ):

कोड लिखें जो आय और व्यय के लिए पियर्सन सहसंबंध की गणना करता है और एक स्कैटर प्लॉट + रैखिक प्रवृत्ति को प्लॉट करता है। सहसंबंध गणना (Anscombe चेतावनी) पर भरोसा करने से पहले मुझे चार्ट की जांच करने की याद दिलाने वाली एक टिप्पणी पंक्ति जोड़ें। ट्रेंड लाइन को अधिक चिकना न करें।

3. सत्यनिष्ठा लेखापरीक्षा:

ईमानदार विज़ुअलाइज़ेशन के लिए निम्नलिखित ggplot कोड की जाँच करें: [कोड]। निम्नलिखित की जाँच करें और सही करें: क्या y-अक्ष शून्य से शुरू होता है, क्या स्केल सुसंगत है, क्या नमूना आकार दिखाई देता है, क्या अत्यधिक स्मूथिंग है? आपके द्वारा किए गए प्रत्येक सुधार का औचित्य स्पष्ट करें।

4. एक खोज नोट तैयार करना (खोज नहीं):

मेरे द्वारा उत्पादित ग्राफ़ के आधार पर, टिप्पणियों को 'खोज नोट' के रूप में सूचीबद्ध करें; प्रत्येक आइटम को 'परीक्षण की जाने वाली परिकल्पना' की भाषा में लिखें, न कि 'निर्णायक निष्कर्ष' की भाषा में। उदाहरण: 'उच्च शिक्षा में आय अधिक फैली हुई लगती है; अलग डेटा के साथ परीक्षण किया जाना चाहिए।' कारणात्मक और निश्चित बयानों से बचें.

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

उपज से अच्छे ग्राफ़ बनाएं और मुझे बताएं कि उनका क्या मतलब है।

यह संकेत भ्रामक आउटपुट को आमंत्रित करता है: "सुंदर" सौंदर्यशास्त्र पर केंद्रित है, जबकि "इसका क्या अर्थ है" एआई को खोज से निश्चित निष्कर्ष तक कूदने के लिए प्रेरित करता है। कारणपरक, अतिरंजित टिप्पणियाँ अनुसरण करती हैं।

शक्तिशाली संकेत:

आपकी भूमिका: ईमानदार ईडीए सहायक। कार्य: (1) चार्ट का प्रकार चुनें जो मेरे प्रश्न के अनुरूप हो और औचित्य लिखें, (2) बार चार्ट में शून्य से अक्ष शुरू करें, (3) डिस्कवरी नोट भाषा में आउटपुट की व्याख्या करें: कोई निश्चित/कारण दावा "परीक्षण नहीं किया जाना चाहिए" भाषा में परिकल्पना का सुझाव देता है, (4) यदि नमूना छोटा है तो मुझे चेतावनी दें (एन <30)। मैं चार्ट को अपने वातावरण में चलाऊंगा और इसे सत्यापित करूंगा।

अंतर: दृढ़ इच्छाशक्ति चार्ट प्रकार को उचित ठहराती है, ईमानदारी के नियम लागू करती है और पुष्टि के साथ खोज को भ्रमित नहीं करती है।

तीन मिनी मामले

केस 1 - असतत अक्ष अतिशयोक्ति। एक विश्लेषक ने एक बार चार्ट में दो शाखाओं (7.8 और 8.0; 10 में से) का संतुष्टि स्कोर दिखाया। YZ अक्ष को 7.5 से शुरू करने पर, दूसरी शाखा पहली की तुलना में लगभग दोगुनी ऊँची दिखाई दी; जबकि अंतर केवल 2.5% था. प्रबंधन गलत धारणा के तहत एक शाखा को पुरस्कृत करने वाला था। जब मैंने अक्ष को शून्य से प्रारंभ किया तो अंतर लगभग अदृश्य था। पाठ: धुरी का चुनाव ही धारणा को बदल देता है।

केस 2 - सहसंबंध पर भरोसा करना और चार्ट को छोड़ना। एक शोधकर्ता ने दो चरों के बीच r = 0.81 देखा और "मजबूत रैखिक संबंध" लिखा। जब उनके सलाहकार ने स्कैटर प्लॉट के लिए पूछा, तो यह देखा गया कि संबंध वास्तव में एक चरम अवलोकन के कारण था, और जब उस बिंदु को हटा दिया गया, तो सहसंबंध 0.12 तक गिर गया। पाठ: सहसंबंध गणना किसी ग्राफ़ का विकल्प नहीं है; हमेशा बिखराव को देखो.

केस 3 - पुष्टि के साथ भ्रमित करने वाली खोज। एक छात्र ने 40-चर डेटा सेट में सभी जोड़ीवार सहसंबंधों को देखा, उच्चतम एक (आर = 0.52) का चयन किया और लिखा, "हमें शिक्षा और बचत (पी = 0.004) के बीच एक महत्वपूर्ण संबंध मिला।" हालाँकि, 40 चरों में सैकड़ों जोड़े थे; उच्चतम को चुनना संयोगवश एक गलत निष्कर्ष था। पाठ: खोजे गए पैटर्न को उसी डेटा में "परीक्षण और महत्वपूर्ण घोषित" नहीं किया जा सकता है; अलग से पुष्टि आवश्यक है.

सामान्य गलतियाँ

  • बार चार्ट में अक्ष को शून्य से प्रारंभ नहीं करना। यह छोटे अंतर को बढ़ा-चढ़ाकर पेश करता है; सबसे आम दृश्य झूठ. हमेशा जांचें.
  • सहसंबंध को देखना और चार्ट को छोड़ना। एक ही सहसंबंध बहुत भिन्न पैटर्न से आता है; एक बाहरी रिश्ते में फिट हो सकता है। सबसे पहले, बिखराव.
  • खोज में मिले पैटर्न को उसी डेटा में "सबूत" मानते हुए. यह पी-हैकिंग का प्रवेश द्वार है; पुष्टि अलग से की जाती है.
  • ग़लत चार्ट प्रकार. रुझान के लिए बार और वितरण के लिए पाई जैसे मिलान भ्रामक हैं। प्रश्न के आधार पर एक शैली चुनें.
  • नमूना आकार छुपाया जा रहा है. n=8 और n=8,000 को एक ही ग्राफ़ पर समान नहीं दिखना चाहिए; अनिश्चितता दिखानी होगी.
टिप: चार्ट प्रकाशित करने से पहले, अपने आप से पूछें: "अगर मैं धुरी बदल दूं तो क्या कहानी बदल जाएगी?" यदि उत्तर हां है, तो संभवतः आपने किसी बेईमान जगह से शुरुआत की है।

सारांश

खोजपूर्ण डेटा विश्लेषण डेटा को पूरा करने, पैटर्न देखने और परिकल्पना उत्पन्न करने का चरण है; यह कोई पुष्टि नहीं है. एआई तुरंत वर्णनात्मक आँकड़े और ग्राफ़ कोड उत्पन्न करता है, लेकिन आप अपने प्रश्न के आधार पर ग्राफ़ प्रकार चुनते हैं और निष्पक्षता के सिद्धांतों (शून्य अक्ष, सुसंगत पैमाने, स्पष्ट अनिश्चितता) को नियंत्रित करते हैं। सहसंबंध संख्या पर भरोसा करने से पहले बिखराव को देखें; खोज में पाए गए पैटर्न को उसी डेटा में "सबूत" के रूप में घोषित न करें। एआई के खूबसूरत ग्राफ का मतलब सही ग्राफ नहीं है।

आवेदन कार्य

डेटा सेट में कम से कम तीन चर चुनें। एआई से पूछें और कोड चलाएं जो ईमानदारी के नियमों को लागू करने वाले संकेत के साथ खोजपूर्ण ग्राफ़ (हिस्टोग्राम, स्कैटर, बॉक्सिंग) तैयार करता है। प्रत्येक चार्ट के लिए: (1) प्रश्न के लिए चार्ट प्रकार की उपयुक्तता, (2) अक्ष की ईमानदारी, (3) नमूना आकार की दृश्यता की जाँच करें। परिकल्पना भाषा में कम से कम एक "खोज नोट" लिखें ("...ऐसा प्रतीत होता है कि इसका परीक्षण अलग से किया गया है")। गिनती और बिखराव दोनों के साथ सहसंबंध की जांच करें और यदि उनके बीच कोई विसंगति है तो रिपोर्ट करें।

चेकलिस्ट

  • [ ] मैंने अपने प्रश्न और डेटा प्रकार के आधार पर चार्ट प्रकार चुना।
  • [ ] बार चार्ट में, मैं y-अक्ष को शून्य से प्रारंभ करता हूं; मैंने अक्ष की ईमानदारी की जाँच की।
  • [ ] सहसंबंध पर भरोसा करने से पहले मैंने स्कैटरप्लॉट को देखा।
  • [ ] मैंने ग्राफ़ पर नमूना आकार और अनिश्चितता को प्रतिबिंबित किया।
  • [ ] मैंने अन्वेषण में पाए गए पैटर्न को "सबूत" के बजाय "परीक्षण की जाने वाली परिकल्पना" के रूप में लिखा।
  • [ ] मैंने नोट किया कि मैं पुष्टि के लिए उसी डेटा का उपयोग नहीं करूंगा और एक अलग चरण की आवश्यकता है।