लाभ:
- कृत्रिम बुद्धिमत्ता समर्थन के साथ वर्णनात्मक आँकड़े और वितरण/संबंध चार्ट तैयार करने और डेटा और प्रश्न के अनुसार सही चार्ट प्रकार चुनने की क्षमता
- कृत्रिम बुद्धिमत्ता द्वारा निर्मित छवियों में भ्रामक विकल्पों (धराशायी अक्ष, अनुचित पैमाने, अत्यधिक स्मूथिंग) को पहचानने और ईमानदार विज़ुअलाइज़ेशन सिद्धांतों को लागू करने की क्षमता
- यह भेद करने में सक्षम होना कि खोजपूर्ण विश्लेषण परिकल्पना उत्पन्न करने और उसी डेटा के साथ खोज और पुष्टि करने के जाल के लिए है (जो पी-हैकिंग का द्वार खोलता है)।
डेटा को साफ करने के बाद, अनुभवजन्य शोधकर्ता का पहला काम इसे जानना है। इस चरण को खोजपूर्ण डेटा विश्लेषण (ईडीए - खोजपूर्ण डेटा विश्लेषण) कहा जाता है: यह ग्राफ़ और सारांश आंकड़ों के साथ डेटा की जांच करने और इसकी संरचना, पैटर्न और आश्चर्य को देखने की प्रक्रिया है। इसका उद्देश्य अभी किसी परिकल्पना का परीक्षण करना नहीं है, बल्कि डेटा से परिचित होना, प्रश्न उत्पन्न करना और भविष्य में आपके द्वारा बनाए जाने वाले मॉडल के लिए आधार तैयार करना है। इस इकाई में, हम देखेंगे कि कृत्रिम बुद्धिमत्ता (एआई) ईडीए और विज़ुअलाइज़ेशन को कैसे तेज करती है, लेकिन इसके द्वारा उत्पादित ग्राफिक्स का सावधानीपूर्वक ऑडिट क्यों किया जाना चाहिए।
आइए पहले दो बुनियादी भेद करें। सबसे पहले, वर्णनात्मक आँकड़े (संख्याएँ जो माध्य, माध्यिका, मानक विचलन, चतुर्थक जैसे डेटा को सारांशित करती हैं) और विज़ुअलाइज़ेशन (समान जानकारी को ग्राफिक रूप से दिखाती हैं) एक दूसरे के पूरक हैं; साथ में वे डेटा का वर्णन करते हैं। दूसरा, और सबसे महत्वपूर्ण: खोज और पुष्टि को अलग किया जाना चाहिए। खोजपूर्ण विश्लेषण परिकल्पना उत्पन्न करने के लिए है; उसी डेटा के साथ परिकल्पना की खोज करना और यह कहना कि "मैंने इसका परीक्षण किया और इसे महत्वपूर्ण पाया" पी-हैकिंग का द्वार खोलता है, जिसे हम अगली इकाई में देखेंगे। डेटा को देखना और पैटर्न देखना मुफ़्त है; लेकिन उसी डेटा में उस पैटर्न को "सिद्ध खोज" घोषित करना भ्रामक है।
चरण दर चरण खोजपूर्ण विश्लेषण
1. अविभाज्य दृश्य। प्रत्येक चर की व्यक्तिगत रूप से जाँच करें: क्या इसका वितरण सममित है या विषम है; वहाँ कितनी पहाड़ियाँ हैं; आउटलाइर्स कहां हैं? संख्यात्मक चर के लिए, हिस्टोग्राम (मानों को श्रेणियों में विभाजित करके आवृत्ति दिखाने वाला प्लॉट) और बॉक्सप्लॉट (बॉक्सप्लॉट - माध्यिका, चतुर्थक और चरम मान दिखाने वाला चार्ट); श्रेणीबद्ध चर के लिए, आवृत्ति तालिकाओं और बार चार्ट का उपयोग करें।
2. द्विचर दृश्य. दो चर के बीच संबंध देखें: दो संख्यात्मक चर के लिए स्कैटर प्लॉट (प्रत्येक अवलोकन को एक्स-वाई विमान पर एक बिंदु के रूप में दिखाता है), संख्यात्मक-श्रेणीबद्ध के लिए समूहीकृत बॉक्स प्लॉट, दो श्रेणीबद्ध के लिए क्रॉसस्टैब। सहसंबंध गुणांक को देखने से पहले, स्कैटर प्लॉट को देखना सुनिश्चित करें: एक ही सहसंबंध बहुत अलग पैटर्न दिखा सकता है (प्रसिद्ध एन्स्कोम्ब चौकड़ी इसे प्रदर्शित करती है; चार डेटा सेटों में लगभग समान आँकड़े होते हैं, लेकिन जब प्लॉट किया जाता है तो वे पूरी तरह से अलग हो जाते हैं)।
3. सही चार्ट प्रकार चुनें. चार्ट प्रकार आपके प्रश्न और डेटा प्रकार पर निर्भर करता है। वितरण के लिए हिस्टोग्राम; रिश्ते के लिए बिखराव; समय के साथ परिवर्तन के लिए लाइन चार्ट; श्रेणी तुलना के लिए बार चार्ट; (सावधानीपूर्वक) भागों और संपूर्ण के अनुपात के लिए स्टैक्ड बार। AI आपके लिए तुरंत कोड तैयार करता है, लेकिन "किस प्रश्न के लिए कौन सा ग्राफ़" का निर्णय आपका है।
4. पैटर्न पर ध्यान दें, नतीजे घोषित न करें. आपके द्वारा देखे गए किसी भी दिलचस्प पैटर्न को "खोज नोट" के रूप में रिकॉर्ड करें, लेकिन इसे एक पुष्टि की गई खोज न मानें। पुष्टिकरण एक अलग चरण में किया जाता है, अधिमानतः अलग डेटा या पूर्व निर्धारित कार्यक्रम के साथ।
ईमानदार विज़ुअलाइज़ेशन सिद्धांत
ग्राफिक आश्वस्त करता है; अतः इसकी भ्रामक शक्ति भी अधिक होती है। एआई सौंदर्यपूर्ण लेकिन कभी-कभी भ्रामक विकल्प चुन सकता है। इन नीतियों की जाँच करें:
- बार चार्ट में, y-अक्ष शून्य से शुरू होना चाहिए। धराशायी अक्ष छोटे अंतर को बड़े के रूप में दिखाता है।
- पैमाना सुसंगत होना चाहिए. यदि दो चार्ट की तुलना की जा रही है, तो समान अक्ष सीमा का उपयोग करें।
- अत्यधिक स्मूथिंग वास्तविक पैटर्न को छिपा सकती है। एक ट्रेंड लाइन अच्छी लगती है, लेकिन अगर यह डेटा को बहुत अधिक "सुचारू" करती है, तो यह भ्रामक हो सकती है।
- रंग और 3डी सजावट ध्यान बिगाड़ते हैं, डेटा नहीं। सादगी चुनें.
- गुम डेटा और नमूना आकार दिखाई देना चाहिए। "n=12" और "n=12,000" एक जैसे नहीं दिखने चाहिए।
ध्यान दें: सिर्फ इसलिए कि एआई द्वारा निर्मित ग्राफिक्स सुंदर हैं, वे सच नहीं हैं। सबसे आम गलती जो वह करता है वह है बार चार्ट में अक्ष को शून्य से शुरू न करना और दोनों समूहों के बीच के अंतर को बढ़ा-चढ़ाकर बताना। हमेशा अक्ष की जाँच करें.
तुलना चार्ट: प्रश्न → चार्ट
पूछो
सही चार्ट
सामान्य गलती
यह चर कैसे वितरित किया जाता है?
हिस्टोग्राम/बॉक्स प्लॉट
पाई चार्ट का उपयोग करें
क्या दो संख्यात्मक चर संबंधित हैं?
बिखराव की साजिश
बस सहसंबंधों की संख्या देख रहे हैं
समय के साथ यह कैसे बदल गया है?
लाइन चार्ट
एक बार चार्ट के साथ एक रुझान बताना
समूहों में क्या अंतर है?
समूहीकृत बॉक्स/बार (स्क्रैच से)
छिन्नित अक्ष छड़
अंश-से-संपूर्ण अनुपात?
स्टैक्ड बार (सावधानी के साथ)
मल्टी-स्लाइस पाई चार्ट
चार प्रतिलिपि योग्य संकेत
1. ऑटो डिस्कवरी कोड:
आपकी भूमिका: ईडीए सहायक। मैं डेटा साझा नहीं करता, मुझे R (ggplot2) कोड चाहिए। 'डेटा' डेटा.फ़्रेम में संख्यात्मक (आय, आयु, व्यय) और श्रेणीबद्ध (क्षेत्र, शिक्षा) चर हैं। कार्य: कोड लिखें जो प्रत्येक संख्या के लिए एक हिस्टोग्राम, प्रत्येक श्रेणी के लिए एक बार चार्ट और आय~आयु के लिए एक स्कैटर प्लॉट तैयार करता है। बार चार्ट में, y-अक्ष को शून्य से प्रारंभ होने दें। टिप्पणी पंक्ति जोड़ें.
2. सहसंबंध समीक्षा (सहसंबंध + दृश्य एक साथ):
कोड लिखें जो आय और व्यय के लिए पियर्सन सहसंबंध की गणना करता है और एक स्कैटर प्लॉट + रैखिक प्रवृत्ति को प्लॉट करता है। सहसंबंध गणना (Anscombe चेतावनी) पर भरोसा करने से पहले मुझे चार्ट की जांच करने की याद दिलाने वाली एक टिप्पणी पंक्ति जोड़ें। ट्रेंड लाइन को अधिक चिकना न करें।
3. सत्यनिष्ठा लेखापरीक्षा:
ईमानदार विज़ुअलाइज़ेशन के लिए निम्नलिखित ggplot कोड की जाँच करें: [कोड]। निम्नलिखित की जाँच करें और सही करें: क्या y-अक्ष शून्य से शुरू होता है, क्या स्केल सुसंगत है, क्या नमूना आकार दिखाई देता है, क्या अत्यधिक स्मूथिंग है? आपके द्वारा किए गए प्रत्येक सुधार का औचित्य स्पष्ट करें।
4. एक खोज नोट तैयार करना (खोज नहीं):
मेरे द्वारा उत्पादित ग्राफ़ के आधार पर, टिप्पणियों को 'खोज नोट' के रूप में सूचीबद्ध करें; प्रत्येक आइटम को 'परीक्षण की जाने वाली परिकल्पना' की भाषा में लिखें, न कि 'निर्णायक निष्कर्ष' की भाषा में। उदाहरण: 'उच्च शिक्षा में आय अधिक फैली हुई लगती है; अलग डेटा के साथ परीक्षण किया जाना चाहिए।' कारणात्मक और निश्चित बयानों से बचें.
कमजोर संकेत/मजबूत संकेत
कमजोर संकेत:
उपज से अच्छे ग्राफ़ बनाएं और मुझे बताएं कि उनका क्या मतलब है।
यह संकेत भ्रामक आउटपुट को आमंत्रित करता है: "सुंदर" सौंदर्यशास्त्र पर केंद्रित है, जबकि "इसका क्या अर्थ है" एआई को खोज से निश्चित निष्कर्ष तक कूदने के लिए प्रेरित करता है। कारणपरक, अतिरंजित टिप्पणियाँ अनुसरण करती हैं।
शक्तिशाली संकेत:
आपकी भूमिका: ईमानदार ईडीए सहायक। कार्य: (1) चार्ट का प्रकार चुनें जो मेरे प्रश्न के अनुरूप हो और औचित्य लिखें, (2) बार चार्ट में शून्य से अक्ष शुरू करें, (3) डिस्कवरी नोट भाषा में आउटपुट की व्याख्या करें: कोई निश्चित/कारण दावा "परीक्षण नहीं किया जाना चाहिए" भाषा में परिकल्पना का सुझाव देता है, (4) यदि नमूना छोटा है तो मुझे चेतावनी दें (एन <30)। मैं चार्ट को अपने वातावरण में चलाऊंगा और इसे सत्यापित करूंगा।
अंतर: दृढ़ इच्छाशक्ति चार्ट प्रकार को उचित ठहराती है, ईमानदारी के नियम लागू करती है और पुष्टि के साथ खोज को भ्रमित नहीं करती है।
तीन मिनी मामले
केस 1 - असतत अक्ष अतिशयोक्ति। एक विश्लेषक ने एक बार चार्ट में दो शाखाओं (7.8 और 8.0; 10 में से) का संतुष्टि स्कोर दिखाया। YZ अक्ष को 7.5 से शुरू करने पर, दूसरी शाखा पहली की तुलना में लगभग दोगुनी ऊँची दिखाई दी; जबकि अंतर केवल 2.5% था. प्रबंधन गलत धारणा के तहत एक शाखा को पुरस्कृत करने वाला था। जब मैंने अक्ष को शून्य से प्रारंभ किया तो अंतर लगभग अदृश्य था। पाठ: धुरी का चुनाव ही धारणा को बदल देता है।
केस 2 - सहसंबंध पर भरोसा करना और चार्ट को छोड़ना। एक शोधकर्ता ने दो चरों के बीच r = 0.81 देखा और "मजबूत रैखिक संबंध" लिखा। जब उनके सलाहकार ने स्कैटर प्लॉट के लिए पूछा, तो यह देखा गया कि संबंध वास्तव में एक चरम अवलोकन के कारण था, और जब उस बिंदु को हटा दिया गया, तो सहसंबंध 0.12 तक गिर गया। पाठ: सहसंबंध गणना किसी ग्राफ़ का विकल्प नहीं है; हमेशा बिखराव को देखो.
केस 3 - पुष्टि के साथ भ्रमित करने वाली खोज। एक छात्र ने 40-चर डेटा सेट में सभी जोड़ीवार सहसंबंधों को देखा, उच्चतम एक (आर = 0.52) का चयन किया और लिखा, "हमें शिक्षा और बचत (पी = 0.004) के बीच एक महत्वपूर्ण संबंध मिला।" हालाँकि, 40 चरों में सैकड़ों जोड़े थे; उच्चतम को चुनना संयोगवश एक गलत निष्कर्ष था। पाठ: खोजे गए पैटर्न को उसी डेटा में "परीक्षण और महत्वपूर्ण घोषित" नहीं किया जा सकता है; अलग से पुष्टि आवश्यक है.
सामान्य गलतियाँ
- बार चार्ट में अक्ष को शून्य से प्रारंभ नहीं करना। यह छोटे अंतर को बढ़ा-चढ़ाकर पेश करता है; सबसे आम दृश्य झूठ. हमेशा जांचें.
- सहसंबंध को देखना और चार्ट को छोड़ना। एक ही सहसंबंध बहुत भिन्न पैटर्न से आता है; एक बाहरी रिश्ते में फिट हो सकता है। सबसे पहले, बिखराव.
- खोज में मिले पैटर्न को उसी डेटा में "सबूत" मानते हुए. यह पी-हैकिंग का प्रवेश द्वार है; पुष्टि अलग से की जाती है.
- ग़लत चार्ट प्रकार. रुझान के लिए बार और वितरण के लिए पाई जैसे मिलान भ्रामक हैं। प्रश्न के आधार पर एक शैली चुनें.
- नमूना आकार छुपाया जा रहा है. n=8 और n=8,000 को एक ही ग्राफ़ पर समान नहीं दिखना चाहिए; अनिश्चितता दिखानी होगी.
टिप: चार्ट प्रकाशित करने से पहले, अपने आप से पूछें: "अगर मैं धुरी बदल दूं तो क्या कहानी बदल जाएगी?" यदि उत्तर हां है, तो संभवतः आपने किसी बेईमान जगह से शुरुआत की है।
सारांश
खोजपूर्ण डेटा विश्लेषण डेटा को पूरा करने, पैटर्न देखने और परिकल्पना उत्पन्न करने का चरण है; यह कोई पुष्टि नहीं है. एआई तुरंत वर्णनात्मक आँकड़े और ग्राफ़ कोड उत्पन्न करता है, लेकिन आप अपने प्रश्न के आधार पर ग्राफ़ प्रकार चुनते हैं और निष्पक्षता के सिद्धांतों (शून्य अक्ष, सुसंगत पैमाने, स्पष्ट अनिश्चितता) को नियंत्रित करते हैं। सहसंबंध संख्या पर भरोसा करने से पहले बिखराव को देखें; खोज में पाए गए पैटर्न को उसी डेटा में "सबूत" के रूप में घोषित न करें। एआई के खूबसूरत ग्राफ का मतलब सही ग्राफ नहीं है।
आवेदन कार्य
डेटा सेट में कम से कम तीन चर चुनें। एआई से पूछें और कोड चलाएं जो ईमानदारी के नियमों को लागू करने वाले संकेत के साथ खोजपूर्ण ग्राफ़ (हिस्टोग्राम, स्कैटर, बॉक्सिंग) तैयार करता है। प्रत्येक चार्ट के लिए: (1) प्रश्न के लिए चार्ट प्रकार की उपयुक्तता, (2) अक्ष की ईमानदारी, (3) नमूना आकार की दृश्यता की जाँच करें। परिकल्पना भाषा में कम से कम एक "खोज नोट" लिखें ("...ऐसा प्रतीत होता है कि इसका परीक्षण अलग से किया गया है")। गिनती और बिखराव दोनों के साथ सहसंबंध की जांच करें और यदि उनके बीच कोई विसंगति है तो रिपोर्ट करें।
चेकलिस्ट
- [ ] मैंने अपने प्रश्न और डेटा प्रकार के आधार पर चार्ट प्रकार चुना।
- [ ] बार चार्ट में, मैं y-अक्ष को शून्य से प्रारंभ करता हूं; मैंने अक्ष की ईमानदारी की जाँच की।
- [ ] सहसंबंध पर भरोसा करने से पहले मैंने स्कैटरप्लॉट को देखा।
- [ ] मैंने ग्राफ़ पर नमूना आकार और अनिश्चितता को प्रतिबिंबित किया।
- [ ] मैंने अन्वेषण में पाए गए पैटर्न को "सबूत" के बजाय "परीक्षण की जाने वाली परिकल्पना" के रूप में लिखा।
- [ ] मैंने नोट किया कि मैं पुष्टि के लिए उसी डेटा का उपयोग नहीं करूंगा और एक अलग चरण की आवश्यकता है।