लाभ:
- कृत्रिम बुद्धिमत्ता समर्थनको साथ वर्णनात्मक तथ्याङ्क र वितरण/सम्बन्ध चार्टहरू उत्पादन गर्ने क्षमता र डेटा र प्रश्न अनुसार सही चार्ट प्रकार छनोट गर्ने क्षमता
- कृत्रिम बुद्धिमत्ताद्वारा उत्पादित छविहरूमा भ्रामक विकल्पहरू (ड्यास गरिएको अक्ष, अनुपयुक्त स्केल, अत्यधिक स्मूथिङ) पहिचान गर्ने क्षमता र इमानदार दृश्य सिद्धान्तहरू लागू गर्ने क्षमता।
- त्यो अन्वेषणात्मक विश्लेषणलाई छुट्याउन सक्षम हुनु भनेको परिकल्पनाहरू उत्पन्न गर्न र एउटै डाटाको साथ खोज र पुष्टि गर्ने पासो हो (जसले p-ह्याकिंगको ढोका खोल्छ)।
डाटा सफा गरेपछि, अनुभवजन्य अनुसन्धानकर्ताको पहिलो काम यसलाई थाहा पाउनु हो। यस चरणलाई अन्वेषण डेटा विश्लेषण (EDA - अन्वेषण डेटा विश्लेषण) भनिन्छ: यो ग्राफ र सारांश तथ्याङ्कहरूको साथ डाटा जाँच गर्ने र यसको संरचना, ढाँचा र आश्चर्यहरू हेर्ने प्रक्रिया हो। उद्देश्य अहिलेसम्म परिकल्पना परीक्षण गर्नु होइन, तर डाटासँग परिचित हुन, प्रश्नहरू उत्पन्न गर्नुहोस् र तपाईंले भविष्यमा निर्माण गर्ने मोडेलको लागि आधार तयार पार्नु हो। यस एकाइमा, हामी कसरी कृत्रिम बुद्धिमत्ता (AI) ले EDA र दृश्यलाई गति दिन्छ भनेर देख्नेछौं, तर किन यसले उत्पादन गर्दछ ग्राफिक्सहरू सावधानीपूर्वक लेखापरीक्षण गर्नुपर्छ।
पहिले दुईवटा आधारभूत विभेद गरौं। पहिलो, वर्णनात्मक तथ्याङ्कहरू (अंकहरू जसले डेटालाई संक्षेप गर्दछ जस्तै औसत, मध्य, मानक विचलन, चतुर्थकहरू) र दृश्यावलोकन (ग्राफिक रूपमा उही जानकारी देखाउँदै) एकअर्काको पूरक हुन्छन्; सँगै तिनीहरूले डाटा वर्णन। दोस्रो, र सबैभन्दा महत्त्वपूर्ण: खोज र पुष्टिकरण छुट्याउनै पर्छ। अन्वेषणात्मक विश्लेषण परिकल्पनाहरू उत्पन्न गर्नका लागि हो; उही डेटाको साथ परिकल्पना अन्वेषण र "मैले यसलाई परीक्षण गरें र यसलाई महत्त्वपूर्ण फेला पारे" भन्नाले p-ह्याकिंगको ढोका खोल्छ, जुन हामी अर्को एकाइमा देख्नेछौं। यो डाटा हेर्न र ढाँचा हेर्न स्वतन्त्र छ; तर उही डाटामा त्यो ढाँचालाई "प्रमाणित खोज" घोषणा गर्नु भ्रामक हो।
चरणबद्ध अन्वेषण विश्लेषण
1. एकरूप दृश्य। प्रत्येक चरलाई व्यक्तिगत रूपमा जाँच्नुहोस्: यसको वितरण सममित वा स्क्युड छ; त्यहाँ कति पहाडहरू छन्; आउटलियरहरू कहाँ छन्? संख्यात्मक चरहरूको लागि, हिस्टोग्राम (दायराहरूमा मानहरू विभाजन गरेर फ्रिक्वेन्सी देखाउने प्लट) र बक्सप्लट (बक्सप्लट — मध्य, चतुर्थक र चरम मानहरू देखाउने चार्ट); वर्गीय चरहरूको लागि, आवृत्ति तालिकाहरू र बार चार्टहरू प्रयोग गर्नुहोस्।
2. द्विविभाजन दृश्य। दुई चरहरू बीचको सम्बन्ध हेर्नुहोस्: दुई संख्यात्मक चरहरूको लागि स्क्याटर प्लट (x-y प्लेनमा प्रत्येक अवलोकनलाई बिन्दुको रूपमा देखाउँदछ), संख्यात्मक-वर्गीयका लागि समूहबद्ध बक्स प्लट, दुई वर्गीयका लागि क्रसट्याब। सहसंबंध गुणांक हेर्नु अघि, स्क्याटर प्लट हेर्न निश्चित हुनुहोस्: एउटै सहसम्बन्धले धेरै फरक ढाँचाहरू देखाउन सक्छ (प्रसिद्ध Anscombe क्वार्टेटले यो देखाउँछ; चार डेटा सेटहरूमा लगभग उस्तै तथ्याङ्कहरू छन्, तर जब तिनीहरू पूर्णतया फरक हुन्छन्)।
3. सही चार्ट प्रकार छान्नुहोस्। चार्ट प्रकार तपाईंको प्रश्न र डेटा प्रकार मा निर्भर गर्दछ। वितरणको लागि हिस्टोग्राम; सम्बन्धको लागि बिखर्ने; समय संग परिवर्तन को लागी रेखा चार्ट; श्रेणी तुलनाको लागि बार चार्ट; (सावधानीपूर्वक) पूरै भागहरूको अनुपातको लागि स्ट्याक गरिएको बार। AI ले तपाईंको लागि द्रुत रूपमा कोड उत्पन्न गर्छ, तर "कुन प्रश्नको लागि कुन ग्राफ" भन्ने निर्णय तपाईंको हो।
4. ढाँचा नोट गर्नुहोस्, परिणाम घोषणा नगर्नुहोस्। तपाईंले "डिस्कवरी नोट" को रूपमा देख्नुभएको कुनै पनि रोचक ढाँचा रेकर्ड गर्नुहोस्, तर यसलाई पुष्टि भएको खोज नठान्नुहोस्। पुष्टिकरण एक अलग चरणमा गरिन्छ, अधिमानतः छुट्टै डेटा वा पूर्वनिर्धारित तालिकाको साथ।
इमानदार दृश्य सिद्धान्तहरू
ग्राफिक आश्वस्त; त्यसैले, यसको भ्रामक शक्ति पनि उच्च छ। AI ले सौन्दर्य तर कहिलेकाहीं भ्रामक छनौट गर्न सक्छ। यी नीतिहरू जाँच गर्नुहोस्:
- बार चार्टहरूमा, y-अक्ष शून्यबाट सुरु हुनुपर्छ। ड्यास गरिएको अक्षले सानो भिन्नतालाई ठूलो रूपमा देखाउँछ।
- स्केल एकरूप हुनुपर्छ। यदि दुई चार्ट तुलना गरिँदै छ भने, एउटै अक्ष दायरा प्रयोग गर्नुहोस्।
- अत्यधिक स्मूथिङले साँचो ढाँचा लुकाउन सक्छ। एउटा प्रवृति रेखा राम्रो देखिन्छ, तर यदि यसले डेटालाई धेरै "स्मूथ" गर्छ भने, यो भ्रामक हुन सक्छ।
- रङ र थ्रीडी सजावटले ध्यान विकृत गर्छ, डाटा होइन। सरलता छान्नुहोस्।
- छुटेको डाटा र नमूना आकार देखिने हुनुपर्छ। "n=12" र "n=12,000" उस्तै देखिनु हुँदैन।
ध्यान दिनुहोस्: केवल किनभने AI द्वारा उत्पादित ग्राफिक्सहरू सुन्दर छन्, तिनीहरू सत्य होइनन्। उसले गर्ने सबैभन्दा सामान्य गल्ती भनेको बार चार्टमा शून्यबाट अक्ष सुरु नगर्नु र दुई समूहहरू बीचको भिन्नतालाई बढाइचढाइ गर्नु हो। सधैं अक्ष जाँच गर्नुहोस्।
तुलना चार्ट: प्रश्न → चार्ट
सोध्नुहोस्
सही चार्ट
सामान्य गल्ती
यो चर कसरी वितरण गरिन्छ?
हिस्टोग्राम/बक्स प्लट
पाई चार्ट प्रयोग गर्नुहोस्
के दुई संख्यात्मक चर सम्बन्धित छन्?
तितरबितर षड्यन्त्र
केवल सहसंबंधको संख्या हेर्दै
समयसँगै कसरी परिवर्तन भएको छ ?
रेखा चार्ट
एक बार चार्ट संग एक प्रवृत्ति बताउँदै
समूहहरू बीचको भिन्नता के हो?
समूहबद्ध बक्स/पट्टी (स्क्र्याचबाट)
काटिएको अक्ष रड
भाग-देखि-पूरा अनुपात?
स्ट्याक बार (सावधानी संग)
बहु-स्लाइस पाई चार्ट
चार प्रतिलिपि योग्य प्रम्प्टहरू
1. स्वत: खोज कोड:
तपाईंको भूमिका: EDA सहायक। म डाटा साझा गर्दिन, म R (ggplot2) कोड चाहन्छु। 'डेटा' डेटा फ्रेममा संख्यात्मक (आय, उमेर, व्यय) र वर्गीकृत (क्षेत्र, शिक्षा) चरहरू छन्। कार्य: कोड लेख्नुहोस् जसले प्रत्येक संख्याको लागि हिस्टोग्राम, प्रत्येक वर्गको लागि बार चार्ट, र आय~ उमेरको लागि स्क्याटर प्लट उत्पादन गर्दछ। बार चार्टहरूमा, y-अक्षलाई शून्यबाट सुरु गरौं। टिप्पणी लाइन थप्नुहोस्।
2. सहसंबंध समीक्षा (सहसंबंध + दृश्य सँगै):
कोड लेख्नुहोस् जुन दुबैले आय र खर्चको लागि पियर्सन सहसम्बन्ध गणना गर्दछ र स्क्याटर प्लट + रैखिक प्रवृति प्लट गर्दछ। सहसंबंध गणना (Anscombe चेतावनी) मा भरोसा गर्नु अघि चार्ट जाँच गर्न मलाई सम्झाउने टिप्पणी रेखा थप्नुहोस्। प्रवृति रेखालाई अधिक चिकनी नगर्नुहोस्।
3. अखण्डता लेखापरीक्षण:
इमानदार दृश्यका लागि निम्न ggplot कोड जाँच गर्नुहोस्: [code]। निम्न जाँच गर्नुहोस् र सच्याउनुहोस्: के y-अक्ष शून्यबाट सुरु हुन्छ, के मापन एकरूप छ, नमूना आकार देखिने छ, के त्यहाँ अत्यधिक स्मूथिंग छ? तपाईंले गर्नुभएको प्रत्येक सुधारको औचित्य व्याख्या गर्नुहोस्।
4. खोज नोट उत्पादन गर्दै (खोज होइन):
मैले उत्पादन गरेको ग्राफहरूमा आधारित, अवलोकनहरूलाई 'डिस्कवरी नोट' को रूपमा सूचीबद्ध गर्नुहोस्; प्रत्येक वस्तुलाई 'परिक्षण गर्नुपर्ने परिकल्पना' को भाषामा लेख्नुहोस्, 'निर्णायक खोज' होइन। उदाहरण: 'उच्च शिक्षामा आय बढि फैलिएको देखिन्छ; छुट्टै डाटाको साथ परीक्षण गर्नुपर्छ।' कारण र निश्चित कथनहरू त्याग्नुहोस्।
कमजोर प्रम्प्ट / बलियो प्रम्प्ट
कमजोर प्रम्प्ट:
उपजबाट राम्रो ग्राफहरू बनाउनुहोस् र मलाई तिनीहरूको अर्थ बताउनुहोस्।
यो प्रम्प्टले भ्रामक आउटपुटलाई निम्तो दिन्छ: "सुन्दर" ले सौन्दर्यशास्त्रमा ध्यान केन्द्रित गर्दछ, जबकि "यसको अर्थ" ले एआईलाई खोजबाट निश्चित निष्कर्षमा पुग्न धकेल्छ। कारण, अतिरंजित टिप्पणीहरू पछ्याउँछन्।
शक्तिशाली प्रम्प्ट:
तपाईंको भूमिका: इमानदार EDA सहायक।कार्य: (१) मेरो प्रश्नसँग मिल्ने चार्टको प्रकार छनोट गर्नुहोस् र औचित्य लेख्नुहोस्, (२) बार चार्टहरूमा शून्यबाट अक्ष सुरु गर्नुहोस्, (३) डिस्कभरी नोट भाषामा आउटपुटको व्याख्या गर्नुहोस्: कुनै निश्चित/कारण दाबीले "परीक्षण गर्नैपर्छ" भाषामा परिकल्पनाको सुझाव दिँदैन (0) यदि नमूना (0) सानो छ (0) मा चल्नेछ। मेरो आफ्नै वातावरणमा चार्ट र यसलाई प्रमाणित गर्नुहोस्।
भिन्नता: बलियो इच्छाले चार्ट प्रकारलाई औचित्य दिन्छ, इमानदारीका नियमहरू लगाउँछ र पुष्टिसँग खोजलाई भ्रमित गर्दैन।
तीन मिनी केसहरू
केस 1 - अलग अक्ष अतिशयोक्ति। एक विश्लेषकले बार चार्टमा दुई शाखाहरू (७.८ र ८.०; १० मध्ये) को सन्तुष्टि स्कोर देखाए। 7.5 बाट YZ अक्ष सुरु गर्दा, दोस्रो शाखा पहिलो भन्दा लगभग दोब्बर उच्च देखा पर्यो; जबकि भिन्नता केवल 2.5% थियो। व्यवस्थापनले गलत छापमा शाखालाई पुरस्कृत गर्न लागेको थियो। जब मैले स्क्र्याचबाट अक्ष सुरु गरें, भिन्नता लगभग अदृश्य थियो। पाठ: अक्ष छनोटले मात्र धारणा परिवर्तन गर्छ।
केस २ - सहसम्बन्धलाई विश्वास गर्दै र चार्ट छोड्दै। एक शोधकर्ताले दुई चरहरू बीच r = 0.81 देखे र "बलियो रैखिक सम्बन्ध" लेखे। जब उनको सल्लाहकारले स्क्याटर प्लटको लागि सोध्यो, यो देखियो कि सम्बन्ध वास्तवमा एकल चरम अवलोकनको कारण थियो, र जब त्यो बिन्दु हटाइयो, सहसंबंध ०.१२ मा झर्यो। पाठ: सहसंबंध गणना ग्राफको लागि कुनै विकल्प छैन; सधैं तितरबितर हेर्नुहोस्।
केस 3 - पुष्टि संग भ्रमित खोज। एक विद्यार्थीले 40-चर डेटा सेटमा सबै जोडीवार सहसंबंधहरू हेरे, उच्चतम (r=0.52) चयन गरे र लेखे, "हामीले शिक्षा र बचत (p=0.004) बीचको महत्त्वपूर्ण सम्बन्ध फेला पार्यौं।" यद्यपि, 40 चरहरूमा सयौं जोडीहरू थिए; उच्चतम छान्नु मौकाको कारण गलत खोज थियो। पाठ: पत्ता लगाइएको ढाँचालाई समान डेटामा "परीक्षण र महत्त्वपूर्ण घोषित" गर्न सकिँदैन; अलग पुष्टिकरण आवश्यक छ।
सामान्य गल्तीहरू
- बार चार्टमा शून्यबाट अक्ष सुरु गर्दैन। यसले सानो भिन्नतालाई बढाइचढाइ गर्दछ; सबैभन्दा सामान्य दृश्य झूट। सधैं जाँच गर्नुहोस्।
- सहसंबंध हेर्दै र चार्ट छोड्दै। एउटै सम्बन्ध धेरै फरक ढाँचाबाट आउँछ; बाहिरी सम्बन्धमा फिट हुन सक्छ। पहिलो, बिखर्ने।
- खोजमा फेला परेको ढाँचालाई एउटै डाटामा "प्रमाण" को रूपमा विचार गर्दै। यो पी-ह्याकिंगको गेटवे हो; पुष्टि छुट्टै गरिन्छ।
- गलत चार्ट प्रकार। प्रवृतिको लागि बार र वितरणको लागि पाई जस्ता मिलानहरू भ्रामक छन्। प्रश्नमा आधारित विधा छनोट गर्नुहोस्।
- नमूना आकार लुकाउँदै। n=8 र n=8,000 एउटै ग्राफमा उस्तै देखिनु हुँदैन; अनिश्चितता देखाउनुपर्छ।
सुझाव: चार्ट प्रकाशित गर्नु अघि, आफैलाई सोध्नुहोस्: "यदि मैले अक्ष परिवर्तन गरें भने कथा परिवर्तन हुनेछ?" यदि जवाफ हो हो भने, तपाईंले सायद बेइमान ठाउँबाट पिभोट सुरु गर्नुभयो।
संक्षेपमा
अन्वेषण डेटा विश्लेषण डेटा भेट्ने, ढाँचाहरू हेर्ने र परिकल्पनाहरू उत्पन्न गर्ने चरण हो; यो एक पुष्टि छैन। AI ले द्रुत रूपमा वर्णनात्मक तथ्याङ्क र ग्राफ कोड उत्पन्न गर्छ, तर तपाईंले आफ्नो प्रश्नको आधारमा ग्राफ प्रकार छान्नुहुन्छ र निष्पक्षताका सिद्धान्तहरू (शून्य अक्ष, लगातार मापन, स्पष्ट अनिश्चितता) नियन्त्रण गर्नुहुन्छ। सहसंबंध संख्यामा विश्वास गर्नु अघि स्क्याटर हेर्नुहोस्; तपाईंले खोजमा फेला पार्नुभएको ढाँचालाई उही डाटामा "प्रमाण" को रूपमा घोषणा नगर्नुहोस्। AI को सुन्दर ग्राफको मतलब सही ग्राफ होइन।
आवेदन कार्य
डेटा सेटमा कम्तिमा तीन चर चयन गर्नुहोस्। AI लाई सोध्नुहोस् र कोड चलाउनुहोस् जसले इमानदारी नियमहरू लागू गर्ने प्रम्प्टको साथ अन्वेषण ग्राफहरू (हिस्टोग्राम, स्क्याटर, बक्स गरिएको) उत्पादन गर्दछ। प्रत्येक चार्टको लागि: जाँच गर्नुहोस् (1) प्रश्नमा चार्ट प्रकारको उपयुक्तता, (2) अक्षको इमानदारी, (3) नमूना आकारको दृश्यता। परिकल्पना भाषामा कम्तिमा एउटा "डिस्कवरी नोट" लेख्नुहोस् ("...छुट्टै परीक्षण गरिएको देखिन्छ")। काउन्ट र स्क्याटर दुवैसँगको सम्बन्धको जाँच गर्नुहोस् र यदि तिनीहरूको बीचमा भिन्नता छ भने रिपोर्ट गर्नुहोस्।
चेकलिस्ट
- [] मैले मेरो प्रश्न र डेटा प्रकारको आधारमा चार्ट प्रकार रोजें।
- [] बार चार्टहरूमा, म शून्यबाट y-अक्ष सुरु गर्छु; मैले अक्षको इमानदारी जाँच गरें।
- [] मैले सहसंबंधमा विश्वास गर्नु अघि स्क्याटरप्लट हेरेँ।
- [] मैले ग्राफमा नमूना आकार र अनिश्चितता प्रतिबिम्बित गरें।
- मैले अन्वेषणमा फेला परेका ढाँचाहरूलाई "प्रमाण" भन्दा "परीक्षण गर्न परिकल्पना" भनेर लेखें।
- [ ] मैले नोट गरे कि म पुष्टिकरणको लागि उही डाटा प्रयोग गर्दिन र छुट्टै चरण आवश्यक थियो।