एकाइहरू
1. इकोनोमेट्रिक्स र तथ्याङ्कमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र गोपनीयता 2. डाटा क्लिनिङ र तयारी: हराएको डाटा, आउटलियर्स, र कोडिङ 3. अन्वेषक डाटा विश्लेषण र भिजुअलाइजेसन: आर्टिफिसियल इन्टेलिजेन्सको साथ ग्राफिङ र व्याख्या 4. रैखिक प्रतिगमन: मोडेल निर्माण, गुणांक व्याख्या र अनुमानहरू 5. प्रतिगमन निदान र उल्लङ्घनहरू: कोलिनियरिटी, हेटेरोसेडेस्टिकिटी, स्वत: सहसंबंध 6. परिकल्पना परीक्षण र p-मान: महत्व, शक्ति, र बहु तुलनाहरू 7. पी-ह्याकिंग, हार्किङ र तथ्याङ्कीय अखण्डता: आर्टिफिसियल इन्टेलिजेन्सको युगमा समस्याहरू 8. समय श्रृंखला विश्लेषण: स्थिरता, ARIMA र पूर्वानुमान 9. कारण र नीति विश्लेषण: DiD, IV, RDD र कृत्रिम बुद्धिमत्ता 10. कोड जेनेरेसन र प्रजनन योग्यता: R/Python, Versioning र Reproducibility 11. रिपोर्ट लेखन, संचार, र नैतिकता: प्रस्तुत परिणाम र संचार सीमाहरू
एकाइ 11 / 11

रिपोर्ट लेखन, संचार, र नैतिकता: प्रस्तुत परिणाम र संचार सीमाहरू

लाभ:

  • इमानदार र अस्पष्ट भाषामा कृत्रिम बुद्धिमत्ताको समर्थनमा लक्षित दर्शकहरूलाई (शैक्षिक, नीति, व्यवस्थापन) अनुभवजन्य निष्कर्षहरू रिपोर्ट गर्ने क्षमता।
  • निष्कर्ष, सीमितता र नैतिक कथनहरू पूर्ण रूपमा लेख्ने क्षमता (डेटा गोपनीयता, चासोको द्वन्द्व, कृत्रिम बुद्धिमत्ता प्रयोगको खुलासा) र भ्रामक प्रस्तुतीकरणबाट बच्न।
  • अतिरञ्जित, एकतर्फी वा कारणात्मक भाषा उत्पादन गर्ने रिपोर्टहरूको मस्यौदा पहिचान गर्न र अन्तिम पाठ र दावीहरूको लागि जिम्मेवारी कायम राख्ने कृत्रिम बुद्धिमत्ताको क्षमता अनुसन्धानकर्तासँग रहन्छ।

मोड्युल परीक्षा

१. एक शोधकर्ताले सोध्छन् '२०१५ र २०२० बीचको टर्कीमा बेरोजगारी र मुद्रास्फीति बीचको सहसम्बन्ध गुणांक के हो?' आर्टिफिसियल इन्टेलिजेन्सलाई कुनै डाटा नदिई। उसले सोध्छ र सिधै आफ्नो लेखमा 0.62 नम्बर लेख्छ। यस दृष्टिकोणमा आधारभूत त्रुटि के हो?

  • क) प्रमाणित डाटा नदिई कृत्रिम बुद्धिमत्ताबाट ठोस तथ्याङ्कको अपेक्षा गर्दै; ✔ प्रमाणित नगरी बनाइएको नम्बर प्रयोग गर्ने
  • ख) लेखमा सहसंबंध गुणांक कहिल्यै प्रयोग गर्नु हुँदैन।
  • ग) बेरोजगारी र मुद्रास्फीति बीचको सम्बन्ध गणना गर्न सकिँदैन
  • D) आर्टिफिसियल इन्टेलिजेन्सले २०२० पछि मात्रै डाटा पहुँच गर्न सक्छ

स्पष्टीकरण: एआई भाषा मोडेलले डाटासेट पहुँच नगरी तथ्याङ्कहरू उत्पादन गर्न सक्दैन; उसले दिएको नम्बर प्राय: भ्रम (बनाईएको) हो। गुणांक, अनुपात र परीक्षण परिणामहरू शोधकर्ताको आफ्नै प्रमाणित डाटाबाट गणना गरिनु पर्छ, मोडेलको मेमोरीबाट लिइएको होइन।

2. हराएको डाटाको अर्थ के हो 'यादृच्छिक रूपमा हराइरहेको छैन' (MNAR) र यो किन महत्त्वपूर्ण छ?

  • क) अभाव अप्रत्याशित मूल्यको कारणले हो; त्यसैले साधारण असाइनमेन्टले पूर्वाग्रह सिर्जना गर्न सक्छ ✔
  • B) डाटा पूर्ण रूपमा अनियमित रूपमा गायब हुन्छ र कुनै पूर्वाग्रह सिर्जना गर्दैन।
  • ग) हराएको डाटा सधैं पङ्क्ति मेटाएर समाधान गर्नुपर्छ।
  • D) हराएको डाटाले कुनै पनि हिसाबले विश्लेषणलाई असर गर्दैन।

स्पष्टीकरण: MNAR (Missing Not At Random) को मामलामा, हराएको कुरा आफैले नदेखेको मूल्यको परिमाणमा निर्भर गर्दछ (जस्तै उच्च कमाउनेहरूले आफ्नो आय रिपोर्ट गर्दैनन्)। यस अवस्थामा, साधारण मेटाउने वा औसत असाइनमेन्टले पक्षपाती परिणाम दिन्छ; कमीको मेकानिजम मोडेल हुनुपर्छ। आर्टिफिसियल इन्टेलिजेन्सले सुझाव दिएको असाइनमेन्ट विधि यस मेकानिजमलाई थाहा नदिई अन्धाधुन्ध रूपमा लागू गर्नु हुँदैन।

3. एक विश्लेषकसँग AI ले बार चार्ट बनाउँछ, र AI ले शून्यको सट्टा 40 मा y-अक्ष सुरु गर्छ। दुई समूहहरू बीच 2% को वास्तविक भिन्नता ग्राफमा ठूलो देखिन्छ। सही दृष्टिकोण के हो?

  • A) स्क्र्याचबाट अक्ष सुरु गर्दै वा चार्ट प्रकार परिवर्तन गर्दै; ✔ भ्रामक बिना फरक को साँचो आकार देखाउन
  • B) AI ले उत्तम छनौट गर्ने हुनाले चार्टको प्रयोग गर्दै
  • C) 45 मा अक्ष सुरु गर्दै भिन्नता अझ ठूलो बनाउन
  • D) बार चार्टको सट्टा भिजुअल प्रयोग नगर्नुहोस्

स्पष्टीकरण: बार चार्टमा, ड्यास गरिएको अक्ष (शून्यबाट सुरु नहुने y-अक्ष) ले साना भिन्नताहरू बढाइचढाइ गरेर भ्रमित गर्छ। इमानदार भिजुअलाइजेशनमा, बार चार्टको अक्ष शून्यबाट सुरु हुनुपर्छ वा भिन्नता सचेत रूपमा स्पष्ट रूपमा बताइनुपर्छ। छवि प्रमाणित गर्ने र आवश्यक भएमा यसलाई सच्याउने जिम्मेवारी विश्लेषकको हो।

4. रैखिक प्रतिगमनमा गुणांक 'महत्वपूर्ण' (p <0.05) हो भन्ने तथ्यलाई कृत्रिम बुद्धिमत्ताको व्याख्यामा अक्सर गलत रूपमा प्रस्तुत गरिन्छ?

  • क) प्रभाव ठूलो र महत्त्वपूर्ण वा कार्यकारण स्थापित भएकोले महत्वको अतिरंजित प्रस्तुति ✔
  • ख) महत्व सधैं प्रभाव सानो छ भनेर संकेत गर्छ
  • C) p <0.05 ले गुणांक बिल्कुल सही छ भनेर प्रमाणित गर्दछ
  • D) महत्त्वपूर्ण गुणांकहरू कहिल्यै रिपोर्ट गर्नु हुँदैन।

स्पष्टीकरण: सांख्यिकीय महत्व प्रमाणको बलसँग सम्बन्धित छ कि प्रभाव शून्य भन्दा फरक छ; यसको मतलब यो होइन कि प्रभाव ठूलो, महत्त्वपूर्ण वा कारण हो। AI ले अक्सर 'महत्वपूर्ण' शब्दलाई 'महत्वपूर्ण/बलियो प्रभाव' को रूपमा प्रस्तुत गर्दछ। अन्वेषकले प्रभाव आकार, आत्मविश्वास अन्तराल, र सन्दर्भ पनि मूल्याङ्कन गर्नुपर्छ।

5. 'p-hacking' शब्दले केलाई जनाउँछ र AI ले किन सजिलो बनाउन सक्छ?

  • A) धेरै विश्लेषणहरू प्रयास गर्दै जबसम्म यो अर्थ बनाउँछ; AI ले यो धेरै छिटो गर्छ, जोखिम बढाउँछ ✔
  • ख) एक पटक र पूर्वनिर्धारित योजना संग डेटा विश्लेषण
  • C) p-value बढाउन नमूना विस्तार गर्दै
  • D) केवल वर्णनात्मक तथ्याङ्कहरू रिपोर्ट गर्दै

स्पष्टीकरण: p-hacking ले अर्थपूर्ण नतिजा नआएसम्म विभिन्न चरहरू, सबसम्पलहरू, रूपान्तरणहरू वा मोडेलहरू प्रयास गरिरहेको हुन्छ; यसले मौकामा आधारित नक्कली निष्कर्षहरू उत्पादन गर्दछ। AI ले सेकेन्डमा दर्जनौं मोडेल भेरियन्टहरू प्रयास गर्न सक्ने भएकोले, यसले इमान्दार योजना बिना पी-ह्याकिंगको गति बढाउन सक्छ। रक्षा; पूर्व दर्ता, निश्चित विश्लेषण योजना र बहु ​​तुलना सुधार।

6. दुई गैर-स्थिर (इकाई मूल) समय श्रृंखला बीचको उच्च R-वर्ग प्रतिगमन किन भ्रामक हुन सक्छ?

  • A) सामान्य प्रवृत्तिको कारणले नकली प्रतिगमन हुन सक्छ; ✔ वास्तविक सम्बन्ध बिना उच्च R-वर्ग आउटपुट
  • B) उच्च R-वर्गले सधैं बलियो कारण सम्बन्ध प्रमाणित गर्छ।
  • C) गैर-स्थिर श्रृंखलाहरू प्रतिगमनमा प्रवेश गर्न सकिँदैन।
  • D) R-squared समय श्रृंखलामा गणना गर्न सकिँदैन

स्पष्टीकरण: यदि गैर-स्थिर श्रृंखलाहरू बीच कुनै साझा सहबद्धता सम्बन्ध छैन भने, नकली प्रतिगमनले सामान्य प्रवृत्तिको कारणले मात्र उच्च आर-वर्ग र महत्त्वपूर्ण गुणांक उत्पादन गर्न सक्छ; जबकि त्यहाँ कुनै वास्तविक सम्बन्ध छैन। तसर्थ, स्थिरता र एकाइ मूल परीक्षण पहिले गर्नुपर्छ, र आवश्यक भएमा, भिन्नता लिनु पर्छ वा एकीकरण परीक्षण गर्नुपर्छ।

7. के आधारभूत धारणा फरक-इन-डिफरन्स डिजाइनको वैधतामा आधारित छ?

  • क) समानान्तर प्रवृति धारणा: कुनै हस्तक्षेप नभएमा समूहहरूले एउटै दिशा पछ्याउनेछन् ✔
  • ख) उपचार र नियन्त्रण समूहहरू सुरुमा ठ्याक्कै उस्तै छन्
  • ग) नमूनाको सामान्य वितरण
  • D) चरहरूले कुनै पनि छुटेको डाटा समावेश गर्दैन

स्पष्टीकरण: DiD ले हस्तक्षेपको अनुपस्थितिमा उपचार र नियन्त्रण समूहहरूको लागि परिणाम चर समयको साथमा समानान्तर हुने थियो (समानान्तर प्रवृत्ति अनुमान) मान्छ। यदि यो धारणा पूरा भएन भने, अनुमान पक्षपाती छ। AI ले DiD कोड उत्पादन गर्न सक्छ, तर यो समानान्तर प्रवृतिहरूको रक्षा र परीक्षण गर्ने अनुसन्धानकर्ताको काम हो।

8. पुन: उत्पादन योग्य विश्लेषणको लागि निम्न मध्ये कुन अनिवार्य अभ्यास हो?

  • A) अनियमित चरणहरूमा बीउ फिक्स गर्दै, प्याकेज संस्करणहरू र कोड रेकर्डिङ ✔
  • B) म्यानुअल रूपमा स्प्रेडसिटमा परिणामहरू प्रतिलिपि गर्नुहोस् र कोड मेटाउनुहोस्
  • ग) प्रत्येक दौडमा फरक नतिजा देख्नु सामान्य हो।
  • D) अन्तिम ग्राफिक्स मात्र राख्ने, डाटा र कोड साझेदारी नगर्ने

विवरण: प्रजनन क्षमता; उही नतिजा एउटै डाटा र कोड संग फेरि प्राप्त गर्न सकिन्छ। अनियमित चरणहरूमा बीज फिक्स गर्दै, प्याकेज संस्करणहरू बचत, र कागजात भित्र कोड कार्यान्वयन (साक्षर प्रोग्रामिंग) यसको आधारशिलाहरू हुन्। नतिजाहरू म्यानुअल रूपमा प्रतिलिपि गर्नाले वा क्लिक-आधारित, गैर-लगिङ चरणहरूले पुन: उत्पादन क्षमतालाई कमजोर बनाउँछ।

9. heteroskedasticity ले रैखिक प्रतिगमनलाई विकृत गर्छ र यसको साझा समाधान के हो?

  • क) यसले मानक त्रुटिहरू विकृत गर्दछ; समाधान बलियो मानक त्रुटिहरू वा उपयुक्त रूपान्तरण हो ✔
  • B) यसले गुणांक अनुमानहरू पूर्ण रूपमा अमान्य गर्दछ र यसको कुनै समाधान छैन
  • C) सधैं R-वर्गलाई शून्यमा घटाउँछ
  • D) नमूना धेरै सानो छ र बेवास्ता गर्न सकिन्छ भने मात्र हुन्छ

स्पष्टीकरण: Heteroscedasticity ले गुणांक अनुमान निष्पक्ष छोड्छ तर मानक त्रुटिहरू गलत गणना गर्दछ; यसले p-मानहरू र आत्मविश्वास अन्तरालहरूलाई अविश्वसनीय बनाउँछ। एउटा सामान्य समाधान भनेको बलियो/HC मानक त्रुटिहरू वा उपयुक्त रूपान्तरण प्रयोग गर्नु हो। यो प्रमाणित गरिनु पर्छ कि AI द्वारा सुझाव गरिएको समाधानले समस्यालाई लुकाउनुको सट्टा वास्तवमा समाधान गर्दछ।

10. एक अनुसन्धानकर्ताले सार्वजनिक एआई च्याट उपकरणमा बिरामी-स्तर पहिचान जानकारी र आम्दानी समावेश भएको माइक्रोडाटा अपलोड गर्दछ र 'डु रिग्रेसन' भन्छ। यो व्यवहार संग मुख्य समस्या के हो?

  • A) बाह्य उपकरणमा व्यक्तिगत/इजाजतपत्र प्राप्त डाटा अपलोड गर्दा गोपनीयता र सम्झौताको उल्लङ्घन हुन्छ ✔
  • ख) कृत्रिम बुद्धिमत्ता द्वारा प्रतिगमन गर्न सकिदैन
  • C) माइक्रो डाटा रिग्रेसनको लागि उपयुक्त छैन
  • D) AI ले जहिले पनि प्रतिगमनको गलत गणना गर्छ

स्पष्टीकरण: व्यक्तिगत/विशेष डेटा जस्तै पहिचान र आय KVKK/GDPR र धेरैजसो डेटा उपयोग सम्झौताहरू अन्तर्गत सुरक्षित छन्; डेटा भण्डारण गर्न सक्ने बाह्य उपकरणमा तिनीहरूलाई अपलोड गर्नु उल्लङ्घन हो। सही बाटो; डाटा गुमाउने, स्थानीय/संस्थागत सुरक्षित उपकरणहरू प्रयोग गरेर, वा केवल कृत्रिम बुद्धिमत्ताबाट कोड अनुरोध गर्ने र कोडलाई आफ्नै वातावरणमा चलाउने।

11. बहु-रेखीयता उच्च हुँदा के अवलोकन गरिन्छ?

  • A) गुणांकहरू अस्थिर हुन्छन् र मानक त्रुटिहरू बढ्छन्; व्यक्तिगत गुणांक अर्थहीन हुन सक्छ ✔
  • B) R-वर्ग सधैं शून्यमा घट्छ
  • C) गुणांक अनुमानहरू सधैं अधिक सटीक हुन्छन्
  • D) निर्भर चर परिवर्तनको स्केल

स्पष्टीकरण: उच्च बहुकोलिनियरिटीमा, स्वतन्त्र चरहरू एकअर्कासँग कडा रूपमा सहसंबद्ध हुन्छन्; गुणांक अनुमानहरू अस्थिर हुन्छन्, मानक त्रुटिहरू बढ्छन्, र व्यक्तिगत गुणांकहरू नगण्य हुन सक्छन्, जबकि समग्र मोडेल महत्त्वपूर्ण हुन सक्छ। यो VIF जस्ता मापदण्डहरूद्वारा निदान गरिन्छ। आर्टिफिसियल इन्टेलिजेन्सले चर उन्मूलनको सुझाव दिन सक्छ, तर कुन चर सैद्धान्तिक रहनुपर्छ भन्ने निर्णय गर्ने अनुसन्धानकर्तामा निर्भर छ।

12. सांख्यिकीय शक्ति के हो र कम शक्ति अध्ययन को जोखिम के हो?

  • क) अवस्थित प्रभाव पत्ता लगाउने सम्भावना; कम शक्तिले साँचो प्रभावहरू गुमाउँछ र निष्कर्षहरूलाई अविश्वसनीय बनाउँछ ✔
  • बी) पी-मान घटाउने सम्भावना; कम शक्ति सधैं अधिक विश्वसनीय परिणाम दिन्छ
  • C) नमूना आकारबाट स्वतन्त्र स्थिर मान
  • D) कृत्रिम बुद्धिमत्ता प्रयोग गर्दा मात्र मान्य हुने अवधारणा

स्पष्टीकरण: पावर भनेको वास्तवमा अवस्थित प्रभाव पत्ता लगाउने सम्भावना हो (१ माइनस प्रकार II त्रुटि)। कम-सक्षम अध्ययनहरूले साँचो प्रभावहरू गुमाउन सक्छ; थप रूपमा, केही महत्त्वपूर्ण परिणामहरूले अतिरंजित प्रभाव आकार ('विजेताको श्राप') बोक्न सक्छ र गलत सकारात्मक दर बढ्छ। तसर्थ, विश्लेषण गर्नु अघि शक्ति/नमूना गणना महत्त्वपूर्ण छ।

13. लेखमा कृत्रिम बुद्धिमत्ताको प्रयोग खुलासा गर्नु नैतिक रूपमा किन आवश्यक छ?

  • क) पारदर्शिता र जवाफदेहिताको लागि; ✔ पाठकहरू र रेफरीहरूले प्रक्रियाको मूल्याङ्कन गर्न सक्छन् र जिम्मेवारी लेखकसँग रहन्छ
  • ख) आर्टिफिसियल इन्टेलिजेन्सको प्रयोगले स्वतः नतिजालाई अमान्य बनाउँछ
  • C) पत्रिकाहरू द्वारा विज्ञापन उद्देश्यका लागि मात्र अनुरोध गरिएको
  • D) स्पष्टीकरणको प्रतिलिपि अधिकार कृत्रिम बुद्धिमत्तामा हस्तान्तरण गर्दै

खुलासा: पारदर्शिता आवश्यक छ ताकि पाठक र समीक्षकहरूले परिणामहरू कसरी उत्पादन गरियो मूल्याङ्कन गर्न सक्छन्; धेरै जर्नल र संस्थाहरूलाई अब एआई प्रयोगको खुलासा चाहिन्छ। थप रूपमा, आर्टिफिसियल इन्टेलिजेन्सले त्रुटिहरू/भ्रमहरू उत्पन्न गर्न सक्ने हुनाले, जिम्मेवारी लेखकसँग रहन्छ र कुन चरणहरू लेखापरीक्षण गरियो भन्ने कुरा बताउन इमानदारीको कुरा हो।

14. इन्स्ट्रुमेन्ट भेरिएबल (IV) विधिमा 'बहिष्करण प्रतिबन्ध' के चाहिन्छ?

  • A) उपकरणले आन्तरिक चर मार्फत मात्र परिणामलाई असर गर्छ, त्यहाँ कुनै अन्य प्रत्यक्ष तरिका छैन ✔
  • B) उपकरणको परिणाम चरसँग कुनै सम्बन्ध छैन।
  • C) इन्स्ट्रुमेन्ट अन्तर्जात चरसँग सम्बन्धित छैन।
  • D) मतलब सधैं बाइनरी (0/1) चर हो

स्पष्टीकरण: बहिष्करण अवरोधको लागि आवश्यक छ कि उपकरणले परिणाम चरलाई अन्तर्जात व्याख्यात्मक चर मार्फत मात्र प्रभाव पार्छ र कुनै अन्य प्रत्यक्ष माध्यम वा अप्रत्याशित कारकहरू मार्फत होइन। यो धारणालाई डाटाबाट पूर्ण रूपमा परीक्षण गर्न सकिँदैन; यसलाई सैद्धान्तिक र संस्थागत आधारमा रक्षा गरिएको छ। AI ले IV कोड लेख्न सक्छ, तर यो उपकरणको वैधता रक्षा गर्न अनुसन्धानकर्ताको काम हो।

15. पूर्व-दर्ता नगरी लचिलो विश्लेषणहरूमा 'फोर्किङ मार्गहरूको बगैंचा' समस्याको अर्थ के हो?

  • क) डाटामा आधारित धेरै उचित विश्लेषण विकल्पहरूले गलत सकारात्मक दर बढाउँछ, नजानेर पनि ✔
  • ख) विश्लेषण विधि एकल र अनिवार्य हुनुपर्छ
  • C) एक समस्या जुन तब मात्र हुन्छ जब जानीजानी धोखाधडी हुन्छ।
  • D) नमूना बढ्दै जाँदा सहज रूपमा गायब हुने अवस्था

स्पष्टीकरण: डेटा हेरेपछि, शोधकर्ताले कुन चर, उपसमूह, रूपान्तरण, वा थ्रेसहोल्ड प्रयोग गर्ने भन्ने बारे धेरै उचित छनोट गर्न सक्छ। कुनै एकल 'इन्टेन्शनल पी-ह्याकिंग' नभए पनि, यो लचिलोपनले झूटा सकारात्मक दरलाई बढाउँछ किनभने महत्त्वपूर्ण विश्लेषणको ठूलो संख्याबाट प्रभावकारी रूपमा चयन गरिएको छ। पूर्व-दर्ता र एक निश्चित विश्लेषण योजनाले यो लचिलोपनलाई सीमित गर्दछ।