युनिट्स
1. अर्थमिती आणि सांख्यिकीमधील कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि गोपनीयता 2. डेटा क्लीनिंग आणि तयारी: गहाळ डेटा, आउटलियर्स आणि कोडिंग 3. एक्सप्लोरेटरी डेटा ॲनालिसिस आणि व्हिज्युअलायझेशन: आर्टिफिशियल इंटेलिजन्ससह आलेख आणि व्याख्या 4. रेखीय प्रतिगमन: मॉडेल बिल्डिंग, गुणांक व्याख्या आणि अनुमान 5. रीग्रेशन डायग्नोस्टिक्स आणि उल्लंघने: समरूपता, विषमता, ऑटोकॉरिलेशन 6. गृहीतक चाचणी आणि p-मूल्य: महत्त्व, शक्ती आणि एकाधिक तुलना 7. पी-हॅकिंग, हार्किंग आणि सांख्यिकीय अखंडता: कृत्रिम बुद्धिमत्तेच्या युगातील नुकसान 8. वेळ मालिका विश्लेषण: स्थिरता, ARIMA आणि अंदाज 9. कारण आणि धोरण विश्लेषण: DiD, IV, RDD आणि कृत्रिम बुद्धिमत्ता 10. कोड निर्मिती आणि पुनरुत्पादकता: आर/पायथन, आवृत्ती आणि पुनरुत्पादनक्षमता 11. अहवाल लेखन, संप्रेषण आणि नैतिकता: सादरीकरण परिणाम आणि संप्रेषण सीमा
युनिट 11 / 11

अहवाल लेखन, संप्रेषण आणि नैतिकता: सादरीकरण परिणाम आणि संप्रेषण सीमा

नफा:

  • कृत्रिम बुद्धिमत्तेच्या सहाय्याने लक्ष्यित प्रेक्षकांना (शैक्षणिक, धोरण, व्यवस्थापन) अनुभवजन्य निष्कर्षांचा अहवाल देण्याची क्षमता, प्रामाणिक आणि अस्पष्ट भाषेत
  • निष्कर्ष, मर्यादा आणि नैतिक विधाने पूर्णपणे लिहिण्याची क्षमता (डेटा गोपनीयता, स्वारस्यांचा संघर्ष, कृत्रिम बुद्धिमत्तेच्या वापराचा खुलासा) आणि दिशाभूल करणारे सादरीकरण टाळणे
  • अतिशयोक्तीपूर्ण, एकतर्फी किंवा कारणात्मक भाषा निर्माण करणाऱ्या अहवालांचे मसुदे ओळखण्याची आणि अंतिम मजकूर आणि दाव्यांची जबाबदारी संशोधकावर ठेवण्याची कृत्रिम बुद्धिमत्तेची क्षमता.

मॉड्यूल परीक्षा

1. एका संशोधकाने विचारले की '2015 आणि 2020 मधील तुर्कियमधील बेरोजगारी आणि चलनवाढ यांच्यातील परस्परसंबंध गुणांक काय आहे?' आर्टिफिशियल इंटेलिजन्सला कोणताही डेटा न देता. तो थेट त्याच्या लेखात ०.६२ क्रमांक विचारतो आणि लिहितो. या दृष्टिकोनातील मूलभूत चूक काय आहे?

  • अ) सत्यापित डेटा न देता कृत्रिम बुद्धिमत्तेकडून ठोस आकडेवारीची अपेक्षा करणे; ✔ पडताळणी न करता तयार केलेला नंबर वापरणे
  • ब) लेखात सहसंबंध गुणांक कधीही वापरू नये.
  • क) बेरोजगारी आणि महागाई यांच्यातील परस्परसंबंध मोजता येत नाहीत
  • ड) कृत्रिम बुद्धिमत्ता 2020 नंतर केवळ डेटामध्ये प्रवेश करू शकते

स्पष्टीकरण: एआय भाषा मॉडेल डेटासेटमध्ये प्रवेश केल्याशिवाय आकडेवारी तयार करू शकत नाही; त्याने दिलेला नंबर बहुधा भ्रम (बनावट) असावा. गुणांक, गुणोत्तर आणि चाचणी परिणाम संशोधकाच्या स्वतःच्या सत्यापित डेटावरून मोजले पाहिजेत, मॉडेलच्या मेमरीमधून घेतलेले नाहीत.

2. गहाळ डेटाचा 'यादृच्छिकपणे गहाळ होत नाही' (MNAR) याचा अर्थ काय आहे आणि ते महत्त्वाचे का आहे?

  • अ) कमतरता हे निरीक्षण न केलेल्या मूल्यामुळे होते; म्हणूनच साध्या असाइनमेंटमुळे पक्षपात होऊ शकतो ✔
  • ब) डेटा पूर्णपणे यादृच्छिकपणे अदृश्य होतो आणि कोणताही पूर्वाग्रह निर्माण करत नाही.
  • क) गहाळ डेटा नेहमी पंक्ती हटवून सोडवला पाहिजे.
  • ड) गहाळ डेटा कोणत्याही प्रकारे विश्लेषण प्रभावित करत नाही.

स्पष्टीकरण: MNAR (Missing Not At Random) च्या बाबतीत, गहाळपणा स्वतःच निरीक्षण न केलेल्या मूल्याच्या विशालतेवर अवलंबून असतो (उदा. उच्च कमाई करणारे त्यांच्या उत्पन्नाची तक्रार करत नाहीत). या प्रकरणात, साधे हटवणे किंवा सरासरी असाइनमेंट पक्षपाती परिणाम देते; कमतरतेची यंत्रणा मॉडेल करणे आवश्यक आहे. आर्टिफिशियल इंटेलिजन्सने सुचवलेली असाइनमेंट पद्धत ही यंत्रणा जाणून घेतल्याशिवाय आंधळेपणाने लागू करू नये.

3. विश्लेषकाकडे AI ने बार चार्ट बनवला आहे आणि AI शून्याऐवजी 40 वर y-अक्ष सुरू करतो. दोन गटांमधील वास्तविक फरक 2% आलेखावर खूप मोठा दिसतो. योग्य दृष्टीकोन काय आहे?

  • अ) अक्ष सुरवातीपासून सुरू करणे किंवा चार्ट प्रकार बदलणे; ✔ दिशाभूल न करता फरकाचा खरा आकार दर्शविण्यासाठी
  • ब) चार्ट जसा आहे तसा वापरणे कारण AI सर्वोत्तम निवड करते
  • क) फरक आणखी मोठा करण्यासाठी 45 वर अक्ष सुरू करणे
  • ड) बार चार्टऐवजी व्हिज्युअल कधीही वापरू नका

स्पष्टीकरण: बार चार्टमध्ये, डॅश केलेला अक्ष (शून्य पासून सुरू होणारा y-अक्ष) लहान फरक अतिशयोक्ती करून दिशाभूल करतो. प्रामाणिक व्हिज्युअलायझेशनमध्ये, बार चार्टचा अक्ष शून्यापासून सुरू झाला पाहिजे किंवा फरक जाणीवपूर्वक स्पष्टपणे नमूद केला पाहिजे. प्रतिमा सत्यापित करणे आणि आवश्यक असल्यास ते दुरुस्त करणे ही विश्लेषकाची जबाबदारी आहे.

4. रेखीय प्रतिगमनामध्ये गुणांक 'महत्त्वपूर्ण' (p<0.05) आहे हे तथ्य कृत्रिम बुद्धिमत्तेच्या स्पष्टीकरणामध्ये अनेकदा चुकीचे कसे मांडले जाते?

  • अ) प्रभाव मोठा आणि महत्त्वाचा किंवा कार्यकारणभाव स्थापित केल्यामुळे महत्त्वाची अतिशयोक्तीपूर्ण सादरीकरण ✔
  • ब) महत्त्व नेहमी सूचित करते की प्रभाव लहान आहे
  • C) p<0.05 हे सिद्ध करते की गुणांक पूर्णपणे बरोबर आहे
  • ड) महत्त्वपूर्ण गुणांक कधीही नोंदवू नयेत.

स्पष्टीकरण: सांख्यिकीय महत्त्व हे पुराव्याच्या ताकदीशी संबंधित आहे की प्रभाव शून्यापेक्षा वेगळा आहे; याचा अर्थ असा नाही की परिणाम मोठा, महत्त्वाचा किंवा कारणात्मक आहे. AI बऱ्याचदा 'लक्षणीय' हा शब्द 'महत्त्वपूर्ण/मजबूत प्रभाव' म्हणून सादर करते. संशोधकाने प्रभाव आकार, आत्मविश्वास मध्यांतर आणि संदर्भ यांचे देखील मूल्यांकन केले पाहिजे.

5. 'पी-हॅकिंग' या शब्दाचा संदर्भ काय आहे आणि AI हे सोपे का करू शकते?

  • अ) अर्थ प्राप्त होईपर्यंत अनेक विश्लेषणे करून पाहणे; AI हे खूप लवकर करते, जोखीम वाढवते ✔
  • ब) डेटाचे एकदा आणि पूर्वनिर्धारित योजनेसह विश्लेषण करणे
  • क) p-मूल्य वाढवण्यासाठी नमुना विस्तृत करणे
  • ड) केवळ वर्णनात्मक आकडेवारीचा अहवाल देणे

स्पष्टीकरण: पी-हॅकिंग अर्थपूर्ण परिणाम येईपर्यंत भिन्न व्हेरिएबल्स, सबसॅम्पल्स, ट्रान्सफॉर्मेशन्स किंवा मॉडेल्स वापरत आहे; यामुळे संधीवर आधारित खोटे निष्कर्ष निघतात. AI काही सेकंदात डझनभर मॉडेल प्रकार वापरून पाहू शकत असल्याने, ते प्रामाणिक योजनेशिवाय पी-हॅकिंगला गती देऊ शकते. संरक्षण; पूर्वनोंदणी, निश्चित विश्लेषण योजना आणि एकाधिक तुलना दुरुस्ती.

6. दोन नॉन-स्टेशनरी (युनिट रूट) टाइम सीरीजमधील उच्च R-वर्ग प्रतिगमन शोधणे दिशाभूल करणारे का असू शकते?

  • अ) सामान्य प्रवृत्तीमुळे बनावट प्रतिगमन होऊ शकते; ✔ वास्तविक संबंधाशिवाय उच्च R-वर्ग आउटपुट
  • ब) उच्च R-वर्ग नेहमी मजबूत कार्यकारण संबंध सिद्ध करतो.
  • क) नॉन-स्टेशनरी मालिका अजिबात रिग्रेशनमध्ये प्रवेश करू शकत नाही.
  • ड) आर-स्क्वेअरची गणना वेळ मालिकेत केली जाऊ शकत नाही

स्पष्टीकरण: नॉन-स्टेशनरी सीरीजमध्ये कोणतेही समान समीकरण संबंध नसल्यास, केवळ सामान्य प्रवृत्तीमुळे बनावट प्रतिगमन उच्च आर-वर्ग आणि लक्षणीय गुणांक तयार करू शकते; तर खरा संबंध नाही. म्हणून, स्थिरता आणि युनिट रूट चाचण्या आधी केल्या पाहिजेत आणि आवश्यक असल्यास, फरक घ्याव्यात किंवा एकीकरण चाचणी केली पाहिजे.

7. डिफरन्स-इन-डिफरन्स डिझाईनच्या वैधतेवर कोणती मूलभूत धारणा आधारित आहे?

  • अ) समांतर ट्रेंड गृहीतक: जर हस्तक्षेप नसेल तर गट समान दिशेने अनुसरण करतील ✔
  • ब) उपचार आणि नियंत्रण गट सुरुवातीला सारखेच असतात
  • क) नमुन्याचे सामान्य वितरण
  • ड) व्हेरिएबल्समध्ये कोणताही गहाळ डेटा नसतो

स्पष्टीकरण: डीआयडी गृहीत धरते की हस्तक्षेपाच्या अनुपस्थितीत, उपचार आणि नियंत्रण गटांसाठी परिणाम व्हेरिएबल कालांतराने समांतर मार्गक्रमण केले असते (समांतर ट्रेंड गृहितक). हे गृहितक पूर्ण न झाल्यास, अंदाज पक्षपाती आहे. एआय डीआयडी कोड तयार करू शकते, परंतु समांतर ट्रेंडचे रक्षण करणे आणि चाचणी करणे हे संशोधकाचे काम आहे.

8. पुनरुत्पादक विश्लेषणासाठी खालीलपैकी कोणता अनिवार्य सराव आहे?

  • अ) यादृच्छिक चरणांमध्ये बियाणे निश्चित करणे, पॅकेज आवृत्त्या आणि कोड रेकॉर्ड करणे ✔
  • ब) स्प्रेडशीटवर परिणाम मॅन्युअली कॉपी करा आणि कोड हटवा
  • क) प्रत्येक रनमध्ये वेगवेगळे परिणाम दिसणे सामान्य आहे.
  • ड) फक्त अंतिम ग्राफिक्स ठेवणे, डेटा आणि कोड शेअर न करणे

वर्णन: पुनरुत्पादनक्षमता; समान डेटा आणि कोडसह समान परिणाम पुन्हा प्राप्त केला जाऊ शकतो. यादृच्छिक पायऱ्यांमध्ये बियाणे निश्चित करणे, पॅकेज आवृत्त्या जतन करणे आणि दस्तऐवजात कोड कार्यान्वित करणे (साक्षर प्रोग्रामिंग) हे यातील कोनशिले आहेत. परिणाम मॅन्युअली कॉपी करणे किंवा क्लिक-आधारित, नॉन-लॉगिंग चरण पुनरुत्पादनक्षमतेला बाधित करतात.

9. हेटरोस्केडॅस्टिकिटी रेखीय प्रतिगमन कशामुळे विकृत करते आणि त्याचे सामान्य समाधान काय आहे?

  • अ) ते मानक त्रुटी विकृत करते; उपाय म्हणजे मजबूत मानक त्रुटी किंवा योग्य परिवर्तन ✔
  • ब) हे गुणांक अंदाज पूर्णपणे अमान्य करते आणि त्याचे कोणतेही समाधान नाही
  • क) नेहमी R-वर्ग शून्यावर कमी करतो
  • ड) नमुना फारच लहान असेल आणि त्याकडे दुर्लक्ष केले जाऊ शकते तरच उद्भवते

स्पष्टीकरण: Heteroscedasticity गुणांक अंदाज निष्पक्ष सोडते परंतु मानक त्रुटींची चुकीची गणना करते; हे p-मूल्ये आणि आत्मविश्वास मध्यांतरांना अविश्वसनीय बनवते. एक सामान्य उपाय म्हणजे मजबूत/एचसी मानक त्रुटी किंवा योग्य रूपांतरण वापरणे. AI ने सुचवलेला उपाय प्रत्यक्षात समस्या लपवण्याऐवजी त्याचे निराकरण करतो हे सत्यापित करणे आवश्यक आहे.

10. एक संशोधक सार्वजनिक AI चॅट टूलमध्ये रुग्ण-स्तरीय ओळख माहिती आणि उत्पन्न असलेला मायक्रोडेटा अपलोड करतो आणि 'डू रिग्रेशन' म्हणतो. या वर्तनाची मुख्य समस्या काय आहे?

  • अ) बाह्य साधनावर वैयक्तिक/परवानाकृत डेटा अपलोड करणे गोपनीयतेचे आणि कराराचे उल्लंघन आहे ✔
  • ब) कृत्रिम बुद्धिमत्तेद्वारे प्रतिगमन अजिबात करता येत नाही
  • क) मायक्रो डेटा रिग्रेशनसाठी अजिबात योग्य नाही
  • ड) AI नेहमी प्रतिगमनाची चुकीची गणना करते

स्पष्टीकरण: वैयक्तिक/विशेष डेटा जसे की ओळख आणि उत्पन्न KVKK/GDPR आणि बहुतेक डेटा वापर करारांतर्गत संरक्षित आहे; डेटा संचयित करू शकणाऱ्या बाह्य उपकरणावर ते अपलोड करणे हे उल्लंघन आहे. योग्य मार्ग; डेटा अनामित करणे, स्थानिक/संस्थात्मक सुरक्षित साधने वापरणे किंवा कृत्रिम बुद्धिमत्तेकडून कोडची विनंती करणे आणि कोड स्वतःच्या वातावरणात चालवणे.

11. जेव्हा बहुसंग्रहता जास्त असते तेव्हा काय पाहिले जाते?

  • अ) गुणांक अस्थिर होतात आणि मानक त्रुटी वाढतात; वैयक्तिक गुणांक निरर्थक असू शकतात ✔
  • ब) R-वर्ग नेहमी शून्यावर कमी होतो
  • क) गुणांक अंदाज नेहमीच अधिक अचूक होतात
  • ड) अवलंबून व्हेरिएबलचे प्रमाण बदलते

स्पष्टीकरण: उच्च मल्टीकोलाइनरिटीमध्ये, स्वतंत्र चल एकमेकांशी जोरदारपणे सहसंबंधित असतात; गुणांक अंदाज अस्थिर होतात, मानक त्रुटी वाढतात आणि वैयक्तिक गुणांक क्षुल्लक असू शकतात, तर एकूण मॉडेल लक्षणीय असू शकते. VIF सारख्या निकषांनुसार त्याचे निदान केले जाते. कृत्रिम बुद्धिमत्ता व्हेरिएबल निर्मूलन सुचवू शकते, परंतु कोणते व्हेरिएबल सैद्धांतिक राहिले पाहिजे हे संशोधकावर अवलंबून आहे.

12. सांख्यिकीय शक्ती म्हणजे काय आणि कमी-शक्तीच्या अभ्यासाचा धोका काय आहे?

  • अ) विद्यमान प्रभाव शोधण्याची शक्यता; कमी शक्तीमुळे खरे परिणाम चुकतात आणि निष्कर्ष अविश्वसनीय बनतात ✔
  • ब) पी-मूल्य कमी करण्याची संभाव्यता; कमी शक्ती नेहमी अधिक विश्वासार्ह परिणाम देते
  • क) नमुन्याच्या आकारापेक्षा स्वतंत्र स्थिर मूल्य
  • ड) एक संकल्पना जी कृत्रिम बुद्धिमत्ता वापरली जाते तेव्हाच वैध असते

स्पष्टीकरण: पॉवर म्हणजे प्रत्यक्षात अस्तित्वात असलेला प्रभाव शोधण्याची संभाव्यता (1 वजा प्रकार II त्रुटी). कमी-शक्तीचे अभ्यास खरे परिणाम चुकवू शकतात; याव्यतिरिक्त, काही महत्त्वपूर्ण परिणामांमध्ये अतिशयोक्तीपूर्ण प्रभाव आकार ('विजेत्याचा शाप') असू शकतो आणि चुकीचा सकारात्मक दर वाढतो. म्हणून, विश्लेषणापूर्वी शक्ती/नमुना मोजणे महत्त्वाचे आहे.

13. लेखात कृत्रिम बुद्धिमत्तेचा वापर उघड करणे नैतिकदृष्ट्या का आवश्यक आहे?

  • अ) पारदर्शकता आणि जबाबदारीसाठी; ✔ वाचक आणि रेफरी प्रक्रियेचे मूल्यांकन करू शकतात आणि जबाबदारी लेखकाची राहते
  • ब) कृत्रिम बुद्धिमत्तेचा वापर केल्याने निकाल आपोआप अमान्य होतो
  • क) नियतकालिकांनी केवळ जाहिरातीच्या उद्देशाने विनंती केली आहे
  • ड) स्पष्टीकरणाचे कॉपीराइट कृत्रिम बुद्धिमत्तेकडे हस्तांतरित करणे

प्रकटीकरण: पारदर्शकता आवश्यक आहे जेणेकरुन वाचक आणि पुनरावलोकनकर्ते परिणाम कसे तयार झाले याचे मूल्यांकन करू शकतील; बऱ्याच जर्नल्स आणि संस्थांना आता एआय वापराचे प्रकटीकरण आवश्यक आहे. याव्यतिरिक्त, कृत्रिम बुद्धिमत्तेमुळे चुका/भ्रम निर्माण होऊ शकतो, ही जबाबदारी लेखकाची राहते आणि कोणत्या चरणांचे ऑडिट केले गेले हे सांगणे प्रामाणिकपणाची बाब आहे.

14. इन्स्ट्रुमेंट व्हेरिएबल (IV) पद्धतीमध्ये 'अपवर्जन प्रतिबंध' काय आवश्यक आहे?

  • अ) टूल केवळ अंतर्गत व्हेरिएबलद्वारे परिणाम प्रभावित करते, दुसरा कोणताही थेट मार्ग नाही ✔
  • ब) इन्स्ट्रुमेंटचा परिणाम व्हेरिएबलशी कोणताही संबंध नाही.
  • क) इन्स्ट्रुमेंट अंतर्जात व्हेरिएबलशी संबंधित नाही.
  • D) म्हणजे नेहमी बायनरी (0/1) चल असतो

स्पष्टीकरण: अपवर्जन निर्बंधासाठी आवश्यक आहे की इन्स्ट्रुमेंट केवळ अंतर्जात स्पष्टीकरणात्मक व्हेरिएबलद्वारे परिणाम व्हेरिएबलवर परिणाम करते आणि इतर कोणत्याही थेट माध्यमाद्वारे किंवा निरीक्षण न केलेल्या घटकांद्वारे नाही. हे गृहितक डेटावरून पूर्णपणे तपासले जाऊ शकत नाही; सैद्धांतिक आणि संस्थात्मक आधारावर त्याचा बचाव केला जातो. AI IV कोड लिहू शकते, परंतु साधनाच्या वैधतेचे रक्षण करणे हे संशोधकाचे काम आहे.

15. पूर्व-नोंदणीशिवाय लवचिक विश्लेषणामध्ये 'गार्डन ऑफ फोर्किंग पाथ' समस्येचा अर्थ काय आहे?

  • अ) डेटावर आधारित अनेक वाजवी विश्लेषण निवडी चुकीच्या सकारात्मक दरात वाढ करतात, अगदी अनावधानाने ✔
  • ब) विश्लेषण पद्धती एकल आणि अनिवार्य असणे आवश्यक आहे
  • क) एक समस्या जी केवळ तेव्हाच उद्भवते जेव्हा हेतुपुरस्सर फसवणूक होते.
  • ड) नमुना वाढत असताना उत्स्फूर्तपणे अदृश्य होणारी परिस्थिती

स्पष्टीकरण: डेटा पाहिल्यानंतर, कोणते व्हेरिएबल, सबग्रुप, ट्रान्सफॉर्मेशन किंवा थ्रेशोल्ड वापरायचे याबद्दल संशोधक अनेक वाजवी निवड करू शकतो. जरी कोणतेही एकल 'इंटेनशनल पी-हॅकिंग' नसले तरीही, ही लवचिकता खोट्या सकारात्मक दरात वाढ करते कारण लक्षणीय एक प्रभावीपणे मोठ्या संख्येने विश्लेषणातून निवडला जातो. पूर्व-नोंदणी आणि निश्चित विश्लेषण योजना ही लवचिकता मर्यादित करते.