लाभ:
- अनुभवजन्य वर्कफ़्लो (डेटा सफाई, कोड, विज़ुअलाइज़ेशन, ड्राफ्ट व्याख्या) में अंतर करने में सक्षम होने के कारण कृत्रिम बुद्धिमत्ता वास्तविक समय बचाती है और जहां कार्य जोखिम स्तर के अनुसार मॉडल चयन, कार्य-कारण दावा और प्रकाशन निर्णय जैसे निर्णय विशेषज्ञ पर छोड़ दिए जाते हैं।
- एक अनुशासन लागू करने की क्षमता जो प्रत्येक कृत्रिम बुद्धिमत्ता आउटपुट (संख्या, गुणांक, कोड, टिप्पणी) को पुनर्गणना, स्रोत से जोड़ने और सांख्यिकीय फ़िल्टरिंग के चरणों के माध्यम से सत्यापित करती है।
- केवीकेके/जीडीपीआर और डेटा उपयोग समझौतों के दायरे में सूक्ष्म डेटा और गोपनीय/लाइसेंस प्राप्त डेटा सेट को सुरक्षित रूप से संसाधित करने और उचित उपकरण चुनने की आदत हासिल करने की क्षमता।
एक अर्थशास्त्री या व्यावहारिक सांख्यिकीविद् के डेस्क पर हर दिन वही प्रश्न दोहराए जाते हैं: क्या यह डेटा सेट विश्वसनीय है; इन लुप्त मूल्यों का क्या करें? इस प्रतिगमन का गुणांक वास्तव में क्या कहता है? क्या यह रिश्ता कारणात्मक है या महज सहसंबद्ध? चूँकि यह पी-वैल्यू महत्वपूर्ण है, क्या मैं इसे लेख या नीति संक्षेप में लिख सकता हूँ? इनमें से कुछ प्रश्न दोहराव वाले, कोड-गहन और समय लेने वाले हैं: डेटा को साफ करना, एक ही ग्राफ को दस बार प्लॉट करना, आर या पायथन कोड को डीबग करना, परिणामों को एक तालिका में स्ट्रिंग करना। अन्य लोग सीधे तौर पर किसी निष्कर्ष की वैधता, किसी प्रकाशन की ईमानदारी या किसी नीतिगत निर्णय की सटीकता का निर्धारण करते हैं।
आर्टिफिशियल इंटेलिजेंस (संक्षेप में एआई, एआई - कंप्यूटर सिस्टम जो इंसानों की तरह टेक्स्ट और कोड तैयार कर सकते हैं, पैटर्न पहचान सकते हैं, डेटा को सारांशित कर सकते हैं और टिप्पणियाँ लिख सकते हैं; आज सबसे अधिक इस्तेमाल किया जाने वाला रूप बड़े भाषा मॉडल हैं, यानी, सिस्टम जो विशाल टेक्स्ट पर प्रशिक्षित होते हैं और अगले शब्द की भविष्यवाणी करके वाक्य बनाते हैं) इस तालिका के ठीक बीच में बैठता है। जब सही ढंग से उपयोग किया जाता है, तो यह डेटा सफाई कोड के घंटों को मिनटों में कम कर देता है, आपको एक जटिल सांख्यिकीय परीक्षण के वाक्यविन्यास की याद दिलाता है, या एक गुणांक की व्याख्या का मसौदा तैयार करता है। जब गलत तरीके से उपयोग किया जाता है, तो यह एक निश्चित रूप से निश्चित लेकिन पूरी तरह से मनगढ़ंत संख्या, एक गलत महत्व, या एक गैर-कारण संबंध को "खोज" के रूप में प्रस्तुत करता है।
यह पहली इकाई कोई सॉफ़्टवेयर परिचय नहीं है. इसका उद्देश्य यह स्पष्ट करना है कि एआई को अपने अनुभवजन्य वर्कफ़्लो में कहाँ रखना है और कहाँ नहीं रखना है। अर्थमिति एक "विधि-महत्वपूर्ण" और अप्रत्यक्ष रूप से "निर्णय-महत्वपूर्ण" क्षेत्र दोनों है: आपके द्वारा बनाए गए मॉडल का गुणांक केंद्रीय बैंक के ब्याज दर निर्णय, एक नियामक की नीति में बदलाव, या एक फर्म के मिलियन-डॉलर के निवेश के लिए इनपुट हो सकता है। आइए शुरू से ही बुनियादी सिद्धांत बताएं: कृत्रिम बुद्धिमत्ता एक विश्लेषण सहायक है, शोधकर्ता नहीं। मॉडल चयन, पहचान रणनीति, कार्य-कारण का दावा, प्रकाशन और नीतिगत निर्णयों की जिम्मेदारी और अंतिम अनुमोदन सक्षम विशेषज्ञ के पास है।
अनुभवजन्य कार्यप्रवाह की परतें और एआई का स्थान
अनुभवजन्य अध्ययन को तीन परतों में विभाजित करना उपयोगी है। निष्पादन परत दैनिक तकनीकी कार्य है: डेटा सफाई कोड, ग्राफ़ ड्राइंग, टेबल फ़ॉर्मेटिंग, सिंटैक्स डिबगिंग। विधि परत विश्लेषणात्मक निर्णय है: कौन सा मॉडल, कौन सी पहचान रणनीति, कौन सा परीक्षण, कौन सी धारणा जाँच। व्याख्या और निर्णय परत निष्कर्षों का अर्थ है: गुणांक क्या कहता है, क्या यह कारण है, नीति के लिए इसका क्या अर्थ है, क्या इसे प्रकाशित किया जाना चाहिए। एआई तीनों परतों को छूता है, लेकिन प्रत्येक में अलग-अलग अधिकार के साथ। निष्पादन स्तर पर, AI जल्दी से कोड ड्राफ्ट और उत्पन्न करता है; व्याख्या और निर्णय स्तर पर, केवल इनपुट दिया जाता है और विशेषज्ञ निर्णय लेता है।
आइए शुरुआत से कुछ बुनियादी शब्दों को परिभाषित करें। अर्थमिति वह शाखा है जो सांख्यिकीय तरीकों से आर्थिक और सामाजिक डेटा का विश्लेषण करती है और संबंधों को मापती है। प्रतिगमन एक ऐसी विधि है जो एक परिणाम चर (आश्रित चर) के संबंध को एक या अधिक व्याख्यात्मक चर (स्वतंत्र चर) के साथ संख्यात्मक रूप से मॉडल करती है। गुणांक वह संख्या है जो दर्शाती है कि एक व्याख्यात्मक चर में एक-इकाई परिवर्तन औसतन परिवर्तन की कितनी इकाइयों के साथ परिणाम चर में जुड़ा हुआ है। पी-वैल्यू वह संभावना है कि देखा गया परिणाम (या अधिक चरम परिणाम) संयोग से घटित होगा जब कोई प्रभाव वास्तव में मौजूद नहीं होगा। हम निम्नलिखित इकाइयों में इन अवधारणाओं को एक-एक करके समझाएंगे; अभी के लिए, यह जान लें: इन सभी में, AI आपको ब्लूप्रिंट, कोड और स्पष्टीकरण देता है, लेकिन यह वैज्ञानिक निर्णय नहीं लेता है।
निम्नलिखित तालिका मिशन द्वारा एआई की भूमिका और जोखिम स्तर का सारांश प्रस्तुत करती है:
खोज
एआई की भूमिका
जोखिम स्तर
कौन मंजूर करता है
डेटा सेनिटाइजेशन कोड लिखना
कोड जनरेटर
कम
विश्लेषक स्वयं (कोड परीक्षण के साथ)
चार्ट/टेबल ड्राफ्ट
स्केच जनरेटर
कम
विश्लेषक
परीक्षण/मॉडल सिंटैक्स अनुस्मारक
संदर्भ सहायक
निम्न-मध्यम
विश्लेषक
ड्राफ्ट गुणांक व्याख्या
मसौदा लेखक
मध्यम
अर्थमितिज्ञ
मॉडल/पहचान रणनीति चयन
सहायक इनपुट
उच्च
विशेषज्ञ शोधकर्ता
कारण का दावा
बस एक मसौदा, अंतिम शब्द कभी नहीं
बहुत ऊँचा
विशेषज्ञ + सहकर्मी समीक्षा
प्रकाशन/नीति निर्णय
केवल इनपुट
बहुत ऊँचा
जिम्मेदार अन्वेषक/संस्था
इस तालिका की एक पंक्ति को ध्यान में रखें: जैसे-जैसे जोखिम बढ़ता है, एआई की भूमिका घटती है और विशेषज्ञ की स्वीकृति बढ़ती है।
क्यों "सत्यापन" इस व्यवसाय का हृदय है?
भाषा मॉडल अपने उत्तर को लेकर आश्वस्त दिखते हैं, लेकिन हो सकता है कि वे आश्वस्त न हों। तकनीकी भाषा में, इसे मतिभ्रम कहा जाता है: यह एक धाराप्रवाह वाक्य में गैर-मौजूद जानकारी का मॉडल द्वारा निर्माण है, जैसे कि यह सच हो। एक अर्थशास्त्री के लिए यह एक घातक जाल है। मॉडल आपको एक सटीक संख्या दे सकता है जैसे "2015-2020 के बीच तुर्किये में बेरोजगारी और मुद्रास्फीति के बीच संबंध 0.62 है"; हालाँकि, उसने आपका डेटा कभी नहीं देखा है और यह संख्या पूरी तरह से बनी हुई है। या यह कह सकता है, "श्वेत परीक्षण पी-मान 0.03 था"; जबकि इसने कोई परीक्षण नहीं चलाया। यह एक आर फ़ंक्शन को ऐसे तर्क के साथ कॉल कर सकता है जो वास्तव में मौजूद नहीं है। वह तीनों को समान प्रवाह के साथ गाते हैं; एकमात्र चीज जो सही को गलत से अलग करती है वह है आपका ज्ञान और आपकी जांच करने की आदत।
सत्यापन अनुशासन में तीन चरण होते हैं:
- अपने स्वयं के वातावरण में पुनर्गणना/चलाएँ: आर/पायथन में एआई द्वारा दिए गए प्रत्येक संख्या, अनुपात, परीक्षण परिणाम और गुणांक की गणना एआई की मेमोरी से नहीं, बल्कि अपने स्वयं के डेटा से करें। कोड लिखने के लिए AI का उपयोग करें, परिणाम याद रखने के लिए नहीं। कोड चलाएँ, आप आउटपुट उत्पन्न करेंगे।
- स्रोत से लिंक: विधि नियमों, सूत्रों और परिभाषाओं के लिए पाठ्यपुस्तकों, विधियों के लेखों और आधिकारिक दस्तावेजों पर भरोसा करें। किसी विश्वसनीय स्रोत से एआई के कथन "इस परीक्षण की धारणा है" की पुष्टि करें।
- सांख्यिकीय फ़िल्टर: विशेषज्ञ आंखों से परीक्षण करें कि क्या आउटपुट सांख्यिकीय तर्क (धारणाओं, नमूना, प्रभाव आकार, अनिश्चितता) का खंडन करता है। "सार्थक लेकिन बेतुके" परिणाम को अस्वीकार करें।
सावधानी: किसी लेख, थीसिस या नीति नोट को मान्य किए बिना एआई-जनरेटेड गुणांक, परीक्षण या व्याख्या डालना एक बिना समीक्षा किए गए निष्कर्ष को प्रकाशित करने जैसा है। सिर्फ इसलिए कि आउटपुट धाराप्रवाह है, सच नहीं है; सिर्फ इसलिए कि संख्या निश्चित लगती है, यह वास्तविक नहीं है।
गोपनीयता: सूक्ष्म डेटा और लाइसेंस प्राप्त डेटा निजी तौर पर सुरक्षित हैं
माइक्रोडेटा (व्यक्तिगत, घरेलू, फर्म या रोगी स्तर पर एकल रिकॉर्ड) अक्सर अर्थमिति में उपयोग किया जाता है। इस डेटा का अधिकांश भाग व्यक्तिगत डेटा है और यूरोप में तुर्किये और जीडीपीआर में केवीकेके (व्यक्तिगत डेटा संरक्षण कानून) के तहत संरक्षित है। इसके अतिरिक्त, तुर्कस्टैट, केंद्रीय बैंक, पैनल डेटा प्रदाता और वाणिज्यिक स्रोत अक्सर डेटा उपयोग समझौते के साथ डेटा प्रदान करते हैं; ये समझौते तीसरे पक्ष को डेटा स्थानांतरित करने पर रोक लगाते हैं। सार्वजनिक एआई चैट टूल में पहचान की जानकारी, आय, स्वास्थ्य या कंपनी के रहस्यों वाली तालिका चिपकाना केवीकेके/जीडीपीआर उल्लंघन और अनुबंध उल्लंघन दोनों है; क्योंकि डेटा बाहरी सर्वर पर जाता है और कुछ टूल में मॉडल प्रशिक्षण में उपयोग किया जा सकता है।
नियम सरल है: डेटा को अपने सुरक्षित वातावरण में रखें, एआई से केवल कोड और तरीकों के लिए पूछें। आदर्श वर्कफ़्लो यह है: एआई से विश्लेषण कोड के लिए पूछें, आप अपने कंप्यूटर/एंटरप्राइज़ सर्वर पर वास्तविक डेटा के साथ कोड चलाते हैं। यदि आपको वास्तव में डेटा साझा करना है, तो अज्ञात करें (आईडी फ़ील्ड हटाएं), समग्र करें (व्यक्तिगत के बजाय औसत/गिनती करें), और ऐसे उपकरण चुनें जो संस्थागत हों, डेटा प्रोसेसिंग समझौता हो, और शिक्षा में अपने डेटा का उपयोग न करें।
तीन मिनी मामले
केस 1 - सुरक्षित और कुशल उपयोग। एक शोधकर्ता ने पहली बार घरेलू बजट डेटा की 40,000 पंक्तियों को मैन्युअल रूप से साफ करने में 6 घंटे बिताए। बिल्कुल भी डेटा साझा किए बिना, उन्होंने एआई को केवल चर नाम और संरचना का वर्णन किया और एक सफाई कोड मांगा। AI ने एक R स्क्रिप्ट तैयार की; शोधकर्ता ने अपने वातावरण में कोड चलाया, प्रत्येक चरण की पंक्तियों की संख्या और सारांश आँकड़ों की जाँच की, और दो तर्क त्रुटियों को ठीक किया। अवधि: 6 घंटे के बजाय 70 मिनट. डेटा कभी बाहर नहीं गया; जिम्मेदारी शोधकर्ता की रही।
केस 2 - असत्यापित नंबर ट्रैप। एक स्नातक छात्र ने एआई से पूछा, "जीडीपी वृद्धि और प्रत्यक्ष विदेशी निवेश के बीच क्या लचीलापन है।" एआई ने आत्मविश्वास से "लगभग 0.34" नंबर दिया, भले ही उसके पास किसी भी डेटा तक पहुंच नहीं थी। छात्र ने साहित्य सारांश में यह लिखा; जब उनके सलाहकार ने स्रोत के बारे में पूछा तो पता चला कि इस संख्या का कोई आधार नहीं है और यह पूरी तरह से मनगढ़ंत है। गलती: एआई को डेटा और संसाधन दिए बिना उससे ठोस आंकड़ों की उम्मीद करना।
केस 3 - गोपनीयता और अनुबंध का उल्लंघन। एक विश्लेषक ने एक्सेल को सार्वजनिक रूप से उपलब्ध एआई टूल पर अपलोड किया, जो उसे एक लाइसेंस प्राप्त कंपनी पैनल से प्राप्त हुआ था, जिसमें कंपनी का नाम और टर्नओवर शामिल था और कहा गया था, "पैनल रिग्रेशन करें।" डेटा प्रदाता के अनुबंध ने तीसरे पक्ष के सिस्टम में डेटा के हस्तांतरण पर रोक लगा दी है; इस घटना ने अनुपालन समीक्षा को प्रेरित किया। सही तरीका यह था कि कंपनी के नामों को गुमनाम कोड से बदल दिया जाए या कोई डेटा साझा न किया जाए और केवल पैनल रिग्रेशन कोड का अनुरोध किया जाए और इसे अपने वातावरण में चलाया जाए।
कमजोर संकेत/मजबूत संकेत
कमजोर संकेत:
मुद्रास्फीति और बेरोजगारी के बीच संबंध का विश्लेषण करें और गुणांक बताएं।
यह दावा गलत है: एआई को कोई डेटा नहीं दिया गया, यह स्पष्ट नहीं है कि कौन सा देश, कौन सा काल, कौन सा मॉडल। एआई केवल बने-बनाए गुणांक के साथ ही उत्तर दे सकता है।
शक्तिशाली संकेत:
आपकी भूमिका: आप अर्थमिति शोधकर्ता की सहायता करने वाले एक विश्लेषण सहायक हैं। मैं आपके साथ डेटा साझा नहीं करता; मुझे बस रननेबल आर कोड चाहिए। मेरे पास वार्षिक पैनल है: चर देश, वर्ष, बेरोजगारी, मुद्रास्फीति (सभी संख्यात्मक)। कार्य: 1) बेरोजगारी ~ मुद्रास्फीति (पीएलएम पैकेज) के लिए एक निश्चित प्रभाव पैनल प्रतिगमन कोड लिखें, 2) एक टिप्पणी पंक्ति के साथ कोड में प्रत्येक चरण की व्याख्या करें, 3) ध्यान दें कि गुणांक की व्याख्या संबंधपरक के रूप में की जानी चाहिए, न कि CAUSAL के रूप में, 4) फ़ंक्शन तर्क बनाएं जिसके बारे में आप निश्चित नहीं हैं; मैं अपने परिवेश में परिणाम चलाऊंगा और सत्यापित करूंगा।
इस अनुरोध में, कोई डेटा साझा नहीं किया गया है, भूमिका, पैकेज, टिप्पणियों की अपेक्षा और "निर्माण" का निषेध स्पष्ट है। आप अभी भी आउटपुट को स्वयं चलाते हैं और सत्यापित करते हैं।
निम्नलिखित तालिका इस पाठ में एक-वाक्य नियमों का सारांश प्रस्तुत करती है:
सिद्धांत
इसका क्या मतलब है
एआई एक सहायक है
वैज्ञानिक निर्णय और जिम्मेदारी विशेषज्ञ की होती है
कोड का अनुरोध करें, परिणाम प्रस्तुत करें
एआई को संख्या याद नहीं रहती; आप इसे चलाएं और गणना करें
डेटा रखें
माइक्रो/लाइसेंस प्राप्त डेटा सुरक्षित वातावरण नहीं छोड़ता है
सत्यापित करें
प्रत्येक मुद्दे, कोड, टिप्पणी की जाँच की जाती है; निर्माण अस्वीकार किया जाता है
सामान्य गलतियाँ
- बिना डेटा दिए एआई से ठोस आंकड़ों की उम्मीद है। मॉडल डेटा तक नहीं पहुंच सकता; यह जो गुणांक, सहसंबंध और पी-वैल्यू देता है वह नकली है। हमेशा कोड का अनुरोध करें और परिणाम स्वयं तैयार करें।
- मतिभ्रम कार्यों पर भरोसा करना। एआई एक आर/पायथन फ़ंक्शन या तर्क का सुझाव दे सकता है जो मौजूद नहीं है। कोड को चलाए और सत्यापित किए बिना उसे स्वीकार न करें.
- माइक्रोडेटा को सार्वजनिक टूल पर अपलोड करना। यह KVKK/GDPR और डेटा उपयोग समझौते का उल्लंघन है। डेटा को अज्ञात रखें या उसे बिल्कुल भी साझा न करें।
- प्रवाह को सटीकता समझने की भूल करना। एक अच्छी तरह से लिखी गई समीक्षा गलत हो सकती है। वाक्य का सौंदर्य प्रमाण नहीं है.
- कारणात्मक भाषा को बिना नियंत्रण के स्वीकार करना। YZ अक्सर कहता है "X, Y को बढ़ाता है"; जबकि अधिकांश प्रतिगमन केवल संबंध दिखाते हैं। डिज़ाइन के साथ कारण संबंधी दावे का बचाव करें।
युक्ति: एआई के साथ काम करते समय, अपने आप से यह प्रश्न पूछें: "यदि कोई रेफरी या ऑडिटर इस आउटपुट के लिए पूछता है, तो क्या मैं स्रोत और खाता दिखा सकता हूं?" यदि उत्तर नहीं है, तो आउटपुट अभी उपयोग के लिए तैयार नहीं है।
सारांश
एआई अर्थमिति और सांख्यिकी वर्कफ़्लो की निष्पादन परत (कोड, क्लीनअप, ग्राफ़, ड्राफ्ट) में वास्तविक और बड़े पैमाने पर त्वरण प्रदान करता है; हालाँकि, मॉडल चयन, कार्य-कारण, व्याख्या, प्रकाशन और नीतिगत निर्णय विशेषज्ञ के होते हैं। तीन बुनियादी अनुशासन: एआई को संख्या की याद न दिलाएं, कोड मांगें और परिणाम स्वयं बनाएं और सत्यापित करें; सुरक्षित वातावरण से सूक्ष्म/लाइसेंसीकृत डेटा न हटाएं; प्रत्येक आउटपुट को सांख्यिकीय फ़िल्टर करें। एक असत्यापित एआई आउटपुट एक बिना समीक्षा की गई खोज के समान ही जोखिम भरा है।
आवेदन कार्य
अपने स्वयं के (या एक उदाहरण) डेटा सेट पर विचार करें। एआई से आर या पायथन कोड के लिए पूछें जो डेटा साझा किए बिना, केवल चर संरचना का वर्णन करके वर्णनात्मक आंकड़े और एक सरल ग्राफ तैयार करता है। आने वाले कोड को अपने परिवेश में चलाएँ। फिर एक चेकलिस्ट रखें: (1) क्या कोड त्रुटियों के बिना चला, (2) आपकी अपेक्षा के अनुरूप लाइनों/टिप्पणियों की संख्या है, (3) एआई के कौन से टिप्पणी वाक्य कारणात्मक भाषा का उपयोग करते हैं और इसे ठीक किया जाना चाहिए। एक पैराग्राफ में, उस समय के बारे में लिखें जब एआई ने आपको बचाया और कम से कम एक बग पकड़ा।
जांच सूची
- [ ] मैंने एआई से ठोस आँकड़े नहीं माँगे; मैंने कोड का अनुरोध किया और परिणाम स्वयं तैयार किया।
- [ ] मैंने अपने वातावरण में दिए गए प्रत्येक नंबर और परीक्षण परिणाम की पुनर्गणना की।
- [ ] मैंने सत्यापित किया कि जिन कार्यों/तर्कों का यह उपयोग करता है वे वास्तव में मौजूद हैं।
- [ ] मैंने सार्वजनिक टूल पर माइक्रो/व्यक्तिगत/लाइसेंस प्राप्त डेटा अपलोड नहीं किया।
- [ ] मैंने कार्य-कारण संबंधी भाषा वाली टिप्पणियों को चिह्नित किया और उन्हें संबंधपरक भाषा की ओर ले गया।
- [ ] मैं ऑडिटर को आउटपुट का स्रोत और लेखांकन दिखाने में सक्षम हूं।