इकाइयाँ
1. अर्थशास्त्र में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, मान्यता और डेटा नैतिकता 2. आर्थिक डेटा संग्रह और स्रोत सत्यापन: तुर्कस्टैट, ईवीडीएस, आईएमएफ, विश्व बैंक, एफआरईडी 3. डेटा सफ़ाई, परिवर्तन और खोजपूर्ण विश्लेषण (पायथन/पांडा समर्थन के साथ) 4. समय श्रृंखला विश्लेषण और पूर्वानुमान समर्थन 5. व्यापक आर्थिक संकेतकों की व्याख्या: मुद्रास्फीति, विकास, बेरोजगारी, चालू खाता शेष 6. परिदृश्य मॉडलिंग और संवेदनशीलता विश्लेषण 7. अर्थमितीय मॉडल समर्थन: प्रतिगमन, कारण और व्याख्या 8. साहित्य समीक्षा और आर्थिक अनुसंधान संश्लेषण 9. नीति नोट, रिपोर्ट और ब्रीफिंग लेखन 10. आर्थिक डेटा विज़ुअलाइज़ेशन और डैशबोर्ड 11. सीमाएँ, मॉडल जोखिम, नैतिकता, गोपनीयता और शासन
इकाई 3 / 11

डेटा सफ़ाई, परिवर्तन और खोजपूर्ण विश्लेषण (पायथन/पांडा समर्थन के साथ)

लाभ:

  • कच्चे आर्थिक डेटा (लापता अवलोकन, इकाई भ्रम, आवृत्ति बेमेल) को साफ करने और कृत्रिम बुद्धिमत्ता की मदद से विश्लेषण के लिए तैयार करने की क्षमता
  • वास्तविक-नाममात्र रूपांतरण, अनुक्रमण, विकास दर, मौसमी समायोजन जैसे मानक आर्थिक परिवर्तनों को कृत्रिम बुद्धिमत्ता में कोड के रूप में मुद्रित करने और उन्हें मैन्युअल रूप से सत्यापित करने की क्षमता
  • खोजपूर्ण डेटा विश्लेषण (सारांश सांख्यिकी, वितरण, आउटलेर, सहसंबंध) के माध्यम से डेटा को पहचानने और कृत्रिम बुद्धिमत्ता सारांश को गंभीर रूप से पढ़ने की क्षमता

आर्थिक आंकड़े शायद ही कभी विश्लेषण के लिए तैयार होते हैं। आपके द्वारा तुर्कस्टैट से डाउनलोड की गई तालिका में, कुछ महीने गायब हैं, एक कॉलम हजार कोष्ठक के साथ पाठ के रूप में आता है, विनिमय दर तुर्की प्रारूप में है जैसे "1.234,56", एक श्रृंखला मासिक है और दूसरी त्रैमासिक है। अर्थशास्त्री का अधिकांश समय विश्लेषण में नहीं, बल्कि डेटा को विश्लेषण के लिए तैयार करने में व्यतीत होता है। यह वह जगह है जहां एआई एक वास्तविक, कम जोखिम वाला त्वरक है: यह सफाई कदम सुझाता है, पांडा (पायथन की डेटा प्रोसेसिंग लाइब्रेरी) लिखता है, मानक आर्थिक परिवर्तनों को संहिताबद्ध करता है। लेकिन इस इकाई में एक अपरिवर्तनीय नियम भी है: आप कृत्रिम बुद्धिमत्ता द्वारा लिखे गए प्रत्येक परिवर्तन को पढ़ते हैं और कम से कम एक अवलोकन में इसे मैन्युअल रूप से सत्यापित करते हैं। यदि वास्तविक-नाममात्र चक्र गलत स्तर पर है, तो संपूर्ण विश्लेषण चुपचाप नष्ट हो जाता है।

सफ़ाई: क्या समस्याएँ, उन्हें कैसे हल करें?

आर्थिक आंकड़ों और उनके तर्क में सबसे आम समस्याएं:

  • अधूरा अवलोकन. एक महीना/तिमाही खाली है. समाधान संदर्भ पर निर्भर करता है: यदि यह वास्तव में अस्तित्व में नहीं है, तो इसे खाली छोड़ दिया जाता है; यदि कोई तकनीकी खामी है, तो सावधानीपूर्वक प्रक्षेप किया जाता है - लेकिन निर्माण के बीच की रेखा पतली होती है।
  • इकाइयों और प्रारूपों का भ्रम. पाठ "12.345.6" को एक संख्या में परिवर्तित किया जाना चाहिए; मिलियन/बिलियन सुसंगत होना चाहिए।
  • आवृत्ति बेमेल. मासिक और त्रैमासिक श्रृंखला को संयोजित करने के लिए, एक को एकत्रित किया जाता है (मासिक से त्रैमासिक) - चाहे वह औसत हो, कुल हो या अवधि का अंत संकेतक की प्रकृति (स्टॉक/प्रवाह भेद) पर निर्भर करता है।
  • बाहरी (चरम) मान. यदि कोई अवलोकन बेतहाशा भटक जाता है: क्या यह एक वास्तविक घटना (संकट, मूल्य वृद्धि), या डेटा त्रुटि है? इसे हटाने से पहले ही समझ लिया जाता है.
  • दिनांक संरेखण. विभिन्न श्रृंखलाओं के दिनांक प्रारूप और अवधि परिभाषाएँ सिंक्रनाइज़ हैं।
ध्यान दें: छूटे हुए डेटा को भरना मासूम लगता है, लेकिन यह एक आर्थिक निर्णय है। किसी संकट माह को "पड़ोसी महीनों के औसत" से भरने का अर्थ है विश्लेषण से उस संकट को हटाना। भरने से पहले, पूछें "यह अंतर क्यों मौजूद है?" सवाल का जवाब दें।

मानक आर्थिक परिवर्तन

एक अर्थशास्त्री के दैनिक प्रदर्शनों में परिवर्तन और उनकी परिभाषाएँ:

  • नाममात्र → वास्तविक। मूल्य प्रभाव के लिए समायोजन: वास्तविक मूल्य = नाममात्र मूल्य / मूल्य सूचकांक × 100। डिफ्लेटर का आधार वर्ष (सूचकांक का समायोजन) परिणाम का आधार निर्धारित करता है।
  • अनुक्रमणिका। किसी शृंखला को पुनः स्केल करना ताकि चयनित अवधि = 100; यह विभिन्न आकारों की श्रृंखला की तुलना करने के लिए उपयोगी है।
  • विकास दर. वार्षिक: (इस अवधि की समान अवधि / पिछले वर्ष - 1) × 100। आवधिक और वार्षिक दर अलग-अलग चीजें हैं; भ्रमित करना एक सामान्य गलती है.
  • मौसमी सुधार. नियमित मौसमी प्रभावों (ग्रीष्मकालीन पर्यटन, छुट्टियां) को शुद्ध करना; कच्ची श्रृंखला और मौसमी रूप से समायोजित श्रृंखला अलग-अलग कहानियाँ बताती हैं।
  • औसत चलन। शोर को शांत करना और रुझान को दृश्यमान बनाना।
  • लघुगणक और अंतर. विकास की गतिशीलता और स्थिरता की जांच करने के लिए (समय श्रृंखला इकाई में गहराई से जाना जाएगा)।
टिप: प्रत्येक रूपांतरण के साथ आपसे पूछा जाएगा "इकाई और आधार का क्या हुआ?" पूछना। वास्तविक श्रृंखला का आधार डिफ्लेटर का आधार है; अनुक्रमित श्रृंखला का आधार आपके द्वारा चुनी गई अवधि है। इसे लिखकर रखने से भविष्य में गलतियां नहीं होतीं।

खोजपूर्ण डेटा विश्लेषण (EDA)

डेटा को मॉडल में दर्ज करने से पहले उसे पहचानना आवश्यक है। खोजपूर्ण डेटा विश्लेषण (ईडीए) में शामिल हैं: सारांश आँकड़े (माध्य, माध्य, मानक विचलन, न्यूनतम-अधिकतम), वितरण का आकार, समय के साथ पाठ्यक्रम, आउटलेर और श्रृंखला के बीच सहसंबंध। एआई इन चरणों के लिए तुरंत कोड तैयार करता है; आपका काम आउटपुट को आर्थिक दृष्टि से पढ़ना है: "क्या यह औसत उचित है? क्या यह सहसंबंध एक संयोग है या एक ज्ञात संबंध है?"

सावधानी: यहाँ सहसंबंध केवल पहचान का एक साधन है, कार्य-कारण का प्रमाण नहीं। तथ्य यह है कि दो शृंखलाएं एक साथ चलती हैं (उदाहरण के लिए, आइसक्रीम की बिक्री और डूबना - दोनों गर्मी से शुरू होते हैं) जरूरी नहीं कि यह इंगित करता हो कि एक दूसरे की ओर ले जाता है। इकाई 7 में हम इस अंतर को और गहरा करेंगे।

तीन मिनी मामले

केस 1 - गलत डिफ्लेटर बेस। एक विश्लेषक के पास वेतन श्रृंखला का एहसास करने के लिए कृत्रिम बुद्धि लेखन कोड था। कोड ने काम किया, परिणाम उचित लग रहा था - लेकिन विश्लेषक ने मैन्युअल रूप से CALCULATE चरण में 2020 की गणना की और यह काम नहीं किया। समस्या: कृत्रिम बुद्धिमत्ता ने 2003=100 के आधार के साथ डिफ्लेटर का उपयोग किया और 2015 की कीमतों के साथ वेतन श्रृंखला का अनुरोध किया; आधार परस्पर विरोधी थे. कोड को एक लाइन फिक्स के साथ दुरुस्त किया गया, पूरी श्रृंखला ठीक हो गई।

केस 2 - साइलेंट वॉल्यूम त्रुटि। एक संस्था ने निर्यात डेटा को हज़ार डॉलर और आयात को मिलियन डॉलर में घटा दिया था. जब कृत्रिम बुद्धिमत्ता ने "विदेशी व्यापार संतुलन" के लिए दोनों को हटा दिया, तो परिणाम एक बेतुका घाटा था। ईडीए में न्यूनतम-अधिकतम दृश्य से त्रुटि का पता चला: दो श्रृंखलाओं के परिमाण का क्रम 1000 के कारक से भिन्न था। एक बार इकाई बराबर होने के बाद संतुलन सही था।

केस 3 - बाहरी हिस्से को नहीं हटाना। एक शृंखला में एक महीना असाधारण रूप से कम था। एआई ने सुझाव दिया "बाहरी बात, चलो इसे साफ़ करें"। विश्लेषक ने जांच की: वास्तव में उस महीने एक प्राकृतिक आपदा के कारण उत्पादन बंद हो गया था। मूल्य वास्तविक था; इसे हटाने से इतिहास विकृत हो जाएगा। हटाने के बजाय इसे फ़ुटनोट कर दिया गया. एआई की "स्पष्ट" सिफ़ारिश का आंख मूंदकर पालन नहीं किया गया।

रूपांतरण सत्यापन तालिका

रूपांतरण

सूत्र सार

मैनुअल चेकपॉइंट

अहसास

नाममात्र/मूल्य सूचकांक × 100

डिफ्लेटर आधार = परिणाम आधार?

वार्षिक वृद्धि

(टी/टी-12माह − 1)×100

कागज पर एक अवधि की गणना करें

अनुक्रमण

श्रृंखला/आधार अवधि × 100

क्या आधार अवधि का मान 100 है?

मासिक→त्रैमासिक

प्रवाह: संग्रह/स्टॉक: अवधि का अंत

सही संग्रहण विधि?

चलती औसत

अंतिम n अवधि औसत

क्या खिड़की की लंबाई सही है?

चार प्रतिलिपि योग्य टेम्पलेट

1) सफाई योजना:

मेरे पास यह कच्चा डेटा है: [कॉलम और नमूना पंक्तियाँ]। विश्लेषण की तैयारी के लिए एक सफाई योजना बनाएं: गुम मूल्य, इकाई/प्रारूप मुद्दा, दिनांक संरेखण, आवृत्ति संरेखण, संभावित आउटलेयर। एक वाक्य में बताएं कि प्रत्येक चरण क्यों आवश्यक है। अभी तक कोड न लिखें; पहले मुझे योजना की पुष्टि करने दीजिए।

2) पांडा क्लीनअप कोड:

मेरे द्वारा अनुमोदित योजना के अनुसार पांडा कोड लिखें। कोड को एक टिप्पणी पंक्ति के साथ यह इंगित करने दें कि वह प्रत्येक चरण में क्या करता है; यह रूपांतरण के बाद पंक्तियों की संख्या और लुप्त मानों को प्रिंट करता है। किसी भी अवलोकन को चुपचाप न मिटाएं; आपके द्वारा हटाई गई प्रत्येक पंक्ति की रिपोर्ट करें।

3) बोध (सत्यापन योग्य):

[मूल्य सूचकांक] के साथ इस नाममात्र श्रृंखला का एहसास करें। जब आप डिफ्लेटर का उपयोग करें तो उसका आधार वर्ष स्पष्ट रूप से लिखें; निर्दिष्ट करें कि परिणामी श्रृंखला का आधार क्या है। मुझे एक अवधि के लिए चरण दर चरण खाता दिखाएं ताकि मैं इसे मैन्युअल रूप से सत्यापित कर सकूं।

4) खोजपूर्ण विश्लेषण सारांश:

निम्नलिखित साफ़ किए गए डेटा के लिए खोजपूर्ण विश्लेषण कोड लिखें: सारांश आँकड़े, समय श्रृंखला प्लॉट, बाहरी स्कैन और सहसंबंध मैट्रिक्स। परिणामों की व्याख्या करते समय, यह स्पष्ट कर दें कि जो सहसंबंध आपको मिल रहे हैं वे CAUSAL नहीं हैं और 3 बिंदु सूचीबद्ध करें जो मेरे लिए महत्वपूर्ण हैं।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

यह डेटा साफ़ करें.

एआई यह जाने बिना कि क्या साफ करना है, धारणाओं के साथ काम करता है; आप अवलोकन हटा सकते हैं, इकाइयाँ बदल सकते हैं, आप ध्यान नहीं देंगे।

शक्तिशाली संकेत:

इस मासिक विदेशी व्यापार डेटा में, निर्यात "हजार अमरीकी डालर" में है और आयात "मिलियन अमरीकी डालर" में है। दोनों को "मिलियन यूएसडी" में बराबर करें, छूटे हुए महीनों को चिह्नित करें लेकिन भरें नहीं, तारीखों को महीने के अंत में संरेखित करें। प्रिंट करें कि प्रत्येक चरण में कितनी पंक्तियाँ प्रभावित होती हैं; चुपचाप कोई पंक्तियाँ न हटाएँ. फिर एक महीने का बैलेंस इस तरह दिखाएं कि मैं मैन्युअली चेक कर सकूं।

सामान्य गलतियाँ

  • रूपांतरण कोड को पढ़े बिना चलाना। गलत आधार/इकाई चुपचाप पूरे विश्लेषण को भ्रष्ट कर देती है।
  • बिना सोचे-समझे छूटे हुए डेटा को भरना। संकट/आपदा काल को औसत से मिटाना।
  • आउटलेर्स को स्वचालित रूप से त्यागें। किसी वास्तविक घटना को डेटा त्रुटि समझ लेना।
  • भ्रमित करने वाली मौसमी और वार्षिक वृद्धि। दोनों अलग-अलग आकार के हैं।
  • आवृत्तियों का ग़लत संयोजन। स्टॉक श्रृंखला को एकत्रित करना और इसे प्रवाह के रूप में संसाधित करना।
  • EDA में सहसंबंध को कार्य-कारण समझने की भूल करना। पहचान उपकरण को साक्ष्य समझ लेना।

सारांश

डेटा की सफाई और परिवर्तन आर्थिक विश्लेषण का अदृश्य लेकिन निर्णायक 80 प्रतिशत हिस्सा है। कृत्रिम बुद्धिमत्ता नाटकीय रूप से इस यांत्रिक कार्य को गति देती है; लेकिन यह आप पर निर्भर है कि आप प्रत्येक सफ़ाई चरण और प्रत्येक परिवर्तन को पढ़ें और कम से कम एक अवलोकन को मैन्युअल रूप से सत्यापित करें। डिफ्लेटर आधार, इकाई, आवृत्ति और बाहरी निर्णय आर्थिक निर्णय हैं और इन्हें आंख मूंदकर कृत्रिम बुद्धिमत्ता पर नहीं छोड़ा जा सकता है। खोजपूर्ण विश्लेषण डेटा का परिचय देता है, लेकिन वहां सहसंबंध कार्य-कारण नहीं है।

आवेदन कार्य

एक वास्तविक कच्ची श्रृंखला डाउनलोड करें (उदाहरण के लिए मासिक सीपीआई और नाममात्र वेतन/आय श्रृंखला)। पहले टेम्प्लेट के साथ एक सफाई योजना बनाएं, दूसरे टेम्प्लेट के साथ कोड जनरेट करें, और तीसरे टेम्प्लेट के साथ श्रृंखला का एहसास करें। फिर कागज पर एक अवधि के वास्तविक मूल्य की गणना करें और इसकी तुलना कृत्रिम बुद्धिमत्ता के आउटपुट से करें। यदि आपको कोई बेमेल मिलता है, तो उसके स्रोत (आधार/इकाई) का निदान करें और उसे ठीक करें और प्रगति नोट करें।

चेकलिस्ट

  • [ ] कोड लिखे जाने से पहले मैंने सफाई योजना की समीक्षा की और उसे मंजूरी दे दी।
  • [ ] रिपोर्ट की गई कृत्रिम बुद्धिमत्ता द्वारा मैंने प्रत्येक पंक्ति को हटा/बदल दिया था; कोई मौन विलोपन नहीं.
  • [ ] छूटे हुए डेटा को भरते समय आप पूछ सकते हैं "यह खाली क्यों है?" मैंने प्रश्न का उत्तर दिया.
  • [ ] मैंने जांच की कि क्या बाहरी घटना वास्तविक घटना थी या डेटा त्रुटि थी।
  • [ ] अहसास में, मैंने सत्यापित किया कि डिफ्लेटर आधार और परिणाम आधार मेल खाते हैं।
  • [ ] मैंने मैन्युअल रूप से कम से कम एक अवधि के रूपांतरण की पुनर्गणना की।
  • [ ] मैंने ईडीए में सहसंबंधों को कार्य-कारण के रूप में प्रस्तुत नहीं किया।