लाभ:
- कच्चा आर्थिक डेटा सफा गर्ने क्षमता (अवलोकनहरू, एकाइ भ्रम, फ्रिक्वेन्सी बेमेल) र कृत्रिम बुद्धिमत्ताको मद्दतले विश्लेषणको लागि तयार पार्ने क्षमता।
- मानक आर्थिक रूपान्तरणहरू जस्तै वास्तविक-नाममात्र रूपान्तरण, अनुक्रमणिका, वृद्धि दर, मौसमी समायोजनलाई कृत्रिम बुद्धिमत्तामा कोडको रूपमा प्रिन्ट गर्ने र तिनीहरूलाई म्यानुअल रूपमा प्रमाणित गर्ने क्षमता।
- अन्वेषण डेटा विश्लेषण (सारांश तथ्याङ्क, वितरण, आउटलियर्स, सहसंबंध) मार्फत डाटा पहिचान गर्ने क्षमता र कृत्रिम बुद्धिमत्ता सारांशहरू आलोचनात्मक रूपमा पढ्नुहोस्।
आर्थिक तथ्याङ्क विरलै विश्लेषणको लागि तयार हुन्छ। तपाईंले TURKSTAT बाट डाउनलोड गर्नुभएको तालिकामा, केही महिनाहरू छुटेका छन्, एउटा स्तम्भ हजार कोष्ठकसहितको पाठको रूपमा आउँछ, विनिमय दर "१.२३४,५६" जस्तै टर्की ढाँचामा छ, एउटा शृङ्खला मासिक र अर्को त्रैमासिक हो। अर्थशास्त्रीको धेरैजसो समय विश्लेषणमा होइन, तथ्यांकलाई विश्लेषणका लागि तयार पार्नमा खर्चिन्छ। यो जहाँ AI एक वास्तविक, कम जोखिम गतिवर्धक हो: यसले सफा गर्ने चरणहरू सुझाव दिन्छ, पान्डाहरू (पाइथनको डेटा प्रशोधन पुस्तकालय) लेख्छ, मानक आर्थिक रूपान्तरणहरू कोडिफाई गर्दछ। तर यो एकाइको पनि अपरिवर्तनीय नियम छ: तपाइँ कृत्रिम बुद्धिमत्ता द्वारा लेखिएको प्रत्येक रूपान्तरण पढ्नुहुन्छ र कम्तिमा एक अवलोकनमा म्यानुअल रूपमा प्रमाणित गर्नुहोस्। यदि वास्तविक-नाममात्र चक्र गलत आधारमा छ भने, सम्पूर्ण विश्लेषण चुपचाप क्षय हुन्छ।
सरसफाई: के समस्या, कसरी समाधान गर्न?
आर्थिक डेटा र तिनीहरूको तर्कमा सबैभन्दा सामान्य समस्याहरू:
- Incomplete observation. एक महिना/चौथाई खाली छ। समाधान सन्दर्भमा निर्भर गर्दछ: यदि यो वास्तवमा अवस्थित छैन भने, यसलाई खाली छोडिन्छ; यदि त्यहाँ प्राविधिक अन्तर छ भने, सावधानीपूर्वक प्रक्षेपण गरिन्छ - तर निर्माण बीचको रेखा पातलो छ।
- एकाइहरू र ढाँचाहरूको भ्रम। पाठ "12.345.6" नम्बरमा रूपान्तरण हुनुपर्छ; मिलियन/बिलियन एकरूप हुनुपर्छ।
- Frequency mismatch. मासिक र त्रैमासिक शृङ्खला जोड्नको लागि, एकलाई (मासिकदेखि त्रैमासिक) जम्मा गरिएको छ — चाहे यो औसत हो, कुल वा अवधिको अन्त्य सूचकको प्रकृति (स्टक/प्रवाह भिन्नता) मा निर्भर गर्दछ।
- आउटलियर (चरम) मानहरू। यदि अवलोकन जंगली रूपमा विचलित हुन्छ: के यो वास्तविक घटना (संकट, मूल्य वृद्धि), वा डेटा त्रुटि हो? यो मेटाउनु अघि बुझिन्छ।
- Date alignment. विभिन्न शृङ्खलाहरूको मिति ढाँचा र अवधि परिभाषाहरू सिङ्क्रोनाइज गरिएका छन्।
ध्यान दिनुहोस्: हराएको डाटा भर्नु निर्दोष देखिन्छ, तर यो एक आर्थिक निर्णय हो। "छिमेकी महिनाको औसत" सँग संकट महिना भर्नु भनेको विश्लेषणबाट त्यो संकट मेटाउनु हो। भर्नु अघि, सोध्नुहोस् "यो खाली किन अवस्थित छ?" प्रश्नको जवाफ दिनुहोस्।
मानक आर्थिक रूपान्तरण
एक अर्थशास्त्रीको दैनिक भण्डारमा परिवर्तन र तिनीहरूको परिभाषा:
- Nominal → Real. मूल्य प्रभावको लागि समायोजन: वास्तविक मूल्य = नाममात्र मूल्य / मूल्य सूचकांक × 100। डिफ्लेटरको आधार वर्ष (अनुक्रमणिका समायोजन) परिणामको आधार निर्धारण गर्दछ।
- Indexing. Rescaling a series so that a selected period = 100; यो विभिन्न आकार को श्रृंखला तुलना को लागी उपयोगी छ।
- Growth rate. Annual: (same period this period / last year − 1) × 100. Periodic and annualized rate are different things; भ्रमित हुनु सामान्य गल्ती हो।
- Seasonal correction. नियमित मौसमी प्रभावहरू शुद्ध गर्दै (गर्मी पर्यटन, छुट्टिहरू); कच्चा शृङ्खलाहरू र मौसमी रूपमा समायोजन गरिएका श्रृंखलाहरूले फरक कथाहरू बताउँछन्।
- Moving average. शोरलाई बाहिर निकाल्दै र प्रवृति दृश्यात्मक बनाउँदै।
- लोगारिदम र भिन्नता। वृद्धि गतिशीलता र स्थिरता परीक्षण गर्न (समय श्रृंखला एकाइमा गहिरो हुनेछ)।
सुझाव: प्रत्येक रूपान्तरणको साथ तपाईलाई सोधिनेछ "एकाइ र आधारलाई के भयो?" सोध्नुहोस्। वास्तविक श्रृंखलाको आधार डिफ्लेटरको आधार हो; अनुक्रमणिका श्रृंखलाको आधार तपाईंले छनौट गर्नुभएको अवधि हो। यो लेखेर राख्दा भविष्यमा हुने गल्तीहरूबाट बच्न सकिन्छ।
अन्वेषण डेटा विश्लेषण (EDA)
यो मोडेल मा प्रविष्ट गर्नु अघि डाटा पहिचान गर्न आवश्यक छ। अन्वेषण डेटा विश्लेषण (EDA) ले समावेश गर्दछ: सारांश तथ्याङ्कहरू (मध्य, मध्य, मानक विचलन, न्यूनतम-अधिकतम), वितरणको आकार, समयको साथ पाठ्यक्रम, आउटलियरहरू र श्रृंखलाहरू बीचको सम्बन्ध। AI ले यी चरणहरूको लागि द्रुत रूपमा कोड उत्पन्न गर्दछ; तपाईको काम भनेको आर्थिक आँखाले आउटपुट पढ्नु हो: "के यो औसत व्यावहारिक छ? के यो सम्बन्ध संयोग हो वा ज्ञात सम्बन्ध?"
सावधानी: सहसंबंध यहाँ पहिचानको माध्यम मात्र हो, कारणको प्रमाण होइन। दुई श्रृङ्खलाहरू सँगै सर्छन् भन्ने तथ्य (जस्तै, आइसक्रिम बिक्री र डुब्ने—दुवै गर्मीले ट्रिगर गरेको) भन्ने कुराले एउटा अर्कोतर्फ लैजान्छ भन्ने संकेत गर्दैन। हामी यो भिन्नतालाई एकाइ 7 मा गहिरो बनाउनेछौं।
तीन मिनी केसहरू
केस १ - गलत डिफ्लेटर आधार। एक विश्लेषक संग मजदूरी श्रृंखला महसुस गर्न आर्टिफिशियल इन्टेलिजेन्स लेखन कोड थियो। कोडले काम गर्यो, नतिजा उचित देखियो — तर विश्लेषकले म्यानुअल रूपमा CALCULATE चरणमा २०२० गणना गरे र यसले काम गरेन। समस्या: कृत्रिम बुद्धिमत्ताले 2003 = 100 को आधारको साथ डिफ्लेटर प्रयोग गर्यो र 2015 मूल्यहरूसँग ज्याला श्रृंखला अनुरोध गर्यो; आधारहरू विवादित थिए। कोड एकल लाइन फिक्स संग मर्मत गरिएको थियो, सम्पूर्ण श्रृंखला ठाउँमा खस्यो।
केस २ - मौन भोल्युम त्रुटि। एउटा संस्थाले निर्यात तथ्याङ्क हजार डलरमा र आयात मिलियन डलरमा घटाएको थियो। जब कृत्रिम बुद्धिमत्ताले "विदेशी व्यापार सन्तुलन" को लागी दुई हटायो, नतिजा एक बेतुका घाटा थियो। EDA मा न्यूनतम-अधिकतम दृश्यले त्रुटि प्रकट गर्यो: दुई शृङ्खलाको म्याग्निच्युडको क्रम 1000 को कारकले भिन्न थियो। एक पटक बराबर भएपछि ब्यालेन्स सही थियो।
केस 3 - आउटलायर मेटाउँदैन। एक शृङ्खलामा एक महिना असाधारण रूपमा कम थियो। एआईले "आउटलियर, यसलाई सफा गरौं" सुझाव दियो। विश्लेषकले अनुसन्धान गरे: त्यो महिना प्राकृतिक प्रकोपका कारण उत्पादन रोकिएको थियो। The value was real; यसलाई मेटाउनाले इतिहास बिगार्छ। मेटाउनुको सट्टा फुटनोट गरिएको थियो। AI को "स्पष्ट" सिफारिसलाई अन्धाधुन्ध पछ्याइएको थिएन।
रूपान्तरण प्रमाणीकरण तालिका
रूपान्तरण
formula essence
manual checkpoint
प्राप्ति
नाममात्र / मूल्य सूचकांक × 100
डिफ्लेटर आधार = परिणाम आधार?
annual growth
(t / t-12 महिना − 1) × 100
कागजमा अवधि गणना गर्नुहोस्
indexing
श्रृंखला/आधार अवधि × 100
आधार अवधि मान 100 हो?
Monthly→quarterly
प्रवाह: सङ्कलन / स्टक: अवधिको अन्त्य
सही संकलन विधि?
moving average
last n period average
के सञ्झ्यालको लम्बाइ सही छ?
चार प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू
1) Cleaning plan:
मसँग यो कच्चा डाटा छ: [स्तम्भ र नमूना पङ्क्तिहरू]। विश्लेषणको लागि तयारी गर्न सफा योजनाको साथ आउनुहोस्: छुटेको मान, एकाइ/ढाँचा मुद्दा, मिति पङ्क्तिबद्धता, फ्रिक्वेन्सी पङ्क्तिबद्धता, सम्भावित आउटलियरहरू। एक वाक्यमा व्याख्या गर्नुहोस् किन प्रत्येक चरण आवश्यक छ। अझै कोड नलेख्नुहोस्; मलाई पहिले योजना पुष्टि गर्न दिनुहोस्।
2) pandas cleanup code:
मैले अनुमोदन गरेको योजना अनुसार पान्डा कोड लेख्नुहोस्। कोडलाई टिप्पणी लाइनको साथ प्रत्येक चरणमा यसले के गर्छ भनेर संकेत गरौं; यसले पङ्क्तिहरूको संख्या र रूपान्तरण पछि छुटेका मानहरू छाप्छ। चुपचाप कुनै पनि अवलोकन नमेट्नुहोस्; तपाईंले मेटाउनुभएको प्रत्येक लाइनलाई रिपोर्ट गर्नुहोस्।
३) प्राप्ति (प्रमाणित):
[मूल्य अनुक्रमणिका] को साथ यो नाममात्र श्रृंखला महसुस गर्नुहोस्। तपाईंले यसलाई प्रयोग गर्दा डिफ्लेटरको आधार वर्ष स्पष्ट रूपमा लेख्नुहोस्; नतिजा श्रृंखला को आधार के हो निर्दिष्ट गर्नुहोस्। मलाई एकल अवधिको लागि चरण-दर-चरण खाता देखाउनुहोस् ताकि म यसलाई म्यानुअल रूपमा प्रमाणित गर्न सकूँ।
4) अन्वेषणात्मक विश्लेषण सारांश:
निम्न सफा गरिएको डाटाको लागि अन्वेषण विश्लेषण कोड लेख्नुहोस्: सारांश तथ्याङ्क, समय श्रृंखला प्लट, आउटलियर स्क्यान, र सहसंबंध म्याट्रिक्स। नतिजाहरूको व्याख्या गर्दा, तपाईंले फेला पार्नुभएका सहसंबंधहरू CAUSAL होइनन् भनी स्पष्ट गर्नुहोस् र मलाई फरक पर्ने ३ अंकहरू सूचीबद्ध गर्नुहोस्।
कमजोर प्रम्प्ट / बलियो प्रम्प्ट
कमजोर प्रम्प्ट:
Clear this data.
एआईले के सफा गर्ने थाहा नदिई अनुमानका साथ कार्य गर्दछ; तपाईंले अवलोकनहरू मेटाउन सक्नुहुन्छ, एकाइहरू परिवर्तन गर्न सक्नुहुन्छ, तपाईंले याद गर्नुहुने छैन।
शक्तिशाली प्रम्प्ट:
यस मासिक वैदेशिक व्यापार डाटामा, निर्यात "हजार USD" मा छ र आयात "मिलियन USD" मा छ। दुईलाई "मिलियन USD" मा बराबर बनाउनुहोस्, छुटेका महिनाहरू चिन्ह लगाउनुहोस् तर न भर्नुहोस्, महिनाको अन्त्यमा मितिहरू पङ्क्तिबद्ध गर्नुहोस्। प्रत्येक चरणमा कति पङ्क्तिहरू प्रभावित छन् छाप्नुहोस्; silently delete no rows. त्यसपछि मैले म्यानुअल रूपमा जाँच गर्न सक्ने तरिकामा एक महिनाको ब्यालेन्स देखाउनुहोस्।
सामान्य गल्तीहरू
- यसलाई नपढाई रूपान्तरण कोड चलाउँदै। गलत आधार/इकाई चुपचाप सम्पूर्ण विश्लेषणलाई भ्रष्ट बनाउँछ।
- बिना सोचाइ हराएको डाटा भर्दै। औसतको साथ संकट/प्रकोप अवधि मेटाउँदै।
- आउटलियरहरू स्वतः खारेज गर्नुहोस्। डाटा त्रुटिको लागि वास्तविक घटनालाई गल्ती गर्दै।
- भ्रामक मौसमी र वार्षिक वृद्धि। दुई फरक आकार हो।
- फ्रिक्वेन्सीहरू गलत रूपमा संयोजन गर्दै। स्टक श्रृंखला सङ्कलन र एक प्रवाह को रूप मा प्रशोधन।
- कारणको लागि EDA मा सहसंबंध गलत गर्दै। प्रमाणको रूपमा पहिचान उपकरणलाई गल्ती गर्दै।
संक्षेपमा
आर्थिक विश्लेषणको ८० प्रतिशत अदृश्य तर निर्णायक तथ्याङ्क सफाई र रूपान्तरण हो। आर्टिफिसियल इन्टेलिजेन्सले यो मेकानिकल कामलाई नाटकीय रूपमा गति दिन्छ; तर प्रत्येक सफाई चरण र प्रत्येक रूपान्तरण पढ्ने र कम्तिमा एउटा अवलोकन म्यानुअल रूपमा प्रमाणित गर्ने तपाईंको हातमा छ। डिफ्लेटर आधार, एकाइ, फ्रिक्वेन्सी र आउटलियर निर्णयहरू आर्थिक निर्णयहरू हुन् र कृत्रिम बुद्धिमत्तामा अन्धाधुन्ध छोड्न सकिँदैन। अन्वेषक विश्लेषणले डाटा परिचय गराउँछ, तर सहसंबंध त्यहाँ कारण छैन।
आवेदन कार्य
वास्तविक कच्चा श्रृंखला डाउनलोड गर्नुहोस् (जस्तै मासिक CPI र नाममात्र ज्याला/आय श्रृंखला)। 1st टेम्प्लेट संग एक सफाई योजना बनाउनुहोस्, 2nd टेम्प्लेट संग उत्पन्न कोड छ, र 3rd टेम्प्लेट संग श्रृंखला महसुस गर्नुहोस्। त्यसपछि कागजमा एकल अवधिको वास्तविक मूल्य गणना गर्नुहोस् र यसलाई कृत्रिम बुद्धिमत्ताको आउटपुटसँग तुलना गर्नुहोस्। यदि तपाईंले बेमेल फेला पार्नुभयो भने, यसको स्रोत (आधार/इकाई) को निदान र सुधार गर्नुहोस् र प्रगति नोट गर्नुहोस्।
चेकलिस्ट
- [ ] मैले कोड लेख्नु अघि सफा योजनाको समीक्षा र अनुमोदन गरें।
- [ ] मैले रिपोर्ट गरेको आर्टिफिसियल इन्टेलिजेन्सले प्रत्येक लाइन मेटाएको/परिवर्तन गरेको थियो; No silent deletion.
- हराएको डाटा भर्दा तपाईंले "किन खाली छ?" सोध्न सक्नुहुन्छ। I answered the question.
- [ ] मैले अनुसन्धान गरें कि आउटलायर वास्तविक घटना वा डाटा त्रुटि थियो।
- [ ] प्राप्तिमा, मैले डिफ्लेटर आधार र नतिजा आधार मेल खाएको प्रमाणित गरें।
- [ ] मैले कम्तिमा एक अवधिको रूपान्तरण म्यानुअल रूपमा पुन: गणना गरें।
- [ ] I did not present correlations in EDA as causation.