লাভ:
- কাঁচা অর্থনৈতিক ডেটা পরিষ্কার করার ক্ষমতা (অনুপস্থিত পর্যবেক্ষণ, ইউনিট বিভ্রান্তি, ফ্রিকোয়েন্সি অমিল) এবং কৃত্রিম বুদ্ধিমত্তার সাহায্যে বিশ্লেষণের জন্য প্রস্তুত করা
- কৃত্রিম বুদ্ধিমত্তায় কোড হিসাবে বাস্তব-নামিক রূপান্তর, সূচীকরণ, বৃদ্ধির হার, ঋতু সামঞ্জস্যের মতো স্ট্যান্ডার্ড অর্থনৈতিক রূপান্তরগুলি মুদ্রণ করার ক্ষমতা এবং সেগুলি ম্যানুয়ালি যাচাই করা
- অনুসন্ধানমূলক ডেটা বিশ্লেষণের মাধ্যমে ডেটা সনাক্ত করার ক্ষমতা (সারাংশ পরিসংখ্যান, বন্টন, আউটলিয়ার, পারস্পরিক সম্পর্ক) এবং সমালোচনামূলকভাবে কৃত্রিম বুদ্ধিমত্তার সারাংশ পড়ার ক্ষমতা
অর্থনৈতিক তথ্য খুব কমই বিশ্লেষণের জন্য প্রস্তুত হয়। আপনি TURKSTAT থেকে ডাউনলোড করেছেন এমন একটি টেবিলে, কিছু মাস অনুপস্থিত, একটি কলাম হাজার বন্ধনী সহ পাঠ্য হিসাবে আসে, বিনিময় হার তুর্কি বিন্যাসে "1.234,56" এর মতো, একটি সিরিজ মাসিক এবং অন্যটি ত্রৈমাসিক। অর্থনীতিবিদদের বেশিরভাগ সময় বিশ্লেষণে নয়, বিশ্লেষণের জন্য ডেটা প্রস্তুত করতে ব্যয় করা হয়। এখানেই AI হল একটি বাস্তব, কম-ঝুঁকির ত্বরণকারী: এটি পরিষ্কার করার পদক্ষেপের পরামর্শ দেয়, পান্ডা (পাইথনের ডেটা প্রসেসিং লাইব্রেরি) লেখে, স্ট্যান্ডার্ড অর্থনৈতিক রূপান্তর কোড করে। কিন্তু এই ইউনিটেরও একটি অপরিবর্তনীয় নিয়ম রয়েছে: আপনি কৃত্রিম বুদ্ধিমত্তা দ্বারা লেখা প্রতিটি রূপান্তর পড়েন এবং কমপক্ষে একটি পর্যবেক্ষণে ম্যানুয়ালি যাচাই করেন। যদি প্রকৃত-নামমাত্র চক্র ভুল পায়ে থাকে, পুরো বিশ্লেষণটি নিঃশব্দে ক্ষয়প্রাপ্ত হয়।
পরিষ্কার: কি সমস্যা, কিভাবে তাদের সমাধান?
অর্থনৈতিক তথ্য এবং তাদের যুক্তিতে সবচেয়ে সাধারণ সমস্যা:
- অসম্পূর্ণ পর্যবেক্ষণ। এক মাস/চতুর্থাংশ খালি। সমাধানটি প্রেক্ষাপটের উপর নির্ভর করে: যদি এটি বাস্তবে বিদ্যমান না থাকে তবে এটি খালি রাখা হয়; যদি কোনও প্রযুক্তিগত ফাঁক থাকে, তবে সাবধানে ইন্টারপোলেশন করা হয় — তবে বানোয়াটের মধ্যে লাইনটি পাতলা।
- ইউনিট এবং বিন্যাসের বিভ্রান্তি। পাঠ্য "12.345.6" একটি সংখ্যা রূপান্তর করা আবশ্যক; মিলিয়ন/বিলিয়ন সামঞ্জস্যপূর্ণ হওয়া উচিত।
- ফ্রিকোয়েন্সি অমিল। একটি মাসিক এবং ত্রৈমাসিক সিরিজকে একত্রিত করার জন্য, একটিকে একত্রিত করা হয় (মাসিক থেকে ত্রৈমাসিক) — এটি গড়, মোট বা পিরিয়ডের শেষ কিনা তা নির্দেশকের প্রকৃতির উপর নির্ভর করে (স্টক/প্রবাহ পার্থক্য)।
- বাহ্যিক (চরম) মান। যদি একটি পর্যবেক্ষণ বন্যভাবে বিচ্যুত হয়: এটি কি একটি বাস্তব ঘটনা (সঙ্কট, মূল্য বৃদ্ধি), নাকি একটি ডেটা ত্রুটি? মুছে ফেলার আগেই বোঝা যায়।
- তারিখ প্রান্তিককরণ। বিভিন্ন সিরিজের তারিখ বিন্যাস এবং সময়ের সংজ্ঞা সিঙ্ক্রোনাইজ করা হয়।
মনোযোগ: অনুপস্থিত ডেটা পূরণ করা নির্দোষ বলে মনে হয়, তবে এটি একটি অর্থনৈতিক সিদ্ধান্ত। "প্রতিবেশী মাসের গড়" দিয়ে একটি সংকট মাস পূরণ করার অর্থ বিশ্লেষণ থেকে সেই সংকট মুছে ফেলা। পূরণ করার আগে, জিজ্ঞাসা করুন "কেন এই ফাঁক বিদ্যমান?" প্রশ্নের উত্তর দাও।
স্ট্যান্ডার্ড অর্থনৈতিক রূপান্তর
একজন অর্থনীতিবিদের দৈনিক ভাণ্ডারে রূপান্তর এবং তাদের সংজ্ঞা:
- নামমাত্র → রিয়াল। মূল্য প্রভাবের জন্য সামঞ্জস্য করা: প্রকৃত মান = নামমাত্র মূল্য / মূল্য সূচক × 100। ডিফ্লেটরের ভিত্তি বছর (অ্যাডজাস্টিং সূচক) ফলাফলের ভিত্তি নির্ধারণ করে।
- ইনডেক্সিং। একটি সিরিজ রিস্কেল করা যাতে একটি নির্বাচিত সময়কাল = 100; এটি বিভিন্ন আকারের সিরিজ তুলনা করার জন্য দরকারী।
- বৃদ্ধির হার। বার্ষিক: (এই সময়ের একই সময়কাল / গত বছর −1) × 100। পর্যায়ক্রমিক এবং বার্ষিক হার ভিন্ন জিনিস; বিভ্রান্তিকর একটি সাধারণ ভুল.
- ঋতু সংশোধন। নিয়মিত ঋতু প্রভাব বিশুদ্ধকরণ (গ্রীষ্মের পর্যটন, ছুটির দিন); কাঁচা সিরিজ এবং ঋতু সামঞ্জস্যপূর্ণ সিরিজ ভিন্ন গল্প বলে।
- চলমান গড়। গোলমাল মসৃণ করা এবং প্রবণতা দৃশ্যমান করা।
- লগারিদম এবং পার্থক্য। বৃদ্ধির গতিশীলতা এবং স্থিতিশীলতা পরীক্ষা করতে (টাইম সিরিজ ইউনিটে গভীর হবে)।
টিপ: প্রতিটি রূপান্তরের সাথে আপনাকে জিজ্ঞাসা করা হবে "ইউনিট এবং বেসের কি হয়েছে?" জিজ্ঞাসা আসল সিরিজের ভিত্তি হল ডিফ্লেটরের ভিত্তি; ইন্ডেক্স করা সিরিজের ভিত্তি হল আপনার বেছে নেওয়া সময়কাল। এটি লিখে রাখলে ভবিষ্যৎ ভুল রোধ হয়।
অনুসন্ধানমূলক তথ্য বিশ্লেষণ (EDA)
মডেলে প্রবেশ করার আগে ডেটা চিনতে হবে। অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA) এর মধ্যে রয়েছে: সংক্ষিপ্ত পরিসংখ্যান (গড়, মধ্য, মানক বিচ্যুতি, সর্বনিম্ন-সর্বোচ্চ), বন্টনের আকৃতি, সময়ের সাথে সাথে, বহিরাগত এবং সিরিজের মধ্যে পারস্পরিক সম্পর্ক। AI দ্রুত এই ধাপগুলির জন্য কোড তৈরি করে; আপনার কাজ একটি অর্থনৈতিক চোখ দিয়ে আউটপুট পড়া হয়: "এই গড় যুক্তিসঙ্গত? এই পারস্পরিক সম্পর্ক একটি কাকতালীয় বা একটি পরিচিত সম্পর্ক?"
সতর্কতা: পারস্পরিক সম্পর্ক এখানে শুধুমাত্র সনাক্তকরণের একটি মাধ্যম, কারণের প্রমাণ নয়। দুটি সিরিজ একসাথে চলে যাওয়ার বিষয়টি (যেমন, আইসক্রিম বিক্রি এবং ডুবে যাওয়া—দুটিই গ্রীষ্মের কারণে শুরু হয়) অগত্যা নির্দেশ করে না যে একটি অন্যটির দিকে নিয়ে যায়। আমরা ইউনিট 7 এ এই পার্থক্যটি আরও গভীর করব।
তিনটি মিনি কেস
কেস 1 - ভুল ডিফ্লেটর বেস। একজন বিশ্লেষকের কাছে কৃত্রিম বুদ্ধিমত্তা লেখার কোড ছিল মজুরি সিরিজ উপলব্ধি করার জন্য। কোডটি কাজ করেছে, ফলাফলটি যুক্তিসঙ্গত বলে মনে হচ্ছে — কিন্তু বিশ্লেষক ম্যানুয়ালি ক্যালকুলেট ধাপে 2020 গণনা করেছেন এবং এটি কাজ করেনি। সমস্যা: কৃত্রিম বুদ্ধিমত্তা 2003=100 এর বেস সহ ডিফ্লেটার ব্যবহার করেছে এবং 2015 মূল্যের সাথে মজুরি সিরিজের অনুরোধ করেছে; ঘাঁটি ছিল পরস্পরবিরোধী। কোডটি একটি একক লাইন ফিক্স দিয়ে মেরামত করা হয়েছিল, পুরো সিরিজটি জায়গায় পড়েছিল।
কেস 2 - নীরব ভলিউম ত্রুটি। একটি প্রতিষ্ঠান রপ্তানি ডাটা হাজার ডলারে এবং আমদানি মিলিয়ন ডলারে কমিয়েছে। যখন কৃত্রিম বুদ্ধিমত্তা "বিদেশী বাণিজ্য ভারসাম্য" এর জন্য দুটিকে সরিয়ে দেয়, ফলাফলটি একটি অযৌক্তিক ঘাটতি ছিল। EDA-তে ন্যূনতম-সর্বোচ্চ ভিউ ত্রুটিটি প্রকাশ করেছে: দুটি সিরিজের মাত্রার ক্রম 1000 এর একটি ফ্যাক্টর দ্বারা পৃথক। একবার ইউনিটটি সমান হয়ে গেলে ভারসাম্য সঠিক ছিল।
কেস 3 - আউটলারটি মুছে ফেলা হচ্ছে না। এক সিরিজে এক মাস ছিল অসাধারণ কম। AI পরামর্শ দিয়েছে "আউটলার, আসুন এটি পরিষ্কার করি"। বিশ্লেষক তদন্ত করেছেন: সেই মাসে একটি প্রাকৃতিক দুর্যোগের কারণে উত্পাদন আসলে বন্ধ হয়ে গিয়েছিল। মূল্য ছিল বাস্তব; এটি মুছে ফেললে ইতিহাস বিকৃত হবে। মুছে ফেলার পরিবর্তে, এটি ফুটনোট করা হয়েছিল। AI এর "স্পষ্ট" সুপারিশ অন্ধভাবে অনুসরণ করা হয়নি।
রূপান্তর বৈধতা টেবিল
রূপান্তর
সূত্র সারাংশ
ম্যানুয়াল চেকপয়েন্ট
উপলব্ধি
নামমাত্র / মূল্য সূচক × 100
Deflator base = ফলাফলের ভিত্তি?
বার্ষিক বৃদ্ধি
(t / t-12 মাস − 1)×100
কাগজে একটি সময়কাল গণনা করুন
ইনডেক্সিং
সিরিজ/বেস পিরিয়ড × 100
বেস পিরিয়ডের মান কি 100?
মাসিক → ত্রৈমাসিক
প্রবাহ: সংগ্রহ / স্টক: মেয়াদ শেষ
সঠিক সংগ্রহ পদ্ধতি?
চলমান গড়
শেষ n সময়ের গড়
জানালার দৈর্ঘ্য কি সঠিক?
চারটি অনুলিপিযোগ্য টেমপ্লেট
1) পরিচ্ছন্নতার পরিকল্পনা:
আমার কাছে এই কাঁচা তথ্য আছে: [কলাম এবং নমুনা সারি]। বিশ্লেষণের জন্য প্রস্তুত করার জন্য একটি পরিষ্কার পরিকল্পনা নিয়ে আসুন: অনুপস্থিত মান, ইউনিট/ফরম্যাট সমস্যা, তারিখ প্রান্তিককরণ, ফ্রিকোয়েন্সি প্রান্তিককরণ, সম্ভাব্য আউটলায়ার। প্রতিটি পদক্ষেপ কেন প্রয়োজনীয় তা এক বাক্যে ব্যাখ্যা করুন। এখনও কোড লিখবেন না; আমাকে প্রথমে পরিকল্পনা নিশ্চিত করতে দিন।
2) পান্ডা ক্লিনআপ কোড:
আমি অনুমোদিত পরিকল্পনা অনুযায়ী পান্ডাস কোড লিখুন। কোডটি একটি মন্তব্য লাইনের সাথে প্রতিটি ধাপে কী করে তা নির্দেশ করুন; এটি রূপান্তরের পরে সারি সংখ্যা এবং অনুপস্থিত মান প্রিন্ট করে। নিঃশব্দে কোনো পর্যবেক্ষণ মুছে ফেলবেন না; আপনি মুছে ফেলা প্রতিটি লাইন রিপোর্ট করুন.
3) উপলব্ধি (যাচাইযোগ্য):
[মূল্য সূচক] সহ এই নামমাত্র সিরিজটি উপলব্ধি করুন। আপনি যখন এটি ব্যবহার করবেন তখন ডিফ্লেটারের ভিত্তি বছরটি পরিষ্কারভাবে লিখুন; ফলাফল সিরিজের ভিত্তি কি নির্দিষ্ট করুন. আমাকে একটি একক সময়ের জন্য ধাপে ধাপে অ্যাকাউন্ট দেখান যাতে আমি নিজে এটি যাচাই করতে পারি।
4) অনুসন্ধানমূলক বিশ্লেষণের সারাংশ:
নিম্নলিখিত পরিষ্কার করা ডেটার জন্য অনুসন্ধানমূলক বিশ্লেষণ কোড লিখুন: সংক্ষিপ্ত পরিসংখ্যান, টাইম সিরিজ প্লট, আউটলিয়ার স্ক্যান এবং পারস্পরিক সম্পর্ক ম্যাট্রিক্স। ফলাফলগুলি ব্যাখ্যা করার সময়, এটি স্পষ্ট করুন যে আপনি যে পারস্পরিক সম্পর্কগুলি খুঁজে পেয়েছেন তা কার্যকারণ নয় এবং 3টি পয়েন্ট তালিকাভুক্ত করুন যা আমার কাছে আলাদা।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট:
এই ডেটা সাফ করুন।
AI কি পরিষ্কার করতে হবে তা না জেনেই অনুমানের সাথে কাজ করে; আপনি পর্যবেক্ষণ মুছে ফেলতে পারেন, ইউনিট পরিবর্তন করতে পারেন, আপনি লক্ষ্য করবেন না।
শক্তিশালী প্রম্পট:
এই মাসিক বৈদেশিক বাণিজ্য তথ্যে, রপ্তানি "হাজার USD" এবং আমদানি "মিলিয়ন USD"-এ। দুটিকে "মিলিয়ন USD"-এ সমান করুন, অনুপস্থিত মাসগুলি চিহ্নিত করুন কিন্তু পূরণ করবেন না, মাসের শেষে তারিখগুলি সারিবদ্ধ করুন৷ প্রতিটি ধাপে কতগুলি সারি প্রভাবিত হয় তা মুদ্রণ করুন; নিঃশব্দে কোন সারি মুছে দিন. তারপর একটি একক মাসের ব্যালেন্স এমনভাবে দেখান যাতে আমি ম্যানুয়ালি চেক করতে পারি।
সাধারণ ভুল
- এটি না পড়ে রূপান্তর কোড চালানো। ভুল ভিত্তি/ইউনিট নিঃশব্দে সমগ্র বিশ্লেষণকে দূষিত করে।
- চিন্তা না করে অনুপস্থিত ডেটা পূরণ করা। গড়ের সাথে সংকট/দুর্যোগের সময়কাল মুছে ফেলা।
- স্বয়ংক্রিয়ভাবে outliers বাতিল. একটি তথ্য ত্রুটির জন্য একটি বাস্তব ঘটনা ভুল.
- বিভ্রান্তিকর ঋতু এবং বার্ষিক বৃদ্ধি. দুটি ভিন্ন আকারের।
- ফ্রিকোয়েন্সি ভুলভাবে একত্রিত করা। স্টক সিরিজ সংগ্রহ এবং একটি প্রবাহ হিসাবে এটি প্রক্রিয়াকরণ.
- কার্যকারণ জন্য EDA মধ্যে পারস্পরিক সম্পর্ক ভুল করা. প্রমাণ হিসাবে স্বীকৃতি টুল ভুল করা.
সংক্ষেপে
ডেটা পরিষ্কার এবং রূপান্তর হল অদৃশ্য কিন্তু সিদ্ধান্তমূলক 80 শতাংশ অর্থনৈতিক বিশ্লেষণ। কৃত্রিম বুদ্ধিমত্তা নাটকীয়ভাবে এই যান্ত্রিক কাজের গতি বাড়ায়; কিন্তু প্রতিটি ক্লিনআপ পদক্ষেপ এবং প্রতিটি রূপান্তর পড়া এবং অন্তত একটি পর্যবেক্ষণ ম্যানুয়ালি যাচাই করা আপনার উপর নির্ভর করে। ডিফ্লেটর বেস, ইউনিট, ফ্রিকোয়েন্সি এবং আউটলিয়ার সিদ্ধান্তগুলি অর্থনৈতিক সিদ্ধান্ত এবং অন্ধভাবে কৃত্রিম বুদ্ধিমত্তার উপর ছেড়ে দেওয়া যায় না। অনুসন্ধানমূলক বিশ্লেষণ তথ্য উপস্থাপন করে, কিন্তু পারস্পরিক সম্পর্ক নেই কারণ।
আবেদন টাস্ক
একটি প্রকৃত কাঁচা সিরিজ ডাউনলোড করুন (যেমন মাসিক CPI এবং একটি নামমাত্র মজুরি/আয় সিরিজ)। ১ম টেমপ্লেট দিয়ে একটি পরিচ্ছন্নতার পরিকল্পনা তৈরি করুন, ২য় টেমপ্লেট দিয়ে কোড তৈরি করুন এবং ৩য় টেমপ্লেটের সাথে সিরিজটি উপলব্ধি করুন। তারপর কাগজে একটি একক সময়ের প্রকৃত মান গণনা করুন এবং কৃত্রিম বুদ্ধিমত্তার আউটপুটের সাথে তুলনা করুন। যদি আপনি একটি অমিল খুঁজে পান, নির্ণয় করুন এবং এর উৎস (বেস/ইউনিট) সংশোধন করুন এবং অগ্রগতি নোট করুন।
চেকলিস্ট
- কোড লেখার আগে আমি পরিচ্ছন্নতার পরিকল্পনা পর্যালোচনা করেছি এবং অনুমোদন করেছি।
- [ ] কৃত্রিম বুদ্ধিমত্তা দ্বারা রিপোর্ট করা প্রতিটি লাইন আমি মুছে/পরিবর্তন করেছি; কোন নীরব মুছে ফেলা.
- অনুপস্থিত ডেটা পূরণ করার সময় আপনি জিজ্ঞাসা করতে পারেন "এটি খালি কেন?" আমি প্রশ্নের উত্তর দিলাম।
- [ ] আমি তদন্ত করেছি যে আউটলায়ারটি একটি বাস্তব ঘটনা নাকি একটি ডেটা ত্রুটি৷
- [ ] উপলব্ধিতে, আমি যাচাই করেছিলাম যে ডিফ্লেটর বেস এবং ফলাফল বেস মিল।
- [ ] আমি ম্যানুয়ালি অন্তত একটি সময়ের রূপান্তর পুনরায় গণনা করেছি৷
- আমি কারণ হিসেবে EDA-তে পারস্পরিক সম্পর্ক উপস্থাপন করিনি।