فائدہ:
- ریگریشن آؤٹ پٹ کو درست طریقے سے پڑھنے کی صلاحیت (گتانک، معیاری غلطی، پی-ویلیو، R-مربع) اور مصنوعی ذہانت کی تشریح کا تنقیدی جائزہ
- نقصانات کو پہچاننے کی اہلیت جیسے کہ ارتباط کی وجہ کی تفریق، endogeneity، چھوڑے گئے متغیرات اور جعلی رجعت، اور مصنوعی ذہانت کی ضرورت سے زیادہ وجہ زبان کو روکنے کی صلاحیت
- ماڈل سیٹ اپ، کوڈ اور تشخیصی ٹیسٹ ڈرافٹنگ کے لیے مصنوعی ذہانت کا استعمال کرنے کی صلاحیت، ماڈل کے انتخاب اور تشریح کی ذمہ داری انسانوں پر چھوڑ کر
اکانومیٹرکس ڈیٹا کے ساتھ معاشی تھیوری کو جانچنے کا ڈسپلن ہے، اور رجعت اس کا بنیادی ٹول ہے۔ "آمدنی بڑھنے سے کھپت میں کتنا اضافہ ہوتا ہے؟"، "سود اور سرمایہ کاری کے درمیان کیا تعلق ہے؟" اس طرح کے سوالات کو رجعت کے اعتبار سے درست کیا جاتا ہے۔ AI اس علاقے میں بہت مفید اور بہت خطرناک ہے: یہ ماڈل کوڈ اور تشخیصی ٹیسٹ سیکنڈوں میں لکھتا ہے، لیکن آؤٹ پٹ کی تشریح کرتے وقت اکثر حد سے زیادہ وجہ اور حد سے زیادہ درست ہوتا ہے۔ جملہ "X بڑھاتا ہے Y" روانی سے بولتا ہے۔ جبکہ زیادہ تر رجعتیں صرف ایک رشتہ کی پیمائش کرتی ہیں۔ اس یونٹ کا خلاصہ یہ ہے: ماڈل سیٹ اپ، کوڈ اور تشخیصی جانچ کے لیے AI کا استعمال کریں۔ لیکن ماڈل کے انتخاب، وجہ کے فیصلے، اور تشریح کی ذمہ داری انسان پر رکھیں۔
ریگریشن آؤٹ پٹ پڑھنا
ایک سادہ رجعت کا آؤٹ پٹ چار چیزوں کی تلاش کرتا ہے:
- عدد۔ اس بات کا اندازہ کہ جب وضاحتی متغیر ایک یونٹ سے بڑھتا ہے تو منحصر متغیر میں کتنی تبدیلی آتی ہے۔ نشان (جمع/مائنس) اور وسعت کا معاشی معنی ہونا چاہیے۔
- معیاری غلطی۔ عددی تخمینہ کی غیر یقینی صورتحال؛ اگر یہ چھوٹا ہے تو اندازہ زیادہ درست ہے۔
- p-value گتانک کا امکان اس مفروضے کے تحت اتنا بڑا دکھائی دیتا ہے کہ یہ "دراصل صفر" ہے۔ سمال پی (<0.05) کو "اعداد و شمار کے لحاظ سے اہم" کہا جاتا ہے - لیکن اس کا مطلب معاشی اہمیت یا وجہ نہیں ہے۔
- آر مربع۔ منحصر متغیر میں کتنی تبدیلی ماڈل بتاتی ہے۔ اعلی R-squared کا مطلب "درست ماڈل" نہیں ہے۔ یہ جعلی رجعت میں بھی زیادہ ہوسکتا ہے۔
مشورہ: شماریاتی اہمیت کو معاشی اہمیت کے ساتھ الجھائیں نہیں۔ یہاں تک کہ ایک بہت چھوٹا، عملی طور پر غیر معمولی اثر بڑے نمونے میں "اہم" (چھوٹا p) نکل سکتا ہے۔ سب سے پہلے، "کیا اس قابلیت کا سائز اقتصادی طور پر اہم ہے؟" '، پھر اہمیت تلاش کریں۔
باہمی تعلق وجہ نہیں ہے: کلاسک نقصانات
یہ اکانومیٹرکس کے مرکز میں انتباہ ہے۔ رجعت کے ذریعہ پایا جانے والا رشتہ اکثر وجہ نہیں ہوتا ہے۔ اہم نقصانات:
- چھوڑ دیا گیا متغیر۔ ایک تیسرا عنصر جو X اور Y دونوں کو متاثر کرتا ہے لیکن ماڈل میں نہیں ہے X اور Y کے درمیان ایک جعلی تعلق پیدا کرتا ہے۔
- معکوس وجہ (اختتام پذیری)۔ جبکہ یہ خیال کیا جاتا ہے کہ X Y کو متاثر کرتا ہے، ہو سکتا ہے Y X کو متاثر کرتا ہے یا دونوں باہمی ہیں۔ (پولیس کی تعداد اور جرائم: کیا پولیس میں اضافہ ہوا کیونکہ جرائم میں اضافہ ہوا؟)
- چھدم رجعت۔ دو نان سٹیشنری (ٹریڈنگ) سیریز اعلی R-squared اور اہم گتانک حاصل کر سکتی ہیں حالانکہ ان کے درمیان کوئی حقیقی تعلق نہیں ہے۔ صرف اس لیے کہ وہ دونوں وقت کے ساتھ بڑھتے ہیں۔
- انتخابی تعصب۔ اگر نمونہ بے ترتیب نہیں ہے، تو رشتہ کو ترچھا ناپا جاتا ہے۔
وجہ کا دعوی صرف ایک مناسب ڈیزائن (طریقوں جیسے کنٹرول شدہ تجربہ، قدرتی تجربہ، آلہ کار متغیر، فرق میں فرق) اور واضح مفروضوں کے ساتھ قائم کیا جا سکتا ہے۔ مصنوعی ذہانت اکثر اس باریکیت سے محروم رہتی ہے۔
احتیاط: اگر AI کہے کہ "یہ متغیر اس میں اضافہ/کم کرتا ہے"، تو فوراً بریک لگائیں۔ مسئلہ: کیا کوئی متغیر چھوڑ دیا گیا ہے؟ کیا ریورس کازلیٹی ممکن ہے؟ کیا سلسلہ ساکن ہے؟ جب تک یہ تینوں سوالات نہ پوچھے جائیں کوئی وجہ جملہ رپورٹ میں داخل نہیں ہوتا۔
تشخیصی ٹیسٹ
رجعت کے قابل اعتماد ہونے کے لیے، اس کے مفروضوں کی جانچ کی جاتی ہے: بقایا جات کا نمونہ (غلطی کی اصطلاحات) (خودکار تعلق)، heteroskedasticity (heteroskedasticity)، multicollinearity (وضاحتی متغیرات ایک دوسرے سے بہت ملتے جلتے ہیں)، عام تقسیم۔ مصنوعی ذہانت ان ٹیسٹوں کے لیے کوڈ لکھتی ہے۔ لیکن یہ ماہر معاشیات کا کام ہے کہ وہ نتائج کی تشریح کرے اور اس کے مطابق ماڈل کو ایڈجسٹ کرے۔
تین چھوٹے مقدمات
کیس 1 - جعلی رجعت۔ ایک محقق نے دو ٹرینڈ سیریز کو پیچھے چھوڑ دیا (ایک برائے نام خرچ، ایک برائے نام دوسری مقدار)؛ R-squared 0.98 تھا، گتانک انتہائی اہم تھا۔ AI "ایک مضبوط رشتہ ہے،" انہوں نے کہا۔ محقق نے سٹیشنری کے لیے تجربہ کیا: دونوں سیریز غیر سٹیشنری تھیں۔ ایک بار جب وہ الگ ہو گئے تو، رشتہ بڑی حد تک غائب ہو گیا. اعلی R-squared صرف اس لیے تھا کہ وہ دونوں وقت کے ساتھ بڑھتے گئے۔ جعلی رجعت پکڑی گئی۔
کیس 2 - چھوڑا ہوا متغیر۔ ایک تجزیے سے پتا چلا ہے کہ "اشتہاری اخراجات فروخت میں اضافہ کرتے ہیں۔" ماہر اقتصادیات نے پوچھا: کیا ماڈل میں موسمی اثر ہے؟ وہاں نہیں تھا۔ تعطیل سے پہلے اشتہارات اور فروخت دونوں بڑھ رہے تھے۔ تعلقات کا ایک حصہ موسمی تھا۔ جب سیزن ڈمی متغیرات کو شامل کیا گیا تو، تشہیر کا گتانک چھوٹا ہو گیا۔ کازل کلیم نرم کر دیا گیا ہے۔
کیس 3 - اہم لیکن غیر اہم۔ ایک بڑے مائیکرو ڈیٹا سیٹ میں، ایک عدد پی <0.001؛ تھا۔ AI "مضبوط اثر،" انہوں نے کہا. لیکن گتانک کی وسعت عملی طور پر نہ ہونے کے برابر تھی (آمدنی میں ایک بڑی تبدیلی نے نتیجہ کو ایک ہزارواں کر دیا)۔ ماہر معاشیات نے اسے صحیح طور پر "اعداد و شمار کے لحاظ سے اہم لیکن معاشی طور پر غیر اہم" قرار دیا۔ اہمیت اہمیت کا نعم البدل نہیں تھی۔
تبصرہ اعتدال کی میز
مصنوعی ذہانت کا کہنا ہے۔
ماہر معاشیات پوچھتا ہے۔
"X Y بڑھاتا ہے"
چھوڑ دیا متغیر؟ ریورس causality؟
"R-squared زیادہ ہے، ماڈل اچھا ہے"
کیا سلسلہ ساکن ہے؟ جعلی رجعت؟
"p <0.05، اہم"
کیا سائز اقتصادی طور پر اہمیت رکھتا ہے؟
"گتانک 0.3"
کیا اس کی علامت اور اکائی تھیوری سے مطابقت رکھتی ہے؟
"رشتہ مضبوط ہے"
کیا نمونے کا انتخاب متعصب ہے؟
چار کاپی کرنے کے قابل ٹیمپلیٹس
1) ماڈل کی تنصیب کا خاکہ:
میں مندرجہ ذیل معاشی سوال کا جائزہ لوں گا: [سوال]۔ منحصر متغیر: [Y]۔ امیدوار کی وضاحت کرنے والے: [X's]۔ مجھے ایک مناسب ابتدائی ریگریشن سیٹ اپ (statsmodels کوڈ) تجویز کریں۔ وضاحت کریں کہ کن کنٹرول متغیرات کی ضرورت ہے اور کیوں۔ وجہ کا دعوی نہ کریں؛ تعلقات کی زبان استعمال کریں۔
2) تشخیصی ٹیسٹ:
میں نے جو ریگریشن ترتیب دیا ہے اس کے لیے تشخیصی ٹیسٹ کوڈ میں لکھیں: خود کار تعلق، متفاوت، کثیر الجہتی، بقایا جات کی بازی، اور سٹیشناریٹی (اگر یہ ٹائم سیریز ہے)۔ مختصراً لکھیں کہ ہر امتحان کے نتائج کی تشریح کیسے کی جائے اور اگر مسائل ہوں تو کیا کریں۔
3) وجہ کنٹرول:
اس رجعت کے نتیجے کی تشریح کریں، لیکن پہلے ان تین خرابیوں کو چیک کریں: (1) کیا کوئی چھوڑا ہوا متغیر ہو سکتا ہے اور کون سا، (2) ریورس کازلیٹی ممکن ہے، (3) کیا سیریز سٹیشنری ہیں / کیا جعلی رجعت کا خطرہ ہے؟ واضح طور پر بیان کریں کہ آیا نتیجہ کو سبب یا محض تعلق کے طور پر سمجھا جانا چاہئے۔
4) اہمیت و اہمیت کا فرق:
درج ذیل گتانک کی تشریح کریں: قدر [x]، معیاری غلطی [y]، p-value [z]۔ شماریاتی اہمیت کا الگ الگ، اقتصادی اہمیت کا الگ سے جائزہ لیں: کیا اس گتانک کی وسعت عملی طور پر اہم اثر ہے؟ مثال کے منظر نامے میں اثرات کی شدت کو کنکریٹ کریں۔
کمزور فوری / مضبوط اشارہ
کمزور اشارہ:
ان متغیرات کے ساتھ ایک رجعت کریں اور نتیجہ کی تشریح کریں۔
مصنوعی ذہانت تشخیصی ٹیسٹ کیے بغیر یا اسٹیشنریٹی کی جانچ کیے بغیر، اس کی وجہ کی زبان میں تشریح کرتی ہے۔ جعلی رجعت یا چھوڑا ہوا متغیر چھوٹ گیا ہے۔
طاقتور اشارہ:
منحصر متغیر کھپت ہے، وضاحتی آمدنی؛ ماہانہ، ٹرینڈنگ سیریز۔ پہلے سٹیشنریٹی کی جانچ کریں۔ اگر ضروری ہو تو فرق حاصل کریں. رجعت کو ترتیب دیں، تشخیصی ٹیسٹ چلائیں (خودکار تعلق، heteroscedasticity)۔ نتیجہ کی تشریح کرتے وقت چھوڑے گئے متغیرات اور معکوس وجہ کے خطرات پر واضح طور پر بات کریں۔ causal زبان کے بجائے رشتہ دار استعمال کریں۔ اہمیت اور اقتصادی اہمیت کا الگ الگ جائزہ لیں اور ہر قدم کے لیے کوڈ دیں۔
عام غلطیاں
- وجہ کے لیے غلط تعلق۔ سب سے عام اور مہنگی غلطی۔
- کوالٹی کے لیے اعلی R-squared کو غلط سمجھنا۔ یہ جعلی رجعت میں بھی زیادہ ہے۔
- سٹیسس چیک کو نظرانداز کرنا۔ ٹرینڈ سیریز جعلی تعلقات پیدا کرتی ہیں۔
- معنی خیزی کو اہمیت کے ساتھ الجھانا۔ چھوٹے پی کا مطلب بڑا اثر نہیں ہے۔
- تشخیصی ٹیسٹوں کو چھوڑنا۔ مفروضہ کی خلاف ورزی پورے قیاس کو شکست دیتی ہے۔
- AI کی causal زبان کو جیسا ہے قبول کرنا۔ فیصلہ انسان کا ہے۔
خلاصہ میں
رجعت ایک طاقتور لیکن نقصان دہ ٹول ہے۔ گتانک، معیاری خرابی، p-value اور R-squared درست طریقے سے پڑھنا؛ ارتباط اور سبب کے درمیان فرق؛ چھوڑے گئے متغیرات، معکوس وجہ، اور جعلی رجعت کے نقصانات کی جانچ کرنا۔ اہمیت اور معاشی اہمیت میں فرق کرنا ضروری ہے۔ AI کوڈ اور تشخیص کی تیاری میں تیز ہو رہا ہے، لیکن یہ بہت زیادہ معقول طور پر بولتا ہے۔ ماڈل کا انتخاب اور وجہ کا فیصلہ ماہر معاشیات پر منحصر ہے۔
درخواست کا کام
آپ کے پاس موجود ڈیٹا کے ساتھ ایک سادہ رجعت ترتیب دیں (مثلاً کھپت-آمدنی)۔ پہلی ٹیمپلیٹ کے ساتھ سیٹ اپ تیار کریں، اور دوسرے ٹیمپلیٹ کے ساتھ تشخیصی ٹیسٹ تیار کریں۔ پھر ٹیمپلیٹ 3 کے ساتھ وجہ کی جانچ کریں، کم از کم ایک ممکنہ حذف شدہ متغیر اور ایک الٹ وجہ کے منظر نامے کا نام دیں۔ AI کی ابتدائی تشریح سے ایک وجہ جملے کو متعلقہ زبان میں ترجمہ کریں اور تبدیلی کو نوٹ کریں۔
چیک لسٹ
- میں نے گتانک، معیاری خرابی، p-value اور R-squared کو صحیح طور پر پڑھا۔
- [ ] میں نے سیریز کی سٹیشنریٹی کی جانچ کی اور جعلی رجعت کے خطرے کو ختم کر دیا۔
- [ ] میں نے چھوڑے گئے متغیر اور ریورس causality امکانات کا نام دیا ہے۔
- میں نے تشخیصی ٹیسٹ کروائے اور خلاف ورزیوں کا جائزہ لیا۔
- میں نے شماریاتی اہمیت اور معاشی اہمیت کا الگ الگ جائزہ لیا۔
- [] میں نے مصنوعی ذہانت کی وجہ زبان کو متعلقہ زبان میں کھینچا ہے۔
- [ ] میں نے برقرار رکھا کہ ماڈل کا انتخاب اور وجہ کا فیصلہ میرا تھا۔