واحد 4 / 11

رگرسیون خطی: ساخت مدل، تفسیر ضریب و مفروضات

سود:

  • امکان ساخت مدل رگرسیون خطی با پشتیبانی هوش مصنوعی و تفسیر ضرایب، خطاهای استاندارد و R-squared به زبانی دقیق و غیر علی
  • توانایی درک مفروضات اساسی که مدل بر اساس آن ها استوار است (خطی بودن، برون زایی، واریانس ثابت) و اینکه در صورت نقض آنها چه اتفاقی می افتد و استفاده از هوش مصنوعی برای کنترل مفروضات.
  • توانایی تشخیص و تصحیح ادعاهای علّی بیش از حد و مشکلات متغیر نادیده گرفته شده در تفاسیر ضرایب تولید شده توسط هوش مصنوعی

رگرسیون خطی ستون فقرات اقتصاد سنجی و آمار کاربردی است. در ساده‌ترین شکل، چگونگی تغییر یک متغیر وابسته (نتیجه‌ای که می‌خواهید توضیح دهید، مانند درآمد) را از طریق یک رابطه خطی با یک یا چند متغیر مستقل (عوامل توضیحی، مانند سال‌های تحصیل، تجربه) تخمین می‌زند. این مدل دارای شکل است: درآمد = β0 + β1 · آموزش + β2 · تجربه + u. در اینجا ضرایب β (بتا) اندازه رابطه را نشان می دهد و u عبارت خطا (همه اثرات مشاهده نشده) را نشان می دهد که مدل نمی تواند توضیح دهد. در این بخش، خواهیم دید که چگونه هوش مصنوعی (AI) ساخت و تفسیر رگرسیون را سرعت می بخشد، اما چرا تفسیر ضریب جایی است که اغلب اشتباهات مرتکب می شوند.

بیایید هدف اصلی را از ابتدا در نظر بگیریم: هوش مصنوعی کد رگرسیون را می نویسد، جدول خروجی را سازماندهی می کند، یک پیش نویس برای تفسیر ضریب تولید می کند. اما این تصمیم شماست که کدام متغیرها وارد مدل شوند (مشخصات مدل)، اینکه آیا ضریب به عنوان علی یا رابطه ای تفسیر شود، و آیا متغیر نادیده گرفته شده وجود دارد. خطرناک ترین عادت هوش مصنوعی ارائه ضرایب رگرسیون معمولی به زبان علی مانند "X Y را افزایش می دهد" است. در حالی که اکثر رگرسیون ها فقط رابطه (همبستگی) را نشان می دهند.

گردش کار رگرسیون گام به گام

1. مدل را با تئوری بسازید. اینکه کدام متغیر وابسته و کدام مستقل خواهد بود از دانش و نظریه میدانی ناشی می شود نه از آمار. منطق "چه عواملی به طور منطقی بر این نتیجه تأثیر می گذارد؟" منطق "هر چه من در داده ها قرار دهم، ضریب قابل توجه خواهد بود" نیست.

2. حدس بزنید. رایج ترین روش OLS (کمترین مربعات معمولی) است: ضرایب را به گونه ای انتخاب می کند که مجموع اختلاف مجذور بین مقادیر مشاهده شده و پیش بینی شده را به حداقل برساند. هوش مصنوعی کد این ()lm() در R، statsmodels در پایتون) را در حال تولید می کند.

3. خروجی را بخوانید. به دنبال چهار چیز در خروجی رگرسیون باشید: ضریب (جهت و بزرگی رابطه)، خطای استاندارد (عدم قطعیت تخمین ضریب)، آماره t و مقدار p (قدرت شواهد مبنی بر اینکه ضریب متفاوت از صفر است)، R-squared (تغییرات متغیر وابسته مدل از 0 تا ran1 چقدر است). R-squared بالا به معنای "مدل خوب" نیست. اصلا علیت وجود ندارد.

4. ضریب را به درستی تفسیر کنید. اگر ضریب تحصیلات 1200 باشد، تعبیر صحیح این است: «ثابت بودن سایر متغیرها، افزایش یک ساله تحصیلی به طور متوسط ​​با 1200 واحد درآمد بالاتر همراه است». تعبیر نادرست: "یک سال تحصیلی دیگر درآمد را 1200 افزایش می دهد." دوم ادعای علیت است و فقط با طرح مناسب قابل دفاع است (واحد 9).

5. مفروضات را بررسی کنید. اعتبار رگرسیون به مفروضات خاصی بستگی دارد (در زیر). هوش مصنوعی کد تشخیصی تولید می کند. شما نظر بدهید

مفروضات اساسی رگرسیون خطی

مفروضاتی که مدل خطی کلاسیک مبتنی بر آن است، برای اینکه ضرایب بی طرفانه (خط محور) و خطاهای استاندارد قابل اعتماد باشند، ضروری هستند:

  • خطی بودن: رابطه از نظر پارامترها خطی است (در صورت لزوم به صورت لگ/مربع کشیده می شود).
  • برون زایی (میانگین شرطی صفر): عبارت خطا با متغیرهای توضیحی همبستگی ندارد. این مهم ترین و اغلب نقض شده ترین فرض است. نقض سوگیری متغیر حذف شده ایجاد می کند.
  • واریانس ثابت (هماهنگی): واریانس عبارت خطا در همه مشاهدات یکسان است (نقض: ناهمسانی - واحد 5).
  • عدم وجود همبستگی خودکار: خطاها مستقل از یکدیگر هستند (تخلفات مکرر در سری زمانی - واحدهای 5 و 8).
  • عدم وجود چند خطی شدید: متغیرهای توضیحی تقریباً با یکدیگر یکسان نیستند (واحد 5).
احتیاط: خطرناک ترین مشکل نادیده گرفته شدن سوگیری متغیر است. اگر عاملی را از مدل خود حذف کنید که هم به درآمد و هم به تحصیلات مربوط می شود (مثلاً سابقه خانوادگی، توانایی)، ضریب تحصیلات تأثیر این عامل گمشده را می گیرد و متورم می شود. هوش مصنوعی نمی تواند متغیر گم شده را بشناسد. فقط دانش میدانی شما می تواند آن را جذب کند.

جدول مقایسه: تفسیر ضریب درست در مقابل اشتباه

خروجی

تفسیر نادرست (علّی).

تفسیر صحیح (رابطه ای).

ضریب تحصیلات = 1.200

آموزش 1200 افزایش درآمد دارد

"یک سال تحصیل بیشتر، ceteris paribus، با 1200 درآمد بالاتر همراه است."

R² = 0.68

"مدل واقعیت را گرفت"

"68% تغییر توضیح داده شده است؛ علیت را نشان نمی دهد"

p <0.01

"تاثیر بسیار زیاد است"

"شواهد قوی مبنی بر اینکه ضریب با صفر متفاوت است؛ قدر گسسته است"

ضریب منفی

"X Y را کاهش می دهد"

با افزایش X، میانگین Y کاهش می یابد؛ چرا مشکل دیگری وجود دارد؟

چهار فرمان قابل کپی

1. ایجاد کد رگرسیون:

نقش شما: دستیار کد اقتصاد سنجی. من داده ها را به اشتراک نمی گذارم، من کد R را می خواهم. در data.frame 'داده'، درآمد (وابسته)، تحصیلات، تجربه، جنسیت (مقوله). وظیفه: نوشتن کد رگرسیون با lm() برای درآمد ~ تحصیلات + تجربه + جنسیت، نمایش خلاصه خروجی و فاصله اطمینان (محدوده) ضرایب. هر قسمت را با یک خط نظر توضیح دهید. اجرا می کنم و نتیجه را تایید می کنم.

2. طرحی از تفسیر ضریب (به زبان رابطه ای):

خروجی رگرسیون را در زیر تفسیر کنید اما قوانین: - ضرایب را به زبان RELATIONAL بنویسید ("مرتبط با")، از زبان علّی استفاده نکنید، - "متغیرهای دیگر ثابت" را اضافه کنید، - R-squad را به عنوان "علیت" نشان دهید، - معناداری را با اندازه اثر اشتباه نگیرید. خروجی: [جدول چسباندن]

3. کد چک فرضی:

یک کد تشخیص فرضی برای مدل درآمد ~ تحصیلات + تجربه (R) بنویسید: نمودارهای برازش باقیمانده (باقیمانده)، نمودار QQ، توزیع باقیمانده ها. در خط نظر توضیح دهید که هر نمودار کدام فرض را آزمایش می کند. پیشنهاد اصلاح؛ فقط یک تشخیص بدهید و من تصمیم خواهم گرفت.

4. پرس و جوی متغیر از دست رفته:

به من کمک کنید تا خطر سوگیری متغیر نادیده گرفته شده در مدل درآمد ~ آموزش را در نظر بگیرم. متغیرهای احتمالی را که به درآمد و تحصیلات مرتبط هستند، اما در مدل نیستند، فهرست کنید (به عنوان مثال، سابقه خانوادگی، منطقه، توانایی) و توضیح دهید که هر کدام در چه جهتی ممکن است ضریب تحصیلات را تغییر دهند. این یک قطعیت نیست، بگذارید فهرستی از ملاحظات باشد. من تصمیم خواهم گرفت.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

این خروجی رگرسیون را تفسیر کرده و نتایج را توضیح دهید.

این اعلان هوش مصنوعی را منتشر می کند. به احتمال زیاد جملات علّی و اغراق آمیز مانند "آموزش درآمد را افزایش می دهد" و "مدل بسیار موفق" تولید می کند.

اعلان قدرتمند:

نقش شما: دستیار دقیق اقتصاد سنجی. خروجی را تفسیر کنید، اما: (1) همه ضرایب را به زبان رابطه ای بنویسید، (2) از الگوی "all other ceteris paribus" استفاده کنید، (3) R-square را اشتباه نگیرید، (4) اهمیت را از اندازه اثر جدا کنید، (5) به شکست در آزمایش فرض برون زایی مدل و ریسک متغیرهای نادیده گرفته شده توجه کنید. خروجی: [جدول]

تفاوت: اراده قوی، زبان علّی را منع می کند و ابهام و حدود فرض را نمایان می کند.

سه کیف کوچک

مورد 1 - تله زبانی علّی. یکی از تحلیلگران ضریب تبلیغات را در رگرسیون تبلیغاتی ~ فروش خود 2.4 یافت و از طرح هوش مصنوعی به این صورت استفاده کرد: "هر واحدی که صرف تبلیغات می شود، فروش را 2.4 واحد افزایش می دهد." مدیریت بر این اساس بودجه را افزایش داد. در حالی که در دوره های فروش بالا تبلیغات بیشتری وجود داشت (علیت معکوس) و ضریب این را منعکس می کرد. درس: رگرسیون معمولی دلیلی بر علیت نیست. جهت نامشخص است

مورد 2 - متغیر نادیده گرفته شده. در یک مطالعه، ضریب درآمد ~ تحصیلات 1900 بود. هنگامی که تحصیلات والدین و منطقه به مدل اضافه شد، ضریب به 1.150 کاهش یافت. در مدل اول، آموزش عملاً بخشی از تأثیر پیشینه خانواده را بر عهده گرفت. درس: یک متغیر گمشده اما همبسته ضریب را افزایش می دهد. کاستی های احتمالی با دانش دامنه را در نظر بگیرید.

مورد 3 - توهم R-squared بالا. دانش آموزی R²=0.94 را دید و گفت "مدل من عالی است". اما یکی از متغیرهای مستقل تقریباً با متغیر وابسته (اقلامی که قبلاً در فروش گنجانده شده بود) یکسان بود. مدل واقعیت را توضیح نمی داد، بلکه خودش را توضیح می داد. درس: R-squared بالا کیفیت مدل را تضمین نمی کند. بررسی منطق مورد نیاز است.

اشتباهات رایج

  • تفسیر ضریب به صورت علی. زبان "افزایش/کاهش" نادرست است، مگر اینکه با طراحی دفاع شود. بگویید «مرتبط با».
  • نادیده گرفتن متغیر نادیده گرفته شده یک عامل گمشده مرتبط با هر دو X و Y ضریب را تعصب می کند. کاستی های احتمالی را در نظر بگیرید.
  • اشتباه گرفتن R-squared به عنوان معیار موفقیت. R-squared بالا به معنای علیت یا مدل صحیح نیست. حتی ممکن است نشانه ای از نشتی متغیر باشد.
  • اشتباه گرفتن اهمیت با عظمت. p<0.05 نشان نمی دهد که اثر بزرگ است. بزرگی عملی ضریب را نیز ببینید.
  • تفسیر مفروضات بدون بررسی آنها. نقض، خطاهای استاندارد و تفسیر را تحریف می کند. تشخیص را نمی توان از دست داد
نکته: برای هر ضریب، بپرسید "آیا می توانم این رابطه را در جهت مخالف توضیح دهم؟ یا عامل سومی وجود دارد که بر هر دو اثر می گذارد؟" این دو سوال پیش از اینکه قلم کاغذ را لمس کند، تفسیر بیش از حد علی را متوقف می کند.

به طور خلاصه

رگرسیون خطی ابزار اساسی برای اندازه گیری رابطه یک نتیجه با عوامل توضیحی است. هوش مصنوعی به سرعت کد، طرح‌بندی خروجی و طرح کلی تفسیر مدل را تولید می‌کند. اما مشخصات مدل، تفسیر رابطه ای ضریب، و ریسک متغیرهای نادیده گرفته شده بر عهده کارشناس است. رایج ترین اشتباه ارائه ضریب به عنوان علی ("افزایش") است. زبان صحیح رابطه ای است ("مربوط به، ثابت بودن همه چیز"). R-squared بالا موفقیت یا علیت نیست. هیچ تفسیری بدون بررسی مفروضات (به ویژه برون زایی) ایمن نیست.

وظیفه کاربردی

یک رگرسیون با یک متغیر وابسته و حداقل دو متغیر مستقل در یک مجموعه داده تنظیم کنید. کد را از هوش مصنوعی بخواهید و آن را اجرا کنید. ابتدا از هوش مصنوعی بخواهید که ضرایب را به زبان رابطه ای تفسیر کند و سپس هر گزاره علی را بررسی و تصحیح کنید. یک متغیر بالقوه مرتبط به مدل اضافه کنید و مشاهده کنید که چگونه ضریب اصلی تغییر می کند و این را در یک پاراگراف در چارچوب تعصب متغیر حذف شده تفسیر کنید. در نهایت، نمودارهای تشخیصی فرضی را تولید کنید و توجه داشته باشید که کدام فرض محکم و کدام یک مشکوک به نظر می رسد.

چک لیست

  • [ ] من مدل را بر اساس تئوری و دانش میدانی ساختم، نه بر اساس داده ها.
  • [ ] من ضرایب را به زبان رابطه ای ("مربوط به، ceteris paribus") تفسیر کردم.
  • [ ] من متذکر شدم که دعاوی علّی نیاز به طرح جداگانه ای دارد.
  • [ ] من حساسیت ضریب اصلی را با در نظر گرفتن متغیرهای نادیده گرفته شده احتمالی آزمایش کردم.
  • [ ] من مربع R را به عنوان معیار موفقیت/علیت ارائه نکردم.
  • [ ] تولید و تفسیر نمودارهای تشخیصی فرضی. من ارزیابی کردم که آیا تخلفی وجود دارد یا خیر.