Единица 7 / 11

Поддержка эконометрической модели: регрессия, причинно-следственная связь и интерпретация

Прибыль:

  • Способность точно считывать результаты регрессии (коэффициент, стандартная ошибка, значение p, R-квадрат) и критически оценивать интерпретацию искусственного интеллекта.
  • Способность распознавать ловушки, такие как различие корреляции и причинно-следственной связи, эндогенность, пропущенные переменные и ложная регрессия, а также обуздать чрезмерный причинный язык искусственного интеллекта.
  • Возможность использовать искусственный интеллект для настройки модели, разработки кода и диагностических тестов, оставляя ответственность за выбор и интерпретацию модели людям.

Эконометрика — это дисциплина проверки экономической теории на данных, а регрессия — ее основной инструмент. «Насколько увеличивается потребление по мере увеличения дохода?», «Какова связь между процентом и инвестициями?» Подобные вопросы количественно оцениваются с помощью регрессии. ИИ одновременно очень полезен и очень опасен в этой области: он пишет код модели и диагностические тесты за считанные секунды, но часто слишком каузален и слишком точен при интерпретации результатов. Свободно произносит предложение «X увеличивает Y»; тогда как большинство регрессий измеряют только одно отношение. Суть этого модуля такова: используйте искусственный интеллект для настройки модели, кода и диагностического тестирования; но оставьте ответственность за выбор модели, суждение о причинно-следственной связи и интерпретацию на человеке.

Чтение вывода регрессии

В результате простой регрессии учитываются четыре вещи:

  • Коэффициент. Оценка того, насколько изменится зависимая переменная, когда объясняющая переменная увеличится на одну единицу. Знак (плюс/минус) и величина должны иметь экономическое значение.
  • Стандартная ошибка. Неопределенность оценки коэффициента; Если оно меньше, оценка будет более точной.
  • p-значение. Вероятность того, что коэффициент окажется таким большим, при условии, что он «фактически равен нулю». Малый p (<0,05) считается «статистически значимым», но это не подразумевает экономическую значимость или причинно-следственную связь.
  • R-квадрат. Какую часть изменения зависимой переменной объясняет модель. Высокий R-квадрат не означает «правильную модель»; Он также может быть высоким в ложных регрессиях.
Совет: не путайте статистическую значимость с экономической значимостью. Даже очень небольшой, практически незначительный эффект может оказаться «значительным» (маленькое р) в большой выборке. Во-первых, «Важен ли размер этого коэффициента с экономической точки зрения?» ', затем ищите значение.

Корреляция — это не причинно-следственная связь: классические ошибки

Это предостережение, лежащее в основе эконометрики. Отношения, обнаруженные с помощью регрессии, часто не являются причинно-следственными. Основные подводные камни:

  • Пропущенная переменная. Третий фактор, который влияет как на X, так и на Y, но не присутствует в модели, создает ложную связь между X и Y. (Пример: если во взаимосвязи между образованием и доходом опустить «способности», коэффициент будет вводить в заблуждение.)
  • Обратная причинность (эндогенность). Хотя считается, что X влияет на Y, возможно, Y влияет на X, или они взаимны. (Количество полиции и преступность: увеличилось ли число полицейских из-за роста преступности?)
  • Псевдорегрессия. Два нестационарных (трендовых) ряда могут давать высокие R-квадраты и значимые коэффициенты, даже если между ними нет реальной связи. Просто потому, что они оба со временем растут.
  • Предвзятость выбора. Если выборка не случайна, соотношение измеряется с искажением.

Утверждение о причинной связи может быть установлено только при наличии соответствующего плана (такие методы, как контролируемый эксперимент, естественный эксперимент, инструментальная переменная, разница-в-разнице) и четких предположений. Искусственный интеллект часто упускает эту тонкость.

Внимание: если ИИ говорит: «Эта переменная увеличивает/уменьшает эту», немедленно тормозите. Проблема: пропущены ли какие-либо переменные? Возможна ли обратная причинно-следственная связь? Серия стационарна? Ни одно причинное предложение не будет включено в отчет до тех пор, пока не будут заданы эти три вопроса.

Диагностические тесты

Чтобы регрессия была надежной, проверяются ее предположения: характер остатков (членов ошибок) (автокорреляция), гетероскедастичность (гетероскедастичность), мультиколлинеарность (объяснительные переменные очень похожи друг на друга), нормальное распределение. Искусственный интеллект пишет код для этих тестов; но задача экономиста — интерпретировать результаты и соответствующим образом корректировать модель.

три мини-кейса

Случай 1 — Ложная регрессия. Исследователь провел регрессию двух рядов тенденций (один номинальный расход, другой номинальный другой количественный); R-квадрат составил 0,98, коэффициент оказался высокозначимым. ИИ «представляет собой прочные отношения», сказал он. Исследователь проверил стационарность: обе серии были нестационарными. После того, как они расстались, отношения практически исчезли. Высокий R-квадрат был обусловлен просто тем, что они оба со временем выросли. Ложная регрессия обнаружена.

Случай 2 — Пропущенная переменная. Один анализ показал, что «расходы на рекламу увеличивают продажи». Экономист спросил: есть ли в модели сезонный эффект? Не было. Перед праздником и реклама, и продажи росли; Частично связь была сезонной. Когда были добавлены фиктивные переменные сезона, коэффициент рекламы стал меньше. Причинно-следственная связь была смягчена.

Случай 3 — Значительный, но незначительный. В большом наборе микроданных коэффициент составил p<0,001; ИИ «сильное воздействие», сказал он. Но величина коэффициента была практически незначительна (большое изменение дохода сдвигало результат на одну тысячную). Экономист правильно сформулировал это как «статистически значимое, но экономически незначительное». Значимость не заменяла важность.

Таблица модерации комментариев

искусственный интеллект говорит

Экономист спрашивает

«X увеличивает Y»

Пропущенная переменная? Обратная причинно-следственная связь?

«R-квадрат высокий, модель хорошая»

Серия стационарна? Фейковая регрессия?

«p<0,05, значимо»

Имеет ли размер значение с экономической точки зрения?

«Коэффициент 0,3»

Совместимы ли его знак и единица измерения с теорией?

«Отношения крепкие»

Является ли выборка предвзятой?

Четыре копируемых шаблона

1) Эскиз установки модели:

Я рассмотрю следующий экономический вопрос: [вопрос]. Зависимая переменная: [Y]. Дескрипторы кандидатов: [X]. Предложите мне подходящую начальную настройку регрессии (код statsmodels). Объясните, какие управляющие переменные необходимы и почему. НЕ заявляйте о причинно-следственной связи; Используйте язык отношений.

2) Диагностические исследования:

Напишите в коде диагностические тесты для созданной мной регрессии: автокорреляция, гетероскедастичность, мультиколлинеарность, дисперсия остатков и стационарность (если это временной ряд). Напишите кратко, как интерпретировать каждый результат теста и что делать, если возникли проблемы.

3) Причинно-следственный контроль:

Интерпретируйте этот результат регрессии, но сначала проверьте эти три ошибки: (1) может ли быть пропущена переменная и какая, (2) возможна ли обратная причинно-следственная связь, (3) является ли ряд стационарным / существует ли риск ложной регрессии? Четко укажите, следует ли интерпретировать результат как причинно-следственный или просто как относительный.

4) Различие значимости-важности:

Интерпретируйте следующий коэффициент: значение [x], стандартная ошибка [y], значение p [z]. Оцените статистическую значимость отдельно, экономическую значимость отдельно: является ли величина этого коэффициента практически значимым эффектом? Конкретизируйте масштабы воздействия на примере сценария.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Выполните регрессию с этими переменными и интерпретируйте результат.

Искусственный интеллект интерпретирует его на причинном языке, не проводя диагностических тестов и не проверяя стационарность; ложная регрессия или пропущенная переменная пропущена.

Мощная подсказка:

Зависимая переменная — потребление, объясняющий доход; ежемесячная трендовая серия. Сначала проверьте стационарность; получить разницу, если необходимо. Настройте регрессию, запустите диагностические тесты (автокорреляция, гетероскедастичность). Подробно обсудите риски, связанные с пропущенными переменными и обратной причинно-следственной связью при интерпретации результата; Используйте реляционный, а не причинный язык. Оцените значимость и экономическую значимость отдельно и дайте код каждому этапу.

Распространенные ошибки

  • Принятие корреляции за причинно-следственную связь. Самая распространенная и самая дорогая ошибка.
  • Принятие высокого R-квадрата за качество. Также высок уровень ложных регрессий.
  • Обход проверки стазиса. Трендовые ряды создают ложные связи.
  • Путать осмысленность со значимостью. Маленькое p не означает большого эффекта.
  • Пропуск диагностических тестов. Нарушенное предположение сводит на нет весь вывод.
  • Принятие причинного языка ИИ таким, какой он есть. Суд принадлежит человеку.

В заключение

Регрессия — мощный, но ошибочный инструмент. Коэффициент чтения, стандартная ошибка, значение p и R-квадрат правильно; различие между корреляцией и причинно-следственной связью; проверка пропущенных переменных, обратной причинно-следственной связи и ошибок ложной регрессии; Необходимо различать значимость и экономическую значимость. ИИ ускоряется в генерировании кодов и диагнозов, но он говорит слишком причинно; Выбор модели и суждение о причинности остается за экономистом.

Задача приложения

Настройте простую регрессию с имеющимися у вас данными (например, потребление-доход). Выполните настройку с использованием 1-го шаблона, а диагностические тесты — с помощью 2-го шаблона. Затем проверьте причинно-следственную связь с помощью шаблона 3, назвав хотя бы одну возможную пропущенную переменную и один сценарий обратной причинно-следственной связи. Переведите причинное предложение из первоначальной интерпретации ИИ на реляционный язык и отметьте изменение.

контрольный список

  • [ ] Я правильно прочитал коэффициент, стандартную ошибку, значение p и R-квадрат.
  • [ ] Я проверил стационарность ряда и устранил риск ложной регрессии.
  • [ ] Я назвал пропущенную переменную и возможности обратной причинности.
  • [ ] Я провел диагностические тесты и оценил нарушения.
  • [ ] Я оценивал статистическую значимость и экономическую значимость отдельно.
  • [ ] Я перевел причинный язык искусственного интеллекта в реляционный язык.
  • [ ] Я утверждал, что выбор модели и суждение о причинности были моими.