одиниця 7 / 11

Підтримка економетричної моделі: регресія, причинно-наслідковий зв’язок та інтерпретація

Прибуток:

  • Здатність точно читати результати регресії (коефіцієнт, стандартна помилка, p-значення, R-квадрат) і критично оцінювати інтерпретацію штучного інтелекту
  • Здатність розпізнавати підводні камені, такі як відмінність кореляції та причинно-наслідкового зв’язку, ендогенність, пропущені змінні та фальшива регресія, а також приборкати надмірну причинно-наслідкову мову штучного інтелекту
  • Можливість використовувати штучний інтелект для налаштування моделі, коду та складання діагностичних тестів, залишаючи відповідальність за вибір та інтерпретацію моделі людям

Економетрика — це дисципліна перевірки економічної теорії за допомогою даних, а регресія — її основний інструмент. «Наскільки зростає споживання зі збільшенням доходу?», «Який зв’язок між процентом та інвестиціями?» Подібні питання кількісно визначаються регресією. Штучний інтелект одночасно дуже корисний і дуже небезпечний у цій сфері: він пише код моделі та діагностичні тести за лічені секунди, але часто є надмірно причинно-наслідковим і надто точним під час інтерпретації результату. Вільно говорить речення «X збільшує Y»; тоді як більшість регресій вимірюють лише одне співвідношення. Суть цього блоку полягає в наступному: використовувати ШІ для налаштування моделі, коду та діагностичного тестування; але покладіть відповідальність за вибір моделі, судження про причинно-наслідкові зв’язки та інтерпретацію на людину.

Вихід регресії читання

Вихід простої регресії шукає чотири речі:

  • Коефіцієнт. Оцінка того, наскільки змінюється залежна змінна, коли пояснювальна змінна збільшується на одну одиницю. Знак (плюс/мінус) і величина повинні мати економічне значення.
  • Стандартна помилка. Невизначеність оцінки коефіцієнта; Якщо він менший, оцінка точніша.
  • р-значення. Імовірність того, що коефіцієнт виявиться таким великим за умови, що він «фактично дорівнює нулю». Невеликий р (<0,05) вважається «статистично значущим», але це не означає економічного значення чи причинного зв’язку.
  • R-квадрат. Яку частину зміни залежної змінної пояснює модель. Високий R-квадрат не означає «правильну модель»; Він також може бути високим у фальшивих регресіях.
Порада: не плутайте статистичну значущість з економічною значущістю. Навіть дуже малий, практично незначний ефект може виявитися «значним» (мале p) у великій вибірці. По-перше, "Чи розмір цього коефіцієнта є економічно важливим?" ', потім шукайте значення.

Кореляція не є причинно-наслідковим зв’язком: класичні підводні камені

Це застереження в основі економетрики. Відношення, виявлені регресією, часто не є причинно-наслідковими зв'язками. Основні підводні камені:

  • Пропущена змінна. Третій фактор, який впливає як на X, так і на Y, але його немає в моделі, створює фальшивий зв’язок між X і Y. (Приклад: якщо «здібності» опущено у зв’язку між освітою та доходом, коефіцієнт буде оманливим.)
  • Зворотна причинність (ендогенність). Хоча вважається, що X впливає на Y, можливо, Y впливає на X або вони взаємні. (Кількість міліції та злочинність: чи збільшилася кількість міліції через зростання злочинності?)
  • Псевдорегресія. Два нестаціонарні (трендові) ряди можуть давати високі R-квадрат і значні коефіцієнти, навіть якщо між ними немає реального зв’язку. Просто тому, що вони обидва з часом ростуть.
  • Упередженість відбору. Якщо вибірка не є випадковою, співвідношення вимірюється спотвореним.

Твердження про причинно-наслідковий зв’язок можна встановити лише за допомогою відповідного дизайну (таких методів, як контрольований експеримент, природний експеримент, інструментальна змінна, різниця в різниці) і чітких припущень. Штучний інтелект часто пропускає цю тонкість.

Застереження: якщо штучний інтелект говорить «ця змінна збільшує/зменшує це», негайно гальмуйте. Проблема: чи є якісь змінні пропущені? Чи можлива зворотна причинність? Серії стаціонарні? Жодне причинне речення не входить до звіту, доки не буде поставлено ці три питання.

Діагностичні дослідження

Щоб регресія була надійною, перевіряються її припущення: модель залишків (терми помилок) (автокореляція), гетероскедастичність (heteroskedasticity), мультиколінеарність (пояснювальні змінні дуже схожі одна на одну), нормальний розподіл. Штучний інтелект пише код для цих тестів; але інтерпретація результатів і відповідне коригування моделі – робота економіста.

три міні-чохла

Випадок 1 — Фальшива регресія. Дослідник регресував два ряди тенденцій (одна номінальна витрата, одна номінальна інша кількість); R-квадрат був 0,98, коефіцієнт був дуже значущим. За його словами, штучний інтелект — це міцні стосунки. Дослідник перевірив стаціонарність: обидва ряди були нестаціонарними. Після того, як вони розлучилися, стосунки в основному зникли. Високий R-квадрат був просто тому, що вони обидва виросли з часом. Виявлено фальшиву регресію.

Випадок 2 — пропущена змінна. Один аналіз показав, що «витрати на рекламу збільшують продажі». Економіст запитав: чи є в моделі сезонний ефект? Не було. Перед святом зростала і реклама, і продажі; Частиною зв’язку була сезонність. Коли були додані сезонні фіктивні змінні, коефіцієнт реклами став меншим. Причинний позов було пом'якшено.

Випадок 3 — Значний, але незначний. У великому наборі мікроданих коефіцієнт був p<0,001; ШІ «сильний вплив», сказав він. Але величина коефіцієнта була практично незначною (велика зміна доходу змінила результат на одну тисячну). Економіст правильно сформулював це як «статистично значуще, але економічно незначуще». Важливість не заміняла важливість.

Таблиця модерації коментарів

говорить штучний інтелект

– запитує економіст

"X збільшує Y"

Пропущена змінна? Зворотна причинність?

"R-квадрат високий, модель хороша"

Серії стаціонарні? Фальшива регресія?

"p<0,05, достовірно"

Чи має розмір економічне значення?

«Коефіцієнт 0,3»

Чи сумісні його знак і одиниця з теорією?

«Стосунки міцні»

Чи упереджений вибір зразка?

Чотири шаблони, які можна копіювати

1) Ескіз установки моделі:

Я розгляну наступне економічне питання: [питання]. Залежна змінна: [Y]. Дескриптори кандидатів: [X]. Запропонуйте мені відповідне початкове налаштування регресії (код statsmodels). Поясніть, які керуючі змінні потрібні і для чого. НЕ заявляйте про причинність; Використовуйте мову стосунків.

2) Діагностичні тести:

Запишіть у коді діагностичні тести для встановленої мною регресії: автокореляція, гетероскедастичність, мультиколінеарність, дисперсія залишків і стаціонарність (якщо це часовий ряд). Напишіть коротко, як інтерпретувати кожен результат тесту та що робити, якщо є проблеми.

3) Контроль причинності:

Інтерпретуйте цей результат регресії, але спочатку перевірте ці три підводні камені: (1) чи може існувати пропущена змінна та яка саме, (2) чи можлива зворотна причинність, (3) чи є ряд стаціонарним/чи існує ризик фальшивої регресії? Чітко вкажіть, чи слід інтерпретувати результат як причинно-наслідковий чи просто як відношення.

4) Розрізнення значущість-важливість:

Інтерпретуйте такий коефіцієнт: значення [x], стандартна помилка [y], p-значення [z]. Оцініть статистичну значущість окремо, економічну значущість окремо: чи є величина цього коефіцієнта практично значущим ефектом? Конкретизуйте величину впливу в прикладі сценарію.

Слабка підказка / Сильна підказка

Слабка підказка:

Виконайте регресію з цими змінними та інтерпретуйте результат.

Штучний інтелект інтерпретує це на причинно-наслідковій мові, не виконуючи діагностичних тестів і не перевіряючи стаціонарність; помилкова регресія або пропущена змінна пропущена.

Потужна підказка:

Залежною змінною є споживання, пояснювальний дохід; щомісяця, популярні серії. Спочатку перевірте стаціонарність; отримати різницю, якщо необхідно. Налаштуйте регресію, запустіть діагностичні тести (автокореляція, гетероскедастичність). Чітко обговоріть ризики пропущених змінних і зворотного причинно-наслідкового зв’язку під час інтерпретації результату; Використовуйте реляційну, а не причинно-наслідкову мову. Оцініть значення та економічну значимість окремо та вкажіть код для кожного кроку.

Поширені помилки

  • Помилково приймаючи кореляцію за причинно-наслідковий зв’язок. Найпоширеніша і найдорожча помилка.
  • Помилково приймаючи високий R-квадрат за якість. Він також високий у фальшивих регресіях.
  • Обхід перевірки застою. Модні серіали створюють фальшиві стосунки.
  • Плутання значущості зі значущістю. Мале p не означає великий ефект.
  • Пропуск діагностичних тестів. Порушене припущення руйнує весь висновок.
  • Прийняття причинної мови штучного інтелекту як є. Суд належить людині.

Підсумовуючи

Регресія є потужним, але невдалим інструментом. Коефіцієнт читання, стандартна помилка, p-значення та R-квадрат правильно; розрізняти кореляцію та причинно-наслідковий зв’язок; перевірка пропущених змінних, зворотного причинно-наслідкового зв’язку та хибних помилок регресії; Необхідно розрізняти значущість і економічну важливість. ШІ прискорюється у створенні коду та діагностики, але він говорить занадто причинно; Вибір моделі та оцінка причинно-наслідкового зв’язку залишається за економістом.

Аплікаційне завдання

Налаштуйте просту регресію з даними, які у вас є (наприклад, споживання-дохід). Виготовте налаштування за 1-м шаблоном, а діагностичні тести — за 2-м шаблоном. Потім перевірте причинність за допомогою шаблону 3, назвавши принаймні одну можливу пропущену змінну та один сценарій зворотного причинно-наслідкового зв’язку. Перекладіть причинне речення з початкової інтерпретації AI на реляційну мову та зверніть увагу на зміни.

контрольний список

  • [ ] Я правильно прочитав коефіцієнт, стандартну помилку, p-значення та R-квадрат.
  • [] Я перевірив стаціонарність ряду та усунув ризик помилкової регресії.
  • [ ] Я назвав пропущену змінну та можливості зворотної причинності.
  • [ ] Я провів діагностичні тести та оцінив порушення.
  • [ ] Я оцінив статистичну значущість та економічну значущість окремо.
  • [ ] Я звернув причинну мову штучного інтелекту до реляційної мови.
  • [ ] Я стверджував, що вибір моделі та судження про причинність були моїми.