Jednostka 7 / 11

Wsparcie modelu ekonometrycznego: regresja, związek przyczynowy i interpretacja

Zyski:

  • Możliwość dokładnego odczytania wyników regresji (współczynnik, błąd standardowy, wartość p, kwadrat R) i krytycznej oceny interpretacji sztucznej inteligencji
  • Umiejętność rozpoznawania pułapek, takich jak rozróżnienie korelacja-przyczyna, endogeniczność, pominięte zmienne i fałszywa regresja, a także powstrzymywania nadmiernego języka przyczynowego sztucznej inteligencji
  • Możliwość wykorzystania sztucznej inteligencji do konfiguracji modelu, tworzenia kodu i testów diagnostycznych, pozostawiając odpowiedzialność za wybór i interpretację modelu ludziom

Ekonometria to dyscyplina polegająca na testowaniu teorii ekonomii za pomocą danych, a regresja jest jej podstawowym narzędziem. „O ile wzrasta konsumpcja wraz ze wzrostem dochodów?”, „Jaki jest związek między odsetkami a inwestycjami?” Pytania takie jak te są określane ilościowo za pomocą regresji. Sztuczna inteligencja jest w tym obszarze zarówno bardzo przydatna, jak i bardzo niebezpieczna: zapisuje kod modelu i testy diagnostyczne w ciągu kilku sekund, ale często interpretuje wyniki w sposób zbyt przyczynowy i zbyt precyzyjny. Płynnie wypowiada zdanie „X zwiększa Y”; podczas gdy większość regresji mierzy tylko jedną relację. Istotą tej jednostki jest: wykorzystanie sztucznej inteligencji do konfiguracji modelu, kodowania i testowania diagnostycznego; ale przenieś odpowiedzialność za wybór modelu, ocenę przyczynowości i interpretację na człowieka.

Odczyt wyniku regresji

Wyniki prostej regresji szukają czterech rzeczy:

  • Współczynnik. Oszacowanie, jak bardzo zmienia się zmienna zależna, gdy zmienna objaśniająca wzrasta o jedną jednostkę. Znak (plus/minus) i wielkość muszą mieć znaczenie ekonomiczne.
  • Standardowy błąd. Niepewność oszacowania współczynnika; Jeśli jest mniejsza, oszacowanie jest dokładniejsze.
  • wartość p. Prawdopodobieństwo, że współczynnik będzie tak duży przy założeniu, że wynosi „właściwie zero”. Mówi się, że małe p (< 0,05) jest „istotne statystycznie” – ale nie oznacza to znaczenia ekonomicznego ani związku przyczynowego.
  • R-kwadrat. Jaką część zmiany zmiennej zależnej wyjaśnia model. Wysoki współczynnik R-kwadrat nie oznacza „poprawnego modelu”; Może być również wysoki w przypadku pozornych regresji.
Wskazówka: Nie myl znaczenia statystycznego ze znaczeniem ekonomicznym. Nawet bardzo mały, praktycznie nieistotny efekt może okazać się „istotny” (małe p) w dużej próbie. Po pierwsze: „Czy wielkość tego współczynnika jest istotna ekonomicznie?” ', a następnie poszukaj znaczenia.

Korelacja nie jest przyczyną: klasyczne pułapki

To jest zastrzeżenie leżące u podstaw ekonometrii. Związek stwierdzony metodą regresji często nie jest związkiem przyczynowym. Główne pułapki:

  • Pominięta zmienna. Trzeci czynnik, który wpływa zarówno na X, jak i Y, ale nie występuje w modelu, tworzy fałszywy związek między X i Y. (Przykład: jeśli w relacji między wykształceniem a dochodami pominie się „zdolności”, współczynnik będzie wprowadzał w błąd).
  • Odwrotna przyczynowość (endogeniczność). Chociaż uważa się, że X wpływa na Y, być może Y wpływa na X lub jedno i drugie jest wzajemne. (Liczby policji i przestępczość: czy policja wzrosła z powodu wzrostu przestępczości?)
  • Pseudoregresja. Dwie niestacjonarne (trenujące) serie mogą dawać wysokie współczynniki R-kwadrat i znaczące, nawet jeśli nie ma między nimi rzeczywistego związku. Tylko dlatego, że oba z czasem rosną.
  • Błąd selekcji. Jeśli próbka nie jest losowa, zależność mierzy się jako skośną.

Twierdzenie o przyczynowości można ustalić jedynie przy odpowiednim projekcie (metody takie jak eksperyment kontrolowany, eksperyment naturalny, zmienna instrumentalna, różnica w różnicy) i jasnych założeniach. Sztuczna inteligencja często pomija tę subtelność.

Uwaga: jeśli sztuczna inteligencja powie „ta zmienna zwiększa/zmniejsza tę wartość”, natychmiast hamuj. Problem: Czy pominięto jakieś zmienne? Czy możliwa jest odwrotna przyczynowość? Czy szeregi są stacjonarne? Do raportu nie zostanie wpisany żaden wyrok przyczynowy, dopóki nie zostaną zadane te trzy pytania.

Testy diagnostyczne

Aby regresja była wiarygodna, sprawdzane są jej założenia: wzór reszt (składniki błędu) (autokorelacja), heteroskedastyczność (heteroskedastyczność), współliniowość (zmienne objaśniające są do siebie bardzo podobne), rozkład normalny. Sztuczna inteligencja pisze kod tych testów; jednak zadaniem ekonomisty jest interpretacja wyników i odpowiednie dostosowanie modelu.

trzy mini etui

Przypadek 1 – Regresja pozorna. Badacz dokonał regresji dwóch serii trendów (jeden wydatek nominalny, drugi nominalny inna wielkość); R-kwadrat wyniósł 0,98, współczynnik był wysoce istotny. Sztuczna inteligencja „to silna relacja” – powiedział. Badacz sprawdził stacjonarność: obie serie były niestacjonarne. Kiedy zostali rozdzieleni, związek w dużej mierze zniknął. Wysokie R-kwadrat wynikało po prostu z tego, że oba rosły z biegiem czasu. Wykryto fałszywą regresję.

Przypadek 2 — Zmienna pominięta. Jedna z analiz wykazała, że ​​„wydatki na reklamę zwiększają sprzedaż”. Ekonomista zadał pytanie: czy w modelu występuje efekt sezonowy? Nie było. Zarówno reklama, jak i sprzedaż rosły przed wakacjami; Częścią związku była sezonowość. Kiedy dodano zmienne fikcyjne sezonu, współczynnik reklamy stał się mniejszy. Twierdzenie przyczynowe zostało złagodzone.

Przypadek 3 — Znaczące, ale nieistotne. W dużym zestawie mikrodanych współczynnik wynosił p<0,001; Sztuczna inteligencja ma „silny wpływ” – powiedział. Jednak wielkość współczynnika była praktycznie znikoma (duża zmiana dochodów przesunęła wynik o jedną tysięczną). Ekonomista słusznie określił to jako „statystycznie istotne, ale nieistotne ekonomicznie”. Znaczenie nie zastąpiło znaczenia.

Tabela moderacji komentarzy

mówi sztuczna inteligencja

– pyta ekonomista

„X zwiększa Y”

Pominięta zmienna? Odwrócona przyczynowość?

„R-kwadrat jest wysoki, model jest dobry”

Czy szeregi są stacjonarne? Fałszywa regresja?

„p<0,05, istotne”

Czy rozmiar ma znaczenie ekonomiczne?

„Współczynnik 0,3”

Czy jego znak i jednostka są zgodne z teorią?

„Relacja jest silna”

Czy dobór próby jest stronniczy?

Cztery szablony do kopiowania

1) Szkic instalacji modelu:

Zbadam następującą kwestię ekonomiczną: [pytanie]. Zmienna zależna: [Y]. Deskryptory kandydatów: [X]. Zaproponuj mi odpowiednią początkową konfigurację regresji (kod statsmodels). Wyjaśnij, które zmienne kontrolne są potrzebne i dlaczego. NIE powołuj się na związek przyczynowy; Używaj języka relacji.

2) Badania diagnostyczne:

Zapisz w kodzie testy diagnostyczne dla ustawionej przeze mnie regresji: autokorelacja, heteroskedastyczność, wieloliniowość, rozproszenie reszt i stacjonarność (jeśli jest to szereg czasowy). Napisz krótko, jak interpretować każdy wynik testu i co zrobić, jeśli pojawią się problemy.

3) Kontrola przyczynowości:

Zinterpretuj wynik regresji, ale najpierw sprawdź trzy pułapki: (1) czy może istnieć pominięta zmienna i która z nich, (2) czy możliwa jest odwrotna przyczynowość, (3) czy szereg jest stacjonarny / czy istnieje ryzyko fałszywej regresji? Należy jasno określić, czy wynik należy interpretować jako przyczynowy, czy jedynie relacyjny.

4) Rozróżnienie istotność-ważność:

Zinterpretuj następujący współczynnik: wartość [x], błąd standardowy [y], wartość p [z]. Oceniaj osobno znaczenie statystyczne, osobno znaczenie ekonomiczne: czy wielkość tego współczynnika jest efektem istotnym praktycznie? Konkretnie określ wielkość wpływu w przykładowym scenariuszu.

Słaba zachęta/silna zachęta

Słaba zachęta:

Wykonaj regresję z tymi zmiennymi i zinterpretuj wynik.

Sztuczna inteligencja interpretuje to w języku przyczynowym, bez przeprowadzania testów diagnostycznych i sprawdzania stacjonarności; pominięto fałszywą regresję lub pominiętą zmienną.

Potężny monit:

Zmienną zależną jest konsumpcja, dochód objaśniający; comiesięczne, popularne serie. Najpierw sprawdź stacjonarność; uzyskaj różnicę, jeśli to konieczne. Ustaw regresję, przeprowadź testy diagnostyczne (autokorelacja, heteroskedastyczność). Podczas interpretacji wyniku wyraźnie omów ryzyko związane z pominiętymi zmiennymi i odwróć związek przyczynowy; Używaj języka relacyjnego, a nie przyczynowego. Oceń oddzielnie znaczenie i znaczenie ekonomiczne i podaj kod dla każdego etapu.

Typowe błędy

  • Mylenie korelacji z przyczynowością. Najczęstszy i najdroższy błąd.
  • Mylenie wysokiego R-kwadratu z jakością. Charakteryzuje się także dużą liczbą fałszywych regresji.
  • Ominięcie kontroli stazy. Popularne seriale tworzą fałszywe relacje.
  • Mylisz sens z znaczeniem. Małe p nie oznacza dużego efektu.
  • Pomijanie badań diagnostycznych. Naruszone założenie obala całe wnioskowanie.
  • Akceptowanie przyczynowego języka AI takim, jakim jest. Sąd należy do człowieka.

Podsumowując

Regresja to potężne, ale pułapkowe narzędzie. Poprawny współczynnik odczytu, błąd standardowy, wartość p i kwadrat R; rozróżnienie korelacji i przyczynowości; sprawdzanie pominiętych zmiennych, odwrotnej przyczynowości i fałszywych pułapek regresji; Należy rozróżnić znaczenie od znaczenia gospodarczego. Sztuczna inteligencja przyspiesza generowanie kodu i diagnoz, ale przemawia zbyt przyczynowo; Wybór modelu i ocena przyczynowości należy do ekonomisty.

Zadanie aplikacji

Skonfiguruj prostą regresję na podstawie posiadanych danych (np. dochodów z konsumpcji). Zlecić wykonanie konfiguracji przy użyciu pierwszego szablonu i wykonanie testów diagnostycznych przy użyciu drugiego szablonu. Następnie sprawdź związek przyczynowy za pomocą szablonu 3, podając co najmniej jedną możliwą pominiętą zmienną i jeden scenariusz odwrotnej przyczynowości. Przetłumacz zdanie przyczynowe z początkowej interpretacji AI na język relacyjny i zanotuj zmianę.

lista kontrolna

  • [ ] Odczytałem poprawnie współczynnik, błąd standardowy, wartość p i R-kwadrat.
  • [ ] Sprawdziłem stacjonarność szeregu i wyeliminowałem ryzyko fałszywej regresji.
  • [ ] Nazwałem pominiętą zmienną i możliwościami odwrotnej przyczynowości.
  • [ ] Przeprowadziłem badania diagnostyczne i oceniłem naruszenia.
  • [ ] Oceniałem oddzielnie istotność statystyczną i ekonomiczną.
  • [ ] Przeniosłem język przyczynowy sztucznej inteligencji do języka relacyjnego.
  • [ ] Utrzymywałem, że wybór modelu i ocena przyczynowości należy do mnie.