Jednotka 7 / 11

Podpora ekonometrického modelu: regresia, príčinná súvislosť a interpretácia

zisky:

  • Schopnosť presne čítať regresný výstup (koeficient, štandardná chyba, p-hodnota, R-štvorec) a kriticky vyhodnotiť interpretáciu umelej inteligencie
  • Schopnosť rozpoznať úskalia, ako je rozdiel medzi koreláciou a príčinnou súvislosťou, endogenita, vynechané premenné a falošná regresia, a obmedziť nadmerný kauzálny jazyk umelej inteligencie
  • Schopnosť používať umelú inteligenciu na nastavenie modelu, návrh kódu a diagnostických testov, pričom zodpovednosť za výber a interpretáciu modelu ponecháva na ľudí

Ekonometria je disciplína testovania ekonomickej teórie s údajmi a jej základným nástrojom je regresia. "O koľko sa zvyšuje spotreba so zvyšujúcim sa príjmom?", "Aký je vzťah medzi úrokmi a investíciami?" Otázky ako tieto sú kvantifikované regresiou. Umelá inteligencia je v tejto oblasti veľmi užitočná a zároveň veľmi nebezpečná: píše kód modelu a diagnostické testy v priebehu niekoľkých sekúnd, ale pri interpretácii výstupu je často príliš kauzálna a príliš presná. Plynule vyslovuje vetu „X zvyšuje Y“; zatiaľ čo väčšina regresií meria iba jeden vzťah. Podstatou tejto jednotky je: Použitie AI na nastavenie modelu, kódovanie a diagnostické testovanie; ale zodpovednosť za výber modelu, posúdenie kauzality a interpretáciu ponechajte na človeku.

Čítanie regresného výstupu

Výstup jednoduchej regresie hľadá štyri veci:

  • Koeficient. Odhad, o koľko sa zmení závislá premenná, keď sa vysvetľujúca premenná zvýši o jednu jednotku. Znamienko (plus/mínus) a veľkosť musia mať ekonomický význam.
  • Štandardná chyba. Neistota odhadu koeficientu; Ak je menší, odhad je presnejší.
  • p-hodnota. Pravdepodobnosť, že koeficient bude taký veľký za predpokladu, že je „v skutočnosti nulový“. Malé p (< 0,05) sa považuje za „štatisticky významné“ – to však neznamená ekonomický význam alebo kauzalitu.
  • R-kvadratický. Akú veľkú časť zmeny závislej premennej vysvetľuje model. Vysoký štvorec R neznamená „správny model“; Môže byť tiež vysoká v falošných regresiách.
Tip: Nezamieňajte si štatistickú významnosť s ekonomickou významnosťou. Aj veľmi malý, prakticky nevýznamný efekt sa môže ukázať ako „významný“ (malé p) vo veľkej vzorke. Po prvé, "Je veľkosť tohto koeficientu ekonomicky dôležitá?" “, potom hľadajte význam.

Korelácia nie je príčinná súvislosť: klasické úskalia

Toto je varovanie v srdci ekonometrie. Vzťah zistený regresiou často nie je kauzalitou. Hlavné úskalia:

  • Vynechaná premenná. Tretí faktor, ktorý ovplyvňuje X aj Y, ale nie je v modeli, vytvára falošný vzťah medzi X a Y. (Príklad: ak sa vo vzťahu medzi vzdelaním a príjmom vynechá „schopnosť“, koeficient bude zavádzajúci.)
  • Reverzná kauzalita (endogenita). Aj keď sa predpokladá, že X ovplyvňuje Y, možno Y ovplyvňuje X alebo sú tieto dve veci vzájomné. (Počet policajtov a kriminalita: zvýšila sa polícia, pretože sa zvýšila kriminalita?)
  • Pseudo regresia. Dve nestacionárne (trendujúce) série môžu poskytnúť vysoké R-kvadratické a významné koeficienty, aj keď medzi nimi neexistuje žiadny skutočný vzťah. Len preto, že obe časom rastú.
  • Skreslenie výberu. Ak vzorka nie je náhodná, vzťah sa meria skreslene.

Tvrdenie o kauzalite môže byť stanovené len s vhodným dizajnom (metódy ako kontrolovaný experiment, prirodzený experiment, inštrumentálna premenná, rozdiel v rozdiele) a jasnými predpokladmi. Umelá inteligencia často postráda túto jemnosť.

Upozornenie: Ak AI povie „táto premenná zvyšuje/znižuje toto“, okamžite zabrzdite. Problém: Sú nejaké premenné vynechané? Je možná spätná kauzalita? Sú série stacionárne? Do správy nevstúpi žiadna príčinná veta, kým nie sú položené tieto tri otázky.

Diagnostické testy

Aby bola regresia spoľahlivá, testujú sa jej predpoklady: vzor rezíduí (chybové členy) (autokorelácia), heteroskedasticita (heteroskedasticita), multikolinearita (vysvetľujúce premenné sú si navzájom veľmi podobné), normálne rozdelenie. Umelá inteligencia píše kód pre tieto testy; ale úlohou ekonóma je interpretovať výsledky a podľa toho upraviť model.

tri mini prípady

Prípad 1 – Falošná regresia. Výskumník regresoval dva trendové rady (jeden nominálny výdavok, jeden nominálny iná veličina); R-kvadrát bol 0,98, koeficient bol vysoko významný. AI „je silný vzťah,“ povedal. Výskumník testoval stacionárnosť: obe série boli nestacionárne. Keď sa rozišli, vzťah do značnej miery zmizol. Vysoká R-kvadratúra bola jednoducho preto, že obe časom rástli. Zachytená falošná regresia.

Prípad 2 – Vynechaná premenná. Jedna analýza zistila, že „výdavky na reklamu zvyšujú predaj“. Ekonóm sa opýtal: je v modeli sezónny efekt? Nebolo. Reklama aj predaj pred sviatkom rástli; Súčasťou vzťahu bola sezónnosť. Keď sa pridali sezónne fiktívne premenné, koeficient reklamy sa zmenšil. Kauzálne tvrdenie bolo zmiernené.

Prípad 3 – Významný, ale nevýznamný. Vo veľkom súbore mikroúdajov bol koeficient p<0,001; AI "silný vplyv," povedal. Ale veľkosť koeficientu bola prakticky zanedbateľná (veľká zmena príjmov posunula výsledok o tisícinu). Ekonóm to správne označil za „štatisticky významné, ale ekonomicky nevýznamné“. Význam nenahrádzal dôležitosť.

Tabuľka moderovania komentárov

hovorí umelá inteligencia

Pýta sa ekonóm

"X zvyšuje Y"

Vynechaná premenná? Obrátená kauzalita?

„R-štvorec je vysoký, model je dobrý“

Sú série stacionárne? Falošná regresia?

"p<0,05, významné"

Záleží na veľkosti ekonomicky?

"Koeficient 0,3"

Sú jeho znak a jednotka kompatibilné s teóriou?

"Vzťah je silný"

Je výber vzorky neobjektívny?

Štyri kopírovateľné šablóny

1) Schéma inštalácie modelu:

Preskúmam nasledujúcu ekonomickú otázku: [otázka]. Závislá premenná: [Y]. Deskriptory kandidátov: [X]. Navrhnite mi vhodné počiatočné nastavenie regresie (kód statsmodels). Vysvetlite, ktoré riadiace premenné sú potrebné a prečo. NEVYHLASUJTE kauzalitu; Používajte vzťahový jazyk.

2) Diagnostické testy:

Napíšte kódom diagnostické testy pre mnou nastavenú regresiu: autokoreláciu, heteroskedasticitu, multikolinearitu, disperziu rezíduí a stacionaritu (ak ide o časový rad). Stručne napíšte, ako interpretovať každý výsledok testu a čo robiť, ak sa vyskytnú problémy.

3) Kontrola príčinnosti:

Interpretujte tento výsledok regresie, ale najprv skontrolujte tieto tri úskalia: (1) mohla by existovať vynechaná premenná a ktorá, (2) je možná reverzná kauzalita, (3) sú série stacionárne / existuje riziko falošnej regresie? Jasne uveďte, či sa má výsledok interpretovať ako kauzálny alebo iba relačný.

4) Rozdiel medzi významom a dôležitosťou:

Interpretujte nasledujúci koeficient: hodnota [x], smerodajná chyba [y], p-hodnota [z]. Samostatne hodnotiť štatistickú významnosť, zvlášť ekonomickú významnosť: je veľkosť tohto koeficientu prakticky významným vplyvom? Konkretizujte veľkosť vplyvu v príklade scenára.

Slabá výzva / Silná výzva

Slabá výzva:

Vykonajte regresiu s týmito premennými a interpretujte výsledok.

Umelá inteligencia ho interpretuje v kauzálnom jazyku bez vykonania diagnostických testov alebo kontroly stacionárnosti; chýba falošná regresia alebo vynechaná premenná.

Výkonná výzva:

Závislou premennou je spotreba, vysvetľujúci príjem; mesačné, trendové série. Najprv otestujte stacionárnosť; v prípade potreby získajte rozdiel. Nastavte regresiu, vykonajte diagnostické testy (autokorelácia, heteroskedasticita). Explicitne diskutujte o rizikách vynechaných premenných a reverznej kauzality pri interpretácii výsledku; Používajte skôr vzťahový ako kauzálny jazyk. Vyhodnoťte význam a ekonomický význam samostatne a uveďte kód pre každý krok.

Časté chyby

  • Nesprávna korelácia s príčinnou súvislosťou. Najčastejšia a najdrahšia chyba.
  • Zamieňanie vysokého štvorca R za kvalitu. Je tiež vysoká v falošných regresiách.
  • Obídenie kontroly stázy. Trendové série vytvárajú falošné vzťahy.
  • Zamieňanie zmysluplnosti s významom. Malé p neznamená veľký účinok.
  • Vynechanie diagnostických testov. Porušený predpoklad poráža celý záver.
  • Akceptovanie kauzálneho jazyka AI tak, ako je. Súd patrí človeku.

V súhrne

Regresia je mocný, ale úskalia. Koeficient čítania, štandardná chyba, p-hodnota a R-kvadratúra správne; rozlišovanie medzi koreláciou a kauzalitou; kontrola vynechaných premenných, spätná kauzalita a falošné úskalia regresie; Je potrebné rozlišovať medzi významom a ekonomickým významom. AI zrýchľuje generovanie kódu a diagnózy, ale hovorí príliš kauzálne; Výber modelu a posúdenie kauzality spočíva na ekonómovi.

Aplikačná úloha

Nastavte si jednoduchú regresiu s údajmi, ktoré máte (napr. spotreba-príjem). Nechajte si vytvoriť nastavenie pomocou 1. šablóny a diagnostické testy pomocou 2. šablóny. Potom skontrolujte kauzalitu pomocou šablóny 3, pomenujte aspoň jednu možnú vynechanú premennú a jeden scenár spätnej kauzality. Preložte príčinnú vetu z pôvodnej interpretácie AI do relačného jazyka a všimnite si zmenu.

kontrolný zoznam

  • [ ] Správne som prečítal koeficient, smerodajnú chybu, p-hodnotu a R-kvadratúru.
  • [ ] Skontroloval som stacionárnosť série a eliminoval som riziko falošnej regresie.
  • [ ] Vynechanú premennú som pomenoval a možnosti spätnej kauzality.
  • [ ] Spustil som diagnostické testy a vyhodnotil som porušenia.
  • [ ] Štatistickú významnosť a ekonomickú významnosť som hodnotila samostatne.
  • [ ] Kauzálny jazyk umelej inteligencie som vtiahol do relačného jazyka.
  • [ ] Tvrdil som, že výber modelu a posúdenie kauzality je na mne.