Jednotka 7 / 11

Podpora ekonometrických modelů: regrese, příčinné souvislosti a interpretace

zisky:

  • Schopnost přesně číst regresní výstup (koeficient, standardní chyba, p-hodnota, R-kvadrát) a kriticky vyhodnotit interpretaci umělé inteligence
  • Schopnost rozpoznat úskalí, jako je rozdíl mezi korelací a kauzalitou, endogenita, vynechané proměnné a falešná regrese, a omezit přílišný kauzální jazyk umělé inteligence
  • Schopnost používat umělou inteligenci pro nastavení modelu, navrhování kódu a diagnostických testů, přičemž odpovědnost za výběr a interpretaci modelu ponechává na lidech

Ekonometrie je disciplína testování ekonomické teorie s daty a regrese je jejím základním nástrojem. "Jak moc se zvyšuje spotřeba, když se zvyšuje příjem?", "Jaký je vztah mezi úroky a investicemi?" Otázky jako tyto jsou kvantifikovány regresí. Umělá inteligence je v této oblasti velmi užitečná i velmi nebezpečná: zapisuje kód modelu a diagnostické testy během několika sekund, ale při interpretaci výstupu je často příliš kauzální a příliš přesná. Plynule vyslovuje větu „X zvyšuje Y“; zatímco většina regresí měří pouze jeden vztah. Podstata této jednotky je: Použití umělé inteligence pro nastavení modelu, testování kódu a diagnostiky; ale ponechte odpovědnost za výběr modelu, posouzení kauzality a interpretaci na člověku.

Čtení regresního výstupu

Výstup jednoduché regrese hledá čtyři věci:

  • Součinitel. Odhad, jak moc se závislá proměnná změní, když se vysvětlující proměnná zvýší o jednu jednotku. Znaménko (plus/minus) a velikost musí mít ekonomický význam.
  • Standardní chyba. Nejistota odhadu koeficientu; Pokud je menší, je odhad přesnější.
  • p-hodnota. Pravděpodobnost, že se koeficient objeví takto velký za předpokladu, že je „ve skutečnosti nulový“. Malé p (< 0,05) je považováno za „statisticky významné“ — to však neznamená ekonomický význam nebo kauzalitu.
  • R-kvadrát. Jak velkou část změny v závislé proměnné model vysvětluje. Vysoký čtverec R neznamená „správný model“; Může být také vysoká u falešných regresí.
Tip: Nezaměňujte statistickou významnost s významností ekonomickou. I velmi malý, prakticky nevýznamný efekt se může ve velkém vzorku ukázat jako „významný“ (malé p). Za prvé: "Je velikost tohoto koeficientu ekonomicky důležitá?" “, pak hledejte význam.

Korelace není kauzalita: klasická úskalí

Toto je varování v srdci ekonometrie. Vztah nalezený regresí často není kauzalita. Hlavní úskalí:

  • Vynechaná proměnná. Třetí faktor, který ovlivňuje X i Y, ale není v modelu, vytváří falešný vztah mezi X a Y. (Příklad: pokud se ve vztahu mezi vzděláním a příjmem vynechá „schopnost“, bude koeficient zavádějící.)
  • Reverzní kauzalita (endogenita). I když se předpokládá, že X ovlivňuje Y, možná Y ovlivňuje X nebo jsou tyto dva vzájemné. (Počet policie a kriminalita: zvýšila se policie, protože vzrostla kriminalita?)
  • Pseudo regrese. Dvě nestacionární (trendující) řady mohou poskytnout vysoké R-kvadráty a významné koeficienty, i když mezi nimi neexistuje žádný skutečný vztah. Už jen proto, že oba časem rostou.
  • Předpojatost výběru. Pokud vzorek není náhodný, je vztah měřen zkresleně.

Tvrzení o kauzalitě lze stanovit pouze pomocí vhodného návrhu (metody jako řízený experiment, přirozený experiment, instrumentální proměnná, rozdíl v rozdílu) a jasných předpokladů. Umělá inteligence tuto jemnost často postrádá.

Upozornění: Pokud AI řekne „tato proměnná zvyšuje/snižuje toto“, okamžitě zabrzděte. Problém: Jsou vynechány nějaké proměnné? Je možná zpětná kauzalita? Jsou série stacionární? Do zprávy nevstoupí žádná příčinná věta, dokud nejsou položeny tyto tři otázky.

Diagnostické testy

Aby byla regrese spolehlivá, jsou testovány její předpoklady: vzor reziduí (chybové členy) (autokorelace), heteroskedasticita (heteroskedasticita), multikolinearita (vysvětlující proměnné jsou si navzájem velmi podobné), normální rozdělení. Umělá inteligence píše kód pro tyto testy; ale je úkolem ekonoma interpretovat výsledky a podle toho upravit model.

tři mini pouzdra

Případ 1 – Nepravá regrese. Výzkumník regresoval dvě trendové řady (jedna nominální výdaje, jedna nominální jiná veličina); R-kvadrát byl 0,98, koeficient byl vysoce významný. AI „je silný vztah,“ řekl. Výzkumník testoval stacionárnost: obě řady byly nestacionární. Jakmile se rozešli, vztah z velké části zmizel. Vysoké R-kvadrát bylo jednoduše proto, že oba postupem času rostli. Podvržená regrese zachycena.

Případ 2 – Vynechaná proměnná. Jedna analýza zjistila, že „výdaje na reklamu zvyšují prodeje“. Ekonom se zeptal: je v modelu sezónní efekt? Nebylo. Reklama i prodej před prázdninami rostly; Součástí vztahu byla sezónnost. Když byly přidány sezónní fiktivní proměnné, koeficient reklamy se zmenšil. Kauzální tvrzení bylo zmírněno.

Případ 3 — Významný, ale nevýznamný. Ve velkém souboru mikrodat byl koeficient p<0,001; AI „silný dopad,“ řekl. Ale velikost koeficientu byla prakticky zanedbatelná (velká změna příjmů posunula výsledek o jednu tisícinu). Ekonom to správně označil za „statisticky významné, ale ekonomicky nevýznamné“. Význam nenahrazoval důležitost.

Tabulka moderování komentářů

říká umělá inteligence

Ptá se ekonom

"X zvyšuje Y"

Vynechaná proměnná? Reverzní kauzalita?

"R-kvadrát je vysoký, model je dobrý"

Jsou série stacionární? Falešná regrese?

"p<0,05, významné"

Záleží na velikosti ekonomicky?

"Koeficient 0,3"

Jsou jeho znak a jednotka kompatibilní s teorií?

"Vztah je silný"

Je výběr vzorků neobjektivní?

Čtyři kopírovatelné šablony

1) Náčrt instalace modelu:

Budu zkoumat následující ekonomickou otázku: [otázka]. Závislá proměnná: [Y]. Deskriptory kandidátů: [X's]. Navrhněte mi vhodné počáteční nastavení regrese (kód statsmodels). Vysvětlete, které řídicí proměnné jsou potřebné a proč. NENÁMLUJTE kauzalitu; Používejte vztahový jazyk.

2) Diagnostické testy:

Napište kódem diagnostické testy pro mnou nastavenou regresi: autokorelaci, heteroskedasticitu, multikolinearitu, disperzi reziduí a stacionaritu (pokud se jedná o časovou řadu). Napište stručně, jak interpretovat každý výsledek testu a co dělat v případě problémů.

3) Kontrola kauzality:

Interpretujte tento výsledek regrese, ale nejprve zkontrolujte tato tři úskalí: (1) mohla by existovat vynechaná proměnná a která, (2) je možná reverzní kauzalita, (3) jsou řady stacionární / existuje riziko falešné regrese? Jasně uveďte, zda má být výsledek interpretován jako kauzální nebo pouze vztahový.

4) Rozdíl mezi významem a důležitostí:

Interpretujte následující koeficient: hodnota [x], směrodatná chyba [y], p-hodnota [z]. Samostatně hodnotit statistickou významnost, zvlášť ekonomickou významnost: má velikost tohoto koeficientu prakticky významný vliv? Konkretujte velikost dopadu v příkladu scénáře.

Slabá výzva / Silná výzva

Slabá výzva:

Proveďte regresi s těmito proměnnými a interpretujte výsledek.

Umělá inteligence jej interpretuje v kauzálním jazyce, aniž by prováděla diagnostické testy nebo kontrolovala stacionaritu; falešná regrese nebo vynechaná proměnná chybí.

Výkonná výzva:

Závislou proměnnou je spotřeba, vysvětlující důchod; měsíční, trendy série. Nejprve otestujte stacionárnost; v případě potřeby získat rozdíl. Nastavte regresi, proveďte diagnostické testy (autokorelace, heteroskedasticita). Explicitně prodiskutujte rizika vynechaných proměnných a obrácené kauzality při interpretaci výsledku; Používejte spíše vztahový než kauzální jazyk. Vyhodnoťte význam a ekonomický význam samostatně a uveďte kód pro každý krok.

Časté chyby

  • Záměna korelace za příčinnou souvislost. Nejčastější a nejdražší chyba.
  • Zaměna vysokého R-kvadrátu za kvalitu. Je také vysoká v falešných regresích.
  • Vynechání kontroly stáze. Trendy seriály vytvářejí falešné vztahy.
  • Zaměňování smysluplnosti s významem. Malé p neznamená velký účinek.
  • Vynechání diagnostických testů. Porušený předpoklad maří celý závěr.
  • Přijetí kauzálního jazyka AI tak, jak je. Soud patří člověku.

V souhrnu

Regrese je mocný, ale úskalí. Koeficient čtení, směrodatná chyba, p-hodnota a R-squared správně; rozlišování mezi korelací a kauzalitou; kontrola vynechaných proměnných, obrácená kauzalita a falešná úskalí regrese; Je třeba rozlišovat mezi významem a ekonomickým významem. AI zrychluje generování kódu a diagnózy, ale mluví příliš kauzálně; Volba modelu a posouzení kauzality spočívá na ekonomovi.

Aplikační úkol

Nastavte jednoduchou regresi s údaji, které máte (např. spotřeba-příjem). Nechte vytvořit nastavení pomocí 1. šablony a diagnostické testy pomocí 2. šablony. Poté zkontrolujte kauzalitu pomocí šablony 3, pojmenujte alespoň jednu možnou vynechanou proměnnou a jeden scénář obrácené kauzality. Přeložte kauzální větu z původní interpretace AI do relačního jazyka a poznamenejte si změnu.

kontrolní seznam

  • [ ] Koeficient, směrodatnou chybu, p-hodnotu a R-squared jsem přečetl správně.
  • [ ] Zkontroloval jsem stacionaritu série a eliminoval jsem riziko falešné regrese.
  • [ ] Pojmenoval jsem vynechanou proměnnou a možnosti obrácené kauzality.
  • [ ] Provedl jsem diagnostické testy a vyhodnotil porušení.
  • [ ] Statistickou významnost a ekonomickou významnost jsem hodnotila samostatně.
  • [ ] Vtáhl jsem kauzální jazyk umělé inteligence do relačního jazyka.
  • [ ] Tvrdil jsem, že volba modelu a posouzení kauzality je moje.