Yksikkö 7 / 11

Ekonometrisen mallin tuki: Regressio, syy-yhteys ja tulkinta

Voitot:

  • Kyky lukea tarkasti regression tulos (kerroin, keskivirhe, p-arvo, R-neliö) ja arvioida kriittisesti tekoälyn tulkintaa
  • Kyky tunnistaa sudenkuopat, kuten korrelaatio-syy-yhteys, endogeenisuus, pois jätetyt muuttujat ja harhaanjohtava regressio, ja hillitä tekoälyn liiallista kausaalikieltä
  • Kyky käyttää tekoälyä mallin asettamiseen, koodin ja diagnostisten testien laatimiseen, jättäen mallin valinnan ja tulkinnan vastuun ihmisille

Ekonometria on talousteorian testaus tiedolla, ja regressio on sen perustyökalu. "Kuinka paljon kulutus lisääntyy tulojen kasvaessa?", "Mikä on koron ja investointien suhde?" Tällaiset kysymykset kvantifioidaan regressiolla. Tekoäly on sekä erittäin hyödyllinen että erittäin vaarallinen tällä alueella: se kirjoittaa mallikoodin ja diagnostiset testit sekunneissa, mutta on usein liian kausaalinen ja liian tarkka tulosten tulkinnassa. Puhuu lauseen "X lisää Y" sujuvasti; kun taas useimmat regressiot mittaavat vain yhtä suhdetta. Tämän yksikön ydin on: Käytä tekoälyä mallin määrittämiseen, koodiin ja diagnostisiin testauksiin; mutta pidä vastuu mallin valinnasta, kausaalisuuden arvioinnista ja tulkinnasta ihmisellä.

Regression tulosteen lukeminen

Yksinkertaisen regression tulos etsii neljää asiaa:

  • Kerroin. Arvio siitä, kuinka paljon riippuva muuttuja muuttuu, kun selittävä muuttuja kasvaa yhdellä yksiköllä. Merkillä (plus/miinus) ja suuruudella on oltava taloudellinen merkitys.
  • Normaali virhe. Kertoimen estimaatin epävarmuus; Jos se on pienempi, arvio on tarkempi.
  • p-arvo. Todennäköisyys sille, että kerroin näyttää näin suurelta olettaen, että se on "todella nolla". Pienen p:n (< 0,05) sanotaan olevan "tilastollisesti merkitsevä" – mutta tämä ei tarkoita taloudellista merkitystä tai kausaalisuutta.
  • R-neliö. Kuinka suuren osan riippuvan muuttujan muutoksesta malli selittää. Korkea R-neliö ei tarkoita "oikeaa mallia"; Se voi myös olla korkea harhaanjohtavissa regressioissa.
Vinkki: Älä sekoita tilastollista merkitsevyyttä taloudelliseen merkitykseen. Jopa hyvin pieni, käytännössä merkityksetön vaikutus voi osoittautua "merkittäväksi" (pieni p) suuressa otoksessa. Ensinnäkin "Onko tämän kertoimen koko taloudellisesti tärkeä?" ', etsi sitten merkitystä.

Korrelaatio ei ole syy-yhteyttä: klassiset sudenkuopat

Tämä on ekonometriikan ytimessä oleva varoitus. Regression avulla löydetty suhde ei useinkaan ole kausaalisuutta. Tärkeimmät sudenkuopat:

  • Poistettu muuttuja. Kolmas tekijä, joka vaikuttaa sekä X:ään että Y:ään, mutta joka ei ole mallissa, luo väärän suhteen X:n ja Y:n välille. (Esimerkki: jos "kyky" jätetään pois koulutuksen ja tulojen välisestä suhteesta, kerroin on harhaanjohtava.)
  • Käänteinen kausaalisuus (endogeenisyys). Vaikka ajatellaan, että X vaikuttaa Y:ään, ehkä Y vaikuttaa X:ään tai nämä kaksi ovat toisiaan. (Poliisimäärät ja rikollisuus: lisääntyivätkö poliisit, koska rikollisuus lisääntyi?)
  • Pseudoregressio. Kaksi ei-stationaarista (trendissä olevaa) sarjaa voivat tuottaa korkeita R-neliöjä ja merkitseviä kertoimia, vaikka niiden välillä ei ole todellista yhteyttä. Vain siksi, että ne molemmat kasvavat ajan myötä.
  • Valintaharha. Jos otos ei ole satunnainen, suhde mitataan vinoon.

Väite syy-seuraussuhteesta voidaan vahvistaa vain asianmukaisella suunnittelulla (menetelmillä, kuten kontrolloitu koe, luonnollinen koe, instrumentaalinen muuttuja, ero-in-ero) ja selkein olettamuksin. Tekoäly kaipaa usein tämän hienovaraisuuden.

Varoitus: Jos tekoäly sanoo "tämä muuttuja lisää/vähentää sitä", jarruta välittömästi. Ongelma: Onko muuttujia jätetty pois? Onko käänteinen syy-yhteys mahdollinen? Ovatko sarjat paikallaan? Mikään syy-lause ei sisälly raporttiin ennen kuin nämä kolme kysymystä on esitetty.

Diagnostiset testit

Jotta regressio olisi luotettava, testataan sen oletuksia: residuaalien malli (virhetermit) (autokorrelaatio), heteroskedastisuus (heteroskedastisuus), multikollineaarisuus (selitysmuuttujat ovat hyvin samankaltaisia keskenään), normaalijakauma. Tekoäly kirjoittaa koodin näitä testejä varten; mutta taloustieteilijän tehtävä on tulkita tuloksia ja muokata mallia sen mukaan.

kolme minilaukkua

Tapaus 1 – Valheellinen regressio. Tutkija regressi kaksi trendisarjaa (yksi nimellinen kulutus, yksi nimellinen toinen määrä); R-neliö oli 0,98, kerroin oli erittäin merkitsevä. AI "on vahva suhde", hän sanoi. Tutkija testasi stationaarisuutta: molemmat sarjat olivat ei-stationaarisia. Kun he erosivat, suhde suurelta osin katosi. Korkea R-neliö johtui yksinkertaisesti siitä, että ne molemmat kasvoivat ajan myötä. Valheellinen regressio kiinni.

Tapaus 2 – Poistettu muuttuja. Eräässä analyysissä havaittiin, että "mainontakulut lisäävät myyntiä". Taloustieteilijä kysyi: onko mallissa kausiluonteista vaikutusta? Ei ollut. Sekä mainonta että myynti kasvoivat ennen lomaa; Osa suhteesta oli kausiluonteisuutta. Kun kausimuuttujat lisättiin, mainonnan kerroin pieneni. Syy-seurausväitettä on lievennetty.

Tapaus 3 – Merkittävä mutta merkityksetön. Suuressa mikrodatajoukossa kerroin oli p<0,001; AI "voimakas vaikutus", hän sanoi. Mutta kertoimen suuruus oli käytännössä mitätön (suuri tulonmuutos siirsi tulosta tuhannesosan). Taloustieteilijä muotoili sen oikein "tilastollisesti merkittäväksi, mutta taloudellisesti merkityksettömäksi". Merkitys ei korvannut tärkeyttä.

Kommenttien moderointitaulukko

tekoäly sanoo

Taloustieteilijä kysyy

"X lisää Y"

Jäikö muuttuja pois? Käänteinen syy-yhteys?

"R-neliö on korkea, malli on hyvä"

Ovatko sarjat paikallaan? Väärä regressio?

"p<0,05, merkitsevä"

Onko koolla taloudellisesti väliä?

"Kerroin 0,3"

Ovatko sen merkki ja yksikkö yhteensopivat teorian kanssa?

"Suhde on vahva"

Onko näytteen valinta puolueellinen?

Neljä kopioitavaa mallia

1) Mallin asennuspiirros:

Tarkastelen seuraavaa taloudellista kysymystä: [kysymys]. Riippuva muuttuja: [Y]. Ehdokaskuvaajat: [X:t]. Ehdota minulle sopivaa alkuperäistä regressioasetusta (statsmodels-koodi). Selitä, mitä ohjausmuuttujia tarvitaan ja miksi. ÄLÄ väitä syy-yhteyttä; Käytä suhdekieltä.

2) Diagnostiset testit:

Kirjoita koodiin määrittämäni regression diagnostiset testit: autokorrelaatio, heteroskedastisuus, multikollineaarisuus, residuaalien dispersio ja stationaarisuus (jos kyseessä on aikasarja). Kirjoita lyhyesti, miten jokainen testitulos tulkitaan ja mitä tehdä, jos ilmenee ongelmia.

3) Syy-seuraus:

Tulkitse tämä regression tulos, mutta tarkista ensin nämä kolme sudenkuoppaa: (1) voiko muuttuja olla pois jätetty ja mikä niistä, (2) onko käänteinen kausaalisuus mahdollinen, (3) ovatko sarjat paikallaan / onko väärän regression riski? Kerro selkeästi, onko tulos tulkittava kausaaliseksi vai vain suhteelliseksi.

4) Merkitys-tärkeys ero:

Tulkitse seuraava kerroin: arvo [x], standardivirhe [y], p-arvo [z]. Arvioi tilastollinen merkitsevyys erikseen, taloudellinen merkitys erikseen: onko tämän kertoimen suuruudella käytännössä merkittävä vaikutus? Konkreettisesti vaikutuksen suuruus esimerkkiskenaariossa.

Heikko kehote / Vahva kehote

Heikko kehote:

Tee regressio näillä muuttujilla ja tulkitse tulos.

Tekoäly tulkitsee sen kausaalikielellä suorittamatta diagnostisia testejä tai tarkistamatta paikallaan olemista; virheellinen regressio tai pois jätetty muuttuja puuttuu.

Tehokas kehotus:

Riippuva muuttuja on kulutus, selittävä tulo; kuukausittaiset trendisarjat. Testaa ensin paikallaan pysyvyys; saada ero tarvittaessa. Aseta regressio, suorita diagnostisia testejä (autokorrelaatio, heteroskedastisuus). Keskustele eksplisiittisesti pois jätettyjen muuttujien riskeistä ja käänteisestä kausaalisuudesta tulosta tulkittaessa; Käytä relaatiokieltä kausaalisen sijaan. Arvioi merkittävyys ja taloudellinen merkitys erikseen ja anna kunkin vaiheen koodi.

Yleisiä virheitä

  • Virheellinen korrelaatio syy-yhteydelle. Yleisin ja kallein virhe.
  • Ymmärrän korkean R-neliön laadun. Siinä on myös paljon vääriä regressioita.
  • Pysähdystarkastuksen ohittaminen. Trendikäs sarjat luovat vääriä suhteita.
  • Sekoita mielekkyys merkitykseen. Pieni p ei tarkoita suurta vaikutusta.
  • Diagnostisten testien ohittaminen. Rikkoutunut oletus kumoaa koko päättelyn.
  • Tekoälyn kausaalikielen hyväksyminen sellaisenaan. Tuomio kuuluu ihmiselle.

Yhteenvetona

Regressio on tehokas, mutta sudenkuopan työkalu. Lukukerroin, keskivirhe, p-arvo ja R-neliö oikein; korrelaation ja syy-yhteyden erottaminen; pois jätettyjen muuttujien, käänteisen syy-yhteyden ja väärän regression sudenkuopat tarkistaminen; On tarpeen tehdä ero merkittävyyden ja taloudellisen merkityksen välillä. Tekoäly kiihtyy koodin ja diagnoosin luomisessa, mutta se puhuu liian kausaalisesti; Mallin valinta ja syy-yhteyden arviointi on taloustieteilijällä.

Sovellustehtävä

Määritä yksinkertainen regressio omistamillasi tiedoilla (esim. kulutus-tulot). Anna asetukset tuotettu 1. mallilla ja diagnostiset testit 2. mallilla. Tarkista sitten kausaalisuus mallilla 3 ja nimeä vähintään yksi mahdollinen pois jätetty muuttuja ja yksi käänteinen kausaalisuusskenaario. Käännä kausaalinen lause tekoälyn alkuperäisestä tulkinnasta relaatiokielelle ja pane merkille muutos.

tarkistuslista

  • [ ] Luin kertoimen, keskivirheen, p-arvon ja R-neliön oikein.
  • [ ] Tarkastin sarjan stationaarisuuden ja eliminoin väärän regression riskin.
  • [ ] Nimesin pois jätetyn muuttujan ja käänteisen kausaalisuuden mahdollisuuksiksi.
  • [ ] Tein diagnostisia testejä ja arvioin rikkomuksia.
  • [ ] Arvioin tilastollisen ja taloudellisen merkityksen erikseen.
  • [ ] Olen piirtänyt tekoälyn kausaalikielen relaatiokieleen.
  • [ ] Väitin, että mallin valinta ja syy-seurausarvio oli minun.