Eenheid 7 / 11

Ondersteuning van econometrische modellen: regressie, causaliteit en interpretatie

Winst:

  • Mogelijkheid om de regressie-uitvoer nauwkeurig te lezen (coëfficiënt, standaardfout, p-waarde, R-kwadraat) en de interpretatie van kunstmatige intelligentie kritisch te evalueren
  • Vermogen om valkuilen te herkennen, zoals het onderscheid tussen correlatie en causaliteit, endogeniteit, weggelaten variabelen en valse regressie, en de buitensporige causale taal van kunstmatige intelligentie te beteugelen
  • Mogelijkheid om kunstmatige intelligentie te gebruiken voor het opzetten van modellen, het opstellen van codes en het opstellen van diagnostische tests, waarbij de verantwoordelijkheid voor modelselectie en interpretatie aan mensen wordt overgelaten

Econometrie is de discipline van het testen van economische theorieën met data, en regressie is het basisinstrument ervan. "Hoeveel neemt de consumptie toe als het inkomen stijgt?", "Wat is de relatie tussen rente en investeringen?" Vragen als deze worden gekwantificeerd door regressie. AI is op dit gebied zowel zeer nuttig als zeer gevaarlijk: het schrijft modelcode en diagnostische tests in enkele seconden, maar is vaak te causaal en te nauwkeurig bij het interpreteren van de output. Spreekt vloeiend de zin "X verhoogt Y"; terwijl de meeste regressies slechts één relatie meten. De essentie van dit apparaat is: Gebruik AI voor het instellen van modellen, coderen en diagnostische tests; maar houd de verantwoordelijkheid voor modelselectie, causaliteitsoordeel en interpretatie bij de mens.

Regressie-uitvoer lezen

De uitvoer van een eenvoudige regressie zoekt naar vier dingen:

  • Coëfficiënt. Een schatting van hoeveel de afhankelijke variabele verandert wanneer de verklarende variabele met één eenheid toeneemt. Het teken (plus/min) en de grootte moeten een economische betekenis hebben.
  • Standaard fout. De onzekerheid van de coëfficiëntschatting; Als deze kleiner is, is de schatting nauwkeuriger.
  • p-waarde. De waarschijnlijkheid dat de coëfficiënt zo groot lijkt onder de veronderstelling dat deze "eigenlijk nul" is. Van kleine p (< 0,05) wordt gezegd dat deze “statistisch significant” is – maar dit impliceert geen economische significantie of causaliteit.
  • R-kwadraat. Hoeveel van de verandering in de afhankelijke variabele het model verklaart. Een hoog R-kwadraat betekent niet het "juiste model"; Het kan ook hoog zijn bij valse regressies.
Tip: Verwar statistische significantie niet met economische significantie. Zelfs een heel klein, vrijwel onbeduidend effect kan in een grote steekproef ‘significant’ (kleine p) blijken te zijn. Ten eerste: "Is de omvang van deze coëfficiënt economisch belangrijk?" ', zoek dan naar betekenis.

Correlatie is geen oorzakelijk verband: klassieke valkuilen

Dit is het voorbehoud dat centraal staat in de econometrie. De relatie die door regressie wordt gevonden, is vaak geen causaliteit. Grote valkuilen:

  • Weggelaten variabele. Een derde factor die zowel X als Y beïnvloedt, maar niet in het model voorkomt, creëert een valse relatie tussen X en Y. (Voorbeeld: als 'bekwaamheid' wordt weggelaten in de relatie tussen opleiding en inkomen, zal de coëfficiënt misleidend zijn.)
  • Omgekeerde causaliteit (endogeniteit). Hoewel men denkt dat X Y beïnvloedt, beïnvloedt Y misschien X of zijn de twee wederzijds. (Politieaantallen en misdaad: is de politie toegenomen omdat de misdaad toenam?)
  • Pseudo-regressie. Twee niet-stationaire (trending) reeksen kunnen hoge R-kwadraat- en significante coëfficiënten opleveren, ook al bestaat er geen echte relatie tussen beide. Gewoon omdat ze allebei in de loop van de tijd groeien.
  • Selectie bias. Als de steekproef niet willekeurig is, wordt de relatie scheef gemeten.

De claim van causaliteit kan alleen worden bevestigd met een passend ontwerp (methoden zoals gecontroleerd experiment, natuurlijk experiment, instrumentele variabele, verschil-in-verschil) en duidelijke aannames. Kunstmatige intelligentie mist deze subtiliteit vaak.

Let op: Als de AI zegt "deze variabele verhoogt/verlaagt dat", rem dan onmiddellijk. Probleem: Zijn er variabelen weggelaten? Is omgekeerde causaliteit mogelijk? Staan de series stil? Er komt geen causaal vonnis in het rapport totdat deze drie vragen zijn gesteld.

Diagnostische tests

Om een regressie betrouwbaar te laten zijn, worden de aannames ervan getest: patroon van residuen (fouttermen) (autocorrelatie), heteroskedasticiteit (heteroskedasticiteit), multicollineariteit (verklarende variabelen lijken erg op elkaar), normale verdeling. Kunstmatige intelligentie schrijft de code voor deze tests; maar het is de taak van de econoom om de resultaten te interpreteren en het model dienovereenkomstig aan te passen.

drie minikoffers

Geval 1 — Onechte regressie. Een onderzoeker heeft twee trendreeksen teruggedraaid (één nominale uitgaven, één nominale andere hoeveelheid); R-kwadraat was 0,98, de coëfficiënt was zeer significant. AI “is een sterke relatie”, zei hij. De onderzoeker testte op stationariteit: beide reeksen waren niet-stationair. Toen ze eenmaal gescheiden waren, verdween de relatie grotendeels. Het hoge R-kwadraat kwam eenvoudigweg doordat ze allebei in de loop van de tijd groeiden. Valse regressie opgevangen.

Geval 2 — Weggelaten variabele. Uit één analyse bleek dat ‘reclame-uitgaven de omzet verhogen’. De econoom vroeg: zit er een seizoenseffect in het model? Dat was er niet. Zowel de reclame als de verkoop stegen vóór de vakantie; Een deel van de relatie was seizoensinvloeden. Toen seizoensdummyvariabelen werden toegevoegd, werd de reclamecoëfficiënt kleiner. De causale claim is verzacht.

Geval 3 – Significant maar onbelangrijk. In een grote microdataset was de coëfficiënt p<0,001; AI “sterke impact”, zei hij. Maar de omvang van de coëfficiënt was praktisch te verwaarlozen (een grote verandering in het inkomen verplaatste het resultaat met een duizendste). De econoom omschreef het terecht als ‘statistisch significant maar economisch onbelangrijk’. Betekenis was geen vervanging voor belangrijkheid.

Moderatietabel voor reacties

kunstmatige intelligentie zegt

De econoom vraagt

"X verhoogt Y"

Weggelaten variabele? Omgekeerde causaliteit?

"R-kwadraat is hoog, model is goed"

Staan de series stil? Valse regressie?

"p<0,05, significant"

Is grootte economisch van belang?

"Coëfficiënt 0,3"

Zijn het teken en de eenheid ervan verenigbaar met de theorie?

‘De relatie is sterk’

Is de steekproefselectie bevooroordeeld?

Vier kopieerbare sjablonen

1) Modelinstallatieschets:

Ik zal de volgende economische vraag onderzoeken: [vraag]. Afhankelijke variabele: [Y]. Kandidaatdescriptoren: [X's]. Stel mij een geschikte initiële regressie-opstelling voor (statsmodels-code). Leg uit welke controlevariabelen nodig zijn en waarom. Claim GEEN causaliteit; Gebruik relatietaal.

2) Diagnostische tests:

Schrijf in code de diagnostische tests voor de regressie die ik heb opgezet: autocorrelatie, heteroscedasticiteit, multicollineariteit, spreiding van residuen en stationariteit (als het een tijdreeks is). Schrijf kort op hoe u elk testresultaat moet interpreteren en wat u moet doen als er problemen optreden.

3) Causaliteitscontrole:

Interpreteer dit regressieresultaat, maar controleer eerst deze drie valkuilen: (1) kan er een weggelaten variabele zijn en welke, (2) is omgekeerde causaliteit mogelijk, (3) zijn de reeksen stationair / bestaat er een risico op valse regressie? Geef duidelijk aan of het resultaat als causaal of louter relationeel moet worden geïnterpreteerd.

4) Onderscheid betekenis-belang:

Interpreteer de volgende coëfficiënt: waarde [x], standaardfout [y], p-waarde [z]. Evalueer de statistische significantie afzonderlijk, de economische significantie afzonderlijk: is de omvang van deze coëfficiënt een praktisch significant effect? Concreet de omvang van de impact in een voorbeeldscenario.

Zwakke prompt/sterke prompt

Zwakke prompt:

Voer een regressie uit met deze variabelen en interpreteer het resultaat.

Kunstmatige intelligentie interpreteert het in een causale taal, zonder diagnostische tests uit te voeren of de stationariteit te controleren; valse regressie of weggelaten variabele wordt gemist.

Krachtige prompt:

De afhankelijke variabele is de consumptie, het verklarende inkomen; maandelijkse, trending serie. Test eerst de stationariteit; verschil krijgen als dat nodig is. Zet de regressie op, voer diagnostische tests uit (autocorrelatie, heteroscedasticiteit). Bespreek expliciet de risico's van weggelaten variabelen en omgekeerde causaliteit bij het interpreteren van het resultaat; Gebruik relationele in plaats van causale taal. Evalueer betekenis en economische betekenis afzonderlijk en geef de code voor elke stap.

Veel voorkomende fouten

  • Correlatie verwarren met causaliteit. De meest voorkomende en duurste fout.
  • Een hoge R-kwadraat verwarren met kwaliteit. Het is ook hoog in valse regressies.
  • De stasiscontrole omzeilen. Trended-series produceren valse relaties.
  • Zingeving verwarren met betekenis. Een kleine p betekent niet een groot effect.
  • Diagnostische tests overslaan. De geschonden veronderstelling vernietigt de gehele gevolgtrekking.
  • Het accepteren van de causale taal van AI zoals die is. Het oordeel behoort de mens toe.

Samengevat

Regressie is een krachtig maar valkuil-instrument. Leescoëfficiënt, standaardfout, p-waarde en R-kwadraat correct; onderscheid maken tussen correlatie en causaliteit; controleren op weggelaten variabelen, omgekeerde causaliteit en valse regressievalkuilen; Er moet onderscheid worden gemaakt tussen betekenis en economisch belang. AI versnelt in het genereren van codes en diagnoses, maar spreekt te causaal; De keuze van het model en het oordeel over de causaliteit berust bij de econoom.

Applicatie taak

Zet een eenvoudige regressie op met de gegevens die u heeft (bijvoorbeeld consumptie-inkomen). Laat de opstelling maken met het 1e sjabloon en de diagnostische tests met het 2e sjabloon. Controleer vervolgens op causaliteit met sjabloon 3, waarbij u ten minste één mogelijke weggelaten variabele en één scenario met omgekeerde causaliteit noemt. Vertaal een causale zin uit de initiële interpretatie van de AI naar relationeel taalgebruik en noteer de verandering.

controlelijst

  • [ ] Ik heb de coëfficiënt, standaardfout, p-waarde en R-kwadraat correct gelezen.
  • [ ] Ik controleerde de stationariteit van de reeks en elimineerde het risico van valse regressie.
  • [ ] Ik heb de weggelaten variabelen en mogelijkheden voor omgekeerde causaliteit genoemd.
  • [ ] Ik heb diagnostische tests uitgevoerd en overtredingen geëvalueerd.
  • [ ] Ik heb de statistische significantie en de economische significantie afzonderlijk beoordeeld.
  • [ ] Ik heb de causale taal van kunstmatige intelligentie in de relationele taal getrokken.
  • [ ] Ik hield vol dat de keuze van het model en het oordeel over de causaliteit aan mij lag.