Vinster:
- Förmåga att noggrant läsa regressionsutgången (koefficient, standardfel, p-värde, R-kvadrat) och kritiskt utvärdera tolkningen av artificiell intelligens
- Förmåga att känna igen fallgropar såsom skillnaden mellan korrelation och orsakssamband, endogenitet, utelämnade variabler och falsk regression, och stävja det överdrivna kausala språket för artificiell intelligens
- Förmåga att använda artificiell intelligens för modelluppställning, kod- och diagnostiska testutkast, vilket överlåter ansvaret för modellval och tolkning till människor
Ekonometri är disciplinen att testa ekonomisk teori med data, och regression är dess grundläggande verktyg. "Hur mycket ökar konsumtionen när inkomsten ökar?", "Vad är sambandet mellan ränta och investeringar?" Frågor som dessa kvantifieras genom regression. AI är både mycket användbar och mycket farlig inom detta område: den skriver modellkod och diagnostiska tester på några sekunder, men är ofta alltför kausal och alltför exakt när man tolkar utdata. Talar meningen "X ökar Y" flytande; medan de flesta regressioner bara mäter ett samband. Kontentan av denna enhet är: Använd AI för modellinställning, kod och diagnostisk testning; men håll ansvaret för modellval, kausalitetsbedömning och tolkning på människan.
Läser regressionsutgång
Resultatet av en enkel regression letar efter fyra saker:
- Koefficient. En uppskattning av hur mycket den beroende variabeln förändras när den förklarande variabeln ökar med en enhet. Tecknet (plus/minus) och magnitud måste ha ekonomisk betydelse.
- Standardfel. Koefficientskattningens osäkerhet; Om den är mindre är uppskattningen mer exakt.
- p-värde. Sannolikheten för att koefficienten blir så stor under antagandet att den är "faktiskt noll". Litet p (< 0,05) sägs vara "statistiskt signifikant" - men detta innebär inte ekonomisk signifikans eller kausalitet.
- R-kvadrat. Hur stor del av förändringen i den beroende variabeln modellen förklarar. En hög R-kvadrat betyder inte den "rätta modellen"; Det kan också vara högt i falska regressioner.
Tips: Blanda inte ihop statistisk signifikans med ekonomisk signifikans. Även en mycket liten, praktiskt taget obetydlig effekt kan visa sig vara "signifikant" (litet p) i ett stort urval. För det första, "Är storleken på denna koefficient ekonomiskt viktig?" ', leta sedan efter betydelse.
Korrelation är inte orsakssamband: klassiska fallgropar
Detta är förbehållet i ekonometrins hjärta. Det samband som hittas av regression är ofta inte kausalitet. Stora fallgropar:
- Utelämnad variabel. En tredje faktor som påverkar både X och Y men som inte finns i modellen skapar ett falskt samband mellan X och Y. (Exempel: om "förmåga" utelämnas i sambandet mellan utbildning och inkomst blir koefficienten missvisande.)
- Omvänd kausalitet (endogenitet). Även om man tror att X påverkar Y, kanske Y påverkar X eller så är de två ömsesidiga. (Polisantal och brottslighet: ökade polisen för att brottsligheten ökade?)
- Pseudo-regression. Två icke-stationära (trendande) serier kan ge höga R-kvadrerade och signifikanta koefficienter även om det inte finns något verkligt samband mellan dem. Bara för att de båda växer med tiden.
- Urvalsbias. Om urvalet inte är slumpmässigt mäts sambandet skevt.
Påståendet om kausalitet kan endast fastställas med en lämplig design (metoder som kontrollerat experiment, naturligt experiment, instrumentell variabel, skillnad-i-skillnad) och tydliga antaganden. Artificiell intelligens missar ofta denna subtilitet.
Varning: Om AI:n säger "den här variabeln ökar/minskar det", bromsa omedelbart. Problem: Finns det några variabler som utelämnas? Är omvänd kausalitet möjlig? Är serien stationära? Ingen kausal mening kommer in i rapporten förrän dessa tre frågor ställs.
Diagnostiska tester
För att en regression ska vara tillförlitlig testas dess antaganden: mönster av residualer (feltermer) (autokorrelation), heteroskedasticitet (heteroskedasticitet), multikollinearitet (förklaringsvariabler är mycket lika varandra), normalfördelning. Artificiell intelligens skriver koden för dessa tester; men det är ekonomens uppgift att tolka resultaten och anpassa modellen därefter.
tre minifodral
Fall 1 — Falsk regression. En forskare regresserade två trendserier (en nominell utgift, en nominell en annan kvantitet); R-kvadrat var 0,98, koefficienten var mycket signifikant. AI "är en stark relation", sa han. Forskaren testade för stationaritet: båda serierna var icke-stationära. När de väl var separerade försvann förhållandet i stort sett. Den höga R-kvadraten berodde helt enkelt på att de båda växte med tiden. Falsk regression fångades.
Fall 2 — Utelämnad variabel. En analys visade att "reklamutgifter ökar försäljningen." Ekonomen frågade: finns det en säsongseffekt i modellen? Det fanns inte. Både reklam och försäljning ökade före semestern; En del av förhållandet var säsongsvariationer. När säsongsvariabler lades till blev reklamkoefficienten mindre. Orsaksanspråket har mildrats.
Fall 3 — Betydande men obetydligt. I en stor mikrodatauppsättning var en koefficient p<0,001; AI "stark inverkan", sa han. Men koefficientens storlek var praktiskt taget försumbar (en stor inkomstförändring flyttade resultatet med en tusendel). Ekonomen formulerade det korrekt som "statistiskt signifikant men ekonomiskt obetydligt." Betydelse var inte ett substitut för betydelse.
Kommentarmodereringstabell
säger artificiell intelligens
Frågar ekonomen
"X ökar Y"
Utelämnad variabel? Omvänd kausalitet?
"R-kvadrat är hög, modellen är bra"
Är serien stationära? Falsk regression?
"p<0,05, signifikant"
Spelar storleken någon roll ekonomiskt?
"Koefficient 0,3"
Är dess tecken och enhet förenliga med teori?
"Relationen är stark"
Är urvalet partiskt?
Fyra kopierbara mallar
1) Modellinstallationsskiss:
Jag kommer att undersöka följande ekonomiska fråga: [fråga]. Beroende variabel: [Y].Kandidatdeskriptorer: [X]. Föreslå mig en lämplig initial regressionsinställning (statsmodels-kod). Förklara vilka kontrollvariabler som behövs och varför. Påstå INTE kausalitet; Använd relationsspråk.
2) Diagnostiska tester:
Skriv i kod de diagnostiska testerna för den regression jag ställt upp: autokorrelation, heteroskedasticitet, multikollinearitet, dispersion av residualer och stationaritet (om det är en tidsserie). Skriv kort hur man tolkar varje testresultat och vad man ska göra om det uppstår problem.
3) Kausalitetskontroll:
Tolka detta regressionsresultat, men kontrollera först dessa tre fallgropar: (1) kan det finnas en utelämnad variabel och vilken, (2) är omvänd kausalitet möjlig, (3) är serierna stationära / finns det risk för falsk regression? Ange tydligt om resultatet ska tolkas som kausalt eller enbart relationellt.
4) Skillnad mellan betydelse och betydelse:
Tolka följande koefficient: värde [x], standardfel [y], p-värde [z]. Utvärdera statistisk signifikans separat, ekonomisk signifikans separat: är storleken på denna koefficient en praktiskt signifikant effekt? Konkretera storleken på påverkan i ett exempelscenario.
Svag prompt / Stark prompt
Svag uppmaning:
Gör en regression med dessa variabler och tolka resultatet.
Artificiell intelligens tolkar det på ett kausalt språk, utan att utföra diagnostiska tester eller kontrollera stationaritet; falsk regression eller utelämnad variabel missas.
Kraftfull uppmaning:
Den beroende variabeln är konsumtion, den förklarande inkomsten; månatliga, trendiga serier. Testa stationariteten först; få skillnad om det behövs. Ställ in regressionen, kör diagnostiska tester (autokorrelation, heteroskedasticitet). Diskutera explicit riskerna med utelämnade variabler och omvänd kausalitet vid tolkning av resultatet; Använd relationsspråk snarare än kausalt språk. Utvärdera betydelse och ekonomisk betydelse för sig och ge koden för varje steg.
Vanliga misstag
- Misstag korrelation för orsakssamband. Det vanligaste och dyraste misstaget.
- Misstag en hög R-kvadrat för kvalitet. Det är också högt i falska regressioner.
- Går förbi staskontrollen. Trendiga serier skapar falska relationer.
- Blandar ihop meningsfullhet med betydelse. Litet p betyder inte stor effekt.
- Hoppa över diagnostiska tester. Det kränkta antagandet motverkar hela slutsatsen.
- Acceptera kausalspråket för AI som det är. Domen tillhör människan.
Sammanfattningsvis
Regression är ett kraftfullt men fällt verktyg. Avläsningskoefficient, standardfel, p-värde och R-kvadrat korrekt; skilja mellan korrelation och orsakssamband; kontrollera för utelämnade variabler, omvänd kausalitet och falska regressionsfällor; Det är nödvändigt att skilja mellan betydelse och ekonomisk betydelse. AI accelererar i kod- och diagnosgenerering, men den talar för kausalt; Valet av modell och bedömningen av kausalitet ligger hos ekonomen.
Applikationsuppgift
Sätt upp en enkel regression med den data du har (t.ex. konsumtionsinkomst). Låt inställningen skapas med den första mallen och de diagnostiska testerna med den andra mallen. Kontrollera sedan om det finns kausalitet med mall 3, och nämner minst en möjlig utelämnad variabel och ett omvänt kausalitetsscenario. Översätt en kausal mening från den initiala tolkningen av AI till relationsspråk och notera förändringen.
checklista
- [ ] Jag läste av koefficienten, standardfelet, p-värdet och R-kvadraten korrekt.
- [ ] Jag kontrollerade seriens stationaritet och eliminerade risken för falsk regression.
- [ ] Jag namngav den utelämnade variabeln och omvända kausalitetsmöjligheter.
- [ ] Jag körde diagnostiska tester och utvärderade överträdelser.
- [ ] Jag utvärderade statistisk signifikans och ekonomisk signifikans separat.
- [ ] Jag har dragit in den artificiella intelligensens kausala språk i relationsspråket.
- [ ] Jag hävdade att valet av modell och bedömningen av kausalitet var mitt.