Gevinster:
- Evne til nøjagtigt at aflæse regressionsoutput (koefficient, standardfejl, p-værdi, R-kvadrat) og kritisk vurdere fortolkningen af kunstig intelligens
- Evne til at genkende faldgruber såsom skelnen mellem korrelation og årsagssammenhæng, endogenitet, udeladte variabler og falsk regression og dæmme op for det overdrevne kausale sprog af kunstig intelligens
- Evne til at bruge kunstig intelligens til modelopsætning, kode og diagnostisk testudkast, og overlade ansvaret for modelvalg og fortolkning til mennesker
Økonometri er disciplinen til at teste økonomisk teori med data, og regression er dens grundlæggende værktøj. "Hvor meget stiger forbruget, når indkomsten stiger?", "Hvad er sammenhængen mellem renter og investering?" Spørgsmål som disse kvantificeres ved regression. AI er både meget nyttig og meget farlig på dette område: den skriver modelkode og diagnostiske tests på få sekunder, men er ofte alt for årsagssammenhængende og overdrevent præcis, når outputtet tolkes. Udtaler sætningen "X øger Y" flydende; hvorimod de fleste regressioner kun måler ét forhold. Kernen i denne enhed er: Brug AI til modelopsætning, kode og diagnostisk testning; men behold ansvaret for modelvalg, kausalitetsvurdering og fortolkning på det menneskelige.
Aflæsning af regressionsoutput
Outputtet af en simpel regression ser efter fire ting:
- Koefficient. Et skøn over, hvor meget den afhængige variabel ændres, når den forklarende variabel stiger med én enhed. Tegnet (plus/minus) og størrelse skal have økonomisk betydning.
- Standard fejl. Koefficientestimatets usikkerhed; Hvis det er mindre, er estimatet mere nøjagtigt.
- p-værdi. Sandsynligheden for, at koefficienten er så stor under den antagelse, at den er "faktisk nul". Lille p (< 0,05) siges at være "statistisk signifikant" - men dette indebærer ikke økonomisk signifikans eller kausalitet.
- R-kvadrat. Hvor meget af ændringen i den afhængige variabel modellen forklarer. En høj R-kvadrat betyder ikke den "korrekte model"; Det kan også være højt i falske regressioner.
Tip: Forveksle ikke statistisk signifikans med økonomisk signifikans. Selv en meget lille, praktisk talt ubetydelig effekt kan vise sig at være "signifikant" (lille p) i en stor stikprøve. For det første: "Er størrelsen af denne koefficient økonomisk vigtig?" ', så se efter betydning.
Korrelation er ikke årsagssammenhæng: klassiske faldgruber
Dette er forbeholdet i hjertet af økonometri. Forholdet fundet ved regression er ofte ikke kausalitet. Vigtigste faldgruber:
- Udeladt variabel. En tredje faktor, der påvirker både X og Y, men som ikke er i modellen, skaber et falsk forhold mellem X og Y. (Eksempel: hvis "evne" udelades i forholdet mellem uddannelse og indkomst, vil koefficienten være misvisende).
- Omvendt kausalitet (endogenitet). Mens det menes, at X påvirker Y, påvirker Y måske X, eller de to er gensidige. (Politital og kriminalitet: steg politiet, fordi kriminaliteten steg?)
- Pseudo-regression. To ikke-stationære (trend) serier kan give høje R-kvadrerede og signifikante koefficienter, selvom der ikke er nogen reel sammenhæng mellem dem. Bare fordi de begge vokser over tid.
- Udvælgelse bias. Hvis stikprøven ikke er tilfældig, måles sammenhængen skævt.
Påstanden om kausalitet kan kun etableres med et passende design (metoder som kontrolleret eksperiment, naturligt eksperiment, instrumentel variabel, forskel-i-forskel) og klare antagelser. Kunstig intelligens savner ofte denne subtilitet.
Forsigtig: Hvis AI siger "denne variabel øger/mindsker det", skal du bremse med det samme. Problem: Er der nogen variable udeladt? Er omvendt kausalitet mulig? Er serien stationære? Der kommer ingen kausalsætning ind i rapporten, før disse tre spørgsmål er stillet.
Diagnostiske tests
For at en regression skal være pålidelig, testes dens antagelser: mønster af residualer (fejlled) (autokorrelation), heteroskedasticitet (heteroskedasticitet), multikollinearitet (forklarende variabler ligner hinanden meget), normalfordeling. Kunstig intelligens skriver koden til disse tests; men det er økonomens opgave at fortolke resultaterne og justere modellen derefter.
tre minisager
Tilfælde 1 - Falsk regression. En forsker regresserede to trendserier (en nominel udgift, en nominel en anden mængde); R-kvadrat var 0,98, koefficienten var meget signifikant. AI "er et stærkt forhold," sagde han. Forskeren testede for stationaritet: begge serier var ikke-stationære. Da de først blev separeret, forsvandt forholdet stort set. Den høje R-kvadrat var simpelthen fordi de begge voksede med tiden. Falsk regression fanget.
Tilfælde 2 — Udeladt variabel. En analyse viste, at "annonceudgifter øger salget." Økonomen spurgte: er der en sæsoneffekt i modellen? Det var der ikke. Både reklame og salg var stigende før ferien; En del af forholdet var sæsonbestemt. Når sæsondummyvariabler blev tilføjet, blev reklamekoefficienten mindre. Årsagspåstanden er blevet mildnet.
Tilfælde 3 — Betydelig, men ubetydelig. I et stort mikrodatasæt var en koefficient p<0,001; AI "stærk indvirkning," sagde han. Men størrelsen af koefficienten var praktisk talt ubetydelig (en stor ændring i indkomst flyttede resultatet med en tusindedel). Økonomen formulerede det korrekt som "statistisk signifikant, men økonomisk ubetydeligt." Betydning var ikke en erstatning for betydning.
Kommentarmoderationstabel
siger kunstig intelligens
Spørger økonomen
"X øger Y"
Udeladt variabel? Omvendt kausalitet?
"R-kvadrat er højt, modellen er god"
Er serien stationære? Falsk regression?
"p<0,05, signifikant"
Betyder størrelse noget økonomisk?
"Koefficient 0,3"
Er dets tegn og enhed kompatibel med teori?
"Forholdet er stærkt"
Er prøveudvælgelsen forudindtaget?
Fire kopierbare skabeloner
1) Modelinstallationsskitse:
Jeg vil undersøge følgende økonomiske spørgsmål: [spørgsmål]. Afhængig variabel: [Y].Kandidatbeskrivelser: [X'er]. Foreslå mig en passende indledende regressionsopsætning (statsmodels-kode). Forklar hvilke kontrolvariable der er nødvendige og hvorfor. Påstår IKKE kausalitet; Brug relationssprog.
2) Diagnostiske tests:
Skriv i kode de diagnostiske tests for den regression, jeg opstiller: autokorrelation, heteroskedasticitet, multikollinearitet, dispersion af residualer og stationaritet (hvis det er en tidsserie). Skriv kort, hvordan man fortolker hvert testresultat, og hvad man skal gøre, hvis der er problemer.
3) Kausalitetskontrol:
Fortolk dette regressionsresultat, men tjek først disse tre faldgruber: (1) kan der være en udeladt variabel, og hvilken, (2) er omvendt kausalitet mulig, (3) er rækken stationære / er der risiko for falsk regression? Angiv klart, om resultatet skal tolkes som kausalt eller blot relationelt.
4) skelnen mellem betydning og betydning:
Fortolk følgende koefficient: værdi [x], standardfejl [y], p-værdi [z]. Vurder statistisk signifikans separat, økonomisk signifikans separat: er størrelsen af denne koefficient en praktisk signifikant effekt? Konkreter størrelsen af påvirkningen i et eksempelscenarie.
Svag prompt / Stærk prompt
Svag prompt:
Lav en regression med disse variable og fortolk resultatet.
Kunstig intelligens fortolker det i et kausalt sprog uden at udføre diagnostiske tests eller kontrollere stationaritet; falsk regression eller udeladt variabel savnes.
Kraftig prompt:
Den afhængige variabel er forbrug, den forklarende indkomst; månedlige, trendende serier. Test stationaritet først; få forskel hvis nødvendigt. Opsæt regressionen, kør diagnostiske test (autokorrelation, heteroskedasticitet). Diskuter eksplicit risikoen ved udeladte variable og omvendt kausalitet ved fortolkning af resultatet; Brug relationelt snarere end kausalt sprog. Vurder betydning og økonomisk betydning separat og giv koden for hvert trin.
Almindelige fejl
- Forkert sammenhæng med årsagssammenhæng. Den mest almindelige og dyreste fejl.
- Forveksler en høj R-kvadrat for kvalitet. Det er også højt i falske regressioner.
- Omgå stasecheck. Trendede serier producerer falske forhold.
- Forveksler meningsfuldhed med betydning. Lille p betyder ikke stor effekt.
- Springer over diagnostiske tests. Den overtrådte antagelse besejrer hele slutningen.
- Accepterer det kausale sprog af AI, som det er. Dommen tilhører mennesket.
Sammenfattende
Regression er et stærkt, men faldgrubet værktøj. Aflæsningskoefficient, standardfejl, p-værdi og R-kvadrat korrekt; skelne mellem korrelation og årsagssammenhæng; kontrol for udeladte variable, omvendt kausalitet og falske regressionsfælder; Det er nødvendigt at skelne mellem betydning og økonomisk betydning. AI accelererer i kode- og diagnosegenerering, men den taler for kausalt; Valget af model og bedømmelsen af kausalitet påhviler økonomen.
Ansøgningsopgave
Opsæt en simpel regression med de data du har (f.eks. forbrugs-indkomst). Få opsætningen fremstillet med den 1. skabelon, og de diagnostiske tests fremstillet med den 2. skabelon. Tjek derefter for kausalitet med skabelon 3, navngiv mindst én mulig udeladt variabel og ét omvendt kausalitetsscenarie. Oversæt en kausal sætning fra den indledende fortolkning af AI til relationelt sprog og noter ændringen.
tjekliste
- [ ] Jeg læste koefficienten, standardfejlen, p-værdien og R-kvadreret korrekt.
- [ ] Jeg tjekkede seriens stationaritet og eliminerede risikoen for falsk regression.
- [ ] Jeg navngav den udeladte variabel og omvendt kausalitetsmuligheder.
- [ ] Jeg kørte diagnostiske tests og evaluerede overtrædelser.
- [ ] Jeg vurderede statistisk signifikans og økonomisk signifikans separat.
- [ ] Jeg har trukket den kunstige intelligenss årsagssprog ind i relationssproget.
- [ ] Jeg fastholdt, at valget af model og bedømmelsen af kausalitet var mit.