Pelnas:
- Gebėjimas tiksliai nuskaityti regresijos išvestį (koeficientą, standartinę paklaidą, p reikšmę, R kvadratą) ir kritiškai įvertinti dirbtinio intelekto interpretaciją
- Gebėjimas atpažinti klaidas, tokias kaip koreliacijos ir priežastinio ryšio skirtumas, endogeniškumas, praleisti kintamieji ir klaidinga regresija, ir pažaboti pernelyg didelę dirbtinio intelekto priežastinę kalbą
- Galimybė naudoti dirbtinį intelektą modelio sąrankai, kodų ir diagnostinių testų rengimui, paliekant atsakomybę už modelio pasirinkimą ir interpretavimą žmonėms.
Ekonometrija yra ekonomikos teorijos tikrinimo su duomenimis disciplina, o regresija yra pagrindinė jos priemonė. „Kiek didėja vartojimas didėjant pajamoms?“, „Koks ryšys tarp palūkanų ir investicijų?“. Tokie klausimai kiekybiškai įvertinami regresija. Dirbtinis intelektas šioje srityje yra labai naudingas ir labai pavojingas: modelio kodą ir diagnostinius testus jis parašo per kelias sekundes, tačiau interpretuodamas išvestį dažnai yra pernelyg priežastinis ir pernelyg tikslus. Sklandžiai kalba sakinį „X padidina Y“; tuo tarpu dauguma regresijų matuoja tik vieną ryšį. Šio įrenginio esmė yra tokia: Naudokite AI modelio sąrankai, kodui ir diagnostikos testavimui; tačiau atsakomybę už modelio pasirinkimą, priežastingumo vertinimą ir aiškinimą palikite žmogui.
Regresijos išvesties skaitymas
Paprastos regresijos išvestis ieško keturių dalykų:
- Koeficientas. Įvertinimas, kiek priklausomasis kintamasis pasikeičia, kai aiškinamasis kintamasis padidėja vienu vienetu. Ženklas (pliusas/minusas) ir dydis turi turėti ekonominę reikšmę.
- Standartinė klaida. Koeficiento įvertinimo neapibrėžtis; Jei jis mažesnis, įvertinimas tikslesnis.
- p reikšmė. Tikimybė, kad koeficientas pasirodys toks didelis, darant prielaidą, kad jis „iš tikrųjų yra nulis“. Sakoma, kad mažas p (< 0,05) yra „statistiškai reikšmingas“, tačiau tai nereiškia ekonominės reikšmės ar priežastingumo.
- R kvadratas. Kiek priklausomo kintamojo pokyčio paaiškina modelis. Didelis R kvadratas nereiškia „teisingo modelio“; Jis taip pat gali būti didelis netikrų regresijų atveju.
Patarimas: nepainiokite statistinio reikšmingumo su ekonomine svarba. Netgi labai mažas, praktiškai nereikšmingas poveikis didelėje imtyje gali pasirodyti „reikšmingas“ (mažas p). Pirma, "Ar šio koeficiento dydis yra ekonomiškai svarbus?" “, tada ieškokite reikšmės.
Koreliacija nėra priežastinis ryšys: klasikiniai spąstai
Tai yra ekonometrijos esmė. Regresijos būdu nustatytas ryšys dažnai nėra priežastinis ryšys. Pagrindiniai spąstai:
- Praleistas kintamasis. Trečiasis veiksnys, turintis įtakos ir X, ir Y, bet kurio nėra modelyje, sukuria klaidingą ryšį tarp X ir Y. (Pavyzdys: jei „gebėjimas“ praleistas santykyje tarp išsilavinimo ir pajamų, koeficientas bus klaidinantis.)
- Atvirkštinis priežastinis ryšys (endogeniškumas). Nors manoma, kad X veikia Y, galbūt Y veikia X arba abu yra abipusiai. (Policijos skaičius ir nusikalstamumas: ar policijos padaugėjo, nes padidėjo nusikalstamumas?)
- Pseudo regresija. Dvi nestacionarios (tendencijos) serijos gali duoti didelius R kvadrato ir reikšmingus koeficientus, net jei tarp jų nėra tikro ryšio. Tiesiog todėl, kad jie abu laikui bėgant auga.
- Atrankos šališkumas. Jei imtis nėra atsitiktinė, ryšys matuojamas iškreiptai.
Teiginys apie priežastinį ryšį gali būti nustatytas tik turint tinkamą planą (tokius metodus kaip kontroliuojamas eksperimentas, natūralus eksperimentas, instrumentinis kintamasis, skirtumas tarp skirtumų) ir aiškiomis prielaidomis. Dirbtinis intelektas dažnai pasigenda šio subtilumo.
Atsargiai: jei AI sako „šis kintamasis tai padidina/sumažina“, nedelsdami stabdykite. Problema: ar yra praleistų kintamųjų? Ar įmanomas atvirkštinis priežastinis ryšys? Ar serija stacionari? Į ataskaitą neįtraukiamas joks priežastinis sakinys, kol neužduodami šie trys klausimai.
Diagnostiniai testai
Kad regresija būtų patikima, tikrinamos jos prielaidos: liekanų modelis (klaidos terminai) (autokoreliacija), heteroskedastiškumas (heteroskedastiškumas), daugiakolineariškumas (aiškinamieji kintamieji labai panašūs vienas į kitą), normalusis pasiskirstymas. Dirbtinis intelektas rašo šių testų kodą; bet ekonomisto darbas yra interpretuoti rezultatus ir atitinkamai pakoreguoti modelį.
trys mini dėklai
1 atvejis – klaidinga regresija. Tyrėjas regresavo dvi tendencijų eilutes (viena nominalios išlaidos, viena nominali kita suma); R kvadratas buvo 0,98, koeficientas buvo labai reikšmingas. AI „yra stiprūs santykiai“, - sakė jis. Tyrėjas išbandė stacionarumą: abi serijos buvo nestacionarios. Kai jie buvo atskirti, santykiai iš esmės išnyko. Didelis R kvadratas buvo tiesiog todėl, kad jie abu laikui bėgant augo. Pagauta netikra regresija.
2 atvejis – praleistas kintamasis. Viena analizė parodė, kad „reklamos išlaidos padidina pardavimą“. Ekonomistas paklausė: ar modelyje yra sezoninis efektas? Nebuvo. Prieš šventę didėjo ir reklama, ir pardavimai; Dalis santykių buvo sezoniškumas. Pridėjus sezono fiktyvius kintamuosius, reklamos koeficientas sumažėjo. Priežastinis ieškinys buvo sušvelnintas.
3 atvejis – reikšmingas, bet nereikšmingas. Dideliame mikroduomenų rinkinyje koeficientas buvo p<0,001; AI „stiprus poveikis“, - sakė jis. Tačiau koeficiento dydis buvo praktiškai nereikšmingas (didelis pajamų pokytis rezultatą pakėlė tūkstantąją dalimi). Ekonomistas teisingai jį suformulavo kaip „statistiškai reikšmingą, bet ekonomiškai nereikšmingą“. Reikšmė nebuvo svarbos pakaitalas.
Komentarų moderavimo lentelė
dirbtinis intelektas sako
– klausia ekonomistas
"X padidina Y"
Praleistas kintamasis? Atvirkštinis priežastinis ryšys?
„R kvadratas aukštas, modelis geras“
Ar serija stacionari? Netikra regresija?
"p<0,05, reikšmingas"
Ar dydis ekonomiškai svarbus?
"Koeficientas 0,3"
Ar jo ženklas ir vienetas suderinami su teorija?
„Santykiai stiprūs“
Ar mėginių atranka yra šališka?
Keturi kopijuojami šablonai
1) Modelio montavimo eskizas:
Išnagrinėsiu tokį ekonominį klausimą: [klausimas]. Priklausomas kintamasis: [Y]. Kandidatų deskriptoriai: [X]. Pasiūlykite man tinkamą pradinę regresijos sąranką (statsmodels kodą). Paaiškinkite, kokių valdymo kintamųjų reikia ir kodėl. NETEIKIA priežastingumo; Naudokite santykių kalbą.
2) Diagnostiniai testai:
Kode parašykite mano nustatytos regresijos diagnostinius testus: autokoreliaciją, heteroskedastiką, daugiakolineariškumą, likučių sklaidą ir stacionarumą (jei tai laiko eilutė). Trumpai parašykite, kaip interpretuoti kiekvieną testo rezultatą ir ką daryti, jei kyla problemų.
3) Priežastingumo kontrolė:
Interpretuokite šį regresijos rezultatą, bet pirmiausia patikrinkite šiuos tris spąstus: (1) ar gali būti praleistas kintamasis ir kuris iš jų, (2) ar galimas atvirkštinis priežastinis ryšys, (3) ar serija nejuda / ar yra klaidingos regresijos rizika? Aiškiai nurodykite, ar rezultatas turėtų būti aiškinamas kaip priežastinis, ar tik santykinis.
4) Reikšmės ir svarbos skirtumas:
Interpretuokite šį koeficientą: reikšmė [x], standartinė paklaida [y], p reikšmė [z]. Atskirai vertinkite statistinį reikšmingumą, atskirai ekonominį: ar šio koeficiento dydis yra praktiškai reikšmingas poveikis? Pavyzdiniame scenarijuje nurodykite poveikio dydį.
Silpnas raginimas / Stiprus raginimas
Silpnas raginimas:
Atlikite regresiją su šiais kintamaisiais ir interpretuokite rezultatą.
Dirbtinis intelektas jį interpretuoja priežastine kalba, neatlikdamas diagnostinių tyrimų ir netikrindamas stacionarumo; klaidinga regresija arba praleistas kintamasis.
Galingas raginimas:
Priklausomas kintamasis yra vartojimas, aiškinamosios pajamos; kasmėnesiniai, populiarūs serialai. Pirmiausia patikrinkite stacionarumą; jei reikia, gaukite skirtumą. Nustatykite regresiją, atlikite diagnostinius testus (autokoreliacija, heteroskedastiškumas). Aiškiai aptarkite praleistų kintamųjų riziką ir atvirkštinį priežastinį ryšį interpretuodami rezultatą; Naudokite santykinę, o ne priežastinę kalbą. Įvertinkite reikšmingumą ir ekonominę reikšmę atskirai ir nurodykite kiekvieno žingsnio kodą.
Dažnos klaidos
- Klaidinga koreliacija ir priežastinis ryšys. Dažniausia ir brangiausia klaida.
- Klaidingai vertinamas didelis R kvadratas dėl kokybės. Jame taip pat yra daug klaidingų regresijų.
- Stazės patikrinimo aplenkimas. Madingi serialai sukuria netikrus santykius.
- Prasmingumą supainioti su reikšmingumu. Mažas p nereiškia didelio efekto.
- Diagnostinių testų praleidimas. Pažeista prielaida paneigia visą išvadą.
- Priimti priežastinę AI kalbą tokią, kokia yra. Nuosprendis priklauso žmogui.
Apibendrinant
Regresija yra galingas, bet nesėkmingas įrankis. Nuskaitymo koeficientas, standartinė paklaida, p reikšmė ir R kvadratas teisingai; koreliacijos ir priežastinio ryšio atskyrimas; tikrinti, ar nėra praleistų kintamųjų, atvirkštinio priežastingumo ir klaidingų regresijos spąstų; Būtina atskirti reikšmingumą ir ekonominę svarbą. DI spartėja kodų ir diagnozių generavimas, tačiau jis kalba pernelyg priežastingai; Modelio pasirinkimas ir priežastingumo vertinimas priklauso ekonomistui.
Taikymo užduotis
Nustatykite paprastą regresiją su turimais duomenimis (pvz., vartojimo pajamomis). Pasirūpinkite, kad sąranka būtų sukurta naudojant 1-ąjį šabloną, o diagnostiniai testai – su 2-uoju šablonu. Tada patikrinkite priežastinį ryšį naudodami 3 šabloną, nurodydami bent vieną galimą praleistą kintamąjį ir vieną atvirkštinio priežastingumo scenarijų. Išverskite priežastinį sakinį iš pradinio AI interpretacijos į reliacinę kalbą ir atkreipkite dėmesį į pasikeitimą.
kontrolinis sąrašas
- [ ] Teisingai perskaičiau koeficientą, standartinę paklaidą, p reikšmę ir R kvadratą.
- [ ] Patikrinau serijos stacionarumą ir pašalinau netikros regresijos riziką.
- [ ] Įvardijau praleistas kintamojo ir atvirkštinio priežastingumo galimybes.
- [ ] Atlikau diagnostinius tyrimus ir įvertinau pažeidimus.
- [ ] Statistinį reikšmingumą ir ekonominį reikšmingumą įvertinau atskirai.
- [ ] Dirbtinio intelekto priežastinę kalbą įtraukiau į santykių kalbą.
- [ ] Teigiau, kad modelio pasirinkimas ir priežastingumo sprendimas buvo mano pasirinkimas.