Dobički:
- Sposobnost natančnega branja regresijskih rezultatov (koeficient, standardna napaka, p-vrednost, R-kvadrat) in kritične ocene interpretacije umetne inteligence
- Sposobnost prepoznavanja pasti, kot so razlikovanje med korelacijo in vzročnostjo, endogenost, izpuščene spremenljivke in lažna regresija, ter zajezitev pretirane vzročne govorice umetne inteligence
- Sposobnost uporabe umetne inteligence za nastavitev modela, kodo in pripravo diagnostičnih testov, pri čemer odgovornost za izbiro in interpretacijo modela prepušča ljudem
Ekonometrija je disciplina preverjanja ekonomske teorije s podatki, regresija pa je njeno osnovno orodje. "Koliko se poveča potrošnja, ko se poveča dohodek?", "Kakšno je razmerje med obrestmi in naložbami?" Takšna vprašanja so kvantificirana z regresijo. Umetna inteligenca je na tem področju hkrati zelo uporabna in zelo nevarna: kodo modela in diagnostične teste napiše v nekaj sekundah, vendar je pri interpretaciji rezultatov pogosto preveč vzročna in preveč natančna. Tekoče govori stavek "X poveča Y"; medtem ko večina regresij meri le eno razmerje. Bistvo te enote je: uporaba AI za nastavitev modela, kodo in diagnostično testiranje; vendar odgovornost za izbiro modela, presojo vzročnosti in interpretacijo prepustite človeku.
Bralni regresijski izhod
Rezultat preproste regresije išče štiri stvari:
- Koeficient. Ocena, koliko se odvisna spremenljivka spremeni, ko se pojasnjevalna spremenljivka poveča za eno enoto. Predznak (plus/minus) in velikost morata imeti ekonomski pomen.
- Standardna napaka. Negotovost ocene koeficienta; Če je manjši, je ocena natančnejša.
- p-vrednost. Verjetnost, da bo koeficient videti tako velik ob predpostavki, da je "pravzaprav nič". Majhen p (< 0,05) naj bi bil "statistično pomemben" - vendar to ne pomeni ekonomskega pomena ali vzročnosti.
- R-kvadrat. Kolikšen del spremembe odvisne spremenljivke pojasnjuje model. Visok R-kvadrat ne pomeni "pravilnega modela"; Visoka je lahko tudi pri lažnih regresijah.
Nasvet: ne zamenjujte statistične pomembnosti z ekonomsko pomembnostjo. Tudi zelo majhen, praktično nepomemben učinek se lahko v velikem vzorcu izkaže za "pomemben" (majhen p). Prvič, "Ali je velikost tega koeficienta gospodarsko pomembna?" ', nato poiščite pomen.
Korelacija ni vzročna zveza: klasične pasti
To je opozorilo v središču ekonometrije. Razmerje, ugotovljeno z regresijo, pogosto ni vzročnost. Glavne pasti:
- Izpuščena spremenljivka. Tretji dejavnik, ki vpliva na X in Y, vendar ni v modelu, ustvarja lažno razmerje med X in Y. (Primer: če je "sposobnost" izpuščena v razmerju med izobrazbo in dohodkom, bo koeficient zavajajoč.)
- Povratna vzročnost (endogenost). Čeprav se domneva, da X vpliva na Y, morda Y vpliva na X ali pa sta oba vzajemna. (Število policistov in kriminal: ali se je policija povečala zaradi povečanja kriminala?)
- Psevdo regresija. Dva nestacionarna (trendna) niza lahko prineseta visoke R-kvadrate in pomembne koeficiente, čeprav med njima ni prave povezave. Samo zato, ker oba sčasoma rasteta.
- Pristranskost pri izbiri. Če vzorec ni naključen, se razmerje meri poševno.
Trditev o vzročnosti je mogoče vzpostaviti samo z ustrezno zasnovo (metode, kot so nadzorovani poskus, naravni poskus, instrumentalna spremenljivka, razlika v razliki) in jasnimi predpostavkami. Umetna inteligenca pogosto spregleda to subtilnost.
Pozor: Če umetna inteligenca reče "ta spremenljivka to poveča/zmanjša", takoj zavirajte. Težava: Ali so kakšne spremenljivke izpuščene? Ali je možna obratna vzročnost? Ali serije mirujejo? V poročilo ne pride noben vzročni stavek, dokler niso postavljena ta tri vprašanja.
Diagnostični testi
Da bi bila regresija zanesljiva, se testirajo njene predpostavke: vzorec ostankov (členov napake) (avtokorelacija), heteroskedastičnost (heteroskedastičnost), multikolinearnost (razlagalne spremenljivke so si med seboj zelo podobne), normalna porazdelitev. Umetna inteligenca piše kodo za te teste; vendar je naloga ekonomista, da interpretira rezultate in ustrezno prilagodi model.
trije mini kovčki
1. primer – Lažna regresija. Raziskovalec je regresiral dve seriji trendov (ena nominalna poraba, ena nominalna druga količina); R-kvadrat je bil 0,98, koeficient je bil zelo pomemben. AI "je močan odnos," je dejal. Raziskovalec je testiral stacionarnost: obe seriji sta bili nestacionarni. Ko sta bila ločena, je odnos večinoma izginil. Visok R-kvadrat je bil preprosto zato, ker sta oba sčasoma rasla. Ulovljena lažna regresija.
Primer 2 – izpuščena spremenljivka. Ena analiza je pokazala, da »poraba za oglaševanje poveča prodajo«. Ekonomist je vprašal: ali je v modelu sezonski učinek? Ni bilo. Tako oglaševanje kot prodaja sta pred praznikom naraščala; Del razmerja je bila sezonskost. Ko so bile dodane navidezne spremenljivke sezone, se je koeficient oglaševanja zmanjšal. Vzročna trditev je bila omehčana.
Primer 3 – Pomemben, vendar nepomemben. V velikem nizu mikropodatkov je bil koeficient p<0,001; AI "močan vpliv," je dejal. A velikost koeficienta je bila tako rekoč zanemarljiva (velika sprememba dohodka je rezultat premaknila za tisočinko). Ekonomist ga je pravilno opisal kot »statistično pomemben, a ekonomsko nepomemben«. Pomen ni bil nadomestek za pomembnost.
Tabela za moderiranje komentarjev
pravi umetna inteligenca
Se sprašuje ekonomist
"X poveča Y"
Izpuščena spremenljivka? Povratna vzročnost?
"R-kvadrat je visok, model je dober"
Ali serije mirujejo? Lažna regresija?
"p<0,05, pomembno"
Ali je velikost pomembna z ekonomskega vidika?
"Koeficient 0,3"
Ali sta njegov znak in enota združljiva s teorijo?
"Odnos je močan"
Je izbor vzorcev pristranski?
Štiri predloge za kopiranje
1) Skica namestitve modela:
Preučil bom naslednje ekonomsko vprašanje: [vprašanje]. Odvisna spremenljivka: [Y]. Deskriptorji kandidatov: [X-ji]. Predlagajte mi primerno začetno nastavitev regresije (koda statsmodels). Pojasnite, katere kontrolne spremenljivke so potrebne in zakaj. NE trdite o vzročnosti; Uporabite jezik odnosa.
2) Diagnostični testi:
V kodo zapišite diagnostične teste za regresijo, ki sem jo nastavil: avtokorelacijo, heteroskedastičnost, multikolinearnost, disperzijo ostankov in stacionarnost (če gre za časovno vrsto). Na kratko napišite, kako razlagati vsak rezultat testa in kaj storiti, če pride do težav.
3) Nadzor vzročnosti:
Interpretirajte ta regresijski rezultat, vendar najprej preverite te tri pasti: (1) ali je lahko izpuščena spremenljivka in katera, (2) ali je možna obratna vzročnost, (3) ali niz miruje / ali obstaja tveganje lažne regresije? Jasno navedite, ali je treba rezultat razlagati kot vzročno ali zgolj relacijsko.
4) Razlika med pomembnostjo in pomembnostjo:
Interpretirajte naslednji koeficient: vrednost [x], standardna napaka [y], p-vrednost [z]. Ločeno ocenite statistično pomembnost, ločeno ekonomsko pomembnost: ali je velikost tega koeficienta praktično pomemben učinek? Konkretno opredelite obseg vpliva v primeru scenarija.
Šibek poziv/močan poziv
Šibek poziv:
Naredite regresijo s temi spremenljivkami in interpretirajte rezultat.
Umetna inteligenca ga interpretira v vzročnem jeziku, brez izvajanja diagnostičnih testov ali preverjanja stacionarnosti; lažna regresija ali izpuščena spremenljivka.
Močan poziv:
Odvisna spremenljivka je potrošnja, pojasnjevalni dohodek; mesečne, priljubljene serije. Najprej preizkusite stacionarnost; dobite razliko, če je potrebno. Nastavite regresijo, zaženite diagnostične teste (avtokorelacija, heteroskedastičnost). Eksplicitno razpravljajte o tveganjih izpuščenih spremenljivk in obrnite vzročnost pri razlagi rezultata; Uporabljajte relacijski in ne vzročni jezik. Ločeno ocenite pomen in ekonomski pomen ter podajte kodo za vsak korak.
Pogoste napake
- Napačna korelacija za vzročno zvezo. Najpogostejša in najdražja napaka.
- Visok R-kvadrat zamenjati s kakovostjo. Visoka je tudi pri lažnih regresijah.
- Obhod preverjanja zastoja. Trendne serije ustvarjajo lažne odnose.
- Zamenjevanje smiselnosti s pomenom. Majhen p ne pomeni velikega učinka.
- Preskakovanje diagnostičnih testov. Kršena predpostavka porazi celotno sklepanje.
- Sprejemanje vzročnega jezika AI, kot je. Sodba pripada človeku.
Če povzamem
Regresija je močno, a zgrešeno orodje. Koeficient branja, standardna napaka, p-vrednost in R-kvadrat pravilno; razlikovanje med korelacijo in vzročno zvezo; preverjanje izpuščenih spremenljivk, obratne vzročnosti in lažnih regresijskih pasti; Treba je razlikovati med pomenom in gospodarskim pomenom. AI pospešuje ustvarjanje kod in diagnoz, vendar govori preveč vzročno; Izbira modela in presoja vzročnosti je v rokah ekonomista.
Aplikacijska naloga
Nastavite preprosto regresijo s podatki, ki jih imate (npr. potrošnja-dohodek). Izdelajte nastavitev s 1. predlogo, diagnostične teste pa z 2. predlogo. Nato preverite vzročnost s predlogo 3, pri čemer navedite vsaj eno možno izpuščeno spremenljivko in en obratni scenarij vzročnosti. Prevedite vzročni stavek iz začetne interpretacije AI v relacijski jezik in zabeležite spremembo.
kontrolni seznam
- [ ] Pravilno sem prebral koeficient, standardno napako, p-vrednost in R-kvadrat.
- [ ] Preveril sem stacionarnost serije in izločil tveganje lažne regresije.
- [ ] Poimenoval sem izpuščeno spremenljivko in možnosti obratne vzročnosti.
- [ ] Opravil sem diagnostične teste in ocenil kršitve.
- [ ] Ločeno sem ocenil statistično pomembnost in ekonomsko pomembnost.
- [ ] Vzročni jezik umetne inteligence sem potegnil v relacijski jezik.
- [ ] Trdil sem, da sta bila izbira modela in presoja vzročnosti moja.