Dobici:
- Sposobnost preciznog čitanja rezultata regresije (koeficijent, standardna greška, p-vrijednost, R-kvadrat) i kritičke procjene interpretacije umjetne inteligencije
- Sposobnost prepoznavanja zamki kao što su razlika između korelacije i uzročnosti, endogenost, izostavljene varijable i lažna regresija, te obuzdavanje pretjeranog kauzalnog jezika umjetne inteligencije
- Sposobnost korištenja umjetne inteligencije za postavljanje modela, izradu koda i dijagnostičkih testova, prepuštajući ljudima odgovornost za odabir i interpretaciju modela
Ekonometrija je disciplina testiranja ekonomske teorije podacima, a regresija je njeno osnovno sredstvo. "Koliko raste potrošnja kako raste prihod?", "Kakav je odnos između kamata i investicija?" Ovakva pitanja se kvantificiraju regresijom. AI je i vrlo korisna i vrlo opasna u ovoj oblasti: piše kod modela i dijagnostičke testove u sekundi, ali je često pretjerano uzročna i previše precizna kada tumači izlaz. Tečno izgovara rečenicu "X povećava Y"; dok većina regresija mjeri samo jednu vezu. Suština ove jedinice je: Koristite AI za podešavanje modela, kod i dijagnostičko testiranje; ali odgovornost za odabir modela, procjenu uzročnosti i interpretaciju zadržite na čovjeku.
Čitanje izlaza regresije
Izlaz jednostavne regresije traži četiri stvari:
- Koeficijent. Procjena koliko se zavisna varijabla mijenja kada se eksplanatorna varijabla poveća za jednu jedinicu. Znak (plus/minus) i veličina moraju imati ekonomsko značenje.
- Standardna greška. Neizvjesnost procjene koeficijenta; Ako je manji, procjena je tačnija.
- p-vrijednost. Vjerovatnoća da se koeficijent pojavi ovako velik pod pretpostavkom da je "zapravo nula". Za mali p (< 0,05) se kaže da je „statistički značajan“ — ali to ne implicira ekonomski značaj ili uzročnost.
- R-kvadrat. Koliki dio promjene zavisne varijable model objašnjava. Visok R-kvadrat ne znači "tačan model"; Takođe može biti visok u lažnim regresijama.
Savjet: Nemojte brkati statistički značaj sa ekonomskim značajem. Čak i vrlo mali, praktično beznačajan efekat može se pokazati kao "značajan" (mali p) u velikom uzorku. Prvo, "Da li je veličina ovog koeficijenta ekonomski važna?" ', a zatim potražite značaj.
Korelacija nije uzročna veza: klasične zamke
Ovo je upozorenje u srcu ekonometrije. Veza pronađena regresijom često nije uzročna. Glavne zamke:
- Izostavljena varijabla. Treći faktor koji utiče i na X i na Y, ali nije u modelu, stvara lažni odnos između X i Y. (Primjer: ako se "sposobnost" izostavi u odnosu između obrazovanja i prihoda, koeficijent će biti pogrešan.)
- Obrnuta uzročnost (endogenost). Iako se smatra da X utiče na Y, možda Y utiče na X ili su to dvoje obostrano. (Broj policije i kriminal: da li se policija povećala jer je kriminal porastao?)
- Pseudo regresija. Dvije nestacionarne (trendne) serije mogu dati visok R-kvadrat i značajne koeficijente iako ne postoji stvarna veza između njih. Samo zato što oboje rastu tokom vremena.
- Pristrasnost odabira. Ako uzorak nije slučajan, odnos se mjeri iskrivljeno.
Tvrdnja o kauzalnosti može se utvrditi samo uz odgovarajući dizajn (metode kao što su kontrolirani eksperiment, prirodni eksperiment, instrumentalna varijabla, razlika u razlici) i jasne pretpostavke. Vještačkoj inteligenciji često nedostaje ova suptilnost.
Oprez: Ako AI kaže "ova varijabla to povećava/smanjuje", odmah zakočite. Problem: Da li su neke varijable izostavljene? Da li je moguća obrnuta uzročnost? Da li je serija nepokretna? Nijedna uzročna rečenica ne ulazi u izvještaj dok se ne postave ova tri pitanja.
Dijagnostički testovi
Da bi regresija bila pouzdana, testiraju se njene pretpostavke: obrazac reziduala (terminovi greške) (autokorelacija), heteroskedastičnost (heteroskedastičnost), multikolinearnost (objašnjavajuće varijable su veoma slične jedna drugoj), normalna distribucija. Umjetna inteligencija piše kod za ove testove; ali posao ekonomiste je da interpretira rezultate i prilagodi model u skladu s tim.
tri mini kofera
Slučaj 1 — Lažna regresija. Istraživač je regresirao dvije serije trendova (jedna nominalna potrošnja, jedna nominalna druga količina); R-kvadrat je bio 0,98, koeficijent je bio visoko značajan. AI je "snažna veza", rekao je. Istraživač je testirao stacionarnost: obje serije su bile nestacionarne. Kada su se razdvojili, veza je uglavnom nestala. Visoki R-kvadrat je jednostavno zato što su oba rasla tokom vremena. Uhvaćena lažna regresija.
Slučaj 2 — Izostavljena varijabla. Jedna analiza je pokazala da “trošenje na oglašavanje povećava prodaju”. Ekonomista je pitao: da li postoji sezonski efekat u modelu? Nije bilo. I oglašavanje i prodaja su se povećavali prije praznika; Dio odnosa je bio sezonski. Kada su dodane sezonske lažne varijable, koeficijent oglašavanja je postao manji. Uzročna tvrdnja je ublažena.
Slučaj 3 — Značajan, ali beznačajan. U velikom skupu mikropodataka, koeficijent je bio p<0,001; AI "snažan uticaj", rekao je. Ali veličina koeficijenta je bila praktično zanemarljiva (velika promjena prihoda pomjerila je rezultat za hiljaditi dio). Ekonomist ga je ispravno označio kao „statistički značajan, ali ekonomski beznačajan“. Značaj nije bio zamjena za važnost.
Tabela moderiranja komentara
umjetna inteligencija kaže
Ekonomista pita
"X povećava Y"
Izostavljena varijabla? Obrnuta uzročnost?
"R-kvadrat je visok, model je dobar"
Da li je serija nepokretna? Lažna regresija?
"p<0,05, značajno"
Da li je veličina ekonomski važna?
"Koeficijent 0,3"
Jesu li njegov znak i jedinica kompatibilni s teorijom?
"Veza je jaka"
Je li odabir uzorka pristrasan?
Četiri šablona za kopiranje
1) Skica instalacije modela:
Ja ću ispitati sljedeće ekonomsko pitanje: [pitanje]. Zavisna varijabla: [Y]. Deskriptori kandidata: [X-ovi]. Predložite mi odgovarajuće početno podešavanje regresije (statsmodels kod). Objasnite koje su kontrolne varijable potrebne i zašto. NEMOJTE tvrditi uzročnost; Koristite jezik odnosa.
2) Dijagnostički testovi:
Upišite u kodu dijagnostičke testove za regresiju koju sam postavio: autokorelacija, heteroskedastičnost, multikolinearnost, disperzija reziduala i stacionarnost (ako je u pitanju vremenska serija). Napišite ukratko kako interpretirati svaki rezultat testa i šta učiniti ako dođe do problema.
3) Kontrola uzročnosti:
Protumačite ovaj rezultat regresije, ali prvo provjerite ove tri zamke: (1) da li postoji izostavljena varijabla i koja, (2) da li je moguća obrnuta uzročnost, (3) da li je niz stacionaran / postoji li rizik od lažne regresije? Jasno navedite da li rezultat treba tumačiti kao uzročni ili samo relacijski.
4) Razlika između značaja i važnosti:
Interpretirajte sljedeći koeficijent: vrijednost [x], standardna greška [y], p-vrijednost [z]. Ocijenite statističku značajnost posebno, ekonomski značaj posebno: da li je veličina ovog koeficijenta praktično značajan efekat? Konkretizirajte veličinu utjecaja u primjeru scenarija.
Slaba prompt / Jaka prompt
Slab upit:
Napravite regresiju s ovim varijablama i interpretirajte rezultat.
Umjetna inteligencija ga tumači uzročnim jezikom, bez obavljanja dijagnostičkih testova ili provjere stacionarnosti; lažna regresija ili izostavljena varijabla je propuštena.
Snažan upit:
Zavisna varijabla je potrošnja, eksplanatorni prihod; mjesečne, trendovske serije. Prvo testirajte stacionarnost; dobiti razliku ako je potrebno. Postavite regresiju, pokrenite dijagnostičke testove (autokorelacija, heteroskedastičnost). Eksplicitno razgovarajte o rizicima izostavljenih varijabli i obrnute uzročnosti prilikom tumačenja rezultata; Koristite relacioni, a ne kauzalni jezik. Posebno procijenite značaj i ekonomski značaj i dajte šifru za svaki korak.
Uobičajene greške
- Pogrešna korelacija za uzročnost. Najčešća i najskuplja greška.
- Zamijeniti visoki R-kvadrat za kvalitet. Takođe je visok u lažnim regresijama.
- Zaobilazeći provjeru zastoja. Trendovi serije proizvode lažne veze.
- Brkanje smislenosti sa značajem. Mali p ne znači veliki efekat.
- Preskakanje dijagnostičkih testova. Povrijeđena pretpostavka poništava čitav zaključak.
- Prihvatanje kauzalnog jezika AI kakav jeste. Sud pripada čovjeku.
Ukratko
Regresija je moćan, ali zamka alat. Koeficijent čitanja, standardna greška, p-vrijednost i R-kvadrat ispravno; razlikovanje korelacije i uzročnosti; provjeravanje izostavljenih varijabli, obrnute uzročnosti i lažne regresijske zamke; Potrebno je razlikovati značaj i ekonomski značaj. AI se ubrzava u generiranju koda i dijagnoze, ali govori previše uzročno; Izbor modela i prosudba uzročnosti ostaje na ekonomisti.
Zadatak aplikacije
Postavite jednostavnu regresiju s podacima koje imate (npr. potrošnja-prihod). Neka podešavanje bude proizvedeno sa 1. šablonom, a dijagnostički testovi napravljeni sa 2. šablonom. Zatim provjerite uzročnost pomoću šablona 3, imenujući barem jednu moguću izostavljenu varijablu i jedan obrnuti scenarij uzročnosti. Prevedite uzročnu rečenicu iz početne interpretacije AI u relacijski jezik i zabilježite promjenu.
kontrolna lista
- [ ] Tačno sam pročitao koeficijent, standardnu grešku, p-vrijednost i R-kvadrat.
- [ ] Provjerio sam stacionarnost serije i eliminirao rizik lažne regresije.
- [ ] Nazvao sam izostavljenu varijablu i mogućnosti obrnute uzročnosti.
- [ ] Proveo sam dijagnostičke testove i procijenio prekršaje.
- [ ] Procijenio sam statistički značaj i ekonomski značaj odvojeno.
- [ ] Uvukao sam kauzalni jezik veštačke inteligencije u relacioni jezik.
- [ ] Tvrdio sam da je izbor modela i sud o uzročnosti moj.