Nyereség:
- Képes a regressziós kimenet pontos olvasására (együttható, standard hiba, p-érték, R-négyzet) és kritikusan értékelni a mesterséges intelligencia értelmezését
- Képes felismerni az olyan buktatókat, mint a korreláció-okozati összefüggés, az endogenitás, a kihagyott változók és a hamis regresszió, és megfékezni a mesterséges intelligencia túlzott oksági nyelvezetét
- Lehetőség mesterséges intelligencia használatára modellbeállításhoz, kód- és diagnosztikai tesztek elkészítéséhez, a modellválasztás és -értelmezés felelősségét az emberekre bízva
Az ökonometria a közgazdasági elmélet adatokkal való tesztelésének tudományága, ennek alapvető eszköze a regresszió. "Mennyire nő a fogyasztás a jövedelem növekedésével?", "Mi a kapcsolat a kamat és a befektetés között?" Az ehhez hasonló kérdéseket regresszióval számszerűsítjük. Az AI egyszerre nagyon hasznos és nagyon veszélyes ezen a területen: másodpercek alatt megírja a modellkódot és a diagnosztikai teszteket, de gyakran túlzottan okozati és túl precíz a kimenet értelmezésekor. Folyékonyan mondja az "X növeli Y" mondatot; míg a legtöbb regresszió csak egy kapcsolatot mér. Ennek az egységnek a lényege: AI használata modellbeállításhoz, kód- és diagnosztikai teszteléshez; de a modellválasztás, az ok-okozati összefüggések megítélése és az értelmezés felelőssége az emberen maradjon.
Regressziós kimenet olvasása
Az egyszerű regresszió kimenete négy dolgot keres:
- Együttható. Becslés, hogy mennyit változik a függő változó, ha a magyarázó változó egy egységgel nő. A jelnek (plusz/mínusz) és a nagyságnak gazdasági jelentéssel kell rendelkeznie.
- Standard hiba. Az együttható becslésének bizonytalansága; Ha kisebb, a becslés pontosabb.
- p-érték. Annak a valószínűsége, hogy az együttható ekkora megjelenésű, ha feltételezzük, hogy „valójában nulla”. A kis p-t (< 0,05) „statisztikailag szignifikánsnak” mondják – ez azonban nem jelent gazdasági szignifikanciát vagy okozati összefüggést.
- R-négyzet. A függő változó változásának mekkora részét magyarázza a modell. A magas R-négyzet nem jelenti a "helyes modellt"; Hamis regressziók esetén is magas lehet.
Tipp: Ne keverje össze a statisztikai szignifikanciát a gazdasági szignifikanciával. Még egy nagyon kicsi, gyakorlatilag jelentéktelen hatás is „szignifikánsnak” (kis p) bizonyulhat nagy mintában. Először is: "Gazdaságilag fontos ennek az együtthatónak a mérete?" ', majd keresd a jelentőségét.
A korreláció nem okozati összefüggés: klasszikus buktatók
Ez a figyelmeztetés az ökonometria középpontjában. A regresszióval talált összefüggés gyakran nem ok-okozati összefüggés. Főbb buktatók:
- Kihagyott változó. Egy harmadik tényező, amely X-et és Y-t is érinti, de nem szerepel a modellben, hamis kapcsolatot hoz létre X és Y között. (Példa: ha az iskolai végzettség és a jövedelem kapcsolatából kihagyjuk a "képességet", az együttható félrevezető lesz.)
- Fordított kauzalitás (endogenitás). Míg úgy gondolják, hogy X hatással van Y-ra, lehet, hogy Y hatással van X-re, vagy a kettő kölcsönös. (A rendőrök száma és a bűnözés: azért nőtt a rendőrség, mert nőtt a bűnözés?)
- Pszeudo regresszió. Két nem stacionárius (trendező) sorozat magas R-négyzetű és szignifikáns együtthatókat eredményezhet, még akkor is, ha nincs valódi kapcsolat közöttük. Csak mert mindketten nőnek az idő múlásával.
- Kiválasztási torzítás. Ha a minta nem véletlenszerű, akkor az összefüggést ferdén mérjük.
Az ok-okozati összefüggés állítása csak megfelelő tervezéssel (módszerek, mint kontrollált kísérlet, természetes kísérlet, műszeres változó, különbség a különbségben) és egyértelmű feltételezések alapján állapítható meg. A mesterséges intelligencia gyakran figyelmen kívül hagyja ezt a finomságot.
Figyelem: Ha az AI azt mondja, hogy "ez a változó növeli/csökkenti ezt", azonnal fékezzen. Probléma: Vannak-e kihagyott változók? Lehetséges-e fordított ok-okozati összefüggés? Állnak a sorozatok? A jelentésbe nem kerül ok-okozati mondat, amíg ezt a három kérdést fel nem teszik.
Diagnosztikai vizsgálatok
Ahhoz, hogy egy regresszió megbízható legyen, teszteljük a feltevéseit: reziduális mintázat (hibakifejezések) (autokorreláció), heteroszkedaszticitás (heteroszkedaszticitás), multikollinearitás (a magyarázó változók nagyon hasonlóak egymáshoz), normális eloszlás. A mesterséges intelligencia írja a kódot ezekhez a tesztekhez; de a közgazdász dolga az eredmények értelmezése és a modell hozzáigazítása.
három mini tok
1. eset – Hamis regresszió. Egy kutató két trendsort regreszett (egy nominális kiadás, egy nominális másik mennyiség); Az R-négyzet 0,98, az együttható nagyon szignifikáns. Az AI „erős kapcsolat” – mondta. A kutató stacionaritást tesztelt: mindkét sorozat nem stacionárius volt. Miután elváltak, a kapcsolat nagyrészt megszűnt. A magas R-négyzet egyszerűen azért volt, mert mindketten nőttek az idő múlásával. Elkapták a hamis regressziót.
2. eset – Kihagyott változó. Egy elemzés megállapította, hogy „a hirdetési kiadások növelik az eladásokat”. A közgazdász megkérdezte: van-e szezonális hatás a modellben? Nem volt. Mind a reklámok, mind az eladások növekedtek az ünnep előtt; A kapcsolat része volt a szezonalitás. Amikor hozzáadták a szezonális dummy változókat, a reklám együtthatója kisebb lett. Az ok-okozati összefüggést enyhítették.
3. eset – Jelentős, de jelentéktelen. Egy nagy mikroadatkészletben az együttható p<0,001 volt; Az AI „erős hatás” – mondta. De az együttható nagysága gyakorlatilag elhanyagolható volt (a jövedelem nagy változása egy ezreddel mozdította el az eredményt). A közgazdász helyesen úgy fogalmazott, hogy „statisztikailag jelentős, de gazdaságilag jelentéktelen”. A jelentőség nem helyettesítette a fontosságot.
Megjegyzés moderációs táblázat
mondja a mesterséges intelligencia
– kérdezi a közgazdász
"X növeli Y-t"
Kihagyott változó? Fordított ok-okozati összefüggés?
"Az R-négyzet magas, a modell jó"
Állnak a sorozatok? Hamis regresszió?
"p<0,05, szignifikáns"
Számít a méret gazdaságilag?
"együttható 0,3"
Összeegyeztethető az előjele és mértékegysége az elmélettel?
"Erős a kapcsolat"
Elfogult a mintaválasztás?
Négy másolható sablon
1) Modell beépítési vázlat:
A következő közgazdasági kérdést fogom megvizsgálni: [kérdés]. Függő változó: [Y]. Jelölt leírók: [X-ek]. Javasoljon egy megfelelő kezdeti regressziós beállítást (statsmodels kód). Magyarázza el, mely vezérlőváltozókra van szükség és miért. NE állítsd az okozati összefüggést; Használj kapcsolati nyelvet.
2) Diagnosztikai vizsgálatok:
Írja be kódba az általam felállított regresszió diagnosztikai tesztjeit: autokorreláció, heteroszkedaszticitás, multikollinearitás, reziduumok diszperziója és stacionaritás (ha idősorról van szó). Röviden írja le, hogyan kell értelmezni az egyes teszteredményeket, és mit kell tenni, ha problémák merülnek fel.
3) Ok-okozati összefüggés ellenőrzése:
Értelmezze ezt a regressziós eredményt, de először ellenőrizze ezt a három buktatót: (1) lehet-e kihagyott változó, és melyik, (2) lehetséges-e a fordított ok-okozati összefüggés, (3) a sorozat stacionárius / fennáll-e a hamis regresszió veszélye? Világosan fogalmazza meg, hogy az eredményt ok-okozatinak vagy pusztán összefüggésnek kell-e értelmezni.
4) Jelentőség-fontosság megkülönböztetés:
Értelmezze a következő együtthatót: érték [x], standard hiba [y], p-érték [z]. Értékelje külön a statisztikai szignifikanciát, külön a gazdasági szignifikanciát: ennek az együtthatónak a nagysága gyakorlatilag szignifikáns hatás? Konkrétan határozza meg a hatás nagyságát egy példa forgatókönyvben.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Végezzen regressziót ezekkel a változókkal, és értelmezze az eredményt.
A mesterséges intelligencia ok-okozati nyelven értelmezi, anélkül, hogy diagnosztikai teszteket végezne, vagy nem ellenőrizné a stacionaritást; hamis regresszió vagy kihagyott változó kimarad.
Erőteljes felszólítás:
A függő változó a fogyasztás, a magyarázó jövedelem; havi, felkapott sorozat. Először tesztelje az állóképességet; különbséget kap, ha szükséges. Állítsa be a regressziót, futtasson diagnosztikai teszteket (autokorreláció, heteroszkedaszticitás). Az eredmény értelmezésekor kifejezetten tárgyalja a kihagyott változók és a fordított ok-okozati összefüggés kockázatait; Inkább relációs, mint oksági nyelvezetet használjon. Értékelje külön-külön a jelentőségét és a gazdasági jelentőségét, és minden lépéshez adja meg a kódot.
Gyakori hibák
- Az ok-okozati összefüggés összetévesztése. A leggyakoribb és legdrágább hiba.
- Összetéveszti a magas R-négyzetet a minőséggel. Magas a hamis regresszió is.
- A pangás ellenőrzésének megkerülése. A felkapott sorozatok hamis kapcsolatokat hoznak létre.
- Az értelmesség összekeverése a jelentőséggel. A kis p nem jelent nagy hatást.
- Diagnosztikai tesztek kihagyása. A megsértett feltételezés az egész következtetést megdönti.
- Az AI kauzális nyelvének elfogadása úgy, ahogy van. Az ítélet az emberé.
Összefoglalva
A regresszió hatékony, de buktatós eszköz. Leolvasási együttható, standard hiba, p-érték és R-négyzet helyesen; a korreláció és az ok-okozati összefüggés megkülönböztetése; a kihagyott változók, a fordított ok-okozati összefüggések és a hamis regressziós buktatók ellenőrzése; Különbséget kell tenni a jelentőség és a gazdasági fontosság között. A mesterséges intelligencia felgyorsul a kód- és diagnózisgenerálásban, de túlságosan kauzálisan beszél; A modell megválasztása és az ok-okozati összefüggés megítélése a közgazdász feladata.
Pályázati feladat
Állítson be egy egyszerű regressziót a birtokában lévő adatokkal (pl. fogyasztás-jövedelem). Készítse elő a beállítást az 1. sablonnal, a diagnosztikai teszteket pedig a 2. sablonnal. Ezután ellenőrizze az okozati összefüggést a 3. sablonnal, megnevezve legalább egy lehetséges kihagyott változót és egy fordított oksági forgatókönyvet. Fordítson le egy oksági mondatot az AI kezdeti értelmezéséből relációs nyelvre, és vegye figyelembe a változást.
ellenőrző lista
- [ ] Helyesen olvastam le az együtthatót, a standard hibát, a p-értéket és az R-négyzetet.
- [ ] Ellenőriztem a sorozat stacionaritását, és kizártam a hamis regresszió kockázatát.
- [ ] Neveztem a kihagyott változó és fordított oksági lehetőségeket.
- [ ] Diagnosztikai teszteket végeztem, és értékeltem a jogsértéseket.
- [ ] A statisztikai szignifikanciát és a gazdasági szignifikanciát külön értékeltem.
- [ ] A mesterséges intelligencia kauzális nyelvét a relációs nyelvbe vontam be.
- [ ] Fenntartottam, hogy a modellválasztás és az ok-okozati összefüggés megítélése az enyém.