Vienība 7 / 11

Ekonometriskā modeļa atbalsts: regresija, cēloņsakarība un interpretācija

Ieguvumi:

  • Spēja precīzi nolasīt regresijas izvadi (koeficients, standarta kļūda, p-vērtība, R-kvadrāts) un kritiski novērtēt mākslīgā intelekta interpretāciju
  • Spēja atpazīt kļūdas, piemēram, korelācijas un cēloņsakarības atšķirības, endogenitāti, izlaistos mainīgos un viltus regresiju, un ierobežot mākslīgā intelekta pārmērīgo cēloņsakarību.
  • Spēja izmantot mākslīgo intelektu modeļu iestatīšanai, koda un diagnostikas testu izstrādei, atstājot atbildību par modeļa izvēli un interpretāciju cilvēkiem

Ekonometrija ir ekonomikas teorijas testēšanas disciplīna ar datiem, un regresija ir tās pamatrīks. "Cik patēriņš palielinās, pieaugot ienākumiem?", "Kāda ir procentu un investīciju saistība?" Šādi jautājumi tiek kvantificēti ar regresiju. AI šajā jomā ir gan ļoti noderīgs, gan ļoti bīstams: tas ieraksta modeļa kodu un diagnostikas testus sekundēs, taču bieži vien ir pārāk cēloņsakarīgs un pārāk precīzs, interpretējot izvadi. tekoši runā teikumu "X palielina Y"; tā kā lielākā daļa regresiju mēra tikai vienu attiecību. Šīs vienības būtība ir šāda: izmantojiet AI modeļa iestatīšanai, koda un diagnostikas testēšanai; bet atbildību par modeļa izvēli, cēloņsakarību spriedumu un interpretāciju paturiet uz cilvēku.

Regresijas izvades nolasīšana

Vienkāršas regresijas rezultāts meklē četras lietas:

  • Koeficients. Aprēķins par to, cik daudz mainās atkarīgais mainīgais, ja skaidrojošais mainīgais palielinās par vienu vienību. Zīmei (plus/mīnus) un lielumam ir jābūt ekonomiskai nozīmei.
  • Standarta kļūda. Koeficienta aprēķina nenoteiktība; Ja tas ir mazāks, aprēķins ir precīzāks.
  • p-vērtība. Varbūtība, ka koeficients parādīsies tik liels, pieņemot, ka tas ir "faktiski nulle". Tiek uzskatīts, ka mazs p (< 0,05) ir “statistiski nozīmīgs”, taču tas nenozīmē ekonomisku nozīmi vai cēloņsakarību.
  • R kvadrātā. Cik lielu daļu atkarīgā mainīgā izmaiņu modelis izskaidro. Augsts R kvadrāts nenozīmē "pareizo modeli"; Tas var būt arī augsts viltus regresijas gadījumā.
Padoms. Nejauciet statistisko nozīmīgumu ar ekonomisko nozīmīgumu. Pat ļoti mazs, praktiski nenozīmīgs efekts var izrādīties "nozīmīgs" (mazs p) lielā izlasē. Pirmkārt, "Vai šī koeficienta lielums ir ekonomiski svarīgs?" ', tad meklējiet nozīmi.

Korelācija nav cēloņsakarība: klasiskās nepilnības

Šis ir brīdinājums ekonometrijas pamatā. Regresijas ceļā konstatētās attiecības bieži vien nav cēloņsakarības. Galvenās nepilnības:

  • Izlaists mainīgais. Trešais faktors, kas ietekmē gan X, gan Y, bet nav iekļauts modelī, rada viltus attiecības starp X un Y. (Piemērs: ja izglītības un ienākumu attiecībās ir izlaista "spēja", koeficients būs maldinošs.)
  • Apgrieztā cēloņsakarība (endogenitāte). Lai gan tiek uzskatīts, ka X ietekmē Y, iespējams, Y ietekmē X vai abi ir savstarpēji saistīti. (Policijas skaits un noziedzība: vai policija palielinājās, jo pieauga noziedzība?)
  • Pseido regresija. Divas nestacionāras (trendējošas) sērijas var dot lielus R kvadrātu un nozīmīgus koeficientus, lai gan starp tām nav reālas attiecības. Tikai tāpēc, ka viņi abi laika gaitā aug.
  • Atlases neobjektivitāte. Ja izlase nav nejauša, attiecības mēra šķībi.

Apgalvojumu par cēloņsakarību var noteikt tikai ar atbilstošu plānu (tādas metodes kā kontrolēts eksperiments, dabisks eksperiments, instrumentālais mainīgais, atšķirības starpība) un skaidriem pieņēmumiem. Mākslīgais intelekts bieži palaiž garām šo smalkumu.

Uzmanību: ja AI saka "šis mainīgais to palielina/samazina", nekavējoties bremzējiet. Problēma: vai ir izlaisti kādi mainīgie? Vai ir iespējama apgrieztā cēloņsakarība? Vai sērija ir stacionāra? Ziņojumā netiek ievadīts neviens cēloņsakarības teikums, kamēr nav uzdoti šie trīs jautājumi.

Diagnostikas testi

Lai regresija būtu ticama, tiek pārbaudīti tās pieņēmumi: atlieku modelis (kļūdu termini) (autokorelācija), heteroskedastiskums (heteroskedastiskums), multikolinearitāte (skaidrojošie mainīgie ir ļoti līdzīgi viens otram), normālais sadalījums. Mākslīgais intelekts raksta kodu šiem testiem; bet ekonomista uzdevums ir interpretēt rezultātus un attiecīgi pielāgot modeli.

trīs mini futrāļi

1. gadījums — viltus regresija. Pētnieks regresēja divas tendenču sērijas (viena nominālā tēriņa, viena nominālā cita summa); R kvadrāts bija 0,98, koeficients bija ļoti nozīmīgs. AI "ir spēcīgas attiecības," viņš teica. Pētnieks pārbaudīja stacionaritāti: abas sērijas bija nestacionāras. Kad viņi tika šķirti, attiecības lielākoties izzuda. Augstais R kvadrāts bija vienkārši tāpēc, ka viņi abi laika gaitā pieauga. Pieķerta viltus regresija.

2. gadījums — izlaists mainīgais. Viena analīze atklāja, ka “reklāmas izdevumi palielina pārdošanas apjomu”. Ekonomists jautāja: vai modelī ir sezonāls efekts? Nebija. Pirms svētkiem pieauga gan reklāma, gan pārdošanas apjomi; Daļa no attiecībām bija sezonalitāte. Kad tika pievienoti sezonas fiktīvie mainīgie, reklāmas koeficients kļuva mazāks. Cēloņsakarības prasība ir mīkstināta.

3. gadījums — nozīmīgs, bet nenozīmīgs. Lielā mikrodatu kopā koeficients bija p<0,001; AI "spēcīga ietekme", viņš teica. Bet koeficienta lielums bija praktiski niecīgs (lielas ienākumu izmaiņas pabīdīja rezultātu par vienu tūkstošdaļu). Ekonomists to pareizi formulēja kā "statistiski nozīmīgu, bet ekonomiski nenozīmīgu". Nozīmīgums neaizstāja svarīgumu.

Komentāru moderēšanas tabula

mākslīgais intelekts saka

Ekonomists jautā

"X palielina Y"

Izlaists mainīgais? Apgrieztā cēloņsakarība?

"R kvadrāts ir augsts, modelis ir labs"

Vai sērija ir stacionāra? Viltus regresija?

"p<0,05, nozīmīgs"

Vai izmēram ir ekonomiska nozīme?

"Koeficients 0,3"

Vai tā zīme un mērvienība ir saderīga ar teoriju?

"Attiecības ir spēcīgas"

Vai izlases atlase ir neobjektīva?

Četras kopējamas veidnes

1) Modeļa uzstādīšanas skice:

Es izskatīšu šādu ekonomisko jautājumu: [jautājums]. Atkarīgais mainīgais: [Y]. Kandidātu deskriptori: [X]. Iesakiet man piemērotu sākotnējo regresijas iestatījumu (statsmodels kodu). Paskaidrojiet, kuri kontroles mainīgie ir nepieciešami un kāpēc. NEPADZIET cēlonību; Izmantojiet attiecību valodu.

2) Diagnostikas testi:

Ierakstiet kodā manis iestatītās regresijas diagnostikas testus: autokorelāciju, heteroskedasticitāti, multikolinearitāti, atlieku izkliedi un stacionaritāti (ja tā ir laikrinda). Īsi uzrakstiet, kā interpretēt katru testa rezultātu un kā rīkoties, ja rodas problēmas.

3) Cēloņsakarības kontrole:

Interpretējiet šo regresijas rezultātu, bet vispirms pārbaudiet šīs trīs nepilnības: (1) vai var būt izlaists mainīgais, un kurš no tiem, (2) ir iespējama apgrieztā cēloņsakarība, (3) vai rinda ir stacionāra / vai pastāv viltus regresijas risks? Skaidri norādiet, vai rezultāts ir jāinterpretē kā cēloņsakarīgs vai tikai saistīts.

4) Nozīmīguma un nozīmes atšķirība:

Interpretējiet šādu koeficientu: vērtība [x], standarta kļūda [y], p vērtība [z]. Atsevišķi izvērtējiet statistisko nozīmību, atsevišķi ekonomisko nozīmīgumu: vai šī koeficienta lielums ir praktiski nozīmīgs efekts? Konkrējiet ietekmes lielumu scenārija piemērā.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Veiciet regresiju ar šiem mainīgajiem un interpretējiet rezultātu.

Mākslīgais intelekts to interpretē kauzālā valodā, neveicot diagnostiskos testus un nepārbaudot stacionaritāti; viltus regresija vai izlaists mainīgais ir izlaista.

Spēcīga uzvedne:

Atkarīgais mainīgais ir patēriņš, skaidrojošie ienākumi; ikmēneša, tendenču sērija. Vispirms pārbaudiet stacionaritāti; ja nepieciešams, iegūstiet atšķirību. Iestatiet regresiju, veiciet diagnostikas testus (autokorelācija, heteroskedastiskums). Interpretējot rezultātu, skaidri apspriediet riskus, kas saistīti ar izlaistu mainīgo lielumu un apgriezto cēloņsakarību; Izmantojiet relāciju, nevis cēloņsakarību valodu. Novērtējiet nozīmīgumu un ekonomisko nozīmi atsevišķi un norādiet katra soļa kodu.

Biežas kļūdas

  • Kļūdaina korelācija ar cēloņsakarību. Visizplatītākā un dārgākā kļūda.
  • Sajaucot augstu R kvadrātu ar kvalitāti. Tas ir arī augsts viltus regresijas.
  • Apejot stāzes pārbaudi. Modernie seriāli rada viltus attiecības.
  • Jaukt jēgpilnību ar nozīmīgumu. Mazs p nenozīmē lielu efektu.
  • Diagnostikas testu izlaišana. Pārkāptais pieņēmums pārspēj visu secinājumu.
  • Pieņemt AI cēloņsakarību tādu, kāda tā ir. Spriedums pieder cilvēkam.

Rezumējot

Regresija ir spēcīgs, bet neveiksmīgs instruments. Pareizi nolasīšanas koeficients, standarta kļūda, p vērtība un R kvadrāts; korelācijas nošķiršana no cēloņsakarības; izlaistu mainīgo, apgrieztās cēloņsakarības un viltus regresijas kļūmju pārbaude; Ir nepieciešams nošķirt nozīmīgumu un ekonomisko nozīmi. AI paātrinās koda un diagnozes ģenerēšana, taču tas runā pārāk cēloņsakarīgi; Modeļa izvēle un cēloņsakarības spriedums ir ekonomista ziņā.

Lietojumprogrammas uzdevums

Iestatiet vienkāršu regresiju ar jūsu rīcībā esošajiem datiem (piemēram, patēriņš-ienākumi). Uzstādiet iestatījumus, izmantojot 1. veidni, un diagnostikas testus, izmantojot 2. veidni. Pēc tam pārbaudiet cēloņsakarību, izmantojot 3. veidni, nosaucot vismaz vienu iespējamo izlaisto mainīgo un vienu apgrieztās cēloņsakarības scenāriju. Tulkojiet cēloņsakarības teikumu no sākotnējās AI interpretācijas relāciju valodā un atzīmējiet izmaiņas.

kontrolsaraksts

  • [ ] Es pareizi nolasīju koeficientu, standarta kļūdu, p vērtību un R kvadrātu.
  • [ ] Es pārbaudīju sērijas stacionaritāti un novērsu viltus regresijas risku.
  • [ ] Es nosaucu izlaisto mainīgo un apgrieztās cēloņsakarības iespējas.
  • [ ] Es veicu diagnostikas testus un novērtēju pārkāpumus.
  • [ ] Atsevišķi izvērtēju statistisko nozīmīgumu un ekonomisko nozīmību.
  • [ ] Es esmu ievilcis mākslīgā intelekta cēloņsakarību valodu relāciju valodā.
  • [ ] Es apgalvoju, ka modeļa izvēle un cēloņsakarības spriedums bija mans.