Câștiguri:
- Abilitatea de a citi cu acuratețe rezultatul regresiei (coeficient, eroare standard, valoare p, pătrat R) și de a evalua critic interpretarea inteligenței artificiale
- Abilitatea de a recunoaște capcanele, cum ar fi distincția corelație-cauză, endogeneitatea, variabilele omise și regresia falsă și de a reduce limbajul cauzal excesiv al inteligenței artificiale
- Abilitatea de a utiliza inteligența artificială pentru configurarea modelului, redactarea codului și a testelor de diagnosticare, lăsând responsabilitatea pentru selecția și interpretarea modelului în seama oamenilor
Econometria este disciplina de testare a teoriei economice cu date, iar regresia este instrumentul său de bază. „Cât de mult crește consumul pe măsură ce crește venitul?”, „Care este relația dintre dobândă și investiție?” Întrebări ca acestea sunt cuantificate prin regresie. AI este atât foarte utilă, cât și foarte periculoasă în acest domeniu: scrie codul modelului și testele de diagnosticare în câteva secunde, dar este adesea excesiv de cauzală și prea precisă atunci când interpretează rezultatul. Rostește fluent propoziția „X crește Y”; în timp ce majoritatea regresiilor măsoară o singură relație. Esența acestei unități este: Utilizați AI pentru configurarea modelului, testarea codului și diagnosticarea; dar păstrați responsabilitatea pentru selecția modelului, judecata cauzalității și interpretarea asupra omului.
Citirea rezultatului de regresie
Rezultatul unei regresii simple caută patru lucruri:
- Coeficient. O estimare a cât de mult se modifică variabila dependentă atunci când variabila explicativă crește cu o unitate. Semnul (plus/minus) și mărimea trebuie să aibă sens economic.
- Eroare standard. Incertitudinea estimării coeficientului; Dacă este mai mică, estimarea este mai precisă.
- valoarea p. Probabilitatea ca coeficientul să apară atât de mare în ipoteza că este „de fapt zero”. Se spune că p mic (< 0,05) este „semnificativ statistic” - dar acest lucru nu implică semnificație economică sau cauzalitate.
- R-pătrat. Cât de mult din modificarea variabilei dependente explică modelul. Un R-pătrat mare nu înseamnă „modelul corect”; Poate fi, de asemenea, mare în regresii false.
Sfat: Nu confundați semnificația statistică cu semnificația economică. Chiar și un efect foarte mic, practic nesemnificativ, se poate dovedi a fi „semnificativ” (p mic) într-un eșantion mare. În primul rând, „Este mărimea acestui coeficient importantă din punct de vedere economic?” ', apoi caută semnificația.
Corelația nu este cauzalitate: capcane clasice
Aceasta este avertismentul din centrul econometriei. Relația găsită prin regresie nu este adesea cauzalitate. Capcane majore:
- Variabilă omisă. Un al treilea factor care afectează atât X cât și Y, dar care nu se află în model, creează o relație falsă între X și Y. (Exemplu: dacă „capacitatea” este omisă în relația dintre educație și venit, coeficientul va induce în eroare.)
- Cauzalitate inversă (endogeneitate). În timp ce se crede că X îl afectează pe Y, poate Y îl afectează pe X sau cele două sunt reciproce. (Numărul poliției și criminalitatea: a crescut poliția pentru că a crescut criminalitatea?)
- Pseudo regresie. Două serii non-staționare (în tendințe) pot produce coeficienți R pătrat mari și semnificativi, chiar dacă nu există o relație reală între ele. Doar pentru că amândoi cresc în timp.
- Prejudecăți de selecție. Dacă eșantionul nu este aleatoriu, relația este măsurată înclinată.
Afirmația de cauzalitate poate fi stabilită numai cu un design adecvat (metode precum experiment controlat, experiment natural, variabilă instrumentală, diferență în diferență) și ipoteze clare. Inteligenței artificiale îi lipsește adesea această subtilitate.
Atenție: Dacă AI spune „această variabilă crește/descrește”, frânează imediat. Problemă: Există variabile omise? Este posibilă cauzalitatea inversă? Seria este staționară? Nicio propoziție cauzală nu intră în raport până când nu sunt adresate aceste trei întrebări.
Teste diagnostice
Pentru ca o regresie să fie fiabilă, sunt testate ipotezele acesteia: model de reziduuri (termeni de eroare) (autocorelație), heteroschedasticitate (heteroschedasticitate), multicoliniaritate (variabilele explicative sunt foarte asemănătoare între ele), distribuție normală. Inteligența artificială scrie codul pentru aceste teste; dar este treaba economistului să interpreteze rezultatele și să ajusteze modelul în consecință.
trei mini cutii
Cazul 1 – Regresia falsă. Un cercetător a regresat două serii de tendințe (una cheltuială nominală, una nominală o altă cantitate); R-pătratul a fost 0,98, coeficientul a fost foarte semnificativ. AI „este o relație puternică”, a spus el. Cercetătorul a testat staționaritatea: ambele serii au fost non-staționare. Odată ce au fost despărțiți, relația a dispărut în mare măsură. R-pătratul mare a fost pur și simplu pentru că ambele au crescut în timp. Regresia falsă prinsă.
Cazul 2 — Variabilă omisă. O analiză a constatat că „cheltuielile publicitare cresc vânzările”. Economistul a întrebat: există un efect sezonier în model? Nu a fost. Atât publicitatea, cât și vânzările erau în creștere înainte de vacanță; O parte a relației a fost sezonalitatea. Când au fost adăugate variabile inactiv de sezon, coeficientul de publicitate a devenit mai mic. Afirmația cauzală a fost atenuată.
Cazul 3 – Semnificativ, dar nesemnificativ. Într-un set mare de microdate, un coeficient a fost p<0,001; AI „impact puternic”, a spus el. Dar amploarea coeficientului a fost practic neglijabilă (o schimbare mare a venitului a mutat rezultatul cu o miime). Economistul l-a încadrat corect drept „semnificativ din punct de vedere statistic, dar nesemnificativ din punct de vedere economic”. Semnificația nu a înlocuit importanța.
Tabel de moderare a comentariilor
spune inteligența artificială
întreabă economistul
„X crește Y”
Variabilă omisă? Cauzalitate inversă?
„R-pătratul este mare, modelul este bun”
Seria este staționară? regresie falsă?
„p<0,05, semnificativ”
Mărimea contează din punct de vedere economic?
„Coeficient 0,3”
Sunt semnul și unitatea sa compatibile cu teoria?
„Relația este puternică”
Selectarea eșantionului este părtinitoare?
Patru șabloane copiabile
1) Schiță de instalare a modelului:
Voi examina următoarea întrebare economică: [întrebare]. Variabilă dependentă: [Y].Descriptori candidați: [X-uri]. Sugerați-mi o configurație de regresie inițială adecvată (codul statsmodels). Explicați ce variabile de control sunt necesare și de ce. NU pretindeți cauzalitate; Folosește limbajul relațional.
2) Teste de diagnostic:
Scrieți în cod testele de diagnostic pentru regresia pe care am configurat-o: autocorelație, heteroscedasticitate, multicoliniaritate, dispersie de reziduuri și staționaritate (dacă este o serie temporală). Scrieți pe scurt cum să interpretați fiecare rezultat al testului și ce să faceți dacă există probleme.
3) Controlul cauzalității:
Interpretați acest rezultat al regresiei, dar mai întâi verificați aceste trei capcane: (1) ar putea exista o variabilă omise și care dintre ele, (2) este posibilă cauzalitatea inversă, (3) seria este staționară / există riscul unei regresii false? Spuneți clar dacă rezultatul trebuie interpretat ca cauzal sau doar relațional.
4) Distincția semnificație-importanță:
Interpretați următorul coeficient: valoarea [x], eroarea standard [y], valoarea p [z]. Evaluați separat semnificația statistică, semnificația economică separat: este mărimea acestui coeficient un efect practic semnificativ? Concretați amploarea impactului într-un scenariu exemplu.
Prompt slab / Prompt puternic
Prompt slab:
Faceți o regresie cu aceste variabile și interpretați rezultatul.
Inteligența artificială o interpretează într-un limbaj cauzal, fără a efectua teste de diagnostic sau a verifica staționaritatea; regresia falsă sau variabila omisă este omisă.
Solicitare puternică:
Variabila dependentă este consumul, venitul explicativ; serii lunare, în tendințe. Testați mai întâi staționaritatea; obțineți diferența dacă este necesar. Configurați regresia, rulați teste de diagnostic (autocorelare, heteroscedasticitate). Discutați în mod explicit riscurile variabilelor omise și cauzalitatea inversă atunci când interpretați rezultatul; Folosiți mai degrabă un limbaj relațional decât cauzal. Evaluați semnificația și semnificația economică separat și dați codul pentru fiecare pas.
Greșeli comune
- Corelație greșită cu cauzalitate. Cea mai frecventă și mai scumpă greșeală.
- Confundarea unui R pătrat mare cu calitatea. Este, de asemenea, mare în regresii false.
- Ocolind verificarea stazei. Serile la modă produc relații false.
- Confundarea semnificației cu semnificația. P mic nu înseamnă efect mare.
- Omiterea testelor de diagnosticare. Presupunerea încălcată înfrânge întreaga inferență.
- Acceptând limbajul cauzal al AI așa cum este. Judecata aparține omului.
Pe scurt
Regresia este un instrument puternic, dar capcană. Coeficientul de citire, eroarea standard, valoarea p și R-pătratul corect; distingerea între corelație și cauzalitate; verificarea variabilelor omise, cauzalitatea inversă și capcanele de regresie false; Este necesar să se facă distincția între semnificație și importanță economică. AI se accelerează în generarea codului și a diagnosticului, dar vorbește prea cauzal; Alegerea modelului și judecata cauzalității revine economistului.
Sarcina de aplicare
Configurați o regresie simplă cu datele pe care le aveți (de exemplu, consum-venit). Produceți configurația cu primul șablon, iar testele de diagnosticare cu cel de-al doilea șablon. Apoi verificați cauzalitatea cu șablonul 3, denumind cel puțin o posibilă variabilă omisă și un scenariu de cauzalitate inversă. Traduceți o propoziție cauzală din interpretarea inițială a IA în limbaj relațional și notați schimbarea.
lista de verificare
- [ ] Am citit corect coeficientul, eroarea standard, valoarea p și R-pătratul.
- [ ] Am verificat staționaritatea seriei și am eliminat riscul unei regresii false.
- [ ] Am numit variabila omisă și posibilitățile de cauzalitate inversă.
- [ ] Am efectuat teste de diagnosticare și am evaluat încălcările.
- [ ] Am evaluat separat semnificația statistică și semnificația economică.
- [ ] Am tras limbajul cauzal al inteligenței artificiale în limbajul relațional.
- [ ] Am susținut că alegerea modelului și judecata cauzalității a fost a mea.