Njësia 4 / 11

Regresioni linear: Ndërtimi i modelit, interpretimi i koeficientit dhe supozimet

Fitimet:

  • Aftësia për të ndërtuar një model regresioni linear me mbështetjen e inteligjencës artificiale dhe interpretimin e koeficientëve, gabimeve standarde dhe R-katrorit në një gjuhë të saktë dhe jo shkakore
  • Aftësia për të kuptuar supozimet bazë mbi të cilat bazohet modeli (lineariteti, ekzogjeniteti, varianca konstante) dhe çfarë ndodh kur ato shkelen dhe të përdorin inteligjencën artificiale për kontrollin e supozimeve.
  • Aftësia për të njohur dhe korrigjuar pretendimet e tepërta kauzale dhe problemet e ndryshueshme të anashkaluara në interpretimet e koeficientëve të prodhuar nga inteligjenca artificiale

Regresioni linear është shtylla kurrizore e ekonometrisë dhe statistikave të aplikuara. Në formën e tij më të thjeshtë, ai vlerëson se si një variabël i varur (rezultati që dëshironi të shpjegoni, të tilla si të ardhurat) ndryshon përmes një marrëdhënieje lineare me një ose më shumë variabla të pavarur (faktorë shpjegues, të tillë si vitet e arsimit, përvoja). Modeli ka formën: të ardhura = β0 + β1· arsim + β2· përvojë + u. Këtu koeficientët β (beta) tregojnë madhësinë e lidhjes, dhe u tregon termin e gabimit (të gjitha efektet e pavëzhguara) që modeli nuk mund ta shpjegojë. Në këtë njësi, ne do të shohim se si inteligjenca artificiale (AI) përshpejton ndërtimin dhe interpretimin e regresionit, por pse interpretimi i koeficientit është vendi ku gabimet bëhen më shpesh.

Le të vendosim nga fillimi qëllimin bazë: AI shkruan kodin e regresionit, organizon tabelën e daljes, prodhon një draft për interpretimin e koeficientit. Por është vendimi juaj se cilat variabla hyjnë në model (specifikimi i modelit), nëse koeficienti interpretohet si shkakësor apo relacional, dhe nëse ka një variabël të anashkaluar. Zakoni më i rrezikshëm i AI është të paraqesë koeficientët e zakonshëm të regresionit në gjuhën shkakësore si "X rrit Y"; kurse shumica e regresioneve tregojnë vetëm lidhje (korrelacion).

Rrjedha e punës e regresionit hap pas hapi

1. Ndërtoni modelin me teori. Se cilat variabla do të jenë të varur dhe cilët do të jenë të pavarur vjen nga njohuritë dhe teoria e fushës, jo nga statistikat. Logjika e "Cilët faktorë ndikojnë logjikisht në këtë rezultat?" nuk është logjika e "çfarëdo që të vendos në të dhëna, koeficienti do të jetë i rëndësishëm".

2. Merre me mend. Metoda më e zakonshme është OLS (Ordinary Least Squares): ajo zgjedh koeficientët në një mënyrë që minimizon shumën e diferencave në katror midis vlerave të vëzhguara dhe të parashikuara. AI gjeneron kodin për këtë (lm() në R, statsmodels në Python) menjëherë.

3. Lexoni rezultatin. Kërkoni katër gjëra në daljen e regresionit: koeficientin (drejtimi dhe madhësia e marrëdhënies), gabimi standard (pasiguria e vlerësimit të koeficientit), statistika t dhe vlera p (fuqia e provës se koeficienti është i ndryshëm nga zero), R-katror (sa është ndryshimi në variablin e varur që modeli shpjegon nga 0 në ran1). Një katror i lartë R nuk do të thotë një "model i mirë"; Nuk ka fare shkakësi.

4. Interpretoni saktë koeficientin. Nëse koeficienti i arsimit është 1200, interpretimi i saktë është: "Vaibla të tjera duke qenë konstante, një rritje njëvjeçare e arsimit shoqërohet me një mesatare prej 1200 njësi të ardhurash më të larta". Keqinterpretim: “Një vit tjetër arsimi rrit të ardhurat me 1200”. E dyta është pretendimi i shkakësisë dhe mund të mbrohet vetëm me modelin e duhur (njësia 9).

5. Kontrolloni supozimet. Vlefshmëria e regresionit varet nga supozime të caktuara (më poshtë). AI gjeneron kodin diagnostik; Ju bëni komentin.

Supozimet bazë të regresionit linear

Supozimet mbi të cilat bazohet modeli linear klasik janë të nevojshme që koeficientët të jenë të paanshëm (të përqendruar në linjë) dhe gabimet standarde të jenë të besueshme:

  • Lineariteti: Lidhja është lineare në parametra (e shtrirë në terma log/katror nëse është e nevojshme).
  • Ekzogjeniteti (mesatarja e kushtëzuar zero): Termi i gabimit është i pakorreluar me variablat shpjegues. Ky është supozimi më kritik dhe më shpesh i shkelur; shkelja krijon paragjykime të variablave të anashkaluara.
  • Varianca konstante (homoscedasticiteti): Varianca e termit të gabimit është e njëjtë në të gjitha vëzhgimet (shkelje: heteroskedasticiteti - njësia 5).
  • Mungesa e autokorrelacionit: Gabimet janë të pavarura nga njëra-tjetra (shkeljet e shpeshta në seritë kohore - njësitë 5 dhe 8).
  • Mungesa e shumëkolinearitetit ekstrem: Variablat shpjegues nuk janë pothuajse identikë me njëri-tjetrin (njësia 5).
Kujdes: Problemi më i rrezikshëm është anashkalimi i paragjykimeve të ndryshueshme. Nëse lini jashtë një faktor nga modeli juaj që lidhet si me të ardhurat ashtu edhe me arsimin (p.sh. prejardhja familjare, aftësia), koeficienti i arsimimit merr efektin e këtij faktori që mungon dhe fryhet. AI nuk mund të dijë variablin që mungon; Vetëm njohuritë tuaja në terren mund ta kapin atë.

Tabela e krahasimit: interpretimi i vërtetë kundrejt koeficientit të gabuar

prodhimit

Interpretim i pasaktë (shkak).

Interpretimi i saktë (relativ).

koeficienti arsimor = 1.200

“Arsimi rrit të ardhurat me 1200”

“Një vit më shumë arsim, ceteris paribus, shoqërohet me 1200 të ardhura më të larta.”

R² = 0,68

"Modelja kapi realitetin"

"68% e ndryshimit shpjegohet; nuk tregon kauzalitet"

p <0,01

"Ndikimi është i madh"

"Dëshmi e fortë se koeficienti është i ndryshëm nga zero; madhësia është diskrete"

koeficient negativ

"X zvogëlon Y"

"Ndërsa X rritet, mesatarja Y zvogëlohet; pse është një problem tjetër?"

Katër kërkesa të kopjueshme

1. Gjenerimi i kodit të regresionit:

Roli juaj: asistent i kodit ekonometrik. Unë nuk i ndaj të dhënat, dua kodin R. Në të dhënat.korniza 'të dhëna', të ardhurat (të varura), arsimi, përvoja, gjinia (kategorike). Detyrë: shkruani kodin e regresionit me lm() për të ardhurat ~ arsim + përvojë + gjini, tregoni rezultatin përmbledhës dhe intervalin e besimit (kufijtë) e koeficientëve. Shpjegoni secilën pjesë me një rresht komenti. Unë do të vrapoj dhe do të verifikoj rezultatin.

2. Skicë e interpretimit të koeficientit (në gjuhën relacionale):

Interpretoni prodhimin e regresionit më poshtë, por RREGULLAT: - shkruani koeficientët në gjuhën RELATIONAL ("lidhur me"), MOS përdorni gjuhë shkakësore, - shtoni "ndryshore të tjera konstante", - paraqisni R-në katror si "shkakshmëri", - mos ngatërroni rëndësinë me madhësinë e efektit. Rezultati: [ngjit tabelën]

3. Kodi i kontrollit të supozimit:

Shkruani një kod të supozimit të diagnostikimit për modelin e të ardhurave ~ arsim + përvojë (R): grafikët e montimit të mbetur (të mbetur), grafiku QQ, shpërndarja e mbetjeve. Shpjegoni në rreshtin e komenteve se cilin supozim teston çdo grafik. Sugjeroni korrigjim; Thjesht bëni një diagnozë dhe unë do të marr vendimin.

4. Pyetja e variablit të humbur:

Më ndihmo të marr parasysh rrezikun e anashkalimit të variablave në modelin e arsimit të të ardhurave. Rendisni variablat e mundshëm që lidhen si me të ardhurat ashtu edhe me arsimin, por NUK janë në model (p.sh., prejardhja familjare, rajoni, aftësia) dhe shpjegoni se në cilin drejtim secila mund të paragjykojë koeficientin e arsimit. Kjo nuk është një siguri, le të jetë një listë konsideratash; Unë do ta marr vendimin.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Interpretoni këtë rezultat të regresionit dhe shpjegoni rezultatet.

Ky prompt lëshon AI; me shumë gjasa prodhon fjali shkakore dhe të ekzagjeruara si "trajnimi rrit të ardhurat" dhe "modeli është shumë i suksesshëm".

Njoftim i fuqishëm:

Roli juaj: asistent i kujdesshëm i ekonometrisë. Interpretoni rezultatin, por: (1) shkruani të gjithë koeficientët në gjuhën relacionale, (2) përdorni modelin "gjithçka tjetër ceteris paribus", (3) mos gaboni R-katrorin për shkakësinë, (4) ndani rëndësinë nga madhësia e efektit, (5) vini re dështimin për të testuar supozimin e ekzogjenitetit të modelit dhe rrezikun e variablave të anashkaluar. Prodhimi: [tabela]

Dallimi: vullneti i fortë e ndalon gjuhën kauzale, duke e bërë të dukshme paqartësinë dhe kufijtë e supozimeve.

tre mini kuti

Rasti 1 — Kurthi i gjuhës shkakësore. Një analist zbuloi se koeficienti i reklamimit ishte 2.4 në regresionin e tij të reklamave ~ shitjeve dhe përdori planin e AI-së si është: "Çdo njësi e shpenzuar për reklama rrit shitjet me 2.4 njësi." Menaxhmenti e fryu buxhetin në përputhje me rrethanat; ndërsa gjatë periudhave të shitjeve të larta tashmë kishte më shumë reklama (kauzaliteti i kundërt) dhe koeficienti e reflektonte këtë. Mësimi: regresioni i zakonshëm nuk është dëshmi e shkakësisë; drejtimi është i paqartë.

Rasti 2 - Variabli i anashkaluar. Në një studim, koeficienti i të ardhurave ~ arsimi ishte 1900. Kur modelit iu shtua arsimi i prindërve dhe rajoni, koeficienti ra në 1.150. Në modelin e parë, arsimi në fakt mori një pjesë të ndikimit të prejardhjes familjare. Mësimi: një variabël që mungon, por e ndërlidhur, fryn koeficientin; Merrni parasysh mangësitë e mundshme me njohuritë e domenit.

Rasti 3 - Iluzioni me katror të lartë R. Një student pa R²=0.94 dhe tha "modeli im është i përsosur". Por një nga variablat e pavarur ishte pothuajse identik me variablin e varur (një artikull tashmë i përfshirë në shitje). Modelja nuk po shpjegonte realitetin, po shpjegonte vetveten. Mësimi: R-katrori i lartë nuk garanton cilësinë e modelit; Kërkohet kontroll logjik.

Gabimet e zakonshme

  • Interpretimi i koeficientit në mënyrë shkakësore. Gjuha “rrit/zvogëlon” është e rreme, përveçse kur mbrohet nga dizajni; Thuaj "lidhur me".
  • Injorimi i ndryshores së anashkaluar. Një faktor që mungon i lidhur me X dhe Y paragjykon koeficientin; Merrni parasysh mangësitë e mundshme.
  • Gabimi i katrorit R si masë e suksesit. Një katror i lartë R nuk do të thotë shkakësi ose një model i saktë; Mund të jetë edhe një shenjë e rrjedhjes së ndryshueshme.
  • Ngatërrimi i rëndësisë me madhështinë. p<0.05 nuk tregon se efekti është i madh; Shih gjithashtu madhësinë praktike të koeficientit.
  • Interpretimi i supozimeve pa i kontrolluar ato. Shkeljet shtrembërojnë gabimet standarde dhe interpretimin; diagnoza nuk mund të mungojë.
Këshillë: Për çdo koeficient, pyesni "A mund ta shpjegoj këtë marrëdhënie në drejtim të kundërt? Apo ka një faktor të tretë që ndikon të dyja?" Këto dy pyetje ndalojnë mbiinterpretimin shkakor përpara se stilolapsi të prekë letrën.

Në përmbledhje

Regresioni linear është mjeti bazë për matjen e marrëdhënies së një rezultati me faktorët shpjegues. AI prodhon shpejt kodin e modelit, paraqitjen e daljes dhe skicën e interpretimit; por specifikimi i modelit, interpretimi relacional i koeficientit dhe rreziku i variablave të neglizhuar janë përgjegjësi e ekspertit. Gabimi më i zakonshëm është paraqitja e koeficientit si shkakësor ("rritet"); gjuha e saktë është relacionale ("lidhet me, gjithçka tjetër është konstante"). R-katrori i lartë nuk është sukses ose shkakësi; Asnjë interpretim nuk është i sigurt pa kontrolluar supozimet (veçanërisht ekzogjenitetin).

Detyra e aplikimit

Vendosni një regresion me një të varur dhe të paktën dy variabla të pavarur në një grup të dhënash. Kërkoni kodin nga AI dhe ekzekutoni atë. Së pari, bëni që AI të interpretojë koeficientët në gjuhën relacionale, dhe më pas ju rishikoni dhe korrigjoni çdo deklaratë shkakësore. Shtoni një variabël potencialisht të lidhur me modelin dhe vëzhgoni se si ndryshon koeficienti kryesor dhe interpretojeni këtë në një paragraf brenda kornizës së anshmërisë së variablave të hequr. Së fundi, prodhoni skema diagnostikuese të supozimeve dhe vini re se cili supozim duket i fortë dhe cili duket i dyshimtë.

listë kontrolli

  • [ ] Unë e ndërtova modelin bazuar në teori dhe njohuri në terren, jo në të dhëna.
  • [ ] I interpretova koeficientët në gjuhën relacionale ("lidhur me, ceteris paribus").
  • [ ] Vura re se pretendimet shkakësore kërkojnë një dizajn të veçantë.
  • [ ] Kam testuar ndjeshmërinë e koeficientit kryesor duke marrë parasysh variablat e mundshëm të anashkaluar.
  • [ ] Nuk e paraqita katrorin R si masë të suksesit/kauzalitetit.
  • [ ] Prodhuar dhe interpretuar komplote hipotetike diagnostike; Kam vlerësuar nëse ka pasur shkelje.