Enhet 4 / 11

Lineær regresjon: modellbygging, koeffisienttolkning og forutsetninger

Gevinster:

  • Evne til å bygge en lineær regresjonsmodell med støtte for kunstig intelligens og tolke koeffisienter, standardfeil og R-kvadrat på et nøyaktig og ikke-årsaksspråk
  • Evne til å forstå de grunnleggende forutsetningene som modellen er basert på (linearitet, eksogenitet, konstant varians) og hva som skjer når de blir krenket, og bruke kunstig intelligens for antakelseskontroll.
  • Evne til å gjenkjenne og korrigere overdrevne årsakspåstander og oversett variable problemer i koeffisienttolkninger produsert av kunstig intelligens

Lineær regresjon er ryggraden i økonometri og anvendt statistikk. I sin enkleste form estimerer den hvordan en avhengig variabel (utfallet du ønsker å forklare, for eksempel inntekt) varierer gjennom en lineær sammenheng med en eller flere uavhengige variabler (forklaringsfaktorer, som år med utdanning, erfaring). Modellen har formen: inntekt = β0 + β1·utdanning + β2·erfaring + u. Her viser β (beta) koeffisienter størrelsen på sammenhengen, og u viser feilleddet (alle uobserverte effekter) som modellen ikke kan forklare. I denne enheten skal vi se hvordan kunstig intelligens (AI) setter fart på regresjonskonstruksjon og tolkning, men hvorfor koeffisienttolkning er der feilene gjøres oftest.

La oss sette det grunnleggende formålet fra begynnelsen: AI skriver regresjonskoden, organiserer utdatatabellen, produserer et utkast for koeffisienttolkning. Men det er din avgjørelse hvilke variabler som går inn i modellen (modellspesifikasjon), om koeffisienten tolkes som kausal eller relasjonell, og om det er en oversett variabel. AIs farligste vane er å presentere vanlige regresjonskoeffisienter på kausalt språk som «X øker Y»; mens de fleste regresjoner bare viser sammenheng (korrelasjon).

Trinnvis regresjonsarbeidsflyt

1. Bygg modellen med teori. Hvilke variabler som vil være avhengige og hvilke som vil være uavhengige kommer fra feltkunnskap og teori, ikke fra statistikk. Logikken til "Hvilke faktorer påvirker logisk dette resultatet?" er ikke logikken i "hva enn jeg legger inn i dataene, vil koeffisienten være signifikant".

2. Gjett. Den vanligste metoden er OLS (Ordinary Least Squares): den velger koeffisientene på en måte som minimerer summen av kvadrerte forskjeller mellom de observerte og predikerte verdiene. AI genererer koden for dette (lm() i R, statsmodeller i Python) i farten.

3. Les utdataene. Se etter fire ting i regresjonsutgangen: koeffisient (retning og størrelse på forholdet), standardfeil (estimeringsusikkerhet for koeffisienten), t-statistikk og p-verdi (styrke på bevis for at koeffisienten er forskjellig fra null), R-kvadrat (hvor mye av variasjonen i den avhengige variabelen modellen forklarer, fra 0 til 1). En høy R-kvadrat betyr ikke en "god modell"; Det er ingen årsakssammenheng i det hele tatt.

4. Tolk koeffisienten riktig. Hvis utdanningskoeffisienten er 1200, er den korrekte tolkningen: "Andre variabler er konstante, en ettårig økning i utdanning er assosiert med et gjennomsnitt på 1200 enheter med høyere inntekt." Feiltolkning: «Nok et år med utdanning øker inntekten med 1200». Den andre er påstanden om årsakssammenheng og kan bare forsvares med passende utforming (enhet 9).

5. Sjekk forutsetninger. Gyldigheten av regresjonen avhenger av visse forutsetninger (nedenfor). AI genererer diagnostisk kode; Du kommer med kommentaren.

Grunnleggende antakelser om lineær regresjon

Forutsetningene som den klassiske lineære modellen er basert på er nødvendige for at koeffisientene skal være objektive (linjesentrert) og standardfeilene skal være pålitelige:

  • Linearitet: Forholdet er lineært i parametere (uttrukket i log/kvadrat-termer om nødvendig).
  • Eksogenitet (null betinget gjennomsnitt): Feilleddet er ukorrelert med forklaringsvariablene. Dette er den mest kritiske og hyppigst krenkede antagelsen; brudd skaper utelatt variabel skjevhet.
  • Konstant varians (homoskedastisitet): Variansen til feilleddet er den samme i alle observasjoner (brudd: heteroskedastisitet — enhet 5).
  • Fravær av autokorrelasjon: Feil er uavhengige av hverandre (hyppige brudd i tidsserien — enhet 5 og 8).
  • Fravær av ekstrem multikollinearitet: Forklaringsvariabler er ikke på langt nær identiske med hverandre (enhet 5).
Forsiktig: Det farligste problemet er oversett variabel skjevhet. Hvis du utelater en faktor fra modellen din som er relatert til både inntekt og utdanning (f.eks. familiebakgrunn, evner), tar utdanningskoeffisienten på seg effekten av denne manglende faktoren og blir oppblåst. AI kan ikke kjenne den manglende variabelen; Bare din feltkunnskap kan fange det.

Sammenligningstabell: sann vs. feil koeffisienttolkning

utgang

Feil (årsaks)tolkning

Riktig (relasjonell) tolkning

utdanningskoeffisient = 1.200

"Utdanning øker inntekten med 1200"

"Ett år mer utdanning, ceteris paribus, er assosiert med 1200 høyere inntekter."

R2 = 0,68

"Modellen fanget virkeligheten"

"68 % av endringen er forklart; viser ikke årsakssammenheng"

p < 0,01

"Konsekvensen er enorm"

"Sterke bevis på at koeffisienten er forskjellig fra null; størrelsen er diskret"

negativ koeffisient

"X reduserer Y"

"Når X øker, synker Y-gjennomsnittet; hvorfor er et annet problem?"

Fire kopierbare spørsmål

1. Generer regresjonskode:

Din rolle: økonometrisk kodeassistent. Jeg deler ikke dataene, jeg vil ha R-koden. I data.frame 'data', inntekt (avhengig), utdanning, erfaring, kjønn (kategorisk). Oppgave: skriv regresjonskode med lm() for inntekt ~ utdanning + erfaring + kjønn, vis oppsummeringsresultatet og konfidensintervallet (konfint) til koeffisientene. Forklar hver del med en kommentarlinje. Jeg vil løpe og verifisere resultatet.

2. Skisse av koeffisienttolkning (på relasjonsspråk):

Tolk regresjonsutgangen nedenfor, men REGLER:- skriv koeffisienter på RELASJONALT språk ("assosiert med"), IKKE bruk kausalt språk,- legg til "andre variabler konstant",- presenter R-kvadrat som 'kausalitet',- ikke forveksle betydning med effektstørrelse. Utdata: [lim inn tabell]

3. Kontrollkode for antagelse:

Skriv en forutsetningsdiagnosekode for inntekten ~ utdanning + erfaringsmodell (R): residualtilpassende (rest)grafer, QQ-graf, fordeling av residualer. Forklar i kommentarfeltet hvilken forutsetning hver graf tester. Foreslå korrigering; Bare still en diagnose, så tar jeg avgjørelsen.

4. Tapte variabelsøk:

Hjelp meg å vurdere risikoen for oversett variabel skjevhet i inntekt ~ utdanningsmodellen. List opp mulige variabler som er relatert til både inntekt og utdanning, men som IKKE er med i modellen (f.eks. familiebakgrunn, region, evne) og forklar i hvilken retning hver enkelt kan påvirke utdanningskoeffisienten. Dette er ikke en sikkerhet, la det være en liste over hensyn; Jeg tar avgjørelsen.

Svak forespørsel / Sterk forespørsel

Svak melding:

Tolk denne regresjonsutgangen og forklar resultatene.

Denne ledeteksten frigir AI; produserer mest sannsynlig årsakssammenheng og overdrevne setninger som «trening øker inntekten» og «modellen er svært vellykket».

Kraftig ledetekst:

Din rolle: nøye økonometrikkassistent. Tolk utdataene, men: (1) skriv alle koeffisienter i et relasjonelt språk, (2) bruk "all else ceteris paribus"-mønsteret, (3) ikke feil R-kvadrat for kausalitet, (4) skille signifikans fra effektstørrelse, (5) noter unnlatelse av å teste modellens eksogenitetsantakelse og risikoen for oversett variable. Utdata: [tabell]

Forskjellen: den sterke viljen forbyr kausalt språk, og synliggjør tvetydighet og grenser for antakelse.

tre minisaker

Tilfelle 1 — Årsaklig språkfelle. En analytiker fant at annonseringskoeffisienten var 2,4 i hans reklame~salgsregresjon og brukte AI-planen som den er: "Hver enhet brukt på annonsering øker salget med 2,4 enheter." Ledelsen blåste opp budsjettet tilsvarende; mens det i perioder med høyt salg allerede var mer reklame (omvendt kausalitet) og koeffisienten reflekterte dette. Leksjon: vanlig regresjon er ikke bevis på kausalitet; retningen er uklar.

Tilfelle 2 — Oversett variabel. I en studie var inntekt ~ utdanningskoeffisienten 1900. Da foreldreutdanning og region ble lagt til modellen, falt koeffisienten til 1,150. I den første modellen overtok utdanning faktisk noe av innflytelsen fra familiebakgrunn. Leksjon: en manglende, men korrelert variabel blåser opp koeffisienten; Vurder mulige mangler med domenekunnskap.

Tilfelle 3 — Høy R-kvadrat illusjon. En student så R²=0,94 og sa "min modell er perfekt". Men en av de uavhengige variablene var nesten identisk med den avhengige variabelen (en vare som allerede var inkludert i salget). Modellen forklarte ikke virkeligheten, den forklarte seg selv. Leksjon: høy R-kvadrat garanterer ikke modellkvalitet; Logikksjekk er nødvendig.

Vanlige feil

  • Å tolke koeffisienten kausalt. Språket "øker/minker" er falskt med mindre det forsvares av design; Si "assosiert med".
  • Ignorerer den oversett variabelen. En manglende faktor assosiert med både X og Y forspenner koeffisienten; Vurder mulige mangler.
  • Ta feil av R-kvadrat som et mål på suksess. En høy R-kvadrat betyr ikke kausalitet eller en korrekt modell; Det kan til og med være et tegn på variabel lekkasje.
  • Forveksler betydning med storhet. p<0,05 indikerer ikke at effekten er stor; Se også den praktiske størrelsen på koeffisienten.
  • Tolke antagelser uten å sjekke dem. Brudd forvrenger standardfeil og tolkning; diagnosen kan ikke gå glipp av.
Hint: Spør for hver koeffisient "Kan jeg forklare dette forholdet i motsatt retning? Eller er det en tredje faktor som påvirker begge?" Disse to spørsmålene stopper kausal overtolkning før pennen i det hele tatt berører papiret.

Oppsummert

Lineær regresjon er det grunnleggende verktøyet for å måle sammenhengen mellom et utfall og forklaringsfaktorer. AI produserer raskt modellens kode, utdatalayout og tolkningskontur; men modellspesifikasjonen, den relasjonelle tolkningen av koeffisienten og risikoen for oversett variable er ekspertens ansvar. Den vanligste feilen er å presentere koeffisienten som kausal ("øker"); riktig språk er relasjonelt ("relaterer til, alt annet er konstant"). Høy R-kvadrat er ikke suksess eller årsakssammenheng; Ingen tolkning er trygg uten å sjekke antagelser (spesielt eksogenitet).

Søknadsoppgave

Sett opp en regresjon med én avhengig og minst to uavhengige variabler på et datasett. Be om koden fra AI og kjør den. Først må AI tolke koeffisientene i relasjonsspråk, og deretter vurdere og korrigere hvert årsaksutsagn. Legg til en potensielt relatert variabel til modellen og observer hvordan hovedkoeffisienten endres og tolk denne i et avsnitt innenfor rammen av utelatt variabelskjevhet. Til slutt produserer du antagelsesdiagnostiske plott og noterer hvilken antagelse som ser solid ut og hvilken som ser tvilsom ut.

sjekkliste

  • [ ] Jeg bygget modellen basert på teori og feltkunnskap, ikke på data.
  • [ ] Jeg tolket koeffisientene i relasjonsspråk ("relating to, ceteris paribus").
  • [ ] Jeg bemerket at årsakspåstander krever en egen utforming.
  • [ ] Jeg testet sensitiviteten til hovedkoeffisienten ved å vurdere mulige oversett variable.
  • [ ] Jeg presenterte ikke R-kvadrat som et mål på suksess/årsakssammenheng.
  • [ ] Produserte og tolket hypotetiske diagnostiske plott; Jeg evaluerte om det var et brudd.