Yksikkö 4 / 11

Lineaarinen regressio: mallin rakentaminen, kertoimien tulkinta ja oletukset

Voitot:

  • Kyky rakentaa lineaarista regressiomallia tekoälyn tuella ja tulkita kertoimia, standardivirheitä ja R-neliötä tarkalla ja ei-kausaalisella kielellä
  • Kyky ymmärtää mallin perustana olevat perusoletukset (lineaarisuus, eksogeenisyys, vakiovarianssi) ja mitä tapahtuu, kun niitä rikotaan, sekä käyttää tekoälyä oletusten ohjaamiseen.
  • Kyky tunnistaa ja korjata liiallisia kausaalisia väitteitä ja huomiotta jätettyjä muuttuvia ongelmia tekoälyn tuottamissa kerrointulkinnoissa

Lineaarinen regressio on ekonometriikan ja sovellettavien tilastojen selkäranka. Yksinkertaisimmassa muodossaan se arvioi, kuinka riippuva muuttuja (tulos, jonka haluat selittää, kuten tulot) vaihtelee lineaarisen suhteen yhden tai useamman riippumattoman muuttujan kanssa (selittävät tekijät, kuten koulutusvuodet, kokemus). Mallin muoto on: tulot = β0 + β1·koulutus + β2·kokemus + u. Tässä β (beta) kertoimet osoittavat suhteen koon ja u näyttää virhetermin (kaikki havaitsemattomat vaikutukset), jota malli ei pysty selittämään. Tässä osiossa näemme kuinka tekoäly (AI) nopeuttaa regression rakentamista ja tulkintaa, mutta miksi kertoimien tulkinta on se paikka, jossa virheitä tehdään useimmiten.

Laitetaanpa perustarkoitus alusta alkaen: AI kirjoittaa regressiokoodin, järjestää tulostaulukon, tuottaa luonnoksen kertoimien tulkintaa varten. Mutta se on sinun päätettävissäsi, mitkä muuttujat sisällytetään malliin (mallin määrittely), tulkitaanko kerroin kausaali- vai relaatiosuhteiseksi ja onko muuttuja, joka jätetään huomiotta. Tekoälyn vaarallisin tapa on esittää tavallisia regressiokertoimia kausaalisella kielellä, kuten "X lisää Y:tä"; kun taas useimmat regressiot osoittavat vain suhteen (korrelaation).

Vaiheittaisen regression työnkulku

1. Rakenna malli teorialla. Mitkä muuttujat ovat riippuvaisia ​​ja mitkä riippumattomia, tulee kenttätiedosta ja teoriasta, ei tilastoista. Logiikka "Mitkä tekijät loogisesti vaikuttavat tähän tulokseen?" ei ole logiikka "minkä tahansa laitan tietoihin, kerroin on merkittävä".

2. Arvaa. Yleisin menetelmä on OLS (Ordinary Least Squares): se valitsee kertoimet tavalla, joka minimoi havaittujen ja ennustettujen arvojen välisten neliöerojen summan. AI luo koodin tälle (lm() R:ssä, statsmodels Pythonissa) lennossa.

3. Lue tulos. Etsi regressiotuloksesta neljä asiaa: kerroin (suhteen suunta ja suuruus), keskivirhe (kertoimen estimointiepävarmuus), t-tilasto ja p-arvo (todisteen voimakkuus siitä, että kerroin eroaa nollasta), R-neliö (kuinka suuren osan riippuvan muuttujan vaihtelusta malli selittää, välillä 0-1). Korkea R-neliö ei tarkoita "hyvää mallia"; Syy-yhteyttä ei ole ollenkaan.

4. Tulkitse kerroin oikein. Jos koulutuskerroin on 1 200, oikea tulkinta on: "Muiden muuttujien pysyessä koulutuksen yhden vuoden nousuun liittyy keskimäärin 1 200 yksikköä suurempia tuloja." Väärintulkinta: "Toinen koulutusvuosi lisää tuloja 1 200." Toinen on syy-yhteyttä koskeva väite, ja sitä voidaan puolustaa vain asianmukaisella suunnittelulla (yksikkö 9).

5. Tarkista oletukset. Regression pätevyys riippuu tietyistä oletuksista (alla). AI luo diagnostiikkakoodin; Kirjoitat kommentin.

Lineaarisen regression perusoletukset

Klassisen lineaarisen mallin perustana olevat oletukset ovat välttämättömiä, jotta kertoimet olisivat puolueettomia (viivakeskeisiä) ja standardivirheet luotettavia:

  • Lineaarisuus: Suhde on lineaarinen parametreilla (tarvittaessa venytetty log/neliö-ehdoissa).
  • Eksogeenisuus (nolla ehdollinen keskiarvo): Virhetermi ei korreloi selittävien muuttujien kanssa. Tämä on kriittisin ja useimmin rikottu oletus; rikkomus luo pois jätetyn muuttujan poikkeaman.
  • Vakiovarianssi (homoskedastisuus): Virhetermin varianssi on sama kaikissa havainnoissa (rikkomus: heteroskedastisuus — yksikkö 5).
  • Autokorrelaation puuttuminen: Virheet ovat toisistaan ​​riippumattomia (usein rikkomuksia aikasarjassa — yksiköt 5 ja 8).
  • Äärimmäisen multikollineaarisuuden puuttuminen: Selittävät muuttujat eivät ole läheskään identtisiä keskenään (yksikkö 5).
Varoitus: Vaarallisin ongelma on huomiotta jätetty muuttuva harha. Jos jätät mallistasi pois tekijän, joka liittyy sekä tuloihin että koulutukseen (esim. perhetausta, kyky), koulutuskerroin saa tämän puuttuvan tekijän vaikutuksen ja kasvaa. AI ei voi tietää puuttuvaa muuttujaa; Vain alan tietosi voi vangita sen.

Vertailutaulukko: tosi vs. väärä kertoimen tulkinta

ulostulo

Väärä (syy) tulkinta

Oikea (relaatio) tulkinta

koulutuskerroin = 1,200

"Koulutus lisää tuloja 1200"

"Yksi vuosi lisää koulutusta, ceteris paribus, liittyy 1 200 korkeampiin tuloihin."

R2 = 0,68

"Malli kiinnitti todellisuuden"

"68% muutoksesta on selitetty; ei osoita syy-yhteyttä"

p < 0,01

"Vaikutus on valtava"

"Vahva todiste siitä, että kerroin on eri kuin nolla; suuruus on diskreetti"

negatiivinen kerroin

"X vähentää Y"

"Kun X kasvaa, Y keskiarvo laskee; miksi on toinen ongelma?"

Neljä kopioitavaa kehotetta

1. Regressiokoodin luominen:

Tehtäväsi: ekonometriakoodiassistentti. En jaa tietoja, haluan R-koodin. Data.framessa 'data', tulot (riippuvainen), koulutus, kokemus, sukupuoli (kategorinen). Tehtävä: kirjoita regressiokoodi lm():llä tuloille ~ koulutus + kokemus + sukupuoli, näytä yhteenvetotulos ja kertoimien luottamusväli (confint). Selitä jokainen osa kommenttirivillä. Ajan ja tarkistan tuloksen.

2. Piirros kertoimen tulkinnasta (relaatiokielellä):

Tulkitse alla oleva regression tulos, mutta SÄÄNNÖT:- kirjoita kertoimet RELATIONAL-kielellä ("liittyy"), ÄLÄ käytä kausaalikieltä, - lisää "muut muuttujat vakio", - esitä R-neliössä "kausaalisuus", - älä sekoita merkitsevyyttä tehosteen kokoon. Tulos: [liitä taulukko]

3. Oletuksen tarkistuskoodi:

Kirjoita oletusdiagnoosikoodi tulo ~ koulutus + kokemus -mallille (R): jäännössovitus (jäännös) graafit, QQ-graafi, jäännösjakauma. Selitä kommenttirivillä, minkä oletuksen kukin kuvaaja testaa. Ehdota korjausta; Tee vain diagnoosi ja minä teen päätöksen.

4. Menetetty muuttujakysely:

Auta minua harkitsemaan riskiä siitä, että tulo- ja koulutusmallissa ei huomioida muuttuvia harhoja. Listaa mahdolliset muuttujat, jotka liittyvät sekä tuloihin että koulutukseen, mutta EIVÄT ole mallissa (esim. perhetausta, alue, kyvyt) ja selitä, mihin suuntaan kukin saattaisi vääristää koulutuskerrointa. Tämä ei ole varma, olkoon se luettelo huomioista; Minä teen päätöksen.

Heikko kehote / Vahva kehote

Heikko kehote:

Tulkitse tämä regression tulos ja selitä tulokset.

Tämä kehote vapauttaa tekoälyn; tuottaa todennäköisesti kausaalisia ja liioiteltuja lauseita, kuten "koulutus lisää tuloja" ja "malli on erittäin onnistunut".

Tehokas kehotus:

Tehtäväsi: huolellinen ekonometria-assistentti. Tulkitse tulos, mutta: (1) kirjoita kaikki kertoimet relaatiokielellä, (2) käytä "kaikki muu ceteris paribus" -mallia, (3) älä erehdy R-neliötä kausaaliseksi, (4) erota merkitys efektin koosta, (5) huomaa mallin eksogeenisuusoletuksen testaamisen epäonnistumisen ja huomioimatta jäävien muuttujien riskin. Tulos: [taulukko]

Ero: vahva tahto kieltää kausaalisen kielen, mikä tekee monitulkintaisuuden ja olettamusten rajat näkyväksi.

kolme minilaukkua

Tapaus 1 – Kausaalinen kieliloukku. Eräs analyytikko havaitsi mainontakertoimen olevan 2,4 mainonnan ~ myyntiregressiossa ja käytti tekoälysuunnitelmaa sellaisenaan: "Jokainen mainontaan käytetty yksikkö lisää myyntiä 2,4 yksiköllä." Johto paisutti budjettia vastaavasti; kun taas korkean myynnin aikoina mainontaa oli jo enemmän (käänteinen kausaalisuus) ja kerroin heijasti tätä. Oppitunti: tavallinen regressio ei ole todiste kausaalisuudesta; suunta on epäselvä.

Tapaus 2 – unohdettu muuttuja. Eräässä tutkimuksessa tulo-koulutuskerroin oli 1900. Kun malliin lisättiin vanhempien koulutus ja alue, kerroin putosi 1,150:een. Ensimmäisessä mallissa koulutus otti itse asiassa osan perhetaustan vaikutuksesta. Oppitunti: puuttuva mutta korreloitu muuttuja paisuttaa kertoimen; Harkitse mahdollisia puutteita verkkotunnuksen tuntemuksessa.

Tapaus 3 – Korkean R-neliön illuusio. Opiskelija näki R² = 0,94 ja sanoi "mallini on täydellinen". Mutta yksi riippumattomista muuttujista oli melkein identtinen riippuvan muuttujan kanssa (tuote, joka sisältyy jo myyntiin). Malli ei selittänyt todellisuutta, se selitti itsensä. Oppitunti: korkea R-neliö ei takaa mallin laatua; Logiikkatarkistus vaaditaan.

Yleisiä virheitä

  • Kertoimen tulkinta kausaalisesti. "Lisää/vähentää" -kieli on väärä, ellei sitä puolusteta suunnittelulla; Sano "liittyy".
  • Ohita huomiotta jätetty muuttuja. Sekä X:ään että Y:ään liittyvä puuttuva tekijä biasoi kerrointa; Harkitse mahdollisia puutteita.
  • R-neliön erehtyminen onnistumisen mittana. Korkea R-neliö ei tarkoita kausaalisuutta tai oikeaa mallia; Se voi olla jopa merkki muuttuvasta vuodosta.
  • Sekoittaa merkitys suuruuden kanssa. p < 0,05 ei osoita, että vaikutus on suuri; Katso myös kertoimen käytännön suuruus.
  • Oletusten tulkitseminen tarkistamatta niitä. Rikkomukset vääristävät standardivirheitä ja tulkintaa; diagnoosia ei voi jättää väliin.
Vihje: Kysy jokaisen kertoimen kohdalla "Voinko selittää tämän suhteen päinvastaiseen suuntaan? Vai onko olemassa kolmas tekijä, joka vaikuttaa molempiin?" Nämä kaksi kysymystä pysäyttävät kausaalisen ylitulkinnan ennen kuin kynä edes koskettaa paperia.

Yhteenvetona

Lineaarinen regressio on perustyökalu, jolla mitataan tuloksen suhdetta selittäviin tekijöihin. Tekoäly tuottaa nopeasti mallin koodin, tulosteen asettelun ja tulkinnan ääriviivat; mutta mallin määrittely, kertoimen relaatiotulkinta ja huomiotta jäävien muuttujien riski ovat asiantuntijan vastuulla. Yleisin virhe on esittää kerroin kausaalisena ("lisää"); oikea kieli on relaatiota ("liittyy, kaikki muu on vakiona"). Korkea R-neliö ei tarkoita menestystä tai syy-yhteyttä; Mikään tulkinta ei ole turvallista ilman olettamusten (etenkin eksogeenisuuden) tarkistamista.

Sovellustehtävä

Aseta regressio, jossa on yksi riippuvainen ja vähintään kaksi riippumatonta muuttujaa tietojoukossa. Pyydä koodi tekoälyltä ja suorita se. Ensinnäkin, pyydä tekoälyä tulkitsemaan kertoimet relaatiokielellä ja sitten tarkistat ja korjaat jokaisen kausaalisen lausuman. Lisää malliin mahdollisesti liittyvä muuttuja ja tarkkaile kuinka pääkerroin muuttuu ja tulkitse tämä kappaleessa pois jätetyn muuttujan biasin puitteissa. Luo lopuksi oletusdiagnostiikkakuvaajat ja pane merkille, mikä oletus näyttää vakaalta ja mikä kyseenalaiselta.

tarkistuslista

  • [ ] Rakensin mallin teorian ja kenttätiedon, en datan perusteella.
  • [ ] Tulkisin kertoimet relaatiokielellä ("relating to, ceteris paribus").
  • [ ] Huomasin, että kausaaliset väitteet vaativat erillisen suunnittelun.
  • [ ] Testasin pääkertoimen herkkyyttä ottamalla huomioon mahdolliset huomiotta jääneet muuttujat.
  • [ ] En esittänyt R-neliötä onnistumisen/syyllisyyden mittana.
  • [ ] Tuotettu ja tulkittu hypoteettisia diagnostisia kuvaajia; Arvioin, onko kyseessä rikkomus.