Vienetas 4 / 11

Tiesinė regresija: modelio kūrimas, koeficientų interpretacija ir prielaidos

Pelnas:

  • Gebėjimas sukurti tiesinės regresijos modelį su dirbtinio intelekto palaikymu ir aiškinti koeficientus, standartines klaidas ir R kvadratą tikslia ir nepriekaištinga kalba
  • Gebėjimas suprasti pagrindines prielaidas, kuriomis grindžiamas modelis (tiesiškumas, egzogeniškumas, pastovi dispersija) ir kas nutinka, kai jos pažeidžiamos, bei naudoti dirbtinį intelektą prielaidų kontrolei.
  • Gebėjimas atpažinti ir ištaisyti pernelyg didelius priežastinius teiginius ir nepastebėtas kintamas problemas dirbtinio intelekto sukurtose koeficientų interpretacijose

Tiesinė regresija yra ekonometrijos ir taikomosios statistikos pagrindas. Paprasčiausia forma jis įvertina, kaip priklausomas kintamasis (rezultatas, kurį norite paaiškinti, pvz., pajamos) kinta tiesiniu ryšiu su vienu ar daugiau nepriklausomų kintamųjų (aiškinamųjų veiksnių, tokių kaip išsilavinimo metai, patirtis). Modelis turi tokią formą: pajamos = β0 + β1·išsilavinimas + β2·patirtis + u. Čia β (beta) koeficientai rodo ryšio dydį, o u rodo klaidos terminą (visus nepastebėtus efektus), kurių modelis negali paaiškinti. Šiame skyriuje pamatysime, kaip dirbtinis intelektas (AI) pagreitina regresijos konstravimą ir interpretavimą, tačiau kodėl dažniausiai daromos klaidos koeficientų interpretacijoje.

Pabrėžkime pagrindinį tikslą nuo pat pradžių: AI rašo regresijos kodą, sutvarko išvesties lentelę, sukuria juodraštį koeficiento interpretacijai. Bet jūs nuspręsite, kurie kintamieji bus įtraukti į modelį (modelio specifikacija), ar koeficientas interpretuojamas kaip priežastinis ar santykinis ir ar yra nepastebėtas kintamasis. Pavojingiausias AI įprotis yra pateikti įprastus regresijos koeficientus priežastine kalba, pavyzdžiui, „X padidina Y“; tuo tarpu dauguma regresijų parodo tik ryšį (koreliaciją).

Laipsniškos regresijos darbo eiga

1. Sukurkite modelį su teorija. Kurie kintamieji bus priklausomi, o kurie nepriklausomi, kyla iš lauko žinių ir teorijos, o ne iš statistikos. Logika „Kokie veiksniai logiškai įtakoja šį rezultatą? nėra logika, kad „ką įdėsiu į duomenis, koeficientas bus reikšmingas“.

2. Atspėk. Labiausiai paplitęs metodas yra OLS (Ordinary Least Squares): jis parenka koeficientus taip, kad sumažintų stebimų ir numatomų verčių skirtumų kvadratu sumą. AI generuoja kodą šiam tikslui (lm() R, statsmodels Python) skrydžio metu.

3. Perskaitykite išvestį. Regresijos išvestyje ieškokite keturių dalykų: koeficiento (ryšio kryptis ir dydis), standartinė paklaida (koeficiento įvertinimo neapibrėžtis), t-statistika ir p reikšmė (įrodymų, kad koeficientas skiriasi nuo nulio, stiprumas), R kvadratas (kiek priklausomo kintamojo kitimo paaiškina modelis, nuo 0 iki 1). Didelis R kvadratas nereiškia „gero modelio“; Priežastingumo visiškai nėra.

4. Teisingai interpretuokite koeficientą. Jei išsilavinimo koeficientas yra 1200, teisingas aiškinimas yra toks: „Kiti kintamieji esant pastoviems, vienerių metų išsilavinimo padidėjimas siejamas su vidutiniškai 1200 vienetų didesnėmis pajamomis“. Klaidingas aiškinimas: „Dar vieni mokslo metai padidina pajamas 1200“. Antrasis yra teiginys dėl priežastingumo ir gali būti ginamas tik tinkamai planuojant (9 skyrius).

5. Patikrinkite prielaidas. Regresijos pagrįstumas priklauso nuo tam tikrų prielaidų (toliau). AI generuoja diagnostinį kodą; Jūs komentuojate.

Pagrindinės tiesinės regresijos prielaidos

Prielaidos, kuriomis grindžiamas klasikinis tiesinis modelis, yra būtinos, kad koeficientai būtų nešališki (centruoti ties linija), o standartinės paklaidos būtų patikimos:

  • Tiesiškumas: ryšys yra tiesinis pagal parametrus (jei reikia, ištemptas log/kvadratais).
  • Egzogeniškumas (nulinis sąlyginis vidurkis): klaidos terminas nėra koreliuojamas su aiškinamaisiais kintamaisiais. Tai pati kritiškiausia ir dažniausiai pažeidžiama prielaida; pažeidimas sukuria praleistą kintamojo šališkumą.
  • Pastovi dispersija (homoscedastiškumas): klaidos nario dispersija yra vienoda visuose stebėjimuose (pažeidimas: heteroskedastiškumas – 5 vienetas).
  • Autokoreliacijos nebuvimas: Klaidos nepriklauso viena nuo kitos (dažni pažeidimai laiko eilutėje – 5 ir 8 vienetai).
  • Ypatingo daugiakolineariškumo nebuvimas: aiškinamieji kintamieji nėra beveik identiški vienas kitam (5 vienetas).
Atsargiai: Pavojingiausia problema yra nepastebimas kintamasis šališkumas. Jei iš savo modelio neįtrauksite veiksnio, kuris yra susijęs ir su pajamomis, ir su išsilavinimu (pvz., šeimos kilmė, gebėjimai), išsilavinimo koeficientas įgyja šio trūkstamo veiksnio poveikį ir tampa išpūstas. AI negali žinoti trūkstamo kintamojo; Tik jūsų žinios gali tai užfiksuoti.

Palyginimo lentelė: teisingas ir neteisingas koeficiento aiškinimas

išvestis

Neteisingas (priežastinis) aiškinimas

Teisingas (santykinis) aiškinimas

išsilavinimo koeficientas = 1,200

„Švietimas padidina pajamas 1200“

„Vienais metais didesnis išsilavinimas, ceteris paribus, yra susijęs su 1200 didesnėmis pajamomis.

R² = 0,68

„Modelis pagavo realybę“

„68 % pokyčio paaiškinta; priežastingumo nerodo“

p < 0,01

„Poveikis didžiulis“

"Tvirtas įrodymas, kad koeficientas skiriasi nuo nulio; dydis yra atskiras"

neigiamas koeficientas

"X sumažina Y"

"Kai X didėja, Y vidurkis mažėja; kodėl yra kita problema?"

Keturi nukopijuoti raginimai

1. Regresijos kodo generavimas:

Jūsų vaidmuo: ekonometrijos kodo asistentas. Aš nesidalinu duomenimis, noriu R kodo. Duomenyse.rėme 'duomenys', pajamos (išlaikomas), išsilavinimas, patirtis, lytis (kategoriška). Užduotis: parašyti regresijos kodą su lm() pajamų ~ išsilavinimas + patirtis + lytis, parodyti suvestinę išvestį ir koeficientų pasikliautinąjį intervalą (confint). Paaiškinkite kiekvieną dalį komentaro eilute. Aš paleisiu ir patikrinsiu rezultatą.

2. Koeficiento aiškinimo eskizas (reliacinė kalba):

Interpretuokite toliau pateiktą regresijos išvestį, bet TAISYKLĖS:- parašykite koeficientus RELATIONAL kalba ("susiję su"), NENAUDOKITE priežastinės kalbos, - pridėkite "kitų kintamųjų konstanta", - R kvadratu nurodykite kaip "priežastinį ryšį", - nepainiokite reikšmės su efekto dydžiu. Išvestis: [įklijuoti lentelę]

3. Prielaidos patikros kodas:

Parašykite pajamų ~ išsilavinimo + patirties modelio (R) prielaidos diagnostikos kodą: likučių derinimo (liekamųjų) grafikai, QQ grafikas, likučių pasiskirstymas. Komentarų eilutėje paaiškinkite, kurią prielaidą tikrina kiekviena diagrama. Pasiūlyti korekciją; Tiesiog nustatykite diagnozę ir aš priimsiu sprendimą.

4. Praleista kintamojo užklausa:

Padėkite man apsvarstyti galimybę nepastebėti kintamo šališkumo pajamų ~ švietimo modelyje. Išvardykite galimus kintamuosius, kurie yra susiję ir su pajamomis, ir su išsilavinimu, bet NĖRA modelyje (pvz., šeimos kilmė, regionas, gebėjimai) ir paaiškinkite, kokia kryptimi kiekvienas gali pakreipti išsilavinimo koeficientą. Tai nėra tikrumas, tegul tai yra svarstymų sąrašas; Aš priimsiu sprendimą.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Interpretuokite šią regresijos išvestį ir paaiškinkite rezultatus.

Šis raginimas išleidžia AI; greičiausiai sukuria priežastinius ir perdėtus sakinius, tokius kaip „mokymas padidina pajamas“ ir „modelis labai sėkmingas“.

Galingas raginimas:

Jūsų vaidmuo: kruopštus ekonometrijos asistentas. Interpretuokite išvestį, bet: (1) parašykite visus koeficientus reliacine kalba, (2) naudokite "viskas kitas ceteris paribus" modelį, (3) nesupainiokite R kvadrato su priežastiniu ryšiu, (4) atskirkite reikšmę nuo efekto dydžio, (5) atkreipkite dėmesį, kad nepavyko patikrinti modelio egzogeniškumo prielaidos ir nepastebimų kintamųjų rizika. Išvestis: [lentelė]

Skirtumas: stipri valia draudžia priežastinę kalbą, todėl dviprasmiškumas ir prielaidų ribos tampa matomos.

trys mini dėklai

1 atvejis – priežastinės kalbos spąstai. Vienas analitikas nustatė, kad reklamos koeficientas yra 2,4 jo reklamos ir pardavimo regresijoje ir panaudojo AI planą tokį, koks yra: „Kiekvienas reklamai išleistas vienetas padidina pardavimą 2,4 vieneto“. Vadovybė atitinkamai išpūtė biudžetą; tuo tarpu didelių pardavimų laikotarpiais jau buvo daugiau reklamos (atvirkštinis priežastinis ryšys) ir koeficientas tai atspindėjo. Pamoka: įprasta regresija nėra priežastingumo įrodymas; kryptis neaiški.

2 atvejis – nepastebėtas kintamasis. Vieno tyrimo metu pajamų ~ išsilavinimo koeficientas buvo 1900. Prie modelio pridėjus tėvų išsilavinimą ir regioną, koeficientas sumažėjo iki 1,150. Pirmajame modelyje išsilavinimas iš tikrųjų perėmė dalį šeimos kilmės įtakos. Pamoka: trūkstamas, bet koreliuojamas kintamasis padidina koeficientą; Apsvarstykite galimus srities žinių trūkumus.

3 atvejis – didelio R kvadrato iliuzija. Studentas pamatė R²=0,94 ir pasakė „mano modelis yra tobulas“. Tačiau vienas iš nepriklausomų kintamųjų buvo beveik identiškas priklausomam kintamajam (prekė jau įtraukta į pardavimą). Modelis aiškino ne tikrovę, o save. Pamoka: didelis R kvadratas negarantuoja modelio kokybės; Reikalingas logikos patikrinimas.

Dažnos klaidos

  • Koeficiento aiškinimas priežastiniu būdu. Kalba „didėja/mažėja“ yra klaidinga, nebent ją gina dizainas; Pasakykite „susijęs su“.
  • Nepaisyto kintamojo ignoravimas. Trūkstamas faktorius, susijęs ir su X, ir su Y, pakreipia koeficientą; Apsvarstykite galimus trūkumus.
  • Klaidingas R kvadratas kaip sėkmės matas. Didelis R kvadratas nereiškia priežastingumo ar teisingo modelio; Tai netgi gali būti kintamo nuotėkio požymis.
  • Supainioja reikšmę su didybe. p<0,05 nerodo, kad poveikis didelis; Taip pat žiūrėkite praktinį koeficiento dydį.
  • Prielaidų aiškinimas jų netikrinant. Pažeidimai iškreipia standartines klaidas ir interpretaciją; diagnozės negalima praleisti.
Užuomina: kiekvienam koeficientui paklauskite "Ar galiu paaiškinti šį ryšį priešinga kryptimi? Ar yra trečias veiksnys, kuris turi įtakos abiems?" Šie du klausimai sustabdo priežastinį pernelyg didelį aiškinimą, kol rašiklis net nepaliečia popieriaus.

Apibendrinant

Tiesinė regresija yra pagrindinė priemonė, leidžianti įvertinti rezultato ryšį su aiškinamaisiais veiksniais. AI greitai sukuria modelio kodą, išvesties išdėstymą ir aiškinimo metmenis; Tačiau modelio specifikacija, koeficiento santykinė interpretacija ir nepastebimų kintamųjų rizika yra eksperto atsakomybė. Dažniausia klaida – koeficiento pateikimas kaip priežastinis („padidėja“); taisyklinga kalba yra santykinė („susijusi su, visa kita yra pastovi“). Didelis R kvadratas nėra sėkmė ar priežastinis ryšys; Joks aiškinimas nėra saugus nepatikrinus prielaidų (ypač egzogeniškumo).

Taikymo užduotis

Nustatykite regresiją su vienu priklausomu ir bent dviem nepriklausomais duomenų rinkinio kintamaisiais. Paprašykite kodo iš AI ir paleiskite jį. Pirmiausia leiskite dirbtiniam intelektui išaiškinti koeficientus reliacine kalba, o tada peržiūrėkite ir pataisykite kiekvieną priežastinį teiginį. Įtraukite į modelį potencialiai susijusį kintamąjį ir stebėkite, kaip keičiasi pagrindinis koeficientas, ir interpretuokite tai pastraipoje praleisto kintamojo šališkumo rėmuose. Galiausiai sukurkite prielaidų diagnostikos diagramas ir pažymėkite, kuri prielaida atrodo tvirta, o kuri abejotina.

kontrolinis sąrašas

  • [ ] Modelį sukūriau remdamasis teorija ir lauko žiniomis, o ne duomenimis.
  • [ ] Koeficientus interpretavau reliacine kalba („susijęs su, ceteris paribus“).
  • [ ] Pažymėjau, kad priežastiniams teiginiams reikia atskiro dizaino.
  • [ ] Išbandžiau pagrindinio koeficiento jautrumą, atsižvelgdamas į galimus nepastebėtus kintamuosius.
  • [ ] Nepristačiau R kvadrato kaip sėkmės / priežastingumo mato.
  • [ ] Sudarė ir interpretavo hipotetinius diagnostinius grafikus; Įvertinau, ar buvo pažeidimas.