Vienība 4 / 11

Lineārā regresija: modeļa veidošana, koeficientu interpretācija un pieņēmumi

Ieguvumi:

  • Spēja izveidot lineārās regresijas modeli ar mākslīgā intelekta atbalstu un interpretēt koeficientus, standarta kļūdas un R kvadrātu precīzā un bezcēloņa valodā
  • Spēja izprast pamata pieņēmumus, uz kuriem balstīts modelis (linearitāte, eksogenitāte, nemainīga dispersija) un to, kas notiek, ja tie tiek pārkāpti, un izmantot mākslīgo intelektu pieņēmumu kontrolei.
  • Spēja atpazīt un labot pārmērīgas cēloņsakarības apgalvojumus un aizmirstās mainīgās problēmas mākslīgā intelekta radītajās koeficientu interpretācijās

Lineārā regresija ir ekonometrijas un lietišķās statistikas pamats. Vienkāršākajā formā tas novērtē, kā atkarīgais mainīgais (iznākums, kuru vēlaties izskaidrot, piemēram, ienākumi) mainās, izmantojot lineāru saistību ar vienu vai vairākiem neatkarīgiem mainīgajiem (paskaidrojošiem faktoriem, piemēram, izglītības gadiem, pieredze). Modelim ir šāda forma: ienākumi = β0 + β1·izglītība + β2·pieredze + u. Šeit β (beta) koeficienti parāda attiecības lielumu, un u parāda kļūdas terminu (visas nenovērotās sekas), ko modelis nevar izskaidrot. Šajā nodaļā mēs redzēsim, kā mākslīgais intelekts (AI) paātrina regresijas konstruēšanu un interpretāciju, bet kāpēc koeficientu interpretācija ir vieta, kur kļūdas tiek pieļautas visbiežāk.

No sākuma izvirzīsim pamatmērķi: AI raksta regresijas kodu, organizē izvades tabulu, izstrādā uzmetumu koeficientu interpretācijai. Bet tas ir jūsu lēmums, kuri mainīgie tiek iekļauti modelī (modeļa specifikācija), vai koeficients tiek interpretēts kā cēloņsakarība vai relācija un vai ir nepamanīts mainīgais. AI visbīstamākais ieradums ir uzrādīt parastos regresijas koeficientus cēloņsakarībā, piemēram, "X palielina Y"; turpretim lielākā daļa regresiju parāda tikai attiecības (korelāciju).

Pakāpeniskas regresijas darbplūsma

1. Izveidojiet modeli ar teoriju. Kuri mainīgie būs atkarīgi un kuri būs neatkarīgi, izriet no lauka zināšanām un teorijas, nevis no statistikas. Loģika "Kādi faktori loģiski ietekmē šo rezultātu?" nav loģika "lai ko es ieliktu datos, koeficients būs ievērojams".

2. Uzminiet. Visizplatītākā metode ir OLS (parastie mazākie kvadrāti): tā atlasa koeficientus tā, lai samazinātu novēroto un prognozēto vērtību kvadrātu atšķirību summu. AI ģenerē kodu šim (lm() valodā R, statsmodels Python) lidojuma laikā.

3. Izlasiet izvadi. Regresijas izvadā meklējiet četras lietas: koeficients (sakarības virziens un lielums), standarta kļūda (koeficienta novērtējuma nenoteiktība), t-statistika un p-vērtība (pierādījumu stiprums, ka koeficients atšķiras no nulles), R kvadrāts (cik lielu daļu atkarīgā mainīgā variācijas modelis izskaidro, diapazonā no 0 līdz 1). Augsts R kvadrāts nenozīmē "labu modeli"; Cēloņsakarības nav vispār.

4. Pareizi interpretēt koeficientu. Ja izglītības koeficients ir 1200, pareizā interpretācija ir: "Citi mainīgie lielumi nemainīgi, izglītības pieaugums par vienu gadu ir saistīts ar vidēji par 1200 lielākiem ienākumiem." Nepareiza interpretācija: "Vēl viens izglītības gads palielina ienākumus par 1200." Otrais ir apgalvojums par cēloņsakarību, un to var aizstāvēt tikai ar atbilstošu plānu (9. vienība).

5. Pārbaudiet pieņēmumus. Regresijas derīgums ir atkarīgs no noteiktiem pieņēmumiem (zemāk). AI ģenerē diagnostikas kodu; Jūs izsakāt komentāru.

Lineārās regresijas pamatpieņēmumi

Pieņēmumi, uz kuriem balstās klasiskais lineārais modelis, ir nepieciešami, lai koeficienti būtu objektīvi (centrēti uz līniju) un standarta kļūdas būtu ticamas:

  • Linearitāte: attiecība ir lineāra parametros (ja nepieciešams, izstiepta log/kvadrātveida izteiksmē).
  • Eksogenitāte (nulles nosacījuma vidējais): kļūdas termins nav korelēts ar skaidrojošajiem mainīgajiem. Šis ir viskritiskākais un visbiežāk pārkāptais pieņēmums; pārkāpums rada izlaistu mainīgā novirzi.
  • Pastāvīga dispersija (homoskedastiskums): kļūdas vārda dispersija visos novērojumos ir vienāda (pārkāpums: heteroskedastiskums — 5. vienība).
  • Autokorelācijas neesamība: kļūdas ir viena no otras neatkarīgas (bieži pārkāpumi laikrindās — 5. un 8. vienība).
  • Ekstrēmas multikolinearitātes trūkums: skaidrojošie mainīgie nav gandrīz identiski viens otram (5. vienība).
Uzmanību: visbīstamākā problēma ir ignorēta mainīgā novirze. Ja savā modelī izlaidīsiet faktoru, kas ir saistīts gan ar ienākumiem, gan izglītību (piemēram, ģimenes izcelsme, spējas), izglītības koeficients pārņem šī trūkstošā faktora ietekmi un tiek palielināts. AI nevar zināt trūkstošo mainīgo; Tikai jūsu zināšanas var to uztvert.

Salīdzinājuma tabula: patiesa pret nepareizu koeficientu interpretāciju

izvade

Nepareiza (cēloniskā) interpretācija

Pareiza (relāciju) interpretācija

izglītības koeficients = 1,200

"Izglītība palielina ienākumus par 1200"

"Par vienu gadu vairāk izglītības, ceteris paribus, ir saistīta ar 1200 lielākiem ienākumiem."

R² = 0,68

"Modele uztvēra realitāti"

"68% izmaiņu ir izskaidrotas; neuzrāda cēloņsakarību"

p < 0,01

"Ietekme ir milzīga"

"Spēcīgi pierādījumi tam, ka koeficients atšķiras no nulles; lielums ir diskrēts"

negatīvs koeficients

"X samazina Y"

"Kad X palielinās, Y vidējais rādītājs samazinās; kāpēc ir cita problēma?"

Četras kopējamas uzvednes

1. Regresijas koda ģenerēšana:

Jūsu loma: ekonometrijas koda asistents. Es nedalos ar datiem, es gribu R kodu. Datos.rāmis 'dati', ienākumi (apgādājamie), izglītība, pieredze, dzimums (kategoriski). Uzdevums: uzrakstiet regresijas kodu ar lm() ienākumiem ~ izglītība + pieredze + dzimums, parādiet kopsavilkuma rezultātu un koeficientu ticamības intervālu (confint). Izskaidrojiet katru daļu ar komentāru rindiņu. Es skrienu un pārbaudīšu rezultātu.

2. Koeficientu interpretācijas skice (relāciju valodā):

Interpretējiet tālāk sniegto regresijas izvadi, bet NOTEIKUMI:- ierakstiet koeficientus RELATIONAL valodā (“saistīts ar”), NELIETOJIET cēloņsakarību,- pievienojiet “citu mainīgo konstante”,- norādiet R kvadrātā kā “cēlonību”,- nejauc nozīmību ar efekta lielumu.Izvade: [ielīmēt tabulu]

3. Pieņēmuma pārbaudes kods:

Uzrakstiet pieņēmuma diagnostikas kodu ienākumu ~ izglītība + pieredzes modelim (R): atlikuma pielāgošanas (atlikuma) grafiki, QQ grafiks, atlikumu sadalījums. Komentāra rindā paskaidrojiet, kurš pieņēmums tiek pārbaudīts katrā diagrammā. Ieteikt labojumu; Vienkārši norādiet diagnozi, un es pieņemšu lēmumu.

4. Neatbildēts mainīgā vaicājums:

Palīdziet man apsvērt risku, ka ienākumu un izglītības modelī netiek ņemta vērā mainīgā novirze. Uzskaitiet iespējamos mainīgos, kas ir saistīti gan ar ienākumiem, gan izglītību, bet NAV modelī (piemēram, ģimenes izcelsme, reģions, spējas), un paskaidrojiet, kādā virzienā katrs var novirzīt izglītības koeficientu. Tā nav pārliecība, lai tas būtu apsvērumu saraksts; Es pieņemšu lēmumu.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Interpretējiet šo regresijas rezultātu un izskaidrojiet rezultātus.

Šī uzvedne atbrīvo AI; visticamāk, rada cēloņsakarības un pārspīlētus teikumus, piemēram, "apmācība palielina ienākumus" un "modelis ir ļoti veiksmīgs".

Spēcīga uzvedne:

Jūsu loma: rūpīgs ekonometrijas asistents. Interpretējiet rezultātu, bet: (1) ierakstiet visus koeficientus relāciju valodā, (2) izmantojiet modeli "viss pārējais ceteris paribus", (3) nejauciet R kvadrātā ar cēloņsakarību, (4) nošķiriet nozīmi no efekta lieluma, (5) ņemiet vērā, ka nav pārbaudīts modeļa eksogenitātes pieņēmums un nepamanītu mainīgo risks. Izvade: [tabula]

Atšķirība: spēcīga griba aizliedz cēloņsakarību, padarot redzamas neskaidrības un pieņēmumu robežas.

trīs mini futrāļi

1. gadījums — cēloņsakarības valodas slazds. Viens analītiķis savā reklāmas ~ pārdošanas regresijā konstatēja, ka reklāmas koeficients ir 2,4, un izmantoja AI plānu, kāds tas ir: "Katra reklāmai iztērētā vienība palielina pārdošanas apjomu par 2,4 vienībām." Vadība attiecīgi palielināja budžetu; turpretim lielu pārdošanas apjomu periodos jau bija vairāk reklāmas (reversā cēloņsakarība), un koeficients to atspoguļoja. Nodarbība: parastā regresija neliecina par cēloņsakarību; virziens nav skaidrs.

2. gadījums — aizmirstais mainīgais. Vienā pētījumā ienākumu ~ izglītības koeficients bija 1900. Kad modelim pievienoja vecāku izglītību un reģionu, koeficients nokritās līdz 1,150. Pirmajā modelī izglītība faktiski pārņēma daļu no ģimenes izcelsmes ietekmes. Nodarbība: trūkstošs, bet korelēts mainīgais palielina koeficientu; Apsveriet iespējamos domēna zināšanu trūkumus.

3. gadījums — liela R kvadrāta ilūzija. Kāds students redzēja R²=0,94 un teica: "mans modelis ir ideāls". Bet viens no neatkarīgiem mainīgajiem bija gandrīz identisks atkarīgajam mainīgajam (prece, kas jau ir iekļauta pārdošanā). Modelis nepaskaidroja realitāti, tas izskaidroja sevi. Nodarbība: augsts R kvadrāts negarantē modeļa kvalitāti; Nepieciešama loģikas pārbaude.

Biežas kļūdas

  • Koeficienta interpretācija cēloņsakarībā. “Palielina/samazina” valoda ir nepatiesa, ja vien to neaizstāv dizains; Sakiet "saistīts ar".
  • Ignorējot aizmirsto mainīgo. Trūkstošais faktors, kas saistīts gan ar X, gan ar Y, novirza koeficientu; Apsveriet iespējamos trūkumus.
  • Kļūdains ar R kvadrātu kā veiksmes mērauklu. Augsts R kvadrāts nenozīmē cēloņsakarību vai pareizu modeli; Tas var būt pat mainīgas noplūdes pazīme.
  • Jauc nozīmi ar diženumu. p<0,05 neliecina, ka efekts ir liels; Skatiet arī koeficienta praktisko lielumu.
  • Pieņēmumu interpretācija, tos nepārbaudot. Pārkāpumi izkropļo standarta kļūdas un interpretāciju; diagnozi nevar palaist garām.
Padoms: katram koeficientam jautājiet: "Vai es varu izskaidrot šīs attiecības pretējā virzienā? Vai arī ir kāds trešais faktors, kas ietekmē abus?" Šie divi jautājumi aptur cēloņsakarību pārmērīgu interpretāciju, pirms pildspalva pat pieskaras papīram.

Rezumējot

Lineārā regresija ir galvenais instruments, lai izmērītu iznākuma saistību ar izskaidrojošiem faktoriem. AI ātri izveido modeļa kodu, izvades izkārtojumu un interpretācijas kontūru; bet par modeļa specifikāciju, koeficienta relāciju interpretāciju un nepamanīto mainīgo risku ir atbildīgs eksperts. Visizplatītākā kļūda ir uzrādīt koeficientu kā cēloņsakarību ("pieaug"); pareizā valoda ir relāciju ("attiecas uz, viss pārējais ir nemainīgs"). Augsts R kvadrāts nav veiksme vai cēloņsakarība; Neviena interpretācija nav droša, nepārbaudot pieņēmumus (īpaši eksogenitāti).

Lietojumprogrammas uzdevums

Datu kopā iestatiet regresiju ar vienu atkarīgu un vismaz diviem neatkarīgiem mainīgajiem. Pieprasiet kodu no AI un palaidiet to. Vispirms palūdziet AI interpretēt koeficientus relāciju valodā un pēc tam pārskatiet un izlabojiet katru cēloņsakarību. Pievienojiet modelim potenciāli saistītu mainīgo un novērojiet, kā mainās galvenais koeficients, un interpretējiet to rindkopā izlaistā mainīgā novirzes ietvaros. Visbeidzot, izveidojiet pieņēmumu diagnostikas grafikus un atzīmējiet, kurš pieņēmums izskatās pamatots un kurš apšaubāms.

kontrolsaraksts

  • [ ] Es veidoju modeli, pamatojoties uz teoriju un lauka zināšanām, nevis uz datiem.
  • [ ] Es interpretēju koeficientus relāciju valodā ("attiecas uz, ceteris paribus").
  • [ ] Es atzīmēju, ka cēloņsakarības apgalvojumiem ir nepieciešams atsevišķs dizains.
  • [ ] Es pārbaudīju galvenā koeficienta jutīgumu, ņemot vērā iespējamos aizmirstos mainīgos.
  • [ ] Es neuzrādīju R kvadrātu kā veiksmes/cēloņsakarības mērauklu.
  • [ ] Izgatavoja un interpretēja hipotētiskus diagnostikas grafikus; Izvērtēju, vai ir pārkāpums.