Jedinica 5 / 11

Dijagnostika regresije i kršenja: kolinearnost, heteroskedastičnost, autokorelacija

Dobici:

  • Sposobnost otkrivanja kršenja kao što su multikolinearnost, heteroskedastičnost i autokorelacija s dijagnostičkim testovima i grafikom s podrškom za umjetnu inteligenciju
  • Sposobnost razlikovanja da li svako kršenje iskrivljuje procjene koeficijenta ili standardne greške i odabire odgovarajuću korekciju (robustna standardna greška, transformacija, revizija modela)
  • Sposobnost da se potvrdi da popravci koje predlaže AI rješavaju problem umjesto da ga skrivaju i da je dijagnoza zasnovana na razumijevanju procesa koji proizvodi podatke

Čitanje rezultata regresije je lako; Teško mu je vjerovati. Budući da su koeficijenti nepristrasni, standardne greške su ispravne, a p-vrijednosti su važeće, ovisno o pretpostavkama koje smo uveli u prethodnoj jedinici su ispunjene. U ovoj jedinici ćemo pokriti tri najčešća kršenja: multikolinearnost, heteroskedastičnost i autokorelaciju. Za svako ćemo odgovoriti na tri pitanja: kako ga dijagnosticirati, šta se kvari (koeficijent ili standardna greška) i kako to popraviti. Umjetna inteligencija (AI) generiše kod za dijagnostičko testiranje i korekciju; ali vi odlučujete koje je kršenje zaista problem i hoće li popravak rješavati problem.

Hajde da unapred napravimo najkritičniju razliku: da li povreda iskrivljuje procenu koeficijenta ili samo standardne greške? Ova razlika određuje rješenje. Problem koji iskrivljuje koeficijent (npr. kršenje egzogenosti) zahtijeva ponovno promišljanje modela; Problem koji samo iskrivljuje standardnu ​​grešku (heteroscedastičnost, autokorelacija) često se rješava standardnom korekcijom greške. Uobičajena greška AI je da primeni tehniku ​​koja ispravlja standardnu ​​grešku, a zatim proglasi problem „rešenim“; dok osnovna struktura možda još uvijek postoji.

Kršenje 1: Multikolinearnost

Zašto? Dvije ili više objašnjavajućih varijabli su snažno povezane jedna s drugom; na primjer, stavljanje "ukupnih godina iskustva" i "doba" u model. Budući da ove varijable nose gotovo iste informacije, model ima poteškoća da ih odvoji.

Šta se lomi? Procjene koeficijenata ostaju nepristrasne, ali postaju nestabilne: standardne greške postaju naduvane, intervali povjerenja se šire, pojedinačni koeficijenti mogu ispasti beznačajni dok model može biti značajan u cjelini (F-test). Mala promjena podataka značajno pomjera koeficijent.

Kako se dijagnosticira? VIF (Faktor inflacije varijanse): za svaku varijablu mjeri koliko je ta varijabla objašnjena drugim. Kao grubi prag, VIF > 5 (oko 10) zahtijeva oprez. Dodatno, ispituje se matrica korelacije između eksplanatornih varijabli.

Kako popraviti? Odbacivanje jedne od koreliranih varijabli, njihovo kombinovanje (pravljenje indeksa) ili (ako teorija zahtijeva) zadržavanje obje i izbjegavanje interpretacije pojedinačnih koeficijenata. Koja varijabla ostaje je teorijska odluka, a ne statistička - AI predlaže eliminaciju, vi dajete opravdanje.

Kršenje 2: Heteroskedastičnost

Zašto? Varijanca termina greške nije konstantna u svim posmatranjima. Tipičan primjer: kako se prihod povećava, tako se povećava i disperzija oko potrošnje; Formira se obrazac "lijevka", uzak pri niskim prihodima i širok pri visokim prihodima.

Šta se lomi? Procjene koeficijenata su opet nepristrasne — ovo je važno. Ono što se iskrivljuje su standardne greške: one su pogrešno izračunate, tako da p-vrijednosti i intervali povjerenja postaju nepouzdani. Dakle, vaš koeficijent je u desnom centru, ali odgovor na pitanje "koliko ste sigurni" je pogrešan.

Kako se dijagnosticira? Dijagram raspršenosti reziduala naspram predviđenih vrijednosti (traženi obrazac lijevka) i formalni testovi: Breusch-Pagan test, White test. Mala p-vrijednost kaže "bez konstantne varijanse".

Kako popraviti? Najčešći i praktičniji rješenje je korištenje robusnih standardnih grešaka (robusna / heteroskedastičnost-konzistentna, HC standardne greške): ne mijenja koeficijent, ispravlja standardnu ​​grešku zbog kršenja. Alternativa: transformacija zavisne varijable (kao log) ili ponderisani LCM. Robustne standardne greške postale su gotovo standardne u današnjem empirijskom radu.

Kršenje 3: Autokorelacija

Zašto? Termini greške nisu nezavisni jedan od drugog; Najčešći je u vremenskim serijama: greška jednog perioda utječe na sljedeći (npr. ostatak ostaje pozitivan u periodima nakon šoka).

Šta se lomi? Opet, prvenstveno iskrivljuje standardne greške (često ih potcjenjuje, stvarajući lažni značaj); Koeficijenti ostaju nepristrasni u LCC-u, ali gube svoju efektivnost.

Kako se dijagnosticira? Durbin-Watsonov test (za autokorelaciju prvog reda), Breusch-Godfrey test (općenitiji) i dijagrami reziduala naspram zaostalih vrijednosti.

Kako popraviti? Newey-West (HAC — otporan na autokorelaciju i heteroskedastičnost) standardne greške, dodavanje zaostalih termina u model ili prelazak na odgovarajući model vremenske serije (jedinica 8).

Oprez: Heteroskedastičnost i autokorelacija iskrivljuju standardnu ​​grešku, a ne koeficijent. Stoga, prije nego što kažete "koeficijent je bio značajan", uvjerite se da je standardna greška ispravno izračunata; Inače bi smisaonost mogla biti iluzija.

uporedni grafikon

kršenje

Šta se lomi

Dijagnoza

Uobičajeno rješenje

multi-link

Naduvava standardne greške, čini koeficijent nestabilnim

VIF, korelaciona matrica

Oduzmi/kombiniraj varijablu (po teoriji)

heteroskedastičnost

Standardne greške (koeficijent nepristrasan)

Breusch-Pagan, Bijela, preostala parcela

Robustan (HC) standardna greška, konverzija

Autokorelacija

Standardne greške (koeficijent nepristrasan)

Durbin-Watson, Breusch-Godfrey

Newey-West (HAC), odgođen termin

Četiri upita za kopiranje

1. Kompletan dijagnostički paket:

Vaša uloga: pomoćnik u dijagnostici regresije. Želim R kod, ne dijelim podatke. Model: lm(rashodi ~ prihod + starost + region, podaci = podaci). Zadatak: (1) Izračunati VIF, (2) Testirati heteroskedastičnost sa Breusch-Paganom i dijagramom procjene reziduala, (3) Testirati autokorelaciju sa Durbin-Watsonom. Objasnite u redu za komentare koje kršenje svaki test mjeri i kako interpretirati p-vrijednost. Correction APPLICATION; postaviti dijagnozu.

2. Robustan standardna greška:

Napišite R kod koji reproducira tablicu koeficijenata sa standardnim greškama heteroskedastičnosti (HC3) za isti model (sendvič + lmtest paketi). Napravite tabelu koja prikazuje klasične i robusne standardne greške jednu pored druge tako da mogu da vidim razliku. Naglasite u retku za komentare da se koeficijenti NE mijenjaju, već samo standardne greške.

3. Multilink recenzija:

Dajte mi THINK listu varijabli sa visokim VIF-om: koje varijable bi teoretski mogle mjeriti istu stvar, koje imaju jak razlog da ih zadrže. NEMOJTE se automatski kvalificirati; Odluku ću donijeti na osnovu teorije. Također objasnite zašto bi moglo biti pogrešno samo pogledati VIF i dodijeliti varijable.

4. Korekcija autokorelacije:

U mojoj regresiji vremenske serije, Breusch-Godfreyjeva p-vrijednost je bila 0,001. Napišite R kod koji proizvodi tablicu koeficijenata sa Newey-West (HAC) standardnim greškama i objasnite kako odabrati kašnjenje. Imajte na umu da ova ispravka ne rješava UZROK autokorelacije, već samo ispravlja zaključak.

Slaba prompt / Jaka prompt

Slab upit:

Postoji li problem sa mojom regresijom? Ako je tako, popravi to.

Ovaj prompt stavlja AI u slijepi način „popravljanja“: može preskočiti testove i primijeniti direktnu transformaciju ili eliminaciju varijabli, a da vam ne pokaže koje kršenje zapravo postoji i šta je pokvarilo.

Snažan upit:

Vaša uloga: dijagnostički asistent, a ne autokorektor. Prvi test za TRI kršenja odvojeno (multikolinearnost, heteroskedastičnost, autokorelacija) i za svako: koji test, kako pročitati rezultat, da li krši KOEFICIJENT ili STANDARDNU GREŠKU. Zatim samo predložite ispravku za kršenje koje je ZAPRAVO otkriveno i objasnite kako mogu provjeriti da je ispravka riješila problem.

Razlika: snažna volja forsira dijagnozu prije korekcije i zahtijeva jasnu razliku između "onoga što lomi".

tri mini kofera

Slučaj 1 — Lažni značaj (heteroscedastičnost). Jedan analitičar je utvrdio da je koeficijent prihoda u modelu potrošnje ~ prihod „značajan“ na p=0,01. Ali sada je na njegovom grafikonu postojao poseban obrazac lijevka. Kada su primijenjene robusne standardne greške, p-vrijednost se povećala na 0,09; smisao je izgubljen. Prvi rezultat je bila iluzija stvorena pogrešno izračunatom standardnom greškom. Pouka: značajnosti se ne može vjerovati bez ispravljanja standardne greške.

Slučaj 2 — Eliminacija slijepe varijable. Jedan student je izbacio varijablu "iskustvo" iz modela jer je njegov VIF bio visok; Koeficijenti su „očišćeni“, ali je teorijsko značenje modela iskrivljeno jer je iskustvo bilo glavna varijabla od interesa. Ispravan način: oduzmite godine i zadržite iskustvo, ili kombinirajte to dvoje. Pouka: VIF prag sam po sebi nije osnova za eliminaciju; teorija određuje.

Slučaj 3 — Nesigurnost skrivena autokorelacijom. U studiji vremenskih serija, Durbin-Watson je ignorisan; koeficijent je djelovao vrlo "precizno" (uzak interval povjerenja). Kada su primijenjene standardne greške Newey-West-a, interval povjerenja se udvostručio i preporuka politike postala je mnogo konzervativnija. Pouka: autokorelacija može potcijeniti neizvjesnost.

Uobičajene greške

  • Pogreška kršenja koja iskrivljuje standardnu grešku kao problem koeficijenta. Heteroskedastičnost i autokorelacija ne iskrivljuju koeficijent; Nemojte paničariti i ponovo izgraditi model nepotrebno, prvo ispravite standardnu ​​grešku.
  • Gledanje u VIF i slijepo dodjeljivanje varijabli. Uklanjanje teoretski neophodne varijable samo zato što je VIF visok čini model besmislenim.
  • Ne provjeravam ispravku. Nakon primjene robusne standardne greške, provjerite da li kršenje zapravo ispravlja zaključak; Nemojte reći "Primijenio sam, gotovo je".
  • Popravite bez dijagnoze. Primjena transformacije/eliminacije bez testiranja koja kršenje postoji može "riješiti" problem tamo gdje ne postoji i sakriti onaj koji postoji.
  • Postavljanje popravka zašto. Newey-West ne rješava uzrok autokorelacije; samo popravlja zaključak. Ako postoji strukturalni problem, model se mora promijeniti.
Savjet: Za svaki prekršaj zapitajte se "da li to uništava koeficijent ili moje povjerenje u njega?" Ako je odgovor „pouzdanje“, rešenje je skoro uvek standardno ispravljanje grešaka, a ne ponovna izgradnja modela.

Ukratko

Dijagnostika regresije je preduvjet za povjerenje u izlaz. Od tri uobičajena kršenja, multikolinearnost čini koeficijent nestabilnim i naduvava standardnu ​​grešku; Heteroskedastičnost i autokorelacija, s druge strane, ostavljaju koeficijent nepristrasnim i samo iskrivljuju standardnu ​​grešku. AI generira dijagnostički kod i kod za popravak, ali vi odlučujete koje je kršenje pravi problem, koja varijanta ostaje teoretska i hoće li popravak riješiti problem. Ni panika ni slijepa korekcija nisu tačni bez pojašnjenja razlike između "onoga što se lomi".

Zadatak aplikacije

Postavite multivarijantnu regresiju i zatražite od AI kod koji samo proizvodi dijagnoze (bez ispravaka): VIF, Breusch-Pagan/White i Durbin-Watson/Breusch-Godfrey. Za svaki test, interpretirajte rezultat i naznačite da li kršenje iskrivljuje koeficijent ili standardnu ​​grešku. Za stvarno kršenje koje otkrijete (npr. heteroskedastičnost), primijenite robusne standardne greške i suprotstavite klasične i robusne rezultate; Pokazati da se koeficijent ne mijenja, ali se standardna greška mijenja. U jednom pasusu navedite kako je ispravka utjecala na rezultat vašeg značaja.

kontrolna lista

  • [ ] Testirao sam tri kršenja (multikolinearnost, heteroskedastičnost, autokorelacija) odvojeno.
  • [ ] Za svako kršenje razlikovao sam da li iskrivljuje koeficijent ili standardnu ​​grešku.
  • [ ] Zasnovao sam eliminaciju varijable u multikolinearnosti na teoriji, a ne samo na VIF-u.
  • [ ] Koristio sam standardnu ​​grešku sa robusnošću na heteroskedastičnost/autokorelaciju (HC/HAC).
  • [ ] Nakon ispravke, provjerio sam i potvrdio utjecaj kršenja na moj zaključak.
  • [ ] Prijavljujem kako je na moj rezultat značajno utjecala standardna korekcija greške.