Unit 4 / 11

Regresi Linear: Pembinaan Model, Tafsiran Pekali dan Andaian

Keuntungan:

  • Keupayaan untuk membina model regresi linear dengan sokongan kecerdasan buatan dan mentafsir pekali, ralat piawai dan R-kuadrat dalam bahasa yang tepat dan bukan sebab.
  • Keupayaan untuk memahami andaian asas yang menjadi asas model (lineariti, eksogeniti, varians malar) dan apa yang berlaku apabila ia dilanggar, dan menggunakan kecerdasan buatan untuk kawalan andaian.
  • Keupayaan untuk mengenali dan membetulkan tuntutan sebab-akibat yang berlebihan dan masalah pembolehubah yang diabaikan dalam tafsiran pekali yang dihasilkan oleh kecerdasan buatan

Regresi linear ialah tulang belakang ekonometrik dan statistik gunaan. Dalam bentuk yang paling mudah, ia menganggarkan bagaimana pembolehubah bersandar (hasil yang anda ingin jelaskan, seperti pendapatan) berbeza-beza melalui hubungan linear dengan satu atau lebih pembolehubah tidak bersandar (faktor penjelasan, seperti tahun pendidikan, pengalaman). Model mempunyai bentuk: pendapatan = β0 + β1·pendidikan + β2·pengalaman + u. Di sini pekali β (beta) menunjukkan saiz perhubungan, dan u menunjukkan istilah ralat (semua kesan tidak diperhatikan) yang tidak dapat dijelaskan oleh model. Dalam unit ini, kita akan melihat bagaimana kecerdasan buatan (AI) mempercepatkan pembinaan dan tafsiran regresi, tetapi mengapa tafsiran pekali adalah tempat kesilapan paling kerap dilakukan.

Mari letakkan tujuan asas dari awal: AI menulis kod regresi, mengatur jadual output, menghasilkan draf untuk tafsiran pekali. Tetapi ia adalah keputusan anda yang mana pembolehubah masuk ke dalam model (spesifikasi model), sama ada pekali ditafsirkan sebagai kausal atau hubungan, dan sama ada terdapat pembolehubah yang diabaikan. Tabiat AI yang paling berbahaya ialah membentangkan pekali regresi biasa dalam bahasa kausal seperti "X meningkatkan Y"; sedangkan kebanyakan regresi hanya menunjukkan hubungan (korelasi).

Aliran kerja regresi berperingkat

1. Bina model dengan teori. Pembolehubah mana yang akan bersandar dan yang akan bebas datang dari pengetahuan dan teori lapangan, bukan dari statistik. Logik "Apakah faktor yang mempengaruhi keputusan ini secara logik?" bukan logik "apa sahaja yang saya masukkan ke dalam data, pekalinya akan menjadi ketara".

2. Teka. Kaedah yang paling biasa ialah OLS (Ordinary Least Squares): ia memilih pekali dengan cara yang meminimumkan jumlah perbezaan kuasa dua antara nilai yang diperhatikan dan diramalkan. AI menjana kod untuk ini (lm() dalam R, statsmodels dalam Python) dengan cepat.

3. Baca output. Cari empat perkara dalam keluaran regresi: pekali (arah dan magnitud perhubungan), ralat piawai (ketidakpastian anggaran pekali), statistik-t dan nilai-p (kekuatan bukti bahawa pekali adalah berbeza daripada sifar), R-kuadrat (berapa banyak variasi dalam pembolehubah bersandar yang dijelaskan oleh model kepada, dari 0). R-kuadrat tinggi tidak bermaksud "model yang baik"; Tidak ada sebab musabab sama sekali.

4. Mentafsir pekali dengan betul. Jika pekali pendidikan ialah 1,200, tafsiran yang betul ialah: "Pembolehubah lain adalah tetap, peningkatan satu tahun dalam pendidikan dikaitkan dengan purata 1,200 unit pendapatan yang lebih tinggi." Salah tafsir: "Satu lagi tahun pendidikan meningkatkan pendapatan sebanyak 1,200." Yang kedua ialah tuntutan kausaliti dan hanya boleh dipertahankan dengan reka bentuk yang sesuai (unit 9).

5. Semak andaian. Kesahihan regresi bergantung pada andaian tertentu (di bawah). AI menjana kod diagnostik; Awak buat komen.

Andaian asas regresi linear

Andaian yang berasaskan model linear klasik adalah perlu untuk pekali tidak berat sebelah (berpusatkan garis) dan ralat standard boleh dipercayai:

  • Kelinearan: Hubungan adalah linear dalam parameter (diregangkan dalam log/istilah kuasa dua jika perlu).
  • Eksogeniti (min bersyarat sifar): Istilah ralat tidak dikaitkan dengan pembolehubah penjelasan. Ini adalah andaian yang paling kritikal dan paling kerap dilanggar; pelanggaran mewujudkan bias pembolehubah yang ditinggalkan.
  • Varians malar (homoskedastisitas): Varians istilah ralat adalah sama dalam semua pemerhatian (pelanggaran: heterokedastisitas — unit 5).
  • Ketiadaan autokorelasi: Ralat adalah bebas antara satu sama lain (pelanggaran yang kerap dalam siri masa — unit 5 dan 8).
  • Ketiadaan multikolineariti melampau: Pembolehubah penjelasan tidak hampir sama antara satu sama lain (unit 5).
Awas: Masalah yang paling berbahaya ialah diabaikan bias berubah-ubah. Jika anda meninggalkan faktor daripada model anda yang berkaitan dengan kedua-dua pendapatan dan pendidikan (cth. latar belakang keluarga, keupayaan), pekali pendidikan mengambil kesan faktor yang hilang ini dan menjadi melambung. AI tidak dapat mengetahui pembolehubah yang hilang; Hanya pengetahuan bidang anda boleh menangkapnya.

Jadual perbandingan: tafsiran pekali benar lwn salah

keluaran

Tafsiran (kausal) yang salah

Tafsiran (hubungan) yang betul

pekali pendidikan = 1.200

"Pendidikan meningkatkan pendapatan sebanyak 1,200"

“Pendidikan satu tahun lagi, ceteris paribus, dikaitkan dengan 1,200 pendapatan lebih tinggi.”

R² = 0.68

"Model itu menangkap realiti"

"68% daripada perubahan dijelaskan; tidak menunjukkan kausaliti"

p < 0.01

"Impaknya sangat besar"

"Bukti kukuh bahawa pekali adalah berbeza daripada sifar; magnitud adalah diskret"

pekali negatif

"X mengurangkan Y"

"Apabila X meningkat, purata Y berkurangan; mengapa ada masalah lain?"

Empat gesaan yang boleh disalin

1. Menjana kod regresi:

Peranan anda: pembantu kod ekonometrik. Saya tidak berkongsi data, saya mahu kod R. Dalam data.frame 'data', pendapatan (bergantung), pendidikan, pengalaman, jantina (kategori). Tugas: tulis kod regresi dengan lm() untuk pendapatan ~ pendidikan + pengalaman + jantina, tunjukkan output ringkasan dan selang keyakinan (confint) bagi pekali. Terangkan setiap bahagian dengan baris komen. Saya akan menjalankan dan mengesahkan hasilnya.

2. Lakaran tafsiran pekali (dalam bahasa perhubungan):

Tafsirkan keluaran regresi di bawah tetapi PERATURAN:- tulis pekali dalam bahasa RELATIONAL ("dikaitkan dengan"), JANGAN gunakan bahasa sebab-akibat,- tambahkan "pembolehubah lain yang tetap",- hadirkan R-kuasa dua sebagai 'causality',- jangan mengelirukan kepentingan dengan saiz kesan. Output: [tampal jadual]

3. Kod semakan andaian:

Tulis kod diagnosis andaian untuk model pendapatan ~ pendidikan + pengalaman (R): graf pemadanan baki (sisa), graf QQ, taburan baki. Terangkan dalam baris komen andaian yang diuji oleh setiap graf. Cadangkan pembetulan; Hanya menghasilkan diagnosis dan saya akan membuat keputusan.

4. Pertanyaan pembolehubah terlepas:

Bantu saya mempertimbangkan risiko bias pembolehubah yang diabaikan dalam model pendapatan ~ pendidikan. Senaraikan kemungkinan pembolehubah yang berkaitan dengan kedua-dua pendapatan dan pendidikan tetapi TIDAK dalam model (cth., latar belakang keluarga, wilayah, keupayaan) dan terangkan ke arah mana masing-masing mungkin berat sebelah pekali pendidikan. Ini bukan satu kepastian, biarlah senarai pertimbangan; Saya akan membuat keputusan.

Gesaan lemah / Gesaan kuat

Gesaan yang lemah:

Tafsirkan keluaran regresi ini dan terangkan hasilnya.

Gesaan ini mengeluarkan AI; berkemungkinan besar menghasilkan ayat sebab dan keterlaluan seperti "latihan meningkatkan pendapatan" dan "model itu sangat berjaya".

Gesaan kuat:

Peranan anda: pembantu ekonometrik yang berhati-hati. Tafsirkan output, tetapi: (1) tulis semua pekali dalam bahasa perhubungan, (2) gunakan pola "all else ceteris paribus", (3) jangan silap R-kuadrat untuk kausalitas, (4) asingkan kepentingan daripada saiz kesan, (5) catat kegagalan untuk menguji andaian eksogeniti model dan risiko pembolehubah yang diabaikan. Output: [jadual]

Perbezaannya: kehendak yang kuat melarang bahasa sebab-akibat, menjadikan kekaburan dan had andaian kelihatan.

tiga kes mini

Kes 1 — Perangkap bahasa sebab musabab. Seorang penganalisis mendapati pekali pengiklanan ialah 2.4 dalam pengiklanan ~ regresi jualannya dan menggunakan pelan tindakan AI seperti: "Setiap unit yang dibelanjakan untuk pengiklanan meningkatkan jualan sebanyak 2.4 unit." Pengurusan melambungkan bajet dengan sewajarnya; sedangkan semasa tempoh jualan yang tinggi sudah ada lebih banyak pengiklanan (kausalitas terbalik) dan pekali mencerminkan ini. Pengajaran: regresi biasa bukan bukti kausalitas; arah tidak jelas.

Kes 2 — Pembolehubah yang diabaikan. Dalam satu kajian, pekali pendapatan ~ pendidikan ialah 1,900. Apabila pendidikan ibu bapa dan rantau ditambahkan pada model, pekali menurun kepada 1.150. Dalam model pertama, pendidikan sebenarnya mengambil alih beberapa pengaruh latar belakang keluarga. Pengajaran: pembolehubah yang hilang tetapi berkorelasi meningkatkan pekali; Pertimbangkan kemungkinan kelemahan dengan pengetahuan domain.

Kes 3 — Ilusi R kuasa dua tinggi. Seorang pelajar melihat R²=0.94 dan berkata "model saya sempurna". Tetapi salah satu pembolehubah tidak bersandar adalah hampir sama dengan pembolehubah bersandar (item sudah termasuk dalam jualan). Model itu tidak menerangkan realiti, ia menerangkan dirinya sendiri. Pengajaran: kuasa dua R tinggi tidak menjamin kualiti model; Semakan logik diperlukan.

Kesilapan biasa

  • Mentafsir pekali secara bersebab. Bahasa "Meningkat/menurun" adalah palsu melainkan dipertahankan oleh reka bentuk; Katakan "dikaitkan dengan".
  • Mengabaikan pembolehubah yang diabaikan. Faktor yang hilang dikaitkan dengan kedua-dua X dan Y memincangkan pekali; Pertimbangkan kemungkinan kekurangan.
  • Menganggap R-kuadrat sebagai ukuran kejayaan. Kuasa dua R tinggi tidak bermakna kausalitas atau model yang betul; Ia mungkin juga merupakan tanda kebocoran berubah-ubah.
  • Mengelirukan kepentingan dengan kebesaran. p<0.05 tidak menunjukkan bahawa kesannya adalah besar; Lihat juga magnitud praktikal pekali.
  • Mentafsir andaian tanpa menyemaknya. Pelanggaran memesongkan kesilapan dan tafsiran standard; diagnosis tidak boleh terlepas.
Petunjuk: Untuk setiap pekali, tanya "Bolehkah saya menerangkan hubungan ini dalam arah yang bertentangan? Atau adakah faktor ketiga yang mempengaruhi kedua-duanya?" Kedua-dua soalan ini menghentikan tafsiran sebab-sebab yang berlebihan sebelum pen menyentuh kertas.

Secara ringkasnya

Regresi linear adalah alat asas untuk mengukur hubungan hasil dengan faktor penjelasan. AI dengan cepat menghasilkan kod model, susun atur keluaran dan garis tafsiran; tetapi spesifikasi model, tafsiran hubungan pekali, dan risiko pembolehubah yang diabaikan adalah tanggungjawab pakar. Kesilapan yang paling biasa ialah membentangkan pekali sebagai sebab ("meningkat"); bahasa yang betul adalah relasional ("berkaitan dengan, semua yang lain tetap"). Kuadrat-R tinggi bukan kejayaan atau kausaliti; Tiada tafsiran yang selamat tanpa menyemak andaian (terutama eksogeniti).

Tugasan permohonan

Sediakan regresi dengan satu bersandar dan sekurang-kurangnya dua pembolehubah tidak bersandar pada set data. Minta kod daripada AI dan jalankannya. Mula-mula, minta AI mentafsir pekali dalam bahasa perhubungan, dan kemudian anda menyemak dan membetulkan setiap pernyataan penyebab. Tambahkan pembolehubah yang berpotensi berkaitan dengan model dan perhatikan bagaimana pekali utama berubah dan tafsirkan ini dalam perenggan dalam rangka bias pembolehubah yang diabaikan. Akhir sekali, hasilkan plot diagnostik andaian dan perhatikan andaian yang kelihatan kukuh dan yang kelihatan boleh dipersoalkan.

senarai semak

  • [ ] Saya membina model berdasarkan teori dan pengetahuan lapangan, bukan berdasarkan data.
  • [ ] Saya mentafsir pekali dalam bahasa perhubungan ("berkaitan dengan, ceteris paribus").
  • [ ] Saya menyatakan bahawa tuntutan kausal memerlukan reka bentuk yang berasingan.
  • [ ] Saya menguji sensitiviti pekali utama dengan mempertimbangkan kemungkinan pembolehubah yang diabaikan.
  • [ ] Saya tidak membentangkan R-kuadrat sebagai ukuran kejayaan/kausalitas.
  • [ ] Menghasilkan dan mentafsir plot diagnostik hipotesis; Saya menilai sama ada terdapat pelanggaran.