Ünite 4 / 11

Doğrusal Regresyon: Model Kurma, Katsayı Yorumu ve Varsayımlar

Kazanimlar:

  • Doğrusal regresyon modelini yapay zeka desteğiyle kurup katsayıları, standart hataları ve R-kareyi doğru ve nedensel olmayan bir dille yorumlayabilme
  • Modelin dayandığı temel varsayımları (doğrusallık, dışsallık, sabit varyans) ve ihlal edildiklerinde ne olduğunu kavrayıp yapay zekayı varsayım kontrolü için kullanabilme
  • Yapay zekanın ürettiği katsayı yorumlarındaki aşırı nedensel iddiaları ve gözden kaçan değişken sorununu fark edip düzeltebilme

Doğrusal regresyon, ekonometrinin ve uygulamalı istatistiğin bel kemiğidir. En yalın hâliyle bir bağımlı değişkenin (açıklamak istediğiniz sonuç, örneğin gelir) bir veya daha çok bağımsız değişkenle (açıklayıcı faktörler, örneğin eğitim yılı, deneyim) doğrusal bir ilişki üzerinden nasıl değiştiğini tahmin eder. Model şu biçimdedir: gelir = β0 + β1·egitim + β2·deneyim + u. Buradaki β (beta) katsayıları ilişkinin büyüklüğünü, u ise modelin açıklayamadığı hata terimini (gözlenmeyen tüm etkiler) gösterir. Bu ünitede yapay zekanın (YZ) regresyon kurma ve yorumlamayı nasıl hızlandırdığını, ama katsayı yorumunun neden en sık hata yapılan yer olduğunu göreceğiz.

Temel amacı baştan koyalım: YZ regresyon kodunu yazar, çıktı tablosunu düzenler, katsayı yorumu için taslak üretir. Ama hangi değişkenlerin modele gireceği (model spesifikasyonu), katsayının nedensel mi ilişkisel mi yorumlanacağı ve gözden kaçan bir değişken olup olmadığı sizin kararınızdır. YZ'nin en tehlikeli alışkanlığı, sıradan bir regresyon katsayısını "X, Y'yi artırır" gibi nedensel bir dille sunmasıdır; oysa çoğu regresyon yalnızca ilişki (korelasyon) gösterir.

Adım adım regresyon iş akışı

1. Modeli kuramla kur. Hangi değişkenlerin bağımlı, hangilerinin bağımsız olacağı istatistikten değil, alan bilgisinden ve kuramdan gelir. "Veriye ne koyarsam katsayı anlamlı çıkar" mantığı değil, "bu sonucu hangi faktörler mantıken etkiler" mantığı işler.

2. Tahmin et. En yaygın yöntem EKK'dir (En Küçük Kareler, İngilizcesiyle OLS — Ordinary Least Squares): katsayıları, gözlenen ve tahmin edilen değerler arasındaki karesel farkların toplamını en küçük yapacak biçimde seçer. YZ bunun kodunu (R'de lm(), Python'da statsmodels) anında üretir.

3. Çıktıyı oku. Regresyon çıktısında dört şeye bakın: katsayı (ilişkinin yönü ve büyüklüğü), standart hata (katsayının tahmin belirsizliği), t-istatistiği ve p-değeri (katsayının sıfırdan farklı olduğuna dair kanıt gücü), R-kare (modelin bağımlı değişkendeki değişimin ne kadarını açıkladığı, 0-1 arası). Yüksek R-kare "iyi model" demek değildir; nedensellik hiç değildir.

4. Katsayıyı doğru yorumla. egitim katsayısı 1.200 ise doğru yorum şudur: "Diğer değişkenler sabitken, eğitimdeki bir yıllık artış ortalama 1.200 birim daha yüksek gelirle ilişkilidir." Yanlış yorum: "Bir yıl daha eğitim geliri 1.200 artırır." İkincisi nedensellik iddiasıdır ve ancak uygun tasarımla (9. ünite) savunulabilir.

5. Varsayımları kontrol et. Regresyonun geçerli olması belirli varsayımlara bağlıdır (aşağıda). YZ teşhis kodunu üretir; yorumu siz yaparsınız.

Doğrusal regresyonun temel varsayımları

Klasik doğrusal modelin dayandığı varsayımlar, katsayıların yansız (doğru merkezli) ve standart hataların güvenilir olması için gerekir:

  • Doğrusallık: İlişki parametrelerde doğrusaldır (gerekirse log/kare terimlerle esnetilir).
  • Dışsallık (sıfır koşullu ortalama): Hata terimi açıklayıcı değişkenlerle ilişkisizdir. Bu, en kritik ve en sık ihlal edilen varsayımdır; ihlali gözden kaçan değişken yanlılığı (omitted variable bias) yaratır.
  • Sabit varyans (homoskedastisite): Hata teriminin varyansı tüm gözlemlerde aynıdır (ihlali: değişen varyans — 5. ünite).
  • Otokorelasyon yokluğu: Hatalar birbirinden bağımsızdır (zaman serisinde sık ihlal edilir — 5. ve 8. ünite).
  • Aşırı çoklu bağlantı yokluğu: Açıklayıcı değişkenler birbirinin neredeyse aynısı değildir (5. ünite).
Dikkat: En tehlikeli sorun gözden kaçan değişken yanlılığıdır. Modelinizden hem gelirle hem eğitimle ilişkili bir faktörü (örneğin aile geçmişi, yetenek) dışarıda bırakırsanız, eğitim katsayısı bu eksik faktörün etkisini de üstlenir ve şişer. YZ eksik değişkeni bilemez; onu ancak alan bilginiz yakalar.

Karşılaştırma tablosu: doğru vs. yanlış katsayı yorumu

Çıktı

Yanlış (nedensel) yorum

Doğru (ilişkisel) yorum

egitim katsayısı = 1.200

"Eğitim geliri 1.200 artırır"

"Diğerleri sabitken bir yıl fazla eğitim 1.200 daha yüksek gelirle ilişkili"

R² = 0,68

"Model gerçeği yakaladı"

"Değişimin %68'i açıklanıyor; nedensellik göstermez"

p < 0,01

"Etki çok büyük"

"Katsayının sıfırdan farklı olduğuna dair güçlü kanıt; büyüklük ayrı"

Negatif katsayı

"X, Y'yi düşürür"

"X arttıkça Y ortalama düşük gözleniyor; neden ayrı sorun"

Dört kopyalanabilir prompt

1. Regresyon kodu üretme:

Rolün: ekonometri kod asistanı. Veriyi paylaşmıyorum, R kodu istiyorum.'veri' data.frame'inde gelir (bağımlı), egitim, deneyim, cinsiyet (kategorik).Görev: gelir ~ egitim + deneyim + cinsiyet için lm() ile regresyon kodu yaz,summary çıktısını ve katsayıların güven aralığını (confint) göster.Yorum satırıyla her parçayı açıkla. Sonucu ben çalıştırıp doğrulayacağım.

2. Katsayı yorumu taslağı (ilişkisel dille):

Aşağıdaki regresyon çıktısını yorumla ama KURALLAR:- katsayıları İLİŞKİSEL dille yaz ("...ile ilişkili"), nedensel dil KULLANMA,- "diğer değişkenler sabitken" ifadesini ekle,- R-kareyi 'nedensellik' olarak sunma,- anlamlılığı etki büyüklüğüyle karıştırma.Çıktı: [tablo yapıştır]

3. Varsayım kontrol kodu:

gelir ~ egitim + deneyim modeli için varsayım teşhis kodu yaz (R):artık-uydurma (residual) grafikleri, QQ grafiği, artıkların dağılımı.Her grafiğin hangi varsayımı sınadığını yorum satırında açıkla.Düzeltme önerme; sadece teşhis üret, kararı ben vereceğim.

4. Gözden kaçan değişken sorgusu:

gelir ~ egitim modelinde gözden kaçan değişken yanlılığı riskini düşünmemeyardım et. Hem gelirle hem eğitimle ilişkili olup modelde OLMAYAN olasıdeğişkenleri (ör. aile geçmişi, bölge, yetenek) listele ve her birininegitim katsayısını hangi yönde saptırabileceğini açıkla. Bu bir kesinlikdeğil, düşünme listesi olsun; kararı ben vereceğim.

Zayıf prompt / Güçlü prompt

Zayıf prompt:

Şu regresyon çıktısını yorumla, sonuçları anlat.

Bu istem YZ'yi serbest bırakır; büyük olasılıkla "eğitim geliri artırıyor", "model çok başarılı" gibi nedensel ve abartılı cümleler üretir.

Güçlü prompt:

Rolün: dikkatli ekonometri asistanı.Çıktıyı yorumla ama: (1) tüm katsayıları ilişkisel dille yaz,(2) "diğerleri sabitken" kalıbını kullan, (3) R-kareyi nedensellik sanma,(4) anlamlılık ile etki büyüklüğünü ayır, (5) modelin dışsallıkvarsayımının test edilemediğini ve gözden kaçan değişken riskini not düş.Çıktı: [tablo]

Fark: güçlü istem nedensel dili yasaklar, belirsizliği ve varsayım sınırlarını görünür kılar.

Üç mini vaka

Vaka 1 — Nedensel dil tuzağı. Bir analist reklam ~ satis regresyonunda reklam katsayısını 2,4 buldu ve YZ'nin taslağını olduğu gibi kullandı: "Reklama harcanan her birim satışı 2,4 birim artırır." Yönetim bütçeyi buna göre şişirdi; oysa yüksek satışlı dönemlerde zaten daha çok reklam yapılıyordu (ters nedensellik) ve katsayı bunu yansıtıyordu. Ders: sıradan regresyon nedensellik kanıtı değildir; yön belirsizdir.

Vaka 2 — Gözden kaçan değişken. Bir çalışmada gelir ~ egitim katsayısı 1.900 çıktı. Modele ebeveyn eğitimi ve bölge eklenince katsayı 1.150'ye düştü. İlk modelde eğitim, aslında aile geçmişinin etkisinin bir kısmını da üstlenmişti. Ders: eksik ama ilişkili bir değişken katsayıyı şişirir; alan bilgisiyle olası eksikleri düşünün.

Vaka 3 — Yüksek R-kare yanılsaması. Bir öğrenci R²=0,94 görüp "modelim mükemmel" dedi. Ama bağımsız değişkenlerden biri bağımlı değişkenin neredeyse aynısıydı (satışın içinde zaten bulunan bir kalem). Model gerçeği açıklamıyor, kendini açıklıyordu. Ders: yüksek R-kare model kalitesini garanti etmez; mantık kontrolü şart.

Sık yapılan hatalar

  • Katsayıyı nedensel yorumlamak. "Artırır/azaltır" dili tasarımla savunulmadıkça yanlıştır; "ile ilişkili" deyin.
  • Gözden kaçan değişkeni ihmal etmek. Hem X hem Y ile ilişkili eksik bir faktör katsayıyı saptırır; olası eksikleri düşünün.
  • R-kareyi başarı ölçütü sanmak. Yüksek R-kare nedensellik ya da doğru model demek değildir; hatta değişken sızıntısının işareti olabilir.
  • Anlamlılık ile büyüklüğü karıştırmak. p<0,05 etkinin büyük olduğunu göstermez; katsayının pratik büyüklüğüne ayrıca bakın.
  • Varsayımları kontrol etmeden yorumlamak. İhlaller standart hataları ve yorumu bozar; teşhis atlanamaz.
İpucu: Her katsayı için "bu ilişkiyi ters yönden de açıklayabilir miyim; ya da ikisini birden etkileyen üçüncü bir faktör olabilir mi" diye sorun. Bu iki soru, nedensel aşırı yorumu daha kalemi kâğıda değmeden durdurur.

Özetle

Doğrusal regresyon, bir sonucun açıklayıcı faktörlerle ilişkisini ölçen temel araçtır. YZ modelin kodunu, çıktı düzenini ve yorum taslağını hızla üretir; ama model spesifikasyonu, katsayının ilişkisel yorumu ve gözden kaçan değişken riski uzmanın sorumluluğundadır. En sık hata katsayıyı nedensel ("artırır") sunmaktır; doğru dil ilişkiseldir ("ile ilişkilidir, diğerleri sabitken"). Yüksek R-kare başarı ya da nedensellik değildir; varsayımlar (özellikle dışsallık) kontrol edilmeden hiçbir yorum güvenli değildir.

Uygulama görevi

Bir veri setinde bir bağımlı ve en az iki bağımsız değişkenle bir regresyon kurun. YZ'den kodu isteyip çalıştırın. Katsayıları önce YZ'ye ilişkisel dille yorumlatın, sonra siz gözden geçirip her nedensel ifadeyi düzeltin. Modele ilişkili olabilecek bir değişken ekleyip ana katsayının nasıl değiştiğini gözlemleyin ve bunu gözden kaçan değişken yanlılığı çerçevesinde bir paragrafta yorumlayın. Son olarak varsayım teşhis grafiklerini üretip hangi varsayımın sağlam, hangisinin şüpheli göründüğünü not edin.

Kontrol listesi

  • [ ] Modeli veriye değil, kurama ve alan bilgisine göre kurdum.
  • [ ] Katsayıları ilişkisel dille ("...ile ilişkili, diğerleri sabitken") yorumladım.
  • [ ] Nedensel iddiaların ayrı bir tasarım gerektirdiğini not ettim.
  • [ ] Gözden kaçan olası değişkenleri düşünüp ana katsayının duyarlılığını sınadım.
  • [ ] R-kareyi başarı/nedensellik ölçütü olarak sunmadım.
  • [ ] Varsayım teşhis grafiklerini üretip yorumladım; ihlal olup olmadığını değerlendirdim.