Kazanimlar:
- Önyargının veriden (tarihsel, temsil, ölçüm, toplama) geldiğini kavrayıp modeli alt gruplar bazında değerlendirerek gizli ayrımcılığı tespit edebilme
- Yüksek etkili kararlarda açıklanabilirlik, insan gözetimi ve hesap verebilirliği sağlayabilme ve model kartıyla şeffaflığı belgeleyebilme
- En küçük yeterli model, prompt kısaltma, önbellek ve batch ile finansal ve çevresel maliyeti kaliteyi bozmadan yönetebilme
Bir model teknik olarak mükemmel çalışabilir ama yine de yanlış olabilir — bazı insanlara haksızlık ederse, açıklanamazsa veya sürdürülemez maliyet üretirse. Bu ünitede ML mühendisliğinin üç "görünmez" ama belirleyici boyutunu işliyoruz: önyargı (bias) ve adalet, etik ve şeffaflık, maliyet ve sürdürülebilirlik. Bunlar sonradan eklenen süsler değil, mühendislik kalitesinin ayrılmaz parçalarıdır.
Önyargı nereden gelir
Model önyargısı (bias: modelin belirli gruplara sistematik olarak farklı/haksız davranması) genellikle modelden değil veriden gelir. Kaynaklar:
- Tarihsel önyargı: Veri, geçmişteki adaletsizliği yansıtır. Geçmişte belirli bir gruba daha az kredi verildiyse, o veriyle eğitilen model bu ayrımcılığı öğrenir ve sürdürür.
- Temsil önyargısı: Bazı gruplar veride az temsil edilir; model onlar için kötü çalışır (ör. az örnekli bir demografide düşük doğruluk).
- Ölçüm önyargısı: Etiketlerin kendisi taraflıdır (ör. "iyi çalışan" tanımı geçmiş terfi kararlarına dayanıyorsa).
- Toplama önyargısı: Veri belirli bir kanaldan geldiği için evreni temsil etmez.
Model bu önyargıları yalnızca öğrenmez; ölçekte otomatikleştirerek büyütür. Bir insanın önyargılı kararı bir kişiyi etkiler; önyargılı bir modelin kararı milyonları.
Dikkat: "Model nötr çünkü sadece matematik" yanılgısına düşmeyin. Model, verideki insani önyargıyı öğrenir ve otomatikleştirir. Nötrlük varsayılan değil, ölçülüp sağlanması gereken bir sonuçtur.
Adaleti ölçmek
Adaleti (fairness) yönetmek için önce ölçmek gerekir. Bunun için modeli alt gruplar bazında değerlendirin: doğruluk, recall, yanlış pozitif oranı gibi metrikler farklı demografik gruplarda eşit mi? Birkaç adalet kavramı:
- Grup adaleti: Model farklı gruplara benzer oranlarda mı doğru/yanlış davranıyor?
- Fırsat eşitliği: Gerçekten pozitif olanları model tüm gruplarda eşit oranda mı yakalıyor (eşit recall)?
Önemli gerçek: farklı adalet tanımları aynı anda sağlanamayabilir (bu matematiksel bir sonuçtur). Hangi adalet tanımının bu bağlamda öncelikli olduğu, teknik değil etik ve iş kararıdır ve paydaşlarla birlikte verilir.
Zayıf yaklaşım / Güçlü yaklaşım
Zayıf: "Modelin genel doğruluğu %88, adil sayılır."
Güçlü: "Genel doğruluk %88 ama alt gruplara ayırdığımızda bir grupta recall %91, başka bir grupta %67 çıktı — model o grubu sistematik kaçırıyordu. Nedenini (temsil azlığı) belgeledik, o grup için veri topladık ve eşit-recall hedefiyle yeniden değerlendirdik. Hangi adalet tanımını önceleyeceğimizi paydaşlarla kararlaştırdık."
Fark: güçlü yaklaşım genel metriğin arkasına saklanmaz, alt grupları ayrıştırır ve adaleti açık bir karar olarak ele alır.
Etik ve şeffaflık
Sorumlu AI'ın temel ilkeleri:
- Açıklanabilirlik (explainability): Model neden bu kararı verdi, açıklanabiliyor mu? Yüksek etkili kararlarda (kredi, işe alım, sağlık) kişinin bir açıklama hakkı vardır. Açıklanamayan model, bu alanlarda kullanılmamalı ya da açıklanabilir bir yöntemle desteklenmeli.
- İnsan gözetimi: Yüksek etkili kararlar otomatik verilmemeli; model önerir, insan onaylar.
- Hesap verebilirlik: Modelin bir hatası olduğunda kimin sorumlu olduğu net olmalı. "Model karar verdi" bir mazeret değildir.
- Şeffaflık: Kullanıcı bir AI ile etkileştiğini ve verisinin nasıl kullanıldığını bilmeli.
Birçok ülkede ve sektörde bu ilkeler yasal düzenlemeye de bağlanmıştır (yüksek riskli AI sistemleri için şeffaflık, denetim ve insan gözetimi zorunlulukları). Mühendis, kendi alanının düzenlemelerini bilmekle yükümlüdür.
Ipucu: Her yüksek etkili model için bir "model kartı" (model card) tutun: model ne yapar, hangi veriyle eğitildi, hangi gruplarda ne kadar iyi/kötü çalışır, bilinen sınırları neler. Bu belge hem şeffaflık hem sorumluluk aracıdır.
Maliyet ve sürdürülebilirlik
AI ucuz değildir. Maliyet iki boyutta yönetilir:
Finansal maliyet:
- Token maliyeti (LLM): Her istek ve cevap token harcar; hacim büyüdükçe fatura büyür. Gereksiz uzun promptlar, aşırı büyük model seçimi ve kontrolsüz ajan döngüleri (5. ünite) maliyeti şişirir.
- Eğitim ve barındırma: Fine-tuning ve model sunumu donanım maliyeti getirir.
- Optimizasyon: Küçük model yetiyorsa büyük model kullanmayın; sık sorulanları önbelleğe (cache) alın; prompt'u kısaltın; batch işlenebileni batch yapın.
Çevresel maliyet: Büyük model eğitimi ve çıkarımı ciddi enerji tüketir. Sürdürülebilirlik, gereksiz hesaplamadan kaçınmayı (doğru boyut model, verimli mimari) meslek sorumluluğu hâline getirir.
Ipucu: Maliyet optimizasyonunun ilk kuralı: "Bu iş için en küçük yeterli model hangisi?" En güçlü modeli her yere koymak, bir çiviyi balyozla çakmaktır — pahalı ve gereksiz.
Üç mini vaka
Vaka 1 - Gizli ayrımcılık. Bir işe alım tarama modeli genel olarak iyi görünüyordu. Alt grup analizinde, geçmiş veri erkek ağırlıklı olduğu için modelin kadın adayları sistematik olarak düşük skorladığı görüldü — tarihsel önyargıyı öğrenmişti. Model durduruldu, veri dengelendi ve adalet metrikleri izlemeye alındı. Genel doğruluk gizli ayrımcılığı örtmüştü.
Vaka 2 - Açıklanamayan ret. Bir kredi modeli başvuruları reddediyor ama neden reddettiğini kimse açıklayamıyordu. Bir müşteri yasal açıklama talep edince ekip cevap veremedi. Açıklanabilir bir yöntem eklenene ve her ret için gerekçe üretilene kadar model yüksek etkili kararlarda kullanımdan çekildi. Ders: yüksek etkili kararda açıklanabilirlik zorunlu.
Vaka 3 - Fatura şoku. Bir ekip her isteğe en büyük LLM'i ve çok uzun promptları kullanıyordu. Aylık fatura beklenmedik şekilde büyüdü. Analiz sonrası: isteklerin çoğu küçük bir modelle çözülebiliyordu, promptların yarısı gereksizdi ve sık sorular önbelleğe alınabilirdi. Bu üç optimizasyon maliyeti ciddi düşürdü, kaliteyi bozmadan. Ders: en güçlü model her yerde gerekli değil.
Kopyalanabilir şablonlar
Bu modeli önyargı/adalet açısından değerlendirmeme yardım et.Hangi alt gruplara (demografik/segment) ayırıp ölçmeliyim?Hangi metrikleri (grup bazında doğruluk, recall, yanlış pozitif oranı) karşılaştırmalıyım?Farklı adalet tanımları çelişebilir mi, bu bağlamda hangisini öncelemeli ve neden?Model/karar bağlamı: [açıklama]
Bu yüksek etkili model için bir model kartı (model card) taslağı üret.İçermeli: amaç, eğitim verisi ve tarihi, alt gruplarda performans, bilinen sınırlar,uygun/uygun olmayan kullanım, açıklanabilirlik durumu, insan gözetimi noktası.Model: [açıklama]
Bu LLM uygulamasının maliyetini düşürmeme yardım et, kaliteyi bozmadan.Mevcut: model boyutu, ortalama prompt uzunluğu, istek hacmi, önbellek var mı?Değerlendir:1) Daha küçük model yeter mi (hangi görevlerde)?2) Prompt kısaltılabilir mi?3) Sık istekler önbelleğe alınabilir mi?4) Batch'e uygun iş var mı?Her önerinin tahmini etkisini yaz.
Bu yüksek etkili karar sistemi için etik/sorumluluk kontrol listesi üret.- Açıklanabilirlik: karar gerekçesi üretilebiliyor mu?- İnsan gözetimi: yüksek etkili karar onaya bağlı mı?- Hesap verebilirlik: hata durumunda sorumlu kim?- Şeffaflık: kullanıcı AI kullanıldığını biliyor mu?- Düzenleme: ilgili yasal yükümlülükler neler?Sistem: [açıklama]
Önyargı kaynağı tablosu
Kaynak
Belirti
Önlem
Tarihsel önyargı
Geçmiş ayrımcılığı sürdürür
Veri denetimi + adalet metriği
Temsil önyargısı
Az örnekli grupta düşük doğruluk
Alt grup analizi + dengeleme
Ölçüm önyargısı
Taraflı etiketler
Etiket süreci gözden geçirme
Toplama önyargısı
Evren temsil edilmez
Kaynak çeşitlendirme
Sık yapılan hatalar
- Genel metriğe güvenmek. Alt grup analizi yapmadan gizli ayrımcılık görülmez.
- "Model nötr" varsaymak. Model verideki önyargıyı öğrenir ve büyütür.
- Yüksek etkili kararı açıklanamayan modele bırakmak. Yasal ve etik risk.
- İnsan gözetimini atlamak. "Model karar verdi" mazeret değildir.
- Her yere en büyük modeli koymak. Gereksiz maliyet ve enerji.
- Maliyeti izlememek. Fatura sessizce şişer.
Ozetle
Teknik olarak doğru bir model, adil, açıklanabilir ve sürdürülebilir değilse yine de başarısızdır. Önyargı çoğunlukla veriden gelir ve model onu ölçekte büyütür; adaleti alt gruplar bazında ölçün ve hangi adalet tanımını önceleyeceğinizi paydaşlarla kararlaştırın. Yüksek etkili kararlarda açıklanabilirlik, insan gözetimi ve hesap verebilirlik zorunludur; model kartıyla şeffaflığı belgeleyin. Maliyeti ve enerjiyi yönetin: en küçük yeterli modeli seçin, promptu kısaltın, önbellek ve batch kullanın. Bu boyutlar mühendislik kalitesinin ayrılmaz parçalarıdır, sonradan eklenen süsler değil.
Uygulama gorevi
Bir modelini en az iki alt gruba ayırıp grup bazında recall ve yanlış pozitif oranını karşılaştır; anlamlı bir fark varsa nedenini ve bir önlemi yaz. Yüksek etkili bir model için kısa bir model kartı taslağı hazırla (amaç, veri, alt grup performansı, sınırlar, açıklanabilirlik). Bir LLM uygulamanın maliyetini düşürmek için en az iki somut optimizasyon (küçük model / prompt kısaltma / önbellek / batch) belirle ve tahmini etkisini yaz.
Kontrol listesi
- [ ] Modeli alt gruplar bazında değerlendirdim, genel metriğe güvenmedim.
- [ ] Hangi adalet tanımını önceleyeceğimi paydaşlarla kararlaştırdım.
- [ ] Yüksek etkili karar açıklanabilir ve insan onayına bağlı.
- [ ] Model kartıyla şeffaflığı ve sınırları belgeledim.
- [ ] En küçük yeterli modeli seçtim; prompt/önbellek/batch optimizasyonu yaptım.
- [ ] Maliyeti ve enerji etkisini izliyorum.