Ünite 6 / 11

Fine-Tuning Temeli: Ne Zaman, Nasıl ve Hangi Riskle

Kazanimlar:

  • Bir problemin bilgi mi davranış mı olduğunu ayırt edebilme ve fine-tuning'i ancak prompt, few-shot ve RAG tükendikten sonra davranış problemleri için değerlendirebilme
  • Fine-tuning yöntemlerini (SFT, LoRA/PEFT, RLHF) ve kaliteyi belirleyen veri niteliklerini (tutarlılık, çeşitlilik, gizlilik) kavrayabilme
  • Öncesi-sonrası değerlendirme, aşırı öğrenme ve yetenek kaybı (catastrophic forgetting) testleriyle fine-tuning'in gerçek değerini ölçebilme

Fine-tuning (ince ayar: önceden eğitilmiş bir modeli, kendi verinizle biraz daha eğitip davranışını özelleştirme), LLM'lerle çalışan mühendisin cephaneliğindeki güçlü ama pahalı bir araçtır. Yanlış yerde kullanıldığında para ve zaman kaybı, doğru yerde kullanıldığında ise başka türlü elde edilemeyecek bir kalite sağlar. Bu ünitede fine-tuning'in ne zaman gerekli olduğunu, temel yöntemlerini ve risklerini işliyoruz. Amaç, sizi karar verebilir kılmak.

Önce doğru soru: fine-tuning gerekli mi?

Yeni başlayanların en pahalı hatası, çözülebilecek bir problemi hemen fine-tuning'e koşmaktır. Sırayı şöyle kurun:

  1. Prompt mühendisliği: Görevi net anlatan iyi bir prompt çoğu problemi çözer. Önce burayı tüketin.
  2. Az örnekli öğrenme (few-shot): Prompt'a birkaç örnek koymak, modele istenen formatı ve davranışı gösterir.
  3. RAG: Sorun "bilgi eksikliği" ise (modelin bilmediği veriye ihtiyaç), çözüm fine-tuning değil RAG'dır (4. ünite).
  4. Fine-tuning: Yukarıdakiler yetmiyorsa ve sorun "davranış/format/stil" ise devreye girer.

Temel ayrım: Fine-tuning modele yeni bilgi öğretmekte zayıftır ve risklidir; ama nasıl davranacağını (belirli bir format, ton, alan jargonu, tutarlı yapı) öğretmekte güçlüdür. "Modelim şirket bilgimizi bilmiyor" → RAG. "Modelim çıktıyı hep bizim istediğimiz kesin formatta versin" → fine-tuning adayı.

Ipucu: Fine-tuning'e karar vermeden önce sorun: "Bu, bir bilgi problemi mi yoksa bir davranış problemi mi?" Bilgi problemleri RAG ile, davranış problemleri fine-tuning ile daha iyi çözülür.

Fine-tuning yöntemleri

Tam fine-tuning (full fine-tuning): Modelin tüm parametrelerini yeniden eğitmek. En güçlü ama en pahalı; büyük donanım (GPU) ve dikkatli veri ister. Çoğu ekip için gereksizdir.

Parametre-verimli fine-tuning (PEFT): Modelin büyük çoğunluğunu donduran, yalnızca küçük bir ek parametre kümesini eğiten yöntemler. En yaygını LoRA (Low-Rank Adaptation: modele eklenen küçük "adaptör" katmanları eğitme). LoRA çok daha az bellek ve maliyetle, tam fine-tuning'e yakın sonuç verir; bu yüzden pratikte ilk tercihtir.

Denetimli fine-tuning (SFT - Supervised Fine-Tuning): Girdi-ideal çıktı çiftlerinden oluşan bir veriyle modele "böyle girdiye böyle cevap ver" öğretmek. En yaygın senaryodur.

İnsan geri bildiriminden pekiştirmeli öğrenme (RLHF): İnsanların tercih ettiği cevaplardan modelin davranışını hizalama. Karmaşık ve pahalıdır; çoğu uygulama ekibinin ihtiyacı SFT ile karşılanır. RLHF'i bir kavram olarak bilmek yeterlidir.

Veri: fine-tuning'in kalbi

Fine-tuning'in kalitesi tamamen eğitim verisinin kalitesine bağlıdır. Birkaç yüz yüksek kalite, tutarlı örnek, binlerce özensiz örnekten iyidir. Veri hazırlarken:

  • Tutarlılık: Tüm örnekler istediğiniz formatı ve tonu tutarlı gösterir. Çelişkili örnekler modeli kafası karışık bırakır.
  • Çeşitlilik: Örnekler gerçek kullanımdaki çeşitliliği kapsar, tek tip değildir.
  • Temizlik: Hatalı, taraflı veya gizli veri içeren örnekler modele kalıcı olarak geçer. Fine-tuning verisi bir sözleşme kadar dikkatli okunmalıdır.
Dikkat: Fine-tuning verisine giren her önyargı, hata ve gizli bilgi modele kazınır ve çıktılarında yeniden belirir. Eğitim verinizi yayınlıyormuş gibi titiz denetleyin; kişisel veri koymayın.

Değerlendirme: fine-tuning işe yaradı mı?

Fine-tuning'den önce bir değerlendirme kümesi (held-out eval set) ayırın ve fine-tuning'siz modelin (baz model) skorunu ölçün. Fine-tuning'den sonra aynı kümede tekrar ölçün. Karşılaştırma olmadan "daha iyi oldu" diyemezsiniz. Ayrıca dikkat edilmesi gereken iki tuzak:

  • Aşırı öğrenme: Küçük veriyle fazla eğitim, modelin eğitim örneklerini ezberleyip genelleme yeteneğini kaybetmesine yol açar.
  • Yeteneklerin unutulması (catastrophic forgetting): Dar bir görevde aşırı eğitim, modelin genel yeteneklerini bozabilir. Yeni davranışı kazanırken eski becerilerin korunduğunu da test edin.

Zayıf yaklaşım / Güçlü yaklaşım

Zayıf: "Elimde 3000 sohbet logu var, hepsini fine-tuning'e verelim, model bizim gibi konuşsun."

Güçlü: "Önce baz modeli 100 gerçek görevle değerlendirdim, skoru not ettim. Prompt ve few-shot ile ne kadar iyileştiğini ölçtüm — yetmedi. Sonra 3000 logdan yalnızca yüksek kalite, tutarlı formatlı ve gizli veri içermeyen 400 örnek seçip temizledim. LoRA ile fine-tune ettim, aynı 100 görevle yeniden ölçtüm ve genel yeteneklerin bozulmadığını ayrı bir testle doğruladım."

Fark: güçlü yaklaşım önce alternatifleri tüketir, veriyi titizce seçer, öncesi-sonrası ölçer ve yan etkileri test eder.

Maliyet ve bakım gerçeği

Fine-tuning tek seferlik bir iş değildir; bir bakım yükümlülüğüdür. Baz model güncellenince, ihtiyaçlar değişince veya veri kayınca yeniden eğitmek gerekebilir. Ayrıca fine-tune edilmiş bir modeli barındırmak (hosting) ek maliyet ve operasyon getirir. Bu toplam sahip olma maliyetini, sağladığı kalite artışıyla karşılaştırın. Çoğu zaman iyi bir prompt + RAG, fine-tuning'den daha ucuz ve daha esnektir.

Üç mini vaka

Vaka 1 - Gereksiz fine-tuning. Bir ekip, "modelimiz ürünlerimizi bilmiyor" diye pahalı bir fine-tuning projesine girişti. Aylar ve bütçe harcandı, sonuç kırılgandı — ürün kataloğu her değiştiğinde model eskiyordu. Sonunda RAG'a geçtiler: ürün verisini belge tabanından getirdiler, güncelleme anında oldu ve maliyet düştü. Ders: bilgi problemi fine-tuning ile çözülmez.

Vaka 2 - Doğru fine-tuning. Bir sigorta şirketi, modelin poliçe özetlerini her zaman aynı katı yapıda (madde madde, belirli başlıklarla) üretmesini istiyordu. Prompt ile tutarlılık %70'te takıldı. 300 iyi örnekle LoRA fine-tuning sonrası format tutarlılığı %98'e çıktı. Bu bir davranış problemiydi ve fine-tuning doğru araçtı.

Vaka 3 - Veriye kaçan gizlilik. Bir ekip sohbet loglarını temizlemeden fine-tuning'e verdi. Loglarda gerçek müşteri isimleri ve kimlik numaraları vardı. Fine-tune edilmiş model, ilgisiz sorularda bu isimleri çıktı olarak "sızdırmaya" başladı. Model geri çekildi, veri maskelenerek yeniden eğitildi. Ders: fine-tuning verisindeki gizli bilgi modele kalıcı geçer.

Kopyalanabilir şablonlar

Şu problemim için fine-tuning gerekli mi, karar vermeme yardım et.Problem: [açıklama]Bu bir BİLGİ problemi mi (model bir şeyi bilmiyor) yoksa DAVRANIŞ problemi mi(model istediğim format/ton/yapıda üretmiyor)?Önce prompt, few-shot ve RAG ile çözülebilir mi? Her birini neden dene/deneme?Fine-tuning'i ancak hangi koşulda öner?

Bu fine-tuning veri setini denetle:1) Örnekler format ve ton olarak tutarlı mı?2) Gerçek kullanımdaki çeşitliliği kapsıyor mu?3) Gizli/kişisel veri içeriyor mu (maskelenmeli)?4) Çelişkili örnek var mı?Örneklerden bir alt küme: [örnekler]Bulduğun her sorunu ve düzeltmeyi listele.

Fine-tuning öncesi-sonrası değerlendirme planı üret.Görev: [açıklama]- Held-out eval kümesi nasıl seçilmeli?- Baz modelin skoru nasıl ölçülür?- Fine-tuning sonrası hangi metrikle karşılaştırılır?- Genel yeteneklerin bozulmadığını (catastrophic forgetting) nasıl test ederim?

LoRA ile fine-tuning için başlangıç hiperparametrelerini öner.Veri boyutu: [örnek sayısı]Amaç: [format/ton öğretme]Aşırı öğrenmeyi önlemek için epoch, öğrenme oranı ve erken durdurma önerini gerekçesiyle ver.

Karar tablosu: hangi araç ne zaman

İhtiyaç

Önce dene

Fine-tuning?

Model bir bilgiyi bilmiyor

RAG

Hayır

Güncel veri gerekiyor

RAG

Hayır

Belirli katı format

Few-shot

Yetmezse evet

Tutarlı ton/stil

Prompt + few-shot

Yetmezse evet

Alan jargonu/tarzı

Prompt

Yetmezse LoRA

Basit görev iyileştirme

Prompt mühendisliği

Genelde hayır

Sık yapılan hatalar

  • Bilgi problemini fine-tuning ile çözmeye çalışmak. RAG doğru araçtır.
  • Prompt/few-shot/RAG'ı tüketmeden fine-tuning'e koşmak. Pahalı ve gereksiz.
  • Düşük kaliteli/çelişkili veriyle eğitmek. Az ama temiz veri daha iyidir.
  • Gizli veriyi eğitime koymak. Modele kalıcı sızar.
  • Öncesi-sonrası ölçmemek. İyileşmeyi kanıtlayamazsınız.
  • Catastrophic forgetting'i test etmemek. Yeni beceri eskisini bozabilir.

Ozetle

Fine-tuning güçlü ama pahalı bir araçtır ve yalnızca davranış/format problemleri için, prompt-few-shot-RAG tüketildikten sonra düşünülmelidir; bilgi problemleri RAG'a aittir. LoRA gibi parametre-verimli yöntemler pratik ilk tercihtir. Kalite tamamen veri kalitesine bağlıdır; az ama temiz, tutarlı ve gizlilikten arınmış veri kullanın. Öncesi-sonrası ölçün, aşırı öğrenme ve yetenek kaybını test edin. Fine-tuning bir bakım yükümlülüğüdür; toplam maliyetini kazandırdığı kaliteyle tartın.

Uygulama gorevi

Bir problem seç ve "bilgi mi davranış mı" ayrımını yaparak fine-tuning'in gerekli olup olmadığına karar ver, gerekçeni yaz. Eğer bir davranış problemiyse, 20-30 tutarlı örnek hazırla, gizli veri açısından denetle ve öncesi-sonrası değerlendirme planını (held-out küme, baz skor, karşılaştırma metriği, forgetting testi) belgele. Fine-tuning yerine RAG/few-shot ile çözülebiliyorsa bunu da not et.

Kontrol listesi

  • [ ] Problemin bilgi mi davranış mı olduğunu belirledim.
  • [ ] Prompt, few-shot ve RAG alternatiflerini önce değerlendirdim.
  • [ ] Fine-tuning verisini tutarlılık, çeşitlilik ve gizlilik açısından denetledim.
  • [ ] Held-out eval kümesi ayırıp baz skoru ölçtüm.
  • [ ] Öncesi-sonrası karşılaştırma ve forgetting testi planladım.
  • [ ] Toplam maliyeti kazandırdığı kaliteyle karşılaştırdım.