Kazanimlar:
- Kullanım, güvenlik, kalite ve performans sinyallerini izleyen metrikler tanımlayabilme
- Temel çizgi ve örneklemeyle çıktı kalitesi drift'ini tespit edebilme
- Anomali ve jailbreak dalgaları için alarm ve geri besleme döngüsü kurabilme
Bir AI sistemini üretime almak yolun sonu değil, başıdır. Model aynı kalsa bile dünya değişir: kullanıcı davranışı, gelen veri, saldırı teknikleri ve iş bağlamı sürekli kayar. Dünkü doğru yanıt bugün yanlış olabilir. Bu yüzden güvenliğin son direği sürekli izleme (continuous monitoring) ve gözlemlenebilirliktir (observability) — sistemin içinde ne olup bittiğini dışarıdan görebilme yeteneği. Bu ünitede hangi metrikleri izleyeceğinizi, çıktı kalitesi drift'ini nasıl yakalayacağınızı ve anomalilere nasıl alarm kuracağınızı öğreneceğiz.
Neden Sürekli İzleme?
Klasik yazılımda "çalışıyor mu" ikili bir sorudur: ya yanıt verir ya vermez. AI'da sistem "çalışır" görünürken sessizce kötüleşebilir: yanıtlar yavaşça yanlışlaşır, maliyet tırmanır, jailbreak denemeleri artar. Bunları yakalamanın tek yolu, doğru sinyalleri sürekli ölçmektir.
Dikkat: En tehlikeli arıza gürültülü değil sessiz olandır. Sistem hata fırlatmaz, sadece kalitesi düşer. İzleme kurmazsanız bunu ilk fark eden siz değil, müşteriniz veya denetçiniz olur.
İzlenecek Dört Sinyal Ailesi
- Kullanım ve maliyet: İstek hacmi, token tüketimi, kullanıcı başına maliyet. Ani sıçrama; kötüye kullanım, döngüye giren bir entegrasyon ya da sızan bir anahtar işareti olabilir.
- Güvenlik sinyalleri: Jailbreak/injection denemeleri, reddedilen araç çağrıları, yetki hataları. Artış, aktif bir saldırı kampanyasını gösterebilir.
- Kalite ve drift: Çıktı kalitesinin zamanla düşmesi (drift). Örneğin doğrulamadan geçme oranı, insan onayında düzeltme oranı, kullanıcı memnuniyeti.
- Performans: Gecikme (latency), hata oranı, zaman aşımı. Kullanıcı deneyimini ve maliyeti doğrudan etkiler.
Drift Nedir ve Nasıl Yakalanır?
Drift, modelin girdileri veya çıktı kalitesinin zamanla, fark edilmeden kaymasıdır. İki türü vardır: veri drift'i (gelen isteklerin dağılımı değişir — yeni konu, yeni dil) ve kalite drift'i (aynı iş için çıktı giderek kötüleşir). Yakalamak için bir temel çizgi (baseline) gerekir: sistem sağlıklıyken metriklerin normal aralığını kaydedin; sapma alarma dönüşsün.
Adım Adım: İzleme Kurmak
- Temel çizgiyi ölçün. Sistem sağlıklıyken her sinyalin normal aralığını kaydedin.
- Eşik ve alarm tanımlayın. Hangi sapma kimi, nasıl uyaracak?
- Örnekleme + insan denetimi. Çıktıların bir örneğini düzenli olarak insan gözden geçirsin (kalite drift'i çoğu zaman yalnızca gözle görülür).
- Gösterge paneli kurun. Dört sinyal ailesini tek ekranda izleyin.
- Geri besleme döngüsü. İzlemeden çıkan bulguları prompt/kontrol iyileştirmesine bağlayın.
Dört Kopyalanabilir Şablon
Kalite örnekleme değerlendirme promptu (LLM-as-judge ile drift takibi):
Aşağıda bu haftanın 20 rastgele çıktısı var. Her birini "iyi / kabuledilebilir / kötü" olarak puanla ve kısa gerekçe yaz. Sonunda kötüoranını geçen haftanın oranıyla karşılaştıracağım; bu hafta dikkatçeken bir kalıp (aynı tür hata tekrarı) varsa işaretle.<ciktilar>{{ ornekler }}</ciktilar>
Anomali özet promptu:
Aşağıdaki günlük metrikleri incele: istek sayısı, token, maliyet,reddedilen araç çağrısı, jailbreak denemesi, ortalama gecikme.Temel çizgiye göre %30'dan fazla sapan her metriği "ANOMALİ" olarakişaretle ve olası nedenini (saldırı, hata, kötüye kullanım) tahmin et.<metrikler>{{ gunluk_veriler }}</metrikler>
Alarm eşiği tanım kuralı:
Her sinyal için alarm tanımla:- Maliyet: günlük ortalamanın 2 katını aşarsa -> yüksek öncelik uyarı- Jailbreak denemesi: saatte 10'u aşarsa -> güvenlik ekibine bildir- Doğrulamadan geçme oranı: %90'ın altına düşerse -> kalite incelemesi- Gecikme: p95 hedefi 2 kat aşarsa -> performans incelemesi
Drift araştırma promptu:
Doğrulamadan geçme oranı son 2 haftada %94'ten %78'e düştü. Şusoruları yanıtlamama yardım et: (1) Gelen isteklerde yeni bir konu/dil/format belirdi mi? (2) Hatalar belirli bir kategoride miyoğunlaşıyor? (3) Bir prompt/model/araç değişikliğiyle zamanlamasıörtüşüyor mu? Her biri için kontrol edilecek veriyi söyle.
Zayıf Prompt / Güçlü Prompt
Zayıf yaklaşım
Güçlü yaklaşım
"Hata gelirse bakarız"
Temel çizgi + eşik + proaktif alarm
Yalnızca sistem ayakta mı diye bakmak
Dört sinyal ailesini (kullanım, güvenlik, kalite, performans) izlemek
Çıktı kalitesini hiç örneklememek
Düzenli insan örnekleme + LLM-as-judge
Metrikleri toplayıp bakmamak
Gösterge paneli + geri besleme döngüsü
Üç Mini Vaka
Vaka 1 — Maliyet alarmı sızan anahtarı yakaladı. Bir firmanın günlük token maliyeti bir gecede 3 katına çıktı. Eşik alarmı güvenlik ekibini uyardı; inceleme, bir test anahtarının sızıp bir botça kullanıldığını gösterdi. Anahtar 25 dakikada iptal edildi; alarm olmasaydı fatura ay sonunda fark edilecekti.
Vaka 2 — Sessiz kalite drift'i. Bir destek asistanının doğrulama geçme oranı üç haftada %95'ten %80'e sessizce düştü. Haftalık örnekleme bunu yakaladı; neden, müşterilerin yeni bir ürün hattı hakkında soru sormaya başlaması ve modelin bu konuda bilgi tabanının eksik olmasıydı. Bilgi tabanı güncellenince oran toparlandı.
Vaka 3 — Jailbreak dalgası erken görüldü. Bir asistana yapılan injection denemeleri bir günde saatte 2'den 40'a çıktı. Güvenlik alarmı tetiklendi; bir forumda sistemi kırma "tarifi" paylaşıldığı görüldü. Ekip savunma promptunu güncelledi ve şüpheli hesapları hız-sınırladı; dalga gerçek bir sızıntıya dönüşmeden söndü.
İpucu: Sadece makine metrikleriyle yetinmeyin. Kalite drift'ini çoğu zaman yalnızca bir insanın örnek çıktıları okuması yakalar. Haftada 15-20 rastgele çıktıyı gözden geçiren küçük bir rutin, en pahalı sessiz arızaları erken yakalar.
Sık yapılan hatalar
- Üretime alıp izleme kurmamak ("çalışıyor, tamam").
- Temel çizgi (baseline) ölçmeden anomaliyi tanımlayamamak.
- Yalnızca "ayakta mı" bakıp kalite drift'ini kaçırmak.
- Çıktı kalitesini hiç insan gözüyle örneklememek.
- Alarm kurmayıp sorunu müşteriden/denetçiden öğrenmek.
- İzleme bulgularını iyileştirmeye bağlamamak (geri besleme döngüsü yok).
Özetle
- AI sistemleri sessizce kötüleşebilir; en tehlikeli arıza hata fırlatmayan, yalnızca kalitesi düşen arızadır.
- Dört sinyal ailesini izleyin: kullanım/maliyet, güvenlik, kalite/drift ve performans.
- Drift (girdi veya çıktı kalitesinin zamanla kayması) yalnızca bir temel çizgiye kıyasla yakalanır.
- Makine metriklerine ek olarak düzenli insan örneklemesi kalite drift'ini yakalar.
- İzlemeyi alarm ve geri besleme döngüsüne bağlayın; ölçüp bakmamak izleme değildir.
Uygulama görevi
Kendi AI sisteminiz için dört sinyal ailesinden en az birer metrik seçin ve mevcut (veya tahmini) temel çizgilerini yazın. Her metrik için bir alarm eşiği tanımlayın. Ardından son dönem çıktılarınızdan 15 tanesini alıp yukarıdaki örnekleme promptuyla puanlayın; "kötü" oranını not edin. Bu, ileride drift'i karşılaştıracağınız ilk temel çizginiz olsun.
Kontrol listesi
- [ ] Dört sinyal ailesinden metrikler tanımladım (kullanım, güvenlik, kalite, performans).
- [ ] Her metrik için temel çizgi ve alarm eşiği belirledim.
- [ ] Çıktı kalitesini düzenli olarak insan gözüyle örnekliyorum.
- [ ] Bir gösterge paneliyle sinyalleri tek ekranda izliyorum.
- [ ] Anomali ve jailbreak dalgaları için alarm güvenlik ekibine gidiyor.
- [ ] İzleme bulgularını prompt/kontrol iyileştirmesine bağlıyorum.