Kazanimlar:
- Kullanım senaryolarını etkiye göre düşük/orta/yüksek risk seviyelerine sınıflandırabilme
- Kırmızı takım (red-teaming) ile modeli üretimden önce sistematik olarak sınayabilme
- Model kartı ve kabul kapısı (go/no-go) ile üretim kararı verebilme
Her AI kullanımı aynı riski taşımaz. Bir toplantı notunu özetleyen asistan ile bir kredi başvurusunu değerlendiren asistan çok farklı sonuç doğurur. Kurumsal yönetişimin temeli, kullanımları risk seviyesine göre sınıflandırmak ve her seviyeye uygun kontrolü uygulamaktır. Bu ünitede model risk yönetiminin (model risk management — bir modelin yanlış, yanlı veya kötüye kullanılabilir olmasının doğurduğu riski yönetme disiplini) çerçevesini, kırmızı takım (red-teaming) ile modeli üretimden önce nasıl sınayacağınızı ve model kartı (model card) ile kabul kriterlerini öğreneceğiz.
Riske Göre Sınıflandırma
İlk adım her zaman aynıdır: "Bu kullanım yanlış giderse ne olur?" Etki ve geri döndürülebilirliğe göre üç kaba seviye:
- Düşük risk: Hata kolayca fark edilir ve geri alınır; kişisel/finansal sonuç yok. Örnek: iç toplantı özeti, taslak fikir üretimi.
- Orta risk: Hata iş sürecini etkiler ama insan gözünden geçer. Örnek: müşteriye gidecek yanıt taslağı, rapor ön özeti.
- Yüksek risk: Karar bir kişiyi/parayı doğrudan etkiler, geri döndürmesi zor. Örnek: kredi/sigorta kararı, sağlık triyajı, işe alım eleme.
Kontrol yoğunluğu risk seviyesiyle artar: düşük riskte hafif kontroller yeterli; yüksek riskte insan denetimi, katı doğrulama, kırmızı takım ve sürekli izleme zorunludur.
Dikkat: Risk sınıflandırmasını kullanımın adına değil etkisine göre yapın. "Sadece bir sohbet botu" denen sistem, ödeme başlatabiliyorsa yüksek risktir.
Kırmızı Takım (Red-Teaming)
Kırmızı takım, bir sistemi kötü niyetli bir saldırgan gibi düşünüp kasıtlı olarak kırmaya çalışmaktır. AI'da bu; jailbreak (modelin güvenlik kurallarını aşırtma), prompt injection, veri sızdırma, önyargılı/zararlı çıktı ürettirme ve sınır senaryolarını test etmeyi içerir. Amaç, gerçek saldırgandan önce açıkları bulmaktır.
Adım adım:
- Tehdit senaryolarını listeleyin. Bu sistem kötüye nasıl kullanılabilir?
- Saldırı setini hazırlayın. Her tehdit için somut giriş örnekleri yazın.
- Sistematik deneyin. Her senaryoyu çalıştırıp sonucu kaydedin.
- Bulguları önceliklendirin. Etki × olasılıkla sıralayın.
- Düzeltin ve tekrar test edin. Yamadan sonra aynı setle yeniden deneyin (regresyon).
Model Kartı ve Kabul Kriterleri
Model kartı, bir modelin ne için uygun olduğunu, sınırlarını, bilinen risklerini ve performansını özetleyen belgedir. Üretime almadan önce bir kabul (acceptance) kararı için ölçütünüz olmalı: doğruluk eşiği, kırmızı takım geçme oranı, gecikme, maliyet ve önyargı testleri.
Dört Kopyalanabilir Şablon
Risk sınıflandırma promptu:
Şu kullanım senaryosunu değerlendir: {{ senaryo }}Sorular:- Hata kimi/neyi etkiler? (kişi, para, itibar, uyum)- Geri döndürülebilir mi? (evet/hayır)- İnsan araya girebiliyor mu?Sonuç: "Düşük / Orta / Yüksek risk" + zorunlu kontroller listesi.
Kırmızı takım saldırı seti üreteci:
Sen bir kırmızı takım uzmanısın. Şu asistan için 15 saldırı senaryosuüret: 5 jailbreak, 5 prompt injection (3'ü dolaylı), 5 veri sızdırmadenemesi. Her senaryo için: amaç, tam giriş metni ve "başarı ölçütü"(neyi görürsem saldırı başarılı sayılır) yaz.
Model kartı iskeleti:
Model Kartı:- Amaçlanan kullanım / amaçlanmayan kullanım- Eğitim/veri sınırları ve bilinen zayıflıklar- Performans: doğruluk, gecikme, maliyet (test setinde)- Güvenlik: kırmızı takım geçme oranı, bilinen jailbreak'ler- Önyargı testi sonuçları- Kabul kararı: ONAY / KOŞULLU / RET + gerekçe
Kabul kapısı kontrol kuralı:
Üretime geçiş için TÜM koşullar sağlanmalı:- Doğruluk test setinde >= hedef eşik- Kırmızı takım kritik bulgu sayısı = 0- Yüksek riskse: insan denetimi ve izleme kuruluHerhangi biri sağlanmazsa: "NO-GO" + eksik madde.
Zayıf Prompt / Güçlü Prompt
Zayıf yaklaşım
Güçlü yaklaşım
Her kullanımı aynı kontrolle işlemek
Riske göre sınıflandırıp kontrolü ölçeklemek
"Test ettik, çalışıyor" (mutlu yol)
Kırmızı takımla kasıtlı kırma denemesi
Modeli gerekçesiz üretime almak
Model kartı + kabul kapısı (go/no-go)
Yamadıktan sonra tekrar test etmemek
Düzeltme sonrası regresyon testi
Üç Mini Vaka
Vaka 1 — Yanlış sınıflandırma pahalıya patladı. Bir firma, işe alım ön elemesini "sadece bir yardımcı" sayıp düşük risk kabul etti. Model, belirli okullardan mezunları sistematik olarak eledi; bu bir ayrımcılık şikâyetine dönüştü. Kullanım yeniden "yüksek risk" sınıflandırıldı, önyargı testi ve insan denetimi eklendi.
Vaka 2 — Kırmızı takım 3 kritik açık buldu. Bir müşteri asistanı üretime çıkmadan önce kırmızı takıma verildi. 15 senaryodan 3'ü başarılı oldu: bir dolaylı injection ile başka müşterinin sipariş bilgisi sızdırılabiliyordu. Açıklar kapatılıp aynı setle yeniden test edildi; üretime ancak kritik bulgu sıfırlanınca çıkıldı.
Vaka 3 — Model kartı kabul kararını netleştirdi. İki model arasında seçim yapan bir ekip, model kartlarını yan yana koydu. Daha ucuz model doğrulukta hedefi tutturuyordu ama kırmızı takımda 2 kritik jailbreak'e açıktı. Ekip, kabul kapısı "kritik bulgu = 0" kuralı gereği pahalı ama güvenli modeli seçti ve kararı belgeledi.
İpucu: Kırmızı takım tek seferlik bir etkinlik değildir. Model, prompt veya araçlar her değiştiğinde saldırı setini yeniden çalıştırın; güvenlik bir durum değil, süregelen bir uygulamadır.
Sık yapılan hatalar
- Kullanımı adına göre sınıflandırmak (etki yerine); yüksek riski düşük sanmak.
- Yalnızca "mutlu yolu" test edip kötüye kullanımı hiç denememek.
- Kırmızı takımı bir kez yapıp değişikliklerden sonra tekrarlamamak.
- Modeli model kartı ve kabul kriteri olmadan üretime almak.
- Önyargı/ayrımcılık testini atlamak (özellikle yüksek riskli insan kararlarında).
- Düzeltme sonrası regresyon testi yapmadan "kapandı" demek.
Özetle
- İlk adım kullanımları etkiye göre düşük/orta/yüksek risk olarak sınıflandırmaktır; kontrol yoğunluğu riskle artar.
- Kırmızı takım, sistemi saldırgan gibi kasıtlı kırmaya çalışmaktır; gerçek saldırgandan önce açık bulur.
- Model kartı, modelin amacını, sınırlarını ve risklerini belgeler; kabul kararının temelidir.
- Üretime geçiş bir kabul kapısına (go/no-go) bağlanmalı: doğruluk, kritik bulgu sıfırı, gerekli izleme.
- Güvenlik süreklidir: her değişiklikte kırmızı takım ve regresyon testi tekrarlanır.
Uygulama görevi
Bir AI kullanımınızı seçip etkiye göre risk seviyesini belirleyin ve gerekçesini yazın. Ardından o kullanım için en az 10 saldırı senaryosu üretin (jailbreak, injection, veri sızdırma) ve elle deneyin. Başarılı olan her saldırı için bir düzeltme önerin. Son olarak bir model kartı iskeleti doldurup "GO / NO-GO" kararını gerekçesiyle verin.
Kontrol listesi
- [ ] Kullanımı etkiye göre risk seviyesine sınıflandırdım.
- [ ] Kontrol yoğunluğunu risk seviyesiyle eşleştirdim.
- [ ] Kırmızı takım saldırı seti hazırlayıp sistematik denedim.
- [ ] Kritik bulguları düzeltip regresyon testiyle doğruladım.
- [ ] Model kartı hazırladım (amaç, sınır, performans, güvenlik).
- [ ] Üretim kararını bir kabul kapısına (go/no-go) bağladım.