Kazanimlar:
- Token kavramını, girdi/çıktı token ayrımını ve tokenizasyonu açıklayabilir
- Bir isteğin ve aylık bir iş yükünün maliyetini token sayısı ve birim fiyattan hesaplayabilir
- Model seçiminin ve prompt uzunluğunun maliyet üzerindeki etkisini karşılaştırabilir
LLM API'lerinin ekonomisini anlamadan ölçekli bir çözüm kuramazsınız. Bir demo bir kez çalışır; asıl mesele, ayda binlerce çağrı yapıldığında faturanın ne olacağını önceden kestirebilmektir. Bu ünitede işin para tarafını kuruyoruz: token nedir, girdi ve çıktı neden farklı fiyatlanır, bir isteğin maliyeti nasıl hesaplanır ve aylık bir iş yükünün bütçesi nasıl çıkarılır. Bu bilgi, ilerleyen ünitelerdeki optimizasyon tekniklerinin (önbellek, model seçimi, batch) getirisini ölçmenizi sağlar.
Token Nedir?
Token, modelin metni işlediği en küçük birimdir. Bir kelime her zaman bir token değildir; token genellikle bir kelime parçasıdır. Kabaca İngilizcede 1 token ≈ 4 karakter ≈ 0,75 kelimedir. Türkçede ve kodda oran değişir: Türkçe kelimeler, ekli yapısı ve alfabesi nedeniyle çoğu zaman İngilizceden daha fazla token'a bölünür. Bu yüzden token sayısını göz kararı tahmin etmek yerine sağlayıcının token sayma aracıyla ölçmek gerekir.
Tokenizasyon (metni token'lara bölme işlemi) her modelde farklı olabilir. Bunun iki pratik sonucu vardır: (1) Aynı metin farklı modellerde farklı token sayısı verebilir; (2) Başka sağlayıcıların tokenizerlarıyla (ör. OpenAI'ın tiktoken kütüphanesi) yapılan tahminler Claude için yanlış olur — kullandığınız modele ait token sayma ucunu kullanın.
İpucu: "Yaklaşık kaç token?" sorusuna göz kararı cevap vermeyin. Temsili bir metni token sayma API'sinden geçirin; bütçe kararlarını ölçüme dayandırın.
Girdi ve Çıktı Token'ları
Fatura iki kalemden oluşur:
- Girdi token'ları (input): Modele gönderdiğiniz her şey — sistem promptu, geçmiş turlar, kullanıcı mesajı, varsa dokümanlar. Bunlar bir kerede işlenir.
- Çıktı token'ları (output): Modelin ürettiği yanıt. Her çıktı token'ı için model adım adım hesaplama yapar.
Çoğu sağlayıcıda çıktı, girdiden birkaç kat pahalıdır. Sebep basittir: girdiyi bir kerede okumak, çıktıyı token-token üretmekten daha ucuzdur. Bu asimetriyi bilmek, "kısa ve öz yanıt iste" gibi optimizasyonların neden bu kadar etkili olduğunu açıklar.
Örnek fiyatlar (1 milyon token başına, USD)
Aşağıdaki tablo bir referanstır; fiyatlar zamanla değişebilir, kendi sağlayıcınızın güncel listesini teyit edin.
Model sınıfı
Örnek model
Girdi ($/1M)
Çıktı ($/1M)
Tipik kullanım
Hızlı/ucuz
Haiku 4.5
1,00
5,00
Sınıflandırma, etiketleme, basit özet
Dengeli
Sonnet 5
3,00
15,00
Genel amaçlı, kodlama, ajan işleri
Güçlü
Opus 4.8
5,00
25,00
Karmaşık akıl yürütme, uzun-ufuklu görevler
Her sınıfta çıktı, girdinin 5 katıdır; ayrıca güçlü modelin girdisi bile ucuz modelin girdisinin 5 katıdır. Bu iki eksen (girdi↔çıktı ve model sınıfı) maliyet kararlarınızın çatısını kurar.
Maliyet Nasıl Hesaplanır?
Formül basittir:
maliyet = (girdi_token / 1.000.000) × girdi_fiyat + (çıktı_token / 1.000.000) × çıktı_fiyat
Örnek hesap. Sonnet 5 ile bir istek: 1.500 girdi token, 400 çıktı token.
girdi = 1.500 / 1.000.000 × 3,00 = 0,0045 $çıktı = 400 / 1.000.000 × 15,00 = 0,0060 $toplam = 0,0105 $ (yaklaşık 1 sent)
Tek çağrı ucuz görünür. Ama hacimle çarpın: günde 20.000 çağrı → günlük 210 $, aylık ~6.300 $. Ölçek burada devreye girer.
Aylık Bütçe Şablonu
Bir iş yükünün aylık maliyetini çıkarmak için şu şablonu kullanın:
1) İstek başına ortalama girdi token: ......2) İstek başına ortalama çıktı token: ......3) Günlük istek sayısı: ......4) Ayda çalışılan gün: ......5) İstek başı maliyet = (1)/1M×girdi_fiyat + (2)/1M×çıktı_fiyat6) Aylık maliyet = (5) × (3) × (4)
Bu şablonu bir tabloya döküp modeli değiştirdiğinizde toplamın nasıl oynadığını görmek, model seçimi (5. ünite) ve önbellek (6. ünite) kararlarını somutlaştırır.
Prompt'u Kopyalanabilir Şablonlarla Kısaltmak
Maliyetin büyük kısmı çoğu zaman gereksiz uzun promptlardan ve serbest bırakılmış çıktılardan gelir. Aşağıdaki şablonlar doğrudan tasarruf sağlar.
# Çıktı uzunluğunu sınırlaYanıtını en fazla 3 madde ile ver. Gerekçe veya giriş cümlesi ekleme.
# Yalnızca istenen alanı döndürYalnızca aşağıdaki JSON'u döndür, başka hiçbir metin ekleme:{"kategori": "...", "aciliyet": "dusuk|orta|yuksek"}
# Gereksiz bağlamı budaAşağıdaki metinden yalnızca tarih ve tutar bilgisini çıkar. Metnin tamamını tekrar etme.Metin: """{{metin}}"""
# Uzun konuşmayı özetle (girdi tasarrufu)Bu konuşmayı 5 maddede özetle. Sonraki turlarda tam geçmiş yerine bu özeti kullanacağım.Konuşma: """{{gecmis}}"""
Zayıf prompt / Güçlü prompt (maliyet açısından)
# ZAYIF (çıktıyı serbest bırakır, pahalı)Bu destek talebini analiz et ve bana kapsamlı bir değerlendirme yaz.
# GÜÇLÜ (çıktıyı kısıtlar, ucuz ve öngörülebilir)Bu destek talebini sınıflandır. Yalnızca şu JSON'u döndür:{"kategori":"fatura|teknik|iade|diger","aciliyet":"dusuk|orta|yuksek"}Açıklama yazma.
Zayıf sürüm belki 500 çıktı token üretir; güçlü sürüm ~15. Çıktı pahalı olduğundan bu, çağrı başına ciddi bir farktır ve hacimle katlanır.
Üç Mini Vaka
Vaka 1 — Uzun promptun gizli maliyeti. Bir muhasebe otomasyonu her faturayı sınıflandırırken 40 sayfalık bir "kural kitabını" her isteğe girdi olarak ekliyordu: istek başına ~12.000 girdi token. Sonnet 5 ile 12.000/1M×3 = 0,036 $ sadece girdi. Günde 5.000 fatura → günlük 180 $. Kural kitabını önbelleğe alınca (6. ünite) girdi maliyeti ~%90 düştü.
Vaka 2 — Model küçültmenin getirisi. Bir ekip basit "olumlu/olumsuz" duygu etiketlemesini Opus 4.8 ile yapıyordu: 300 girdi + 10 çıktı token. Opus maliyeti 300/1M×5 + 10/1M×25 = 0,00175 $. Haiku'ya geçince 300/1M×1 + 10/1M×5 = 0,00035 $ — 5 kat ucuz, doğruluk farkı ölçülemez düzeydeydi. Ayda 3 milyon çağrıda fark 5.250 $ → 1.050 $.
Vaka 3 — Çıktıyı serbest bırakmak. Bir pazarlama ekibi ürün açıklaması üretirken çıktıya sınır koymamıştı; model bazen 1.500 token yazıyordu. "En fazla 60 kelime" talimatı ekleyince ortalama çıktı 900'den 90 token'a indi. Çıktı pahalı olduğundan aylık fatura üçte bire düştü, üstelik metinler daha kullanışlı oldu.
Sık yapılan hatalar
- Token'ı gözle tahmin etmek: Özellikle Türkçe ve kodda yanılırsınız. Ölçün.
- Girdi ve çıktıyı aynı sanmak: Çıktı genellikle çok daha pahalıdır; optimizasyonun çoğu çıktıyı kısaltmaktan gelir.
- Tek çağrının ucuzluğuna aldanmak: Karar hacimle verilir. 0,01 $ × milyon = 10.000 $.
- Başka sağlayıcının tokenizerıyla tahmin: Yanlış sonuç verir; modele ait token sayma aracını kullanın.
- Konuşma geçmişini sınırsız büyütmek: Her tur girdiye eklenir; uzun sohbetlerde özetleyin.
- `max_tokens`'ı gereksiz yüksek tutmak: Bütçe planını ve kesilme riskini gizler; gerçekçi bir değer verin.
Daha Derine: Bağlam Penceresi ve Uzun Girdi Maliyeti
Fiyatın yalnızca "istek başına" değil, "konuşma boyunca" nasıl biriktiğini görmek kritiktir. Modelin işleyebildiği toplam metin miktarına bağlam penceresi (context window) denir; girdi ve çıktının toplamı bu pencereye sığmalıdır. Modern modeller çok geniş pencereler sunar (yüz binlerce, hatta milyonlarca token), ama bu, "sınırsızca doldurabilirsiniz" anlamına gelmez — pencereye ne koyarsanız girdi olarak fatura edilirsiniz.
Uzun konuşmalarda tuzak şudur: her yeni turda tüm geçmişi tekrar gönderirsiniz (1. ünitedeki durumsuzluk). 20 turluk bir sohbette 20. istek, ilk 19 turun tamamını girdi olarak taşır. Böylece konuşma uzadıkça istek başına maliyet doğrusal değil, birikimli büyür. Bir müşteri temsilcisi asistanında 50 turluk bir sohbet, ilk turun onlarca katı girdi maliyeti üretebilir.
Bunu yönetmenin iki yolu vardır. Birincisi özetleme: eski turları tek bir özet bloğuna sıkıştırıp yalnızca son birkaç turu ham tutmak. İkincisi prompt önbellekleme (6. ünite): sabit bağlamı tekrar tekrar tam fiyattan işlemek yerine onda bir fiyata okumak. İkisi birlikte, uzun ve bağlam-yoğun iş yüklerinde faturayı belirgin biçimde aşağı çeker. Bu yüzden token ekonomisi, tek bir isteğin değil, tüm oturumun tasarımıyla ilgilidir.
Özetle
Token, metnin işlendiği en küçük birimdir; girdi ve çıktı ayrı fiyatlanır ve çıktı genellikle çok daha pahalıdır. Maliyet, token sayısı ile birim fiyatın çarpımıdır ve asıl karar hacimle verilir. Promptu kısaltmak, çıktıyı sınırlamak ve görevi başaran en hafif modeli seçmek, maliyeti kat kat düşüren en doğrudan kaldıraçlardır.
Uygulama görevi
Kendi bir görevinizi seçin. (1) Temsili bir prompt için girdi ve tahmini çıktı token sayısını belirleyin (mümkünse token sayma aracıyla ölçün). (2) Üç model sınıfı için istek başı maliyeti hesaplayın. (3) Günlük istek sayınızı tahmin edip aylık bütçeyi üç model için çıkarın. (4) Çıktıyı kısaltacak bir talimat ekleyip beklenen tasarrufu not edin.
Kontrol listesi
- [ ] Token kavramını ve tokenizasyonun modele göre değiştiğini açıklayabiliyorum.
- [ ] Girdi ve çıktı token'larının neden farklı fiyatlandığını biliyorum.
- [ ] Bir isteğin maliyetini formülle hesaplayabiliyorum.
- [ ] Bir iş yükünün aylık bütçesini şablonla çıkarabiliyorum.
- [ ] Çıktıyı kısaltmanın ve model küçültmenin getirisini örnekle gösterebiliyorum.