Satuan 2 / 11

Logika Token dan Harga

Keuntungan:

  • Jelaskan konsep token, pembedaan token input/output, dan tokenisasi.
  • Dapat menghitung biaya permintaan dan beban kerja bulanan dari jumlah token dan harga satuan
  • Dapat membandingkan dampak pemilihan model dan durasi prompt terhadap biaya

Anda tidak dapat membangun solusi dalam skala besar tanpa memahami keekonomian LLM API. Demo berjalan satu kali; Yang penting bisa memprediksi berapa tagihannya ketika ribuan panggilan dilakukan per bulan. Dalam unit ini kita mengatur sisi uang: apa itu token, mengapa harga input dan output berbeda, bagaimana menghitung biaya permintaan, dan bagaimana menganggarkan beban kerja bulanan. Informasi ini memungkinkan Anda mengukur pengembalian teknik pengoptimalan (caching, pemilihan model, batch) di unit berikutnya.

Apa itu Token?

Token adalah unit terkecil tempat model memproses teks. Sebuah kata tidak selalu merupakan tanda; token biasanya merupakan bagian dari sebuah kata. Secara kasar, dalam bahasa Inggris, 1 token adalah ≈ 4 karakter ≈ 0,75 kata. Dalam bahasa Turki dan kode, rasionya bervariasi: Kata-kata Turki sering kali dibagi menjadi lebih banyak token dibandingkan bahasa Inggris karena struktur sufiks dan alfabetnya. Oleh karena itu, perlu dilakukan pengukuran jumlah token dengan alat penghitung token milik penyedia daripada menebak-nebak secara langsung.

Tokenisasi (proses pemisahan teks menjadi token) mungkin berbeda untuk setiap model. Hal ini mempunyai dua konsekuensi praktis: (1) Teks yang sama mungkin menghasilkan jumlah token yang berbeda dalam model yang berbeda; (2) Prediksi yang dibuat dengan tokenizer dari penyedia lain (misalnya perpustakaan tiktoken OpenAI) tidak akan akurat untuk Claude — gunakan tip penghitungan token untuk model yang Anda gunakan.

Petunjuk: "Berapa banyak tokennya?" Jangan menjawab pertanyaan secara membabi buta. Meneruskan teks representatif melalui API penghitungan token; Dasarkan keputusan anggaran pada pengukuran.

Token Masukan dan Keluaran

Faktur terdiri dari dua item:

  • Token masukan: Apa pun yang Anda kirim ke model — perintah sistem, tur sebelumnya, pesan pengguna, dokumentasi jika ada. Ini diproses sekaligus.
  • Token keluaran: Respons yang dihasilkan oleh model. Untuk setiap token keluaran, model melakukan penghitungan langkah demi langkah.

Pada sebagian besar penyedia layanan, outputnya beberapa kali lebih mahal daripada input. Alasannya sederhana: membaca masukan sekaligus lebih murah dibandingkan menghasilkan keluaran token demi token. Mengetahui asimetri ini menjelaskan mengapa pengoptimalan seperti “memerlukan jawaban ringkas” sangat efektif.

Harga sampel (per 1 juta token, USD)

Tabel di bawah ini merupakan referensi; Harga dapat berubah seiring waktu, harap konfirmasikan sendiri daftar penyedia Anda saat ini.

kelas teladan

model sampel

Masukan ($/1 juta)

Keluaran ($/1 juta)

Penggunaan yang umum

cepat/murah

Haiku 4.5

1,00

5.00

Klasifikasi, pelabelan, ringkasan sederhana

seimbang

soneta 5

3.00

15.00

Tujuan umum, pengkodean, pekerjaan agen

kuat

Karya 4.8

5.00

25.00

Penalaran yang kompleks, tugas jangka panjang

Di setiap kelas, keluarannya 5 kali lipat masukan; Terlebih lagi, masukan dari model yang kuat pun 5 kali lipat dari masukan model yang murah. Kedua sumbu ini (input↔output dan kelas model) membentuk kerangka keputusan biaya Anda.

Bagaimana Menghitung Biaya?

Rumusnya sederhana:

biaya = (token_input / 1.000.000) × harga_input + (token_output / 1.000.000) × harga_output

Contoh akun. Permintaan dengan Soneta 5: 1.500 token masukan, 400 token keluaran.

masukan = 1.500 / 1.000.000 × 3,00 = $0,0045 keluaran = 400 / 1.000.000 × 15,00 = $0,0060 total = $0,0105 (sekitar 1 sen)

Satu panggilan terlihat murah. Namun kalikan dengan volume: 20.000 panggilan per hari → $210 per hari, ~$6.300 per bulan. Di sinilah skala berperan.

Templat Anggaran Bulanan

Untuk mengekstrak biaya bulanan suatu beban kerja, gunakan templat ini:

1) Rata-rata token input per permintaan: ......2) Rata-rata token output per permintaan: ......3) Jumlah permintaan per hari: ......4) Hari kerja per bulan: ......5) Biaya per permintaan = (1)/1M×input_price + (2)/1M×output_price6) Biaya bulanan = (5) × (3) × (4)

Menuangkan pola ini ke dalam spreadsheet dan melihat bagaimana penjumlahannya saat Anda mengubah model merupakan perwujudan keputusan pemilihan model (unit 5) dan cache (unit 6).

Memperpendek Prompt dengan Templat yang Dapat Disalin

Sebagian besar biaya berasal dari permintaan yang terlalu lama dan hasil yang terbuang. Templat di bawah ini memberikan penghematan langsung.

# Batasi panjang keluaran. Jawab dengan maksimal 3 item. Tambahkan alasan atau kalimat pengantar.

# Kembalikan hanya kolom yang diminta Kembalikan JSON berikut saja, jangan tambahkan teks lain:{"category": "...", "urgency": "low|medium|high"}

# Hapus konteks yang tidak perluHapus hanya tanggal dan jumlah dari teks berikut. Jangan ulangi keseluruhan teks. Teks: """{{teks}}"""

# Ringkaslah pidato yang panjang (input saving) Ringkaslah pidato ini dalam 5 item. Saya akan menggunakan ringkasan ini alih-alih keseluruhan masa lalu di babak berikutnya. Pidato: """{{masa lalu}}"""

Prompt lemah / Prompt kuat (dalam hal biaya)

# LEMAH (rilis keluaran, mahal) Analisis permintaan dukungan ini dan tuliskan ulasan komprehensif untuk saya.

# KUAT (membatasi keluaran, murah dan dapat diprediksi) Klasifikasikan permintaan dukungan ini. Cukup kembalikan JSON berikut:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Jangan tulis deskripsi.

Versi lemah mungkin menghasilkan 500 token keluaran; versi kuat ~15. Karena keluarannya mahal, perbedaan ini signifikan per panggilan dan berlipat ganda seiring dengan volume.

Tiga Kasus Mini

Kasus 1 - Biaya tersembunyi dari permintaan jangka panjang. Saat otomatisasi akuntansi mengurutkan setiap faktur, ia menambahkan “buku peraturan” setebal 40 halaman sebagai masukan untuk setiap permintaan: ~12.000 token masukan per permintaan. Dengan Soneta 5 12,000/1M×3 = $0,036 baru saja masuk. 5.000 tagihan per hari → $180 per hari. Dengan menyimpan buku aturan (unit 6) dalam cache, biaya input turun ~90%.

Kasus 2 — Manfaat dari perampingan model. Satu tim melakukan penandaan sentimen “positif/negatif” sederhana dengan Opus 4.8: 300 input + 10 token output. Harga Opus 300/1M×5 + 10/1M×25 = $0,00175. Beralih ke Haiku, 300/1M×1 + 10/1M×5 = $0,00035 — 5x lebih murah, perbedaan akurasinya tidak dapat diukur. Pada 3 juta panggilan per bulan, selisihnya adalah $5.250 → $1.050.

Kasus 3 — Melepaskan output. Ketika tim pemasaran menghasilkan deskripsi produk, mereka tidak menetapkan batasan pada output; modelnya terkadang mengatakan 1.500 token. Ketika saya menambahkan instruksi "maksimum 60 kata", keluaran rata-rata turun dari 900 menjadi 90 token. Karena biaya pencetakan mahal, tagihan bulanan berkurang sepertiganya, dan SMS menjadi lebih berguna.

Kesalahan umum

  • Menebak token dengan mata: Anda bisa saja salah terutama dalam bahasa Turki dan kode. Ukuran.
  • Dengan asumsi input dan output sama: Output biasanya jauh lebih mahal; Sebagian besar pengoptimalan berasal dari pemendekan keluaran.
  • Jangan tertipu oleh murahnya satu panggilan telepon: Keputusan dibuat berdasarkan volume. $0,01 × juta = $10.000.
  • Prediksi dengan tokenizer penyedia lain: Memberikan hasil yang salah; Gunakan alat penghitungan token model.
  • Pembesaran riwayat percakapan tanpa batas: Setiap putaran ditambahkan ke entri; rangkum dalam percakapan panjang.
  • Menjaga `max_tokens` terlalu tinggi: Menyembunyikan rencana anggaran dan risiko pemotongan; Berikan nilai yang realistis.

Lebih Dalam: Jendela Konteks dan Biaya Masukan yang Panjang

Penting untuk melihat bagaimana harga naik "di seluruh percakapan" dan bukan hanya "per permintaan". Jumlah total teks yang dapat diproses oleh model disebut jendela konteks; Jumlah input dan output harus sesuai dengan jendela ini. Model modern menawarkan jendela yang sangat besar (ratusan ribu, bahkan jutaan token), namun itu tidak berarti Anda dapat "mengisinya tanpa batas" — apa pun yang Anda masukkan ke dalam jendela akan ditagih sebagai masukan.

Jebakan dalam percakapan yang panjang adalah ini: dengan setiap babak baru Anda mengirimkan seluruh riwayat lagi (tanpa kewarganegaraan di unit 1). Dalam percakapan 20 putaran, permintaan ke-20 membawa seluruh 19 putaran pertama sebagai masukan. Jadi, seiring bertambahnya waktu percakapan, biaya per permintaan meningkat secara kumulatif, bukan secara linier. Percakapan 50 putaran dengan asisten agen dapat menghasilkan biaya masukan puluhan kali lipat dari putaran pertama.

Ada dua cara untuk mengelola ini. Yang pertama adalah rekap: mengompresi putaran lama menjadi satu blok rekap, hanya menyisakan beberapa putaran terakhir saja. Yang kedua adalah caching cepat (unit 6): membaca konteks tetap dengan sepersepuluh harga daripada memprosesnya berulang kali dengan harga penuh. Bersama-sama, keduanya secara signifikan mengurangi beban kerja yang panjang dan intensif konteks. Jadi token economics adalah tentang desain keseluruhan sesi, bukan satu permintaan saja.

Singkatnya

Token adalah unit terkecil tempat teks diproses; input dan output dihargai secara terpisah, dan output seringkali jauh lebih mahal. Biayanya adalah jumlah token dikalikan dengan harga satuan, dan keputusan sebenarnya dibuat berdasarkan volume. Mempersingkat waktu, membatasi output, dan memilih model paling ringan yang menyelesaikan tugas adalah cara paling langsung yang mengurangi biaya berkali-kali lipat.

Tugas aplikasi

Pilih tugas Anda sendiri. (1) Tentukan jumlah token masukan dan perkiraan keluaran untuk prompt representatif (ukur dengan alat penghitung token jika memungkinkan). (2) Hitung biaya per permintaan untuk tiga kelas model. (3) Perkirakan jumlah permintaan harian Anda dan dapatkan anggaran bulanan untuk ketiga model tersebut. (4) Tambahkan instruksi untuk mempersingkat output dan catat penghematan yang diharapkan.

daftar periksa

  • [ ] Saya dapat menjelaskan konsep token dan tokenisasi bervariasi tergantung modelnya.
  • [] Saya tahu mengapa token input dan output diberi harga berbeda.
  • [ ] Saya dapat menghitung biaya permintaan dengan rumus.
  • [ ] Saya dapat membuat anggaran bulanan untuk suatu beban kerja menggunakan templat.
  • [ ] Saya dapat menunjukkan dengan sebuah contoh manfaat memperpendek keluaran dan pengurangan model.