Unit 2 / 11

Token dan Logik Harga

Keuntungan:

  • Terangkan konsep token, pembezaan token input/output dan tokenisasi.
  • Boleh mengira kos permintaan dan beban kerja bulanan daripada bilangan token dan harga unit
  • Boleh membandingkan kesan pemilihan model dan panjang segera pada kos

Anda tidak boleh membina penyelesaian secara berskala tanpa memahami ekonomi API LLM. Demo dijalankan sekali; Perkara utama ialah dapat meramalkan jumlah bil apabila beribu-ribu panggilan dibuat setiap bulan. Dalam unit ini, kami menyediakan bahagian wang: apakah itu token, sebab input dan output diberi harga yang berbeza, cara mengira kos permintaan dan cara membuat belanjawan beban kerja bulanan. Maklumat ini membolehkan anda mengukur pulangan teknik pengoptimuman (caching, pemilihan model, kelompok) dalam unit berikutnya.

Apa itu Token?

Token ialah unit terkecil di mana model memproses teks. Sepatah perkataan tidak selalu menjadi tanda; token biasanya merupakan sebahagian daripada perkataan. Secara kasarnya, dalam bahasa Inggeris, 1 token ialah ≈ 4 aksara ≈ 0.75 perkataan. Dalam bahasa Turki dan kod, nisbahnya berbeza-beza: Perkataan Turki sering dibahagikan kepada lebih banyak token berbanding dalam bahasa Inggeris kerana struktur akhiran dan abjadnya. Oleh itu, adalah perlu untuk mengukur bilangan token dengan alat mengira token pembekal dan bukannya meneka dengan mata.

Tokenisasi (proses pemisahan teks kepada token) mungkin berbeza untuk setiap model. Ini mempunyai dua akibat praktikal: (1) Teks yang sama mungkin menghasilkan bilangan token yang berbeza dalam model yang berbeza; (2) Ramalan yang dibuat dengan tokenizer daripada penyedia lain (cth. perpustakaan tiktoken OpenAI) akan menjadi tidak tepat untuk Claude — gunakan petua mengira token untuk model yang anda gunakan.

Petunjuk: "Mengenai berapa banyak token?" Jangan jawab soalan secara membabi buta. Lulus teks perwakilan melalui API pengiraan token; Dasar keputusan belanjawan pada pengukuran.

Token Input dan Output

Invois terdiri daripada dua item:

  • Token input: Apa sahaja yang anda hantar ke model — gesaan sistem, lawatan lepas, mesej pengguna, dokumentasi jika ada. Ini diproses sekaligus.
  • Token output: Respons yang dihasilkan oleh model. Untuk setiap token output, model melakukan pengiraan langkah demi langkah.

Dengan kebanyakan pembekal, output adalah beberapa kali lebih mahal daripada input. Sebabnya mudah: membaca input sekaligus adalah lebih murah daripada menghasilkan token demi token output. Mengetahui asimetri ini menjelaskan mengapa pengoptimuman seperti "memerlukan jawapan ringkas" sangat berkesan.

Harga sampel (setiap 1 juta token, USD)

Jadual di bawah adalah rujukan; Harga mungkin berubah dari semasa ke semasa, sila sahkan senarai semasa pembekal anda sendiri.

kelas model

contoh model

Input ($/1J)

Output ($/1J)

Penggunaan biasa

cepat/murah

Haiku 4.5

1.00

5.00

Pengelasan, pelabelan, ringkasan mudah

seimbang

soneta 5

3.00

15.00

Tujuan umum, pengekodan, kerja ejen

kuat

Opus 4.8

5.00

25.00

Penaakulan yang kompleks, tugas jangka panjang

Dalam setiap kelas, output adalah 5 kali input; Lebih-lebih lagi, walaupun input model berkuasa adalah 5 kali ganda input model murah. Kedua-dua paksi ini (input↔output dan kelas model) membentuk rangka kerja keputusan kos anda.

Bagaimana untuk Mengira Kos?

Formulanya mudah:

kos = (input_token / 1,000,000) × input_price + (output_token / 1,000,000) × output_price

Contoh akaun. Permintaan dengan Sonnet 5: 1,500 token input, 400 token output.

input = 1,500 / 1,000,000 × 3.00 = $0.0045 output = 400 / 1,000,000 × 15.00 = $0.0060 jumlah = $0.0105 (kira-kira 1 sen)

Satu panggilan nampak murah. Tetapi darab mengikut volum: 20,000 panggilan sehari → $210 sehari, ~$6,300 sebulan. Di sinilah skala memainkan peranan.

Templat Belanjawan Bulanan

Untuk mengekstrak kos bulanan beban kerja, gunakan templat ini:

1) Purata token input setiap permintaan: ......2) Purata token output setiap permintaan: ......3) Bilangan permintaan setiap hari: ......4) Hari bekerja sebulan: ......5) Kos setiap permintaan = (1)/1M×input_price + (2)/1M×output_price6) Kos bulanan = (5) × (3) × (4)

Menuangkan corak ini ke dalam hamparan dan melihat bagaimana jumlah itu dimainkan apabila anda menukar model merangkumi keputusan pemilihan model (unit 5) dan cache (unit 6).

Memendekkan Prompt dengan Templat Boleh Disalin

Kebanyakan kos datang daripada gesaan yang tidak perlu panjang dan pengeluaran yang sia-sia. Templat di bawah memberikan penjimatan langsung.

# Hadkan panjang output. Jawab dengan maksimum 3 item. Tambahkan ayat rasional atau pendahuluan.

# Kembalikan hanya medan yang diminta Kembalikan JSON berikut sahaja, jangan tambahkan sebarang teks lain:{"category": "...", "urgency": "low|medium|high"}

# Alih keluar konteks yang tidak perluAlih keluar hanya tarikh dan amaun daripada teks berikut. Jangan ulangi keseluruhan teks.Teks: """{{teks}}"""

# Ringkaskan ucapan yang panjang (penjimatan input) Ringkaskan ucapan ini dalam 5 perkara. Saya akan menggunakan ringkasan ini dan bukannya masa lalu penuh dalam pusingan seterusnya. Ucapan: """{{past}}"""

Gesaan lemah / Gesaan kuat (dari segi kos)

# LEMAH (mengeluarkan output, mahal)Analisis permintaan sokongan ini dan tulis ulasan komprehensif kepada saya.

# KUAT (mengekang output, murah dan boleh diramal) Klasifikasikan permintaan sokongan ini. Hanya kembalikan JSON berikut:{"category":"invois|teknikal|bayaran balik|lain","kedekatan":"rendah|sederhana|tinggi"}Jangan tulis perihalan.

Versi lemah menghasilkan mungkin 500 token keluaran; versi kuat ~15. Oleh kerana output adalah mahal, ini merupakan perbezaan yang ketara bagi setiap panggilan dan berganda dengan volum.

Tiga Kes Mini

Kes 1 — Kos tersembunyi bagi gesaan panjang. Apabila automasi perakaunan mengisih setiap invois, ia menambahkan "buku peraturan" 40 halaman sebagai input kepada setiap permintaan: ~12,000 token input setiap permintaan. Dengan Sonnet 5 12,000/1M×3 = $0.036 baru sahaja masuk. 5,000 bil sehari → $180 sehari. Dengan meng-cache buku peraturan (unit 6) kos input menurun sebanyak ~90%.

Kes 2 — Hasil mengecilkan model. Satu pasukan melakukan penandaan sentimen "positif/negatif" mudah dengan Opus 4.8: 300 input + 10 token output. Kos Opus 300/1M×5 + 10/1M×25 = $0.00175. Beralih kepada Haiku, 300/1M×1 + 10/1M×5 = $0.00035 — 5x lebih murah, perbezaan dalam ketepatan tidak boleh diukur. Pada 3 juta panggilan sebulan, perbezaannya ialah $5,250 → $1,050.

Kes 3 — Melepaskan output. Apabila pasukan pemasaran menghasilkan penerangan produk, ia tidak menetapkan had pada output; model itu kadang-kadang berkata 1,500 token. Apabila saya menambah arahan "maksimum 60 perkataan", output purata menurun daripada 900 kepada 90 token. Memandangkan percetakan mahal, bil bulanan dikurangkan sebanyak satu pertiga, dan teks menjadi lebih berguna.

Kesilapan biasa

  • Meneka token dengan mata: Anda boleh tersilap terutamanya dalam bahasa Turki dan kod. ukur.
  • Dengan mengandaikan input dan output adalah sama: Output biasanya jauh lebih mahal; Kebanyakan pengoptimuman datang daripada memendekkan output.
  • Jangan tertipu dengan murahnya satu panggilan: Keputusan dibuat mengikut kelantangan. $0.01 × juta = $10,000.
  • Ramalan dengan tokenizer penyedia lain: Memberikan hasil yang salah; Gunakan alat mengira token model.
  • Pembesaran tanpa had sejarah perbualan: Setiap pusingan ditambah pada entri; rumuskan dalam perbualan yang panjang.
  • Mengekalkan `maks_tokens` tidak semestinya tinggi: Menyembunyikan pelan belanjawan dan risiko dipotong; Berikan nilai yang realistik.

Lebih Dalam: Tetingkap Konteks dan Kos Input Panjang

Adalah penting untuk melihat bagaimana harga disusun "merentasi perbualan" dan bukan hanya "setiap permintaan." Jumlah keseluruhan teks yang model boleh proses dipanggil tetingkap konteks; Jumlah input dan output mesti dimuatkan ke dalam tetingkap ini. Model moden menawarkan tingkap yang sangat besar (ratusan ribu, malah berjuta-juta token), tetapi itu tidak bermakna anda boleh "mengisinya tanpa terhingga" — apa sahaja yang anda masukkan ke dalam tetingkap dibilkan sebagai input.

Perangkap dalam perbualan yang panjang adalah ini: dengan setiap pusingan baharu anda menghantar keseluruhan sejarah sekali lagi (ketidaknegaraan dalam unit 1). Dalam perbualan 20 pusingan, permintaan ke-20 membawa keseluruhan 19 pusingan pertama sebagai input. Oleh itu, apabila perbualan menjadi lebih panjang, kos setiap permintaan meningkat secara kumulatif dan bukannya linear. Perbualan 50 pusingan dengan pembantu ejen boleh menghasilkan kos input berpuluh-puluh kali ganda pada pusingan pertama.

Terdapat dua cara untuk menguruskan ini. Yang pertama ialah rekap semula: memampatkan pusingan lama ke dalam blok rekap tunggal, mengekalkan hanya beberapa pusingan terakhir mentah. Yang kedua ialah caching segera (unit 6): membaca konteks tetap pada sepersepuluh daripada harga dan bukannya memprosesnya berulang kali pada harga penuh. Bersama-sama, mereka mengurangkan dengan ketara bil pada beban kerja yang panjang dan intensif konteks. Jadi ekonomi token adalah mengenai reka bentuk keseluruhan sesi, bukan satu permintaan.

Secara ringkasnya

Token ialah unit terkecil di mana teks diproses; input dan output berharga secara berasingan, dan output selalunya jauh lebih mahal. Kos ialah bilangan token didarab dengan harga unit, dan keputusan sebenar dibuat mengikut volum. Memendekkan gesaan, mengehadkan output, dan memilih model paling ringan yang menyelesaikan tugas adalah tuil paling langsung yang mengurangkan kos berkali-kali ganda.

Tugasan permohonan

Pilih tugas anda sendiri. (1) Tentukan bilangan token input dan anggaran output untuk gesaan perwakilan (ukur dengan alat mengira token jika boleh). (2) Kira kos setiap permintaan untuk tiga kelas model. (3) Anggarkan bilangan permintaan harian anda dan dapatkan belanjawan bulanan untuk ketiga-tiga model tersebut. (4) Tambah arahan untuk memendekkan output dan perhatikan penjimatan yang dijangkakan.

senarai semak

  • [ ] Saya boleh menerangkan konsep token dan tokenisasi itu berbeza-beza bergantung pada model.
  • [ ] Saya tahu sebab token input dan output diberi harga secara berbeza.
  • [ ] Saya boleh mengira kos permintaan dengan formula.
  • [ ] Saya boleh membuat belanjawan bulanan untuk beban kerja menggunakan templat.
  • [ ] Saya boleh menunjukkan dengan contoh faedah memendekkan output dan pengurangan model.