Satuan 6 / 10

Logika Penetapan Harga: Ekonomi Token dan Keseimbangan Kualitas Biaya

Keuntungan:

  • Kemampuan untuk membaca harga token input/output dan item faktur
  • Kemampuan untuk memperkirakan biaya bulanan alur kerja dengan rumus kasar
  • Menerapkan metode pemotongan biaya seperti caching, pemrosesan batch, dan pementasan model

Mampu memperkirakan berapa biaya suatu model adalah salah satu keterampilan paling praktis yang dimiliki pengambil keputusan. "Berapa yang harus saya bayar setiap bulannya?" Jika Anda tidak dapat menjawab pertanyaan tersebut, Anda tidak dapat merencanakan anggaran atau memilih tingkat yang tepat. Kabar baiknya adalah penetapan harga lebih sederhana daripada kedengarannya, dan setelah Anda memahaminya, Anda dapat membuat perkiraan kasarnya sendiri. Dalam unit ini, Anda akan mempelajari cara membaca harga token input/output, memperkirakan biaya bulanan alur kerja dengan rumus sederhana, dan metode yang benar-benar mengurangi biaya.

Aturan praktisnya: Input dan output diberi harga secara terpisah

Dalam model bobot tertutup, harga dihitung berdasarkan jumlah token yang diproses dan terdapat dua item terpisah:

  • Token masukan (input): Teks yang Anda kirim ke model. Permintaan Anda, dokumen Anda, sampel Anda.
  • Token keluaran: Jawaban yang dihasilkan model untuk Anda.

Poin penting: Token keluaran seringkali beberapa kali lebih mahal daripada token masukan. Hal ini karena secara komputasi lebih mahal bagi model untuk menghasilkan keluaran. Misalnya, dalam satu model, masukannya mungkin $3 per juta token sedangkan keluarannya mungkin $15; Jadi outputnya lima kali lebih mahal. Artinya, jawaban yang panjang dan tidak perlu dapat dengan cepat menggerogoti anggaran.

Tip: Salah satu cara termudah untuk mengurangi biaya adalah dengan tidak menanyakan jawaban panjang yang tidak perlu kepada model. Pembatasan seperti "maksimum 5 artikel", "paragraf tunggal", "ekspor tabel saja" meningkatkan kualitas dan menghemat token keluaran.

Contoh Harga Saat Ini

Di bawah ini adalah perkiraan harga beberapa model (per juta token, dolar AS). Nilai-nilai ini termasuk dalam periode penyusunan modul ini dan sering berubah; Periksa halaman harga penyedia saat ini untuk keputusan yang tepat.

model

Panggung

Masukkan $/1 juta

Keluaran $/1 juta

Claude Opus 4.8

kuat

~5

~25

Claude Soneta 5

seimbang

~3

~15

Claude Haiku 4.5

ringan

~1

~5

Seperti terlihat pada tabel, terdapat perbedaan harga hingga lima kali lipat antara tingkat kuat dan tingkat ringan. Itu sebabnya pendekatan "model yang paling cocok untuk semua bisnis" sering kali hanya membuang-buang uang. Melakukan pekerjaan sederhana yang dilakukan dengan model yang murah dan pekerjaan sulit dengan model yang kuat memberikan penghematan besar tanpa kehilangan kualitas. Ide ini akan kita perdalam pada unit 7 dan 9.

Memperkirakan Biaya Bulanan: Rumus Sederhana

Untuk perkiraan kasar biaya bulanan, Anda dapat menggunakan rumus ini:

Biaya bulanan ≈ (Jumlah permintaan per bulan × Rata-rata token masukan × Harga masukan / 1.000.000)+ (Jumlah permintaan per bulan × Rata-rata token keluaran × Harga keluaran / 1.000.000)

Mari kita ambil contoh. Katakanlah sebuah tim e-niaga menghasilkan 50.000 deskripsi produk per bulan. Setiap permintaan mengirimkan rata-rata 500 token masukan (informasi produk) dan menerima 300 token keluaran (deskripsi). Dalam model seimbang (input ~3, output ~15):

  • Biaya masukan: 50.000 × 500 × 3 / 1.000.000 = $75
  • Biaya keluaran: 50.000 × 300 × 15 / 1.000.000 = $225
  • Total ≈ $300/bulan

Jika mereka melakukan pekerjaan yang sama dalam model ringan (input ~1, output ~5):

  • Masukan: 50.000 × 500 × 1 / 1.000.000 = $25
  • Keluaran: 50.000 × 300 × 5 / 1.000.000 = $75
  • Total ≈ $100/bulan

Jadi pemilihan tahap saja dapat mengurangi pekerjaan yang sama dari $300 menjadi $100. Untuk tugas yang relatif sederhana seperti deskripsi produk, model yang ringan seringkali lebih dari cukup.

Perhatian: Rumus ini merupakan perkiraan kasar; penagihan sebenarnya bervariasi berdasarkan faktor seperti penggunaan cache, percobaan ulang, dan mode penalaran. Namun, ini merupakan awal yang baik untuk mendapatkan konfirmasi anggaran atau membandingkan dua model. Yang terbaik adalah mengukur bilangan real dengan uji coba kecil sebelum mengambil keputusan.

Lima Metode untuk Mengurangi Biaya

  1. Pilih tingkat yang tepat. Modelnya sederhana dan ringan. Ini adalah satu-satunya sumber tabungan terbesar.
  2. Buat masukannya lebih kecil. Daripada mengisi dokumen berukuran besar untuk setiap permintaan, kirimkan hanya bagian yang relevan (optimasi konteks di unit 5).
  3. Batasi keluaran. Memperjelas panjang dan format jawaban; Jawaban yang terlalu panjang = biaya yang tidak perlu.
  4. Gunakan cache. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Ini memberikan penghematan yang signifikan jika Anda mengirimkan instruksi besar yang sama ribuan kali.
  5. Lakukan pemrosesan batch. Jika Anda tidak terburu-buru, opsi "batch", yang mengirimkan banyak permintaan secara massal dan memprosesnya dengan harga diskon, akan mengurangi biaya secara signifikan.

Tiga Kasus Realistis

Kasus 1 — Penghematan dengan perubahan langkah. Tim layanan pelanggan merangkum semua email masuk dengan model terkuat, dan tagihan bulanan mereka adalah ~$900. Meringkas adalah tugas yang sederhana; Ketika mereka berpindah ke tingkat seimbang, kualitas keluarannya tetap hampir sama, namun tagihannya turun menjadi ~$250. Hemat ~$7.800 per tahun, hanya dengan memilih tingkatan yang tepat.

Kasus 2 — Menyimpan dengan cache. Sebuah tim perangkat lunak mengirimkan 8.000 token dokumen “standar pengkodean” yang sama dengan setiap permintaan peninjauan kode. 400 permintaan per hari × 8.000 token = input berulang yang besar. Ketika mereka mengaktifkan fitur cache, partisi tetap ini mulai dibaca jauh lebih murah dan sebagian besar biaya input hilang.

Kasus 3 — Penghematan dengan membatasi keluaran. Ketika tim pemasaran meminta deskripsi produk, model tersebut menghasilkan paragraf yang panjang dan berbunga-bunga. Ketika mereka menambahkan batasan "maksimum 60 kata, satu paragraf", penjelasannya menjadi lebih berguna dan token keluarannya dikurangi setengahnya. Meskipun kualitas meningkat, biaya menurun; menang-menang.

Prompt Lemah / Prompt Kuat

Perintah yang lemah:

Tuliskan saya deskripsi yang bagus untuk produk ini. [informasi produk]

Model dapat menulis selama yang diinginkannya; Token keluaran tidak terkontrol.

Perintah yang kuat:

Peran Anda: copywriter e-niaga. Produk: [INFORMASI]. Tugas: Menulis deskripsi produk. Batasan: Maksimal 60 kata, satu paragraf, menarik bagi pelanggan non-teknis, berisi 2 manfaat + 1 use case. Hindari kata sifat yang mewah.

Perintah yang kuat mengontrol kualitas dan panjang keluaran (dan juga biaya).

Templat yang Dapat Disalin

1. Perkiraan biaya bulanan:

Saya membuat permintaan [KUANTITAS] setiap bulan. Rata-rata masukan ~[NUM] token, keluaran ~[NUM] token. Hitung biaya bulanan untuk model berikut ([MODEL A], [MODEL B]) dengan rumus dan bandingkan dalam tabel. Menerima harga input/output [PRICES].

Perbandingan tingkat 2:

Tugas saya [TUGAS]. Apakah pekerjaan ini benar-benar memerlukan model yang kuat, atau apakah model yang ringan/seimbang saja sudah cukup? Evaluasi dari segi kualitas dan biaya dan sarankan 2 tingkatan untuk saya uji coba.

3. Penyaringan pengurangan biaya:

Identifikasi cara untuk mengurangi biaya dalam alur kerja berikut: [ALIRAN KERJA]. Tulis kelayakan dan perkiraan penghematan untuk setiap header kaskade, pengurangan input, batas output, cache, dan pemrosesan batch.

4. Batasan keluaran:

Tulis ulang perintah berikut untuk mengurangi token keluaran tanpa mengurangi kualitas: "[PROMPT]". Optimalkan panjang, format, dan pengulangan yang tidak perlu.

Kesalahan umum

  • Melewatkan perbedaan input/output: Membiarkan jawaban yang panjang tanpa mengetahui bahwa outputnya jauh lebih mahal.
  • Model yang paling kuat untuk setiap pekerjaan: Melakukan pekerjaan sederhana dengan model yang mahal dan membayar berkali-kali lipat lebih banyak jika tidak perlu.
  • Melepaskan panjang keluaran: Memberikan izin penulisan tanpa batas ke model tanpa menerapkan batasan format atau panjang apa pun.
  • Mengabaikan cache dan batch: Hilangnya peluang penghematan yang serius untuk input berulang dan tugas yang tidak mendesak.
  • Berpikir bahwa harga sudah terkini: Mengandalkan tabel harga lama dan salah merencanakan anggaran; harga sering berubah.

Singkatnya

  • Harga dihitung berdasarkan token; input dan output dihargai secara terpisah, dan output seringkali beberapa kali lebih mahal.
  • Anda dapat memperkirakan secara kasar biaya bulanan dengan rumus jumlah permintaan × token rata-rata × harga.
  • Pemilihan langkah yang benar saja dapat mengurangi biaya berkali-kali lipat.
  • Minimalkan masukan, pembatasan keluaran, caching, dan pemrosesan batch adalah metode praktis yang mengurangi tagihan secara signifikan.

Tugas aplikasi

Dapatkan nilai token yang Anda perkirakan pada unit sebelumnya. Hitung biaya bulanan bisnis Anda untuk dua tingkat berbeda dengan templat 1 di unit ini (perkiraan biaya bulanan). Kemudian, dengan templat ke-3 (pemindaian pengurangan biaya), simpulkan berapa banyak penghematan yang dapat dihasilkan setiap metode pada alur kerja Anda. Rencanakan untuk memilih dua metode yang paling menjanjikan dan terapkan pada anggaran bulan berikutnya.

daftar periksa

  • [] Saya tahu bahwa token input dan output diberi harga terpisah dan output lebih mahal.
  • [ ] Saya dapat memperkirakan secara kasar biaya bulanan suatu alur kerja dengan rumus sederhana.
  • [ ] Saya dapat menunjukkan dampak biaya dari pemilihan level yang tepat dengan sebuah contoh.
  • [ ] Saya dapat mengenali lima metode pengurangan biaya dan memilih salah satu yang sesuai.
  • [] Saya dapat menulis ulang prompt untuk mengurangi token keluaran.