Yunit 2 / 11

Token at Lohika ng Pagpepresyo

Mga nadagdag:

  • Ipaliwanag ang konsepto ng token, input/output token distinction at tokenization.
  • Maaaring kalkulahin ang halaga ng isang kahilingan at buwanang workload mula sa bilang ng mga token at presyo ng unit
  • Maaaring ihambing ang epekto ng pagpili ng modelo at mabilis na haba sa gastos

Hindi ka makakagawa ng isang solusyon sa sukat nang hindi nauunawaan ang ekonomiya ng mga LLM API. Ang isang demo ay tumatakbo nang isang beses; Ang pangunahing bagay ay upang mahulaan kung ano ang magiging bayarin kapag libu-libong mga tawag ang ginawa bawat buwan. Sa unit na ito, ise-set up namin ang bahagi ng pera ng mga bagay: ano ang isang token, bakit naiiba ang presyo ng input at output, kung paano kalkulahin ang halaga ng isang kahilingan, at kung paano magbadyet ng buwanang workload. Nagbibigay-daan sa iyo ang impormasyong ito na sukatin ang pagbabalik ng mga diskarte sa pag-optimize (caching, pagpili ng modelo, batch) sa mga kasunod na unit.

Ano ang Token?

Ang Token ay ang pinakamaliit na unit kung saan nagpoproseso ang modelo ng text. Ang isang salita ay hindi palaging isang tanda; Ang token ay karaniwang bahagi ng isang salita. Sa halos pagsasalita, sa Ingles, ang 1 token ay ≈ 4 na character ≈ 0.75 na salita. Sa Turkish at code, nag-iiba ang ratio: Ang mga salitang Turkish ay kadalasang nahahati sa mas maraming token kaysa sa Ingles dahil sa suffixed structure at alpabeto nito. Samakatuwid, kinakailangang sukatin ang bilang ng mga token gamit ang tool sa pagbibilang ng token ng provider sa halip na hulaan sa pamamagitan ng mata.

Ang tokenization (ang proseso ng paghahati ng teksto sa mga token) ay maaaring iba para sa bawat modelo. Ito ay may dalawang praktikal na kahihinatnan: (1) Ang parehong teksto ay maaaring magbunga ng magkakaibang bilang ng mga token sa iba't ibang modelo; (2) Ang mga hula na ginawa gamit ang mga tokenizer mula sa iba pang mga provider (hal. OpenAI's tiktoken library) ay magiging hindi tumpak para kay Claude — gamitin ang token counting tip para sa modelong iyong ginagamit.

Hint: "Tungkol sa ilang mga token?" Huwag sagutin ang tanong nang walang taros. Magpasa ng isang text na kinatawan sa pamamagitan ng token counting API; Batayin ang mga desisyon sa badyet sa pagsukat.

Mga Token ng Input at Output

Ang invoice ay binubuo ng dalawang item:

  • Mga token ng input: Anumang bagay na ipapadala mo sa modelo — prompt ng system, mga nakaraang tour, mensahe ng user, dokumentasyon kung mayroon man. Pinoproseso ang mga ito nang sabay-sabay.
  • Mga token ng output: Ang tugon na ginawa ng modelo. Para sa bawat output token, ginagawa ng modelo ang pagkalkula nang sunud-sunod.

Sa karamihan ng mga provider, ang output ay ilang beses na mas mahal kaysa sa input. Ang dahilan ay simple: ang pagbabasa ng input nang sabay-sabay ay mas mura kaysa sa paggawa ng output na token-by-token. Ang pag-alam sa kawalaan ng simetrya na ito ay nagpapaliwanag kung bakit ang mga pag-optimize tulad ng "nangangailangan ng maigsi na mga sagot" ​​ay napakabisa.

Mga sample na presyo (bawat 1 milyong token, USD)

Ang talahanayan sa ibaba ay isang sanggunian; Maaaring magbago ang mga presyo sa paglipas ng panahon, mangyaring kumpirmahin ang kasalukuyang listahan ng iyong sariling provider.

klase ng modelo

sample na modelo

Input ($/1M)

Output ($/1M)

Karaniwang paggamit

mabilis/mura

Haiku 4.5

1.00

5.00

Pag-uuri, pag-label, simpleng buod

balanse

soneto 5

3.00

15.00

Pangkalahatang layunin, coding, trabaho ng ahente

malakas

Opus 4.8

5.00

25.00

Masalimuot na pangangatwiran, pangmatagalang gawain

Sa bawat klase, ang output ay 5 beses ang input; Bukod dito, kahit na ang input ng makapangyarihang modelo ay 5 beses ang input ng murang modelo. Ang dalawang axes na ito (input↔output at model class) ay bumubuo sa balangkas ng iyong mga desisyon sa gastos.

Paano Kalkulahin ang Gastos?

Ang formula ay simple:

gastos = (input_token / 1,000,000) × input_price + (output_token / 1,000,000) × output_price

Halimbawang account. Isang kahilingan sa Sonnet 5: 1,500 input token, 400 output token.

input = 1,500 / 1,000,000 × 3.00 = $0.0045 output = 400 / 1,000,000 × 15.00 = $0.0060 kabuuang = $0.0105 (mga 1 sentimo)

Mukhang mura ang isang tawag. Ngunit i-multiply sa dami: 20,000 tawag bawat araw → $210 bawat araw, ~$6,300 bawat buwan. Dito pumapasok ang sukat.

Template ng Buwanang Badyet

Upang kunin ang buwanang gastos ng isang workload, gamitin ang template na ito:

1) Average na input token bawat kahilingan: ......2) Average na output token bawat kahilingan: ......3) Bilang ng mga kahilingan bawat araw: ......4) Mga araw na nagtrabaho bawat buwan: ......5) Gastos bawat kahilingan = (1)/1M×input_price + (2)/1M×output_price6) Buwanang gastos = (5) × (3) × (4)

Ang pagbuhos ng pattern na ito sa isang spreadsheet at makita kung paano gumaganap ang kabuuan kapag binago mo ang modelo ay naglalaman ng mga desisyon sa pagpili ng modelo (unit 5) at cache (unit 6).

Paikliin ang Prompt gamit ang mga Copiable Template

Karamihan sa mga gastos ay nagmumula sa hindi kinakailangang mahabang senyas at nasayang na output. Ang mga template sa ibaba ay nagbibigay ng direktang pagtitipid.

# Limitahan ang haba ng output. Sagutin nang may maximum na 3 aytem. Magdagdag ng katwiran o panimulang pangungusap.

# Ibalik lamang ang hiniling na field Ibalik lamang ang sumusunod na JSON, huwag magdagdag ng anumang iba pang teksto:{"category": "...", "urgency": "low|medium|high"}

# Alisin ang hindi kinakailangang kontekstoAlisin lamang ang petsa at halaga mula sa sumusunod na teksto. Huwag ulitin ang buong text.Text: """{{text}}"""

# I-summarize ang mahabang speech (input saving) Summarize this speech in 5 items. Gagamitin ko ang buod na ito sa halip na ang buong nakaraan sa mga susunod na round. Pagsasalita: """{{nakaraang}}"""

Mahinang prompt / Malakas na prompt (sa mga tuntunin ng gastos)

# WEAK (naglalabas ng output, mahal) Suriin ang kahilingan sa suporta na ito at sumulat sa akin ng isang komprehensibong pagsusuri.

# STRONG (pinipigilan ang output, mura at predictable)I-classify ang kahilingan sa suporta na ito. Ibalik lang ang sumusunod na JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Huwag magsulat ng paglalarawan.

Ang mahinang bersyon ay gumagawa ng marahil 500 mga token ng output; malakas na bersyon ~15. Dahil mahal ang output, ito ay isang makabuluhang pagkakaiba sa bawat tawag at dumarami sa volume.

Tatlong Mini Case

Case 1 — Ang nakatagong halaga ng mahabang prompt. Habang pinagbukud-bukod ng automation ng accounting ang bawat invoice, nagdagdag ito ng 40-pahinang “rule book” bilang input sa bawat kahilingan: ~12,000 input token bawat kahilingan. Sa Sonnet 5 12,000/1M×3 = $0.036 kakapasok lang. 5,000 bill bawat araw → $180 bawat araw. Sa pamamagitan ng pag-cache sa rulebook (unit 6) na input cost ay bumaba ng ~90%.

Case 2 — Ang kabayaran ng pagbabawas ng modelo. Isang team ang gumagawa ng simpleng “positibo/negatibong” sentiment tagging gamit ang Opus 4.8: 300 input + 10 output token. Ang halaga ng Opus ay 300/1M×5 + 10/1M×25 = $0.00175. Ang paglipat sa Haiku, 300/1M×1 + 10/1M×5 = $0.00035 — 5x na mas mura, ang pagkakaiba sa katumpakan ay hindi nasusukat. Sa 3 milyong tawag bawat buwan, ang pagkakaiba ay $5,250 → $1,050.

Case 3 — Ilalabas ang output. Kapag ang isang pangkat ng marketing ay gumawa ng isang paglalarawan ng produkto, hindi ito nagtatakda ng mga limitasyon sa output; minsan sinabi ng modelo na 1,500 token. Noong idinagdag ko ang "60 words maximum" na pagtuturo, bumaba ang average na output mula 900 hanggang 90 token. Dahil mahal ang pag-imprenta, ang buwanang bayarin ay nabawasan ng isang ikatlo, at ang mga teksto ay naging mas kapaki-pakinabang.

Mga karaniwang pagkakamali

  • Hulaan ang token sa pamamagitan ng mata: Maaari kang magkamali lalo na sa Turkish at code. Sukatin.
  • Ipagpalagay na magkapareho ang input at output: Karaniwang mas mahal ang output; Karamihan sa pag-optimize ay nagmumula sa pagpapaikli ng output.
  • Huwag magpalinlang sa mura ng isang tawag: Ang desisyon ay ginawa sa pamamagitan ng lakas ng tunog. $0.01 × milyon = $10,000.
  • Paghula kasama ang tokenizer ng isa pang provider: Nagbibigay ng mga maling resulta; Gamitin ang tool sa pagbilang ng token ng modelo.
  • Walang limitasyong pagpapalaki ng kasaysayan ng pag-uusap: Ang bawat round ay idinaragdag sa entry; buod sa mahabang pag-uusap.
  • Pagpapanatiling mataas ang `max_tokens` nang hindi kinakailangan: Itinatago ang plano sa badyet at ang panganib na maputol; Magbigay ng makatotohanang halaga.

Mas malalim: Context Window at Mahabang Gastos ng Input

Mahalagang makita kung paano tumataas ang presyo "sa kabuuan ng pag-uusap" at hindi lamang "bawat kahilingan." Ang kabuuang dami ng text na maaaring iproseso ng modelo ay tinatawag na window ng konteksto; Ang kabuuan ng input at output ay dapat magkasya sa window na ito. Ang mga modernong modelo ay nag-aalok ng napakalaking bintana (daan-daang libo, kahit milyon-milyong mga token), ngunit hindi iyon nangangahulugan na maaari mong "punan ito nang walang hanggan" — kahit anong ilagay mo sa window ay sinisingil bilang input.

Ang bitag sa mahabang pag-uusap ay ito: sa bawat bagong pag-ikot ipapadala mo muli ang buong kasaysayan (kawalan ng estado sa unit 1). Sa isang 20-round na pag-uusap, ang ika-20 na kahilingan ay nagdadala ng buong unang 19 na round bilang input. Kaya, habang humahaba ang pag-uusap, ang gastos sa bawat kahilingan ay lumalaki nang sama-sama sa halip na linearly. Ang isang 50-round na pag-uusap sa isang agent assistant ay maaaring makabuo ng input cost dose-dosenang beses sa unang round.

Mayroong dalawang paraan upang pamahalaan ito. Ang una ay recap: pag-compress ng mas lumang mga round sa isang solong recap block, pinapanatili lamang ang mga huling round na raw. Ang pangalawa ay agarang pag-cache (unit 6): pagbabasa ng nakapirming konteksto sa ikasampu ng presyo sa halip na paulit-ulit na iproseso ito sa buong presyo. Magkasama, makabuluhang binabawasan ng mga ito ang singil sa mahaba, masinsinang gawain sa konteksto. Kaya ang token economics ay tungkol sa disenyo ng buong session, hindi isang kahilingan.

Sa buod

Ang Token ay ang pinakamaliit na yunit kung saan pinoproseso ang teksto; magkahiwalay ang presyo ng input at output, at kadalasang mas mahal ang output. Ang gastos ay ang bilang ng mga token na pinarami ng presyo ng unit, at ang tunay na desisyon ay ginawa ayon sa dami. Ang paikliin ang prompt, nililimitahan ang output, at ang pagpili ng pinakamagaan na modelo na nakakatugon sa gawain ay ang mga pinakadirektang lever na nagpapababa sa gastos nang maraming beses.

Gawain ng aplikasyon

Pumili ng sarili mong gawain. (1) Tukuyin ang bilang ng mga input at tinantyang output token para sa isang kinatawan na prompt (sukatin gamit ang tool sa pagbilang ng token kung maaari). (2) Kalkulahin ang gastos sa bawat kahilingan para sa tatlong klase ng modelo. (3) Tantyahin ang iyong pang-araw-araw na bilang ng mga kahilingan at kunin ang buwanang badyet para sa tatlong modelo. (4) Magdagdag ng tagubilin upang paikliin ang output at tandaan ang inaasahang matitipid.

checklist

  • [ ] Maaari kong ipaliwanag ang konsepto ng mga token at ang tokenization ay nag-iiba depende sa modelo.
  • [ ] Alam ko kung bakit magkaiba ang presyo ng mga input at output token.
  • [ ] Maaari kong kalkulahin ang halaga ng isang kahilingan gamit ang formula.
  • [ ] Maaari akong lumikha ng buwanang badyet para sa isang workload gamit ang isang template.
  • [ ] Maipapakita ko sa isang halimbawa ang pakinabang ng pagpapaikli ng output at pagbabawas ng modelo.