Enota 2 / 11

Žeton in cenovna logika

Dobički:

  • Pojasnite koncept žetona, razlikovanje vhodnih/izhodnih žetonov in tokenizacijo.
  • Zna izračunati stroške zahteve in mesečno delovno obremenitev iz števila žetonov in cene na enoto
  • Lahko primerja vpliv izbire modela in takojšnje dolžine na stroške

Ne morete zgraditi rešitve v velikem obsegu, ne da bi razumeli ekonomiko API-jev LLM. Demo se izvede enkrat; Glavna stvar je, da lahko predvidite, kakšen bo račun, ko bo opravljenih na tisoče klicev na mesec. V tej enoti smo postavili denarno stran stvari: kaj je žeton, zakaj sta vhod in izhod cenjena drugače, kako izračunati stroške zahteve in kako načrtovati mesečno delovno obremenitev. Te informacije vam omogočajo merjenje donosa optimizacijskih tehnik (predpomnjenje, izbira modela, serija) v naslednjih enotah.

Kaj je Token?

Žeton je najmanjša enota, v kateri model obdeluje besedilo. Beseda ni vedno žeton; token je običajno del besede. V grobem je v angleščini 1 žeton ≈ 4 znake ≈ 0,75 besede. V turščini in kodi je razmerje različno: turške besede so zaradi strukture s priponami in abecede pogosto razdeljene na več žetonov kot v angleščini. Zato je treba število žetonov izmeriti s ponudnikovim orodjem za štetje žetonov in ne ugibati na oko.

Tokenizacija (postopek razdelitve besedila na žetone) se lahko razlikuje za vsak model. To ima dve praktični posledici: (1) isto besedilo lahko daje različno število žetonov v različnih modelih; (2) Napovedi z žetonizatorji drugih ponudnikov (npr. knjižnica tiktoken OpenAI) bodo za Clauda netočne — uporabite nasvet za štetje žetonov za model, ki ga uporabljate.

Namig: "Približno koliko žetonov?" Ne odgovarjajte na vprašanje slepo. Predajte reprezentativno besedilo skozi API za štetje žetonov; Odločitve o proračunu temeljijo na meritvah.

Vhodni in izhodni žetoni

Račun je sestavljen iz dveh postavk:

  • Vhodni žetoni: Vse, kar pošljete modelu — sistemski poziv, pretekli ogledi, uporabniško sporočilo, morebitna dokumentacija. Ti so obdelani vsi naenkrat.
  • Izhodni žetoni: odziv, ki ga ustvari model. Za vsak izhodni žeton model izvede izračun korak za korakom.

Pri večini ponudnikov je output nekajkrat dražji od inputa. Razlog je preprost: branje vnosa naenkrat je cenejše kot ustvarjanje izhoda žeton za žetonom. Poznavanje te asimetrije pojasnjuje, zakaj so optimizacije, kot je »zahtevaj jedrnate odgovore« tako učinkovite.

Vzorčne cene (za 1 milijon žetonov, USD)

Spodnja tabela je referenca; Cene se lahko sčasoma spremenijo, prosimo, potrdite trenutni seznam svojega ponudnika.

razred modela

vzorčni model

Vnos ($/1 milijon)

Rezultat ($/1 milijon)

Tipična uporaba

hitro/poceni

Haiku 4.5

1,00

5.00

Klasifikacija, označevanje, enostaven povzetek

uravnoteženo

sonet 5

3.00

15.00

Splošni namen, kodiranje, agentsko delo

močan

Opus 4.8

5.00

25.00

Kompleksno sklepanje, dolgoročne naloge

V vsakem razredu je proizvodnja 5-krat večja od vložka; Poleg tega je celo vložek močnejšega modela 5-krat večji od vložka poceni modela. Ti dve osi (vhod↔izhod in razred modela) tvorita okvir vaših stroškovnih odločitev.

Kako izračunati stroške?

Formula je preprosta:

stroški = (vhodni_žeton / 1.000.000) × vhodna_cena + (izhodni_žeton / 1.000.000) × izhodna_cena

Vzorčni račun. Zahteva s Sonnetom 5: 1500 vhodnih žetonov, 400 izhodnih žetonov.

vnos = 1.500 / 1.000.000 × 3,00 = 0,0045 USD izhod = 400 / 1.000.000 × 15,00 = 0,0060 USD skupaj = 0,0105 USD (približno 1 cent)

En klic je videti poceni. Toda pomnožite s količino: 20.000 klicev na dan → 210 USD na dan, ~6.300 USD na mesec. Tu nastopi obseg.

Predloga mesečnega proračuna

Če želite izluščiti mesečne stroške delovne obremenitve, uporabite to predlogo:

1) Povprečni vhodni žeton na zahtevo: ......2) Povprečni izhodni žeton na zahtevo: ......3) Število zahtev na dan: ......4) Opravljeni dnevi na mesec: ......5) Strošek na zahtevo = (1)/1M×input_price + (2)/1M×output_price6) Mesečni strošek = (5) × (3) × (4)

Prelivanje tega vzorca v preglednico in ogled, kako se vsota odigra, ko spremenite model, uteleša odločitve o izbiri modela (enota 5) in predpomnilniku (enota 6).

Skrajšanje poziva s predlogami, ki jih je mogoče kopirati

Večino stroškov povzročijo nepotrebno dolgi pozivi in zapravljeni rezultati. Spodnje predloge zagotavljajo neposredne prihranke.

# Omejite izhodno dolžino. Odgovorite z največ 3 elementi. Dodajte utemeljitev ali uvodni stavek.

# Vrni samo zahtevano polje. Vrni le naslednji JSON, ne dodajaj drugega besedila:{"kategorija": "...", "nujnost": "nizka|srednja|visoka"}

# Odstranite nepotreben kontekst Iz naslednjega besedila odstranite samo datum in znesek. Ne ponavljajte celotnega besedila. Besedilo: """{{text}}"""

# Povzemite dolg govor (shranjevanje vnosa) Povzemite ta govor v 5 postavk. Ta povzetek bom uporabil namesto celotne preteklosti v naslednjih krogih. Govor: """{{past}}"""

Šibek poziv/močan poziv (v smislu stroškov)

# ŠIBKO (izdaja rezultat, drago)Analiziraj to zahtevo za podporo in mi napiši izčrpno oceno.

# MOČNO (omejuje izhod, poceni in predvidljivo) Razvrstite to zahtevo za podporo. Samo vrnite naslednji JSON:{"category":"invoice|technical|refund|other","urency":"low|medium|high"}Ne pišite opisa.

Šibka različica proizvede morda 500 izhodnih žetonov; močna različica ~15. Ker je izhod drag, je to pomembna razlika na klic in se pomnoži z obsegom.

Trije mini kovčki

1. primer – Skrita cena dolgega poziva. Ko je računovodska avtomatizacija razvrstila vsak račun, je vsaki zahtevi dodala 40-stransko »knjigo pravil« kot vnos: ~12.000 vhodnih žetonov na zahtevo. S sonetom 5 12.000/1M×3 = pravkar vnesenih 0,036 USD. 5.000 računov na dan → 180 $ na dan. S predpomnjenjem pravilnika (enota 6) so se vhodni stroški znižali za ~90 %.

Primer 2 – Izplačilo zmanjšanja modela. Ena ekipa je izvajala preprosto označevanje čustev "pozitivno/negativno" z Opus 4.8: 300 vhodnih + 10 izhodnih žetonov. Opus stane 300/1M×5 + 10/1M×25 = 0,00175 USD. Preklop na Haiku, 300/1M×1 + 10/1M×5 = 0,00035 $ — 5x ceneje, razlika v natančnosti je bila neizmerna. Pri 3 milijonih klicev na mesec je razlika 5.250 $ → 1.050 $.

Primer 3 — Sprostitev izhoda. Ko je marketinška ekipa izdelala opis izdelka, ni postavila nobenih omejitev glede proizvodnje; model je včasih rekel 1500 žetonov. Ko sem dodal navodilo "največ 60 besed", je povprečni rezultat padel z 900 na 90 žetonov. Ker je bilo tiskanje drago, se je mesečni račun znižal za tretjino, besedila pa so postala uporabnejša.

Pogoste napake

  • Ugibanje žetona na oko: Motiš se lahko predvsem v turščini in kodi. Izmeri.
  • Ob predpostavki, da sta vhod in izhod enaka: izhod je običajno veliko dražji; Večina optimizacije izhaja iz skrajšanja izhoda.
  • Naj vas poceni en sam klic ne zavede: odločitev je odvisna od količine. 0,01 $ × milijon = 10.000 $.
  • Predvidevanje z tokenizerjem drugega ponudnika: daje napačne rezultate; Uporabite orodje za štetje žetonov modela.
  • Neomejeno povečanje zgodovine pogovorov: Vsak krog je dodan vnosu; povzemati v dolgih pogovorih.
  • Ohranjanje `max_tokens` po nepotrebnem visokem: skrije proračunski načrt in tveganje zmanjšanja; Podajte realno vrednost.

Globlje: Kontekstno okno in dolgi vhodni stroški

Ključnega pomena je videti, kako se cena giblje "v celotnem pogovoru" in ne le "na zahtevo". Skupna količina besedila, ki jo lahko model obdela, se imenuje kontekstno okno; Vsota vnosa in izhoda se mora prilegati temu oknu. Sodobni modeli ponujajo zelo velika okna (na stotine tisoče, celo milijone žetonov), vendar to ne pomeni, da ga lahko "polnite neskončno" - karkoli vstavite v okno, se obračuna kot vložek.

Past v dolgih pogovorih je naslednja: z vsakim novim krogom ponovno pošlješ celotno zgodovino (apatridnost v enoti 1). V 20-krožnem pogovoru 20. zahteva nosi vseh prvih 19 krogov kot vnos. Tako, ko se pogovor daljša, strošek na zahtevo raste kumulativno in ne linearno. 50-krat dolg pogovor s pomočnikom agenta lahko povzroči vhodne stroške, ki so več desetkrat večji od prvega kroga.

To lahko upravljate na dva načina. Prvi je povzetek: stiskanje starejših krogov v en sam blok povzetka, pri čemer ostane samo nekaj zadnjih krogov neobdelanih. Drugi je hitro predpomnjenje (enota 6): branje fiksnega konteksta po desetini cene namesto večkratne obdelave po polni ceni. Skupaj znatno zmanjšajo račun za dolge, kontekstno intenzivne delovne obremenitve. Pri ekonomiji žetonov gre torej za načrtovanje celotne seje, ne za eno samo zahtevo.

Če povzamem

Žeton je najmanjša enota, v kateri se obdeluje besedilo; vhod in izhod se cenita ločeno, izhod pa je pogosto veliko dražji. Strošek je število žetonov, pomnoženo s ceno na enoto, prava odločitev pa je sprejeta glede na količino. Skrajšanje poziva, omejitev izhoda in izbira najlažjega modela, ki opravi nalogo, so najbolj neposredni vzvodi, ki večkrat znižajo stroške.

Aplikacijska naloga

Izberite nalogo po svoje. (1) Določite število vhodnih in ocenjenih izhodnih žetonov za reprezentativni poziv (izmerite z orodjem za štetje žetonov, če je mogoče). (2) Izračunajte stroške na zahtevo za tri razrede modelov. (3) Ocenite svoje dnevno število zahtev in izpeljite mesečni proračun za tri modele. (4) Dodajte navodilo za skrajšanje izhoda in zabeležite pričakovane prihranke.

kontrolni seznam

  • [ ] Lahko razložim koncept žetonov in da se tokenizacija razlikuje glede na model.
  • [ ] Vem, zakaj imajo vhodni in izhodni žetoni različne cene.
  • [ ] S formulo lahko izračunam stroške zahteve.
  • [ ] Z uporabo predloge lahko ustvarim mesečni proračun za delovno obremenitev.
  • [ ] S primerom lahko pokažem korist skrajšanja izpisa in zmanjšanja modela.