Jednotka 2 / 11

Token a logika tvorby cien

zisky:

  • Vysvetlite pojem token, rozlíšenie vstupných/výstupných tokenov a tokenizácia.
  • Dokáže vypočítať náklady na požiadavku a mesačné pracovné zaťaženie z počtu tokenov a jednotkovej ceny
  • Dokáže porovnať vplyv výberu modelu a promptnej dĺžky na náklady

Bez pochopenia ekonomiky LLM API nemôžete vytvoriť riešenie vo veľkom rozsahu. Ukážka sa spustí raz; Hlavná vec je vedieť predvídať, aký bude účet pri tisíckach hovorov mesačne. V tejto jednotke nastavujeme peňažnú stránku vecí: čo je token, prečo sú ceny vstupu a výstupu rozdielne, ako vypočítať náklady na požiadavku a ako rozpočítať mesačné pracovné zaťaženie. Tieto informácie vám umožňujú merať návratnosť optimalizačných techník (cachovanie, výber modelu, dávka) v nasledujúcich jednotkách.

Čo je token?

Token je najmenšia jednotka, v ktorej model spracováva text. Slovo nie je vždy symbolom; token je zvyčajne súčasťou slova. Zhruba povedané, v angličtine je 1 token ≈ 4 znaky ≈ 0,75 slova. V turečtine a kóde sa pomer líši: turecké slová sú často rozdelené na viac znakov ako v angličtine kvôli ich štruktúre a abecede s príponami. Preto je potrebné merať počet tokenov pomocou nástroja na počítanie tokenov poskytovateľa a nie hádať od oka.

Tokenizácia (proces rozdelenia textu na tokeny) môže byť pre každý model odlišná. To má dva praktické dôsledky: (1) Ten istý text môže priniesť rôzne počty tokenov v rôznych modeloch; (2) Predpovede vytvorené pomocou tokenizérov od iných poskytovateľov (napr. knižnica tiktokenov OpenAI) budú pre Clauda nepresné – použite tip na počítanie tokenov pre model, ktorý používate.

Tip: "Koľko žetónov?" Neodpovedajte na otázku slepo. Pošlite reprezentatívny text cez rozhranie API na počítanie tokenov; Rozhodovanie o rozpočte založte na meraní.

Vstupné a výstupné tokeny

Faktúra pozostáva z dvoch položiek:

  • Vstupné tokeny: Všetko, čo pošlete do modelu – systémová výzva, minulé prehliadky, správa používateľa, dokumentácia, ak existuje. Tieto sú spracované naraz.
  • Výstupné tokeny: Odozva vytvorená modelom. Pre každý výstupný token model vykoná výpočet krok za krokom.

U väčšiny poskytovateľov je výstup niekoľkonásobne drahší ako vstup. Dôvod je jednoduchý: čítanie vstupu naraz je lacnejšie ako vytváranie výstupného tokenu po tokene. Poznanie tejto asymetrie vysvetľuje, prečo sú optimalizácie ako „vyžadujú stručné odpovede“ také účinné.

Vzorové ceny (za 1 milión tokenov, USD)

Nižšie uvedená tabuľka je referenčná; Ceny sa môžu v priebehu času meniť, potvrďte si prosím aktuálny zoznam vášho vlastného poskytovateľa.

modelovej triedy

vzorový model

Vstup ($/1 milión)

Výstup ($/1 milión)

Typické použitie

rýchlo/lacno

Haiku 4.5

1,00

5,00

Klasifikácia, označovanie, jednoduché zhrnutie

vyvážený

sonet 5

3,00

15:00

Všeobecný účel, kódovanie, práca agentov

silný

Opus 4.8

5,00

25:00

Komplexné uvažovanie, úlohy s dlhým dosahom

V každej triede je výstup 5-násobkom vstupu; Navyše aj príkon výkonného modelu je 5-násobok príkonu lacného modelu. Tieto dve osi (vstup↔výstup a trieda modelu) tvoria rámec vašich rozhodnutí o nákladoch.

Ako vypočítať náklady?

Vzorec je jednoduchý:

náklady = (vstupný_token / 1 000 000) × vstupná_cena + (výstupný_token / 1 000 000) × výstupná_cena

Vzorový účet. Požiadavka so Sonetom 5: 1 500 vstupných tokenov, 400 výstupných tokenov.

vstup = 1 500 / 1 000 000 × 3,00 = 0,0045 USD výstup = 400 / 1 000 000 × 15,00 = 0,0060 USD celkom = 0,0105 USD (približne 1 cent)

Jeden hovor vyzerá lacno. Ale vynásobte objemom: 20 000 hovorov za deň → 210 USD za deň, ~ 6 300 USD za mesiac. Tu vstupuje do hry mierka.

Šablóna mesačného rozpočtu

Ak chcete extrahovať mesačné náklady na pracovné zaťaženie, použite túto šablónu:

1) Priemerný vstupný token na požiadavku: ......2) Priemerný výstupný token na požiadavku: ......3) Počet požiadaviek za deň: ......4) Odpracované dni za mesiac: ......5) Náklady na požiadavku = (1)/1M×vstupná_cena + (2)/1M×výstupná_cena6) Mesačné náklady = (5) × (3) × (4)

Naliatie tohto vzoru do tabuľky a zobrazenie súčtu pri zmene modelu stelesňuje rozhodnutia o výbere modelu (jednotka 5) a cache (jednotka 6).

Skrátenie výzvy pomocou kopírovateľných šablón

Väčšina nákladov pochádza zo zbytočne dlhých výziev a zbytočných výstupov. Nižšie uvedené šablóny poskytujú priame úspory.

# Obmedzte výstupnú dĺžku. Odpoveď s maximálne 3 položkami. Pridajte odôvodnenie alebo úvodnú vetu.

# Vráti iba požadované pole Vráti iba nasledujúci JSON, nepridáva žiadny ďalší text:{"category": "...", "urgency": "low|medium|high"}

# Odstráňte nepotrebný kontextZ nasledujúceho textu odstráňte iba dátum a sumu. Neopakujte celý text.Text: """{{text}}"""

# Zhrňte dlhý prejav (uloženie vstupu) Zhrňte tento prejav do 5 položiek. Toto zhrnutie použijem namiesto úplnej minulosti v ďalších kolách. Reč: """{{minulý}}"""

Slabá výzva / silná výzva (z hľadiska nákladov)

# SLABÝ (uvoľňuje výstup, drahé) Analyzujte túto žiadosť o podporu a napíšte mi komplexnú recenziu.

# SILNÝ (obmedzuje výstup, je lacný a predvídateľný) Klasifikujte túto požiadavku na podporu. Stačí vrátiť nasledujúci JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Nepíšte popis.

Slabá verzia produkuje možno 500 výstupných tokenov; silná verzia ~15. Pretože výstup je drahý, ide o významný rozdiel na hovor a znásobuje sa s objemom.

Tri mini puzdrá

Prípad 1 – Skrytá cena dlhej výzvy. Keďže automatizácia účtovníctva triedila každú faktúru, pridala ku každej požiadavke 40-stranovú „knihu pravidiel“ ako vstup: ~ 12 000 vstupných tokenov na požiadavku. So Sonetom 5 12 000/1M×3 = 0,036 $ práve zadaný. 5 000 účtov za deň → 180 USD za deň. Uložením knihy pravidiel (jednotka 6) do vyrovnávacej pamäte klesli vstupné náklady o ~90 %.

Prípad 2 – Výnos zo zmenšenia modelu. Jeden tím robil jednoduché „pozitívne/negatívne“ označovanie sentimentu s Opus 4.8: 300 vstupných + 10 výstupných tokenov. Opus stál 300/1M×5 + 10/1M×25 = 0,00175 USD. Prechod na Haiku, 300/1M×1 + 10/1M×5 = 0,00035 $ — 5x lacnejšie, rozdiel v presnosti bol nemerateľný. Pri 3 miliónoch hovorov za mesiac je rozdiel 5 250 USD → 1 050 USD.

Prípad 3 – Uvoľnenie výstupu. Keď marketingový tím vytvoril popis produktu, nestanovil žiadne obmedzenia na výstup; model niekedy povedal 1500 tokenov. Keď som pridal pokyn „maximálne 60 slov“, priemerný výstup klesol z 900 na 90 tokenov. Keďže tlač bola drahá, mesačný účet sa znížil o tretinu a texty sa stali užitočnejšími.

Časté chyby

  • Hádanie tokenu podľa oka: Mýliť sa môžete najmä v turečtine a kóde. Zmerajte.
  • Za predpokladu, že vstup a výstup sú rovnaké: Výstup je zvyčajne oveľa drahší; Väčšina optimalizácie pochádza zo skrátenia výstupu.
  • Nenechajte sa zmiasť lacnosťou jediného hovoru: Rozhodnutie sa robí podľa objemu. 0,01 $ × milión = 10 000 $.
  • Predpoveď pomocou tokenizéra iného poskytovateľa: Dáva nesprávne výsledky; Použite nástroj na počítanie žetónov modelu.
  • Neobmedzené rozšírenie histórie konverzácie: Každé kolo sa pridá k záznamu; zhrnúť do dlhých rozhovorov.
  • Udržiavanie `max_tokens` zbytočne vysoko: Skryje plán rozpočtu a riziko zníženia; Dajte reálnu hodnotu.

Hlbšie: Kontextové okno a dlhé vstupné náklady

Je dôležité vidieť, ako sa cena ukladá „v rámci konverzácie“ a nielen „na žiadosť“. Celkové množstvo textu, ktoré dokáže model spracovať, sa nazýva kontextové okno; Súčet vstupu a výstupu sa musí zmestiť do tohto okna. Moderné modely ponúkajú veľmi veľké okná (stovky tisíc, dokonca milióny tokenov), ale to neznamená, že ich môžete „plniť donekonečna“ – všetko, čo do okna vložíte, sa účtuje ako vstup.

Pasca v dlhých rozhovoroch je takáto: s každým novým kolom posielate celú históriu znova (bezštátnosť v jednotke 1). V 20-kolovej konverzácii obsahuje 20. požiadavka ako vstup celých prvých 19 kôl. Keď sa teda konverzácia predlžuje, cena za požiadavku rastie skôr kumulatívne ako lineárne. 50-kolový rozhovor s asistentom agenta môže v prvom kole vyprodukovať niekoľkonásobok vstupných nákladov.

Sú dva spôsoby, ako to zvládnuť. Prvým je rekapitulácia: stlačenie starších kôl do jedného rekapitulačného bloku, pričom len posledných pár kôl zostane v surovom stave. Druhým je rýchle ukladanie do vyrovnávacej pamäte (jednotka 6): čítanie pevného kontextu za desatinu ceny namiesto jeho opakovaného spracovania za plnú cenu. Spoločne výrazne znižujú účet za dlhé, kontextovo náročné úlohy. Tokenová ekonomika je teda o dizajne celej relácie, nie o jedinej požiadavke.

V súhrne

Token je najmenšia jednotka, v ktorej sa spracováva text; vstup a výstup sú oceňované oddelene a výstup je často oveľa drahší. Cena je počet tokenov vynásobený jednotkovou cenou a skutočné rozhodnutie sa robí podľa objemu. Skrátenie výzvy, obmedzenie výkonu a výber najľahšieho modelu, ktorý splní úlohu, sú najpriamejšie páky, ktoré mnohonásobne znižujú náklady.

Aplikačná úloha

Vyberte si vlastnú úlohu. (1) Určite počet vstupných a odhadovaných výstupných tokenov pre reprezentatívnu výzvu (ak je to možné, zmerajte pomocou nástroja na počítanie tokenov). (2) Vypočítajte náklady na žiadosť pre tri modelové triedy. (3) Odhadnite svoj denný počet žiadostí a odvodite mesačný rozpočet pre tri modely. (4) Pridajte pokyn na skrátenie výkonu a poznamenajte si očakávané úspory.

kontrolný zoznam

  • [ ] Viem vysvetliť koncept tokenov a to, že tokenizácia sa líši v závislosti od modelu.
  • [ ] Viem, prečo majú vstupné a výstupné tokeny rozdielne ceny.
  • [ ] Viem vypočítať náklady na žiadosť podľa vzorca.
  • [ ] Môžem vytvoriť mesačný rozpočet pre pracovné zaťaženie pomocou šablóny.
  • [ ] Na príklade môžem ukázať prínos skrátenia výkonu a zmenšenia modelu.