zisky:
- Vysvětlete pojem token, rozlišení vstupních/výstupních tokenů a tokenizace.
- Dokáže vypočítat náklady na požadavek a měsíční zátěž z počtu tokenů a jednotkové ceny
- Dokáže porovnat dopad výběru modelu a okamžité délky na náklady
Bez pochopení ekonomiky LLM API nemůžete vytvořit řešení ve velkém měřítku. Demo se spustí jednou; Hlavní je umět předvídat, jaký bude účet při tisících hovorů měsíčně. V této jednotce nastavujeme peněžní stránku věcí: co je token, proč jsou vstupy a výstupy oceněny odlišně, jak vypočítat náklady na požadavek a jak rozpočítat měsíční pracovní zátěž. Tyto informace umožňují měřit návratnost optimalizačních technik (cachování, výběr modelu, dávka) v následujících jednotkách.
Co je Token?
Token je nejmenší jednotka, ve které model zpracovává text. Slovo není vždy symbolem; token je obvykle součástí slova. Zhruba řečeno, v angličtině je 1 token ≈ 4 znaky ≈ 0,75 slova. V turečtině a kódu se poměr liší: turecká slova jsou často rozdělena na více tokenů než v angličtině kvůli své struktuře a abecedě s příponou. Proto je nutné změřit počet tokenů nástrojem poskytovatele na počítání tokenů spíše než hádat od oka.
Tokenizace (proces dělení textu na tokeny) se může u každého modelu lišit. To má dva praktické důsledky: (1) Stejný text může přinést různé počty žetonů v různých modelech; (2) Předpovědi vytvořené pomocí tokenizérů od jiných poskytovatelů (např. knihovna tiktokenů OpenAI) budou pro Clauda nepřesné – použijte tip na počítání tokenů pro model, který používáte.
Nápověda: "Kolik žetonů?" Neodpovídejte na otázku slepě. Předejte reprezentativní text prostřednictvím rozhraní API pro počítání tokenů; Rozhodování o rozpočtu založte na měření.
Vstupní a výstupní tokeny
Faktura se skládá ze dvou položek:
- Vstupní tokeny: Cokoli, co pošlete do modelu – systémová výzva, minulé prohlídky, uživatelská zpráva, dokumentace, pokud existuje. Ty se zpracovávají všechny najednou.
- Výstupní tokeny: Odezva vytvořená modelem. Pro každý výstupní token model provádí výpočet krok za krokem.
U většiny poskytovatelů je výstup několikanásobně dražší než vstup. Důvod je jednoduchý: čtení vstupu najednou je levnější než vytváření výstupního tokenu po tokenu. Znalost této asymetrie vysvětluje, proč jsou optimalizace jako „vyžadují stručné odpovědi“ tak účinné.
Ukázkové ceny (za 1 milion tokenů, USD)
Níže uvedená tabulka je referenční; Ceny se mohou v průběhu času měnit, potvrďte prosím aktuální seznam svého vlastního poskytovatele.
modelová třída
ukázkový model
Vstup ($/1 milion)
Výstup ($/1 milion)
Typické použití
rychle/levně
Haiku 4.5
1,00
5,00
Klasifikace, označování, jednoduché shrnutí
vyvážený
sonet 5
3,00
15:00
Obecný účel, kódování, práce agenta
silný
Opus 4.8
5,00
25:00
Složité uvažování, úkoly s dlouhým dosahem
V každé třídě je výstup 5násobkem vstupu; Navíc i příkon výkonného modelu je 5krát vyšší než příkon levného modelu. Tyto dvě osy (vstup↔výstup a modelová třída) tvoří rámec vašich rozhodnutí o nákladech.
Jak vypočítat náklady?
Vzorec je jednoduchý:
náklady = (vstupní_token / 1 000 000) × vstupní_cena + (výstupní_token / 1 000 000) × výstupní_cena
Ukázkový účet. Požadavek se Sonnetem 5: 1 500 vstupních tokenů, 400 výstupních tokenů.
vstup = 1 500 / 1 000 000 × 3,00 = 0,0045 $ výstup = 400 / 1 000 000 × 15,00 = 0,0060 $ celkem = 0,0105 $ (asi 1 cent)
Jeden hovor vypadá levně. Ale vynásobte objemem: 20 000 hovorů za den → 210 $ za den, ~ 6 300 $ za měsíc. Zde vstupuje do hry měřítko.
Šablona měsíčního rozpočtu
Chcete-li extrahovat měsíční náklady na pracovní zátěž, použijte tuto šablonu:
1) Průměrný vstupní token na požadavek: ......2) Průměrný výstupní token na požadavek: ......3) Počet požadavků za den: ......4) Odpracované dny za měsíc: ......5) Náklady na požadavek = (1)/1M×vstupní_cena + (2)/1M×výstupní_cena6) Měsíční náklady = (5) × (3) × (4)
Nalití tohoto vzoru do tabulky a sledování, jak se součet projeví při změně modelu, ztělesňuje rozhodnutí o výběru modelu (jednotka 5) a mezipaměti (jednotka 6).
Zkrácení výzvy pomocí kopírovatelných šablon
Většina nákladů pochází ze zbytečně dlouhých výzev a zbytečných výstupů. Níže uvedené šablony poskytují přímé úspory.
# Omezte výstupní délku. Odpovězte maximálně 3 položkami. Přidejte zdůvodnění nebo úvodní větu.
# Vraťte pouze požadované pole Vraťte pouze následující JSON, nepřidávejte žádný další text:{"category": "...", "urgence": "low|medium|high"}
# Odstraňte zbytečný kontextZ následujícího textu odstraňte pouze datum a částku. Neopakujte celý text.Text: """{{text}}"""
# Shrnutí dlouhé řeči (úspora vstupu) Shrnutí této řeči do 5 položek. Toto shrnutí použiji místo úplné minulosti v dalších kolech. Řeč: """{{minulý}}"""
Slabá výzva / silná výzva (z hlediska ceny)
# SLABÝ (uvolňuje výstup, drahé) Analyzujte tuto žádost o podporu a napište mi komplexní recenzi.
# SILNÝ (omezuje výstup, je levný a předvídatelný) Klasifikujte tento požadavek na podporu. Stačí vrátit následující JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Nepište popis.
Slabá verze produkuje možná 500 výstupních tokenů; silná verze ~15. Protože výstup je drahý, jde o významný rozdíl na hovor a násobí se s objemem.
Tři mini pouzdra
Případ 1 – Skrytá cena dlouhé výzvy. Když automatizace účetnictví třídila každou fakturu, přidala ke každému požadavku 40stránkovou „knihu pravidel“ jako vstup: ~12 000 vstupních tokenů na požadavek. Se Sonetem 5 12 000/1M×3 = 0,036 $ právě zadáno. 5 000 bankovek za den → 180 $ za den. Uložením knihy pravidel (jednotka 6) do mezipaměti klesly vstupní náklady o ~90 %.
Případ 2 — Výplata zmenšení modelu. Jeden tým prováděl jednoduché značkování „pozitivních/negativních“ sentimentů s Opus 4.8: 300 vstupních + 10 výstupních tokenů. Opus stál 300/1M×5 + 10/1M×25 = 0,00175 $. Přechod na Haiku, 300/1M×1 + 10/1M×5 = 0,00035 $ — 5x levnější, rozdíl v přesnosti byl neměřitelný. Při 3 milionech hovorů za měsíc je rozdíl 5 250 $ → 1 050 $.
Případ 3 — Uvolnění výstupu. Když marketingový tým vytvořil popis produktu, nestanovil žádná omezení na výstup; model někdy říkal 1500 žetonů. Když jsem přidal instrukci „60 slov maximum“, průměrný výstup klesl z 900 na 90 tokenů. Protože tisk byl drahý, měsíční účet se snížil o třetinu a texty se staly užitečnějšími.
Časté chyby
- Hádání tokenu podle oka: Mýlit se můžete zejména v turečtině a kódu. Opatření.
- Za předpokladu, že vstup a výstup jsou stejné: Výstup je obvykle mnohem dražší; Většina optimalizace pochází ze zkrácení výstupu.
- Nenechte se zmást laciností jediného hovoru: Rozhodnutí se dělá podle objemu. 0,01 $ × milion = 10 000 $.
- Predikce s tokenizérem jiného poskytovatele: Dává nesprávné výsledky; Použijte nástroj pro počítání žetonů modelu.
- Neomezené rozšiřování historie konverzace: Každé kolo je přidáno k záznamu; shrnout v dlouhých rozhovorech.
- Udržování `max_tokens` zbytečně vysoko: Skryje plán rozpočtu a riziko snížení; Dejte realistickou hodnotu.
Deeper: Kontextové okno a dlouhé vstupní náklady
Je důležité vidět, jak se cena hromadí „v rámci konverzace“ a ne pouze „na žádost“. Celkové množství textu, které může model zpracovat, se nazývá kontextové okno; Součet vstupu a výstupu se musí vejít do tohoto okna. Moderní modely nabízejí velmi velká okna (stovky tisíc, dokonce miliony tokenů), ale to neznamená, že je můžete „plnit donekonečna“ – vše, co do okna vložíte, je účtováno jako vstup.
Past v dlouhých rozhovorech je následující: s každým dalším kolem posíláte celou historii znovu (bezstátí v jednotce 1). V konverzaci o 20 kolech obsahuje 20. požadavek jako vstup celých prvních 19 kol. Jak se tedy konverzace prodlužuje, cena za požadavek roste spíše kumulativně než lineárně. 50kolová konverzace s asistentem agenta může v prvním kole přinést několikanásobné vstupní náklady.
Existují dva způsoby, jak to zvládnout. První je rekapitulace: komprimace starších kol do jednoho rekapitulačního bloku, přičemž pouze posledních několik kol zůstane nezpracovaných. Druhým je rychlé ukládání do mezipaměti (jednotka 6): čtení pevného kontextu za desetinu ceny místo jeho opakovaného zpracování za plnou cenu. Společně výrazně snižují účet za dlouhé, kontextově náročné úlohy. Ekonomika tokenů je tedy o designu celé relace, nikoli o jediném požadavku.
V souhrnu
Token je nejmenší jednotka, ve které se zpracovává text; vstup a výstup se oceňují samostatně a výstup je často mnohem dražší. Cena je počet tokenů vynásobený jednotkovou cenou a skutečné rozhodnutí je učiněno podle objemu. Zkrácení výzvy, omezení výkonu a výběr nejlehčího modelu, který splní úkol, jsou nejpřímější páky, které mnohonásobně snižují náklady.
Aplikační úkol
Vyberte si svůj vlastní úkol. (1) Určete počet vstupních a odhadovaných výstupních tokenů pro reprezentativní výzvu (pokud je to možné, změřte pomocí nástroje pro počítání tokenů). (2) Vypočítejte náklady na žádost pro tři modelové třídy. (3) Odhadněte svůj denní počet požadavků a odvoďte měsíční rozpočet pro tři modely. (4) Přidejte pokyn ke zkrácení výkonu a poznamenejte si očekávané úspory.
kontrolní seznam
- [ ] Dokážu vysvětlit koncept tokenů a to, že tokenizace se liší v závislosti na modelu.
- [ ] Vím, proč mají vstupní a výstupní tokeny rozdílnou cenu.
- [ ] Mohu vypočítat náklady na žádost pomocí vzorce.
- [ ] Mohu vytvořit měsíční rozpočet pro pracovní zátěž pomocí šablony.
- [ ] Na příkladu mohu ukázat přínos zkrácení výkonu a zmenšení modelu.