Gevinster:
- Forklar begrebet token, input/output token distinktion og tokenization.
- Kan beregne prisen på en anmodning og en månedlig arbejdsbyrde ud fra antallet af tokens og enhedsprisen
- Kan sammenligne indflydelsen af modelvalg og hurtig længde på omkostningerne
Du kan ikke bygge en løsning i stor skala uden at forstå økonomien ved LLM API'er. En demo kører én gang; Det vigtigste er at kunne forudsige, hvad regningen bliver, når der foretages tusindvis af opkald om måneden. I denne enhed opsætter vi pengesiden af tingene: hvad er et token, hvorfor input og output prissættes forskelligt, hvordan man beregner omkostningerne ved en anmodning, og hvordan man budgetterer en månedlig arbejdsbyrde. Denne information giver dig mulighed for at måle returneringen af optimeringsteknikker (caching, modelvalg, batch) i efterfølgende enheder.
Hvad er Token?
Token er den mindste enhed, som modellen behandler tekst i. Et ord er ikke altid et tegn; token er normalt en del af et ord. Groft sagt er 1 token på engelsk ≈ 4 tegn ≈ 0,75 ord. På tyrkisk og kode varierer forholdet: Tyrkiske ord er ofte opdelt i flere tokens end på engelsk på grund af dets suffiksstruktur og alfabet. Derfor er det nødvendigt at måle antallet af tokens med udbyderens token-tælleværktøj frem for at gætte med øjet.
Tokenisering (processen med at opdele tekst i tokens) kan være forskellig for hver model. Dette har to praktiske konsekvenser: (1) Den samme tekst kan give forskellige antal tokens i forskellige modeller; (2) Forudsigelser lavet med tokenizere fra andre udbydere (f.eks. OpenAIs tiktoken-bibliotek) vil være unøjagtige for Claude – brug tippet til tokentælling til den model, du bruger.
Tip: "Om hvor mange tokens?" Svar ikke blindt på spørgsmålet. Send en repræsentativ tekst gennem token counting API; Baser budgetbeslutninger på måling.
Input og Output Tokens
Fakturaen består af to poster:
- Input-tokens: Alt, hvad du sender til modellen - systemprompt, tidligere rundvisninger, brugermeddelelse, dokumentation, hvis nogen. Disse behandles på én gang.
- Output-tokens: Responsen produceret af modellen. For hvert output-token udfører modellen beregningen trin for trin.
Hos de fleste udbydere er output flere gange dyrere end input. Årsagen er enkel: at læse input på én gang er billigere end at producere output token-by-token. At kende denne asymmetri forklarer, hvorfor optimeringer som "kræver kortfattede svar" er så effektive.
Prøvepriser (pr. 1 million tokens, USD)
Tabellen nedenfor er en reference; Priserne kan ændre sig over tid, bekræft venligst din egen udbyders aktuelle liste.
modelklasse
prøvemodel
Input ($/1 mio.)
Output ($/1 mio.)
Typisk brug
hurtig/billig
Haiku 4.5
1.00
5.00
Klassificering, mærkning, simpel opsummering
afbalanceret
sonet 5
3.00
15.00
Generelt formål, kodning, agentarbejde
stærk
Opus 4.8
5.00
25.00
Komplekse ræsonnementer, langsigtede opgaver
I hver klasse er output 5 gange input; Desuden er selv input fra den kraftfulde model 5 gange input fra den billige model. Disse to akser (input↔output og modelklasse) danner rammen om dine omkostningsbeslutninger.
Hvordan beregner man omkostninger?
Formlen er enkel:
pris = (input_token / 1.000.000) × input_price + (output_token / 1.000.000) × output_price
Eksempel på konto. En anmodning med Sonnet 5: 1.500 input-tokens, 400 output-tokens.
input = 1.500 / 1.000.000 × 3,00 = $ 0,0045 output = 400 / 1.000.000 × 15,00 = $ 0,0060 i alt = $ 0,0105 (ca. 1 cent)
Et opkald ser billigt ud. Men multiplicer med volumen: 20.000 opkald pr. dag → $210 pr. dag, ~$6.300 pr. måned. Det er her skalaen spiller ind.
Månedligt budget skabelon
Brug denne skabelon for at udtrække de månedlige omkostninger for en arbejdsbyrde:
1) Gennemsnitlig input-token pr. anmodning: ......2) Gennemsnitlig output-token pr. anmodning: ......3) Antal forespørgsler pr. dag: ......4) Arbejdsdage pr. måned: ......5) Pris pr.
At hælde dette mønster ind i et regneark og se, hvordan summen udspiller sig, når du ændrer modellen, inkorporerer beslutningerne om modelvalg (enhed 5) og cache (enhed 6).
Forkortelse af prompten med kopierbare skabeloner
De fleste af omkostningerne kommer fra unødvendigt lange opfordringer og spildt output. Skabelonerne nedenfor giver direkte besparelser.
# Begræns outputlængde. Svar med max 3 punkter. Tilføj en begrundelse eller indledende sætning.
# Returner kun det anmodede felt Returner kun følgende JSON, tilføj ikke anden tekst:{"category": "...", "urgency": "low|medium|high"}
# Fjern unødvendig kontekstFjern kun dato og beløb fra følgende tekst. Gentag ikke hele teksten.Tekst: """{{text}}"""
# Opsummer den lange tale (besparelse af input) Opsummer denne tale i 5 punkter. Jeg vil bruge dette resumé i stedet for hele fortiden i de efterfølgende runder. Tale: """{{past}}"""
Svag prompt / stærk prompt (med hensyn til omkostninger)
# SWAG (frigiver output, dyrt) Analyser denne supportanmodning og skriv en omfattende anmeldelse til mig.
# STÆRK (begrænser output, billig og forudsigelig) Klassificer denne supportanmodning. Bare returner følgende JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Skriv ikke en beskrivelse.
Den svage version producerer måske 500 output-tokens; stærk version ~15. Fordi output er dyrt, er dette en betydelig forskel pr. opkald og ganges med volumen.
Tre mini etuier
Case 1 — De skjulte omkostninger ved den lange prompt. Da en regnskabsautomatisering sorterede hver faktura, tilføjede den en 40-siders "regelbog" som input til hver anmodning: ~12.000 input-tokens pr. anmodning. Med Sonnet 5 12.000/1M×3 = $0,036 lige indtastet. 5.000 regninger pr. dag → $180 pr. dag. Ved at cache regelbogen (enhed 6) faldt inputomkostningerne med ~90 %.
Case 2 — Gevinsten ved at reducere modellen. Et hold lavede simpel "positiv/negativ" følelsesmærkning med Opus 4.8: 300 input + 10 output-tokens. Opus koster 300/1M×5 + 10/1M×25 = $0,00175. Skift til Haiku, 300/1M×1 + 10/1M×5 = $0,00035 — 5x billigere, forskellen i nøjagtighed var umådelig. På 3 millioner opkald om måneden er forskellen $5.250 → $1.050.
Tilfælde 3 — Frigivelse af output. Når et marketingteam udarbejdede en produktbeskrivelse, satte det ingen grænser for output; modellen sagde nogle gange 1.500 tokens. Da jeg tilføjede "60 ord maksimum" instruktionen, faldt den gennemsnitlige output fra 900 til 90 tokens. Da udskrivning var dyrt, blev den månedlige regning reduceret med en tredjedel, og tekster blev mere nyttige.
Almindelige fejl
- Gætte symbolet med øjet: Du kan tage fejl, især på tyrkisk og kode. Måle.
- Forudsat at input og output er det samme: Output er normalt meget dyrere; Det meste af optimeringen kommer fra at forkorte output.
- Lad dig ikke narre af det billige ved et enkelt opkald: Beslutningen træffes efter volumen. $0,01 × million = $10.000.
- Forudsigelse med en anden udbyders tokenizer: Giver forkerte resultater; Brug modellens token tælleværktøj.
- Ubegrænset udvidelse af samtalehistorikken: Hver runde føjes til indgangen; opsummere i lange samtaler.
- Holder `max_tokens` unødigt højt: Skjuler budgetplanen og risikoen for at blive skåret; Giv en realistisk værdi.
Dybere: kontekstvindue og lange inputomkostninger
Det er vigtigt at se, hvordan prisen hænger sammen "på tværs af samtalen" og ikke kun "pr. anmodning." Den samlede mængde tekst, som modellen kan behandle, kaldes kontekstvinduet; Summen af input og output skal passe ind i dette vindue. Moderne modeller tilbyder meget store vinduer (hundrede af tusinder, endda millioner af tokens), men det betyder ikke, at du kan "fylde det uendeligt" - uanset hvad du sætter ind i vinduet faktureres som input.
Fælden i lange samtaler er denne: Med hver ny runde sender du hele historien igen (statsløshed i enhed 1). I en samtale på 20 runder bærer den 20. anmodning hele de første 19 runder som input. Efterhånden som samtalen bliver længere, vokser prisen pr. anmodning kumulativt snarere end lineært. En samtale på 50 runder med en agentassistent kan give inputomkostninger dusinvis af gange den første runde.
Der er to måder at håndtere dette på. Den første er recap: at komprimere ældre runder til en enkelt opsummeringsblok, så kun de sidste par runder holdes rå. Den anden er prompt caching (enhed 6): læsning af den faste kontekst til en tiendedel af prisen i stedet for gentagne gange at behandle den til den fulde pris. Tilsammen reducerer de regningen på lange, kontekstkrævende arbejdsbyrder markant. Så symbolsk økonomi handler om designet af hele sessionen, ikke en enkelt anmodning.
Sammenfattende
Token er den mindste enhed, som tekst behandles i; input og output prissættes separat, og output er ofte meget dyrere. Prisen er antallet af tokens ganget med enhedsprisen, og den reelle beslutning træffes efter volumen. At forkorte prompten, begrænse outputtet og vælge den letteste model, der udfører opgaven, er de mest direkte håndtag, der reducerer omkostningerne mange gange.
Ansøgningsopgave
Vælg din egen opgave. (1) Bestem antallet af input- og estimerede output-tokens for en repræsentativ prompt (mål med et token-tælleværktøj, hvis det er muligt). (2) Beregn prisen pr. anmodning for de tre modelklasser. (3) Estimer dit daglige antal anmodninger og udled det månedlige budget for de tre modeller. (4) Tilføj en instruktion for at forkorte output og noter de forventede besparelser.
tjekliste
- [ ] Jeg kan forklare begrebet tokens, og at tokenisering varierer afhængigt af modellen.
- [ ] Jeg ved, hvorfor input- og output-tokens prissættes forskelligt.
- [ ] Jeg kan beregne prisen på en anmodning med formlen.
- [ ] Jeg kan oprette et månedligt budget for en arbejdsbyrde ved hjælp af en skabelon.
- [ ] Jeg kan med et eksempel vise fordelen ved at forkorte output og modelreduktion.