Ganhos:
- Explique o conceito de token, distinção de token de entrada/saída e tokenização.
- Pode calcular o custo de uma solicitação e uma carga de trabalho mensal a partir do número de tokens e do preço unitário
- Pode comparar o impacto da seleção do modelo e do comprimento imediato no custo
Você não pode construir uma solução em escala sem compreender a economia das APIs LLM. Uma demonstração é executada uma vez; O principal é poder prever qual será a conta quando forem feitas milhares de ligações por mês. Nesta unidade, configuramos o lado financeiro: o que é um token, por que a entrada e a saída têm preços diferentes, como calcular o custo de uma solicitação e como orçar uma carga de trabalho mensal. Essas informações permitem medir o retorno das técnicas de otimização (caching, seleção de modelo, lote) nas unidades subsequentes.
O que é token?
Token é a menor unidade na qual o modelo processa texto. Uma palavra nem sempre é um símbolo; token geralmente faz parte de uma palavra. Grosso modo, em inglês, 1 token tem ≈ 4 caracteres ≈ 0,75 palavras. Em turco e no código, a proporção varia: as palavras turcas são frequentemente divididas em mais tokens do que em inglês devido à sua estrutura de sufixo e alfabeto. Portanto, é necessário medir o número de tokens com a ferramenta de contagem de tokens do provedor, em vez de adivinhar a olho nu.
A tokenização (o processo de divisão do texto em tokens) pode ser diferente para cada modelo. Isto tem duas consequências práticas: (1) O mesmo texto pode produzir diferentes números de tokens em diferentes modelos; (2) As previsões feitas com tokenizers de outros provedores (por exemplo, a biblioteca tiktoken da OpenAI) serão imprecisas para Claude — use a dica de contagem de tokens para o modelo que você está usando.
Dica: "Cerca de quantos tokens?" Não responda cegamente à pergunta. Passe um texto representativo pela API de contagem de tokens; Baseie as decisões orçamentárias na medição.
Tokens de entrada e saída
A fatura é composta por dois itens:
- Tokens de entrada: tudo o que você envia ao modelo – prompt do sistema, tours anteriores, mensagem do usuário, documentação, se houver. Eles são processados de uma só vez.
- Tokens de saída: a resposta produzida pelo modelo. Para cada token de saída, o modelo realiza o cálculo passo a passo.
Na maioria dos provedores, a produção é várias vezes mais cara que a entrada. A razão é simples: ler a entrada de uma só vez é mais barato do que produzir a saída token por token. Conhecer essa assimetria explica por que otimizações como “exigir respostas concisas” são tão eficazes.
Preços de amostra (por 1 milhão de tokens, USD)
A tabela abaixo é uma referência; Os preços podem mudar com o tempo, por favor confirme a lista atual do seu próprio fornecedor.
classe de modelo
modelo de amostra
Entrada ($/1 milhão)
Produção ($/1 milhão)
Uso típico
rápido/barato
Haiku 4.5
1,00
5h00
Classificação, rotulagem, resumo simples
equilibrado
soneto 5
3h00
15h00
Uso geral, codificação, trabalho de agente
forte
Opus 4.8
5h00
25h00
Raciocínio complexo, tarefas de longo alcance
Em cada classe, a saída é 5 vezes a entrada; Além disso, mesmo a entrada do modelo poderoso é 5 vezes a entrada do modelo barato. Esses dois eixos (entrada↔saída e classe de modelo) formam a estrutura de suas decisões de custos.
Como calcular o custo?
A fórmula é simples:
custo = (token_de entrada / 1.000.000) × preço_de entrada + (token_de saída / 1.000.000) × preço_de saída
Exemplo de conta. Uma solicitação com Soneto 5: 1.500 tokens de entrada, 400 tokens de saída.
entrada = 1.500 / 1.000.000 × 3,00 = $ 0,0045 saída = 400 / 1.000.000 × 15,00 = $ 0,0060 total = $ 0,0105 (cerca de 1 centavo)
Uma ligação parece barata. Mas multiplique pelo volume: 20.000 chamadas por dia → US$ 210 por dia, aproximadamente US$ 6.300 por mês. É aqui que a escala entra em jogo.
Modelo de orçamento mensal
Para extrair o custo mensal de uma carga de trabalho, use este modelo:
1) Média de token de entrada por solicitação: ......2) Média de token de saída por solicitação: ......3) Número de solicitações por dia: ......4) Dias trabalhados por mês: ......5) Custo por solicitação = (1)/1M×input_price + (2)/1M×output_price6) Custo mensal = (5) × (3) × (4)
Colocar esse padrão em uma planilha e ver como a soma funciona quando você altera o modelo incorpora as decisões de seleção de modelo (unidade 5) e cache (unidade 6).
Encurtando o prompt com modelos copiáveis
A maior parte do custo vem de solicitações desnecessariamente longas e desperdício de produção. Os modelos abaixo proporcionam economia direta.
# Limite o comprimento da saída. Responda com no máximo 3 itens. Adicione uma justificativa ou frase introdutória.
# Retorna apenas o campo solicitado Retorna apenas o seguinte JSON, não adicione nenhum outro texto:{"categoria": "...", "urgência": "low|medium|high"}
# Remova contexto desnecessárioRemova apenas a data e o valor do texto a seguir. Não repita o texto inteiro.Texto: """{{text}}"""
# Resuma o discurso longo (salvamento de entrada) Resuma esse discurso em 5 itens. Usarei este resumo em vez do passado completo nas rodadas subsequentes. Discurso: """{{passado}}"""
Alerta fraco / Alerta forte (em termos de custo)
# FRACO (saída de lançamento, caro)Analise esta solicitação de suporte e escreva-me uma revisão abrangente.
# FORTE (restringe a produção, é barato e previsível)Classifique esta solicitação de suporte. Basta retornar o seguinte JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}Não escreva uma descrição.
A versão fraca produz talvez 500 tokens de saída; versão forte ~15. Como a produção é cara, essa é uma diferença significativa por chamada e se multiplica pelo volume.
Três Mini Estojos
Caso 1 — O custo oculto do prompt longo. À medida que uma automação contábil classificava cada fatura, ela adicionava um “livro de regras” de 40 páginas como entrada para cada solicitação: aproximadamente 12.000 tokens de entrada por solicitação. Com o Soneto 5 12.000/1M×3 = $0,036 recém-inseridos. 5.000 contas por dia → $ 180 por dia. Ao armazenar em cache o livro de regras (unidade 6), o custo de entrada caiu cerca de 90%.
Caso 2 — A recompensa de reduzir o modelo. Uma equipe estava fazendo uma marcação simples de sentimento “positivo/negativo” com o Opus 4.8: 300 tokens de entrada + 10 tokens de saída. Opus custa 300/1M×5 + 10/1M×25 = $0,00175. Mudando para o Haiku, 300/1M×1 + 10/1M×5 = $0,00035 – 5x mais barato, a diferença na precisão era imensurável. Em 3 milhões de ligações por mês, a diferença é de US$ 5.250 → US$ 1.050.
Caso 3 — Liberando a saída. Quando uma equipe de marketing produzia uma descrição de produto, ela não estabelecia limites de produção; o modelo às vezes dizia 1.500 tokens. Quando adicionei a instrução "máximo de 60 palavras", a saída média caiu de 900 para 90 tokens. Como a impressão era cara, a fatura mensal foi reduzida em um terço e os textos tornaram-se mais úteis.
Erros comuns
- Adivinhando o token a olho nu: você pode estar errado, especialmente em turco e no código. Medir.
- Supondo que a entrada e a saída sejam iguais: a produção geralmente é muito mais cara; A maior parte da otimização vem da redução da produção.
- Não se deixe enganar pelo preço baixo de uma única ligação: a decisão é tomada por volume. US$ 0,01 × milhão = US$ 10.000.
- Predição com tokenizer de outro provedor: Fornece resultados incorretos; Use a ferramenta de contagem de tokens do modelo.
- Ampliação ilimitada do histórico de conversas: Cada rodada é adicionada à entrada; resumir em longas conversas.
- Manter `max_tokens` desnecessariamente altos: Esconde o plano orçamentário e o risco de ser cortado; Dê um valor realista.
Mais profundo: janela de contexto e custo de entrada longo
É fundamental ver como o preço se acumula “durante a conversa” e não apenas “por solicitação”. A quantidade total de texto que o modelo pode processar é chamada de janela de contexto; A soma de entrada e saída deve caber nesta janela. Os modelos modernos oferecem janelas muito grandes (centenas de milhares, até milhões de tokens), mas isso não significa que você pode “preenchê-las infinitamente” – tudo o que você colocar na janela será cobrado como entrada.
A armadilha nas longas conversas é esta: a cada nova rodada você envia novamente toda a história (apatridia na unidade 1). Em uma conversa de 20 rodadas, a 20ª solicitação carrega todas as primeiras 19 rodadas como entrada. Assim, à medida que a conversa se prolonga, o custo por solicitação aumenta cumulativamente e não linearmente. Uma conversa de 50 rodadas com um assistente de agente pode produzir custos de insumos dezenas de vezes maiores que os da primeira rodada.
Existem duas maneiras de gerenciar isso. A primeira é a recapitulação: comprimir as rodadas mais antigas em um único bloco de recapitulação, mantendo apenas as últimas rodadas brutas. O segundo é o cache imediato (unidade 6): ler o contexto fixo por um décimo do preço, em vez de processá-lo repetidamente pelo preço total. Juntos, eles reduzem significativamente a conta de cargas de trabalho longas e com uso intensivo de contexto. Portanto, a economia simbólica trata do design de toda a sessão, não de uma única solicitação.
Em resumo
Token é a menor unidade na qual o texto é processado; a entrada e a produção são cobradas separadamente e a produção costuma ser muito mais cara. O custo é o número de tokens multiplicado pelo preço unitário, e a verdadeira decisão é tomada pelo volume. Encurtar o prompt, limitar a produção e escolher o modelo mais leve que realiza a tarefa são as alavancas mais diretas que reduzem muitas vezes o custo.
Tarefa de aplicativo
Escolha uma tarefa de sua preferência. (1) Determine o número de tokens de entrada e de saída estimados para um prompt representativo (meça com uma ferramenta de contagem de tokens, se possível). (2) Calcule o custo por solicitação para as três classes de modelo. (3) Estime seu número diário de solicitações e obtenha o orçamento mensal para os três modelos. (4) Adicione uma instrução para reduzir a produção e observe as economias esperadas.
lista de verificação
- [ ] Posso explicar o conceito de tokens e que a tokenização varia dependendo do modelo.
- [] Eu sei por que os tokens de entrada e saída têm preços diferentes.
- [] Posso calcular o custo de uma solicitação com a fórmula.
- [] Posso criar um orçamento mensal para uma carga de trabalho usando um modelo.
- [ ] Posso mostrar com um exemplo o benefício de encurtar a produção e a redução do modelo.