Ganhos:
- Capacidade de ler preços de token de entrada/saída e itens de fatura
- Capacidade de estimar o custo mensal de um fluxo de trabalho com uma fórmula aproximada
- Implementação de métodos de redução de custos, como armazenamento em cache, processamento em lote e preparação de modelo
Ser capaz de estimar quanto custará um modelo é uma das habilidades mais práticas do tomador de decisão. "Quanto eu pago mensalmente?" Se não conseguir responder à pergunta, não poderá planear um orçamento nem escolher o nível certo. A boa notícia é que o preço é mais simples do que parece e, quando você pegar o jeito, poderá fazer uma estimativa aproximada por conta própria. Nesta unidade, você aprenderá como ler os preços dos tokens de entrada/saída, estimar o custo mensal de um fluxo de trabalho com uma fórmula simples e métodos que realmente reduzem custos.
Regra prática: entrada e saída são cobradas separadamente
Nos modelos de peso fechado, o preço é calculado com base na quantidade de tokens processados e há dois itens separados:
- Token de entrada (entrada): O texto que você envia ao modelo. Seu prompt, seus documentos, suas amostras.
- Token de saída: a resposta que o modelo produz para você.
Ponto crítico: O token de saída costuma ser várias vezes mais caro que o token de entrada. Isso ocorre porque é computacionalmente mais caro para o modelo produzir resultados. Por exemplo, em um modelo, a entrada pode ser de US$ 3 por milhão de tokens, enquanto a saída pode ser de US$ 15; Portanto, a produção é cinco vezes mais cara. Isso significa que respostas longas e desnecessárias podem rapidamente consumir o orçamento.
Dica: Uma das maneiras mais fáceis de reduzir custos é não pedir ao modelo respostas desnecessariamente longas. Restrições como “máximo 5 artigos”, “parágrafo único”, “exportar apenas a tabela” aumentam a qualidade e salvam o token de saída.
Exemplos de preços atuais
Abaixo estão os preços aproximados de vários modelos (por milhão de tokens, dólares americanos). Estes valores pertencem ao período em que este módulo foi elaborado e mudam frequentemente; Verifique a página de preços atual do fornecedor para a decisão exata.
modelo
Palco
Insira $/1 milhão
Saída $/1 milhão
Cláudio Opus 4.8
forte
~5
~25
Claude Soneto 5
equilibrado
~3
~15
Claude Haiku 4.5
leve
~1
~5
Conforme visto na tabela, pode haver uma diferença de preço de até cinco vezes entre o nível forte e o nível leve. É por isso que a abordagem do “modelo mais adequado para todos os negócios” costuma ser um desperdício de dinheiro. Ter o trabalho simples realizado por um modelo barato e o trabalho difícil por um modelo poderoso proporciona grande economia sem perda de qualidade. Aprofundaremos essa ideia nas unidades 7 e 9.
Estimando o custo mensal: fórmula simples
Para uma estimativa aproximada de custo mensal, você pode usar esta fórmula:
Custo mensal ≈ (Número de solicitações por mês × Token de entrada médio × Preço de entrada / 1.000.000)+ (Número de solicitações por mês × Token de saída médio × Preço de saída / 1.000.000)
Vamos dar um exemplo. Digamos que uma equipe de comércio eletrônico produza 50.000 descrições de produtos por mês. Cada solicitação envia em média 500 tokens de entrada (informações do produto) e recebe 300 tokens de saída (descrição). Em um modelo balanceado (entrada ~3, saída ~15):
- Custo de entrada: 50.000 × 500 × 3 / 1.000.000 = $ 75
- Custo de produção: 50.000 × 300 × 15 / 1.000.000 = $ 225
- Total ≈ US$ 300/mês
Se eles fizessem o mesmo trabalho em um modelo leve (entrada ~1, saída ~5):
- Entrada: 50.000 × 500 × 1/1.000.000 = US$ 25
- Produção: 50.000 × 300 × 5 / 1.000.000 = $ 75
- Total ≈ US$ 100/mês
Portanto, apenas a seleção do estágio pode reduzir o mesmo trabalho de US$ 300 para US$ 100. Para uma tarefa relativamente simples, como a descrição de um produto, o modelo leve costuma ser mais que suficiente.
Cuidado: Esta fórmula é uma estimativa aproximada; o faturamento real varia de acordo com fatores como uso de cache, novas tentativas e modo de raciocínio. Ainda assim, é um bom começo para obter uma confirmação de orçamento ou comparar dois modelos. É melhor medir o número real com um pequeno piloto antes de tomar uma decisão.
Cinco métodos para reduzir custos
- Escolha o nível certo. Modelo simples e leve. Esta é a maior fonte de poupança.
- Torne a entrada menor. Em vez de preencher documentos enormes para cada solicitação, envie apenas a seção relevante (otimização de contexto na unidade 5).
- Limite a produção. Esclareça a extensão e o formato da resposta; Resposta desnecessariamente longa = custo desnecessário.
- Use cache. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Isso proporciona uma economia significativa se você enviar a mesma instrução grande milhares de vezes.
- Execute o processamento em lote. Se você não tem pressa, as opções em “lote”, que enviam muitas solicitações em massa e as processam com desconto, reduzem significativamente o custo.
Três casos realistas
Caso 1 — Economia com mudança de etapa. Uma equipe de atendimento ao cliente estava resumindo todos os e-mails recebidos com o modelo mais forte, e sua fatura mensal era de aproximadamente US$ 900. Resumir foi uma tarefa simples; Quando eles mudaram para o nível balanceado, a qualidade da saída permaneceu quase a mesma, mas a conta caiu para aproximadamente US$ 250. Economia de aproximadamente US$ 7.800 por ano, apenas escolhendo o nível certo.
Caso 2 — Salvando com cache. Uma equipe de software estava enviando o mesmo documento de “padrões de codificação” de 8.000 tokens com cada solicitação de revisão de código. 400 solicitações por dia × 8.000 tokens = grande entrada repetitiva. Quando ativaram o recurso de cache, essa partição fixa passou a ser lida de forma muito mais barata e uma parte significativa dos custos de entrada desapareceu.
Caso 3 — Poupança através da limitação da produção. Quando uma equipe de marketing solicitou uma descrição do produto, o modelo produziu parágrafos longos e floridos por vez. Quando adicionaram a restrição “máximo de 60 palavras, parágrafo único”, as explicações tornaram-se mais úteis e o token de saída foi reduzido pela metade. Embora a qualidade aumentasse, o custo diminuía; ganha-ganha.
Alerta Fraco/Prompt Forte
Alerta fraco:
Escreva-me uma boa descrição para este produto. [informações do produto]
A modelo pode escrever o quanto quiser; O token de saída não é controlado.
Alerta poderoso:
Sua função: redator de comércio eletrônico. Produto: [INFORMAÇÕES]. Tarefa: Escreva uma descrição do produto. Restrições: Máximo de 60 palavras, um parágrafo, apelo a clientes não técnicos, contém 2 benefícios + 1 caso de uso. Evite adjetivos sofisticados.
O poderoso prompt controla a qualidade e o comprimento da saída (e, portanto, o custo).
Modelos copiáveis
1. Estimativa de custo mensal:
Faço solicitações de [QUANTIDADE] mensalmente. Média de tokens de entrada ~[NUM], tokens de saída ~[NUM]. Calcule o custo mensal dos seguintes modelos ([MODELO A], [MODELO B]) com a fórmula e compare em uma tabela. Aceitar preços de entrada/saída [PRICES].
Comparação de nível 2:
Meu dever [TAREFA]. Este trabalho realmente requer um modelo poderoso ou um modelo leve/balanceado é suficiente? Avalie em termos de qualidade e custo e sugira 2 níveis para eu fazer um teste piloto.
3. Triagem de redução de custos:
Identifique maneiras de reduzir custos no seguinte fluxo de trabalho: [WORKFLOW]. Escreva a viabilidade e as economias estimadas para cada um dos cabeçalhos de cascata, redução de entrada, limite de saída, cache e processamento em lote.
4. Limitação de saída:
Reescreva o seguinte prompt para reduzir o token de saída sem reduzir a qualidade: "[PROMPT]". Otimize o tamanho, o formato e as repetições desnecessárias.
Erros comuns
- Ignorando a diferença de entrada/saída: Permitir respostas longas sem saber que a saída é muito mais cara.
- O modelo mais poderoso para cada trabalho: Fazer um trabalho simples com um modelo caro e pagar muitas vezes mais desnecessariamente.
- Liberar o comprimento de saída: Conceder permissão de escrita ilimitada ao modelo sem impor qualquer restrição de formato ou comprimento.
- Ignorando cache e lote: Perdendo oportunidades sérias de economia para entradas repetitivas e tarefas não urgentes.
- Pensar que os preços estão atualizados: Basear-se numa tabela de preços antiga e planear o orçamento de forma incorreta; os preços mudam com frequência.
Em resumo
- O preço é calculado com base em tokens; a entrada e a saída são cobradas separadamente e a produção costuma ser várias vezes mais cara.
- Você pode estimar aproximadamente o custo mensal pela fórmula número de solicitações × token médio × preço.
- A seleção correta da etapa por si só pode reduzir o custo muitas vezes.
- Minimização de entrada, limitação de saída, armazenamento em cache e processamento em lote são métodos práticos que reduzem significativamente a conta.
Tarefa de aplicativo
Obtenha os valores de token estimados na unidade anterior. Calcule o custo mensal do seu negócio para dois níveis diferentes com o modelo 1 desta unidade (estimativa de custo mensal). Depois, com o 3º modelo (digitalização de redução de custos), deduza quanta economia cada método pode trazer para o seu fluxo de trabalho. Planeje escolher os dois métodos mais promissores e aplicá-los ao orçamento do próximo mês.
lista de verificação
- [] Eu sei que o token de entrada e saída tem preços separados e a saída é mais cara.
- [] Posso estimar aproximadamente o custo mensal de um fluxo de trabalho com a fórmula simples.
- [ ] Posso mostrar o impacto no custo da escolha do nível certo com um exemplo.
- [ ] Consigo reconhecer cinco métodos de redução de custos e escolher o mais adequado.
- [] Posso reescrever um prompt para reduzir o token de saída.