Unidad 2 / 11

Lógica de precios y tokens

Ganancias:

  • Explique el concepto de token, distinción de token de entrada/salida y tokenización.
  • Puede calcular el costo de una solicitud y una carga de trabajo mensual a partir de la cantidad de tokens y el precio unitario.
  • Puede comparar el impacto de la selección del modelo y la duración del aviso en el costo.

No se puede crear una solución a escala sin comprender los aspectos económicos de las API de LLM. Una demostración se ejecuta una vez; Lo principal es poder predecir cuál será la factura cuando se realicen miles de llamadas al mes. En esta unidad, explicamos el lado monetario de las cosas: qué es un token, por qué los insumos y los productos tienen precios diferentes, cómo calcular el costo de una solicitud y cómo presupuestar una carga de trabajo mensual. Esta información le permite medir el rendimiento de las técnicas de optimización (almacenamiento en caché, selección de modelo, lotes) en unidades posteriores.

¿Qué es la ficha?

Token es la unidad más pequeña en la que el modelo procesa texto. Una palabra no siempre es una señal; El token suele ser parte de una palabra. En términos generales, en inglés, 1 token equivale a ≈ 4 caracteres ≈ 0,75 palabras. En turco y en código, la proporción varía: las palabras turcas a menudo se dividen en más símbolos que en inglés debido a su estructura de sufijos y alfabeto. Por lo tanto, es necesario medir la cantidad de tokens con la herramienta de conteo de tokens del proveedor en lugar de adivinar a simple vista.

La tokenización (el proceso de dividir el texto en tokens) puede ser diferente para cada modelo. Esto tiene dos consecuencias prácticas: (1) El mismo texto puede producir diferentes números de fichas en diferentes modelos; (2) Las predicciones realizadas con tokenizadores de otros proveedores (por ejemplo, la biblioteca tiktoken de OpenAI) serán inexactas para Claude; utilice el consejo de conteo de tokens para el modelo que esté utilizando.

Pista: "¿Aproximadamente cuántas fichas?" No respondas la pregunta a ciegas. Pasar un texto representativo a través de la API de conteo de tokens; Basar las decisiones presupuestarias en la medición.

Tokens de entrada y salida

La factura consta de dos partidas:

  • Tokens de entrada: cualquier cosa que envíe al modelo: aviso del sistema, recorridos anteriores, mensajes de usuario, documentación, si corresponde. Estos se procesan todos a la vez.
  • Tokens de salida: la respuesta producida por el modelo. Para cada token de salida, el modelo realiza el cálculo paso a paso.

Con la mayoría de los proveedores, la producción es varias veces más cara que la entrada. La razón es simple: leer toda la entrada de una vez es más barato que producir la salida token por token. Conocer esta asimetría explica por qué optimizaciones como “requieren respuestas concisas” son tan efectivas.

Precios de muestra (por 1 millón de tokens, USD)

La siguiente tabla es una referencia; Los precios pueden cambiar con el tiempo; confirme la lista actual de su propio proveedor.

clase de modelo

modelo de muestra

Entrada ($/1 millón)

Producción ($/1 millón)

Uso típico

rápido/barato

Haikú 4.5

1.00

5.00

Clasificación, etiquetado, resumen sencillo.

equilibrado

soneto 5

3.00

15.00

Propósito general, codificación, trabajo de agente.

fuerte

Obra 4.8

5.00

25.00

Razonamiento complejo, tareas de largo alcance.

En cada clase, la salida es 5 veces la entrada; Además, incluso la entrada del modelo potente es 5 veces la entrada del modelo barato. Estos dos ejes (entrada↔salida y clase de modelo) forman el marco de sus decisiones de costos.

¿Cómo calcular el costo?

La fórmula es sencilla:

costo = (token_entrada / 1.000.000) × precio_entrada + (token_salida / 1.000.000) × precio_salida

Cuenta de muestra. Una solicitud con Sonnet 5: 1500 tokens de entrada, 400 tokens de salida.

entrada = 1.500 / 1.000.000 × 3,00 = $0,0045 salida = 400 / 1.000.000 × 15,00 = $0,0060 total = $0,0105 (alrededor de 1 centavo)

Una llamada parece barata. Pero multiplique por el volumen: 20.000 llamadas por día → $210 por día, ~$6.300 por mes. Aquí es donde entra en juego la escala.

Plantilla de presupuesto mensual

Para extraer el costo mensual de una carga de trabajo, utilice esta plantilla:

1) Token de entrada promedio por solicitud: ......2) Token de salida promedio por solicitud: ......3) Número de solicitudes por día: ......4) Días trabajados por mes: ......5) Costo por solicitud = (1)/1M×precio_entrada + (2)/1M×precio_salida6) Costo mensual = (5) × (3) × (4)

Verter este patrón en una hoja de cálculo y ver cómo se desarrolla la suma cuando se cambia el modelo encarna las decisiones de selección del modelo (unidad 5) y caché (unidad 6).

Acortar el mensaje con plantillas copiables

La mayor parte del costo proviene de indicaciones innecesariamente largas y producción desperdiciada. Las plantillas siguientes proporcionan ahorros directos.

# Limitar la longitud de salida. Responda con un máximo de 3 ítems. Agregue una justificación o una oración introductoria.

# Devuelve solo el campo solicitado Devuelve solo el siguiente JSON, no agregue ningún otro texto:{"category": "...", "urgency": "low|medium|high"}

# Eliminar contexto innecesarioElimine solo la fecha y el monto del siguiente texto. No repetir todo el texto.Texto: """{{text}}"""

# Resume el discurso largo (guardado de entrada) Resume este discurso en 5 elementos. Usaré este resumen en lugar del pasado completo en rondas posteriores. Discurso: """{{pasado}}"""

Aviso débil / Aviso fuerte (en términos de costo)

# DÉBIL (publica resultados, costoso) Analice esta solicitud de soporte y escríbame una reseña completa.

# FUERTE (limita la producción, es económico y predecible) Clasifique esta solicitud de soporte. Simplemente devuelva el siguiente JSON:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}No escriba una descripción.

La versión débil produce quizás 500 tokens de salida; versión fuerte ~15. Debido a que la producción es costosa, esta es una diferencia significativa por llamada y se multiplica con el volumen.

Tres mini estuches

Caso 1: El costo oculto del aviso largo. A medida que una automatización contable clasificaba cada factura, agregaba un “libro de reglas” de 40 páginas como entrada para cada solicitud: ~12 000 tokens de entrada por solicitud. Con Sonnet 5 12.000/1M×3 = $0,036 recién ingresado. 5000 billetes por día → $180 por día. Al almacenar en caché el libro de reglas (unidad 6), el costo de los insumos se redujo en aproximadamente un 90 %.

Caso 2: La recompensa de reducir el modelo. Un equipo estaba realizando un etiquetado de sentimientos “positivo/negativo” simple con Opus 4.8: 300 tokens de entrada + 10 tokens de salida. La obra cuesta 300/1M×5 + 10/1M×25 = $0,00175. Cambiando a Haiku, 300/1M×1 + 10/1M×5 = $0,00035: 5 veces más barato, la diferencia en precisión era inconmensurable. En 3 millones de llamadas por mes, la diferencia es $5250 → $1050.

Caso 3: Liberación de la salida. Cuando un equipo de marketing elaboraba una descripción de producto, no establecía límites a la producción; el modelo a veces decía 1.500 fichas. Cuando agregué la instrucción "60 palabras como máximo", la producción promedio cayó de 900 a 90 tokens. Como la impresión era cara, la factura mensual se redujo en un tercio y los textos se volvieron más útiles.

Errores comunes

  • Adivinar la ficha a simple vista: puedes equivocarte especialmente en turco y en código. Medida.
  • Suponiendo que los insumos y los productos son iguales: los productos suelen ser mucho más caros; La mayor parte de la optimización proviene de acortar la salida.
  • No se deje engañar por lo barato de una sola llamada: la decisión se toma por volumen. 0,01 dólares × millón = 10.000 dólares.
  • Predicción con tokenizador de otro proveedor: Da resultados incorrectos; Utilice la herramienta de conteo de fichas del modelo.
  • Ampliación ilimitada del historial de conversaciones: cada ronda se agrega a la entrada; resumir en largas conversaciones.
  • Mantener `max_tokens` innecesariamente alto: oculta el plan presupuestario y el riesgo de recortes; Dar un valor realista.

Más profundo: ventana de contexto y costo de entrada a largo plazo

Es fundamental ver cómo se acumula el precio "a lo largo de la conversación" y no sólo "por solicitud". La cantidad total de texto que el modelo puede procesar se denomina ventana de contexto; La suma de entradas y salidas debe caber en esta ventana. Los modelos modernos ofrecen ventanas muy grandes (cientos de miles, incluso millones de tokens), pero eso no significa que puedas "llenarlas infinitamente": todo lo que pongas en la ventana se factura como entrada.

La trampa en las conversaciones largas es la siguiente: con cada nueva ronda envías nuevamente toda la historia (apatridia en la unidad 1). En una conversación de 20 rondas, la vigésima solicitud incluye las primeras 19 rondas completas como entrada. Por lo tanto, a medida que la conversación se prolonga, el costo por solicitud crece de forma acumulativa en lugar de lineal. Una conversación de 50 rondas con un asistente de agente puede generar costos de insumos decenas de veces superiores a los de la primera ronda.

Hay dos formas de gestionar esto. La primera es la recapitulación: comprimir rondas más antiguas en un solo bloque de recapitulación, manteniendo solo las últimas rondas sin editar. El segundo es el almacenamiento en caché rápido (unidad 6): leer el contexto fijo a una décima parte del precio en lugar de procesarlo repetidamente al precio completo. Juntos, reducen significativamente la factura de cargas de trabajo largas y de contexto intensivo. Entonces, la economía de tokens se trata del diseño de toda la sesión, no de una sola solicitud.

En resumen

Token es la unidad más pequeña en la que se procesa el texto; Los precios de los insumos y los productos se fijan por separado y la producción suele ser mucho más cara. El costo es la cantidad de tokens multiplicada por el precio unitario, y la decisión real se toma por volumen. Acortar el plazo, limitar la producción y elegir el modelo más liviano que cumpla la tarea son las palancas más directas que reducen el costo muchas veces.

Tarea de aplicación

Elige una tarea propia. (1) Determine la cantidad de tokens de entrada y salida estimada para un mensaje representativo (mida con una herramienta de conteo de tokens si es posible). (2) Calcule el costo por solicitud para las tres clases de modelos. (3) Calcule su número diario de solicitudes y obtenga el presupuesto mensual para los tres modelos. (4) Agregue una instrucción para acortar la salida y observe los ahorros esperados.

lista de verificación

  • [ ] Puedo explicar el concepto de tokens y que la tokenización varía según el modelo.
  • [] Sé por qué los tokens de entrada y salida tienen precios diferentes.
  • [ ] Puedo calcular el costo de una solicitud con la fórmula.
  • [] Puedo crear un presupuesto mensual para una carga de trabajo usando una plantilla.
  • [] Puedo mostrar con un ejemplo el beneficio de acortar la producción y la reducción del modelo.