Ganancias:
- Capacidad para leer precios de tokens de entrada/salida y artículos de factura
- Capacidad para estimar el costo mensual de un flujo de trabajo con una fórmula aproximada
- Implementar métodos de reducción de costos, como el almacenamiento en caché, el procesamiento por lotes y la preparación de modelos.
Ser capaz de estimar cuánto costará un modelo es una de las habilidades más prácticas de quien toma decisiones. "¿Qué pago mensualmente?" Si no puedes responder a la pregunta, no podrás planificar un presupuesto ni elegir el nivel adecuado. La buena noticia es que fijar precios es más sencillo de lo que parece y, una vez que lo domines, podrás hacer una estimación aproximada por tu cuenta. En esta unidad, aprenderá a leer el precio de los tokens de entrada/salida, a estimar el costo mensual de un flujo de trabajo con una fórmula simple y a métodos que realmente reducen el costo.
Regla general: los insumos y los productos se cotizan por separado
En los modelos de peso cerrado, el precio se calcula en función de la cantidad de tokens procesados y hay dos elementos separados:
- Token de entrada (entrada): El texto que envía al modelo. Su aviso, sus documentos, sus muestras.
- Token de salida: la respuesta que el modelo produce para usted.
Punto crítico: el token de salida suele ser varias veces más caro que el token de entrada. Esto se debe a que, desde el punto de vista computacional, es más costoso para el modelo producir resultados. Por ejemplo, en un modelo, la entrada podría ser de 3 dólares por millón de tokens, mientras que la salida podría ser de 15 dólares; Por tanto, la producción es cinco veces más cara. Esto significa que las respuestas largas e innecesarias pueden consumir rápidamente el presupuesto.
Consejo: una de las formas más sencillas de reducir costos es no pedirle al modelo respuestas innecesariamente largas. Restricciones como "máximo 5 artículos", "un solo párrafo", "exportar solo la tabla" aumentan la calidad y guardan el token de salida.
Ejemplos de precios actuales
A continuación se muestran los precios aproximados de varios modelos (por millón de tokens, dólares estadounidenses). Estos valores pertenecen al período en el que se elaboró este módulo y cambian con frecuencia; Consulte la página de precios actual del proveedor para conocer la decisión exacta.
modelo
etapa
Ingrese $/1 millón
Producción $/1 millón
Claude Opus 4.8
fuerte
~5
~25
Claudio Soneto 5
equilibrado
~3
~15
Claude Haiku 4.5
ligero
~1
~5
Como se ve en la tabla, puede haber una diferencia de precio de hasta cinco veces entre el nivel fuerte y el nivel ligero. Es por eso que el enfoque del "modelo más adecuado para todas las empresas" suele ser una pérdida de dinero. Hacer el trabajo simple con un modelo económico y el trabajo difícil con un modelo potente proporciona grandes ahorros sin pérdida de calidad. Profundizaremos en esta idea en las unidades 7 y 9.
Estimación del costo mensual: fórmula simple
Para obtener una estimación aproximada del costo mensual, puede utilizar esta fórmula:
Costo mensual ≈ (Número de solicitudes por mes × Token de entrada promedio × Precio de entrada / 1,000,000)+ (Número de solicitudes por mes × Token de salida promedio × Precio de salida / 1,000,000)
Hagamos un ejemplo. Digamos que un equipo de comercio electrónico produce 50.000 descripciones de productos por mes. Cada solicitud envía un promedio de 500 tokens de entrada (información del producto) y recibe 300 tokens de salida (descripción). En un modelo equilibrado (entrada ~3, salida ~15):
- Costo de insumos: 50.000 × 500 × 3 / 1.000.000 = $75
- Costo de producción: 50.000 × 300 × 15 / 1.000.000 = $225
- Total ≈ $300/mes
Si hicieron el mismo trabajo en un modelo liviano (entrada ~1, salida ~5):
- Entrada: 50.000 × 500 × 1 / 1.000.000 = $25
- Salida: 50.000 × 300 × 5 / 1.000.000 = $75
- Total ≈ $100/mes
Así que la simple selección de la etapa puede reducir el mismo trabajo de $300 a $100. Para una tarea relativamente sencilla como la descripción de un producto, el modelo ligero suele ser más que suficiente.
Precaución: esta fórmula es una estimación aproximada; la facturación real varía según factores como el uso de la caché, los reintentos y el modo de razonamiento. Aún así, es un muy buen comienzo para obtener una confirmación de presupuesto o comparar dos modelos. Lo mejor es medir el número real con un pequeño piloto antes de tomar una decisión.
Cinco métodos para reducir costos
- Elige el nivel correcto. Modelo sencillo y ligero. Esta es la mayor fuente de ahorro.
- Haz la entrada más pequeña. En lugar de completar documentos enormes para cada solicitud, envíe solo la sección relevante (optimización del contexto en la unidad 5).
- Limitar la salida. Aclare la extensión y formato de la respuesta; Respuesta innecesariamente larga = costo innecesario.
- Utilice el almacenamiento en caché. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Esto proporciona ahorros significativos si envía la misma instrucción grande miles de veces.
- Realizar procesamiento por lotes. Si no tiene prisa, las opciones "por lotes", que envían muchas solicitudes en bloque y las procesan con descuento, reducen significativamente el costo.
Tres casos realistas
Caso 1: Ahorros con cambio de paso. Un equipo de servicio al cliente estaba resumiendo todos los correos electrónicos entrantes con el modelo más sólido y su factura mensual era de ~$900. Resumir era una tarea sencilla; Cuando pasaron al nivel equilibrado, la calidad de la producción siguió siendo casi la misma, pero la factura se redujo a ~$250. Ahorro de ~$7800 por año, simplemente eligiendo el nivel correcto.
Caso 2: Guardar con caché. Un equipo de software enviaba el mismo documento de “estándares de codificación” de 8000 tokens con cada solicitud de revisión de código. 400 solicitudes por día × 8000 tokens = gran entrada repetitiva. Cuando activaron la función de caché, esta partición fija comenzó a leerse de manera mucho más económica y una parte importante de los costos de entrada desapareció.
Caso 3: Ahorros al limitar la producción. Cuando un equipo de marketing pidió una descripción del producto, el modelo produjo párrafos largos y floridos a la vez. Cuando agregaron la restricción de "máximo 60 palabras, un solo párrafo", las explicaciones se volvieron más útiles y el token de salida se redujo a la mitad. Si bien la calidad aumentó, el costo disminuyó; ganar-ganar.
Aviso débil / Aviso fuerte
Aviso débil:
Escríbeme una buena descripción para este producto. [información del producto]
La modelo puede escribir todo el tiempo que quiera; El token de salida no está controlado.
Potente mensaje:
Su función: redactor de comercio electrónico. Producto: [INFORMACIÓN]. Tarea: escribir una descripción del producto. Restricciones: Máximo 60 palabras, un párrafo, atractivo para clientes no técnicos, contiene 2 beneficios + 1 caso de uso. Evite los adjetivos elegantes.
El poderoso mensaje controla tanto la calidad como la duración de la producción (y, por lo tanto, el costo).
Plantillas copiables
1. Estimación de costos mensuales:
Hago solicitudes de [CANTIDAD] mensualmente. Entrada promedio ~[NUM] tokens, salida ~[NUM] tokens. Calcula el costo mensual para los siguientes modelos ([MODELO A], [MODELO B]) con la fórmula y compara en una tabla. Aceptar precios de entrada/salida [PRECIOS].
Comparación del nivel 2:
Mi deber [TAREA]. ¿Este trabajo realmente requiere un modelo potente o es suficiente un modelo liviano y equilibrado? Evalúelo en términos de calidad y costo y sugiérame 2 niveles para realizar una prueba piloto.
3. Detección de reducción de costos:
Identifique formas de reducir costos en el siguiente flujo de trabajo: [FLUJO DE TRABAJO]. Escriba la viabilidad y los ahorros estimados para cada uno de los encabezados de procesamiento en cascada, reducción de entradas, enlace de salida, caché y procesamiento por lotes.
4. Limitación de salida:
Vuelva a escribir el siguiente mensaje para reducir el token de salida sin reducir la calidad: "[PROMPT]". Optimice la longitud, el formato y las repeticiones innecesarias.
Errores comunes
- Saltarse la diferencia entrada/salida: Permitir respuestas largas sin saber que la salida es mucho más cara.
- El modelo más potente para cada trabajo: hacer un trabajo sencillo con un modelo caro y pagar muchas veces más innecesariamente.
- Liberar la longitud de salida: otorgar permiso de escritura ilimitado al modelo sin imponer restricciones de formato o longitud.
- Ignorar el caché y el lote: perder importantes oportunidades de ahorro para entradas repetitivas y tareas no urgentes.
- Pensar que los precios están actualizados: Confiar en una tabla de precios antigua y planificar incorrectamente el presupuesto; los precios cambian con frecuencia.
En resumen
- El precio se calcula en base a tokens; Los precios de los insumos y los productos se fijan por separado y el producto suele ser varias veces más caro.
- Puede estimar aproximadamente el costo mensual mediante la fórmula número de solicitudes × token promedio × precio.
- La selección correcta del paso por sí sola puede reducir el costo muchas veces.
- La minimización de entradas, la limitación de salidas, el almacenamiento en caché y el procesamiento por lotes son métodos prácticos que reducen significativamente la factura.
Tarea de aplicación
Obtenga los valores de los tokens que estimó en la unidad anterior. Calcule el costo mensual de su negocio para dos niveles diferentes con la plantilla 1 en esta unidad (estimación de costo mensual). Luego, con la tercera plantilla (escaneo de reducción de costos), deduzca cuánto ahorro puede aportar cada método a su flujo de trabajo. Planee elegir los dos métodos más prometedores y aplíquelos al presupuesto del próximo mes.
lista de verificación
- [] Sé que los tokens de entrada y salida tienen un precio por separado y la salida es más cara.
- [] Puedo estimar aproximadamente el costo mensual de un flujo de trabajo con una fórmula simple.
- [ ] Puedo mostrar el impacto en el costo de elegir el nivel correcto con un ejemplo.
- [ ] Puedo reconocer cinco métodos de reducción de costos y elegir el apropiado.
- [] Puedo reescribir un mensaje para reducir el token de salida.