Ganancias:
- Capacidad para explicar los conceptos de token, ventana de contexto y multimodalidad en el lenguaje cotidiano.
- Diagnosticar si una tarea requiere un contexto amplio o multimodalidad
- Capacidad para tener en cuenta cómo estos conceptos afectan el costo y la selección del modelo.
Hasta ahora estamos familiarizados con los proveedores y los tipos de modelos. Sin embargo, para seleccionar el modelo correcto, también es necesario comprender cómo funcionan los modelos "por dentro"; porque las decisiones de precio, capacidad y disponibilidad se basan en tres conceptos centrales: token, ventana de contexto y multimodalidad. Alguien que no conozca estos conceptos no puede leer la hoja de precios y preguntarse "¿este documento se ajustará al modelo?" No puede responder la pregunta y no puede ver cuándo el procesamiento visual es esencial. Al final de esta unidad, podrá explicar estos tres conceptos en el lenguaje cotidiano, diagnosticar si un trabajo requiere un contexto amplio o multimodalidad y tener en cuenta su impacto en los costos.
Token: Unidad utilizada por el modelo en lugar de Word
Los modelos de inteligencia artificial procesan el texto no palabra por palabra, sino en pequeños fragmentos llamados tokens. Una ficha; Puede ser una palabra, parte de una palabra, un signo de puntuación o un espacio. Para hacer un cálculo aproximado: en inglés, una ficha promedio tiene unos cuatro caracteres y 100 palabras equivalen a entre 130 y 150 fichas. En turco, esta tasa puede ser ligeramente mayor debido a las palabras largas y con sufijos; En otras palabras, un texto turco con el mismo significado consume un poco más de tokens que el inglés.
¿Por qué es importante saber esto? Porque todo se cobra y se mide en fichas. El texto (entrada) que envía al modelo y la respuesta (salida) producida por el modelo se cuentan como tokens separados. Tanto tu factura como la capacidad del modelo están en tokens.
Consejo: para obtener una estimación aproximada de cuántas fichas tiene un texto, divida la cantidad de caracteres entre cuatro. Un correo electrónico de 4000 caracteres equivale aproximadamente a 1000 tokens. En turco, suponga un poco más alto para estar seguro.
Ventana de contexto: "Memoria a corto plazo" del modelo
La ventana de contexto es la cantidad total de tokens que el modelo puede tener en cuenta a la vez. La entrada y la salida deben encajar juntas en esta ventana. Piensa en ello como la cantidad de papel que puedes extender sobre una mesa a la vez: el papel que no cabe en la mesa está fuera de tu campo de visión en ese momento.
Si la ventana de contexto de un modelo es de 200.000 tokens, esto equivale aproximadamente a 150.000 palabras o varios libros de tamaño mediano. 1 millón de tokens pueden procesar documentos mucho más grandes en su conjunto. Algunos modelos potentes actuales (por ejemplo, Claude Opus 4.8 y Sonnet 5) ofrecen 1 millón de contextos de tokens, mientras que los modelos livianos suelen venir con ventanas más pequeñas (por ejemplo, 200.000 tokens para Haiku 4.5).
¿Por qué es importante? Porque si un documento no cabe en la ventana de contexto, el modelo no puede verlo todo junto. No se puede ceder un contrato de 500 páginas en su totalidad a un modelo de 200.000 tokens; O divides el documento en partes (lo que puede perder la relación entre las partes) o eliges un modelo con un contexto más amplio.
Precaución: No es aconsejable completar todos los documentos, ya que esto se debe simplemente a que la ventana contextual es grande. Cuantas más fichas pongas en la ventana, más pagarás y, a veces, el modelo puede perder los detalles intermedios en textos muy largos. A menudo es más económico y preciso enviar sólo la pieza que funciona.
La ventana de contexto es un criterio de decisión
Búsqueda
Contexto aproximado requerido
Nivel apropiado
Breve respuesta por correo electrónico
varios cientos de fichas
ligero
Resumen de una página
varios miles de fichas
Ligero/equilibrado
Análisis de informes de 40 páginas.
~30.000 fichas
Equilibrado/fuerte
Revisión de contrato de 300 páginas
~250.000 fichas
Potente con amplio contexto
Procese cientos de documentos a la vez
Más de 500.000 fichas
Contexto más amplio
Esta tabla responde a la pregunta "¿qué modelo?" Muestra que parte de la pregunta se responde directamente por el tamaño del documento. Es un desperdicio comprar un modelo caro con un gran contexto para trabajos cortos; Un modelo con una ventana pequeña no es adecuado para documentos grandes.
Multimodalidad: yendo más allá del texto
La multimodalidad es la capacidad de un modelo para manejar múltiples tipos de datos (imagen, audio, a veces video), no solo texto. "Modal" aquí significa "tipo de datos"; multimodal significa "muchos tipos".
- Modelo de solo texto: lee y escribe solo texto escrito.
- Modelo multimodal: puede leer una fotografía de un billete, interpretar una tendencia en un gráfico, decodificar una nota escrita a mano y, a veces, transcribir una grabación de voz.
¿Por qué es importante? Porque la naturaleza de tu negocio puede requerir multimodalidad. Un equipo de contabilidad que extrae importes de imágenes de facturas, un equipo de comercio electrónico que clasifica fotografías de productos o un equipo de seguros que evalúa fotografías de daños no pueden hacer este trabajo con un modelo que solo lee texto. El procesamiento visual es esencial para estas tareas.
Tres casos realistas
Caso 1: Sorpresa en el costo del token. Un equipo de contenido también envía al modelo un documento de “guía de marca” de 20 páginas a medida que producen cada publicación de blog. Esta guía tiene alrededor de 15.000 tokens. Producen 2.000 artículos al mes; Entonces, simplemente enviar la guía una y otra vez significa 30 millones de tokens de entrada. Al acortar la guía y enviar sólo la sección relevante (unas 2.000 fichas), reducen la entrada a una séptima parte y reducen significativamente la factura.
Caso 2: la ventana de contexto no es suficiente. Un bufete de abogados quiere que se revise un acuerdo de fusión de 280 páginas. El primer modelo que probaron tenía una encuadernación de 200.000 fichas y el documento no encajaba; Cuando el documento se rompe, el modelo no puede notar que un artículo de la primera sección contradice un artículo de la última sección. Cuando cambia a un modelo con un contexto de 1 millón de tokens, lee el documento como un todo y detecta la contradicción. Aquí la ventana de contexto determinó directamente la precisión.
Caso 3: La multimodalidad es imprescindible. Una compañía de seguros quiere realizar una evaluación preliminar a partir de fotografías de daños en vehículos. Esto es imposible con un modelo que sólo lee texto; Se requiere un modelo multimodal que "vea" la fotografía. Cuando cambian a un modelo multimodal, establecen un sistema de preselección que clasifica aproximadamente la ubicación y la gravedad del daño en la fotografía y orienta al experto. Sin embargo, señalan que un experto humano toma la decisión final; porque el modelo es una herramienta de selección preliminar, no la última palabra.
Aviso débil / Aviso fuerte
Aviso débil:
Resume este documento. [documento pegado demasiado largo]
Potente mensaje:
Resuma el informe de 40 páginas a continuación. Primero estime la cantidad aproximada de tokens en el informe y díganos si encaja dentro de la ventana de contexto de un modelo equilibrado típico. Luego proporcione el resumen en este formato: resumen ejecutivo de 5 elementos + 3 hallazgos riesgosos. Utilice únicamente la información del informe; Marque la parte de la que no esté seguro como "no clara en el informe". [informe]
El potente mensaje reconoce el token y el contexto y controla el formato y la verificabilidad de la salida.
Plantillas copiables
1. Predicción de tokens:
Calcule el número aproximado de tokens para el siguiente texto e interprete esto en términos de costo de entrada: "[TEXTO]". Redondea un poco, teniendo en cuenta que es turco.
2. Verificación de disponibilidad de contexto:
Mi trabajo consiste en procesar los siguientes documentos: promedio de [PÁGINAS] de [CANT.] documentos por mes. ¿Qué ventana de contexto requiere este tamaño? ¿Cuál de los niveles ligero/equilibrado/fuerte sería suficiente? ¿Qué riesgo surge si es necesario desmantelarlo?
3. Diagnóstico multimodal:
Mi flujo de trabajo: [DESCRIPCIÓN]. ¿Hay procesamiento visual, de audio o de video en esta transmisión? Si es así, ¿se requiere un modelo multimodal o se puede convertir a texto (OCR/transcripción) y resolver con el modelo de texto? Compare los pros y los contras de los dos caminos.
4. Optimización del contexto:
Envío un documento al modelo con cada solicitud, pero la mayor parte es innecesaria. ¿Cómo extraigo las partes que realmente se requieren para [TAREA] de este documento? Sugiera 3 formas concretas de reducir los insumos e indique el ahorro estimado de tokens.
Errores comunes
- Confundir token con una palabra: Token es diferente de una palabra; La factura y la capacidad siempre están en fichas, calcular con palabras es engañoso.
- Pensar que la ventana de contexto es infinita: cada modelo tiene un límite; Si el documento no encaja, el modelo no puede ver el todo.
- Usar un contexto grande innecesario: comprar un modelo costoso con un contexto grande para un trabajo corto; o complete documentos enormes para cada solicitud y pague en vano.
- Suponiendo multimodalidad: no todos los modelos pueden procesar imágenes; Para trabajos visuales, comience sin confirmar que el modelo sea multimodal.
- Olvidando la carga de tokens del turco: los textos turcos generalmente consumen un poco más de tokens para el mismo significado; ignorando esto en la estimación de costos.
En resumen
- Un token es la pequeña unidad en la que el modelo procesa texto; la entrada y la salida se miden y facturan por separado como tokens.
- La ventana de contexto son los tokens totales que el modelo puede tener en cuenta a la vez; El tamaño del documento afecta directamente la selección del modelo.
- La multimodalidad es la capacidad del modelo para procesar datos que no son de texto, como imágenes/audio; Es esencial para trabajos visuales.
- Estos tres conceptos son relevantes para la pregunta "¿qué modelo?" así como "¿cuánto cuesta?" Constituye la base de las preguntas.
Tarea de aplicación
Elija una tarea de IA recurrente en su negocio. Haga que la primera plantilla (predicción de tokens) calcule cuántos tokens hay en una entrada típica en esta tarea. Luego determine qué nivel es suficiente con la plantilla 2 (verificación de disponibilidad de contexto). Si tiene un trabajo visual, aclare si se requiere un modelo multimodal con la 3ª plantilla (diagnóstico multimodal). Usaremos la estimación del token resultante en el cálculo del costo de la siguiente unidad.
lista de verificación
- [] Conozco el concepto de token y cómo estimar aproximadamente cuántos tokens tiene un texto.
- [] Puedo explicar la ventana de contexto con una analogía de "tabla/memoria".
- [] Puedo evaluar si un documento encajará en un modelo.
- [ ] Puedo diagnosticar cuando la multimodalidad es esencial.
- [] Tomo en cuenta los gastos generales simbólicos del turco y el costo del contexto innecesario.