Ganhos:
- Capacidade de explicar os conceitos de token, janela de contexto e multimodalidade na linguagem cotidiana
- Diagnosticar se uma tarefa requer contexto amplo ou multimodalidade
- Capacidade de levar em conta como esses conceitos afetam o custo e a seleção do modelo
Até agora estamos familiarizados com os fornecedores e tipos de modelos. Porém, para a seleção correta do modelo, também é necessário entender como os modelos funcionam “por dentro”; porque as decisões de preço, capacidade e disponibilidade dependem de três conceitos principais: token, janela de contexto e multimodalidade. Quem não conhece esses conceitos não consegue ler a tabela de preços e se perguntar “será que esse documento se enquadra no modelo?” não consegue responder à pergunta e não consegue ver quando o processamento visual é essencial. Ao final desta unidade, você será capaz de explicar esses três conceitos em linguagem cotidiana, diagnosticar se um trabalho requer contexto amplo ou multimodalidade e levar em consideração seu impacto nos custos.
Token: unidade usada pelo modelo em vez de palavra
Os modelos de inteligência artificial processam texto não palavra por palavra, mas em pequenos pedaços chamados tokens. Um token; Pode ser uma palavra, parte de uma palavra, um sinal de pontuação ou um espaço. Para fazer um cálculo aproximado: em inglês, um token médio tem cerca de quatro caracteres e 100 palavras equivalem a cerca de 130-150 tokens. Em turco, esta taxa pode ser ligeiramente mais elevada devido a palavras longas e com sufixos; Em outras palavras, um texto turco com o mesmo significado consome um pouco mais tokens do que o inglês.
Por que isso é importante saber? Porque tudo é cobrado e medido em tokens. O texto (entrada) que você envia ao modelo e a resposta (saída) produzida pelo modelo são contados como tokens separados. Tanto a sua fatura quanto a capacidade do modelo estão em tokens.
Dica: Para obter uma estimativa aproximada de quantos tokens um texto possui, divida o número de caracteres por quatro. Um e-mail de 4.000 caracteres equivale a aproximadamente 1.000 tokens. Em turco, presuma um pouco mais alto para ficar do lado seguro.
Janela de Contexto: “Memória de Curto Prazo” do Modelo
A janela de contexto é a quantidade total de tokens que o modelo pode ter em mente por vez. A entrada e a saída devem caber nesta janela. Pense nisso como a quantidade de papel que você pode espalhar sobre uma mesa de uma só vez: o papel que não cabe na mesa está fora do seu campo de visão naquele momento.
Se a janela de contexto de um modelo tiver 200.000 tokens, isso equivale a aproximadamente 150.000 palavras ou vários livros de tamanho médio. 1 milhão de tokens podem processar documentos muito maiores como um todo. Alguns modelos poderosos hoje (por exemplo, Claude Opus 4.8 e Sonnet 5) oferecem 1 milhão de contextos de token, enquanto modelos leves geralmente vêm com janelas menores (por exemplo, 200.000 tokens para o Haiku 4.5).
Por que isso é importante? Porque se um documento não couber na janela de contexto, o modelo não poderá vê-lo todo junto. Você não pode fornecer um contrato completo de 500 páginas para um modelo de 200.000 tokens; Ou você divide o documento em partes (o que pode perder a relação entre as partes) ou escolhe um modelo com contexto mais amplo.
Cuidado: Não é aconselhável preencher todos os documentos porque a janela de contexto é grande. Quanto mais tokens você coloca na janela, mais você paga, e às vezes o modelo pode perder os detalhes intermediários em textos muito longos. Muitas vezes é mais barato e mais preciso enviar apenas a peça que funciona.
A janela de contexto é um critério de decisão
Missão
Contexto necessário aproximado
Nível apropriado
Resposta curta por e-mail
várias centenas de tokens
leve
Resumo de uma página
vários milhares de tokens
Leve/equilibrado
Análise de relatório de 40 páginas
~30.000 tokens
Equilibrado/forte
Revisão de contrato de 300 páginas
~250.000 tokens
Poderoso com amplo contexto
Processe centenas de documentos de uma só vez
Mais de 500.000 tokens
Contexto mais amplo
Esta tabela responde à pergunta “qual modelo?” Mostra que parte da questão é respondida diretamente pelo tamanho do documento. É um desperdício comprar um modelo caro e com grande contexto para trabalhos curtos; Um modelo com janela pequena é inadequado para documentos grandes.
Multimodalidade: indo além do texto
Multimodalidade é a capacidade de um modelo de lidar com vários tipos de dados (imagem, áudio, às vezes vídeo), não apenas texto. "Modal" aqui significa "tipo de dados"; multimodal significa "muitos tipos".
- Modelo somente texto: Lê e escreve apenas texto escrito.
- Modelo multimodal: pode ler a foto de uma fatura, interpretar uma tendência em um gráfico, decodificar uma nota manuscrita, às vezes transcrever uma gravação de voz.
Por que isso é importante? Porque a natureza do seu negócio pode exigir multimodalidade. Uma equipe de contabilidade que extrai valores de imagens de faturas, uma equipe de e-commerce que classifica fotos de produtos ou uma equipe de seguros que avalia fotos de danos não podem fazer esse trabalho com um modelo que apenas lê texto. O processamento visual é essencial para essas tarefas.
Três casos realistas
Caso 1 — Surpresa no custo do token. Uma equipe de conteúdo também envia ao modelo um documento de “guia da marca” de 20 páginas à medida que produz cada postagem no blog. Este guia tem cerca de 15.000 tokens. Produzem 2.000 artigos por mês; Portanto, apenas enviar o guia repetidamente significa 30 milhões de tokens de entrada. Ao encurtar o guia e enviar apenas a seção relevante (cerca de 2.000 tokens), eles reduzem a entrada para um sétimo e reduzem significativamente a conta.
Caso 2 — A janela de contexto não é suficiente. Um escritório de advocacia deseja que um acordo de fusão de 280 páginas seja revisado. O primeiro modelo que tentaram tinha uma vinculação de 200 mil tokens e o documento não cabia; Quando o documento é rasgado, o modelo não consegue perceber que um artigo da primeira seção contradiz um artigo da última seção. Quando muda para um modelo com contexto de 1 milhão de tokens, ele lê o documento como um todo e capta a contradição. Aqui, a janela de contexto determinou diretamente a precisão.
Caso 3 — A multimodalidade é obrigatória. Uma seguradora deseja fazer uma avaliação preliminar a partir de fotografias de danos em veículos. Isto é impossível com um modelo que apenas lê texto; É necessário um modelo multimodal que “veja” a fotografia. Ao mudar para um modelo multimodal, eles estabelecem um sistema de pré-triagem que classifica aproximadamente a localização e a gravidade do dano na foto e direciona o especialista. Observam, contudo, que um especialista humano toma a decisão final; porque o modelo é uma ferramenta de triagem preliminar e não a palavra final.
Alerta Fraco/Prompt Forte
Alerta fraco:
Resuma este documento. [documento muito longo colado]
Alerta poderoso:
Resuma o relatório de 40 páginas abaixo. Primeiro, estime o número aproximado de tokens no relatório e diga-nos se ele se enquadra na janela de contexto de um modelo balanceado típico. Em seguida, apresente o resumo neste formato: resumo executivo de 5 itens + 3 conclusões arriscadas. Utilize apenas as informações do relatório; Marque a parte que você não tem certeza como “não está clara no relatório”. [relatório]
O poderoso prompt reconhece token/contexto e controla o formato e a verificabilidade da saída.
Modelos copiáveis
1. Previsão de token:
Estime o número aproximado de tokens para o texto a seguir e interprete isso em termos de custo de entrada: "[TEXTO]". Arredonde um pouco, levando em consideração que é turco.
2. Verificação de disponibilidade de contexto:
Meu trabalho é processar os seguintes documentos: média de [PÁGINAS] de [QTY] documentos por mês. Qual janela de contexto esse tamanho requer? Qual dos níveis leve/equilibrado/forte seria suficiente? Que risco surge se for necessário desmontá-lo?
3. Diagnóstico multimodal:
Meu fluxo de trabalho: [DESCRIÇÃO]. Há processamento visual, de áudio ou de vídeo neste fluxo? Em caso afirmativo, é necessário um modelo multimodal ou pode ser convertido para texto (OCR/transcrição) e resolvido com o modelo de texto? Compare os prós/contras dos dois caminhos.
4. Otimização de contexto:
Envio um documento para a modelo a cada solicitação, mas a maior parte é desnecessária. Como extraio as partes realmente necessárias para [TASK] deste documento? Sugira três maneiras concretas de reduzir a entrada e indicar economias estimadas de tokens.
Erros comuns
- Confundir token com palavra: token é diferente de palavra; A fatura e a capacidade são sempre em tokens, calcular por palavras é enganoso.
- Pensar que a janela de contexto é infinita: todo modelo tem um limite; Se o documento não couber, o modelo não consegue ver o todo.
- Usar um contexto grande desnecessário: Comprar um modelo caro com um contexto grande para um trabalho curto; ou preencha documentos enormes para cada solicitação e pague em vão.
- Assumindo multimodalidade: Nem todo modelo pode processar recursos visuais; Para trabalhos visuais, comece sem confirmar se o modelo é multimodal.
- Esquecendo a carga de tokens do turco: os textos turcos geralmente consomem um pouco mais de tokens para o mesmo significado; ignorando isso na estimativa de custos.
Em resumo
- Um token é a pequena unidade na qual o modelo processa o texto; a entrada e a saída são medidas e faturadas separadamente como tokens.
- A janela de contexto é o total de tokens que o modelo pode ter em mente por vez; o tamanho do documento afeta diretamente a seleção do modelo.
- Multimodalidade é a capacidade do modelo de processar dados não textuais, como visuais/áudio; É essencial para trabalhos visuais.
- Estes três conceitos são relevantes para a questão “qual modelo?” bem como “quanto custa?” É a base das perguntas.
Tarefa de aplicativo
Escolha uma tarefa recorrente de IA em sua empresa. Faça com que o primeiro modelo (previsão de token) calcule quantos tokens uma entrada típica contém nesta tarefa. Em seguida, determine qual nível é suficiente com o modelo 2 (verificação de disponibilidade de contexto). Se você tem um trabalho visual, esclareça se é necessário um modelo multimodal com o 3º modelo (diagnóstico de multimodalidade). Usaremos a estimativa de token resultante no cálculo do custo da próxima unidade.
lista de verificação
- [] Eu conheço o conceito de token e como estimar aproximadamente quantos tokens um texto possui.
- [] Posso explicar a janela de contexto com uma analogia "tabela/memória".
- [ ] Posso avaliar se um documento se enquadrará em um modelo.
- [ ] Consigo diagnosticar quando a multimodalidade é essencial.
- [] Levo em consideração a sobrecarga simbólica do turco e o custo do contexto desnecessário.