Unidade 4 / 11

Prompt do sistema e parâmetros do modelo

Ganhos:

  • Pode projetar como o prompt do sistema guia o modelo durante toda a conversa
  • Compreende o papel e o impacto nos custos do pensamento adaptativo e dos parâmetros de esforço
  • implementa controles de saída como max_tokens, sequências de parada e saída estruturada

Dois produtos diferentes do mesmo modelo podem se comportar de maneira completamente diferente. A diferença não está no modelo em si, mas no prompt do sistema e nos parâmetros fornecidos a ele. O prompt do sistema é o “contrato de trabalho” do modelo e os parâmetros são “configurações de trabalho”. Nesta unidade, você aprenderá como projetar um prompt de sistema poderoso, o que fazem as configurações de pensamento e esforço em modelos modernos e como controlar a saída quanto ao formato/comprimento. Definir essas configurações corretamente permite gerenciar a qualidade e o custo ao mesmo tempo.

Prompt do Sistema: Diretiva Permanente do Modelo

O prompt do sistema é a instrução de alto nível que se aplica durante toda a conversa. Essas regras permanecem válidas independentemente do que o usuário digita. Um bom prompt do sistema inclui os seguintes componentes:

  1. Papel/identidade: Quem é o modelo? (“Você é um assistente de suporte corporativo.”)
  2. Escopo e limite: o que faz e o que não faz? (“Baseie-se apenas no documento de apólice fornecido.”)
  3. Regras de formato: como deve ser a saída? ("Máximo de 3 artigos, idioma oficial.")
  4. Comportamento na incerteza: o que alguém faz quando não tem certeza? (“Se não houver informação, invente, encaminhe para a unidade competente.”)
  5. Segurança/privacidade: O que não quer/não quer? ("Solicitar dados pessoais.")
Dica: mantenha o prompt do sistema fixo. Não incorpore informações que mudam a cada solicitação (data atual, nome de usuário, ID da sessão). Isso quebra a consistência e invalida o cache de prompt na unidade 6. Coloque as informações da variável na mensagem do usuário.

A armadilha da instrução excessivamente agressiva

Os modelos modernos seguem as instruções de perto. Frases agressivas como “DEVE”, “SEMPRE”, “DEFINITIVAMENTE fazer isso”, etc., que funcionavam em modelos mais antigos, hoje levam ao overtriggering: o modelo chama um agente quando não é necessário ou fica em execução por um tempo desnecessariamente longo. Suavize a regra: em vez de “DEVE usar a ferramenta de pesquisa”, “Se a resposta não estiver na conversa, use a ferramenta de pesquisa” é mais preciso.

Parâmetros do modelo: pensamento e esforço

Os LLMs clássicos tinham um parâmetro de temperatura: um valor mais baixo produzia resultados mais específicos/consistentes, um valor mais alto produzia resultados mais variados/criativos. Modelos de geração moderna (como Opus 4.8, Sonnet 5) substituem esta abordagem por dois mecanismos mais poderosos e não aceitam mais parâmetros de amostragem como temperatura.

  • Pensamento adaptativo: O modelo raciocina passo a passo em sua “cabeça” antes de responder. O modelo decide quanto pensar com base na dificuldade da tarefa. Melhora significativamente a precisão em problemas complexos e com várias etapas; Ele pensa menos para evitar atrasos desnecessários em questões simples.
  • Esforço: botão de alto nível que ajusta a profundidade com que o modelo se aprofunda em uma tarefa e quantos tokens ele gasta no total. Níveis típicos: baixo, médio, alto e superior. Um grande esforço pode melhorar a qualidade, mas também aumenta os atrasos e os custos; Baixo esforço traz velocidade e economia.

Configuração

O que faz

quando

Pensando mal/baixo esforço

Rápido, barato, superficial

Classificação simples, resposta curta, tarefas sensíveis a atrasos

Pensamento adaptativo + esforço médio

Qualidade/custo equilibrado

A maioria das tarefas de uso geral

Pensamento adaptativo + alto esforço

maior precisão

Raciocínio complexo, codificação, trabalho de agente de longo alcance

Cuidado: O reflexo do “esforço máximo, não importa o que aconteça” inflaciona os custos. Ajustar o esforço à tarefa; Em tarefas simples, o baixo esforço muitas vezes dá o mesmo resultado preciso a um preço muito mais barato. Vá alto onde a precisão crítica é necessária.

Controle de saída: formato, comprimento, estrutura

Além dos parâmetros, você também controla a própria saída:

  • max_tokens: Limite máximo de saída (1ª e 3ª unidade).
  • Sequências de parada: Parando o modelo ao ver uma determinada string. Útil para definir pontos de interrupção na produção estruturada.
  • Saída estruturada: força a resposta do modelo a estar em conformidade com um esquema JSON fornecido. Ele garante que a saída seja analisável e válida programaticamente. É mais confiável do que dizer "basta retornar JSON" com um prompt.

{ "output_config": { "format": { "type": "json_schema", "schema": { "type": "object", "additionalProperties": false, "properties": { "category": { "type": "string", "enum": ["fatura", "técnico", "retorno", "outro"] }, "urgência": { "tipo": "string", "enum": ["baixo", "médio", "alto"] } }, "obrigatório": ["categoria", "urgência"] } } }}

Modelos copiáveis de prompt do sistema

# Assistente de suporte corporativoVocê é um assistente de suporte corporativo.- Confie apenas no documento de política fornecido; Se não estiver no documento, diga “Não tenho esta informação”. - Dê uma resposta formal e clara em no máximo 3 frases. - Peça dados pessoais (número de identificação do TC, número do cartão) e não os repita na sua resposta. - Se você não tem certeza, não adivinhe.

# Classificador de forçamento de saída estruturadoVocê é um classificador de demanda. A entrada é uma mensagem do cliente. Devolva apenas os campos solicitados, não escreva comentários. Se não tiver certeza, use "outro".

# Analista com comportamento definido de incerteza Você é um analista de dados. Extraia apenas inferências verificáveis ​​da tabela fornecida. Nunca tire uma conclusão que não exista nos dados. Se uma inferência não for clara, escreva “dados insuficientes”.

# Redator de conteúdo com controle de tom e duraçãoVocê é um redator de conteúdo. Use um tom caloroso, mas profissional. Limite cada texto a 120 palavras ou menos. Evite linguagem de marketing clichê.

Alerta fraco / Alerta forte

# FRACOSeja prestativo e dê boas respostas. Faça o seu melhor.

# FORTEFunção: Especialista em suporte técnico.Escopo: Apenas guia do produto fornecido.Formato: Passo a passo, lista numerada, máximo de 5 etapas.Limite: Solução recomendada que não está no guia; Diga "Não consegui encontrar no manual". Privacidade: Não repita o número de série compartilhado pelo usuário na resposta.

Versão poderosa; Determina a função, o escopo, o formato, os limites e a confidencialidade separadamente. A consistência da saída vem diretamente dessa clareza.

Três Mini Estojos

Caso 1 — Redução de custos através de ajuste de esforço. Uma equipe estava executando todas as suas chamadas com alto esforço e pensamento; Mesmo resumos simples por e-mail eram caros e lentos de produzir. Eles atribuíram tarefas simples, como resumos, a tarefas de baixo esforço e análises de contratos a tarefas de alto esforço. A precisão foi mantida, a latência média foi reduzida pela metade e o custo mensal foi reduzido em um terço.

Caso 2 — Garantia JSON. Uma equipe de operações solicitou a saída da classificação com um prompt dizendo "apenas forneça JSON", mas o modelo ocasionalmente escrevia "Aqui está o resultado:" e o analisador travava. Quando conectei o esquema de saída configurado, a saída sempre retornou JSON válido; erros de análise foram redefinidos.

Caso 3 — Recuo imediato e agressivo. Um prompt do assistente dizia: "DEVE pesquisar TODAS AS PERGUNTAS"; O modelo fazia buscas desnecessárias até mesmo por questões simples para as quais já sabia a resposta, desacelerando e aumentando custos. Eles relaxaram a regra para “Se a resposta não estiver no contexto, pesquise”; As chamadas desnecessárias diminuíram 70% e as respostas aceleraram.

Erros comuns

  • Incorporar dados variáveis no prompt do sistema: quebra a consistência e invalida o cache.
  • Instrução excessivamente agressiva: Acionamento excessivo e custo desnecessário em modelos modernos.
  • Alto esforço em todas as tarefas: Desperdício em tarefas simples; ajustar o esforço à tarefa.
  • Solicitando JSON apenas via prompt: quebra ocasionalmente; se for crítico, use saída estruturada.
  • Não definir comportamento de limite/ambiguidade: O modelo preenche a lacuna com fabricação (alucinação).
  • Antigo hábito de `temperatura`: Os modelos modernos não aceitam isso; Orientar o comportamento com rapidez e esforço.

Mais profundo: escrevendo o prompt como um contrato

Equipes experientes tratam o prompt do sistema como um contrato, não como um texto literário: cláusulas claras, regras mensuráveis, limites inequívocos. Esta abordagem tem três benefícios concretos. A primeira é a consistência: a mesma entrada produz resultados semelhantes em momentos diferentes. Em segundo lugar está a testabilidade: você pode testar cada item separadamente com uma amostra. O terceiro é a facilidade de manutenção: se um comportamento estiver errado, você sabe qual item substituir.

Uma boa prática é liderar com exemplos positivos. Em vez de fornecer uma lista de "não faça isso", é muito mais eficaz nos modelos modernos fornecer um exemplo que diga "é exatamente assim que se parece o resultado desejado". Por exemplo, em um classificador, adicionar uma ou duas amostras do JSON esperado ao prompt reduz significativamente os erros de formatação.

Outra técnica poderosa é escrever explicitamente o comportamento da incerteza. Uma cláusula como "Se não tiver certeza, não adivinhe; diga 'dados insuficientes'" suprime a tendência do modelo de preencher a lacuna com fabricação (alucinação). Esta única frase alivia a camada de verificação, que abordaremos na unidade 11: uma vez que o modelo já sinalizou incerteza, fica mais fácil levar à validação humana.

Finalmente, considere o esforço e a prontidão juntos. Com alto esforço, o modelo explora mais e às vezes faz “trabalho extra” indesejado (explicação desnecessária, sugestão adicional). Dizer "forneça apenas o resultado desejado, não adicione comentários adicionais" no prompt compensa esse efeito colateral de alto esforço.

Resumindo

O prompt do sistema é a diretiva permanente do modelo: define a função, escopo, formato, comportamento de obscuridade e confidencialidade. Nos modelos modernos, o comportamento é impulsionado pelo pensamento adaptativo e pelos parâmetros de esforço, e não pela temperatura; Alinhar o esforço à tarefa gerencia a qualidade e o custo simultaneamente. Você protege a saída com max_tokens, stop arrays e saída estruturada.

Tarefa de aplicativo

Escolha uma tarefa. (1) Escreva um prompt do sistema com cinco componentes (função, escopo, formato, ambigüidade, confidencialidade). (2) Indique que nível de esforço você escolheria para esta tarefa e por quê. (3) Se a saída precisar ser estruturada, esboce um pequeno esquema JSON. (4) Verifique se há um padrão excessivamente agressivo em seu prompt e suavize-o.

lista de verificação

  • [] Posso citar cinco componentes de um bom prompt do sistema.
  • [ ] Posso explicar o que os parâmetros de pensamento adaptativo e esforço fazem.
  • [ ] Consigo equilibrar qualidade/custo ajustando o esforço de acordo com a tarefa.
  • [] Eu sei por que a saída estruturada é mais segura do que solicitar JSON via prompt.
  • [] Posso reconhecer o risco nos modelos modernos de instruções excessivamente agressivas.