Ganhos:
- Definir métricas que medem a retenção e a qualidade da geração separadamente
- Configure um conjunto de perguntas douradas e execute uma avaliação automática com LLM como juiz
- Manter a qualidade por meio de feedback, monitoramento e testes de regressão na produção
A frase “Instalei o assistente, parece estar funcionando bem” não é uma declaração de engenharia. Os sistemas RAG falham silenciosamente: um novo tipo de documento engana a recuperação, uma alteração imediata reduz a precisão, o índice fica obsoleto. A única maneira de perceber isso é medindo. Nesta unidade, abordamos como medir a qualidade do RAG (recuperação e geração separadamente), avaliação automática (LLM como juiz) e manter a qualidade na produção (monitoramento, regressão). “Não se pode melhorar aquilo que não se mede” é o lema desta unidade.
Meça duas coisas separadas
O RAG tem duas pernas e deve ser medido separadamente porque o problema pode estar em qualquer uma delas:
- Qualidade de recuperação: A peça correta chegou?
- Qualidade de geração: A resposta correta foi produzida a partir da peça recebida?
Se a resposta for ruim, você precisa primeiro saber qual perna está ruim. Se a parte certa nunca chegar, mesmo o melhor prompt não poderá ser salvo (problema de recuperação). Se a peça correta chegou, mas o modelo a interpretou mal, melhorar a recuperação é inútil (problema de geração).
Métricas de recuperação
A recuperação é um problema de classificação/acesso; medido por métricas clássicas de recuperação de informação. Para isso você deve ter o cacho de ouro: o conhecimento de qual peça está “correta” para cada questão.
métrica
Quais medidas
Definição simples
Lembre-se@k
A peça correta está no top k?
Taxa correta de captura de peças
precisão@k
Quantas das k peças retornadas são relevantes?
Limpeza do que é trazido
MRR (classificação média recíproca)
Em que ordem está a peça correta?
Recompensas estando nas primeiras posições
Taxa de acerto
Chegou pelo menos uma peça correta?
A medida mais básica de sucesso
Comentário prático: Se Recall@k for baixo, a estratégia de chunking ou de busca (híbrido, k, reclassificação) deve ser refeita. Se a precisão for baixa, mas o recall for alto, adicionar a reclassificação é uma boa medida.
Métricas de Geração
Quando chega a peça correta, medimos a qualidade da resposta produzida pelo modelo. Três dimensões básicas:
- Fidelidade: Cada afirmação da resposta é apoiada pelo contexto? Existe algum encaixe? É uma medida direta de alucinação.
- Relevância da resposta: a resposta realmente responde à pergunta ou está fora do assunto?
- Completude: Todas as informações relevantes no contexto foram utilizadas ou estão faltando?
Muitas vezes, eles são pontuados de forma graduada (por exemplo, 1-5), em vez de binários como “verdadeiro/falso”.
Dica: monitore a fidelidade como uma métrica separada. Se a fidelidade diminui à medida que a precisão diminui, o problema é a geração; Se a fidelidade for alta, mas a resposta estiver errada, o problema é a peça errada (recuperação). Juntas, essas duas métricas são uma bússola que mostra a localização da falha.
Estabelecendo um conjunto de perguntas de ouro
Cada medição requer um conjunto de ouro/conjunto de dados de avaliação: perguntas realistas + respostas corretas esperadas + peças de origem corretas. Começar com 30 a 50 perguntas bem escolhidas é melhor do que 500 perguntas aleatórias. Inclua no conjunto o seguinte: perguntas reais feitas com frequência, perguntas difíceis conhecidas, perguntas armadilhas sem respostas (deve-se dizer "não sei"), perguntas com fontes contraditórias.
# Exemplo de cluster dourado (conceitual)[ {"question": "Quantos dias de férias anuais?", "expected_answer": "14 dias para 1-5 anos de antiguidade", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Onde fica o escritório da empresa em Marte?", "expected_answer": "NO_INFORMATION", # armadilha: não sei "correct_part_id": null, "categoria": "armadilha"}]
LLM como Juiz: Avaliação Automática
Marcar centenas de respostas manualmente é cansativo. O modelo LLM como juiz ocorre quando um modelo pontua e justifica a resposta de outro modelo com base em determinados critérios. Um bom juiz define claramente os critérios, dá exemplos e pede justificativas.
# Prompt de LLM como juiz (conceitual)Você é um avaliador imparcial. Avalie a RESPOSTA abaixo de acordo com o CONTEXTO fornecido e a RESPOSTA ESPERADA. Pontue (1-5) e justifique:- fidelidade: cada afirmação na resposta é apoiada no contexto?- precisão: a resposta corresponde à resposta esperada?- exaustividade: a informação relevante está completa? Particularmente: se a resposta contiver informações fora do contexto, forneça fidelidade1 e indique qual afirmação é fabricada. CONTEXTO: {contexto}ESPERADO: {esperado}RESPOSTA: {resposta}Resultado: {fidelidade, precisão, completude, justificação}
Cuidado: LLM como juiz não é perfeito; Eles podem ter seus próprios preconceitos (resposta longa, preferindo seu próprio estilo). Verifique também o Juiz: tenha algumas respostas pontuadas tanto pelo juiz quanto pelo humano e meça a concordância entre eles. Se o Juiz for consistente com as pontuações humanas, você pode confiar nele.
Classificação Fraca/Forte
Fraco (“foi bom para mim”):
Fiz algumas perguntas e as respostas pareceram boas. Eu tenho isso ao vivo. # Problema: sem medições, regressão imperceptível, melhoria cega.
Poderoso (cluster de ouro + métricas discretas + julgamento automático + regressão):
Cluster dourado de 40 perguntas. A cada alteração, recall@5, a fidelidade e a precisão são medidas automaticamente. Se a pontuação cair, a alteração será revertida. Na produção, o feedback do usuário é coletado e adicionado ao conjunto.
Monitoramento e Regressão na Produção
A avaliação não é feita uma vez e terminada. Três práticas constantes:
- Teste de regressão: execute automaticamente o cluster dourado em cada alteração de prompt/recuperação/modelo. Se a pontuação for reduzida, a alteração é revertida. Isso evita "quebrá-lo enquanto tenta melhorá-lo".
- Monitoramento da produção: são monitorados índice de “não encontrei informação” em questões reais, atraso médio, custo, feedback do usuário (👍/👎). Um aumento repentino de "não sei" costuma ser o primeiro sinal de mau funcionamento do índice ou recuperação.
- Ciclo de feedback: As perguntas reais fornecidas pelo usuário 👎 são revisadas e adicionadas à pilha dourada; Assim, o conjunto torna-se mais rico com o tempo e os pontos cegos do sistema são fechados.
Três Mini Estojos
Caso 1 — Regressão silenciosa. Uma equipe modificou o prompt para “melhorá-lo”; A precisão geral aumentou, mas a fidelidade diminuiu 30% nas questões armadilha (o modelo começou a se ajustar mais). Não teria sido notado se não fosse pelas questões armadilhas no aglomerado dourado; O teste de regressão reverteu a mudança.
Caso 2 — Esticando a perna errada. Num assistente as respostas foram ruins; A equipe trabalhou no prompt por semanas. Quando medimos as métricas de recuperação, recall@5 foi de apenas 48% — o problema estava na recuperação, não na geração. Quando o híbrido + reclassificação foi adicionado, o recall aumentou para 89% e a precisão também aumentou.
Caso 3 — Alerta de produção. Um dia, a taxa de “não consegui encontrar informações” para um assistente de suporte saltou de 6% para 34%. O trackpad avisou; O motivo foi que o trabalho de indexação, que funciona à noite, falhou silenciosamente e novos artigos não foram carregados. Sem monitoramento, afirmações incorretas de “não sei” teriam continuado por dias.
Erros comuns
- Estar satisfeito com “funcionou bem para mim”: Sem medição, a regressão passa despercebida.
- Não separar recuperação e geração: você corrigirá a perna errada e perderá tempo.
- Não fazer perguntas armadilhas: A tendência de inventar coisas não aparece no cluster dourado.
- Juiz não verificador: Um júri tendencioso dá falsa confiança.
- Não monitorar a produção: Falha no índice, explosão de custos continua silenciosamente.
Em resumo
- No RAG, a qualidade da recuperação e da geração são medidas separadamente; Deve ser determinado primeiro qual perna está danificada.
- recall@k, precisão@k, MRR para recuperação; Fidelidade, adequação e integridade são usadas para geração.
- Cada medição requer um cluster de ouro; Coloque nele questões reais, difíceis, armadilhas e contraditórias.
- LLM-as-juiz grandes conjuntos de pontuações automáticas; mas o próprio juiz deve ser justificado contra o homem.
- Testes de regressão, monitoramento da produção e um ciclo de feedback mantêm a qualidade ao longo do tempo.
Tarefa de aplicativo
(1) Crie um conjunto dourado de pelo menos 15 perguntas para seu próprio assistente: inclua pelo menos 3 armadilhas (sem respostas), 3 perguntas difíceis e 2 perguntas de origem contraditórias. Escreva a resposta esperada e a parte correta para cada pergunta. (2) Compare manualmente duas versões de prompt diferentes com este conjunto; Dê a cada resposta de 1 a 5 pontos pela fidelidade e precisão. (3) Adapte a solicitação do LLM como juiz acima aos seus próprios critérios. (4) Identifique três métricas que você acompanhará na produção e, para cada uma, pergunte “em que limite devo alarmar?” escreva o valor.
lista de verificação
- [ ] Posso medir a retenção e a qualidade da geração com métricas separadas.
- [] Eu sei o que significam métricas como recall@k e fidelidade.
- [ ] Posso construir um cluster dourado que inclua questões reais, difíceis, armadilhas e contraditórias.
- [] Posso configurar a avaliação automática e verificar o juiz com o LLM como juiz.
- [ ] Posso operar testes de regressão, monitoramento de produção e ciclo de feedback.