Unidade 8 / 11

Avaliação e Monitoramento RAG

Ganhos:

  • Definir métricas que medem a retenção e a qualidade da geração separadamente
  • Configure um conjunto de perguntas douradas e execute uma avaliação automática com LLM como juiz
  • Manter a qualidade por meio de feedback, monitoramento e testes de regressão na produção

A frase “Instalei o assistente, parece estar funcionando bem” não é uma declaração de engenharia. Os sistemas RAG falham silenciosamente: um novo tipo de documento engana a recuperação, uma alteração imediata reduz a precisão, o índice fica obsoleto. A única maneira de perceber isso é medindo. Nesta unidade, abordamos como medir a qualidade do RAG (recuperação e geração separadamente), avaliação automática (LLM como juiz) e manter a qualidade na produção (monitoramento, regressão). “Não se pode melhorar aquilo que não se mede” é o lema desta unidade.

Meça duas coisas separadas

O RAG tem duas pernas e deve ser medido separadamente porque o problema pode estar em qualquer uma delas:

  1. Qualidade de recuperação: A peça correta chegou?
  2. Qualidade de geração: A resposta correta foi produzida a partir da peça recebida?

Se a resposta for ruim, você precisa primeiro saber qual perna está ruim. Se a parte certa nunca chegar, mesmo o melhor prompt não poderá ser salvo (problema de recuperação). Se a peça correta chegou, mas o modelo a interpretou mal, melhorar a recuperação é inútil (problema de geração).

Métricas de recuperação

A recuperação é um problema de classificação/acesso; medido por métricas clássicas de recuperação de informação. Para isso você deve ter o cacho de ouro: o conhecimento de qual peça está “correta” para cada questão.

métrica

Quais medidas

Definição simples

Lembre-se@k

A peça correta está no top k?

Taxa correta de captura de peças

precisão@k

Quantas das k peças retornadas são relevantes?

Limpeza do que é trazido

MRR (classificação média recíproca)

Em que ordem está a peça correta?

Recompensas estando nas primeiras posições

Taxa de acerto

Chegou pelo menos uma peça correta?

A medida mais básica de sucesso

Comentário prático: Se Recall@k for baixo, a estratégia de chunking ou de busca (híbrido, k, reclassificação) deve ser refeita. Se a precisão for baixa, mas o recall for alto, adicionar a reclassificação é uma boa medida.

Métricas de Geração

Quando chega a peça correta, medimos a qualidade da resposta produzida pelo modelo. Três dimensões básicas:

  • Fidelidade: Cada afirmação da resposta é apoiada pelo contexto? Existe algum encaixe? É uma medida direta de alucinação.
  • Relevância da resposta: a resposta realmente responde à pergunta ou está fora do assunto?
  • Completude: Todas as informações relevantes no contexto foram utilizadas ou estão faltando?

Muitas vezes, eles são pontuados de forma graduada (por exemplo, 1-5), em vez de binários como “verdadeiro/falso”.

Dica: monitore a fidelidade como uma métrica separada. Se a fidelidade diminui à medida que a precisão diminui, o problema é a geração; Se a fidelidade for alta, mas a resposta estiver errada, o problema é a peça errada (recuperação). Juntas, essas duas métricas são uma bússola que mostra a localização da falha.

Estabelecendo um conjunto de perguntas de ouro

Cada medição requer um conjunto de ouro/conjunto de dados de avaliação: perguntas realistas + respostas corretas esperadas + peças de origem corretas. Começar com 30 a 50 perguntas bem escolhidas é melhor do que 500 perguntas aleatórias. Inclua no conjunto o seguinte: perguntas reais feitas com frequência, perguntas difíceis conhecidas, perguntas armadilhas sem respostas (deve-se dizer "não sei"), perguntas com fontes contraditórias.

# Exemplo de cluster dourado (conceitual)[ {"question": "Quantos dias de férias anuais?", "expected_answer": "14 dias para 1-5 anos de antiguidade", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Onde fica o escritório da empresa em Marte?", "expected_answer": "NO_INFORMATION", # armadilha: não sei "correct_part_id": null, "categoria": "armadilha"}]

LLM como Juiz: Avaliação Automática

Marcar centenas de respostas manualmente é cansativo. O modelo LLM como juiz ocorre quando um modelo pontua e justifica a resposta de outro modelo com base em determinados critérios. Um bom juiz define claramente os critérios, dá exemplos e pede justificativas.

# Prompt de LLM como juiz (conceitual)Você é um avaliador imparcial. Avalie a RESPOSTA abaixo de acordo com o CONTEXTO fornecido e a RESPOSTA ESPERADA. Pontue (1-5) e justifique:- fidelidade: cada afirmação na resposta é apoiada no contexto?- precisão: a resposta corresponde à resposta esperada?- exaustividade: a informação relevante está completa? Particularmente: se a resposta contiver informações fora do contexto, forneça fidelidade1 e indique qual afirmação é fabricada. CONTEXTO: {contexto}ESPERADO: {esperado}RESPOSTA: {resposta}Resultado: {fidelidade, precisão, completude, justificação}

Cuidado: LLM como juiz não é perfeito; Eles podem ter seus próprios preconceitos (resposta longa, preferindo seu próprio estilo). Verifique também o Juiz: tenha algumas respostas pontuadas tanto pelo juiz quanto pelo humano e meça a concordância entre eles. Se o Juiz for consistente com as pontuações humanas, você pode confiar nele.

Classificação Fraca/Forte

Fraco (“foi bom para mim”):

Fiz algumas perguntas e as respostas pareceram boas. Eu tenho isso ao vivo. # Problema: sem medições, regressão imperceptível, melhoria cega.

Poderoso (cluster de ouro + métricas discretas + julgamento automático + regressão):

Cluster dourado de 40 perguntas. A cada alteração, recall@5, a fidelidade e a precisão são medidas automaticamente. Se a pontuação cair, a alteração será revertida. Na produção, o feedback do usuário é coletado e adicionado ao conjunto.

Monitoramento e Regressão na Produção

A avaliação não é feita uma vez e terminada. Três práticas constantes:

  • Teste de regressão: execute automaticamente o cluster dourado em cada alteração de prompt/recuperação/modelo. Se a pontuação for reduzida, a alteração é revertida. Isso evita "quebrá-lo enquanto tenta melhorá-lo".
  • Monitoramento da produção: são monitorados índice de “não encontrei informação” em questões reais, atraso médio, custo, feedback do usuário (👍/👎). Um aumento repentino de "não sei" costuma ser o primeiro sinal de mau funcionamento do índice ou recuperação.
  • Ciclo de feedback: As perguntas reais fornecidas pelo usuário 👎 são revisadas e adicionadas à pilha dourada; Assim, o conjunto torna-se mais rico com o tempo e os pontos cegos do sistema são fechados.

Três Mini Estojos

Caso 1 — Regressão silenciosa. Uma equipe modificou o prompt para “melhorá-lo”; A precisão geral aumentou, mas a fidelidade diminuiu 30% nas questões armadilha (o modelo começou a se ajustar mais). Não teria sido notado se não fosse pelas questões armadilhas no aglomerado dourado; O teste de regressão reverteu a mudança.

Caso 2 — Esticando a perna errada. Num assistente as respostas foram ruins; A equipe trabalhou no prompt por semanas. Quando medimos as métricas de recuperação, recall@5 foi de apenas 48% — o problema estava na recuperação, não na geração. Quando o híbrido + reclassificação foi adicionado, o recall aumentou para 89% e a precisão também aumentou.

Caso 3 — Alerta de produção. Um dia, a taxa de “não consegui encontrar informações” para um assistente de suporte saltou de 6% para 34%. O trackpad avisou; O motivo foi que o trabalho de indexação, que funciona à noite, falhou silenciosamente e novos artigos não foram carregados. Sem monitoramento, afirmações incorretas de “não sei” teriam continuado por dias.

Erros comuns

  • Estar satisfeito com “funcionou bem para mim”: Sem medição, a regressão passa despercebida.
  • Não separar recuperação e geração: você corrigirá a perna errada e perderá tempo.
  • Não fazer perguntas armadilhas: A tendência de inventar coisas não aparece no cluster dourado.
  • Juiz não verificador: Um júri tendencioso dá falsa confiança.
  • Não monitorar a produção: Falha no índice, explosão de custos continua silenciosamente.

Em resumo

  • No RAG, a qualidade da recuperação e da geração são medidas separadamente; Deve ser determinado primeiro qual perna está danificada.
  • recall@k, precisão@k, MRR para recuperação; Fidelidade, adequação e integridade são usadas para geração.
  • Cada medição requer um cluster de ouro; Coloque nele questões reais, difíceis, armadilhas e contraditórias.
  • LLM-as-juiz grandes conjuntos de pontuações automáticas; mas o próprio juiz deve ser justificado contra o homem.
  • Testes de regressão, monitoramento da produção e um ciclo de feedback mantêm a qualidade ao longo do tempo.

Tarefa de aplicativo

(1) Crie um conjunto dourado de pelo menos 15 perguntas para seu próprio assistente: inclua pelo menos 3 armadilhas (sem respostas), 3 perguntas difíceis e 2 perguntas de origem contraditórias. Escreva a resposta esperada e a parte correta para cada pergunta. (2) Compare manualmente duas versões de prompt diferentes com este conjunto; Dê a cada resposta de 1 a 5 pontos pela fidelidade e precisão. (3) Adapte a solicitação do LLM como juiz acima aos seus próprios critérios. (4) Identifique três métricas que você acompanhará na produção e, para cada uma, pergunte “em que limite devo alarmar?” escreva o valor.

lista de verificação

  • [ ] Posso medir a retenção e a qualidade da geração com métricas separadas.
  • [] Eu sei o que significam métricas como recall@k e fidelidade.
  • [ ] Posso construir um cluster dourado que inclua questões reais, difíceis, armadilhas e contraditórias.
  • [] Posso configurar a avaliação automática e verificar o juiz com o LLM como juiz.
  • [ ] Posso operar testes de regressão, monitoramento de produção e ciclo de feedback.