Unidade 7 / 11

Redução de alucinações e representação de recursos

Ganhos:

  • Explique as causas da alucinação e o papel do aterramento
  • Aplicar técnicas que façam o modelo dizer 'não sei' se não estiver no contexto
  • Garantir confiança e auditabilidade adicionando fontes/citações verificáveis às respostas

O comportamento mais perigoso de um modelo de linguagem é inventar algo que ele não conhece em tom confiante e persuasivo. Isso é chamado de alucinação. Ter alucinações com um assistente corporativo não é apenas irritante, é totalmente arriscado: o dia de folga errado, o preço errado, a substância jurídica errada podem, na verdade, colocar um funcionário ou cliente em perigo. Nesta unidade, abordamos por que ocorrem as alucinações, como reduzi-las no RAG e como tornar a resposta verificável.

O que causa alucinações?

O modelo é treinado para produzir a próxima palavra mais provável; Não “dizer a verdade”, mas “produzir texto fluente e razoável”. Se faltar informação, esta pode preencher a lacuna com algo estatisticamente plausível, mas factualmente incorreto. Três gatilhos típicos:

  • Não há resposta no contexto, mas o modelo se sente compelido a dizer algo de qualquer maneira.
  • O contexto é conflitante ou inadequado; O modelo fecha a lacuna com a previsão.
  • A questão vai além do contexto; o modelo retorna ao seu próprio conhecimento geral (e possivelmente desatualizado).

O RAG reduz a alucinação porque dá ao modelo uma fonte real – mas não o reinicia. Se você trouxer a peça errada ou deixar o modelo “liberdade para preencher a lacuna”, o sistema com RAG também poderá encaixá-la.

tipo de alucinação

sintoma

causa raiz

camada de solução

originado da recuperação

A resposta correta está no documento mas não chegou

Peça errada/faltando entregue

Chunking, híbrido, reclassificação (Unidade 3-4)

Fonte de geração

A parte correta chegou, mas a resposta está errada/deve ser adicionada

O modelo preencheu a lacuna com previsão

Aterramento, permissão "não sei", baixa criatividade

Fonte de citação

A resposta está correta, mas a fonte está errada

Modelo referido à parte errada

Verificação de citação (ver Unidade 8)

Dica: divida a alucinação em duas partes. Originado da recuperação: chegou a peça errada/faltando (solução: melhorar a recuperação). Fonte de geração: Chegou a peça correta, mas o modelo leu/adicionou incorretamente (solução: prompt e aterramento). Você não pode consertar a menos que saiba qual é.

Aterramento: acertando a resposta no contexto

Grounding é o nome dado a todas as técnicas de dizer ao modelo "apenas confie no texto que lhe dou, não vá além dele". Sua técnica mais básica e eficaz: dar explicitamente ao modelo permissão para dizer “não sei”. O modelo, assim como o humano, hesita em dizer “não sei”; Você deve dar a ele permissão expressa para fazer isso.

Responda apenas com base no CONTEXTO abaixo. Se a resposta não estiver CLARAMENTE no contexto, escreva exatamente isto: "Não consegui encontrar informações suficientes sobre isso na documentação." Não inclua números, datas ou nomes que não estejam no contexto. Não adivinhe.

Técnicas adicionais de aterramento:

  • Requisito de citação: Antes de cada afirmação, cite o contexto literalmente (“O documento diz: '...'”). Produzir cotações fabricadas é mais difícil para o modelo.
  • Temperatura baixa: A temperatura (temperatura, criatividade/configuração aleatória) deve ser baixa. Nota: em alguns modelos atuais este parâmetro foi removido; Neles, você fornece aterramento com um aviso. A alta criatividade é inimiga da integridade corporativa.
  • Limite de escopo: "Responda apenas a questões de política de consentimento; recuse educadamente a desativação."

Citação

A defesa sistêmica mais forte contra a alucinação é tornar a resposta verificável. Se o usuário conseguir ver em qual documento a resposta se baseia: (1) ele mesmo consegue detectar o erro, (2) a auditoria se torna possível, (3) a confiança aumenta e (4) o modelo produz com mais cautela com a consciência de que “precisarei citar a fonte”.

Duas abordagens comuns:

Atribuição inline: tag de origem ao lado de cada reivindicação. "As férias anuais são de 14 dias [1]." Abaixo está a documentação completa de [1].

Saída estruturada: Pedir ao modelo para produzir a resposta e a lista de fontes em campos separados; Mostrando recursos como links clicáveis ​​na interface.

# Produzindo uma resposta estruturada com base no modelo (conceitual) Dê sua resposta na seguinte estrutura:- resposta: <resposta baseada no contexto>- fontes: [{"part_no": 1, "file": "...", "section": "..."}]- confiança: <high|medium|low> # Quão claramente o contexto suporta isso? Se o contexto não suportar a resposta, escreva “nenhuma informação encontrada” no campo de resposta e deixe as fontes em branco.

Para que a Citação realmente funcione, é necessário verificar se a atribuição está correta. Às vezes, o modelo pode dar a resposta correta, mas fornecer a fonte errada. Sistemas avançados verificam automaticamente se cada afirmação produzida é realmente apoiada na peça para a qual aponta (a medida de “fidelidade” na próxima unidade).

Fraco/Forte: Aviso contra alucinações

Fraco (convite para preencher a lacuna):

Responda à pergunta da melhor maneira possível com as informações que você possui: {context} Pergunta: {question}# "O melhor que puder" significa "adivinhe se você não sabe" para o modelo.

Forte (aterramento + não sei permissão + fonte + confiança):

Basta confiar no CONTEXTO. Caso contrário, diga “Não consegui encontrar nenhuma informação”; invente o número/data/nome. Adicione [n] o número da fonte a cada reivindicação. Especifique o nível de confiança suportado pelo contexto.CONTEXT: [1]... [2]... PERGUNTA: {question}

Três Mini Estojos

Caso 1 — Número do item confeccionado. Um paralegal elaborou uma declaração do “Artigo 17/B” que estava fora de contexto e forneceu informações falsas ao funcionário. Quando foi acrescentada a instrução “Não indique um número de artigo que não esteja no contexto, caso contrário diga que não sei” + a obrigação de citar, os casos de artigos fabricados diminuíram de 11 para 0 em 40 exemplos.

Caso 2 — Resposta correta, fonte errada. Um assistente de suporte informou o período de devolução correto, mas citou o artigo errado; Quando o cliente clicou no link, uma página irrelevante foi aberta. Quando a verificação de citações (verificar se a afirmação aparece no artigo citado) foi adicionada, a taxa de citações falsas caiu de 23% para 2%.

Caso 3 — A permissão “não sei” não foi concedida. Um assistente de RH inventou uma resposta plausível, mas incorreta, para uma pergunta que não estava no documento. Quando o consentimento explícito "Não sei" e o texto completo ("Não consegui encontrar informações sobre isso na documentação") foram adicionados ao prompt, a taxa de rejeição honesta para perguntas sem resposta, em vez de invenção, aumentou de 8% para 95%.

Erros comuns

  • Não permitir “não sei”: o modelo preenche a lacuna com a fabricação.
  • Manter a criatividade elevada: a aleatoriedade é prejudicial à integridade corporativa.
  • Confiar na fonte sem verificá-la: o modelo pode associar a fonte errada à resposta correta.
  • Não fazer distinção entre os dois tipos de alucinações: você corrige o lugar errado sem saber se é causado por recuperação ou geração.
  • Confundir citação com cosméticos: A citação da fonte é tanto uma confirmação quanto um impedimento; leve isso a sério.
Cuidado: “O modelo parece muito confiante” não é o mesmo que “o modelo está correto”. As alucinações são geralmente as frases mais fluentes e confiantes. Leia a confiança pela fonte que ela indica, não pelo tom da frase.

Resumindo

  • Alucinação ocorre quando o modelo preenche a lacuna de informação com um texto plausível, mas falso; RAG reduz, mas não reinicia.
  • A alucinação pode ser causada por recuperação (parte errada) ou geração (leitura errada); Determine qual primeiro.
  • A técnica mais poderosa do Grounding é dar ao modelo permissão explícita de “não sei”; também exigência de citação e baixa criatividade.
  • A citação torna a resposta verificável; Isso tanto dá confiança quanto incentiva o modelo a ser produzido com cautela.
  • A exatidão da citação também deve ser verificada; A fonte errada pode ser anexada à resposta correta.

Tarefa de aplicativo

(1) Prepare 4 perguntas para fazer ao seu assistente, cujas respostas não estão nos documentos (perguntas armadilha). Teste cada um com o prompt fraco e forte e marque se o modelo se ajusta ou não. (2) Para as 4 questões cujas respostas estão no documento, faça com que o modelo gere o número da solda e verifique manualmente se a solda mostrada é realmente a peça correta. (3) Verifique se o modelo fornece “resposta certa, fonte errada” em pelo menos um caso e escreva em uma frase como você pode capturar isso automaticamente.

lista de verificação

  • [ ] Posso dizer por que a alucinação está acontecendo e que o RAG a reduz, mas não a reinicia.
  • [] Posso distinguir entre recuperação e alucinações induzidas por geração e corrigir o local correto.
  • [] Estou adicionando permissão explícita "Não sei" e regras básicas ao prompt.
  • [] Estou adicionando uma fonte verificável (citação) à resposta.
  • [ ] Entendo a necessidade de verificar melhor a exatidão da atribuição.