Ganancias:
- Explicar las causas de las alucinaciones y el papel de la conexión a tierra.
- Aplicar técnicas que hagan que el modelo diga 'no sé' si no está en contexto
- Garantizar la confianza y la auditabilidad agregando fuentes/citas verificables a las respuestas
El comportamiento más peligroso de un modelo de lenguaje es inventar algo que no sabe en un tono seguro y persuasivo. Esto se llama alucinación. Alucinar en un asistente corporativo no sólo es molesto, sino francamente riesgoso: el día libre equivocado, el precio equivocado, la sustancia legal equivocada pueden poner en peligro a un empleado o cliente. En esta unidad, cubrimos por qué ocurren las alucinaciones, cómo reducirlas en RAG y cómo hacer que la respuesta sea verificable.
¿Qué causa las alucinaciones?
El modelo está entrenado para producir la siguiente palabra más probable; No "decir la verdad", sino "producir un texto fluido y razonable". Si falta información, se puede llenar el vacío con algo estadísticamente plausible pero objetivamente incorrecto. Tres desencadenantes típicos:
- No hay respuesta en el contexto, pero el modelo se siente obligado a decir algo de todos modos.
- El contexto es conflictivo o inadecuado; El modelo cierra la brecha con la predicción.
- La pregunta va más allá del contexto; el modelo vuelve a su propio conocimiento general (y posiblemente obsoleto).
RAG reduce las alucinaciones porque le da al modelo una fuente real, pero no las restablece. Si traes la pieza equivocada o dejas al modelo "libertad para llenar el hueco", el sistema con RAG también puede adaptarse.
tipo de alucinación
síntoma
causa raíz
capa de solución
procedente de la recuperación
La respuesta correcta está en el documento pero no llegó
Pieza entregada incorrecta o faltante
Fragmentación, híbrido, reclasificación (Unidad 3-4)
Generación de origen
Llegó la parte correcta pero la respuesta es incorrecta/debe agregarse
El modelo llenó el vacío con predicción.
Puesta a tierra, permiso de "no sé", poca creatividad.
Cita obtenida
La respuesta es correcta pero la fuente está equivocada.
Modelo referido a pieza equivocada
Verificación de citación (ver Unidad 8)
Pista: divide la alucinación en dos partes. Procedente de la recuperación: llegó una pieza incorrecta o faltante (solución: mejorar la recuperación). Fuente de generación: Llegó la pieza correcta, pero el modelo la leyó/agregó incorrectamente (solución: aviso y conexión a tierra). No puedes arreglarlo a menos que sepas cuál es.
Conexión a tierra: encontrar la respuesta en contexto
Grounding es el nombre que se le da a todas las técnicas para decirle al modelo "solo confía en el texto que te doy, no vayas más allá". Su técnica más básica y efectiva: dar permiso explícito al modelo para decir "No lo sé". El modelo, como el humano, duda en decir "no lo sé"; Debes darle permiso expreso para hacer esto.
Responda únicamente según el CONTEXTO a continuación. Si la respuesta no está CLARAMENTE en el contexto, escriba exactamente esto: "No pude encontrar suficiente información sobre esto en la documentación". No incluya números, fechas o nombres que no estén en el contexto. No adivines.
Técnicas de puesta a tierra adicionales:
- Requisito de cita: Antes de cada afirmación, citar el contexto textualmente (“El documento dice: '...'”). Producir citas inventadas es más difícil para el modelo.
- Baja temperatura: La temperatura (temperatura, creatividad/ajuste aleatorio) debe ser baja. Nota: en algunos modelos actuales este parámetro ha sido eliminado; En ellos, proporcionas conexión a tierra con un aviso. La alta creatividad es enemiga de la integridad corporativa.
- Límite de alcance: "Responda únicamente a cuestiones de política de consentimiento; rechace cortésmente la opción de no participar".
Citación
La defensa sistémica más fuerte contra las alucinaciones es hacer que la respuesta sea verificable. Si el usuario puede ver en qué documento se basa la respuesta: (1) él mismo puede detectar el error, (2) la auditoría se vuelve posible, (3) aumenta la confianza y (4) el modelo produce con más cautela, sabiendo que "tendré que citar la fuente".
Dos enfoques comunes:
Atribución en línea: etiqueta de fuente junto a cada reclamo. "Las vacaciones anuales son de 14 días [1]". A continuación se muestra la documentación completa de [1].
Salida estructurada: pedirle al modelo que produzca la respuesta y la lista de fuentes en campos separados; Mostrar recursos como enlaces en los que se puede hacer clic en la interfaz.
# Producir una respuesta estructurada basada en el modelo (conceptual) Dé su respuesta en la siguiente estructura:- respuesta: <respuesta basada en contexto>- fuentes: [{"part_no": 1, "file": "...", "section": "..."}]- confianza: <high|medium|low> # ¿Con qué claridad lo respalda el contexto? Si el contexto no respalda la respuesta, escriba "no se encontró información" en el campo de respuesta y deje las fuentes en blanco.
Para que Citation realmente funcione es necesario verificar que la atribución sea correcta. En ocasiones, el modelo puede dar la respuesta correcta pero dar la fuente incorrecta. Los sistemas avanzados verifican automáticamente que cada afirmación presentada esté realmente respaldada en la pieza a la que apunta (la medida de "fidelidad" en la siguiente unidad).
Débil/Fuerte: Aviso contra las alucinaciones
Débil (invitación a llenar el espacio en blanco):
Responda la pregunta lo mejor que pueda con la información que tiene: {context} Pregunta: {question}# "Lo mejor que pueda" significa "adivina si no lo sabe" para el modelo.
Fuerte (conexión a tierra + no sé permiso + fuente + confianza):
Simplemente confíe en el CONTEXTO. De lo contrario, diga "No pude encontrar ninguna información"; número de composición/fecha/nombre. Agregue [n] número de fuente a cada reclamo. Especifique el nivel de confianza admitido por el contexto.CONTEXTO: [1]... [2]... PREGUNTA: {pregunta}
Tres mini estuches
Caso 1: Número de artículo inventado. Un asistente legal inventó una declaración del "Artículo 17/B" que estaba fuera de contexto y proporcionó información falsa al empleado. Cuando se añadió la instrucción "No dar un número de artículo que no esté en el contexto, en caso contrario decir no lo sé" + la obligación de citar, los casos de artículos fabricados disminuyeron de 11 a 0 en 40 ejemplos.
Caso 2: respuesta correcta, fuente incorrecta. Un asistente de soporte indicó el período de devolución correcto pero citó el artículo incorrecto; Cuando el cliente hizo clic en el enlace, se abrió una página irrelevante. Cuando se agregó la verificación de citación (verificar si el reclamo aparece en el artículo citado), la tasa de citación falsa cayó del 23% al 2%.
Caso 3: No se concedió el permiso “No sé”. Un asistente de recursos humanos había inventado una respuesta plausible pero incorrecta a una pregunta que no estaba en el documento. Cuando se agregaron al mensaje el consentimiento explícito "No sé" y el texto completo ("No pude encontrar información sobre esto en la documentación"), la tasa de rechazo honesto para preguntas sin respuesta, en lugar de mentiras, aumentó del 8% al 95%.
Errores comunes
- No permitir el "no sé": el modelo llena el vacío con la fabricación.
- Mantener alta la creatividad: la aleatoriedad es perjudicial para la integridad corporativa.
- Confiar en la fuente sin verificarla: el modelo puede adjuntar la fuente incorrecta a la respuesta correcta.
- No distinguir entre los dos tipos de alucinaciones: Corriges el lugar equivocado sin saber si es causado por recuperación o por generación.
- Confundir la cita con los cosméticos: la cita de la fuente es a la vez confirmatoria y disuasoria; tómalo en serio.
Precaución: "El modelo parece muy seguro" no es lo mismo que "el modelo es correcto". Las alucinaciones son generalmente las frases más fluidas y seguras. Lea la confianza desde la fuente que indica, no desde el tono de la oración.
En resumen
- La alucinación ocurre cuando el modelo llena el vacío de información con texto plausible pero falso; RAG se reduce pero no se restablece.
- La alucinación puede ser causada por recuperación (parte equivocada) o generación (lectura incorrecta); Determina cuál primero.
- La técnica más poderosa de Grounding es darle al modelo un permiso explícito de "No sé"; también requisito de citación y baja creatividad.
- La cita hace que la respuesta sea verificable; Esto da confianza y al mismo tiempo empuja a que el modelo se produzca con cautela.
- También se debe comprobar la exactitud de la cita; Es posible que se adjunte la fuente incorrecta a la respuesta correcta.
Tarea de aplicación
(1) Prepare 4 preguntas para hacerle a su asistente, cuyas respuestas no están en los documentos (preguntas trampa). Pruebe cada uno con las indicaciones débil y fuerte y marque si el modelo se ajusta o no. (2) Para las 4 preguntas cuyas respuestas están en el documento, haga que el modelo genere el número de soldadura y verifique manualmente si la soldadura que muestra es realmente la pieza correcta. (3) Verifique si el modelo da "respuesta correcta, fuente incorrecta" en al menos un caso y escriba en una oración cómo puede detectar esto automáticamente.
lista de verificación
- [] Puedo decir por qué ocurre la alucinación y que RAG la reduce pero no la restablece.
- [ ] Puedo distinguir entre alucinaciones de recuperación y alucinaciones inducidas por generación y corregir el lugar correcto.
- [] Estoy agregando permisos explícitos de "No sé" y reglas básicas al mensaje.
- [] Estoy agregando una fuente verificable (cita) a la respuesta.
- [] Entiendo la necesidad de verificar más a fondo la exactitud de la atribución.