Unidad 1 / 11

¿Qué es RAG y por qué es necesario?

Ganancias:

  • Explicar que RAG inyecta contexto sin cambiar los pesos del modelo y funciona con una lógica de 'examen a libro abierto'
  • Comparación de RAG con enfoques de contexto largo y de ajuste fino según el costo, la puntualidad y el escenario de uso
  • Enumerar los pasos de una canalización RAG típica que consta de fases de indexación y consulta.

No importa cuán poderoso sea un modelo de lenguaje (inteligencia artificial que comprende y produce texto; de ahora en adelante lo llamaremos modelo para abreviar), no conoce el contrato que su empresa firmó ayer, su página wiki interna (base de conocimiento interna) o la nota de lanzamiento publicada esta mañana. El modelo se limita al conocimiento general hasta la fecha en que fue entrenado; Esto se llama "fecha límite de educación". RAG (Recuperación-Generación Aumentada) llena exactamente este vacío: encuentra los documentos de la empresa relacionados con la pregunta, se los da al modelo como contexto (es decir, el texto adicional que leerá mientras produce la respuesta) y produce la respuesta en base a este contexto.

En esta unidad, veremos claramente qué es RAG, cuándo se prefiere sobre qué alternativas y los pasos de una tubería RAG típica. Todas las unidades posteriores profundizarán las partes de este mapa una por una.

La idea básica de RAG: examen a libro abierto

Expliquemos RAG en una oración: "Primero busque el documento relevante, luego haga que el modelo lea ese documento e imprima la respuesta en consecuencia".

La analogía más útil es ésta: RAG traslada el modelo de un “examen a libro cerrado” a un “examen a libro abierto”. En el examen a libro cerrado, el alumno responde sólo de memoria; Existe un alto riesgo de inventar lo que no recuerdas. En el examen a libro abierto, el alumno responde mirando la fuente colocada frente a él. En RAG, el modelo ya no responde desde su propia memoria, sino desde el texto actual y específico que le das.

Punto crítico: RAG no cambia los pesos del modelo, es decir, los miles de millones de parámetros numéricos que el modelo ha aprendido. No vuelves a entrenar el modelo. Para cada pregunta, inserta fragmentos de texto relevantes para esa pregunta en el mensaje (texto de instrucción enviado al modelo). Por lo tanto, no es necesario volver a entrenar el modelo cuando se actualiza un documento; simplemente actualiza el registro relevante en la base de datos de búsqueda.

Sugerencia: Dos preguntas determinan la calidad del RAG: (1) ¿Encontró el documento correcto? (2) ¿El modelo lo leyó correctamente? La primera es "calidad de recuperación", la segunda es "calidad de generación". Los dos se miden y mejoran por separado.

RAG, ¿ajuste fino o contexto largo?

A menudo se confunden tres caminos cuando se busca una solución a un problema organizacional. Aclaremos sus diferencias. El ajuste fino consiste en actualizar los pesos del modelo con sus datos y enseñarle un nuevo comportamiento/estilo. El contexto largo significa completar todos los documentos directamente en el mensaje sin ninguna selección.

Enfoque

¿Qué hace?

¿Cuándo es apropiado?

Costo / Riesgo

trapo

Inyecta el documento relevante como contexto.

Información extensa, específica y que cambia con frecuencia

Bajo; fácil de actualizar, se puede citar la fuente

Ajuste fino

Actualiza pesos con nuevos datos.

Estilo/formato/enseñanza de idiomas fijos

Alto; Se requiere reentrenamiento con cada actualización

Solo contexto largo

Llena todos los documentos en el mensaje

Pequeño juego de documentos estacionarios

Aumenta el coste del token y el riesgo de "perder la parte media"

Como regla general: el ajuste fino le enseña al modelo a hablar; RAG le dice al modelo lo que debe saber. En la mayoría de los escenarios empresariales, se prueba primero RAG porque es económico, actualizable y puede mostrar la fuente de la respuesta. Un contexto extenso es razonable si el conjunto de documentos es realmente pequeño y fijo (por ejemplo, un único manual de 20 páginas); Pero con miles de páginas, es caro y el modelo puede perder información en medio de un texto largo.

Una tubería RAG típica

RAG consta de dos fases principales: indexación (preparación, realizada una vez o periódicamente) y consulta (se ejecuta en cada pregunta del usuario).

Indexación paso a paso (offline, sin espera del usuario):

  1. Recopile: extraiga documentos de fuentes (PDF, wiki, sistema de tickets, base de datos, correo electrónico).
  2. Fragmentación: divida el texto largo en partes más pequeñas y manejables.
  3. Incrustar: convierte cada parte en incrustación (el vector numérico que lleva el significado del texto).
  4. Guardar: escriba los vectores junto con el texto y los metadatos (fuente, fecha, información de autorización) en la base de datos de vectores.

Consulta paso a paso (en línea, mientras el usuario espera):

  1. Convierta la pregunta del usuario a incrustada.
  2. Recupere las partes más similares de la base de datos de vectores.
  3. Coloque estas piezas + pregunta en una plantilla de mensajes.
  4. Obtenga la respuesta contextual y sus fuentes del modelo.

# Esquema conceptual de la fase de consulta (no depende del idioma)question = "¿Cuántos días de vacaciones anuales?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # partes más similaresprompt = f"""Responda la PREGUNTA usando el CONTEXTO a continuación. Si la respuesta no está en contexto, diga "No tengo información sobre esto". Montaje.CONTEXTO:{partes}PREGUNTA: {pregunta}"""respuesta = model.uret(prompt) # p.e. modelo: claude-opus-4-8

Este flujo es un mapa de cada etapa, que desglosaremos una por una en unidades posteriores.

Aviso débil / Aviso fuerte

Incluso con el mismo contexto RAG, la calidad del mensaje cambia la respuesta.

Mensaje débil (abierto al ajuste del modelo, no requiere recursos):

Utilice esta información y diga vacaciones anuales: {parts}. Pregunta: {pregunta}

Aviso potente (conexión a tierra + permiso "No sé" + solicitud de recursos):

Responda únicamente según el CONTEXTO a continuación. Si no hay una respuesta clara en el contexto, escriba "No pude encontrar información sobre esto en la documentación"; No adivines. Agregue la etiqueta [Fuente: nombre_archivo] del fragmento en el que confía al final de su respuesta. CONTEXTO: {piezas} PREGUNTA: {pregunta}

Tres mini estuches

Caso 1 — Asistente de RRHH (Recursos Humanos). Una empresa tiene un manual de recursos humanos de 340 páginas y los empleados hacen una media de 90 preguntas al día. Se intentó realizar ajustes, pero como el manual se actualizaba mensualmente, era necesario volver a capacitarse cada vez; El costo alcanzó miles de dólares por mes. Después de cambiar a RAG, la actualización se redujo al paso "volver a indexar el documento" (minutos) y la tasa de respuestas correctas aumentó del 71% al 93% en la medición manual.

Caso 2: Atención al cliente. El equipo de soporte cuenta con 12.000 tickets resueltos y 800 artículos de ayuda. Un representante tarda un promedio de 4 minutos en encontrar manualmente una respuesta. Cuando el asistente del RAG trajo los 5 registros más relevantes y elaboró ​​un borrador de respuesta, el tiempo se redujo a 40 segundos; Pero el equipo se dio cuenta del riesgo de "parecer inseguro al traer el artículo equivocado" e hizo obligatoria la cita de la fuente.

Caso 3 — Derecho. Un equipo de contratación preguntó "¿en qué contratos la cláusula de confidencialidad dura 5 años?" él hace la pregunta. En la prueba de contexto largo, se completaron 60 contratos en un solo aviso; el modelo se saltó los dos contratos del medio. Cuando solo se introdujeron los elementos relevantes con RAG, el costo del token disminuyó en un 80 % y se restableció el salto faltante.

¿Por qué se necesita RAG?

  • Vigencia: Accedes a la información después de la fecha de corte de formación.
  • Información especial: Tus documentos internos no están incluidos en la formación de ningún modelo; Sólo tú puedes dar.
  • Verificabilidad: puede citar la fuente de la respuesta (citación), esencial para la auditoría y la confianza.
  • Control de alucinaciones: se basa en el texto colocado delante en lugar de inventar un modelo.
  • Costo: Es mucho más económico y rápido de poner en funcionamiento que un ajuste fino.
Precaución: RAG no es mágico. Si trae la pieza equivocada, el modelo llega a la respuesta equivocada y parece "confiado". Tenga en cuenta la frase "Calidad de recuperación = calidad RAG".

Errores comunes

  • Confundir RAG con ajuste fino: RAG no cambia los pesos; Simplemente agrega contexto. Confundir estos dos conducirá a elegir la arquitectura incorrecta.
  • No permitir "No sé": si el mensaje deja al modelo libre para completar el espacio en blanco, lo compensará.
  • No citar fuentes: No se puede verificar una respuesta sin una fuente; El usuario no puede notar el error.
  • Reunir todo en un solo mensaje: el contexto largo parece barato pero es caro y omite la información intermedia.
  • Quedarse estancado en la generación sin medir la recuperación: si la respuesta es mala, primero pregunte "¿Llegó la pieza correcta?" debería preguntarse.

En resumen

  • RAG es un enfoque que inyecta documentos relevantes para la pregunta en el modelo como contexto; no cambia los pesos ("examen a libro abierto").
  • El ajuste fino enseña estilo/formato, RAG brinda información actual y específica; El contexto largo funciona bien para conjuntos fijos pequeños. En la mayoría de los escenarios, se prueba primero RAG.
  • La canalización tiene dos fases: indexación fuera de línea (fragmento + incrustación + guardar) y consulta en línea (recuperación + solicitud + generación).
  • RAG brinda puntualidad, información específica, verificabilidad, control de alucinaciones y bajo costo.
  • La calidad del sistema depende directamente de la calidad de la recuperación: pieza incorrecta significa respuesta incorrecta.

Tarea de aplicación

Elija una fuente genuina de información de su propio equipo (por ejemplo, un documento de procedimiento o una página de preguntas frecuentes). (1) Escriba 5 preguntas factuales sobre esta fuente. (2) Tenga en cuenta qué parte del documento contiene la respuesta correcta para cada pregunta; esta se convierte en su lista de “respuestas de oro”. (3) Utilizando la plantilla de "mensaje fuerte" anterior, pegue manualmente la sección relevante como contexto y pregunte a un modelo. (4) Compare la respuesta dada por el modelo con la respuesta dorada y márquela como verdadero/falso. Esta es la primera versión manual de la evaluación que automatizará en unidades futuras.

lista de verificación

  • [] Puedo explicar en una oración que RAG no cambia los pesos, solo agrega contexto.
  • [ ] Puedo distinguir entre RAG, ajuste fino y contexto largo y cuándo es apropiado.
  • [] Puedo contar las fases de indexación (recopilar-triturar-incrustar-guardar) y de consulta (incrustar-buscar-prompt-generar) en orden.
  • [] Sé por qué agregué las instrucciones "si no está en contexto, diga que no lo sé" y "citar la fuente" al mensaje.
  • [ ] Puedo adaptar el principio "Calidad de recuperación = Calidad RAG" a mi propio caso.