La generación aumentada por recuperación, normalmente abreviada como RAG, proporciona a un modelo de lenguaje información seleccionada en el momento de responder. En lugar de depender solo de patrones aprendidos durante el entrenamiento, una aplicación busca en una colección de documentos, añade pasajes relevantes a la solicitud y pide al modelo que responda a partir de esa evidencia.
El flujo básico tiene tres partes. La recuperación encuentra pasajes candidatos. La ampliación reúne esos pasajes con instrucciones y la pregunta del usuario. La generación produce una respuesta que debería mantenerse fundamentada en el material proporcionado. Este patrón resulta útil cuando el conocimiento es privado, cambia con frecuencia o necesita citas.
RAG no vuelve veraz a un modelo por sí mismo. Crea una cadena de componentes que se puede inspeccionar y mejorar. El recuperador puede no encontrar el documento correcto, seleccionar una versión desactualizada o devolver un pasaje que comparte palabras clave pero no significado. El prompt puede no exigir fundamentación. Entonces el modelo puede combinar extractos válidos y llegar a una conclusión sin respaldo.
La preparación de documentos determina buena parte del resultado. Los archivos necesitan identificadores estables, metadatos útiles, reglas de acceso y fragmentos que conserven suficiente significado circundante. Los fragmentos demasiado grandes desperdician contexto y difuminan la relevancia. Los demasiado pequeños separan una afirmación de su definición, fecha, excepción o encabezado de tabla.
La recuperación puede usar búsqueda por palabras clave, similitud vectorial, clasificación semántica o una combinación. La búsqueda por palabras clave funciona bien con nombres, códigos y frases exactas. La búsqueda vectorial puede encontrar pasajes relacionados conceptualmente aunque cambie la redacción. La recuperación híbrida suele ser un mejor punto de partida porque combina ambas señales, pero aun así necesita evaluarse con preguntas reales.
El control de acceso pertenece a la recuperación, no a un aviso posterior a la generación. Una persona nunca debería recibir un pasaje que no tenía permiso para recuperar. Los documentos recuperados también deben tratarse como entradas no confiables: un documento puede contener instrucciones que intenten anular las reglas de la aplicación. Mantén separada la política del sistema y limita lo que pueden hacer las herramientas posteriores.
El prompt debe identificar cada fragmento de fuente, exigir citas para las afirmaciones factuales y definir la alternativa cuando la evidencia no sea suficiente. También debe indicar al modelo cómo gestionar los desacuerdos: presentar las versiones en conflicto con fechas y citas, en vez de elegir una en silencio. Estos requisitos facilitan el diagnóstico de errores.
Mide por separado la recuperación y la generación. Las pruebas de recuperación preguntan si el pasaje de apoyo apareció entre los mejores resultados. Las pruebas de generación preguntan si la respuesta está respaldada, es completa, cita correctamente y muestra una cautela adecuada. Una respuesta elegante puede esconder una recuperación deficiente, y una recuperación perfecta todavía puede desembocar en una mala síntesis.
Más contexto no siempre es mejor. Los pasajes poco relevantes consumen tokens y pueden alejar la respuesta de la evidencia más sólida. Establece un umbral de relevancia, elimina duplicados, prioriza versiones actuales cuando importe la vigencia y reserva espacio suficiente para la respuesta. Las preguntas complejas pueden requerir dividirse en varias búsquedas concretas.
RAG es la herramienta adecuada cuando los hechos viven en un corpus privado o cambiante. El ajuste fino suele encajar mejor cuando el objetivo es cambiar el comportamiento, el estilo o el rendimiento de una tarea, y no incorporar conocimiento actual. Las herramientas de agentes son útiles cuando el sistema debe decidir cuándo y dónde recuperar información dentro de un flujo más amplio.
Una interfaz RAG fiable debe mostrar sus fuentes, reconocer cuando el corpus no puede responder y permitir corregir errores. El producto real no es el párrafo generado. Es la ruta de evidencia que permite a quien lee decidir si ese párrafo merece confianza.
Combinamos fuentes primarias, documentación de producto y casos de uso reales para ayudarte a valorar si una herramienta encaja en tu flujo de trabajo.