RAG — Generación aumentada por recuperación
La generación aumentada por recuperación, o RAG, es la técnica de buscar información relevante en una fuente propia y pasársela al modelo de lenguaje para que redacte la respuesta con ella. El modelo no memoriza el contenido: lo consulta en el momento de responder.
¿Qué es generación aumentada por recuperación?
La generación aumentada por recuperación, o RAG, es la técnica de buscar información relevante en una fuente propia y pasársela al modelo de lenguaje para que redacte la respuesta con ella. El modelo no memoriza el contenido: lo consulta en el momento de responder.
También: RAG · recuperación aumentada
RAG no es entrenar un modelo
Es la confusión más extendida. Entrenar significa modificar el modelo con tus datos, cuesta mucho y deja el conocimiento congelado en el momento del entrenamiento. RAG deja el modelo intacto y le pasa los documentos relevantes en cada pregunta. Por eso, con RAG, corregir un artículo hoy cambia la respuesta hoy.
Por qué importa
Qué cambia en un SaaS
Es lo que hace que un sistema de IA pueda hablar de tu producto sin inventárselo. También es lo que hace que la calidad de tu documentación ponga el techo: el modelo no puede responder mejor de lo que está escrito, y si el fragmento recuperado es el equivocado, la respuesta será impecable y estará mal.

Generación aumentada por recuperación en detalle
Cómo funciona, en cuatro pasos
Se parte la documentación en fragmentos; cada fragmento se convierte en un vector que representa su significado; cuando llega una pregunta se buscan los vectores más cercanos a ella; y esos fragmentos se le pasan al modelo junto con la pregunta para que redacte.
Por qué busca por significado y no por palabras
Porque el cliente no usa tus palabras. Si tu artículo dice «política de retención» y el cliente escribe «cuánto tiempo guardáis mis datos», una búsqueda por coincidencia exacta no encuentra nada. La búsqueda por vectores sí, porque compara significados.
Dónde falla
En la recuperación, casi siempre, no en la redacción. Si se recupera el fragmento equivocado, el modelo redactará una respuesta convincente basada en él. Por eso la mayor parte del trabajo de mejorar un sistema de este tipo consiste en mejorar qué se recupera, no en cambiar de modelo.
Lo que RAG no resuelve
Los datos que no están en ningún documento: el plan que tiene este cliente, cuánto le queda de cupo, si su último pago entró. Eso no se recupera de la documentación, se consulta en el sistema. Es la diferencia entre un chatbot documental y un agente.
Cómo lo resuelve Intake
Preguntas sobre generación aumentada por recuperación
¿Qué significa RAG?
Retrieval-Augmented Generation, generación aumentada por recuperación: buscar información relevante en una fuente propia y pasársela al modelo para que redacte con ella.
¿RAG es lo mismo que entrenar un modelo con mis datos?
No. Entrenar modifica el modelo y deja el conocimiento fijado; RAG deja el modelo intacto y consulta los documentos en cada pregunta. Con RAG, actualizar un artículo cambia la respuesta al instante.
¿Por qué mi sistema con RAG responde cosas incorrectas?
Casi siempre porque recupera el fragmento equivocado, no porque el modelo redacte mal. Revisar qué fragmentos se están recuperando para las preguntas fallidas suele explicar el problema entero.
Términos relacionados
Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.
Embedding
Un embedding es la representación de un texto como una lista de números que codifica su significado. Dos textos que quieren decir lo mismo con palabras distintas producen listas parecidas, y esa cercanía numérica es lo que permite buscar por significado en vez de por coincidencia exacta.
LLM — Modelo de lenguaje
Un modelo de lenguaje es un sistema entrenado con enormes cantidades de texto que, dado un fragmento, predice cómo continúa. De esa capacidad tan simple salen la redacción, el resumen, la traducción y la conversación: todas son formas de continuar un texto de manera plausible.
Alucinación
Una alucinación es una respuesta de un modelo de lenguaje que suena correcta y no lo es: un dato inventado, una función que no existe, una cifra plausible que nadie ha comprobado. No es un fallo del sistema, es consecuencia directa de cómo funciona un modelo, que produce la continuación más probable y no la verificada.
Agente de IA
Un agente de IA es un sistema que, además de generar texto, consulta datos y ejecuta acciones para completar una tarea. En soporte significa que antes de responder mira cómo está la cuenta de verdad del cliente, y que cuando la respuesta implica hacer algo, lo hace en vez de explicar cómo se hace.
Base de conocimiento
Una base de conocimiento es el conjunto organizado de artículos que documentan cómo funciona un producto y cómo resolver lo que se pregunta con frecuencia. Sirve a dos públicos a la vez: a los clientes, que buscan la respuesta ellos mismos, y al equipo, que la usa como fuente para responder.
Chatbot
Un chatbot es un programa que mantiene una conversación por escrito con un usuario. En soporte, los actuales indexan la documentación de la empresa y responden con lo que encuentran en ella; los anteriores seguían árboles de decisión escritos a mano.
