Ventana de contexto
La ventana de contexto es todo lo que un modelo de lenguaje puede tener delante a la vez para producir una respuesta: la instrucción del sistema, el histórico de la conversación, los fragmentos recuperados de la documentación y los datos consultados. Se mide en tokens y tiene un tope.
¿Qué es ventana de contexto?
La ventana de contexto es todo lo que un modelo de lenguaje puede tener delante a la vez para producir una respuesta: la instrucción del sistema, el histórico de la conversación, los fragmentos recuperados de la documentación y los datos consultados. Se mide en tokens y tiene un tope.
También: context window · contexto
Más ventana no es más memoria
Un modelo con una ventana enorme no recuerda conversaciones anteriores: cada petición se le manda entera otra vez. La ventana es cuánto cabe en esa petición, no lo que el modelo sabe de ti. La memoria entre conversaciones hay que construirla aparte, guardando y volviendo a enviar lo que importe.
Por qué importa
Qué cambia en un SaaS
Porque es donde se decide qué información llega al modelo y cuál se queda fuera, y eso pesa más en la calidad de la respuesta que qué modelo se use. Cuando la ventana se llena hay que elegir, y esa elección —qué fragmentos, cuánto histórico, qué datos de la cuenta— es el trabajo de verdad de montar un agente.

Ventana de contexto en detalle
Lo que compite por el sitio
Cuatro cosas: las instrucciones, el histórico de la conversación, los fragmentos de documentación y el estado de la cuenta. En una conversación larga, el histórico se come el hueco de los fragmentos, y el agente empieza a responder peor sin que nadie haya tocado nada.
Lo del medio se pierde
Los modelos atienden mejor al principio y al final de lo que se les manda que a lo que queda en medio. Poner lo importante al final del contexto es una de las mejoras más baratas que existen.
Cuesta dinero y tiempo
Se factura por token, así que llenar la ventana con todo lo que se pueda encarece cada respuesta y la hace más lenta. Recuperar cinco fragmentos buenos es mejor que veinte mediocres, también en la factura.
Preguntas sobre ventana de contexto
¿Una ventana de contexto más grande da mejores respuestas?
No por sí sola. Da sitio para más información, pero si lo que se mete es ruido, la respuesta empeora y además cuesta más. Lo que mejora las respuestas es elegir bien qué entra.
¿El modelo recuerda lo que hablamos ayer?
No, salvo que el sistema se lo vuelva a mandar. Cada petición es independiente; la sensación de memoria la construye la aplicación guardando el histórico y reenviándolo.
Términos relacionados
Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.
LLM — Modelo de lenguaje
Un modelo de lenguaje es un sistema entrenado con enormes cantidades de texto que, dado un fragmento, predice cómo continúa. De esa capacidad tan simple salen la redacción, el resumen, la traducción y la conversación: todas son formas de continuar un texto de manera plausible.
RAG — Generación aumentada por recuperación
La generación aumentada por recuperación, o RAG, es la técnica de buscar información relevante en una fuente propia y pasársela al modelo de lenguaje para que redacte la respuesta con ella. El modelo no memoriza el contenido: lo consulta en el momento de responder.
Prompt de sistema
El prompt de sistema son las instrucciones fijas que recibe un modelo antes de cada conversación: quién es, qué puede y qué no puede hacer, con qué tono responde y qué hacer cuando no sabe algo. No lo ve el usuario y se manda en todas las peticiones.
Latencia
La latencia es lo que tarda un sistema de IA en devolver una respuesta desde que recibe la pregunta. Incluye la búsqueda de información, las consultas a otros sistemas y la generación del texto, y se percibe entera aunque el modelo solo sea una parte.
Alucinación
Una alucinación es una respuesta de un modelo de lenguaje que suena correcta y no lo es: un dato inventado, una función que no existe, una cifra plausible que nadie ha comprobado. No es un fallo del sistema, es consecuencia directa de cómo funciona un modelo, que produce la continuación más probable y no la verificada.
Llamada a herramientas
La llamada a herramientas es el mecanismo por el que un modelo de lenguaje puede ejecutar funciones definidas por ti en vez de limitarse a escribir. Se le describen las herramientas disponibles, el modelo decide cuál usar y con qué parámetros, y recibe el resultado para incorporarlo a su respuesta.
