Latencia
La latencia es lo que tarda un sistema de IA en devolver una respuesta desde que recibe la pregunta. Incluye la búsqueda de información, las consultas a otros sistemas y la generación del texto, y se percibe entera aunque el modelo solo sea una parte.
¿Qué es latencia?
La latencia es lo que tarda un sistema de IA en devolver una respuesta desde que recibe la pregunta. Incluye la búsqueda de información, las consultas a otros sistemas y la generación del texto, y se percibe entera aunque el modelo solo sea una parte.
También: tiempo de respuesta del modelo
Por qué importa
Qué cambia en un SaaS
Porque en soporte compite con la expectativa de un chat, que se mide en segundos. Un agente que tarda quince segundos en responder pierde a quien pregunta aunque acierte, y en la práctica se percibe peor que una persona que tarda dos minutos pero avisa de que está mirándolo.

Latencia en detalle
Dónde se va el tiempo
Rara vez en un solo sitio: recuperar fragmentos, consultar la cuenta, generar la respuesta y, si el modelo llama a una herramienta, otra vuelta entera. Medir los tramos por separado es lo primero, porque optimizar el equivocado no cambia nada.
Enseñar el texto según se genera
Escribir la respuesta a medida que sale reduce mucho la espera percibida sin tocar la real. Es de los cambios con mejor relación entre esfuerzo y efecto.
La compensación con la calidad
Más contexto y más pasos suelen dar mejores respuestas y siempre dan más latencia. Dónde está el punto medio depende del canal: en un chat pesa la rapidez, en un correo no.
Preguntas sobre latencia
¿Cuánta latencia es aceptable en un chat de soporte?
Por debajo de tres o cuatro segundos hasta las primeras palabras la conversación se siente fluida. Por encima de diez, la gente se va o escribe otra vez, y las dos cosas empeoran el resultado.
¿Un modelo más pequeño responde antes?
Suele hacerlo, y para clasificar o enrutar es una buena opción. Para redactar la respuesta al cliente, la diferencia de calidad casi siempre compensa el segundo de más.
Términos relacionados
Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.
Ventana de contexto
La ventana de contexto es todo lo que un modelo de lenguaje puede tener delante a la vez para producir una respuesta: la instrucción del sistema, el histórico de la conversación, los fragmentos recuperados de la documentación y los datos consultados. Se mide en tokens y tiene un tope.
LLM — Modelo de lenguaje
Un modelo de lenguaje es un sistema entrenado con enormes cantidades de texto que, dado un fragmento, predice cómo continúa. De esa capacidad tan simple salen la redacción, el resumen, la traducción y la conversación: todas son formas de continuar un texto de manera plausible.
Agente de IA
Un agente de IA es un sistema que, además de generar texto, consulta datos y ejecuta acciones para completar una tarea. En soporte significa que antes de responder mira cómo está la cuenta de verdad del cliente, y que cuando la respuesta implica hacer algo, lo hace en vez de explicar cómo se hace.
FRT — Tiempo de primera respuesta
El tiempo de primera respuesta es lo que transcurre desde que un cliente envía su consulta hasta que recibe la primera contestación de una persona. Mide la espera inicial, no la resolución, y es la métrica que más pesa en la percepción de si un soporte es bueno o no.
Guardarraíles
Los guardarraíles son las restricciones que impiden a un sistema de IA hacer o decir determinadas cosas: de qué fuentes puede sacar los datos, qué acciones puede ejecutar, qué temas no toca y qué requiere confirmación de una persona. Se aplican fuera del modelo, no confiando en que obedezca.
Evals — Evaluación
Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.
