Evals — Evaluación
Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.
¿Qué es evaluación?
Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.
También: evals · evaluaciones
Probar a mano no es evaluar
Escribir cuatro preguntas en el chat después de un cambio y ver si contesta bien es una comprobación, no una evaluación. Lo que la convierte en evaluación es que sea el mismo conjunto siempre, para poder comparar: sin eso no se sabe si el cambio mejoró algo o solo movió el problema.
Por qué importa
Qué cambia en un SaaS
Porque en un sistema de IA cualquier cambio puede empeorar cosas que ya funcionaban, y eso no se ve mirando. Ajustar el prompt para arreglar una respuesta y romper otras diez es lo normal sin evaluaciones, y lo peor es que nadie se entera hasta que lo dice un cliente.

Evaluación en detalle
De dónde salen los casos
De tus propias conversaciones. Las cincuenta preguntas más frecuentes, más los casos que salieron mal, más los límites que quieres proteger —lo que no debe responder—. Inventarse casos genéricos da una evaluación que pasa siempre y no protege de nada.
Qué se comprueba
Que la respuesta contenga el dato correcto, que no contenga lo que no debe, y que escale cuando toca. Lo tercero es lo que más se olvida y lo que más cuesta cuando falla.
Cuándo se pasan
Antes de cada cambio que llegue a clientes. Es la misma disciplina que las pruebas de un despliegue, aplicada a algo que no es determinista y que por eso la necesita más.
Preguntas sobre evaluación
¿Cuántos casos necesita una evaluación?
Empieza con treinta o cuarenta sacados de tus conversaciones reales. Es suficiente para detectar una regresión y lo bastante poco como para que alguien los mantenga.
¿Se pueden evaluar automáticamente las respuestas?
En parte. Comprobar que aparece un dato concreto o que no aparece algo prohibido se automatiza bien. Juzgar si una respuesta está bien redactada sigue necesitando criterio, aunque se use otro modelo para puntuar.
Términos relacionados
Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.
Guardarraíles
Los guardarraíles son las restricciones que impiden a un sistema de IA hacer o decir determinadas cosas: de qué fuentes puede sacar los datos, qué acciones puede ejecutar, qué temas no toca y qué requiere confirmación de una persona. Se aplican fuera del modelo, no confiando en que obedezca.
Prompt de sistema
El prompt de sistema son las instrucciones fijas que recibe un modelo antes de cada conversación: quién es, qué puede y qué no puede hacer, con qué tono responde y qué hacer cuando no sabe algo. No lo ve el usuario y se manda en todas las peticiones.
Alucinación
Una alucinación es una respuesta de un modelo de lenguaje que suena correcta y no lo es: un dato inventado, una función que no existe, una cifra plausible que nadie ha comprobado. No es un fallo del sistema, es consecuencia directa de cómo funciona un modelo, que produce la continuación más probable y no la verificada.
Agente de IA
Un agente de IA es un sistema que, además de generar texto, consulta datos y ejecuta acciones para completar una tarea. En soporte significa que antes de responder mira cómo está la cuenta de verdad del cliente, y que cuando la respuesta implica hacer algo, lo hace en vez de explicar cómo se hace.
RAG — Generación aumentada por recuperación
La generación aumentada por recuperación, o RAG, es la técnica de buscar información relevante en una fuente propia y pasársela al modelo de lenguaje para que redacte la respuesta con ella. El modelo no memoriza el contenido: lo consulta en el momento de responder.
Latencia
La latencia es lo que tarda un sistema de IA en devolver una respuesta desde que recibe la pregunta. Incluye la búsqueda de información, las consultas a otros sistemas y la generación del texto, y se percibe entera aunque el modelo solo sea una parte.
