Evals — Evaluación

Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.

¿Qué es evaluación?

Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.

También: evals · evaluaciones

Probar a mano no es evaluar

Escribir cuatro preguntas en el chat después de un cambio y ver si contesta bien es una comprobación, no una evaluación. Lo que la convierte en evaluación es que sea el mismo conjunto siempre, para poder comparar: sin eso no se sabe si el cambio mejoró algo o solo movió el problema.

Por qué importa

Qué cambia en un SaaS

Porque en un sistema de IA cualquier cambio puede empeorar cosas que ya funcionaban, y eso no se ve mirando. Ajustar el prompt para arreglar una respuesta y romper otras diez es lo normal sin evaluaciones, y lo peor es que nadie se entera hasta que lo dice un cliente.

Primer plano de una placa de circuito

Evaluación en detalle

  • De dónde salen los casos

    De tus propias conversaciones. Las cincuenta preguntas más frecuentes, más los casos que salieron mal, más los límites que quieres proteger —lo que no debe responder—. Inventarse casos genéricos da una evaluación que pasa siempre y no protege de nada.

  • Qué se comprueba

    Que la respuesta contenga el dato correcto, que no contenga lo que no debe, y que escale cuando toca. Lo tercero es lo que más se olvida y lo que más cuesta cuando falla.

  • Cuándo se pasan

    Antes de cada cambio que llegue a clientes. Es la misma disciplina que las pruebas de un despliegue, aplicada a algo que no es determinista y que por eso la necesita más.

Preguntas sobre evaluación

¿Cuántos casos necesita una evaluación?

Empieza con treinta o cuarenta sacados de tus conversaciones reales. Es suficiente para detectar una regresión y lo bastante poco como para que alguien los mantenga.

¿Se pueden evaluar automáticamente las respuestas?

En parte. Comprobar que aparece un dato concreto o que no aparece algo prohibido se automatiza bien. Juzgar si una respuesta está bien redactada sigue necesitando criterio, aunque se use otro modelo para puntuar.

Términos relacionados

Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.

Pruébalo sin dejar lo que ya usas