Guardarraíles
Los guardarraíles son las restricciones que impiden a un sistema de IA hacer o decir determinadas cosas: de qué fuentes puede sacar los datos, qué acciones puede ejecutar, qué temas no toca y qué requiere confirmación de una persona. Se aplican fuera del modelo, no confiando en que obedezca.
¿Qué es guardarraíles?
Los guardarraíles son las restricciones que impiden a un sistema de IA hacer o decir determinadas cosas: de qué fuentes puede sacar los datos, qué acciones puede ejecutar, qué temas no toca y qué requiere confirmación de una persona. Se aplican fuera del modelo, no confiando en que obedezca.
También: guardrails · límites de seguridad
Pedirlo en el prompt no es un guardarraíl
Escribir «no canceles suscripciones» en las instrucciones es una petición, y un modelo puede ignorarla ante una conversación lo bastante rara. El guardarraíl de verdad es que la herramienta de cancelar no esté disponible, o que exija una confirmación humana. Lo primero es una intención; lo segundo, un límite.
Por qué importa
Qué cambia en un SaaS
Porque un agente conectado a tu API puede hacer cosas con consecuencias, y la diferencia entre un incidente y un susto está en si el límite estaba en el código o en una frase. Es también lo primero que pregunta el equipo de seguridad de cualquier cliente mediano.

Guardarraíles en detalle
Los tres niveles
Qué puede leer, qué puede escribir y qué puede decir. El primero se controla con permisos, el segundo con qué herramientas se exponen y una confirmación en lo irreversible, y el tercero revisando salidas.
Separar leer de escribir
Es la línea que más rinde. Consultar un plan no rompe nada; cambiarlo sí. Empezar exponiendo solo lecturas resuelve buena parte de las conversaciones sin ningún riesgo, y deja las escrituras para cuando haya confianza.
Lo irreversible, con persona
Cancelar, borrar, reembolsar. No porque el agente vaya a equivocarse más que una persona, sino porque cuando se equivoque no habrá nadie que se dé cuenta a tiempo.
Cómo lo resuelve Intake
Preguntas sobre guardarraíles
¿Los guardarraíles se ponen en el prompt?
Ahí van las instrucciones, que ayudan. El guardarraíl de verdad se pone en el sistema: si una acción no debe ocurrir, la herramienta no se expone o exige confirmación. Confiar en que el modelo obedezca no es un límite.
¿Qué acciones conviene dejar siempre con confirmación?
Las irreversibles y las que tocan dinero: cancelaciones, borrados, reembolsos y cambios de plan a la baja.
Términos relacionados
Un término suelto se entiende a medias. Estos son los que aparecen en la misma conversación.
Llamada a herramientas
La llamada a herramientas es el mecanismo por el que un modelo de lenguaje puede ejecutar funciones definidas por ti en vez de limitarse a escribir. Se le describen las herramientas disponibles, el modelo decide cuál usar y con qué parámetros, y recibe el resultado para incorporarlo a su respuesta.
Prompt de sistema
El prompt de sistema son las instrucciones fijas que recibe un modelo antes de cada conversación: quién es, qué puede y qué no puede hacer, con qué tono responde y qué hacer cuando no sabe algo. No lo ve el usuario y se manda en todas las peticiones.
Agente de IA
Un agente de IA es un sistema que, además de generar texto, consulta datos y ejecuta acciones para completar una tarea. En soporte significa que antes de responder mira cómo está la cuenta de verdad del cliente, y que cuando la respuesta implica hacer algo, lo hace en vez de explicar cómo se hace.
Evals — Evaluación
Una evaluación es un conjunto de casos de prueba con los que se comprueba, de forma repetible, si un sistema de IA responde como debe. Cada caso lleva una entrada y un criterio de acierto, y se vuelven a pasar todos cada vez que cambia algo: el prompt, el modelo o la documentación.
Alucinación
Una alucinación es una respuesta de un modelo de lenguaje que suena correcta y no lo es: un dato inventado, una función que no existe, una cifra plausible que nadie ha comprobado. No es un fallo del sistema, es consecuencia directa de cómo funciona un modelo, que produce la continuación más probable y no la verificada.
Ventana de contexto
La ventana de contexto es todo lo que un modelo de lenguaje puede tener delante a la vez para producir una respuesta: la instrucción del sistema, el histórico de la conversación, los fragmentos recuperados de la documentación y los datos consultados. Se mide en tokens y tiene un tope.
