Antes de que un agente interactúe con datos de producción: lista de verificación de guardrail
El riesgo no es que el modelo diga algo incorrecto, sino que el agente haga algo incorrecto — con credenciales, en un sistema que no tiene una función de deshacer
Por qué los agentes son una categoría de riesgo diferente
Un chatbot que alucina produce una oración incorrecta. Un agente con acceso a herramientas produce un efecto secundario: un registro actualizado, un correo electrónico enviado, una fila eliminada. La superficie de fallo ya no es la calidad del texto, sino el radio de acción de las acciones. Es por eso que los controles que importan aquí se parecen más a la seguridad de la infraestructura que a la ingeniería de instrucciones.
Verificación uno: qué puede alcanzar realmente
Escribe cada herramienta que el agente puede llamar y qué puede hacer cada una para establecer el estado. La mayoría de los equipos descubren en este paso que un ayudante de solo lectura comparte una credencial con algo que escribe. Limita las credenciales por herramienta, no por agente, y prefiere tokens que caducan.
Verificación dos: ¿hay una puerta para acciones irreversibles
Clasifica cada acción como reversible, reversible con esfuerzo o irreversible. Cualquier cosa en el tercer grupo necesita un paso de confirmación humana que no pueda ser omitido por una instrucción astuta en el contenido que el agente está leyendo. Ten en cuenta que la entrada no confiable no es solo la instrucción del usuario, sino también los documentos, páginas web y resultados de herramientas que el agente consume.
Verificación tres: ¿puedes reproducir lo que sucedió
Necesitas un registro de cada llamada a la herramienta con sus argumentos y resultado, conservado durante suficiente tiempo para reconstruir un incidente. Cuando algo sale mal, la pregunta nunca es qué dijo el modelo, sino qué hizo y en qué orden.
Verificación cuatro: ¿hay un presupuesto
Limita los pasos, tokens, tiempo de reloj y dinero por ejecución. Los bucles descontrolados son el incidente de agente más común y son baratos de prevenir. Muestra el límite en el producto para que el usuario vea el límite en lugar de un bloqueo.
Verificación cinco: ¿qué sucede con la salida malformada
Define la ruta de fallo antes de que la necesites. Si el agente devuelve una llamada a la herramienta que no se puede analizar, ¿vuelve a intentarlo, pregunta al usuario o se detiene? Volver a intentarlo silenciosamente para siempre y rendirse silenciosamente son ambos valores predeterminados malos; elige uno deliberadamente y regístralo.
Verificación seis: ¿puede una persona apagarlo
Debe haber un solo interruptor que detenga toda la actividad del agente sin una implementación. Esto suena obvio y a menudo falta, porque los agentes tienden a implementarse como características dentro de otros sistemas en lugar de como un servicio con su propio interruptor de apagado.
Qué hacer con esto
- El riesgo del agente es el radio de acción, no la corrección del texto
- Limitar las credenciales por herramienta y colocar una puerta de seguridad no eludible en acciones irreversibles
- Conservar trazas de llamadas a herramientas con argumentos y resultados — los incidentes se reconstruyen a partir de acciones, no de salidas
- Limitar los pasos, tokens, tiempo y dinero por ejecución, y crear un solo interruptor que detenga todo