Las evaluaciones de agentes son las nuevas pruebas unitarias
Cada equipo que ejecuta un agente en producción eventualmente construye lo mismo: una suite de escenarios que no deben retroceder. La única pregunta es si lo construyes antes o después del primer incidente que afecta a los clientes.
Qué sucedió
El comportamiento del agente es no determinista, por lo que una pequeña modificación en la solicitud que mejora un caso rompe silenciosamente tres otros. Los equipos sin una suite de evaluación descubren esto a través de un ticket de soporte, semanas después.
Por qué es importante para los equipos de despliegue
Una suite de evaluación convierte la ingeniería de solicitudes de opinión en ingeniería. Con 30 a 50 escenarios representativos puntuados en cada cambio, realmente puedes decir si una modificación fue una mejora.
Qué hacer al respecto
Comienza con los fallos que ya has visto. Escribe cada uno como un escenario con una condición de aprobación explícita, conéctalo a la integración continua y rechaza fusionar cambios de agente que disminuyen la puntuación sin una razón escrita.
Qué hacer con esto
- Recopila 30-50 escenarios reales, no ideales sintéticos
- Evalúa cada cambio de prompt en la integración continua
- Trata una caída en la puntuación como una construcción fallida