Agent-Bewertungen sind die neuen Unit-Tests
Jedes Team, das einen Agenten in der Produktion ausführt, baut letztendlich das Gleiche: eine Sammlung von Szenarien, die nicht regressiv sein dürfen. Die einzige Frage ist, ob Sie dies vor oder nach dem ersten kundenorientierten Vorfall tun.
Was passiert ist
Das Verhalten des Agents ist nicht deterministisch, sodass eine kleine Änderung an einem Prompt, die einen Fall verbessert, drei andere stillschweigend kaputt macht. Teams ohne ein Eval-Suite entdecken dies erst Wochen später durch ein Support-Ticket.
Warum es für Deployment-Teams wichtig ist
Ein Eval-Suite wandelt die Prompt-Engineering von einer Meinung in echte Ingenieurskunst um. Mit 30 bis 50 repräsentativen Szenarien, die bei jedem Change bewertet werden, können Sie tatsächlich sagen, ob eine Änderung eine Verbesserung war.
Was dagegen unternommen werden kann
Beginnen Sie mit den Fehlern, die Sie bereits gesehen haben. Schreiben Sie jeden als Szenario mit einer expliziten Bestehensbedingung, integrieren Sie es in die CI und verweigern Sie das Mergen von Agent-Änderungen, die den Score ohne einen schriftlichen Grund senken.
Was daraus folgt
- Sammeln Sie 30-50 reale Szenarien, keine synthetischen Ideale
- Bewerten Sie jeden Prompt-Wechsel im CI
- Behandeln Sie einen Punkte-Rückgang wie einen fehlgeschlagenen Build