Eval & LLMOps

Evaluasi agent adalah unit test yang baru

Anda tidak akan merge kode tanpa test. Berhenti mengirim perubahan agent tanpa eval.

Apa yang terjadi

Perilaku agent tidak deterministik, sehingga satu ubahan prompt yang memperbaiki satu kasus bisa diam-diam merusak tiga kasus lain. Tim tanpa eval suite mengetahuinya dari tiket support, berminggu-minggu kemudian.

Mengapa penting bagi tim deployment

Eval suite mengubah prompt engineering dari opini menjadi rekayasa. Dengan 30 sampai 50 skenario representatif yang diskor di setiap perubahan, Anda benar-benar bisa menyatakan apakah sebuah modifikasi merupakan peningkatan.

Yang bisa dilakukan sekarang

Mulailah dari kegagalan yang sudah Anda lihat. Tulis masing-masing sebagai skenario dengan kondisi lulus yang eksplisit, pasang ke CI, dan tolak merge perubahan agent yang menurunkan skor tanpa alasan tertulis.

Yang bisa Anda lakukan sekarang

  • Kumpulkan 30-50 skenario nyata, bukan ideal sintetis
  • Skor setiap perubahan prompt di CI
  • Anggaplah penurunan skor sebagai build yang gagal