Evaluación y LLMOps

Construyendo 50 preguntas de evaluación que predicen la calidad de producción

Los equipos que miden tienden a medir los casos fáciles, porque son aquellos donde alguien ya conoce la respuesta. Las preguntas que te costarán dinero son aquellas que nadie se molestó en incluir.

Qué sucedió

Un equipo construye un conjunto de evaluación de cincuenta preguntas, obtiene buenos resultados, lo lanza y luego observa cómo la satisfacción del usuario disminuye durante dos meses sin que se mueva una sola métrica. El conjunto no estaba mal; era poco representativo. Muestreó las preguntas que los constructores ya conocían las respuestas, que son, por construcción, las que el sistema maneja mejor.

Por qué es importante para los equipos de implementación

Un conjunto de evaluación es un instrumento estadístico, y su único trabajo es predecir el comportamiento en el tráfico que no has visto. Un conjunto construido a partir de la imaginación del equipo sobreestimará la calidad en exactamente las dimensiones que el equipo entiende, y permanecerá en silencio sobre las que no entienden: jerga, consultas malformadas, preguntas que abarcan dos documentos, y preguntas que el corpus no puede responder en absoluto.

Cómo construirlo

Obtén fuentes de la realidad siempre que puedas — tickets de soporte, registros de búsqueda, las preguntas que recibe el equipo de ventas. Donde no puedas, haz que alguien que realiza el trabajo diariamente las escriba, no la persona que construyó el sistema. Luego, establece una composición. Aproximadamente cuarenta deberían ser respondibles, distribuidas en diferentes niveles de dificultad. Cinco deben ser irrespondibles desde el corpus, para probar si el sistema se niega en lugar de inventar. Cinco deberían tener un documento distractor convincente que parezca relevante y no lo sea.

Manteniéndolo honesto

Actualiza el conjunto trimestralmente y nunca dejes que el modelo lo vea durante el desarrollo, o te ajustarás a él. Registra una muestra de consultas en vivo cada semana y comprueba si se parecen a tu conjunto; cuando dejen de parecerse, el conjunto ha caducado. Y trata una regresión de más de cinco puntos en la memoria de contexto como un error de compilación, porque una métrica que nadie hace cumplir es una métrica que se ignorará la semana anterior a una fecha límite.