Cómo crear un conjunto de evaluación a partir del tráfico real
La mayoría de los conjuntos de evaluación se escriben a partir de la documentación y miden la documentación. Crear uno a partir de registros, tickets y abandonos lleva una semana y es la tarea de mayor impacto disponible.
Por qué no escribir preguntas a partir de la documentación
La documentación describe el sistema de la manera en que sus autores lo entienden. Las preguntas derivadas de ella comparten los supuestos de los autores, aparecen en el corpus de recuperación como parafrases y se agrupan en torno a las partes del producto que están bien documentadas en lugar de las partes que se utilizan. La suite resultante es fácil de aprobar y lenta de cambiar.
El tráfico real tiene una distribución opuesta, por lo que vale la pena el esfuerzo de recopilarlo.
Cuatro fuentes, en orden de utilidad
Registros de búsqueda. Las consultas que los usuarios escribieron realmente, incluidas las que no devolvieron nada. Las consultas con cero resultados son la fuente más barata de elementos de evaluación de alto valor que existen, porque están pre-filtradas para temas que el sistema aún no maneja.
Tickets de soporte y preguntas internas. Cada vez que un ser humano fue preguntado y respondió una pregunta que el sistema debería haber manejado, esa es una pregunta con una respuesta correcta conocida y un costo identificado. Estos también son los elementos más propensos a estar formulados de la manera en que un usuario real formula las cosas.
Sesiones abandonadas. Usuarios que iniciaron, escribieron algo y se fueron sin completar. Más difíciles de interpretar, pero marcan el límite de dónde el sistema actualmente falla de una manera que los datos de satisfacción no pueden.
Recuerdo de expertos, deliberadamente limitado. Siéntese con dos o tres personas que realizan el trabajo y pregúntele qué se les pregunta con más frecuencia y en qué depende la respuesta. Utilice esto para llenar los vacíos que los registros no pueden mostrar, como las preguntas formuladas en reuniones y nunca escritas. Limite el tiempo dedicado a esto; su propósito es la cobertura, no el volumen.
Escribir elementos que sobreviven a la reevaluación
- Almacene la pregunta exactamente como la formuló el usuario, incluidos los errores de escritura y las abreviaturas. Reescribirla en un lenguaje limpio elimina la parte difícil.
- Establezca la respuesta esperada y la razón por la que es correcta. La razón es lo que hace que el elemento sea reevaluable por alguien más y mantiene los criterios para que no se desvíen silenciosamente.
- Registre qué es el comportamiento correcto cuando la respuesta no está en el corpus. Aproximadamente una quinta parte de los elementos deberían ser inrespondibles, y negarse limpiamente debería puntuar como un aprobado.
- Etiquete cada elemento con la capacidad que ejercita —recuperación, aritmética sobre valores recuperados, síntesis de múltiples documentos, negación— para que los fallos apunten a un componente en lugar de al sistema.
- Nota la fuente y la fecha. Los elementos extraídos de un incidente transitorio dejan de ser válidos cuando los datos del incidente salen del corpus.
Ejecutarlo como un hábito
Muestre mensualmente, no una sola vez. Revise la suite trimestralmente y retire lo que ya no refleja el producto. Mantenga una rebanada con calificación humana permanentemente, porque es la única parte que nota cuando la definición de una buena respuesta cambia.
La primera ejecución será incómoda. Una suite construida a partir del tráfico suele informar una calidad sustancialmente menor que la suite derivada de la documentación que reemplaza, y esa brecha es la cantidad de calidad que la antigua suite estaba ocultando. Informe ambos números uno al lado del otro, atribuya la diferencia al cambio en los criterios y luego trabaje a partir de la línea de base honesta.
Qué hacer con esto
- Extraer información de cuatro fuentes: registros de búsqueda, tickets de soporte, sesiones abandonadas y recuerdo de expertos
- Cada elemento necesita una razón explícita, no solo una respuesta esperada
- Incluir preguntas sin respuesta y puntuar la negativa como condición de aprobación