Cómo elegir un reranker sin un conjunto de pruebas de referencia
No necesitas una clasificación pública para elegir un reranker. Necesitas consultas con pasajes correctos conocidos, una forma de medir la posición y la disciplina para incluir consultas sin respuesta.
Qué cambia un rerankizador
Un recuperador de primera etapa se optimiza para ser rápido sobre un conjunto de candidatos grande, lo que significa que aproxima la relevancia. Un rerankizador lee la consulta y el pasaje juntos y les asigna puntuaciones adecuadas, sobre un conjunto mucho más pequeño. Mejora el orden de lo que ya se encontró. No puede encontrar lo que la primera etapa pasó por alto.
Esa sola propiedad establece la evaluación: un rerankizador solo puede ser juzgado en consultas donde el pasaje correcto ya está en el conjunto de candidatos. Si no es así, ningún rerankizador ayuda y el trabajo pertenece a la etapa anterior.
El arnés mínimo viable
Necesitas un conjunto de consultas, el identificador del pasaje correcto para cada consulta y una forma de registrar el rango en el que aparece ese pasaje con y sin el rerankizador. Para unas pocas centenas de consultas, esto puede ser un script que escribe dos listas ordenadas por consulta e imprime las diferencias. No necesita un framework.
- Registra si el pasaje correcto aparece en los resultados principales, y en qué rango. Rastrea ambos, porque un rerankizador que mejora el rango medio mientras empuja el pasaje fuera de la ventana ha empeorado las cosas.
- Incluye consultas con ningún pasaje correcto. Un rerankizador todavía devolverá su mejor suposición, y la medición útil es si la puntuación más alta de un fallo reordenado permanece visible como baja confianza o sale indistinguible de un acierto.
- Mantén la dificultad de la consulta en el conjunto. Las consultas que funcionan sin reordenar no contribuyen a la comparación más allá de la latencia.
- Almacena los resultados como una línea de base comprometida para que un cambio futuro en el rerankizador o en la primera etapa se mida en comparación con algo.
El intercambio que nadie escribe
Un rerankizador de codificador cruzado agrega latencia proporcional al número de candidatos que puntúa, y ese costo se encuentra en el camino crítico de cada solicitud. Dos preguntas deben ser respondidas antes de la adopción, por escrito: ¿cuántos candidatos se reordenarán, y cuánta latencia media es aceptable? Un rerankizador ajustado solo en calidad tiende a terminar reordenando un conjunto de candidatos lo suficientemente grande como para estallar el presupuesto de latencia, en cuyo punto la ganancia de calidad se gasta en timeouts y reintentos.
Pruebas de referencia públicas y por qué engañan aquí
Las pruebas de referencia de recuperación pública describen un corpus y una distribución de consultas que no tienes. Un modelo que lidera en texto general puede seguir en tus documentos si tu corpus está estructurado — cláusulas, tablas, especificaciones — porque la distribución de entrenamiento rara vez se parece a un documento de política. Trata a una clasificación como una lista corta, luego decide en tu propio corpus con tus propias consultas, incluyendo los casos de rechazo.
Cuándo no agregar uno
Si la primera etapa ya devuelve el pasaje correcto en la parte superior para la mayoría de las consultas, un rerankizador está optimizando un caso resuelto al costo de la latencia para cada solicitud. Si los fallos se concentran en la cola de consultas difíciles, el cambio de mayor influencia suele ser la fragmentación o el análisis. Un rerankizador es la herramienta adecuada cuando la primera etapa encuentra el pasaje pero lo clasifica por debajo de otro texto superficialmente similar — y esa es una condición que puedes medir antes de comprometerte.
Qué hacer con esto
- Mide la recurrencia en el límite y la posición media del pasaje correcto
- Mide siempre la latencia que agrega el reranker, no solo la calidad
- Prueba en el corpus que realmente sirves, no en un conjunto de pruebas de referencia público