Despliegue e inferencia

Dónde se van los milisegundos: un presupuesto de latencia para RAG

Una solicitud de RAG se siente lenta mucho antes de que realmente lo sea. Saber cuál de los cinco estados es el responsable marca la diferencia entre una solución dirigida y tres semanas de reemplazar el componente incorrecto.

Qué sucedió

Los usuarios informan que el asistente es lento. El equipo perfila el modelo, encuentra que la generación es el cuello de botella y dedica un sprint a optimizarlo. La latencia percibida apenas se mueve, porque el problema real era una cadena secuencial: la recuperación esperaba a la reescritura de la consulta, la reordenación esperaba a la recuperación y nada se superponía.

Por qué es importante para los equipos de despliegue

La latencia es un presupuesto y, como cualquier presupuesto, el primer requisito es saber dónde se gasta. Una solicitud RAG típica tiene cinco etapas — comprensión de la consulta, recuperación, reordenación, empaquetado, generación — y en un sistema saludable estas etapas tienen un tiempo de aproximadamente 20 a 60 milisegundos, 20 a 60, 40 a 150, despreciable y 300 a 900 respectivamente. Dos números son más importantes que el total: el tiempo hasta el primer token, que es lo que los usuarios realmente sienten, y el p99, que es lo que recuerdan.

Qué hacer al respecto

Instrumente cada etapa por separado antes de optimizar cualquier cosa; la mayoría de los equipos se equivocan sobre qué etapa domina. Luego busque trabajo que se realice secuencialmente que pueda superponerse — la reescritura de la consulta y la incrustación pueden ejecutarse en paralelo con las búsquedas de metadatos. Reduzca el conjunto de candidatos enviado al reordenador antes de optimizar el reordenador en sí. Almacene en caché de forma agresiva: la recuperación y la reordenación son deterministas para una versión determinada del corpus y las preguntas de soporte se repiten mucho más de lo que los equipos esperan.

La victoria barata

Transmita en flujo. El tiempo hasta el primer token es una decisión de producto tanto como técnica, y transmitir una respuesta parcial a los 400 milisegundos se siente materialmente más rápido que una respuesta completa a los 1.400 milisegundos. Esto suele ser el cambio de rendimiento percibido más alto disponible y cuesta una tarde.