Despliegue e inferencia

TensorRT-LLM

El último porcentaje de rendimiento de GPU, a costa de una complejidad de compilación y bloqueo de hardware.

Mientras que vLLM y SGLang ofrecen una configuración predeterminada sólida de manera rápida, TensorRT-LLM requiere que compile un motor por modelo, por configuración de GPU y por precisión, y ofrece un rendimiento en la parte superior de lo que el hardware puede hacer. Ese intercambio tiene sentido cuando se sirven uno o dos modelos a muy alto volumen en hardware conocido. Tiene mucho menos sentido durante la evaluación, cuando el modelo y el hardware aún están cambiando semanalmente. Espere que el paso de compilación sea parte de su pipeline de implementación, no una tarea única.

Ideal para: Servicio de alta volumen de un conjunto de modelos estables en hardware NVIDIA fijo