SGLang
Motor de servidor diseñado para salidas estructuradas y reutilización intensiva de prefijos.
SGLang combina un tiempo de ejecución rápido con RadixAttention para la caché de prefijos, lo que se traduce en beneficios cuando muchas solicitudes comparten un prompt de sistema largo. También cuenta con soporte de primera clase para decodificación restringida, por lo que los agentes en modo JSON siguen siendo fiables bajo carga.
Ideal para: Salida estructurada, cargas de trabajo con prefijos compartidos, agentes
Despliegue: Autoalojable