SGLang
Servicing-Engine, entwickelt für strukturierte Ausgaben und intensive Präfix-Wiederverwendung.
SGLang kombiniert eine schnelle Laufzeit mit RadixAttention für Präfix-Caching, was sich auszahlt, wenn viele Anfragen einen langen Systemprompt teilen. Es bietet auch erstklassige Unterstützung für eingeschränkte Dekodierung, sodass JSON-Modus-Agents auch unter hoher Last zuverlässig bleiben.
Am besten für: Strukturierte Ausgaben, Workloads mit gemeinsamen Präfixen, Agents
Deployment: Selbst hostbar