Deployment & Inferenz ★ 62.0k

vLLM

Hochleistungs-LLM-Schlußfolgerungsmotor mit PagedAttention – die Standardwahl, wenn Sie eine GPU optimal auslasten müssen.

vLLM serviert offene Modelle mit kontinuierlicher Batch-Verarbeitung und PagedAttention und liefert damit mehrere Male die Durchsatzleistung von einfachen HuggingFace-Pipelines auf der gleichen Karte. Es bietet eine OpenAI-kompatible API, sodass das Einsetzen vor einer bestehenden App normalerweise nur eine Änderung der Basis-URL erfordert.

Am besten für: Selbstgehostete Produktionsinferenz auf NVIDIA-/AMD-GPUs

Deployment: Selbst hostbar