vLLM
Hochleistungs-LLM-Schlußfolgerungsmotor mit PagedAttention – die Standardwahl, wenn Sie eine GPU optimal auslasten müssen.
vLLM serviert offene Modelle mit kontinuierlicher Batch-Verarbeitung und PagedAttention und liefert damit mehrere Male die Durchsatzleistung von einfachen HuggingFace-Pipelines auf der gleichen Karte. Es bietet eine OpenAI-kompatible API, sodass das Einsetzen vor einer bestehenden App normalerweise nur eine Änderung der Basis-URL erfordert.
Am besten für: Selbstgehostete Produktionsinferenz auf NVIDIA-/AMD-GPUs
Deployment: Selbst hostbar