Deployment & Inferenz

Serving-Stacks, Inferenz-Engines, GPU-Orchestrierung und Werkzeuge zur Kostenkontrolle.

Werkzeuge in dieser Kategorie

9router

Eine Routing-Schicht, die Ihren Coding-Agenten am Laufen hält, wenn ein Anbieter eine Rate-Limit erreicht – allein der Fallback lohnt sich.

Einzelne und kleine Teams, die bei intensiven Agentensitzungen auf Anbieter-Rate-Limits stoßen Weiterlesen →

TensorRT-LLM

Die letzten paar Prozent der GPU-Durchsatzrate, erkauft mit erhöhter Build-Komplexität und Hardware-Abhängigkeit.

Hochvolumige Bereitstellung eines stabilen Modell-Satzes auf festgelegter NVIDIA-Hardware Weiterlesen →

Open WebUI

Die Benutzeroberfläche, die Sie den Anwendern zur Verfügung stellen, wenn die Modellschicht bereits fertiggestellt ist.

Interne Chat-Deployments auf Basis selbst gehosteter Modelle mit echten Benutzerkonten Weiterlesen →

LibreChat

Multi-Benutzer-, Multi-Anbieter-Chat-Plattform mit bereits integrierten Agenten und MCP.

Teams und Abteilungen, die eine gemeinsame Bereitstellung über mehrere Modelanbieter hinweg teilen Weiterlesen →

vLLM

Hochleistungs-LLM-Schlußfolgerungsmotor mit PagedAttention – die Standardwahl, wenn Sie eine GPU optimal auslasten müssen.

Selbstgehostete Produktionsinferenz auf NVIDIA-/AMD-GPUs Weiterlesen →

Ollama

Ein Befehl, um ein LLM auf einem Laptop auszuführen – der schnellste Weg, um ein Modell vor einem Kunden zu präsentieren.

Lokale Demos, air-gapped-Piloten, Entwicklermaschinen Weiterlesen →

SGLang

Servicing-Engine, entwickelt für strukturierte Ausgaben und intensive Präfix-Wiederverwendung.

Strukturierte Ausgaben, Workloads mit gemeinsamen Präfixen, Agents Weiterlesen →

LiteLLM

Eine OpenAI-ähnliche Schnittstelle für über 100 Modelanbieter, plus ein Proxy, der den Ausgaben pro Schlüssel nachverfolgt.

Routing mit mehreren Anbietern, Ausgabenkontrolle, Fallbacks Weiterlesen →

Beiträge in dieser Kategorie