Deployment & Inferenz

TensorRT-LLM

Die letzten paar Prozent der GPU-Durchsatzrate, erkauft mit erhöhter Build-Komplexität und Hardware-Abhängigkeit.

Während vLLM und SGLang Ihnen schnell eine starke Standardkonfiguration bieten, verlangt TensorRT-LLM, dass Sie einen Engine pro Modell, pro GPU-Konfiguration und pro Genauigkeit kompilieren – und bietet Ihnen Durchsatzrate auf dem höchsten Niveau, das die Hardware leisten kann. Dieser Kompromiss macht Sinn, wenn Sie ein oder zwei Modelle in sehr hohem Volumen auf bekannter Hardware bereitstellen. Er macht viel weniger Sinn während der Evaluierung, wenn Modell und Hardware sich noch wöchentlich ändern. Erwarten Sie, dass der Build-Schritt Teil Ihrer Deployment-Pipeline ist, nicht ein einmaliger Vorgang.

Am besten für: Hochvolumige Bereitstellung eines stabilen Modell-Satzes auf festgelegter NVIDIA-Hardware