Text Generation Inference
HuggingFaces Rust-basiertes Servingsystem mit Tensor-Parallelismus und Streaming-Funktionen.
TGI ist ein ausgereifter Inferenzserver, der Sharding über mehrere GPUs, kontinuierliches Batchen und Token-Streaming unterstützt. Er integriert sich eng in das HuggingFace-Ökosystem, was wichtig ist, wenn das Modell Ihrer Wahl nur als HuggingFace-Checkpoint existiert.
Am besten für: Multi-GPU-Serving innerhalb des HuggingFace-Ökosystems
Deployment: Selbst hostbar