Despliegue e inferencia ★ 12.0k

Text Generation Inference

Pila de servicio basada en Rust de HuggingFace con paralelismo de tensores y transmisión en streaming integrados.

TGI es un servidor de inferencia maduro que maneja la división en fragmentos a través de múltiples GPUs, batcheo continuo y transmisión de tokens. Se integra estrechamente con el ecosistema de HuggingFace, lo que importa cuando tu modelo elegido solo existe como un punto de control de HF.

Ideal para: Servicio multi-GPU dentro del ecosistema de HuggingFace

Despliegue: Autoalojable