Text Generation Inference
Pila de servicio basada en Rust de HuggingFace con paralelismo de tensores y transmisión en streaming integrados.
TGI es un servidor de inferencia maduro que maneja la división en fragmentos a través de múltiples GPUs, batcheo continuo y transmisión de tokens. Se integra estrechamente con el ecosistema de HuggingFace, lo que importa cuando tu modelo elegido solo existe como un punto de control de HF.
Ideal para: Servicio multi-GPU dentro del ecosistema de HuggingFace
Despliegue: Autoalojable