部署与推理 ★ 12.0k Text Generation Inference HuggingFace 用 Rust 写的推理服务栈,内置张量并行与流式输出。 访问官网 → Homepage TGI 是成熟的推理服务器,支持多卡张量并行、连续批处理与逐 token 流式返回。它和 HuggingFace 生态结合紧密——当你选中的模型只有一个 HF checkpoint 时,这点很关键。 适合场景:HuggingFace 生态内的多卡推理服务 部署方式:可自托管 #推理服务 #服务化 #GPU #开源