Despliegue e inferencia

Stacks de servicio, motores de inferencia, orquestación de GPU y herramientas de control de costes.

Herramientas de esta categoría

9router

Una capa de enrutamiento que mantiene vivo a tu agente de codificación cuando un proveedor te limita la velocidad — vale la pena solo por la función…

Individuos y equipos pequeños que alcanzan los límites de velocidad de los proveedores durante sesiones de agente intensivas Leer más →

TensorRT-LLM

El último porcentaje de rendimiento de GPU, a costa de una complejidad de compilación y bloqueo de hardware.

Servicio de alta volumen de un conjunto de modelos estables en hardware NVIDIA fijo Leer más →

Open WebUI

La interfaz de usuario que entregas a los usuarios cuando la capa de modelo ya está lista.

Despliegues de chat internos sobre modelos autohospedados, con cuentas de usuario reales Leer más →

LibreChat

Plataforma de chat multiusuario y multiproveedor con agentes y MCP ya integrados.

Equipos y departamentos que comparten una implementación en varios proveedores de modelos Leer más →

vLLM

Motor de inferencia LLM de alto rendimiento con PagedAttention — la opción predeterminada cuando necesitas aprovechar al máximo una GPU.

Inferencia de producción autoalojada en GPUs de NVIDIA/AMD Leer más →

Ollama

Un solo comando para ejecutar un LLM en una laptop — la forma más rápida de poner un modelo frente a un cliente.

Demos locales, pilotos aislados, máquinas de desarrollo Leer más →

SGLang

Motor de servidor diseñado para salidas estructuradas y reutilización intensiva de prefijos.

Salida estructurada, cargas de trabajo con prefijos compartidos, agentes Leer más →

LiteLLM

Una interfaz con forma de OpenAI para más de 100 proveedores de modelos, además de un proxy que rastrea el gasto por clave.

Enrutamiento multi-proveedor, control de gastos, reenvíos Leer más →

Notas de esta categoría