vLLM
Motor de inferencia LLM de alto rendimiento con PagedAttention — la opción predeterminada cuando necesitas aprovechar al máximo una GPU.
vLLM sirve modelos abiertos con procesamiento por lotes continuo y PagedAttention, lo que ofrece varias veces el rendimiento de las tuberías de HuggingFace ingenuas en la misma tarjeta. Expone una API compatible con OpenAI, por lo que reemplazarla frente a una aplicación existente suele ser un cambio de una sola línea en la URL base.
Ideal para: Inferencia de producción autoalojada en GPUs de NVIDIA/AMD
Despliegue: Autoalojable