Despliegue e inferencia ★ 118.0k

Ollama

Un solo comando para ejecutar un LLM en una laptop — la forma más rápida de poner un modelo frente a un cliente.

Ollama combina pesos de modelo, cuantización y un servidor local detrás de una sola interfaz de línea de comandos. Es el paso estándar para demos, pilotos aislados y máquinas de desarrollo, aunque la mayoría de los equipos pasan a un stack de servicio dedicado para tráfico real.

Ideal para: Demos locales, pilotos aislados, máquinas de desarrollo

Despliegue: Autoalojable