llama.cpp
Inferencia de CPU en C/C++ puro — se ejecuta donde una GPU no puede llegar.
llama.cpp es el motor detrás de la mayoría de las implementaciones de CPU y LLM de borde, con cuantización GGUF que reduce los modelos lo suficiente como para ejecutarse en hardware modesto. Espere un rendimiento más bajo que una pila de GPU, pero muchas menos restricciones de implementación.
Ideal para: Inferencia solo con CPU, de borde y embebida
Despliegue: Autoalojable