Deployment & Inference ★ 87.0k

llama.cpp

Inferensi berbasis C/C++ yang mengutamakan CPU — jalan di tempat GPU tidak bisa.

llama.cpp adalah mesin di balik sebagian besar deployment LLM di CPU dan edge, dengan kuantisasi GGUF yang menyusutkan model hingga bisa jalan di perangkat sederhana. Throughput-nya di bawah stack GPU, tetapi jauh lebih sedikit batasan deployment.

Cocok untuk: Inferensi CPU-only, edge, dan embedded

Deployment: Bisa self-host