llama.cpp
CPU-erstes Inferencing in reinem C/C++ — läuft dort, wo eine GPU nicht hinkommt.
llama.cpp ist der Motor hinter den meisten CPU- und Edge-LLM-Deployments, mit GGUF-Quantisierung, die Modelle so sehr verkleinert, dass sie auf bescheidenen Hardware-Ressourcen laufen können. Erwarten Sie eine geringere Durchsatzleistung als bei einem GPU-Stack, aber deutlich weniger Deploy-Einschränkungen.
Am besten für: CPU-only, Edge- und Embedded-Inferencing
Deployment: Selbst hostbar