Deployment & Inferenz ★ 118.0k

Ollama

Ein Befehl, um ein LLM auf einem Laptop auszuführen – der schnellste Weg, um ein Modell vor einem Kunden zu präsentieren.

Ollama bündelt Modellgewichte, Quantisierung und einen lokalen Server hinter einer einzigen CLI. Es ist der Standard-Schritt für Demos, air-gapped-Piloten und Entwicklermaschinen, obwohl die meisten Teams zu einem dedizierten Servierungsstack für echten Traffic wechseln.

Am besten für: Lokale Demos, air-gapped-Piloten, Entwicklermaschinen

Deployment: Selbst hostbar