Ollama
Ein Befehl, um ein LLM auf einem Laptop auszuführen – der schnellste Weg, um ein Modell vor einem Kunden zu präsentieren.
Ollama bündelt Modellgewichte, Quantisierung und einen lokalen Server hinter einer einzigen CLI. Es ist der Standard-Schritt für Demos, air-gapped-Piloten und Entwicklermaschinen, obwohl die meisten Teams zu einem dedizierten Servierungsstack für echten Traffic wechseln.
Am besten für: Lokale Demos, air-gapped-Piloten, Entwicklermaschinen
Deployment: Selbst hostbar