Das GPU-Kostenmodell, das niemand vor dem Kauf von Hardware aufschreibt
Selbsthosting schlägt die API in Bezug auf die Kosten pro Token nur über einem Auslastungsschwellenwert, den fast niemand erreicht. Darunter zahlen Sie für untätige Silizium-Chips und die Aufmerksamkeit von Ingenieuren – und nur eines davon ist in der Tabelle…
Der Vergleich, den jeder durchführt
Irgendwo in jedem Build-vs.-Buy-Gespräch gibt es eine Tabelle mit zwei Zahlen: dem Preis pro Million Token einer API und der stündlichen Miete einer GPU, geteilt durch eine angenommene Durchsatzleistung. Die zweite Zahl ist normalerweise drei bis zehn Mal kleiner als die erste, und das Meeting endet.
Die Tabelle ist nicht falsch in Bezug auf die Arithmetik. Sie ist jedoch falsch in Bezug auf den Nenner. Sie teilt durch die Durchsatzleistung, die die Karte liefern kann, und nicht durch die Durchsatzleistung, die sie tatsächlich liefern wird.
Die Zahl, die tatsächlich entscheidet
Auslastung. Eine gemietete A100 oder H100, die stündlich abgerechnet wird, kostet das Gleiche, ob sie einen oder zehntausend Anfragen bedient. Die API berechnet Ihnen die Token, die Sie tatsächlich verbrauchen. Die Grenze liegt also nicht bei dem rohen Preis, sondern bei der Frage, wie viele Stunden pro Tag Ihre Karte tatsächlich ausgelastet ist.
Nehmen wir eine konkrete Form: einen gleichmäßigen Datenverkehr von einigen Millionen Token pro Tag, verteilt über die Arbeitszeit. Das ist eine Arbeitsbelastung, die eine einzelne Karte vielleicht für ein Viertel des Tages auslastet und sie ansonsten idle lässt. Bei einem Preis pro tatsächlich bedientem Token sind die Idle-Stunden reine Overhead-Kosten, und die API gewinnt deutlich. Wenn Sie den gleichen Datenverkehr auf eine 24-Stunden-Last mit Batch-Verarbeitung umstellen, kehrt sich das Ranking um.
Was die Tabelle außer Acht lässt
Zwei Kosten fehlen systematisch. Die erste ist der Ingenieur. Jemand muss den Servierungsstack, die Modell-Updates, die CUDA- und Treiber-Kompatibilität, die Autoscaling-Policy und den On-Call-Service besitzen. Das ist kein Posten, den Sie in Rechnung stellen können, aber es ist ein reeller Bruchteil einer Person, und es skaliert nicht herunter, wenn der Datenverkehr nachlässt.
Die zweite ist der Retry- und Fehlerbudget. Managed APIs absorbieren ihre eigenen schlechten Stunden. Ihr Cluster absorbiert Ihre, in Form von Incidents, und Incidents während eines Kunden-Piloten kosten mehr als der Compute, den sie unterbrechen.
Wie man tatsächlich entscheidet
Messen Sie, bevor Sie kaufen. Führen Sie die Arbeitsbelastung auf gemieteter Hardware für zwei Wochen mit echtem Datenverkehr durch, zeichnen Sie die bedienten Token und die abgerechneten GPU-Stunden auf und berechnen Sie Ihre realisierten Kosten pro Million Token. Vergleichen Sie das mit dem API-Preis für die gleiche Qualitätsstufe. Das Ergebnis ist spezifisch für Ihre Datenverkehrsform, und genau deshalb kann eine generische Vergleichstabelle es nicht für Sie beantworten.
Dann entscheiden Sie aufgrund der nicht-kostenbezogenen Faktoren, die normalerweise die eigentlichen Treiber sind: Datenresidenz, Latenz zu Ihren Benutzern, Unabhängigkeit von Rate Limits und ob Sie ein Modell benötigen, das niemand bedient.
Was daraus folgt
- Selbsthosting ist nur über einem Auslastungsschwellenwert, den Sie messen und nicht annehmen sollten, günstiger
- Zwei Kosten fehlen immer in der Tabelle: der Bruchteil eines Ingenieurs und der Budget für Störungen
- Führen Sie die reale Arbeitslast auf gemieteter Hardware für zwei Wochen aus, bevor Sie sich für etwas entscheiden
- Datenresidenz und Unabhängigkeit von Rate Limits entscheiden normalerweise, bevor es um die Kosten geht