Leitfäden

So führen Sie eine Kostenprüfung durch, bevor Sie die Inferenz skalieren

Bevor Sie die Kapazität erhöhen oder das Modell wechseln, gehen Sie den Anfragepfad einmal durch und berechnen Sie jeden Schritt. Die meisten Kostenprüfungen finden die Kosten in der Kontextgröße, Wiederholungen und dem Caching und nicht in der Modellauswahl.

Die Reihenfolge, in der es zu tun ist

Kostenüberprüfungen beginnen normalerweise mit dem Modellkatalog, da dort die sichtbaren Preise angezeigt werden. Beginnen Sie stattdessen einen Schritt früher: Verfolgen Sie eine einzelne repräsentative Anfrage von der Benutzeroberfläche bis zur Antwort und notieren Sie jede Phase, die bezahlte Ressourcen verbraucht. Das Modell ist nur eine Zeile unter mehreren und selten der größte kontrollierbare Faktor.

Schritt für Schritt

  • Abruf. Einbetten der Abfrage, Durchsuchen des Index und eventuelle Neubewertung. Eine Neubewertung einer großen Kandidatensammlung mit einem Cross-Encoder ist häufig teurer als die Generierung, die sie verbessert, und der Handel wird selten gemessen.
  • Kontextzusammenstellung. Die abgerufenen Chunks, die Konversationshistorie, die Systemanweisung, die Werkzeugdefinitionen und die Formatierungsanweisungen. Alles hier wird bei jedem Schritt berechnet, unabhängig davon, ob es sich seit dem vorherigen Schritt geändert hat.
  • Generierung. Eingabe- und Ausgabetoken, wobei Ausgabetoken normalerweise höher bewertet werden und langsamer produziert werden. Verbosität ist eine Kostenentscheidung und nicht nur eine Stilpräferenz.
  • Wiederholungen und Zeitüberschreitungen. Doppelte Arbeit, die in keiner Nutzungsstatistik erscheint und mit dem Ende der Latenzverteilung skaliert.
  • Auswertung und Überwachung. Kontinuierliche Bewertungsläufe, synthetischer Datenverkehr und das Judge-Modell, das oft die gleiche Größe wie das Produktionsmodell hat.

Die vier Hebel, die die Zahl bewegen

Kontextdisziplin. In den meisten Abrufsystemen ist dies der größte kontrollierbare Kostenfaktor. Entfernen Sie doppelte Chunks, begrenzen Sie die Anzahl der Passagen, entfernen Sie die Historie, die nicht mehr referenziert wird, und stellen Sie den stabilen Teil der Anweisung zuerst, damit ein Cache wiederverwendet werden kann. Messen Sie die durchschnittliche Kontextgröße pro Anfrage und stellen Sie sie auf ein Dashboard; sie driftet nach oben, ohne dass jemand beschließt, sie zu erhöhen.

Routing. Senden Sie die Fragen, die kein großes Modell benötigen, an ein kleines Modell. Die Routing-Entscheidung selbst muss billig und messbar sein, und der Fallback – wenn das kleine Modell nicht zuversichtlich ist – muss im Voraus definiert werden, anstatt in der Produktion entdeckt zu werden.

Caching. Identische und nahezu identische Fragen sind viel häufiger als Produktteams erwarten, insbesondere in internen Tools mit einer kleinen Benutzerpopulation. Cachen Sie auf der Ebene der Antwort, mit einer expliziten Invalidierungsregel, die an den Corpus geknüpft ist.

Ausgabelänge. Fordern Sie die Länge an, die Sie wollen. Ein Modell, das angewiesen wird, gründlich zu sein, wird auf jeder Anfrage gründlich sein, und die Ausgabe wird zum höheren Tarif berechnet.

Das Modell aufschreiben

Notieren Sie die Eingaben, nicht nur das Ergebnis: Anfragen pro Periode, durchschnittliche Eingabe- und Ausgabetoken pro Anfrage, Wiederholungsverhältnis, Cache-Trefferquote und die verwendeten Einzelpreise. Ein Kostenmodell ohne seine Eingaben ist eine Vermutung, die in einer Tabellenkalkulation getarnt ist, und es kann nicht überprüft werden, wenn eine der Annahmen geändert wird – was genau dann der Fall ist, wenn die Entscheidung überprüft werden muss.

Dann ordnen Sie die Kosten den Einheiten zu, die das Unternehmen interessieren. Kosten pro aktiver Benutzer und Kosten pro abgeschlossener Aufgabe erklären eine Rechnung; Kosten pro Token erklären nichts, da niemand beschlossen hat, ein Token zu kaufen.

Wann man stattdessen Kapazität kaufen sollte

Nach den oben genannten Hebeln, wenn die Arbeitslast wirklich groß und konstant ist, kann selbst gehostete Kapazität gewinnen. Die Entscheidung basiert auf der Auslastung: reservierte Hardware ist billig pro Stunde und teuer pro ungenutzter Stunde. Schreiben Sie die erwartete Auslastung, die gemessene Auslastung und den Schwellenwert auf, bei dem der Vergleich umschlägt. Ohne die Auslastungsnummer ist der Vergleich ein Argument und keine Berechnung.

Was daraus folgt

  • Berechnen Sie den gesamten Anfragepfad, nicht nur die Modellposition
  • Die Kontextgröße ist die größte kontrollierbare Kostenkomponente in den meisten RAG-Systemen
  • Schreiben Sie die Annahmen auf – ein Kostenmodell ohne Eingaben ist eine Vermutung