El modelo de costos de GPU que nadie escribe antes de comprar hardware
La autohospedación supera al API en costo por token solo por encima de un umbral de utilización que casi nadie alcanza. Por debajo de él, estás pagando por silicio inactivo y la atención de un ingeniero — y solo uno de esos está en la hoja de cálculo.
La comparación que todos realizan
En alguna parte de cada conversación sobre construir o comprar, hay una hoja de cálculo con dos números: el precio por millón de tokens de una API y el alquiler por hora de una GPU dividido por un rendimiento asumido. El segundo número suele ser de tres a diez veces menor que el primero, y la reunión termina.
La hoja de cálculo no está equivocada sobre la aritmética. Está equivocada sobre el denominador. Divide por el rendimiento que la tarjeta puede entregar, no por el rendimiento que entregará.
El número que realmente decide
Utilización. Una A100 o H100 alquilada por hora cuesta lo mismo ya sea que atienda una solicitud o diez mil. La API te cobra por los tokens que realmente consumes. Entonces, el punto de equilibrio no es una cuestión de precio bruto, sino de cuántas horas al día la tarjeta está realmente ocupada.
Toma una forma concreta: tráfico constante de unos pocos millones de tokens al día, distribuidos durante las horas laborales. Esa es una carga de trabajo que satura una sola tarjeta durante tal vez un cuarto del día y la deja inactiva de lo contrario. Con precio por token realmente servido, las horas inactivas son un gasto puro, y la API gana cómodamente. Empuja el mismo tráfico a una carga sostenida de veinticuatro horas con procesamiento por lotes y la clasificación se invierte.
Lo que la hoja de cálculo deja fuera
Hay dos costos que sistemáticamente faltan. El primero es el ingeniero. Alguien tiene que ser el propietario de la pila de servicio, las actualizaciones del modelo, la compatibilidad de CUDA y controlador, la política de escalado automático y el servicio de atención. Eso no es un elemento que puedas facturar, pero es una fracción real de una persona, y no se reduce cuando el tráfico disminuye.
El segundo es el presupuesto de reintento y falla. Las API administradas absorben sus propias malas horas. Tu clúster absorbe las tuyas, en forma de incidentes, y los incidentes durante un piloto de cliente cuestan más que el cómputo que interrumpen.
Cómo decidir realmente
Mide antes de comprar. Ejecuta la carga de trabajo en hardware alquilado durante dos semanas con tráfico real, registra tokens servidos y horas de GPU facturadas, y calcula tu costo realizado por millón de tokens. Compara eso con el precio de la API para el mismo nivel de calidad. El resultado es específico de la forma de tu tráfico, lo cual es exactamente por qué una tabla de comparación genérica no puede responder por ti.
Luego decide sobre los factores no relacionados con el costo, que suelen ser los verdaderos impulsores: residencia de datos, latencia para tus usuarios, independencia de límites de velocidad y si necesitas un modelo que nadie sirve.
Qué hacer con esto
- La autohospedación gana en costo solo por encima de un umbral de utilización que debes medir, no asumir
- Dos costos siempre están ausentes de la hoja de cálculo: la fracción de un ingeniero y el presupuesto para incidentes
- Ejecuta la carga de trabajo real en hardware alquilado durante dos semanas antes de comprometerte con algo
- La residencia de datos y la independencia de límites de velocidad suelen decidirlo antes que el costo