Manuales

Cómo realizar una revisión de costos antes de escalar la inferencia

Antes de agregar capacidad o cambiar de modelo, analice la solicitud una vez y establezca un precio para cada etapa. La mayoría de las revisiones de costos encuentran el ahorro en el tamaño del contexto, los reintentos y la caché, no en la elección del modelo.

El orden en que hacerlo

Las revisiones de costos suelen comenzar con el catálogo de modelos, porque allí es donde se encuentran los precios visibles. Comience un paso antes: siga una sola solicitud representativa desde la interfaz de usuario hasta la respuesta y anote cada etapa que consume recursos pagados. El modelo es una línea entre varias, y rara vez es el más grande controllable.

Paso a paso

  • Recuperación. Incorporación de la consulta, búsqueda en el índice y cualquier paso de reordenación. Reordenar un conjunto grande de candidatos con un codificador cruzado es frecuentemente más costoso que la generación que mejora, y el intercambio rara vez se mide.
  • Ensamblaje de contexto. Los fragmentos recuperados, el historial de conversación, la llamada al sistema, las definiciones de herramientas y las instrucciones de formato. Todo aquí se factura en cada turno, ya sea que haya cambiado desde el turno anterior o no.
  • Generación. Tokens de entrada y salida, con tokens de salida generalmente más caros y producidos más lentamente. La verbosidad es una decisión de costo, no solo una preferencia de estilo.
  • Reintentos y tiempos de espera. Trabajo duplicado que no aparece en ningún gráfico de uso y se escala con la cola de la distribución de latencia.
  • Evaluación y monitoreo. Ejecuciones de puntuación continuas, tráfico sintético y el modelo de juez, que a menudo es del mismo tamaño que el modelo de producción.

Las cuatro palancas que mueven el número

Disciplina de contexto. En la mayoría de los sistemas de recuperación, esto es el costo controllable más grande. Duplicar fragmentos, limitar el número de pasajes, eliminar el historial que ya no se referencia y colocar la parte estable de la llamada primero para que se pueda reutilizar una caché. Mida el tamaño de contexto promedio por solicitud y colóquelo en un panel; se desvía hacia arriba sin que nadie decida aumentarlo.

Enrutamiento. Envíe las preguntas que no necesitan un modelo grande a uno pequeño. La decisión de enrutamiento en sí debe ser barata y medible, y el respaldo —cuando el modelo pequeño no es confiable— debe estar definido de antemano en lugar de descubrirse en producción.

Caché. Las preguntas idénticas y casi idénticas son mucho más comunes de lo que esperan los equipos de productos, particularmente en herramientas internas con una pequeña población de usuarios. Almacene en caché al nivel de la respuesta, con una regla de invalidación explícita vinculada al corpus.

Longitud de salida. Pida la longitud que desee. Un modelo que se le indica que sea exhaustivo será exhaustivo en cada solicitud, y la salida se factura a la tarifa más alta.

Escribiendo el modelo

Registre las entradas, no solo el resultado: solicitudes por período, tokens de entrada y salida promedio por solicitud, relación de reintento, tasa de acierto de caché y los precios unitarios utilizados. Un modelo de costo sin sus entradas es una suposición con una hoja de cálculo, y no se puede volver a comprobar cuando uno de los supuestos cambia —que es exactamente cuando la decisión necesita revisarse.

Luego atribuya el costo a las unidades que le importan al negocio. El costo por usuario activo y el costo por tarea completada explican una factura; el costo por token no, porque nadie decidió comprar un token.

Cuándo comprar capacidad en su lugar

Después de las palancas anteriores, si la carga de trabajo es genuinamente grande y constante, la capacidad autohospedada puede ganar. La decisión se basa en la utilización: el hardware reservado es barato por hora y caro por hora no utilizada. Anote la utilización que espera, la utilización que puede medir y el umbral en el que la comparación se invierte. Sin el número de utilización, la comparación es un argumento, no un cálculo.

Qué hacer con esto

  • Establezca un precio para toda la ruta de la solicitud, no solo para el elemento del modelo
  • El tamaño del contexto es el mayor costo controlable en la mayoría de los sistemas RAG
  • Anote los supuestos — un modelo de costos sin entradas es una suposición