Después de acortar el prompt, comprueba el ahorro con el usage de cada respuesta y el coste de toda la tarea. Una respuesta breve puede implicar un consumo considerable de razonamiento, y continuar una conversación puede volver a contabilizar el historial. Para controlar el presupuesto, separa el volumen de tokens, las categorías tarifarias y el número de llamadas necesarias para obtener el resultado.

Cuatro contadores y cómo se relacionan
En el ejemplo del objeto usage, OpenAI muestra la entrada, la salida y el desglose de ambos contadores. Interprétalos así:
input_tokens: volumen total de tokens de entrada de esta llamada, incluido el contexto utilizado para continuar la conversación.input_tokens_details.cached_tokens: parte de la entrada atendida desde la caché. Ya está incluida eninput_tokens.output_tokens: volumen total de tokens generados, incluido el razonamiento.output_tokens_details.reasoning_tokens: parte de la salida utilizada para el razonamiento.
Los tokens de razonamiento ya están incluidos en output_tokens; no debes sumarlos de nuevo a la salida. OpenAI los factura según la tarifa de tokens de salida. Del mismo modo, sumar cached_tokens a la entrada contabiliza dos veces la misma parte de la solicitud. Para obtener el volumen total, usa total_tokens o la suma de input_tokens + output_tokens.
Coste: desglosa la entrada por categorías
La página de precios actual presenta por separado la entrada normal, la entrada en caché, la escritura en caché y la salida. Elige las tarifas correspondientes al modelo real, al modo de procesamiento y a la longitud de contexto aplicable. Guarda los valores exactos en una configuración de cálculo con control de versiones.
Un detalle importante de la documentación actual sobre el almacenamiento en caché: para GPT-5.6 y los modelos posteriores, se contabiliza input_tokens_details.cache_write_tokens. Si tu esquema contempla un cargo independiente por escribir en la caché, resta esta categoría de la entrada normal y aplica su tarifa.
I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens
ordinary_input = I - C - W
cost = ((I - C - W) * P_input
+ C * P_cached
+ W * P_write
+ O * P_output) / 1_000_000
En este ejemplo, los precios se expresan por millón de tokens; si el esquema no contempla una categoría independiente para la escritura, usa W = 0. La fórmula cubre las categorías de tokens enumeradas. Añade las herramientas de pago en líneas separadas según sus condiciones de facturación.
Ejemplo hipotético: entrada: 4000; entrada en caché: 3000; escritura en caché: 500; salida: 1000, de los cuales 600 son de razonamiento. El resultado es de 500 tokens de entrada normal y 5000 tokens en total. Se facturan 1000 tokens de salida; el valor 600 se conserva para el diagnóstico.
Al continuar una conversación, la entrada vuelve a contabilizarse
Cuando administra el historial manualmente, la aplicación envía los mensajes anteriores junto con la nueva entrada. Los mensajes incluidos en la siguiente solicitud vuelven a formar parte del contexto de entrada. Por eso, medir solo el último mensaje del usuario omite el coste del historial.
Con previous_response_id, la aplicación transmite una referencia a la respuesta anterior y la API enlaza el contexto. Según las reglas de contabilización de continuaciones, los tokens de entrada previos de la cadena vuelven a facturarse como tokens de entrada. La caché puede cambiar la categoría tarifaria de parte de esa entrada; consulta cached_tokens en cada respuesta para comprobar si hubo una coincidencia.
Cómo comprobar el resultado de la optimización
- Guarda una muestra de referencia. Compara tareas iguales, con el mismo modelo y criterio de éxito, y longitudes de conversación similares.
- Registra cada llamada. Anota los identificadores de respuesta y tarea, el modelo, la configuración de razonamiento, el estado, la latencia y el
usagecompleto. Guarda la versión del prompt y de la configuración tarifaria. - Suma los costes de la tarea. Incluye todas sus llamadas y las respuestas obtenidas en los reintentos. La métrica principal es el coste de una tarea completada con éxito.
- Separa las causas de los cambios. Sigue la entrada normal, la lectura y escritura de la caché, la salida y la proporción de razonamiento. Para calcular la proporción agregada de caché, divide la suma de
Centre la suma deI. - Comprueba la calidad y la cola de la distribución. Además del coste medio, compara el percentil p95, el número de intentos y el porcentaje de tareas exitosas.
El parámetro max_output_tokens limita la generación, incluido el razonamiento. Si se agota el límite, la respuesta puede recibir el estado incomplete, incluso cuando no hay texto visible pero sí consumo de tokens. Ten en cuenta estas respuestas al comprobar el ahorro: la optimización ha cumplido su objetivo cuando tareas comparables se completan con éxito y un coste total menor.