jsonscraper

Cómo calcular el consumo de tokens de Responses API: entrada, salida, caché y razonamiento

Control práctico del uso: cómo verificar el ahorro tras optimizar el prompt, el historial y el razonamiento.

Después de acortar el prompt, comprueba el ahorro con el usage de cada respuesta y el coste de toda la tarea. Una respuesta breve puede implicar un consumo considerable de razonamiento, y continuar una conversación puede volver a contabilizar el historial. Para controlar el presupuesto, separa el volumen de tokens, las categorías tarifarias y el número de llamadas necesarias para obtener el resultado.

Cómo calcular el consumo de tokens de Responses API: entrada, salida, caché y razonamiento
Contexto: Analizamos los contadores de Responses API, el recuento repetido del contexto y la fórmula de costes. Los tokens de razonamiento ya están incluidos en output_tokens; los tokens almacenados en caché forman parte de la entrada, mientras que escribir en la caché puede tener un coste aparte.
Tema visual: Una misma portada de IA para las versiones en ruso, inglés y alemán. Bodegón editorial fotorrealista: sobre el escritorio de un desarrollador hay cuatro grupos de pequeñas fichas de vidrio translúcido; dentr
© jsonscraper · Imagen generada por IA

Cuatro contadores y cómo se relacionan

En el ejemplo del objeto usage, OpenAI muestra la entrada, la salida y el desglose de ambos contadores. Interprétalos así:

  • input_tokens: volumen total de tokens de entrada de esta llamada, incluido el contexto utilizado para continuar la conversación.
  • input_tokens_details.cached_tokens: parte de la entrada atendida desde la caché. Ya está incluida en input_tokens.
  • output_tokens: volumen total de tokens generados, incluido el razonamiento.
  • output_tokens_details.reasoning_tokens: parte de la salida utilizada para el razonamiento.

Los tokens de razonamiento ya están incluidos en output_tokens; no debes sumarlos de nuevo a la salida. OpenAI los factura según la tarifa de tokens de salida. Del mismo modo, sumar cached_tokens a la entrada contabiliza dos veces la misma parte de la solicitud. Para obtener el volumen total, usa total_tokens o la suma de input_tokens + output_tokens.

Coste: desglosa la entrada por categorías

La página de precios actual presenta por separado la entrada normal, la entrada en caché, la escritura en caché y la salida. Elige las tarifas correspondientes al modelo real, al modo de procesamiento y a la longitud de contexto aplicable. Guarda los valores exactos en una configuración de cálculo con control de versiones.

Un detalle importante de la documentación actual sobre el almacenamiento en caché: para GPT-5.6 y los modelos posteriores, se contabiliza input_tokens_details.cache_write_tokens. Si tu esquema contempla un cargo independiente por escribir en la caché, resta esta categoría de la entrada normal y aplica su tarifa.

I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens

ordinary_input = I - C - W
cost = ((I - C - W) * P_input
        + C * P_cached
        + W * P_write
        + O * P_output) / 1_000_000
Cómo calcular el consumo de tokens de Responses API: entrada, salida, caché y razonamiento
Contexto: Analizamos los contadores de Responses API, el recuento repetido del contexto y la fórmula de costes. Los tokens de razonamiento ya están incluidos en output_tokens; los tokens almacenados en caché forman parte de la entrada, mientras que escribir en la caché puede tener un coste aparte.
Tema visual: Una misma portada de IA para las versiones en ruso, inglés y alemán. Bodegón editorial fotorrealista: sobre el escritorio de un desarrollador hay cuatro grupos de pequeñas fichas de vidrio translúcido; dentr
© jsonscraper · Imagen generada por IA

En este ejemplo, los precios se expresan por millón de tokens; si el esquema no contempla una categoría independiente para la escritura, usa W = 0. La fórmula cubre las categorías de tokens enumeradas. Añade las herramientas de pago en líneas separadas según sus condiciones de facturación.

Ejemplo hipotético: entrada: 4000; entrada en caché: 3000; escritura en caché: 500; salida: 1000, de los cuales 600 son de razonamiento. El resultado es de 500 tokens de entrada normal y 5000 tokens en total. Se facturan 1000 tokens de salida; el valor 600 se conserva para el diagnóstico.

Al continuar una conversación, la entrada vuelve a contabilizarse

Cuando administra el historial manualmente, la aplicación envía los mensajes anteriores junto con la nueva entrada. Los mensajes incluidos en la siguiente solicitud vuelven a formar parte del contexto de entrada. Por eso, medir solo el último mensaje del usuario omite el coste del historial.

Con previous_response_id, la aplicación transmite una referencia a la respuesta anterior y la API enlaza el contexto. Según las reglas de contabilización de continuaciones, los tokens de entrada previos de la cadena vuelven a facturarse como tokens de entrada. La caché puede cambiar la categoría tarifaria de parte de esa entrada; consulta cached_tokens en cada respuesta para comprobar si hubo una coincidencia.

Cómo comprobar el resultado de la optimización

  1. Guarda una muestra de referencia. Compara tareas iguales, con el mismo modelo y criterio de éxito, y longitudes de conversación similares.
  2. Registra cada llamada. Anota los identificadores de respuesta y tarea, el modelo, la configuración de razonamiento, el estado, la latencia y el usage completo. Guarda la versión del prompt y de la configuración tarifaria.
  3. Suma los costes de la tarea. Incluye todas sus llamadas y las respuestas obtenidas en los reintentos. La métrica principal es el coste de una tarea completada con éxito.
  4. Separa las causas de los cambios. Sigue la entrada normal, la lectura y escritura de la caché, la salida y la proporción de razonamiento. Para calcular la proporción agregada de caché, divide la suma de C entre la suma de I.
  5. Comprueba la calidad y la cola de la distribución. Además del coste medio, compara el percentil p95, el número de intentos y el porcentaje de tareas exitosas.

El parámetro max_output_tokens limita la generación, incluido el razonamiento. Si se agota el límite, la respuesta puede recibir el estado incomplete, incluso cuando no hay texto visible pero sí consumo de tokens. Ten en cuenta estas respuestas al comprobar el ahorro: la optimización ha cumplido su objetivo cuando tareas comparables se completan con éxito y un coste total menor.

People

No people listed for this article yet.

Keep readingAnthropic lanza Claude Haiku 5.5: el precio depende de la longitud del prompt
Read the next article

Convierte lo que lees en una integración funcional

Explora las API de datos sociales de jsonscraper, prueba solicitudes y crea tu próximo flujo de trabajo.

Explorar APIs