jsonscraper

Como calcular o consumo de tokens da Responses API: entrada, saída, cache e raciocínio

Contabilização prática do uso: como verificar a economia após otimizar o prompt, o histórico e o raciocínio.

Depois de encurtar o prompt, verifique a economia com base no usage de cada resposta e no custo da tarefa inteira. Uma resposta curta pode vir acompanhada de um consumo considerável com raciocínio, e a continuação de uma conversa pode contabilizar o histórico novamente. Para controlar o orçamento, separe o volume de tokens, as categorias tarifárias e o número de chamadas necessárias para concluir a tarefa.

Como calcular o consumo de tokens da Responses API: entrada, saída, cache e raciocínio
Contexto: Analisamos os contadores da Responses API, a contabilização repetida do contexto e a fórmula de custo. Os tokens de raciocínio já estão incluídos em output_tokens; os tokens em cache fazem parte da entrada, e a gravação no cache pode ser tarifada separadamente.
Assunto visual: Uma única capa de IA para as versões em russo, inglês e alemão. Natureza-morta editorial fotorrealista: sobre a mesa de trabalho de um desenvolvedor, quatro grupos de pequenas fichas de vidro translúcido; dentr
© jsonscraper · Imagem gerada por IA

Quatro contadores e como se relacionam

No exemplo do objeto usage, a OpenAI mostra a entrada, a saída e os detalhes de ambos os contadores. Interprete-os assim:

  • input_tokens — volume total de tokens de entrada desta chamada, incluindo o contexto usado para continuar a conversa.
  • input_tokens_details.cached_tokens — parte da entrada atendida pelo cache. Ela já está incluída em input_tokens.
  • output_tokens — volume total de tokens gerados, incluindo o raciocínio.
  • output_tokens_details.reasoning_tokens — parte da saída usada para raciocínio.

Os tokens de raciocínio já estão incluídos em output_tokens; não os some à saída uma segunda vez. A OpenAI os contabiliza pela tarifa de tokens de saída. Da mesma forma, somar cached_tokens à entrada contabiliza novamente a mesma parte da solicitação. Para o volume total, use total_tokens ou a soma de input_tokens + output_tokens.

Custo: divida a entrada por categoria

A página de preços atual apresenta separadamente a entrada normal, a entrada em cache, a gravação no cache e a saída. Escolha as tarifas correspondentes ao modelo efetivamente usado, ao modo de processamento e ao comprimento de contexto aplicável. Armazene os valores exatos em uma configuração de cálculo com controle de versões.

Um detalhe importante da documentação atual sobre cache: para GPT-5.6 e modelos mais recentes, é contabilizado input_tokens_details.cache_write_tokens. Se o seu esquema prevê uma cobrança separada pela gravação no cache, subtraia essa categoria da entrada normal e aplique a tarifa correspondente.

I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens

ordinary_input = I - C - W
cost = ((I - C - W) * P_input
        + C * P_cached
        + W * P_write
        + O * P_output) / 1_000_000
Como calcular o consumo de tokens da Responses API: entrada, saída, cache e raciocínio
Contexto: Analisamos os contadores da Responses API, a contabilização repetida do contexto e a fórmula de custo. Os tokens de raciocínio já estão incluídos em output_tokens; os tokens em cache fazem parte da entrada, e a gravação no cache pode ser tarifada separadamente.
Assunto visual: Uma única capa de IA para as versões em russo, inglês e alemão. Natureza-morta editorial fotorrealista: sobre a mesa de trabalho de um desenvolvedor, quatro grupos de pequenas fichas de vidro translúcido; dentr
© jsonscraper · Imagem gerada por IA

Aqui, os preços são definidos por milhão de tokens; para um esquema sem uma categoria separada de gravação, use W = 0. A fórmula abrange as categorias de tokens listadas. Acrescente as ferramentas pagas em linhas separadas, de acordo com as condições de tarifação.

Exemplo hipotético: entrada — 4000, entrada em cache — 3000, gravação no cache — 500, saída — 1000, dos quais 600 são de raciocínio. Isso resulta em 500 tokens de entrada normal e 5000 tokens no total. A saída é cobrada sobre 1000 tokens; o valor 600 é mantido para diagnóstico.

A continuação da conversa consome entrada novamente

Ao gerenciar o histórico manualmente, o aplicativo envia as mensagens anteriores junto com a nova entrada. As mensagens incluídas na solicitação seguinte voltam a fazer parte do contexto de entrada. Por isso, medir apenas a última mensagem do usuário deixa de fora o consumo do histórico.

Com previous_response_id, o aplicativo envia uma referência à resposta anterior, e a API mantém o contexto encadeado. De acordo com as regras de contabilização das continuações, os tokens de entrada anteriores da sequência voltam a ser cobrados como tokens de entrada. O cache pode alterar a categoria tarifária de parte dessa entrada; consulte cached_tokens em cada resposta para verificar se houve acerto no cache.

Como verificar o resultado da otimização

  1. Guarde uma amostra de referência. Compare tarefas iguais, com o mesmo modelo, critério de sucesso e comprimentos de diálogo semelhantes.
  2. Registre cada chamada. Anote os identificadores da resposta e da tarefa, o modelo, as configurações de raciocínio, o status, a latência e o usage completo. Guarde a versão do prompt e da configuração tarifária.
  3. Inclua todas as chamadas e as respostas recebidas em novas tentativas. A métrica principal é o custo da tarefa concluída com sucesso.
  4. Separe os motivos das alterações. Acompanhe a entrada normal, a leitura e a gravação no cache, a saída e a proporção de raciocínio. Para calcular a proporção agregada de cache, divida a soma de C pela soma de I.
  5. Verifique a qualidade e a cauda da distribuição. Além do custo médio, compare o p95, o número de tentativas e a porcentagem de tarefas concluídas com sucesso.

O parâmetro max_output_tokens limita a geração junto com o raciocínio. Quando o limite é atingido, a resposta pode receber o status incomplete, inclusive em casos sem texto visível, mas com consumo de tokens. Leve essas respostas em conta ao verificar a economia: a otimização atinge o objetivo quando tarefas comparáveis são concluídas com sucesso a um custo total menor.

People

No people listed for this article yet.

Keep readingAnthropic lança Claude Haiku 5.5: preço varia conforme o tamanho do prompt
Read the next article

Transforme o que lê numa integração funcional

Explore as APIs de dados sociais da jsonscraper, teste pedidos e crie o seu próximo fluxo de trabalho.

Explorar APIs