Depois de encurtar o prompt, verifique a economia com base no usage de cada resposta e no custo da tarefa inteira. Uma resposta curta pode vir acompanhada de um consumo considerável com raciocínio, e a continuação de uma conversa pode contabilizar o histórico novamente. Para controlar o orçamento, separe o volume de tokens, as categorias tarifárias e o número de chamadas necessárias para concluir a tarefa.

Quatro contadores e como se relacionam
No exemplo do objeto usage, a OpenAI mostra a entrada, a saída e os detalhes de ambos os contadores. Interprete-os assim:
input_tokens— volume total de tokens de entrada desta chamada, incluindo o contexto usado para continuar a conversa.input_tokens_details.cached_tokens— parte da entrada atendida pelo cache. Ela já está incluída eminput_tokens.output_tokens— volume total de tokens gerados, incluindo o raciocínio.output_tokens_details.reasoning_tokens— parte da saída usada para raciocínio.
Os tokens de raciocínio já estão incluídos em output_tokens; não os some à saída uma segunda vez. A OpenAI os contabiliza pela tarifa de tokens de saída. Da mesma forma, somar cached_tokens à entrada contabiliza novamente a mesma parte da solicitação. Para o volume total, use total_tokens ou a soma de input_tokens + output_tokens.
Custo: divida a entrada por categoria
A página de preços atual apresenta separadamente a entrada normal, a entrada em cache, a gravação no cache e a saída. Escolha as tarifas correspondentes ao modelo efetivamente usado, ao modo de processamento e ao comprimento de contexto aplicável. Armazene os valores exatos em uma configuração de cálculo com controle de versões.
Um detalhe importante da documentação atual sobre cache: para GPT-5.6 e modelos mais recentes, é contabilizado input_tokens_details.cache_write_tokens. Se o seu esquema prevê uma cobrança separada pela gravação no cache, subtraia essa categoria da entrada normal e aplique a tarifa correspondente.
I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens
ordinary_input = I - C - W
cost = ((I - C - W) * P_input
+ C * P_cached
+ W * P_write
+ O * P_output) / 1_000_000
Aqui, os preços são definidos por milhão de tokens; para um esquema sem uma categoria separada de gravação, use W = 0. A fórmula abrange as categorias de tokens listadas. Acrescente as ferramentas pagas em linhas separadas, de acordo com as condições de tarifação.
Exemplo hipotético: entrada — 4000, entrada em cache — 3000, gravação no cache — 500, saída — 1000, dos quais 600 são de raciocínio. Isso resulta em 500 tokens de entrada normal e 5000 tokens no total. A saída é cobrada sobre 1000 tokens; o valor 600 é mantido para diagnóstico.
A continuação da conversa consome entrada novamente
Ao gerenciar o histórico manualmente, o aplicativo envia as mensagens anteriores junto com a nova entrada. As mensagens incluídas na solicitação seguinte voltam a fazer parte do contexto de entrada. Por isso, medir apenas a última mensagem do usuário deixa de fora o consumo do histórico.
Com previous_response_id, o aplicativo envia uma referência à resposta anterior, e a API mantém o contexto encadeado. De acordo com as regras de contabilização das continuações, os tokens de entrada anteriores da sequência voltam a ser cobrados como tokens de entrada. O cache pode alterar a categoria tarifária de parte dessa entrada; consulte cached_tokens em cada resposta para verificar se houve acerto no cache.
Como verificar o resultado da otimização
- Guarde uma amostra de referência. Compare tarefas iguais, com o mesmo modelo, critério de sucesso e comprimentos de diálogo semelhantes.
- Registre cada chamada. Anote os identificadores da resposta e da tarefa, o modelo, as configurações de raciocínio, o status, a latência e o
usagecompleto. Guarde a versão do prompt e da configuração tarifária. - Inclua todas as chamadas e as respostas recebidas em novas tentativas. A métrica principal é o custo da tarefa concluída com sucesso.
- Separe os motivos das alterações. Acompanhe a entrada normal, a leitura e a gravação no cache, a saída e a proporção de raciocínio. Para calcular a proporção agregada de cache, divida a soma de
Cpela soma deI. - Verifique a qualidade e a cauda da distribuição. Além do custo médio, compare o p95, o número de tentativas e a porcentagem de tarefas concluídas com sucesso.
O parâmetro max_output_tokens limita a geração junto com o raciocínio. Quando o limite é atingido, a resposta pode receber o status incomplete, inclusive em casos sem texto visível, mas com consumo de tokens. Leve essas respostas em conta ao verificar a economia: a otimização atinge o objetivo quando tarefas comparáveis são concluídas com sucesso a um custo total menor.