프롬프트를 줄인 뒤에는 각 응답의 usage와 작업 전체 비용을 확인하세요. 응답이 짧아도 추론에 상당한 토큰이 들 수 있고, 대화를 이어 가면 기록이 다시 집계될 수 있습니다. 예산을 관리하려면 토큰 사용량, 요금 범주, 결과를 얻는 데 필요한 호출 횟수를 구분하세요.

네 가지 카운터와 포함 관계
OpenAI는 usage 객체 예시에서 입력, 출력 및 두 카운터의 세부 정보를 보여 줍니다. 다음과 같이 해석하세요.
input_tokens— 대화 이어 가기에 사용되는 컨텍스트를 포함한, 해당 호출의 전체 입력 토큰 수입니다.input_tokens_details.cached_tokens— 캐시에서 처리된 입력의 일부입니다. 이 값은 이미input_tokens에 포함되어 있습니다.output_tokens— 추론 토큰을 포함한 전체 생성 토큰 수입니다.output_tokens_details.reasoning_tokens— 추론에 사용된 출력 토큰의 일부입니다.
추론 토큰은 이미 output_tokens에 포함되어 있으므로 출력에 두 번 더하면 안 됩니다. OpenAI는 추론 토큰에 출력 토큰 요금을 적용합니다. 마찬가지로 cached_tokens를 입력에 더하면 같은 요청 일부를 중복 집계하게 됩니다. 전체 토큰 수에는 total_tokens 또는 input_tokens + output_tokens를 사용하세요.
비용: 입력을 요금 범주별로 나누기
최신 요금 페이지에는 일반 입력, 캐시 입력, 캐시 쓰기, 출력이 별도로 표시되어 있습니다. 실제 모델, 처리 모드, 적용되는 컨텍스트 길이에 맞는 요금을 선택하세요. 정확한 값은 버전 관리되는 계산 설정에 저장하세요.
현재 캐싱 문서에서 주목할 점은 GPT-5.6 및 이후 모델의 경우 input_tokens_details.cache_write_tokens가 집계된다는 것입니다. 사용 중인 스키마에서 캐시 쓰기에 별도 요금을 부과한다면, 해당 범주를 일반 입력에서 빼고 별도 요금을 적용하세요.
I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens
ordinary_input = I - C - W
cost = ((I - C - W) * P_input
+ C * P_cached
+ W * P_write
+ O * P_output) / 1_000_000
여기서 가격은 토큰 100만 개당 요금입니다. 캐시 쓰기가 별도 범주로 없는 스키마에서는 W = 0으로 설정하세요. 이 계산식은 나열된 토큰 범주를 반영합니다. 유료 도구는 해당 요금 조건에 따라 별도 항목으로 추가하세요.
가상의 예: 입력 4000, 캐시 입력 3000, 캐시 쓰기 500, 출력 1000이며, 이 중 추론 토큰은 600입니다. 일반 입력 토큰은 500이고 총 토큰 수는 5000입니다. 출력 요금은 1000개에 적용하며, 600이라는 값은 진단 목적으로 보존합니다.
대화를 이어 가면 입력이 다시 발생합니다
기록을 직접 관리하는 경우 애플리케이션은 새 입력과 함께 이전 메시지를 전달합니다. 다음 요청에 포함된 메시지는 다시 입력 컨텍스트가 됩니다. 따라서 마지막 사용자 메시지만 측정하면 대화 기록에 든 비용을 놓치게 됩니다.
previous_response_id를 사용하면 애플리케이션은 이전 응답을 가리키는 ID를 전달하고 API가 컨텍스트를 연결합니다. 대화 이어 가기의 집계 규칙에 따르면 체인의 이전 입력 토큰도 입력 토큰으로 다시 요금이 부과됩니다. 캐시에 따라 해당 입력 일부의 요금 범주가 달라질 수 있으므로, 실제 캐시 적중 여부는 각 응답의 cached_tokens에서 확인하세요.
최적화 결과 확인 방법
- 기준 데이터를 저장하세요. 동일한 작업, 모델, 성공 기준, 길이가 비슷한 대화를 비교하세요.
- 모든 호출을 기록하세요. 응답 및 작업 ID, 모델, 추론 설정, 상태, 지연 시간, 전체
usage를 저장하세요. 프롬프트 버전과 요금 설정 버전도 보관하세요. - 작업별 비용을 합산하세요. 작업에 포함된 모든 호출과 재시도에서 받은 응답을 포함하세요. 핵심 지표는 성공적으로 완료된 작업의 비용입니다.
- 변화의 원인을 구분하세요. 일반 입력, 캐시 읽기와 쓰기, 출력, 추론 비중을 추적하세요. 전체 캐시 비중은 모든
C의 합을 모든I의 합으로 나누어 계산합니다. - 품질과 분포의 꼬리를 확인하세요. 평균 비용과 함께 p95, 시도 횟수, 작업 성공률을 비교하세요.
max_output_tokens 매개변수는 추론을 포함한 생성을 제한합니다. 한도에 도달하면 응답 상태가 incomplete가 될 수 있습니다. 눈에 보이는 텍스트는 없지만 토큰이 소모되는 경우도 포함됩니다. 절감 효과를 확인할 때 이런 응답도 고려하세요. 비교 가능한 작업이 더 적은 총비용으로 성공적으로 완료될 때 최적화가 목표를 달성한 것입니다.