İstemi kısalttıktan sonra tasarrufu her yanıtın usage değerine ve görevin toplam maliyetine bakarak kontrol edin. Kısa bir yanıt, akıl yürütme için kayda değer miktarda token harcanmış olabileceği gerçeğini değiştirmez; konuşmanın devamında ise geçmiş yeniden hesaba katılabilir. Bütçeyi izlemek için token hacmini, tarife kategorilerini ve sonuca ulaşmak için gereken çağrı sayısını ayrı ayrı değerlendirin.

Dört sayaç ve aralarındaki ilişki
OpenAI, örnek usage nesnesinde girdiyi, çıktıyı ve her iki sayacın ayrıntılarını gösteriyor. Bunları şöyle okuyun:
input_tokens— konuşmayı sürdürmek için kullanılan bağlam da dahil olmak üzere, bu çağrının toplam girdi token’ı.input_tokens_details.cached_tokens— önbellekten karşılanan girdinin bir kısmı. Bu değer zateninput_tokensiçinde yer alır.output_tokens— akıl yürütme de dahil olmak üzere üretilen toplam token sayısı.output_tokens_details.reasoning_tokens— akıl yürütme için harcanan çıktı token’larının bir kısmı.
Akıl yürütme token’ları zaten output_tokens değerine dahildir; bunları çıktıya ikinci kez eklemeyin. OpenAI bunları çıktı token’ı tarifesiyle ücretlendirir. Benzer şekilde, cached_tokens değerini girdiye eklemek, isteğin aynı kısmını iki kez sayar. Toplam hacim için total_tokens değerini veya input_tokens + output_tokens toplamını kullanın.
Maliyet: girdiyi kategorilere ayırın
Güncel fiyatlandırma sayfasında standart girdi, önbelleğe alınmış girdi, önbelleğe yazma ve çıktı ayrı ayrı listelenir. Gerçekte kullanılan model, işleme modu ve geçerli bağlam uzunluğu için doğru ücretleri seçin. Kesin değerleri sürüm denetimine tabi bir hesaplama yapılandırmasında saklayın.
Güncel önbellekleme belgelerindeki önemli bir ayrıntı: GPT-5.6 ve daha yeni modeller için input_tokens_details.cache_write_tokens değeri hesaba katılır. Şemanızda önbelleğe yazma ayrıca ücretlendiriliyorsa bu kategoriyi standart girdiden çıkarın ve kendi ücretini uygulayın.
I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens
ordinary_input = I - C - W
cost = ((I - C - W) * P_input
+ C * P_cached
+ W * P_write
+ O * P_output) / 1_000_000
Burada fiyatlar milyon token başına verilmiştir; ayrı bir yazma kategorisi bulunmayan şemalarda W = 0 kullanın. Formül, listelenen token kategorilerini kapsar. Ücretli araçları fiyatlandırma koşullarına göre ayrı satırlar halinde ekleyin.
Varsayımsal örnek: girdi 4000, önbelleğe alınmış girdi 3000, önbelleğe yazma 500, çıktı 1000; bunların 600’ü akıl yürütme token’ı olsun. Böylece 500 standart girdi token’ı ve toplam 5000 token elde edilir. Çıktı 1000 token üzerinden ücretlendirilir; 600 değeri tanılama amacıyla saklanır.
Konuşmayı sürdürmek girdiyi yeniden harcatır
Geçmişi elle yöneten uygulama, yeni girdiyle birlikte önceki mesajları da iletir. Sonraki isteğe dahil edilen mesajlar yeniden girdi bağlamına dönüşür. Bu nedenle yalnızca kullanıcının son iletisini ölçmek, geçmişin maliyetini gözden kaçırır.
previous_response_id kullanıldığında uygulama önceki yanıta bir referans iletir ve API bağlamı ilişkilendirir. Devam eden konuşmaların ücretlendirme kurallarına göre zincirdeki önceki girdi token’ları yeniden girdi olarak ücretlendirilir. Önbellek, bu girdinin bir kısmının tarife kategorisini değiştirebilir; gerçek önbellek isabetini her yanıtın cached_tokens değerinden kontrol edin.
Optimizasyonun sonucunu nasıl doğrularsınız?
- Başlangıç ölçümünü kaydedin. Aynı görevleri, modeli, başarı ölçütünü ve karşılaştırılabilir konuşma uzunluklarını karşılaştırın.
- Her çağrıyı günlüğe kaydedin. Yanıt ve görev kimliklerini, modeli, akıl yürütme ayarlarını, durumu, gecikmeyi ve tam
usagedeğerini kaydedin. İstem sürümünü ve tarife yapılandırmasını saklayın. - Görev maliyetlerini toplayın. Göreve ait tüm çağrıları ve yeniden denemelerde alınan yanıtları dahil edin. Temel metrik, başarıyla tamamlanan görev başına maliyettir.
- Değişimin nedenlerini ayırın. Standart girdiyi, önbellekten okumayı ve önbelleğe yazmayı, çıktıyı ve akıl yürütme oranını izleyin. Toplam önbellek oranını hesaplamak için tüm
Cdeğerlerinin toplamını tümIdeğerlerinin toplamına bölün. - Kaliteyi ve dağılımın uç değerlerini kontrol edin. Ortalama maliyetin yanı sıra p95 değerini, deneme sayısını ve başarılı görev yüzdesini de karşılaştırın.
max_output_tokens parametresi, akıl yürütme dahil üretimi sınırlar. Sınır dolduğunda yanıt incomplete durumunu alabilir; buna görünür metin içermeyen, ancak token harcamış yanıtlar da dahildir. Tasarrufu değerlendirirken bu yanıtları da hesaba katın: optimizasyon, karşılaştırılabilir görevler daha düşük toplam maliyetle başarıyla tamamlandığında amacına ulaşmıştır.