Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceListe fiyatları girdi ve çıktı için milyon token başına verilir, bu da tek bir ortalamaya davet eder. Gerçek faturalar dört farklı fiyatın toplamıdır: girdi, çıktı, önbellek okuma ve önbellek yazma. Karışım değiştiğinde, token toplamı pek değişmeden fatura değişir.
İnsanları şaşırtan kısım önbellek yönüdür. Önbellekten okumak ucuzdur – önbelleğin var olma sebebi budur. Önbelleğe yazmak ise token'ları sıfırdan göndermekten pahalıdır. Yani her turda bağlamının başını değiştiren bir döngü önbelleği geçersiz kılar ve her seferinde fazlasını öder; sabit bir ön eke ekleme yapan döngü ise indirimi alır.
Kendi faturalama kayıtlarımızdaki rakamlar ölçeği somutlaştırıyor: Önbellekli isteklerden alınan bir örnekte normal girdi ve çıktı birlikte işlenen tüm token'ların yaklaşık %3'üydü, gerisini önbellek yazmaları ve okumaları oluşturuyordu. Otuz isteklik bir oturumda yalnızca önbellek yazmaları ücretin %63'ünü oluşturdu – hiç çıktı üretmeyen token'lar.
Sağlayıcınızın kullanım kaydından gerçek bir isteği alın ve dört sayacı ayırın:
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Her sayacın ücretin ne kadarını oluşturduğunu hesaplayın. Önbellek yazmaları öndeyse, kaldıraç daha ucuz bir model değil, istem kararlılığıdır.
Son kontrol: 2026-10-01. Canlı bir OpenAI uyumlu ağ geçidinde teşhis edilen sorunlardan yazılmıştır, başka sitelerden derlenmemiştir.