Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceI prezzi di listino sono indicati per milione di token di input e di output, il che invita a ragionare su un'unica media. Le fatture reali sono la somma di quattro tariffe diverse: input, output, lettura dalla cache e scrittura in cache. Quando la composizione cambia, cambia la fattura, anche se il totale dei token si muove poco.
A sorprendere è la direzione della cache. Leggere dalla cache costa poco: è la ragione per cui esiste. Scriverci costa più che inviare di nuovo i token. Quindi un ciclo che modifica l'inizio del contesto a ogni turno invalida la cache e paga il sovrapprezzo ogni volta, mentre un ciclo che aggiunge a un prefisso stabile ottiene lo sconto.
I numeri della nostra fatturazione rendono concreta la scala: su un campione di richieste con cache, input e output ordinari insieme erano circa il 3% di tutti i token elaborati, mentre il resto erano scritture e letture di cache. In una sessione di trenta richieste, le sole scritture in cache rappresentavano il 63% dell'addebito: token che non hanno prodotto alcun output.
Prendi una richiesta reale dal log di utilizzo del tuo provider e separa i quattro contatori:
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Calcola quale quota dell'addebito spetta a ciascun contatore. Se dominano le scritture in cache, la leva è la stabilità del prompt, non un modello più economico.
Ultima verifica: 2026-10-01. Scritto a partire da problemi diagnosticati su un gateway compatibile con OpenAI in produzione, non raccolto da altri siti.