Home → Assistenza

La fattura è più alta di quanto giustifichi il numero di token

Moltiplica per la tariffa giusta. L'output costa di solito circa cinque volte l'input. Le letture dalla cache sono una piccola frazione della tariffa di input; le scritture in cache costano di più. Un carico che riscrive continuamente il proprio contesto paga la tariffa di scrittura ancora e ancora, producendo pochissimo output visibile.

Cosa vedi

Perché succede

I prezzi di listino sono indicati per milione di token di input e di output, il che invita a ragionare su un'unica media. Le fatture reali sono la somma di quattro tariffe diverse: input, output, lettura dalla cache e scrittura in cache. Quando la composizione cambia, cambia la fattura, anche se il totale dei token si muove poco.

A sorprendere è la direzione della cache. Leggere dalla cache costa poco: è la ragione per cui esiste. Scriverci costa più che inviare di nuovo i token. Quindi un ciclo che modifica l'inizio del contesto a ogni turno invalida la cache e paga il sovrapprezzo ogni volta, mentre un ciclo che aggiunge a un prefisso stabile ottiene lo sconto.

I numeri della nostra fatturazione rendono concreta la scala: su un campione di richieste con cache, input e output ordinari insieme erano circa il 3% di tutti i token elaborati, mentre il resto erano scritture e letture di cache. In una sessione di trenta richieste, le sole scritture in cache rappresentavano il 63% dell'addebito: token che non hanno prodotto alcun output.

Verifica se la causa è questa

Prendi una richiesta reale dal log di utilizzo del tuo provider e separa i quattro contatori:

# Any provider that reports usage will expose these four fields.
# What to compare:
#   input_tokens           charged at the input rate
#   output_tokens          usually ~5x the input rate
#   cache_read_tokens      a fraction of the input rate
#   cache_creation_tokens  charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.

Calcola quale quota dell'addebito spetta a ciascun contatore. Se dominano le scritture in cache, la leva è la stabilità del prompt, non un modello più economico.

Come risolvere

  1. Stabilizza l'inizio del promptTutto ciò che cambia a ogni turno (un timestamp, un elenco di strumenti rimescolato, un contatore) invalida la cache da quel punto in poi. Sposta i contenuti variabili alla fine e il prefisso resterà memorizzabile in cache.
  2. Guarda la lunghezza dell'output prima di cambiare modelloL'output costa diverse volte l'input. Una modifica al prompt che accorcia le risposte di un terzo spesso fa risparmiare più del passaggio a una fascia più economica, e non richiede una nuova validazione.
  3. Indirizza i passaggi semplici a un modello economicoClassificazione, estrazione e instradamento raramente richiedono un modello di punta. Inviare al modello costoso solo il passaggio finale di ragionamento di solito riduce il costo complessivo di oltre la metà.
  4. Confronta per milione di output, non per milione di tokenUna cifra media per token nasconde ciò che davvero determina la fattura. Due modelli con medie simili possono differire molto una volta applicato il rapporto input/output del tuo carico.
APICLAN dettaglia tutti e quattro i contatori per ogni chiamata, così una fattura sorprendente può essere ricondotta a una richiesta specifica invece di essere stimata. Le tariffe per modello sono nelle pagine dei prezzi.

Articoli correlati

Unexpected token '<' quando chiami un'API compatibile con OpenAI401 invalid API key: quando la chiave sembra giusta ma continua a fallire

Ultima verifica: 2026-10-01. Scritto a partire da problemi diagnosticati su un gateway compatibile con OpenAI in produzione, non raccolto da altri siti.