Home → Assistenza

context_length_exceeded: cosa conta davvero per il limite

Input e output richiesto devono stare insieme nella finestra. L'intera cronologia dei messaggi conta a ogni chiamata, e max_tokens viene riservato in anticipo: una richiesta può quindi fallire per la prenotazione anche quando il prompt da solo ci starebbe.

Cosa vedi

Perché succede

Le API di chat sono senza stato. Ogni turno reinvia tutta la cronologia, quindi una conversazione che dura da un'ora non invia un messaggio, li invia tutti. Ecco perché il codice che la mattina funzionava inizia a fallire il pomeriggio senza che sia cambiato nulla.

max_tokens è una prenotazione, non un tetto a ciò che ricevi. Chiedere 8.000 token di output ne toglie 8.000 dal budget prima ancora che il prompt venga misurato.

Prompt di sistema, definizioni degli strumenti ed esempi few-shot di solito non si notano nel diff, ma sono ben presenti nel conteggio. Uno schema di strumenti grande può pesare migliaia di token in ogni singola chiamata.

Come risolvere

  1. Abbassa max_tokens a ciò che ti serve davveroÈ la soluzione più rapida e quella che tutti saltano. Se le risposte sono di due paragrafi, riservare 8.000 token non porta nulla e ti toglie spazio.
  2. Accorcia la cronologia, non il messaggio attualeTieni il prompt di sistema, gli ultimi turni e un breve riassunto di ciò che è venuto prima. Eliminare i turni più vecchi recupera molto più spazio che accorciare ciò che chiedi adesso.
  3. Conta le definizioni degli strumentiSerializza lo schema degli strumenti e misuralo. Togliere gli strumenti inutilizzati spesso libera più spazio di qualsiasi intervento sulla conversazione.
Le finestre di contesto variano da modello a modello, e la pagina di ogni modello su APICLAN indica la finestra accanto al prezzo. Accorciare la cronologia riduce anche direttamente la fattura, perché i token di input vengono addebitati a ogni turno.

Articoli correlati

Unexpected token '<' quando chiami un'API compatibile con OpenAI401 invalid API key: quando la chiave sembra giusta ma continua a fallire

Ultima verifica: 2026-10-01. Scritto a partire da problemi diagnosticati su un gateway compatibile con OpenAI in produzione, non raccolto da altri siti.