Accueil → Aide
context_length_exceeded : ce qui compte vraiment dans la limite
L'entrée et la sortie demandée doivent tenir ensemble dans la fenêtre. Tout votre historique de messages compte à chaque appel, et max_tokens est réservé d'avance : une requête peut donc échouer sur la réservation alors que le prompt seul tiendrait.
Ce que vous voyez
This model's maximum context length is N tokens, however you requested M tokenscontext_length_exceededinvalid_request_error: prompt is too longThe call worked yesterday and fails today with the same code
Pourquoi cela arrive
Les API de chat sont sans état. Chaque tour renvoie tout l'historique, donc une conversation qui dure depuis une heure n'envoie pas un message, elle les envoie tous. C'est pourquoi un code qui fonctionnait le matin se met à échouer l'après-midi sans que rien n'ait changé.
max_tokens est une réservation, pas un plafond de ce que vous recevez. Demander 8 000 tokens de sortie retire 8 000 du budget avant même que le prompt ne soit mesuré.
Les prompts système, les définitions d'outils et les exemples few-shot sont généralement invisibles dans le diff, mais bien présents dans le décompte. Un gros schéma d'outils peut représenter des milliers de tokens à chaque appel.
Comment le corriger
- Abaissez max_tokens à ce dont vous avez vraiment besoinC'est la correction la plus rapide, et celle qu'on oublie. Si les réponses font deux paragraphes, réserver 8 000 tokens n'apporte rien et vous coûte de la place.
- Réduisez l'historique, pas le message actuelGardez le prompt système, les derniers tours et un court résumé de ce qui précède. Supprimer les tours les plus anciens libère bien plus que raccourcir ce que vous demandez maintenant.
- Comptez les définitions d'outilsSérialisez votre schéma d'outils et mesurez-le. Retirer les outils inutilisés libère souvent plus de place que tout ce que vous pourriez faire sur la conversation.
Les fenêtres de contexte varient selon les modèles, et la page de chaque modèle sur APICLAN indique la fenêtre à côté du prix. Réduire l'historique diminue aussi directement la facture, puisque les tokens d'entrée sont facturés à chaque tour.
Voir aussi
Dernière vérification le 2026-10-01. Rédigé à partir de problèmes diagnostiqués sur une passerelle
compatible OpenAI en production, pas compilé à partir d'autres sites.