Accueil → Aide
Claude Code : API Error 400 prompt is too long
Tout ce que la session a vu est renvoyé à chaque tour. Quelques lectures de gros fichiers ou une seule sortie de commande très longue peuvent faire dépasser à la conversation la fenêtre du modèle, et à partir de là, rien de ce que vous tapez n'est assez petit pour tenir.
Ce que vous voyez
API Error: 400 {"type":"error","error":{"type":"invalid_request_error","message":"prompt is too long"}}The session worked for an hour and then every message failsFailure starts right after reading a large file or a long command outputStarting a new session fixes it immediately
Pourquoi cela arrive
Les sessions d'agent sont cumulatives par conception : le modèle a besoin du contexte antérieur pour rester cohérent. La contrepartie est qu'une seule lecture de fichier de 40 000 tokens reste dans la transcription jusqu'à la fin de la session.
Le coupable habituel est la sortie des outils plutôt que vos messages. Un dump de journal complet, une grosse réponse JSON ou un listage de répertoire non filtré peuvent dépasser tout ce que vous avez tapé de la journée.
La compaction aide, mais elle n'est pas instantanée. Une fois la limite dépassée, la requête qui déclencherait la compaction peut elle-même être refusée, ce qui explique que la session paraisse bloquée.
Comment le corriger
- Démarrez une nouvelle session pour une nouvelle tâcheLa correction la moins chère, qui réduit aussi votre facture : les tokens d'entrée sont facturés à chaque tour, donc une session gonflée coûte plus cher par message en plus d'échouer.
- Lisez moins, filtrez plusPréférez grep et des plages de lignes ciblées à la lecture de fichiers entiers, et faites passer les longues sorties de commandes par head ou un filtre avant qu'elles n'entrent dans la transcription.
- Vérifiez la base URL si cela a commencé soudainementUn changement soudain sans croissance de la session peut signifier que vous êtes passé à un modèle à la fenêtre plus petite. Vérifiez quel modèle la session utilise réellement.
Sur APICLAN, la même règle vaut pour la facturation que pour la limite : chaque tour renvoie toute la conversation, donc les tokens d'entrée s'accumulent. Les lectures de cache adoucissent le coût mais pas la fenêtre : ces tokens y comptent toujours.
Voir aussi
Dernière vérification le 2026-10-01. Rédigé à partir de problèmes diagnostiqués sur une passerelle
compatible OpenAI en production, pas compilé à partir d'autres sites.