Inicio → Ayuda

Claude Code: API Error 400 prompt is too long

Todo lo que la sesión ha visto se reenvía en cada turno. Unas pocas lecturas de archivos grandes o una única salida de comando muy larga pueden llevar la conversación más allá de la ventana del modelo, y a partir de ahí nada de lo que escribas es lo bastante pequeño para caber.

Lo que ves

Por qué ocurre

Las sesiones de agente son acumulativas por diseño: el modelo necesita el contexto anterior para mantener la coherencia. El precio es que una sola lectura de un archivo de 40.000 tokens se queda en la transcripción el resto de la sesión.

El culpable habitual es la salida de las herramientas, no tus mensajes. Un volcado de log completo, una respuesta JSON grande o un listado de directorio sin filtrar pueden ser más grandes que todo lo que has escrito en el día.

La compactación ayuda, pero no es instantánea. Una vez superado el límite, la propia petición que activaría la compactación puede ser rechazada, y por eso la sesión parece atascada.

Cómo solucionarlo

  1. Empieza una sesión nueva para una tarea nuevaEl arreglo más barato, y además reduce tu factura: los tokens de entrada se cobran en cada turno, así que una sesión inflada cuesta más por mensaje además de fallar.
  2. Lee menos, filtra másPrefiere grep y rangos de líneas concretos a leer archivos enteros, y pasa la salida larga de los comandos por head o un filtro antes de que entre en la transcripción.
  3. Revisa la base URL si empezó de repenteUn cambio repentino sin crecimiento puede significar que cambiaste a un modelo con una ventana más pequeña. Confirma qué modelo está usando realmente la sesión.
En APICLAN la misma regla se aplica a la facturación que al límite: cada turno reenvía toda la conversación, así que los tokens de entrada se acumulan. Las lecturas de caché suavizan el coste pero no la ventana: esos tokens siguen contando para ella.

Relacionado

Unexpected token '<' al llamar a una API compatible con OpenAI401 invalid API key: cuando la clave parece correcta pero sigue fallando

Revisado por última vez el 2026-10-01. Escrito a partir de problemas diagnosticados en una pasarela compatible con OpenAI en producción, no recopilado de otras webs.