error code: 524A timeout occurredThe request timed out after N seconds with no response bodyLe détail important est que le chronomètre mesure le temps jusqu'au premier octet, pas la durée totale. Une réponse en streaming commence à émettre presque immédiatement, elle peut donc durer de longues minutes sans jamais atteindre la limite. Une requête sans streaming avec une longue phase de raisonnement n'envoie rien avant d'avoir complètement terminé, et c'est exactement ce profil qui se fait couper.
C'est pourquoi la panne semble aléatoire. Le même prompt réussit quand il se termine vite et échoue quand le modèle réfléchit plus longtemps, et cela dépend de la profondeur du raisonnement plutôt que de quoi que ce soit que vous ayez changé.
Exécutez la même requête avec et sans streaming. Si l'une survit et pas l'autre, vous avez trouvé :
# non-streaming — vulnerable to the time-to-first-byte limit
curl -sS -X POST 'YOUR_BASE_URL/chat/completions' \
-H 'Authorization: Bearer YOUR_KEY' \
-H 'Content-Type: application/json' \
-d '{"model":"MODEL","stream":false,"messages":[...]}'
# streaming — first byte arrives in well under a second
-d '{"model":"MODEL","stream":true,"messages":[...]}'
Le streaming vous offre aussi un bien meilleur mode d'échec : si quelque chose casse en cours de route, vous gardez la sortie partielle au lieu de perdre tout l'appel.
https://api.apiclan.us/v1 sans cette limite.Dernière vérification le 2026-10-01. Rédigé à partir de problèmes diagnostiqués sur une passerelle compatible OpenAI en production, pas compilé à partir d'autres sites.