error code: 524A timeout occurredThe request timed out after N seconds with no response bodyDas wichtige Detail: Die Uhr misst die Zeit bis zum ersten Byte, nicht die Gesamtdauer. Eine Streaming-Antwort sendet fast sofort, kann also viele Minuten laufen, ohne das Limit je zu erreichen. Eine Anfrage ohne Streaming mit langer Denkphase sendet gar nichts, bis sie komplett fertig ist – und genau diese Form wird abgeschnitten.
Deshalb wirkt der Fehler zufällig. Derselbe Prompt klappt, wenn er zufällig schnell fertig wird, und scheitert, wenn das Modell länger nachdenkt. Er hängt mit der Denktiefe zusammen, nicht mit irgendetwas, das Sie geändert haben.
Führen Sie dieselbe Anfrage mit und ohne Streaming aus. Überlebt die eine und die andere nicht, haben Sie es gefunden:
# non-streaming — vulnerable to the time-to-first-byte limit
curl -sS -X POST 'YOUR_BASE_URL/chat/completions' \
-H 'Authorization: Bearer YOUR_KEY' \
-H 'Content-Type: application/json' \
-d '{"model":"MODEL","stream":false,"messages":[...]}'
# streaming — first byte arrives in well under a second
-d '{"model":"MODEL","stream":true,"messages":[...]}'
Streaming bringt außerdem ein viel besseres Fehlerverhalten: Geht unterwegs etwas schief, haben Sie wenigstens die bisherige Ausgabe, statt den ganzen Aufruf zu verlieren.
https://api.apiclan.us/v1 ohne dieses Limit.Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.