Start → Hilfe

524-Timeout bei langen API-Anfragen

Ein 524 wird von einem Reverse Proxy oder CDN vor der API erzeugt, nicht vom Modell. Er löst aus, wenn der Ursprungsserver das erste Byte der Antwort nicht innerhalb eines festen Zeitfensters geschickt hat – häufig 100 Sekunden.

Was Sie sehen

Warum das passiert

Das wichtige Detail: Die Uhr misst die Zeit bis zum ersten Byte, nicht die Gesamtdauer. Eine Streaming-Antwort sendet fast sofort, kann also viele Minuten laufen, ohne das Limit je zu erreichen. Eine Anfrage ohne Streaming mit langer Denkphase sendet gar nichts, bis sie komplett fertig ist – und genau diese Form wird abgeschnitten.

Deshalb wirkt der Fehler zufällig. Derselbe Prompt klappt, wenn er zufällig schnell fertig wird, und scheitert, wenn das Modell länger nachdenkt. Er hängt mit der Denktiefe zusammen, nicht mit irgendetwas, das Sie geändert haben.

Prüfen, ob es daran liegt

Führen Sie dieselbe Anfrage mit und ohne Streaming aus. Überlebt die eine und die andere nicht, haben Sie es gefunden:

# non-streaming — vulnerable to the time-to-first-byte limit
curl -sS -X POST 'YOUR_BASE_URL/chat/completions' \
  -H 'Authorization: Bearer YOUR_KEY' \
  -H 'Content-Type: application/json' \
  -d '{"model":"MODEL","stream":false,"messages":[...]}'

# streaming — first byte arrives in well under a second
  -d '{"model":"MODEL","stream":true,"messages":[...]}'

Streaming bringt außerdem ein viel besseres Fehlerverhalten: Geht unterwegs etwas schief, haben Sie wenigstens die bisherige Ausgabe, statt den ganzen Aufruf zu verlieren.

So beheben Sie es

  1. Streaming einschaltenDas löst das Problem für fast jede Anwendung vollständig und ist eine einzeilige Änderung. Die meisten SDKs und Agent-Tools streamen ohnehin standardmäßig.
  2. Einen direkten Endpunkt nutzen, falls der Anbieter einen hatManche Anbieter veröffentlichen einen API-Host, der ihr CDN genau wegen dieses Limits umgeht. Wenn lange Aufrufe ohne Streaming unvermeidbar sind, ist er genau dafür da.
  3. Die Arbeit aufteilenBraucht ein einzelner Aufruf wirklich Minuten an Überlegung, bevor er etwas liefert, ist es meist günstiger und zuverlässiger, ihn in Schritte mit Zwischenständen zu zerlegen.
Bei APICLAN werden Streaming-Anfragen nie gepuffert und sind daher nicht betroffen. Für lange Aufrufe ohne Streaming gibt es einen direkten Endpunkt unter https://api.apiclan.us/v1 ohne dieses Limit.

Verwandte Themen

Unexpected token '<' beim Aufruf einer OpenAI-kompatiblen API401 invalid API key – wenn der Schlüssel richtig aussieht und trotzdem scheitert

Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.