error code: 524Requests consistently fail at 100-101 seconds, never at 90 or 120The same request succeeds when sent directly to the origin IPA streaming response stops mid-sentence with no error in the server logread ECONNRESET / IncompleteRead after a long pauseDas Verräterische ist die Genauigkeit. Netzwerkprobleme und Timeouts am Ursprungsserver streuen – einmal nach 40 Sekunden, dann nach 180. Ein Proxy-Limit greift jedes Mal bei derselben Zahl. Häufen sich Ihre Fehler bei 100–101 Sekunden, hören Sie auf, Ihren eigenen Stack zu durchsuchen.
Gemessen wird bis zum ersten Byte des Response-Bodys – deshalb verhält sich Streaming so anders. Mit stream: true kommt das erste Token meist nach ein, zwei Sekunden, und die Uhr kommt nie in die Nähe. Ohne Streaming wartet der Proxy auf die ganze Completion – und eine lange Reasoning-Kette oder ein 4K-Bild überschreitet 100 Sekunden leicht.
Das erklärt auch ein verwirrendes Symptom: Auf dem Server sieht die Anfrage erfolgreich aus. Der Upstream war fertig, der Ursprungsserver hat 200 geloggt, die Tokens wurden abgerechnet. Nur die Strecke zwischen Proxy und Client wurde gekappt. Im Nutzungslog Ihres Anbieters sehen Sie eine abgeschlossene, abgerechnete Anfrage, die Ihr Client nie erhalten hat.
Messen Sie, wann der Fehler auftritt. Die genaue Zahl ist die Diagnose:
time curl -s -o /dev/null -w '%{http_code} %{time_total}s\n' \
'YOUR_BASE_URL/chat/completions' \
-H 'Authorization: Bearer YOUR_KEY' \
-H 'Content-Type: application/json' \
-d '{"model":"YOUR_MODEL","messages":[{"role":"user","content":"Write a 3000 word essay."}]}'
Etwa 100s mit einem 524 bestätigt es. Führen Sie dieselbe Anfrage mit "stream": true aus – läuft sie durch, war das Limit das einzige Problem.
stream: true im Request-Body; jedes große SDK unterstützt es. Das erste Token kommt in Sekunden, das 100-Sekunden-Fenster öffnet sich nie.max_tokens-Wert, den das Modell innerhalb des Fensters schafft, macht aus einem unsichtbaren Abbruch einen vorhersehbaren Stopp. Eine lange Generierung auf mehrere Aufrufe zu verteilen bewirkt dasselbe und lässt sich leichter wiederholen.https://api.apiclan.us/v1 — dieser Endpunkt liegt nicht hinter dem 100-Sekunden-Limit, lange Completions ohne Streaming laufen also durch. Der Hauptendpunkt https://apiclan.us/v1 eignet sich für Streaming und alles, was schnell antwortet.Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.