error code: 524A timeout occurredThe request timed out after N seconds with no response bodyKluczowy szczegół: zegar mierzy czas do pierwszego bajtu, a nie łączny czas trwania. Odpowiedź ze streamingiem zaczyna wysyłać dane niemal od razu, więc może trwać wiele minut i nigdy nie trafić w limit. Zapytanie bez streamingu z długą fazą rozumowania nie wysyła nic, dopóki całkiem nie skończy – i właśnie takie zostaje ucięte.
Dlatego błąd wygląda na losowy. Ten sam prompt przechodzi, gdy akurat szybko się kończy, i pada, gdy model dłużej myśli; koreluje to z głębokością rozumowania, a nie z czymkolwiek, co zmieniłeś.
Uruchom to samo zapytanie ze streamingiem i bez. Jeśli jedno przeżywa, a drugie nie, znalazłeś przyczynę:
# non-streaming — vulnerable to the time-to-first-byte limit
curl -sS -X POST 'YOUR_BASE_URL/chat/completions' \
-H 'Authorization: Bearer YOUR_KEY' \
-H 'Content-Type: application/json' \
-d '{"model":"MODEL","stream":false,"messages":[...]}'
# streaming — first byte arrives in well under a second
-d '{"model":"MODEL","stream":true,"messages":[...]}'
Streaming daje też dużo lepszy sposób zawodzenia: jeśli coś pójdzie nie tak w połowie, masz przynajmniej częściową odpowiedź, zamiast tracić całe wywołanie.
https://api.apiclan.us/v1 bez takiego limitu.Ostatnio sprawdzono 2026-10-01. Napisane na podstawie problemów zdiagnozowanych na działającej bramce zgodnej z OpenAI, a nie zebrane z innych stron.