error code: 524A timeout occurredThe request timed out after N seconds with no response bodyIl dettaglio importante è che il cronometro misura il tempo fino al primo byte, non la durata totale. Una risposta in streaming inizia a emettere quasi subito, quindi può durare molti minuti senza mai toccare il limite. Una richiesta senza streaming con una lunga fase di ragionamento non invia nulla finché non ha finito del tutto, ed è proprio quella forma a essere tagliata.
Ecco perché il problema sembra casuale. Lo stesso prompt riesce quando finisce in fretta e fallisce quando il modello ragiona più a lungo, e la cosa dipende dalla profondità del ragionamento, non da qualcosa che hai cambiato.
Esegui la stessa richiesta con lo streaming attivo e disattivo. Se una sopravvive e l'altra no, l'hai trovato:
# non-streaming — vulnerable to the time-to-first-byte limit
curl -sS -X POST 'YOUR_BASE_URL/chat/completions' \
-H 'Authorization: Bearer YOUR_KEY' \
-H 'Content-Type: application/json' \
-d '{"model":"MODEL","stream":false,"messages":[...]}'
# streaming — first byte arrives in well under a second
-d '{"model":"MODEL","stream":true,"messages":[...]}'
Lo streaming ti dà anche un modo di fallire molto migliore: se qualcosa va storto a metà, conservi l'output parziale invece di perdere l'intera chiamata.
https://api.apiclan.us/v1 senza questo limite.Ultima verifica: 2026-10-01. Scritto a partire da problemi diagnosticati su un gateway compatibile con OpenAI in produzione, non raccolto da altri siti.