Start → Hilfe
context_length_exceeded – was wirklich zum Limit zählt
Input und angeforderter Output müssen zusammen ins Fenster passen. Ihr gesamter Nachrichtenverlauf zählt bei jedem Aufruf, und max_tokens wird vorab reserviert – eine Anfrage kann also an der Reservierung scheitern, obwohl der Prompt allein passen würde.
Was Sie sehen
This model's maximum context length is N tokens, however you requested M tokenscontext_length_exceededinvalid_request_error: prompt is too longThe call worked yesterday and fails today with the same code
Warum das passiert
Chat-APIs sind zustandslos. Jeder Durchlauf schickt den ganzen Verlauf erneut, eine Unterhaltung, die seit einer Stunde läuft, sendet also nicht eine Nachricht, sondern alle. Deshalb scheitert Code, der morgens funktionierte, nachmittags, ohne dass sich etwas geändert hat.
max_tokens ist eine Reservierung, keine Obergrenze dessen, was Sie bekommen. 8.000 Output-Tokens anzufordern zieht 8.000 vom Budget ab, bevor der Prompt überhaupt gemessen wird.
System-Prompts, Tool-Definitionen und Few-Shot-Beispiele sieht man im Diff meist nicht, in der Zählung aber sehr wohl. Ein großes Tool-Schema kann bei jedem einzelnen Aufruf Tausende Tokens ausmachen.
So beheben Sie es
- max_tokens auf das senken, was Sie wirklich brauchenDie schnellste Lösung und die, die man gern überspringt. Sind Antworten zwei Absätze lang, bringt eine Reservierung von 8.000 Tokens nichts und kostet Sie den Platz.
- Den Verlauf kürzen, nicht die aktuelle NachrichtBehalten Sie den System-Prompt, die letzten paar Durchläufe und eine kurze Zusammenfassung des Vorherigen. Die ältesten Durchläufe zu streichen bringt weit mehr, als die aktuelle Frage zu kürzen.
- Tool-Definitionen mitzählenSerialisieren Sie Ihr Tool-Schema und messen Sie es. Ungenutzte Tools zu streichen schafft oft mehr Platz als alles, was Sie an der Unterhaltung ändern.
Kontextfenster unterscheiden sich je nach Modell, und jede Modellseite bei APICLAN nennt das Fenster neben dem Preis. Den Verlauf zu kürzen senkt auch direkt die Rechnung, denn Input-Tokens werden bei jedem Durchlauf berechnet.
Verwandte Themen
Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden
OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.