Start → Hilfe

context_length_exceeded – was wirklich zum Limit zählt

Input und angeforderter Output müssen zusammen ins Fenster passen. Ihr gesamter Nachrichtenverlauf zählt bei jedem Aufruf, und max_tokens wird vorab reserviert – eine Anfrage kann also an der Reservierung scheitern, obwohl der Prompt allein passen würde.

Was Sie sehen

Warum das passiert

Chat-APIs sind zustandslos. Jeder Durchlauf schickt den ganzen Verlauf erneut, eine Unterhaltung, die seit einer Stunde läuft, sendet also nicht eine Nachricht, sondern alle. Deshalb scheitert Code, der morgens funktionierte, nachmittags, ohne dass sich etwas geändert hat.

max_tokens ist eine Reservierung, keine Obergrenze dessen, was Sie bekommen. 8.000 Output-Tokens anzufordern zieht 8.000 vom Budget ab, bevor der Prompt überhaupt gemessen wird.

System-Prompts, Tool-Definitionen und Few-Shot-Beispiele sieht man im Diff meist nicht, in der Zählung aber sehr wohl. Ein großes Tool-Schema kann bei jedem einzelnen Aufruf Tausende Tokens ausmachen.

So beheben Sie es

  1. max_tokens auf das senken, was Sie wirklich brauchenDie schnellste Lösung und die, die man gern überspringt. Sind Antworten zwei Absätze lang, bringt eine Reservierung von 8.000 Tokens nichts und kostet Sie den Platz.
  2. Den Verlauf kürzen, nicht die aktuelle NachrichtBehalten Sie den System-Prompt, die letzten paar Durchläufe und eine kurze Zusammenfassung des Vorherigen. Die ältesten Durchläufe zu streichen bringt weit mehr, als die aktuelle Frage zu kürzen.
  3. Tool-Definitionen mitzählenSerialisieren Sie Ihr Tool-Schema und messen Sie es. Ungenutzte Tools zu streichen schafft oft mehr Platz als alles, was Sie an der Unterhaltung ändern.
Kontextfenster unterscheiden sich je nach Modell, und jede Modellseite bei APICLAN nennt das Fenster neben dem Preis. Den Verlauf zu kürzen senkt auch direkt die Rechnung, denn Input-Tokens werden bei jedem Durchlauf berechnet.

Verwandte Themen

Unexpected token '<' beim Aufruf einer OpenAI-kompatiblen API401 invalid API key – wenn der Schlüssel richtig aussieht und trotzdem scheitert

Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.