Start → Hilfe

Die Rechnung ist höher, als die Token-Zahl rechtfertigt

Multiplizieren Sie mit dem richtigen Satz. Output kostet meist etwa das Fünffache von Input. Cache-Lesevorgänge kosten einen kleinen Bruchteil des Input-Preises; Cache-Schreibvorgänge liegen darüber. Ein Workload, der seinen Kontext ständig neu schreibt, zahlt immer wieder den Schreibpreis und erzeugt dabei kaum sichtbare Ausgabe.

Was Sie sehen

Warum das passiert

Listenpreise werden pro Million Tokens für Input und Output angegeben, was zu einem einzigen Durchschnitt verleitet. Echte Rechnungen sind die Summe aus vier verschiedenen Sätzen: Input, Output, Cache-Lesen und Cache-Schreiben. Verschiebt sich die Mischung, verschiebt sich die Rechnung, ohne dass sich die Token-Summe stark ändert.

Die Cache-Richtung überrascht die meisten. Aus dem Cache zu lesen ist billig – genau deshalb gibt es Caching. In den Cache zu schreiben kostet mehr, als die Tokens frisch zu senden. Eine Schleife, die bei jedem Durchlauf den Anfang ihres Kontexts verändert, macht den Cache ungültig und zahlt jedes Mal den Aufschlag; eine Schleife, die an einen stabilen Präfix anhängt, bekommt den Rabatt.

Zahlen aus unseren eigenen Abrechnungsdaten machen die Größenordnung greifbar: In einer Stichprobe gecachter Anfragen machten normaler Input und Output zusammen etwa 3 % aller verarbeiteten Tokens aus, Cache-Schreib- und Lesevorgänge den Rest. In einer Sitzung mit dreißig Anfragen entfielen allein auf Cache-Schreibvorgänge 63 % der Kosten – Tokens, die überhaupt keine Ausgabe erzeugt haben.

Prüfen, ob es daran liegt

Nehmen Sie eine echte Anfrage aus dem Nutzungslog Ihres Anbieters und trennen Sie die vier Zähler:

# Any provider that reports usage will expose these four fields.
# What to compare:
#   input_tokens           charged at the input rate
#   output_tokens          usually ~5x the input rate
#   cache_read_tokens      a fraction of the input rate
#   cache_creation_tokens  charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.

Rechnen Sie aus, welchen Anteil der Kosten jeder Zähler ausmacht. Führen die Cache-Schreibvorgänge, ist der Hebel ein stabiler Prompt, nicht ein günstigeres Modell.

So beheben Sie es

  1. Den Anfang des Prompts stabil haltenAlles, was sich bei jedem Durchlauf ändert – ein Zeitstempel, eine umsortierte Tool-Liste, ein Zähler –, macht den Cache ab dieser Stelle ungültig. Schieben Sie veränderliche Inhalte ans Ende, dann bleibt der Präfix cachebar.
  2. Vor einem Modellwechsel die Output-Länge prüfenOutput kostet ein Mehrfaches von Input. Eine Prompt-Änderung, die Antworten um ein Drittel kürzt, spart oft mehr als ein günstigerer Tarif und muss nicht neu validiert werden.
  3. Einfache Schritte an ein günstiges Modell gebenKlassifizierung, Extraktion und Routing brauchen selten ein Spitzenmodell. Nur den letzten Denkschritt an das teure Modell zu schicken senkt die Mischkosten meist um mehr als die Hälfte.
  4. Pro Million Output-Tokens vergleichen, nicht pro Million TokensEin gemischter Preis pro Token verdeckt genau das, was die Rechnung treibt. Zwei Modelle mit ähnlichem Durchschnitt können sich deutlich unterscheiden, sobald das Input-Output-Verhältnis Ihres Workloads zählt.
APICLAN schlüsselt bei jedem Aufruf alle vier Zähler auf, sodass sich eine überraschende Rechnung auf eine konkrete Anfrage zurückführen lässt, statt geschätzt zu werden. Die Preise pro Modell stehen auf den Preisseiten.

Verwandte Themen

Unexpected token '<' beim Aufruf einer OpenAI-kompatiblen API401 invalid API key – wenn der Schlüssel richtig aussieht und trotzdem scheitert

Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.