Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceListenpreise werden pro Million Tokens für Input und Output angegeben, was zu einem einzigen Durchschnitt verleitet. Echte Rechnungen sind die Summe aus vier verschiedenen Sätzen: Input, Output, Cache-Lesen und Cache-Schreiben. Verschiebt sich die Mischung, verschiebt sich die Rechnung, ohne dass sich die Token-Summe stark ändert.
Die Cache-Richtung überrascht die meisten. Aus dem Cache zu lesen ist billig – genau deshalb gibt es Caching. In den Cache zu schreiben kostet mehr, als die Tokens frisch zu senden. Eine Schleife, die bei jedem Durchlauf den Anfang ihres Kontexts verändert, macht den Cache ungültig und zahlt jedes Mal den Aufschlag; eine Schleife, die an einen stabilen Präfix anhängt, bekommt den Rabatt.
Zahlen aus unseren eigenen Abrechnungsdaten machen die Größenordnung greifbar: In einer Stichprobe gecachter Anfragen machten normaler Input und Output zusammen etwa 3 % aller verarbeiteten Tokens aus, Cache-Schreib- und Lesevorgänge den Rest. In einer Sitzung mit dreißig Anfragen entfielen allein auf Cache-Schreibvorgänge 63 % der Kosten – Tokens, die überhaupt keine Ausgabe erzeugt haben.
Nehmen Sie eine echte Anfrage aus dem Nutzungslog Ihres Anbieters und trennen Sie die vier Zähler:
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Rechnen Sie aus, welchen Anteil der Kosten jeder Zähler ausmacht. Führen die Cache-Schreibvorgänge, ist der Hebel ein stabiler Prompt, nicht ein günstigeres Modell.
Zuletzt geprüft am 2026-10-01. Geschrieben aus Problemen, die auf einem laufenden OpenAI-kompatiblen Gateway diagnostiziert wurden – nicht von anderen Seiten zusammengetragen.