Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceCeny katalogowe podaje się za milion tokenów wejścia i wyjścia, co zachęca do liczenia jednej średniej. Prawdziwe faktury to suma czterech różnych stawek: wejście, wyjście, odczyt z cache i zapis do cache. Gdy proporcje się zmieniają, zmienia się rachunek, choć suma tokenów prawie stoi w miejscu.
Zaskakuje zwykle kierunek cache. Odczyt z cache jest tani – po to cache istnieje. Zapis do niego kosztuje więcej niż wysłanie tokenów od nowa. Pętla, która w każdej turze zmienia początek kontekstu, unieważnia cache i za każdym razem płaci dopłatę, a pętla dopisująca do stałego prefiksu dostaje zniżkę.
Liczby z naszych własnych rozliczeń dobrze pokazują skalę: w próbie żądań korzystających z cache zwykłe wejście i wyjście stanowiły łącznie około 3% wszystkich przetworzonych tokenów, a resztę – zapisy i odczyty cache. W jednej sesji z trzydziestu żądań same zapisy do cache odpowiadały za 63% opłaty – tokeny, które nie dały żadnego wyjścia.
Weź jedno prawdziwe żądanie z logu użycia u dostawcy i rozbij cztery liczniki:
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Policz, jaką część opłaty odpowiada każdy licznik. Jeśli prowadzą zapisy do cache, dźwignią jest stabilność promptu, a nie tańszy model.
Ostatnio sprawdzono 2026-10-01. Napisane na podstawie problemów zdiagnozowanych na działającej bramce zgodnej z OpenAI, a nie zebrane z innych stron.