Strona główna → Pomoc

Rachunek jest wyższy, niż sugeruje liczba tokenów

Mnóż przez właściwą stawkę. Wyjście kosztuje zwykle około pięć razy więcej niż wejście. Odczyty z cache to mały ułamek stawki za wejście; zapisy do cache są droższe od niej. Obciążenie, które ciągle przepisuje swój kontekst, płaci stawkę za zapis raz po raz, generując bardzo mało widocznego wyjścia.

Co widzisz

Dlaczego tak się dzieje

Ceny katalogowe podaje się za milion tokenów wejścia i wyjścia, co zachęca do liczenia jednej średniej. Prawdziwe faktury to suma czterech różnych stawek: wejście, wyjście, odczyt z cache i zapis do cache. Gdy proporcje się zmieniają, zmienia się rachunek, choć suma tokenów prawie stoi w miejscu.

Zaskakuje zwykle kierunek cache. Odczyt z cache jest tani – po to cache istnieje. Zapis do niego kosztuje więcej niż wysłanie tokenów od nowa. Pętla, która w każdej turze zmienia początek kontekstu, unieważnia cache i za każdym razem płaci dopłatę, a pętla dopisująca do stałego prefiksu dostaje zniżkę.

Liczby z naszych własnych rozliczeń dobrze pokazują skalę: w próbie żądań korzystających z cache zwykłe wejście i wyjście stanowiły łącznie około 3% wszystkich przetworzonych tokenów, a resztę – zapisy i odczyty cache. W jednej sesji z trzydziestu żądań same zapisy do cache odpowiadały za 63% opłaty – tokeny, które nie dały żadnego wyjścia.

Sprawdź, czy to ta przyczyna

Weź jedno prawdziwe żądanie z logu użycia u dostawcy i rozbij cztery liczniki:

# Any provider that reports usage will expose these four fields.
# What to compare:
#   input_tokens           charged at the input rate
#   output_tokens          usually ~5x the input rate
#   cache_read_tokens      a fraction of the input rate
#   cache_creation_tokens  charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.

Policz, jaką część opłaty odpowiada każdy licznik. Jeśli prowadzą zapisy do cache, dźwignią jest stabilność promptu, a nie tańszy model.

Jak to naprawić

  1. Ustabilizuj początek promptuWszystko, co zmienia się w każdej turze – znacznik czasu, przetasowana lista narzędzi, licznik – unieważnia cache od tego miejsca dalej. Przenieś zmienne treści na koniec, a prefiks pozostanie cache'owalny.
  2. Zanim zmienisz model, spójrz na długość wyjściaWyjście kosztuje kilka razy więcej niż wejście. Zmiana promptu, która skraca odpowiedzi o jedną trzecią, często oszczędza więcej niż przejście na tańszy poziom i nie wymaga ponownej walidacji.
  3. Tanie kroki kieruj do taniego modeluKlasyfikacja, ekstrakcja i routing rzadko potrzebują flagowca. Wysyłanie do drogiego modelu tylko ostatniego kroku rozumowania zwykle obniża łączny koszt o ponad połowę.
  4. Porównuj cenę za milion wyjścia, nie za milion tokenówUśredniona cena za token ukrywa to, co naprawdę napędza rachunek. Dwa modele o podobnej średniej mogą się wyraźnie różnić, gdy zastosujesz proporcję wejścia do wyjścia twojego obciążenia.
APICLAN rozpisuje wszystkie cztery liczniki dla każdego wywołania, więc zaskakującą fakturę można przypisać konkretnemu żądaniu, zamiast ją szacować. Stawki dla poszczególnych modeli są na stronach cennika.

Powiązane

Unexpected token '<' przy wywołaniu API zgodnego z OpenAI401 invalid API key – gdy klucz wygląda dobrze, a i tak nie działa

Ostatnio sprawdzono 2026-10-01. Napisane na podstawie problemów zdiagnozowanych na działającej bramce zgodnej z OpenAI, a nie zebrane z innych stron.