Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceLes prix affichés sont donnés par million de tokens d'entrée et de sortie, ce qui invite à raisonner sur une seule moyenne. Les vraies factures sont la somme de quatre tarifs différents : entrée, sortie, lecture de cache et écriture en cache. Quand la répartition change, la facture change sans que le total de tokens bouge beaucoup.
C'est le sens du cache qui surprend. Lire depuis le cache est bon marché : c'est la raison d'être du cache. Y écrire coûte plus cher que de renvoyer les tokens. Une boucle qui modifie le début de son contexte à chaque tour invalide donc le cache et paie le supplément à chaque fois, tandis qu'une boucle qui ajoute à un préfixe stable bénéficie de la remise.
Les chiffres de notre propre facturation donnent l'échelle : sur un échantillon de requêtes avec cache, l'entrée et la sortie ordinaires représentaient ensemble environ 3 % de tous les tokens traités, le reste étant des écritures et lectures de cache. Dans une session de trente requêtes, les seules écritures en cache représentaient 63 % du montant : des tokens qui n'ont produit aucune sortie.
Prenez une vraie requête dans le journal d'utilisation de votre fournisseur et séparez les quatre compteurs :
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Calculez la part du montant que représente chaque compteur. Si les écritures en cache dominent, le levier est la stabilité du prompt, pas un modèle moins cher.
Dernière vérification le 2026-10-01. Rédigé à partir de problèmes diagnostiqués sur une passerelle compatible OpenAI en production, pas compilé à partir d'autres sites.