Cost per request varies wildly for similar promptsMedian and mean cost per call differ by several timesA short conversation costs more than a long oneAgent frameworks cost far more than the same prompts by handThe math using the headline per-token price does not reproduce the invoiceLos precios de catálogo se dan por millón de tokens de entrada y de salida, lo que invita a pensar en una única media. Las facturas reales son la suma de cuatro tarifas distintas: entrada, salida, lectura de caché y escritura en caché. Cuando la mezcla cambia, la factura cambia aunque el total de tokens apenas se mueva.
Lo que sorprende es la dirección de la caché. Leer de la caché es barato: para eso existe. Escribir en ella cuesta más que enviar los tokens de nuevo. Así que un bucle que altera el principio de su contexto en cada turno invalida la caché y paga el recargo cada vez, mientras que uno que añade a un prefijo estable obtiene el descuento.
Los números de nuestra propia facturación muestran la escala: en una muestra de peticiones con caché, la entrada y la salida normales sumaban alrededor del 3% de todos los tokens procesados, y el resto eran escrituras y lecturas de caché. En una sesión de treinta peticiones, solo las escrituras en caché supusieron el 63% del cargo: tokens que no produjeron ninguna salida.
Toma una petición real del registro de uso de tu proveedor y separa los cuatro contadores:
# Any provider that reports usage will expose these four fields.
# What to compare:
# input_tokens charged at the input rate
# output_tokens usually ~5x the input rate
# cache_read_tokens a fraction of the input rate
# cache_creation_tokens charged ABOVE the input rate
#
# If cache_creation dominates, the cost is context churn, not generation.
Calcula qué parte del cargo corresponde a cada contador. Si dominan las escrituras en caché, la palanca es la estabilidad del prompt, no un modelo más barato.
Revisado por última vez el 2026-10-01. Escrito a partir de problemas diagnosticados en una pasarela compatible con OpenAI en producción, no recopilado de otras webs.