Por qué Claude es tan caro: cálculo de tokens
Los tokens de salida cuestan 5 veces más que los de entrada y cada turno reenvía todo el contexto. Consulta una sesión real y 4 medidas para reducir el coste.
¿Por qué Claude es caro? La respuesta breve
Claude es caro por cuatro razones que se acumulan. Los tokens de salida tienen un precio cinco veces superior al de los tokens de entrada. La API no conserva la memoria de la conversación, por lo que todo el historial se envía de nuevo y se factura de nuevo en cada turno. Un agente convierte una pregunta en docenas de llamadas a la API, y cada llamada incluye ese historial cada vez más extenso. Además, el modelo de frontera se tarifica según la dificultad del trabajo que realiza, no según el coste de ejecutar un modelo pequeño.
Un token es un fragmento de texto. Como orientación general, un token equivale aproximadamente a cuatro caracteres o a unas 0.75 palabras en inglés. Las tarifas se expresan por millón de tokens, con la abreviatura MTok (millón de tokens). Todas las tarifas siguientes corresponden a la tarifa publicada de la API de Claude en agosto de 2026.
La mayoría de las facturas inesperadas se deben a la segunda y tercera razones de esa lista. Normalmente, los usuarios creen que el coste procede de las respuestas que escribe Claude. En una sesión con un agente, la redacción suele representar menos de una décima parte de la factura.
Las tarifas publicadas, para usar los mismos valores
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Observe la proporción, no los valores absolutos. Todos los modelos cobran exactamente cinco veces más por la salida que por la entrada. Opus 5 cuesta 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Haiku 4.5 cuesta 1 y 5 dólares, respectivamente. Por tanto, la diferencia entre el modelo más barato y el más caro es de cinco veces, y la diferencia entre leer y escribir también es de cinco veces.
Sonnet 5 tiene una tarifa introductoria de 2 y 10 dólares por millón hasta el 31 de agosto de 2026. A partir del 1 de septiembre de 2026, pasa a 3 y 15. Las tarifas cambian cuando se publican nuevas versiones de los modelos, así que compruebe las actuales antes de elaborar un presupuesto.
La última columna es la tarifa de lectura de la caché. Determina la mayor parte de las facturas. Volveremos a ella después de hacer los cálculos.
¿Por qué los tokens de salida cuestan cinco veces más que los tokens de entrada?
Leer y escribir no requieren el mismo trabajo. Los tokens de entrada se procesan en una sola pasada. El modelo lee todo el prompt a la vez y el trabajo se ejecuta en paralelo, por lo que un prompt de 60,000 tokens no tarda 60,000 veces más en leerse que uno de 1,000 tokens.
Los tokens de salida se generan uno a uno. Cada token nuevo necesita su propia pasada por el modelo y necesita como contexto todos los tokens anteriores. Escribir 1,000 tokens requiere 1,000 pasadas, una tras otra. Este trabajo secuencial no se puede distribuir como la lectura, por lo que cada token de salida ocupa el hardware durante más tiempo.
Por eso, «hacer la respuesta más corta» es una medida menos eficaz de lo que muchos esperan. Afecta a la mitad más pequeña del coste de un agente.
¿Por qué se vuelve a facturar toda mi conversación en cada turno?
La API de Claude no tiene estado. No hay una conversación almacenada en los servidores de Anthropic a la que se añada un mensaje. Cada solicitud incluye todo el historial de mensajes y el modelo lo lee completo antes de generar una respuesta. Por eso, el turno 30 también se factura por los turnos 1 a 29.
Esto significa que el coste de una conversación aumenta más rápido que su longitud. En el turno 1 se factura un contexto pequeño. En el turno 40 se factura uno grande. Si suma los cuarenta turnos, habrá pagado varias veces la cantidad de tokens que se escribieron realmente.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]La sesión anterior comienza con 20,000 tokens. Incluye el prompt del sistema, las definiciones de herramientas y los primeros archivos que abrió el agente. En el turno 40, el contexto contiene 100,000 tokens. Si calcula el promedio de los cuarenta turnos, obtiene aproximadamente 60,000 tokens leídos por solicitud.
¿Por qué un agente cuesta mucho más que un chat?
Un chat realiza una solicitud por pregunta. Un agente realiza una solicitud por paso. Leer un archivo es un paso. Ejecutar una prueba es un paso. Leer el resultado de la prueba es un paso. Editar el archivo es un paso. Cuarenta pasos para completar una tarea son habituales en un agente de programación.
El uso de herramientas añade otros dos costes. Las definiciones de las herramientas son tokens de entrada en cada solicitud, porque el modelo debe recibir cada vez la información sobre las herramientas disponibles. Anthropic publica este coste adicional: el prompt del sistema para usar herramientas ocupa 286 tokens en Opus 5 con tool_choice configurado como auto, además de los tokens de los esquemas de sus propias herramientas. Algunas herramientas del servidor tienen también una tarifa independiente. La búsqueda web se factura a $10 por cada 1,000 búsquedas, además de los tokens que consumen los resultados.
Cada resultado de una herramienta también pasa a formar parte permanente del contexto. Un comando que imprime 3,000 líneas incorpora esas 3,000 líneas en todas las solicitudes posteriores de la sesión. El uso de tokens por sesión que muestra Claude Code permite verlo: observe cómo aumenta el número de tokens de entrada justo después de ejecutar un comando con mucha salida.
La aritmética de una sesión real
Este es un ejemplo realista de una hora de programación agéntica con Opus 5. Se realizan cuarenta solicitudes a la API. El contexto crece de 20,000 a 100,000 tokens, por lo que cada solicitud procesa un promedio aproximado de 60,000 tokens. El modelo escribe unos 700 tokens por solicitud, combinando llamadas breves a herramientas con algunos bloques de código más largos.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Observe el desglose. El coste de lectura es de 12.00 dólares y el de escritura es de 0.70 dólares, por lo que la salida que realmente lee representa aproximadamente el cinco por ciento de la factura. El modelo escribió 28,000 tokens y se facturó la lectura de 2,400,000 tokens. Nadie introdujo 2.4 millones de tokens. Los mismos 100,000 tokens se leyeron una y otra vez.
Palanca 1: el almacenamiento en caché de prompts, la de mayor impacto
El almacenamiento en caché de prompts guarda la forma procesada de un prefijo estable del prompt. En la siguiente solicitud, ese prefijo se lee desde la caché en lugar de procesarse otra vez. Escribir en la caché cuesta 1.25 veces la tarifa de entrada para la caché de cinco minutos, o 2 veces para la caché de una hora. Leer desde ella cuesta 0.1 veces la tarifa de entrada. En Opus 5, eso equivale a 0.50 dólares por millón, en lugar de 5 dólares.
Aplique esto a la sesión anterior. Cada uno de los 100,000 tokens se escribe una vez en la caché a medida que crece la conversación. Los otros 2,300,000 tokens de entrada se convierten en lecturas de la caché.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Marque la parte que se puede almacenar en caché con un campo cache_control. Coloque el punto de corte después del contenido que no cambia entre turnos: el prompt del sistema y las definiciones de las herramientas. Un documento extenso que consulta con frecuencia debe pertenecer a ese mismo bloque estable.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}El orden del prompt determina ahora el coste. Un acierto de caché necesita una coincidencia exacta desde el principio del prompt, por lo que todo lo que cambie en cada solicitud debe ir después de todo lo que no cambie. Si coloca una marca de tiempo al principio del prompt del sistema, rompe la caché en cada turno: todo el prefijo se convierte en un fallo de caché y debe pagar 1.25 veces la tarifa de entrada para escribirlo de nuevo.
La respuesta indica si funcionó. Envíe una solicitud y lea el bloque de uso.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Cada respuesta contiene un objeto usage como este:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Una solicitud repetida que siga mostrando 0 en cache_read_input_tokens significa que la caché no se está utilizando. La causa habitual es que algo situado antes del punto de corte cambió. La caché de cinco minutos también caduca, por lo que una solicitud enviada seis minutos después produce un fallo de caché seguido de una escritura nueva.
Palanca 2: envíe las tareas sencillas a un modelo más pequeño
La mayoría de las tareas de una sesión de un agente no son difíciles. Abrir un archivo, ejecutar un formateador o leer un diff. No necesitan el modelo de gama alta. Enrutar estas tareas a Haiku 4.5 reduce la tarifa de entrada de 5 dólares por millón a 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]La misma sesión cuesta 12.70 dólares con Opus 5 sin almacenamiento en caché, 2.48 con almacenamiento en caché, 0.99 con Sonnet 5 y almacenamiento en caché, y 0.50 con Haiku 4.5 y almacenamiento en caché. El almacenamiento en caché por sí solo elimina aproximadamente el 80 % del coste. La elección del modelo elimina la mayor parte del coste restante.
Esta es la salvedad importante. Un modelo más barato que se equivoca le cuesta otra vez la sesión completa, además de su propio tiempo. Enrute las tareas según su dificultad, no según el precio. Elegir entre Opus, Sonnet y Haiku explica en qué situaciones funciona bien cada uno.
Palanca 3: higiene del contexto
Cada token que dejas en el contexto se factura en todos los turnos restantes, por lo que eliminarlo pronto vale mucho más que eliminarlo tarde. Un archivo de 5,000 tokens pegado en el turno 5 de una sesión de 40 turnos se vuelve a leer 35 veces. Eso supone 175,000 tokens de entrada adicionales, casi un dólar en Opus 5 por un solo pegado innecesario.
Cuatro hábitos que reducen esa cifra:
- Inicia una sesión nueva para cada tarea en lugar de continuar la del día anterior.
- Filtra los comandos ruidosos antes de que la salida llegue al modelo, con algo como
head -50, en lugar de hacerlo después. - Pide sólo la función que necesitas, no el archivo completo.
- Cuando una sesión larga deje de avanzar, pide un resumen y vuelve a empezar a partir de él. El resumen ocupa unos cientos de tokens. La transcripción ocupa cien mil.
Palanca 4: procese por lotes todo lo que no sea interactivo
La API Batch procesa las solicitudes de forma asíncrona y aplica un descuento del 50 por ciento tanto a la entrada como a la salida. Si un trabajo no necesita una respuesta en el siguiente segundo, procéselo por lotes. Esto incluye la clasificación, la extracción, el resumen de un conjunto acumulado de datos y las ejecuciones de evaluación. El descuento por procesamiento por lotes se acumula con el almacenamiento en caché de prompts. No se aplica a una sesión interactiva porque en ese caso no hay nada que esperar.
¿Me están cobrando de más?
Esa es la verdadera pregunta detrás de «por qué Claude es caro», así que aquí tiene una respuesta directa. Las tarifas son públicas, son las mismas para todos en los niveles estándar y se cobran por token. Ningún importe de la factura es discrecional. Lo que la tabla de tarifas no puede decirle es si obtiene un valor proporcional, porque la tarificación se basa en tokens y a usted le importan los resultados.
Por tanto, calcule el precio del resultado. La sesión anterior costó 12.70 dólares sin caché. Si implementó una funcionalidad que le habría llevado una hora, es barato. Si dedicó cuarenta turnos a dar vueltas sin avanzar, los mismos 12.70 dólares no produjeron nada, y la tarifa nunca fue el problema.
Esto es lo que conviene recordar. La factura aumenta con los tokens, no con el valor. Una sesión productiva y una sesión desperdiciada de la misma duración cuestan lo mismo. Por eso los cuatro factores de ajuste importan más que la tabla de tarifas: no puede negociar el precio por token, pero decide cuántos tokens necesita el trabajo.
Por tanto, mida los dólares por tarea completada, no los dólares por mes. Si esa cifra disminuye mientras ajusta el almacenamiento en caché y el enrutamiento, su configuración está mejorando aunque aumente el total mensual, porque el total aumenta al realizar más trabajo.
Lo que no reduce la factura
Algunos consejos populares aportan muy poco. Indicar al modelo que sea «conciso» reduce la salida, y la salida representaba el cinco por ciento de la factura del ejemplo. Acortar la pregunta sólo ahorra unos cientos de tokens frente a un contexto de 60,000 tokens. Desactivar el razonamiento extendido sólo ayuda cuando los tokens de razonamiento representaban una parte significativa de la salida. El bloque de uso indica si es así, en lugar de obligarle a adivinar.
Una ventana de contexto más grande tampoco aumenta por sí misma el coste. En Claude 4.6 y versiones posteriores, la ventana completa de un millón de tokens se factura con la tarifa estándar por token. Por tanto, una solicitud de 900,000 tokens cuesta lo mismo por token que una de 9,000 tokens. El tamaño de la ventana no determina el precio. Lo determina el contenido que decide incluir en ella.
Hay otras dos cuestiones que deben planificarse, no resolverse en una sola sesión. Si usa el servicio a diario y de forma interactiva, compare el pago por token con una tarifa fija: la comparación de costes entre la API y las suscripciones calcula esa diferencia. Si un agente se ejecuta sin supervisión en un servidor, establezca un límite máximo de gasto antes de ajustar cualquier otro parámetro. Eso es lo que cubre el control de costes de un agente de IA en un VPS. Para obtener una referencia sencilla de escala, qué se puede comprar realmente con un millón de tokens de Claude convierte la tabla de tarifas en páginas de texto.
FAQ
¿Por qué aumentó tanto mi factura de Claude cuando empecé a usar un agente?
Porque un agente envía muchas solicitudes por pregunta y cada solicitud incluye toda la conversación anterior. Un chat envía una solicitud por pregunta. Un agente de programación envía una solicitud por paso, y cuarenta pasos para una tarea son habituales. Cada una de esas solicitudes se factura con todo el contexto, por lo que una sesión que termina con 100,000 tokens puede facturarse por más de dos millones de tokens de entrada en total. Consulte input_tokens y cache_read_input_tokens en la respuesta de la API para comprobarlo directamente.
¿El almacenamiento en caché de prompts realmente reduce tanto la factura?
En el ejemplo desarrollado, redujo el coste de la sesión de 12.70 dólares a 2.48 dólares, porque una lectura de caché cuesta una décima parte de la tarifa de entrada. El ahorro depende por completo de la tasa de aciertos. Con la caché de cinco minutos, se amortiza después de una sola lectura, ya que la escritura cuesta 1.25 veces la entrada y la lectura cuesta 0.1 veces. Si el prompt cambia cerca del principio en cada solicitud, no obtiene ningún acierto y paga el recargo de escritura sin obtener ningún beneficio. Confirme el funcionamiento con cache_read_input_tokens antes de darlo por válido.
¿Debería usar Haiku para todo?
No. Haiku 4.5 cuesta 1 dólares por millón de tokens de entrada, frente a 5 para Opus 5, por lo que el ahorro es real en tareas sencillas y de gran volumen, como la clasificación y el enrutamiento. Una respuesta incorrecta en una tarea compleja cuesta más que lo ahorrado con el modelo, porque también paga el reintento y su propio tiempo. El patrón que suele funcionar es mixto: el modelo pequeño para pasos mecánicos y el modelo de frontera para el paso que requiere criterio.
¿La API es más barata que una suscripción de Claude?
Depende de la regularidad de su uso. Una suscripción tiene un precio mensual fijo con límites de uso. La API se factura por token y no tiene un límite superior, por lo que es más barata cuando el uso es reducido o se concentra en ráfagas, y más cara cuando la utiliza mucho todos los días laborables. Tome el promedio de tokens diarios del bloque de uso, calcule su precio con la tarifa de su modelo y compare el resultado con el precio del plan.