Por qué Claude es tan caro: cálculo de tokens
Los tokens de salida cuestan 5 veces más que los de entrada y cada turno reenvía todo el contexto. Vea el cálculo de una sesión real y 4 formas de reducirlo.
Por qué es caro Claude: respuesta breve
Claude es caro por cuatro razones que se acumulan. Los tokens de salida tienen un precio cinco veces mayor que los tokens de entrada. La API no conserva la memoria de la conversación, por lo que todo el historial se vuelve a enviar y se vuelve a facturar en cada turno. Un agente convierte una pregunta en decenas de llamadas a la API, y cada llamada incluye ese historial cada vez más largo. Además, el modelo de frontera se factura según la dificultad del trabajo que realiza, no según el coste de ejecutar un modelo pequeño.
Un token es un fragmento de texto. Como orientación general, un token equivale aproximadamente a cuatro caracteres o a 0.75 palabras en inglés. Las tarifas se expresan por millón de tokens y se escriben como MTok (million tokens). Todas las tarifas siguientes son las tarifas publicadas de la API de Claude a fecha de August 2026.
La mayoría de las facturas inesperadas se deben a la segunda y tercera razones de esa lista. Normalmente, los usuarios creen que lo que cuesta dinero son las respuestas que escribe Claude. En una sesión con un agente, la generación de texto suele representar menos de una décima parte de la factura.
Las tarifas publicadas, para que usemos los mismos importes
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Observe la proporción, no los importes absolutos. Todos los modelos cobran exactamente cinco veces más por la salida que por la entrada. Opus 5 cuesta 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Haiku 4.5 cuesta 1 y 5. Por tanto, la distancia entre el modelo más barato y el más caro es de cinco veces, y la distancia entre leer y escribir también es de cinco veces.
Sonnet 5 tiene una tarifa introductoria de 2 y 10 dólares por millón hasta el 31 de agosto de 2026. A partir del 1 de septiembre de 2026, pasa a 3 y 15. Las tarifas cambian cuando se publican nuevos modelos, así que compruebe las actuales antes de elaborar un presupuesto basándose en ellas. Tampoco hay un nivel gratuito por debajo de esta tabla, aunque las cuentas nuevas empiezan con un pequeño crédito y algunas partes de la API no tienen ningún coste.
La última columna es la tarifa de lectura de caché. Determina la mayor parte de las facturas. Volveremos a ella después de hacer los cálculos.
¿Por qué los tokens de salida cuestan cinco veces más que los tokens de entrada?
Leer y escribir no requieren la misma cantidad de trabajo. Los tokens de entrada se procesan en una sola pasada. El modelo lee todo el prompt a la vez y el trabajo se ejecuta en paralelo, por lo que un prompt de 60,000 tokens no tarda 60,000 veces más en leerse que uno de 1,000 tokens.
Los tokens de salida se generan uno a uno. Cada token nuevo requiere su propia pasada por el modelo y necesita como contexto todos los tokens anteriores. Escribir 1,000 tokens implica 1,000 pasadas, una tras otra. Ese trabajo secuencial no se puede distribuir como la lectura, por lo que cada token de salida mantiene el hardware ocupado durante más tiempo.
Por eso, «hacer la respuesta más corta» es una medida menos eficaz de lo que muchos esperan. Actúa sobre la mitad menor de la factura de un agente.
¿Por qué se factura de nuevo toda mi conversación en cada turno?
La API de Claude no tiene estado. No hay una conversación almacenada en los servidores de Anthropic a la que se añada un mensaje. Cada solicitud incluye todo el historial de mensajes, y el modelo lo lee completo antes de generar una respuesta. Por eso, el turno 30 se factura incluyendo los turnos 1 a 29.
Esto significa que el coste de una conversación crece más rápido que su longitud. El turno 1 factura un contexto pequeño. El turno 40 factura uno grande. Si suma los cuarenta turnos, habrá pagado varias veces la cantidad de tokens que se escribieron realmente.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]La sesión anterior comienza con 20,000 tokens, que corresponden al prompt del sistema, las definiciones de las herramientas y los primeros archivos que abrió el agente. En el turno 40, el contexto contiene 100,000 tokens. Si calcula el promedio entre los cuarenta turnos, obtiene aproximadamente 60,000 tokens leídos por solicitud.
¿Por qué un agente cuesta mucho más que un chat?
Un chat realiza una petición por pregunta. Un agente realiza una petición por paso. Leer un archivo es un paso. Ejecutar una prueba es un paso. Leer el resultado de la prueba es un paso. Editar el archivo es un paso. Cuarenta pasos para completar una tarea es algo habitual en un agente de programación.
El uso de herramientas añade otros dos costes. Las definiciones de las herramientas son tokens de entrada en cada petición, porque el modelo debe recibir información sobre las herramientas disponibles cada vez. Anthropic publica este coste adicional: el prompt de sistema para usar herramientas ocupa 286 tokens en Opus 5 con tool_choice configurado como auto, además de los tokens de los esquemas de tus propias herramientas. Algunas herramientas del servidor también tienen una tarifa independiente. La búsqueda web cuesta $10 por cada 1.000 búsquedas, además de los tokens que consumen los resultados.
Cada resultado de una herramienta también pasa a formar parte permanente del contexto. Un comando que muestra 3.000 líneas añade esas 3.000 líneas a cada petición durante el resto de la sesión. El uso de tokens por sesión que muestra Claude Code lo hace visible: observa cómo aumenta el número de tokens de entrada justo después de ejecutar un comando que genera mucha salida.
La aritmética de una sesión real
Esta es una hora realista de programación agéntica con Opus 5. Se realizan cuarenta solicitudes a la API. El contexto crece de 20,000 a 100,000 tokens, por lo que el promedio es de unos 60,000 tokens por solicitud. El modelo escribe unos 700 tokens por solicitud, combinando llamadas breves a herramientas con algunos bloques de código más largos.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Observe el desglose. El coste de lectura es de 12.00 dólares y el de escritura es de 0.70 dólares, por lo que el contenido que realmente lee representa aproximadamente el cinco por ciento de la factura. El modelo escribió 28,000 tokens y se facturó la lectura de 2,400,000 tokens. Nadie escribió 2.4 millones de tokens. Los mismos 100,000 tokens se leyeron una y otra vez.
Palanca 1: el almacenamiento en caché de prompts, que es la de mayor impacto
El almacenamiento en caché de prompts guarda la forma procesada de un prefijo estable del prompt. En la siguiente solicitud, ese prefijo se lee desde la caché en lugar de procesarse de nuevo. Escribir en la caché cuesta 1.25 veces la tarifa de entrada para la caché de cinco minutos, o 2 veces para la caché de una hora. Leer de ella cuesta 0.1 veces la tarifa de entrada. En Opus 5, eso equivale a 0.50 dólares por millón, en lugar de 5 dólares.
Aplique esto a la sesión anterior. Cada uno de los 100,000 tokens se escribe una vez en la caché a medida que crece la conversación. Los otros 2,300,000 tokens de entrada se convierten en lecturas de la caché.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Marque la parte que se puede almacenar en caché con un campo cache_control. Coloque el punto de ruptura después del contenido que no cambia entre turnos: el prompt del sistema y las definiciones de las herramientas. Un documento extenso al que hace referencia de forma continua debe pertenecer al mismo bloque estable.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}El orden del prompt determina ahora el coste. Un acierto de caché requiere una coincidencia exacta desde el principio del prompt, por lo que todo lo que cambie en cada solicitud debe quedar después de todo lo que no cambie. Si coloca una marca de tiempo al principio del prompt del sistema, rompe la caché en cada turno: todo el prefijo se convierte en un fallo de caché y debe pagar 1.25 veces la tarifa de entrada para escribirlo de nuevo.
La respuesta indica si ha funcionado. Envíe una solicitud y lea el bloque de uso.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Cada respuesta incluye un objeto usage como este:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Si una solicitud repetida sigue mostrando 0 en cache_read_input_tokens, significa que la caché no se está utilizando. La causa habitual es que algo situado antes del punto de ruptura ha cambiado. La caché de cinco minutos también caduca, por lo que una solicitud enviada seis minutos después provoca un fallo de caché seguido de una nueva escritura.
Palanca 2: envíe las tareas sencillas a un modelo más pequeño
La mayoría de los turnos de una sesión de un agente no son difíciles. Abrir un archivo, ejecutar un formateador o leer un diff. Esas tareas no necesitan el modelo de vanguardia. Enrutar esas tareas a Haiku 4.5 reduce la tarifa de entrada de 5 dólares por millón a 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]La misma sesión cuesta 12.70 dólares con Opus 5 sin caching, 2.48 con caching, 0.99 con Sonnet 5 y caching, y 0.50 con Haiku 4.5 y caching. El caching por sí solo elimina aproximadamente el ochenta por ciento del coste. Elegir el modelo elimina la mayor parte del coste restante.
Esta es la salvedad importante. Un modelo más barato que se equivoca le cuesta otra vez toda la sesión, además de su propio tiempo. Enrute las tareas según su dificultad, no según el precio. La regla también se aplica hacia arriba: Claude Fable 5 aparece por encima de Opus 5, con 10 y 50 dólares por millón; por tanto, lea qué obtiene con esas tarifas antes de enviarle un turno. Elegir entre Opus, Sonnet y Haiku explica en qué situaciones funciona mejor cada uno.
Nivel 3: higiene del contexto
Cada token que dejas en el contexto se factura en todos los turnos restantes, por lo que eliminarlo pronto vale mucho más que eliminarlo tarde. Un archivo de 5,000 tokens incluido en el turno 5 de una sesión de 40 turnos se lee 35 veces más. Eso supone 175,000 tokens de entrada adicionales, casi un dólar en Opus 5 por una sola copia pegada sin cuidado.
Cuatro hábitos que reducen esa cifra:
- Inicia una sesión nueva para cada tarea en lugar de continuar la del día anterior.
- Filtra los comandos ruidosos antes de que la salida llegue al modelo, con algo como
head -50, y no después. - Solicita sólo la función que te interesa, no el archivo completo.
- Cuando una sesión larga deje de avanzar, solicita un resumen y vuelve a empezar desde él. El resumen ocupa unos cientos de tokens. La transcripción ocupa cien mil.
Palanca 4: procese por lotes todo lo que no sea interactivo
La Batch API procesa las solicitudes de forma asíncrona y aplica un descuento del 50 por ciento tanto a la entrada como a la salida. Si un trabajo no necesita una respuesta en el siguiente segundo, procéselo por lotes. Esto incluye la clasificación, la extracción, el resumen de una cola de trabajo pendiente y las ejecuciones de evaluación. El descuento por procesamiento por lotes se acumula con el almacenamiento en caché de prompts. No se aplica a una sesión interactiva porque en ese caso no hay nada que esperar.
¿Me están cobrando de más?
Esa es la pregunta real detrás de «por qué Claude es caro», así que la respuesta directa es la siguiente. Las tarifas son públicas, son las mismas para todos en los niveles estándar y se cobran por token. La excepción es un contrato negociado. Incluso en ese caso, precios de Claude Enterprise añade un cargo por puesto a los mismos tokens medidos, en lugar de sustituirlos. Ningún importe de la factura es discrecional. Lo que la tabla de tarifas no puede decirte es si estás obteniendo valor, porque cobra los tokens y a ti te importan los resultados.
Por tanto, calcula el precio del resultado. La sesión anterior costó 12.70 dólares sin caché. Si entregó una funcionalidad que te habría llevado una hora, es barato. Si pasó cuarenta turnos dando vueltas, esos mismos 12.70 dólares no produjeron nada, y la tarifa nunca fue el problema.
Esta es la idea que conviene recordar. La factura aumenta con los tokens, no con el valor. Una sesión productiva y una sesión desperdiciada con la misma duración cuestan lo mismo. Por eso los cuatro factores importan más que la tabla de tarifas: no puedes negociar el precio por token, pero decides cuántos tokens necesita el trabajo.
Por tanto, mide los dólares por tarea completada, no los dólares por mes. Si esa cifra disminuye mientras ajustas la caché y el enrutamiento, tu configuración está mejorando aunque aumente el total mensual, porque el total aumenta al realizar más trabajo.
Lo que no reduce su factura
Algunos consejos populares aportan muy poco. Indicar al modelo que sea «conciso» reduce la salida, y la salida representaba el cinco por ciento de la factura de ejemplo. Acortar su propia pregunta ahorra unos cientos de tokens frente a un contexto de 60,000 tokens. Desactivar el razonamiento extendido sólo ayuda cuando los tokens de razonamiento representaban una parte importante de la salida. El bloque de uso se lo indica, sin obligarle a calcularlo.
Una ventana de contexto más grande tampoco aumenta el coste por sí sola. En Claude 4.6 y versiones posteriores, la ventana completa de un millón de tokens se factura con la tarifa estándar por token. Por tanto, una solicitud de 900,000 tokens cuesta lo mismo por token que una de 9,000 tokens. El tamaño de la ventana no determina el precio. Lo determina el contenido que decide incluir en ella.
Hay otras dos cuestiones que deben planificarse aparte de una sesión individual. Si su uso es diario e interactivo, compare el pago por token con un plan fijo: la comparación de costes entre la API y las suscripciones hace ese cálculo. Si el plan fijo resulta más conveniente y al mismo tiempo está valorando otro proveedor, los planes de Claude y ChatGPT comparados con precios lado a lado realiza la misma comparación entre ambos. Si un agente se ejecuta sin supervisión en un servidor, establezca un límite máximo de gasto antes de ajustar cualquier otra cosa. Eso es lo que cubre el control de costes de un agente de IA en un VPS. Para tener una referencia clara de la escala, lo que realmente se puede comprar con un millón de tokens de Claude convierte la tabla de tarifas en páginas de texto.
FAQ
¿Por qué aumentó tanto mi factura de Claude cuando empecé a usar un agente?
Porque un agente envía muchas solicitudes por pregunta y cada solicitud incluye toda la conversación acumulada. Un chat envía una solicitud por pregunta. Un agente de programación envía una solicitud por paso, y cuarenta pasos para una tarea es algo normal. Cada una de esas solicitudes se factura con todo el contexto, por lo que una sesión que termina con 100,000 tokens puede facturar más de dos millones de tokens de entrada en total. Consulte input_tokens y cache_read_input_tokens en la respuesta de la API para verlo directamente.
¿El almacenamiento en caché de prompts reduce realmente tanto la factura?
En el ejemplo desarrollado, redujo el coste de la sesión de 12.70 dólares a 2.48 dólares, porque una lectura de caché cuesta una décima parte de la tarifa de entrada. El ahorro depende por completo de la tasa de aciertos. Con la caché de cinco minutos, se amortiza después de una sola lectura, porque la escritura cuesta 1.25 veces la entrada y la lectura cuesta 0.1 veces. Si el prompt cambia cerca del inicio en cada solicitud, no obtiene ningún acierto y paga el recargo de escritura sin ningún beneficio. Confirme el resultado con cache_read_input_tokens antes de asumir que funciona.
¿Debería usar Haiku para todo?
No. Haiku 4.5 cuesta 1 dólares por millón de tokens de entrada, frente a 5 para Opus 5, por lo que el ahorro es real en tareas sencillas y de gran volumen, como la clasificación y el enrutamiento. Una respuesta incorrecta en una tarea difícil cuesta más que lo ahorrado con el modelo, porque además paga el reintento y el tiempo que usted dedica. El patrón que funciona es mixto: el modelo pequeño para pasos mecánicos y el modelo de vanguardia para el paso que requiere criterio.
¿La API es más barata que una suscripción de Claude?
Depende de lo estable que sea su uso. Una suscripción tiene un precio mensual fijo con límites de uso. La API se paga por token y no tiene un límite máximo, por lo que resulta más barata cuando el uso es bajo o se concentra en periodos puntuales, y más cara cuando se utiliza mucho todos los días laborables. Tome el promedio de tokens diarios del bloque de uso, calcule su precio con la tarifa de su modelo y compare el resultado con el precio del plan, que para el nivel inicial se indica en cuánto cuesta Claude Pro y dónde terminan sus límites de uso. Si el total favorece a la API, cancelar el plan o bajar de nivel no desperdicia el mes que ya ha pagado, porque el acceso se mantiene hasta el final del periodo de facturación actual.