¿Cuánto cuesta 1M de tokens en Claude?
Claude cobra por millón de tokens, con entrada y salida a precios distintos. Consulta la fórmula para convertir tu consumo en una factura mensual estimada.
¿Cuánto cuestan 1M tokens en Claude?
1M tokens significa un millón de tokens y es la unidad en la que se expresa el precio de todas las API (interfaces de programación de aplicaciones) de Claude. No existe un precio único, porque los tokens de entrada y de salida se facturan con tarifas diferentes y cada modelo tiene su propio par de tarifas. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 y $5 en Claude Opus 5.
La salida es la parte más cara. En todos los modelos actuales, la tarifa de salida es cinco veces la tarifa de entrada. Por tanto, la proporción entre ambas determina la factura más que la cifra principal. Una aplicación que envía documentos largos y devuelve respuestas breves se comporta de forma muy diferente de otra que redacta respuestas largas a partir de un prompt corto.
Esta página trata sobre la economía por unidad: cuánto cuesta un token y cómo estimar una factura antes de desarrollar. Para saber dónde se consumen realmente los tokens durante el trabajo, consulte dónde se consumen los tokens dentro de una sesión de Claude Code.
Qué aspecto tiene 1M de tokens
Un token es un fragmento de texto que el modelo lee o genera. La guía aproximada de Anthropic indica que corresponde a un token por cada 4 caracteres, o a unas 0.75 palabras en inglés. Por tanto, un millón de tokens equivale aproximadamente a 750,000 palabras, o a unos 4 MB de texto sin formato.
Las estimaciones publicadas para entradas habituales permiten hacerse una mejor idea de la escala.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Con esas tasas, 1M de tokens equivale aproximadamente a leer una vez 400 páginas web promedio, o ocho artículos de investigación de ese tamaño. También equivale a procesar una vez un codebase de tamaño mediano, o a un mes de uso ligero del chat para una persona.
Considere todo esto como una estimación. El código, JSON y el texto en idiomas distintos del inglés contienen menos palabras por token, por lo que la proporción de 0.75 representa el extremo optimista. Hay otro factor que modifica el recuento: Claude Opus 4.7 y versiones posteriores, incluidos Opus 5 y Sonnet 5, usan un tokenizer más reciente que genera aproximadamente un 30 por ciento más de tokens para el mismo texto que Sonnet 4.6 y versiones anteriores. Claude Haiku 4.5 usa el tokenizer anterior. Por tanto, un recuento medido en Haiku 4.5 subestima el recuento en Sonnet 5 para una entrada idéntica. Esto significa que una comparación directa del precio por millón entre esas versiones no es válida. Cuente el mismo prompt en ambos modelos antes de decidir.
Cuánto cobra Claude por cada millón de tokens
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 tiene un precio introductorio de $2 por los tokens de entrada y $10 por los de salida hasta el 31 August 2026. A partir del 1 September 2026 se aplica la tarifa estándar: $3 por los tokens de entrada y $15 por los de salida. Claude Opus 5 cuesta $5 por los tokens de entrada y $25 por los de salida. Hay un modelo que supera ampliamente esas tarifas: Claude Fable 5 cuesta $10 por los tokens de entrada y $50 por los de salida. Por tanto, si esas tarifas justifican el coste depende de las tareas que le asigne.
Las tarifas cambian. Considere todas las cifras de esta página como un ejemplo práctico fechado en August 2026 y confirme los valores actuales en la página oficial de precios antes de aprobar un presupuesto.
La longitud del contexto no cambia la tarifa. En Claude 4.6 y versiones posteriores, la ventana de contexto completa de 1M tokens se factura con la tarifa estándar. Por tanto, una solicitud de 900,000 tokens cuesta lo mismo por token que una de 9,000 tokens. Un prompt largo cuesta más porque contiene más tokens. No se aplica una tarifa independiente para contextos largos.
La aritmética que sigue siendo válida cuando cambia el precio
Cada factura consta de dos multiplicaciones y una suma.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateEscrito como código ejecutable:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Eso muestra 0.0126. Una solicitud que envía 4,300 tokens de entrada y recibe 400 tokens de salida cuesta aproximadamente 1.3 centavos en Sonnet 5. Mantenga las dos tarifas en un solo lugar del código. Cuando cambie un precio, edite dos líneas y todas las estimaciones del sistema se actualizarán.
Una estimación práctica para una aplicación real
Piense en un asistente de soporte. Su prompt del sistema y la documentación del producto suman 4,000 tokens, y se envían en cada solicitud porque la Messages API no mantiene estado y el modelo no recuerda nada entre llamadas. La pregunta del usuario añade unos 300 tokens. La respuesta tiene unos 400. En total, son 4,300 tokens de entrada y 400 de salida por solicitud.
Un millón de tokens de entrada permite unas 232 solicitudes de ese tipo. Con 1,000 solicitudes al día, la aplicación consume 4.3 millones de tokens de entrada diarios, por lo que «1M tokens» representa menos de seis horas de tráfico.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Con Claude Opus 5, ese tráfico cuesta $31.50 por cada 1,000 solicitudes. Con Sonnet 5, cuesta $12.60. Cambiar a Claude Haiku 4.5 reduce el coste a $6.30, y una caché de prompts activa en Sonnet 5 lo reduce aún más, hasta $5.40.
Multiplique por 30 para calcular un mes con ese tráfico. Sonnet 5, con las tarifas publicadas, cuesta unos $378 al mes. La misma aplicación con una caché activa cuesta unos $162. La elección del modelo y la decisión de usar caché tienen más impacto que cualquier tarifa que pueda negociar con este volumen. Elegir el modelo es una cuestión independiente. La opción más barata que supere sus evaluaciones es la adecuada: cómo elegir entre Opus, Sonnet y Haiku explica cómo probarlo correctamente.
El almacenamiento en caché de prompts reduce la parte repetida
Ese prefijo de 4,000 tokens es idéntico en cada solicitud y se cobra al precio completo de entrada cada vez. El almacenamiento en caché de prompts guarda el prefijo procesado y aplica una tarifa reducida al reutilizarlo.
Una lectura de caché cuesta 0.1 veces la tarifa base de entrada. Escribir en la caché cuesta 1.25 veces la tarifa base durante una vigencia de 5 minutos, o 2 veces la tarifa base durante una vigencia de 1 hora. Por tanto, la caché de 5 minutos se amortiza después de una lectura: la escritura cuesta 0.25 adicional, mientras que cada lectura ahorra 0.9. La caché de 1 hora necesita dos lecturas para alcanzar el punto de equilibrio.
La forma más sencilla de activarla es usar un único campo de nivel superior:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Después, lea el bloque usage que se devuelve:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Esos tres contadores de entrada se facturan con tres tarifas diferentes y suman el volumen real de entrada: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Una estimación de costes que lea sólo input_tokens será muy incorrecta cuando el almacenamiento en caché esté activado.
Dos factores impiden que una caché resulte rentable, y ambos fallan de forma silenciosa.
El prefijo debe ser idéntico byte por byte. La búsqueda de caché compara prefijos, por lo que una marca de tiempo o el nombre del usuario al principio del prompt de sistema lo cambia en cada solicitud. En ese caso, se paga 1.25 veces la tarifa base de entrada cada vez y nunca se hace una lectura. El síntoma es que cache_creation_input_tokens permanece alto mientras cache_read_input_tokens sigue en 0. Coloque cache_control en el último bloque cuyo contenido sea igual entre solicitudes y sitúe después todo lo que varíe. Cambiar las definiciones de tools invalida toda la caché que aparece debajo, porque la invalidación sigue el orden de tools, después system y después messages.
El prefijo debe tener una longitud suficiente. La longitud mínima que se puede almacenar en caché es de 512 tokens en Opus 5, 1,024 en Sonnet 5 y 4,096 en Haiku 4.5. Un prompt más corto no se almacena en caché y no se devuelve ningún error. El prefijo de 4,000 tokens del ejemplo anterior se almacena en caché en Sonnet 5, pero no en Haiku 4.5, porque 4,000 está por debajo del mínimo de ese modelo. Si ambos contadores muestran 0, no se almacenó nada en caché.
El procesamiento por lotes reduce la tarifa a la mitad
La Batch API procesa las solicitudes de forma asíncrona con un descuento del 50 por ciento tanto en la entrada como en la salida. En el ejemplo anterior, eso convierte $12.60 por 1.000 solicitudes en $6.30. El descuento se acumula con el almacenamiento en caché de prompts, por lo que un trabajo por lotes almacenado en caché es la forma más económica de ejecutar tareas masivas.
El coste es la latencia. Por eso, el procesamiento por lotes no sirve para nada que una persona esté esperando. Es adecuado para clasificaciones nocturnas y para completar documentos que faltan.
Por qué aumentan los costes del chat dentro de una sola conversación
Como la API no conserva el estado, el cliente vuelve a enviar toda la conversación en cada turno. Por tanto, el uso de tokens dentro de un mismo chat crece con el cuadrado de su longitud, no de forma lineal.
Supongamos que cada turno tiene una media de 500 tokens. El turno 1 envía 500 tokens de entrada. El turno 2 envía 1,000. El turno 20 envía 10,000. Si se suman con n(n+1)/2, una conversación de 20 turnos habrá enviado aproximadamente 105,000 tokens de entrada, aunque la transcripción sólo tenga 10,000 tokens.
Por eso una función de chat cuesta más de lo que su transcripción parece indicar. También por eso resulta rentable almacenar en caché el prefijo estable o resumir los turnos antiguos en conversaciones largas. Un agente que ejecuta bucles sobre llamadas a herramientas tiene el mismo patrón, y es aún peor: cada resultado de herramienta permanece en el historial y se vuelve a enviar en todos los turnos posteriores. Establecer un límite estricto de gasto para un agente que ejecuta usted mismo es especialmente importante en este caso, porque ese crecimiento es automático y nadie lo supervisa.
Cuente los tokens antes de hacer estimaciones
No derive el recuento de tokens a partir del recuento de palabras. La API los cuenta por usted, sin coste adicional, con un límite de frecuencia independiente de la creación de mensajes.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'La respuesta contiene un campo:
{ "input_tokens": 14 }Envíe su prompt de sistema real y las definiciones de las herramientas, junto con un mensaje de usuario representativo, y coloque el número en la función de coste anterior. El endpoint acepta el mismo cuerpo que una solicitud de mensaje, por lo que las imágenes y los archivos PDF también se cuentan correctamente. Hay dos aspectos importantes. El recuento es una estimación y puede diferir ligeramente del valor facturado. Además, se mide con el tokenizador del modelo que indique; por tanto, indique el modelo que realmente vaya a ejecutar.
Los tokens de salida no se pueden contar por adelantado porque todavía no existen. Limítelos con max_tokens y mida la distribución real a partir de usage.output_tokens en el tráfico de producción.
Qué más se incluye en la factura
Los tokens representan la mayor parte de la factura. Algunos conceptos no son tokens y suelen sorprender.
- Las definiciones de herramientas se convierten en tokens de entrada en cada solicitud. El prompt de sistema de uso de herramientas añade por sí solo entre 286 y 406 tokens en Opus 5, antes de incluir sus propios esquemas. Diez descripciones de herramientas detalladas pueden duplicar un prompt pequeño.
- Las búsquedas web se cobran a $10 por cada 1,000 búsquedas, además de los tokens que consumen los resultados cuando se incorporan al contexto.
- La obtención de páginas web no añade ningún cargo propio, pero la página obtenida se convierte en tokens de entrada. Una página de documentación de 100 kB contiene aproximadamente 25,000 tokens.
- Solicitar inferencia exclusiva para EE. UU. con
inference_geoen Claude 4.6 y versiones posteriores aplica un multiplicador de 1.1 a cada categoría de tokens, incluidas las lecturas y escrituras de caché.
Que la API sea la opción adecuada depende del volumen de uso. Esta cuestión suele plantearse cuando se alcanza el límite de uso de un plan, y las opciones para superar un límite van desde esperar a que termine la ventana hasta trasladar ese trabajo a llamadas a la API con facturación por uso. Por debajo de cierto nivel de uso, un plan mensual fijo resulta claramente más conveniente, y la API comparada con una suscripción de Claude hace esa comparación con cifras reales.
FAQ
¿Cuánto cuesta 1M de tokens en Claude?
Depende del modelo y de si los tokens son de entrada o de salida. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 con el precio introductorio y $5 en Claude Opus 5. La salida cuesta cinco veces la tarifa de entrada en cada uno de esos modelos. Sonnet 5 pasa a costar $3 por los tokens de entrada y $15 por los de salida el 1 de septiembre de 2026. Las tarifas cambian, así que confírmelas en la página oficial de precios antes de incluir una cifra en un presupuesto.
¿1M de tokens equivale a 1M de palabras?
No. Un token equivale aproximadamente a 4 caracteres en inglés, o a unas 0.75 palabras, por lo que un millón de tokens equivale aproximadamente a 750,000 palabras. Esa proporción sólo sirve como referencia. El código, JSON y los idiomas distintos del inglés usan más tokens por palabra. Claude Opus 4.7 y las versiones posteriores también usan un tokenizer más reciente que produce aproximadamente un 30 por ciento más de tokens para el mismo texto que Claude Sonnet 4.6 y las versiones anteriores, por lo que los recuentos no son comparables entre generaciones de modelos. Mida con el endpoint gratuito /v1/messages/count_tokens y pase el modelo que piensa ejecutar.
¿El almacenamiento en caché de prompts siempre reduce los costes?
No. Una escritura en caché de 5 minutos cuesta 1.25 veces la tarifa base de entrada, por lo que un prefijo que se escribe y nunca se vuelve a leer cuesta un 25 por ciento más que enviarlo directamente. Se amortiza desde la primera lectura. Puede fallar de dos formas, ambas silenciosas. Si el prefijo almacenado en caché cambia entre solicitudes, la búsqueda nunca coincide porque debe coincidir exactamente con el prefijo. Si el prefijo es más corto que la longitud mínima que se puede almacenar en caché del modelo, que es de 1,024 tokens en Sonnet 5 y de 4,096 en Haiku 4.5, no se almacena nada en caché y no se devuelve ningún error. Cuando cache_creation_input_tokens y cache_read_input_tokens leen 0, la caché no está haciendo nada.
¿Por qué mi factura aumentó más rápido que el número de mensajes?
Porque la conversación completa se vuelve a enviar en cada turno. La Messages API no mantiene ningún estado, por lo que el turno 20 de un chat vuelve a enviar como entrada los 19 turnos anteriores. Si los turnos tienen una media de 500 tokens, una conversación de 20 turnos envía aproximadamente 105,000 tokens de entrada, aunque la transcripción sólo tenga 10,000 tokens. Los bucles de agentes se comportan igual, porque cada resultado de herramienta permanece en el historial. Almacene en caché el prefijo estable, o resuma los turnos antiguos y elimínelos de la solicitud.