¿Cuánto cuesta 1M de tokens en Claude?
Claude cobra por millón de tokens, con entrada y salida a precios distintos. Consulta el cálculo exacto para estimar tu factura mensual según el modelo.
¿Cuánto cuestan 1M tokens en Claude?
1M tokens significa un millón de tokens y es la unidad en la que se expresa el precio de todas las API (interfaces de programación de aplicaciones) de Claude. No existe un precio único, porque los tokens de entrada y de salida se facturan con tarifas diferentes y cada modelo tiene su propio par de tarifas. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 y $5 en Claude Opus 5.
La salida es la parte más cara. En todos los modelos actuales, la tarifa de salida es cinco veces superior a la de entrada, por lo que la proporción entre ambas determina la factura más que la cifra principal. Una aplicación que envía documentos largos y devuelve respuestas breves se comporta de forma muy diferente de otra que redacta respuestas largas a partir de un prompt corto.
Esta página trata sobre la economía por unidad: cuánto cuesta un token y cómo estimar una factura antes de crear la aplicación. Para saber dónde se utilizan realmente los tokens mientras trabaja, consulte dónde se utilizan los tokens dentro de una sesión de Claude Code.
Cómo se ve 1M de tokens
Un token es un fragmento de texto que el modelo lee o genera. La guía aproximada de Anthropic indica que hay un token por cada 4 caracteres, o aproximadamente 0.75 palabras en inglés. Por tanto, un millón de tokens equivale a unos 750,000 palabras, o aproximadamente 4 MB de texto sin formato.
Las estimaciones publicadas para entradas habituales permiten hacerse una mejor idea de la escala.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Con esas tasas, 1M de tokens equivale aproximadamente a leer una vez 400 páginas web normales, o ocho artículos de investigación de ese tamaño. También equivale a procesar una vez una base de código de tamaño mediano, o a un mes de uso ligero del chat para una persona.
Considere todo esto como una estimación. El código, JSON y el texto en idiomas distintos del inglés contienen menos palabras por token, por lo que la proporción de 0.75 representa el extremo optimista. Hay otro factor que modifica el recuento: Claude Opus 4.7 y las versiones posteriores, incluidos Opus 5 y Sonnet 5, usan un tokenizador más reciente que produce aproximadamente un 30 por ciento más de tokens para el mismo texto que Sonnet 4.6 y las versiones anteriores. Claude Haiku 4.5 usa el tokenizador anterior. Por tanto, un recuento medido en Haiku 4.5 subestima el recuento en Sonnet 5 para una entrada idéntica. Esto significa que una comparación directa del precio por millón entre ambas generaciones no es justa. Cuente el mismo prompt con ambos modelos antes de decidir.
Qué cobra Claude por millón de tokens
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 tiene un precio introductorio de $2 por los tokens de entrada y de $10 por los de salida hasta el 31 de agosto de 2026. A partir del 1 de septiembre de 2026 se aplicará la tarifa estándar: $3 por los tokens de entrada y $15 por los de salida. Claude Opus 5 cuesta $5 y $25. Un modelo queda por encima de toda esa tabla: Claude Fable 5 tiene un precio de $10 por los tokens de entrada y $50 por los de salida, por lo que depende del trabajo al que lo destine que esas tarifas compensen.
Las tarifas cambian. Considere todas las cifras de esta página como un ejemplo calculado con fecha de agosto de 2026 y confirme los valores actuales en la página oficial de precios antes de aprobar un presupuesto.
Estas tarifas indican cuánto cuesta Claude, pero no si es la opción más económica para su carga de trabajo. Tres trabajos con costes calculados para Claude y ChatGPT muestran qué API ofrece un coste menor en cada caso.
La longitud del contexto no cambia la tarifa. En Claude 4.6 y versiones posteriores, la ventana de contexto completa de 1M tokens se factura con la tarifa estándar. Por tanto, una solicitud de 900,000 tokens cuesta lo mismo por token que una de 9,000 tokens. Una solicitud larga cuesta más porque contiene más tokens. No se aplica una tarifa independiente para contextos largos.
La aritmética que sigue siendo válida cuando cambia el precio
Cada factura consta de dos multiplicaciones y una suma.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateEscrito como código ejecutable:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Esto imprime 0.0126. Una solicitud que envía 4,300 tokens de entrada y recibe 400 tokens de salida cuesta aproximadamente 1.3 centavos en Sonnet 5. Mantenga las dos tarifas en un solo lugar del código. Cuando cambie un precio, edite dos líneas y todas las estimaciones del sistema se actualizarán.
Una estimación práctica para una aplicación real
Piense en un asistente de soporte. Su prompt de sistema y la documentación del producto suman 4,000 tokens y se envían en cada solicitud, porque la Messages API no mantiene estado y el modelo no recuerda nada entre llamadas. Una pregunta del usuario añade unos 300 tokens. Una respuesta tiene unos 400. En total, son 4,300 tokens de entrada y 400 de salida por solicitud.
Un millón de tokens de entrada permite unas 232 solicitudes de ese tipo. Con 1,000 solicitudes al día, la aplicación consume 4.3 millones de tokens de entrada diarios, por lo que «1M tokens» representa menos de seis horas de tráfico.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]En Claude Opus 5, ese tráfico cuesta $31.50 por cada 1,000 solicitudes. En Sonnet 5 cuesta $12.60. Si se cambia a Claude Haiku 4.5, el coste baja a $6.30, y una caché de prompts activa en Sonnet 5 lo reduce aún más, hasta $5.40.
Multiplique por 30 para obtener el coste de un mes con ese tráfico. Sonnet 5, con las tarifas publicadas, cuesta unos $378 al mes. La misma aplicación con una caché activa cuesta unos $162. La elección del modelo y la decisión sobre la caché tienen más impacto que cualquier tarifa que pueda negociar con este volumen. Elegir qué modelo ejecutar es una cuestión independiente. La opción más barata que supere sus evaluaciones es la adecuada: cómo elegir entre Opus, Sonnet y Haiku explica cómo probarlo correctamente.
La caché de prompts reduce la parte repetida
Ese prefijo de 4,000 tokens es idéntico en todas las solicitudes y pagas el precio completo de entrada por él cada vez. La caché de prompts almacena el prefijo procesado y aplica una tarifa reducida al reutilizarlo.
Una lectura de la caché cuesta 0.1 veces la tarifa base de entrada. Escribir en la caché cuesta 1.25 veces la tarifa base durante los 5 minutos de vigencia, o 2 veces la tarifa base durante 1 hora. Por tanto, la caché de 5 minutos se amortiza después de una lectura: la escritura cuesta 0.25 adicional, mientras que cada lectura ahorra 0.9. La caché de 1 hora necesita dos lecturas para alcanzar el punto de equilibrio.
La forma más sencilla de activarla es añadir un único campo de nivel superior:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'A continuación, lee el bloque usage que devuelve la respuesta:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Esos tres contadores de entrada se facturan con tres tarifas diferentes y su suma representa tu volumen de entrada real: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Una estimación de costes que lea sólo input_tokens será muy incorrecta cuando la caché esté activada.
Hay dos factores que impiden que una caché resulte rentable. Ambos fallan de forma silenciosa.
El prefijo debe ser idéntico byte a byte. La búsqueda de la caché coincide con un prefijo, por lo que una marca de tiempo o el nombre del usuario al principio del prompt del sistema lo cambia en cada solicitud. En ese caso, pagas 1.25 veces la tarifa base de entrada cada vez y nunca haces una lectura. El síntoma es que cache_creation_input_tokens se mantiene alto mientras cache_read_input_tokens permanece en 0. Coloca cache_control en el último bloque cuyo contenido sea igual entre solicitudes y pon después todo lo que varíe. Cambiar las definiciones de tools invalida toda la caché que aparece después, porque la invalidación se propaga siguiendo este orden: tools, luego system y después messages.
El prefijo debe tener una longitud suficiente. La longitud mínima que se puede almacenar en la caché es de 512 tokens en Opus 5, 1,024 en Sonnet 5 y 4,096 en Haiku 4.5. Un prompt más corto no se almacena en la caché y no se devuelve ningún error. El prefijo de 4,000 tokens del ejemplo anterior se almacena en la caché en Sonnet 5, pero no en Haiku 4.5, porque 4,000 está por debajo del mínimo de ese modelo. Si ambos contadores muestran 0, no se almacenó nada en la caché.
El procesamiento por lotes reduce el coste a la mitad
La Batch API procesa las solicitudes de forma asíncrona con un descuento del 50 por ciento tanto en las entradas como en las salidas. En el ejemplo anterior, eso convierte $12.60 por cada 1.000 solicitudes en $6.30. El descuento se acumula con la caché de prompts, por lo que un trabajo por lotes en caché es la opción más económica para ejecutar cargas masivas.
El inconveniente es la latencia. Por eso, el procesamiento por lotes no es adecuado cuando una persona está esperando el resultado. Encaja bien para clasificaciones nocturnas y para completar documentos pendientes.
Por qué aumentan los costes del chat dentro de una sola conversación
Como la API no conserva el estado, el cliente reenvía toda la conversación en cada turno. Por eso, el uso de tokens dentro de un chat crece con el cuadrado de su longitud, no de forma lineal.
Suponga turnos con un promedio de 500 tokens. El turno 1 envía 500 tokens de entrada. El turno 2 envía 1,000. El turno 20 envía 10,000. Si suma esta serie con n(n+1)/2, una conversación de 20 turnos habrá enviado aproximadamente 105,000 tokens de entrada, aunque la transcripción sólo tenga 10,000 tokens.
Por eso una función de chat cuesta más de lo que su transcripción sugiere. También por eso almacenar en caché el prefijo estable o resumir los turnos antiguos resulta rentable en conversaciones largas. Un agente que ejecuta llamadas a herramientas en un bucle tiene el mismo patrón, y además un coste mayor: cada resultado de herramienta permanece en el historial y se reenvía en todos los turnos posteriores. Establecer un límite de gasto estricto para un agente que ejecuta usted mismo es especialmente importante en este caso, porque ese crecimiento es automático y nadie lo supervisa.
Cuenta los tokens antes de hacer estimaciones
Deja de calcular la cantidad de tokens a partir del número de palabras. La API los cuenta sin coste adicional, con un límite de tasa independiente de la creación de mensajes.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'La respuesta contiene un campo:
{ "input_tokens": 14 }Envíale tu prompt de sistema real y las definiciones de herramientas, junto con un mensaje de usuario representativo. Después, introduce el número en la función de coste anterior. El endpoint acepta el mismo cuerpo que una solicitud de mensaje, por lo que las imágenes y los archivos PDF también se cuentan correctamente. Debes tener en cuenta dos aspectos. El recuento es una estimación y puede diferir ligeramente de la cifra facturada. Además, se mide con el tokenizador del modelo que indiques. Por tanto, indica el modelo que realmente vas a ejecutar.
Los tokens de salida no se pueden contar por adelantado porque todavía no existen. Limítalos con max_tokens y mide la distribución real a partir de usage.output_tokens con tráfico en producción.
Qué más se incluye en la factura
Los tokens representan la mayor parte de la factura. Algunos conceptos no son tokens y suelen sorprender.
- Las definiciones de herramientas se convierten en tokens de entrada en cada solicitud. El prompt de sistema para el uso de herramientas añade por sí solo de 286 a 406 tokens en Opus 5, antes de incluir sus propios esquemas. Diez descripciones de herramientas demasiado extensas pueden duplicar un prompt pequeño.
- Las búsquedas web se cobran a $10 por cada 1,000 búsquedas, además de los tokens que consumen los resultados al incorporarse al contexto.
- La obtención de páginas web no tiene un cargo propio, pero la página obtenida se convierte en tokens de entrada. Una página de documentación de 100 kB equivale aproximadamente a 25,000 de esos tokens.
- Solicitar inferencia exclusiva para EE. UU. con
inference_geoen Claude 4.6 y versiones posteriores aplica un multiplicador de 1.1 a todas las categorías de tokens, incluidas las lecturas y escrituras de caché.
Que la API sea la opción adecuada depende del volumen de uso. Esta cuestión suele plantearse al alcanzar el límite de uso de un plan, y las opciones para superar un límite van desde esperar a que termine la ventana hasta trasladar ese trabajo a llamadas a la API con cobro por uso. Por debajo de cierto nivel de uso, un plan mensual fijo resulta claramente más conveniente, y la comparación entre la API y una suscripción de Claude la hace con cifras reales.
FAQ
¿Cuánto cuesta 1M de tokens en Claude?
Depende del modelo y de si los tokens son de entrada o de salida. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 con el precio introductorio y $5 en Claude Opus 5. En cada uno de esos modelos, la salida cuesta cinco veces la tarifa de entrada. El precio de entrada de Sonnet 5 pasará a $3 y el de salida a $15 el 1 de septiembre de 2026. Las tarifas cambian, así que confírmelas en la página oficial de precios antes de incluir una cifra en un presupuesto.
¿1M de tokens equivale a 1M de palabras?
No. Un token equivale aproximadamente a 4 caracteres en inglés, o a unas 0.75 palabras, por lo que un millón de tokens representa alrededor de 750,000 palabras. Esa proporción sólo sirve como orientación. El código, JSON y los idiomas distintos del inglés usan más tokens por palabra. Claude Opus 4.7 y las versiones posteriores también usan un tokenizador más reciente que genera aproximadamente un 30 por ciento más de tokens para el mismo texto que Claude Sonnet 4.6 y las versiones anteriores. Por tanto, los recuentos no son comparables entre generaciones de modelos. Mida el texto con el endpoint gratuito /v1/messages/count_tokens y especifique el modelo que piensa ejecutar.
¿El almacenamiento en caché de prompts siempre reduce el coste?
No. Escribir una caché de 5 minutos cuesta 1.25 veces la tarifa base de entrada. Por tanto, un prefijo que se escribe y nunca se lee cuesta un 25 por ciento más que enviarlo sin caché. El coste se compensa con la primera lectura. Puede fallar de dos formas, ambas sin mostrar errores. Si el prefijo almacenado cambia entre solicitudes, la búsqueda nunca coincide porque debe coincidir exactamente con el prefijo. Si el prefijo es más corto que la longitud mínima que el modelo permite almacenar en caché, que es de 1,024 tokens en Sonnet 5 y de 4,096 en Haiku 4.5, no se almacena nada y no se devuelve ningún error. Si cache_creation_input_tokens y cache_read_input_tokens muestran ambos el valor 0, la caché no está haciendo nada.
¿Por qué mi factura creció más rápido que el número de mensajes?
Porque toda la conversación se vuelve a enviar en cada turno. La Messages API no mantiene estado, por lo que el turno 20 de un chat vuelve a enviar como entrada los 19 turnos anteriores. Si los turnos tienen un promedio de 500 tokens, una conversación de 20 turnos envía aproximadamente 105,000 tokens de entrada, aunque la transcripción sólo tenga 10,000 tokens. Los bucles de agentes funcionan igual, porque cada resultado de herramienta permanece en el historial. Almacene en caché el prefijo estable, o resuma los turnos antiguos y elimínelos de la solicitud.