SSD Nodes Learn 8GB de RAM — $66/año
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-02

¿Cuánto cuesta 1M de tokens en Claude?

Claude cobra por millón de tokens y separa entrada y salida. Compara las tarifas de cada modelo y calcula cuánto puede sumar tu factura mensual.

¿Cuánto cuestan 1M tokens en Claude?

1M tokens significa un millón de tokens y es la unidad en la que se expresa el precio de todas las API (interfaces de programación de aplicaciones) de Claude. No existe un precio único, porque los tokens de entrada y de salida se facturan con tarifas diferentes y cada modelo tiene su propio par de tarifas. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 y $5 en Claude Opus 5.

La salida es la parte más cara. En todos los modelos actuales, la tarifa de salida es cinco veces mayor que la tarifa de entrada. Por eso, la proporción entre ambas determina el costo más que la cifra principal. Una aplicación que envía documentos largos y devuelve respuestas breves se comporta de forma muy diferente de otra que redacta respuestas largas a partir de una solicitud breve.

Esta página trata sobre la economía por unidad: cuánto cuesta un token y cómo estimar una factura antes de crear la aplicación. Para saber dónde se usan realmente los tokens durante el trabajo, lee dónde se usan los tokens dentro de una sesión de Claude Code.

Cómo se ven 1M tokens

Un token es un fragmento de texto que el modelo lee o escribe. La guía aproximada de Anthropic indica que corresponde a 1 token por cada 4 caracteres, o a unas 0.75 palabras en inglés. Por tanto, un millón de tokens equivale aproximadamente a 750,000 palabras, o a unos 4 MB de texto sin formato.

Las estimaciones publicadas para entradas habituales permiten apreciar mejor la escala.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

A ese ritmo, 1M tokens equivale aproximadamente a leer una vez 400 páginas web promedio, o a ocho artículos de investigación de ese tamaño. También equivale a procesar una vez un código base de tamaño mediano, o a un mes de uso ligero del chat por parte de una persona.

Considere todo esto como una estimación. El código, JSON y el texto en idiomas distintos del inglés contienen menos palabras por token, por lo que la proporción de 0.75 representa el extremo optimista. Hay otro factor que modifica el recuento: Claude Opus 4.7 y versiones posteriores, incluidos Opus 5 y Sonnet 5, usan un tokenizador más reciente que produce aproximadamente un 30 por ciento más de tokens para el mismo texto que Sonnet 4.6 y versiones anteriores. Claude Haiku 4.5 usa el tokenizador anterior. Por tanto, un recuento medido en Haiku 4.5 subestima el recuento en Sonnet 5 para una entrada idéntica. Esto significa que una comparación directa del precio por millón entre esas versiones no es justa. Cuente el mismo prompt en ambos modelos antes de decidir.

Qué cobra Claude por millón de tokens

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5 tiene un precio introductorio de $2 por los tokens de entrada y de $10 por los tokens de salida hasta el 31 de agosto de 2026. A partir del 1 de septiembre de 2026 se aplicará la tarifa estándar: $3 por los tokens de entrada y $15 por los tokens de salida. Claude Opus 5 cuesta $5 y $25.

Las tarifas cambian. Considere todas las cifras de esta página como un ejemplo calculado con fecha de agosto de 2026 y confirme los valores actuales en la página oficial de precios antes de aprobar un presupuesto.

La longitud del contexto no cambia la tarifa. En Claude 4.6 y versiones posteriores, toda la ventana de contexto de 1M de tokens se factura con la tarifa estándar. Por tanto, una solicitud de 900,000 tokens cuesta lo mismo por token que una de 9,000 tokens. Un prompt largo cuesta más porque contiene más tokens. No se aplica una tarifa independiente para contextos largos.

El cálculo que sigue siendo válido tras un cambio de precio

Cada factura consta de dos multiplicaciones y una suma.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Escrito como código que puede ejecutar:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Esto imprime 0.0126. Una solicitud que envía 4,300 tokens de entrada y recibe 400 tokens de salida cuesta aproximadamente 1.3 centavos en Sonnet 5. Mantenga las dos tarifas en un solo lugar del código. Cuando cambie un precio, edite dos líneas y todas las estimaciones del sistema se actualizarán.

Un cálculo práctico para una aplicación real

Supongamos un asistente de soporte. Su prompt del sistema y la documentación del producto suman 4,000 tokens y se envían en cada solicitud, porque la Messages API no tiene estado y el modelo no conserva nada entre llamadas. Una pregunta del usuario añade unos 300 tokens. Una respuesta suele tener unos 400. Cada solicitud contiene 4,300 tokens de entrada y 400 de salida.

Un millón de tokens de entrada permite unas 232 solicitudes de ese tipo. Con 1,000 solicitudes al día, la aplicación consume 4.3 millones de tokens de entrada diarios. Por tanto, "1M tokens" representa menos de seis horas de tráfico.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Con Claude Opus 5, ese tráfico cuesta $31.50 por cada 1,000 solicitudes. Con Sonnet 5, cuesta $12.60. Cambiar a Claude Haiku 4.5 reduce el coste a $6.30, y una caché de prompts activa en Sonnet 5 lo reduce aún más, hasta $5.40.

Multiplica por 30 para obtener el coste mensual de ese tráfico. Sonnet 5, con las tarifas publicadas, cuesta unos $378 al mes. La misma aplicación con una caché activa cuesta unos $162. La elección del modelo y la decisión de usar caché tienen más impacto que cualquier tarifa que negocies con este volumen. Elegir el modelo es una cuestión independiente. La opción más barata que supere tus evaluaciones es la adecuada: elegir entre Opus, Sonnet y Haiku explica cómo probarlo correctamente.

El almacenamiento en caché de prompts reduce la parte repetida

Ese prefijo de 4,000 tokens es idéntico en todas las solicitudes y se cobra el precio completo de entrada cada vez. El almacenamiento en caché de prompts guarda el prefijo procesado y aplica una tarifa reducida al reutilizarlo.

La lectura de la caché cuesta 0.1 veces la tarifa de entrada base. Escribir en la caché cuesta 1.25 veces la tarifa base para una vigencia de 5 minutos, o 2 veces la tarifa base para una vigencia de 1 hora. Por tanto, la caché de 5 minutos se amortiza después de una lectura, porque la escritura cuesta 0.25 adicional y cada lectura ahorra 0.9. La caché de 1 hora necesita dos lecturas para alcanzar el punto de equilibrio.

La forma más sencilla de activarla es usar un único campo de nivel superior:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Después, lea el bloque usage que se devuelve:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Esos tres contadores de entrada se facturan con tres tarifas diferentes y su suma representa el volumen de entrada real: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Una estimación de costes que solo lea input_tokens será muy imprecisa cuando el almacenamiento en caché esté activado.

Hay dos factores que impiden que la caché resulte rentable. Ambos fallan silenciosamente.

El prefijo debe ser idéntico a nivel de bytes. La búsqueda de la caché compara prefijos. Por eso, una marca de tiempo o el nombre del usuario al principio del prompt del sistema lo cambia en cada solicitud. En ese caso, paga 1.25 veces la entrada base cada vez y no obtiene ninguna lectura. El síntoma es que cache_creation_input_tokens permanece alto mientras cache_read_input_tokens permanece en 0. Coloque cache_control en el último bloque cuyo contenido sea igual entre solicitudes y coloque después todo lo que varíe. Cambiar las definiciones de tools invalida toda la caché posterior, porque la invalidación sigue el orden de las herramientas, luego el sistema y después los mensajes.

El prefijo debe tener una longitud suficiente. La longitud mínima que se puede almacenar en caché es de 512 tokens en Opus 5, 1,024 en Sonnet 5 y 4,096 en Haiku 4.5. Un prompt más corto no se almacena en caché y no se devuelve ningún error. El prefijo de 4,000 tokens del ejemplo anterior se almacena en caché en Sonnet 5, pero no en Haiku 4.5, porque 4,000 está por debajo del mínimo de ese modelo. Si ambos contadores muestran 0, no se almacenó nada en caché.

El procesamiento por lotes reduce la tarifa a la mitad

La Batch API procesa las solicitudes de forma asíncrona con un descuento del 50 por ciento tanto en la entrada como en la salida. En el ejemplo anterior, esto convierte 12.60 USD por cada 1,000 solicitudes en 6.30 USD. El descuento se acumula con el almacenamiento en caché de prompts, por lo que un trabajo por lotes almacenado en caché es la opción más económica para ejecutar trabajos masivos.

La contrapartida es la latencia. Por eso, el procesamiento por lotes no es adecuado para ninguna tarea en la que una persona deba esperar el resultado. Es apropiado para clasificaciones nocturnas y para completar documentos pendientes.

Por qué aumenta el costo de un chat dentro de una sola conversación

Como la API no conserva el estado, el cliente reenvía toda la conversación en cada turno. Por tanto, el uso de tokens dentro de un chat aumenta con el cuadrado de su longitud, no de forma lineal.

Supongamos turnos de 500 tokens en promedio. El turno 1 envía 500 tokens de entrada. El turno 2 envía 1,000. El turno 20 envía 10,000. Si se suman mediante n(n+1)/2, una conversación de 20 turnos habrá enviado aproximadamente 105,000 tokens de entrada, aunque la transcripción solo tenga 10,000 tokens.

Por eso una función de chat cuesta más de lo que sugiere la transcripción, y por eso almacenar en caché el prefijo estable o resumir los turnos antiguos resulta rentable en conversaciones largas. Un agente que ejecuta un bucle de llamadas a herramientas tiene el mismo comportamiento, y el problema es mayor: cada resultado de herramienta permanece en el historial y se reenvía en todos los turnos posteriores. Establecer un límite estricto de gasto para un agente que ejecuta usted mismo es especialmente importante en este caso, porque ese crecimiento es automático y nadie lo supervisa.

Cuenta los tokens antes de hacer estimaciones

Deja de derivar el número de tokens a partir del número de palabras. La API los cuenta por ti, sin coste, mediante un límite de velocidad independiente de la creación de mensajes.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

La respuesta contiene un campo:

{ "input_tokens": 14 }

Envíale tu mensaje de sistema real y las definiciones de las herramientas, junto con un mensaje de usuario representativo, y usa el número en la función de costes anterior. El endpoint acepta el mismo cuerpo que una solicitud de mensaje, por lo que también cuenta correctamente las imágenes y los PDF. Hay dos aspectos importantes. El recuento es una estimación y puede diferir ligeramente de la cifra facturada. Además, se mide con el tokenizador del modelo que indiques, por lo que debes indicar el modelo que realmente vas a ejecutar.

Los tokens de salida no se pueden contar por adelantado porque todavía no existen. Limítalos con max_tokens y mide la distribución real a partir de usage.output_tokens en el tráfico de producción.

Qué más se incluye en la factura

Los tokens representan la mayor parte de la factura. Algunos conceptos no son tokens y pueden sorprender.

  • Las definiciones de herramientas se convierten en tokens de entrada en cada solicitud. El prompt del sistema de uso de herramientas, por sí solo, añade de 286 a 406 tokens en Opus 5, antes de incluir sus propios esquemas. Diez descripciones de herramientas demasiado detalladas pueden duplicar un prompt pequeño.
  • La búsqueda web se cobra a $10 por cada 1,000 búsquedas, además de los tokens que consumen los resultados al incorporarse al contexto.
  • Web fetch no añade una tarifa propia, pero la página obtenida se convierte en tokens de entrada. Una página de documentación de 100 kB contiene aproximadamente 25,000 de estos tokens.
  • Solicitar inferencia exclusiva para EE. UU. con inference_geo en Claude 4.6 y versiones posteriores aplica un multiplicador de 1.1 a cada categoría de tokens, incluidas las lecturas y escrituras de caché.

La conveniencia de comprar la API depende también de su volumen de uso. Por debajo de cierto nivel de uso, un plan mensual fijo resulta claramente más económico, y la comparación entre la API y una suscripción a Claude analiza esa diferencia con cifras reales.

FAQ

¿Cuánto cuestan 1M tokens en Claude?

Depende del modelo y de si los tokens son de entrada o de salida. En agosto de 2026, un millón de tokens de entrada cuesta $1 en Claude Haiku 4.5, $2 en Claude Sonnet 5 con el precio introductorio y $5 en Claude Opus 5. En cada uno de estos modelos, la salida cuesta cinco veces la tarifa de entrada. El precio de entrada de Sonnet 5 cambiará a $3 y el de salida a $15 el 1 de septiembre de 2026. Las tarifas cambian. Confírmalas en la página oficial de precios antes de incluir una cifra en un presupuesto.

¿1M tokens equivale a 1M palabras?

No. Un token equivale aproximadamente a 4 caracteres en inglés, o a unas 0.75 palabras. Por tanto, un millón de tokens equivale aproximadamente a 750,000 palabras. Esta proporción solo sirve como orientación. El código, JSON y los idiomas distintos del inglés usan más tokens por palabra. Claude Opus 4.7 y las versiones posteriores también usan un tokenizador más reciente que genera aproximadamente un 30 por ciento más de tokens para el mismo texto que Claude Sonnet 4.6 y las versiones anteriores. Por eso, los recuentos no son comparables entre generaciones de modelos. Haz la medición con el endpoint gratuito /v1/messages/count_tokens y especifica el modelo que quieres ejecutar.

¿El almacenamiento en caché de prompts siempre reduce los costes?

No. Escribir una caché de 5 minutos cuesta 1.25 veces la tarifa base de entrada. Por tanto, un prefijo que se escribe y nunca se lee cuesta un 25 por ciento más que enviarlo sin caché. La caché se amortiza desde la primera lectura. Puede fallar de dos formas, y ambas son silenciosas. Si el prefijo almacenado cambia entre solicitudes, la consulta nunca coincide porque la coincidencia debe ser exacta. Si el prefijo es más corto que la longitud mínima que admite la caché del modelo, que es de 1,024 tokens en Sonnet 5 y de 4,096 en Haiku 4.5, no se almacena nada en la caché y no se devuelve ningún error. Si cache_creation_input_tokens y cache_read_input_tokens muestran ambos el valor 0, la caché no está haciendo nada.

¿Por qué mi factura aumentó más rápido que el número de mensajes?

Porque toda la conversación se vuelve a enviar en cada turno. La Messages API no mantiene ningún estado. Por eso, el turno 20 de un chat vuelve a enviar como entrada los 19 turnos anteriores. Con un promedio de 500 tokens por turno, una conversación de 20 turnos envía aproximadamente 105,000 tokens de entrada, aunque la transcripción solo tenga 10,000 tokens. Los bucles de agentes funcionan igual, porque cada resultado de herramienta permanece en el historial. Almacena en caché el prefijo estable, o resume los turnos anteriores y elimínalos de la solicitud.

#claude#tokens#api-pricing#cost-estimation#prompt-caching