¿Cuántos tokens incluye Claude Pro?
Claude Pro no publica una cuota fija de tokens: el uso se mide por mensajes en una ventana móvil y los chats largos consumen el límite más rápido.
¿Cuántos tokens incluye Claude Pro?
Claude Pro no incluye una asignación de tokens y, a septiembre de 2026, Anthropic no publica ninguna. Una suscripción de Claude se mide en mensajes dentro de una ventana de tiempo móvil, no en tokens descontados de un saldo. El alcance de esa ventana depende del modelo que elija, de cuánto haya crecido la conversación y de cuánto texto incluya cada turno.
Esta es la respuesta que rara vez recibe esta pregunta, porque se espera que un plan funcione como una clave de API. Una clave de API consume un saldo contado en tokens, por lo que puede calcular el importe de la factura. Un plan vende acceso hasta un límite que Anthropic establece y ajusta, y ese límite se expresa en mensajes. Por tanto, no hay una cantidad fija de tokens que se pueda indicar. Quien le dé una cifra la ha inventado.
Formule otra pregunta. ¿Qué hace que mis mensajes sean costosos? Esa pregunta sí tiene una respuesta concreta y puede actuar sobre ella hoy mismo.
Por qué una suscripción no puede indicar una cantidad de tokens
La API factura cada solicitud por tokens. Los tokens de entrada incluyen todo lo que envía, y los tokens de salida incluyen todo lo que el modelo devuelve. Además, tienen tarifas diferentes. Por eso los tokens de entrada y salida tienen costes diferentes antes de hacer cualquier estimación.
Los planes para consumidores no tienen un saldo que gastar. Anthropic limita cuántos mensajes puede enviar dentro de una ventana móvil que comienza con su primer mensaje y se cierra después de un número determinado de horas. Los planes de pago tienen además un segundo límite más amplio, medido a lo largo de una semana. Un mensaje no tiene un tamaño fijo. Por tanto, el mismo número de mensajes representa una cantidad de trabajo muy diferente para dos personas distintas. Las páginas de ayuda de Anthropic describen los límites como un número aproximado de mensajes para una conversación breve. Después advierten que las conversaciones largas y los archivos adjuntos grandes consumen la asignación más rápido. Esa advertencia resume todo el funcionamiento, pero casi nunca se explica el mecanismo que hay detrás.
Por qué el turno 20 de un chat cuesta mucho más que el turno 1
El modelo no conserva memoria entre solicitudes. No tiene estado, por lo que en cada turno vuelve a enviar toda la conversación: el mensaje del sistema, cada mensaje anterior que escribiste, cada respuesta anterior de Claude y cada archivo adjunto. Tu nueva pregunta puede tener veinte palabras. La solicitud que la contiene es toda la transcripción.
Por tanto, el coste de un turno aumenta con la longitud del chat y lo hace de forma lineal. Las filas siguientes muestran ese cálculo con un conjunto de supuestos redondos: un mensaje del sistema de unos 1,000 tokens, mensajes tuyos de unos 1,000 tokens cada uno y respuestas de unos 1,200 tokens cada una. Sirven para ilustrar el mecanismo. No miden tu cuenta.
The data behind this chart
[
{
"label": "Turn 1",
"sent_this_turn": "2,000",
"cumulative_input": "2,000"
},
{
"label": "Turn 5",
"sent_this_turn": "10,800",
"cumulative_input": "32,000"
},
{
"label": "Turn 10",
"sent_this_turn": "21,800",
"cumulative_input": "119,000"
},
{
"label": "Turn 20",
"sent_this_turn": "43,800",
"cumulative_input": "458,000"
}
]En el primer turno se envían 2,000 tokens de entrada. En el turno 20, la misma pregunta breve envía 43,800, más de veinte veces esa cantidad, aunque tú hayas escrito lo mismo. En toda la conversación has enviado 458,000 tokens de entrada, y la mayor parte corresponde al mismo texto enviado una y otra vez.
Veinte chats independientes de un solo turno habrían enviado veinte veces la primera fila anterior y nada más. Las mismas preguntas, con una fracción de la carga. Los archivos adjuntos amplían la diferencia, porque un PDF que adjuntaste en el turno dos vuelve a enviarse en el turno tres, en el turno cuatro y en todos los turnos posteriores, aunque la conversación ya no trate sobre él.
Por eso dos personas con el mismo plan informan de un rendimiento completamente distinto. Una mantiene un solo hilo abierto durante toda la semana y alcanza el límite el miércoles. La otra abre un chat nuevo para cada tarea y rara vez ve un límite. Ninguna está haciendo nada incorrecto. Su consumo de tokens difiere en un orden de magnitud porque sus hábitos son distintos.
En la API puedes reducir el coste de repetir contenido mediante el almacenamiento en caché de prompts, que guarda la parte inicial sin cambios de una solicitud para que las llamadas posteriores facturen esa parte a una tarifa de entrada reducida. Con una suscripción no controlas el almacenamiento en caché, por lo que la longitud de la conversación es la variable que realmente puedes controlar. El mismo mecanismo predomina en las sesiones de programación, donde el contenido de los archivos y las definiciones de herramientas se incluyen en cada turno. Por eso mantener pequeño el contexto de una sesión de programación ayuda más con tus límites que cualquier ajuste, y conviene leer dónde se consumen realmente los tokens de una sesión de Claude Code antes de culpar al plan.
Qué ofrece cada nivel del plan en términos relativos
Ningún nivel publica una cuota absoluta. Lo que se publica es relativo, y esa comparación basta para elegir. Free se sitúa en la parte inferior, y su capacidad puede reducirse cuando la demanda del servicio es alta. Pro está por encima. Max se ofrece en dos tamaños, descritos como múltiplos del uso de Pro: aproximadamente cinco veces y aproximadamente veinte veces. Team y Enterprise tienen un precio por usuario y sus propios límites.
Considere esos multiplicadores como una declaración de intención, no como un contrato. Anthropic ajusta los límites, y esos ajustes no se anuncian con antelación. Por eso tampoco una página fiable puede proporcionarle una cifra de tokens. Para la parte económica de la misma comparación, cuánto cuesta Pro y dónde aplica límites y la diferencia entre los dos niveles de Max cubren ese tema. qué permite realmente el plan Free cubre el nivel mínimo.
La elección del modelo es un segundo multiplicador que se aplica sobre el nivel del plan. La misma pregunta consume una parte mayor de su ventana con el modelo más grande que con el más pequeño, porque ejecutar un modelo más pesado cuesta más por token. Pasar las tareas rutinarias de Opus a Sonnet o Haiku suele proporcionar más tiempo de trabajo que una actualización del plan. Por eso, asignar el modelo adecuado a cada tarea es lo primero que debe probar cuando se queda sin capacidad continuamente.
Cómo consultar tu propio uso en lugar de hacer estimaciones
Tu propia cuenta es la única fuente fiable y está a dos clics. En claude.ai, abre Settings y después Usage. Allí se muestra lo que has consumido en la ventana actual y cuándo se restablece. Compruébalo una vez cuando las respuestas empiecen a rechazarse y otra después de una sesión larga. Así conocerás tu patrón antes y con más precisión que con cualquier cifra publicada.
En Claude Code, dos comandos slash hacen lo mismo desde el terminal. /usage muestra el uso del plan y la hora de restablecimiento. /context desglosa qué está ocupando ahora la ventana de contexto y separa el prompt del sistema, las definiciones de herramientas, los archivos y el historial de la conversación. Cuando /context muestra que la conversación antigua ocupa la mayor parte, /clear inicia una sesión nueva y el coste por turno vuelve a aproximarse a la primera fila de la tabla anterior.
En la API, el recuento es exacto y puedes solicitarlo antes de enviar nada:
curl https://api.anthropic.com/v1/messages/count_tokens \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached report."}]
}'Una respuesta correcta contiene un único campo, que es el número que se usará para la facturación:
{"input_tokens": 14}Cada solicitud completada informa del mismo cálculo cuando termina:
{"usage": {"input_tokens": 21430, "output_tokens": 512}}Envía una pregunta breve como solicitud nueva y después envía esa misma pregunta al final de un hilo largo. Compara los dos valores de input_tokens. La diferencia muestra exactamente el efecto que mide tu suscripción, expresado en un número.
Qué hacer cuando el límite se alcanza en mitad de una tarea
- Espere a que termine la ventana. La aplicación muestra la hora del restablecimiento, y la espera suele ser más corta que la solución alternativa. Esta es la opción adecuada cuando no hay nada urgente.
- Cambie a un modelo más ligero. Un modelo más pequeño cuesta menos por turno en todos los planes y, en algunos planes, consume una cuota independiente. Así, el trabajo puede continuar mientras el modelo más potente espera.
- Inicie un chat nuevo con sólo lo que necesita el siguiente paso. Pegue la conclusión, no la transcripción. El coste por turno disminuye de inmediato y las respuestas suelen mejorar, porque el modelo ya no tiene que procesar miles de tokens de una conversación ya resuelta.
- Traslade el trabajo a la API, donde los tokens se cuentan por solicitud y se facturan por token. No hay que esperar a que termine ninguna ventana y puede ver el precio de cada llamada antes y después de realizarla.
La opción adecuada depende de si el problema es el reloj o la carga de trabajo. Un aumento puntual de la demanda es un problema de sincronización. Un límite que alcanza cada miércoles es un problema de carga de trabajo y requiere la API o un plan más amplio, no una mejor sincronización. la lista de comprobación completa para un límite que se alcanza en mitad de una tarea explica la recuperación paso a paso, y cómo se abren y restablecen las ventanas móviles explica por qué el reloj funciona de esa manera. Si va a utilizar la API, calcule primero el precio: la API comparada con una suscripción para la misma carga de trabajo y cuánto cuestan realmente un millón de tokens muestran las cifras antes de cambiar.
FAQ
¿Cuántos tokens incluye Claude Pro?
Anthropic no publica una asignación de tokens para Pro y, a fecha de septiembre de 2026, no existe ninguna cifra que se pueda citar. Pro mide el uso en mensajes dentro de una ventana móvil, con un límite adicional calculado a lo largo de una semana. El número de mensajes disponibles varía según el modelo y la longitud de la conversación. Cualquier página que indique una cifra mensual concreta de tokens para Pro está haciendo una estimación. Abra Settings y, después, Usage en claude.ai para consultar su consumo y cuándo se restablece el límite.
¿Abrir un chat nuevo restablece mi uso?
No. El uso se contabiliza para toda la cuenta dentro de la ventana, por lo que un chat nuevo no devuelve lo que ya ha consumido. Lo que cambia es el coste de cada turno a partir de ese momento. Un chat nuevo no tiene una transcripción que volver a enviar, así que empieza en el extremo inferior del gráfico anterior en lugar de seguir aumentando. Abrir un chat nuevo cuando cambia el tema es el hábito más económico disponible en cualquier plan.
¿Por qué alcancé el límite más rápido hoy que ayer?
Normalmente, porque el trabajo de hoy se desarrolló en un único hilo largo. Cada turno vuelve a enviar toda la conversación y cualquier archivo adjunto, por lo que el coste por mensaje aumenta de forma constante aunque el número de mensajes no cambie. La otra causa habitual es el modelo: los modelos más pesados consumen la asignación más rápido en cada turno, por lo que una tarde con el modelo más grande termina antes que una mañana con uno más pequeño.
¿Debería pasar a la API para obtener un recuento real de tokens?
Pase a la API si necesita cifras o previsibilidad. La API cuenta los tokens de entrada y salida en cada llamada, ofrece un endpoint de recuento de tokens que puede ejecutar antes del envío y no tiene ninguna ventana cuyo restablecimiento deba esperar. La facturación es por token, por lo que un uso intensivo cuesta más que una suscripción fija y un uso ligero cuesta mucho menos. Calcule el coste de su carga de trabajo real con respecto a su plan actual antes de cambiar, porque el resultado depende de cuántos tokens envíe.