¿La API de Claude sale más barata que una suscripción?
Compara la API con un plan fijo: calcula el punto de equilibrio con las tarifas actuales por token y descubre qué hábitos cambian más el coste que la cuota mensual.
¿La API de Claude es más barata que una suscripción?
La API de Claude es más barata que una suscripción por debajo de cierto volumen de uso y más cara por encima de ese volumen. Para un desarrollador que programa de forma interactiva durante todo el día, el plan de tarifa fija suele ser más rentable. Para un programa que realiza sus propias llamadas, la API es la única opción, por lo que el coste no determina la decisión. El resto son cálculos que puede hacer en diez minutos.
No existe una cifra oficial de equilibrio que pueda consultar. La suscripción se vende mediante ventanas de uso, no mediante asignaciones de tokens, por lo que ninguna cifra publicada puede indicar dónde se cruzan ambas líneas. A continuación se muestra la fórmula, calculada con las tarifas actuales por token, además de los aspectos de su propio comportamiento que influyen mucho más en el resultado que el precio del plan. Todas las cifras de equilibrio siguientes son cálculos propios basados en tarifas publicadas y supuestos indicados; no son cifras documentadas.
Si todavía está decidiendo qué plan comprar, qué plan de Claude se adapta a su forma de trabajar responde a esa pregunta. Este artículo presupone que ya sabe qué plan compraría y que quiere saber si debe comprarlo.
Dos modelos de facturación que no tienen la misma estructura
Una suscripción es capacidad que quizá no utilice. Paga una tarifa fija y obtiene una asignación que se restablece según un calendario. La documentación de Anthropic sobre Claude Code describe esta estructura para las plazas Team y Enterprise: el uso «consume una asignación por plaza que se restablece en una ventana móvil de cinco horas y en una ventana semanal», compartida con el chat de Claude y Cowork. Un suscriptor se encuentra con la misma estructura mediante los mensajes que envía, que muestran «Ha alcanzado el límite de su sesión» y «Ha alcanzado el límite semanal». La capacidad que no utiliza sigue siendo dinero que ha pagado. La capacidad que supera detiene su trabajo hasta que se restablece la ventana, y cambiar de modelo con /model no recupera el acceso, porque las ventanas se comparten entre modelos. Si está viendo uno de esos mensajes ahora mismo, determinar qué ventana está esperando es lo primero, porque los límites de cinco horas y semanal requieren respuestas diferentes.
La API es un contador que no se detiene. No hay ninguna ventana ni ningún límite que detenga el uso. Cada solicitud se factura por token, y algunos conceptos se facturan fuera de los tokens: la búsqueda web «está disponible en Claude API por $10 por cada 1,000 búsquedas». Nada se detiene al alcanzar un límite. La factura simplemente aumenta. Tampoco hay una modalidad gratuita debajo de este modelo, aunque el crédito de registro y los componentes sin coste permiten realizar una primera prueba antes de que importe este cálculo.
Tarifas de los planes a fecha de 23 July 2026, según la página de precios de Claude: Pro cuesta «$17 Per month with annual subscription discount ($200 billed up front). $20 if billed monthly» e incluye Claude Code. Max aparece como «From $100 Per month». Las plazas Team empiezan en «$20 Per seat / month if billed annually». Enterprise es el caso más interesante, porque utiliza ambos modelos a la vez: «Seat price + usage at API rates $20/seat». Si está valorando este modelo híbrido, qué cubre realmente la tarifa de la plaza Enterprise explica los mínimos de plazas y los componentes que sólo aparecen en una oferta negociada. Si está calculando específicamente el coste de la herramienta de programación y no el de Claude en conjunto, cuánto cuesta Claude Code en cada plan aplica esas mismas tarifas a una estimación mensual completa. Si todavía no ha decidido la parte de tarifa fija de Claude, estos niveles comparados con Go, Plus y Pro de ChatGPT cubren la otra mitad de esa decisión. Las tarifas cambian con frecuencia y la asignación de cada plan nunca se publica en tokens, así que consulte la página de precios el día que tome la decisión.
Lo que no puede obtener de la API
Una asignación de plan y la interfaz asociada. El comando /usage-credits de Claude Code gestiona los créditos de uso de la suscripción, y se ejecuta «después de iniciar sesión con su suscripción de claude.ai mediante /login; el comando no está disponible con autenticación mediante clave de API». La pantalla /usage también cambia según el modo de facturación: su bloque Session «muestra el uso de tokens de API y está pensado para usuarios de la API», mientras que los suscriptores ven barras de uso del plan y un desglose del uso. Ambas opciones presuponen que su plan incluye Claude Code, algo que aclara qué planes incluyen Claude Code y cuáles comparten su ventana de uso, incluido el caso en que una clave de API olvidada facture el uso sin que lo advierta. También presuponen que puede abrir esa interfaz en el equipo donde realmente trabaja. En Linux, la lista es más corta de lo que podría esperar. Por eso conviene comprobar qué interfaces se ejecutan de forma nativa allí y qué plan necesita cada una antes de pagar por cualquiera de las dos opciones.
Una caché de prompts más prolongada en Claude Code. Esta opción tiene un coste real y es fácil pasarla por alto. La documentación indica lo siguiente: «La duración es de una hora con una suscripción y baja a cinco minutos cuando se utilizan créditos de uso; con una clave de API o un proveedor cloud, es de cinco minutos de forma predeterminada». El primer mensaje después de una pausa superior a la duración de la caché no la utiliza. Por tanto, todo el contexto se vuelve a procesar y se factura con precios de escritura. Con una suscripción puede asistir a una reunión de cincuenta minutos y volver con la caché disponible. Con una clave de API, la misma pausa obliga a volver a escribir el prefijo completo de la sesión.
Lo que no se obtiene con una suscripción
Acceso programático. Un trabajo de cron o un controlador de webhook que llame a Claude necesita una clave de API. Si esa es su carga de trabajo, la comparación termina aquí. Cómo crear la primera aplicación de Claude API en un VPS explica la gestión de la clave y el primer script funcional.
El descuento de Batch API. La página de precios lo indica claramente: "Batch API permite procesar de forma asíncrona grandes volúmenes de solicitudes con un descuento del 50% tanto en los tokens de entrada como en los de salida." Esto reduce a la mitad el coste de cualquier trabajo que no requiera que una persona espere. Las tarifas de Batch por millón de tokens son de $2.50 de entrada y $12.50 de salida en Opus 4.8, y de $1 y $5 en Sonnet 5 con el precio introductorio, además de $0.50 y $2.50 en Haiku 4.5. El intercambio es la latencia: la mayoría de los lotes terminan en menos de una hora, un lote que no se haya completado en 24 horas caduca y el streaming no se puede incluir en lotes. Batch y la caché de prompts se pueden combinar. Como un lote puede ejecutarse durante más de cinco minutos, use la caché de 1 hora dentro de él.
Asignación de costes por proyecto. Cada respuesta de la API devuelve un bloque usage. Esto permite registrar el coste de una sola solicitud y asignarlo a un proyecto o cliente. Una suscripción muestra un único conjunto de barras para la persona que ocupa el puesto. Al multiplicarlo por un equipo, la decisión deja de ser personal. Por eso Claude Code con precio por puesto frente al mismo trabajo facturado por token es la versión de esta comparación que debe ejecutar cuando compre puestos para otras personas.
Conviene aclarar un punto, porque es fácil suponer lo contrario: son superficies de facturación independientes. La documentación de Anthropic dirige la facturación de las suscripciones al soporte de claude.ai y la facturación de Console a la plataforma de API, y /usage-credits no funciona con una clave de API. Nada de lo que he comprobado indica que una suscripción incluya crédito para la API. Por tanto, planifique dos cuentas y dos facturas.
La fórmula del punto de equilibrio
Mida primero una ejecución y después escálela.
turn cost = uncached_input_tokens x base_input_price
+ cache_write_tokens x 1.25 x base_input_price
+ cache_read_tokens x 0.10 x base_input_price
+ output_tokens x output_price
monthly API cost = turn cost x turns_per_active_day x active_days_per_month
break even when: monthly API cost = flat plan feeLos multiplicadores están publicados, no son estimaciones. Escribir en la caché durante 5 minutos cuesta «1.25x del precio base de entrada», escribir durante 1 hora cuesta «2x del precio base de entrada» y leer de la caché cuesta «0.1x del precio base de entrada». Los tokens de razonamiento se facturan como tokens de salida, por lo que corresponden a output_tokens incluso en los modelos que no muestran un resumen del razonamiento.
Tarifas base por millón de tokens (MTok), vigentes el 23 de julio de 2026:
claude-fable-5: $10 de entrada y $50 de salida. Lectura de caché: $1. Escritura en caché durante 5 minutos: $12.50. Contexto de 1M.claude-opus-4-8yclaude-opus-4-7: $5 de entrada y $25 de salida. Lectura de caché: $0.50. Escritura en caché durante 5 minutos: $6.25. Contexto de 1M.claude-sonnet-5: $2 de entrada y $10 de salida con la tarifa introductoria hasta el 31 de agosto de 2026; después, $3 y $15. Con las tarifas introductorias, la lectura de caché cuesta $0.20 y la escritura en caché durante 5 minutos cuesta $2.50. Contexto de 1M.claude-haiku-4-5: $1 de entrada y $5 de salida. Lectura de caché: $0.10. Escritura en caché durante 5 minutos: $1.25. Contexto de 200K.
No hay ningún recargo por usar un contexto largo: «una solicitud de 900k tokens se factura con la misma tarifa por token que una solicitud de 9k tokens».
Un ejemplo completo, con las suposiciones documentadas
Tomemos un turno de Claude Code a mitad de sesión en Sonnet 5 con 60,000 tokens de contexto: 55,000 servidos desde la caché, 3,000 escritos recientemente en la caché, 2,000 tokens de entrada nuevos sin caché y 1,200 tokens de salida, incluido el razonamiento.
- Lecturas de caché: 55,000 x $0.20/MTok = $0.0110
- Escrituras en caché: 3,000 x $2.50/MTok = $0.0075
- Entrada sin caché: 2,000 x $2.00/MTok = $0.0040
- Salida: 1,200 x $10.00/MTok = $0.0120
Eso equivale a aproximadamente $0.035 por turno. Con 120 turnos en un día de actividad intensa, son aproximadamente $4.14 al día. Con 20 días activos al mes, son aproximadamente $83 al mes.
Compare esa cifra con las tarifas fijas anteriores. El resultado muestra dos cosas a la vez. Es aproximadamente cuatro veces la tarifa de Pro, por lo que Pro es más barato sobre el papel, siempre que su cuota permita realizar 120 turnos de Sonnet al día. Esa condición es precisamente lo que ninguna cifra publicada puede resolver por usted. Lo más cercano a una respuesta es un análisis más detallado de lo que incluye Pro y de dónde sus límites pueden impedirle continuar, que conviene leer antes de suponer que gana la tarifa más barata. Los mismos $83 quedan por debajo de la tarifa inicial de Max, por lo que en este caso el consumo medido resulta más barato que Max. La palabra inicial es importante en la última frase, porque Max se ofrece a dos precios, y cuál de las dos categorías de Max compraría realmente desplaza $100 al mes la línea con la que compara.
Ahora cambie una suposición cada vez y observe cómo la tarifa del plan deja de ser la cifra decisiva.
Tres aspectos desplazan el punto de equilibrio más que el precio del plan
Almacenamiento en caché del prompt. Ejecute el mismo turno de 60,000 tokens sin caché. Todo el prompt se factura como entrada nueva: 60,000 x $2.00/MTok = $0.12, más $0.012 de salida, para un total de $0.132 por turno. Es casi cuatro veces el coste del turno con caché y convierte los $83 mensuales en unos $317. Este es el único punto de equilibrio que publica Anthropic, porque no depende de su carga de trabajo: "Una coincidencia de caché cuesta el 10% del precio estándar de entrada. Por tanto, el almacenamiento en caché resulta rentable después de una sola lectura de caché para la duración de 5 minutos (escritura de 1.25x), o después de dos lecturas de caché para la duración de 1 hora (escritura de 2x)."
Dos modos de fallo desactivan el almacenamiento en caché sin informar de ello. El primero es un prefijo más corto que la longitud mínima que admite el modelo: 512 tokens en Fable 5, 1,024 en Opus 4.8 y Sonnet 5, 2,048 en Opus 4.7 y 4,096 en Haiku 4.5. Un prefijo más corto no se almacena en caché y no se genera ningún error. El segundo son las solicitudes paralelas, porque "una entrada de caché sólo está disponible después de que comienza la primera respuesta". Diez solicitudes idénticas enviadas a la vez pagan el precio completo de entrada. El indicador de ambos casos es cache_read_input_tokens en cero.
Elección del modelo. Calcule el precio del mismo turno con Opus 4.8, a $5 de entrada y $25 de salida, con lecturas de caché a $0.50 y escrituras de 5 minutos a $6.25 por MTok: $0.0275 por las lecturas, $0.0188 por las escrituras, $0.0100 por la entrada sin caché y $0.0300 por la salida. El total es de aproximadamente $0.086 por turno, 2.5 veces el turno con Sonnet, y unos $207 mensuales con el mismo volumen. Una sola elección de modelo trasladó el mismo trabajo desde un coste inferior a la tarifa Max inicial hasta más del doble de esa tarifa. Haiku 4.5, a $1 de entrada y $5 de salida, lo desplaza en la otra dirección para tareas mecánicas como el análisis inicial de registros. Fable 5 lo desplaza aún más en la dirección costosa, con $10 de entrada y $50 de salida. Por eso conviene leer qué trabajos compensan realmente la tarifa de Fable 5 antes de convertirlo en el modelo que usa por defecto.
El nivel de esfuerzo forma parte de la elección del modelo, porque los tokens de razonamiento se facturan con las tarifas de salida. En Opus 4.8, el valor predeterminado de la API es high y el punto de partida documentado para programación y trabajo agéntico es el más costoso xhigh. Redúzcalo con /effort en Claude Code o con output_config.effort en la API. Otro aspecto modifica las estimaciones anteriores: los modelos nuevos usan un tokenizador más reciente que "produce aproximadamente un 30% más de tokens para el mismo texto". Por tanto, un recuento realizado con un modelo antiguo subestima la cantidad de tokens del mismo texto en la actualidad.
Higiene de las sesiones. La API no conserva estado. Por ello, cada turno vuelve a enviar toda la conversación como entrada facturable. Una sesión larga cuesta más por mensaje que una sesión nueva. Este es el mecanismo que explica la mayoría de las facturas inesperadas y se detalla en qué consume realmente tokens en una sesión de Claude Code. Ejecute /clear entre tareas no relacionadas, porque el contexto obsoleto se vuelve a enviar y a facturar en cada mensaje posterior. Ejecute /compact dentro de una tarea larga para resumir el historial en lugar de conservarlo completo. Trabaje en periodos continuos, porque la caché predeterminada "tiene una duración de 5 minutos" y "se actualiza sin coste adicional cada vez que se utiliza el contenido almacenado en caché". Una sesión que se utiliza una vez cada diez minutos paga una nueva escritura en cada ocasión. Una sesión de Claude Code separada que se ejecuta en tmux en un VPS no consume prácticamente nada mientras permanece inactiva, pero superar la duración de la caché mientras está inactiva hace que se pierda el prefijo almacenado en caché.
Mida su propio uso antes de decidir
No decida a partir de mi ejemplo. Decida a partir de una semana de uso propio.
En Claude Code, ejecute /usage al final de cada sesión durante una semana (/cost es un alias para la misma pantalla). Muestra los recuentos de tokens de la sesión y una estimación del coste, con una salvedad de la documentación: "La cifra en dólares es una estimación calculada localmente a partir de los recuentos de tokens y puede diferir de su factura real". Los totales se restablecen cuando ejecuta /clear, así que lea primero la pantalla. En una suscripción, esa cifra en dólares no es su factura, pero los recuentos de tokens que la sustentan son los que necesita esta fórmula. /context muestra qué está ocupando la ventana.
En una cuenta de API, la página de uso de Claude Console es el registro de referencia. Para calcular el precio de un prompt antes de enviarlo, client.messages.count_tokens() es "gratuito, pero sujeto a límites de solicitudes por minuto según su nivel de uso", y es el único recuento que usa el tokenizer con el que se le facturará realmente.
Después de una llamada, lea el bloque de uso y hágalo correctamente:
u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokensinput_tokens cuenta sólo el resto que no está en caché, documentado como los "tokens posteriores al último punto de caché". Un turno que informa input_tokens: 4000 no es un turno de 4,000 tokens, y los tres campos sumados representan el tamaño del prompt que necesita esta fórmula.
Después, compare los resultados. Si el consumo medido queda claramente por debajo de la tarifa del plan, elija el consumo medido. Si queda claramente por encima, elija el plan, siempre que su cuota cubra una jornada laboral normal para usted. Si queda cerca del límite, elija el plan, porque un plan no puede darle sorpresas y el consumo medido sí. Si queda muy por debajo incluso de la tarifa Pro, determine si un plan de pago supera al nivel gratuito según su forma de trabajo antes de contratar cualquiera de las dos opciones, porque un consumo tan bajo quizá no alcance el límite gratuito con la frecuencia necesaria para justificar ningún pago. Además, ninguna de estas decisiones es irreversible: cancelar o bajar de nivel conserva intacto el mes que ya pagó si unas semanas más de uso real contradicen su estimación. Elija la opción que elija, este cálculo sólo determina qué modelo de facturación es más barato. Si el gasto se recupera con las horas ahorradas es el cálculo independiente que debe comparar con su propia tarifa por hora.
FAQ
¿La API de Claude es más barata que Claude Pro o Max?
Depende del volumen. No existe un punto de equilibrio publicado que se pueda consultar, porque las suscripciones se venden como periodos de uso y no como asignaciones de tokens. Calcule el precio de un turno típico con las tarifas publicadas por token, multiplíquelo por los turnos diarios y por los días activos del mes, y compare el resultado con la cuota del plan. En un ejemplo práctico, un turno de 60,000 tokens con Sonnet 5 costó aproximadamente $0.035, o unos $83 al mes con 120 turnos al día durante 20 días: por encima de la cuota de Pro y por debajo de la cuota inicial de Max.
¿Cómo calculo el coste mensual de la API de Claude?
Ejecute /usage en Claude Code durante una semana para recopilar recuentos reales de tokens, o consulte la página de uso en Claude Console si ya tiene una cuenta de API. Después, calcule el precio de un turno: la entrada sin caché se factura con la tarifa base, las escrituras en caché cuestan 1.25 veces la entrada base, las lecturas de caché cuestan 0.1 veces la entrada base y la salida se factura con la tarifa de salida. Los tokens de razonamiento cuentan como salida. Multiplique el resultado por los turnos diarios y por los días activos del mes.
¿Qué factor cambia más una factura de la API de Claude?
La caché de prompts, más que cualquier otro factor. Un turno de 60,000 tokens en Sonnet 5 cuesta aproximadamente $0.035 cuando el prefijo se sirve desde la caché y unos $0.132 cuando no se sirve desde ella. Después viene la elección del modelo: el mismo turno en Opus 4.8 cuesta aproximadamente $0.086. La duración de la sesión ocupa el tercer lugar, porque la API no mantiene estado y cada turno vuelve a enviar toda la conversación como entrada facturable.
¿Una suscripción de Claude incluye acceso a la API?
Trátelos como dos cuentas con dos facturas. Las llamadas a la API se facturan por token contra una cuenta que se crea en Console, y ninguna parte de la documentación que he consultado indica que una suscripción conceda crédito para la API. La señal más clara de que son superficies separadas es el comando /usage-credits de Claude Code, que «no está disponible con autenticación mediante clave de API». Muchos desarrolladores tienen ambos: un plan para la programación interactiva y una clave para lo que crean.