SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-27

Qué modelo de Claude usar: guía de costes

¿Opus 4.8, Sonnet 5 o Haiku 4.5? Consulta las tarifas de julio de 2026, compara 100.000 trabajos y ajusta los parámetros que más elevan la factura.

¿Qué modelo de Claude debería usar?

La respuesta breve a qué modelo de Claude debería usar es: empiece con Claude Opus 4.8 y deje de usarlo sólo por un motivo concreto. La recomendación de Anthropic es la misma: «Si no está seguro de qué modelo usar, empiece con Claude Opus 4.8 para tareas complejas de programación agéntica y trabajo empresarial». Cambie a Claude Sonnet 5 cuando la tarea esté bien especificada y la ejecute muchas veces al día. Cambie de nuevo a Claude Haiku 4.5 para trabajo mecánico y de gran volumen, cuando ya sepa cómo debe ser una respuesta correcta. Claude Fable 5 está por encima de todos ellos y está diseñado para agentes de larga ejecución.

La elección tiene un coste asociado. Estas son las tarifas de Claude API (interfaz de programación de aplicaciones) a fecha de 23 July 2026, por millón de tokens, que la documentación escribe como MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok de entrada, $50 / MTok de salida. Contexto de 1M.
  • Claude Opus 4.8 (claude-opus-4-8): $5 de entrada, $25 de salida. Contexto de 1M.
  • Claude Opus 4.7 (claude-opus-4-7): $5 de entrada, $25 de salida. Contexto de 1M.
  • Claude Sonnet 5 (claude-sonnet-5): $2 de entrada, $10 de salida con el precio introductorio hasta el 31 August 2026. El precio estándar de $3 de entrada y $15 de salida entra en vigor el 1 September 2026. Contexto de 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 de entrada, $5 de salida. Contexto de 200K.

Esos identificadores están completos tal como aparecen. No se les añade nada.

El tamaño no añade ningún recargo en los modelos de 1M tokens: «Una solicitud de 900k tokens se factura con la misma tarifa por token que una solicitud de 9k tokens». Esas tarifas también se aplican fuera de la API, porque Claude Enterprise mide el uso con las tarifas de la API además del precio por puesto. Por tanto, todo lo que sigue usa el mismo cálculo para un equipo con un plan por puestos. Una suscripción de tarifa plana cambia el contador, pero no esta decisión, porque los dos niveles de Claude Max incluyen los mismos modelos y sólo se diferencian por la cantidad de uso disponible. En un nivel inferior de la misma escala, los $20 mensuales de Claude Pro compran una cuota de uso en lugar de una tarifa por token, por lo que lo que le detiene allí es el reinicio del límite, no una factura. Si esa es su situación actual, determinar qué ventana está esperando es prioritario antes de hacer cualquier cálculo, porque la solución consiste en usar un modelo más pequeño, un contexto más reducido o pasar a la API, no en buscar una tarifa más baja. Y si todavía no ha empezado a pagar, decidir si Pro merece los $20 en primer lugar depende de la frecuencia con la que el límite gratuito le detenga, no de ninguna de las tarifas anteriores.

Para qué sirve realmente cada modelo

Anthropic describe la línea de modelos con una frase por modelo, y esas frases orientan mejor que cualquier clasificación.

  • Claude Fable 5: "Inteligencia de nueva generación para agentes de larga duración." Es el más lento de los cuatro en latencia.
  • Claude Opus 4.8: "Para programación compleja con agentes y trabajo empresarial." Tiene una latencia moderada.
  • Claude Sonnet 5: "La mejor combinación de velocidad e inteligencia." Es rápido.
  • Claude Haiku 4.5: "El modelo más rápido con una inteligencia cercana a la frontera."

Fable 5 es el único de los cuatro cuyo precio no se evalúa en ninguna carga de trabajo de esta comparación, y, con una tarifa que duplica la de Opus 4.8, la cuestión de qué trabajos justifican pagar $10 para obtener $50 merece una respuesta propia.

Haiku 4.5 también tiene límites que determinan si encaja con un trabajo antes que el precio. Su ventana de contexto es de 200K tokens en lugar de 1M, por lo que un repositorio grande o una transcripción extensa de un agente no cabrán. Su salida máxima en la API síncrona Messages es de 64K tokens, frente a 128K en los otros modelos, y su fecha de corte de conocimiento fiable es febrero de 2025, mientras que la de los otros tres es enero de 2026.

¿Cuánto me cuesta esta elección con una carga de trabajo real?

Todos los modelos de la gama cobran la salida a una tarifa cinco veces superior a la de entrada. Opus 4.8 cuesta $5 por la entrada y $25 por la salida. Haiku 4.5 cuesta $1 por la entrada y $5 por la salida. La proporción se mantiene en toda la gama, por lo que el modelo elegido importa sobre todo en trabajos que generan mucha salida.

El trabajo agéntico pertenece a esa categoría, porque los tokens de razonamiento se facturan como tokens de salida y cuentan para max_tokens aunque el texto nunca llegue a usted. En Fable 5, Opus 4.8, Opus 4.7 y Sonnet 5, el resumen del razonamiento se omite de forma predeterminada, por lo que el campo thinking vuelve vacío. La facturación no cambia: "En ambos casos, el bloque se factura igual y se devuelve igual en las conversaciones de varios turnos." Qué incluye realmente una factura de tokens de Claude analiza ese contador en detalle.

El hecho de que el razonamiento se ejecute o no también varía entre los modelos que compara. Si no tiene esto en cuenta, la prueba de costes quedará invalidada. En Sonnet 5 y Fable 5, el razonamiento ya está activado y no requiere configuración. En Opus 4.8 y Opus 4.7 está desactivado hasta que establezca thinking: {type: "adaptive"} en la solicitud. Iguale la configuración en ambos lados antes de extraer conclusiones de las cifras.

Por qué el modelo más barato puede ser el más caro

Considere una tarea de programación independiente. La solicitud contiene 60,000 tokens de contexto y el modelo genera 8,000 tokens de salida, incluido el razonamiento. No hay almacenamiento en caché, por lo que el cálculo permanece visible.

En Opus 4.8: 0.06 MTok de entrada a $5 cuestan $0.30, y 0.008 MTok de salida a $25 cuestan $0.20. El intento cuesta $0.50. En Haiku 4.5, el mismo intento cuesta $0.06 más $0.04, es decir, $0.10.

Haiku es cinco veces más barato por intento. Esto parece dejar mucho margen hasta que se analiza lo que ocurre cuando un intento falla. Lee la respuesta incorrecta, lo que consume tiempo. La reenvía como contexto en el reintento, por lo que cada intento es más grande que el anterior. Y cuando el tercer intento sigue siendo incorrecto, recurre al modelo superior de todos modos: $0.30 de Haiku más $0.50 de Opus suman $0.80, es decir, un 60% más que ejecutar Opus una sola vez.

Por tanto, la pregunta decisiva es cuánto cuesta comprobar la respuesta. Cuando una respuesta incorrecta es evidente en un segundo, el modelo pequeño es una buena opción. Cuando detectarla exige revisar un diff con atención, el modelo pequeño consume tiempo que no aparece en la factura. Asignar un valor a ese tiempo requiere el mismo cálculo que calcular si un plan de Claude Code se amortiza, y cuando se incluye la tarifa horaria propia en la suma, el modelo más barato suele dejar de parecer barato.

Cuando un modelo más pequeño gana claramente

Haiku 4.5 es la opción adecuada en estos casos:

  • Trabajo mecánico de subagentes. Un subagente que cambia nombres de archivos o recopila resultados de búsqueda no necesita razonamiento de vanguardia. Este es el patrón habitual después de crear un agente de IA con Claude y proporcionarle herramientas auxiliares.
  • Clasificación inicial de registros. Determinar si una línea es ruido o merece la atención de una persona requiere un criterio limitado y tiene un modo de fallo evidente.
  • Clasificación con un conjunto fijo de etiquetas. La salida es breve y la precisión se puede medir con una muestra.
  • Llamadas de producción de gran volumen. Con 100,000 ejecuciones al día, la diferencia por token deja de ser un error de redondeo. Esta es la forma habitual de los flujos de trabajo de IA conectados a n8n.
  • Cualquier caso en el que la velocidad de respuesta sea importante para el usuario. Haiku 4.5 está considerado el modelo más rápido de la gama.

Hay un límite específico de Haiku. Su prompt mínimo almacenable en caché es de 4,096 tokens, frente a 1,024 en Opus 4.8 y Sonnet 5. Por debajo de ese mínimo, "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Un bloque de instrucciones de 1,500 tokens que se almacena en caché con Sonnet 5 no se almacena en caché silenciosamente con Haiku 4.5. La señal es que cache_creation_input_tokens y cache_read_input_tokens aparecen ambos con valor cero. Mantener bajos los costes de un agente siempre activo explica este caso junto con las demás formas de perder una caché.

Los factores que cambian la respuesta

Cada uno de estos factores puede influir más en el coste que el nombre del modelo.

Esfuerzo. output_config.effort controla cuánto trabajo realiza el modelo antes de responder. Los niveles son low, medium, high, xhigh y max, y high es el valor predeterminado: «Configurar effort como high produce exactamente el mismo comportamiento que omitir por completo el parámetro effort». Se incluye dentro de output_config, no en el nivel superior de la solicitud:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

El esfuerzo afecta a todos los tokens de la respuesta: «Puede afectar a todo el consumo de tokens, incluidas las llamadas a herramientas. Por ejemplo, un esfuerzo menor haría que Claude realizara menos llamadas a herramientas». Este efecto se acumula en un bucle agéntico. No es un límite de tokens: «El esfuerzo es una señal de comportamiento, no un presupuesto estricto de tokens». Anthropic no publica ningún multiplicador de coste por nivel y recomienda probar cada caso de uso. Por tanto, puede comparar directamente una ejecución de Sonnet 5 con high con una ejecución de Opus 4.8 con low esta misma tarde. Haiku 4.5 no aparece en la lista de modelos compatibles con el esfuerzo.

Caché de prompts. Una lectura desde la caché cuesta 0.1x de la tarifa base de entrada. Para elegir un modelo importa el efecto de esta reducción entre los distintos niveles. Un acierto de caché en Opus 4.8 cuesta $0.50 / MTok, mientras que una entrada sin caché en Haiku 4.5 cuesta $1 / MTok. Por tanto, un prefijo de Opus con una caché bien aprovechada cuesta menos por token de entrada que un prompt de Haiku sin caché. En cualquier carga de trabajo que reenvíe un prefijo grande y estable, una gestión adecuada de las sesiones tiene más impacto que la elección del modelo.

Procesamiento por lotes. Si nadie necesita esperar la respuesta, la API Message Batches ejecuta los mismos modelos con «un descuento del 50% tanto en los tokens de entrada como en los de salida». Reduce a la mitad cada fila de la comparación siguiente y funciona en todos los niveles: un trabajo por lotes con Opus 4.8 cuesta menos que un trabajo síncrono con Sonnet 5 al precio estándar vigente desde el 1 de septiembre de 2026. El intercambio consiste en aceptar más latencia a cambio de capacidad con el mismo presupuesto.

Una comparación de costes con cifras concretas

La carga de trabajo: clasificar 100,000 correos de soporte, una llamada por correo, con 2,000 tokens de entrada y 300 tokens de salida por llamada. Son 200 MTok de entrada y 30 MTok de salida.

  • Haiku 4.5: 200 x $1 = $200 de entrada, 30 x $5 = $150 de salida. Total: $350.
  • Sonnet 5, tarifa introductoria: 200 x $2 = $400 de entrada, 30 x $10 = $300 de salida. Total: $700.
  • Sonnet 5, desde el 1 de septiembre de 2026: 200 x $3 = $600 de entrada, 30 x $15 = $450 de salida. Total: $1,050.
  • Opus 4.8: 200 x $5 = $1,000 de entrada, 30 x $25 = $750 de salida. Total: $1,750.

Cambie cuatro números para repetir el cálculo con los precios de mañana. Los ajustes siguientes modifican el resultado más que el nombre del modelo:

  • El procesamiento por lotes reduce a la mitad cada línea: $175, $350, $525 y $875. No es necesario esperar a una ejecución nocturna de clasificación, por lo que no hay motivo para omitirla.
  • Almacenamiento en caché del prefijo compartido. Suponga que 1,200 de los 2,000 tokens de entrada corresponden al mismo bloque de instrucciones en cada llamada. En Sonnet 5 con la tarifa introductoria, esos tokens cuestan $0.20 / MTok como aciertos de caché, en lugar de $2 / MTok, por lo que 120 MTok cuestan $24 en vez de $240. Añada 80 MTok de entrada nueva a $2, que son $160, más $300 de salida, y Sonnet 5 queda en aproximadamente $484 en lugar de $700. El mismo método no produce ningún ahorro en Haiku 4.5, porque 1,200 tokens están por debajo de su mínimo de 4,096 tokens.
  • Reintentos. Suponga que rechaza la respuesta de Haiku en el 8% de los correos y vuelve a procesarlos con Opus 4.8. Añada 0.08 x $1,750 = $140 a los $350, para un total de $490. Mida su propia tasa de rechazo en lugar de utilizar la mía.
  • Definiciones de herramientas, si el trabajo las utiliza. El prompt del sistema que generan tiene 290 tokens en Opus 4.8 con tool_choice configurado como auto, 354 en Sonnet 5 y 496 en Haiku 4.5. El modelo más barato tiene la mayor sobrecarga fija.

Haiku con una ruta de escalado que cuesta $490 y Sonnet 5 con caché, que cuesta $484, tienen prácticamente el mismo coste, y uno de ellos realiza el trabajo en una sola pasada. El modelo nunca fue el único factor.

¿Cambiar de modelo a mitad de una sesión ahorra dinero?

Con menos frecuencia de lo que sugieren los precios anunciados, porque el ahorro se calcula por token y lo que se arriesga es todo un prefijo almacenado en caché.

Anthropic documenta qué invalida una caché. Los prefijos se construyen en el orden tools, luego system y después messages, y «Los cambios en cada nivel invalidan ese nivel y todos los niveles posteriores». En esa lista también aparecen dos opciones de la solicitud: «La configuración de razonamiento y el nivel effort resuelto se incluyen en el prompt; por tanto, cambiar cualquiera de ellos inicia un nuevo prefijo de caché». Sobre el esfuerzo, la documentación añade: «varíe el esfuerzo entre cargas de trabajo, no dentro de una conversación que dependa de aciertos de caché».

El modelo no aparece en esa lista documentada, así que no dé por supuesto nada en ningún sentido. Lea cache_read_input_tokens en la primera solicitud posterior al cambio y deje que el número responda. En un prefijo de 150,000 tokens de Opus 4.8, una lectura de caché cuesta aproximadamente $0.08 y una escritura nueva, unos $0.94. Es más que el coste de varios turnos de la diferencia por token que intentaba ahorrar.

Por tanto, cambie estas opciones entre tareas, no dentro de una misma tarea. En Claude Code, eso significa usar primero /clear, cuando la caché se descarta de todos modos, y después /model o /effort. Ambas opciones se introducen en la CLI, así que, si trabaja en Linux, la instalación que merece la pena es la de terminal, porque lo que Anthropic distribuye de forma nativa para Linux combina una CLI estable con una aplicación de escritorio que todavía está en beta. Que el cambio aparezca o no en la factura depende de cómo pague esa sesión, porque Claude Code funciona con un plan mensual fijo o con créditos de API por token y sólo la segunda modalidad asigna un precio en dólares al cambio de modelo. En el plan fijo, el precio de usar un modelo más pesado se descuenta de la ventana de uso, no de la factura. Además, Claude Code está incluido a partir de Pro y consume la misma ventana que las aplicaciones de chat, así que una hora de Opus en la terminal es una hora que no puede usar en el navegador.

Cómo probar la respuesta con su propia carga de trabajo

No dimensione un prompt con un recuento obtenido de otro modelo. El endpoint de recuento de tokens es gratuito y cuenta con el tokenizador del modelo que indique, así que indique el modelo que piensa utilizar. Ese endpoint es una de las pocas partes de la plataforma que nunca genera cargos, y conviene revisar qué más puede ejecutar sin pagar antes de gastar crédito real en una comparación. Opus 4.7 y versiones posteriores, Fable 5 y Sonnet 5 usan un tokenizador más reciente que «produce aproximadamente un 30% más de tokens para el mismo texto», por lo que un presupuesto medido con un modelo anterior resulta inferior en uno más reciente si la tarifa por token no cambia.

Después, lea la respuesta obtenida. input_tokens sólo representa el resto no almacenado en caché, por lo que el tamaño real del prompt es la suma de ese campo, cache_creation_input_tokens y cache_read_input_tokens. Una primera aplicación de Claude API en un VPS es el lugar más pequeño y realista para ejecutar esa medición, y qué plan de Claude se ajusta a su uso es la decisión independiente de si paga por token. Si la cuestión resulta ser qué suscripción conservar y no si debe tener una, los niveles de Claude junto a los precios de ChatGPT explica cuánto cuesta el mismo trabajo de programación en las suscripciones del otro proveedor. Si la medición hace que traslade definitivamente su trabajo a la API, bajar la suscripción un nivel o cancelarla por completo no elimina el periodo que ya ha pagado, por lo que no hay ninguna penalización por decidir cuando ya tenga los datos. Ejecute la misma medición para un equipo en lugar de una sola persona y el resultado vuelve a cambiar, porque una suscripción Team o Enterprise debe superar lo que esa persona habría gastado por token para que valga la pena comprarla.

FAQ

¿Qué modelo de Claude es mejor para programar?

Claude Opus 4.8 es el punto de partida documentado para tareas complejas de programación agéntica, con un precio de $5 por millón de tokens de entrada y $25 por millón de tokens de salida en julio de 2026. Claude Sonnet 5 se presenta como la mejor combinación de velocidad e inteligencia. A $2 / $10 hasta el 31 de agosto de 2026, cuesta menos de la mitad. Ejecute la misma tarea con ambos modelos, mantenga constante la configuración de razonamiento y compare el gasto total de tokens desde response.usage.

¿Claude Haiku 4.5 es lo bastante barato para sustituir a Sonnet 5?

Por token, sí: $1 / $5 frente a $2 / $10 para Sonnet 5 con el precio introductorio, o $3 / $15 desde el 1 de septiembre de 2026. Los límites son los que determinan la respuesta. Claude Haiku 4.5 tiene una ventana de contexto de 200K tokens en lugar de 1M, una salida máxima de 64K en la API Messages síncrona, un límite de conocimiento fiable de febrero de 2025, no admite output_config.effort y exige un prompt de al menos 4,096 tokens para poder almacenarlo en caché. Esto desactiva silenciosamente la caché en prompts de sistema cortos.

¿Cambiar a un modelo de Claude más barato a mitad de una sesión reduce el coste?

Con menos frecuencia de lo que parece. Anthropic documenta como invalidadores de la caché los cambios en el prefijo tools, system o messages, los cambios en la configuración de razonamiento y los cambios en output_config.effort. No está documentado qué efecto tiene el cambio de modelo sobre una caché existente. Trátelo como desconocido y lea cache_read_input_tokens en la primera solicitud posterior. Es importante conocer el coste: con un prefijo de 150,000 tokens de Opus 4.8, una lectura de la caché cuesta aproximadamente $0.08 y una escritura nueva, unos $0.94. Esto supera el ahorro de varias iteraciones por token. Cambie de modelo entre tareas, después de /clear en Claude Code, cuando la caché se vaya a descartar de todos modos.

¿Cómo afecta output_config.effort a mi factura?

Cambia la cantidad de tokens que el modelo consume en texto, llamadas a herramientas y razonamiento. Un nivel de esfuerzo menor genera menos llamadas a herramientas. Esto se acumula en los bucles agénticos porque cada resultado de herramienta se vuelve a enviar en las iteraciones posteriores. Los niveles son low, medium, high, xhigh y max, y high es el valor predeterminado. Anthropic no publica ningún multiplicador de coste por nivel. Define el esfuerzo como una señal de comportamiento, no como un presupuesto de tokens. Por tanto, mídalo en su propia tarea.

¿Cuánto ahorra la API Claude Batches?

Un 50% en los tokens de entrada y de salida, a cambio de una entrega asíncrona. En julio de 2026, esto sitúa Opus 4.8 en $2.50 de entrada / $12.50 de salida, Sonnet 5 en $1 / $5 con el precio introductorio y Haiku 4.5 en $0.50 / $2.50. La comparación más relevante es entre niveles: un trabajo por lotes con Opus 4.8 cuesta menos que un trabajo síncrono con Sonnet 5 a la tarifa estándar desde el 1 de septiembre de 2026. Por tanto, el procesamiento por lotes proporciona un modelo más potente por el mismo coste.