SSD Nodes Learn
Guías Matt ConnorPor Matt Connor · Actualizado 2026-07-24

Qué modelo de Claude usar y costes API

Comparativa de precios de Claude Opus 4.8, Sonnet 5 y Haiku 4.5. Análisis de costes por millón de tokens y comparativa de gastos para 100000 jobs.

¿Qué modelo de Claude debo usar?

La respuesta corta sobre qué modelo de Claude usar es: comienza con Claude Opus 4.8, y cámbiate solo si tienes una razón específica. La recomendación de Anthropic es la misma. "Si no estás seguro de qué modelo usar, comienza con Claude Opus 4.8 para tareas complejas de codificación agente y trabajo empresarial". Cambia a Claude Sonnet 5 cuando la tarea esté bien especificada y se ejecute muchas veces al día. Cambia nuevamente a Claude Haiku 4.5 para trabajos mecánicos de alto volumen donde ya conozcas el formato de la respuesta correcta. Claude Fable 5 se sitúa por encima de todos ellos para agentes de larga duración.

La elección tiene un coste. Estas son las tarifas de la Claude API (application programming interface) al 23 de julio de 2026, por millón de tokens (MTok).

  • Claude Fable 5 (claude-fable-5): $10 / MTok entrada, $50 / MTok salida. 1M de contexto.
  • Claude Opus 4.8 (claude-opus-4-8): $5 entrada, $25 salida. 1M de contexto.
  • Claude Opus 4.7 (claude-opus-4-7): $5 entrada, $25 salida. 1M de contexto.
  • Claude Sonnet 5 (claude-sonnet-5): $2 entrada, $10 salida con precio de introducción hasta el 31 de agosto de 2026. El precio estándar de $3 entrada, $15 salida entra en vigor el 1 de septiembre de 2026. 1M de contexto.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 entrada, $5 salida. 200K de contexto.

Esos identificadores son exactos tal como están escritos. No se les añade nada.

El tamaño no aplica recargos en los modelos de 1M de tokens: "Una solicitud de 900k tokens se factura a la misma tarifa por token que una solicitud de 9k tokens".

Uso real de cada modelo

Anthropic describe la línea de productos con una frase por modelo; estas descripciones son más útiles que cualquier ranking.

  • Claude Fable 5: "Inteligencia de próxima generación para agentes de ejecución prolongada". Es el modelo con mayor latencia de los cuatro.
  • Claude Opus 4.8: "Para codificación de agentes complejos y trabajo empresarial". Latencia moderada.
  • Claude Sonnet 5: "La mejor combinación de velocidad e inteligencia". Rápido.
  • Claude Haiku 4.5: "El modelo más rápido con inteligencia cercana al límite del sector".

Haiku 4.5 también tiene limitaciones que definen su utilidad antes que el precio. Su ventana de contexto es de 200K tokens en lugar de 1M, por lo que no admite repositorios grandes o transcripciones de agentes extensas. Su salida máxima en la Messages API síncrona es de 64K tokens frente a los 128K de los demás, y su fecha de corte de conocimiento es febrero de 2025, mientras que los otros tres llegan hasta enero de 2026.

¿Cuánto me cuesta la elección en una carga de trabajo real?

Todos los modelos de la línea tienen un precio de salida cinco veces superior al de entrada. Opus 4.8 cuesta $5 de entrada y $25 de salida. Haiku 4.5 cuesta $1 de entrada y $5 de salida. Esta proporción se mantiene en toda la gama, por lo que el modelo elegido es crítico en tareas que generan mucha salida.

El trabajo de agentes es de este tipo, ya que los tokens de razonamiento se facturan como tokens de salida y cuentan para max_tokens incluso si el texto nunca se recibe. En Fable 5, Opus 4.8, Opus 4.7 y Sonnet 5, el resumen de razonamiento se omite por defecto, por lo que el campo thinking se devuelve vacío. La facturación no cambia: "En cualquier caso, el bloque se factura y se devuelve de la misma forma en conversaciones de múltiples turnos". Qué llena realmente una factura de Claude analiza este proceso detalladamente.

La ejecución del razonamiento varía según los modelos comparados, lo que invalidará una prueba de costes si se omite este detalle. En Sonnet 5 y Fable 5, el razonamiento está activado por defecto y no requiere configuración. En Opus 4.8 y Opus 4.7, está desactivado hasta que se configure thinking: {type: "adaptive"} en la solicitud. Asegúrese de que la configuración sea idéntica en ambos lados antes de analizar los datos.

Por qué el modelo más barato puede ser el más caro

Considere una tarea de programación aislada. La solicitud tiene 60,000 tokens de contexto y el modelo genera 8,000 tokens de salida incluyendo el proceso de pensamiento. Sin uso de caching, el cálculo es directo.

En Opus 4.8: 0.06 MTok de entrada a $5 son $0.30, y 0.008 MTok de salida a $25 son $0.20. El intento cuesta $0.50. En Haiku 4.5, el mismo intento cuesta $0.06 más $0.04, es decir, $0.10.

Haiku es cinco veces más barato por intento, lo que parece un ahorro considerable hasta que se analiza el efecto de un intento fallido. Si recibe una respuesta incorrecta, pierde tiempo. Al reintentar, debe enviar la respuesta anterior como contexto, por lo que cada intento es más grande que el anterior. Si el tercer intento falla, recurrirá al modelo superior: $0.30 de Haiku más $0.50 de Opus suman $0.80, un 60% más que ejecutar Opus una sola vez.

Por tanto, la pregunta clave es qué tan barato puede verificar la respuesta. Si una respuesta incorrecta es obvia en un segundo, el modelo pequeño es rentable. Si detectar el error requiere leer un diff con detalle, el modelo pequeño le costará tiempo que no aparece en la factura.

Casos donde un modelo más pequeño es superior

Haiku 4.5 es la opción correcta en estos casos:

  • Tareas mecánicas de subagentes. Un subagente que renombra archivos o recopila resultados de búsqueda no requiere razonamiento avanzado. Este es el patrón estándar tras construir un agente de IA con Claude y asignarle ayudantes.
  • Triaje de logs. Determinar si una línea es ruido o requiere atención humana es un juicio limitado con un modo de fallo evidente.
  • Clasificación con un conjunto de etiquetas fijo. La salida es corta y la precisión es medible mediante una muestra.
  • Llamadas de producción de alto volumen. Con 100,000 ejecuciones diarias, la diferencia de coste por token deja de ser un error de redondeo. Este es el formato habitual de los flujos de trabajo de IA integrados en n8n.
  • Cualquier tarea donde la velocidad de respuesta sea crítica para el usuario. Haiku 4.5 es el modelo más rápido de la gama.

Haiku tiene una limitación específica. Su prompt mínimo para usar cache es de 4,096 tokens, frente a los 1,024 de Opus 4.8 y Sonnet 5; por debajo de ese mínimo, "cualquier solicitud para cachear menos de este número de tokens se procesará sin cache y no se devolverá ningún error". Un bloque de instrucciones de 1,500 tokens que se cachea silenciosamente en Sonnet 5 no se cacheará en Haiku 4.5. El indicador es que cache_creation_input_tokens y cache_read_input_tokens permanecen en cero, lo cual afecta a reducir los costes de un agente siempre activo junto con otras formas de perder el cache.

Los parámetros que modifican la respuesta

Cada uno de estos elementos altera el coste más que el nombre del modelo.

Effort. output_config.effort controla la cantidad de procesamiento que realiza el modelo antes de responder. Los niveles son low, medium, high, xhigh y max, siendo high el valor por defecto: "Configurar effort en high produce exactamente el mismo comportamiento que omitir el parámetro effort por completo". Se encuentra anidado dentro de output_config en lugar de estar en el nivel superior de la solicitud:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

El parámetro Effort afecta a cada token de la respuesta: "Puede afectar a todo el gasto de tokens, incluyendo las llamadas a herramientas (tool calls). Por ejemplo, un nivel de effort bajo haría que Claude realice menos tool calls". Esto tiene un efecto acumulativo en un bucle de agentes. No es un límite de tokens: "Effort es una señal de comportamiento, no un presupuesto estricto de tokens". Anthropic no publica un multiplicador de coste por nivel y recomienda probar cada caso de uso; por tanto, comparar una ejecución de Sonnet 5 en high frente a una de Opus 4.8 en low es una comparativa válida que puede realizar hoy mismo. Haiku 4.5 no figura en la lista de modelos que admiten effort.

Prompt caching. Una lectura de caché cuesta 0.1x la tarifa de entrada base; el factor determinante para elegir un modelo es el coste resultante en cada nivel. Un acierto de caché (cache hit) en Opus 4.8 cuesta $0.50 / MTok, mientras que la entrada sin caché en Haiku 4.5 cuesta $1 / MTok. Por tanto, un prefijo de Opus con caché es más económico por token de entrada que un prompt de Haiku sin caché. La gestión de la sesión es más importante que la elección del modelo en cualquier carga de trabajo que reenvíe un prefijo grande y estable.

Batches. Si la respuesta no requiere inmediatez, la API de Message Batches ejecuta los mismos modelos con "un 50% de descuento tanto en tokens de entrada como de salida". Esto reduce a la mitad cada valor de la siguiente comparativa y funciona en todos los niveles: un trabajo por batches en Opus 4.8 es más barato que un trabajo síncrono en Sonnet 5 con el precio estándar a partir del 1 de septiembre de 2026, intercambiando latencia por capacidad por el mismo dinero.

Comparativa de costes por unidad de trabajo

La carga de trabajo: clasificar 100,000 correos de soporte. Cada llamada consume 2,000 tokens de entrada y 300 tokens de salida. Esto equivale a 200 MTok de entrada y 30 MTok de salida.

  • Haiku 4.5: 200 x $1 = $200 de entrada, 30 x $5 = $150 de salida. Total $350.
  • Sonnet 5, tarifa de lanzamiento: 200 x $2 = $400 de entrada, 30 x $10 = $300 de salida. Total $700.
  • Sonnet 5, desde el 1 de septiembre de 2026: 200 x $3 = $600 de entrada, 30 x $15 = $450 de salida. Total $1,050.
  • Opus 4.8: 200 x $5 = $1,000 de entrada, 30 x $25 = $750 de salida. Total $1,750.

Modifique cuatro valores para recalcular con los precios de mañana. Los ajustes a continuación alteran el resultado más que el nombre del modelo:

  • Batching reduce el coste a la mitad en cada línea: $175, $350, $525 y $875. No hay tiempo de espera en ejecuciones de clasificación nocturnas, por lo que no hay razón para omitirlo.
  • Caching del prefijo compartido. Supongamos que 1,200 de los 2,000 tokens de entrada son el mismo bloque de instrucciones siempre. En Sonnet 5 con la tarifa de lanzamiento, esto cuesta $0.20 / MTok como cache hits en lugar de $2 / MTok. Así, 120 MTok cuestan $24 en vez de $240. Sume 80 MTok de entrada nueva a $2, que son $160, más $300 de salida, y el coste de Sonnet 5 se sitúa cerca de $484 en lugar de $700. Este método no tiene efecto en Haiku 4.5, porque 1,200 tokens es inferior a su mínimo de 4,096 tokens.
  • Retries. Supongamos que rechaza la respuesta de Haiku en el 8% de los correos y vuelve a ejecutarlos en Opus 4.8. Sume 0.08 x $1,750 = $140 a los $350, resultando en $490. Mida su propia tasa de rechazo en lugar de usar la mía.
  • Tool definitions, si el trabajo las utiliza. El system prompt que generan es de 290 tokens en Opus 4.8 con tool_choice configurado en auto, 354 en Sonnet 5 y 496 en Haiku 4.5. El modelo más barato tiene la mayor carga fija.

Haiku con una ruta de escalada a $490 y Sonnet 5 con cache a $484 cuestan lo mismo, y uno de ellos completa la tarea en una sola pasada. El modelo no era la única variable.

¿Cambiar de modelo a mitad de una sesión ahorra dinero?

Ocurre con menos frecuencia de lo que sugieren los precios de lista, debido a que el ahorro se calcula por token y lo que se arriesga es un prefijo completo en caché.

Anthropic documenta qué invalida una caché. Los prefijos se construyen en el orden tools, luego system, y luego messages, y "los cambios en cada nivel invalidan ese nivel y todos los niveles subsiguientes". Dos configuraciones de solicitud también están en esa lista: "la configuración de pensamiento (thinking configuration) y el nivel effort resuelto se renderizan en el propio prompt, por lo que cambiar cualquiera de ellos inicia un nuevo prefijo de caché". En cuanto al esfuerzo (effort), la documentación especifica: "varíe el esfuerzo entre cargas de trabajo en lugar de hacerlo dentro de una conversación que dependa de aciertos en la caché (cache hits)".

El modelo no aparece en esa lista documentada, por lo que no se debe asumir nada en ningún sentido. Revise cache_read_input_tokens en la primera solicitud después de un cambio y deje que el número le dé la respuesta. En un prefijo de Opus de 150,000 tokens, una lectura de caché cuesta aproximadamente $0.08 y una escritura nueva aproximadamente $0.94, lo cual es más que la diferencia de varios turnos por token que intentaba aprovechar.

Por tanto, cambie estos parámetros entre tareas, no dentro de una misma. En Claude Code, esto significa /clear primero, cuando la caché se va a descartar de todos modos, y luego /model o /effort.

Cómo probar la respuesta con su propia carga de trabajo

No dimensione un prompt usando un conteo obtenido de un modelo diferente. El endpoint de conteo de tokens es gratuito y utiliza el tokenizer del modelo que usted especifique; por lo tanto, especifique el modelo que planea llamar. Opus 4.7 y versiones posteriores, Fable 5 y Sonnet 5 utilizan un tokenizer más reciente que "produce aproximadamente un 30% más de tokens para el mismo texto", por lo que un presupuesto medido en un modelo antiguo resultará insuficiente en uno nuevo con la misma tarifa por token.

Luego, analice el resultado. input_tokens es solo el remanente sin caché, por lo que el tamaño real del prompt es ese campo más cache_creation_input_tokens más cache_read_input_tokens. Una primera aplicación de Claude API en un VPS es el lugar más sencillo para realizar esa medición, y qué plan de Claude se adapta a su uso es la decisión independiente sobre si debe pagar por token o no.

FAQ

¿Qué modelo de Claude es mejor para programar?

Claude Opus 4.8 es el punto de partida documentado para programación agentica compleja, con un coste de $5 por millón de tokens de entrada y $25 por millón de salida a partir de julio de 2026. Claude Sonnet 5 se posiciona como la mejor combinación de velocidad e inteligencia; con un precio de $2 / $10 hasta el 31 de agosto de 2026, cuesta menos de la mitad. Ejecute la misma tarea en ambos modelos, mantenga constante la configuración de thinking y compare el gasto total de tokens desde response.usage.

¿Es Claude Haiku 4.5 lo suficientemente barato para reemplazar a Sonnet 5?

Por token, es más barato: $1 / $5 frente a $2 / $10 para Sonnet 5 con precios de lanzamiento, o $3 / $15 desde el 1 de septiembre de 2026. Los límites determinan la decisión. Haiku 4.5 tiene una ventana de contexto de 200K tokens en lugar de 1M, un máximo de 64K de salida en la Messages API síncrona, un límite de conocimiento fiable de febrero de 2025, sin soporte para output_config.effort y un prompt cacheable mínimo de 4,096 tokens que desactiva el caché en prompts de sistema cortos.

¿Cambiar a un modelo de Claude más barato a mitad de sesión ahorra dinero?

Menos veces de lo que parece. Anthropic documenta los invalidadores de caché como cambios en el prefijo tools, system o messages, cambios en la configuración de thinking y cambios en output_config.effort. El efecto de un cambio de modelo en un caché existente no está documentado, por lo que debe tratarse como desconocido; consulte cache_read_input_tokenscache_read_input_tokens en la primera petición posterior. El impacto es relevante: en un prefijo de Opus 4.8 de 150,000 tokens, una lectura de caché cuesta aproximadamente $0.08 y una escritura nueva aproximadamente $0.94, lo que anula el ahorro de varios turnos por token. Cambie entre tareas después de /clear en Claude Code, cuando el caché se descarte de todos modos.

¿Qué efecto tiene output_config.effort en mi factura?

Cambia la cantidad de tokens que el modelo consume en texto, llamadas a herramientas (tool calls) y thinking. Un esfuerzo (effort) menor genera menos llamadas a herramientas, lo que aumenta el coste en bucles agenticos porque cada resultado de herramienta se reenvía en turnos posteriores. Los niveles son low, medium, high, xhigh y max, siendo high el predeterminado. Anthropic no publica un multiplicador de coste por nivel; define el effort como una señal de comportamiento en lugar de un presupuesto de tokens, por lo que debe medirlo en su propia tarea.

¿Cuánto ahorra la Claude Batches API?

Un 50% tanto en tokens de entrada como de salida, a cambio de una entrega asíncrona. A partir de julio de 2026, esto sitúa a Opus 4.8 en $2.50 de entrada / $12.50 de salida, a Sonnet 5 en $1 / $5 con precios de lanzamiento, y a Haiku 4.5 en $0.50 / $2.50. La comparación relevante abarca diferentes niveles: un trabajo por lotes (batch) de Opus 4.8 cuesta menos que un trabajo síncrono de Sonnet 5 con la tarifa estándar a partir del 1 de septiembre de 2026; por tanto, el procesamiento por lotes permite usar un modelo más potente por el mismo dinero.