SSD Nodes Learn 🎉 VPS desde $5.50/mes
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-14

¿La memoria de Claude cuesta dinero adicional?

Anthropic no publica un precio por tokens de memoria: el texto recordado se reenvía como entrada y se cobra según los tokens enviados y la caché.

¿Las funciones de memoria de Claude tienen un coste adicional?

Las funciones de memoria de Claude no tienen un precio propio. Las tarifas publicadas por Anthropic se calculan por millón de tokens de entrada y por millón de tokens de salida, con tarifas adicionales para el almacenamiento en caché de prompts. Ninguna de ellas se denomina token de memoria. El almacenamiento de la memoria no tiene coste en Claude API (interfaz de programación de aplicaciones), porque la herramienta de memoria se ejecuta en el cliente y el archivo se almacena en un sistema que usted controla.

La memoria sí puede afectar a la factura, porque un dato recordado sólo modifica una respuesta cuando forma parte de la solicitud que Claude lee. Recordar significa volver a enviar el texto. Ese texto llega como tokens de entrada y se factura con la tarifa normal de entrada del modelo. Dos valores determinan el importe: cuántos tokens del texto recordado se vuelven a enviar en cada turno y si ese texto puede servirse desde la caché de prompts.

Con una suscripción Pro o Max no se factura por token, por lo que la memoria consume su cuota de uso en lugar de dinero. El mecanismo es idéntico. Sólo cambia la unidad. Esa cuota es finita, así que conviene saber cuánto cuesta Claude Pro y en qué punto sus límites le impiden continuar antes de decidir cuánta memoria debe incluir cada turno. Claude Enterprise funciona de otra manera, porque mide cada token con tarifas de API además del precio por puesto, por lo que un bloque de memoria demasiado grande vuelve a convertirse en dinero y no en cuota. Si reducir la memoria hace que su uso quede cómodamente por debajo del límite de un plan más pequeño, pasar de Max a Pro es el siguiente cambio que conviene considerar. El cambio se aplica al final del periodo que ya ha pagado. Si la comparación que está haciendo abarca proveedores distintos y no sólo los niveles de Anthropic, la comparación entre los planes de Claude y los de ChatGPT con los precios actuales es el punto de partida.

Qué significa «memoria» en cada interfaz de Claude

Tres productos distintos comparten esta palabra. Confundirlos es la principal razón por la que esta cuestión resulta confusa.

La herramienta de memoria en Claude API. Añade una entrada a la matriz tools e implementa las operaciones de archivo en tu propio código.

{"type": "memory_20250818", "name": "memory"}

En agosto de 2026, esta herramienta está disponible de forma general en la Messages API sin una cabecera beta, en los modelos Claude 4 y posteriores. Es del lado del cliente: Claude solicita una operación como view /memories, tu controlador la ejecuta en el almacenamiento que controlas y devuelves el resultado en un bloque tool_result. Anthropic nunca almacena el archivo, por lo que no hay ningún coste de almacenamiento que repercutir. Pagas por el intercambio de solicitudes y respuestas. La definición de la herramienta se envía en cada solicitud, y el contenido del archivo que se devuelve permanece en la conversación desde ese momento.

Anthropic publica la parte fija de esa sobrecarga. En Claude Opus 5, con una selección de herramienta de auto, el prompt de sistema de uso de herramientas ocupa 286 tokens, según la documentación de agosto de 2026. Se paga una vez por solicitud siempre que haya alguna herramienta, independientemente de que sea de memoria o de otro tipo.

Claude Code. Dos mecanismos cargan contenido al inicio de cada sesión. Los archivos CLAUDE.md contienen las instrucciones que escribes. La memoria automática contiene notas que Claude escribe para sí mismo, en ~/.claude/projects/<project>/memory/. Sólo se cargan las primeras 200 líneas o 25KB de MEMORY.md, lo que ocurra primero. Los archivos de temas situados junto a él se leen bajo demanda, no durante el arranque. Todo lo que se carga al inicio pasa a formar parte del prefijo que se envía con cada solicitud posterior de esa sesión. Cómo recupera Claude Code la memoria entre sesiones explica el orden de carga archivo por archivo.

Claude en la web. En claude.ai, la memoria es un conjunto de entradas que Claude escribe y actualiza mientras chateas, con un espacio de memoria independiente para cada proyecto. Settings > Memory muestra lo que está almacenado, y el selector permite elegir Pause memory o Reset memory. Esta interfaz se factura mediante una suscripción, por lo que la memoria consume los límites de uso.

Por qué el texto recordado se factura como tokens de entrada

La API de Messages no conserva estado. No guarda nada entre llamadas, por lo que el cliente envía toda la conversación en cada turno y el modelo vuelve a leerla completa. La memoria no es una excepción a esta regla. Es otro bloque de texto dentro de la misma solicitud.

La división aparece en el objeto usage de cualquier respuesta.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens cuenta sólo los tokens que no se leyeron de la caché ni se usaron para crearla. En la práctica, son los tokens posteriores al último punto de caché. El total de entrada de la solicitud es cache_read_input_tokens más cache_creation_input_tokens más input_tokens. Un archivo de memoria que Claude abrió hace tres turnos forma parte de ese total en cada turno posterior. Se incluye en cache_read_input_tokens mientras se mantenga el prefijo en caché y en input_tokens cuando no se mantenga. Es el mismo texto, pero con dos precios muy diferentes. Los tokens de entrada y salida tienen precios diferentes, y la memoria siempre se factura como entrada.

Dónde consultar estas cifras en su propio uso

No tome una cifra de una publicación de blog, incluida esta. Mida su propio bloque de memoria. El recuento de tokens es gratuito y tiene su propio límite de frecuencia, por lo que la medición no cuesta nada.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

La respuesta es un solo número, como { "input_tokens": 14 }. Ejecútelo una vez con el texto de memoria pegado en el campo system y otra vez sin él. La diferencia es lo que esa memoria le cuesta en cada turno. Hay dos advertencias. El recuento es una estimación, y los tokens adicionales que Anthropic añade para sus propias optimizaciones del sistema no se le facturan. Cuente también con el modelo que realmente vaya a ejecutar, porque Claude 4.7 y las versiones posteriores usan un tokenizador más reciente que produce aproximadamente un 30 por ciento más de tokens para el mismo texto.

En Claude Code, la misma pregunta se responde sin usar curl.

  • /context muestra lo que está cargado en este momento, incluidos los archivos de memoria, para que pueda ver qué parte de la ventana ocupan antes de escribir nada.
  • /memory muestra una lista de los archivos CLAUDE.md y abre la carpeta de memoria automática.
  • /usage muestra los totales de la sesión, incluidos los accesos y las escrituras de caché.
  • La línea de estado puede mostrar continuamente el uso de la ventana de contexto, de modo que el crecimiento sea visible mientras ocurre.

El bloque de sesión /usage tiene este aspecto:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Lea atentamente la última línea. La cifra de 940.0k de lecturas de caché corresponde a toda la conversación, incluida la memoria, que se vuelve a enviar en cada turno con la tarifa de caché. La cifra de 1.2k de entrada corresponde únicamente a la parte nueva. Claude Code calcula localmente ese importe en dólares a partir de los precios de lista, por lo que ignora cualquier descuento que tenga y puede diferir de su factura. La página Usage de Claude Console es la cifra de referencia.

A continuación, haga la comparación directamente. Formule la misma pregunta inicial en dos sesiones nuevas: una normal y otra con la memoria automática desactivada.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Ejecute /context en cada una y compare la entrada de archivos de memoria. La diferencia indica cuánto le cuesta la memoria acumulada al inicio de cada sesión, antes de realizar cualquier trabajo. Desglose completo de dónde se consume el uso de tokens de Claude Code merece la pena leerlo junto a esas dos cifras.

¿Cuánto cuesta reproducir la memoria por millón de tokens?

El almacenamiento en caché de prompts explica por qué el mismo bloque de memoria puede costar diez veces más en un turno que en otro. Anthropic publica las tarifas de caché como múltiplos del precio base de entrada de cada modelo, por lo que la relación se mantiene aunque cambien los precios en dólares.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Una lectura de caché cuesta 0.1 veces el precio base de entrada. Escribir una entrada con una duración de 5 minutos cuesta 1.25 veces el precio base, y una duración de 1 hora cuesta 2 veces el precio base. Anthropic indica claramente el punto de equilibrio: el almacenamiento en caché resulta rentable después de una lectura de caché con una duración de 5 minutos, o después de dos lecturas de caché con una duración de 1 hora. El punto de equilibrio del almacenamiento en caché de prompts es el cálculo que debe hacer antes de decidir dónde colocar la memoria.

Esos múltiplos convierten el número de reproducciones en una operación aritmética. El bloque siguiente usa los múltiplos publicados arriba. No es una medición de ninguna carga de trabajo real. Calcula el coste de un bloque de memoria de tres formas durante una sesión de 100 turnos, expresado como el número equivalente de tokens cobrados con la tarifa base de entrada.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Un bloque de memoria de 4,000 tokens que no obtiene aciertos de caché en ninguno de los 100 turnos se factura como 400,000 tokens con la tarifa base. El mismo bloque, detrás de una escritura de caché de 5 minutos y 99 lecturas de caché, se factura como 44,600. Si lo reduce a una cuarta parte de su tamaño y mantiene el almacenamiento en caché, se factura como 11,150. La función no cambió en esas 3 filas. Sólo cambió el comportamiento de reproducción. Siguen siendo recuentos de tokens, no importes, y convertir un recuento de tokens en un importe de la factura mensual requiere una multiplicación por la tarifa por millón de tokens del modelo. Esa tarifa depende del modelo que ejecute. Por tanto, si el agente funcionará con Claude Fable 5, empiece por sus tarifas publicadas por millón de tokens y los trabajos para los que resulta adecuado.

La segunda fila supone que cada una de las 99 solicitudes posteriores llega mientras la entrada de caché sigue activa. Esa suposición es la causa de la mayoría de los errores en las facturas reales.

¿Por qué cuesta más la misma pregunta después de una pausa?

Una entrada de caché tiene una duración, y el reloj empieza a contar desde la solicitud que la escribe o la lee. El valor predeterminado es 5 minutos. La opción de 1 hora cuesta el doble de la escritura indicada arriba. En Claude Code, la duración es de una hora con una suscripción y se reduce a cinco minutos cuando se consumen créditos de uso; con una clave de API o un proveedor de nube, es de cinco minutos de forma predeterminada. Configurar ENABLE_PROMPT_CACHING_1H=1 mantiene la duración de una hora mientras se consumen créditos de uso.

Por eso, una pregunta de una sola línea escrita en una sesión que dejó abierta durante la comida resulta cara: la entrada de caché caducó mientras no estaba. Se procesa de nuevo todo el prefijo, incluida la memoria, con la tarifa de entrada base y se vuelve a escribir en la caché. La duración de la pausa determinó ese precio.

Puede confirmarlo en lugar de aceptarlo sin más. En los planes Pro, Max, Team o Enterprise, el desglose de /usage marca cualquier comportamiento responsable del 10 por ciento o más del uso reciente. Allí aparecen con su nombre tanto el contexto largo como los fallos de caché. En la API, observe cómo cache_creation_input_tokens vuelve a aumentar hasta alcanzar el tamaño completo del prefijo en la primera solicitud después de un periodo de inactividad.

Qué invalida silenciosamente la caché

El prefijo almacenado en caché sigue este orden: herramientas, sistema y mensajes. Un cambio en un nivel invalida ese nivel y todos los posteriores. Editar una definición de herramienta descarta toda la caché. Editar el prompt del sistema descarta la caché del sistema y de los mensajes.

Esta es la trampa para quien guarda memoria en el prompt del sistema y lo reescribe a medida que el agente aprende. Cada reescritura descarta la copia almacenada en caché de todo lo que viene después, por lo que la siguiente solicitud debe volver a pagar el coste completo de escritura. Mantenga el material estable al principio y no lo modifique. Coloque el material variable al final de la lista de mensajes, donde invalidarlo es barato.

Hay un segundo fallo más silencioso. Cada modelo tiene un prefijo mínimo que se puede almacenar en caché: 512 tokens en Claude Opus 5, 1,024 en Claude Sonnet 5 y 4,096 en Claude Haiku 4.5, según la información publicada en agosto de 2026. La documentación de Anthropic explica claramente qué ocurre por debajo de ese límite: "Cualquier solicitud que intente almacenar en caché menos tokens que esta cantidad se procesará sin caché y no se devolverá ningún error." Por tanto, un archivo de memoria pequeño marcado con cache_control no hace absolutamente nada, de forma silenciosa. El síntoma observable es que cache_creation_input_tokens permanece en 0 aunque el prompt contenga claramente un punto de interrupción.

Depure la memoria que ya no aporta valor

Cada línea de memoria consume tokens en cada turno que la incluye. Por tanto, para cada línea debe preguntarse si ha cambiado una respuesta recientemente. Claude Code hace que los límites sean concretos. Procure mantener un archivo CLAUDE.md de menos de 200 líneas, porque los archivos más largos consumen más contexto y reducen la fiabilidad con la que Claude los sigue. MEMORY.md tiene un límite de las primeras 200 líneas o 25KB durante la carga, y todo lo que queda después de ese límite se descarta al iniciar la siguiente sesión. Por tanto, un índice demasiado grande consume tokens sin aportar información.

Dos prácticas ayudan a mantenerlo pequeño. Traslade los detalles del índice a archivos temáticos, que Claude lee cuando los necesita en lugar de leerlos al iniciar. Traslade las instrucciones de flujo de trabajo de CLAUDE.md a las skills, que sólo se cargan cuando se invocan. En los archivos de memoria que ya comienzan con frontmatter, Claude Code registra la hora de escritura en un campo modified como una marca de tiempo ISO 8601, desde la versión 2.1.214. Esa marca de tiempo es la forma más rápida de detectar un dato obsoleto. Depuración de la memoria obsoleta del agente explica con más detalle el proceso de revisión.

Cuando recuperar información es mejor que cargarlo todo en el contexto

La herramienta de memoria existe para permitir la recuperación justo a tiempo. En lugar de cargarlo todo al principio, el agente registra lo que aprende y vuelve a leer un archivo sólo cuando una tarea lo necesita. Esto cambia el cálculo, porque leer un archivo cuesta sus tokens una vez y después permanece dentro del prefijo en caché, mientras que un bloque cargado permanentemente cuesta tokens en cada turno.

De los dos gráficos anteriores se desprende una regla sencilla. El texto que se utiliza en casi todos los turnos debe estar en el prefijo estable en caché. El texto que se utiliza en uno de cada veinte turnos debe quedar detrás de una llamada a view. El punto de equilibrio depende del número de repeticiones, no de ningún importe que cobre Anthropic.

En la API también puede permitir que la plataforma reduzca la conversación. La edición del contexto elimina los resultados antiguos de las herramientas cuando la conversación supera el umbral que haya establecido.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

Los valores predeterminados son un umbral de 100,000 tokens de entrada y 3 usos de herramientas conservados. Lea cómo funciona la interacción con la caché antes de activarla: eliminar contenido invalida el prefijo en caché en el punto de eliminación, por lo que la siguiente petición debe pagar una escritura en caché. Para eso sirve clear_at_least. Retrasa la eliminación hasta que el ahorro sea suficiente para justificar la escritura. La respuesta informa exactamente de lo ocurrido mediante context_management, con cleared_tool_uses y cleared_input_tokens, de modo que el intercambio se puede medir y no queda en el plano teórico. Administrar la ventana de contexto en Claude Code aplica la misma idea a una sesión de programación.

Qué aparece como partida independiente

La memoria no tiene un coste propio, pero algunas funciones sí lo tienen, y conviene saber cuáles. Estas son las tarifas publicadas de la API de Claude en agosto de 2026. Algunas operaciones no tienen ningún coste, pero la API de Claude no tiene un nivel gratuito, sólo un pequeño crédito al registrarse, por lo que todo lo siguiente supone un gasto real desde la primera solicitud.

  • Búsqueda web: $10 por cada 1,000 búsquedas, más el coste normal de los tokens de todo lo que la búsqueda incluya en el contexto.
  • Ejecución de código: 1,550 horas gratuitas por organización cada mes; después, $0.05 por hora y contenedor. Es gratuita cuando se usa junto con la búsqueda web o la obtención de contenido web.
  • Claude Managed Agents: tiempo de ejecución de la sesión a $0.08 por hora de sesión, además de los cargos habituales por tokens.
  • Obtención de contenido web: sin cargo adicional; sólo se cobran los tokens del contenido obtenido.

La memoria no aparece en ninguna de esas partidas. Aparece en el recuento de tokens de entrada. Ahí es exactamente donde puede medirla y donde la poda y la caché pueden reducir su coste. Si está presupuestando un agente que se ejecuta sin supervisión en un servidor privado virtual (VPS), los controles de costes de un agente de IA en un VPS son lo siguiente que debe configurar, porque un agente con un archivo de memoria cada vez mayor y sin poda se vuelve más caro cada semana sin que ningún informe lo indique.

FAQ

¿Se cobra por separado por las funciones de memoria de Claude?

No. La lista de precios de Anthropic establece tarifas por millón de tokens de entrada, por millón de tokens de salida y los multiplicadores del almacenamiento en caché de prompts; no incluye ninguna línea específica para la memoria. En la API de Claude, la herramienta de memoria se ejecuta en el cliente, por lo que los archivos se almacenan en un sistema de almacenamiento que ya paga. La memoria añade tokens de entrada, que se facturan con la tarifa normal de entrada del modelo en cada turno que los incluya.

¿Desactivar la memoria hace que Claude sea más barato?

Reduce el número de tokens de cada solicitud, lo que reduce el coste de cada solicitud. El ahorro total depende de lo que ocurra después. Si Claude tiene que volver a leer tres archivos y hacerle dos preguntas para reconstruir lo que ya contenía la memoria, esos tokens cuestan más que la memoria. Mídalo en lugar de hacer suposiciones: ejecute /context en una sesión con la memoria automática activada y en otra iniciada con CLAUDE_CODE_DISABLE_AUTO_MEMORY=1; después, compare el total de tokens utilizados para la misma tarea.

¿Por qué aumentó mi uso si no cambié nada?

La causa más habitual es un fallo de caché después de una pausa. Las entradas de caché duran 5 minutos de forma predeterminada, o una hora con la configuración ampliada. Por tanto, la primera solicitud después de una pausa vuelve a procesar todo el prefijo con la tarifa base de tokens de entrada y lo escribe otra vez. La segunda causa más habitual es una modificación del prefijo: cambiar una definición de herramienta invalida toda la caché, y cambiar el prompt del sistema invalida la caché del sistema y de los mensajes. En un plan de suscripción, el desglose /usage identifica este comportamiento cuando representa el 10 por ciento o más del uso reciente.

¿Debe estar la memoria en el prompt del sistema o detrás de una llamada a una herramienta?

Colóquela en el prompt del sistema cuando se utilice en casi todos los turnos, porque así permanece en el prefijo almacenado en caché y se factura con la tarifa de lectura de caché. Colóquela detrás de una llamada view cuando sólo algunos trabajos la necesiten, porque un archivo que se lee una vez cuesta sus tokens una sola vez en lugar de en cada turno. El número decisivo es el de repeticiones, y el objeto usage proporciona ese número directamente.

¿Las funciones de memoria cuentan para los límites de uso de la suscripción?

Sí, de forma indirecta, porque los límites de la suscripción consumen los tokens que lleva cada solicitud. La documentación de ayuda de Anthropic indica que las conversaciones más largas que activan la gestión automática del contexto consumen una mayor parte del límite de uso. La memoria hace que cada solicitud sea ligeramente más larga, y una sesión extensa repite esa longitud en cada turno. Cómo funcionan realmente los límites de uso de Claude explica qué se restablece y cuándo.