¿La memoria de Claude tiene un coste adicional?
Anthropic no publica un precio por tokens de memoria: el texto recordado se reenvía como entrada y el coste depende de los tokens y la caché.
¿Las funciones de memoria de Claude tienen un coste adicional?
Las funciones de memoria de Claude no tienen un precio propio. Las tarifas publicadas por Anthropic se calculan por millón de tokens de entrada y por millón de tokens de salida, con tarifas adicionales para el almacenamiento en caché de prompts. Ninguna de ellas se denomina token de memoria. Almacenar la memoria no tiene coste en Claude API (interfaz de programación de aplicaciones), porque la herramienta de memoria se ejecuta en el cliente y el archivo se guarda en un almacenamiento que usted controla.
La memoria puede afectar a la factura porque un dato recordado sólo cambia una respuesta cuando forma parte de la solicitud que Claude lee. Recordar implica volver a enviar el contenido. Ese texto llega como tokens de entrada y se factura con la tarifa normal de entrada del modelo. Hay dos factores que determinan el importe: cuántos tokens de texto recordado vuelve a enviar en cada turno y si ese texto se puede servir desde la caché de prompts.
Con una suscripción Pro o Max no se factura por token, por lo que la memoria consume su cuota de uso y no su dinero. El mecanismo es el mismo. Sólo cambia la unidad. La cuota es finita, por lo que conviene saber cuánto cuesta Claude Pro y en qué momento sus límites le impiden continuar antes de decidir cuánta memoria debe incluir cada turno. Claude Enterprise funciona de otra manera, porque mide cada token con tarifas de API además del precio por puesto, de modo que un bloque de memoria demasiado grande vuelve a convertirse en dinero en lugar de consumo de la cuota. Si reducir la memoria hace que su uso quede cómodamente por debajo del límite de un plan más pequeño, pasar de Max a Pro es el siguiente cambio que conviene considerar. El cambio se aplica al final del periodo que ya ha pagado. Si la comparación que está haciendo es entre proveedores y no entre los propios niveles de Anthropic, comparar los planes de Claude con los de ChatGPT a los precios actuales es el punto de partida.
Qué significa «memoria» en cada superficie de Claude
Tres productos distintos comparten esta palabra. Confundirlos es la principal razón por la que esta cuestión resulta confusa.
La herramienta de memoria de Claude API. Añade una entrada a la matriz tools e implementa las operaciones de archivo en tu propio código.
{"type": "memory_20250818", "name": "memory"}En agosto de 2026, esta herramienta está disponible de forma general en Messages API, sin una cabecera beta, en los modelos Claude 4 y posteriores. Es del lado del cliente: Claude solicita una operación como view /memories, tu controlador la ejecuta en el almacenamiento que controlas y devuelves el resultado en un bloque tool_result. Anthropic nunca almacena el archivo, por lo que no hay ningún coste de almacenamiento que repercutir. En su lugar, pagas por el intercambio de solicitudes y respuestas. La definición de la herramienta se envía en cada solicitud, y el contenido del archivo que vuelve permanece en la conversación desde ese momento.
Anthropic publica la parte fija de esta sobrecarga. En Claude Opus 5, con una selección de herramienta de auto, el prompt de sistema para el uso de herramientas tiene 286 tokens, según la documentación de agosto de 2026. Se paga una vez por solicitud siempre que haya alguna herramienta, sea de memoria o de otro tipo.
Claude Code. Dos mecanismos cargan información al inicio de cada sesión. Los archivos CLAUDE.md contienen las instrucciones que escribes. La memoria automática contiene notas que Claude escribe para sí mismo, en ~/.claude/projects/<project>/memory/. Solo se cargan las primeras 200 líneas o 25KB de MEMORY.md, lo que ocurra primero. Los archivos de temas que están junto a él se leen bajo demanda, no durante el inicio. Todo lo que se carga al inicio pasa a formar parte del prefijo que lleva cada solicitud posterior de esa sesión. Cómo recupera Claude Code la memoria entre sesiones explica el orden de carga archivo por archivo.
Claude en la web. En claude.ai, la memoria es un conjunto de entradas que Claude escribe y actualiza mientras conversas, con un espacio de memoria independiente para cada proyecto. Settings > Memory muestra lo que está almacenado. El interruptor de esa sección ofrece Pause memory o Reset memory. Esta superficie se factura mediante una suscripción, por lo que la memoria consume los límites de uso.
Por qué el texto recordado se factura como tokens de entrada
La API de Messages no tiene estado. No conserva nada entre llamadas, por lo que el cliente envía toda la conversación en cada turno y el modelo la vuelve a leer completa. La memoria no es una excepción a esta regla. Es otro bloque de texto dentro de la misma solicitud.
La división se muestra en el objeto usage de cualquier respuesta.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens cuenta únicamente los tokens que no se leyeron de la caché ni se usaron para crearla. En la práctica, son los tokens posteriores al último punto de caché. La entrada total de la solicitud es cache_read_input_tokens más cache_creation_input_tokens más input_tokens. Un archivo de memoria que Claude abrió hace tres turnos forma parte de ese total en cada turno posterior. Se incluye en cache_read_input_tokens mientras el prefijo en caché siga disponible, y en input_tokens cuando no lo esté. El mismo texto puede tener dos precios muy diferentes. Los tokens de entrada y salida tienen precios diferentes, y la memoria siempre se factura como entrada.
Dónde consultar estas cifras en su propio uso
No tome una cifra de una publicación de blog, incluida esta. Mida su propio bloque de memoria. El recuento de tokens es gratuito y tiene su propio límite de velocidad, por lo que la medición no cuesta nada.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'La respuesta es un número, como { "input_tokens": 14 }. Ejecútelo una vez con el texto de memoria pegado en el campo system y otra vez sin él. La diferencia es lo que esa memoria le cuesta en cada turno. Hay que tener en cuenta dos aspectos. El recuento es una estimación, y los tokens adicionales que Anthropic añade para sus propias optimizaciones del sistema no se le facturan. Cuente también con el modelo que realmente vaya a ejecutar, porque Claude 4.7 y las versiones posteriores usan un tokenizador más reciente que produce aproximadamente un 30 por ciento más de tokens para el mismo texto.
Dentro de Claude Code, la misma pregunta se responde sin usar curl.
/contextmuestra lo que está cargado en este momento, incluidos los archivos de memoria, para que pueda ver qué parte de la ventana ocupan antes de escribir nada./memorymuestra sus archivosCLAUDE.mdy abre la carpeta de memoria automática./usagemuestra los totales de la sesión, incluidas las lecturas y escrituras de caché.- La línea de estado puede mostrar continuamente el uso de la ventana de contexto, de modo que el crecimiento sea visible mientras ocurre.
El bloque de sesión de /usage tiene este aspecto:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Lea con atención la última línea. La cifra de 940.0k de lecturas de caché corresponde a toda la conversación, incluida la memoria, que se vuelve a enviar en cada turno con la tarifa de caché. La cifra de 1.2k de entrada corresponde sólo a la parte nueva. Claude Code calcula localmente ese importe en dólares a partir de los precios de lista, por lo que no tiene en cuenta ningún descuento que se le aplique y puede diferir de su factura. La página Usage de Claude Console muestra la cifra autorizada.
Después, ejecute la comparación directamente. Haga la misma pregunta inicial en dos sesiones nuevas: una normal y otra con la memoria automática desactivada.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeEjecute /context en cada una y compare la entrada de archivos de memoria. La diferencia es lo que le cuesta la memoria acumulada al inicio de cada sesión, antes de realizar cualquier trabajo. Un desglose completo de adónde va el uso de tokens de Claude Code merece leerse junto a esas dos cifras.
¿Cuánto cuesta reproducir la memoria por millón de tokens?
El almacenamiento en caché de prompts es la razón por la que el mismo bloque de memoria puede costar diez veces más en un turno que en otro. Anthropic publica las tarifas de caché como múltiplos del precio base de entrada de cada modelo, por lo que la relación se mantiene incluso cuando cambian los precios en dólares.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Una lectura de caché cuesta 0.1 veces el precio base de entrada. Escribir una entrada con una duración de 5 minutos cuesta 1.25 veces el precio base, y una duración de 1 hora cuesta 2 veces el precio base. Anthropic indica claramente el punto de equilibrio: el almacenamiento en caché resulta rentable después de una lectura de caché con una duración de 5 minutos, o después de dos lecturas de caché con una duración de 1 hora. El punto de equilibrio del almacenamiento en caché de prompts es el cálculo que debe hacer antes de decidir dónde colocar la memoria.
Esos múltiplos convierten el número de reproducciones en una operación aritmética. El siguiente bloque usa los múltiplos publicados arriba. No es una medición de ninguna carga de trabajo activa. Calcula el coste de un bloque de memoria de tres formas durante una sesión de 100 turnos, expresado como el número equivalente de tokens cobrados con la tarifa base de entrada.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Un bloque de memoria de 4,000 tokens que no encuentra la caché en ninguno de los 100 turnos se factura como 400,000 tokens con la tarifa base. El mismo bloque, con una escritura de caché de 5 minutos y 99 lecturas de caché, se factura como 44,600. Si lo reduce a una cuarta parte de su tamaño y mantiene el almacenamiento en caché, se factura como 11,150. La función no cambió en esas 3 filas. Sólo cambió el comportamiento de reproducción. Siguen siendo cantidades de tokens, no importes monetarios, y convertir una cantidad de tokens en un importe de la factura mensual requiere multiplicarla por la tarifa por millón de tokens del modelo. Esa tarifa depende del modelo que ejecute. Si el agente va a funcionar con Claude Fable 5, empiece por sus tarifas publicadas por millón de tokens y los trabajos para los que resulta adecuado. Si el proveedor sigue siendo una cuestión abierta y no sólo importa el modelo, los mismos trabajos con costes en la API de Claude y en ChatGPT muestra dónde produce resultados distintos esa multiplicación; un agente con mucha memoria depende especialmente del coste de entrada.
La segunda fila supone que cada una de las 99 solicitudes posteriores llega mientras la entrada de caché todavía está activa. Esa suposición es la causa de la mayoría de los errores en las facturas reales.
¿Por qué cuesta más la misma pregunta después de una pausa?
Una entrada de caché tiene una duración, y el reloj empieza cuando la solicitud la escribe o la lee. El valor predeterminado es 5 minutos. La opción de 1 hora cuesta el doble de la escritura mostrada arriba. En Claude Code, la duración es de una hora con una suscripción y baja a 5 minutos cuando se consumen créditos de uso; con una clave de API o un proveedor cloud, el valor predeterminado es de 5 minutos. Configurar ENABLE_PROMPT_CACHING_1H=1 mantiene la duración de una hora cuando se utilizan créditos de uso.
Por eso, una pregunta de una sola línea escrita en una sesión que dejó abierta durante el almuerzo resulta cara: la entrada de caché caducó mientras estaba ausente. Todo el prefijo, incluida la memoria, se procesa de nuevo con la tarifa de entrada base y vuelve a escribirse en la caché. La duración de la pausa determinó ese precio.
Puede confirmarlo en lugar de aceptarlo sin más. En un plan Pro, Max, Team o Enterprise, el desglose de /usage señala cualquier comportamiento responsable del 10 por ciento o más del uso reciente. Tanto el contexto largo como los fallos de caché aparecen allí con esos nombres. En la API, observe cómo cache_creation_input_tokens vuelve a aumentar hasta alcanzar el tamaño completo del prefijo en la primera solicitud después de un periodo de inactividad.
Qué invalida la caché sin que se note
El prefijo almacenado en caché sigue un orden: herramientas, después sistema y, por último, mensajes. Un cambio en un nivel invalida ese nivel y todos los posteriores. Editar la definición de una herramienta descarta toda la caché. Editar el prompt del sistema descarta la caché del sistema y de los mensajes.
Esta es la trampa para quien guarda memoria en el prompt del sistema y lo reescribe a medida que el agente aprende. Cada reescritura descarta la copia en caché de todo lo que viene después, por lo que la siguiente solicitud debe volver a pagar una escritura completa. Mantenga el material estable al principio y no lo modifique. Coloque el material volátil al final de la lista de mensajes, donde invalidarlo resulta barato.
Hay un segundo fallo más silencioso. Cada modelo tiene un prefijo mínimo que se puede almacenar en caché: 512 tokens en Claude Opus 5, 1,024 en Claude Sonnet 5 y 4,096 en Claude Haiku 4.5, según lo publicado en agosto de 2026. La documentación de Anthropic explica explícitamente qué ocurre por debajo de ese límite: "Any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned." Por tanto, un archivo de memoria pequeño marcado con cache_control no hace nada, de forma silenciosa. El síntoma visible es que cache_creation_input_tokens permanece en 0 aunque el prompt contenga claramente un punto de ruptura.
Depure la memoria que ya no aporta valor
Cada línea de memoria consume tokens en cada turno que la incluye. Por eso, la pregunta para cada línea es si ha cambiado una respuesta recientemente. Claude Code establece límites concretos. Procure mantener CLAUDE.md por debajo de 200 líneas, porque los archivos más largos consumen más contexto y reducen la fiabilidad con la que Claude sigue sus instrucciones. MEMORY.md está limitado a las primeras 200 líneas o 25KB durante la carga. Todo lo que supere ese límite se descarta al iniciar la siguiente sesión. Por tanto, un índice demasiado grande consume tokens y no aporta información.
Dos hábitos ayudan a mantenerlo pequeño. Traslade los detalles del índice a archivos temáticos. Claude los lee cuando los necesita, en lugar de cargarlos al iniciar. Traslade las instrucciones de flujo de trabajo de CLAUDE.md a las skills. Estas sólo se cargan cuando se invocan. En los archivos de memoria que ya comienzan con frontmatter, Claude Code registra la hora de escritura en un campo modified como una marca de tiempo ISO 8601, a partir de la versión 2.1.214. Esa marca de tiempo es la forma más rápida de detectar un dato obsoleto. Depuración de la memoria obsoleta del agente explica con más detalle el proceso de revisión.
Cuando recuperar información es mejor que cargar todo en el contexto
La herramienta de memoria permite recuperar información justo cuando se necesita. En lugar de cargar todo al principio, el agente registra lo que aprende y vuelve a leer un archivo sólo cuando una tarea lo necesita. Esto cambia el cálculo, porque la lectura de un archivo consume sus tokens una vez y después permanece dentro del prefijo almacenado en caché, mientras que un bloque cargado permanentemente tiene un coste en cada turno.
De los dos gráficos anteriores se desprende una regla sencilla. El texto que se usa en casi todos los turnos debe estar en el prefijo estable almacenado en caché. El texto que se usa en un turno de cada veinte debe quedar detrás de una llamada a view. El punto de equilibrio depende del número de repeticiones, no de ningún cargo de Anthropic.
En la API también puede permitir que la plataforma reduzca la conversación. La edición del contexto elimina los resultados antiguos de las herramientas cuando la conversación supera el umbral que haya definido.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Los valores predeterminados son un umbral de 100,000 tokens de entrada y 3 usos de herramientas conservados. Lea cómo funciona la interacción con el almacenamiento en caché antes de activarla: eliminar contenido invalida el prefijo almacenado en caché en el punto de eliminación, por lo que la siguiente petición genera un coste de escritura en caché. Para eso sirve clear_at_least. Retrasa la eliminación hasta que el ahorro sea suficiente para justificar la escritura. La respuesta informa exactamente de lo ocurrido mediante context_management, con cleared_tool_uses y cleared_input_tokens, por lo que el intercambio puede medirse y no queda en una consideración teórica. Administración de la ventana de contexto en Claude Code aplica la misma idea a una sesión de programación.
Qué tiene su propia partida
La memoria no tiene un cargo propio, pero algunas funciones sí lo tienen, y conviene saber cuáles. Estas son las tarifas publicadas de la API de Claude a fecha de agosto de 2026. Algunas operaciones no tienen ningún coste, pero la API de Claude no ofrece un nivel gratuito, sino sólo un pequeño crédito al registrarse. Por tanto, todo lo que aparece a continuación supone un gasto real desde la primera solicitud.
- Búsqueda web: $10 por cada 1,000 búsquedas, más el coste habitual de los tokens de todo lo que la búsqueda introduzca en el contexto.
- Ejecución de código: 1,550 horas gratuitas por organización cada mes; después, $0.05 por hora y contenedor. Es gratuita cuando se utiliza junto con la búsqueda web o la obtención de contenido web.
- Claude Managed Agents: tiempo de ejecución de la sesión a $0.08 por hora de sesión, además de los cargos habituales por tokens.
- Obtención de contenido web: sin cargo adicional; sólo se cobra el coste de los tokens del contenido obtenido.
La memoria no aparece en ninguna de esas partidas. Se incluye en el recuento de tokens de entrada. Ahí es exactamente donde puede medirla, y también donde la poda y el almacenamiento en caché pueden reducir su coste. Si está presupuestando un agente que se ejecuta sin supervisión en un servidor privado virtual (VPS), los controles de costes de un agente de IA en un VPS son lo siguiente que debe configurar, porque un agente con un archivo de memoria cada vez mayor y sin poda resulta más caro cada semana sin que ningún sistema lo notifique.
FAQ
¿Existe un cargo adicional por las funciones de memoria de Claude?
No. La lista de precios de Anthropic establece tarifas por millón de tokens de entrada, por millón de tokens de salida y multiplicadores del almacenamiento en caché de prompts; no incluye un concepto específico para la memoria. En la API de Claude, la herramienta de memoria funciona en el cliente, por lo que los archivos se almacenan en un almacenamiento que ya paga. La memoria añade tokens de entrada, que se facturan con la tarifa normal de entrada del modelo en cada turno que los incluya.
¿Desactivar la memoria hace que Claude sea más barato?
Reduce el número de tokens de cada solicitud y, por tanto, el coste de cada solicitud. El ahorro total depende de lo que ocurra después. Si Claude tiene que volver a leer tres archivos y hacerle dos preguntas para reconstruir lo que ya contenía la memoria, esos tokens cuestan más que la memoria. Mídalo en lugar de hacer suposiciones: ejecute /context en una sesión con la memoria automática activada y en otra iniciada con CLAUDE_CODE_DISABLE_AUTO_MEMORY=1; después, compare los tokens totales consumidos en la misma tarea.
¿Por qué aumentó mi consumo si no cambié nada?
La causa más habitual es un fallo de caché después de una pausa. Las entradas de caché duran 5 minutos de forma predeterminada, o una hora con la configuración ampliada. Por eso, la primera solicitud después de una pausa vuelve a procesar todo el prefijo con la tarifa base de entrada y lo escribe de nuevo. La segunda causa más habitual es una modificación del prefijo: cambiar una definición de herramienta invalida toda la caché, mientras que cambiar el prompt del sistema invalida la caché del sistema y de los mensajes. En un plan de suscripción, el desglose /usage identifica este comportamiento cuando representa el 10 por ciento o más del consumo reciente.
¿La memoria debe estar en el prompt del sistema o detrás de una llamada a una herramienta?
Colóquela en el prompt del sistema cuando se use en casi todos los turnos, porque así permanece en el prefijo almacenado en caché y se factura con la tarifa de lectura de caché. Colóquela detrás de una llamada a view cuando sólo algunos trabajos la necesiten, porque un archivo que se lee una vez consume sus tokens una sola vez, en lugar de hacerlo en cada turno. El número decisivo es el de repeticiones, y el objeto usage proporciona ese número directamente.
¿Las funciones de memoria cuentan para los límites de uso de la suscripción?
Sí, de forma indirecta, porque los límites de la suscripción se consumen según los tokens que transporta cada solicitud. La documentación de ayuda de Anthropic indica que las conversaciones más largas que activan la gestión automática del contexto consumen una parte mayor del límite de uso. La memoria hace que cada solicitud sea ligeramente más larga, y una sesión extensa repite esa longitud en cada turno. Cómo funcionan realmente los límites de uso de Claude explica qué se restablece y cuándo.