Caveman y el límite de Claude Code: ¿ahorra de verdad?
Caveman acorta las respuestas de Claude, pero en Claude Code casi todo el consumo es entrada que se relee en cada turno. Qué ahorra la skill y qué exige a cambio el proxy.
La respuesta corta
Caveman apenas estira tu límite de Claude Code si solo instalas la skill que acorta las respuestas. En una sesión de programación, casi todo lo que procesa el modelo es entrada: el historial, los archivos leídos, la salida de los comandos y las reglas cargadas, que Claude Code vuelve a enviar en cada llamada. La skill no toca esa parte. El proxy que llegó con la versión 3 sí la comprime, pero ve todo lo que lee tu agente, así que activarlo es una decisión de confianza.
Si usas Claude Pro o Max y has visto el titular de que caveman recorta un 75 % de los tokens, lo que sigue describe caveman fijado a la etiqueta v3.1.0 (revisada en octubre de 2026), cómo instalarlo en esa versión exacta y qué dicen las mediciones. Todas las cifras son del propio proyecto o de pruebas de terceros, y se citan como tales. Ninguna es una medición nuestra.
Un apunte de vocabulario antes de empezar. Un token es la unidad en la que el modelo cuenta el texto: un trozo de palabra o una palabra corta. Los tokens de entrada son lo que el modelo lee. Los tokens de salida son lo que escribe.
Qué es caveman en la versión 3.1.0
Caveman es un proyecto de código abierto, con licencia Apache-2.0, para agentes de programación como Claude Code, Codex, Cursor o Gemini CLI. Empezó como una skill que hace que el agente responda "como un cavernícola": frases mínimas, sin cortesías, con el contenido técnico intacto. En la rama 3.x son dos piezas distintas, y casi toda la confusión sobre el ahorro viene de mezclarlas.
La skill de estilo de salida
Una skill es un paquete de instrucciones que el agente carga en su contexto. Si no tienes clara la diferencia con un servidor MCP (Model Context Protocol), la tienes explicada en qué diferencia una skill de un servidor MCP o de un archivo de reglas. La skill de caveman le dice a Claude cómo escribir. No cambia nada de lo que Claude lee. En la etiqueta v3.1.0 trae tres voces y varios comandos auxiliares:
/caveman: el modo por defecto. Respuestas breves, con gramática normal./ultracave: quita gramática para comprimir al máximo./megacave: responde en chino clásico, que expresa mucho en pocos caracteres./caveman-commity/caveman-review: mensajes de commit en formato Conventional Commits y revisiones de código con un hallazgo por línea./caveman-compressseguido de la ruta de un archivo: comprime archivos de memoria comoCLAUDE.md./caveman-stats: muestra el uso de tokens que registra caveman.
El documento de cifras del propio proyecto, docs/HONEST-NUMBERS.md, lo dice de forma directa: la reducción de entrada que aporta la skill es del 0 %, porque es una instrucción de estilo de salida.
El proxy de entrada que llegó con la 3.x
Un proxy es un programa que se coloca en medio de una conexión. Claude Code le envía sus peticiones a él, y él las reenvía a Anthropic. El proxy de caveman escucha en 127.0.0.1:8787, es decir, solo en tu propia máquina. Comprime lo que el agente va a leer antes de que llegue al modelo: logs, salida de tests, diffs, páginas web y datos estructurados como CSV (valores separados por comas) o JSON. Los originales quedan guardados en un archivo SQLite local, por si el agente necesita recuperar el texto completo. Es la única parte de caveman que reduce tokens de entrada.
Cómo instalar caveman fijado a la etiqueta v3.1.0
Fija la versión. Los comandos de instalación que circulan por redes apuntan a la rama main, que cambia con cada commit, así que el mismo comando instala cosas distintas según la semana. La URL con la etiqueta v3.1.0 instala siempre el mismo código. El instalador necesita Node.js 22.13 o superior, según el README. Compruébalo primero:
node --versionSi la versión que ves es menor que v22.13.0, actualiza Node.js antes de seguir, porque el instalador es un script que delega en npx.
En macOS, Linux, WSL o Git Bash:
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/v3.1.0/install.sh | bashEn Windows, desde PowerShell 5.1 o superior:
irm https://raw.githubusercontent.com/JuliusBrussee/caveman/v3.1.0/install.ps1 | iexAntes de ejecutar un script descargado de internet, conviene ver qué va a hacer. El instalador acepta --dry-run, que imprime los pasos y no cambia nada. Con bash -s -- le pasas esa opción al script que llega por la tubería:
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/v3.1.0/install.sh | bash -s -- --dry-runEl instalador detecta los agentes que tienes instalados y aplica la integración de cada uno. En Claude Code añade, por defecto, hooks de SessionStart y UserPromptSubmit y una insignia en la barra de estado. Un hook es un comando que Claude Code ejecuta solo en un momento fijo de la sesión. Si quieres saber qué puede hacer uno antes de aceptarlo, lee cómo funcionan los hooks de Claude Code. Si prefieres no instalarlos, añade --no-hooks igual que antes añadiste --dry-run.
Para comprobar que funciona, abre Claude Code y escribe /caveman. Las respuestas siguientes deberían salir mucho más cortas. Si no cambian, el instalador no detectó Claude Code: ejecuta el script con --list en lugar de --dry-run para ver qué agentes reconoce. Para quitarlo todo, usa --uninstall de la misma forma.
El proxy se instala aparte, con la CLI (interfaz de línea de comandos) del proyecto. Lee la sección sobre confianza más abajo antes de ejecutar esto:
npm install -g @caveman-ai/cli && caveman setup --install
caveman claudecaveman claude abre Claude Code con sus peticiones dirigidas al proxy local. Usas Claude Code igual que siempre, pero cada petición pasa antes por el proxy.
¿Existe caveman-es, la versión en español?
No en la v3.1.0. Ninguna de las carpetas de skills de esa etiqueta se llama caveman-es, y ninguna lleva nombre de idioma. La ayuda del instalador (bin/install.js) tampoco ofrece una opción --skill al usuario. Si un tutorial te muestra un comando con --skill caveman-es, no corresponde a esta etiqueta, así que no lo copies esperando que funcione aquí.
Por qué acortar las respuestas de Claude apenas mueve tu límite de uso
La API (interfaz de programación de aplicaciones) de Claude no recuerda nada entre una petición y la siguiente. Cada vez que Claude Code habla con el modelo, envía de nuevo todo lo que el modelo necesita para responder: el prompt de sistema, las definiciones de herramientas, tu CLAUDE.md, las skills cargadas, cada archivo que el agente ha leído, cada salida de comando y todas las respuestas anteriores.
Una tarea de programación tampoco es un solo turno. Es una serie de llamadas: leer un archivo, ejecutar los tests, leer el error, editar, volver a ejecutar. Cada llamada reenvía el historial completo, y ese historial crece con cada archivo y cada salida de comando. Por eso la entrada domina una sesión de Claude Code. El reparto concreto está desglosado en en qué gasta tokens Claude Code.
Puedes verlo en tu propia sesión. Escribe /context en Claude Code. El comando muestra cómo se reparte la ventana de contexto entre prompt de sistema, herramientas, archivos de memoria y mensajes. Todo lo que aparece ahí viaja como entrada en la siguiente llamada. Las respuestas en prosa de Claude son solo una parte de los mensajes, y en una sesión de trabajo real suelen pesar poco al lado de los archivos y de la salida de las herramientas.
La skill de caveman solo acorta esa prosa. El código, los diffs, los comandos y las llamadas a herramientas salen igual, porque son contenido exacto que no se puede resumir. Hay un efecto secundario a favor: una respuesta corta también ocupa menos cuando se relee en los turnos siguientes. Pero hay otro en contra. Según el README, el conjunto de reglas viaja como tokens de entrada en cada llamada, unos 1000 tokens estimados para la skill completa. Ese coste se paga también en las muchas llamadas en las que Claude apenas escribe prosa y solo usa una herramienta. El propio proyecto concluye que el balance depende de tu agente, del comportamiento de la caché, del tipo de trabajo y de cómo te cobran.
La caché entra aquí. Claude Code usa prompt caching: Anthropic guarda el principio estable del contexto y lo relee a un precio mucho menor que la entrada normal. En la API, esa diferencia de precio está publicada y la explica la diferencia de coste entre tokens de entrada y de salida en Claude. Para Pro y Max, Anthropic no publica la fórmula exacta con la que cada token cuenta contra tu límite. Por eso nadie de fuera puede decirte cuántos mensajes más te da caveman en tu plan.
Qué dicen las cifras del proyecto y las pruebas independientes
Las cifras del propio proyecto
El primer dato que conviene mirar es el de la skill. El proyecto midió la longitud de la salida de cada voz frente a un control que ya pedía brevedad: una instrucción simple de Answer concisely. ("responde de forma concisa"). Es una mediana sobre 10 respuestas, de una sola ejecución, contando tokens con una aproximación.
The data behind this chart
[
{
"label": "caveman",
"reduccion_salida_pct": 3
},
{
"label": "ultracave",
"reduccion_salida_pct": 35
},
{
"label": "megacave",
"reduccion_salida_pct": 9
}
]Frente a un Claude al que ya se le pide ser breve, la voz por defecto recorta un 3 % de la salida. La voz ultracave llega al 35 %, y megacave al 9 %. Los titulares del 65 % y el 75 % comparaban con un Claude sin ninguna instrucción de brevedad, en conversaciones donde casi todo es prosa. Ninguna de estas cifras mide la entrada.
El proxy tiene su propia prueba, CaveBench, publicada en docs/WRAP-BENCHMARK.md. Son 54 ejecuciones de agente con Claude Code 2.1.223 y el modelo claude-sonnet-5, en 18 pares de sesión directa frente a sesión con caveman, sobre seis tareas fijas. Cada tarea obliga al agente a leer salidas grandes y estructuradas. El proyecto afirma que las 18 respuestas fueron correctas.
The data behind this chart
[
{
"label": "Logs de SRE",
"cambio_entrada_pct": -50.2
},
{
"label": "JSON de despliegue",
"cambio_entrada_pct": -26.4
},
{
"label": "CSV de fraude",
"cambio_entrada_pct": -55.1
},
{
"label": "Salida de tests",
"cambio_entrada_pct": -27.8
},
{
"label": "YAML de configuraci\u00f3n",
"cambio_entrada_pct": -46.2
},
{
"label": "HTML de un panel",
"cambio_entrada_pct": 9.9
},
{
"label": "Total de los seis casos",
"cambio_entrada_pct": -33.2
}
]En total, el proyecto informa de un cambio de -33.2 % en los tokens de entrada, según el recuento que devuelve el propio proveedor. El mejor caso es el CSV, con -55.1 %. El caso del panel HTML (el lenguaje de las páginas web) sube un 9.9 %. El motivo, según el mismo documento: no se aplicó ninguna transformación de compresión, y el coste de las reglas de la skill siguió contando desde la primera petición. Son tareas elegidas para que haya mucho que comprimir. Una sesión tuya, con otro reparto entre código y salida de herramientas, puede dar otro resultado.
Las pruebas de terceros
El 20 de abril de 2026, Growwstacks publicó una prueba con la misma tarea de programación hecha dos veces, con y sin caveman, en Claude Opus 4.7 con esfuerzo alto. Midieron el contador de uso de la sesión antes y después de cada tarea.
The data behind this chart
[
{
"label": "Sin caveman",
"uso_antes_pct": 13,
"uso_despues_pct": 17
},
{
"label": "Con caveman",
"uso_antes_pct": 17,
"uso_despues_pct": 21
}
]Sin caveman, el contador pasó de 13 % a 17 %. Con caveman, pasó de 17 % a 21 %. La subida fue la misma, aunque las respuestas eran más cortas. Es una sola tarea, así que no basta para sacar una regla general.
En julio de 2026, JetBrains repitió la prueba a mayor escala sobre 86 tareas reales de programación. Activaron caveman de forma forzada en cada tarea, que es el mejor caso posible. Midieron un 8.5 % menos de tokens de salida y una calidad indistinguible de la sesión normal. Su explicación coincide con lo anterior: en el trabajo de un agente, la salida es sobre todo llamadas a herramientas, ediciones, diffs y código, y la skill no toca nada de eso.
El proxy ve todo lo que lee Claude Code
El proxy es la pieza que sí actúa sobre la entrada. También es la pieza que pide más confianza, porque se sitúa entre Claude Code y Anthropic y procesa cada petición completa.
La documentación técnica del proyecto (docs/technical/security-and-privacy.md) enumera lo que el proxy maneja: prompts, salida de herramientas, código fuente, credenciales del proveedor y estado del navegador. Sobre la autenticación dice que el proxy reenvía la credencial que elige quien llama. Si usas Claude Code con tu sesión de Pro o Max, quien llama es Claude Code, y la credencial que pasa por el proxy es la de tu cuenta. La norma del proyecto es conservar esa cabecera de autorización sin registrarla en ningún log.
Hay además una copia en disco. El README lo indica así: los originales de todo lo que el proxy comprime quedan en un archivo SQLite en tu máquina. Si un comando imprime una variable de entorno con una clave, o un log contiene datos de clientes, ese texto queda también en ese archivo. Trátalo como tratarías cualquier archivo que contiene secretos.
La telemetría es opcional. Según el README envía estadísticas de uso, un identificador de instalación, el sistema operativo y la zona horaria, nunca prompts ni código. Se desactiva con caveman telemetry off o con la variable DO_NOT_TRACK=1. El README también afirma que el proxy local no se conecta a los servidores del proyecto. El código es abierto, así que esas afirmaciones se pueden comprobar leyéndolo.
Hay un efecto secundario que pocos esperan. La documentación del proyecto explica que Claude Code 2.1.196 y posteriores solo permiten Remote Control cuando ANTHROPIC_BASE_URL apunta a api.anthropic.com. Una sesión que pasa por el proxy no puede iniciar Remote Control. Si sigues tus sesiones desde el móvil como en usar Claude Code desde el teléfono, esa sesión no estará disponible.
Antes de ejecutar caveman claude, responde a dos preguntas. ¿Tu empresa o tu cliente permite que un programa de terceros procese su código y guarde copias en tu disco? ¿Has leído, o confías en quien ha leído, el código del proxy en la versión que instalas? Si la respuesta a cualquiera de las dos es no, quédate con la skill sola o sin caveman.
Si decides probarlo, mide en lugar de suponer. El proyecto incluye caveman trial -- claude, que compara sesiones reales con y sin compresión. También ofrece caveman wrap --off claude, un modo de registro que observa el tráfico sin cambiar los bytes que ve el modelo. Para seguir el gasto desde fuera de caveman, revisa las herramientas para seguir el gasto de Claude Code.
¿Ahorra lo mismo el modo cavernícola en español que en inglés?
Es una pregunta abierta, y aquí no tiene respuesta. Todas las mediciones citadas arriba se hicieron en inglés, tanto las del proyecto como las de terceros. Las reglas de la skill también están escritas en inglés.
Hay dos variables que nadie ha aislado para caveman. La primera es el tokenizador, el componente que parte el texto en tokens. Un mismo contenido puede ocupar un número distinto de tokens en español y en inglés. La segunda es el propio estilo cavernícola. El español quita artículos y conjugaciones de forma distinta al inglés, así que el porcentaje que se ahorra al eliminar palabras no tiene por qué ser el mismo. Si trabajas en otro idioma, el análisis de los límites de uso de Claude Pro cuando trabajas en portugués ayuda a plantear la misma pregunta para el español. La forma honesta de responderla para tu caso es caveman trial -- claude con tus propias tareas y tus propios prompts en español.
Qué sí estira tu límite de Claude
Si la entrada es casi todo el consumo, las palancas que funcionan son las que reducen lo que Claude relee en cada llamada. Ninguna es tan llamativa como un 75 %, pero actúan sobre la parte grande.
- Disciplina de contexto. Empezar una conversación nueva para cada tarea y no arrastrar archivos que ya no hacen falta. Lo tienes paso a paso en cómo gestionar el contexto en Claude Code.
- Elección de modelo y de esfuerzo. Un modelo más pequeño o un nivel de esfuerzo menor consume menos para la misma tarea sencilla. Las diferencias están en los niveles de esfuerzo max y high de Claude.
- Menos carga fija por llamada. Cada servidor MCP y cada skill se pagan en cada petición, y eso incluye las propias reglas de caveman. El detalle está en el coste fijo en tokens del entorno del agente.
- Saber qué gasta tu plan. Antes de cambiar nada, conviene ver qué consume tu límite de Claude Pro, porque el patrón de uso de cada persona es distinto.
Si ya estás delante de la pantalla de límite alcanzado, qué hacer cuando Claude te dice que has llegado al límite cubre las opciones inmediatas.
FAQ
¿Caveman reduce de verdad un 75 % los tokens de Claude?
Solo en la salida, y solo en conversaciones donde casi todo es prosa. Frente a un control que ya pide respuestas concisas, el propio proyecto mide en la versión 3.1.0 una mediana del 3 % para la voz por defecto y del 35 % para ultracave. En 86 tareas reales de programación, JetBrains midió un 8.5 % menos de tokens de salida. La skill no reduce la entrada, que es la mayor parte de una sesión de Claude Code.
¿La skill de caveman hace que Claude Pro o Max me dure más?
Poco, en el mejor caso. Claude Code reenvía en cada llamada el historial, los archivos leídos, la salida de los comandos y las reglas cargadas, y la skill no toca nada de eso. Además, sus reglas añaden unos 1000 tokens de entrada estimados en cada llamada, según su README. En una prueba independiente de abril de 2026, el contador de uso subió lo mismo con y sin caveman en la misma tarea.
¿Es seguro usar el proxy de caveman con mi cuenta de Claude Pro o Max?
Es una decisión de confianza. El proxy corre en tu máquina, en 127.0.0.1:8787, y procesa cada petición completa: prompts, código, salida de herramientas y la credencial de tu cuenta, que reenvía a Anthropic. Guarda copias de lo que comprime en un archivo SQLite local. Además, una sesión que pasa por el proxy no puede iniciar Remote Control en Claude Code 2.1.196 o posterior. Úsalo solo si tu empresa lo permite y confías en el código de la versión que instalas.
¿Existe una versión de caveman en español?
No en la etiqueta v3.1.0. Ninguna carpeta de skills de esa versión se llama caveman-es, y el instalador no ofrece una opción --skill para elegirla. Tampoco hay mediciones publicadas que digan si el estilo cavernícola en español ahorra lo mismo que en inglés. Para saberlo en tu caso, compara tus propias sesiones con caveman trial -- claude.