SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor

Caveman в Claude Code: растягивает ли он лимит Pro и Max

Вирусные 75% против цифр самого README: /caveman режет вывод на 3%, /ultracave на 35%. Почему лимит Claude тратится на вход и что из Caveman пробовать первым.

Короткий ответ: растягивает ли Caveman лимит Claude

Скилл Caveman для Claude Code растягивает лимит Claude Pro и Max, но намного слабее, чем обещали вирусные посты. Весной 2026 года обзоры повторяли цифру от 65 до 75% экономии токенов. README проекта на 6 октября 2026 года даёт другие числа. Режим /caveman сокращает ответы на 3% по сравнению с обычной просьбой отвечать кратко, а /ultracave на 35%.

Есть и вторая причина не ждать чуда. Эти проценты относятся к выходным токенам, то есть к тексту, который пишет модель. Лимит в Claude Code уходит в основном на входные токены, потому что каждый ход заново отправляет модели весь контекст. Поэтому даже честные 35% от вывода дают небольшую долю от всего расхода. Ниже мы разберём три механизма Caveman по отдельности, покажем, как измерить свою сессию, и скажем, что пробовать первым.

Что такое Caveman и откуда взялись 75%

Caveman (автор Julius Brussee) учит ИИ-агента отвечать коротко, «как пещерный человек». Девиз проекта: «why many token when few do trick». Начинался он как один скилл. Скиллом (skill) называют файл с инструкциями, который Claude Code подгружает в контекст, когда он нужен. Если термин для вас новый, начните с объяснения, что такое скиллы агента и как они загружаются.

Ранние описания проекта обещали срезать около 75% токенов. Сегодняшняя таблица README показывает, откуда берутся такие большие числа: если сравнивать с ответом модели без всяких инструкций, разница выглядит огромной. Такой ответ у модели самый многословный. Теперь README сам называет правильную точку отсчёта: «New models already know "be concise", so that line is the real baseline». Иначе говоря, честно сравнивать скилл нужно с одной строкой «Answer concisely.», а не с пустым промптом.

Таблица из README показывает, почему это важно:

ChartВыходные токены на десяти вопросах разработчика, claude-opus-5-5 (данные README Caveman, 6 октября 2026)
The data behind this chart
[
  {
    "label": "\u0411\u0435\u0437 \u0438\u043d\u0441\u0442\u0440\u0443\u043a\u0446\u0438\u0438",
    "output_tokens": "6,983"
  },
  {
    "label": "Answer concisely.",
    "output_tokens": "4,334"
  },
  {
    "label": "/caveman",
    "output_tokens": "4,119"
  },
  {
    "label": "/ultracave",
    "output_tokens": "2,693"
  }
]

Без инструкций модель написала 6,983 выходных токенов. Одна строка «Answer concisely.» дала 4,334. Значит, большую часть экономии даёт обычная просьба о краткости, а не скилл. /caveman добавил к ней совсем немного: 4,119. Заметную разницу даёт только /ultracave: 2,693. Проценты в README даны как медиана по вопросам. Поэтому они не совпадают точно с простым отношением итоговых чисел.

Тест маленький: десять вопросов на модели claude-opus-5-5, так указано в README. Это не повод ему не верить. Это повод не переносить его результат на свою работу без проверки.

Что README Caveman говорит в релизе v3.1.0

Всё ниже относится к релизу Caveman 3.1.0, на который ссылается README на 6 октября 2026 года. Релиз вышел 4 октября. Он заменил шесть уровней интенсивности тремя самостоятельными голосами: /caveman, /ultracave и /megacave. Основой стал упрощённый технический английский, а не ломаная грамматика.

ChartЗаявленное сокращение по README и релизу Caveman 3.1.0, % (что именно сокращается, см. колонку notes)
The data behind this chart
[
  {
    "label": "/caveman",
    "reduction_pct": 3,
    "notes": "\u0432\u044b\u0445\u043e\u0434\u043d\u044b\u0435 \u0442\u043e\u043a\u0435\u043d\u044b, \u043c\u0435\u0434\u0438\u0430\u043d\u0430, \u0431\u0430\u0437\u0430 Answer concisely."
  },
  {
    "label": "/ultracave",
    "reduction_pct": 35,
    "notes": "\u0432\u044b\u0445\u043e\u0434\u043d\u044b\u0435 \u0442\u043e\u043a\u0435\u043d\u044b, \u043c\u0435\u0434\u0438\u0430\u043d\u0430, \u0431\u0430\u0437\u0430 Answer concisely."
  },
  {
    "label": "/megacave",
    "reduction_pct": 9,
    "notes": "\u0432\u044b\u0445\u043e\u0434\u043d\u044b\u0435 \u0442\u043e\u043a\u0435\u043d\u044b \u043f\u0440\u043e\u0442\u0438\u0432 \u043a\u043e\u043d\u0442\u0440\u043e\u043b\u044f, \u0438\u0437 \u0437\u0430\u043c\u0435\u0442\u043e\u043a \u043a \u0440\u0435\u043b\u0438\u0437\u0443"
  },
  {
    "label": "\u041f\u0440\u043e\u043a\u0441\u0438",
    "reduction_pct": 33.2,
    "notes": "\u0432\u0445\u043e\u0434\u043d\u044b\u0435 \u0442\u043e\u043a\u0435\u043d\u044b \u0437\u0430 \u0441\u0435\u0441\u0441\u0438\u044e Claude Code"
  },
  {
    "label": "caveman-compress",
    "reduction_pct": 46,
    "notes": "\u0440\u0430\u0437\u043c\u0435\u0440 \u0444\u0430\u0439\u043b\u0430 \u043f\u0430\u043c\u044f\u0442\u0438 \u0432 \u0441\u0440\u0435\u0434\u043d\u0435\u043c"
  }
]

Эти пять чисел нельзя складывать и нельзя сравнивать между собой. Первые три описывают вывод модели. Цифра 33.2% описывает вход за целую сессию. Последняя, 46%, говорит только о размере файла CLAUDE.md после сжатия. Вирусные посты брали самое крупное число и применяли его ко всему лимиту. Так делать нельзя.

README приводит и внешние данные. По его словам, JetBrains проверила скилл на 86 задачах и получила 8,5% меньше выходных токенов без заметной потери качества. Это тоже процент от вывода, а не от лимита.

Почему сжатый вывод почти не двигает лимит Claude

Каждый запрос Claude Code несёт всю историю сессии: системный промпт, CLAUDE.md, описания инструментов, прочитанные файлы и результаты команд. Документация Anthropic пишет об этом прямо. Claude Code отправляет весь разговор с каждым запросом, а после каждого вызова инструмента отправляет ещё один запрос с его результатом. Кеширование промпта (prompt caching) делает повтор дешевле, но не убирает его. История читается заново по ставке кеша. Подробно эта механика разобрана в разборе, из чего складываются токены в Claude Code.

Вот как выглядит сводка одной сессии. Это пример из документации Anthropic к команде /usage, а не наш замер:

ChartТокены одной сессии по типам: пример из документации Claude Code
The data behind this chart
[
  {
    "category": "input",
    "tokens": "1,200"
  },
  {
    "category": "output",
    "tokens": "5,300"
  },
  {
    "category": "cache read",
    "tokens": "940,000"
  },
  {
    "category": "cache write",
    "tokens": "50,000"
  }
]

В этом примере чтение из кеша составляет 940,000 токенов, а вывод модели 5,300. Вывод здесь меньше одного процента от всех токенов. Сократите его даже вдвое, и общий объём почти не изменится.

Конечно, токены разных типов стоят по-разному. На API выходной токен дороже входного, а чтение из кеша дешевле обычного входа. Точные ставки есть на странице цен Anthropic. Но как подписка Pro или Max взвешивает разные типы токенов при расчёте лимита, Anthropic не публикует. Поэтому честного процента «сколько лимита съедает вывод» нет ни у нас, ни у авторов Caveman. Есть только ваш собственный замер. Что ещё расходует лимит, кроме ответов модели, описано в статье что на самом деле расходует лимит Claude Pro.

У скилла есть и обратная сторона. README честно предупреждает: «The ruleset rides along as input tokens on every call (about 1,000 estimated for the full skill)». То есть правила скилла добавляют около тысячи входных токенов к каждому запросу. На коротких вопросах и ответах эта добавка может съесть всю экономию на выводе. Сколько вообще стоят собственные инструкции агента, разобрано в материале о накладных расходах обвязки агента на токены.

Как измерить свою сессию вместо чужой цифры

Проверка простая. Вам нужны две похожие задачи: одна с Caveman, другая без него.

  1. Запустите /clear, чтобы начать новую сессию. Счётчики /usage при этом обнуляются.
  2. Выполните обычную задачу без Caveman. В конце запустите /usage.
  3. Запишите четыре числа из блока Session: input, output, cache read и cache write.
  4. Снова запустите /clear, включите /caveman и повторите похожую задачу.
  5. Сравните оба блока Session. Затем посмотрите на полосы лимита плана на том же экране.

Здоровый результат выглядит так: строка output заметно уменьшилась, а cache read почти не изменилась. Если output и раньше была крошечной по сравнению с cache read, скилл не поможет вашему лимиту. Это нормально. Просто ваш расход находится в другом месте.

На планах Pro и Max /usage показывает ещё и строку Attribution. Она делит недавний расход между скиллами, субагентами, плагинами и MCP-серверами. Так видно, сколько стоит сам плагин Caveman. Команда /caveman-stats из Caveman тоже показывает записанный расход токенов Claude Code. Но README сам оговаривает: точную экономию без контрольного замера не посчитать. Если нужен учёт за недели, а не за одну сессию, посмотрите обзор инструментов для учёта расхода Claude Code.

Рычаг первый: скилл для коротких ответов

Скилл меняет только то, как модель пишет. Правила голоса из README такие:

  • ответ в начале, без приветствий и пересказа вопроса;
  • одна мысль в предложении, не больше 20 слов, активный залог;
  • отрицания, числа и единицы измерения сохраняются точно;
  • код и команды не меняются;
  • минимум комментариев между вызовами инструментов;
  • предупреждения о безопасности пишутся полными предложениями;
  • если обычный английский короче, «пещерный» стиль не используется.

README релиза v3.1.0 даёт для Claude Code такую команду установки в виде плагина:

claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman

Для всех агентов сразу README предлагает скрипт, закреплённый на теге v3.1.0:

curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/v3.1.0/install.sh | bash

Этот скрипт выполняется с правами вашего пользователя. Откройте адрес в браузере и прочитайте скрипт перед запуском. Удаление установки, сделанной этим путём, README описывает так:

npx -y github:JuliusBrussee/caveman -- --uninstall

После установки откройте новую сессию Claude Code и наберите /caveman. Ответы должны стать короче, а код и пути в них должны остаться прежними. Как плагины подключаются и где хранятся, объясняет разбор плагинов Claude Code.

Рычаг второй: caveman-compress для CLAUDE.md

Второй механизм сжимает не ответы, а файлы памяти. CLAUDE.md загружается в начале сессии и остаётся в контексте каждого запроса. Значит, каждый лишний абзац в нём вы оплачиваете на каждом ходе. Экономия здесь окупается постоянно, а не только при длинных ответах.

Команда из README:

/caveman-compress CLAUDE.md

По README команда сохраняет заголовки, код, пути и адреса URL, а оригинал кладёт рядом как резервную копию. В среднем файл становится на 46% меньше. Проверьте результат сами:

wc -c CLAUDE.md
git diff CLAUDE.md

wc -c покажет новый размер в байтах. git diff покажет, что именно исчезло. Читайте этот дифф внимательно, потому что модель будет видеть именно сжатый текст. Если пропало правило, которое вам важно, верните его руками. Затем запустите /context в Claude Code и сравните, сколько места занимают файлы памяти. Документация Anthropic отдельно советует держать CLAUDE.md короче 200 строк, а редкие инструкции выносить в скиллы.

Рычаг третий: прокси, и что именно он читает

Третий механизм самый сильный и самый навязчивый. Это отдельная программа на Node.js (нужна версия 22.13 или новее). Команды из README:

npm install -g @caveman-ai/cli && caveman setup --install
caveman claude

README описывает прокси так: «One local process. Your agent talks to it, it talks to your provider». Это значит, что через него проходят все ваши запросы к Claude вместе с кодом и все ответы модели. Прокси сжимает то, что агент читает: логи, вывод тестов, JSON, диффы и веб-страницы. Именно там обычно и сидит основная масса входных токенов.

Замер README выполнен на Claude Code 2.1.223 с моделью Claude Sonnet 5. В нём шесть типов задач, по три прогона каждой, всего 54 прогона, и 18 из 18 ответов верны.

ChartВходные токены за набор сессий Claude Code (данные README Caveman)
The data behind this chart
[
  {
    "config": "Claude Code \u043d\u0430\u043f\u0440\u044f\u043c\u0443\u044e",
    "input_tokens": "885,793"
  },
  {
    "config": "Caveman \u043f\u0440\u043e\u043a\u0441\u0438 \u0438 \u0441\u043a\u0438\u043b\u043b",
    "input_tokens": "591,673"
  }
]

Напрямую сессии потратили 885,793 входных токенов, через прокси 591,673. Это и есть те самые 33.2%. README указывает и 95-процентный интервал: от 14,6% до 48,5%. Разброс большой, потому что экономия зависит от того, сколько логов и вывода тестов читает агент.

Теперь о том, что прокси трогает кроме трафика. Команда caveman learn читает историю агента, которая уже лежит на диске. У Claude Code это сессии в каталоге ~/.claude/projects. Скилл, по словам README, работает локально и ничего не отправляет. А вот CLI по умолчанию отправляет телеметрию: команды, запуски сессий, число токенов, случайный ID установки, ОС и её версию, часовой пояс и IP-адрес (IP удаляют через 90 дней). Отключение:

caveman telemetry off

Подходит и переменная окружения DO_NOT_TRACK=1. Если вы работаете с закрытым кодом, решите заранее, готовы ли вы пустить сторонний процесс между агентом и Anthropic. Есть вариант без посредника: хуки Claude Code умеют фильтровать вывод тестов до того, как он попадёт в контекст.

С чего начать, чтобы растянуть лимит Claude

Сначала добавьте в CLAUDE.md одну строку «Answer concisely.». Она бесплатна, и по таблице самого README именно она даёт основную часть экономии на выводе.

Из трёх рычагов Caveman первым пробуйте /caveman-compress для CLAUDE.md. Он не работает в фоне, не видит ваш трафик, оставляет резервную копию и окупается на каждом ходе. Результат легко проверить через git diff.

Прокси пробуйте вторым и только по замеру. Если /usage показывает длинные сессии, полные логов и вывода тестов, прокси может дать больше всего. Но он видит весь ваш трафик и по умолчанию отправляет телеметрию.

Скилл /caveman ставьте последним. Небольшое сокращение вывода против примерно тысячи входных токенов на каждый запрос редко окупается. /ultracave режет заметно сильнее, если вам удобно читать очень сжатый текст.

Если вы пишете Claude по-русски

README упоминает только один неанглийский вариант. Голос /megacave отвечает на классическом китайском (вэньянь), и README показывает пример такого ответа. Все замеры выше сделаны на английских вопросах, а правила голоса прямо ссылаются на «plain English».

О русских промптах README не говорит ничего. Неизвестно, ответит ли модель под /caveman по-русски и насколько короче будет ответ. Поэтому проценты из README нельзя переносить на работу на русском языке. Проверьте сами по схеме из раздела о замере: две похожие задачи на русском, одна с Caveman и одна без него.

FAQ

Сколько токенов на самом деле экономит Caveman?

По README на 6 октября 2026 года /caveman сокращает выходные токены на 3% по медиане относительно инструкции «Answer concisely.», а /ultracave на 35%. Прокси Caveman в замере README сократил входные токены за сессию на 33.2%. Большие цифры из ранних обзоров получаются, если сравнивать с ответом модели без всяких инструкций, поэтому они завышают пользу скилла.

Почему Caveman почти не помогает, если я упираюсь в лимит Claude Pro?

Скилл сокращает вывод модели, а лимит в Claude Code расходуется в основном на вход. Каждый ход заново отправляет всю историю сессии, и чтение из кеша обычно намного больше вывода. Кроме того, правила скилла добавляют около тысячи входных токенов к каждому запросу. Запустите /usage и сравните строки output и cache read, чтобы увидеть свою картину.

Безопасно ли запускать прокси Caveman с закрытым кодом?

Прокси работает локально, но через него проходят все запросы агента к провайдеру, включая код. Команда caveman learn читает историю агента на диске. CLI по умолчанию отправляет телеметрию, включая число токенов, ОС и IP-адрес. Отключить её можно командой caveman telemetry off или переменной DO_NOT_TRACK=1. Если посредник недопустим, используйте хуки Claude Code для фильтрации вывода тестов.

Работает ли Caveman, если я пишу Claude на русском?

README не приводит никаких данных о русском языке. Из неанглийских вариантов он описывает только /megacave, который отвечает на классическом китайском. Все проценты измерены на английских вопросах. Для русского языка их нужно проверить самостоятельно через /usage на двух похожих задачах.