Можно ли запустить Claude на своём сервере? Честный ответ
Весы Claude не опубликованы, поэтому запустить модель на своём сервере нельзя. Разбираем, что можно разместить самостоятельно: open models, gateway и Claude Code.
Можно ли разместить Claude на собственном сервере? Нет, и вот почему
Вы не можете разместить Claude на собственном сервере. Anthropic не публикует веса модели, поэтому не существует файла для скачивания, контейнера для запуска или лицензии, которая позволила бы обслуживать модель на собственном оборудовании. Каждый запрос к Claude отправляется через API Anthropic или размещённого партнёра, например Amazon Bedrock, Google Vertex AI или Microsoft Foundry. Запуск модели на принадлежащей вам машине — не проблема конфигурации. За пределами Anthropic этого артефакта просто не существует.
Это краткий ответ. Более полный ответ заключается в том, что большинство людей, задающих этот вопрос, на самом деле не хотят получить веса модели. Им нужно одно из трёх решений, каждое из которых можно реализовать на сервере под вашим контролем: производительная модель, работающая локально; шлюз, который хранит их API keys и ограничивает расходы; или coding agent, работающий на их собственном сервере, а не на ноутбуке. В этом руководстве рассматриваются все три варианта вместе с командами.
Что обычно означает «self-hosted Claude»
Поисковые запросы «self hosted Claude» обычно отражают несколько разных задач. Для каждой задачи нужен свой вариант решения.
Некоторым нужна конфиденциальность. Они не хотят, чтобы запросы покидали их сеть. Это решает только локальная модель с открытыми весами, поскольку любой запрос к Claude по определению отправляется в Anthropic.
Некоторым нужен контроль затрат. Они опасаются, что неконтролируемый агент израсходует все кредиты. Это решает шлюз. Он работает с Claude, поэтому качество модели сохраняется.
Некоторым нужна независимость от ноутбука. Они хотят, чтобы агент продолжал работать после закрытия крышки. Для этого подходит VPS, на котором Claude Code работает без проблем.
Некоторым нужен «self-hosted OpenRouter». Это также шлюз. Обычно для этого используют LiteLLM.
Сначала определите свою задачу. Для каждого случая требуется своя конфигурация.
Разверните открытую модель самостоятельно с помощью Ollama
Если необходимо, чтобы ни один запрос не покидал ваш сервер, используйте модель с открытыми весами. Семейства, которые сегодня действительно можно использовать на арендованном сервере, — Llama, Qwen, Mistral, Gemma и DeepSeek. Для всех них опубликованы веса, которые можно скачать и запустить.
Ollama — самый быстрый способ начать работу. Скрипт установки состоит из одной строки и настраивает службу systemd в Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamaКоманда systemctl status ollama должна вывести active (running). Затем скачайте модель и отправьте ей запрос.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."При первом выполнении pull скачиваются несколько гигабайт данных, поэтому до обработки запросов модель должна помещаться в оперативную или видеопамять. Для квантованных моделей можно использовать следующее приблизительное правило: модели с 8 миллиардами параметров требуется около 6 GB свободной памяти, модели с 14 миллиардами параметров — около 10 GB, а модели с 70 миллиардами параметров требуется больше памяти, чем обычно доступно в тарифах VPS общего назначения. Если памяти недостаточно, ядро завершает процесс, и вы видите Error: llama runner process has terminated. В dmesg при этом появляется строка об отсутствии памяти. Перед тем как обвинять модель, проверьте free -h.
Ollama также предоставляет HTTP API на 127.0.0.1:11434. Поэтому его можно использовать с другим программным обеспечением, а не только как чат.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Оставьте этот порт доступным только через localhost. Открытый порт Ollama на публичном IP-адресе превращает сервер в бесплатный GPU для любого, кто его обнаружит. Полная настройка, включая модуль systemd, обнаружение GPU и размещение reverse proxy перед сервисом, описана в руководстве по запуску Ollama на VPS. Если одновременно обслуживаются несколько пользователей, сначала прочитайте сравнение Ollama и vLLM, поскольку архитектура Ollama с одним потоком становится узким местом задолго до того, как им становится оборудование.
Реалистично оценивайте различия. Хорошая открытая модель на VPS среднего размера действительно полезна для создания резюме, классификации, подготовки черновиков и простого извлечения данных. При длительных многоэтапных рассуждениях, работе с большими кодовыми базами и использовании инструментов агентами она значительно уступает размещаемой frontier-модели, и никакая настройка запросов не устранит этот разрыв. Выбирайте локальную модель для задач, с которыми она хорошо справляется, а размещаемую модель используйте там, где задача действительно сложная.
Запустите собственный шлюз с LiteLLM
Это и есть «собственный OpenRouter», который ищут пользователи. Шлюз находится между вашими приложениями и всеми поставщиками моделей. Приложения используют один ключ, который указывает на ваш сервер. Настоящие ключи поставщиков хранятся только на этом сервере. Вы можете ограничить расходы для каждого ключа, направлять разные приложения к разным моделям и регистрировать все запросы в одном месте.
LiteLLM часто выбирают потому, что он поддерживает совместимый с OpenAI API и проксирует запросы к Anthropic, Ollama и большинству других поставщиков через одну и ту же конечную точку. Запустите его в Docker с файлом конфигурации.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Сохраните это как litellm_config.yaml и запустите прокси. Он прослушивает порт 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY — это учетные данные администратора. Обращайтесь с ними как с паролем root и не используйте значение из примера в рабочей среде. Обращайтесь к прокси так же, как к размещенному API.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Корректный ответ представляет собой обычный JSON с массивом choices. Ответ 401 означает, что заголовок Authorization не соответствует главному ключу. Ответ 400 с именем модели означает, что значение model в вашем запросе не соответствует ни одному значению model_name в файле конфигурации.
Причина развернуть такой шлюз, а не обращаться напрямую к Anthropic, — ограничение расходов. Выпустите отдельный виртуальный ключ для каждого приложения и задайте для каждого ключа собственный бюджет.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'С помощью этого ключа можно потратить сто долларов и получить доступ к одной модели, но ни к чему другому. Если агент начнет работать неправильно в три часа ночи, последствия затронут один ключ, а не весь ваш аккаунт. Этому подходу и связанному с ним мониторингу посвящен материал как контролировать расходы агентов на VPS. Если вы еще решаете, стоит ли вообще платить за токены, в материале сравнение стоимости API и подписки приведен расчет.
Обратите внимание, чего шлюз не делает. Он не делает Claude локальной моделью и не скрывает ваши запросы от Anthropic. Запросы по-прежнему покидают ваш сервер и отправляются поставщику. Вы получаете контроль над ключами, расходами, маршрутизацией и журналами.
Запустите Claude Code на собственном VPS
Третье пожелание выполнить проще всего. Claude Code — это клиент. Он работает везде, где установлен Node.js, и обращается к API по HTTPS. Если установить его на собственном сервере, агент продолжит работу после выключения ноутбука. Кроме того, зона воздействия агента будет ограничена системой, которую можно переустановить, а не вашим основным компьютером.
npm install -g @anthropic-ai/claude-code
claude --versionЗапускайте его внутри tmux, чтобы разрыв SSH-соединения не остановил длительное задание. Эта настройка, включая управление сеансом, описана в разделе запуск Claude Code на VPS с tmux. Выделите для агента отдельного непривилегированного пользователя. Перед тем как предоставить ему доступ на запись к важным данным, ознакомьтесь с разделом правила безопасности при запуске Claude Code на сервере.
Так вы размещаете агента на собственном сервере, но не модель. Важно точно понимать это различие, поскольку его часто не учитывают. Вам принадлежат процесс, файловая система, исходящий сетевой трафик и журналы. Anthropic по-прежнему отвечает за выполнение инференса.
Сколько на самом деле стоит каждый вариант
Цены меняются, поэтому воспринимайте эти значения как ориентир, а не как точную расценку. По состоянию на июль 2026 года Claude Sonnet 5 стоит $3 за миллион входных токенов и $15 за миллион выходных токенов, а Claude Opus 5 — $5 и $25 соответственно. Локальная модель не тарифицируется за токены. Вместо этого вы платите ежемесячную стоимость сервера, который работает независимо от того, используете вы его или нет.
Точка безубыточности наступает раньше, чем многие ожидают. VPS с достаточным объемом памяти для запуска полезной открытой модели каждый месяц стоит реальных денег и большую часть времени простаивает. При неравномерной нагрузке размещенный API обычно обходится дешевле. При постоянной нагрузке или если данные не могут покидать вашу сеть локальная модель выигрывает по обоим параметрам.
Для большинства команд оптимальным оказывается смешанный вариант. Запускайте открытую модель локально для большого объема простых задач. Сложные запросы направляйте в размещенную передовую модель. Разместите перед обеими моделями шлюз, чтобы приложениям не приходилось знать, какая модель обрабатывает запрос, и чтобы вы могли менять границу между ними без изменения кода приложений. Такая архитектура является практическим вариантом «Claude с самостоятельным размещением». В отличие от буквального варианта, она существует. Если вы также хотите самостоятельно запускать весь стек агентов, в обзоре AI-агентов с самостоятельным размещением описаны доступные варианты.
FAQ
Можно ли скачать веса модели Claude и запустить их локально?
Нет. Anthropic никогда не выпускала веса ни одной модели Claude, и лицензии, разрешающей самостоятельное размещение, не существует. Всё, что в интернете рекламируется как загружаемая «модель Claude», — это либо другая модель с вводящим в заблуждение названием, либо оболочка, которая обращается к API. Если для работы требуется API key, модель не является локальной.
Какая открытая модель наиболее близка к Claude?
Точного соответствия нет, а лидеры меняются каждые несколько месяцев. Стоит протестировать семейства моделей с открытыми весами Llama, Qwen, Mistral, Gemma и DeepSeek. Для создания сводок, классификации и простого редактирования кода хорошая открытая модель с 8–14 миллиардами параметров действительно полезна. В задачах многошагового рассуждения на длинном контексте и агентного использования инструментов отставание от размещённой передовой модели всё ещё велико. Тестируйте модели на собственных запросах, а не полагайтесь на таблицу лидеров.
Является ли LiteLLM самостоятельно размещаемым OpenRouter?
Функционально — да, в части маршрутизации и управления ключами. LiteLLM работает на вашем сервере, предоставляет одну совместимую с OpenAI конечную точку и проксирует запросы к Anthropic, Ollama и большинству других провайдеров. Вы получаете лимиты расходов для каждого ключа, маршрутизацию моделей и единое место для просмотра журналов. При этом LiteLLM не предоставляет локальный вывод: запросы к Claude по-прежнему передаются в Anthropic.
Обеспечивает ли запуск Claude Code на собственном сервере конфиденциальность моего кода?
Нет. Claude Code отправляет содержимое прочитанных файлов в Anthropic API независимо от того, где запущен процесс. VPS изолирует агент, но не обеспечивает конфиденциальность содержимого. Предоставьте ему отдельную непривилегированную учётную запись, закройте доступ к учётным данным и несвязанным репозиториям и считайте всё, что он может прочитать, содержимым, покидающим сервер.