SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-25

Можно ли развернуть Claude на своем сервере

Развернуть Claude на своем оборудовании невозможно, так как веса модели закрыты. В статье разобраны альтернативы: запуск открытых LLM, настройка API-шлюза и Claude Code.

Можно ли развернуть Claude на собственном сервере? Нет, и вот почему

Вы не можете развернуть Claude на собственном оборудовании. Anthropic не публикует веса модели, поэтому не существует файлов для загрузки, контейнеров для запуска и лицензий, позволяющих использовать её на своих мощностях. Каждый запрос к Claude отправляется через API Anthropic или к партнёрам, таким как Amazon Bedrock, Google Vertex AI или Microsoft Foundry. Запуск модели на собственной машине — это не вопрос конфигурации. Данный артефакт просто не существует вне инфраструктуры Anthropic.

Это краткий ответ. Более развёрнутый ответ заключается в том, что большинству людей, задающих этот вопрос, на самом деле не нужны веса модели. Им нужно одно из трёх решений, которые можно реализовать на подконтрольном вам сервере: производительная модель для локального запуска, шлюз для управления API-ключами и лимитами расходов или агент для программирования, работающий на сервере, а не на локальном ноутбуке. В этом руководстве рассматриваются все три варианта с необходимыми командами.

Что обычно подразумевают под «self-hosted Claude»

Поисковые запросы по фразе «self hosted Claude» отражают несколько разных потребностей, для каждой из которых требуется свое решение.

Некоторым пользователям важна конфиденциальность. Они не хотят, чтобы промпты покидали пределы их сети. Эту задачу решает только локальная модель с открытыми весами, так как любой запрос к Claude по определению является запросом к Anthropic.

Некоторым пользователям нужен контроль расходов. Они опасаются, что вышедший из-под контроля агент израсходует все кредиты. Эту проблему решает шлюз; он работает с Claude, позволяя сохранить высокое качество модели.

Некоторым пользователям нужна независимость от ноутбука. Они хотят, чтобы агент продолжал работу, даже когда крышка ноутбука закрыта. Эту задачу решает VPS, на котором Claude Code работает без проблем.

Некоторые пользователи ищут «self hosted OpenRouter». Это также подразумевает шлюз, и стандартным решением здесь является LiteLLM.

Определитесь со своей целью, так как для каждого случая требуется разная архитектура системы.

Развертывание открытой модели с помощью Ollama

Если необходимо, чтобы ни один запрос не покидал ваш сервер, используйте модель с открытыми весами. Семейства моделей, которые сегодня реально использовать на арендованном сервере: Llama, Qwen, Mistral, Gemma и DeepSeek. Все они публикуют веса, которые можно загрузить и запустить.

Ollama — самый быстрый способ начать работу. Скрипт установки состоит из одной строки и настраивает службу systemd в Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama должен вывести active (running). После этого загрузите модель и начните общение.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

Первая команда pull загружает несколько гигабайт данных, поэтому модель должна поместиться в ОЗУ или видеопамять, прежде чем она сможет ответить. Примерное правило для квантованных моделей: модели с 8 миллиардами параметров требуется около 6 ГБ свободной памяти, модели с 14 миллиардами — около 10 ГБ, а модели с 70 миллиардами параметров требуют больше памяти, чем есть у большинства стандартных VPS. Если на сервере не хватает памяти, процесс завершается ядром, и вы увидите Error: llama runner process has terminated, а в dmesg появится запись об ошибке нехватки памяти (out of memory). Проверьте free -h, прежде чем винить модель. Тот же объем памяти определяет, какой объем длинного запроса модель фактически прочитает, поскольку Ollama незаметно обрезает все, что выходит за рамки небольшого окна по умолчанию, поэтому увеличение num_ctx и настройка размера KV-кэша — это первое, что нужно проверить, если длинные документы возвращаются лишь частично обобщенными.

Ollama также предоставляет HTTP API на 127.0.0.1:11434, что делает ее полезной для другого программного обеспечения, а не только как инструмент для чата.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Если первый запрос после периода простоя выполняется тридцать секунд, а следующий возвращается мгновенно — это не ошибка: Ollama выгружает модель через пять минут бездействия, а удержание модели в памяти с помощью keep_alive устраняет задержку на повторную загрузку.

Оставьте этот порт привязанным к localhost. Открытый порт Ollama на публичном IP-адресе — это бесплатный GPU для любого, кто его обнаружит. Полная настройка, включая юнит systemd, определение GPU и установку обратного прокси-сервера перед ним, описана в руководстве по запуску Ollama на VPS. Если вы обслуживаете более одного пользователя одновременно, сначала прочитайте сравнение Ollama и vLLM, так как архитектура Ollama, ориентированная на один поток, становится узким местом задолго до того, как им станет аппаратное обеспечение.

Будьте реалистичны в оценке возможностей. Хорошая открытая модель на VPS среднего размера действительно полезна для обобщения, классификации, черновиков и простого извлечения данных. В задачах с длинными многошаговыми рассуждениями, при работе с большими кодовыми базами и при использовании агентских инструментов она не приближается к передовым облачным моделям, и никакая настройка промптов не устранит этот разрыв. Выбирайте локальную модель для задач, с которыми она справляется хорошо, и оплачивайте облачные решения там, где сложность задач действительно высока.

Запуск собственного шлюза с LiteLLM

Это именно то «самостоятельно размещаемое решение уровня OpenRouter», которое ищут многие. Шлюз располагается между вашими приложениями и любым поставщиком моделей. Ваши приложения используют один ключ, указывающий на ваш сервер. Реальные ключи поставщиков хранятся только на этом сервере. Вы можете ограничивать расходы для каждого ключа, направлять запросы разных приложений к разным моделям и вести единый журнал всех обращений.

LiteLLM — популярный выбор, так как он поддерживает API, совместимый с OpenAI, и проксирует запросы к Anthropic, Ollama и большинству других провайдеров через одну и ту же конечную точку. Запустите его в Docker с файлом конфигурации.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Сохраните это как litellm_config.yaml и запустите прокси. Он ожидает подключений на порту 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY — это учетные данные администратора, поэтому относитесь к ним как к паролю root и не используйте пример значения в продакшене. Обращайтесь к прокси точно так же, как вы обращались бы к любому другому API.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Корректный ответ представляет собой стандартный JSON с массивом choices. Ошибка 401 означает, что заголовок Authorization не совпадает с вашим мастер-ключом. Ошибка 400 с указанием модели означает, что model в вашем запросе не соответствует ни одному model_name в файле конфигурации.

Причина создания такой системы вместо прямого обращения к Anthropic — возможность ограничения расходов. Выпускайте отдельный виртуальный ключ для каждого приложения, устанавливая для каждого свой бюджет.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Такой ключ может быть ограничен суммой в сто долларов и доступом только к одной модели. Если агент начнет вести себя некорректно в три часа ночи, ущерб будет ограничен одним ключом, а не всей вашей учетной записью. Этот подход, а также сопутствующий мониторинг, подробно описаны в статье контроль расходов на агентов на VPS. Если вы еще решаете, стоит ли платить за каждый токен, сравнение стоимости API и подписки поможет разобраться в расчетах.

Учтите, чего шлюз не делает. Он не делает Claude локальным и не скрывает ваши промпты от Anthropic. Запросы по-прежнему покидают ваш сервер и отправляются к поставщику. Вы получаете контроль над ключами, расходами, маршрутизацией и логами.

Запуск Claude Code на собственном VPS

Третье желание выполнить проще всего. Claude Code — это клиентское приложение. Оно работает везде, где установлен Node.js, и взаимодействует с API по протоколу HTTPS. Размещение агента на собственном сервере означает, что он продолжит работу после выключения вашего ноутбука, а область потенциального воздействия агента будет ограничена изолированной средой, которую можно пересоздать, в отличие от вашей основной рабочей машины.

npm install -g @anthropic-ai/claude-code
claude --version

Запускайте его внутри tmux, чтобы разрыв SSH-соединения не прерывал выполнение длительных задач. Эта настройка, включая управление сессиями, описана в запуске Claude Code на VPS с использованием tmux. Создайте для агента отдельного непривилегированного пользователя и ознакомьтесь с правилами безопасности при запуске Claude Code на сервере, прежде чем предоставлять ему права на запись в важные для вас данные.

Это self-hosting агента, а не модели. Важно соблюдать точность в формулировках, так как это часто вызывает путаницу. Вы контролируете процесс, файловую систему, исходящий сетевой трафик и логи. Инференс по-прежнему остается на стороне Anthropic.

Во что на самом деле обходится каждый вариант

Цены меняются, поэтому воспринимайте их как ориентир, а не как коммерческое предложение. По состоянию на июль 2026 года Claude Sonnet 5 стоит 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов, а Claude Opus 5 — 5 и 25 долларов соответственно. Локальная модель не требует оплаты за токены, но её стоимость равна ежемесячным расходам на сервер, который работает независимо от того, используете вы его или нет.

Точка безубыточности находится ниже, чем принято считать. VPS с объёмом памяти, достаточным для запуска полезной открытой модели, стоит реальных денег каждый месяц, при этом большую часть времени он простаивает. Если ваша нагрузка носит скачкообразный характер, использование API обычно обходится дешевле. Если же нагрузка постоянна или ваши данные не должны покидать внутреннюю сеть, локальная модель выигрывает по обоим пунктам.

Честный гибридный подход — это то, к чему приходит большинство команд. Запускайте открытую модель локально для выполнения объёмных и простых задач. Сложные запросы направляйте в облачную frontier-модель. Установите шлюз перед обеими моделями, чтобы приложениям не нужно было знать, какая из них используется, и чтобы вы могли менять распределение нагрузки, не затрагивая код приложений. Такая архитектура является практической реализацией концепции «Claude с собственным хостингом», и в отличие от буквального понимания, она реально существует. Если вы хотите также самостоятельно запускать весь стек агентов, обзор self-hosted AI-агентов содержит информацию о доступных решениях.

FAQ

Могу ли я скачать веса моделей Claude и запустить их локально?

Нет. Anthropic никогда не выпускала веса для моделей Claude, и не существует лицензии, разрешающей их самостоятельный хостинг. Всё, что рекламируется в сети как скачиваемая «модель Claude», является либо другой моделью с вводящим в заблуждение названием, либо обёрткой, которая обращается к API. Если для работы требуется API key, модель не является локальной.

Какая открытая модель ближе всего к Claude?

Точного соответствия нет, а лидеры меняются каждые несколько месяцев. Семейства моделей с открытыми весами, которые стоит протестировать: Llama, Qwen, Mistral, Gemma и DeepSeek. В задачах суммаризации, классификации и простого редактирования кода качественная открытая модель с 8–14 миллиардами параметров действительно полезна. В задачах на длинные многошаговые рассуждения и использование агентских инструментов разрыв с облачными пограничными моделями всё ещё велик. Тестируйте на собственных промптах, а не доверяйте рейтингам.

Является ли LiteLLM самохостинговым аналогом OpenRouter?

Функционально — да, в части маршрутизации и управления ключами. LiteLLM запускается на вашем сервере, предоставляет одну точку входа, совместимую с OpenAI, и проксирует запросы к Anthropic, Ollama и большинству других провайдеров. Вы получаете лимиты расходов на каждый ключ, маршрутизацию моделей и единое место для чтения логов. Чего он не даёт, так это локального инференса: запросы к Claude всё равно уходят в Anthropic.

Гарантирует ли запуск Claude Code на собственном сервере конфиденциальность моего кода?

Нет. Claude Code отправляет содержимое файлов, которые он читает, в API Anthropic, независимо от того, где запущен процесс. VPS обеспечивает изоляцию агента, а не конфиденциальность контента. Выделите для него отдельного пользователя без привилегий, держите его подальше от учётных данных и несвязанных репозиториев, и относитесь ко всему, что он может прочитать, как к данным, которые покидают ваш сервер.