SSD Nodes Learn 8GB RAM — $66/рік
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-01

Чи можна розгорнути Claude на власному сервері?

Ваги Claude не опубліковані, тому запустити його на власному сервері неможливо. Дізнайтеся, що можна self-host: open models, gateway і Claude Code.

Чи можна розгорнути Claude на власній інфраструктурі? Ні, і ось чому

Ви не можете розгорнути Claude на власній інфраструктурі. Anthropic не публікує ваги моделі, тому немає файла для завантаження, контейнера для запуску чи ліцензії, яка дозволяла б обслуговувати модель на власному обладнанні. Кожен запит до Claude надходить до API Anthropic або до розміщеного партнера, наприклад Amazon Bedrock, Google Vertex AI чи Microsoft Foundry. Запуск моделі на власній машині — не проблема конфігурації. Відповідного артефакту просто не існує за межами Anthropic.

Це коротка відповідь. Розгорнута відповідь полягає в тому, що більшість людей, які ставлять це запитання, насправді не потребують ваг моделі. Їм потрібен один із трьох компонентів, які можна реалізувати на сервері під власним контролем: потужна модель, що працює локально; шлюз, який зберігає їхні API keys і обмежує витрати; або coding agent, який працює на їхньому власному сервері, а не на ноутбуці. У цьому посібнику розглянуто всі три варіанти разом із командами.

Що зазвичай означає «self-hosted Claude»

Пошукові запити «self hosted Claude» відображають кілька різних потреб, і для кожної потрібна окрема відповідь.

Деяким користувачам потрібна конфіденційність. Вони не хочуть, щоб промпти залишали їхню мережу. Це вирішує лише локальна модель із відкритими вагами, оскільки будь-який запит до Claude за визначенням надсилається до Anthropic.

Деяким користувачам потрібно контролювати витрати. Вони побоюються, що агент без обмежень витратить усі кредити. Це вирішує шлюз. Він працює з Claude, тому якість моделі зберігається.

Деяким користувачам потрібна незалежність від ноутбука. Вони хочуть, щоб агент продовжував працювати після закриття кришки. Це вирішує VPS, і Claude Code без проблем працює на ньому.

Деяким користувачам потрібен «self-hosted OpenRouter». Це також шлюз. Зазвичай для цього використовують LiteLLM.

Визначте, яка саме потреба у вас, оскільки для кожного випадку потрібна інша конфігурація.

Розгорніть модель з відкритими вагами за допомогою Ollama

Якщо потрібно, щоб жоден промпт не залишав ваш сервер, запустіть модель з відкритими вагами. Сімейства моделей, які сьогодні справді придатні для використання на орендованому сервері, — це Llama, Qwen, Mistral, Gemma і DeepSeek. Для всіх них опубліковано ваги, які можна завантажити й запускати.

Ollama — найшвидший спосіб почати. Скрипт встановлення складається з одного рядка й налаштовує службу systemd в Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

Команда systemctl status ollama має вивести active (running). Потім завантажте модель і почніть із нею працювати.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

Перший запуск pull завантажує кілька гігабайтів, тому перед обробленням запитів модель має поміщатися в RAM або пам’ять GPU. Орієнтовне правило для квантизованих моделей: моделі з 8 мільярдами параметрів потрібно приблизно 6 GB вільної пам’яті, моделі з 14 мільярдами параметрів — приблизно 10 GB, а моделі з 70 мільярдами параметрів потрібно більше пам’яті, ніж зазвичай доступно в більшості планів VPS загального призначення. Якщо пам’яті недостатньо, процес завершується ядром, і ви бачите Error: llama runner process has terminated, а в dmesg з’являється повідомлення про нестачу пам’яті. Перевірте free -h, перш ніж звинувачувати модель.

Ollama також надає HTTP API на 127.0.0.1:11434. Завдяки цьому нею можуть користуватися інші програми, а не лише чат-клієнт.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Залиште цей порт прив’язаним до localhost. Відкритий порт Ollama на публічній IP-адресі перетворюється на безкоштовний GPU для будь-кого, хто його знайде. Повний процес налаштування, включно з модулем systemd, виявленням GPU та розміщенням reverse proxy перед сервісом, описано в посібнику із запуску Ollama на VPS. Якщо одночасно обслуговується більше одного користувача, спочатку прочитайте порівняння Ollama і vLLM, оскільки конструкція Ollama з одним потоком стає вузьким місцем задовго до того, як ним стає апаратне забезпечення.

Об’єктивно оцінюйте обмеження. Хороша модель з відкритими вагами на VPS середнього розміру справді придатна для узагальнення, класифікації, підготовки чернеток і простого вилучення даних. Для тривалого багатокрокового міркування, роботи з великими кодовими базами та агентної роботи з інструментами вона не наближається до передової хмарної моделі, і жодне налаштування промптів не усуне цю різницю. Вибирайте локальну модель для завдань, у яких вона добре працює, а для складних завдань використовуйте платну хмарну модель.

Запустіть власний шлюз за допомогою LiteLLM

Це те, що користувачі називають «власним OpenRouter». Шлюз розташовується між вашими застосунками та всіма постачальниками моделей. Застосунки використовують один ключ, спрямований на ваш сервер. Справжні ключі постачальників зберігаються лише на цьому сервері. Ви можете обмежити витрати для кожного ключа, спрямовувати різні застосунки до різних моделей і реєструвати всі запити в одному місці.

LiteLLM часто обирають, оскільки він підтримує API, сумісний з OpenAI, і проксуює запити до Anthropic, Ollama та більшості інших постачальників через одну кінцеву точку. Запустіть його в Docker за допомогою конфігураційного файла.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Збережіть це як litellm_config.yaml і запустіть проксі. Він прослуховує порт 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY — це облікові дані адміністратора, тому поводьтеся з ними як із паролем root і не використовуйте наведене в прикладі значення в робочій системі. Викликайте проксі так само, як викликали б розміщений API.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Успішна відповідь — це звичайний JSON із масивом choices. 401 означає, що заголовок Authorization не відповідає вашому головному ключу. 400 із назвою моделі означає, що model у вашому запиті не відповідає жодному model_name у конфігураційному файлі.

Причина створити такий шлюз замість прямого виклику Anthropic — обмеження витрат. Створіть окремий віртуальний ключ для кожного застосунку та призначте кожному власний бюджет.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Цей ключ може витратити сто доларів і отримати доступ до однієї моделі — і більше ні до чого. Якщо агент працює некоректно о третій годині ночі, зона впливу обмежується одним ключем, а не всім вашим обліковим записом. Цей підхід і пов’язаний із ним моніторинг описано в матеріалі як контролювати витрати агентів на VPS. Якщо ви ще вирішуєте, чи варто взагалі платити за кожен токен, у матеріалі порівняння вартості API та підписки наведено відповідні розрахунки.

Зверніть увагу, чого шлюз не робить. Він не робить Claude локальним і не приховує ваші запити від Anthropic. Запити й надалі залишають ваш сервер і надсилаються постачальнику. Ви отримуєте контроль над ключами, витратами, маршрутизацією та журналами.

Запустіть Claude Code на власному VPS

Третє побажання виконати найпростіше. Claude Code — це клієнт. Він працює всюди, де встановлено Node.js, і взаємодіє з API через HTTPS. Розміщення Claude Code на власному сервері означає, що агент продовжить працювати після вимкнення ноутбука. Крім того, у разі помилки агент матиме доступ лише до сервера, який можна перебудувати, а не до вашого основного комп’ютера.

npm install -g @anthropic-ai/claude-code
claude --version

Запускайте його всередині tmux, щоб розрив SSH-з’єднання не припинив тривале завдання. Цей процес, зокрема керування сеансом, описано в матеріалі як запускати Claude Code на VPS за допомогою tmux. Створіть для агента окремого непривілейованого користувача. Перш ніж надати йому доступ на запис до важливих для вас даних, ознайомтеся з правилами безпеки для запуску Claude Code на сервері.

Це самостійне розміщення агента, а не моделі. Важливо чітко розрізняти ці поняття, оскільки їх часто плутають. Ви контролюєте процес, файлову систему, вихідний мережевий трафік і журнали. Водночас Anthropic контролює процес виконання моделі.

Яку реальну вартість має кожен варіант

Ціни змінюються, тому сприймайте їх як орієнтир, а не як комерційну пропозицію. Станом на July 2026 Claude Sonnet 5 коштує $3 за мільйон вхідних токенів і $15 за мільйон вихідних токенів, а Claude Opus 5 — $5 і $25 відповідно. Локальна модель не має плати за токени. Натомість ви сплачуєте щомісячну вартість сервера, який працює незалежно від того, використовуєте ви його чи ні.

Точка беззбитковості настає раніше, ніж багато хто очікує. VPS із достатнім обсягом пам’яті для запуску корисної відкритої моделі щомісяця коштує реальних грошей і більшу частину часу простоює. Якщо навантаження нерівномірне, hosted API зазвичай дешевший. Якщо навантаження постійне або ваші дані не можуть залишати мережу, локальна модель вигідніша за обома критеріями.

Найреалістичніша відповідь для більшості команд — комбінований підхід. Запускайте відкриту модель локально для великого обсягу простих завдань. Складні запити спрямовуйте до hosted frontier model. Розмістіть перед обома моделями gateway, щоб застосунки не залежали від того, яку саме модель вони використовують, а також щоб можна було змінювати розподіл запитів без змін у коді застосунків. Така архітектура є практичною версією "self hosted Claude" і, на відміну від буквальної версії, справді існує. Якщо ви також хочете самостійно запускати весь стек агентів, огляд self-hosted AI agents містить інформацію про доступні варіанти.

FAQ

Чи можу я завантажити ваги моделі Claude і запустити її локально?

Ні. Anthropic ніколи не випускала ваги жодної моделі Claude, і не існує ліцензії, яка дозволяє самостійне розгортання. Усе, що в Інтернеті рекламують як модель Claude, доступну для завантаження, — це або інша модель із оманливою назвою, або оболонка, яка викликає API. Якщо для цього потрібен ключ API, це не локальне виконання.

Яка відкрита модель найближча до Claude?

Точного відповідника немає, а лідери змінюються кожні кілька місяців. Серед сімейств моделей із відкритими вагами варто протестувати Llama, Qwen, Mistral, Gemma і DeepSeek. Для підсумовування, класифікації та простого редагування коду якісна відкрита модель із 8–14 мільярдами параметрів справді корисна. У тривалому багатоетапному міркуванні та агентному використанні інструментів розрив із провідною розміщеною моделлю все ще великий. Тестуйте моделі на власних запитах, а не покладайтеся на таблицю лідерів.

Чи є LiteLLM самостійно розміщеним OpenRouter?

Функціонально так — у частині маршрутизації та керування ключами. LiteLLM працює на вашому сервері, надає одну сумісну з OpenAI кінцеву точку та проксує запити до Anthropic, Ollama і більшості інших провайдерів. Ви отримуєте ліміти витрат для кожного ключа, маршрутизацію моделей і єдине місце для перегляду журналів. Локального виконання це не забезпечує: запити до Claude усе одно надходять до Anthropic.

Чи зберігає запуск Claude Code на моєму сервері конфіденційність мого коду?

Ні. Claude Code надсилає вміст прочитаних файлів до API Anthropic незалежно від того, де запущено процес. VPS забезпечує ізоляцію агента, але не конфіденційність вмісту. Створіть для нього окремого непривілейованого користувача, обмежте доступ до облікових даних і сторонніх репозиторіїв та вважайте, що все, що він може прочитати, залишає сервер.