Czy można hostować Claude samodzielnie? Uczciwa odpowiedź
Wagi Claude nie są publiczne, więc nie da się uruchomić go na własnym serwerze. Sprawdź, co można hostować zamiast tego: modele open source, bramę API i Claude Code.
Czy można samodzielnie hostować Claude? Nie, i oto dlaczego
Nie można samodzielnie hostować Claude. Anthropic nie publikuje wag modelu, dlatego nie istnieje plik do pobrania, kontener do uruchomienia ani licencja umożliwiająca udostępnianie modelu z własnego sprzętu. Każde żądanie Claude trafia do API Anthropic albo do hostowanego partnera, takiego jak Amazon Bedrock, Google Vertex AI lub Microsoft Foundry. Uruchomienie modelu na własnej maszynie nie jest problemem konfiguracyjnym. Artefakt ten po prostu nie istnieje poza Anthropic.
To krótka odpowiedź. Dłuższa odpowiedź jest taka, że większość osób zadających to pytanie w rzeczywistości nie potrzebuje wag modelu. Potrzebują jednej z trzech rzeczy, które można uruchomić na kontrolowanym przez siebie serwerze: wydajnego modelu działającego lokalnie, bramy przechowującej ich klucze API i ograniczającej wydatki albo agenta programistycznego działającego na ich własnym serwerze zamiast na laptopie. W tym przewodniku opisano wszystkie trzy rozwiązania wraz z poleceniami.
Co zwykle oznacza „self-hosted Claude”
Ruch z wyszukiwań dla hasła „self hosted Claude” obejmuje kilka różnych potrzeb. Każda z nich wymaga innej odpowiedzi.
Niektórym zależy na prywatności. Nie chcą, aby polecenia opuszczały ich sieć. Tylko lokalny model open weight zapewnia takie rozwiązanie, ponieważ każde żądanie do Claude jest z definicji żądaniem kierowanym do Anthropic.
Niektórym zależy na kontroli kosztów. Obawiają się agenta, który może bez kontroli zużywać środki. Rozwiązaniem jest gateway. Działa on z Claude, więc zachowana zostaje jakość modelu.
Niektórym zależy na niezależności od laptopa. Chcą agenta, który nadal działa po zamknięciu pokrywy. Rozwiązaniem jest VPS. Claude Code działa na nim bez problemów.
Niektórym chodzi o rozwiązanie określane jako „self hosted OpenRouter”. To również gateway. Typowym rozwiązaniem jest LiteLLM.
Należy ustalić, który przypadek dotyczy danego zastosowania, ponieważ w każdym z nich właściwa konfiguracja jest inna.
Samodzielne hostowanie otwartego modelu za pomocą Ollama
Jeśli wymagane jest, aby żaden prompt nie opuszczał serwera, należy uruchomić model z otwartymi wagami. Rodziny modeli, które można obecnie praktycznie uruchomić na wynajętym serwerze, to Llama, Qwen, Mistral, Gemma i DeepSeek. Dla wszystkich tych rodzin są publikowane wagi, które można pobrać i uruchomić.
Ollama to najszybszy sposób na rozpoczęcie pracy. Skrypt instalacyjny składa się z jednego wiersza i konfiguruje usługę systemd w Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamaPolecenie systemctl status ollama powinno wyświetlić active (running). Następnie należy pobrać model i rozpocząć z nim pracę.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."Pierwsze pull pobiera kilka gigabajtów danych, dlatego przed udzieleniem odpowiedzi model musi zmieścić się w pamięci RAM lub pamięci GPU. Przybliżona zasada dla modeli skwantyzowanych jest następująca: model z 8 miliardami parametrów wymaga około 6 GB wolnej pamięci, model z 14 miliardami parametrów około 10 GB, a model z 70 miliardami parametrów wymaga więcej pamięci, niż oferuje większość planów VPS ogólnego przeznaczenia. Jeśli na serwerze brakuje pamięci, proces zostaje zakończony przez jądro i wyświetlany jest komunikat Error: llama runner process has terminated, a w dmesg znajduje się wpis o braku pamięci. Przed obwinieniem modelu należy sprawdzić free -h.
Ollama udostępnia również API HTTP na porcie 127.0.0.1:11434. Dzięki temu może współpracować z innym oprogramowaniem, a nie służy wyłącznie jako narzędzie do rozmów.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Ten port należy pozostawić przypisany do localhost. Otwarty port Ollama pod publicznym adresem IP staje się bezpłatnym GPU dla każdego, kto go znajdzie. Pełna konfiguracja, obejmująca jednostkę systemd, wykrywanie GPU i umieszczenie reverse proxy przed usługą, została opisana w przewodniku dotyczącym uruchamiania Ollama na VPS. Jeśli jednocześnie obsługiwany jest więcej niż 1 użytkownik, najpierw należy przeczytać porównanie Ollama i vLLM, ponieważ konstrukcja Ollama z pojedynczym strumieniem staje się wąskim gardłem na długo przed osiągnięciem ograniczeń sprzętowych.
Należy realistycznie ocenić różnicę. Dobry otwarty model uruchomiony na VPS średniej wielkości jest naprawdę przydatny do tworzenia podsumowań, klasyfikowania, przygotowywania wersji roboczych i prostego wyodrębniania danych. W przypadku długiego wnioskowania wieloetapowego, dużych baz kodu i korzystania z narzędzi przez agentów nie dorównuje on najnowocześniejszemu modelowi hostowanemu, a żadna ilość dostrajania promptów nie pozwoli zniwelować tej różnicy. Model lokalny należy wybrać do zadań, w których sprawdza się dobrze, a za model hostowany zapłacić tam, gdzie problem jest rzeczywiście trudny.
Uruchom własną bramę za pomocą LiteLLM
To jest rozwiązanie typu „samodzielnie hostowany OpenRouter”, którego szukają użytkownicy. Brama znajduje się między aplikacjami a każdym dostawcą modeli. Aplikacje używają jednego klucza wskazującego na serwer. Rzeczywiste klucze dostawców są przechowywane wyłącznie na tym serwerze. Można ograniczyć wydatki dla każdego klucza, kierować różne aplikacje do różnych modeli i rejestrować wszystkie żądania w jednym miejscu.
LiteLLM jest często wybieranym rozwiązaniem, ponieważ udostępnia API zgodne z OpenAI i pośredniczy w komunikacji z Anthropic, Ollama oraz większością innych dostawców za pośrednictwem tego samego endpointu. Należy uruchomić je w Dockerze z plikiem konfiguracyjnym.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Należy zapisać ten plik jako litellm_config.yaml i uruchomić proxy. Nasłuchuje ono na porcie 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY jest poświadczeniem administratora, dlatego należy traktować je jak hasło konta root i nie używać przykładowej wartości w środowisku produkcyjnym. Z proxy należy korzystać dokładnie tak samo jak z hostowanego API.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Prawidłowa odpowiedź jest poprawnym dokumentem JSON zawierającym tablicę choices. Komunikat 401 oznacza, że nagłówek Authorization nie jest zgodny z kluczem głównym. Komunikat 400 zawierający nazwę modelu oznacza, że wartość model w żądaniu nie odpowiada żadnej wartości model_name w pliku konfiguracyjnym.
Powodem budowy tego rozwiązania zamiast bezpośredniego wywoływania Anthropic jest możliwość ograniczenia wydatków. Należy utworzyć osobny klucz wirtualny dla każdej aplikacji i przypisać mu odrębny budżet.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Taki klucz może umożliwiać wydanie stu dolarów i dostęp do jednego modelu, bez żadnych innych uprawnień. Gdy agent zacznie działać nieprawidłowo o trzeciej nad ranem, skutki ograniczają się do jednego klucza, a nie całego konta. Ten wzorzec oraz związane z nim monitorowanie opisano w artykule jak kontrolować koszty agentów na VPS. Jeśli nadal nie wiadomo, czy w ogóle opłacać użycie na podstawie liczby tokenów, porównanie kosztów API i subskrypcji przedstawia odpowiednie obliczenia.
Należy pamiętać, czego brama nie zapewnia. Nie uruchamia Claude lokalnie i nie ukrywa promptów przed Anthropic. Żądania nadal opuszczają serwer i są wysyłane do dostawcy. Zyskuje się natomiast kontrolę nad kluczami, wydatkami, routingiem i logami.
Uruchamianie Claude Code na własnym VPS
Trzecie życzenie jest najłatwiejsze do spełnienia. Claude Code jest klientem. Działa wszędzie tam, gdzie zainstalowano Node.js, i komunikuje się z API przez HTTPS. Uruchomienie go na własnym serwerze oznacza, że agent będzie działać po wyłączeniu laptopa, a zakres potencjalnych skutków jego działań ograniczy się do systemu, który można odtworzyć, zamiast obejmować główny komputer.
npm install -g @anthropic-ai/claude-code
claude --versionUruchamiaj go wewnątrz tmux, aby zerwane połączenie SSH nie przerwało długotrwałego zadania. Ta konfiguracja, w tym obsługa sesji, została opisana w uruchamianie Claude Code na VPS z użyciem tmux. Utwórz dla agenta osobnego użytkownika bez uprawnień uprzywilejowanych. Przed przyznaniem mu dostępu do zapisu w jakichkolwiek istotnych lokalizacjach zapoznaj się z zasadami bezpieczeństwa dotyczącymi uruchamiania Claude Code na serwerze.
Jest to samodzielne hostowanie agenta, a nie modelu. Warto dokładnie to rozróżnić, ponieważ te kwestie są często mylone. Kontrolowane są proces, system plików, ruch wychodzący z sieci oraz logi. Anthropic nadal kontroluje proces wnioskowania.
Ile w praktyce kosztuje każda opcja
Ceny się zmieniają, dlatego należy traktować te wartości jako przybliżenie, a nie ofertę cenową. W lipcu 2026 Claude Sonnet 5 kosztuje 3 USD za milion tokenów wejściowych i 15 USD za milion tokenów wyjściowych, a Claude Opus 5 odpowiednio 5 USD i 25 USD. Model lokalny nie generuje kosztu za token. Kosztuje natomiast tyle, ile wynosi miesięczne utrzymanie serwera, który działa niezależnie od tego, czy jest używany.
Próg opłacalności pojawia się wcześniej, niż można oczekiwać. VPS z pamięcią wystarczającą do uruchomienia użytecznego modelu open model kosztuje co miesiąc realne pieniądze, a przez większość czasu pozostaje bezczynny. Przy nieregularnym użyciu hostowane API zwykle jest tańsze. Przy stałym użyciu lub gdy dane nie mogą opuszczać sieci lokalnej model lokalny wygrywa pod oboma względami.
Najbardziej trafna odpowiedź jest zwykle rozwiązaniem mieszanym. Model open model należy uruchomić lokalnie do zadań o dużej liczbie wywołań i niskim poziomie trudności. Trudne żądania należy kierować do hostowanego modelu frontier. Przed oboma modelami należy umieścić gateway, aby aplikacje nie musiały wiedzieć, z którego modelu korzystają, oraz aby można było zmieniać podział zadań bez modyfikowania kodu aplikacji. Taka architektura jest praktyczną wersją rozwiązania „self hosted Claude” i, w przeciwieństwie do wersji dosłownej, istnieje. Jeśli cały stos agentów ma również działać samodzielnie, zestawienie samodzielnie hostowanych agentów AI przedstawia dostępne rozwiązania.
FAQ
Czy można pobrać wagi modelu Claude i uruchomić je lokalnie?
Nie. Anthropic nigdy nie wydał wag żadnego modelu Claude i nie istnieje licencja zezwalająca na samodzielne hostowanie. Wszystko, co jest reklamowane w Internecie jako możliwy do pobrania „model Claude”, to albo inny model o wprowadzającej w błąd nazwie, albo wrapper wywołujący API. Jeśli wymagany jest klucz API, rozwiązanie nie działa lokalnie.
Jaki otwarty model jest najbardziej zbliżony do Claude?
Nie istnieje dokładny odpowiednik, a liderzy zmieniają się co kilka miesięcy. Rodziny modeli z otwartymi wagami, które warto przetestować, to Llama, Qwen, Mistral, Gemma i DeepSeek. W zadaniach takich jak tworzenie podsumowań, klasyfikacja i proste modyfikacje kodu dobry otwarty model z 8 do 14 miliardami parametrów jest rzeczywiście użyteczny. W przypadku wieloetapowego rozumowania na długim kontekście i używania narzędzi przez agentów różnica względem hostowanego modelu najwyższej klasy nadal jest duża. Należy testować modele na własnych promptach, zamiast ufać rankingom.
Czy LiteLLM jest samoobsługowo hostowanym OpenRouter?
Funkcjonalnie tak, w zakresie routingu i zarządzania kluczami. LiteLLM działa na własnym serwerze, udostępnia jeden endpoint zgodny z OpenAI i przekazuje żądania do Anthropic, Ollama oraz większości innych dostawców. Dostępne są limity wydatków dla poszczególnych kluczy, routing modeli oraz jedno miejsce do odczytu logów. Nie zapewnia to jednak lokalnego wnioskowania: żądania do Claude nadal są przesyłane do Anthropic.
Czy uruchomienie Claude Code na własnym serwerze zapewnia prywatność kodu?
Nie. Claude Code wysyła zawartość odczytywanych plików do Anthropic API, niezależnie od miejsca uruchomienia procesu. VPS zapewnia izolację agenta, ale nie prywatność treści. Należy użyć dedykowanego użytkownika bez uprawnień uprzywilejowanych, odizolować agenta od danych uwierzytelniających i niezwiązanych repozytoriów oraz traktować wszystko, co może on odczytać, jako treść opuszczającą serwer.