SSD Nodes Learn 8GB RAM — $66/taon
Mga Gabay Matt ConnorNi Matt Connor · Na-update 2026-08-02

Maaari bang i-self-host ang Claude? Ang totoong sagot

Hindi public ang Claude weights, kaya walang server na makakapagpatakbo nito. Alamin ang puwedeng i-self-host: open models, gateway, at Claude Code.

Maaari mo bang i-self-host ang Claude? Hindi, at narito ang dahilan

Hindi mo maaaring i-self-host ang Claude. Hindi inilalabas ng Anthropic ang model weights, kaya walang file na mada-download, walang container na mapapatakbo, at walang lisensiyang magpapahintulot sa iyong i-serve ito mula sa sarili mong hardware. Ang bawat request sa Claude ay ipinapadala sa API ng Anthropic o sa isang hosted partner gaya ng Amazon Bedrock, Google Vertex AI, o Microsoft Foundry. Ang pagpapatakbo nito sa machine na pagmamay-ari mo ay hindi simpleng configuration problem. Wala lang talaga ang artefact sa labas ng Anthropic.

Iyan ang maikling sagot. Ang mas mahabang sagot ay karaniwang hindi naman talaga weights ang kailangan ng mga nagtatanong nito. Gusto nila ng isa sa tatlong bagay na lahat ay maaaring patakbuhin sa server na kontrolado nila: isang mahusay na model na lokal na tumatakbo, isang gateway na nag-iingat ng kanilang API keys at naglilimita sa kanilang gastos, o isang coding agent na nasa sarili nilang box sa halip na sa kanilang laptop. Saklaw ng gabay na ito ang tatlo, kasama ang mga command.

Karaniwang ibig sabihin ng “self-hosted Claude”

Ang search traffic para sa “self-hosted Claude” ay nahahati sa ilang magkakaibang pangangailangan, at magkakaibang sagot ang kailangan ng bawat isa.

May mga taong privacy ang nais. Ayaw nilang lumabas sa network nila ang prompts. Local open-weight model lang ang makalulutas nito, dahil ang bawat Claude request ay likas na request sa Anthropic.

May mga taong nais kontrolin ang gastos. Nag-aalala sila na maubos ng runaway agent ang kanilang credits. Nalulutas ito ng gateway, at gumagana ito sa Claude, kaya napapanatili ang kalidad ng model.

May mga taong nais maging independent sa laptop. Gusto nila ng agent na patuloy na gumagana kahit isara nila ang takip ng laptop. Nalulutas ito ng VPS, at maayos na tumatakbo rito ang Claude Code.

May mga taong ang hinahanap ay ang pariralang “self-hosted OpenRouter”. Gateway din ito, at ang karaniwang sagot ay LiteLLM.

Tukuyin kung alin dito ang kailangan mo, dahil magkakaiba ang tamang setup sa bawat kaso.

Magpatakbo ng open model sa sarili mong server gamit ang Ollama

Kung kinakailangan na walang prompt na lumabas sa iyong server, gumamit ng open weight model. Ang mga pamilyang aktuwal na magagamit sa isang nirentahang server ngayon ay Llama, Qwen, Mistral, Gemma, at DeepSeek. Naglalabas ang lahat ng ito ng weights na maaari mong i-download at patakbuhin.

Ang Ollama ang pinakamabilis na paraan para makapagsimula. Isang linya ang install script, at nagse-set up ito ng systemd service sa Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

Dapat mag-print ang systemctl status ollama ng active (running). Pagkatapos, mag-pull ng model at makipag-usap dito.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

Nagda-download ang unang pull ng ilang gigabyte, kaya dapat magkasya muna ang model sa RAM o GPU memory bago ito makasagot. Tinatayang gabay para sa quantised models: nangangailangan ang model na may 8 billion parameters ng humigit-kumulang 6 GB na libreng memory, ang model na may 14 billion parameters ng humigit-kumulang 10 GB, at nangangailangan ang model na may 70 billion parameters ng mas maraming memory kaysa sa karaniwang inilalaan ng karamihan sa general-purpose VPS plans. Kung kulang ang memory ng server, pinapatay ng kernel ang process at makikita mo ang Error: llama runner process has terminated, kasama ang out of memory line sa dmesg. Suriin ang free -h bago sisihin ang model.

Naghahain din ang Ollama ng HTTP API sa 127.0.0.1:11434, kaya magagamit ito ng ibang software at hindi lamang bilang chat toy.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Iwanang naka-bind ang port na iyon sa localhost. Ang bukas na Ollama port sa public IP ay libreng GPU para sa sinumang makakita nito. Saklaw ng kumpletong setup, kasama ang systemd unit, GPU detection, at paglalagay ng reverse proxy sa harap nito, ang gabay sa pagpapatakbo ng Ollama sa isang VPS. Kung mahigit isang user ang sabay-sabay mong sineserbisyuhan, basahin muna ang paghahambing ng Ollama at vLLM, dahil nagiging bottleneck ang single-stream design ng Ollama bago pa malimitahan ng hardware ang performance.

Maging tapat tungkol sa agwat. Tunay na kapaki-pakinabang ang isang mahusay na open model sa isang mid-sized VPS para sa pagbubuod, pag-uuri, pagbuo ng draft, at simpleng extraction. Sa mahabang multi-step reasoning, malalaking codebase, at agentic tool use, hindi ito malapit sa frontier hosted model, at hindi maisasara ng anumang dami ng prompt tuning ang agwat na iyon. Piliin ang local model para sa mga gawaing mahusay nitong magawa, at magbayad para sa hosted model kapag talagang mahirap ang gawain.

Patakbuhin ang sarili mong gateway gamit ang LiteLLM

Ito ang “self-hosted OpenRouter” na hinahanap ng mga tao. Nasa pagitan ang gateway ng iyong mga application at ng bawat model provider. Isang key lang ang hawak ng iyong mga app, at nakaturo ito sa iyong server. Ang aktuwal na provider keys ay nasa server lamang na iyon. Maaari kang magtakda ng limitasyon sa gastos bawat key, mag-route ng magkakaibang app sa magkakaibang model, at mag-log ng bawat request sa iisang lugar.

Karaniwang pinipili ang LiteLLM dahil gumagamit ito ng OpenAI-compatible API at nagpo-proxy sa Anthropic, Ollama, at karamihan ng iba pang provider sa iisang endpoint. Patakbuhin ito sa Docker gamit ang isang config file.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

I-save ito bilang litellm_config.yaml at simulan ang proxy. Nakikinig ito sa port 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

Ang LITELLM_MASTER_KEY ang admin credential, kaya ituring ito na parang root password at huwag gamitin ang halimbawang value. Tawagin ang proxy gaya ng pagtawag mo sa isang hosted API.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Ang matagumpay na response ay karaniwang JSON na may choices array. Ibig sabihin ng 401 na hindi tugma ang Authorization header sa iyong master key. Ang 400 na tumutukoy sa model ay nangangahulugang hindi tugma ang model sa iyong request sa alinman sa model_name sa config file.

Ang dahilan kung bakit ito binubuo sa halip na direktang tumawag sa Anthropic ay ang spend cap. Gumawa ng hiwalay na virtual key para sa bawat application, na may sariling budget ang bawat isa.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Maaaring gumastos ang key na iyon ng isang daang dolyar at maka-access sa isang model lamang, at wala nang iba. Kapag nagkamali ang isang agent nang alas-tres ng madaling-araw, isang key lamang ang apektado sa halip na ang buong account mo. Ang pattern na ito, kasama ang monitoring para rito, ang paksa ng pagkontrol sa gastos ng agent sa isang VPS. Kung pinag-iisipan mo pa kung magbabayad ka ba talaga bawat token, ipinapakita ng paghahambing ng gastos ng API at subscription ang kalkulasyon.

Tandaan kung ano ang hindi ginagawa ng gateway. Hindi nito ginagawang local ang Claude, at hindi nito itinatago ang iyong mga prompt mula sa Anthropic. Lumalabas pa rin sa iyong server ang mga request papunta sa provider. Ang nakukuha mo ay kontrol sa mga key, gastos, routing, at log.

Patakbuhin ang Claude Code sa sarili mong VPS

Ang ikatlong kahilingan ang pinakamadaling pagbigyan. Client ang Claude Code. Gumagana ito saanman naka-install ang Node.js, at kumokonekta ito sa API gamit ang HTTPS. Kapag inilagay mo ito sa server na pagmamay-ari mo, magpapatuloy na gumana ang agent kahit patayin mo ang laptop mo. Nangangahulugan din ito na ang blast radius ng agent ay isang box na maaari mong i-rebuild, sa halip na ang pangunahing machine mo.

npm install -g @anthropic-ai/claude-code
claude --version

Patakbuhin ito sa loob ng tmux upang hindi mapatay ng naputol na SSH connection ang matagal na job. Saklaw ng pagpapatakbo ng Claude Code sa VPS gamit ang tmux ang setup na ito, pati ang session handling. Bigyan ang agent ng sarili nitong unprivileged user. Basahin din ang mga panuntunan sa kaligtasan sa pagpapatakbo ng Claude Code sa server bago mo ito bigyan ng write access sa anumang mahalaga sa iyo.

Ito ay self-hosting ng agent, hindi ng model. Mahalagang maging tumpak tungkol dito dahil ito ang bahaging madalas napagkakamalan ng mga tao. Ikaw ang nagmamay-ari ng process, filesystem, network egress, at logs. Pagmamay-ari pa rin ng Anthropic ang inference.

Ang aktuwal na halaga ng bawat opsyon

Nagbabago ang mga presyo, kaya ituring ang mga ito bilang pangkalahatang batayan, hindi eksaktong quote. Noong July 2026, ang Claude Sonnet 5 ay nagkakahalaga ng $3 bawat milyong input token at $15 bawat milyong output token, habang ang Claude Opus 5 ay nagkakahalaga ng $5 at $25. Walang bayad bawat token ang isang local model. Sa halip, ang gastos nito ay ang buwanang halaga ng server, na patuloy na naiipon ginagamit man ito o hindi.

Mas mababa kaysa inaasahan ng marami ang break-even point. Ang VPS na may sapat na memory para magpatakbo ng kapaki-pakinabang na open model ay may aktuwal na buwanang gastos, at halos buong panahon itong idle. Kung bursty ang paggamit mo, karaniwang mas mura ang hosted API. Kung tuloy-tuloy ang paggamit mo, o kung hindi maaaring lumabas sa network mo ang data, mas mainam ang local model sa parehong aspeto.

Ang praktikal na sagot para sa karamihan ng mga team ay isang kombinasyon. Magpatakbo ng open model nang lokal para sa mga gawaing mataas ang volume ngunit mababa ang hirap. I-route ang mahihirap na request sa isang hosted frontier model. Maglagay ng gateway sa harap ng dalawa para hindi kailangang malaman ng mga application kung alin ang ginagamit, at para mailipat mo ang hangganan sa pagitan ng mga ito nang hindi binabago ang application code. Ito ang praktikal na bersyon ng "self hosted Claude". Hindi tulad ng literal na bersyon, umiiral ito. Kung gusto mo ring ikaw mismo ang magpatakbo ng buong agent stack, saklaw ng buod ng mga self-hosted AI agent ang mga available na opsyon.

FAQ

Maaari ko bang i-download ang model weights ng Claude at patakbuhin ito nang lokal?

Hindi. Hindi kailanman nag-release ang Anthropic ng weights para sa anumang Claude model, at walang lisensiyang nagpapahintulot sa self-hosting. Anumang ina-advertise online bilang nada-download na “Claude model” ay alinman sa ibang model na may mapanlinlang na pangalan o isang wrapper na tumatawag sa API. Kung nangangailangan ito ng API key, hindi ito lokal.

Ano ang pinakamalapit na open model sa Claude?

Walang eksaktong katumbas, at nagbabago ang mga nangunguna bawat ilang buwan. Ang mga open-weight family na sulit subukan ay Llama, Qwen, Mistral, Gemma, at DeepSeek. Para sa summarization, classification, at simpleng code edit, tunay na kapaki-pakinabang ang isang mahusay na open model na may 8 hanggang 14 bilyong parameter. Para sa mahahabang multi-step na pangangatwiran at agentic tool use, malaki pa rin ang agwat kumpara sa isang hosted frontier model. Subukan ito gamit ang sarili mong prompt sa halip na umasa sa leaderboard.

Ang LiteLLM ba ay isang self-hosted OpenRouter?

Oo, sa aspeto ng routing at pamamahala ng key. Tumatakbo ang LiteLLM sa sarili mong server, nagbibigay ng isang OpenAI-compatible endpoint, at nagpo-proxy sa Anthropic, Ollama, at karamihan ng iba pang provider. Makakakuha ka ng mga spend cap bawat key, model routing, at isang lugar para basahin ang mga log. Ang hindi nito ibinibigay ay local inference: ang mga request sa Claude ay dumadaan pa rin sa Anthropic.

Mananatili bang pribado ang code ko kapag pinatakbo ko ang Claude Code sa sarili kong server?

Hindi. Ipinapadala ng Claude Code ang nilalaman ng mga file na binabasa nito sa Anthropic API, saanman tumatakbo ang proseso. Ang ibinibigay sa iyo ng VPS ay isolation ng agent, hindi privacy ng content. Gumamit para rito ng dedicated unprivileged user, ilayo ito sa mga credential at hindi kaugnay na repository, at ituring ang lahat ng mababasa nito bilang content na lumalabas sa server.