Maaari bang i-self-host ang Claude? Ang totoong sagot
Hindi public ang Claude weights, kaya walang server na makakapagpatakbo nito. Alamin ang puwedeng i-self-host: open models, gateway, at Claude Code.
Maaari mo bang i-self-host ang Claude? Hindi, at narito kung bakit
Hindi mo maaaring i-self-host ang Claude. Hindi inilalabas ng Anthropic ang model weights, kaya walang file na mada-download, walang container na mapapatakbo, at walang licence na magpapahintulot sa iyong i-serve ito mula sa sarili mong hardware. Ang bawat request sa Claude ay ipinapadala sa Anthropic API o sa isang hosted partner gaya ng Amazon Bedrock, Google Vertex AI, o Microsoft Foundry. Ang pagpapatakbo nito sa isang machine na pagmamay-ari mo ay hindi problema sa configuration. Hindi talaga umiiral ang artefact sa labas ng Anthropic.
Iyan ang maikling sagot. Ang mas mahabang sagot ay karaniwang hindi naman talaga model weights ang gusto ng mga nagtatanong nito. Gusto nila ang isa sa tatlong bagay na lahat ay maaaring patakbuhin sa server na kontrolado nila: isang mahusay na model na lokal na tumatakbo, isang gateway na nag-iingat ng kanilang API keys at naglilimita sa kanilang gastos, o isang coding agent na nasa sarili nilang box sa halip na nasa laptop nila. Sinasaklaw ng guide na ito ang lahat ng tatlo, kasama ang mga command.
Karaniwang ibig sabihin ng “self-hosted Claude”
Nahahati sa ilang magkakaibang layunin ang mga search query para sa “self hosted Claude”, at magkakaiba rin ang tamang sagot sa mga ito.
May mga taong naghahanap ng privacy. Ayaw nilang lumabas sa network nila ang mga prompt. Local open weight model lamang ang makalulutas nito, dahil ang bawat request sa Claude ay, ayon sa depinisyon, request sa Anthropic.
May mga taong gustong kontrolin ang gastos. Nag-aalala sila na baka maubos ng runaway agent ang kanilang credits. Nalulutas ito ng gateway, at gumagana ito sa Claude, kaya napapanatili ang kalidad ng model.
May mga taong gustong hindi umasa sa laptop. Gusto nila ng agent na patuloy na gumagana kahit isara nila ang takip ng laptop. Nalulutas ito ng VPS, at maayos na tumatakbo rito ang Claude Code.
May mga taong ang hinahanap ay ang pariralang “self hosted OpenRouter”. Gateway din ito, at ang karaniwang sagot ay LiteLLM.
Tukuyin kung alin dito ang kailangan mo, dahil magkakaiba ang tamang setup sa bawat kaso.
Mag-host ng open model gamit ang Ollama
Kung kailangan na walang prompt na lumabas sa server mo, gumamit ng open weight model. Ang mga model family na aktuwal na magagamit sa inuupahang server ngayon ay Llama, Qwen, Mistral, Gemma, at DeepSeek. Naglalabas ang lahat ng mga ito ng weights na maaari mong i-download at patakbuhin.
Ang Ollama ang pinakamabilis na paraan para magsimula. Isang linya lang ang install script, at nagse-set up ito ng systemd service sa Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamaDapat mag-print ang systemctl status ollama ng active (running). Pagkatapos, mag-pull ng model at makipag-usap dito.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."Ang unang pull ay nagda-download ng ilang gigabyte, kaya kailangang magkasya ang model sa RAM o GPU memory bago ito makasagot. Bilang tinatayang gabay para sa quantised models: ang model na may 8 billion parameter ay nangangailangan ng humigit-kumulang 6 GB na bakanteng memory, ang model na may 14 billion parameter ay nangangailangan ng humigit-kumulang 10 GB, at ang model na may 70 billion parameter ay nangangailangan ng mas maraming memory kaysa sa karaniwang kapasidad ng karamihan sa general-purpose VPS plan. Kung kulang ang memory ng server, papatayin ng kernel ang proseso at makikita mo ang Error: llama runner process has terminated, kasama ang out of memory line sa dmesg. Suriin ang free -h bago sisihin ang model. Tinutukoy rin ng parehong memory budget kung gaano kalaking bahagi ng mahabang prompt ang aktuwal na nababasa ng model, dahil tahimik na tina-truncate ng Ollama ang anumang lampas sa katamtamang default window. Kaya ang pagtaas ng num_ctx at pagtakda ng laki ng KV cache ang unang dapat suriin kapag kalahati lamang ng mahabang dokumento ang nasusummarise.
Nagbibigay rin ang Ollama ng HTTP API sa 127.0.0.1:11434. Dahil dito, magagamit ito ng ibang software at hindi lang bilang chat toy.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Kung tumatagal ng tatlumpung segundo ang unang request matapos ang mahabang idle period, pero agad bumabalik ang kasunod na request, walang sira: ina-unload ng Ollama ang model matapos ang limang minutong idle period. Inaalis ng pagpapanatili rito sa memory gamit ang keep_alive ang penalty ng muling pag-load.
Panatilihing naka-bind ang port na iyon sa localhost. Ang bukas na Ollama port sa public IP ay libreng GPU para sa sinumang makahanap nito. Saklaw ng buong build, kabilang ang systemd unit, GPU detection, at paglalagay ng reverse proxy sa harap nito, ang gabay sa pagpapatakbo ng Ollama sa isang VPS. Kung nagseserve ka ng higit sa isang user nang sabay, basahin muna ang paghahambing ng Ollama at vLLM, dahil nagiging bottleneck ang single stream design ng Ollama bago pa malimitahan ng hardware ang performance.
Maging tapat tungkol sa limitasyon. Tunay na kapaki-pakinabang ang isang mahusay na open model sa mid-sized VPS para sa summarising, classifying, drafting, at simpleng extraction. Sa mahaba at maraming hakbang na reasoning, malalaking codebase, at agentic tool use, hindi ito malapit sa frontier hosted model, at hindi kayang isara ng anumang prompt tuning ang agwat na iyon. Piliin ang local model para sa mga gawaing mahusay nitong kayang gawin, at magbayad para sa hosted model kapag tunay na mahirap ang gawain.
Magpatakbo ng sarili mong gateway gamit ang LiteLLM
Ito ang “self-hosted OpenRouter” na hinahanap ng maraming tao. Nasa pagitan ng iyong mga application at ng bawat model provider ang gateway. Isang key lang ang hawak ng iyong mga app, at nakaturo ito sa iyong server. Sa server lang na iyon nakalagay ang mga totoong provider key. Maaari kang magtakda ng spending limit sa bawat key, mag-route ng iba’t ibang app sa iba’t ibang model, at mag-log ng bawat request sa iisang lugar.
Karaniwang pinipili ang LiteLLM dahil gumagamit ito ng OpenAI-compatible API at nagpo-proxy ito sa Anthropic, Ollama, at karamihan ng iba pang provider sa iisang endpoint. Patakbuhin ito sa Docker gamit ang isang config file.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434I-save ito bilang litellm_config.yaml at simulan ang proxy. Nakikinig ito sa port 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlAng LITELLM_MASTER_KEY ang admin credential, kaya ituring ito na parang root password at huwag gamitin sa production ang halimbawang value. Tawagin ang proxy gaya ng pagtawag mo sa isang hosted API.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Ang healthy response ay karaniwang JSON na may choices array. Ang 401 ay nangangahulugang hindi tumutugma ang Authorization header sa iyong master key. Ang 400 na tumutukoy sa model ay nangangahulugang hindi tumutugma ang model sa iyong request sa alinman sa mga model_name sa config file.
Ang dahilan kung bakit ginagawa ito sa halip na direktang tumawag sa Anthropic ay ang spending limit. Gumawa ng hiwalay na virtual key para sa bawat application, at magtakda ng sariling budget para sa bawat isa.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Maaaring gumastos ang key na iyon ng one hundred dollars at maka-access sa isang model lang, at wala nang iba. Kapag nagkaproblema ang isang agent nang alas-tres ng umaga, isang key lang ang maaapektuhan sa halip na ang buong account mo. Ang pattern na iyon, kasama ang monitoring para rito, ang paksa ng pagkontrol sa gastusin ng agent sa isang VPS. Kung pinag-iisipan mo pa kung magbabayad ka ba talaga per token, ipinapaliwanag ng paghahambing ng gastos ng API at subscription ang kalkulasyon.
Tandaan kung ano ang hindi ginagawa ng gateway. Hindi nito ginagawang local ang Claude, at hindi nito itinatago sa Anthropic ang iyong mga prompt. Lumalabas pa rin sa iyong server ang mga request papunta sa provider. Ang nakukuha mo ay kontrol sa mga key, gastusin, routing, at log.
Patakbuhin ang Claude Code sa sarili mong VPS
Ang ikatlong kahilingan ang pinakamadaling ibigay. Client ang Claude Code. Tumatakbo ito saanman naka-install ang Node.js, at kumokonekta ito sa API gamit ang HTTPS. Kapag inilagay mo ito sa server na pagmamay-ari mo, magpapatuloy ang agent kahit i-shut down mo ang laptop mo. Nangangahulugan din ito na ang blast radius ng agent ay isang box na maaari mong i-rebuild, sa halip na ang pangunahing machine mo.
npm install -g @anthropic-ai/claude-code
claude --versionPatakbuhin ito sa loob ng tmux upang hindi mapatigil ng naputol na SSH connection ang matagal na trabaho. Saklaw ng pagpapatakbo ng Claude Code sa VPS gamit ang tmux ang setup na ito, pati ang session handling. Bigyan ang agent ng sarili nitong unprivileged user, at basahin ang mga panuntunan sa kaligtasan para sa pagpapatakbo ng Claude Code sa server bago mo ito bigyan ng write access sa anumang mahalagang data.
Self-hosting ito ng agent, hindi ng model. Mahalagang maging eksakto rito dahil madalas itong napagkakamalang iisang bagay. Ikaw ang may kontrol sa process, filesystem, network egress, at logs. Pagmamay-ari pa rin ng Anthropic ang inference.
Ang tunay na gastos ng bawat opsyon
Nagbabago ang mga presyo, kaya ituring ang mga ito bilang pangkalahatang gabay, hindi eksaktong quotation. Noong July 2026, ang Claude Sonnet 5 ay nagkakahalaga ng $3 bawat milyong input token at $15 bawat milyong output token, habang ang Claude Opus 5 ay nagkakahalaga ng $5 at $25. Walang bayad bawat token ang local model. Sa halip, ang gastos nito ay ang buwanang halaga ng server, tumatakbo man ito o hindi.
Mas mababa kaysa inaasahan ng marami ang break-even point. Ang VPS na may sapat na memory para magpatakbo ng kapaki-pakinabang na open model ay may tunay na buwanang gastos, at kadalasan ay idle ito. Kung pabugso-bugso ang paggamit mo, karaniwang mas mura ang hosted API. Kung tuloy-tuloy ang paggamit mo, o hindi maaaring lumabas sa network mo ang data, mas kapaki-pakinabang ang local model sa parehong sitwasyon.
Ang pinakatapat na mixed approach ang karaniwang pinipili ng mga team. Magpatakbo ng open model nang lokal para sa maraming request na hindi mahirap. I-route ang mahihirap na request sa isang hosted frontier model. Maglagay ng gateway sa harap ng dalawa para hindi kailangang malaman ng mga application kung alin ang ginagamit, at para mailipat mo ang hangganan sa pagitan ng mga ito nang hindi binabago ang application code. Ito ang praktikal na bersyon ng "self hosted Claude", at hindi tulad ng literal na bersyon, umiiral talaga ito. Kung gusto mo ring ikaw ang magpatakbo ng buong agent stack, saklaw ng buod ng mga self-hosted AI agent kung ano ang available.
FAQ
Maaari ko bang i-download ang model weights ng Claude at patakbuhin ito nang lokal?
Hindi. Hindi kailanman nag-release ang Anthropic ng weights para sa anumang Claude model, at walang licence na nagpapahintulot sa self-hosting. Ang anumang ina-advertise online bilang downloadable na “Claude model” ay alinman sa ibang model na may mapanlinlang na pangalan o wrapper na tumatawag sa API. Kung kailangan nito ng API key, hindi ito lokal.
Ano ang pinakamalapit na open model sa Claude?
Walang eksaktong katumbas, at nagbabago ang mga nangungunang model bawat ilang buwan. Ang mga open-weight family na dapat subukan ay Llama, Qwen, Mistral, Gemma, at DeepSeek. Para sa summarization, classification, at simpleng code edits, tunay na kapaki-pakinabang ang isang mahusay na open model na may 8 hanggang 14 billion parameters. Para sa mahahabang multi-step reasoning task at agentic tool use, malaki pa rin ang agwat kumpara sa isang hosted frontier model. Subukan ito gamit ang sarili mong prompts sa halip na basta umasa sa leaderboard.
Ang LiteLLM ba ay isang self-hosted OpenRouter?
Oo, sa functionality ng routing at key management. Tumatakbo ang LiteLLM sa sarili mong server, nagbibigay ng isang OpenAI-compatible endpoint, at nagpo-proxy sa Anthropic, Ollama, at karamihan ng iba pang provider. Makakakuha ka ng spend cap bawat key, model routing, at iisang lugar para basahin ang logs. Ang hindi nito ibinibigay ay local inference: ang mga request sa Claude ay dumadaan pa rin sa Anthropic.
Nananatili bang pribado ang code ko kapag pinapatakbo ko ang Claude Code sa sarili kong server?
Hindi. Ipinapadala ng Claude Code sa Anthropic API ang nilalaman ng mga file na binabasa nito, saanman tumatakbo ang process. Ang ibinibigay sa iyo ng VPS ay isolation ng agent, hindi privacy ng content. Bigyan ito ng nakatalagang unprivileged user, ilayo ito sa credentials at mga repository na walang kaugnayan, at ituring ang lahat ng mababasa nito bilang content na lumalabas sa server.