Je, unaweza kujiendeshea Claude? Jibu la kweli
Uzani wa Claude haujawekwa hadharani, hivyo huwezi kuiendesha kwenye server yako. Jua unachoweza kujiendeshea: open models, gateway na Claude Code.
Je, unaweza kujiendeshea Claude mwenyewe? Hapana, na hii ndiyo sababu
Huwezi kujiendeshea Claude mwenyewe. Anthropic haichapishi uzani wa modeli, kwa hiyo hakuna faili ya kupakua, hakuna container ya kuendesha, wala leseni inayokuruhusu kuihudumia kwenye maunzi yako mwenyewe. Kila ombi la Claude huenda kwenye API ya Anthropic au kwa mshirika mwenye huduma mwenyeji, kama Amazon Bedrock, Google Vertex AI, au Microsoft Foundry. Kuiendesha kwenye mashine unayomiliki si tatizo la usanidi. Kifurushi hicho hakipo nje ya Anthropic.
Hilo ndilo jibu fupi. Jibu refu ni kwamba watu wengi wanaouliza swali hili hawataki uzani wa modeli kwa kweli. Wanataka mojawapo ya mambo matatu ambayo yote yanawezekana kwenye server unayoidhibiti: modeli yenye uwezo inayotumika locally, gateway inayohifadhi API keys zao na kuweka kikomo cha matumizi yao, au coding agent inayofanya kazi kwenye mashine yao badala ya laptop yao. Mwongozo huu unashughulikia yote matatu, pamoja na commands.
Kile ambacho "Claude inayojihifadhiwa mwenyewe" humaanisha kwa kawaida
Trafiki ya utafutaji ya "self hosted Claude" hugawanyika katika mahitaji machache tofauti, na kila hitaji linahitaji jibu tofauti.
Baadhi ya watu wanataka faragha. Hawataki vidokezo vitoke kwenye mtandao wao. Ni modeli ya ndani yenye uzani huria pekee inayoweza kutatua hilo, kwa sababu ombi lolote la Claude ni, kwa ufafanuzi, ombi linalotumwa kwa Anthropic.
Baadhi ya watu wanataka kudhibiti gharama. Wana wasiwasi kuhusu wakala anayefanya kazi kupita kiasi na kutumia mikopo yote. Lango linatatua hilo, na linafanya kazi na Claude, hivyo unabaki na ubora wa modeli.
Baadhi ya watu wanataka kujitegemea kutoka kwenye laptop. Wanataka wakala aendelee kufanya kazi wanapofunga kifuniko. VPS inatatua hilo, na Claude Code hufanya kazi humo bila matatizo.
Baadhi ya watu wanataka maneno "self hosted OpenRouter". Hilo pia ni lango, na jibu la kawaida ni LiteLLM.
Tambua ni kundi gani linalokuhusu, kwa sababu usanidi unaofaa hutofautiana katika kila hali.
Jiendeshee mfano huria kwa Ollama
Ikiwa sharti ni kwamba hakuna prompt inayotoka kwenye server yako, tumia mfano wenye weights huria. Familia zinazoweza kutumika kwenye server iliyokodishwa leo ni Llama, Qwen, Mistral, Gemma, na DeepSeek. Zote huchapisha weights unazoweza kupakua na kuendesha.
Ollama ndiyo njia ya haraka zaidi ya kuanza. Install script ina mstari mmoja, na huweka huduma ya systemd kwenye Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama inapaswa kuchapisha active (running). Kisha pakua mfano na uwasiliane nao.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."Mara ya kwanza pull hupakua gigabyte kadhaa, kwa hiyo mfano lazima utoshee kwenye RAM au kumbukumbu ya GPU kabla haujajibu chochote. Kanuni ya makadirio kwa mifano iliyopunguzwa: mfano wenye vigezo bilioni 8 unahitaji takriban GB 6 za nafasi iliyo huru, mfano wenye vigezo bilioni 14 unahitaji takriban GB 10, na mfano wenye vigezo bilioni 70 unahitaji kumbukumbu zaidi kuliko mipango mingi ya VPS ya matumizi ya jumla inavyotoa. Ikiwa mashine ina kumbukumbu haitoshi, mchakato huuawa na kernel na unaona Error: llama runner process has terminated, pamoja na mstari unaoonyesha ukosefu wa kumbukumbu kwenye dmesg. Kagua free -h kabla ya kuilaumu mfano.
Ollama pia hutoa HTTP API kwenye 127.0.0.1:11434, jambo linaloifanya iwe muhimu kwa programu nyingine badala ya kuwa zana ya mazungumzo pekee.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Acha port hiyo ifungwe kwenye localhost. Port ya Ollama iliyo wazi kwenye IP ya umma ni GPU ya bure kwa yeyote anayeipata. Ujenzi kamili, ukiwa na systemd unit, utambuzi wa GPU, na kuweka reverse proxy mbele yake, umeelezwa kwenye mwongozo wa kuendesha Ollama kwenye VPS. Ikiwa unahudumia zaidi ya mtumiaji mmoja kwa wakati mmoja, soma kwanza ulinganisho wa Ollama na vLLM, kwa sababu muundo wa Ollama wa stream moja huwa kizuizi kabla ya hardware kuwa kizuizi.
Kuwa mkweli kuhusu tofauti hiyo. Mfano mzuri huria kwenye VPS yenye uwezo wa wastani ni muhimu kwa kufupisha, kuainisha, kuandaa rasimu, na kutoa data kwa njia rahisi. Katika hoja ndefu za hatua nyingi, kwenye codebase kubwa, na katika matumizi ya zana za kiwakala, haufikii karibu mfano wa kisasa unaopangishwa, na hakuna kiasi cha kuboresha prompt kinachoweza kuziba tofauti hiyo. Chagua mfano wa ndani kwa kazi unazoweza kuufanyia vizuri, na ulipie mfano unaopangishwa pale ambapo ugumu wa kazi ni halisi.
Endesha gateway yako mwenyewe kwa LiteLLM
Hiki ndicho kile ambacho watu wanachotafuta kama "OpenRouter inayojihifadhiwa mwenyewe". Gateway hukaa kati ya programu zako na kila mtoa huduma wa modeli. Programu zako hushikilia key moja inayoelekezwa kwenye server yako. Keys halisi za watoa huduma huhifadhiwa kwenye server hiyo pekee. Unaweza kuweka kikomo cha matumizi kwa kila key, kuelekeza programu tofauti kwenye modeli tofauti, na kurekodi kila ombi mahali pamoja.
LiteLLM ndiyo chaguo la kawaida kwa sababu hutumia API inayooana na OpenAI na hutuma maombi kwa Anthropic, Ollama, na watoa huduma wengine wengi kupitia endpoint hiyo hiyo. Iendeshe katika Docker kwa kutumia faili ya usanidi.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Hifadhi hilo kama litellm_config.yaml kisha uanzishe proxy. Husikiliza kwenye port 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY ni kitambulisho cha msimamizi, kwa hiyo kishughulikie kama nenosiri la root na usitumie thamani ya mfano inayotolewa. Ita proxy kama vile ungeita API iliyohifadhiwa na mtoa huduma.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Jibu linaloonyesha hali nzuri ni JSON ya kawaida yenye array ya choices. 401 inamaanisha kuwa header ya Authorization hailingani na master key yako. 400 inayotaja modeli inamaanisha kuwa model katika ombi lako hailingani na model_name yoyote iliyo katika faili ya usanidi.
Sababu ya kujenga hili badala ya kuita Anthropic moja kwa moja ni kuweka kikomo cha matumizi. Toa key pepe tofauti kwa kila programu, kila moja ikiwa na bajeti yake.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Key hiyo inaweza kutumia dola mia moja na kufikia modeli moja pekee. Haiwezi kufanya jambo lingine. Agent inapofanya makosa saa tatu asubuhi, athari inaishia kwenye key moja badala ya akaunti yako yote. Mfumo huo, pamoja na ufuatiliaji wake, unaelezwa katika kudhibiti gharama za agent kwenye VPS. Ikiwa bado unaamua kama ulipe kwa kila tokeni, ulinganisho wa gharama ya API dhidi ya usajili unaeleza hesabu hiyo.
Zingatia kile ambacho gateway haifanyi. Haifanyi Claude iwe ya ndani, wala haifichi prompts zako kutoka kwa Anthropic. Maombi bado hutoka kwenye server yako kwenda kwa mtoa huduma. Unachopata ni udhibiti wa keys, matumizi, uelekezaji, na kumbukumbu za matukio.
Kuendesha Claude Code kwenye VPS yako mwenyewe
Hili ni ombi rahisi zaidi kutimiza. Claude Code ni client. Huendeshwa mahali popote unapoweka Node.js, na huwasiliana na API kupitia HTTPS. Kuiweka kwenye server unayomiliki humwezesha agent kuendelea kufanya kazi baada ya kuzima laptop yako. Pia humaanisha kuwa eneo la athari la agent linakuwa kwenye mfumo unaoweza kuujenga upya, badala ya kwenye mashine yako kuu.
npm install -g @anthropic-ai/claude-code
claude --versionIendeshe ndani ya tmux ili muunganisho wa SSH ukikatika, kazi ndefu isiishe. Usanidi huo, pamoja na udhibiti wa session, umeelezwa katika kuendesha Claude Code kwenye VPS kwa kutumia tmux. Mpe agent user wake asiye na privileges, na soma kanuni za usalama za kuendesha Claude Code kwenye server kabla hujampa ruhusa ya kuandika kwenye kitu chochote muhimu kwako.
Huku ni kujihostia agent, si model. Ni muhimu kutofautisha mambo hayo, kwa sababu mara nyingi watu huyachanganya. Unamiliki process, filesystem, network egress, na logs. Anthropic bado inamiliki inference.
Gharama halisi ya kila chaguo
Bei hubadilika, kwa hiyo chukulia hizi kama makadirio ya muundo wa gharama, si bei rasmi. Kufikia Julai 2026, Claude Sonnet 5 imeorodheshwa kwa $3 kwa kila tokeni milioni moja za ingizo na $15 kwa kila tokeni milioni moja za towe, huku Claude Opus 5 ikiwa $5 na $25. Modeli ya ndani haina gharama kwa kila tokeni. Badala yake, unalipia gharama ya seva kwa mwezi, iwe unaitumia au la.
Kiwango cha kusawazisha gharama huwa cha chini kuliko watu wanavyotarajia. VPS yenye kumbukumbu ya kutosha kuendesha modeli huria inayofaa hugharimu fedha halisi kila mwezi, na mara nyingi huwa haitumiki. Ikiwa matumizi yako huongezeka na kupungua kwa vipindi, API inayopangishwa huwa nafuu kwa kawaida. Ikiwa matumizi yako ni ya kudumu, au ikiwa data yako haiwezi kuondoka kwenye mtandao wako, modeli ya ndani huwa bora kwa sababu zote mbili.
Jibu mseto la kweli ndilo ambalo timu nyingi huchagua. Endesha modeli huria ndani kwa kazi zenye ujazo mkubwa na ugumu mdogo. Elekeza maombi magumu kwenye modeli ya kiwango cha juu inayopangishwa. Weka gateway mbele ya zote mbili ili programu zisihitaji kujua tofauti hiyo, na ili uweze kubadilisha mgawanyo kati yao bila kugusa msimbo wa programu. Muundo huo ndio utekelezaji wa kivitendo wa "Claude inayopangishwa binafsi", na tofauti na toleo la moja kwa moja, upo. Ikiwa pia unataka kuendesha stack yote ya agent mwenyewe, muhtasari wa mawakala wa AI wanaopangishwa binafsi unaeleza chaguo zinazopatikana.
FAQ
Je, ninaweza kupakua uzito wa modeli ya Claude na kuiendesha ndani ya mfumo wangu?
Hapana. Anthropic haijawahi kutoa uzito wa modeli yoyote ya Claude, na hakuna leseni inayoruhusu kujiendeshea modeli hiyo. Kitu chochote kinachotangazwa mtandaoni kama "modeli ya Claude" inayoweza kupakuliwa ni modeli tofauti iliyopewa jina la kupotosha, au kifuniko kinachotumia API. Ikiwa kinahitaji ufunguo wa API, hakifanyi kazi ndani ya mfumo wako.
Ni modeli gani iliyo wazi iliyo karibu zaidi na Claude?
Hakuna inayolingana kikamilifu, na modeli zinazoongoza hubadilika kila baada ya miezi michache. Familia za modeli zilizo wazi zinazofaa kujaribiwa ni Llama, Qwen, Mistral, Gemma, na DeepSeek. Kwa kufanya muhtasari, uainishaji, na marekebisho rahisi ya msimbo, modeli nzuri iliyo wazi yenye vigezo 8 hadi 14 billion ni yenye manufaa halisi. Kwa hoja ndefu za hatua nyingi na matumizi ya zana na mawakala, tofauti na modeli ya kisasa inayoendeshwa na mtoa huduma bado ni kubwa. Jaribu kwa vidokezo vyako mwenyewe badala ya kutegemea jedwali la viwango.
Je, LiteLLM ni OpenRouter inayojikaribisha yenyewe?
Kwa utendaji, ndiyo, kwa sehemu ya uelekezaji na usimamizi wa funguo. LiteLLM huendeshwa kwenye server yako, hutoa endpoint moja inayooana na OpenAI, na hutuma maombi kupitia Anthropic, Ollama, na watoa huduma wengine wengi. Unapata vikomo vya matumizi kwa kila ufunguo, uelekezaji wa modeli, na mahali pamoja pa kusoma kumbukumbu. Kile isichokupa ni uendeshaji wa modeli ndani ya mfumo wako: maombi kwa Claude bado hupitia Anthropic.
Je, kuendesha Claude Code kwenye server yangu mwenyewe kunalinda msimbo wangu usiwe wazi?
Hapana. Claude Code hutuma maudhui ya faili inazosoma kwenye Anthropic API, bila kujali mchakato huo unaendeshwa wapi. VPS hukupa utenganishaji wa wakala, si faragha ya maudhui. Mpe mtumiaji maalumu asiye na marupurupu, mzuie kufikia taarifa za uthibitishaji na hazina zisizohusiana, na chukulia kila kitu anachoweza kusoma kuwa ni maudhui yanayotoka kwenye server hiyo.