SSD Nodes Learn 8GB RAM — $66/वर्ष
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-01

Claude स्वतःच्या सर्व्हरवर होस्ट करता येते का? खरे उत्तर

Claude चे weights सार्वजनिक नाहीत, त्यामुळे कोणताही स्वतःचा server ते चालवू शकत नाही. त्याऐवजी open models, API gateway आणि Claude Code स्वतः होस्ट करण्याचे पर्याय येथे पाहा.

Claude स्वतःच्या सर्व्हरवर होस्ट करता येते का? नाही, आणि त्याचे कारण येथे आहे

Claude स्वतःच्या सर्व्हरवर होस्ट करता येत नाही. Anthropic मॉडेलचे weights प्रकाशित करत नाही. त्यामुळे डाउनलोड करण्यासाठी कोणतीही फाइल, चालवण्यासाठी कोणताही container किंवा स्वतःच्या hardware वर ते serve करण्याची परवानगी देणारा कोणताही licence उपलब्ध नाही. Claude साठी केलेली प्रत्येक विनंती Anthropic च्या API कडे किंवा Amazon Bedrock, Google Vertex AI किंवा Microsoft Foundry सारख्या hosted partner कडे जाते. आपल्या मालकीच्या machine वर ते चालवणे ही configuration ची समस्या नाही. Anthropic च्या बाहेर हा artefact अस्तित्वातच नाही.

हे संक्षिप्त उत्तर आहे. सविस्तर उत्तर असे आहे की हा प्रश्न विचारणाऱ्या बहुतेक लोकांना प्रत्यक्षात model चे weights नको असतात. त्यांना आपल्या नियंत्रणातील server वर चालणाऱ्या पुढील तीनपैकी एखाद्या गोष्टीची गरज असते: स्थानिक पातळीवर चालणारे सक्षम model, त्यांच्या API keys सुरक्षित ठेवणारा आणि खर्चाला मर्यादा घालणारा gateway, किंवा laptop ऐवजी त्यांच्या स्वतःच्या box वर चालणारा coding agent. या मार्गदर्शकामध्ये या तिन्ही पर्यायांचा commands सह समावेश आहे.

"self-hosted Claude" याचा सामान्यतः अर्थ

"self hosted Claude" साठी होणारे शोध काही वेगवेगळ्या गरजांमध्ये विभागले जातात. प्रत्येक गरजेसाठी वेगळे उत्तर आवश्यक आहे.

काही लोकांना गोपनीयता हवी असते. त्यांना prompts त्यांच्या network च्या बाहेर पाठवायचे नसतात. हे साध्य करण्यासाठी केवळ स्थानिक open weight model पुरेसा आहे, कारण प्रत्येक Claude request ही व्याख्येनुसार Anthropic कडे केलेली request असते.

काही लोकांना खर्चावर नियंत्रण हवे असते. एखादा runaway agent credits वेगाने खर्च करेल याची त्यांना चिंता असते. gateway ही समस्या सोडवतो. तो Claude सोबत कार्य करतो, त्यामुळे model quality कायम राहते.

काही लोकांना laptop वरील अवलंबित्व दूर करायचे असते. laptop चे झाकण बंद केल्यानंतरही कार्यरत राहणारा agent त्यांना हवा असतो. VPS ही गरज पूर्ण करतो आणि Claude Code त्यावर सहज कार्य करतो.

काही लोकांना "self hosted OpenRouter" हवे असते. हे देखील gateway आहे आणि यासाठी नेहमीचे उत्तर LiteLLM आहे.

तुमची गरज कोणती आहे ते निश्चित करा, कारण प्रत्येक बाबतीत योग्य build वेगळा असतो.

Ollama वापरून मुक्त मॉडेल स्वतःच्या सर्व्हरवर होस्ट करा

प्रॉम्प्ट सर्व्हरच्या बाहेर जाऊ नये अशी आवश्यकता असल्यास, मुक्त वेट्स असलेले मॉडेल चालवा. आज भाड्याने घेतलेल्या सर्व्हरवर प्रत्यक्ष वापरता येणारी मॉडेल कुटुंबे म्हणजे Llama, Qwen, Mistral, Gemma आणि DeepSeek. ही सर्व कुटुंबे डाउनलोड करून चालवता येतील असे वेट्स प्रकाशित करतात.

Ollama वापरणे सुरू करण्याचा सर्वात जलद मार्ग आहे. इंस्टॉल स्क्रिप्ट एका ओळीत आहे आणि ती Ubuntu वर systemd सेवा सेट करते.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama ने active (running) दाखवले पाहिजे. त्यानंतर मॉडेल डाउनलोड करून त्याच्याशी संवाद साधा.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

पहिल्या pull वेळी अनेक gigabytes डेटा डाउनलोड होतो. त्यामुळे मॉडेल उत्तर देण्यापूर्वी ते RAM किंवा GPU memory मध्ये मावले पाहिजे. Quantised मॉडेलसाठी साधारण नियम असा आहे: 8 billion parameters असलेल्या मॉडेलला सुमारे 6 GB मोकळी memory, 14 billion parameters असलेल्या मॉडेलला सुमारे 10 GB memory आवश्यक असते. 70 billion parameters असलेल्या मॉडेलला बहुतेक general purpose VPS plans पेक्षा अधिक memory लागते. सर्व्हरमध्ये memory कमी असल्यास kernel process बंद करतो. त्यावेळी Error: llama runner process has terminated दिसते आणि dmesg मध्ये out of memory अशी ओळ दिसते. मॉडेलला दोष देण्यापूर्वी free -h तपासा.

Ollama 127.0.0.1:11434 वर HTTP API देखील उपलब्ध करून देते. त्यामुळे ते केवळ chat toy न राहता इतर software साठी उपयुक्त ठरते.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

तो port localhost ला bound ठेवा. Public IP वर खुला Ollama port सापडणाऱ्या कोणासाठीही विनामूल्य GPU उपलब्ध करून देतो. systemd unit, GPU detection आणि reverse proxy समोरील configuration यांसह संपूर्ण build VPS वर Ollama चालवण्याच्या मार्गदर्शकात दिला आहे. एकाच वेळी एकापेक्षा जास्त वापरकर्त्यांना सेवा देत असल्यास, आधी Ollama आणि vLLM यांची तुलना वाचा. कारण hardware ची मर्यादा येण्यापूर्वीच Ollama चे single stream design bottleneck बनते.

या फरकाबद्दल वास्तववादी रहा. Mid sized VPS वरील चांगले open model summarising, classifying, drafting आणि simple extraction यांसाठी खरोखर उपयुक्त असते. दीर्घ multi step reasoning, मोठ्या codebases आणि agentic tool use मध्ये ते frontier hosted model च्या जवळही पोहोचत नाही. Prompt tuning कितीही केले तरी हा फरक दूर होत नाही. ज्या कामांसाठी local model चांगले आहे त्यासाठी ते निवडा. अडचण खरोखर मोठी असेल तेथे hosted model साठी खर्च करा.

LiteLLM वापरून स्वतःचे gateway चालवा

लोक शोधत असलेले हे "self hosted OpenRouter" आहे. Gateway तुमच्या applications आणि प्रत्येक model provider यांच्या दरम्यान कार्य करते. तुमच्या apps मध्ये एकच key असते आणि ती तुमच्या server कडे निर्देशित केलेली असते. वास्तविक provider keys केवळ त्या server वर असतात. तुम्ही प्रत्येक key साठी खर्चाची मर्यादा ठरवू शकता, वेगवेगळ्या apps ना वेगवेगळ्या models कडे route करू शकता आणि प्रत्येक request चे logging एकाच ठिकाणी करू शकता.

LiteLLM हा सर्वसाधारण पर्याय आहे, कारण तो OpenAI compatible API वापरतो आणि त्याच endpoint मागे Anthropic, Ollama तसेच इतर बहुतांश providers कडे proxy करतो. तो config file सह Docker मध्ये चालवा.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

ती litellm_config.yaml म्हणून save करा आणि proxy सुरू करा. तो port 4000 वर listen करतो.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY हे admin credential आहे. त्यामुळे ते root password प्रमाणे सुरक्षित ठेवा आणि example value वापरू नका. Hosted API ला call करता त्याच पद्धतीने proxy ला call करा.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

यशस्वी response हा choices array असलेला सामान्य JSON असतो. 401 याचा अर्थ Authorization header तुमच्या master key शी जुळत नाही. Model चे नाव असलेला 400 याचा अर्थ तुमच्या request मधील model config file मधील कोणत्याही model_name शी जुळत नाही.

Anthropic ला थेट call करण्याऐवजी हे तयार करण्याचे कारण म्हणजे spend cap. प्रत्येक application साठी स्वतंत्र virtual key जारी करा आणि प्रत्येक key साठी स्वतंत्र budget ठेवा.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

त्या key मधून one hundred dollars पर्यंत खर्च करता येतो आणि ती केवळ एका model पर्यंत पोहोचू शकते. इतर कोणतीही सुविधा उपलब्ध नसते. एखादा agent पहाटे तीन वाजता चुकीचे वर्तन करू लागला, तरी त्याचा परिणाम तुमच्या संपूर्ण account ऐवजी एका key पुरता मर्यादित राहतो. ही पद्धत आणि तिच्याशी संबंधित monitoring यांचा आढावा VPS वर agent चा खर्च नियंत्रणात ठेवणे येथे आहे. Token नुसार पैसे देणे योग्य आहे की नाही हे अजून ठरवत असाल, तर API विरुद्ध subscription खर्चाची तुलना या गणनेतून मार्गदर्शन करते.

Gateway काय करत नाही हे लक्षात ठेवा. ते Claude ला local बनवत नाही आणि Anthropic पासून तुमचे prompts लपवत नाही. Requests अजूनही provider कडे तुमच्या server वरून बाहेर जातात. तुम्हाला keys, खर्च, routing आणि logs यांवर नियंत्रण मिळते.

तुमच्या स्वतःच्या VPS वर Claude Code चालवा

तिसरी इच्छा पूर्ण करणे सर्वात सोपे आहे. Claude Code हा एक client आहे. तुम्ही Node.js जिथे install करता तिथे तो चालतो आणि HTTPS द्वारे API शी संवाद साधतो. तो तुमच्या मालकीच्या server वर install केल्याने laptop बंद केल्यानंतरही agent काम करत राहतो. तसेच agent मुळे होणारे संभाव्य नुकसान तुम्ही पुन्हा तयार करू शकणाऱ्या serverपुरते मर्यादित राहते, मुख्य machineपुरते नाही.

npm install -g @anthropic-ai/claude-code
claude --version

तो tmux मध्ये चालवा, जेणेकरून SSH connection तुटल्यास दीर्घकाळ चालणारे काम बंद होणार नाही. session हाताळणीसह ही रचना tmux सह VPS वर Claude Code चालवणे येथे दिली आहे. agent साठी स्वतंत्र unprivileged user तयार करा. त्याला महत्त्वाच्या कोणत्याही गोष्टीवर write access देण्यापूर्वी server वर Claude Code चालवण्याचे सुरक्षा नियम वाचा.

ही agent ची self-hosting आहे, model ची नाही. हा फरक स्पष्टपणे समजून घेणे महत्त्वाचे आहे, कारण अनेकजण या दोन्ही गोष्टी एकत्र समजतात. process, filesystem, network egress आणि logs यांवर तुमचे नियंत्रण असते. Inference चे नियंत्रण मात्र Anthropic कडेच राहते.

प्रत्येक पर्यायाची वास्तविक किंमत

किंमती बदलत असतात. त्यामुळे हे आकडे निश्चित दर समजू नका; त्याऐवजी त्यातून खर्चाची रूपरेषा समजा. July 2026 पर्यंत Claude Sonnet 5 ची किंमत प्रति दशलक्ष input tokens साठी $3 आणि प्रति दशलक्ष output tokens साठी $15 आहे. Claude Opus 5 साठी या किंमती अनुक्रमे $5 आणि $25 आहेत. स्थानिक model साठी प्रत्येक token वर कोणताही खर्च येत नाही. त्याऐवजी, तो server दरमहा जितका खर्चिक असेल तितकाच खर्च येतो, आणि तुम्ही तो वापरत असलात किंवा नसाल तरी तो चालू राहतो.

समतोलबिंदू लोकांच्या अपेक्षेपेक्षा लवकर येतो. उपयुक्त open model चालवण्यासाठी पुरेशी memory असलेल्या VPS साठी दरमहा प्रत्यक्ष खर्च येतो, आणि तो बहुतेक वेळ idle राहतो. तुमचा वापर अधूनमधून वाढत-घटत असेल, तर hosted API सहसा स्वस्त पडतो. तुमचा वापर सतत असेल किंवा तुमचा data network बाहेर जाऊ शकत नसेल, तर स्थानिक model दोन्ही बाबतीत अधिक योग्य ठरतो.

बहुतेक teams शेवटी स्वीकारतात ते प्रामाणिक मिश्र उत्तर आहे. मोठ्या प्रमाणातील, कमी अवघडपणाच्या कामांसाठी open model स्थानिक पातळीवर चालवा. कठीण requests hosted frontier model कडे पाठवा. दोन्हींच्या समोर gateway ठेवा. त्यामुळे कोणता model वापरला जात आहे हे applications ना माहीत असण्याची गरज राहत नाही. तसेच application code न बदलता तुम्ही दोन्हीमधील कामाचे विभाजन बदलू शकता. ही architecture म्हणजे "self hosted Claude" ची व्यावहारिक आवृत्ती आहे. शब्दशः आवृत्तीच्या उलट, ही प्रत्यक्षात उपलब्ध आहे. संपूर्ण agent stack स्वतः चालवायचा असल्यास, self-hosted AI agents चा आढावा उपलब्ध पर्याय स्पष्ट करतो.

FAQ

Claude चे model weights download करून ते स्थानिक पातळीवर चालवता येतात का?

नाही. Anthropic ने कोणत्याही Claude model चे weights कधीही release केलेले नाहीत आणि self hosting ला परवानगी देणारा कोणताही licence नाही. Online download करता येणारे "Claude model" म्हणून जाहिरात केलेले काहीही एकतर दिशाभूल करणाऱ्या नावाचे वेगळे model असते किंवा API ला call करणारा wrapper असतो. त्यासाठी API key आवश्यक असल्यास ते local नाही.

Claude शी सर्वाधिक जवळचे open model कोणते आहे?

याचे अचूक समान model नाही आणि आघाडीची models दर काही महिन्यांनी बदलतात. तपासण्यासारखी open weight families म्हणजे Llama, Qwen, Mistral, Gemma आणि DeepSeek. Summarising, classification आणि साध्या code edits साठी 8 ते 14 billion parameters असलेले चांगले open model प्रत्यक्षात उपयुक्त ठरते. दीर्घ multi step reasoning आणि agentic tool use मध्ये hosted frontier model च्या तुलनेत अजूनही मोठी तफावत आहे. Leaderboard वर अवलंबून राहण्याऐवजी तुमच्या स्वतःच्या prompts वर चाचणी घ्या.

LiteLLM हे self-hosted OpenRouter आहे का?

Routing आणि key management या भागांसाठी कार्यात्मकदृष्ट्या होय. LiteLLM तुमच्या server वर चालते, एक OpenAI compatible endpoint उपलब्ध करून देते आणि Anthropic, Ollama तसेच इतर बहुतांश providers कडे proxy करते. तुम्हाला प्रत्येक key साठी spend caps, model routing आणि logs वाचण्यासाठी एकच ठिकाण मिळते. मात्र ते local inference उपलब्ध करून देत नाही: Claude कडे केलेल्या requests अजूनही Anthropic कडे जातात.

माझ्या स्वतःच्या server वर Claude Code चालवल्यास माझा code private राहतो का?

नाही. Process कुठेही चालू असला तरी Claude Code वाचत असलेल्या file contents Anthropic API कडे पाठवते. VPS मुळे agent चे isolation मिळते, परंतु content ची privacy मिळत नाही. त्यासाठी dedicated unprivileged user द्या, त्याला credentials आणि असंबंधित repositories पासून दूर ठेवा आणि तो वाचू शकणारी प्रत्येक गोष्ट box बाहेर जाणारा content आहे असे समजा.