SSD Nodes Learn Hosting plans →
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-29

Claude स्वतःच्या सर्व्हरवर चालवता येईल का? खरे उत्तर

Claude चे weights सार्वजनिक नाहीत, त्यामुळे तुमच्या server वर ते चालवता येत नाही. त्याऐवजी self-host करण्यासाठी open models, gateway आणि Claude Code चे पर्याय समजून घ्या.

Claude स्वतःच्या सर्व्हरवर चालवता येईल का? नाही, आणि त्याचे कारण येथे आहे

Claude स्वतःच्या सर्व्हरवर चालवता येत नाही. Anthropic मॉडेलचे weights प्रकाशित करत नाही. त्यामुळे download करण्यासाठी कोणतीही file, चालवण्यासाठी कोणताही container किंवा स्वतःच्या hardware वरून ते serve करण्याची परवानगी देणारा कोणताही licence उपलब्ध नाही. प्रत्येक Claude request Anthropic's API कडे किंवा Amazon Bedrock, Google Vertex AI किंवा Microsoft Foundry सारख्या hosted partner कडे जाते. आपल्या मालकीच्या machine वर ते चालवणे ही configuration ची समस्या नाही. Anthropic च्या बाहेर हा artefact अस्तित्वातच नाही.

हे थोडक्यात उत्तर आहे. सविस्तर उत्तर असे आहे की हा प्रश्न विचारणाऱ्या बहुतेक लोकांना प्रत्यक्षात weights नको असतात. त्यांना आपल्या नियंत्रणातील server वर चालणाऱ्या खालीलपैकी एखाद्या गोष्टीची गरज असते: स्थानिक पातळीवर चालणारे सक्षम model, त्यांच्या API keys सुरक्षित ठेवणारा आणि खर्चाला मर्यादा घालणारा gateway, किंवा laptop ऐवजी त्यांच्या स्वतःच्या box वर चालणारा coding agent. या मार्गदर्शिकेत commands सह या तिन्ही पर्यायांचा समावेश आहे.

"self-hosted Claude" याचा सामान्य अर्थ

"self hosted Claude" या शोधासाठी येणाऱ्या लोकांच्या गरजा काही वेगवेगळ्या प्रकारच्या असतात. प्रत्येक गरजेसाठी वेगळे उत्तर आवश्यक आहे.

काही लोकांना गोपनीयता हवी असते. त्यांना prompts त्यांच्या network च्या बाहेर जाऊ नयेत असे वाटते. हे साध्य करण्यासाठी केवळ स्थानिक open weight model उपयोगी ठरतो, कारण कोणतीही Claude विनंती म्हणजे व्याख्येनुसार Anthropic कडे केलेली विनंती असते.

काही लोकांना खर्चावर नियंत्रण हवे असते. agent अनियंत्रितपणे credits खर्च करेल याची त्यांना चिंता असते. gateway ही समस्या सोडवतो. तो Claude सोबत कार्य करतो, त्यामुळे model ची गुणवत्ता कायम ठेवता येते.

काही लोकांना laptop वरून स्वातंत्र्य हवे असते. laptop चे झाकण बंद केल्यानंतरही agent कार्यरत राहावा अशी त्यांची इच्छा असते. VPS ही गरज पूर्ण करतो आणि Claude Code त्यावर सहजपणे चालतो.

काही लोक "self hosted OpenRouter" शोधत असतात. हे देखील gateway आहे आणि यासाठी नेहमीचे उत्तर LiteLLM हे आहे.

तुमची गरज यापैकी कोणती आहे ते निश्चित करा, कारण प्रत्येक बाबतीत योग्य deployment वेगळे असते.

Ollama वापरून open model स्वतः होस्ट करा

एकही prompt तुमच्या सर्व्हरबाहेर जाऊ नये अशी आवश्यकता असल्यास open weight model चालवा. आज भाड्याने घेतलेल्या सर्व्हरवर प्रत्यक्ष वापरता येणाऱ्या प्रमुख families म्हणजे Llama, Qwen, Mistral, Gemma आणि DeepSeek. या सर्वांकडून तुम्ही download करून चालवता येतील असे weights प्रकाशित केले जातात.

Ollama वापरण्याचा हा सर्वात जलद मार्ग आहे. Install script एका ओळीत आहे आणि Ubuntu वर तो systemd service तयार करतो.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama ने active (running) दाखवले पाहिजे. त्यानंतर model pull करून त्याच्याशी संवाद साधा.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

पहिल्या pull मध्ये अनेक gigabytes download होतात. त्यामुळे model कोणत्याही प्रश्नाचे उत्तर देण्यापूर्वी तो RAM किंवा GPU memory मध्ये मावणे आवश्यक आहे. Quantised models साठी साधारण नियम असा आहे: 8 billion parameters असलेल्या model साठी सुमारे 6 GB मोकळी memory, 14 billion parameters असलेल्या model साठी सुमारे 10 GB memory आवश्यक असते. 70 billion parameters असलेल्या model साठी बहुतेक general purpose VPS plans मध्ये उपलब्ध असते त्यापेक्षा अधिक memory लागते. सर्व्हरमध्ये memory कमी असल्यास kernel process बंद करतो आणि तुम्हाला Error: llama runner process has terminated दिसते; dmesg मध्ये out of memory अशी नोंद असते. Model ला दोष देण्यापूर्वी free -h तपासा. हीच memory मर्यादा model लांब prompt पैकी प्रत्यक्षात किती भाग वाचतो हेही ठरवते. Ollama मध्यम आकाराच्या default window पेक्षा पुढील मजकूर शांतपणे truncate करते. त्यामुळे लांब documents अर्धवट summarise होत असतील, तर सर्वप्रथम num_ctx वाढवणे आणि KV cache साठी योग्य memory आकार ठरवणे तपासा.

Ollama 127.0.0.1:11434 वर HTTP API देखील उपलब्ध करून देते. त्यामुळे ते केवळ chat toy न राहता इतर software साठीही उपयुक्त ठरते.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

काही काळ वापर न झाल्यानंतरची पहिली request तीस seconds घेत असेल आणि पुढची request त्वरित पूर्ण होत असेल, तर काहीही बिघडलेले नाही. Ollama पाच minutes idle राहिल्यानंतर model unload करते. keep_alive वापरून model memory मध्येच ठेवणे ही पुन्हा load करण्याची विलंबाची किंमत दूर करते.

तो port localhost ला bind ठेवावा. Public IP वर उघडा Ollama port म्हणजे तो सापडणाऱ्या कोणासाठीही मोफत GPU उपलब्ध करून देणे होय. systemd unit, GPU detection आणि reverse proxy समोर ठेवण्यासह संपूर्ण setup VPS वर Ollama चालवण्याच्या मार्गदर्शिकेत दिला आहे. एकाच वेळी एकापेक्षा अधिक users साठी सेवा देत असल्यास प्रथम Ollama आणि vLLM यांची तुलना वाचा. कारण hardware ची मर्यादा येण्यापूर्वीच Ollama ची single stream रचना bottleneck ठरते.

ही मर्यादा स्पष्टपणे समजून घ्या. Mid sized VPS वरील चांगला open model summarising, classifying, drafting आणि simple extraction साठी खरोखर उपयुक्त असतो. लांब multi step reasoning, मोठ्या codebases आणि agentic tool use यांमध्ये तो frontier hosted model च्या क्षमतेच्या जवळही पोहोचत नाही. Prompt tuning कितीही केले तरी ही तफावत भरून निघत नाही. Local model ज्या कामांसाठी चांगला आहे त्यासाठी तो निवडा आणि काम खरोखर कठीण असेल तेथे hosted model साठी पैसे द्या.

LiteLLM वापरून स्वतःचे gateway चालवा

लोक शोधत असलेले हे “self hosted OpenRouter” आहे. Gateway तुमचे अॅप्लिकेशन आणि प्रत्येक model provider यांच्यामध्ये कार्य करते. तुमच्या अॅप्लिकेशनकडे एकच key असते आणि ती तुमच्या server कडे निर्देशित केलेली असते. प्रत्यक्ष provider keys फक्त त्या server वर साठवलेल्या असतात. प्रत्येक key साठी खर्चाची कमाल मर्यादा ठरवता येते, वेगवेगळ्या अॅप्लिकेशनना वेगवेगळ्या models कडे पाठवता येते आणि प्रत्येक request चे logs एकाच ठिकाणी ठेवता येतात.

LiteLLM हा सर्वसाधारण पर्याय आहे, कारण तो OpenAI compatible API वापरतो आणि त्याच endpoint मागे Anthropic, Ollama तसेच इतर बहुतांश providers कडे proxy करतो. तो config file सह Docker मध्ये चालवा.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

ही सामग्री litellm_config.yaml म्हणून साठवा आणि proxy सुरू करा. तो port 4000 वर ऐकतो.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY हे admin credential आहे. त्यामुळे त्याला root password प्रमाणे सुरक्षित ठेवा आणि उदाहरणातील value वापरू नका. Hosted API ला call करता त्याच पद्धतीने proxy ला call करा.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

यशस्वी response हा choices array असलेला नेहमीचा JSON असतो. 401 याचा अर्थ Authorization header तुमच्या master key शी जुळत नाही. Model चे नाव असलेला 400 याचा अर्थ तुमच्या request मधील model config file मधील कोणत्याही model_name शी जुळत नाही.

Anthropic ला थेट call करण्याऐवजी हे gateway तयार करण्याचे कारण म्हणजे खर्चाची कमाल मर्यादा. प्रत्येक अॅप्लिकेशनसाठी स्वतंत्र virtual key तयार करा आणि प्रत्येक key साठी स्वतंत्र budget ठेवा.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

त्या key मधून one hundred dollars पर्यंत खर्च करता येतो आणि फक्त एका model पर्यंत पोहोचता येते. इतर कोणत्याही model किंवा सेवेचा access मिळत नाही. एखादा agent पहाटे three वाजता चुकीच्या पद्धतीने कार्य करू लागला, तर त्याचा परिणाम संपूर्ण account वर न होता फक्त एका key पुरता मर्यादित राहतो. ही पद्धत आणि तिच्याशी संबंधित monitoring यांचे वर्णन VPS वर agent चा खर्च नियंत्रणात ठेवणे येथे केले आहे. प्रत्येक token साठी पैसे द्यायचे की नाही याचा निर्णय अजून घेतला नसेल, तर API आणि subscription खर्चाची तुलना या गणिताचे स्पष्टीकरण देते.

Gateway काय करत नाही हे लक्षात घ्या. ते Claude ला local बनवत नाही आणि तुमचे prompts Anthropic पासून लपवत नाही. Requests अजूनही तुमच्या server वरून provider कडे जातात. तुम्हाला keys, खर्च, routing आणि logs यांवर नियंत्रण मिळते.

तुमच्या स्वतःच्या VPS वर Claude Code चालवा

तिसरी इच्छा पूर्ण करणे सर्वांत सोपे आहे. Claude Code हा client आहे. Node.js install केलेल्या कोणत्याही ठिकाणी तो चालतो आणि HTTPS द्वारे API शी संवाद साधतो. तो तुमच्या मालकीच्या server वर ठेवल्याने तुम्ही laptop बंद केल्यानंतरही agent काम करत राहतो. तसेच agent चा blast radius हा तुमच्या मुख्य machine ऐवजी पुन्हा build करता येणाऱ्या box पर्यंत मर्यादित राहतो.

npm install -g @anthropic-ai/claude-code
claude --version

SSH connection तुटल्यास दीर्घकाळ चालणारे job बंद होऊ नये, यासाठी ते tmux च्या आत चालवा. Session handling सह ही रचना tmux वापरून VPS वर Claude Code चालवणे येथे स्पष्ट केली आहे. Agent साठी स्वतंत्र unprivileged user द्या. तसेच ज्या data किंवा files वर write access देणार आहात, त्यापूर्वी server वर Claude Code चालवण्यासाठीची सुरक्षा नियमावली वाचा.

याला agent चे self-hosting म्हणता येते, model चे नाही. हा फरक स्पष्टपणे समजून घेणे महत्त्वाचे आहे, कारण या दोन्ही गोष्टी अनेकदा एकच समजल्या जातात. Process, filesystem, network egress आणि logs तुमच्या नियंत्रणाखाली असतात. Inference ची मालकी मात्र Anthropic कडेच राहते.

प्रत्येक पर्यायाची प्रत्यक्ष किंमत

किंमती बदलत राहतात. त्यामुळे यांना अचूक दर न मानता साधारण चित्र म्हणून पाहा. July 2026 पर्यंत Claude Sonnet 5 साठी प्रति million input tokens $3 आणि प्रति million output tokens $15 असे दर आहेत. Claude Opus 5 साठी हे दर अनुक्रमे $5 आणि $25 आहेत. स्थानिक model साठी प्रत्येक token ची स्वतंत्र किंमत नसते. त्याऐवजी सर्व्हरची मासिक किंमत द्यावी लागते. तुम्ही तो वापरत असलात किंवा नसाल, सर्व्हर चालू असेपर्यंत ही किंमत लागू राहते.

Break-even point लोकांच्या अपेक्षेपेक्षा लवकर येतो. उपयुक्त open model चालवण्यासाठी पुरेशी memory असलेल्या VPS साठी दरमहा प्रत्यक्ष खर्च येतो. तो बहुतेक वेळा idle राहतो. तुमचा वापर अधूनमधून वाढणारा असेल, तर hosted API सहसा स्वस्त पडतो. तुमचा वापर सतत असेल किंवा तुमचा data network बाहेर पाठवता येत नसेल, तर स्थानिक model दोन्ही बाबतीत अधिक योग्य ठरतो.

बहुतेक teams शेवटी मिश्र पद्धत स्वीकारतात. मोठ्या प्रमाणातील आणि कमी अवघड कामांसाठी open model स्थानिकरित्या चालवा. कठीण requests hosted frontier model कडे पाठवा. दोन्हींच्या पुढे gateway ठेवा. त्यामुळे applications ला कोणता model वापरला जात आहे हे माहीत असण्याची गरज राहत नाही. तसेच application code न बदलता दोन्हीमधील कामाचे विभाजन बदलता येते. ही रचना "self hosted Claude" ची व्यावहारिक आवृत्ती आहे. शब्दशः आवृत्तीच्या उलट, ती प्रत्यक्षात उपलब्ध आहे. संपूर्ण agent stack देखील स्वतः चालवायचा असल्यास, self-hosted AI agents चा आढावा उपलब्ध पर्याय स्पष्ट करतो.

FAQ

Claude चे model weights डाउनलोड करून ते स्थानिक पातळीवर चालवता येतील का?

नाही. Anthropic ने कोणत्याही Claude model साठी weights कधीही release केलेले नाहीत आणि self-hosting ला परवानगी देणारा कोणताही licence उपलब्ध नाही. ऑनलाइन डाउनलोड करता येणारे "Claude model" म्हणून जाहिरात केलेले कोणतेही सॉफ्टवेअर एकतर दिशाभूल करणाऱ्या नावाचे वेगळे model असते किंवा API ला call करणारा wrapper असतो. त्यासाठी API key आवश्यक असल्यास ते स्थानिक पातळीवर चालत नाही.

Claude शी सर्वाधिक जवळचे open model कोणते आहे?

याचे अचूक समान model नाही आणि अग्रगण्य models दर काही महिन्यांनी बदलतात. तपासण्यासारखी open-weight कुटुंबे म्हणजे Llama, Qwen, Mistral, Gemma आणि DeepSeek. summarising, classification आणि साध्या code edits साठी 8 ते 14 billion parameters असलेले चांगले open model प्रत्यक्षात उपयुक्त ठरते. दीर्घ multi-step reasoning आणि agentic tool use बाबतीत hosted frontier model च्या तुलनेत अंतर अजूनही मोठे आहे. leaderboard वर अवलंबून न राहता स्वतःच्या prompts वर चाचणी घ्या.

LiteLLM हे self-hosted OpenRouter आहे का?

routing आणि key management या कार्यांच्या दृष्टीने होय. LiteLLM तुमच्या server वर चालते, एक OpenAI-compatible endpoint उपलब्ध करून देते आणि Anthropic, Ollama तसेच इतर बहुतेक providers कडे proxy करते. प्रत्येक key साठी spend caps, model routing आणि logs पाहण्यासाठी एकच ठिकाण मिळते. मात्र यामुळे local inference मिळत नाही: Claude कडे पाठवलेल्या requests अजूनही Anthropic कडे जातात.

माझ्या स्वतःच्या server वर Claude Code चालवल्यास माझा code private राहतो का?

नाही. प्रक्रिया कुठेही चालू असली तरी Claude Code वाचत असलेल्या file contents Anthropic API कडे पाठवते. VPS मुळे agent चे isolation मिळते; content ची privacy मिळत नाही. त्यासाठी dedicated unprivileged user द्या, credentials आणि संबंधित नसलेल्या repositories पासून त्याला दूर ठेवा आणि तो वाचू शकणारी प्रत्येक गोष्ट server बाहेर पाठवली जाणारी content आहे असे समजा.