SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-23

क्या Claude को self-host किया जा सकता है? पूरी सच्चाई

Claude के weights सार्वजनिक नहीं हैं, इसलिए इसे अपने सर्वर पर चलाना असंभव है। इस लेख में जानें कि आप किन open models और gateway विकल्पों का उपयोग करके अपनी जरूरतें पूरी कर सकते हैं।

क्या आप Claude को self-host कर सकते हैं? नहीं, और इसका कारण यहाँ दिया गया है

आप Claude को self-host नहीं कर सकते। Anthropic मॉडल के weights प्रकाशित नहीं करता है, इसलिए डाउनलोड करने के लिए कोई फाइल, चलाने के लिए कोई container, और ऐसा कोई licence उपलब्ध नहीं है जो आपको इसे अपने हार्डवेयर से serve करने की अनुमति दे। Claude का प्रत्येक request Anthropic के API या Amazon Bedrock, Google Vertex AI, या Microsoft Foundry जैसे किसी hosted partner के पास जाता है। इसे अपने स्वामित्व वाली मशीन पर चलाना कोई configuration की समस्या नहीं है। यह artefact Anthropic के बाहर मौजूद ही नहीं है।

यह संक्षिप्त उत्तर है। विस्तृत उत्तर यह है कि जो लोग यह प्रश्न पूछते हैं, उनमें से अधिकांश वास्तव में weights नहीं चाहते हैं। वे तीन में से एक ऐसी चीज चाहते हैं जो आपके द्वारा नियंत्रित सर्वर पर प्राप्त की जा सकती है: स्थानीय रूप से चलने वाला एक सक्षम मॉडल, एक gateway जो उनके API keys को सुरक्षित रखे और उनके खर्च को सीमित करे, या एक coding agent जो उनके लैपटॉप के बजाय उनके अपने सर्वर पर रहे। यह गाइड इन तीनों को commands के साथ कवर करती है।

"Self-hosted Claude" का सामान्य अर्थ क्या है

"Self-hosted Claude" के लिए सर्च ट्रैफिक कुछ अलग-अलग इच्छाओं में विभाजित है, और उनके लिए अलग-अलग उत्तरों की आवश्यकता होती है।

कुछ लोग गोपनीयता चाहते हैं। वे नहीं चाहते कि उनके प्रॉम्प्ट्स उनके नेटवर्क से बाहर जाएं। केवल एक लोकल ओपन वेट मॉडल ही इसका समाधान करता है, क्योंकि Claude का कोई भी अनुरोध परिभाषा के अनुसार Anthropic को भेजा गया अनुरोध होता है।

कुछ लोग लागत पर नियंत्रण चाहते हैं। उन्हें चिंता है कि कोई अनियंत्रित एजेंट उनके क्रेडिट्स खत्म कर देगा। एक गेटवे इसका समाधान करता है, और यह Claude के साथ काम करता है, जिससे आप मॉडल की गुणवत्ता बनाए रखते हैं।

कुछ लोग लैपटॉप से स्वतंत्रता चाहते हैं। वे एक ऐसा एजेंट चाहते हैं जो उनके लैपटॉप बंद करने के बाद भी काम करता रहे। एक VPS इसका समाधान करता है, और Claude Code उस पर आसानी से चलता है।

कुछ लोग "self-hosted OpenRouter" वाक्यांश चाहते हैं। वह भी एक गेटवे है, और इसका सामान्य उत्तर LiteLLM है।

तय करें कि आप इनमें से किस श्रेणी में आते हैं, क्योंकि हर स्थिति में सही बिल्ड अलग होता है।

Ollama के साथ एक open model को self-host करना

यदि आपकी आवश्यकता यह है कि कोई भी prompt आपके सर्वर से बाहर न जाए, तो एक open weight model चलाएं। आज के समय में रेंटेड सर्वर पर उपयोग करने योग्य मॉडल परिवार Llama, Qwen, Mistral, Gemma और DeepSeek हैं। ये सभी ऐसे weights प्रकाशित करते हैं जिन्हें आप डाउनलोड करके चला सकते हैं।

Ollama इसे शुरू करने का सबसे तेज़ तरीका है। इसका install script केवल एक लाइन का है और यह Ubuntu पर एक systemd service सेटअप कर देता है।

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama को active (running) प्रिंट करना चाहिए। इसके बाद एक मॉडल pull करें और उससे बात करें।

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

पहला pull कई gigabytes डेटा डाउनलोड करता है, इसलिए किसी भी प्रश्न का उत्तर देने से पहले मॉडल का RAM या GPU memory में फिट होना आवश्यक है। Quantised models के लिए एक सामान्य नियम यह है: 8 billion parameter वाले मॉडल को लगभग 6 GB खाली जगह चाहिए, 14 billion parameter वाले मॉडल को लगभग 10 GB, और 70 billion parameter वाले मॉडल को अधिकांश general purpose VPS plans की तुलना में अधिक memory की आवश्यकता होती है। यदि सर्वर में memory कम है, तो process को kernel द्वारा kill कर दिया जाता है और आपको Error: llama runner process has terminated दिखाई देगा, साथ ही dmesg में out of memory की लाइन दिखेगी। मॉडल को दोष देने से पहले free -h की जाँच करें। यही memory बजट यह भी तय करता है कि मॉडल एक लंबे prompt का कितना हिस्सा वास्तव में पढ़ता है, क्योंकि Ollama चुपचाप एक सामान्य default window के बाद के हिस्से को truncate कर देता है। इसलिए जब लंबे दस्तावेज़ आधे-अधूरे summarize होकर आएं, तो सबसे पहले num_ctx को बढ़ाना और KV cache का आकार तय करना चेक करें।

Ollama 127.0.0.1:11434 पर एक HTTP API भी serve करता है, जो इसे केवल एक chat toy के बजाय अन्य software के लिए उपयोगी बनाता है।

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

यदि शांत रहने के बाद पहली request में तीस सेकंड लगते हैं जबकि अगली request तुरंत आ जाती है, तो कुछ भी खराब नहीं है: Ollama पांच मिनट के idle समय के बाद मॉडल को unload कर देता है, और keep_alive के साथ इसे resident रखना उस reload penalty को हटा देता है।

उस port को localhost पर ही bound रहने दें। public IP पर खुला Ollama port उसे खोजने वाले किसी भी व्यक्ति के लिए एक मुफ्त GPU है। systemd unit, GPU detection और सामने एक reverse proxy लगाने सहित पूरा build, VPS पर Ollama चलाने की गाइड में कवर किया गया है। यदि आप एक समय में एक से अधिक user को serve कर रहे हैं, तो पहले Ollama और vLLM की तुलना पढ़ें, क्योंकि Ollama का single stream डिज़ाइन hardware की क्षमता से काफी पहले ही bottleneck बन जाता है।

अंतर के बारे में ईमानदार रहें। एक mid-sized VPS पर एक अच्छा open model summarising, classifying, drafting और simple extraction के लिए वास्तव में उपयोगी है। लंबी multi-step reasoning, बड़े codebases और agentic tool use पर यह frontier hosted models के करीब नहीं है, और prompt tuning से यह अंतर खत्म नहीं होता। local model को उस काम के लिए चुनें जिसमें वह अच्छा है, और जहाँ कठिनाई वास्तविक हो, वहाँ hosted model के लिए भुगतान करें।

LiteLLM के साथ अपना स्वयं का गेटवे चलाएं

यह वही "self-hosted OpenRouter" है जिसे लोग खोज रहे हैं। एक गेटवे आपके ऐप्लिकेशंस और प्रत्येक मॉडल प्रदाता के बीच स्थित होता है। आपके ऐप्स के पास केवल एक की (key) होती है, जो आपके सर्वर की ओर पॉइंट करती है। वास्तविक प्रदाता कीज़ केवल उस सर्वर पर रहती हैं। आप प्रति की खर्च की सीमा तय कर सकते हैं, अलग-अलग ऐप्स को अलग-अलग मॉडल्स पर रूट कर सकते हैं, और प्रत्येक रिक्वेस्ट को एक ही स्थान पर लॉग कर सकते हैं।

LiteLLM एक सामान्य विकल्प है क्योंकि यह OpenAI के साथ संगत API का उपयोग करता है और Anthropic, Ollama, तथा अधिकांश अन्य प्रदाताओं के लिए उसी एंडपॉइंट के पीछे प्रॉक्सी का काम करता है। इसे एक कॉन्फ़िगरेशन फ़ाइल के साथ Docker में चलाएं।

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

इसे litellm_config.yaml के रूप में सेव करें और प्रॉक्सी को स्टार्ट करें। यह पोर्ट 4000 पर लिसन करता है।

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY एडमिन क्रेडेंशियल है, इसलिए इसे root पासवर्ड की तरह संभालें और उदाहरण में दी गई वैल्यू को कभी भी शिप न करें। प्रॉक्सी को बिल्कुल वैसे ही कॉल करें जैसे आप किसी होस्टेड API को कॉल करते हैं।

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

एक सफल रिस्पॉन्स choices ऐरे के साथ सामान्य JSON होता है। 401 का अर्थ है कि Authorization हेडर आपकी मास्टर की से मेल नहीं खाता है। मॉडल का नाम बताने वाला 400 का अर्थ है कि आपकी रिक्वेस्ट में दिया गया model कॉन्फ़िगरेशन फ़ाइल में किसी भी model_name से मेल नहीं खाता है।

Anthropic को सीधे कॉल करने के बजाय इसे बनाने का कारण खर्च की सीमा (spend cap) है। प्रत्येक ऐप्लिकेशन के लिए एक अलग वर्चुअल की जारी करें, जिसका अपना बजट हो।

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

वह की केवल एक सौ डॉलर खर्च कर सकती है और केवल एक मॉडल तक पहुंच सकती है, और कुछ नहीं। जब कोई एजेंट सुबह तीन बजे गलत व्यवहार करता है, तो उसका प्रभाव आपके पूरे अकाउंट के बजाय केवल एक की तक सीमित रहता है। वह पैटर्न, और उसके आसपास की मॉनिटरिंग, VPS पर एजेंट की लागत को नियंत्रित रखने का विषय है। यदि आप अभी भी यह तय कर रहे हैं कि प्रति टोकन भुगतान करना है या नहीं, तो API बनाम सब्सक्रिप्शन लागत तुलना गणना को समझने में मदद करती है।

ध्यान दें कि गेटवे क्या नहीं करता है। यह Claude को लोकल नहीं बनाता है, और यह Anthropic से आपके प्रॉम्प्ट्स को छिपाता नहीं है। रिक्वेस्ट्स अभी भी प्रदाता के पास जाने के लिए आपके सर्वर से बाहर जाती हैं। जो आप हासिल करते हैं वह कीज़, खर्च, रूटिंग और लॉग्स पर नियंत्रण है।

अपने VPS पर Claude Code चलाएं

तीसरी इच्छा पूरी करना सबसे आसान है। Claude Code एक क्लाइंट है। यह वहां चलता है जहाँ आप Node.js इंस्टॉल करते हैं, और यह HTTPS के माध्यम से API से बात करता है। इसे अपने सर्वर पर रखने का मतलब है कि आपके लैपटॉप को बंद करने के बाद भी एजेंट काम करता रहता है, और इसका मतलब है कि एजेंट का प्रभाव क्षेत्र (blast radius) एक ऐसा बॉक्स है जिसे आप अपनी मुख्य मशीन के बजाय फिर से बना सकते हैं।

npm install -g @anthropic-ai/claude-code
claude --version

इसे tmux के अंदर चलाएं ताकि SSH कनेक्शन टूटने पर कोई लंबा काम बंद न हो। उस सेटअप को, जिसमें सेशन हैंडलिंग भी शामिल है, VPS पर tmux के साथ Claude Code चलाने के लेख में कवर किया गया है। एजेंट को अपना एक unprivileged user दें, और किसी भी महत्वपूर्ण चीज़ का write access देने से पहले सर्वर पर Claude Code चलाने के सुरक्षा नियमों को पढ़ें।

यह एजेंट की सेल्फ-होस्टिंग है, मॉडल की नहीं। इस बारे में सटीक होना महत्वपूर्ण है, क्योंकि लोग अक्सर इन दोनों को एक ही समझ लेते हैं। आप प्रोसेस, फाइलसिस्टम, नेटवर्क इग्रेस और लॉग्स के मालिक हैं। Anthropic अभी भी इन्फरेंस (inference) का मालिक है।

प्रत्येक विकल्प की वास्तविक लागत

कीमतें बदलती रहती हैं, इसलिए इन्हें सटीक कोटेशन के बजाय एक अनुमान के रूप में देखें। जुलाई 2026 तक, Claude Sonnet 5 की कीमत प्रति दस लाख input tokens पर $3 और प्रति दस लाख output tokens पर $15 है, जबकि Claude Opus 5 की कीमत क्रमशः $5 और $25 है। एक local model के लिए प्रति token कोई शुल्क नहीं लगता, इसके बजाय इसकी लागत उस सर्वर के मासिक खर्च के बराबर होती है, जो आपके उपयोग करने या न करने पर भी चलता रहता है।

Break even point लोगों की अपेक्षा से कम होता है। एक उपयोगी open model चलाने के लिए पर्याप्त memory वाला VPS हर महीने वास्तविक खर्च मांगता है, और यह अधिकांश समय खाली बैठा रहता है। यदि आपका उपयोग रुक-रुक कर (bursty) होता है, तो hosted API आमतौर पर सस्ता पड़ता है। यदि आपका उपयोग निरंतर है, या यदि आपका डेटा आपके नेटवर्क से बाहर नहीं जा सकता है, तो local model दोनों ही मामलों में बेहतर है।

ईमानदार और मिश्रित उत्तर वही है जिसे अधिकांश टीमें अपनाती हैं। अधिक मात्रा वाले और कम कठिन कार्यों के लिए स्थानीय स्तर पर open model चलाएं। कठिन requests को hosted frontier model पर भेजें। दोनों के सामने एक gateway रखें ताकि applications को यह जानने की आवश्यकता न हो कि कौन सा model उपयोग हो रहा है, और आप application code को छुए बिना उनके बीच के विभाजन को बदल सकें। वह architecture "self hosted Claude" का व्यावहारिक संस्करण है, और शाब्दिक संस्करण के विपरीत, यह वास्तव में मौजूद है। यदि आप पूरे agent stack को भी स्वयं चलाना चाहते हैं, तो self-hosted AI agents का संग्रह उपलब्ध विकल्पों के बारे में जानकारी देता है।

FAQ

क्या मैं Claude के model weights डाउनलोड करके उन्हें स्थानीय रूप से चला सकता हूँ?

नहीं। Anthropic ने कभी भी किसी Claude model के weights जारी नहीं किए हैं, और ऐसा कोई लाइसेंस नहीं है जो self-hosting की अनुमति देता हो। ऑनलाइन डाउनलोड करने योग्य "Claude model" के रूप में विज्ञापित कोई भी चीज़ या तो भ्रामक नाम वाला कोई अन्य मॉडल है या फिर एक ऐसा wrapper है जो API को कॉल करता है। यदि इसे API key की आवश्यकता है, तो यह local नहीं है।

Claude के सबसे करीब का open model कौन सा है?

इसका कोई सटीक विकल्प नहीं है, और अग्रणी मॉडल हर कुछ महीनों में बदलते रहते हैं। Llama, Qwen, Mistral, Gemma और DeepSeek ऐसे open weight परिवार हैं जिन्हें आज़माना सार्थक है। summarising, classification और साधारण code edits के लिए 8 से 14 billion parameters वाला एक अच्छा open model वास्तव में उपयोगी है। लंबी multi-step reasoning और agentic tool use के मामले में, hosted frontier model और open model के बीच का अंतर अभी भी काफी बड़ा है। लीडरबोर्ड पर भरोसा करने के बजाय अपने स्वयं के prompts पर परीक्षण करें।

क्या LiteLLM एक self-hosted OpenRouter है?

routing और key management के हिस्से के लिए, कार्यात्मक रूप से हाँ। LiteLLM आपके सर्वर पर चलता है, एक OpenAI-compatible endpoint प्रस्तुत करता है, और Anthropic, Ollama तथा अधिकांश अन्य प्रदाताओं के लिए proxy के रूप में कार्य करता है। आपको प्रति key spend caps, model routing और logs पढ़ने के लिए एक केंद्रीय स्थान मिलता है। यह आपको local inference की सुविधा नहीं देता है: Claude के लिए किए गए अनुरोध अभी भी Anthropic तक जाते हैं।

क्या अपने सर्वर पर Claude Code चलाने से मेरा कोड निजी रहता है?

नहीं। Claude Code जिन फ़ाइलों को पढ़ता है, उनकी सामग्री को Anthropic API पर भेजता है, चाहे यह प्रक्रिया कहीं भी चल रही हो। VPS आपको agent का isolation तो देता है, लेकिन सामग्री की गोपनीयता नहीं। इसे एक समर्पित unprivileged user दें, इसे credentials और असंबंधित repositories से दूर रखें, और यह जिस भी चीज़ को पढ़ सकता है, उसे ऐसी सामग्री मानें जो सर्वर से बाहर जाती है।