क्या Claude को self-host कर सकते हैं? सच्चाई जानें
Claude के weights public नहीं हैं, इसलिए कोई server इसे चला नहीं सकता। जानें कि आप open models, gateway और Claude Code में से क्या self-host कर सकते हैं।
क्या आप Claude को self-host कर सकते हैं? नहीं, और इसका कारण यह है
आप Claude को self-host नहीं कर सकते। Anthropic मॉडल के weights प्रकाशित नहीं करता। इसलिए डाउनलोड करने के लिए कोई फ़ाइल, चलाने के लिए कोई container, और अपने hardware से इसे serve करने की अनुमति देने वाला कोई licence उपलब्ध नहीं है। Claude की हर request Anthropic के API या Amazon Bedrock, Google Vertex AI, अथवा Microsoft Foundry जैसे hosted partner के पास जाती है। अपने स्वामित्व वाली machine पर इसे चलाना configuration की समस्या नहीं है। यह artefact Anthropic के बाहर मौजूद ही नहीं है।
यह संक्षिप्त उत्तर है। विस्तृत उत्तर यह है कि यह प्रश्न पूछने वाले अधिकांश लोग वास्तव में weights नहीं चाहते। वे ऐसी तीन चीज़ों में से एक चाहते हैं, जिन्हें आपके नियंत्रण वाले server पर चलाना संभव है: locally चलने वाला सक्षम model, ऐसा gateway जो उनकी API keys सुरक्षित रखे और उनके खर्च की सीमा तय करे, या ऐसा coding agent जो उनके laptop के बजाय उनके अपने box पर चलता हो। यह guide इन तीनों को commands सहित समझाती है।
"self-hosted Claude" का आमतौर पर क्या अर्थ है
"self hosted Claude" के लिए होने वाली खोजें कुछ अलग-अलग जरूरतों को दर्शाती हैं। इनके उत्तर भी अलग होते हैं।
कुछ लोग गोपनीयता चाहते हैं। वे नहीं चाहते कि prompts उनके network से बाहर जाएं। इसे केवल local open weight model हल करता है, क्योंकि Claude का हर request परिभाषा के अनुसार Anthropic को भेजा गया request होता है।
कुछ लोग लागत पर नियंत्रण चाहते हैं। उन्हें चिंता होती है कि कोई runaway agent बहुत अधिक credits खर्च कर सकता है। Gateway इस समस्या को हल करता है। यह Claude के साथ काम करता है, इसलिए आप model की गुणवत्ता बनाए रखते हैं।
कुछ लोग laptop से स्वतंत्रता चाहते हैं। वे ऐसा agent चाहते हैं जो lid बंद करने के बाद भी काम करता रहे। VPS इस समस्या को हल करता है, और Claude Code उस पर आसानी से चलता है।
कुछ लोग "self hosted OpenRouter" चाहते हैं। यह भी एक gateway है, और इसका सामान्य उत्तर LiteLLM है।
पहले तय करें कि आपकी जरूरत इनमें से कौन-सी है, क्योंकि हर स्थिति में सही build अलग होता है।
Ollama के साथ एक open model को स्वयं होस्ट करें
यदि आवश्यकता यह है कि कोई भी prompt आपके server से बाहर न जाए, तो एक open weight model चलाएँ। आज rented server पर वास्तव में उपयोग किए जा सकने वाले परिवार Llama, Qwen, Mistral, Gemma और DeepSeek हैं। ये सभी ऐसे weights प्रकाशित करते हैं जिन्हें आप download करके चला सकते हैं।
Ollama शुरू करने का सबसे तेज़ तरीका है। इसका install script एक ही line का है और यह Ubuntu पर systemd service सेट करता है।
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama को active (running) दिखाना चाहिए। इसके बाद एक model pull करें और उससे बात करें।
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."पहला pull कई gigabytes download करता है, इसलिए उत्तर देने से पहले model का RAM या GPU memory में समाना आवश्यक है। Quantised models के लिए एक मोटा नियम यह है: 8 billion parameters वाले model को लगभग 6 GB free memory चाहिए, 14 billion parameters वाले model को लगभग 10 GB चाहिए, और 70 billion parameters वाले model को अधिकांश general purpose VPS plans की उपलब्ध memory से अधिक memory चाहिए। यदि box में memory कम है, तो kernel process को समाप्त कर देता है और आपको Error: llama runner process has terminated दिखाई देता है। साथ ही dmesg में out of memory वाली line होती है। Model को दोष देने से पहले free -h जाँचें।
Ollama 127.0.0.1:11434 पर HTTP API भी उपलब्ध कराता है। इसी कारण यह केवल chat toy न रहकर अन्य software के लिए उपयोगी बनता है।
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'उस port को localhost से bound रखें। Public IP पर खुला Ollama port उसे खोजने वाले किसी भी व्यक्ति के लिए मुफ्त GPU उपलब्ध करा देता है। पूरा build, जिसमें systemd unit, GPU detection और सामने reverse proxy लगाना शामिल है, VPS पर Ollama चलाने की guide में दिया गया है। यदि आप एक समय में एक से अधिक users को service दे रहे हैं, तो पहले Ollama और vLLM की तुलना पढ़ें, क्योंकि hardware की सीमा आने से काफी पहले Ollama का single stream design bottleneck बन जाता है।
इस अंतर के बारे में ईमानदार रहें। Mid sized VPS पर एक अच्छा open model summarising, classifying, drafting और simple extraction के लिए वास्तव में उपयोगी है। लंबे multi step reasoning, बड़े codebases और agentic tool use में यह frontier hosted model के करीब नहीं है, और prompt tuning की कोई भी मात्रा इस अंतर को समाप्त नहीं करती। Local model को उस काम के लिए चुनें जिसमें वह अच्छा है, और जहाँ कठिनाई वास्तविक हो वहाँ hosted model के लिए भुगतान करें।
LiteLLM के साथ अपना gateway चलाएँ
इसे लोग "self hosted OpenRouter" के रूप में खोजते हैं। एक gateway आपके applications और हर model provider के बीच काम करता है। आपके apps में एक key होती है, जो आपके server पर भेजी जाती है। वास्तविक provider keys केवल उसी server पर रहती हैं। आप प्रत्येक key के लिए spend limit तय कर सकते हैं, अलग-अलग apps को अलग models पर route कर सकते हैं, और हर request को एक ही स्थान पर log कर सकते हैं।
LiteLLM आम विकल्प है, क्योंकि यह OpenAI compatible API प्रदान करता है और Anthropic, Ollama तथा अधिकांश अन्य providers के लिए उसी endpoint के पीछे proxy का काम करता है। इसे config file के साथ Docker में चलाएँ।
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434इसे litellm_config.yaml के रूप में save करें और proxy शुरू करें। यह port 4000 पर listen करता है।
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY admin credential है। इसलिए इसे root password की तरह सुरक्षित रखें और example value को production में deploy न करें। Proxy को ठीक उसी तरह call करें, जैसे आप hosted API को call करते हैं।
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'सफल response में choices array वाला सामान्य JSON होता है। 401 का अर्थ है कि Authorization header आपकी master key से match नहीं करता। किसी model का नाम बताने वाले 400 का अर्थ है कि आपकी request में मौजूद model config file के किसी model_name से match नहीं करता।
Anthropic को सीधे call करने के बजाय इसे बनाने का मुख्य कारण spend cap है। प्रत्येक application के लिए अलग virtual key बनाएँ और हर key का अपना budget रखें।
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'वह key एक model तक पहुँच सकती है और अधिकतम one hundred dollars खर्च कर सकती है। इसके अलावा वह कुछ नहीं कर सकती। जब कोई agent सुबह तीन बजे गलत तरीके से काम करे, तो उसका प्रभाव आपके पूरे account के बजाय केवल एक key तक सीमित रहता है। यह pattern और इसके साथ की monitoring VPS पर agent की लागत को नियंत्रण में रखना का विषय है। यदि आप अभी भी यह तय कर रहे हैं कि token के अनुसार भुगतान करना है या नहीं, तो API और subscription की लागत की तुलना में इसका arithmetic समझाया गया है।
ध्यान दें कि gateway क्या नहीं करता। यह Claude को local नहीं बनाता और आपके prompts को Anthropic से छिपाता नहीं है। Requests अभी भी provider के लिए आपके server से बाहर जाती हैं। आपको keys, spend, routing और logs पर नियंत्रण मिलता है।
अपने VPS पर Claude Code चलाएँ
तीसरी इच्छा पूरी करना सबसे आसान है। Claude Code एक client है। यह वहाँ चलता है जहाँ आप Node.js install करते हैं, और HTTPS के माध्यम से API से संचार करता है। इसे अपने स्वामित्व वाले server पर चलाने से agent आपके laptop को बंद करने के बाद भी काम करता रहता है। इससे agent का प्रभाव-क्षेत्र आपके मुख्य machine के बजाय ऐसे box तक सीमित रहता है जिसे आप दोबारा बना सकते हैं।
npm install -g @anthropic-ai/claude-code
claude --versionइसे tmux के अंदर चलाएँ, ताकि SSH connection टूटने पर लंबा job बंद न हो। यह setup, जिसमें session handling भी शामिल है, tmux के साथ VPS पर Claude Code चलाना में बताया गया है। Agent के लिए अपना unprivileged user बनाएँ। किसी ऐसी चीज़ पर write access देने से पहले, जिसकी आपको आवश्यकता है, server पर Claude Code चलाने के सुरक्षा नियम पढ़ें।
यह agent की self-hosting है, model की नहीं। इस अंतर को स्पष्ट रखना आवश्यक है, क्योंकि लोग अक्सर दोनों को एक ही समझ लेते हैं। Process, filesystem, network egress और logs आपके नियंत्रण में होते हैं। Inference का स्वामित्व अब भी Anthropic के पास रहता है।
हर विकल्प की वास्तविक लागत
कीमतें बदलती रहती हैं, इसलिए इन्हें निश्चित quote के बजाय एक अनुमानित ढांचे के रूप में देखें। July 2026 तक, Claude Sonnet 5 की कीमत प्रति million input tokens $3 और प्रति million output tokens $15 है। Claude Opus 5 की कीमत क्रमशः $5 और $25 है। Local model प्रति token कोई शुल्क नहीं लेता। इसके बजाय, इसकी लागत server की मासिक कीमत के बराबर होती है, चाहे आप उसका उपयोग करें या नहीं।
लागत बराबर होने का बिंदु लोगों की अपेक्षा से कम होता है। उपयोगी open model चलाने के लिए पर्याप्त memory वाले VPS की हर महीने वास्तविक लागत होती है। वह अधिकांश समय idle रहता है। यदि आपका उपयोग असमान है, तो hosted API आमतौर पर सस्ता होता है। यदि आपका उपयोग लगातार रहता है, या आपका data network से बाहर नहीं जा सकता, तो local model दोनों मामलों में बेहतर होता है।
अधिकांश teams जिस व्यावहारिक निष्कर्ष पर पहुंचती हैं, वह एक मिश्रित व्यवस्था है। High volume और कम कठिनाई वाले काम के लिए open model को locally चलाएं। कठिन requests को hosted frontier model पर भेजें। दोनों के सामने एक gateway रखें, ताकि applications को यह जानने की आवश्यकता न हो कि कौन-सा model उपयोग हो रहा है। इससे application code बदले बिना दोनों के बीच कार्य-विभाजन बदला जा सकता है। यही "self hosted Claude" का व्यावहारिक रूप है। शाब्दिक रूप मौजूद नहीं है, लेकिन यह architecture मौजूद है। यदि आप पूरा agent stack भी स्वयं चलाना चाहते हैं, तो self-hosted AI agents का सारांश उपलब्ध विकल्पों को समझाता है।
FAQ
क्या मैं Claude के model weights download करके उन्हें स्थानीय रूप से चला सकता हूँ?
नहीं। Anthropic ने किसी भी Claude model के weights कभी release नहीं किए हैं, और self hosting की अनुमति देने वाला कोई licence नहीं है। ऑनलाइन downloadable "Claude model" के रूप में विज्ञापित कोई भी चीज़ या तो भ्रामक नाम वाला कोई अलग model है या API को call करने वाला wrapper है। यदि उसे API key की आवश्यकता है, तो वह local नहीं है।
Claude के सबसे निकट कौन-सा open model है?
इसका कोई exact match नहीं है, और हर कुछ महीनों में अग्रणी models बदल जाते हैं। जिन open weight families को test करना उपयोगी है, वे Llama, Qwen, Mistral, Gemma और DeepSeek हैं। summarising, classification और simple code edits में 8 से 14 billion parameters वाला अच्छा open model वास्तव में उपयोगी होता है। long multi step reasoning और agentic tool use में hosted frontier model की तुलना में अंतर अभी भी बड़ा है। leaderboard पर भरोसा करने के बजाय अपने prompts पर test करें।
क्या LiteLLM self-hosted OpenRouter है?
Routing और key management के संदर्भ में, कार्यात्मक रूप से हाँ। LiteLLM आपके server पर चलता है, एक OpenAI compatible endpoint उपलब्ध कराता है और Anthropic, Ollama तथा अधिकांश अन्य providers को proxy करता है। आपको per key spend caps, model routing और logs पढ़ने के लिए एक केंद्रीकृत स्थान मिलता है। लेकिन यह local inference उपलब्ध नहीं कराता: Claude को भेजे गए requests अभी भी Anthropic तक जाते हैं।
क्या अपने server पर Claude Code चलाने से मेरा code private रहता है?
नहीं। Claude Code जिन files को पढ़ता है, उनकी contents Anthropic API को भेजता है, चाहे process कहीं भी चल रहा हो। VPS आपको agent का isolation देता है, content की privacy नहीं। इसके लिए एक dedicated unprivileged user दें, उसे credentials और असंबंधित repositories से दूर रखें, और उसकी पहुँच में आने वाली हर चीज़ को ऐसा content मानें जो server से बाहर जाता है।