SSD Nodes Learn 8GB RAM — సంవత్సరానికి $66
మార్గదర్శకాలు Matt Connorద్వారా Matt Connor · అప్‌డేట్ చేయబడింది 2026-08-01

Claude ను self-host చేయగలరా? నిజమైన సమాధానం

Claude weights ను Anthropic బహిరంగంగా విడుదల చేయదు. అందుకే మీ serverలో Claude నడపలేరు. బదులుగా open models, gateway లేదా Claude Codeను self-host చేయవచ్చు.

Claude ను స్వయంగా హోస్ట్ చేయగలరా? లేదు, కారణం ఇదే

మీరు Claude ను స్వయంగా హోస్ట్ చేయలేరు. Anthropic మోడల్ weights ను ప్రచురించదు. అందువల్ల డౌన్‌లోడ్ చేయడానికి file, నడపడానికి container, లేదా మీ స్వంత hardware నుంచి దాన్ని serve చేయడానికి అనుమతించే licence ఏదీ లేదు. ప్రతి Claude అభ్యర్థన Anthropic's APIకి లేదా Amazon Bedrock, Google Vertex AI, Microsoft Foundry వంటి hosted partnerకి వెళ్తుంది. మీ సొంత machineలో దాన్ని నడపడం configuration సమస్య కాదు. ఆ artefact Anthropic వెలుపల అసలు అందుబాటులో లేదు.

ఇది సంక్షిప్త సమాధానం. విస్తృత సమాధానం ఏమిటంటే, ఈ ప్రశ్న అడిగే చాలా మందికి నిజంగా model weights అవసరం ఉండదు. వారు మీ నియంత్రణలో ఉన్న serverపై సాధించగలిగే మూడు విషయాల్లో ఒకదాన్ని కోరుకుంటారు: స్థానికంగా నడిచే సామర్థ్యవంతమైన model, వారి API keysను భద్రపరచి ఖర్చుకు పరిమితి విధించే gateway, లేదా laptopకు బదులుగా వారి స్వంత boxలో నడిచే coding agent. ఈ guide ఈ మూడింటినీ commandsతో వివరిస్తుంది.

“self-hosted Claude” అంటే సాధారణంగా ఏమిటి

“self hosted Claude” కోసం జరిగే శోధనలు కొన్ని భిన్నమైన అవసరాలను సూచిస్తాయి. వాటికి వేర్వేరు పరిష్కారాలు అవసరం.

కొంతమందికి గోప్యత కావాలి. తమ నెట్‌వర్క్‌ను prompts విడిచిపెట్టకూడదని వారు కోరుకుంటారు. దీనికి స్థానిక open weight model మాత్రమే పరిష్కారం. Claude చేసే ప్రతి request నిర్వచనం ప్రకారం Anthropic‌కు పంపే request అవుతుంది.

కొంతమందికి ఖర్చుపై నియంత్రణ కావాలి. నియంత్రణ తప్పిన agent credits‌ను వేగంగా ఖర్చు చేస్తుందేమోనని వారు ఆందోళన చెందుతారు. gateway దీనికి పరిష్కారం. ఇది Claude‌తో పనిచేస్తుంది కాబట్టి model నాణ్యతను అలాగే ఉంచవచ్చు.

కొంతమందికి laptop‌పై ఆధారపడకూడదు. మూత మూసిన తర్వాత కూడా agent పనిచేస్తూ ఉండాలని వారు కోరుకుంటారు. దీనికి VPS పరిష్కారం. Claude Code దానిపై సులభంగా పనిచేస్తుంది.

కొంతమందికి “self hosted OpenRouter” అనే నిర్మాణం కావాలి. అదీ gateway‌నే. దీనికి సాధారణంగా LiteLLM‌ను ఉపయోగిస్తారు.

మీ అవసరం ఏదో ముందుగా నిర్ధారించుకోండి. ప్రతి సందర్భంలో సరైన నిర్మాణం వేర్వేరుగా ఉంటుంది.

Ollamaతో ఓపెన్ మోడల్‌ను స్వయంగా హోస్ట్ చేయండి

ఏ prompt కూడా మీ server‌ను విడిచిపెట్టకూడదనేది అవసరమైతే, open weight model‌ను అమలు చేయండి. ప్రస్తుతం అద్దెకు తీసుకున్న server‌లో వాస్తవంగా ఉపయోగించగల model కుటుంబాలు Llama, Qwen, Mistral, Gemma, మరియు DeepSeek. ఇవన్నీ మీరు download చేసి అమలు చేయగల weights‌ను విడుదల చేస్తాయి.

Ollama ప్రారంభించడానికి వేగవంతమైన మార్గం. Install script ఒకే పంక్తిలో ఉంటుంది. ఇది Ubuntuలో systemd service‌ను కూడా ఏర్పాటు చేస్తుంది.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama, active (running)ను ముద్రించాలి. తర్వాత ఒక model‌ను pull చేసి, దానితో మాట్లాడండి.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

మొదటి pullలో అనేక gigabytes download అవుతాయి. అందువల్ల model ఏదైనా సమాధానం ఇవ్వడానికి ముందు అది RAMలో లేదా GPU memoryలో సరిపోవాలి. Quantised models కోసం ఒక సుమారు నియమం: 8 billion parameters ఉన్న model‌కు సుమారు 6 GB ఖాళీ memory అవసరం, 14 billion parameters ఉన్న model‌కు సుమారు 10 GB అవసరం, 70 billion parameters ఉన్న model‌కు చాలా సాధారణ VPS plansలో లభించే memory కంటే ఎక్కువ అవసరం. Server‌లో memory తక్కువగా ఉంటే kernel process‌ను terminate చేస్తుంది. అప్పుడు Error: llama runner process has terminated కనిపిస్తుంది, అలాగే dmesgలో out of memory పంక్తి కనిపిస్తుంది. Model‌ను తప్పుపట్టే ముందు free -hను తనిఖీ చేయండి.

Ollama 127.0.0.1:11434లో HTTP APIను కూడా అందిస్తుంది. అందువల్ల ఇది కేవలం chat toy కాకుండా ఇతర softwareకు కూడా ఉపయోగపడుతుంది.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

ఆ port‌ను localhostకు మాత్రమే bind చేసి ఉంచండి. Public IPపై open Ollama port ఉంటే, దాన్ని కనుగొన్న ఎవరికైనా ఉచిత GPU లభించినట్లే. systemd unit, GPU detection, మరియు ముందు reverse proxy ఏర్పాటు చేయడం సహా పూర్తి setup VPSలో Ollamaను అమలు చేసే guideలో ఉంది. ఒకేసారి ఒకరి కంటే ఎక్కువ usersకు service అందిస్తే, ముందుగా Ollama మరియు vLLM పోలికను చదవండి. Hardware పరిమితికి చాలా ముందే Ollama యొక్క single stream design bottleneckగా మారుతుంది.

ఈ వ్యత్యాసాన్ని నిజాయితీగా అంచనా వేయండి. Mid sized VPSలో మంచి open model summarising, classifying, drafting, మరియు simple extraction పనులకు నిజంగా ఉపయోగకరంగా ఉంటుంది. దీర్ఘమైన multi step reasoning, పెద్ద codebases, మరియు agentic tool use విషయంలో ఇది frontier hosted modelకు దగ్గరగా కూడా ఉండదు. ఎంత prompt tuning చేసినా ఆ వ్యత్యాసం తొలగదు. Local model బాగా చేయగల పనులకు దానిని ఎంచుకోండి. పని నిజంగా క్లిష్టంగా ఉన్నప్పుడు hosted model కోసం చెల్లించండి.

LiteLLMతో మీ స్వంత gateway నడపండి

ప్రజలు వెతుకుతున్న "self hosted OpenRouter" ఇదే. gateway మీ applications మరియు ప్రతి model provider మధ్య పనిచేస్తుంది. మీ apps ఒకే keyను కలిగి ఉంటాయి. ఆ key మీ serverను సూచిస్తుంది. అసలు provider keys ఆ serverలో మాత్రమే ఉంటాయి. ప్రతి keyకి ఖర్చు పరిమితిని నిర్ణయించవచ్చు, వేర్వేరు appsను వేర్వేరు modelsకు route చేయవచ్చు, అలాగే ప్రతి requestను ఒకే చోట log చేయవచ్చు.

LiteLLM సాధారణంగా ఎంచుకునే పరిష్కారం. ఇది OpenAI compatible APIని అందిస్తుంది. అదే endpoint వెనుక Anthropic, Ollama మరియు చాలా ఇతర providersకు proxyగా పనిచేస్తుంది. దీన్ని config fileతో Dockerలో నడపండి.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

దాన్ని litellm_config.yamlగా save చేసి proxyని ప్రారంభించండి. ఇది port 4000పై listening చేస్తుంది.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY admin credential. కాబట్టి దాన్ని root passwordలాగా భద్రపరచండి. ఉదాహరణ విలువను ఉపయోగించవద్దు. Hosted APIని పిలిచినట్లే proxyని పిలవండి.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

సరిగ్గా పనిచేస్తున్న response సాధారణ JSONగా ఉంటుంది. అందులో choices array ఉంటుంది. 401 అంటే Authorization header మీ master keyతో సరిపోలడం లేదని అర్థం. Model పేరును సూచించే 400 అంటే మీ requestలోని model config fileలోని ఏ model_nameతోనూ సరిపోలడం లేదని అర్థం.

Anthropicను నేరుగా పిలవడానికి బదులుగా దీన్ని నిర్మించడానికి కారణం spend cap. ప్రతి applicationకు ప్రత్యేక virtual keyని జారీ చేయండి. ప్రతి keyకి స్వంత budget ఉండాలి.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

ఆ key one hundred dollars వరకు ఖర్చు చేయగలదు. అది ఒక modelను మాత్రమే చేరుకోగలదు. మరే ఇతరదీ చేయలేడు. Agent తెల్లవారుజామున మూడు గంటలకు తప్పుగా పనిచేసినప్పుడు, ప్రభావ పరిధి మీ మొత్తం accountకు కాకుండా ఒక keyకు మాత్రమే పరిమితమవుతుంది. ఈ విధానం, దానికి సంబంధించిన monitoringతో కలిసి, VPSలో agent ఖర్చులను నియంత్రణలో ఉంచడం అనే అంశంలో వివరించబడింది. అసలు tokenకు చెల్లించాలా వద్దా అని ఇంకా నిర్ణయించుకుంటుంటే, API మరియు subscription ఖర్చుల పోలిక గణనను వివరిస్తుంది.

Gateway చేయనిది ఏమిటో గమనించండి. ఇది Claudeను localగా మార్చదు. మీ promptsను Anthropic నుంచి దాచదు. Requests ఇప్పటికీ మీ server నుంచి providerకు వెళ్తాయి. మీకు లభించేది keys, spend, routing మరియు logsపై నియంత్రణ.

మీ స్వంత VPSలో Claude Code అమలు చేయండి

మూడవ కోరికను నెరవేర్చడం అత్యంత సులభం. Claude Code ఒక client. మీరు Node.js install చేసిన ఎక్కడైనా ఇది అమలవుతుంది. ఇది HTTPS ద్వారా APIతో కమ్యూనికేట్ చేస్తుంది. మీ స్వంత serverలో దీన్ని ఉంచితే, మీరు laptopను ఆపివేసిన తర్వాత కూడా agent పని కొనసాగిస్తుంది. అలాగే agent వల్ల కలిగే ప్రభావ పరిధి మీ ప్రధాన machineకు బదులుగా మళ్లీ నిర్మించగల ఒక boxకే పరిమితమవుతుంది.

npm install -g @anthropic-ai/claude-code
claude --version

దీన్ని tmux లో అమలు చేయండి. అప్పుడు SSH connection తెగిపోయినా ఎక్కువసేపు నడిచే job ఆగదు. session handlingతో సహా ఆ setup గురించి tmuxతో VPSలో Claude Code అమలు చేయడంలో వివరించబడింది. agent కోసం ప్రత్యేక unprivileged userను సృష్టించండి. మీరు ముఖ్యమైన ఏదైనా వనరుపై దానికి write access ఇచ్చే ముందు serverలో Claude Code అమలుకు భద్రతా నియమాలు చదవండి.

ఇది agentను self-hosting చేయడం, modelను కాదు. ఈ తేడాను స్పష్టంగా గుర్తించడం ముఖ్యం, ఎందుకంటే చాలామంది ఈ రెండింటినీ కలిపి భావిస్తారు. process, filesystem, network egress, logs మీ ఆధీనంలో ఉంటాయి. inferenceపై మాత్రం Anthropicకే నియంత్రణ ఉంటుంది.

ప్రతి ఎంపికకు వాస్తవ ఖర్చు

ధరలు మారుతుంటాయి. కాబట్టి వీటిని ఖచ్చితమైన కోట్‌గా కాకుండా, ఒక అంచనా రూపంగా పరిగణించండి. July 2026 నాటికి, Claude Sonnet 5 ధర ప్రతి మిలియన్ input tokensకు $3 మరియు ప్రతి మిలియన్ output tokensకు $15గా ఉంది. Claude Opus 5 ధరలు వరుసగా $5 మరియు $25. Local modelకు ప్రతి tokenపై ఖర్చు ఉండదు. దానికి బదులుగా, మీరు ఉపయోగించినా ఉపయోగించకపోయినా నడుస్తూ ఉండే serverకు నెలవారీగా అయ్యే ఖర్చు ఉంటుంది.

Break-even point చాలామంది ఊహించిన దానికంటే తక్కువగా ఉంటుంది. ఉపయోగకరమైన open modelను నడపడానికి తగినంత memory ఉన్న VPSకు ప్రతి నెలా వాస్తవమైన ఖర్చు ఉంటుంది. ఎక్కువ సమయం అది idleగా ఉంటుంది. మీ వినియోగం burstyగా ఉంటే, hosted API సాధారణంగా చౌకగా ఉంటుంది. మీ వినియోగం నిరంతరంగా ఉంటే, లేదా మీ data మీ networkను విడిచి వెళ్లకూడదంటే, local model రెండు అంశాల్లోనూ మెరుగైనది.

చాలా teams చివరకు ఎంచుకునే సమాధానం సాధారణంగా ఈ mixed విధానమే. అధిక పరిమాణంలో, తక్కువ క్లిష్టత ఉన్న పనులకు open modelను locally నడపండి. క్లిష్టమైన requestsను hosted frontier modelకు route చేయండి. రెండింటి ముందు gatewayను ఉంచండి. అప్పుడు applicationsకు ఏది ఉపయోగిస్తున్నారో తెలుసుకోవాల్సిన అవసరం ఉండదు. Application codeను మార్చకుండా, ఈ రెండింటి మధ్య విభజనను కూడా మార్చవచ్చు. ఈ architecture, "self hosted Claude"కు ఆచరణాత్మక రూపం. పదశః అర్థంలోని వెర్షన్‌కు భిన్నంగా, ఇది వాస్తవంగా అందుబాటులో ఉంది. మొత్తం agent stackను కూడా మీరే నడపాలనుకుంటే, self-hosted AI agentsపై సమగ్ర జాబితాలో అందుబాటులో ఉన్న ఎంపికలను చూడండి.

FAQ

Claude model weights ను download చేసి స్థానికంగా అమలు చేయవచ్చా?

లేదు. Anthropic ఏ Claude model కోసం కూడా weights ను ఎప్పుడూ విడుదల చేయలేదు. Self hosting ను అనుమతించే licence కూడా లేదు. Online లో download చేయగల "Claude model"గా ప్రచారం చేసేది వేరే model కు తప్పుదారి పట్టించే పేరు అయి ఉండవచ్చు లేదా API ను పిలిచే wrapper అయి ఉండవచ్చు. దీనికి API key అవసరమైతే, అది local కాదు.

Claude కు అత్యంత సమీపమైన open model ఏది?

ఖచ్చితమైన సమానం ఏదీ లేదు. ప్రతి కొన్ని నెలలకు ముందున్న models మారుతుంటాయి. పరీక్షించదగిన open weight families లో Llama, Qwen, Mistral, Gemma, మరియు DeepSeek ఉన్నాయి. Summarising, classification, మరియు simple code edits కోసం 8 నుండి 14 billion parameters కలిగిన మంచి open model వాస్తవంగా ఉపయోగకరంగా ఉంటుంది. Long multi step reasoning మరియు agentic tool use లో hosted frontier model తో ఉన్న తేడా ఇంకా పెద్దదే. Leaderboard ను మాత్రమే నమ్మకుండా, మీ స్వంత prompts పై పరీక్షించండి.

LiteLLM self-hosted OpenRouter వంటిదేనా?

Routing మరియు key management పరంగా, అవును. LiteLLM మీ server పై నడుస్తుంది. ఇది ఒక OpenAI compatible endpoint ను అందిస్తుంది. Anthropic, Ollama, మరియు ఇతర providers లో ఎక్కువ భాగానికి requests ను proxy చేస్తుంది. ప్రతి key కు spend caps, model routing, మరియు logs చదవడానికి ఒకే స్థలం లభిస్తాయి. అయితే ఇది local inference ను అందించదు. Claude కు పంపే requests ఇంకా Anthropic కు వెళ్తాయి.

నా స్వంత server పై Claude Code నడిపితే నా code private గా ఉంటుందా?

లేదు. Process ఎక్కడ నడుస్తున్నా, Claude Code చదివే file contents ను Anthropic API కు పంపుతుంది. VPS మీకు అందించేది agent యొక్క isolation మాత్రమే, content యొక్క privacy కాదు. దానికి ప్రత్యేకమైన unprivileged user ను కేటాయించండి. Credentials మరియు సంబంధం లేని repositories కు దాన్ని దూరంగా ఉంచండి. అది చదవగల ప్రతిదీ server నుండి బయటకు వెళ్లే content గా పరిగణించండి.