SSD Nodes Learn 8GB RAM — ஆண்டுக்கு $66
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-08-01

Claude-ஐ self-host செய்ய முடியுமா? உண்மையான பதில்

Claude model weights public அல்ல. எனவே உங்கள் server-ல் Claude-ஐ இயக்க முடியாது. அதற்குப் பதிலாக open models, API gateway, Claude Code ஆகியவற்றை self-host செய்வது எப்படி என்பதை அறிக.

Claude-ஐ self-host செய்ய முடியுமா? முடியாது, அதற்கான காரணம் இதோ

Claude-ஐ self-host செய்ய முடியாது. Anthropic model weights-ஐ வெளியிடுவதில்லை. எனவே பதிவிறக்கக்கூடிய file இல்லை, இயக்கக்கூடிய container இல்லை, மேலும் உங்கள் சொந்த hardware-இல் அதை serve செய்ய அனுமதிக்கும் licence-உம் இல்லை. ஒவ்வொரு Claude request-உம் Anthropic's API அல்லது Amazon Bedrock, Google Vertex AI, Microsoft Foundry போன்ற hosted partner சேவைக்கு செல்கிறது. நீங்கள் சொந்தமாக வைத்திருக்கும் machine-இல் அதை இயக்குவது configuration பிரச்சினை அல்ல. Anthropic-க்கு வெளியே அந்த artefact இருப்பதே இல்லை.

இதுவே சுருக்கமான பதில். விரிவான பதில் என்னவென்றால், இந்தக் கேள்வியைக் கேட்கும் பெரும்பாலானவர்கள் உண்மையில் model weights-ஐ விரும்புவதில்லை. அவர்கள் server-இல் control வைத்திருக்கும் பின்வரும் மூன்று அம்சங்களில் ஒன்றை விரும்புகின்றனர்: locally இயங்கும் திறன்மிக்க model, அவர்களின் API keys-ஐ பாதுகாத்து செலவுக்கு வரம்பு விதிக்கும் gateway, அல்லது laptop-க்கு பதிலாக அவர்களின் சொந்த box-இல் இயங்கும் coding agent. இந்த guide மூன்றையும் commands உடன் விளக்குகிறது.

“self-hosted Claude” என்பதன் வழக்கமான பொருள்

“self hosted Claude” என்பதற்கான search traffic சில வேறுபட்ட தேவைகளாகப் பிரிகிறது. ஒவ்வொன்றுக்கும் வேறுபட்ட தீர்வு தேவை.

சிலர் privacy விரும்புகிறார்கள். அவர்களின் network-ஐ விட்டு prompts வெளியேறக் கூடாது என்று அவர்கள் விரும்புகிறார்கள். இதற்கு local open weight model மட்டுமே தீர்வு. ஏனெனில் எந்த Claude request-உம் வரையறையின்படி Anthropic-க்கு அனுப்பப்படும் request ஆகும்.

சிலர் cost control விரும்புகிறார்கள். கட்டுப்பாடின்றி இயங்கும் agent, credits-ஐ விரைவாகச் செலவழித்துவிடுமோ என்று அவர்கள் கவலைப்படுகிறார்கள். இதற்கு gateway தீர்வாகும். இது Claude உடன் செயல்படுவதால், model quality-ஐத் தொடர்ந்து பயன்படுத்தலாம்.

சிலர் laptop-இலிருந்து independence விரும்புகிறார்கள். அவர்கள் laptop-ன் மூடியை மூடிய பிறகும் agent தொடர்ந்து செயல்பட வேண்டும் என்று விரும்புகிறார்கள். இதற்கு VPS தீர்வாகும். Claude Code அதில் சீராக இயங்கும்.

சிலர் “self hosted OpenRouter” என்ற அமைப்பை விரும்புகிறார்கள். இதுவும் gateway ஆகும். இதற்கான வழக்கமான தீர்வு LiteLLM ஆகும்.

உங்களுக்கு ஏற்ற தேவையை முதலில் தீர்மானியுங்கள். ஒவ்வொரு தேவைக்கும் பொருத்தமான build வேறுபடும்.

Ollama மூலம் open model-ஐ நீங்களே host செய்யவும்

எந்த prompt-மும் உங்கள் server-ஐ விட்டு வெளியே செல்லக்கூடாது என்ற தேவை இருந்தால், open weight model-ஐ இயக்கவும். இன்று rented server-ல் நடைமுறையில் பயன்படுத்தக்கூடிய model families Llama, Qwen, Mistral, Gemma மற்றும் DeepSeek ஆகியவை. இவை அனைத்தும் நீங்கள் download செய்து இயக்கக்கூடிய weights-ஐ வெளியிடுகின்றன.

Ollama தொடங்குவதற்கான விரைவான வழியாகும். Install script ஒரே வரியாக உள்ளது. அது Ubuntu-ல் systemd service-ஐ அமைக்கிறது.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama, active (running) என்பதை வெளியிட வேண்டும். பின்னர் ஒரு model-ஐ pull செய்து அதனுடன் உரையாடவும்.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

முதல் pull பல gigabytes-ஐ download செய்யும். எனவே அது பதிலளிப்பதற்கு முன் model RAM அல்லது GPU memory-ல் பொருந்த வேண்டும். Quantised models-க்கு ஒரு தோராயமான விதி: 8 billion parameters கொண்ட model-க்கு சுமார் 6 GB free memory தேவை; 14 billion parameters கொண்ட model-க்கு சுமார் 10 GB தேவை; 70 billion parameters கொண்ட model-க்கு பெரும்பாலான general purpose VPS plans வழங்குவதைவிட அதிக memory தேவை. Server-ல் memory குறைந்தால், kernel process-ஐ நிறுத்தும். அப்போது Error: llama runner process has terminated தோன்றும்; dmesg-ல் out of memory வரியும் காணப்படும். Model-ஐ குற்றம் சாட்டுவதற்கு முன் free -h-ஐ சரிபார்க்கவும்.

Ollama 127.0.0.1:11434-ல் HTTP API-யையும் வழங்குகிறது. இதனால் அது chat toy ஆக மட்டும் இல்லாமல், பிற software-களுக்கும் பயனுள்ளதாகிறது.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

அந்த port-ஐ localhost-க்கு மட்டும் bind செய்து வைக்கவும். Public IP-ல் திறந்த Ollama port இருந்தால், அதை கண்டுபிடிப்பவர்களுக்கு இலவச GPU கிடைத்துவிடும். systemd unit, GPU detection மற்றும் reverse proxy-ஐ முன்னால் அமைத்தல் உள்ளிட்ட முழுமையான build, VPS-ல் Ollama இயக்குவதற்கான வழிகாட்டி-ல் விளக்கப்பட்டுள்ளது. ஒரே நேரத்தில் ஒன்றுக்கும் மேற்பட்ட user-களுக்கு service வழங்கினால், முதலில் Ollama மற்றும் vLLM ஒப்பீட்டை படிக்கவும். Hardware bottleneck ஆகும் முன்பே Ollama-வின் single stream design bottleneck ஆகிவிடும்.

இந்த இடைவெளியை நேர்மையாக மதிப்பிடவும். Mid sized VPS-ல் இயங்கும் நல்ல open model, summarising, classifying, drafting மற்றும் simple extraction போன்ற பணிகளுக்கு உண்மையாகப் பயனுள்ளதாக இருக்கும். நீண்ட multi step reasoning, பெரிய codebase-கள் மற்றும் agentic tool use ஆகியவற்றில், அது frontier hosted model-க்கு நெருக்கமாக இல்லை. எந்த அளவு prompt tuning செய்தாலும் இந்த இடைவெளியை நீக்க முடியாது. Local model சிறப்பாகச் செய்யக்கூடிய பணிகளுக்கு அதைத் தேர்ந்தெடுக்கவும். சிரமம் உண்மையாக இருக்கும் இடங்களில் hosted model-க்கு பணம் செலுத்தவும்.

LiteLLM மூலம் உங்கள் சொந்த gateway-ஐ இயக்குதல்

மக்கள் தேடும் "self hosted OpenRouter" இதுதான். ஒரு gateway, உங்கள் applications மற்றும் ஒவ்வொரு model provider-க்கும் இடையில் செயல்படும். உங்கள் applications, உங்கள் server-ஐச் சுட்டிக்காட்டும் ஒரே key-ஐ வைத்திருக்கும். உண்மையான provider keys அந்த server-ல் மட்டுமே இருக்கும். ஒவ்வொரு key-க்குமான செலவை வரம்பிடலாம், வெவ்வேறு applications-ஐ வெவ்வேறு models-க்கு route செய்யலாம், மேலும் ஒவ்வொரு request-ஐயும் ஒரே இடத்தில் log செய்யலாம்.

LiteLLM பொதுவாகத் தேர்ந்தெடுக்கப்படுவதற்குக் காரணம், அது OpenAI compatible API-யைப் பயன்படுத்துவதும், ஒரே endpoint-ன் பின்னால் Anthropic, Ollama மற்றும் பிற பெரும்பாலான providers-க்கு proxy செய்வதுமாகும். இதை config file-உடன் Docker-ல் இயக்குங்கள்.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

அதை litellm_config.yaml ஆக சேமித்து proxy-ஐத் தொடங்குங்கள். அது port 4000-ல் listening செய்யும்.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY என்பது admin credential ஆகும். எனவே அதை root password போலப் பாதுகாத்து, example value-ஐப் பயன்படுத்த வேண்டாம். Hosted API-ஐ அழைப்பது போலவே proxy-ஐ அழைக்கவும்.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

சரியாக இயங்கும் response-ல் choices array கொண்ட வழக்கமான JSON இருக்கும். 401 என்பது Authorization header, உங்கள் master key-உடன் பொருந்தவில்லை என்பதைக் குறிக்கும். Model-ஐக் குறிப்பிடும் 400 என்பது, உங்கள் request-ல் உள்ள model, config file-ல் உள்ள எந்த model_name உடனும் பொருந்தவில்லை என்பதைக் குறிக்கும்.

Anthropic-ஐ நேரடியாக அழைப்பதற்குப் பதிலாக இதை உருவாக்குவதற்கான காரணம் spend cap ஆகும். ஒவ்வொரு application-க்கும் தனித்தனி virtual key-ஐ வழங்கி, ஒவ்வொன்றுக்கும் தனிப்பட்ட budget அமைக்கவும்.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

அந்த key மூலம் one hundred dollars வரை செலவிடலாம் மற்றும் ஒரே ஒரு model-ஐ மட்டுமே அணுகலாம். வேறு எதையும் அணுக முடியாது. ஒரு agent அதிகாலை three மணிக்கு தவறாகச் செயல்பட்டாலும், பாதிப்பு உங்கள் முழு account-க்கு அல்ல, அந்த ஒரு key-க்கு மட்டுமே இருக்கும். இந்த அணுகுமுறையும் அதனுடன் தொடர்புடைய monitoring-உம் VPS-ல் agent செலவுகளை கட்டுப்படுத்துதல் என்ற பகுதியில் விளக்கப்படுகின்றன. Token அடிப்படையில் கட்டணம் செலுத்த வேண்டுமா என்பதை இன்னும் தீர்மானிக்கவில்லை என்றால், API மற்றும் subscription செலவு ஒப்பீடு கணக்கீட்டை விளக்குகிறது.

Gateway செய்யாத செயலையும் கவனியுங்கள். அது Claude-ஐ local ஆக மாற்றாது. உங்கள் prompts-ஐ Anthropic-இடமிருந்து மறைக்கவும்ாது. Requests இன்னும் உங்கள் server-ஐ விட்டு provider-ஐ சென்றடையும். நீங்கள் பெறுவது keys, spend, routing மற்றும் logs மீது கட்டுப்பாடு.

உங்கள் சொந்த VPS-ல் Claude Code-ஐ இயக்குதல்

மூன்றாவது விருப்பத்தை நிறைவேற்றுவது மிகவும் எளிதானது. Claude Code என்பது ஒரு client ஆகும். Node.js-ஐ நிறுவியுள்ள எந்தச் சூழலிலும் அது இயங்கும். HTTPS வழியாக API-யுடன் தொடர்புகொள்ளும். அதை நீங்கள் சொந்தமாக வைத்திருக்கும் server-ல் நிறுவினால், உங்கள் laptop-ஐ shutdown செய்த பிறகும் agent தொடர்ந்து இயங்கும். மேலும், agent-ன் தாக்க வரம்பு உங்கள் பிரதான machine-க்கு பதிலாக மீண்டும் உருவாக்கக்கூடிய ஒரு box-க்குள் இருக்கும்.

npm install -g @anthropic-ai/claude-code
claude --version

நீண்ட நேர job-ஐ SSH connection துண்டிப்பு நிறுத்தாமல் இருக்க, அதை tmux-க்குள் இயக்குங்கள். Session handling உட்பட அந்த setup, tmux மூலம் VPS-ல் Claude Code-ஐ இயக்குதல் என்ற பகுதியில் விளக்கப்பட்டுள்ளது. Agent-க்காக தனி unprivileged user-ஐ உருவாக்குங்கள். நீங்கள் முக்கியமான எந்தப் பொருளுக்கும் write access வழங்குவதற்கு முன், server-ல் Claude Code-ஐ இயக்குவதற்கான பாதுகாப்பு விதிகள் என்பதைப் படியுங்கள்.

இது agent-ஐ self-host செய்வது; model-ஐ அல்ல. இந்த வேறுபாட்டைத் துல்லியமாகக் குறிப்பிடுவது முக்கியம், ஏனெனில் பலர் இவற்றை ஒன்றாகக் கருதுகின்றனர். Process, filesystem, network egress மற்றும் logs ஆகியவற்றை நீங்கள் கட்டுப்படுத்துகிறீர்கள். Inference-ஐ Anthropic இன்னும் கட்டுப்படுத்துகிறது.

ஒவ்வொரு விருப்பத்திற்கும் உண்மையில் ஏற்படும் செலவு

விலைகள் மாறக்கூடும். எனவே, இவற்றைத் துல்லியமான விலைப்பட்டியலாக அல்லாமல், ஒரு பொதுவான தோற்றமாகக் கருதுங்கள். July 2026 நிலவரப்படி, Claude Sonnet 5-ன் விலை ஒரு million input tokens-க்கு $3 என்றும், ஒரு million output tokens-க்கு $15 என்றும் உள்ளது. Claude Opus 5-ன் விலை முறையே $5 மற்றும் $25. Local model-க்கு ஒவ்வொரு token-க்கும் கட்டணம் இல்லை. அதற்குப் பதிலாக, நீங்கள் பயன்படுத்தினாலும் பயன்படுத்தாவிட்டாலும் இயங்கும் server-க்கான மாதாந்திர செலவைச் செலுத்த வேண்டும்.

செலவு சமநிலைப் புள்ளி, பலர் எதிர்பார்ப்பதைவிடக் குறைவாக உள்ளது. பயனுள்ள open model-ஐ இயக்குவதற்குப் போதுமான memory கொண்ட VPS-க்கு ஒவ்வொரு மாதமும் உண்மையான செலவு இருக்கும். மேலும், அது பெரும்பாலான நேரம் idle நிலையில் இருக்கும். உங்கள் பயன்பாடு இடைவிடையாக இருந்தால், hosted API பொதுவாகக் குறைந்த செலவாகும். உங்கள் பயன்பாடு தொடர்ந்து இருந்தால், அல்லது உங்கள் data network-ஐ விட்டு வெளியே செல்லக்கூடாது என்றால், local model இரு காரணங்களிலும் சிறந்த தேர்வாகும்.

நடைமுறையில் பெரும்பாலான teams தேர்வு செய்யும் பதில், இரண்டையும் இணைத்த அமைப்பாகும். அதிக volume மற்றும் குறைந்த difficulty கொண்ட பணிகளுக்கு open model-ஐ local-ஆக இயக்குங்கள். கடினமான requests-ஐ hosted frontier model-க்கு route செய்யுங்கள். இரண்டிற்கும் முன்பாக gateway ஒன்றை அமைக்கவும். இதனால் applications எந்த model பயன்படுத்தப்படுகிறது என்பதை அறியத் தேவையில்லை. மேலும், application code-ஐ மாற்றாமல் அவற்றுக்கிடையிலான பகிர்வை மாற்றலாம். இந்த architecture, "self hosted Claude" என்பதன் நடைமுறை வடிவமாகும். சொல்லின் நேரடி பொருளில் உள்ள பதிப்பு போலல்லாமல், இது உண்மையில் உள்ளது. முழு agent stack-ஐயும் நீங்களே இயக்க விரும்பினால், self-hosted AI agents பற்றிய தொகுப்பு கிடைக்கக்கூடிய விருப்பங்களை விளக்குகிறது.

FAQ

Claude-ன் model weights-ஐ download செய்து locally இயக்க முடியுமா?

முடியாது. Anthropic எந்த Claude model-க்கும் weights-ஐ ஒருபோதும் release செய்யவில்லை. Self hosting-ஐ அனுமதிக்கும் licence-ம் இல்லை. Online-ல் download செய்யக்கூடிய "Claude model" என்று விளம்பரப்படுத்தப்படுவது, தவறாக வழிநடத்தும் பெயரைக் கொண்ட வேறு model ஆக இருக்கலாம் அல்லது API-ஐ call செய்யும் wrapper ஆக இருக்கலாம். அதற்கு API key தேவைப்பட்டால், அது local அல்ல.

Claude-க்கு மிக அருகிலுள்ள open model எது?

துல்லியமான இணையான model இல்லை. சிறந்த models சில மாதங்களுக்கு ஒருமுறை மாறுகின்றன. சோதிக்கத் தகுந்த open weight families: Llama, Qwen, Mistral, Gemma, மற்றும் DeepSeek. Summarising, classification, மற்றும் எளிய code edits பணிகளில் 8 முதல் 14 billion parameters கொண்ட நல்ல open model உண்மையில் பயனுள்ளதாக இருக்கும். நீண்ட multi step reasoning மற்றும் agentic tool use பணிகளில் hosted frontier model-உடனான இடைவெளி இன்னும் அதிகமாக உள்ளது. Leaderboard-ஐ மட்டும் நம்பாமல், உங்கள் சொந்த prompts மூலம் சோதிக்கவும்.

LiteLLM என்பது self-hosted OpenRouter போன்றதா?

Routing மற்றும் key management பகுதிகளில், செயல்பாட்டு ரீதியாக ஆம். LiteLLM உங்கள் server-ல் இயங்கி, ஒரு OpenAI compatible endpoint-ஐ வழங்குகிறது. அது Anthropic, Ollama மற்றும் பிற providers-க்கு requests-ஐ proxy செய்கிறது. ஒவ்வொரு key-க்கும் spend caps, model routing, மற்றும் logs-ஐப் பார்ப்பதற்கான ஒரே இடம் ஆகியவற்றைப் பெறுகிறீர்கள். இது வழங்காதது local inference ஆகும். Claude-க்கு அனுப்பப்படும் requests இன்னும் Anthropic-க்கு network மூலம் செல்கின்றன.

Claude Code-ஐ எனது சொந்த server-ல் இயக்கினால் எனது code private-ஆக இருக்குமா?

இல்லை. Claude Code படிக்கும் file contents-ஐ, process எங்கு இயங்கினாலும், Anthropic API-க்கு அனுப்புகிறது. VPS வழங்குவது agent-க்கான isolation மட்டுமே; content-க்கான privacy அல்ல. அதற்கு dedicated unprivileged user-ஐ ஒதுக்கவும். Credentials மற்றும் தொடர்பில்லாத repositories-இலிருந்து அதைத் தனிமைப்படுத்தவும். அது படிக்கக்கூடிய அனைத்தும் அந்த server-ஐ விட்டு வெளியேறும் content எனக் கருதவும்.