SSD Nodes Learn Hosting plans →
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-08-30

Claude-ஐ சொந்தமாக self-host செய்ய முடியுமா? உண்மை என்ன?

Claude-ன் model weights பொதுவெளியில் இல்லை என்பதால் அதை self-host செய்ய முடியாது. அதற்கு மாற்றாக உள்ள open models, API gateway மற்றும் Claude Code அமைப்பது எப்படி என அறிக.

Claude-ஐ உங்களால் self-host செய்ய முடியுமா? முடியாது, அதற்கான காரணங்கள் இதோ

Claude-ஐ உங்களால் self-host செய்ய முடியாது. Anthropic அதன் model weights-ஐ வெளியிடுவதில்லை. எனவே, பதிவிறக்கம் செய்ய கோப்புகளோ, இயக்குவதற்கு container-களோ அல்லது உங்கள் சொந்த hardware-ல் பயன்படுத்துவதற்கான உரிமமோ (licence) இல்லை. Claude-க்கான ஒவ்வொரு கோரிக்கையும் Anthropic-ன் API-க்கு அல்லது Amazon Bedrock, Google Vertex AI, அல்லது Microsoft Foundry போன்ற partner-களின் சேவைகளுக்குச் செல்கிறது. இதை உங்கள் சொந்த கணினியில் இயக்குவது என்பது ஒரு configuration பிரச்சினை அல்ல. Anthropic-ன் கட்டுப்பாட்டிற்கு வெளியே இந்த artefact-கள் கிடைப்பதில்லை.

இதுதான் சுருக்கமான பதில். விரிவான பதில் என்னவென்றால், இந்தக் கேள்வியைக் கேட்பவர்களில் பெரும்பாலானோருக்கு உண்மையில் model weights தேவையில்லை. அவர்கள் எதிர்பார்ப்பது பின்வரும் மூன்றில் ஒன்று, இவை அனைத்தையும் நீங்கள் கட்டுப்படுத்தும் server-ல் சாதிக்க முடியும்: உள்ளூர் கணினியில் இயங்கும் திறன்மிக்க model, API keys-ஐப் பாதுகாத்து செலவைக் கட்டுப்படுத்தும் gateway, அல்லது உங்கள் laptop-க்கு பதிலாக server-ல் இயங்கும் coding agent. இந்தக் கையேடு இந்த மூன்றையும், அதற்கான commands-உடன் விளக்குகிறது.

"Self-hosted Claude" என்பதன் பொதுவான அர்த்தம்

"Self-hosted Claude" என்பதற்கான தேடல் முடிவுகள் பயனர்களின் பல்வேறு தேவைகளைப் பிரதிபலிக்கின்றன. ஒவ்வொன்றிற்கும் வெவ்வேறு தீர்வுகள் தேவைப்படுகின்றன.

சில பயனர்கள் தனியுரிமையை (privacy) விரும்புகிறார்கள். தங்களின் prompts தங்களின் network-ஐ விட்டு வெளியேறக்கூடாது என்று அவர்கள் கருதுகிறார்கள். இதற்கு local open weight model மட்டுமே தீர்வாகும், ஏனெனில் Claude-க்கு அனுப்பப்படும் எந்தவொரு கோரிக்கையும் Anthropic-க்கு அனுப்பப்படும் கோரிக்கையாகவே அமையும்.

சில பயனர்கள் செலவைக் கட்டுப்படுத்த விரும்புகிறார்கள். அதிகப்படியான credits செலவாவதை அவர்கள் அஞ்சுகிறார்கள். இதற்கு ஒரு gateway தீர்வாக அமையும். இது Claude-உடன் இணைந்து செயல்படுவதால், model-ன் தரம் குறையாது.

சில பயனர்கள் laptop-ஐச் சார்ந்து இருக்க விரும்பவில்லை. laptop-ஐ மூடினாலும் தொடர்ந்து இயங்கும் ஒரு agent-ஐ அவர்கள் எதிர்பார்க்கிறார்கள். இதற்கு ஒரு VPS தீர்வாகும்; அதில் Claude Code தடையின்றி இயங்கும்.

சில பயனர்கள் "self-hosted OpenRouter" என்ற சொற்றொடரைப் பயன்படுத்துகிறார்கள். இதுவும் ஒரு gateway-தான். இதற்கு LiteLLM-ஐப் பயன்படுத்துவதே பொதுவான தீர்வாகும்.

உங்கள் தேவை என்ன என்பதை முதலில் கண்டறியவும், ஏனெனில் ஒவ்வொரு தேவைக்கும் ஏற்றவாறு சரியான கட்டமைப்பு (build) மாறுபடும்.

Ollama மூலம் open model-ஐ self-host செய்தல்

உங்கள் server-லிருந்து எந்தவொரு prompt-ம் வெளியே செல்லக்கூடாது என்பது தேவையாக இருந்தால், open weight model-ஐ இயக்கவும். தற்போது வாடகை server-களில் பயன்படுத்தக்கூடிய குடும்பங்கள் Llama, Qwen, Mistral, Gemma, மற்றும் DeepSeek ஆகும். இவை அனைத்தும் நீங்கள் download செய்து இயக்கக்கூடிய weights-ஐ வழங்குகின்றன.

Ollama இதற்கான மிக வேகமான வழியாகும். இதன் install script ஒரே வரியில் அமையும், இது Ubuntu-வில் systemd service-ஐ அமைத்துவிடும்.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama கட்டளை active (running) என்பதை அச்சிட வேண்டும். அதன் பிறகு ஒரு model-ஐ pull செய்து அதனுடன் உரையாடலாம்.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

முதல் pull கட்டளை பல gigabytes தரவை download செய்யும், எனவே எதற்கும் பதில் அளிக்கும் முன் அந்த model RAM அல்லது GPU memory-ல் பொருந்த வேண்டும். Quantised model-களுக்கான ஒரு பொதுவான விதி: 8 billion parameter model-க்கு சுமார் 6 GB, 14 billion parameter model-க்கு சுமார் 10 GB தேவைப்படும்; 70 billion parameter model-க்கு பெரும்பாலான பொதுவான VPS திட்டங்களில் இருப்பதை விட அதிக memory தேவைப்படும். server-ல் memory குறைவாக இருந்தால், kernel அந்த process-ஐ நிறுத்திவிடும் (kill), அப்போது Error: llama runner process has terminated பிழையை நீங்கள் காண்பீர்கள், மேலும் dmesg-ல் out of memory என்ற வரி இடம்பெறும். model-ஐ குறை கூறுவதற்கு முன் free -h-ஐ சரிபார்க்கவும். அதே memory அளவுதான் model ஒரு நீண்ட prompt-ஐ எவ்வளவு தூரம் வாசிக்கும் என்பதையும் தீர்மானிக்கிறது, ஏனெனில் Ollama இயல்பாகவே ஒரு குறிப்பிட்ட அளவிற்கு மேல் உள்ளவற்றை நீக்கிவிடும் (truncate). எனவே நீண்ட ஆவணங்கள் பாதியிலேயே சுருக்கப்படும்போது, raising num_ctx and sizing the KV cache என்பதைச் சரிபார்ப்பது முதல் வேலையாக இருக்க வேண்டும்.

Ollama, 127.0.0.1:11434-ல் ஒரு HTTP API-ஐயும் வழங்குகிறது, இதுவே இதை வெறும் chat கருவியாக மட்டுமன்றி பிற மென்பொருட்களுக்குப் பயனுள்ளதாக மாற்றுகிறது.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

நீண்ட இடைவெளிக்குப் பிறகு வரும் முதல் கோரிக்கைக்கு முப்பது வினாடிகள் ஆகி, அடுத்தடுத்த கோரிக்கைகள் உடனடியாகப் பதில் அளித்தால், எதிலும் கோளாறு இல்லை என்று அர்த்தம்: Ollama ஐந்து நிமிடங்கள் பயன்பாடு இல்லையென்றால் model-ஐ memory-யிலிருந்து நீக்கிவிடும், holding it resident with keep_alive என்பதைப் பயன்படுத்துவது அந்த reload தாமக்கத்தைத் தவிர்க்கும்.

அந்த port-ஐ localhost-ல் மட்டுமே பிணைக்கவும் (bind). பொது IP-யில் Ollama port-ஐத் திறந்து வைப்பது, அதைக் கண்டறியும் எவருக்கும் உங்கள் GPU-வை இலவசமாக வழங்குவதற்குச் சமம். systemd unit, GPU detection, மற்றும் reverse proxy அமைத்தல் உள்ளிட்ட முழுமையான கட்டமைப்பு the guide to running Ollama on a VPS-ல் விவரிக்கப்பட்டுள்ளது. நீங்கள் ஒரே நேரத்தில் ஒன்றுக்கும் மேற்பட்ட பயனர்களுக்குச் சேவை வழங்குகிறீர்கள் என்றால், the comparison of Ollama and vLLM-ஐ முதலில் படிக்கவும், ஏனெனில் வன்பொருள் (hardware) திறன் குறையும் முன்பே Ollama-வின் single stream வடிவமைப்பு ஒரு தடையாக (bottleneck) மாறிவிடும்.

திறன் இடைவெளியைப் பற்றி உண்மையாக இருங்கள். நடுத்தர அளவுள்ள VPS-ல் இயங்கும் ஒரு நல்ல open model, சுருக்கம் எழுதுதல், வகைப்படுத்துதல், வரைவு செய்தல் மற்றும் எளிமையான தரவு பிரித்தெடுத்தல் போன்ற பணிகளுக்கு மிகவும் பயனுள்ளதாக இருக்கும். நீண்ட மற்றும் பல கட்டங்களைக் கொண்ட பகுத்தறிவு (reasoning), பெரிய codebases, மற்றும் agentic tool பயன்பாடு ஆகியவற்றில் இது முன்னணி hosted model-களுக்கு இணையாக இருக்காது; prompt tuning செய்தாலும் இந்த இடைவெளியை முழுமையாக நிரப்ப முடியாது. local model-ஐ அது சிறப்பாகச் செய்யும் பணிகளுக்கு மட்டும் பயன்படுத்தவும், கடினமான பணிகளுக்கு hosted model-க்குக் கட்டணம் செலுத்துவது சிறந்தது.

LiteLLM மூலம் உங்கள் சொந்த gateway-ஐ இயக்குதல்

இது மக்கள் தேடும் "self hosted OpenRouter" ஆகும். உங்கள் applications-க்கும் அனைத்து model provider-களுக்கும் இடையில் ஒரு gateway செயல்படுகிறது. உங்கள் applications ஒரு key-ஐ மட்டும் வைத்துக்கொண்டு, உங்கள் server-ஐ நோக்கிச் செயல்படும். உண்மையான provider keys அந்த server-ல் மட்டுமே இருக்கும். ஒவ்வொரு key-க்கும் செலவு வரம்பை (spend cap) நிர்ணயிக்கலாம், வெவ்வேறு applications-ஐ வெவ்வேறு models-க்கு அனுப்பலாம், மேலும் ஒவ்வொரு request-ஐயும் ஓரிடத்தில் பதிவு செய்யலாம்.

LiteLLM ஒரு பொதுவான தேர்வாகும், ஏனெனில் இது OpenAI compatible API-ஆகச் செயல்படுகிறது மற்றும் Anthropic, Ollama மற்றும் பிற பெரும்பாலான providers-க்கு ஒரே endpoint மூலம் proxy செய்கிறது. இதை ஒரு config file-உடன் Docker-ல் இயக்கவும்.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

இதை litellm_config.yaml எனச் சேமித்து, proxy-ஐத் தொடங்கவும். இது port 4000-ல் இயங்கும்.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY என்பது admin credential ஆகும், எனவே இதை root password போலக் கையாளவும்; example value-ஐ அப்படியே பயன்படுத்த வேண்டாம். ஒரு hosted API-ஐ அழைப்பது போலவே இந்த proxy-ஐயும் அழைக்கவும்.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

சரியான response என்பது choices array-ஐக் கொண்ட சாதாரண JSON ஆகும். 401 என்பது Authorization header உங்கள் master key-உடன் பொருந்தவில்லை என்பதைக் குறிக்கிறது. 400 ஒரு model-ஐக் குறிப்பிடுகிறது என்றால், உங்கள் request-ல் உள்ள model, config file-ல் உள்ள எந்த model_name-உடனும் பொருந்தவில்லை என்று அர்த்தம்.

Anthropic-ஐ நேரடியாக அழைப்பதற்குப் பதிலாக இதை உருவாக்குவதற்கான காரணம் செலவு வரம்பு (spend cap) ஆகும். ஒவ்வொரு application-க்கும் தனித்தனி virtual key-ஐ வழங்கவும், ஒவ்வொன்றுக்கும் தனித்தனி பட்ஜெட் ஒதுக்கவும்.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

அந்த key நூறு டாலர்கள் வரை மட்டுமே செலவழிக்க முடியும் மற்றும் ஒரு குறிப்பிட்ட model-ஐ மட்டுமே அணுக முடியும். அதிகாலை மூன்று மணிக்கு ஒரு agent தவறாகச் செயல்பட்டால், பாதிப்பு உங்கள் முழு கணக்கையும் பாதிக்காமல், அந்த ஒரு key-க்கு மட்டுமே கட்டுப்படும். அந்த முறை மற்றும் அதைச் சுற்றியுள்ள கண்காணிப்பு ஆகியவை VPS-ல் agent செலவுகளைக் கட்டுப்படுத்துதல் என்ற தலைப்பில் விவாதிக்கப்பட்டுள்ளன. நீங்கள் token அடிப்படையில் பணம் செலுத்த வேண்டுமா என்று இன்னும் முடிவு செய்யவில்லை என்றால், API மற்றும் சந்தா செலவு ஒப்பீடு என்ற கட்டுரை கணக்கீடுகளைப் புரிந்துகொள்ள உதவும்.

இந்த gateway எதைச் செய்யாது என்பதைக் கவனத்தில் கொள்ளவும். இது Claude-ஐ local-ஆக மாற்றாது, மேலும் உங்கள் prompts-ஐ Anthropic-விடமிருந்து மறைக்காது. Requests உங்கள் server-லிருந்து provider-க்குச் செல்லும். நீங்கள் பெறுவது keys, செலவு, routing மற்றும் logs ஆகியவற்றின் மீதான கட்டுப்பாடு மட்டுமே.

உங்கள் சொந்த VPS-ல் Claude Code-ஐ இயக்குதல்

மூன்றாவது விருப்பத்தை நிறைவேற்றுவது மிகவும் எளிது. Claude Code என்பது ஒரு client மென்பொருள். Node.js நிறுவப்பட்ட எந்த இடத்திலும் இது இயங்கும், மேலும் இது HTTPS வழியாக API-உடன் தொடர்பு கொள்ளும். இதை உங்கள் சொந்த server-ல் நிறுவுவதன் மூலம், உங்கள் laptop-ஐ அணைத்த பிறகும் agent தொடர்ந்து வேலை செய்யும். மேலும், agent-ன் செயல்பாட்டு எல்லையை உங்கள் முதன்மை கணினியில் இல்லாமல், நீங்கள் எப்போது வேண்டுமானாலும் அழித்து மீண்டும் உருவாக்கக்கூடிய ஒரு தனி சூழலில் வைத்திருக்க முடியும்.

npm install -g @anthropic-ai/claude-code
claude --version

SSH இணைப்பு துண்டிக்கப்பட்டாலும் நீண்ட நேரம் நடக்கும் பணிகள் பாதிக்கப்படாமல் இருக்க, இதை tmux-க்குள் இயக்கவும். session கையாளுதல் உள்ளிட்ட இந்த அமைப்பு முறை VPS-ல் tmux மூலம் Claude Code-ஐ இயக்குதல் என்ற பகுதியில் விளக்கப்பட்டுள்ளது. இந்த agent-க்கு என தனியாக ஒரு unprivileged user-ஐ உருவாக்கவும். நீங்கள் முக்கியமாகக் கருதும் கோப்புகளில் மாற்றங்களைச் செய்யும் அதிகாரத்தை வழங்குவதற்கு முன், server-ல் Claude Code-ஐ இயக்குவதற்கான பாதுகாப்பு விதிகள் என்பதைப் படிக்கவும்.

இது model-ஐ அல்ல, agent-ஐ self-host செய்வதாகும். இதைத் தெளிவாகப் புரிந்துகொள்வது அவசியம், ஏனெனில் பலர் இதில் குழப்பமடைகிறார்கள். நீங்கள் process, filesystem, network egress மற்றும் logs ஆகியவற்றைக் கட்டுப்படுத்துகிறீர்கள். inference-க்கான உரிமை Anthropic நிறுவனத்திடமே உள்ளது.

ஒவ்வொரு விருப்பத்திற்கும் ஆகும் உண்மையான செலவு

விலைகள் மாறக்கூடியவை, எனவே இவற்றை ஒரு நிலையான விலையாகக் கருதாமல், ஒரு தோராயமான மதிப்பீடாகக் கொள்ளவும். ஜூலை 2026 நிலவரப்படி, Claude Sonnet 5-ன் விலை ஒரு மில்லியன் input tokens-க்கு $3 மற்றும் ஒரு மில்லியன் output tokens-க்கு $15 ஆகும். Claude Opus 5-ன் விலை முறையே $5 மற்றும் $25 ஆகும். ஒரு local model-க்கு token அடிப்படையில் கட்டணம் ஏதுமில்லை; அதற்குப் பதிலாக, நீங்கள் பயன்படுத்தினாலும் இல்லாவிட்டாலும், அந்த server-க்கான மாதாந்திர வாடகையை நீங்கள் செலுத்த வேண்டும்.

செலவு சமநிலையை அடையும் புள்ளி (break even point) மக்கள் எதிர்பார்ப்பதை விடக் குறைவுதான். ஒரு பயனுள்ள open model-ஐ இயக்கத் தேவையான memory கொண்ட VPS-க்கு ஒவ்வொரு மாதமும் கணிசமான தொகை செலவாகும், மேலும் அது பெரும்பாலான நேரங்களில் பயன்பாடின்றி சும்மா இருக்கும். உங்கள் பயன்பாடு அவ்வப்போது மட்டுமே இருக்கும் பட்சத்தில், hosted API பொதுவாக மலிவானது. உங்கள் பயன்பாடு தொடர்ந்து இருந்தாலோ அல்லது உங்கள் தரவு உங்கள் network-ஐ விட்டு வெளியேறக் கூடாது என்றாலோ, local model சிறந்த தேர்வாகும்.

பெரும்பாலான குழுக்கள் பின்பற்றும் நடைமுறை, இரண்டையும் கலந்த ஒரு தீர்வாகும். அதிக அளவிலான, எளிமையான பணிகளுக்கு ஒரு open model-ஐ local-ஆக இயக்கவும். கடினமான கோரிக்கைகளை ஒரு hosted frontier model-க்கு அனுப்பவும். இவை இரண்டிற்கும் முன்னால் ஒரு gateway-ஐ அமைக்கவும்; அப்போதுதான் எந்தக் கோரிக்கை எங்கு செல்கிறது என்பது application-களுக்குத் தெரிய வேண்டிய அவசியமிருக்காது. மேலும், application code-ஐ மாற்றாமலேயே, எந்தப் பணியை எங்கு கையாள்வது என்ற எல்லையை உங்களால் மாற்ற முடியும். இந்த architecture தான் "self hosted Claude"-ன் நடைமுறை வடிவம்; இது நிஜமான பதிப்பைப் போலன்றி, உண்மையில் சாத்தியமானது. நீங்கள் முழு agent stack-ஐயும் நீங்களே இயக்க விரும்பினால், self-hosted AI agents பற்றிய தொகுப்பு உங்களுக்குத் தேவையான தகவல்களை வழங்கும்.

FAQ

நான் Claude-ன் model weights-ஐ தரவிறக்கம் செய்து locally இயக்க முடியுமா?

முடியாது. Anthropic எந்தவொரு Claude model-ன் weights-ஐயும் வெளியிட்டதில்லை, மேலும் self-hosting-ஐ அனுமதிக்கும் எந்த உரிமமும் (licence) இல்லை. இணையத்தில் "Claude model" என்று தரவிறக்கம் செய்யக் கிடைக்கும் எதுவும், தவறாகப் பெயரிடப்பட்ட வேறொரு model அல்லது API-ஐ அழைக்கும் ஒரு wrapper ஆகும். அதற்கு API key தேவைப்பட்டால், அது local கிடையாது.

Claude-க்கு நெருக்கமான open model எது?

துல்லியமான ஒப்பீடு எதுவும் இல்லை, மேலும் முன்னணியில் இருப்பவை சில மாதங்களுக்கு ஒருமுறை மாறுகின்றன. Llama, Qwen, Mistral, Gemma மற்றும் DeepSeek ஆகிய open weight குடும்பங்களைச் சோதித்துப் பார்க்கலாம். சுருக்கம் (summarising), வகைப்படுத்துதல் (classification) மற்றும் எளிய code திருத்தங்களுக்கு 8 முதல் 14 billion parameters கொண்ட ஒரு நல்ல open model பயனுள்ளதாக இருக்கும். நீண்ட multi-step reasoning மற்றும் agentic tool பயன்பாட்டில், hosted frontier model-க்கும் இதற்கும் இடையே இன்னும் பெரிய இடைவெளி உள்ளது. leaderboard-ஐ நம்புவதை விட, உங்கள் சொந்த prompts-களைக் கொண்டு சோதித்துப் பாருங்கள்.

LiteLLM என்பது self-hosted OpenRouter-ஆ?

செயல்பாட்டு ரீதியாக ஆம், routing மற்றும் key management பகுதிக்கு இது பொருந்தும். LiteLLM உங்கள் server-ல் இயங்குகிறது, OpenAI-க்கு இணக்கமான ஒரு endpoint-ஐ வழங்குகிறது, மேலும் Anthropic, Ollama மற்றும் பிற providers-க்கு proxy-ஆகச் செயல்படுகிறது. இதன் மூலம் நீங்கள் per-key spend caps, model routing மற்றும் logs-ஐ ஒரே இடத்தில் பார்க்கும் வசதியைப் பெறுகிறீர்கள். இது உங்களுக்கு local inference-ஐ வழங்காது: Claude-க்கான கோரிக்கைகள் (requests) தொடர்ந்து Anthropic-க்கே செல்லும்.

Claude Code-ஐ எனது சொந்த server-ல் இயக்குவது எனது code-ஐத் தனிப்பட்டதாக (private) வைத்திருக்குமா?

இல்லை. Claude Code தான் படிக்கும் file-களின் உள்ளடக்கத்தை Anthropic API-க்கு அனுப்புகிறது, அந்த process எங்கு இயங்கினாலும் இதுவே நடக்கும். ஒரு VPS உங்களுக்கு agent-ன் தனிமைப்படுத்தலை (isolation) மட்டுமே தருகிறது, உள்ளடக்கத்தின் தனியுரிமையை (privacy) அல்ல. இதற்குத் தனிப்பட்ட unprivileged user-ஐ ஒதுக்குங்கள், credentials மற்றும் தொடர்பில்லாத repositories-லிருந்து இதைத் தள்ளி வையுங்கள், மேலும் இது படிக்கக்கூடிய அனைத்தையும் server-ஐ விட்டு வெளியேறும் உள்ளடக்கமாகவே கருதுங்கள்.