SSD Nodes Learn 8GB RAM — $66/বছর
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-08-01

Claude কি নিজে হোস্ট করা যায়? সৎ উত্তর ও বিকল্প

Claude-এর weights প্রকাশ্য নয়, তাই নিজের server-এ এটি চালানো যায় না। self-host করার বাস্তব বিকল্প হিসেবে open model, API gateway ও Claude Code কীভাবে চালাবেন তা জানুন।

আপনি কি Claude নিজে হোস্ট করতে পারবেন? না, এবং এর কারণ এখানে

আপনি Claude নিজে হোস্ট করতে পারবেন না। Anthropic মডেলের weight প্রকাশ করে না। তাই ডাউনলোড করার মতো কোনো file নেই, চালানোর মতো কোনো container নেই, এবং নিজের hardware থেকে এটি serve করার অনুমতি দেয় এমন কোনো licence নেই। Claude-এর প্রতিটি request Anthropic-এর API-তে অথবা Amazon Bedrock, Google Vertex AI বা Microsoft Foundry-এর মতো hosted partner-এর কাছে যায়। আপনার মালিকানাধীন machine-এ এটি চালানো configuration-এর সমস্যা নয়। Anthropic-এর বাইরে এই artefact-এর অস্তিত্বই নেই।

সংক্ষিপ্ত উত্তর এটাই। বিস্তারিত উত্তর হলো, যারা এই প্রশ্ন করেন তাদের অধিকাংশই আসলে model weight চান না। তারা এমন তিনটি জিনিসের একটি চান, যেগুলো আপনার নিয়ন্ত্রণাধীন server-এ চালানো সম্ভব: স্থানীয়ভাবে চলা একটি সক্ষম model, এমন একটি gateway যা তাদের API key সংরক্ষণ করে এবং খরচের সীমা নির্ধারণ করে, অথবা এমন একটি coding agent যা laptop-এর বদলে তাদের নিজস্ব box-এ চলে। এই guide-এ তিনটিই command-সহ দেখানো হয়েছে।

"self-hosted Claude" বলতে সাধারণত যা বোঝায়

"self hosted Claude" খোঁজার পেছনে কয়েক ধরনের আলাদা চাহিদা থাকে। প্রতিটির জন্য আলাদা সমাধান প্রয়োজন।

কেউ কেউ গোপনীয়তা চান। তারা চান না যে prompt তাদের network-এর বাইরে যাক। এটি সমাধান করতে হলে শুধু স্থানীয় open weight model ব্যবহার করা যায়, কারণ Claude-এর যেকোনো request সংজ্ঞা অনুযায়ী Anthropic-এর কাছে পাঠানো request।

কেউ কেউ খরচ নিয়ন্ত্রণ করতে চান। তারা আশঙ্কা করেন, একটি নিয়ন্ত্রণহীন agent অতিরিক্ত credit ব্যবহার করতে পারে। Gateway এই সমস্যা সমাধান করে। এটি Claude-এর সঙ্গে কাজ করে, তাই model-এর গুণমান বজায় থাকে।

কেউ কেউ laptop-এর ওপর নির্ভরতা কমাতে চান। তারা চান, laptop-এর ঢাকনা বন্ধ করলেও agent কাজ চালিয়ে যাক। VPS এই সমস্যার সমাধান করে, এবং Claude Code এতে সহজেই চলে।

কেউ কেউ "self hosted OpenRouter" চান। এটিও একটি gateway। এর জন্য প্রচলিত সমাধান হলো LiteLLM।

আপনার প্রয়োজন কোন ধরনের, তা নির্ধারণ করুন। কারণ প্রতিটি ক্ষেত্রে সঠিক setup আলাদা।

Ollama দিয়ে একটি ওপেন মডেল নিজে হোস্ট করুন

যদি কোনো prompt আপনার server-এর বাইরে না যাওয়া বাধ্যতামূলক হয়, তাহলে একটি open weight model চালান। আজ rented server-এ বাস্তবে ব্যবহারযোগ্য family হলো Llama, Qwen, Mistral, Gemma এবং DeepSeek। এগুলোর সবকটিই download করে চালানোর জন্য weights প্রকাশ করে।

Ollama শুরু করার দ্রুততম উপায়। Install script এক লাইনের, এবং এটি Ubuntu-তে একটি systemd service সেট আপ করে।

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama-এর output হিসেবে active (running) দেখা উচিত। এরপর একটি model pull করে সেটির সঙ্গে কথা বলুন।

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

প্রথম pull কয়েক gigabyte data download করে। তাই model কোনো উত্তর দেওয়ার আগে সেটিকে RAM অথবা GPU memory-তে জায়গা পেতে হবে। Quantised model-এর জন্য একটি আনুমানিক নিয়ম হলো: 8 billion parameter-এর model-এর প্রায় 6 GB free memory প্রয়োজন, 14 billion parameter-এর model-এর প্রায় 10 GB প্রয়োজন, এবং 70 billion parameter-এর model-এর জন্য অধিকাংশ general purpose VPS plan-এ থাকা memory-এর চেয়ে বেশি memory প্রয়োজন। Server-এ memory কম থাকলে kernel process-টি বন্ধ করে দেয়। তখন Error: llama runner process has terminated দেখা যায় এবং dmesg-তে out of memory সংক্রান্ত একটি line থাকে। Model-কে দোষ দেওয়ার আগে free -h পরীক্ষা করুন।

Ollama 127.0.0.1:11434-এ একটি HTTP API-ও চালায়। এর ফলে এটি শুধু chat toy না থেকে অন্যান্য software-এর জন্যও ব্যবহারযোগ্য হয়।

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

এই port-টি localhost-এ bound রাখুন। Public IP-তে খোলা Ollama port যে কেউ খুঁজে পেলে বিনামূল্যে GPU হিসেবে ব্যবহার করতে পারে। systemd unit, GPU detection এবং সামনে reverse proxy বসানোসহ সম্পূর্ণ setup VPS-এ Ollama চালানোর guide-এ দেখানো হয়েছে। একসঙ্গে একাধিক user-কে service দিলে আগে Ollama এবং vLLM-এর তুলনা পড়ুন। কারণ hardware-এর সীমায় পৌঁছানোর অনেক আগেই Ollama-র single stream design bottleneck হয়ে যায়।

সীমাবদ্ধতা সম্পর্কে সৎ থাকুন। Mid-sized VPS-এ একটি ভালো open model summarising, classifying, drafting এবং simple extraction-এর কাজে সত্যিই উপযোগী। দীর্ঘ multi-step reasoning, বড় codebase এবং agentic tool use-এর ক্ষেত্রে এটি frontier hosted model-এর কাছাকাছিও নয়। কোনো পরিমাণ prompt tuning সেই ব্যবধান দূর করতে পারে না। যে কাজে local model ভালো, তার জন্য সেটিই বেছে নিন। আর যেখানে কাজটি সত্যিই কঠিন, সেখানে hosted model-এর জন্য অর্থ ব্যয় করুন।

LiteLLM দিয়ে নিজের gateway চালান

মানুষ যে "self hosted OpenRouter" খুঁজছে, এটি তারই সমাধান। একটি gateway আপনার application এবং প্রতিটি model provider-এর মধ্যে থাকে। আপনার application-এ একটি key থাকে, যা আপনার server-এর দিকে নির্দেশ করে। প্রকৃত provider key শুধু ওই server-এ থাকে। প্রতি key-এর জন্য ব্যয়ের সীমা নির্ধারণ করতে পারেন, বিভিন্ন application-কে বিভিন্ন model-এ route করতে পারেন এবং প্রতিটি request এক জায়গায় log করতে পারেন।

LiteLLM একটি প্রচলিত পছন্দ, কারণ এটি OpenAI compatible API ব্যবহার করে এবং একই endpoint-এর মাধ্যমে Anthropic, Ollama ও অধিকাংশ অন্যান্য provider-এ proxy করে। একটি config file সহ এটি Docker-এ চালান।

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

এটি litellm_config.yaml হিসেবে সংরক্ষণ করুন এবং proxy চালু করুন। এটি port 4000-এ listening করে।

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY হলো admin credential। তাই এটিকে root password-এর মতো সুরক্ষিত রাখুন এবং উদাহরণে দেওয়া মান ব্যবহার করবেন না। Hosted API-তে যেভাবে call করেন, proxy-কে ঠিক সেভাবেই call করুন।

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

সুস্থ response হলো স্বাভাবিক JSON, যাতে choices array থাকে। 401 বোঝায়, Authorization header আপনার master key-এর সঙ্গে মেলে না। কোনো model-এর নামসহ 400 বোঝায়, আপনার request-এর model config file-এর কোনো model_name-এর সঙ্গে মেলে না।

Anthropic-কে সরাসরি call না করে এটি তৈরি করার প্রধান কারণ হলো ব্যয়ের সীমা নির্ধারণ করা। প্রতি application-এর জন্য আলাদা virtual key তৈরি করুন এবং প্রতিটির নিজস্ব budget রাখুন।

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

ওই key সর্বোচ্চ একশো ডলার ব্যয় করতে পারবে এবং শুধু একটি model-এ পৌঁছাতে পারবে। অন্য কিছুতে নয়। রাত তিনটায় কোনো agent ভুল আচরণ করলে, তার প্রভাব আপনার পুরো account-এর বদলে একটি key-তে সীমাবদ্ধ থাকবে। এই পদ্ধতি এবং এর সঙ্গে থাকা monitoring নিয়ে VPS-এ agent-এর খরচ নিয়ন্ত্রণে রাখা আলোচনা করা হয়েছে। আপনি যদি এখনও token অনুযায়ী অর্থ দেওয়া আদৌ যুক্তিযুক্ত কি না তা নির্ধারণ করে থাকেন, API এবং subscription-এর খরচের তুলনা-এ হিসাবটি দেখানো হয়েছে।

Gateway কী করে না, তা মনে রাখুন। এটি Claude-কে local করে না এবং Anthropic-এর কাছ থেকে আপনার prompt গোপন করে না। Request এখনও provider-এর কাছে যাওয়ার জন্য আপনার server ছেড়ে যায়। আপনি যা পান, তা হলো key, ব্যয়, routing এবং log-এর ওপর নিয়ন্ত্রণ।

আপনার নিজস্ব VPS-এ Claude Code চালান

তৃতীয় ইচ্ছাটি পূরণ করা সবচেয়ে সহজ। Claude Code একটি client। আপনি যেখানে Node.js ইনস্টল করবেন, সেখানেই এটি চলবে এবং HTTPS-এর মাধ্যমে API-এর সঙ্গে যোগাযোগ করবে। আপনার মালিকানাধীন একটি server-এ এটি চালালে laptop বন্ধ করার পরও agent কাজ চালিয়ে যেতে পারে। এতে agent-এর ক্ষতির পরিধি আপনার মূল machine-এর বদলে এমন একটি box-এ সীমাবদ্ধ থাকে, যেটি আপনি পুনর্নির্মাণ করতে পারেন।

npm install -g @anthropic-ai/claude-code
claude --version

এটি tmux-এর ভিতরে চালান, যাতে SSH connection বিচ্ছিন্ন হলেও দীর্ঘ job বন্ধ না হয়। session handling-সহ এই setup tmux দিয়ে VPS-এ Claude Code চালানো-এ ব্যাখ্যা করা হয়েছে। agent-এর জন্য একটি আলাদা unprivileged user দিন। আপনি যে কোনো গুরুত্বপূর্ণ resource-এ write access দেওয়ার আগে server-এ Claude Code চালানোর নিরাপত্তা নিয়ম পড়ুন।

এটি agent-এর self-hosting, model-এর নয়। এই পার্থক্যটি স্পষ্টভাবে বোঝা গুরুত্বপূর্ণ, কারণ মানুষ প্রায়ই দুটি বিষয়কে এক করে ফেলে। process, filesystem, network egress এবং logs-এর মালিক আপনি। Inference-এর মালিকানা এখনও Anthropic-এর।

প্রতিটি বিকল্পের প্রকৃত খরচ

দাম পরিবর্তিত হয়। তাই এগুলোকে নির্দিষ্ট উদ্ধৃতি নয়, বরং একটি আনুমানিক চিত্র হিসেবে বিবেচনা করুন। July 2026 অনুযায়ী, Claude Sonnet 5-এর মূল্য প্রতি 1 million input tokens-এ $3 এবং প্রতি 1 million output tokens-এ $15। Claude Opus 5-এর মূল্য যথাক্রমে $5 এবং $25। স্থানীয় model-এর ক্ষেত্রে প্রতি token-এর জন্য কোনো খরচ নেই। এর পরিবর্তে server-এর মাসিক খরচ দিতে হয়, আপনি এটি ব্যবহার না করলেও server চালু থাকে।

খরচ সমান হওয়ার সীমা মানুষ যতটা মনে করে, তার চেয়ে কম। কার্যকর open model চালানোর মতো পর্যাপ্ত memory-সহ একটি VPS-এর জন্য প্রতি মাসে বাস্তব খরচ হয়। বেশির ভাগ সময় VPS নিষ্ক্রিয় থাকে। আপনার ব্যবহার যদি অনিয়মিত হয়, hosted API সাধারণত সস্তা। আপনার ব্যবহার যদি নিরবচ্ছিন্ন হয়, অথবা আপনার data network-এর বাইরে পাঠানো না যায়, তাহলে local model উভয় ক্ষেত্রেই সুবিধাজনক।

বেশির ভাগ team শেষ পর্যন্ত যে বাস্তবসম্মত সমাধান গ্রহণ করে, সেটি হলো একটি মিশ্র ব্যবস্থা। উচ্চ volume এবং কম difficulty-এর কাজের জন্য স্থানীয়ভাবে একটি open model চালান। কঠিন request-গুলো hosted frontier model-এ পাঠান। উভয় model-এর সামনে একটি gateway রাখুন, যাতে application-গুলোকে কোনটি ব্যবহৃত হচ্ছে তা জানতে না হয় এবং application code পরিবর্তন না করেই দুটির মধ্যে কাজের সীমা পরিবর্তন করতে পারেন। এই architecture-ই "self hosted Claude"-এর বাস্তব রূপ। আক্ষরিক সংস্করণটির বিপরীতে, এটি বাস্তবে বিদ্যমান। আপনি যদি সম্পূর্ণ agent stack-ও নিজে চালাতে চান, তাহলে self-hosted AI agent-গুলোর সংক্ষিপ্ত পর্যালোচনা উপলভ্য বিকল্পগুলো ব্যাখ্যা করে।

FAQ

আমি কি Claude-এর model weights ডাউনলোড করে locally চালাতে পারি?

না। Anthropic কখনও কোনো Claude model-এর weights release করেনি, এবং self hosting অনুমোদন করে এমন কোনো licence নেই। অনলাইনে downloadable "Claude model" হিসেবে প্রচারিত যেকোনো কিছু হয় বিভ্রান্তিকর নামে প্রকাশিত অন্য কোনো model, নয়তো API কল করা একটি wrapper। এতে API key প্রয়োজন হলে সেটি local নয়।

Claude-এর সবচেয়ে কাছাকাছি open model কোনটি?

এর কোনো exact match নেই, এবং সেরা model-গুলোর অবস্থান প্রতি কয়েক মাসে বদলায়। পরীক্ষার জন্য উপযোগী open weight family হলো Llama, Qwen, Mistral, Gemma এবং DeepSeek। Summarising, classification এবং simple code edit-এর ক্ষেত্রে 8 থেকে 14 billion parameter-এর একটি ভালো open model বাস্তবে কার্যকর। দীর্ঘ multi step reasoning এবং agentic tool use-এর ক্ষেত্রে hosted frontier model-এর সঙ্গে ব্যবধান এখনও বড়। Leaderboard-এর ওপর নির্ভর না করে নিজের prompt দিয়ে পরীক্ষা করুন।

LiteLLM কি self-hosted OpenRouter?

Routing এবং key management-এর দিক থেকে কার্যত হ্যাঁ। LiteLLM আপনার server-এ চলে, একটি OpenAI compatible endpoint প্রকাশ করে এবং Anthropic, Ollama ও অধিকাংশ অন্যান্য provider-এ proxy করে। আপনি প্রতি key-র spend cap, model routing এবং log পড়ার জন্য একটি কেন্দ্রীয় স্থান পান। তবে এটি local inference দেয় না: Claude-এ পাঠানো request এখনও Anthropic-এ যায়।

নিজের server-এ Claude Code চালালে কি আমার code private থাকে?

না। Process যেখানেই চলুক, Claude Code যে file content পড়ে তা Anthropic API-তে পাঠায়। VPS আপনাকে agent-এর isolation দেয়, content-এর privacy নয়। Agent-কে একটি dedicated unprivileged user দিন, credentials এবং সম্পর্কহীন repository থেকে দূরে রাখুন, এবং এটি যে সব content পড়তে পারে সেগুলো server-এর বাইরে চলে যায়—এভাবে বিবেচনা করুন।