SSD Nodes Learn Hosting plans →
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-08-26

coding agent-এর সঙ্গে Ollama কীভাবে ব্যবহার করবেন

Ollama-কে coding agent-এ যুক্ত করতে base URL বদলান, API key-তে dummy string দিন। context length-এর ভুলে কীভাবে সবকিছু ভাঙে এবং local model কোন কাজে জেতে তা জানুন।

আপনি কী সংযোগ করছেন

আপনি আপনার coding agent-এর সঙ্গে Ollama ব্যবহার করতে পারেন। সংযোগের জন্য প্রত্যাশার চেয়ে কম পরিবর্তন লাগে। একটি base URL পরিবর্তন করুন এবং একটি model name নির্বাচন করুন। API key field-এ এখনও একটি মান দিতে হয়, কিন্তু local server সেটি উপেক্ষা করে। তাই যেকোনো string ব্যবহার করা যায়।

Ollama port 11434-এ listen করে এবং একই সময়ে দুই ধরনের request shape পরিবেশন করে। /v1/chat/completions হলো OpenAI-compatible shape। Ollama-এর documentation-এ এই ক্ষেত্রের key-কে required কিন্তু ignored হিসেবে বর্ণনা করা হয়েছে। /v1/messages হলো Anthropic-compatible shape, যা Claude Code ব্যবহার করে। আপনার agent ইতিমধ্যে এই দুইটির একটিতে কথা বলে। তাই agent-এর অন্য কোনো সেটিং পরিবর্তন করতে হবে না।

এই অংশে পাঁচ মিনিট সময় লাগে। ফলাফল ব্যবহারযোগ্য হবে কি না, তা মূলত দুটি setting-এর ওপর নির্ভর করে, যেগুলো প্রায় কেউ পরিবর্তন করে না: context length এবং keep-alive। এ ছাড়া model-কে তার উপযোগী ধরনের কাজ দিতে হবে। এই দুটি setting-এর জন্য আলাদা section থাকবে। প্রকৃত সীমাবদ্ধতাগুলো শেষে দেওয়া হয়েছে।

কোন coding agent স্থানীয় base URL গ্রহণ করে

পরীক্ষাটি একটি প্রশ্নেই সীমাবদ্ধ: tool-টি কি base URL সেট করার সুবিধা দেয়? দিলে এটি আপনার server-এর সঙ্গে যোগাযোগ করতে পারবে।

Ollama, Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs এবং VS Code-এর জন্য integration page প্রকাশ করে। Aider তার নিজস্ব Ollama support আলাদাভাবে নথিভুক্ত করে। August 2026-এ coding agent বলতে সাধারণত যা বোঝানো হয়, তার অধিকাংশই এতে অন্তর্ভুক্ত। এগুলো সবাই একই API format ব্যবহার করে না, এবং setup ব্যর্থ হওয়ার প্রধান কারণ এই পার্থক্য।

  • অধিকাংশ agent OpenAI-compatible endpoint চায়। তাদের base URL হিসেবে http://localhost:11434/v1 দিন এবং যেকোনো non-empty API key string ব্যবহার করুন।
  • Claude Code কোনো OpenAI base URL গ্রহণ করে না। এটি Anthropic Messages API ব্যবহার করে। তাই ANTHROPIC_BASE_URL-কে http://localhost:11434 হিসেবে সেট করতে হবে, যেখানে Ollama /v1/messages পরিবেশন করে।
  • Codex OpenAI Responses API ব্যবহার করে। Ollama /v1/responses-ও পরিবেশন করে; এই সুবিধা version 0.13.3-এ যোগ করা হয়েছে।
  • কোনো agent-এ base URL সেট করার সুবিধা না থাকলে সেটিকে redirect করা যায় না, কারণ endpoint client-এর ভেতরেই নির্ধারিত থাকে। এর সামনে একটি translation layer রাখুন, যেমন self-hosted LiteLLM gateway, এবং client যে format দাবি করে সেই format-এ আপনার model পুনরায় expose করুন।

Ollama আপনার জন্য এই config-গুলো লিখে দিতে পারে। ollama launch opencode আপনার নির্বাচিত model-এর জন্য inline config দিয়ে OpenCode চালু করে, ollama launch claude Claude Code-এর জন্য একই কাজ করে, আর ollama launch droid --config tool চালু না করে config লিখে দেয়।

Ollama ইনস্টল করুন এবং tool call করতে পারে এমন একটি model pull করুন

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama ls

Installer একটি systemd unit যোগ করে এবং সেটি চালু করে। তাই systemctl status ollama চালালে active (running) দেখানোর কথা। তা না হলে journalctl -e -u ollama কারণটি দেখাবে।

Agent কাজ করার জন্য model-কে tool calling সমর্থন করতে হবে। কারণ agent tool calling ব্যবহার করেই কাজ করে। এটি একটি file পড়ে, একটি patch লেখে, test চালায়, তারপর failure পড়ে আবার চেষ্টা করে। Tool call emit করতে না-পারা model edit করার পরিবর্তে prose-এ edit বর্ণনা করবে। ফলে agent একই কাজ বারবার করবে অথবা থেমে যাবে। pull করার আগে ollama.com-এ model-এর page-এ tools label খুঁজুন। qwen3-coder:30b-এ এই label আছে। August 2026 অনুযায়ী এই tag-এর download size 19 GB এবং context window 256K। আপনার box যদি CPU-only হয় বা RAM কম থাকে, download শুরু করার আগে VPS-এ Qwen 27B tag-এর memory arithmetic দেখে 8 থেকে 64 GB-এর মধ্যে বাস্তবে কোনটি চলবে তা যাচাই করুন। Model pull করার পর ওই gigabyte-গুলো server-এর root disk-এ জমা হবে। VPS-এর যেসব storage-এর অব্যবহৃত জায়গা সাধারণত সবচেয়ে কম, root disk তারই অংশ। তাই disk পূর্ণ হওয়ার আগে Ollama কোথায় model file রাখে এবং সেগুলো অন্যত্র কীভাবে সরাবেন পড়ে নিন।

এখন server আসলে কোন নামগুলো serve করছে তা নিশ্চিত করুন:

curl http://localhost:11434/v1/models

ওই response-এ থাকা string-গুলোই agent config-এ character by character একইভাবে রাখতে হবে। আগে এটি পরীক্ষা করলে model-not-found error-এর বেশির ভাগ কারণ নির্ধারণ করা যায়। Ollama এখনও ইনস্টল করা না থাকলে VPS-এ Ollama দিয়ে LLM self-host করা-এ বিস্তারিত নির্দেশনা আছে।

Ollama-এর দিকে OpenCode নির্দেশ করুন

~/.config/opencode/opencode.json সম্পাদনা করুন:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "qwen3-coder 30b"
        }
      }
    }
  }
}

models-এর অধীনের key হলো Ollama-তে পাঠানো model name। তাই এটি ollama ls-এর সঙ্গে হুবহু মিলতে হবে। name field-টি শুধু model picker-এ প্রদর্শিত label। opencode চালু করুন, Ollama provider-এ switch করুন, এবং journalctl -e -u ollama monitor করে নিশ্চিত করুন যে request অন্য কোথাও নয়, আপনার server-এ পৌঁছেছে। Agent নিজে সেট আপ করার নির্দেশনা VPS-এ OpenCode চালানো-এ রয়েছে।

Ollama-তে Claude Code নির্দেশ করুন

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b

ANTHROPIC_API_KEY ইচ্ছাকৃতভাবে একটি খালি string হিসেবে সেট করা হয়েছে। Environment-এ সত্যিকারের key থাকলে আপনার অনুরোধ hosted API-তে পাঠানো হবে। ফলে বিল তৈরি হবে এবং local inference চলবে না। ollama launch claude আপনার জন্য এই সব সেট করে দেয়।

Compatibility layer কোন বিষয়গুলো বাদ রাখে তা জানুন। এটি tool_choice বা prompt caching implement করে না। এর কোনো token counting endpoint-ও নেই। তাই আপনি যে token সংখ্যা দেখেন, সেগুলো model-এর নিজস্ব tokenizer থেকে নেওয়া আনুমানিক হিসাব। Claude Code-এর সঙ্গে একটি বড় system prompt এবং বড় tool set-ও থাকে। তাই chat client-এর তুলনায় এর বেশি context প্রয়োজন হয়। কোন বিষয়গুলো একইভাবে কাজ করে এবং কোনগুলো করে না, তার বিস্তৃত আলোচনা Claude self-host করা যায় কি না-এ রয়েছে।

Ollama-এ Aider নির্দেশ করুন

export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b

Aider-এর documentation-এ ollama/-এর পরিবর্তে ollama_chat/ prefix ব্যবহারের পরামর্শ দেওয়া হয়েছে। .aider.model.settings.yml-এ প্রতিটি model-এর জন্য context window নির্দিষ্ট করাও সম্ভব। server-এর default window থেকে কোনো model-এর আলাদা window প্রয়োজন হলে এটি কার্যকর:

- name: ollama_chat/qwen3-coder:30b
  extra_params:
    num_ctx: 65536

কাজের সেটআপ থেকেও কেন ভুল ফল পাওয়া যায়

এই অংশটিই সবচেয়ে গুরুত্বপূর্ণ। Ollama যে VRAM (GPU-তে থাকা video memory) দেখতে পায়, তার ভিত্তিতে default context length নির্বাচন করে। এই default-গুলো প্রকাশিত:

ChartOllama default context length by available VRAM, documented August 2026
The data behind this chart
[
  {
    "label": "Under 24 GiB VRAM",
    "default_context_tokens": "4,096"
  },
  {
    "label": "24 to 48 GiB VRAM",
    "default_context_tokens": "32,768"
  },
  {
    "label": "48 GiB VRAM or more",
    "default_context_tokens": "262,144"
  }
]

বেশিরভাগ VPS plan এবং প্রতিটি CPU-only server প্রথম সারিতে পড়ে: 4,096 tokens। শেষ সারির 262,144 tokens পেতে বড় GPU প্রয়োজন।

কোনো কাজ শুরু করার আগেই একটি agent 4096 tokens ব্যবহার করে। system prompt, tool definition, repository listing এবং এটি খোলা প্রথম file—সব মিলিয়ে এরই মধ্যে সেই সীমা ছাড়িয়ে যায়। এরপর পুরো সমস্যাটি শুরু হয়: কোনো error দেখা যায় না। Aider-এর documentation অনুযায়ী, window-এর সীমা ছাড়িয়ে যাওয়া context Ollama নীরবে বাদ দেয়। সবচেয়ে পুরোনো tokens বাদ পড়ে। ফলে model এমন কোনো file নিয়ে আত্মবিশ্বাসের সঙ্গে উত্তর দেয় যা সে আর দেখতে পাচ্ছে না, অথবা দুই ধাপ আগে দেওয়া কোনো instruction ভুলে যায়। Local model code লেখার জন্য খুব দুর্বল—এমন অধিকাংশ report-এর পেছনে এই প্রক্রিয়াই থাকে। সংখ্যাটি নির্বাচন করাও আলাদা সিদ্ধান্ত, এবং প্রতিটি আকারে KV cache memory-তে num_ctx-এর খরচ কত তা নির্ধারণের আগে পড়ে নেওয়া উচিত।

Ollama-এর documentation অনুযায়ী agents এবং coding tools-এর মতো কাজের জন্য অন্তত 64000 tokens নির্ধারণ করা উচিত। এটি server-এ সেট করুন:

sudo systemctl edit ollama.service

override file-এ এই line-গুলো যোগ করুন:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"

এরপর reload ও restart করুন:

sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama ps

ollama ps হলো যাচাইয়ের ধাপ। এটি একটি CONTEXT column দেখায়, এবং সেই সংখ্যাটিই model বাস্তবে পেয়েছে। আপনার ID এবং SIZE আলাদা হবে:

NAME               ID              SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3-coder:30b    a1b2c3d4e5f6    24 GB    100% GPU     64000      4 minutes from now

এটি agent-এ নয়, server-এ সেট করুন। এর দুটি কারণ আছে। OpenAI chat completions schema-তে context length-এর জন্য কোনো field নেই। তাই OpenAI-compatible client এটি চাইতে পারে না। আর setting-টি server-ভিত্তিক। ফলে ওই server-এ নির্দেশ করা প্রতিটি agent এটি পায়। Output-এর জন্য আলাদা ceiling আছে। Context length-এর বিপরীতে এটি compatibility endpoint-এর মাধ্যমে পাঠানো যায়। তাই কোনো reply patch-এর মাঝপথে থেমে গেলে num_predict এবং এর সঙ্গে mapping হওয়া max_tokens field ব্যবহার করুন। কোনো model-এর জন্য আলাদা window প্রয়োজন হলে Modelfile দিয়ে একটি copy তৈরি করে setting-টি তাতে নির্দিষ্ট করুন:

FROM qwen3-coder:30b
PARAMETER num_ctx 65536
ollama create qwen3-coder-64k -f Modelfile

Context বিনামূল্যের নয়। দীর্ঘ window বেশি memory ব্যবহার করে। তাই PROCESSOR column পর্যবেক্ষণ করুন। 100% GPU-এর মানই আপনার প্রয়োজন। Model-এর কোনো অংশ CPU-তে চলে গেলে token rate এত কমে যায় যে agent loop ব্যবহারযোগ্য থাকে না। আপনার server-এর প্রকৃত সীমা জানতে local LLM-এ প্রতি সেকেন্ডে tokens মাপা প্রয়োজন। Machine কেনার আগে sizing করার বিষয়টি coding agent VPS-এর জন্য কত RAM ও CPU প্রয়োজন-এ ব্যাখ্যা করা হয়েছে।

অনুরোধগুলোর মধ্যে model loaded রাখুন

ডিফল্টভাবে Ollama সর্বশেষ request-এর 5 মিনিট পরে model unload করে। Chat box-এর জন্য এটি উপযুক্ত, কিন্তু agent-এর কাজের জন্য নয়। আপনি diff পড়ার জন্য বিরতি নেন, timer শেষ হয়ে যায়, এবং প্রথম token প্রদর্শনের আগে পরবর্তী request disk থেকে কয়েক দশ gigabyte weights আবার load করে। এতে প্রক্রিয়াটি আটকে আছে বলে মনে হয়।

OLLAMA_KEEP_ALIVE-এ 10m বা 24h-এর মতো একটি duration string, seconds-এর সাধারণ সংখ্যা, model অনির্দিষ্টকাল loaded রাখার জন্য -1, অথবা সঙ্গে সঙ্গে unload করার জন্য 0 দেওয়া যায়। Context length-এর পাশে এটি সেট করুন:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"

keep_alive request field শুধু Ollama-এর native /api/generate এবং /api/chat endpoint-এ আছে, compatibility endpoint-এ নেই। তাই agent প্রতি request-এ এটি সেট করতে পারে না। Environment variable-ই আপনার একমাত্র নিয়ন্ত্রণের উপায়। Memory আবার প্রয়োজন হলে server বন্ধ না করেই ollama stop qwen3-coder:30b model unload করে। Setting-টি reboot-এর পরেও কার্যকর রাখতে চাইলে, অথবা সারাদিন weights memory-তে রাখার সুবিধা এবং memory ফেরত পাওয়ার সুবিধার মধ্যে সিদ্ধান্ত নিতে চাইলে, Ollama model memory-তে loaded রাখা—উভয় ক্ষেত্রেই কাজ করে।

অন্য সার্ভারে Ollama চালানো

Ollama localhost-এ bind করে। অন্য কোনো মেশিন থেকে এতে সংযোগ করতে একই systemd override-এ OLLAMA_HOST=0.0.0.0:11434 সেট করুন এবং service restart করুন।

এটি শুধু private network-এ করুন। Ollama-এর documentation অনুযায়ী local API-তে কোনো authentication প্রয়োজন হয় না। তাই port 11434 Internet-এ open থাকলে যে কেউ আপনার hardware ব্যবহার করতে এবং আপনার agent যা পাঠায় তা পড়তে পারবে। নিরাপদ দুটি বিকল্প আছে। bind localhost-এ রাখুন এবং আপনার laptop থেকে SSH-এর মাধ্যমে port forward করুন:

ssh -N -L 11434:localhost:11434 you@your-vps

আপনার agent http://localhost:11434/v1-এর দিকেই সংযোগ করতে থাকবে এবং কোনো পার্থক্য বুঝবে না। অন্য বিকল্প হলো VPN ব্যবহার করা। এ ক্ষেত্রে Ollama 0.0.0.0-এর পরিবর্তে VPN address-এ bind করবে। একাধিক ব্যক্তি বা একাধিক agent একই box ব্যবহার করলে Ollama-এর scheduler এই ধরনের load-এর জন্য তৈরি নয়। Ollama এবং vLLM-এর তুলনা দেখুন, throughput-এর পার্থক্য কোথা থেকে সমস্যা তৈরি করতে শুরু করে।

যেখানে local coding model কার্যকর, এবং যেখানে নয়

আপনার host করা model প্রতিটি কাজে frontier API-কে প্রতিস্থাপন করতে পারে না। চার ধরনের কাজে এটি স্পষ্টভাবে বেশি কার্যকর।

  • বড় পরিসরের যান্ত্রিক edit, যেখানে প্রতিটি পরিবর্তন ছোট এবং আপনি তা যাচাই করতে পারেন। একটি repository জুড়ে নাম পরিবর্তন করা, type hint যোগ করা, docstring লেখা, comment অনুবাদ করা। Model কয়েক ঘণ্টা চললেও bill বাড়ে না।
  • যে কাজের তথ্য আপনার hardware-এর বাইরে যাওয়া নিষিদ্ধ। যেমন confidentiality agreement-এর অধীন client code, অথবা এমন internal repository যা third party-কে পাঠানোর অনুমতি আপনার নেই।
  • Offline এবং air-gapped machine, যেখানে call করার মতো কোনো hosted API-ই নেই।
  • পূর্বানুমানযোগ্য খরচ। Server-এর খরচ পরিশোধ করার পর loop-এ token ব্যবহার করা agent-এর জন্য অতিরিক্ত খরচ হয় না। Metered API-তে ঠিক এর বিপরীত। GPU VPS API token-এর তুলনায় কখন খরচের দিক থেকে সমান হয়-এ হিসাব দেওয়া আছে।

দীর্ঘ বহু-ধাপের কাজে এটি দুর্বল। “এই test কেন ব্যর্থ হচ্ছে খুঁজে বের করুন, কারণটি ঠিক করুন, caller-গুলো update করুন”—এ ধরনের কাজে পরপর অনেকগুলো সঠিক tool call দরকার হয় এবং সম্পূর্ণ history context-এ রাখতে হয়। একটি মাঝারি server-এ চলা 8B থেকে 14B range-এর model malformed tool call তৈরি করতে পারে, অথবা কয়েকটি turn-এর পর plan হারিয়ে ফেলতে পারে। তখন কাজটি নিজে করতে যত সময় লাগত, তার চেয়ে model-কে নির্দেশনা দিতেই বেশি সময় ব্যয় হয়। এটি এমন prompt সমস্যা নয়, যা আরও ভালোভাবে লিখে সমাধান করা যায়। এটি capacity-এর সীমাবদ্ধতা।

যখন ভুলের খরচ বেশি এবং আপনি প্রতিটি line পড়বেন না, তখনও এটি দুর্বল। Local model-কে এমন সীমিত কাজ দিন যার output আপনি যাচাই করবেন। আর যে কাজ ধাপে ধাপে যাচাই করবেন না, তার জন্য hosted model ব্যবহার করুন।

ব্যর্থতার ধরন এবং যে স্ট্রিংগুলো আপনি দেখবেন

curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused। সার্ভারটি চালু নেই, অথবা agent-টি অন্য host-এ নির্দেশিত। systemctl status ollama চালান, তারপর journalctl -e -u ollama চালান।

agent জানায় যে model-টি নেই। আপনার config-এ থাকা নামটি server যে নাম পরিবেশন করে, তার সঙ্গে মেলে না। curl http://localhost:11434/v1/models-এর সঙ্গে মিলিয়ে দেখুন এবং সেখানকার string কপি করুন। tag নামের অংশ। তাই এমন tag উল্লেখ করা config ব্যর্থ হবে, যা আপনি কখনও pull করেননি, যদিও একই রকম একটি model ইনস্টল করা থাকে।

agent prose-এ উত্তর দেয় এবং কোনো file সম্পাদনা করে না। হয় model-এ tool support নেই, অথবা request এবং তার tool definition-গুলো মিলে context window ইতিমধ্যে পূর্ণ করে ফেলেছে। model page-এ tools label দেখুন। তারপর ollama ps-এ CONTEXT column পরীক্ষা করুন।

প্রথম token আসার আগে দীর্ঘ নীরবতা, তারপর স্বাভাবিক গতি। keep-alive-এর মেয়াদ শেষ হয়েছে এবং weights আবার disk থেকে পড়া হচ্ছে। OLLAMA_KEEP_ALIVE সেট করুন।

model এইমাত্র পড়া একটি file-এর বিরোধী উত্তর দেয়। এটি context truncation-এর লক্ষণ। ollama ps-এ সাধারণত আপনার সেট করা মানের চেয়ে ছোট CONTEXT value দেখা যায়, কারণ environment variable-টি systemd unit-এর পরিবর্তে আপনার shell-এ গিয়েছে।

সবকিছু কাজ করে, তবে ধীরগতিতে, এবং PROCESSOR হলো না 100% GPU। model এবং তার context VRAM-এ একসঙ্গে ধরছে না। context length কমান, অথবা ছোট model কিংবা ছোট quantisation ব্যবহার করুন। পুনরায় pull করার আগে q4_K_M, q8_0 এবং fp16-এ memory কত লাগে, গুণমান কোথায় কমে, তা জানুন ব্যাখ্যা করে যে এক ধাপ কমালে কতটা জায়গা পাওয়া যায় এবং এর বিনিময়ে কী ত্যাগ করতে হয়।

FAQ

আমি কি Claude Code-কে Ollama-এর দিকে নির্দেশ করতে পারি?

হ্যাঁ, তবে OpenAI-compatible URL দিয়ে নয়। Claude Code Anthropic Messages API ব্যবহার করে, আর Ollama একই port 11434-এ /v1/messages-এ সেই format সরবরাহ করে। ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama এবং একটি খালি ANTHROPIC_API_KEY export করুন, তারপর claude --model qwen3-coder:30b দিয়ে এটি চালু করুন। ollama launch claude আপনার হয়ে একই settings লিখে দেয়। এই compatibility layer tool_choice বা prompt caching implement করে না। এতে token counting endpoint-ও নেই, তাই প্রদর্শিত token count আনুমানিক।

আমার local model যে code দেখতে পাচ্ছে না, সে সম্পর্কে উত্তর দেয় কেন?

কারণ request আর context window-এর মধ্যে fit করছে না, এবং request-এর সবচেয়ে পুরোনো অংশ কোনো error ছাড়াই বাদ পড়েছে। Ollama যে VRAM পায়, সেখান থেকে তার default context নির্ধারণ করে। 24 GiB-এর কম হলে সেই default হলো 4,096 tokens, যা একটি agent-এর system prompt এবং tool definitions একাই অতিক্রম করে। systemd unit-এ OLLAMA_CONTEXT_LENGTH=64000 সেট করুন, Ollama restart করুন, এবং ollama ps-এর CONTEXT column-এ নতুন value দেখা যাচ্ছে কি না নিশ্চিত করুন।

VPS-এ coding agent-এর জন্য কোন model চালানো উচিত?

64k context window সহ memory-তে fit করে এমন tools label-যুক্ত সবচেয়ে বড় model বেছে নিন। Code-এর জন্য tuned model অগ্রাধিকার দিন। পর্যাপ্ত VRAM-সহ GPU server-এ qwen3-coder:30b সাধারণ পছন্দ। সেই tag আপনার server-এর জন্য বড় হলে download করার আগে Nemotron 3.5 Lightning-এর RAM figure এবং CPU-only speed তুলনা হিসেবে কাজে লাগবে। প্রায় 14B parameters-এর নিচে থাকা model code-সম্পর্কিত প্রশ্নের ভালো উত্তর দিতে পারে, কিন্তু multi-step edit-এ ব্যর্থ হতে পারে। কারণ tool call-এ সামান্য formatting mistake-ও agent-এর কাজকে কঠিন করে তোলে। Sample prompt-এর বদলে নিজের repository-এর একটি বাস্তব task দিয়ে পরীক্ষা করুন।

নিজের model-এ coding agent চালাতে কি GPU দরকার?

বাস্তবে, হ্যাঁ। CPU-only inference কাজ করে এবং একক প্রশ্নের জন্য যথেষ্ট। তবে একটি task-এ agent অনেক request পাঠায়, এবং প্রতিটি request-এ দীর্ঘ history আবার পড়ে। তাই token rate ধীর হলে দুই মিনিটের task এক ঘণ্টায় গিয়ে দাঁড়ায়। ollama ps-এ PROCESSOR column পরীক্ষা করুন। 100% GPU ছাড়া অন্য যেকোনো value-এর অর্থ হলো model-এর একটি অংশ CPU-তে চলছে, ফলে token rate দ্রুত কমে যায়।

#ollama#coding-agent#openai-compatible#local-llm#self-hosted-ai