SSD Nodes Learn Hosting plans →
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-08-30

Coding Agent-உடன் Ollama-வை இணைப்பது எப்படி?

Coding agent-ல் Ollama-வை இணைக்க தேவையான base URL, dummy API key மற்றும் context length அமைப்புகளை அறியுங்கள். எந்தெந்த பணிகளுக்கு local model சிறந்தது என்பதை இதில் காணலாம்.

நீங்கள் இணைக்கும் விதம்

உங்கள் coding agent-உடன் Ollama-வை இணைக்கலாம், இந்த இணைப்பு பலரும் எதிர்பார்ப்பதை விட எளிமையானது. நீங்கள் ஒரு base URL-ஐ மாற்ற வேண்டும் மற்றும் ஒரு model பெயரைத் தேர்ந்தெடுக்க வேண்டும். API key புலத்திற்கு ஒரு மதிப்பு தேவைப்படுகிறது, ஆனால் local server அதைப் புறக்கணித்துவிடும், எனவே எந்தவொரு string-ஐயும் அங்கு உள்ளிடலாம்.

Ollama 11434 port-ல் இயங்குகிறது மற்றும் ஒரே நேரத்தில் இரண்டு வகையான request வடிவங்களை வழங்குகிறது. /v1/chat/completions என்பது OpenAI-உடன் இணக்கமான வடிவம், இதில் API key தேவை என்று Ollama ஆவணங்கள் குறிப்பிட்டாலும், அது புறக்கணிக்கப்படுகிறது. /v1/messages என்பது Anthropic-உடன் இணக்கமான வடிவம், இதையே Claude Code பயன்படுத்துகிறது. உங்கள் agent ஏற்கனவே இந்த இரண்டில் ஏதேனும் ஒன்றை ஆதரிக்கும் என்பதால், அதில் வேறு எந்த மாற்றமும் செய்யத் தேவையில்லை.

இந்த அமைப்பிற்கு ஐந்து நிமிடங்கள் மட்டுமே ஆகும். இதன் முடிவு பயனுள்ளதாக இருக்குமா என்பது, பெரும்பாலானோர் மாற்றாத இரண்டு அமைப்புகளைப் பொறுத்தது: context length மற்றும் keep-alive. மேலும், அந்த model-க்கு ஏற்ற பணிகளை வழங்குவதும் முக்கியம். இவை இரண்டுக்கும் தனித்தனி பகுதிகள் உள்ளன, மேலும் உண்மையான வரம்புகள் இறுதியில் கொடுக்கப்பட்டுள்ளன.

எந்தெந்த coding agents உள்ளூர் base URL-ஐ ஏற்றுக்கொள்கின்றன

இதற்கான சோதனை எளிதானது: அந்த கருவியில் base URL அமைப்பை மாற்றும் வசதி உள்ளதா? அப்படி இருந்தால், அது உங்கள் server-உடன் தொடர்பு கொள்ள முடியும்.

Ollama, Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs மற்றும் VS Code ஆகியவற்றிற்கான ஒருங்கிணைப்பு பக்கங்களை வழங்குகிறது. Aider தனது சொந்த Ollama ஆதரவை தனித்தனியாக ஆவணப்படுத்தியுள்ளது. ஆகஸ்ட் 2026 நிலவரப்படி, coding agent என்று பொதுவாகக் குறிப்பிடப்படும் பெரும்பாலான கருவிகளை இது உள்ளடக்குகிறது. இவை அனைத்தும் ஒரே மாதிரியான வடிவமைப்பைப் பின்பற்றுவதில்லை; இந்த வேறுபாட்டால்தான் பல அமைப்புகள் (setups) தோல்வியடைகின்றன.

  • பெரும்பாலான agents, OpenAI-க்கு இணக்கமான (OpenAI-compatible) endpoint-ஐ எதிர்பார்க்கின்றன. அவற்றுக்கு http://localhost:11434/v1 base URL-ஐயும், ஏதேனும் ஒரு வெற்று அல்லாத API key string-ஐயும் வழங்கவும்.
  • Claude Code, OpenAI base URL-ஐ ஏற்பதில்லை. இது Anthropic Messages API-ல் இயங்குவதால், ANTHROPIC_BASE_URL-ஐ http://localhost:11434 என அமைக்க வேண்டும்; இங்கு Ollama /v1/messages-ஐ வழங்குகிறது.
  • Codex, OpenAI Responses API-ஐப் பயன்படுத்துகிறது. Ollama, பதிப்பு 0.13.3 முதல் /v1/responses-ஐயும் வழங்குகிறது.
  • base URL அமைப்பில்லாத ஒரு agent-ஐ மாற்றியமைக்க முடியாது, ஏனெனில் அதன் endpoint அந்த client-க்குள்ளேயே கட்டமைக்கப்பட்டிருக்கும். அதற்குப் பதிலாக, சுயமாக இயங்கும் LiteLLM gateway போன்ற ஒரு translation layer-ஐ முன்னால் வைத்து, அந்த client கோரும் வடிவமைப்பில் உங்கள் model-ஐ மீண்டும் வெளிப்படுத்தவும்.

Ollama இந்த அமைப்புகளை (configs) உங்களுக்காக உருவாக்க முடியும். ollama launch opencode, நீங்கள் தேர்ந்தெடுக்கும் model-க்கான inline config-உடன் OpenCode-ஐத் தொடங்கும்; ollama launch claude, Claude Code-க்கு இதையே செய்யும்; ollama launch droid --config, அந்த கருவியைத் தொடங்காமலேயே config-ஐ மட்டும் உருவாக்கும்.

Ollama-ஐ நிறுவி, tool-களை அழைக்கும் திறன் கொண்ட model-ஐ pull செய்தல்

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama ls

Installer ஒரு systemd unit-ஐச் சேர்த்து அதைத் தொடக்கிவிடும், எனவே systemctl status ollama கட்டளை active (running) என்று காட்ட வேண்டும். அவ்வாறு காட்டவில்லை என்றால், journalctl -e -u ollama கட்டளை அதற்கான காரணத்தைக் காட்டும்.

Agent செயல்படுவதற்கு tool calling அவசியமானதால், model-க்கு அந்தத் திறன் இருக்க வேண்டும். இது ஒரு கோப்பை வாசித்து, patch-ஐ எழுதி, test-ஐ இயக்கி, பின் தோல்விக்கான காரணத்தைப் படித்து மீண்டும் முயற்சிக்கும். Tool call செய்ய முடியாத model, மாற்றங்களைச் செய்வதற்குப் பதிலாக உரை வடிவில் விவரிக்கும்; இதனால் agent சுழற்சியில் சிக்கிவிடும் அல்லது நின்றுவிடும். Ollama.com-ல் உள்ள model பக்கத்தில் tools label உள்ளதா என்று pull செய்வதற்கு முன் சரிபார்க்கவும். qwen3-coder:30b இந்தத் திறனைக் கொண்டுள்ளது. ஆகஸ்ட் 2026 நிலவரப்படி, இந்த tag 19 GB அளவுள்ள download மற்றும் 256K context window-வைக் கொண்டுள்ளது. உங்கள் server-ல் CPU மட்டுமே இருந்தால் அல்லது RAM குறைவாக இருந்தால், VPS-ல் Qwen 27B tag-க்கான memory கணக்கீடு பகுதியில் 8 முதல் 64 GB RAM-க்குள் எது பொருந்தும் என்பதைப் பார்த்துவிட்டு download செய்யவும். Pull செய்தவுடன், அந்த gigabyte-கள் server-ன் root disk-ல் சேமிக்கப்படும். VPS-ல் பொதுவாக root disk-ல் தான் இடம் குறைவாக இருக்கும் என்பதால், Ollama model கோப்புகளை எங்கே சேமிக்கிறது மற்றும் அவற்றை எப்படி வேறு இடத்திற்கு மாற்றுவது என்பதை disk நிரம்புவதற்கு முன்பே வாசிப்பது நல்லது.

இப்போது server எந்தெந்த model-களை வழங்குகிறது என்பதை உறுதிப்படுத்தவும்:

curl http://localhost:11434/v1/models

அந்தப் பதிலில் உள்ள strings-தான் உங்கள் agent config-ல் இருக்க வேண்டும், எழுத்து மாறாமல் அப்படியே இருக்க வேண்டும். இதை முதலில் சரிபார்ப்பது model-not-found பிழைகளைத் தவிர்க்க உதவும். Ollama இன்னும் நிறுவப்படவில்லை என்றால், VPS-ல் Ollama மூலம் LLM-ஐ self-host செய்வது எப்படி என்ற விரிவான வழிகாட்டியைப் பார்க்கவும்.

Ollama-வுடன் OpenCode-ஐ இணைத்தல்

~/.config/opencode/opencode.json-ஐ திருத்தவும்:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "qwen3-coder 30b"
        }
      }
    }
  }
}

models-க்கு கீழே உள்ள key என்பது Ollama-க்கு அனுப்பப்படும் model-ன் பெயர், எனவே அது ollama ls-உடன் சரியாகப் பொருந்த வேண்டும். name புலம் என்பது model picker-ல் காட்டப்படும் label மட்டுமே. opencode-ஐத் தொடங்கி, Ollama provider-க்கு மாறி, உங்கள் server-க்கு கோரிக்கை வந்துள்ளதா என்பதை உறுதிப்படுத்த journalctl -e -u ollama-ஐ கவனிக்கவும். Agent-ஐ அமைப்பது OpenCode-ஐ VPS-ல் இயக்குதல் பகுதியில் விளக்கப்பட்டுள்ளது.

Claude Code-ஐ Ollama-வுடன் இணைத்தல்

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b

ANTHROPIC_API_KEY வேண்டுமென்றே காலியாக விடப்பட்டுள்ளது. உண்மையான key-ஐ environment-ல் வைத்தால், அது உங்கள் கோரிக்கைகளை hosted API-க்கு அனுப்பிவிடும்; இதனால் உங்களுக்குக் கட்டணம் வசூலிக்கப்படும், ஆனால் local inference கிடைக்காது. ollama launch claude இவை அனைத்தையும் உங்களுக்காக அமைத்துவிடும்.

இந்த compatibility layer எவற்றை உள்ளடக்குவதில்லை என்பதைத் தெரிந்துகொள்ளுங்கள். இது tool_choice அல்லது prompt caching-ஐ செயல்படுத்துவதில்லை. இதில் token counting endpoint கிடையாது, எனவே நீங்கள் பார்க்கும் token எண்கள் அந்த model-ன் சொந்த tokenizer மூலம் கணிக்கப்பட்ட தோராயமான மதிப்புகளே ஆகும். Claude Code ஒரு பெரிய system prompt மற்றும் அதிகப்படியான tool-களைக் கொண்டுள்ளதால், ஒரு chat client-ஐ விட இதற்கு அதிக context தேவைப்படுகிறது. எவை செயல்படும், எவை செயல்படாது என்பது குறித்த விரிவான தகவல்களை Claude-ஐ நீங்களே host செய்ய முடியுமா என்பதில் காணலாம்.

Ollama-வில் Aider-ஐப் பயன்படுத்துதல்

export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b

Aider-ன் ஆவணங்கள் ollama/-க்கு பதிலாக ollama_chat/ முன்னொட்டைப் (prefix) பயன்படுத்தப் பரிந்துரைக்கின்றன. இது ஒவ்வொரு model-க்கும் தேவையான context window-ஐ .aider.model.settings.yml-ல் குறிப்பிட்டுக் கொள்ளவும் அனுமதிக்கிறது. ஒரு model-க்கு server-ன் default அமைப்பிலிருந்து மாறுபட்ட window அளவு தேவைப்படும்போது இது பயனுள்ளதாக இருக்கும்:

- name: ollama_chat/qwen3-coder:30b
  extra_params:
    num_ctx: 65536

செயல்படும் அமைப்பு ஏன் தவறான முடிவுகளைத் தருகிறது

இதுவே மிக முக்கியமான பகுதி. Ollama தான் கண்டறியும் VRAM (GPU-வில் உள்ள video memory) அளவைப் பொறுத்து ஒரு default context length-ஐத் தேர்வு செய்கிறது. அந்த அளவுகள் கீழே கொடுக்கப்பட்டுள்ளன:

ChartOllama default context length by available VRAM, documented August 2026
The data behind this chart
[
  {
    "label": "Under 24 GiB VRAM",
    "default_context_tokens": "4,096"
  },
  {
    "label": "24 to 48 GiB VRAM",
    "default_context_tokens": "32,768"
  },
  {
    "label": "48 GiB VRAM or more",
    "default_context_tokens": "262,144"
  }
]

பெரும்பாலான VPS திட்டங்களும், CPU-மட்டும் கொண்ட server-களும் முதல் வரிசையில் வருகின்றன: 4,096 tokens. பெரிய GPU கொண்டவை மட்டுமே கடைசி வரிசையில் உள்ள 262,144 tokens அளவைப் பெறுகின்றன.

ஒரு agent எந்த வேலையையும் தொடங்குவதற்கு முன்பே 4096 tokens-ஐப் பயன்படுத்திவிடுகிறது. system prompt, tool definitions, repository பட்டியல் மற்றும் அது திறக்கும் முதல் கோப்பு ஆகியவை ஏற்கனவே அந்த அளவை விடப் பெரியவை. அடுத்து நடப்பதுதான் சிக்கல்: எந்த error-ம் காட்டப்படாது. Ollama, window அளவைத் தாண்டும் context-ஐ அமைதியாக நீக்கிவிடும் என்று Aider-ன் ஆவணங்கள் கூறுகின்றன. பழைய tokens நீக்கப்படுவதால், ஏற்கனவே பார்த்த கோப்பைப் பற்றி model தவறாகப் பேசும் அல்லது இரண்டு படிகளுக்கு முன்பு நீங்கள் கொடுத்த கட்டளையை மறந்துவிடும். local model-ஆல் code எழுத முடியவில்லை என்ற புகார்களுக்கு இந்த நுட்பமே காரணம். இந்த எண்ணைத் தேர்வு செய்வது உங்கள் முடிவு. ஒவ்வொரு அளவிலும் KV cache memory-க்கு num_ctx எவ்வளவு செலவாகும் என்பதைத் தீர்மானிக்கும் முன் வாசிப்பது நல்லது.

Agents மற்றும் coding tools போன்ற பணிகளுக்குக் குறைந்தபட்சம் 64000 tokens இருக்க வேண்டும் என்று Ollama-ன் ஆவணங்கள் கூறுகின்றன. இதை server-ல் அமைக்கவும்:

sudo systemctl edit ollama.service

override கோப்பில் இந்த வரிகளைச் சேர்க்கவும்:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"

பின்பு reload செய்து restart செய்யவும்:

sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama ps

ollama ps என்பது சரிபார்ப்புக்கானது. இது CONTEXT நிரலை அச்சிடும், அந்த எண்ணே model உண்மையில் பெற்ற அளவு. உங்கள் ID மற்றும் SIZE மதிப்புகள் மாறுபடும்:

NAME               ID              SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3-coder:30b    a1b2c3d4e5f6    24 GB    100% GPU     64000      4 minutes from now

இரண்டு காரணங்களுக்காக, agent-ல் அமைப்பதற்குப் பதிலாக server-லேயே இதை அமைக்கவும். OpenAI chat completions schema-வில் context length-க்கான புலம் (field) இல்லை, எனவே OpenAI-compatible client-ஆல் அதைக் கேட்க முடியாது. மேலும், இந்த அமைப்பு server-க்கு உரியது, எனவே அந்த server-ஐப் பயன்படுத்தும் அனைத்து agent-களும் இதைப் பெற்றுக்கொள்ளும். வெளியீட்டுப் பகுதிக்குத் தனி வரம்பு உண்டு. context length போலன்றி, இது compatibility endpoint வழியாகச் செல்லும். எனவே, ஒரு patch-ன் பாதியில் பதில் நின்றுவிட்டால், num_predict மற்றும் அதனுடன் தொடர்புடைய max_tokens field ஆகியவற்றைப் பயன்படுத்தவும். ஒரு குறிப்பிட்ட model-க்கு வேறு window தேவைப்பட்டால், Modelfile மூலம் ஒரு நகலை உருவாக்கி அதில் அமைக்கவும்:

FROM qwen3-coder:30b
PARAMETER num_ctx 65536
ollama create qwen3-coder-64k -f Modelfile

Context இலவசமானது அல்ல. பெரிய window அதிக memory-ஐ எடுத்துக்கொள்ளும், எனவே PROCESSOR நிரலைக் கவனிக்கவும். 100% GPU என்பதே நீங்கள் எதிர்பார்க்கும் நிலை. model-ன் ஒரு பகுதி CPU-க்குச் சென்றால், token வேகம் மிகவும் குறைந்துவிடும், இதனால் agent loop-ஐப் பயன்படுத்த முடியாது. local LLM-ல் tokens per second-ஐ அளவிடுவது உங்கள் server-ன் உண்மையான வரம்பைக் கண்டறிய உதவும். வாங்குவதற்கு முன்பே இயந்திரத்தின் அளவைத் தீர்மானிப்பது பற்றி coding agent VPS-க்கு எவ்வளவு RAM மற்றும் CPU தேவை என்பதில் விளக்கப்பட்டுள்ளது.

கோரிக்கைகளுக்கு இடையே model-ஐ நினைவகத்தில் வைத்திருத்தல்

இயல்பாக, Ollama ஒரு model-ஐ அதன் கடைசி கோரிக்கைக்குப் பிறகு 5 நிமிடங்களில் நினைவகத்திலிருந்து நீக்கிவிடும் (unload). இது ஒரு chat interface-க்குச் சரியாக இருக்கலாம், ஆனால் agent பணிகளுக்கு இது உகந்ததல்ல. நீங்கள் ஒரு diff-ஐப் படிக்க இடைநிறுத்தம் செய்யும்போது, அந்த நேரம் முடிந்துவிடும்; அடுத்த கோரிக்கையின்போது, முதல் token தோன்றுவதற்கு முன்பே பல gigabytes எடையுள்ள weights வட்டில் (disk) இருந்து மீண்டும் ஏற்றப்படும். இது system முடங்கியது போன்ற உணர்வைத் தரும்.

OLLAMA_KEEP_ALIVE என்பது 10m அல்லது 24h போன்ற கால அளவு சரத்தை (duration string), அல்லது வினாடிகளின் எண்ணிக்கையை ஏற்கும். -1 என்று குறிப்பிட்டால் model காலவரையின்றி நினைவகத்தில் இருக்கும், 0 என்று குறிப்பிட்டால் உடனடியாக நீக்கப்படும். இதை context length-க்கு அருகில் அமைக்கவும்:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"

keep_alive கோரிக்கை புலம் (request field) Ollama-வின் சொந்த /api/generate மற்றும் /api/chat endpoints-ல் மட்டுமே உள்ளது, compatibility endpoints-ல் இல்லை. எனவே, ஒரு agent-ஆல் ஒவ்வொரு கோரிக்கைக்கும் இதை அமைக்க முடியாது. சூழல் மாறி (environment variable) மட்டுமே உங்களிடம் உள்ள ஒரே வழி. உங்களுக்கு நினைவகம் தேவைப்படும்போது, ollama stop qwen3-coder:30b கட்டளையைப் பயன்படுத்தி server-ஐ நிறுத்தாமலேயே model-ஐ நீக்கலாம். இந்த அமைப்பை reboot-க்குப் பிறகும் நிலைநிறுத்த விரும்பினாலோ, அல்லது நாள் முழுவதும் நினைவகத்தில் weights-ஐ வைத்திருப்பதற்கும் நினைவகத்தை விடுவிப்பதற்கும் இடையே உள்ள சமநிலையை ஆராய விரும்பினாலோ, Ollama model-ஐ நினைவகத்தில் வைத்திருத்தல் குறித்த வழிகாட்டி இரண்டிற்கும் உதவும்.

Ollama-ஐ தனி server-ல் இயக்குதல்

Ollama இயல்பாக localhost-ல் மட்டுமே இயங்கும். மற்றொரு கணினியிலிருந்து அதை அணுக, அதே systemd override கோப்பில் OLLAMA_HOST=0.0.0.0:11434-ஐ அமைத்து, service-ஐ restart செய்யவும்.

இதை ஒரு private network-ல் மட்டுமே செய்யவும். Ollama-ன் ஆவணங்களின்படி, local API-க்கு எந்தவிதமான authentication-ம் தேவையில்லை. எனவே, 11434 port-ஐ இணையத்திற்குத் திறந்து வைத்தால், எவரும் உங்கள் hardware-ஐப் பயன்படுத்த முடியும்; உங்கள் agent அனுப்பும் தகவல்களைப் படிக்க முடியும். இதற்கு இரண்டு பாதுகாப்பான வழிகள் உள்ளன. Bind-ஐ localhost-லேயே வைத்துவிட்டு, உங்கள் laptop-லிருந்து SSH மூலம் port-ஐ forward செய்யவும்:

ssh -N -L 11434:localhost:11434 you@your-vps

உங்கள் agent தொடர்ந்து http://localhost:11434/v1-ஐயே அணுகும், இதில் எந்த மாற்றமும் தெரியாது. மற்றொரு வழி VPN-ஐப் பயன்படுத்துவது; இதில் Ollama-வை 0.0.0.0-க்கு பதிலாக VPN முகவரியில் bind செய்ய வேண்டும். பல நபர்கள் அல்லது பல agents ஒரே server-ஐப் பயன்படுத்தினால், Ollama-ன் scheduler அந்தச் சுமையைச் சமாளிக்க வடிவமைக்கப்படவில்லை. Ollama மற்றும் vLLM இடையேயான ஒப்பீடு throughput-ல் ஏற்படும் பாதிப்பு எங்கு தொடங்குகிறது என்பதை விளக்குகிறது.

உள்ளூர் coding model எப்போது சிறந்தது, எப்போது சிறந்தது அல்ல

நீங்கள் host செய்யும் model-ஆல் இயக்கப்படும் ஒரு agent, எல்லா பணிகளுக்கும் frontier API-க்கு மாற்றாகாது. நான்கு வகையான பணிகளில் இது தெளிவாகச் சிறந்து விளங்குகிறது.

  • மொத்தமாகச் செய்யப்படும் இயந்திரத்தனமான மாற்றங்கள் (Bulk mechanical edits). இதில் ஒவ்வொரு மாற்றமும் சிறியது, அதை உங்களால் சரிபார்க்க முடியும். ஒரு repository முழுவதும் பெயர்களை மாற்றுவது, type hints சேர்ப்பது, docstrings எழுதுவது, comments-ஐ மொழிபெயர்ப்பது போன்றவை. இந்த model பல மணிநேரம் இயங்கினாலும், கட்டணம் உயராது.
  • உங்கள் hardware-ஐ விட்டு வெளியேறக்கூடாத பணிகள். ரகசிய ஒப்பந்தத்தின் கீழ் உள்ள client code, அல்லது மூன்றாம் தரப்பினருக்கு அனுப்ப அனுமதி இல்லாத internal repository.
  • Offline மற்றும் air-gapped இயந்திரங்கள். இவற்றில் அழைப்பதற்கு hosted API வசதி இருக்காது.
  • கணிக்கக்கூடிய செலவு. server-க்கான செலவைச் செய்துவிட்டால், loop-ல் tokens-ஐப் பயன்படுத்தும் agent-க்கு கூடுதல் செலவு இல்லை. இது metered API-க்கு நேர்மாறானது. API tokens-க்கு எதிராக GPU VPS எப்போது லாபகரமாகிறது என்பதில் இதற்கான கணக்கீடுகள் உள்ளன.

நீண்ட, பல படிகளைக் கொண்ட பணிகளில் இது தோல்வியடைகிறது. "இந்த test ஏன் தோல்வியடைகிறது என்பதைக் கண்டறிந்து, காரணத்தைச் சரிசெய்து, callers-ஐப் புதுப்பித்தல்" போன்ற பணிகளுக்கு, தொடர்ச்சியாகப் பல சரியான tool calls தேவைப்படும், மேலும் முழு வரலாறும் context-ல் இருக்க வேண்டும். ஒரு சாதாரண server-ல் 8B முதல் 14B வரம்பில் உள்ள model, தவறான tool call-ஐ உருவாக்கலாம் அல்லது சில சுற்றுகளுக்குப் பிறகு திட்டத்தை மறந்துவிடலாம். அப்போது, அந்தப் பணியைச் செய்ய எடுக்கும் நேரத்தை விட, அதை வழிநடத்தவே நீங்கள் அதிக நேரம் செலவிடுவீர்கள். இது prompt மூலம் சரிசெய்யக்கூடிய பிரச்சினை அல்ல. இது அதன் கொள்ளளவு (capacity) சார்ந்த பிரச்சினை.

தவறுகள் நடப்பது அதிக செலவை ஏற்படுத்தும் மற்றும் ஒவ்வொரு வரியையும் உங்களால் வாசிக்க முடியாது என்ற சூழலிலும் இது தோல்வியடைகிறது. உள்ளூர் model-க்கு நீங்கள் சரிபார்க்கக்கூடிய குறுகிய பணிகளை மட்டும் கொடுங்கள். நீங்கள் படிப்படியாகச் சரிபார்க்க முடியாத பணிகளுக்கு hosted model-ஐப் பயன்படுத்துங்கள்.

தோல்வி முறைகள் மற்றும் நீங்கள் காணும் செய்திகள்

curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused. server இயங்கவில்லை அல்லது agent வேறொரு host-ஐக் குறிக்கிறது. systemctl status ollama-ஐ இயக்கவும், பிறகு journalctl -e -u ollama-ஐ இயக்கவும்.

Model இல்லை என்று agent தெரிவிக்கிறது. உங்கள் config-ல் உள்ள பெயர், server வழங்கும் பெயருடன் பொருந்தவில்லை. அதை curl http://localhost:11434/v1/models உடன் ஒப்பிட்டு, அங்கிருந்து அந்த string-ஐ நகலெடுக்கவும். Tag என்பது பெயரின் ஒரு பகுதி; எனவே, நீங்கள் pull செய்யாத tag-ஐக் குறிப்பிடும் config, அதே போன்ற model நிறுவப்பட்டிருந்தாலும் தோல்வியடையும்.

Agent உரை வடிவில் பதிலளிக்கிறது, ஆனால் கோப்பைத் திருத்தவில்லை. ஒன்று அந்த model-க்கு tool ஆதரவு இல்லை, அல்லது கோரிக்கையும் அதன் tool வரையறைகளும் ஏற்கனவே context window-ஐ நிரப்பிவிட்டன. Model பக்கத்தில் உள்ள tools label-ஐச் சரிபார்க்கவும், பிறகு ollama ps-ல் உள்ள CONTEXT column-ஐச் சரிபார்க்கவும்.

முதல் token-க்கு முன் நீண்ட அமைதி, பிறகு இயல்பான வேகம். Keep-alive காலாவதியாகிவிட்டது, weights மீண்டும் disk-லிருந்து வாசிக்கப்படுகின்றன. OLLAMA_KEEP_ALIVE-ஐ அமைக்கவும்.

Model தான் வாசித்த கோப்பிற்கு முரணாகப் பதிலளிக்கிறது. Context truncation நிகழ்ந்துள்ளது. நீங்கள் அமைத்ததாக நினைக்கும் மதிப்பை விட CONTEXT மதிப்பு குறைவாக இருப்பதை ollama ps பெரும்பாலும் காட்டும்; ஏனெனில் environment variable systemd unit-க்குச் செல்வதற்குப் பதிலாக உங்கள் shell-க்குச் சென்றுவிட்டது.

அனைத்தும் வேலை செய்கிறது, ஆனால் மெதுவாக உள்ளது மற்றும் PROCESSOR என்பது 100% GPU ஆக இல்லை. Model மற்றும் அதன் context VRAM-ல் பொருந்தவில்லை. Context நீளத்தைக் குறைக்கவும், அல்லது சிறிய model அல்லது சிறிய quantisation-க்கு மாறவும். நீங்கள் மீண்டும் pull செய்வதற்கு முன், q4_K_M, q8_0 மற்றும் fp16 ஒவ்வொன்றும் நினைவகத்தில் எவ்வளவு செலவாகும் மற்றும் தரம் எங்கு குறைகிறது என்பதைப் பார்க்கவும்; இது ஒரு படி கீழே இறங்குவதால் எவ்வளவு இடம் கிடைக்கும் மற்றும் எதை இழக்கிறீர்கள் என்பதைத் தெரிவிக்கும்.

FAQ

Claude Code-ஐ Ollama-வுடன் இணைக்க முடியுமா?

ஆம், ஆனால் OpenAI-க்கு இணக்கமான URL மூலம் இதைச் செய்ய முடியாது. Claude Code, Anthropic Messages API-ஐப் பயன்படுத்துகிறது; Ollama அதே 11434 port-ல் /v1/messages வடிவத்தில் அதை வழங்குகிறது. ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama மற்றும் காலியான ANTHROPIC_API_KEY ஆகியவற்றை export செய்து, பின் claude --model qwen3-coder:30b மூலம் தொடங்கவும். ollama launch claude உங்களுக்காக அதே அமைப்புகளை எழுதிவிடும். இந்த compatibility layer, tool_choice அல்லது prompt caching-ஐ செயல்படுத்துவதில்லை. மேலும், இதில் token counting endpoint இல்லாததால், காட்டப்படும் token எண்ணிக்கைகள் தோராயமானவை மட்டுமே.

எனது local model, தன்னால் பார்க்க முடியாத code-ஐப் பற்றி ஏன் பதிலளிக்கிறது?

ஏனெனில், கோரிக்கை (request) context window-க்குள் அடங்கவில்லை, மேலும் அதன் பழைய பகுதி எந்த பிழைச் செய்தியும் இன்றி நீக்கப்பட்டுவிட்டது. Ollama தனது default context-ஐ அது கண்டறியும் VRAM-ஐப் பொறுத்து அமைக்கிறது. 24 GiB-க்குக் குறைவாக இருந்தால், அந்த default அளவு 4,096 tokens ஆகும். ஒரு agent-ன் system prompt மற்றும் tool definitions மட்டுமே இந்த அளவை விட அதிகமாக இருக்கும். systemd unit-ல் OLLAMA_CONTEXT_LENGTH=64000-ஐ அமைத்து, Ollama-வை restart செய்யவும். பின் ollama ps-ல் உள்ள CONTEXT column-ல் புதிய மதிப்பு காட்டப்படுகிறதா என்பதை உறுதிப்படுத்தவும்.

VPS-ல் coding agent-க்காக எந்த model-ஐ இயக்க வேண்டும்?

64k context window-டன் நினைவகத்தில் (memory) பொருந்தக்கூடிய, tools label கொண்ட மிகப்பெரிய model-ஐத் தேர்ந்தெடுக்கவும். code-க்காகவே பிரத்யேகமாக உருவாக்கப்பட்ட model-களுக்கு முன்னுரிமை அளிக்கவும். போதுமான VRAM கொண்ட GPU server-களில் qwen3-coder:30b பொதுவாகப் பரிந்துரைக்கப்படுகிறது. அந்த அளவு உங்கள் server-க்கு மிக அதிகமாக இருந்தால், நீங்கள் download செய்வதற்கு முன் Nemotron 3.5 Lightning-க்கான RAM அளவுகள் மற்றும் CPU-only வேகங்கள் குறித்த ஒப்பீடு பயனுள்ளதாக இருக்கும். 14B parameters-க்குக் குறைவான model-கள், code குறித்த கேள்விகளுக்கு நன்றாகப் பதிலளித்தாலும், பல கட்டத் திருத்தங்களை (multi-step edits) செய்வதில் தோல்வியடையலாம். ஏனெனில், agent பணிகளில் tool calls-ல் ஏற்படும் சிறிய வடிவமைப்புப் பிழைகள் கூட பெரிய பாதிப்பை ஏற்படுத்தும். மாதிரி prompt-களைப் பயன்படுத்துவதற்குப் பதிலாக, உங்கள் சொந்த repository-ல் உள்ள ஒரு உண்மையான பணியை வைத்துச் சோதிக்கவும்.

எனது சொந்த model-ல் coding agent-ஐ இயக்க GPU அவசியமா?

நடைமுறையில் ஆம். CPU-only inference ஒற்றைக் கேள்விகளுக்குச் சரியாக இருக்கும். ஆனால், ஒரு agent ஒவ்வொரு பணிக்கும் பல கோரிக்கைகளை அனுப்பும்; ஒவ்வொன்றும் நீண்ட வரலாற்றை மீண்டும் படிக்கும். எனவே, token வேகம் குறைவாக இருந்தால், இரண்டு நிமிடப் பணி ஒரு மணிநேரம் ஆகலாம். ollama ps-ல் உள்ள PROCESSOR column-ஐச் சரிபார்க்கவும்: 100% GPU தவிர வேறு எந்த மதிப்பும் இருந்தால், model-ன் ஒரு பகுதி CPU-ல் இயங்குகிறது என்று அர்த்தம்; இதனால் token வேகம் கடுமையாகக் குறையும்.

#ollama#coding-agent#openai-compatible#local-llm#self-hosted-ai