Ollama-வை உங்கள் Coding Agent-உடன் இணைப்பது எப்படி?
Coding agent-ல் Ollama-வை இணைக்க தேவையான base URL, dummy API key மற்றும் context length அமைப்புகளை அறியுங்கள். எந்தெந்த பணிகளுக்கு local model சிறந்தது என்பதையும் தெரிந்துகொள்ளுங்கள்.
நீங்கள் இணைப்பது என்ன
உங்கள் coding agent-உடன் Ollama-வை நீங்கள் பயன்படுத்தலாம், இதற்கான இணைப்பு பலரும் எதிர்பார்ப்பதை விட மிக எளிமையானது. நீங்கள் ஒரு base URL-ஐ மாற்ற வேண்டும் மற்றும் ஒரு model பெயரைத் தேர்ந்தெடுக்க வேண்டும். API key புலத்திற்கு ஒரு மதிப்பு தேவைப்படும், ஆனால் local server அதை நிராகரித்துவிடும், எனவே எந்தவொரு string-ஐயும் நீங்கள் உள்ளிடலாம்.
Ollama 11434 port-ல் இயங்குகிறது மற்றும் ஒரே நேரத்தில் இரண்டு வகையான request வடிவங்களை வழங்குகிறது. /v1/chat/completions என்பது OpenAI-உடன் இணக்கமான வடிவம், இதில் API key தேவை என்று Ollama ஆவணங்கள் குறிப்பிட்டாலும், அது புறக்கணிக்கப்படுகிறது. /v1/messages என்பது Anthropic-உடன் இணக்கமான வடிவம், இதையே Claude Code பயன்படுத்துகிறது. உங்கள் agent ஏற்கனவே இந்த இரண்டில் ஒன்றை ஆதரிப்பதால், அதைத் தவிர வேறு எதையும் மாற்ற வேண்டியதில்லை.
இந்த அமைப்பிற்கு ஐந்து நிமிடங்கள் மட்டுமே ஆகும். இதன் முடிவு பயனுள்ளதாக இருக்குமா என்பது, பெரும்பாலானோர் மாற்றாத இரண்டு அமைப்புகளைப் பொறுத்தது: அவை context length மற்றும் keep-alive ஆகும். மேலும், அந்த model-க்கு ஏற்ற பணிகளை வழங்குவதும் முக்கியம். இவை இரண்டுக்கும் தனித்தனி பகுதிகள் உள்ளன, மேலும் இதிலுள்ள உண்மையான வரம்புகள் இறுதியில் கொடுக்கப்பட்டுள்ளன.
எந்தெந்த coding agents உள்ளூர் base URL-ஐ ஏற்கும்
இதற்கான சோதனை எளிதானது: அந்த கருவி base URL அமைப்பை வழங்குகிறதா? அவ்வாறு வழங்கினால், அது உங்கள் server-உடன் தொடர்பு கொள்ள முடியும்.
Ollama, Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs மற்றும் VS Code ஆகியவற்றிற்கான ஒருங்கிணைப்பு பக்கங்களை வெளியிடுகிறது. Aider தனது சொந்த Ollama ஆதரவை தனித்தனியாக ஆவணப்படுத்துகிறது. ஆகஸ்ட் 2026 நிலவரப்படி, coding agent என்று மக்கள் குறிப்பிடும் பெரும்பாலான கருவிகளை இது உள்ளடக்குகிறது. இவை அனைத்தும் ஒரே மாதிரியான வடிவமைப்பில் இயங்குவதில்லை, அந்த வேறுபாட்டால்தான் அமைப்புகள் தோல்வியடைகின்றன.
- பெரும்பாலான agents, OpenAI-க்கு இணக்கமான endpoint-ஐ எதிர்பார்க்கின்றன. அவற்றுக்கு
http://localhost:11434/v1base URL-ஐயும், காலியாக இல்லாத ஏதேனும் ஒரு API key string-ஐயும் வழங்கவும். - Claude Code, OpenAI base URL-ஐ ஏற்பதில்லை. இது Anthropic Messages API-ல் இயங்குவதால்,
ANTHROPIC_BASE_URL-ஐhttp://localhost:11434என அமைக்க வேண்டும், அங்கு Ollama/v1/messages-ஐ வழங்குகிறது. - Codex, OpenAI Responses API-ஐப் பயன்படுத்துகிறது. Ollama, பதிப்பு 0.13.3-ல் சேர்க்கப்பட்ட
/v1/responses-ஐயும் வழங்குகிறது. - base URL அமைப்பு இல்லாத ஒரு agent-ஐ திசைதிருப்ப முடியாது, ஏனெனில் endpoint அந்த client-க்குள்ளேயே கட்டமைக்கப்பட்டிருக்கும். அதற்குப் பதிலாக, சுயமாக ஹோஸ்ட் செய்யப்பட்ட LiteLLM gateway போன்ற ஒரு மொழிபெயர்ப்பு அடுக்கை (translation layer) முன்னால் வைத்து, client கோரும் வடிவத்தில் உங்கள் model-ஐ மீண்டும் வெளிப்படுத்தவும்.
Ollama இந்த அமைப்புகளை உங்களுக்காக உருவாக்க முடியும். ollama launch opencode, நீங்கள் தேர்ந்தெடுக்கும் model-க்கான inline config-உடன் OpenCode-ஐத் தொடங்கும், ollama launch claude Claude Code-க்கும் இதையே செய்யும், மேலும் ollama launch droid --config கருவியைத் தொடங்காமலேயே config-ஐ எழுதும்.
Ollama-ஐ நிறுவி, tool calling வசதி கொண்ட model-ஐ பதிவிறக்கம் செய்தல்
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama lsInstaller ஒரு systemd unit-ஐச் சேர்த்து அதைத் தொடங்கும், எனவே systemctl status ollama கட்டளை active (running) என்று காட்ட வேண்டும். அவ்வாறு காட்டவில்லை எனில், journalctl -e -u ollama கட்டளை அதற்கான காரணத்தைக் காட்டும்.
Agent-ன் செயல்பாட்டிற்கு tool calling அவசியமானதால், model-க்கு அந்த வசதி இருக்க வேண்டும். Agent ஒரு கோப்பை வாசித்து, patch எழுதி, சோதனையை இயக்கி, தோல்வியைக் கவனித்து மீண்டும் முயற்சிக்கும். Tool call செய்ய முடியாத model, மாற்றங்களைச் செய்வதற்குப் பதிலாக உரை வடிவில் விவரிக்கும், இதனால் agent சுழற்சியில் சிக்கிவிடும் அல்லது நின்றுவிடும். Ollama.com தளத்தில் உள்ள model பக்கத்தில் tools குறியீடு உள்ளதா என்று சரிபார்த்துப் பதிவிறக்கவும். qwen3-coder:30b இந்த வசதியைக் கொண்டுள்ளது. ஆகஸ்ட் 2026 நிலவரப்படி, இந்த tag 19 GB அளவுடையது மற்றும் 256K context window கொண்டது. உங்கள் server-ல் CPU மட்டுமே இருந்தால் அல்லது RAM குறைவாக இருந்தால், VPS-ல் Qwen 27B tag-க்கான memory கணக்கீடு பகுதியில் 8 GB முதல் 64 GB வரையிலான RAM-ல் எது பொருந்தும் என்பதைப் பார்த்துவிட்டுப் பதிவிறக்கவும்.
இப்போது server-ல் எந்தெந்த model-கள் உள்ளன என்பதை உறுதிப்படுத்தவும்:
curl http://localhost:11434/v1/modelsஅந்தப் பதிலில் உள்ள பெயர்களைத்தான் உங்கள் agent configuration-ல் அப்படியே பயன்படுத்த வேண்டும். இதை முதலில் சரிபார்ப்பதன் மூலம் model-not-found பிழைகளைத் தவிர்க்கலாம். Ollama இன்னும் நிறுவப்படவில்லை எனில், VPS-ல் Ollama மூலம் LLM-ஐ self-host செய்தல் என்ற விரிவான வழிகாட்டியைப் பார்க்கவும்.
OpenCode-ஐ Ollama-வுடன் இணைத்தல்
~/.config/opencode/opencode.json-ஐத் திருத்தவும்:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"name": "Ollama",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"qwen3-coder:30b": {
"name": "qwen3-coder 30b"
}
}
}
}
}models-க்குக் கீழே உள்ள விசை (key) Ollama-வுக்கு அனுப்பப்படும் model-ன் பெயராகும், எனவே அது ollama ls-உடன் சரியாகப் பொருந்த வேண்டும். name புலம் (field) என்பது model picker-ல் காட்டப்படும் பெயருக்கானது மட்டுமே. opencode-ஐத் தொடங்கவும், Ollama provider-க்கு மாறவும், உங்கள் server-க்கு கோரிக்கை (request) வந்துள்ளதா என்பதை உறுதிப்படுத்த journalctl -e -u ollama-ஐக் கவனிக்கவும். Agent-ஐ அமைப்பது OpenCode-ஐ VPS-ல் இயக்குதல் பகுதியில் விளக்கப்பட்டுள்ளது.
Claude Code-ஐ Ollama-வுடன் இணைத்தல்
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30bANTHROPIC_API_KEY வேண்டுமென்றே காலியாக விடப்பட்டுள்ளது. உண்மையான key-ஐ environment-ல் அப்படியே விட்டால், உங்கள் கோரிக்கைகள் hosted API-க்குச் சென்றுவிடும்; இதனால் உங்களுக்குக் கட்டணம் வசூலிக்கப்படும், ஆனால் local inference கிடைக்காது. ollama launch claude இவை அனைத்தையும் உங்களுக்காக அமைத்துவிடும்.
இந்த compatibility layer எவற்றை உள்ளடக்குவதில்லை என்பதைத் தெரிந்துகொள்ளுங்கள். இது tool_choice அல்லது prompt caching-ஐச் செயல்படுத்துவதில்லை. மேலும், இதில் token counting endpoint இல்லை; எனவே நீங்கள் பார்க்கும் token எண்கள், அந்த model-ன் சொந்த tokenizer மூலம் கணிக்கப்பட்ட தோராயமான மதிப்புகளே ஆகும். Claude Code ஒரு பெரிய system prompt மற்றும் பெரிய tool set-ஐக் கொண்டுள்ளதால், ஒரு chat client-ஐ விட இதற்கு அதிக context தேவைப்படுகிறது. எவை செயல்படும், எவை செயல்படாது என்பது குறித்த விரிவான தகவலுக்கு Claude-ஐ நீங்களே host செய்ய முடியுமா என்பதைப் பார்க்கவும்.
Ollama-வில் Aider-ஐப் பயன்படுத்துதல்
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30bAider-ன் ஆவணங்கள் ollama/-க்கு பதிலாக ollama_chat/ முன்னொட்டைப் (prefix) பயன்படுத்தப் பரிந்துரைக்கின்றன. மேலும், ஒவ்வொரு model-க்கும் தேவையான context window-வை .aider.model.settings.yml-ல் pin செய்யவும் இது அனுமதிக்கிறது. ஒரு model-க்கு server-ன் default அமைப்பிலிருந்து மாறுபட்ட window அளவு தேவைப்படும்போது இது பயனுள்ளதாக இருக்கும்.
- name: ollama_chat/qwen3-coder:30b
extra_params:
num_ctx: 65536செயல்படும் அமைப்பு ஏன் தவறான முடிவுகளைத் தருகிறது
இதுவே மிக முக்கியமான பகுதி. Ollama தான் கண்டறியும் VRAM (GPU-வில் உள்ள video memory)-ஐப் பொறுத்து ஒரு default context length-ஐத் தேர்வு செய்கிறது. அந்த அளவுகள் கீழே கொடுக்கப்பட்டுள்ளன:
The data behind this chart
[
{
"label": "Under 24 GiB VRAM",
"default_context_tokens": "4,096"
},
{
"label": "24 to 48 GiB VRAM",
"default_context_tokens": "32,768"
},
{
"label": "48 GiB VRAM or more",
"default_context_tokens": "262,144"
}
]பெரும்பாலான VPS திட்டங்களும், CPU-மட்டும் கொண்ட server-களும் முதல் வரிசையில் வருகின்றன: 4,096 tokens. பெரிய GPU கொண்டவை மட்டுமே கடைசி வரிசையில் உள்ள 262,144 tokens-ஐப் பெறுகின்றன.
ஒரு agent எந்த வேலையையும் தொடங்குவதற்கு முன்பே 4096 tokens-ஐப் பயன்படுத்திவிடுகிறது. system prompt, tool definitions, repository listing மற்றும் அது திறக்கும் முதல் கோப்பு ஆகியவை ஏற்கனவே இந்த அளவை விடப் பெரியவை. அடுத்து நடப்பதுதான் சிக்கல்: எந்த error-ம் காட்டப்படாது. Ollama-வின் ஆவணங்களின்படி, context window-ஐத் தாண்டும் தகவல்களை அது அமைதியாக நீக்கிவிடும். பழைய tokens நீக்கப்படுவதால், ஏற்கனவே பார்த்த கோப்பைப் பற்றி model தவறான தகவல்களைத் தரும் அல்லது இரண்டு படிகளுக்கு முன்பு நீங்கள் கொடுத்த கட்டளையை மறந்துவிடும். local model-ஆல் code எழுத முடியவில்லை என்ற புகார்களுக்கு இந்த நுட்பமே முக்கிய காரணம்.
Agents மற்றும் coding tools போன்ற பணிகளுக்குக் குறைந்தபட்சம் 64000 tokens இருக்க வேண்டும் என்று Ollama-வின் ஆவணங்கள் கூறுகின்றன. இதை server-ல் அமைக்கவும்:
sudo systemctl edit ollama.serviceoverride கோப்பில் இந்த வரிகளைச் சேர்க்கவும்:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"பின்பு reload செய்து restart செய்யவும்:
sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama psollama ps என்பது சரிபார்ப்புக்கான கட்டளை. இது CONTEXT நிரலை அச்சிடும், அந்த எண்ணே model உண்மையில் பெற்ற tokens-ன் அளவு. உங்கள் ID மற்றும் SIZE மதிப்புகள் மாறுபடும்:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3-coder:30b a1b2c3d4e5f6 24 GB 100% GPU 64000 4 minutes from nowஇந்த அமைப்பை agent-ல் செய்யாமல் server-ல் செய்ய இரண்டு காரணங்கள் உள்ளன. OpenAI chat completions schema-வில் context length-க்கான புலம் (field) இல்லை, எனவே OpenAI-compatible client-ஆல் அதைக் கேட்க முடியாது. மேலும், இந்த அமைப்பு server-க்கு பொதுவானது, எனவே அந்த server-ஐப் பயன்படுத்தும் அனைத்து agent-களும் இதைப் பெற்றுக்கொள்ளும். ஒரு குறிப்பிட்ட model-க்கு மட்டும் வேறு அளவு தேவைப்பட்டால், அதை Modelfile மூலம் ஒரு நகலில் உருவாக்கவும்:
FROM qwen3-coder:30b
PARAMETER num_ctx 65536ollama create qwen3-coder-64k -f ModelfileContext இலவசமானது அல்ல. அதிக window அளவு அதிக memory-ஐப் பயன்படுத்தும், எனவே PROCESSOR நிரலைக் கவனிக்கவும். 100% GPU என்பது நீங்கள் எதிர்பார்க்கும் அளவு. model-ன் ஒரு பகுதி CPU-க்குச் சென்றால், token rate மிகவும் குறைந்துவிடும், இதனால் agent loop-ஐப் பயன்படுத்த முடியாது. local LLM-ல் tokens per second-ஐ அளவிடுதல் மூலம் உங்கள் server-ன் உண்மையான திறனைக் கண்டறியலாம். வாங்குவதற்கு முன்பே server-ன் அளவைத் தீர்மானிப்பது coding agent VPS-க்கு எவ்வளவு RAM மற்றும் CPU தேவை என்பதில் விளக்கப்பட்டுள்ளது.
கோரிக்கைகளுக்கு இடையே model-ஐ நினைவகத்தில் வைத்திருத்தல்
இயல்பாக, Ollama ஒரு model-ஐ கடைசியாகப் பயன்படுத்திய 5 நிமிடங்களுக்குப் பிறகு நினைவகத்திலிருந்து நீக்கிவிடும். இது ஒரு chat interface-க்கு சரியாக இருக்கலாம், ஆனால் agent பணிகளுக்கு இது உகந்ததல்ல. நீங்கள் ஒரு diff-ஐப் படிக்கத் தாமதப்படுத்தும்போது, அந்த நேரம் முடிந்துவிடும்; அடுத்த கோரிக்கை வரும்போது, முதல் token-ஐ உருவாக்குவதற்கு முன்பே பல gigabytes எடையுள்ள weights-ஐ வட்டில் (disk) இருந்து மீண்டும் ஏற்ற வேண்டியிருக்கும். இது system முடங்கியது போன்ற உணர்வைத் தரும்.
OLLAMA_KEEP_ALIVE என்பது 10m அல்லது 24h போன்ற கால அளவு சரத்தை (duration string), அல்லது வினாடிகளின் எண்ணிக்கையை ஏற்கும். -1 என்று குறிப்பிட்டால் model காலவரையின்றி நினைவகத்தில் இருக்கும், 0 என்று குறிப்பிட்டால் உடனடியாக நீக்கப்படும். இதை context length-க்கு அருகில் அமைக்கவும்:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"keep_alive என்ற கோரிக்கை புலம் (request field) Ollama-வின் சொந்த /api/generate மற்றும் /api/chat endpoints-ல் மட்டுமே உள்ளது, compatibility endpoints-ல் இல்லை. எனவே, ஒரு agent-ஆல் ஒவ்வொரு கோரிக்கைக்கும் இதை அமைக்க முடியாது. Environment variable மட்டுமே இதற்கான ஒரே வழி. உங்களுக்கு மீண்டும் நினைவகம் தேவைப்படும்போது, ollama stop qwen3-coder:30b கட்டளையைப் பயன்படுத்தி server-ஐ நிறுத்தாமலேயே model-ஐ நினைவகத்திலிருந்து நீக்கலாம்.
Ollama-ஐ தனி server-ல் இயக்குதல்
Ollama இயல்பாக localhost-ல் மட்டுமே இயங்கும். மற்றொரு கணினியிலிருந்து இதை அணுக, அதே systemd override கோப்பில் OLLAMA_HOST=0.0.0.0:11434-ஐ அமைத்து, service-ஐ restart செய்யவும்.
இதை ஒரு private network-ல் மட்டுமே செய்யவும். Ollama-வின் local API-க்கு எந்தவித authentication-ம் தேவையில்லை என்று அதன் ஆவணங்கள் குறிப்பிடுகின்றன. எனவே, 11434 port-ஐ இணையத்திற்குத் திறந்து வைத்தால், எவர் வேண்டுமானாலும் உங்கள் hardware-ஐப் பயன்படுத்தலாம் மற்றும் உங்கள் agent அனுப்பும் தகவல்களைப் படிக்கலாம். இதற்கு இரண்டு பாதுகாப்பான வழிகள் உள்ளன. bind-ஐ localhost-லேயே வைத்துக்கொண்டு, உங்கள் laptop-லிருந்து SSH மூலம் port-ஐ forward செய்யவும்:
ssh -N -L 11434:localhost:11434 you@your-vpsஉங்கள் agent தொடர்ந்து http://localhost:11434/v1-ஐயே குறிக்கும், இதில் எந்த மாற்றமும் தெரியாது. மற்றொரு வழி VPN-ஐப் பயன்படுத்துவது; இதில் Ollama-வை 0.0.0.0-க்கு பதிலாக VPN முகவரியில் bind செய்ய வேண்டும். பல நபர்கள் அல்லது பல agents ஒரே server-ஐப் பயன்படுத்தினால், Ollama-வின் scheduler அந்தச் சுமையைச் சமாளிக்க வடிவமைக்கப்படவில்லை. Ollama மற்றும் vLLM இடையேயான ஒப்பீடு throughput-ல் ஏற்படும் பாதிப்பு எங்கு தொடங்குகிறது என்பதைக் காட்டுகிறது.
உள்ளூர் coding model எப்போது சிறந்தது, எப்போது சிறந்தது அல்ல
நீங்கள் host செய்யும் model-ஆல் இயக்கப்படும் ஒரு agent, ஒவ்வொரு பணியிலும் frontier API-க்கு மாற்றாக இருக்காது. நான்கு வகையான பணிகளில் இது தெளிவாக வெற்றி பெறுகிறது.
- மொத்தமாகச் செய்யப்படும் இயந்திரத்தனமான மாற்றங்கள் (Bulk mechanical edits). இதில் ஒவ்வொரு மாற்றமும் சிறியது மற்றும் அதை உங்களால் சரிபார்க்க முடியும். ஒரு repository முழுவதும் பெயர்களை மாற்றுவது, type hints சேர்ப்பது, docstrings எழுதுவது, comments-ஐ மொழிபெயர்ப்பது போன்றவை. இந்த model பல மணிநேரம் இயங்கினாலும், கட்டணம் உயராது.
- உங்கள் hardware-ஐ விட்டு வெளியேறக்கூடாத பணிகள். ரகசிய ஒப்பந்தத்தின் கீழ் உள்ள client code அல்லது மூன்றாம் தரப்பினருக்கு அனுப்ப அனுமதி இல்லாத internal repository.
- Offline மற்றும் air-gapped இயந்திரங்கள். இவற்றில் அழைப்பதற்கு எந்த hosted API-யும் இருக்காது.
- கணிக்கக்கூடிய செலவு. server-க்கான கட்டணத்தைச் செலுத்திய பிறகு, loop-ல் tokens-ஐப் பயன்படுத்தும் agent-க்கு கூடுதல் செலவு இல்லை. இது metered API-க்கு நேர்மாறானது. API tokens-க்கு எதிராக GPU VPS எப்போது லாபகரமாகிறது என்பதில் இதற்கான கணக்கீடு உள்ளது.
நீண்ட, பல படிகளைக் கொண்ட பணிகளில் இது தோல்வியடைகிறது. "இந்த test ஏன் தோல்வியடைகிறது என்பதைக் கண்டறிந்து, காரணத்தைச் சரிசெய்து, callers-ஐப் புதுப்பித்தல்" போன்ற பணிகளுக்கு, தொடர்ச்சியாகப் பல சரியான tool calls தேவைப்படும்; மேலும் முழு வரலாறும் context-ல் இருக்க வேண்டும். ஒரு சாதாரண server-ல் இயங்கும் 8B முதல் 14B வரையிலான model, தவறான tool call-ஐ உருவாக்கலாம் அல்லது சில சுற்றுகளுக்குப் பிறகு திட்டத்தை மறந்துவிடலாம். அந்தப் பணியை நீங்களே செய்திருந்தால் எவ்வளவு நேரம் ஆகுமோ, அதைவிட அதிக நேரத்தை அதை வழிநடத்துவதற்கே நீங்கள் செலவிட வேண்டியிருக்கும். இது prompt மூலம் சரிசெய்யக்கூடிய பிரச்சினை அல்ல. இது அதன் திறன் (capacity) சார்ந்த பிரச்சினை.
தவறு நடந்தால் அதிக விலை கொடுக்க வேண்டியிருக்கும் மற்றும் ஒவ்வொரு வரியையும் உங்களால் வாசிக்க முடியாது என்ற சூழலிலும் இது தோல்வியடைகிறது. உள்ளூர் model-க்கு நீங்கள் சரிபார்க்கக்கூடிய குறுகிய பணிகளை மட்டும் கொடுங்கள். படிப்படியாகச் சரிபார்க்க முடியாத பணிகளுக்கு hosted model-ஐப் பயன்படுத்துங்கள்.
தோல்வி முறைகள் மற்றும் நீங்கள் காணும் சரங்கள் (strings)
curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused. சர்வர் இயங்கவில்லை அல்லது ஏஜென்ட் வேறொரு ஹோஸ்ட்டைச் சுட்டிக்காட்டுகிறது. systemctl status ollama-ஐ இயக்கவும், பிறகு journalctl -e -u ollama-ஐ இயக்கவும்.
மாடல் இல்லை என்று ஏஜென்ட் தெரிவிக்கிறது. உங்கள் கான்ஃபிகரேஷனில் உள்ள பெயர், சர்வர் வழங்கும் பெயருடன் பொருந்தவில்லை. அதை curl http://localhost:11434/v1/models உடன் ஒப்பிட்டு, அங்கிருந்து அந்தச் சரத்தை நகலெடுக்கவும். டேக் (tag) என்பது பெயரின் ஒரு பகுதி, எனவே நீங்கள் ஒருபோதும் பதிவிறக்காத டேக்-ஐக் கொண்ட கான்ஃபிகரேஷன், ஒத்த மாடல் நிறுவப்பட்டிருந்தாலும் தோல்வியடையும்.
ஏஜென்ட் உரை வடிவில் பதிலளிக்கிறது, ஆனால் கோப்பைத் திருத்தவில்லை. மாடலுக்கு டூல் சப்போர்ட் (tool support) இல்லை அல்லது கோரிக்கையும் அதன் டூல் வரையறைகளும் ஏற்கனவே கான்டெக்ஸ்ட் விண்டோவை (context window) நிரப்பிவிட்டன. மாடல் பக்கத்தில் உள்ள tools லேபிளைச் சரிபார்க்கவும், பிறகு ollama ps-ல் உள்ள CONTEXT நெடுவரிசையைச் சரிபார்க்கவும்.
முதல் டோக்கனுக்கு முன் நீண்ட அமைதி, பிறகு இயல்பான வேகம். கீப்-அலைவ் (keep-alive) காலாவதியாகிவிட்டது, வெயிட்டுகள் (weights) மீண்டும் டிஸ்க்கிலிருந்து வாசிக்கப்படுகின்றன. OLLAMA_KEEP_ALIVE-ஐ அமைக்கவும்.
மாடல் தான் வாசித்த கோப்பிற்கு முரணாகப் பதிலளிக்கிறது. கான்டெக்ஸ்ட் ட்ரன்கேஷன் (context truncation). ollama ps பெரும்பாலும் நீங்கள் அமைத்ததாக நினைப்பதை விட சிறிய CONTEXT மதிப்பைக் காட்டும், ஏனெனில் என்விரான்மென்ட் வேரியபிள் (environment variable) systemd யூனிட்டிற்குப் பதிலாக உங்கள் ஷெல்லிற்குச் சென்றிருக்கும்.
அனைத்தும் வேலை செய்கிறது, ஆனால் மெதுவாக உள்ளது மற்றும் PROCESSOR என்பது 100% GPU ஆக இல்லை. மாடல் மற்றும் அதன் கான்டெக்ஸ்ட் VRAM-ல் பொருந்தவில்லை. கான்டெக்ஸ்ட் நீளத்தைக் குறைக்கவும் அல்லது சிறிய மாடலுக்கு அல்லது சிறிய குவாண்டிசேஷனுக்கு (quantisation) மாறவும்.
FAQ
நான் Claude Code-ஐ Ollama-வுடன் இணைக்க முடியுமா?
முடியும், ஆனால் OpenAI-க்கு இணக்கமான URL மூலம் அல்ல. Claude Code, Anthropic Messages API-ஐப் பயன்படுத்துகிறது. Ollama இந்த API வடிவத்தை /v1/messages என்ற முகவரியில், அதே 11434 port-ல் வழங்குகிறது. ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama மற்றும் காலியான ANTHROPIC_API_KEY ஆகியவற்றை export செய்யவும், பின் claude --model qwen3-coder:30b மூலம் தொடங்கவும். ollama launch claude உங்களுக்காக அதே அமைப்புகளைச் சேமிக்கும். இந்த இணக்கத்தன்மை அடுக்கு (compatibility layer) tool_choice அல்லது prompt caching-ஐச் செயல்படுத்துவதில்லை. மேலும், இதில் token-களைக் கணக்கிடும் endpoint இல்லாததால், காட்டப்படும் token எண்ணிக்கை தோராயமானதே.
எனது local model என்னால் பார்க்க முடியாத code-ஐப் பற்றி ஏன் பதிலளிக்கிறது?
ஏனெனில், கோரிக்கை (request) context window-க்குள் பொருந்தவில்லை, மேலும் அதன் பழைய பகுதி எந்தப் பிழையும் இன்றி நீக்கப்பட்டுவிட்டது. Ollama தனது default context-ஐ அது கண்டறியும் VRAM-ஐப் பொறுத்து அமைக்கிறது. 24 GiB-க்குக் கீழே, அந்த default அளவு 4,096 tokens ஆகும். ஒரு agent-ன் system prompt மற்றும் tool definitions மட்டுமே இந்த அளவை விட அதிகமாக இருக்கும். systemd unit-ல் OLLAMA_CONTEXT_LENGTH=64000-ஐ அமைக்கவும், Ollama-வை restart செய்யவும், பின் ollama ps-ல் உள்ள CONTEXT column புதிய மதிப்பைக் காட்டுகிறதா என்பதை உறுதிப்படுத்தவும்.
VPS-ல் coding agent-க்காக நான் எந்த model-ஐ இயக்க வேண்டும்?
64k context window-டன் நினைவகத்தில் (memory) பொருந்தக்கூடிய, tools label கொண்ட மிகப்பெரிய model-ஐத் தேர்ந்தெடுக்கவும். code-க்காகவே பிரத்யேகமாக வடிவமைக்கப்பட்ட model-களுக்கு முன்னுரிமை அளிக்கவும். போதுமான VRAM கொண்ட GPU server-களில் qwen3-coder:30b பொதுவாகப் பரிந்துரைக்கப்படுகிறது. 14B parameters-க்குக் குறைவான model-கள் code பற்றிய கேள்விகளுக்குச் சரியாகப் பதிலளித்தாலும், பல கட்டத் திருத்தங்களைச் (multi-step edits) செய்யும்போது தோல்வியடையலாம். ஏனெனில், agent பணிகளில் tool calls-ல் ஏற்படும் சிறிய வடிவமைப்புப் பிழைகள் கூடப் பெரிய பாதிப்பை ஏற்படுத்தும். மாதிரி prompt-களைப் பயன்படுத்துவதற்குப் பதிலாக, உங்கள் சொந்த repository-ல் உள்ள ஒரு உண்மையான பணியைச் செய்து சோதிக்கவும்.
எனது சொந்த model-ல் coding agent-ஐ இயக்க எனக்கு GPU தேவையா?
நடைமுறையில் ஆம். CPU-மட்டும் கொண்ட inference ஒற்றைக் கேள்விகளுக்குச் சரியாக இருக்கும். ஆனால், ஒரு agent ஒவ்வொரு பணிக்கும் பல கோரிக்கைகளை அனுப்பும், மேலும் ஒவ்வொன்றும் நீண்ட வரலாற்றை மீண்டும் படிக்கும். எனவே, token வேகம் குறைவாக இருந்தால், இரண்டு நிமிடப் பணி ஒரு மணிநேரம் ஆகலாம். ollama ps-ல் உள்ள PROCESSOR column-ஐச் சரிபார்க்கவும்: 100% GPU தவிர வேறு ஏதேனும் மதிப்பு இருந்தால், model-ன் ஒரு பகுதி CPU-ல் இயங்குகிறது என்று அர்த்தம், இதனால் token வேகம் கடுமையாகக் குறையும்.