SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-23

Coding agent के साथ Ollama का उपयोग कैसे करें

अपने कोडिंग एजेंट को स्थानीय Ollama मॉडल से कनेक्ट करने का तरीका जानें। इसमें base URL सेटिंग, dummy API key का उपयोग और context length की महत्वपूर्ण सीमाएं विस्तार से समझाई गई हैं।

आप क्या कनेक्ट कर रहे हैं

आप अपने कोडिंग एजेंट के साथ Ollama का उपयोग कर सकते हैं, और यह कनेक्शन लोगों की अपेक्षा से कहीं अधिक सरल है। आपको केवल एक base URL बदलना है और एक model name चुनना है। API key फ़ील्ड में अभी भी एक मान की आवश्यकता होती है, लेकिन स्थानीय सर्वर इसे अनदेखा कर देता है, इसलिए कोई भी स्ट्रिंग काम करेगी।

Ollama पोर्ट 11434 पर listen करता है और एक ही समय में दो request shapes को सर्व करता है। /v1/chat/completions OpenAI-compatible shape है, और Ollama का दस्तावेज़ीकरण बताता है कि वहाँ key की आवश्यकता है लेकिन उसे अनदेखा कर दिया जाता है। /v1/messages Anthropic-compatible shape है, जिसका उपयोग Claude Code करता है। आपका एजेंट पहले से ही इन दो में से एक का उपयोग करता है, इसलिए इसमें और कुछ भी बदलने की आवश्यकता नहीं है।

इस भाग में पाँच मिनट लगते हैं। परिणाम उपयोगी होगा या नहीं, यह दो सेटिंग्स पर निर्भर करता है जिन्हें लगभग कोई नहीं बदलता: context length और keep-alive, साथ ही मॉडल को उस प्रकार का काम देना जिसमें वह कुशल है। दोनों के लिए अलग-अलग सेक्शन दिए गए हैं, और वास्तविक सीमाएँ अंत में बताई गई हैं।

कौन से कोडिंग एजेंट लोकल बेस URL स्वीकार करते हैं

परीक्षण का एक ही प्रश्न है: क्या टूल बेस URL सेटिंग को एक्सपोज़ करता है? यदि ऐसा है, तो यह आपके सर्वर से बात कर सकता है।

Ollama, Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs और VS Code के लिए इंटीग्रेशन पेज प्रकाशित करता है। Aider अपने स्वयं के Ollama सपोर्ट का दस्तावेजीकरण अलग से करता है। अगस्त 2026 में कोडिंग एजेंट से लोग जो समझते हैं, उसमें से अधिकांश इसमें शामिल हैं। वे सभी एक ही प्रारूप (shape) का उपयोग नहीं करते हैं, और यही अंतर है जहाँ सेटअप विफल हो जाते हैं।

  • अधिकांश एजेंट OpenAI-संगत एंडपॉइंट चाहते हैं। उन्हें बेस URL http://localhost:11434/v1 और कोई भी नॉन-एम्प्टी API की स्ट्रिंग दें।
  • Claude Code बिल्कुल भी OpenAI बेस URL स्वीकार नहीं करता है। यह Anthropic Messages API का उपयोग करता है, इसलिए इसे ANTHROPIC_BASE_URL को http://localhost:11434 पर सेट करने की आवश्यकता होती है, जहाँ Ollama /v1/messages को सर्व करता है।
  • Codex, OpenAI Responses API का उपयोग करता है। Ollama /v1/responses को भी सर्व करता है, जिसे वर्जन 0.13.3 में जोड़ा गया था।
  • बिना बेस URL सेटिंग वाले एजेंट को रीडायरेक्ट नहीं किया जा सकता है, क्योंकि एंडपॉइंट क्लाइंट में ही इन-बिल्ट होता है। इसके बजाय सामने एक ट्रांसलेशन लेयर रखें, जैसे कि एक सेल्फ-होस्टेड LiteLLM गेटवे, और अपने मॉडल को उस प्रारूप में फिर से एक्सपोज़ करें जिसकी क्लाइंट को आवश्यकता है।

Ollama आपके लिए ये कॉन्फ़िगरेशन लिख सकता है। ollama launch opencode आपके द्वारा चुने गए मॉडल के लिए इनलाइन कॉन्फ़िगरेशन के साथ OpenCode शुरू करता है, ollama launch claude Claude Code के लिए भी ऐसा ही करता है, और ollama launch droid --config टूल को लॉन्च किए बिना कॉन्फ़िगरेशन लिखता है।

Ollama इंस्टॉल करें और टूल कॉल करने में सक्षम मॉडल पुल करें

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama ls

इंस्टॉलर एक systemd unit जोड़ता है और उसे start करता है, इसलिए systemctl status ollama को active (running) प्रिंट करना चाहिए। यदि ऐसा नहीं होता है, तो journalctl -e -u ollama कारण प्रिंट करेगा।

मॉडल को टूल कॉलिंग का समर्थन करना चाहिए, क्योंकि टूल कॉलिंग ही वह तरीका है जिससे एक एजेंट काम करता है। यह एक फाइल पढ़ता है, एक patch लिखता है, टेस्ट चलाता है, फिर विफलता को पढ़ता है और दोबारा प्रयास करता है। जो मॉडल टूल कॉल नहीं कर सकता, वह बदलाव करने के बजाय उसे prose में वर्णित करेगा, और एजेंट लूप में फंस जाएगा या रुक जाएगा। पुल करने से पहले ollama.com पर मॉडल के पेज पर tools लेबल देखें। qwen3-coder:30b में यह सुविधा है, और अगस्त 2026 तक यह टैग 19 GB का डाउनलोड है जिसमें 256K context window है। यदि आपका बॉक्स केवल CPU-आधारित है या उसमें RAM कम है, तो VPS पर Qwen 27B टैग के लिए मेमोरी गणना यह दर्शाती है कि डाउनलोड करने से पहले 8 से 64 GB में वास्तव में क्या फिट बैठता है। एक बार जब आप इसे पुल कर लेते हैं, तो वे गीगाबाइट सर्वर की root disk पर आ जाते हैं, जो VPS का वह हिस्सा है जिसमें सबसे कम जगह खाली होती है, इसलिए Ollama अपनी मॉडल फाइलें कहाँ रखता है और उन्हें कहीं और कैसे ले जाएं डिस्क भरने से पहले पढ़ना उचित है।

अब पुष्टि करें कि सर्वर वास्तव में किन नामों को सर्व कर रहा है:

curl http://localhost:11434/v1/models

उस रिस्पॉन्स में मौजूद स्ट्रिंग्स वही हैं जो आपके एजेंट कॉन्फ़िगरेशन में अक्षर-दर-अक्षर होनी चाहिए। इसे पहले चेक करने से अधिकांश model-not-found त्रुटियां हल हो जाती हैं। यदि Ollama अभी तक इंस्टॉल नहीं है, तो विस्तृत जानकारी VPS पर Ollama के साथ LLM को self-host करना में उपलब्ध है।

OpenCode को Ollama पर पॉइंट करें

~/.config/opencode/opencode.json को एडिट करें:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "qwen3-coder 30b"
        }
      }
    }
  }
}

models के अंतर्गत मौजूद key वह model name है जिसे Ollama को भेजा जाता है, इसलिए इसे ollama ls से बिल्कुल मेल खाना चाहिए। name field केवल model picker में दिखने वाला label है। opencode को start करें, Ollama provider पर स्विच करें, और यह पुष्टि करने के लिए कि request आपके सर्वर पर ही आई है, journalctl -e -u ollama को monitor करें। Agent को सेटअप करने की प्रक्रिया OpenCode को VPS पर चलाना में बताई गई है।

Claude Code को Ollama पर पॉइंट करें

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b

ANTHROPIC_API_KEY को जानबूझकर खाली स्ट्रिंग पर सेट किया गया है। यदि environment में कोई वास्तविक key रह जाती है, तो आपके requests hosted API पर चले जाएंगे, जिससे आपको बिल का भुगतान करना पड़ेगा और local inference नहीं मिलेगा। ollama launch claude आपके लिए यह सब सेट कर देता है।

यह जानें कि compatibility layer क्या सुविधाएँ नहीं देता है। यह tool_choice या prompt caching को implement नहीं करता है, और इसमें कोई token counting endpoint नहीं है, इसलिए जो token numbers आप देखते हैं, वे model के अपने tokenizer द्वारा अनुमानित हैं। Claude Code एक बड़ा system prompt और टूल सेट भी साथ लाता है, इसलिए इसे chat client की तुलना में अधिक context की आवश्यकता होती है। क्या-क्या सुविधाएँ काम करती हैं और क्या नहीं, इस व्यापक प्रश्न को क्या आप Claude को self-host कर सकते हैं में कवर किया गया है।

Ollama पर Aider को कॉन्फ़िगर करना

export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b

Aider का documentation ollama/ के बजाय ollama_chat/ prefix का उपयोग करने की सलाह देता है। यह आपको .aider.model.settings.yml में प्रति मॉडल context window को पिन करने की सुविधा भी देता है। यह तब उपयोगी होता है जब किसी मॉडल को सर्वर के डिफ़ॉल्ट मान से अलग window size की आवश्यकता होती है:

- name: ollama_chat/qwen3-coder:30b
  extra_params:
    num_ctx: 65536

एक कार्यशील सेटअप के बावजूद गलत परिणाम क्यों मिलते हैं

यह अनुभाग सबसे महत्वपूर्ण है। Ollama उपलब्ध VRAM (GPU पर वीडियो मेमोरी) के आधार पर एक डिफ़ॉल्ट कॉन्टेक्स्ट लेंथ चुनता है, और ये डिफ़ॉल्ट मान प्रकाशित किए जाते हैं:

ChartOllama default context length by available VRAM, documented August 2026
The data behind this chart
[
  {
    "label": "Under 24 GiB VRAM",
    "default_context_tokens": "4,096"
  },
  {
    "label": "24 to 48 GiB VRAM",
    "default_context_tokens": "32,768"
  },
  {
    "label": "48 GiB VRAM or more",
    "default_context_tokens": "262,144"
  }
]

अधिकांश VPS प्लान, और हर CPU-ओनली सर्वर, पहली पंक्ति में आते हैं: 4,096 टोकन। केवल एक बड़ा GPU ही अंतिम पंक्ति में 262,144 टोकन प्राप्त करता है।

कोई भी काम शुरू करने से पहले एक एजेंट 4096 टोकन का उपयोग कर लेता है। सिस्टम प्रॉम्प्ट, टूल डेफिनिशन, रिपॉजिटरी लिस्टिंग और पहली फाइल जिसे वह खोलता है, वे पहले से ही इससे बड़े होते हैं। इसके बाद जो होता है वही मुख्य समस्या है: कोई एरर नहीं आता। Aider का डॉक्यूमेंटेशन बताता है कि Ollama चुपचाप उस कॉन्टेक्स्ट को हटा देता है जो विंडो से बाहर हो जाता है। सबसे पुराने टोकन हट जाते हैं, इसलिए मॉडल उस फाइल के बारे में आत्मविश्वास से जवाब देता है जिसे वह अब देख नहीं सकता, या वह उस निर्देश को भूल जाता है जो आपने दो चरण पहले दिया था। यही वह तंत्र है जिसके कारण अधिकांश रिपोर्टें आती हैं कि लोकल मॉडल कोड लिखने के लिए बहुत धीमा या अक्षम है। संख्या का चुनाव स्वयं एक निर्णय है, और प्रत्येक आकार पर KV कैश मेमोरी में num_ctx की लागत को पढ़ने के बाद ही कोई निर्णय लेना उचित है।

Ollama का डॉक्यूमेंटेशन कहता है कि एजेंट और कोडिंग टूल जैसे कार्यों के लिए इसे कम से कम 64000 टोकन पर सेट किया जाना चाहिए। इसे सर्वर पर सेट करें:

sudo systemctl edit ollama.service

ओवरराइड फाइल में ये लाइनें जोड़ें:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"

फिर रिलोड और रीस्टार्ट करें:

sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama ps

ollama ps जांच का तरीका है। यह एक CONTEXT कॉलम प्रिंट करता है, और वह संख्या वही है जो मॉडल को वास्तव में प्राप्त हुई है। आपके ID और SIZE अलग होंगे:

NAME               ID              SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3-coder:30b    a1b2c3d4e5f6    24 GB    100% GPU     64000      4 minutes from now

इसे एजेंट के बजाय सर्वर पर सेट करें, इसके दो कारण हैं। OpenAI चैट कंप्लीशन स्कीमा में कॉन्टेक्स्ट लेंथ के लिए कोई फील्ड नहीं है, इसलिए OpenAI-संगत क्लाइंट इसकी मांग नहीं कर सकता। और यह सेटिंग प्रति सर्वर होती है, इसलिए आप जिस भी एजेंट को उस बॉक्स की ओर निर्देशित करेंगे, वह इसे इनहेरिट कर लेगा। आउटपुट साइड की अपनी सीमा होती है, और कॉन्टेक्स्ट लेंथ के विपरीत यह कम्पैटिबिलिटी एंडपॉइंट पर जाती है, इसलिए जब कोई रिप्लाई पैच के बीच में रुक जाए तो num_predict और max_tokens फील्ड जो इससे मैप होता है का उपयोग करें। यदि किसी मॉडल को अलग विंडो की आवश्यकता है, तो उसे Modelfile के साथ एक कॉपी में शामिल करें:

FROM qwen3-coder:30b
PARAMETER num_ctx 65536
ollama create qwen3-coder-64k -f Modelfile

कॉन्टेक्स्ट मुफ्त नहीं है। एक लंबी विंडो अधिक मेमोरी की खपत करती है, इसलिए PROCESSOR कॉलम पर नज़र रखें। 100% GPU वह है जो आप चाहते हैं। एक बार जब मॉडल का हिस्सा CPU पर चला जाता है, तो टोकन दर इतनी गिर जाती है कि एजेंट लूप अनुपयोगी हो जाता है, और लोकल LLM पर टोकन प्रति सेकंड मापना ही वह तरीका है जिससे आप अपने बॉक्स की वास्तविक सीमा का पता लगा सकते हैं। मशीन खरीदने से पहले उसका आकार निर्धारित करने के बारे में कोडिंग एजेंट VPS को कितनी RAM और CPU की आवश्यकता होती है में बताया गया है।

अनुरोधों के बीच मॉडल को लोड रखें

डिफ़ॉल्ट रूप से, Ollama अंतिम अनुरोध के 5 मिनट बाद मॉडल को अनलोड कर देता है। यह चैट बॉक्स के लिए तो ठीक है, लेकिन एजेंट के काम के लिए गलत है। जब आप diff पढ़ने के लिए रुकते हैं, तो टाइमर समाप्त हो जाता है, और अगला अनुरोध पहला टोकन दिखाई देने से पहले डिस्क से दसियों गीगाबाइट weights को फिर से लोड करता है। यह एक हैंग की तरह प्रतीत होता है।

OLLAMA_KEEP_ALIVE एक duration स्ट्रिंग लेता है जैसे कि 10m या 24h, सेकंड की एक साधारण संख्या, मॉडल को अनिश्चित काल तक लोड रखने के लिए -1, या तुरंत अनलोड करने के लिए 0। इसे context length के साथ सेट करें:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"

keep_alive अनुरोध फ़ील्ड केवल Ollama के नेटिव /api/generate और /api/chat एंडपॉइंट्स पर मौजूद है, न कि compatibility एंडपॉइंट्स पर, इसलिए एक एजेंट इसे प्रति अनुरोध सेट नहीं कर सकता है। एनवायरनमेंट वेरिएबल ही एकमात्र विकल्प है जो आपके पास है। जब आपको मेमोरी वापस चाहिए हो, तो ollama stop qwen3-coder:30b सर्वर को रोके बिना मॉडल को अनलोड कर देता है। यदि आप चाहते हैं कि यह सेटिंग रीबूट के बाद भी बनी रहे, या आप पूरे दिन मेमोरी में weights रखने और उस मेमोरी को वापस पाने के बीच संतुलन बनाना चाहते हैं, तो Ollama मॉडल को मेमोरी में लोड रखना दोनों स्थितियों में काम करता है।

Ollama को एक अलग सर्वर पर चलाना

Ollama डिफ़ॉल्ट रूप से localhost पर bind होता है। इसे किसी अन्य मशीन से एक्सेस करने के लिए, उसी systemd override में OLLAMA_HOST=0.0.0.0:11434 सेट करें और service को restart करें।

ऐसा केवल private network पर ही करें। Ollama का documentation स्पष्ट करता है कि local API के लिए किसी authentication की आवश्यकता नहीं होती है। इसलिए, यदि port 11434 internet के लिए खुला है, तो कोई भी आपके hardware का उपयोग कर सकता है और आपके agent द्वारा भेजा गया डेटा पढ़ सकता है। इसके दो सुरक्षित विकल्प हैं। bind को localhost पर ही रहने दें और अपने laptop से SSH के माध्यम से port को forward करें:

ssh -N -L 11434:localhost:11434 you@your-vps

आपका agent लगातार http://localhost:11434/v1 की ओर संकेत करता रहेगा और उसे कोई अंतर महसूस नहीं होगा। दूसरा विकल्प VPN का उपयोग करना है, जिसमें Ollama को 0.0.0.0 के बजाय VPN address पर bind किया जाता है। यदि कई लोग या कई agents एक ही box का उपयोग करेंगे, तो Ollama का scheduler उस load के लिए नहीं बना है, और Ollama और vLLM के बीच तुलना यह दर्शाती है कि throughput का अंतर कहाँ नुकसान पहुँचाना शुरू करता है।

स्थानीय कोडिंग मॉडल कहाँ बेहतर है और कहाँ नहीं

आपके द्वारा होस्ट किया गया मॉडल, हर कार्य के लिए frontier API का विकल्प नहीं है। यह चार प्रकार के कार्यों में स्पष्ट रूप से बेहतर है।

  • थोक में किए जाने वाले यांत्रिक बदलाव, जहाँ हर बदलाव छोटा हो और आप उसे जाँच सकें। रिपॉजिटरी में नाम बदलना, टाइप हिंट्स जोड़ना, डॉकस्ट्रिंग्स लिखना, टिप्पणियों का अनुवाद करना। मॉडल घंटों तक चलता है और बिल में कोई वृद्धि नहीं होती।
  • ऐसा काम जिसे आपके हार्डवेयर से बाहर नहीं जाना चाहिए। गोपनीयता समझौते के अंतर्गत क्लाइंट कोड, या कोई आंतरिक रिपॉजिटरी जिसे आप किसी तीसरे पक्ष को भेजने के लिए अधिकृत नहीं हैं।
  • ऑफलाइन और एयर-गैप्ड मशीनें, जहाँ कॉल करने के लिए कोई होस्टेड API उपलब्ध ही नहीं है।
  • अनुमानित लागत। एक बार सर्वर का भुगतान हो जाने के बाद, लूप में टोकन खर्च करने वाले एजेंट की कोई अतिरिक्त लागत नहीं होती, जो कि metered API के बिल्कुल विपरीत है। GPU VPS की लागत API टोकन के मुकाबले कब बराबर होती है में इसका गणित दिया गया है।

यह लंबे और बहु-चरणीय कार्यों में विफल रहता है। "पता लगाएँ कि यह टेस्ट क्यों विफल हो रहा है, कारण ठीक करें, कॉलर्स को अपडेट करें" जैसे कार्यों में लगातार कई सही टूल कॉल्स की आवश्यकता होती है, जिसमें पूरा इतिहास संदर्भ (context) में बना रहना चाहिए। एक साधारण सर्वर पर 8B से 14B रेंज का मॉडल अक्सर गलत टूल कॉल उत्पन्न करेगा, या कुछ चरणों के बाद योजना भूल जाएगा, और आप कार्य पूरा करने की तुलना में उसे निर्देशित करने में अधिक समय व्यतीत करेंगे। यह प्रॉम्प्ट की समस्या नहीं है जिसे आप लिखकर ठीक कर सकें। यह क्षमता (capacity) की समस्या है।

यह तब भी विफल रहता है जब गलत होना महंगा हो और आप हर पंक्ति को न पढ़ें। स्थानीय मॉडल को सीमित कार्य दें जिनके आउटपुट को आप सत्यापित कर सकें, और जिस काम को आप चरण-दर-चरण नहीं जाँचेंगे, उसके लिए होस्टेड मॉडल का ही उपयोग करें।

विफलता के प्रकार और वे संदेश जो आपको दिखाई देंगे

curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused. सर्वर चल नहीं रहा है, या एजेंट किसी अन्य होस्ट की ओर इंगित है। systemctl status ollama चलाएं, फिर journalctl -e -u ollama चलाएं।

एजेंट रिपोर्ट करता है कि मॉडल मौजूद नहीं है। आपके कॉन्फ़िगरेशन में दिया गया नाम सर्वर द्वारा प्रदान किए जा रहे नाम से मेल नहीं खाता है। इसकी तुलना curl http://localhost:11434/v1/models से करें और वहां से स्ट्रिंग कॉपी करें। टैग नाम का हिस्सा होता है, इसलिए यदि कॉन्फ़िगरेशन में ऐसा टैग है जिसे आपने कभी पुल (pull) नहीं किया, तो वह विफल हो जाएगा, भले ही वैसा ही कोई अन्य मॉडल इंस्टॉल हो।

एजेंट गद्य (prose) में उत्तर देता है और फ़ाइल को एडिट नहीं करता है। या तो मॉडल में टूल सपोर्ट नहीं है, या अनुरोध और उसकी टूल परिभाषाएं पहले ही कॉन्टेक्स्ट विंडो को भर चुकी हैं। मॉडल पेज पर tools लेबल की जांच करें, फिर ollama ps में CONTEXT कॉलम देखें।

पहले टोकन से पहले लंबी चुप्पी, फिर सामान्य गति। कीप-अलाइव (keep-alive) समाप्त हो गया है और वेट्स (weights) को डिस्क से फिर से पढ़ा जा रहा है। OLLAMA_KEEP_ALIVE सेट करें।

मॉडल उस फ़ाइल का खंडन करता है जिसे उसने अभी पढ़ा है। कॉन्टेक्स्ट ट्रंकेशन (Context truncation)। ollama ps आमतौर पर CONTEXT का ऐसा मान दिखाता है जो आपके द्वारा सेट किए गए मान से छोटा होता है, क्योंकि एनवायरनमेंट वेरिएबल आपके शेल में चला गया, न कि systemd यूनिट में।

सब कुछ काम कर रहा है, लेकिन धीरे, और PROCESSOR का मान 100% GPU नहीं है। मॉडल और उसका कॉन्टेक्स्ट VRAM में फिट नहीं हो रहा है। कॉन्टेक्स्ट की लंबाई कम करें, या किसी छोटे मॉडल या छोटे क्वांटाइजेशन (quantisation) पर स्विच करें। दोबारा पुल करने से पहले, q4_K_M, q8_0 और fp16 में से प्रत्येक की मेमोरी लागत क्या है, और गुणवत्ता वास्तव में कहाँ गिरती है यह बताता है कि एक स्टेप नीचे जाने पर आपको कितनी जगह मिलती है और इसके बदले में आप क्या खोते हैं।

FAQ

क्या मैं Claude Code को Ollama पर पॉइंट कर सकता हूँ?

हाँ, लेकिन OpenAI-compatible URL के साथ नहीं। Claude Code, Anthropic Messages API का उपयोग करता है और Ollama उसी आकार में इसे port 11434 पर उपलब्ध कराता है। /v1/messages का उपयोग करें। ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama और एक खाली ANTHROPIC_API_KEY को export करें, फिर इसे claude --model qwen3-coder:30b के साथ शुरू करें। ollama launch claude आपके लिए वही सेटिंग्स लिख देता है। यह compatibility layer tool_choice या prompt caching को लागू नहीं करता है, और इसमें कोई token counting endpoint नहीं है, इसलिए दिखाए गए token counts अनुमानित हैं।

मेरा local model उस कोड के बारे में उत्तर क्यों देता है जिसे वह देख नहीं सकता?

क्योंकि request अब context window में फिट नहीं होती है, और इसका सबसे पुराना हिस्सा बिना किसी error के हटा दिया गया है। Ollama अपने default context को उपलब्ध VRAM के आधार पर सेट करता है, और 24 GiB से नीचे यह default 4,096 tokens होता है, जिसे एक agent का system prompt और tool definitions अकेले ही पार कर जाते हैं। systemd unit में OLLAMA_CONTEXT_LENGTH=64000 सेट करें, Ollama को restart करें, और पुष्टि करें कि ollama ps में CONTEXT column नया मान दिखाता है।

मुझे VPS पर coding agent के लिए कौन सा model चलाना चाहिए?

वह सबसे बड़ा model चुनें जिसमें tools label हो और जो 64k context window के साथ memory में फिट हो जाए, और code के लिए tuned model को प्राथमिकता दें। पर्याप्त VRAM वाले GPU सर्वर पर qwen3-coder:30b एक सामान्य उत्तर है। यदि वह tag आपके सर्वर के लिए बहुत बड़ा है, तो Nemotron 3.5 Lightning के लिए RAM के आंकड़े और CPU-only गति डाउनलोड करने से पहले एक उपयोगी तुलना प्रदान करते हैं। लगभग 14B parameters से नीचे, एक model कोड के बारे में सवालों के जवाब तो अच्छी तरह दे सकता है, लेकिन multi-step edits में विफल हो सकता है, क्योंकि agent का काम tool calls में छोटी formatting गलतियों के लिए दंडित करता है। एक sample prompt के बजाय अपनी खुद की repository से एक वास्तविक कार्य के साथ परीक्षण करें।

क्या मुझे अपने model पर coding agent चलाने के लिए GPU की आवश्यकता है?

व्यावहारिक रूप से हाँ। CPU-only inference काम करता है और एकल प्रश्नों के लिए ठीक है, लेकिन एक agent प्रति कार्य कई requests भेजता है और प्रत्येक request एक लंबे इतिहास को फिर से पढ़ती है, इसलिए धीमी token दर दो मिनट के कार्य को एक घंटे में बदल देती है। ollama ps में PROCESSOR column की जाँच करें: 100% GPU के अलावा कोई भी मान होने का मतलब है कि model का कुछ हिस्सा CPU पर चल रहा है, और token दर तेजी से गिर जाती है।

#ollama#coding-agent#openai-compatible#local-llm#self-hosted-ai