Ollama को कोडिंग एजेंट के साथ कैसे कनेक्ट करें
अपने कोडिंग एजेंट को Ollama से जोड़ने का तरीका जानें। इसमें base URL सेट करना, dummy API key का उपयोग और context length की वह सीमा शामिल है जो अक्सर मॉडल को क्रैश कर देती है।
आप क्या कनेक्ट कर रहे हैं
आप अपने कोडिंग एजेंट के साथ Ollama का उपयोग कर सकते हैं, और इसका कनेक्शन उम्मीद से कहीं अधिक सरल है। आपको केवल एक base URL बदलना होता है और एक model name चुनना होता है। API key फ़ील्ड में अभी भी एक मान (value) की आवश्यकता होती है, लेकिन स्थानीय सर्वर इसे अनदेखा कर देता है, इसलिए कोई भी स्ट्रिंग काम कर जाएगी।
Ollama पोर्ट 11434 पर listen करता है और एक ही समय में दो प्रकार के request shapes को सर्व करता है। /v1/chat/completions OpenAI-compatible shape है, और Ollama का डॉक्यूमेंटेशन बताता है कि यहाँ key की आवश्यकता तो है लेकिन इसे अनदेखा कर दिया जाता है। /v1/messages Anthropic-compatible shape है, जिसका उपयोग Claude Code करता है। आपका एजेंट पहले से ही इन दोनों में से एक का उपयोग करता है, इसलिए इसमें कुछ और बदलने की आवश्यकता नहीं है।
इस हिस्से में पाँच मिनट का समय लगता है। परिणाम उपयोग करने योग्य है या नहीं, यह दो सेटिंग्स पर निर्भर करता है जिन्हें लगभग कोई नहीं बदलता: context length और keep-alive, साथ ही मॉडल को उस तरह का काम देना जिसमें वह सक्षम है। दोनों के लिए अलग-अलग सेक्शन दिए गए हैं, और वास्तविक सीमाएँ अंत में बताई गई हैं।
कौन से कोडिंग एजेंट्स लोकल बेस URL स्वीकार करते हैं
परीक्षण एक ही प्रश्न पर आधारित है: क्या टूल बेस URL सेटिंग को expose करता है? यदि ऐसा है, तो यह आपके सर्वर से बात कर सकता है।
Ollama, Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs और VS Code के लिए इंटीग्रेशन पेज प्रकाशित करता है। Aider अपने स्वयं के Ollama सपोर्ट को अलग से डॉक्यूमेंट करता है। अगस्त 2026 में कोडिंग एजेंट से लोग जो समझते हैं, यह उसका अधिकांश हिस्सा कवर करता है। वे सभी एक ही प्रारूप (shape) का उपयोग नहीं करते हैं, और यही अंतर है जहाँ सेटअप विफल हो जाते हैं।
- अधिकांश एजेंट्स को OpenAI-compatible एंडपॉइंट चाहिए होता है। उन्हें बेस URL
http://localhost:11434/v1और कोई भी नॉन-एम्प्टी API की स्ट्रिंग दें। - Claude Code किसी भी OpenAI बेस URL को स्वीकार नहीं करता है। यह Anthropic Messages API का उपयोग करता है, इसलिए इसे
ANTHROPIC_BASE_URLकोhttp://localhost:11434पर सेट करने की आवश्यकता होती है, जहाँ Ollama/v1/messagesसर्व करता है। - Codex, OpenAI Responses API का उपयोग करता है। Ollama
/v1/responsesभी सर्व करता है, जिसे वर्जन 0.13.3 में जोड़ा गया था। - जिस एजेंट में बेस URL सेटिंग नहीं होती, उसे रीडायरेक्ट नहीं किया जा सकता, क्योंकि एंडपॉइंट क्लाइंट के अंदर ही बिल्ट-इन होता है। इसके बजाय सामने एक ट्रांसलेशन लेयर रखें, जैसे कि एक सेल्फ-होस्टेड LiteLLM गेटवे, और अपने मॉडल को उस प्रारूप में फिर से expose करें जिसकी क्लाइंट को आवश्यकता है।
Ollama आपके लिए ये कॉन्फ़िगरेशन लिख सकता है। ollama launch opencode आपके द्वारा चुने गए मॉडल के लिए इनलाइन कॉन्फ़िगरेशन के साथ OpenCode शुरू करता है, ollama launch claude Claude Code के लिए भी ऐसा ही करता है, और ollama launch droid --config टूल को लॉन्च किए बिना कॉन्फ़िगरेशन लिख देता है।
Ollama इंस्टॉल करें और टूल कॉल करने में सक्षम मॉडल पुल करें
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama lsइंस्टॉलर एक systemd unit जोड़ता है और उसे start करता है, इसलिए systemctl status ollama को active (running) प्रिंट करना चाहिए। यदि ऐसा नहीं होता है, तो journalctl -e -u ollama कारण प्रिंट करेगा।
मॉडल को टूल कॉलिंग का समर्थन करना चाहिए, क्योंकि टूल कॉलिंग ही वह तरीका है जिससे एक एजेंट काम करता है। यह एक फाइल पढ़ता है, पैच लिखता है, टेस्ट चलाता है, फिर विफलता को पढ़ता है और दोबारा प्रयास करता है। जो मॉडल टूल कॉल नहीं कर सकता, वह बदलाव करने के बजाय उसे गद्य (prose) में वर्णित करेगा, और एजेंट लूप में फंस जाएगा या रुक जाएगा। पुल करने से पहले ollama.com पर मॉडल के पेज पर tools लेबल देखें। qwen3-coder:30b में यह सुविधा है, और अगस्त 2026 तक यह टैग 19 GB का डाउनलोड है जिसमें 256K कॉन्टेक्स्ट विंडो है।
अब पुष्टि करें कि सर्वर वास्तव में कौन से नाम सर्व कर रहा है:
curl http://localhost:11434/v1/modelsउस रिस्पॉन्स में मौजूद स्ट्रिंग्स ही वे नाम हैं जो आपके एजेंट कॉन्फ़िगरेशन में अक्षर-दर-अक्षर होने चाहिए। इसे पहले चेक करने से 'model-not-found' की अधिकांश त्रुटियाँ हल हो जाती हैं। यदि Ollama अभी तक इंस्टॉल नहीं है, तो विस्तृत जानकारी VPS पर Ollama के साथ LLM को self-host करना में उपलब्ध है।
Ollama पर OpenCode को पॉइंट करें
~/.config/opencode/opencode.json को एडिट करें:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"name": "Ollama",
"options": {
"baseURL": "http://localhost:11434/v1"
},
"models": {
"qwen3-coder:30b": {
"name": "qwen3-coder 30b"
}
}
}
}
}models के अंतर्गत की key वह model name है जिसे Ollama पर भेजा जाता है, इसलिए इसे ollama ls से बिल्कुल मेल खाना चाहिए। name field केवल model picker में दिखने वाला label है। opencode को start करें, Ollama provider पर switch करें, और यह पुष्टि करने के लिए journalctl -e -u ollama को monitor करें कि request आपके सर्वर पर ही आई है, न कि कहीं और। Agent को setup करने की प्रक्रिया VPS पर OpenCode चलाना में कवर की गई है।
Claude Code को Ollama पर पॉइंट करें
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30bANTHROPIC_API_KEY को जानबूझकर एक खाली स्ट्रिंग पर सेट किया गया है। यदि environment में कोई वास्तविक key रह जाती है, तो आपके requests hosted API पर चले जाएंगे, जिससे आपको बिल प्राप्त होगा और local inference नहीं मिलेगा। ollama launch claude आपके लिए यह सब सेट कर देता है।
यह जानें कि compatibility layer क्या नहीं देता है। यह tool_choice या prompt caching को implement नहीं करता है, और इसमें कोई token counting endpoint नहीं है, इसलिए जो token numbers आप देखते हैं, वे model के अपने tokenizer से प्राप्त अनुमान हैं। Claude Code एक बड़ा system prompt और एक बड़ा tool set भी साथ लाता है, इसलिए इसे chat client की तुलना में अधिक context की आवश्यकता होती है। क्या-क्या काम करता है और क्या नहीं, इस व्यापक प्रश्न को क्या आप Claude को self-host कर सकते हैं में कवर किया गया है।
Ollama के साथ Aider का उपयोग
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30bAider का documentation ollama_chat/ prefix का उपयोग करने की सलाह देता है, न कि ollama/ का। यह आपको .aider.model.settings.yml में प्रति मॉडल context window को पिन करने की सुविधा भी देता है। यह तब उपयोगी होता है जब किसी मॉडल को सर्वर के डिफ़ॉल्ट मान से अलग window size की आवश्यकता होती है:
- name: ollama_chat/qwen3-coder:30b
extra_params:
num_ctx: 65536काम करने वाला सेटअप भी गलत परिणाम क्यों देता है
यह सबसे महत्वपूर्ण सेक्शन है। Ollama उपलब्ध VRAM (GPU की वीडियो मेमोरी) के आधार पर एक डिफ़ॉल्ट कॉन्टेक्स्ट लेंथ चुनता है, और ये डिफ़ॉल्ट मान प्रकाशित किए गए हैं:
The data behind this chart
[
{
"label": "Under 24 GiB VRAM",
"default_context_tokens": "4,096"
},
{
"label": "24 to 48 GiB VRAM",
"default_context_tokens": "32,768"
},
{
"label": "48 GiB VRAM or more",
"default_context_tokens": "262,144"
}
]अधिकांश VPS प्लान और सभी CPU-ओनली सर्वर पहली पंक्ति में आते हैं: 4,096 टोकन। केवल एक बड़ा GPU ही अंतिम पंक्ति में 262,144 टोकन प्राप्त करता है।
कोई भी काम शुरू करने से पहले एक एजेंट 4096 टोकन का उपयोग कर लेता है। सिस्टम प्रॉम्प्ट, टूल डेफिनिशन, रिपॉजिटरी लिस्टिंग और पहली फाइल जिसे वह खोलता है, वे पहले से ही इससे बड़े होते हैं। इसके बाद जो होता है वही मुख्य समस्या है: कोई एरर नहीं आता। Aider का डॉक्यूमेंटेशन बताता है कि Ollama चुपचाप उस कॉन्टेक्स्ट को हटा देता है जो विंडो से बाहर हो जाता है। सबसे पुराने टोकन हट जाते हैं, इसलिए मॉडल उस फाइल के बारे में आत्मविश्वास से जवाब देता है जिसे वह अब देख नहीं सकता, या वह उस निर्देश को भूल जाता है जो आपने दो स्टेप पहले दिया था। यही वह मैकेनिज्म है जिसके कारण अधिकांश रिपोर्ट में कहा जाता है कि लोकल मॉडल कोड लिखने के लिए बहुत कमजोर है।
Ollama का डॉक्यूमेंटेशन कहता है कि एजेंट और कोडिंग टूल जैसे कार्यों के लिए कम से कम 64000 टोकन सेट होने चाहिए। इसे सर्वर पर सेट करें:
sudo systemctl edit ollama.serviceओवरराइड फाइल में ये लाइनें जोड़ें:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"फिर रिलोड और रीस्टार्ट करें:
sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama psollama ps ही जांच है। यह एक CONTEXT कॉलम प्रिंट करता है, और वह संख्या वही है जो मॉडल को वास्तव में प्राप्त हुई है। आपके ID और SIZE अलग होंगे:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3-coder:30b a1b2c3d4e5f6 24 GB 100% GPU 64000 4 minutes from nowइसे एजेंट के बजाय सर्वर पर सेट करें, इसके दो कारण हैं। OpenAI चैट कंप्लीशन स्कीमा में कॉन्टेक्स्ट लेंथ के लिए कोई फील्ड नहीं है, इसलिए OpenAI-संगत क्लाइंट इसकी मांग नहीं कर सकता। और यह सेटिंग प्रति सर्वर होती है, इसलिए आप जिस भी एजेंट को उस बॉक्स की ओर पॉइंट करेंगे, वह इसे इनहेरिट कर लेगा। यदि किसी मॉडल को अलग विंडो की आवश्यकता है, तो उसे Modelfile के साथ एक कॉपी में शामिल करें:
FROM qwen3-coder:30b
PARAMETER num_ctx 65536ollama create qwen3-coder-64k -f Modelfileकॉन्टेक्स्ट मुफ्त नहीं है। एक लंबी विंडो अधिक मेमोरी लेती है, इसलिए PROCESSOR कॉलम पर नजर रखें। 100% GPU वह है जो आप चाहते हैं। एक बार जब मॉडल का हिस्सा CPU पर चला जाता है, तो टोकन रेट इतना गिर जाता है कि एजेंट लूप अनुपयोगी हो जाता है, और लोकल LLM पर टोकन प्रति सेकंड मापना वह तरीका है जिससे आप अपने बॉक्स की वास्तविक सीमा का पता लगा सकते हैं। मशीन खरीदने से पहले उसका आकार तय करने के बारे में कोडिंग एजेंट VPS को कितनी RAM और CPU की आवश्यकता होती है में बताया गया है।
मॉडल को requests के बीच लोड रखें
डिफ़ॉल्ट रूप से, Ollama अपनी अंतिम request के 5 मिनट बाद मॉडल को अनलोड कर देता है। यह चैट बॉक्स के लिए तो ठीक है, लेकिन एजेंट के काम के लिए गलत है। जब आप diff पढ़ने के लिए रुकते हैं, तो टाइमर समाप्त हो जाता है, और अगली request पहला टोकन दिखाई देने से पहले डिस्क से दसियों गीगाबाइट weights को फिर से लोड करती है। यह सिस्टम के हैंग होने जैसा लगता है।
OLLAMA_KEEP_ALIVE एक duration स्ट्रिंग लेता है जैसे कि 10m या 24h, सेकंड की एक साधारण संख्या, मॉडल को अनिश्चित काल तक लोड रखने के लिए -1, या तुरंत अनलोड करने के लिए 0। इसे context length के साथ सेट करें:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"keep_alive request फ़ील्ड केवल Ollama के नेटिव /api/generate और /api/chat एंडपॉइंट्स पर मौजूद है, न कि compatibility एंडपॉइंट्स पर, इसलिए एक एजेंट इसे प्रति request सेट नहीं कर सकता है। एनवायरनमेंट वेरिएबल ही एकमात्र विकल्प है जो आपके पास है। जब आपको मेमोरी वापस चाहिए हो, तो ollama stop qwen3-coder:30b सर्वर को रोके बिना मॉडल को अनलोड कर देता है।
Ollama को एक अलग सर्वर पर चलाना
Ollama डिफ़ॉल्ट रूप से localhost पर bind होता है। इसे किसी दूसरी मशीन से एक्सेस करने के लिए, उसी systemd override में OLLAMA_HOST=0.0.0.0:11434 सेट करें और सर्विस को रीस्टार्ट करें।
ऐसा केवल प्राइवेट नेटवर्क पर ही करें। Ollama का डॉक्यूमेंटेशन स्पष्ट करता है कि लोकल API के लिए किसी ऑथेंटिकेशन की आवश्यकता नहीं होती है। इसलिए, इंटरनेट पर पोर्ट 11434 खुला रखने का मतलब है कि कोई भी आपके हार्डवेयर का उपयोग कर सकता है और आपका एजेंट जो कुछ भी भेजता है उसे पढ़ सकता है। इसके दो सुरक्षित विकल्प हैं। बाइंड को localhost पर ही रहने दें और अपने लैपटॉप से SSH के माध्यम से पोर्ट को फॉरवर्ड करें:
ssh -N -L 11434:localhost:11434 you@your-vpsआपका एजेंट http://localhost:11434/v1 की ओर पॉइंट करता रहता है और उसे कोई अंतर पता नहीं चलता। दूसरा विकल्प VPN है, जिसमें Ollama को 0.0.0.0 के बजाय VPN एड्रेस पर बाइंड किया जाता है। यदि कई लोग या कई एजेंट एक ही बॉक्स का उपयोग करेंगे, तो Ollama का शेड्यूलर उस लोड के लिए नहीं बना है, और Ollama और vLLM के बीच तुलना यह दर्शाती है कि थ्रूपुट का अंतर कहाँ से समस्या पैदा करने लगता है।
स्थानीय कोडिंग मॉडल कहाँ बेहतर है और कहाँ नहीं
आपके द्वारा होस्ट किया गया मॉडल, हर कार्य के लिए frontier API का विकल्प नहीं हो सकता। यह चार प्रकार के कार्यों में स्पष्ट रूप से बेहतर है।
- थोक में किए जाने वाले यांत्रिक बदलाव, जहाँ प्रत्येक बदलाव छोटा हो और आप उसे जाँच सकें। रिपॉजिटरी में नाम बदलना, टाइप हिंट्स जोड़ना, डॉकस्ट्रिंग्स लिखना, टिप्पणियों का अनुवाद करना। मॉडल घंटों तक चलता है और बिल में कोई वृद्धि नहीं होती।
- ऐसा काम जो आपके हार्डवेयर से बाहर नहीं जाना चाहिए। गोपनीयता समझौते के तहत क्लाइंट कोड, या कोई आंतरिक रिपॉजिटरी जिसे आप किसी तीसरे पक्ष को भेजने के लिए अधिकृत नहीं हैं।
- ऑफलाइन और एयर-गैप्ड मशीनें, जहाँ कॉल करने के लिए कोई होस्टेड API उपलब्ध ही नहीं होता।
- अनुमानित लागत। एक बार सर्वर का भुगतान हो जाने के बाद, लूप में टोकन खर्च करने वाले एजेंट की कोई अतिरिक्त लागत नहीं होती, जो कि metered API के बिल्कुल विपरीत है। GPU VPS की लागत API टोकन के मुकाबले कब बराबर होती है में इसका गणित दिया गया है।
यह लंबे और बहु-चरणीय कार्यों में विफल रहता है। "पता लगाएँ कि यह टेस्ट क्यों विफल हो रहा है, कारण ठीक करें, कॉलर्स को अपडेट करें" जैसे कार्यों के लिए लगातार कई सही टूल कॉल्स की आवश्यकता होती है, जिसमें पूरा इतिहास संदर्भ (context) में बना रहना चाहिए। एक साधारण सर्वर पर 8B से 14B रेंज का मॉडल गलत टूल कॉल उत्पन्न करेगा, या कुछ चरणों के बाद योजना भूल जाएगा, और आप कार्य पूरा करने की तुलना में उसे नियंत्रित करने में अधिक समय व्यतीत करेंगे। यह कोई ऐसी प्रॉम्प्ट समस्या नहीं है जिसे आप लिखकर ठीक कर सकें। यह क्षमता (capacity) की कमी है।
यह तब भी विफल रहता है जब गलत होना महंगा हो और आप हर पंक्ति को न पढ़ें। स्थानीय मॉडल को सीमित कार्य दें जिनके आउटपुट को आप सत्यापित कर सकें, और जिस काम को आप चरण-दर-चरण नहीं जाँचेंगे, उसके लिए होस्टेड मॉडल का उपयोग करें।
विफलता के प्रकार और वे संदेश जो आपको दिखाई देंगे
curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused. सर्वर नहीं चल रहा है, या एजेंट किसी अन्य होस्ट पर पॉइंट कर रहा है। systemctl status ollama चलाएं, फिर journalctl -e -u ollama चलाएं।
एजेंट रिपोर्ट करता है कि मॉडल मौजूद नहीं है। आपके कॉन्फ़िगरेशन में दिया गया नाम सर्वर द्वारा प्रदान किए जाने वाले नाम से मेल नहीं खाता है। इसकी तुलना curl http://localhost:11434/v1/models से करें और वहां से स्ट्रिंग कॉपी करें। टैग नाम का हिस्सा होता है, इसलिए यदि कॉन्फ़िगरेशन में ऐसा टैग है जिसे आपने कभी पुल (pull) नहीं किया, तो वह विफल हो जाएगा, भले ही उसी तरह का कोई अन्य मॉडल इंस्टॉल हो।
एजेंट गद्य (prose) में उत्तर देता है और फ़ाइल को एडिट नहीं करता है। या तो मॉडल में टूल सपोर्ट नहीं है, या अनुरोध और उसकी टूल परिभाषाएं पहले ही कॉन्टेक्स्ट विंडो को भर चुकी हैं। मॉडल पेज पर tools लेबल की जांच करें, फिर ollama ps में CONTEXT कॉलम देखें।
पहले टोकन से पहले लंबी चुप्पी, फिर सामान्य गति। कीप-अलाइव (keep-alive) समाप्त हो गया है और वेट्स (weights) को डिस्क से फिर से पढ़ा जा रहा है। OLLAMA_KEEP_ALIVE सेट करें।
मॉडल उस फ़ाइल का खंडन करता है जिसे उसने अभी पढ़ा है। कॉन्टेक्स्ट ट्रंकेशन (context truncation)। ollama ps आमतौर पर CONTEXT का ऐसा मान दिखाता है जो आपके द्वारा सेट किए गए मान से छोटा होता है, क्योंकि एनवायरनमेंट वेरिएबल सिस्टमd यूनिट के बजाय आपके शेल (shell) पर चला गया था।
सब कुछ काम कर रहा है, लेकिन धीरे, और PROCESSOR का मान 100% GPU नहीं है। मॉडल और उसका कॉन्टेक्स्ट VRAM में फिट नहीं हो रहा है। कॉन्टेक्स्ट की लंबाई कम करें, या किसी छोटे मॉडल या छोटे क्वांटाइजेशन (quantisation) पर स्विच करें।
FAQ
क्या मैं Claude Code को Ollama पर पॉइंट कर सकता हूँ?
हाँ, लेकिन OpenAI-compatible URL के साथ नहीं। Claude Code, Anthropic Messages API का उपयोग करता है और Ollama उसी प्रारूप में /v1/messages पर 11434 पोर्ट पर सेवा प्रदान करता है। ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama और एक खाली ANTHROPIC_API_KEY को export करें, फिर इसे claude --model qwen3-coder:30b के साथ शुरू करें। ollama launch claude आपके लिए वही सेटिंग्स लिख देता है। यह compatibility layer tool_choice या prompt caching को लागू नहीं करता है, और इसमें कोई token counting endpoint नहीं है, इसलिए दिखाए गए token counts अनुमानित हैं।
मेरा local model उस कोड के बारे में उत्तर क्यों देता है जिसे वह देख नहीं सकता?
क्योंकि request अब context window में फिट नहीं होती है, और इसका सबसे पुराना हिस्सा बिना किसी error के हटा दिया गया है। Ollama अपने default context को उपलब्ध VRAM के आधार पर सेट करता है, और 24 GiB से नीचे वह default 4,096 tokens होता है, जिसे एक agent का system prompt और tool definitions अपने आप ही पार कर जाते हैं। systemd unit में OLLAMA_CONTEXT_LENGTH=64000 सेट करें, Ollama को restart करें, और पुष्टि करें कि ollama ps में CONTEXT कॉलम नया मान दिखा रहा है।
VPS पर coding agent के लिए मुझे कौन सा model चलाना चाहिए?
वह सबसे बड़ा model चुनें जिसमें tools लेबल हो और जो 64k context window के साथ memory में फिट हो जाए, और code के लिए tuned model को प्राथमिकता दें। पर्याप्त VRAM वाले GPU सर्वर पर qwen3-coder:30b एक सामान्य विकल्प है। लगभग 14B parameters से नीचे का model कोड के बारे में सवालों के जवाब तो दे सकता है, लेकिन multi-step edits में विफल हो सकता है, क्योंकि agent का काम tool calls में छोटी formatting गलतियों को भी सहन नहीं करता है। किसी sample prompt के बजाय अपनी खुद की repository से एक वास्तविक कार्य के साथ परीक्षण करें।
क्या मुझे अपने model पर coding agent चलाने के लिए GPU की आवश्यकता है?
व्यावहारिक रूप से हाँ। केवल CPU पर inference काम करता है और एक-दो सवालों के लिए ठीक है, लेकिन एक agent प्रति कार्य कई requests भेजता है और प्रत्येक request एक लंबा इतिहास फिर से पढ़ती है, इसलिए धीमी token rate दो मिनट के काम को एक घंटे में बदल देती है। ollama ps में PROCESSOR कॉलम की जाँच करें: 100% GPU के अलावा कोई भी मान होने का मतलब है कि model का कुछ हिस्सा CPU पर चल रहा है, और token rate तेजी से गिर जाती है।