SSD Nodes Learn Hosting plans →
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-30

Ollama coding agent सोबत कसे वापरावे

Ollama ला coding agent शी जोडण्यासाठी base URL, चालणारी dummy key, context length मुळे येणाऱ्या अडचणी आणि local model कोणत्या कामांत उपयुक्त ठरतो हे जाणून घ्या.

तुम्ही कशाशी कनेक्ट करत आहात

तुमचा coding agent Ollama सोबत वापरता येतो. यासाठी अपेक्षेपेक्षा कमी बदल करावे लागतात. एक base URL बदला आणि एक model name निवडा. API key field मध्ये मूल्य आवश्यक असते; मात्र local server ते दुर्लक्षित करतो. त्यामुळे कोणतीही string चालते.

Ollama port 11434 वर listening करते आणि एकाच वेळी दोन request shapes पुरवते. /v1/chat/completions हा OpenAI-compatible shape आहे. Ollama च्या documentation मध्ये तेथील key आवश्यक पण दुर्लक्षित असल्याचे नमूद केले आहे. /v1/messages हा Anthropic-compatible shape आहे. Claude Code हाच shape वापरते. तुमचा agent या दोन्हीपैकी एक shape आधीपासून वापरतो. त्यामुळे त्यामध्ये इतर कोणताही बदल करावा लागत नाही.

हा भाग पूर्ण करण्यासाठी पाच मिनिटे लागतात. प्रत्यक्ष परिणाम उपयोगी ठरेल का, हे जवळजवळ कोणीही बदलत नसलेल्या दोन settings वर अवलंबून असते: context length आणि keep-alive. तसेच model कोणत्या प्रकारच्या कामासाठी योग्य आहे, हेही महत्त्वाचे आहे. या दोन्ही settings साठी स्वतंत्र section आहे. शेवटी त्याच्या वास्तविक मर्यादा दिल्या आहेत.

स्थानिक base URL स्वीकारणारे coding agents

चाचणीमध्ये एकच प्रश्न असतो: या tool मध्ये base URL सेट करण्याची सुविधा आहे का? असल्यास, ते तुमच्या server शी संवाद साधू शकते.

Ollama Claude Code, OpenCode, Codex, Cline, Roo Code, Zed, JetBrains IDEs आणि VS Code साठी integration pages उपलब्ध करून देते. Aider त्याच्या Ollama support चे स्वतंत्र documentation देते. ऑगस्ट 2026 मध्ये coding agent या संज्ञेत सामान्यतः अभिप्रेत असलेल्या बहुतेक tools चा यात समावेश होतो. हे सर्व एकाच प्रकारच्या API शी संवाद साधत नाहीत. सेटअप अयशस्वी होण्याचे मुख्य कारण हेच आहे.

  • बहुतेक agents ना OpenAI-compatible endpoint आवश्यक असतो. त्यांना base URL http://localhost:11434/v1 आणि रिकामी नसलेली कोणतीही API key string द्या.
  • Claude Code कोणताही OpenAI base URL स्वीकारत नाही. ते Anthropic Messages API वापरते. त्यामुळे ANTHROPIC_BASE_URL हे http://localhost:11434 वर सेट करावे लागते. Ollama हा endpoint /v1/messages वर उपलब्ध करून देते.
  • Codex OpenAI Responses API वापरते. Ollama /v1/responses देखील उपलब्ध करून देते. ही सुविधा version 0.13.3 मध्ये जोडली गेली.
  • एखाद्या agent मध्ये base URL सेट करण्याची सुविधा नसेल, तर त्याला दुसऱ्या endpoint कडे redirect करता येत नाही, कारण endpoint client मध्येच निश्चित केलेला असतो. त्याऐवजी पुढे translation layer ठेवा. उदाहरणार्थ, self-hosted LiteLLM gateway वापरा आणि client ला आवश्यक असलेल्या प्रकारात तुमचे model पुन्हा उपलब्ध करून द्या.

Ollama हे configuration स्वतः तयार करू शकते. ollama launch opencode तुम्ही निवडलेल्या model साठी inline config वापरून OpenCode सुरू करते, ollama launch claude Claude Code साठी तेच करते, आणि ollama launch droid --config tool सुरू न करता configuration लिहिते.

Ollama स्थापित करा आणि tools कॉल करू शकणारे model pull करा

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama --no-pager
ollama pull qwen3-coder:30b
ollama ls

Installer systemd unit जोडतो आणि तो सुरू करतो. त्यामुळे systemctl status ollama ने active (running) दाखवले पाहिजे. तसे न झाल्यास journalctl -e -u ollama कारण दाखवते.

Agent कार्य करण्यासाठी model ने tool calling समर्थित केले पाहिजे. Agent याच पद्धतीने काम करतो. तो file वाचतो, patch लिहितो, test चालवतो, त्यानंतर failure वाचून पुन्हा प्रयत्न करतो. Tool call जारी करू न शकणारे model edit करण्याऐवजी त्याचे वर्णन prose मध्ये करते. त्यामुळे agent पुन्हा पुन्हा तेच कार्य करू शकतो किंवा थांबू शकतो. pull करण्यापूर्वी ollama.com वरील model च्या page वर tools label शोधा. qwen3-coder:30b मध्ये हा label आहे. August 2026 पर्यंत हा tag 19 GB download आहे आणि त्याची context window 256K आहे. तुमचा box केवळ CPU वर चालत असेल किंवा RAM कमी असेल, तर download सुरू करण्यापूर्वी 8 ते 64 GB मध्ये प्रत्यक्षात काय बसते हे VPS वरील Qwen 27B tag साठी memory arithmetic दाखवते. एकदा तुम्ही तो pull केल्यानंतर हे gigabytes server च्या root disk वर साठतात. VPS मध्ये उपलब्ध जागा सर्वात कमी असणारा भाग साधारणपणे हाच असतो. त्यामुळे disk भरून जाण्यापूर्वी Ollama model files कुठे ठेवतो आणि त्या इतरत्र कशा हलवायच्या हे वाचणे उपयुक्त ठरेल.

आता server प्रत्यक्षात कोणती names serve करतो ते तपासा:

curl http://localhost:11434/v1/models

त्या response मधील strings तुमच्या agent config मध्ये अक्षरशः तशाच असणे आवश्यक आहे. आधी ही तपासणी केल्यास model-not-found संबंधी बहुतेक errors दूर होतात. Ollama अद्याप installed नसेल, तर सविस्तर walkthrough VPS वर Ollama वापरून LLM self-host करणे येथे आहे.

Ollama कडे OpenCode निर्देशित करा

~/.config/opencode/opencode.json संपादित करा:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "ollama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Ollama",
      "options": {
        "baseURL": "http://localhost:11434/v1"
      },
      "models": {
        "qwen3-coder:30b": {
          "name": "qwen3-coder 30b"
        }
      }
    }
  }
}

models अंतर्गत असलेली key ही Ollama कडे पाठवले जाणारे model name आहे. त्यामुळे ती ollama ls शी तंतोतंत जुळली पाहिजे. name field हे केवळ model picker मध्ये दिसणारे label आहे. opencode सुरू करा, Ollama provider वर switch करा आणि विनंती तुमच्या server वर आली आहे, इतरत्र कुठे पाठवली गेली नाही, याची खात्री करण्यासाठी journalctl -e -u ollama monitor करा. Agent ची स्वतःची setup प्रक्रिया VPS वर OpenCode चालवणे येथे दिली आहे.

Ollama कडे Claude Code निर्देशित करा

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b

ANTHROPIC_API_KEY मुद्दाम रिकामी string ठेवली आहे. Environment मध्ये खरी key राहिल्यास तुमच्या requests hosted API कडे पाठवल्या जातात. त्यामुळे bill आकारले जाते आणि local inference होत नाही. ollama launch claude हे सर्व तुमच्यासाठी सेट करते.

Compatibility layer मधून काय उपलब्ध नाही हे समजून घ्या. ती tool_choice किंवा prompt caching implement करत नाही. तसेच तिच्याकडे token counting endpoint नाही. त्यामुळे तुम्हाला दिसणारे token numbers हे model च्या स्वतःच्या tokenizer वर आधारित अंदाज असतात. Claude Code मोठा system prompt आणि मोठा tool set देखील पाठवते. त्यामुळे chat client पेक्षा त्याला अधिक context आवश्यक असतो. काय टिकून राहते आणि काय टिकत नाही, याचा व्यापक आढावा Claude स्वतःच्या server वर चालवता येतो का येथे दिला आहे.

Ollama कडे Aider निर्देशित करा

export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b

Aider च्या दस्तऐवजीकरणात ollama/ ऐवजी ollama_chat/ prefix वापरण्याची शिफारस केली आहे. .aider.model.settings.yml मध्ये प्रत्येक model साठी context window निश्चित करता येते. त्यामुळे एखाद्या model ला server default पेक्षा वेगळी window आवश्यक असल्यास ते उपयुक्त ठरते:

- name: ollama_chat/qwen3-coder:30b
  extra_params:
    num_ctx: 65536

कार्यरत सेटअप असूनही निरर्थक परिणाम का मिळतात

हा महत्त्वाचा विभाग आहे. Ollama ला दिसणाऱ्या VRAM (GPU वरील video memory) वरून ते default context length निवडते. हे defaults प्रकाशित केलेले आहेत:

ChartOllama default context length by available VRAM, documented August 2026
The data behind this chart
[
  {
    "label": "Under 24 GiB VRAM",
    "default_context_tokens": "4,096"
  },
  {
    "label": "24 to 48 GiB VRAM",
    "default_context_tokens": "32,768"
  },
  {
    "label": "48 GiB VRAM or more",
    "default_context_tokens": "262,144"
  }
]

बहुतेक VPS plans आणि प्रत्येक CPU-only server पहिल्या row मध्ये येतात: 4,096 tokens. शेवटच्या row मधील 262,144 tokens फक्त मोठ्या GPU ला मिळतात.

Agent कोणतेही काम करण्यापूर्वी 4096 tokens पाठवतो. System prompt, tool definitions, repository listing आणि तो उघडणारी पहिली file यांची लांबी आधीच त्यापेक्षा जास्त असते. त्यानंतर नेमके काय घडते, हीच मुख्य समस्या आहे: कोणतीही error दिसत नाही. Aider च्या documentation नुसार window पेक्षा जास्त असलेला context Ollama शांतपणे टाकून देते. सर्वात जुने tokens बाहेर पडतात. त्यामुळे model ला दिसत नसलेल्या file विषयीही ते आत्मविश्वासाने उत्तर देते किंवा दोन steps आधी दिलेली सूचना विसरते. Local model code लिहिण्यासाठी खूपच कमी सक्षम आहे, अशा बहुतेक अहवालांमागे हीच प्रक्रिया असते. हा number निवडणे हा स्वतंत्र निर्णय आहे. त्यामुळे तुम्ही तो निश्चित करण्यापूर्वी प्रत्येक size मध्ये num_ctx साठी लागणारी KV cache memory वाचणे उपयुक्त ठरेल.

Ollama च्या documentation नुसार agents आणि coding tools सारख्या tasks साठी किमान 64000 tokens सेट करावेत. हे server वर सेट करा:

sudo systemctl edit ollama.service

override file मध्ये या lines जोडा:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"

त्यानंतर reload आणि restart करा:

sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama ps

ollama ps ही पडताळणी आहे. ते CONTEXT column दाखवते. त्या column मधील number म्हणजे model ला प्रत्यक्षात मिळालेला context आहे. तुमचे ID आणि SIZE वेगळे असतील:

NAME               ID              SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3-coder:30b    a1b2c3d4e5f6    24 GB    100% GPU     64000      4 minutes from now

हे agent मध्ये नव्हे तर server वर सेट करा. याची दोन कारणे आहेत. OpenAI chat completions schema मध्ये context length साठी field नाही. त्यामुळे OpenAI-compatible client अशी length मागू शकत नाही. तसेच ही setting server नुसार लागू होते. त्यामुळे त्या server कडे निर्देश केलेला प्रत्येक agent ती setting वापरतो. Output साठी स्वतंत्र ceiling असते. Context length च्या उलट, ती compatibility endpoint मार्फत पाठवली जाते. त्यामुळे patch मधील reply अर्धवट थांबल्यास num_predict आणि त्याला अनुरूप असलेले max_tokens field वापरा. एखाद्या model ला वेगळी window हवी असल्यास, Modelfile वापरून त्याची copy तयार करा:

FROM qwen3-coder:30b
PARAMETER num_ctx 65536
ollama create qwen3-coder-64k -f Modelfile

Context विनामूल्य नसतो. मोठ्या window साठी अधिक memory लागते. त्यामुळे PROCESSOR column वर लक्ष ठेवा. तुम्हाला 100% GPU हवे आहे. Model चा काही भाग CPU वर spill झाल्यावर token rate इतका कमी होतो की agent loop वापरण्यायोग्य राहत नाही. तुमच्या box ची वास्तविक मर्यादा शोधण्यासाठी local LLM वर tokens per second मोजणे आवश्यक आहे. Machine खरेदी करण्यापूर्वी तिचे sizing कसे करावे, हे coding agent VPS साठी किती RAM आणि CPU आवश्यक आहे येथे दिले आहे.

विनंत्यांदरम्यान मॉडेल लोड ठेवणे

डीफॉल्टनुसार Ollama शेवटच्या विनंतीनंतर 5 मिनिटांनी मॉडेल unload करते. Chat box साठी हे योग्य आहे, पण agent कामासाठी अयोग्य आहे. Diff वाचण्यासाठी तुम्ही थांबता, timer ची मुदत संपते आणि पुढील विनंतीवर पहिला token दिसण्यापूर्वी disk वरून दहा-दहा gigabytesचे weights पुन्हा load केले जातात. त्यामुळे सेवा अडकलेली असल्यासारखी दिसते.

OLLAMA_KEEP_ALIVE मध्ये 10m किंवा 24h सारखी duration string, seconds मधील साधी संख्या, मॉडेल अनिश्चित काळासाठी loaded ठेवण्यासाठी -1 किंवा ते त्वरित unload करण्यासाठी 0 देता येते. Context length च्या शेजारी ते सेट करा:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=64000"
Environment="OLLAMA_KEEP_ALIVE=-1"

keep_alive हे request field केवळ Ollama च्या native /api/generate आणि /api/chat endpoints मध्ये उपलब्ध आहे; compatibility endpoints मध्ये ते उपलब्ध नाही. त्यामुळे agent ते प्रत्येक विनंतीसाठी स्वतंत्रपणे सेट करू शकत नाही. तुमच्याकडे environment variable हाच एकमेव नियंत्रण पर्याय आहे. मेमरी पुन्हा उपलब्ध करून घ्यायची असल्यास, ollama stop qwen3-coder:30b server थांबविल्याशिवाय मॉडेल unload करते. ही setting reboot नंतरही कायम ठेवायची असल्यास, किंवा weights दिवसभर memory मध्ये ठेवणे आणि ती memory परत मिळवणे यापैकी कोणता पर्याय योग्य आहे हे ठरवायचे असल्यास, Ollama मॉडेल memory मध्ये loaded ठेवणे या दोन्ही बाबींमध्ये उपयोगी ठरते.

वेगळ्या सर्व्हरवर Ollama चालवणे

Ollama localhost ला bind होते. दुसऱ्या मशीनवरून त्याच्यापर्यंत पोहोचण्यासाठी, त्याच systemd override मध्ये OLLAMA_HOST=0.0.0.0:11434 सेट करा आणि सेवा पुन्हा सुरू करा.

हे फक्त private network वर करा. Ollama च्या documentation नुसार local API साठी authentication आवश्यक नाही. त्यामुळे port 11434 इंटरनेटवर उघडा ठेवला, तर कोणीही तुमचे hardware वापरू शकते आणि तुमचा agent पाठवतो ते सर्व वाचू शकते. दोन सुरक्षित पर्याय आहेत. bind localhost वरच ठेवा आणि तुमच्या laptop वरून SSH द्वारे port forward करा:

ssh -N -L 11434:localhost:11434 you@your-vps

तुमचा agent http://localhost:11434/v1 कडेच निर्देश करत राहतो आणि त्याला कोणताही फरक जाणवत नाही. दुसरा पर्याय VPN आहे. यात Ollama 0.0.0.0 ऐवजी VPN address वर bind होते. एकाच box वर अनेक लोक किंवा अनेक agents काम करणार असतील, तर Ollama चा scheduler त्या load साठी तयार केलेला नाही. Ollama आणि vLLM मधील तुलना throughput मधील फरक कुठून त्रासदायक ठरू लागतो हे दाखवते.

स्थानिक coding model कुठे प्रभावी ठरते आणि कुठे ठरत नाही

तुम्ही host केलेल्या model वर चालणारा agent प्रत्येक कामासाठी frontier API ची जागा घेत नाही. मात्र खालील चार प्रकारच्या कामांमध्ये तो स्पष्टपणे प्रभावी ठरतो.

  • मोठ्या प्रमाणातील यांत्रिक बदल, जिथे प्रत्येक बदल लहान असतो आणि तुम्ही त्याची पडताळणी करू शकता. संपूर्ण repository मध्ये नावे बदलणे, type hints जोडणे, docstrings लिहिणे आणि comments चे भाषांतर करणे. Model अनेक तास चालू राहू शकतो आणि खर्च वाढत नाही.
  • तुमच्या hardware बाहेर जाऊ नये असे काम. Confidentiality agreement अंतर्गत असलेला client code किंवा third party कडे पाठवण्याची परवानगी नसलेला internal repository.
  • Offline आणि air-gapped machines, जिथे call करण्यासाठी hosted API उपलब्धच नसतो.
  • अंदाज करता येणारा खर्च. Server साठी पैसे भरल्यानंतर loop मध्ये tokens वापरणाऱ्या agent साठी अतिरिक्त खर्च होत नाही. Metered API मध्ये याच्या उलट स्थिती असते. GPU VPS API tokens च्या तुलनेत समतोलावर कधी येतो येथे त्याचे गणित दिले आहे.

दीर्घ, अनेक टप्प्यांच्या कामांमध्ये तो कमी प्रभावी ठरतो. “ही test का fail होते ते शोधा, कारण दुरुस्त करा आणि callers अपडेट करा” यासाठी सलग अनेक अचूक tool calls आवश्यक असतात. तसेच संपूर्ण history context मध्ये ठेवावी लागते. मध्यम क्षमतेच्या server वर 8B ते 14B range मधील model malformed tool call तयार करू शकतो किंवा काही turns नंतर plan विसरू शकतो. त्यामुळे काम पूर्ण करण्यापेक्षा model ला steer करण्यात अधिक वेळ जातो. हा prompt चा प्रश्न नाही, ज्यावर अधिक चांगले लिहून मात करता येईल. ही capacity ची मर्यादा आहे.

तुम्ही प्रत्येक line वाचणार नसाल आणि चुकीची माहिती महागात पडणार असेल, तेव्हाही तो कमी प्रभावी ठरतो. स्थानिक model ला असे मर्यादित काम द्या ज्याच्या output ची तुम्ही पडताळणी करू शकता. ज्या कामाची step by step पडताळणी तुम्ही करणार नाही, त्यासाठी hosted model वापरा.

अपयशाच्या स्थिती आणि दिसणारे स्ट्रिंग

curl: (7) Failed to connect to localhost port 11434 after 0 ms: Connection refused. सर्व्हर चालू नाही किंवा agent वेगळ्या host कडे निर्देशित आहे. systemctl status ollama चालवा, त्यानंतर journalctl -e -u ollama चालवा.

agent model अस्तित्वात नसल्याचे सांगतो. तुमच्या config मधील नाव server पुरवत असलेल्या नावाशी जुळत नाही. ते curl http://localhost:11434/v1/models मधील नावाशी तुलना करा आणि तेथील string कॉपी करा. tag हा नावाचाच भाग आहे. त्यामुळे तुम्ही कधीही pull न केलेल्या tag चे नाव config मध्ये दिल्यास, तत्सम model install केलेले असले तरी अपयश येते.

agent prose मध्ये उत्तर देतो आणि कोणतीही file संपादित करत नाही. एकतर model ला tool support नाही किंवा request आणि त्याच्या tool definitions मिळून context window आधीच भरली आहे. model page वरील tools label तपासा. त्यानंतर ollama ps मधील CONTEXT column तपासा.

पहिला token येण्यापूर्वी बराच वेळ शांतता, त्यानंतर नेहमीचा वेग. keep-alive कालबाह्य झाला आहे आणि weights पुन्हा disk वरून वाचल्या जात आहेत. OLLAMA_KEEP_ALIVE सेट करा.

model नुकतीच वाचलेल्या file शी विरोधाभास असलेले उत्तर देतो. हे context truncation आहे. ollama ps मध्ये साधारणपणे तुम्ही सेट केलेल्या मूल्यापेक्षा लहान CONTEXT value दिसते, कारण environment variable तुमच्या shell कडे गेले आणि systemd unit कडे गेले नाही.

सर्व काही हळू चालते आणि PROCESSOR हे 100% GPU नाही. model आणि त्याचा context मिळून VRAM मध्ये बसत नाहीत. context length कमी करा किंवा लहान model अथवा लहान quantisation वापरा. पुन्हा pull करण्यापूर्वी, q4_K_M, q8_0 आणि fp16 साठी memory मध्ये किती जागा लागते आणि quality प्रत्यक्षात कुठे कमी होते हे वाचल्यास एक पायरी कमी केल्यावर किती जागा मिळते आणि त्यासाठी काय गमवावे लागते हे समजेल.

FAQ

Claude Code ला Ollama कडे निर्देशित करू शकतो का?

होय, पण OpenAI-compatible URL सह नाही. Claude Code Anthropic Messages API वापरते आणि Ollama त्याच port 11434 वर /v1/messages येथे हेच स्वरूप उपलब्ध करून देते. ANTHROPIC_BASE_URL=http://localhost:11434, ANTHROPIC_AUTH_TOKEN=ollama आणि रिकामे ANTHROPIC_API_KEY export करा, त्यानंतर ते claude --model qwen3-coder:30b सह सुरू करा. ollama launch claude हीच settings तुमच्यासाठी लिहिते. Compatibility layer tool_choice किंवा prompt caching लागू करत नाही. तसेच token counting endpoint उपलब्ध नसल्यामुळे दाखवलेली token counts अंदाजे असतात.

माझे local model त्याला दिसत नसलेल्या code विषयी उत्तर का देते?

कारण request आता context window मध्ये बसत नाही आणि त्यातील सर्वात जुना भाग कोणतीही error न दाखवता काढून टाकला जातो. Ollama ला सापडणाऱ्या VRAM वरून ते default context ठरवते. 24 GiB पेक्षा कमी VRAM असल्यास हा default 4,096 tokens असतो. Agent चा system prompt आणि tool definitions स्वतंत्रपणेच यापेक्षा मोठे असतात. systemd unit मध्ये OLLAMA_CONTEXT_LENGTH=64000 सेट करा, Ollama restart करा आणि ollama ps मधील CONTEXT column मध्ये नवीन value दिसत असल्याची खात्री करा.

VPS वर coding agent साठी कोणते model चालवावे?

64k context window सह memory मध्ये बसणारे आणि tools label असलेले सर्वात मोठे model निवडा. Code साठी tune केलेल्या model ला प्राधान्य द्या. पुरेशी VRAM असलेल्या GPU server वर qwen3-coder:30b हा सामान्य पर्याय आहे. हा tag तुमच्या server साठी मोठा असल्यास, download करण्यापूर्वी Nemotron 3.5 Lightning साठी RAM आकडे आणि CPU-only वेग उपयुक्त तुलना ठरतात. साधारण 14B parameters पेक्षा कमी असलेले model code विषयी चांगली उत्तरे देऊ शकते, पण multi-step edits मध्ये तरीही अपयशी ठरू शकते. Agent कामात tool calls मधील लहान formatting चुका परिणामकारक ठरतात. Sample prompt ऐवजी तुमच्या स्वतःच्या repository मधील एक वास्तविक task वापरून चाचणी करा.

माझ्या स्वतःच्या model वर coding agent चालवण्यासाठी GPU आवश्यक आहे का?

प्रत्यक्ष वापरात होय. CPU-only inference चालते आणि एकल प्रश्नांसाठी ती पुरेशी असते. परंतु agent प्रत्येक task साठी अनेक requests पाठवतो आणि प्रत्येक request मध्ये मोठी history पुन्हा वाचली जाते. त्यामुळे कमी token rate मुळे दोन मिनिटांचे task एक तास घेऊ शकते. ollama ps मधील PROCESSOR column तपासा. 100% GPU व्यतिरिक्त कोणतीही value दिसत असल्यास model चा काही भाग CPU वर चालत आहे आणि token rate मोठ्या प्रमाणात कमी होतो.

#ollama#coding-agent#openai-compatible#local-llm#self-hosted-ai