SSD Nodes Learn 🎉 VPS $5.50/माह से
गाइड Matt Connorलेखक: Matt Connor

Meta Muse Glimmer 30B को VPS पर कैसे चलाएं

Meta Muse Glimmer 30B को Linux VPS पर चलाने के लिए आवश्यक RAM और डिस्क स्पेस का सही अनुमान लगाएं। 17GB से 59GB तक के टैग्स के लिए CPU इंफरेंस लागत और सटीक हार्डवेयर आवश्यकताओं को समझें।

VPS पर Muse Glimmer के लिए आवश्यक संसाधन

Muse Glimmer बिना GPU वाले सामान्य Linux VPS पर चलता है। आप कौन सा tag pull करते हैं, यह तय करता है कि वह memory में फिट होगा या नहीं। Meta Superintelligence Labs ने 10 August 2026 को Apache 2.0 के तहत इस model को प्रकाशित किया था: इसमें 30 billion parameters, 128K context window और एक समर्पित 1.8B parameter perception encoder है, जिससे यह text के साथ-साथ images को भी पढ़ सकता है। Meta इसे chat के बजाय हमेशा active रहने वाले local agents के लिए प्रस्तावित करता है, जिसकी reasoning strength आप प्रति request सेट कर सकते हैं।

16 August 2026 को देखे गए प्रकाशित Ollama tags, 17 GB से लेकर 59 GB तक हैं। यह दायरा ही पूरी sizing समस्या है। default tag लगभग 18 GB का है, इसलिए सबसे छोटे उपयुक्त server में स्पष्ट रूप से 18 GB से अधिक free RAM होनी चाहिए। download के लिए disk space और context window के लिए memory इसके अतिरिक्त आवश्यक हैं।

आपको कौन सा muse-glimmer tag pull करना चाहिए?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama ने इस model के लिए 11 tags सूचीबद्ध किए हैं जो Apple builds नहीं हैं। इनमें समान 30 billion weights अलग-अलग numeric precisions पर संग्रहीत हैं। जो size आप देखते हैं, वही आप download करते हैं, और context जोड़े जाने से पहले आपको लगभग इतनी ही memory की आवश्यकता होती है।

दो 4-bit builds छोटे हैं: 17 GB पर 30b-nvfp4 और 18 GB पर 30b-q4_K_M। डिफ़ॉल्ट 30b tag का size q4_K_M build के समान ही सूचीबद्ध है। 8-bit builds, 30b-q8_0 और 30b-mxfp8, 31 GB के आसपास हैं। 30b-bf16 57 GB पर unquantised 16-bit release है, जिसके लिए अधिकांश किराए के सर्वरों (rented servers) की तुलना में अधिक RAM की आवश्यकता होती है, जो किसी side project के लिए किफायती नहीं है।

-dflash tags DFlash support के साथ वही builds हैं, और प्रत्येक का size उसके plain twin से अधिक सूचीबद्ध है। Ollama, DFlash को एक speed feature के रूप में वर्णित करता है और इसे Apple Silicon तथा desktop GPUs पर प्रदर्शित करता है। केवल CPU वाले VPS पर आप अन्य hardware पर मापी गई इस सुविधा के लिए वास्तविक memory में अतिरिक्त size का भुगतान कर रहे होंगे, इसलिए plain tag से शुरुआत करें और एक बार में केवल एक बदलाव करें।

जब तक आपके पास ऐसा न करने का कोई विशिष्ट कारण न हो, 4-bit से शुरुआत करें। 4-bit से 8-bit पर जाने से CPU को प्रत्येक token generate करने के लिए पढ़े जाने वाले bytes लगभग दोगुने हो जाते हैं, जिससे memory उपयोग बढ़ने के साथ throughput गिर जाता है। यह trade-off q4, q8 और fp16 quantisation की वास्तविक लागत का विषय है, और CPU box पर संक्षिप्त उत्तर यह है कि 4-bit build ही एकमात्र ऐसा build है जिससे शुरुआत करना सार्थक है।

Linux सर्वर पर MLX टैग काम क्यों नहीं करते

MLX, Apple का array framework है और Ollama का MLX engine विशेष रूप से Apple Silicon के लिए बनाया गया backend है। जिस भी टैग के नाम में mlx होता है, वह उसी engine और hardware के लिए तैयार किया गया है। x86 Linux VPS पर यह कई gigabytes का ऐसा download है जिसे आप run नहीं कर सकते, और यह केवल आपकी disk पर जगह घेरेगा। घोषणा में दिए गए गति के आंकड़े Mac पर मापे गए थे और वे उन्हीं टैग्स के लिए हैं, इसलिए वे आपके सर्वर पर लागू नहीं होते। जब आप model page पर टैग सूची देखें, तो सबसे पहले सभी mlx नामों को filter करके हटा दें, और फिर बचे हुए विकल्पों में से आकार के आधार पर चयन करें।

इसे वास्तव में कितनी RAM और डिस्क की आवश्यकता है?

दो चीजें मेमोरी का उपयोग करती हैं, और उनमें से केवल एक tag का आकार है। weights उस tag द्वारा निर्धारित होते हैं जिसे आप pull करते हैं। KV cache, जो कि conversation के लिए model द्वारा रखा गया प्रति-token state है, आपके द्वारा कॉन्फ़िगर की गई context length के साथ बढ़ता है। Ollama का अपना documentation बताता है कि parallel requests को serve करने से context, flight में मौजूद requests की संख्या से गुणा हो जाता है। इसलिए, एक साथ दो agents को जवाब देने वाले सर्वर को एक agent को जवाब देने वाले सर्वर की तुलना में अधिक मेमोरी की आवश्यकता होती है।

किसी भी गाइड से RAM का आंकड़ा न लें, जिसमें यह गाइड भी शामिल है। tag को pull करें, उसे एक prompt भेजें, और जब model अभी भी memory में हो, तो ये दो commands चलाएं।

ollama ps
free -h

ollama ps दिखाता है कि अभी क्या load है और काम CPU और GPU के बीच कैसे विभाजित है। free -h दिखाता है कि क्या बचा है। आपके अपने सर्वर पर ये दो outputs किसी भी प्रकाशित तालिका से बेहतर हैं, क्योंकि इनमें पहले से ही आपकी context setting, आपकी quantisation और सर्वर पर चल रही अन्य सभी चीजें शामिल हैं।

डिस्क का हिस्सा आसान है। Ollama models को Linux पर /usr/share/ollama/.ollama/models के अंतर्गत store करता है, जो अधिकांश VPS images पर root filesystem पर स्थित होता है। 40GB का root volume 57 GB वाले bf16 build को नहीं रख पाएगा, और यह दो 8-bit tags को भी साथ-साथ नहीं रख पाएगा। कुछ भी pull करने से पहले store को एक mounted volume पर ले जाएं।

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

ollama user के पास उस directory का स्वामित्व होना चाहिए, क्योंकि service ollama के रूप में चलती है और अपने blobs को वहीं लिखती है। यदि permissions के कारण pull विफल हो जाता है, तो journalctl -u ollama -n 50 वह स्थान है जहाँ इसका कारण दिखाई देता है।

Swap के बारे में एक स्पष्ट बात: swap आपको बड़ा tag चलाने की अनुमति नहीं देता है। generation हर उस token के लिए weights को touch करता है जिसे वह produce करता है, इसलिए swap में रहने वाले weights को बार-बार disk से पढ़ा जाता है। vmstat 1 दिखाता है कि si और so columns व्यस्त हैं, और output की गति घटकर प्रति token कई seconds हो जाती है। out of memory killer से बचने के लिए एक छोटी swap file रखें। RAM का आकार उस tag के अनुसार रखें जिसे आप वास्तव में चलाना चाहते हैं।

Ollama इंस्टॉल करें और एक named tag पिन करें

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

इंस्टॉल स्क्रिप्ट एक systemd सर्विस सेट अप करती है, इसलिए रीबूट के बाद सर्वर अपने आप चालू हो जाता है। यदि आप इसे root द्वारा प्रबंधित सिस्टम सर्विस के रूप में नहीं चलाना चाहते हैं, तो Podman के अंतर्गत Ollama को rootless चलाना उस विकल्प को कवर करता है। इसके बाद एक स्पष्ट tag को pull करें।

ollama pull muse-glimmer:30b
ollama list

ollama list में size कॉलम को स्वयं पढ़ें और मॉडल पेज पर वर्तमान tag सूची के साथ इसकी तुलना करें। प्रकाशित tags जोड़े, नाम बदले और हटाए जाते हैं, और गाइड में दिया गया size एक विशेष दिन का स्नैपशॉट होता है।

जिस सर्वर पर आप निर्भर हैं, उस पर कभी भी ollama pull muse-glimmer न लिखें। एक bare मॉडल नाम latest tag को resolve करता है, और latest एक ऐसा पॉइंटर है जिसे प्रकाशक किसी अलग बिल्ड पर ले जा सकता है। एक रूटीन pull आपके एजेंट के नीचे मॉडल को बदल देता है, जिसकी मेमोरी आवश्यकताएं और व्यवहार अलग हो सकते हैं, और आपके लॉग में इसकी कोई सूचना नहीं मिलती है। अपनी स्क्रिप्ट्स, अपनी unit फाइलों और अपने एजेंट कॉन्फ़िगरेशन में tag लिखें। VPS पर Ollama के साथ LLM को self-host करना सर्वर सेटअप के बाकी हिस्सों को कवर करता है।

क्या आप बिना GPU के Muse Glimmer चला सकते हैं?

हाँ, और इसकी सीमाओं के बारे में स्पष्ट रहना उचित है। एक टोकन जनरेट करने का अर्थ है मेमोरी से मॉडल वेट्स (model weights) को पढ़ना, इसलिए गति vCPUs की संख्या के बजाय मेमोरी बैंडविड्थ पर निर्भर करती है। कुछ कोर के बाद, अधिक कोर से बहुत कम लाभ मिलता है। एक शेयर्ड VPS पर यह बैंडविड्थ होस्ट के अन्य सभी टेनेंट्स के साथ साझा की जाती है, इसलिए 4-bit पर 30B मॉडल प्रति सेकंड बहुत कम टोकन जनरेट करता है।

इसके लिए किसी के भी आंकड़ों पर भरोसा न करें, मेरे आंकड़ों पर भी नहीं। अपने सिस्टम पर टोकन प्रति सेकंड मापें और जो आप देखते हैं उसके आधार पर निर्णय लें।

परिणामस्वरूप, यह मॉडल किस काम के लिए उपयुक्त है, इसमें स्पष्ट अंतर है। इंटरैक्टिव चैट कष्टदायक होती है, क्योंकि आप सर्वर के लिखने की गति से तेज पढ़ते हैं और हर उत्तर एक लंबे विराम के साथ शुरू होता है। बैकग्राउंड एजेंट का काम ठीक रहता है, क्योंकि जो कार्य दस मिनट तक बिना किसी निगरानी के चलता है, उसे धीमी गति से कोई फर्क नहीं पड़ता। मेटा (Meta) ने इस मॉडल के लिए ठीक इसी तरह के वर्कलोड का वर्णन किया है।

यदि आपको इंटरैक्टिव गति की आवश्यकता है, तो दो ईमानदार उत्तर हैं: एक GPU या एक होस्टेड API। कुछ भी किराए पर लेने से पहले GPU VPS और API टोकन के बीच ब्रेक-ईवन पॉइंट का पता लगाएं, और GPU VPS वास्तव में आपको क्या देता है यह बताता है कि आप क्या खरीद रहे हैं। किसी दिए गए सर्वर की क्षमता के व्यापक प्रश्न के लिए, आप कौन से मॉडल सेल्फ-होस्ट कर सकते हैं से शुरुआत करें, और VPS पर समान आकार का Qwen मॉडल चलाना इस आकार वर्ग में सबसे सटीक तुलना है।

यह 128K tokens से काफी पहले ही चीजें क्यों भूल जाता है?

इसका कारण यह है कि Ollama की डिफ़ॉल्ट context window 4096 tokens की है, चाहे मॉडल कितना भी सपोर्ट क्यों न करता हो। अगस्त 2026 तक, यह डिफ़ॉल्ट मान Ollama के अपने FAQ में दिया गया है। टैग 128K का विज्ञापन करता है, लेकिन जब तक आप अन्यथा न कहें, सर्वर मॉडल को 4096 tokens ही देता है। इसलिए, एक लंबी एजेंट ट्रांसक्रिप्ट अपने शुरुआती हिस्से को खो देती है और ऐसा लगता है जैसे मॉडल को भूलने की बीमारी (amnesia) हो गई है।

इसे हर request के लिए सर्वर पर बढ़ाएं:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

एक interactive session के भीतर, /set parameter num_ctx 32768 इसे केवल उस session के लिए बदलता है। API के माध्यम से, request options में num_ctx भेजें।

context का हर अतिरिक्त token weights के अलावा मेमोरी की खपत करता है। यदि आप केवल weights के लिए बने सिस्टम पर पूरे 128K की मांग करेंगे, तो लोड विफल हो जाएगा या सिस्टम धीमी गति पर आ जाएगा। इसे चरणों में बढ़ाएं और हर चरण के बाद ollama ps चलाएं। Ollama में num_ctx और context length कैसे काम करते हैं लेख में इसकी गणना विस्तार से समझाई गई है।

तर्क क्षमता (reasoning strength): low, medium, high और xhigh

Meta ने Muse Glimmer के लिए चार तर्क क्षमताओं (reasoning strengths) का दस्तावेजीकरण किया है, जो low से लेकर xhigh तक हैं। जटिल कोडिंग और एजेंट कार्यों के लिए Meta उच्च स्तर की दो क्षमताओं का उपयोग करने की सलाह देता है। Ollama में यह think पैरामीटर पर निर्भर करता है। कमांड लाइन पर --think= का उपयोग करें, या API बॉडी में think भेजें।

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

एक इंटरैक्टिव सत्र के भीतर, /set think और /set nothink इसे टॉगल करते हैं। Ollama के दस्तावेज़ों के अनुसार, अधिकांश मॉडल या तो बूलियन (boolean) मान या low, medium, या high जैसे स्तर स्वीकार करते हैं। कुछ मॉडल उच्चतम उपलब्ध स्तर के लिए max भी स्वीकार करते हैं। यह मॉडल किन सटीक स्ट्रिंग्स को स्वीकार करता है, इसकी जानकारी इसके मॉडल पेज पर दी गई है। इसलिए अनुमान लगाने के बजाय उसे पढ़ें, और किसी एजेंट में इसे लागू करने से पहले स्वयं एक बार प्रयास करके देखें।

केवल CPU वाले बॉक्स पर इस सेटिंग का प्रभाव अधिक होता है। उच्च क्षमता का अर्थ है कि उत्तर का पहला शब्द दिखाई देने से पहले अधिक 'थिंकिंग टोकन' जनरेट होंगे। एक थिंकिंग टोकन के लिए उतना ही समय लगता है जितना एक उत्तर टोकन के लिए। नियमित कार्यों के लिए इसे low सेटिंग पर ही रहने दें।

मॉडल को हमेशा चालू एजेंट के लिए लोड रखें

Ollama डिफ़ॉल्ट रूप से पांच मिनट के बाद निष्क्रिय मॉडल को अनलोड कर देता है। ऐसे एजेंट के लिए जो हर दस मिनट में चलता है, इसका मतलब है कि हर बार 18 GB डेटा को डिस्क से लोड करना, और नेटवर्क अटैच्ड स्टोरेज वाले VPS पर यह लोड जल्दी नहीं होता। इसके बजाय इसे मेमोरी में पिन करें।

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

एक नकारात्मक मान मॉडल को तब तक मेमोरी में रखता है जब तक कि कोई अन्य प्रक्रिया उसे अनलोड न कर दे, और API अनुरोध में keep_alive उस एक कॉल के लिए सर्वर के डिफ़ॉल्ट मान को ओवरराइड कर देता है। इसकी लागत स्पष्ट है: जब कुछ नहीं हो रहा होता है तब भी RAM व्यस्त रहती है, इसलिए यह सेटिंग केवल उस सर्वर के लिए है जो विशेष रूप से एजेंट के लिए समर्पित है। Ollama मॉडल को लोड रखना इसके विभिन्न विकल्पों को कवर करता है।

Coding agent को इससे जोड़ें

Ollama, http://127.0.0.1:11434/v1 पर एक OpenAI compatible API प्रदान करता है, इसलिए अधिकांश agent tools एक base URL और किसी भी non-empty API key के साथ जुड़ जाते हैं। Ollama का Muse Glimmer पेज एक launch shortcut के बारे में भी बताता है जो एक समर्थित agent को एक ही command में local model से जोड़ देता है, और आपको वहाँ tag को भी pin करना चाहिए।

ollama launch claude --model muse-glimmer:30b

Agents बड़े prompts भेजते हैं। File contents, tool output और बढ़ता हुआ transcript, सभी input tokens के रूप में आते हैं, और CPU box पर generation शुरू होने से पहले prompt processing ही सबसे अधिक समय लेने वाली प्रक्रिया होती है। Context setting को कार्य के अनुसार जितना संभव हो, छोटा रखें। Coding agent को Ollama से जोड़ना client side को कवर करता है, VPS पर coding agent चलाना उस box को कवर करता है जिस पर यह चलता है, और VPS पर agent की लागत नियंत्रित करना यह बताता है कि जब यह पूरे दिन चलता है तो क्या होता है।

Image input भी इसी तरह काम करता है। Ollama API एक message के images field पर images लेता है, इसलिए एक text-only client कभी भी image नहीं भेजेगा, चाहे perception encoder कितना भी सक्षम क्यों न हो।

Port 11434 को open न करें

Ollama API में कोई authentication नहीं होता है। OLLAMA_HOST=0.0.0.0:11434 को set करने से आप इसे अपने laptop से तो access कर पाएंगे, लेकिन यह एक unauthenticated model runner को public internet पर डाल देता है। कोई भी व्यक्ति जो इसे ढूँढ लेगा, वह आपके disk पर models load कर सकता है और आपका agent जो भी data भेज रहा है, उसे पढ़ सकता है। इसे localhost पर ही bound रहने दें और इसके बजाय tunnel का उपयोग करें।

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

Ollama API endpoint को सुरक्षित करना में उचित विकल्पों के बारे में बताया गया है, जिसमें एक ऐसा reverse proxy भी शामिल है जो credentials की मांग करता है।

क्या खराब होता है और आपको क्या दिखाई देगा

पुल (pull) बीच में ही रुक जाता है। डिस्क। मॉडल डायरेक्टरी पर df -h चलाएं। 9 GB bf16 बिल्ड 40GB के रूट वॉल्यूम पर फिट नहीं होता है, और न ही दो 8-बिट टैग एक साथ फिट होते हैं।

मॉडल लोड होता है और फिर प्रोसेस बंद हो जाती है। मेमोरी खत्म हो गई है। dmesg -T रिकॉर्ड करता है कि कर्नल का आउट ऑफ मेमोरी किलर किसी प्रोसेस को चुन रहा है, और journalctl -u ollama -n 100 उसी घटना को सर्विस साइड पर दिखाता है। इसका समाधान एक छोटा टैग या छोटा num_ctx है। यह अधिक स्वैप (swap) नहीं है।

यह प्रति टोकन सेकंड के हिसाब से चलता है। vmstat 1 चलाएं और si तथा so कॉलम पर नजर रखें। निरंतर स्वैप गतिविधि का मतलब है कि वेट्स (weights) RAM में फिट नहीं हो रहे हैं और काम करते समय बॉक्स उन्हें डिस्क से वापस पढ़ रहा है।

जो टैग पिछले हफ्ते काम कर रहा था, वह गायब है। टैग सूचियां बदलती रहती हैं। मॉडल पेज को दोबारा पढ़ें, जो भी वर्तमान है उसे पिन करें, और टैग का नाम कहीं ऐसी जगह नोट करें जहाँ आप उसे दोबारा देख सकें।

पुल करने से पहले स्वयं आकारों की दोबारा जाँच करें

चार्ट में दिए गए आकार 16 अगस्त 2026 को मॉडल के टैग पेज से पढ़े गए थे, और प्रकाशित टैग सूची कोई वादा नहीं है। मॉडल पेज पर वर्तमान सूची पढ़ें, फिर पुष्टि करें कि वास्तव में आपकी डिस्क पर क्या आया है:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama मॉडल लेयर्स को साझा ब्लब्स (shared blobs) के रूप में स्टोर करता है, इसलिए दो टैग जो एक लेयर साझा करते हैं, उनकी डिस्क लागत दोगुनी नहीं होती है। du जो रिपोर्ट करता है उसकी तुलना प्रकाशित आकार से करें और अपनी डिस्क की योजना दोनों में से बड़े आकार के आधार पर बनाएं।

FAQ

Muse Glimmer को VPS पर कितनी RAM की आवश्यकता होती है?

टैग के आकार से शुरुआत करें और उसमें कॉन्टेक्स्ट विंडो को जोड़ें। 16 अगस्त 2026 को डिफ़ॉल्ट टैग का आकार लगभग 18 GB बताया गया है, इसलिए 16GB का सर्वर इसे बिल्कुल भी लोड नहीं कर पाएगा और 24GB के सर्वर में कॉन्टेक्स्ट के लिए बहुत कम जगह बचेगी। इसे एक शुरुआती बिंदु मानें, न कि अंतिम उत्तर। टैग को पुल करें, उसे एक बार लोड करें, फिर अपने सर्वर पर ollama ps और free -h चलाएं और स्वयं आंकड़े देखें। लंबा कॉन्टेक्स्ट और समानांतर अनुरोध (parallel requests) दोनों ही मॉडल के वेट्स (weights) के ऊपर अतिरिक्त मेमोरी की खपत करते हैं।

क्या मैं बिना GPU के Muse Glimmer चला सकता हूँ?

हाँ। यह केवल CPU वाले VPS पर लोड हो सकता है और उत्तर दे सकता है। जनरेशन की गति कोर की संख्या के बजाय मेमोरी बैंडविड्थ द्वारा सीमित होती है, और एक शेयर्ड होस्ट पर यह बैंडविड्थ साझा की जाती है, इसलिए 4-bit पर बहुत कम टोकन प्रति सेकंड की गति की अपेक्षा रखें। यह बिना निगरानी के चलने वाले बैकग्राउंड एजेंट कार्यों के लिए उपयोगी है, लेकिन इंटरैक्टिव चैट के लिए यह काफी धीमा है। अनुरोध के दौरान ollama ps चलाएं और यह पुष्टि करने के लिए प्रोसेसर कॉलम देखें कि कार्य कहाँ चल रहा है।

क्या Linux VPS पर MLX टैग किसी काम के हैं?

नहीं। mlx नाम वाले प्रत्येक टैग को Ollama के MLX इंजन के लिए बनाया गया है, जो इसका Apple Silicon बैकएंड है। x86 Linux सर्वर पर ये टैग एक बड़ी डाउनलोड फाइल हैं जिन्हें आप चला नहीं सकते। साधारण 30b टैग या अन्य गैर-MLX टैग का उपयोग करें, और MLX बिल्ड्स के साथ दिए गए Apple हार्डवेयर बेंचमार्क को अनदेखा करें।

मॉडल 128K टोकन से बहुत पहले ही चीजें क्यों भूल जाता है?

क्योंकि Ollama की डिफ़ॉल्ट कॉन्टेक्स्ट विंडो 4096 टोकन है, चाहे मॉडल कितना भी सपोर्ट क्यों न करता हो। इसलिए सर्वर लंबी बातचीत को मॉडल द्वारा देखे जाने से पहले ही काट (truncate) देता है। सर्वर पर OLLAMA_CONTEXT_LENGTH सेट करें, या एक सत्र के लिए /set parameter num_ctx का उपयोग करें, या API अनुरोध विकल्पों में num_ctx भेजें। इसके साथ मेमोरी का उपयोग बढ़ता है, इसलिए इसे धीरे-धीरे बढ़ाएं और हर बार ollama ps की जाँच करें।

क्या मुझे टैग को पिन करना चाहिए या केवल latest का उपयोग करना चाहिए?

इसे पिन करें। बिना टैग के muse-glimmer का मतलब latest होता है, जो एक ऐसा पॉइंटर है जिसे प्रकाशक किसी भी समय किसी अलग बिल्ड पर ले जा सकता है। इसलिए एक सामान्य पुल (pull) उस मॉडल को बदल सकता है जिस पर आपका एजेंट चल रहा है। स्क्रिप्ट, यूनिट फाइलों और एजेंट कॉन्फ़िगरेशन में muse-glimmer:30b लिखें। पिन करने से पहले मॉडल पेज पर टैग सूची की जाँच करें, क्योंकि प्रकाशित टैग बदलते रहते हैं।