VPS-এ Meta Muse Glimmer 30B চালাতে কত RAM লাগবে
Muse Glimmer tag-এর আকার 17GB থেকে 59GB। Linux VPS-এ pull করার আগে RAM ও disk হিসাব করুন, আর GPU ছাড়া CPU inference-এর খরচ ও গতি জানুন।
VPS-এ Muse Glimmer-এর প্রয়োজনীয়তা
Muse Glimmer GPU ছাড়াই একটি সাধারণ Linux VPS-এ চলে। আপনি যে tag pull করবেন, সেটিই নির্ধারণ করে মডেলটি মেমরিতে চলবে কি না। Meta Superintelligence Labs মডেলটি 10 August 2026 তারিখে Apache 2.0 লাইসেন্সের অধীনে প্রকাশ করেছে। এতে 30 billion parameter, 128K context window এবং 1.8B parameter-এর একটি dedicated perception encoder রয়েছে। ফলে এটি text-এর পাশাপাশি image-ও পড়তে পারে। Meta এটিকে chat-এর পরিবর্তে সবসময় চালু থাকা local agent-এর জন্য তৈরি হিসেবে উপস্থাপন করেছে। প্রতিটি request-এ reasoning strength নির্ধারণ করা যায়।
16 August 2026 তারিখে দেখা published Ollama tag-গুলোর আকার 17 GB থেকে 59 GB পর্যন্ত। এই range-ই সম্পূর্ণ sizing সমস্যার মূল বিষয়। default tag-এর আকার প্রায় 18 GB হিসেবে তালিকাভুক্ত। তাই ব্যবহারযোগ্য সর্বনিম্ন VPS-এ 18 GB-এর চেয়ে স্পষ্টতই বেশি free RAM থাকা উচিত। Download-এর জন্য disk space এবং context window-এর জন্য memory এর অতিরিক্ত প্রয়োজন হবে।
কোন muse-glimmer tag ডাউনলোড করা উচিত?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama এই model-এর জন্য Apple build নয়—এমন 11টি tag দেখিয়েছে। এগুলোতে একই 30 billion weight বিভিন্ন numeric precision-এ সংরক্ষিত আছে। প্রদর্শিত size-ই আপনার download-এর পরিমাণ। Context যোগ করার আগে প্রায় একই পরিমাণ memory-ও ধরে রাখতে হবে।
দুটি 4-bit build ছোট: 30b-nvfp4, যার size 17 GB, এবং 30b-q4_K_M, যার size 18 GB। Default 30b tag-টির size q4_K_M build-এর সমান হিসেবে দেখানো হয়েছে। 8-bit build 30b-q8_0 এবং 30b-mxfp8-এর size প্রায় 31 GB। 30b-bf16 হলো 57 GB-এর unquantised 16-bit release। একটি side project-এর জন্য গ্রহণযোগ্য দামে ভাড়া নেওয়া অধিকাংশ server-এ এর চেয়ে বেশি RAM থাকে না।
-dflash tag-গুলো একই build, তবে DFlash support-সহ। প্রতিটি plain twin-এর চেয়ে বড় হিসেবে তালিকাভুক্ত। Ollama DFlash-কে speed feature হিসেবে বর্ণনা করে এবং Apple Silicon ও desktop GPU-তে এর ব্যবহার দেখায়। শুধু CPU-ভিত্তিক VPS-এ অন্য hardware-এ পরিমাপ করা একটি feature-এর জন্য সেই অতিরিক্ত size-এর সমপরিমাণ real memory দিতে হবে। তাই plain tag দিয়ে শুরু করুন এবং একবারে একটি পরিবর্তন করুন।
নির্দিষ্ট কারণ না থাকলে 4-bit দিয়ে শুরু করুন। 4-bit থেকে 8-bit-এ গেলে CPU-কে generate করা প্রতিটি token-এর জন্য প্রায় দ্বিগুণ bytes পড়তে হয়। ফলে memory use বাড়লেও throughput কমে। q4, q8 এবং fp16 quantisation-এর প্রকৃত খরচ অংশে এই trade ব্যাখ্যা করা হয়েছে। CPU box-এ সংক্ষিপ্ত উত্তর হলো, শুরু করার জন্য 4-bit build-ই একমাত্র উপযোগী।
Linux সার্ভারে MLX tag কেন কোনো কাজ করে না
MLX হলো Apple-এর array framework, আর Ollama-এর MLX engine হলো Apple Silicon-এর backend। নামের মধ্যে mlx থাকা যেকোনো tag ওই engine ও hardware-এর জন্য তৈরি। x86 Linux VPS-এ এগুলো এমন কয়েক দশ GB download, যা আপনি চালাতে পারবেন না এবং যা disk-এ পড়ে থেকে কোনো কাজ করবে না। ঘোষণায় দেওয়া speed figure-গুলো Mac-এ মাপা হয়েছিল। তাই সেগুলো আপনার server-এর কর্মক্ষমতাও নির্দেশ করে না। Model page-এ tag list পড়ার সময় প্রথমে প্রতিটি mlx নাম বাদ দিন। এরপর অবশিষ্ট tag দেখে প্রয়োজনীয় disk space নির্ধারণ করুন।
এটির প্রকৃত RAM ও disk প্রয়োজন কত?
দুটি বিষয় memory দখল করে, এবং তার মধ্যে মাত্র একটি tag-এর size। আপনি যে tag pull করেন, তার weights নির্দিষ্ট থাকে। KV cache, অর্থাৎ conversation-এর জন্য model যে প্রতি-token state ধরে রাখে, আপনার নির্ধারিত context length বাড়ার সঙ্গে সঙ্গে বড় হয়। Ollama-এর নিজস্ব documentation অনুযায়ী, parallel request পরিবেশন করলে in-flight request-এর সংখ্যা অনুযায়ী context বহুগুণ হয়। তাই একই সময়ে দুই agent-এর উত্তর দেওয়া একটি server-এর memory, এক agent-এর উত্তর দেওয়া একই server-এর চেয়ে বেশি প্রয়োজন।
কোনো guide থেকে RAM-এর সংখ্যা ধরে নেবেন না, এই guide থেকেও নয়। tag pull করুন, সেটিকে একটি prompt পাঠান, এবং model resident থাকা অবস্থায় এই দুটি command চালান।
ollama ps
free -hollama ps বর্তমানে কী loaded আছে এবং কাজটি CPU ও GPU-এর মধ্যে কীভাবে ভাগ হয়েছে তা দেখায়। free -h অব্যবহৃত memory কত আছে তা দেখায়। আপনার নিজের server-এ এই দুটি output যেকোনো published table-এর চেয়ে বেশি নির্ভরযোগ্য, কারণ এতে আপনার context setting, আপনার quantisation এবং server-এ চলমান অন্যান্য সবকিছু ইতিমধ্যে অন্তর্ভুক্ত থাকে।
Disk-এর বিষয়টি সহজতর। Linux-এ Ollama model সংরক্ষণ করে /usr/share/ollama/.ollama/models-এর অধীনে। অধিকাংশ VPS image-এ এটি root filesystem-এ থাকে। 40GB root volume-এ 57 GB-এর bf16 build রাখা যাবে না। পাশাপাশি দুটি 8-bit tag-ও রাখা যাবে না। কিছু pull করার আগে store-টি একটি mounted volume-এ সরিয়ে নিন।
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaollama user-কে ওই directory-এর owner হতে হবে, কারণ service-টি ollama হিসেবে চলে এবং নিজস্ব account ব্যবহার করে সেখানে blob লেখে। কোনো pull permissions-এর কারণে ব্যর্থ হলে কারণটি journalctl -u ollama -n 50-এ দেখা যাবে।
Swap সম্পর্কে একটি সরাসরি কথা মনে রাখুন: swap ব্যবহার করলে বড় tag চালানো যায় না। Generation প্রতিটি উৎপাদিত token-এর জন্য weights-এ access করে। তাই swap-এ থাকা weights বারবার disk থেকে পড়তে হয়, vmstat 1-এ si এবং so column ব্যস্ত দেখা যায়, এবং output প্রতি token-এ কয়েক সেকেন্ড সময় নিতে পারে। Out of memory killer থেকে সুরক্ষার জন্য একটি ছোট swap file রাখুন। আপনি যে tag বাস্তবে চালাতে চান, তার জন্য RAM নির্ধারণ করুন।
Ollama ইনস্টল করুন এবং নামযুক্ত tag নির্দিষ্ট করুন
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaইনস্টল script একটি systemd service সেট আপ করে। তাই reboot-এর পর server service-টি আবার চালু করে। আপনি যদি root দ্বারা পরিচালিত system service হিসেবে এটি চালাতে না চান, তাহলে Podman-এর অধীনে rootless Ollama চালানো পদ্ধতিটি দেখুন। এরপর একটি নির্দিষ্ট tag pull করুন।
ollama pull muse-glimmer:30b
ollama listollama list-এর size column নিজে পড়ুন এবং model page-এর বর্তমান tag list-এর সঙ্গে তুলনা করুন। Published tag যোগ, rename এবং remove করা হয়। কোনো guide-এ দেওয়া size একটি নির্দিষ্ট দিনের snapshot।
আপনি যে server-এর ওপর নির্ভর করেন, সেখানে কখনো ollama pull muse-glimmer লিখবেন না। সরাসরি model name ব্যবহার করলে সেটি latest tag-এ resolve হয়। আর latest এমন একটি pointer, যেটি publisher অন্য build-এ সরিয়ে নিতে পারে। নিয়মিত pull করলে আপনার agent-এর নিচে থাকা model বদলে যায়। এর ফলে memory requirement ও behaviour পরিবর্তিত হয়, কিন্তু আপনার log-এ এর কোনো ঘোষণা থাকে না। আপনার script, unit file এবং agent config-এ tag লিখে নির্দিষ্ট করুন। VPS-এ Ollama দিয়ে LLM self-host করা-তে server setup-এর বাকি অংশ ব্যাখ্যা করা হয়েছে।
GPU ছাড়া কি Muse Glimmer চালানো যায়?
হ্যাঁ, তবে এর সীমাবদ্ধতা স্পষ্টভাবে বোঝা জরুরি। একটি token তৈরি করতে model weights মেমরি থেকে পড়তে হয়। তাই গতি vCPU-এর সংখ্যা নয়, memory bandwidth নির্ধারণ করে। কয়েকটি core-এর বেশি হলে অতিরিক্ত core থেকে খুব সামান্য সুবিধা পাওয়া যায়। একটি shared VPS-এ host-এর অন্য সব tenant-এর সঙ্গে এই bandwidth ভাগ করতে হয়। তাই 4-bit-এ 30B model প্রতি সেকেন্ডে অল্পসংখ্যক token তৈরি করে।
এ বিষয়ে কারও দেওয়া সংখ্যাকে, এমনকি আমার দেওয়া সংখ্যাকেও, যাচাই না করে গ্রহণ করবেন না। আপনার নিজের box-এ প্রতি সেকেন্ডে token মাপুন এবং ফলাফল দেখে সিদ্ধান্ত নিন।
এতে model-টির উপযোগিতায় একটি স্পষ্ট পার্থক্য দেখা যায়। Interactive chat ব্যবহার করা কষ্টকর, কারণ server লেখা শুরু করার আগেই আপনি পড়া শেষ করে ফেলেন এবং প্রতিটি উত্তরের শুরুতে দীর্ঘ বিরতি থাকে। Background agent-এর কাজ ঠিকভাবে করা যায়, কারণ unattended অবস্থায় দশ মিনিট চলা কোনো task ধীরগতিকে গুরুত্ব দেয় না। Meta এই model-এর জন্য ঠিক এই দ্বিতীয় ধরনের workload-এর কথা উল্লেখ করেছে।
আপনার interactive speed প্রয়োজন হলে সৎ উত্তর দুটি: একটি GPU অথবা একটি hosted API। কিছু ভাড়া নেওয়ার আগে GPU VPS এবং API token-এর মধ্যে break-even point হিসাব করুন। আপনি আসলে কী কিনছেন, তা একটি GPU VPS বাস্তবে কী সুবিধা দেয়-এ ব্যাখ্যা করা হয়েছে। নির্দিষ্ট একটি box কী ধারণ করতে পারে—এই বিস্তৃত প্রশ্নের জন্য কোন model আপনি self-host করতে পারবেন থেকে শুরু করুন। এই size class-এ সবচেয়ে কাছের তুলনা হলো VPS-এ একই আকারের Qwen model চালানো।
128K token পূর্ণ হওয়ার অনেক আগেই এটি আগের তথ্য কেন ভুলে যায়?
কারণ মডেল যত token সমর্থন করুক, Ollama-এর ডিফল্ট context window হলো 4096 token। August 2026 অনুযায়ী, Ollama-এর নিজস্ব FAQ-তেও এই ডিফল্ট মান উল্লেখ আছে। Tag-এ 128K ঘোষণা করা হলেও, আপনি আলাদা করে না বললে server মডেলকে 4096 token দেয়। তাই দীর্ঘ agent transcript-এর শুরুর দিকের বার্তাগুলো বাদ পড়ে এবং মডেলটির amnesia হয়েছে বলে মনে হয়।
প্রতিটি request-এর জন্য server-এ এটি বাড়ান:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Interactive session-এর মধ্যে /set parameter num_ctx 32768 শুধু সেই session-এর জন্য মান পরিবর্তন করে। API ব্যবহার করলে request options-এ num_ctx পাঠান।
Context-এর প্রতিটি অতিরিক্ত token weights-এর পাশাপাশি memory ব্যবহার করে। শুধু weights চালানোর মতো capacity থাকা কোনো machine-এ পূর্ণ 128K চাইলেই load ব্যর্থ হতে পারে বা আরও ধীর কোনো পদ্ধতিতে fallback করতে পারে। ধাপে ধাপে মান বাড়ান এবং প্রতিটি ধাপের পরে ollama ps চালান। Ollama-তে num_ctx এবং context length কীভাবে কাজ করে-এ এই হিসাবটি বিস্তারিতভাবে ব্যাখ্যা করা হয়েছে।
Reasoning strength: low, medium, high and xhigh
Meta documents four reasoning strengths for Muse Glimmer, low through xhigh, and recommends the higher two for complex coding and agent tasks. In Ollama this rides on the think parameter. Use --think= on the command line, or send think in the API body.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Inside an interactive session, /set think and /set nothink toggle it. Ollama's documentation says most models accept either a boolean or a level such as low, medium or high, and that some accept max for the highest available. Which exact strings this model accepts belongs on its model page, so read that rather than guessing, and try one by hand before you wire it into an agent.
On a CPU only box this dial has teeth. A higher strength means more thinking tokens generated before the first word of the answer appears, and a thinking token costs the same wall clock time as an answer token. Leave routine work at the low setting.
সবসময় চালু থাকা agent-এর জন্য model loaded রাখুন
Ollama ডিফল্টভাবে পাঁচ মিনিট নিষ্ক্রিয় থাকার পর model unload করে। প্রতি দশ মিনিটে একবার চালু হওয়া agent-এর ক্ষেত্রে এর অর্থ হলো প্রতিটি run-এ disk থেকে সম্পূর্ণ 18 GB model load করতে হবে। Network-attached storage ব্যবহার করা VPS-এ এই load দ্রুত হয় না। তাই model-টিকে memory-তে স্থিরভাবে রাখুন।
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"ঋণাত্মক মান ব্যবহার করলে অন্য কোনো প্রক্রিয়া model unload না করা পর্যন্ত এটি memory-তে resident থাকে। API request-এ keep_alive ব্যবহার করলে শুধু ওই call-এর জন্য server-এর default মানটি override হয়। এর খরচ স্পষ্ট: কোনো কাজ না চললেও RAM occupied থাকে। তাই agent-এর জন্য নির্দিষ্ট একটি server-এ এই setting ব্যবহার করুন। Ollama model loaded রাখা অংশে বিভিন্ন ব্যবহারের ধরন ব্যাখ্যা করা হয়েছে।
একটি coding agent-কে এর দিকে নির্দেশ করুন
Ollama http://127.0.0.1:11434/v1-এ OpenAI compatible API সরবরাহ করে। তাই অধিকাংশ agent tool একটি base URL এবং যেকোনো non empty API key ব্যবহার করে সংযোগ করতে পারে। Ollama-এর Muse Glimmer page-এ একটি launch shortcut-ও নথিভুক্ত আছে। এটি একটি supported agent-কে একটি command-এ local model-এর সঙ্গে সংযুক্ত করে। সেখানেও tag নির্দিষ্ট করে দিন।
ollama launch claude --model muse-glimmer:30bAgent বড় prompt পাঠায়। File content, tool output এবং ক্রমশ বড় হওয়া transcript—সবই input token হিসেবে আসে। CPU box-এ generation শুরু হওয়ার আগেই prompt processing সবচেয়ে বেশি সময় নেয়। তাই কাজের জন্য যতটা সম্ভব ছোট context setting ব্যবহার করুন। একটি coding agent-কে Ollama-এ নির্দেশ করা client side নিয়ে আলোচনা করে, একটি VPS-এ coding agent চালানো agent চলা box নিয়ে আলোচনা করে, এবং একটি VPS-এ agent-এর খরচ নিয়ন্ত্রণ করা এটি সারাদিন চললে কী ঘটে তা ব্যাখ্যা করে।
Image input একইভাবে কাজ করে। Ollama API একটি message-এর images field-এ image গ্রহণ করে। তাই perception encoder যত উন্নতই হোক, text only client কখনো image পাঠাবে না।
port 11434 খুলবেন না
Ollama API-তে কোনো authentication নেই। আপনার laptop থেকে এটি ব্যবহার করার জন্য OLLAMA_HOST=0.0.0.0:11434 সেট করলে authentication-বিহীন একটি model runner public internet-এ উন্মুক্ত হয়ে যায়। যে কেউ এটি খুঁজে পেলে আপনার disk-এ model load করতে পারে এবং আপনার agent এর মাধ্যমে পাঠানো সবকিছু পড়তে পারে। এটিকে localhost-এ bound রাখুন এবং tunnel ব্যবহার করুন।
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API endpoint সুরক্ষিত করা-এ সঠিক বিকল্পগুলো ব্যাখ্যা করা হয়েছে। এর মধ্যে credentials চায় এমন একটি reverse proxy-ও রয়েছে।
কী কী নষ্ট হয় এবং আপনি কী দেখতে পাবেন
Pull মাঝপথে থেমে যায়। কারণ হলো disk। Model directory-এর বিরুদ্ধে df -h চালান। 57 GB bf16 build একটি 40GB root volume-এ ধরে না, এবং পাশাপাশি দুটি 8-bit tag-ও ধরে না।
Model load হওয়ার পর process বন্ধ হয়ে যায়। কারণ হলো out of memory। dmesg -T-এ kernel out of memory killer যে process নির্বাচন করেছে, তা দেখা যায়। journalctl -u ollama -n 100 একই ঘটনার service-side তথ্য দেখায়। সমাধান হলো ছোট tag অথবা ছোট num_ctx ব্যবহার করা। বেশি swap যোগ করা সমাধান নয়।
এটি প্রতি token-এ কয়েক সেকেন্ড সময় নেয়। vmstat 1 চালিয়ে si এবং so column পর্যবেক্ষণ করুন। নিয়মিত swap activity দেখা গেলে বুঝবেন weights RAM-এ ধরে না। কাজ চলার সময় box-টি disk থেকে সেগুলো বারবার পড়ছে।
গত সপ্তাহে কাজ করা একটি tag এখন নেই। Tag list পরিবর্তিত হয়। Model page আবার পড়ুন, বর্তমানে প্রয়োজনীয় tag pin করুন, এবং tag name এমন কোথাও লিখে রাখুন যেখানে পরে আবার দেখবেন।
Pull করার আগে নিজে sizes আবার যাচাই করুন
Chart-এর sizes 16 August 2026 তারিখে model-এর tag page থেকে নেওয়া হয়েছিল। Published tag list কোনো নিশ্চয়তা নয়। Model page-এ বর্তমান list পড়ুন। এরপর আপনার disk-এ বাস্তবে কী এসেছে, তা নিশ্চিত করুন:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama shared blobs হিসেবে model layer সংরক্ষণ করে। তাই একই layer ব্যবহার করা দুটি tag-এর জন্য disk-এর দ্বিগুণ জায়গা লাগে না। du যে তথ্য দেখায়, তা published size-এর সঙ্গে তুলনা করুন। Disk পরিকল্পনা করার সময় দুটি মানের মধ্যে বড়টি ধরুন।
FAQ
Muse Glimmer-এর জন্য VPS-এ কত RAM প্রয়োজন?
Tag-এর আকার দিয়ে শুরু করুন এবং এর সঙ্গে context window যোগ করুন। 16 August 2026 তারিখে default tag-এর আকার প্রায় 18 GB হিসেবে তালিকাভুক্ত ছিল। তাই 16GB-এর একটি box এটি একেবারেই ধারণ করতে পারে না, আর 24GB-এর একটি box-এ এটি রাখলে context-এর জন্য খুব কম জায়গা অবশিষ্ট থাকে। এটিকে চূড়ান্ত উত্তর নয়, প্রাথমিক হিসাব হিসেবে ধরুন। Tag pull করুন, একবার load করুন, তারপর নিজের box-এ ollama ps এবং free -h চালিয়ে নিজের পরিমাপ দেখুন। দীর্ঘ context এবং parallel request—দুটিই weights-এর অতিরিক্ত memory ব্যবহার করে।
GPU ছাড়া কি Muse Glimmer চালানো যায়?
হ্যাঁ। শুধু CPU ব্যবহার করা VPS-এ এটি load হয়ে উত্তর দিতে পারে। Generation speed core count-এর চেয়ে memory bandwidth দ্বারা বেশি সীমাবদ্ধ। Shared host-এ সেই bandwidth ভাগাভাগি হয়। তাই 4-bit-এ প্রতি second-এ অল্প সংখ্যক token আশা করুন। Unattended অবস্থায় চলা background agent-এর কাজের জন্য এটি ব্যবহারযোগ্য, কিন্তু interactive chat-এর জন্য ধীর এবং অসুবিধাজনক। কোনো request চলার সময় ollama ps চালিয়ে processor column দেখুন। এতে কাজটি কোথায় চলছে তা নিশ্চিত করা যাবে।
Linux VPS-এ MLX tag কি কোনো কাজে আসে?
না। নামের মধ্যে mlx থাকা প্রতিটি tag Ollama-এর MLX engine-এর জন্য তৈরি। এটি Apple Silicon backend। x86 Linux server-এ ওই tag-গুলো বড় download, কিন্তু চালানো যায় না। সাধারণ 30b tag অথবা অন্য কোনো non-MLX tag ব্যবহার করুন। MLX build-এর সঙ্গে থাকা Apple hardware benchmark উপেক্ষা করুন।
128K token-এর অনেক আগেই model কেন বিষয়বস্তু ভুলে যায়?
কারণ model যতটুকু সমর্থন করুক না কেন, Ollama-এর default context window 4096 token। ফলে model conversation দেখার আগেই server দীর্ঘ conversation কেটে ফেলে। Server-এ OLLAMA_CONTEXT_LENGTH সেট করুন, অথবা একটি session-এর জন্য /set parameter num_ctx ব্যবহার করুন, অথবা API request options-এ num_ctx পাঠান। এর সঙ্গে memory ব্যবহারও বাড়ে। তাই ধাপে ধাপে মান বাড়ান এবং প্রতিবার ollama ps পরীক্ষা করুন।
Tag pin করা উচিত, নাকি শুধু latest ব্যবহার করব?
Tag pin করুন। কোনো tag ছাড়া muse-glimmer চালালে এটি latest-এ resolve হয়। এটি এমন একটি pointer, যা publisher যেকোনো সময় অন্য build-এর দিকে সরিয়ে দিতে পারে। ফলে সাধারণ pull-ও আপনার agent যে model চালায় তা পরিবর্তন করতে পারে। Script, unit file এবং agent config-এ muse-glimmer:30b লিখুন। Pin করার আগে model page-এ tag list পরীক্ষা করুন, কারণ প্রকাশিত tag পরিবর্তিত হতে পারে।