تشغيل نموذج Meta Muse Glimmer 30B على خادم VPS
تعرف على متطلبات الذاكرة ومساحة القرص لتشغيل نموذج Muse Glimmer 30B على خادم Linux. اكتشف أحجام الوسوم التي تتراوح بين 17 و59 جيجابايت وتكلفة الاستنتاج باستخدام المعالج.
متطلبات Muse Glimmer على خادم VPS
يعمل Muse Glimmer على خادم Linux VPS عادي دون الحاجة إلى وحدة معالجة رسومية (GPU)، ويحدد الوسم (tag) الذي تسحبه ما إذا كان النموذج سيتسع في الذاكرة. نشرت Meta Superintelligence Labs النموذج في 10 أغسطس 2026 تحت رخصة Apache 2.0: يتكون النموذج من 30 مليار معامل، ونافذة سياق بحجم 128K، ومُشفّر إدراك مخصص بـ 1.8 مليار معامل ليتمكن من قراءة الصور بجانب النصوص. تروّج Meta لهذا النموذج كأداة للوكلاء المحليين الذين يعملون باستمرار بدلاً من كونه مجرد واجهة دردشة، مع قوة استنتاج يمكنك ضبطها لكل طلب.
تتراوح وسوم Ollama المنشورة، والتي تم الاطلاع عليها في 16 أغسطس 2026، من 17 جيجابايت إلى 59 جيجابايت. هذا النطاق يمثل مشكلة التحجيم بأكملها. الوسم الافتراضي مدرج بحجم 18 جيجابايت تقريباً، لذا فإن أصغر خادم منطقي يجب أن يحتوي بوضوح على أكثر من 18 جيجابايت من ذاكرة الوصول العشوائي (RAM) الحرة. تُضاف إلى ذلك مساحة القرص اللازمة للتنزيل، والذاكرة المطلوبة لنافذة السياق.
أي وسم muse-glimmer يجب أن تسحب؟
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]أدرجت Ollama عدد 11 وسماً لهذا النموذج لا تتبع إصدارات Apple. تحتوي هذه الوسوم على نفس الأوزان البالغ حجمها 30 ملياراً ولكن مخزنة بدقة رقمية مختلفة. الحجم الذي تراه هو ما ستقوم بتنزيله، وهو أيضاً الحجم التقريبي الذي يجب أن توفره في الذاكرة قبل إضافة أي سياق.
إصدارا 4-bit هما الأصغر حجماً: 30b-nvfp4 بحجم 17 GB و30b-q4_K_M بحجم 18 GB. الوسم الافتراضي 30b مدرج بنفس حجم إصدار q4_K_M. أما إصدارات 8-bit، وهي 30b-q8_0 و30b-mxfp8، فتقترب من 31 GB. بينما 30b-bf16 هو الإصدار غير المكمم (unquantised) بدقة 16-bit وحجمه 57 GB، وهو ما يتطلب ذاكرة وصول عشوائي (RAM) تفوق ما توفره معظم الخوادم المستأجرة بسعر معقول لمشروع جانبي.
وسوم -dflash هي نفس الإصدارات مع دعم DFlash، وكل منها مدرج بحجم أكبر من نظيره العادي. تصف Ollama ميزة DFlash بأنها ميزة تحسين سرعة وتستعرضها على معالجات Apple Silicon ووحدات معالجة الرسوميات المكتبية (desktop GPUs). على خادم افتراضي (VPS) يعتمد على المعالج المركزي (CPU) فقط، ستدفع ثمن هذا الحجم الإضافي من الذاكرة الفعلية مقابل ميزة تم قياس أدائها على عتاد مختلف، لذا ابدأ بالوسم العادي وغيّر إعداداً واحداً في كل مرة.
ابدأ بإصدار 4-bit ما لم يكن لديك سبب محدد لغير ذلك. الانتقال من 4-bit إلى 8-bit يضاعف تقريباً عدد البايتات التي يجب على المعالج قراءتها لكل رمز (token) يقوم بتوليده، مما يؤدي إلى انخفاض معدل الإنتاجية وزيادة استهلاك الذاكرة. هذه المقايضة هي موضوع ما تكلفة التكميم q4 و q8 و fp16 فعلياً، وبالنسبة لخادم يعتمد على CPU، الإجابة المختصرة هي أن إصدار 4-bit هو الوحيد الذي يستحق البدء به.
لماذا لا تعمل وسوم MLX على خادم Linux
إطار عمل MLX هو إطار المصفوفات الخاص بشركة Apple، ومحرك MLX في Ollama هو الواجهة الخلفية المخصصة لمعالجات Apple Silicon. أي وسم يحتوي على mlx في اسمه مصمم خصيصاً لهذا المحرك وذلك العتاد. على خادم VPS يعمل بنظام x86 Linux، سيؤدي ذلك إلى تنزيل عشرات الجيجابايت التي لا يمكنك تشغيلها، وستشغل مساحة على قرصك دون أي فائدة. أرقام السرعة المذكورة في الإعلان والتي تم قياسها على جهاز Mac تخص تلك الوسوم، لذا فهي لا تصف أداء خادمك أيضاً. عند قراءة قائمة الوسوم في صفحة النموذج، قم بتصفية واستبعاد كل اسم يحتوي على mlx أولاً، ثم اختر الحجم المناسب من القائمة المتبقية.
ما مقدار ذاكرة الوصول العشوائي (RAM) والمساحة التخزينية المطلوبة فعلياً؟
هناك عاملان يستهلكان الذاكرة، أحدهما فقط هو حجم النموذج (tag). الأوزان ثابتة بناءً على النموذج الذي تسحبه. أما ذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache)، وهي الحالة التي يحتفظ بها النموذج لكل رمز (token) أثناء المحادثة، فتزداد مع طول السياق الذي تضبطه. تشير وثائق Ollama إلى أن خدمة الطلبات المتوازية تضاعف السياق بعدد الطلبات الجارية، لذا فإن الخادم الذي يجيب على وكيلين في وقت واحد يحتاج إلى ذاكرة أكبر من الخادم الذي يجيب على وكيل واحد.
لا تعتمد على رقم ذاكرة الوصول العشوائي (RAM) المذكور في أي دليل، بما في ذلك هذا الدليل. اسحب النموذج، وأرسل إليه طلباً واحداً، وبينما لا يزال النموذج محملاً في الذاكرة، نفذ هذين الأمرين:
ollama ps
free -hيعرض ollama ps ما هو محمل حالياً وكيفية توزيع العمل بين المعالج (CPU) ومعالج الرسوميات (GPU). يعرض free -h ما تبقى من الذاكرة. هاتان المخرجات على خادمك الخاص أدق من أي جدول منشور، لأنهما تتضمنان بالفعل إعدادات السياق الخاصة بك، ومستوى التكميم (quantisation)، وكل ما يشغله الخادم حالياً.
المساحة التخزينية هي الجزء الأسهل. يخزن Ollama النماذج في /usr/share/ollama/.ollama/models على أنظمة Linux، وهو مسار يقع ضمن نظام ملفات الجذر (root) في معظم صور الخوادم الافتراضية (VPS). لن يتسع حجم الجذر البالغ 40 جيجابايت لإصدار bf16 بحجم 57 جيجابايت، ولن يتسع أيضاً لنموذجين بترميز 8-bit جنباً إلى جنب. انقل مسار التخزين إلى وحدة تخزين (volume) مثبتة قبل سحب أي شيء.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaيجب أن يكون المستخدم ollama هو مالك ذلك الدليل، لأن الخدمة تعمل بصلاحيات ollama وتكتب ملفات الـ blobs هناك بصفته هذه. إذا فشلت عملية السحب بسبب صلاحيات الوصول، فستجد السبب في journalctl -u ollama -n 50.
بخصوص مساحة التبادل (Swap)، يجب توضيح أمر واحد: مساحة التبادل لا تسمح لك بتشغيل نموذج أكبر. عملية التوليد تلمس الأوزان لكل رمز تنتجه، لذا فإن الأوزان الموجودة في مساحة التبادل تُقرأ من القرص مراراً وتكراراً، حيث يظهر vmstat 1 انشغال عمودي si و so، وتتباطأ المخرجات لتصبح ثوانٍ لكل رمز. احتفظ بملف تبادل صغير كإجراء وقائي ضد ميزة إنهاء العمليات عند نفاد الذاكرة (OOM killer). حدد حجم ذاكرة الوصول العشوائي (RAM) بناءً على النموذج الذي ترغب في استخدامه فعلياً.
تثبيت Ollama وتثبيت إصدار محدد (Tag)
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaيقوم سكربت التثبيت بإعداد خدمة systemd، مما يضمن عمل الخادم تلقائياً بعد إعادة التشغيل. إذا كنت تفضل عدم تشغيله كخدمة مدارة بواسطة root، فإن تشغيل Ollama بدون صلاحيات root باستخدام Podman يغطي هذا المسار. بعد ذلك، قم بسحب إصدار (tag) محدد.
ollama pull muse-glimmer:30b
ollama listاقرأ عمود الحجم في ollama list بنفسك وقارنه بقائمة الإصدارات الحالية في صفحة النموذج. تتم إضافة الإصدارات المنشورة، وإعادة تسميتها، وإزالتها، والحجم المذكور في أي دليل هو مجرد لقطة زمنية ليوم واحد.
لا تكتب ollama pull muse-glimmer أبداً على خادم تعتمد عليه. اسم النموذج المجرد يحلّ إلى الإصدار latest، وlatest هو مؤشر يمكن للناشر نقله إلى إصدار بناء مختلف. عملية سحب روتينية قد تستبدل النموذج الذي يعمل عليه وكيلك (agent) بنسخة أخرى، مما يغير متطلبات الذاكرة والسلوك، ولن تجد في سجلاتك ما يشير إلى ذلك. اكتب الإصدار (tag) في سكربتاتك، وفي ملفات الوحدات (unit files)، وفي إعدادات الوكيل الخاص بك. يغطي استضافة نموذج لغوي كبير (LLM) ذاتياً باستخدام Ollama على خادم VPS بقية إعدادات الخادم.
هل يمكنك تشغيل Muse Glimmer بدون وحدة معالجة رسوميات (GPU)؟
نعم، ومن الضروري أن نكون صريحين بشأن سقف الأداء. توليد رمز (token) واحد يعني قراءة أوزان النموذج من الذاكرة، لذا تتحدد السرعة بناءً على عرض نطاق الذاكرة (memory bandwidth) وليس بعدد أنوية المعالج الافتراضي (vCPU) التي تعلن عنها الخطة. بعد تجاوز عدد قليل من الأنوية، لن يضيف لك المزيد منها أي فائدة تذكر. على خادم افتراضي خاص (VPS) مشترك، يتم تقاسم عرض النطاق هذا مع جميع المستأجرين الآخرين على المضيف، لذا فإن نموذجاً بحجم 30B بدقة 4-bit سينتج عدداً قليلاً من الرموز في الثانية.
لا تعتمد على أرقام أي شخص، بما في ذلك أرقامي. قِس عدد الرموز في الثانية على خادمك الخاص وقرر بناءً على ما تراه.
النتيجة هي تباين حقيقي في مجالات استخدام النموذج. الدردشة التفاعلية ستكون تجربة سيئة، لأنك تقرأ أسرع مما يكتب الخادم، وكل رد يبدأ بتوقف طويل. أما عمل الوكيل في الخلفية فهو مقبول، لأن المهمة التي تعمل دون مراقبة لمدة عشر دقائق لا يهمها البطء. هذا النوع الثاني من أعباء العمل هو بالضبط ما تصفه Meta لهذا النموذج.
إذا كنت بحاجة إلى سرعة تفاعلية، فالإجابتان الصادقتان هما استخدام وحدة معالجة رسوميات (GPU) أو واجهة برمجة تطبيقات (API) مستضافة. احسب نقطة التعادل بين تكلفة خادم VPS مزود بـ GPU وتكلفة رموز الـ API قبل استئجار أي شيء، ويوضح مقال ما الذي يمنحك إياه خادم VPS مزود بـ GPU فعلياً ما تشتريه مقابل مالك. بالنسبة للسؤال الأوسع حول ما يمكن لخادم معين استيعابه، ابدأ بـ النماذج التي يمكنك استضافتها ذاتياً، ويعد مقال تشغيل نموذج Qwen بحجم مشابه على خادم VPS أقرب مقارنة في فئة الحجم هذه.
لماذا ينسى النموذج المعلومات قبل الوصول إلى 128K من الرموز (tokens)؟
لأن نافذة السياق الافتراضية في Ollama هي 4096 رمزاً، بغض النظر عما يدعمه النموذج. هذا الإعداد الافتراضي مذكور في الأسئلة الشائعة الخاصة بـ Ollama حتى أغسطس 2026. يعلن الوسم (tag) عن دعم 128K، لكن الخادم يزوّد النموذج بـ 4096 رمزاً فقط ما لم تحدد خلاف ذلك، لذا يفقد سجل المحادثة الطويل بداياته ويظهر النموذج وكأنه يعاني من فقدان الذاكرة.
ارفع القيمة على الخادم لكل طلب:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"داخل جلسة تفاعلية، يغيّر /set parameter num_ctx 32768 القيمة لتلك الجلسة فقط. عبر واجهة برمجة التطبيقات (API)، أرسل num_ctx ضمن خيارات الطلب.
كل رمز إضافي في السياق يستهلك ذاكرة إضافية فوق حجم أوزان النموذج. إذا طلبت كامل سعة 128K على خادم مخصص للأوزان فقط، سيفشل التحميل أو سينتقل النظام إلى أداء أبطأ. ارفع القيمة تدريجياً ونفّذ ollama ps بعد كل خطوة. يشرح الرابط كيفية عمل num_ctx وطول السياق في Ollama الحسابات المتعلقة بذلك.
قوة الاستنتاج: منخفضة، متوسطة، عالية، وعالية جداً (xhigh)
تُوثّق Meta أربع مستويات لقوة الاستنتاج في نموذج Muse Glimmer، تبدأ من المنخفضة وتصل إلى العالية جداً (xhigh)، وتوصي باستخدام المستويين الأعلى للمهام البرمجية المعقدة ومهام الوكلاء (agent tasks). في Ollama، يعتمد هذا على المعامل think. استخدم --think= في سطر الأوامر، أو أرسل think ضمن نص طلب API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"داخل جلسة تفاعلية، يمكنك التبديل بين المستويات باستخدام /set think و/set nothink. تشير وثائق Ollama إلى أن معظم النماذج تقبل إما قيمة منطقية (boolean) أو مستوى مثل low أو medium أو high، وأن بعضها يقبل max للحصول على أعلى مستوى متاح. تعتمد السلاسل النصية الدقيقة التي يقبلها هذا النموذج على صفحة النموذج الخاصة به، لذا اقرأها بدلاً من التخمين، وجرّب إحداها يدوياً قبل ربطها ببرمجية وكيل.
على الأجهزة التي تعمل بالمعالج (CPU) فقط، لهذا الإعداد تأثير ملموس. تعني القوة الأعلى توليد المزيد من رموز التفكير (thinking tokens) قبل ظهور الكلمة الأولى من الإجابة، وتستغرق رموز التفكير نفس الوقت الفعلي الذي تستغرقه رموز الإجابة. اترك المهام الروتينية على الإعداد المنخفض (low).
إبقاء النموذج محملاً لعميل يعمل باستمرار
يقوم Ollama بإلغاء تحميل النموذج الخامل بعد خمس دقائق افتراضياً. بالنسبة لعميل يعمل كل عشر دقائق، يعني هذا دفع تكلفة تحميل كاملة بحجم 18 GB من القرص في كل تشغيل، وهذا التحميل ليس سريعاً على خادم VPS يستخدم وحدة تخزين متصلة بالشبكة. بدلاً من ذلك، قم بتثبيت النموذج في الذاكرة.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"تؤدي القيمة السالبة إلى إبقاء النموذج مقيماً في الذاكرة حتى يقوم شيء ما بإلغاء تحميله، كما يتجاوز المعامل keep_alive في طلب API الإعداد الافتراضي للخادم لهذا الطلب فقط. التكلفة واضحة: تظل ذاكرة الوصول العشوائي (RAM) مشغولة بينما لا يحدث شيء، لذا فهذا الإعداد مخصص لخادم مكرس لهذا العميل. يغطي الرابط إبقاء نموذج Ollama محملاً المتغيرات المختلفة.
توجيه وكيل برمجي إليه
يُقدّم Ollama واجهة برمجة تطبيقات متوافقة مع OpenAI على http://127.0.0.1:11434/v1، لذا تتصل معظم أدوات الوكلاء باستخدام رابط أساسي (Base URL) وأي مفتاح API غير فارغ. توثّق صفحة Muse Glimmer الخاصة بـ Ollama أيضاً اختصار تشغيل يربط الوكيل المدعوم بنموذج محلي في أمر واحد، وعليك تثبيت الإصدار (tag) هناك أيضاً.
ollama launch claude --model muse-glimmer:30bيرسل الوكلاء مطالبات (prompts) كبيرة. تصل محتويات الملفات ومخرجات الأدوات وسجل المحادثة المتنامي كرموز إدخال (input tokens)، وفي أجهزة المعالجات المركزية (CPU)، تُعد معالجة المطالبات هي الجزء الأكثر استهلاكاً للموارد قبل أن يبدأ التوليد الفعلي. اجعل إعدادات السياق (context) صغيرة قدر الإمكان حسب متطلبات المهمة. يغطي توجيه وكيل برمجي إلى Ollama جانب العميل، بينما يغطي تشغيل وكيل برمجي على خادم VPS الجهاز الذي يعمل عليه، ويغطي التحكم في تكاليف الوكيل على خادم VPS ما يحدث عند تشغيله طوال اليوم.
يعمل إدخال الصور بنفس الطريقة. تقبل واجهة برمجة تطبيقات Ollama الصور في حقل images من الرسالة، لذا لن يرسل العميل الذي يدعم النصوص فقط أي صورة، بغض النظر عن مدى كفاءة مُشفّر الإدراك (perception encoder) لديه.
لا تفتح المنفذ 11434
لا تتضمن واجهة برمجة تطبيقات Ollama أي آلية للمصادقة. إن ضبط OLLAMA_HOST=0.0.0.0:11434 لتتمكن من الوصول إليها من حاسوبك المحمول يضع مشغّل نماذج غير مصادق عليه على شبكة الإنترنت العامة، حيث يمكن لأي شخص يعثر عليه تحميل نماذج على قرصك وقراءة كل ما يرسله الوكيل الخاص بك عبره. اترك الخدمة مرتبطة بـ localhost واستخدم نفقاً (tunnel) بدلاً من ذلك.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsتغطي تأمين نقطة نهاية واجهة برمجة تطبيقات Ollama الخيارات المناسبة، بما في ذلك استخدام وكيل عكسي (reverse proxy) يطلب بيانات اعتماد.
ما الذي يتعطل، وما الذي ستراه
تتوقف عملية السحب في منتصف الطريق. القرص. شغّل df -h على دليل النموذج. بناء bf16 بحجم 57 جيجابايت لا يتسع على وحدة تخزين جذرية بحجم 40 جيجابايت، وكذلك لا يتسع وسمان (tags) بحجم 8-bit جنباً إلى جنب.
يتم تحميل النموذج ثم تموت العملية. نفاد الذاكرة. يسجل dmesg -T قيام قاتل نفاد الذاكرة في النواة (kernel out of memory killer) باختيار عملية لإنهاؤها، ويظهر journalctl -u ollama -n 100 جانب الخدمة من الحدث نفسه. الحل هو استخدام وسم أصغر أو num_ctx أصغر. الحل ليس زيادة مساحة التبادل (swap).
يعمل النموذج بسرعة ثوانٍ لكل رمز (token). شغّل vmstat 1 وراقب عمودي si و so. نشاط التبادل المستمر يعني أن الأوزان لا تتسع في الذاكرة العشوائية (RAM)، وأن الخادم يقرؤها من القرص أثناء العمل.
وسم كان يعمل الأسبوع الماضي اختفى. قوائم الوسوم تتغير. أعد قراءة صفحة النموذج، وثبّت (pin) أي إصدار حالي، وسجّل اسم الوسم في مكان يمكنك الرجوع إليه.
أعد التحقق من الأحجام بنفسك قبل السحب
الأحجام المذكورة في الجدول قُرئت من صفحة وسوم النموذج في 16 أغسطس 2026، وقائمة الوسوم المنشورة ليست وعداً. اقرأ القائمة الحالية على صفحة النموذج، ثم تأكد مما وصل فعلياً إلى قرصك:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsيخزن Ollama طبقات النموذج كـ blobs مشتركة، لذا فإن وسمين يشتركان في طبقة لا يستهلكان ضعف مساحة القرص. قارن ما يبلغه du بالحجم المنشور وخطط لمساحة قرصك بناءً على الحجم الأكبر بينهما.
FAQ
ما مقدار ذاكرة الوصول العشوائي (RAM) التي يحتاجها Muse Glimmer على خادم VPS؟
ابدأ بحجم الوسم (tag) وأضف إليه نافذة السياق. يبلغ حجم الوسم الافتراضي حوالي 18 جيجابايت بتاريخ 16 أغسطس 2026، لذا لا يمكن لخادم بسعة 16 جيجابايت استيعابه إطلاقاً، بينما الخادم بسعة 24 جيجابايت يستوعبه مع مساحة ضئيلة جداً للسياق. اعتبر هذا نقطة انطلاق وليس إجابة نهائية. اسحب الوسم، وقم بتحميله مرة واحدة، ثم نفّذ ollama ps و free -h على خادمك الخاص واقرأ الأرقام الناتجة لديك. يؤدي السياق الأطول والطلبات المتوازية إلى زيادة استهلاك الذاكرة فوق حجم الأوزان.
هل يمكنني تشغيل Muse Glimmer بدون وحدة معالجة رسومية (GPU)؟
نعم. يتم تحميله والإجابة عليه على خادم VPS يعتمد على المعالج (CPU) فقط. سرعة التوليد محدودة بعرض نطاق الذاكرة الترددي بدلاً من عدد الأنوية، وعلى الخادم المشترك يتم مشاركة هذا النطاق، لذا توقع عدداً قليلاً من الرموز (tokens) في الثانية عند دقة 4-bit. هذا مناسب لعمل الوكلاء في الخلفية دون مراقبة، ولكنه بطيء جداً للمحادثات التفاعلية. نفّذ ollama ps أثناء الطلب واقرأ عمود المعالج للتأكد من مكان تنفيذ العمل.
هل وسوم MLX مفيدة على خادم Linux VPS؟
لا. كل وسم يحتوي على mlx في اسمه مصمم لمحرك MLX الخاص بـ Ollama، وهو المحرك المخصص لمعالجات Apple Silicon. على خادم Linux بمعمارية x86، تعتبر هذه الوسوم تنزيلاً كبيراً لا يمكنك تشغيله. استخدم الوسم العادي 30b، أو أحد الوسوم الأخرى غير المخصصة لـ MLX، وتجاهل معايير أداء أجهزة Apple التي تظهر مع إصدارات MLX.
لماذا ينسى النموذج الأشياء قبل الوصول إلى 128K من الرموز؟
لأن نافذة السياق الافتراضية في Ollama هي 4096 رمزاً بغض النظر عما يدعمه النموذج، لذا يقوم الخادم باقتطاع المحادثات الطويلة قبل أن يراها النموذج. اضبط OLLAMA_CONTEXT_LENGTH على الخادم، أو /set parameter num_ctx لجلسة واحدة، أو أرسل num_ctx ضمن خيارات طلب API. يرتفع استهلاك الذاكرة مع زيادة هذا الرقم، لذا ارفعه تدريجياً وتحقق من ollama ps في كل مرة.
هل يجب علي تثبيت إصدار الوسم (pin) أم استخدام الأحدث (latest)؟
قم بتثبيته. muse-glimmer بدون وسم يتم حله إلى latest، وهو مؤشر يمكن للناشر تغييره إلى إصدار مختلف في أي وقت، لذا فإن عملية السحب الروتينية قد تغير النموذج الذي يعمل عليه وكيلك. اكتب muse-glimmer:30b في النصوص البرمجية (scripts)، وملفات الوحدات (unit files)، وإعدادات الوكيل. تحقق من قائمة الوسوم في صفحة النموذج قبل التثبيت، لأن الوسوم المنشورة تتغير.