تشغيل نموذج Muse Glimmer 30B على خادم VPS
تعرف على متطلبات الذاكرة ومساحة القرص لتشغيل Muse Glimmer 30B على خادم Linux. اكتشف التكلفة الحقيقية للاستنتاج عبر المعالج فقط وتجنب أخطاء الذاكرة عند سحب وسوم Ollama.
متطلبات Muse Glimmer على خادم VPS
يعمل Muse Glimmer على خادم Linux VPS عادي بدون وحدة معالجة رسومية (GPU)، ويحدد الوسم (tag) الذي تسحبه ما إذا كان النموذج سيتناسب مع ذاكرة الوصول العشوائي (RAM) المتوفرة. نشرت Meta Superintelligence Labs النموذج في 10 أغسطس 2026 بموجب ترخيص Apache 2.0: يتكون النموذج من 30 مليار معامل، ونافذة سياق بحجم 128K، ومشفر إدراك مخصص بـ 1.8 مليار معامل ليتمكن من قراءة الصور بجانب النصوص. تروّج Meta للنموذج كأداة للوكلاء المحليين الذين يعملون بشكل دائم بدلاً من استخدامه للدردشة، مع قوة استنتاج يمكنك ضبطها لكل طلب.
تتراوح وسوم Ollama المنشورة، كما رُصدت في 16 أغسطس 2026، من 17 جيجابايت إلى 59 جيجابايت. هذا النطاق هو جوهر مشكلة تحديد الحجم. الوسم الافتراضي مدرج بحجم 18 جيجابايت تقريباً، لذا فإن أصغر خادم منطقي يجب أن يحتوي بوضوح على أكثر من 18 جيجابايت من ذاكرة الوصول العشوائي الحرة. تُضاف إلى ذلك مساحة القرص المطلوبة للتنزيل وذاكرة إضافية لنافذة السياق.
أي وسم muse-glimmer يجب أن تسحب؟
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]أدرجت Ollama عدد 11 من الوسوم لهذا النموذج، وهي ليست إصدارات خاصة بـ Apple. تحتوي هذه الوسوم على نفس الأوزان البالغة 30 ملياراً والمخزنة بدقة رقمية مختلفة. الحجم الذي تراه هو الحجم الذي ستقوم بتحميله، وهو أيضاً الحجم التقريبي الذي يجب أن توفره في الذاكرة قبل إضافة أي سياق.
إصدارا 4-bit هما الأصغر حجماً: 30b-nvfp4 بحجم 17 GB و30b-q4_K_M بحجم 18 GB. الوسم الافتراضي 30b مدرج بنفس حجم إصدار q4_K_M. أما إصدارات 8-bit، وهي 30b-q8_0 و30b-mxfp8، فتصل إلى حوالي 31 GB. بينما 30b-bf16 هو الإصدار غير المكمم (unquantised) بدقة 16-bit بحجم 57 GB، وهو ما يتطلب ذاكرة وصول عشوائي (RAM) تفوق ما توفره معظم الخوادم المستأجرة بسعر معقول للمشاريع الجانبية.
وسوم -dflash هي نفس الإصدارات مع دعم DFlash، وكل منها مدرج بحجم أكبر من نظيره العادي. تصف Ollama ميزة DFlash بأنها ميزة لزيادة السرعة وتستعرض أداءها على معالجات Apple Silicon ومعالجات الرسوميات المكتبية (desktop GPUs). على خادم افتراضي (VPS) يعمل بالمعالج المركزي (CPU) فقط، ستدفع ثمن هذا الحجم الإضافي من الذاكرة الفعلية مقابل ميزة تم قياس أدائها على عتاد مختلف، لذا ابدأ بالوسم العادي وقم بتغيير شيء واحد في كل مرة.
ابدأ بإصدار 4-bit ما لم يكن لديك سبب محدد لعدم القيام بذلك. الانتقال من 4-bit إلى 8-bit يضاعف تقريباً عدد البايتات التي يجب على المعالج قراءتها لكل رمز (token) يقوم بتوليده، مما يؤدي إلى انخفاض معدل الإنتاجية بينما يرتفع استهلاك الذاكرة. هذه المقايضة هي موضوع التكلفة الفعلية لعمليات التكميم q4 وq8 وfp16، وبالنسبة لخادم يعتمد على المعالج المركزي، فإن الإجابة المختصرة هي أن إصدار 4-bit هو الوحيد الذي يستحق البدء به.
لماذا لا تعمل وسوم MLX على خادم Linux
MLX هو إطار عمل المصفوفات الخاص بشركة Apple، ومحرك MLX في Ollama هو الواجهة الخلفية المخصصة لمعالجات Apple Silicon. أي وسم يحتوي على mlx في اسمه مصمم خصيصاً لهذا المحرك وذلك العتاد. على خادم VPS يعمل بنظام Linux بمعمارية x86، سيؤدي ذلك إلى تنزيل عشرات الجيجابايت التي لا يمكنك تشغيلها، وستشغل مساحة على قرصك دون أي فائدة. أرقام السرعة المذكورة في الإعلان والتي تم قياسها على أجهزة Mac تخص تلك الوسوم، لذا فهي لا تصف أداء خادمك أيضاً. عند قراءة قائمة الوسوم في صفحة النموذج، استبعد أولاً كل اسم يحتوي على mlx، ثم اختر الحجم المناسب مما تبقى.
ما مقدار ذاكرة الوصول العشوائي (RAM) والمساحة التخزينية التي يحتاجها النظام فعلياً؟
هناك أمران يستهلكان الذاكرة، أحدهما فقط هو حجم الوسم (tag). يتم تحديد أوزان النموذج بناءً على الوسم الذي تسحبه. أما ذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache)، وهي الحالة التي يحتفظ بها النموذج لكل رمز (token) أثناء المحادثة، فتزداد مع زيادة طول السياق الذي تضبطه. تشير وثائق Ollama إلى أن خدمة الطلبات المتوازية تضاعف السياق بعدد الطلبات الجارية، لذا فإن الخادم الذي يجيب على وكيلين في وقت واحد يحتاج إلى ذاكرة أكبر من الخادم الذي يجيب على وكيل واحد.
لا تعتمد على رقم ذاكرة الوصول العشوائي (RAM) الوارد في أي دليل، بما في ذلك هذا الدليل. اسحب الوسم، وأرسل إليه طلباً واحداً، وبينما لا يزال النموذج محملاً في الذاكرة، نفذ هذين الأمرين.
ollama ps
free -hيعرض ollama ps ما يتم تحميله حالياً وكيفية توزيع العمل بين المعالج (CPU) ومعالج الرسوميات (GPU). بينما يعرض free -h ما تبقى من موارد. هاتان المخرجات على خادمك الخاص أدق من أي جدول منشور، لأنهما تتضمنان بالفعل إعدادات السياق الخاصة بك، ومستوى التكميم (quantisation)، وكل ما يشغله الخادم حالياً.
المساحة التخزينية هي الجزء الأسهل. يخزن Ollama النماذج في المسار /usr/share/ollama/.ollama/models على أنظمة Linux، والذي يقع عادةً ضمن نظام ملفات الجذر (root) في معظم صور الخوادم الافتراضية (VPS). وحدة تخزين جذر بحجم 40GB لن تتسع لإصدار bf16 بحجم 57 GB، ولن تتسع أيضاً لوسمين بحجم 8-bit جنباً إلى جنب. إذا لم يسبق لك الاطلاع على ما يكتبه أمر السحب فعلياً، فإن مكان تخزين Ollama للنماذج وكيفية نقلها يشرح ذلك الدليل بالتفصيل. انقل مخزن النماذج إلى وحدة تخزين مثبتة (mounted volume) قبل سحب أي شيء.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaيجب أن يكون المستخدم ollama هو مالك ذلك الدليل، لأن الخدمة تعمل بصلاحيات ollama وتكتب ملفاتها (blobs) هناك بصفتها تلك. إذا فشلت عملية السحب بسبب صلاحيات الوصول، فستجد السبب في journalctl -u ollama -n 50.
بخصوص مساحة التبديل (swap)، يجب توضيح أمر واحد: مساحة التبديل لا تسمح لك بتشغيل وسم أكبر. عملية التوليد تلمس الأوزان لكل رمز تنتجه، لذا فإن الأوزان الموجودة في مساحة التبديل تُقرأ من القرص مراراً وتكراراً، وسيظهر vmstat 1 عمودي si و so في حالة نشاط، وستتباطأ سرعة المخرجات لتصل إلى ثوانٍ لكل رمز. احتفظ بملف تبديل صغير كإجراء وقائي ضد أداة إنهاء العمليات عند نفاد الذاكرة (OOM killer). حدد حجم ذاكرة الوصول العشوائي (RAM) بناءً على الوسم الذي ترغب في استخدامه فعلياً.
تثبيت Ollama وتثبيت إصدار محدد (Tag)
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaيُعدّ نص التثبيت خدمة systemd، لذا سيعود الخادم للعمل تلقائياً بعد إعادة التشغيل. إذا كنت تفضل عدم تشغيلها كخدمة مدارة بواسطة root، فإن تشغيل Ollama بدون صلاحيات root باستخدام Podman يغطي هذا المسار. بعد ذلك، قم بسحب إصدار (tag) محدد.
ollama pull muse-glimmer:30b
ollama listاقرأ عمود الحجم في ollama list بنفسك وقارنه بقائمة الإصدارات الحالية في صفحة النموذج. تُضاف الإصدارات المنشورة، وتُعاد تسميتها، وتُحذف، لذا فإن الحجم المذكور في أي دليل هو مجرد لقطة ليوم واحد.
لا تكتب أبداً ollama pull muse-glimmer على خادم تعتمد عليه. اسم النموذج المجرد يحلّ إلى الإصدار latest، وlatest هو مؤشر يمكن للناشر نقله إلى إصدار مختلف. عملية سحب روتينية قد تستبدل النموذج الذي يعمل عليه وكيلك، مما يؤدي إلى متطلبات ذاكرة مختلفة وسلوك مختلف، ولن يظهر أي إشعار بذلك في سجلاتك. اكتب الإصدار (tag) في نصوصك البرمجية، وفي ملفات الوحدات (unit files)، وفي إعدادات وكيلك. يغطي استضافة نموذج لغوي كبير ذاتياً باستخدام Ollama على خادم افتراضي خاص (VPS) بقية إعدادات الخادم.
هل يمكنك تشغيل Muse Glimmer بدون وحدة معالجة رسوميات (GPU)؟
نعم، ومن الضروري أن نكون صريحين بشأن سقف الأداء. توليد رمز (token) واحد يعني قراءة أوزان النموذج من الذاكرة، لذا فإن السرعة تتحدد بعرض نطاق الذاكرة (memory bandwidth) وليس بعدد أنوية المعالج (vCPU) التي تعلن عنها الخطة. بعد تجاوز عدد قليل من الأنوية، لن يضيف المزيد منها أي تحسن ملموس. على خادم افتراضي خاص (VPS) مشترك، يتم مشاركة هذا النطاق مع جميع المستأجرين الآخرين على المضيف، لذا فإن نموذجاً بحجم 30B بدقة 4-bit سينتج عدداً قليلاً من الرموز في الثانية.
لا تقبل أرقام أي شخص، بما في ذلك أرقامي. قِس عدد الرموز في الثانية على خادمك الخاص وقرر بناءً على ما تراه.
النتيجة هي انقسام حقيقي في مجالات استخدام النموذج. الدردشة التفاعلية ستكون تجربة سيئة، لأنك تقرأ أسرع مما يكتب الخادم، وكل رد يبدأ بتوقف طويل. أما عمل الوكيل في الخلفية فهو مقبول، لأن المهمة التي تعمل دون مراقبة لمدة عشر دقائق لا يهمها كونها بطيئة. هذا النوع الثاني من أعباء العمل هو بالضبط ما تصفه Meta لهذا النموذج.
إذا كنت بحاجة إلى سرعة تفاعلية، فالإجابتان الصادقتان هما استخدام GPU أو واجهة برمجة تطبيقات (API) مستضافة. احسب نقطة التعادل بين تكلفة خادم GPU ورموز الـAPI قبل استئجار أي شيء، ويشرح ما الذي يمنحك إياه خادم GPU فعلياً ما تشتريه. بالنسبة للسؤال الأوسع حول ما يمكن لخادم معين استيعابه، ابدأ بـ النماذج التي يمكنك استضافتها ذاتياً، ويعد تشغيل نموذج Qwen بحجم مشابه على خادم VPS أقرب مقارنة في فئة الحجم هذه. إذا كانت الأرقام التي تقيسها بطيئة جداً بحيث لا يمكنك التعايش معها، فإن Nemotron 3.5 Lightning على خادم VPS يطرح نفس أسئلة الذاكرة العشوائية (RAM) وعدد الرموز في الثانية لنموذج بُني من أجل السرعة بدلاً من الحجم.
لماذا ينسى النموذج المعلومات قبل الوصول إلى 128K من الرموز (tokens)؟
لأن نافذة السياق الافتراضية في Ollama هي 4096 رمزاً، بغض النظر عما يدعمه النموذج. هذا الإعداد الافتراضي مذكور في قسم الأسئلة الشائعة الخاص بـ Ollama حتى أغسطس 2026. يعلن الوسم (tag) عن دعم 128K، لكن الخادم يزوّد النموذج بـ 4096 رمزاً فقط ما لم تحدد خلاف ذلك، لذا يفقد سجل المحادثة الطويل بداياته ويظهر النموذج وكأنه يعاني من فقدان الذاكرة.
قم بزيادة القيمة على الخادم لكل طلب:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"داخل جلسة تفاعلية، يقوم /set parameter num_ctx 32768 بتغيير القيمة لتلك الجلسة فقط. عبر واجهة برمجة التطبيقات (API)، أرسل num_ctx ضمن خيارات الطلب.
كل رمز إضافي في السياق يستهلك ذاكرة إضافية فوق حجم أوزان النموذج. إذا طلبت كامل سعة 128K على خادم مخصص للأوزان فقط، سيفشل التحميل أو سينتقل النظام إلى أداء أبطأ. ارفع القيمة تدريجياً ونفذ ollama ps بعد كل خطوة. يشرح الرابط كيفية عمل num_ctx وطول السياق في Ollama الحسابات المتعلقة بذلك.
قوة الاستنتاج: low و medium و high و xhigh
تُوثّق Meta أربع مستويات لقوة الاستنتاج في نموذج Muse Glimmer، بدءاً من low وصولاً إلى xhigh، وتوصي باستخدام المستويين الأعلى للمهام البرمجية المعقدة ومهام الوكلاء (agent tasks). في Ollama، يعتمد هذا على المعامل think. استخدم --think= في سطر الأوامر، أو أرسل think ضمن نص طلب API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"داخل جلسة تفاعلية، يمكنك التبديل بينها باستخدام /set think و /set nothink. تشير وثائق Ollama إلى أن معظم النماذج تقبل إما قيمة منطقية (boolean) أو مستوى مثل low أو medium أو high، وأن بعضها يقبل max للحصول على أعلى مستوى متاح. تعتمد السلاسل النصية الدقيقة التي يقبلها هذا النموذج على صفحة النموذج الخاصة به، لذا اقرأها بدلاً من التخمين، وجرّب إحداها يدوياً قبل ربطها في وكيل برمجي.
على خادم يعمل بمعالج CPU فقط، لهذا الإعداد تأثير ملموس. تعني القوة الأعلى توليد المزيد من رموز التفكير (thinking tokens) قبل ظهور الكلمة الأولى من الإجابة، ويستغرق رمز التفكير نفس الوقت الفعلي الذي يستغرقه رمز الإجابة. اترك المهام الروتينية على إعداد low. يستحق طول الإجابة نفس القدر من العناية، لذا حدد طول الرد باستخدام num_predict بدلاً من السماح لاستجابة طويلة ومشتتة بإشغال خادم بطيء لعدة دقائق.
إبقاء النموذج محملاً لعميل يعمل باستمرار
يقوم Ollama بإلغاء تحميل النموذج الخامل بعد خمس دقائق افتراضياً. بالنسبة لعميل يعمل كل عشر دقائق، يعني هذا دفع تكلفة تحميل كاملة بحجم 18 جيجابايت من القرص في كل عملية تشغيل، وهذا التحميل ليس سريعاً على خادم افتراضي (VPS) يستخدم وحدة تخزين متصلة بالشبكة. بدلاً من ذلك، قم بتثبيت النموذج في الذاكرة.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"تؤدي القيمة السالبة إلى إبقاء النموذج مقيماً في الذاكرة حتى يقوم شيء ما بإلغاء تحميله، كما أن استخدام keep_alive في طلب API يتجاوز الإعداد الافتراضي للخادم لهذا الطلب فقط. التكلفة واضحة: تظل ذاكرة الوصول العشوائي (RAM) مشغولة بينما لا يحدث شيء، لذا فهذا الإعداد مخصص لخادم مكرس لهذا العميل. يغطي الرابط إبقاء نموذج Ollama محملاً المتغيرات المختلفة.
توجيه وكيل برمجي إليه
يُقدّم Ollama واجهة برمجة تطبيقات متوافقة مع OpenAI على http://127.0.0.1:11434/v1، لذا تتصل معظم أدوات الوكلاء باستخدام رابط أساسي (Base URL) وأي مفتاح API غير فارغ. توثّق صفحة Muse Glimmer الخاصة بـ Ollama أيضاً اختصاراً للتشغيل يربط الوكيل المدعوم بنموذج محلي في أمر واحد، ويجب عليك تثبيت الإصدار (tag) هناك أيضاً.
ollama launch claude --model muse-glimmer:30bترسل الوكلاء مطالبات (prompts) كبيرة. محتويات الملفات، ومخرجات الأدوات، وسجل المحادثة المتنامي، كلها تصل كرموز إدخال (input tokens)، وفي الأجهزة التي تعتمد على المعالج المركزي (CPU)، تُعد معالجة المطالبات الجزء الأكثر استهلاكاً للموارد قبل أن يبدأ التوليد الفعلي. حافظ على إعدادات السياق (context) بأصغر حجم تسمح به المهمة. يغطي توجيه وكيل برمجي إلى Ollama جانب العميل، بينما يغطي تشغيل وكيل برمجي على خادم VPS الجهاز الذي يعمل عليه، ويغطي التحكم في تكاليف الوكيل على خادم VPS ما يحدث عند تشغيله طوال اليوم.
يعمل إدخال الصور بنفس الطريقة. تقبل واجهة برمجة تطبيقات Ollama الصور في حقل images من الرسالة، لذا لن يرسل العميل الذي يدعم النصوص فقط أي صورة، بغض النظر عن مدى كفاءة مُشفّر الإدراك (perception encoder) لديه.
لا تفتح المنفذ 11434
لا تتضمن واجهة برمجة تطبيقات Ollama أي آلية للمصادقة. إنّ ضبط OLLAMA_HOST=0.0.0.0:11434 لتتمكن من الوصول إليها من حاسوبك المحمول يضع مشغّل نماذج غير مصادق عليه على شبكة الإنترنت العامة، حيث يمكن لأي شخص يعثر عليه تحميل نماذج على قرصك وقراءة أي بيانات يرسلها وكيلك عبره. اترك الخدمة مرتبطة بـ localhost واستخدم نفقاً (tunnel) بدلاً من ذلك.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsيتناول تأمين نقطة نهاية واجهة برمجة تطبيقات Ollama الخيارات المناسبة، بما في ذلك استخدام وكيل عكسي (reverse proxy) يطلب بيانات اعتماد.
ما الذي يتعطل، وما الذي ستراه
يتوقف السحب في منتصف الطريق. القرص ممتلئ. شغّل df -h على دليل النموذج. بناء bf16 بحجم 57 جيجابايت لا يتسع على وحدة تخزين جذر بحجم 40 جيجابايت، وكذلك لا يتسع وسما (tag) بحجم 8-bit جنباً إلى جنب.
يتم تحميل النموذج ثم تموت العملية. نفاد الذاكرة. يسجّل dmesg -T قيام أداة إنهاء العمليات عند نفاد الذاكرة في النواة (kernel out of memory killer) باختيار عملية ما، ويظهر journalctl -u ollama -n 100 جانب الخدمة من نفس الحدث. الحل هو استخدام وسم أصغر أو num_ctx أصغر. زيادة مساحة التبادل (swap) ليست حلاً.
يعمل النموذج بسرعة ثوانٍ لكل رمز (token). شغّل vmstat 1 وراقب عمودي si و so. نشاط التبادل المستمر يعني أن الأوزان لا تتسع في ذاكرة الوصول العشوائي (RAM) وأن الجهاز يقرؤها من القرص أثناء العمل.
وسم كان يعمل الأسبوع الماضي لم يعد موجوداً. تتغير قوائم الوسوم. أعد قراءة صفحة النموذج، وثبّت الإصدار الحالي، وسجّل اسم الوسم في مكان يمكنك الرجوع إليه لاحقاً.
أعد التحقق من الأحجام بنفسك قبل السحب
تمت قراءة الأحجام الواردة في الجدول من صفحة وسوم النموذج بتاريخ 16 أغسطس 2026، وقائمة الوسوم المنشورة ليست وعداً ثابتاً. اقرأ القائمة الحالية على صفحة النموذج، ثم تأكد مما وصل فعلياً إلى قرصك:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsيخزّن Ollama طبقات النموذج ككتل بيانات مشتركة (shared blobs)، لذا فإن وسمين يتشاركان في طبقة واحدة لا يستهلكان ضعف مساحة القرص. قارن ما يظهره du مع الحجم المنشور وخطط لمساحة قرصك بناءً على الحجم الأكبر بينهما.
FAQ
ما مقدار ذاكرة الوصول العشوائي (RAM) التي يحتاجها Muse Glimmer على خادم VPS؟
ابدأ بحجم الوسم (tag) وأضف إليه نافذة السياق. يبلغ حجم الوسم الافتراضي حوالي 18 جيجابايت بتاريخ 16 أغسطس 2026، لذا لا يمكن لخادم بذاكرة 16 جيجابايت استيعابه إطلاقاً، بينما الخادم بذاكرة 24 جيجابايت يستوعبه مع مساحة ضئيلة جداً للسياق. اعتبر هذا نقطة انطلاق وليس إجابة نهائية. قم بسحب الوسم، وتحميله مرة واحدة، ثم شغّل ollama ps و free -h على خادمك الخاص واقرأ الأرقام بنفسك. يؤدي السياق الأطول والطلبات المتوازية إلى زيادة استهلاك الذاكرة فوق حجم الأوزان.
هل يمكنني تشغيل Muse Glimmer بدون وحدة معالجة رسوميات (GPU)؟
نعم. يمكن تحميله والإجابة عليه على خادم VPS يعمل بالمعالج (CPU) فقط. سرعة التوليد محدودة بعرض نطاق الذاكرة الترددي وليس بعدد الأنوية، وفي الاستضافة المشتركة يكون هذا النطاق مشتركاً، لذا توقع عدداً قليلاً من الرموز (tokens) في الثانية عند دقة 4-bit. هذا مناسب لعمل الوكلاء في الخلفية دون مراقبة، ولكنه بطيء جداً للمحادثات التفاعلية. شغّل ollama ps أثناء تنفيذ طلب وتحقق من عمود المعالج لتأكيد مكان تنفيذ العمل.
هل وسوم MLX مفيدة على خادم Linux VPS؟
لا. كل وسم يحتوي على mlx في اسمه مصمم لمحرك MLX الخاص بـ Ollama، وهو المحرك المخصص لمعالجات Apple Silicon. على خادم Linux بمعمارية x86، تعتبر هذه الوسوم تنزيلاً ضخماً لا يمكنك تشغيله. استخدم الوسم العادي 30b، أو أحد الوسوم الأخرى غير المخصصة لـ MLX، وتجاهل معايير أداء أجهزة Apple التي ترافق إصدارات MLX.
لماذا ينسى النموذج المعلومات قبل الوصول إلى 128K من الرموز؟
لأن نافذة السياق الافتراضية في Ollama هي 4096 رمزاً بغض النظر عما يدعمه النموذج، لذا يقوم الخادم باقتطاع المحادثات الطويلة قبل أن يراها النموذج. اضبط OLLAMA_CONTEXT_LENGTH على الخادم، أو /set parameter num_ctx لجلسة واحدة، أو أرسل num_ctx ضمن خيارات طلب API. يرتفع استهلاك الذاكرة مع زيادة هذا الرقم، لذا ارفعه تدريجياً وتحقق من ollama ps في كل مرة.
هل يجب علي تثبيت إصدار الوسم (pin) أم استخدام الأحدث (latest)؟
ثبّت الإصدار. استخدام muse-glimmer بدون وسم يشير إلى latest، وهو مؤشر يمكن للناشر تغيير الإصدار المرتبط به في أي وقت، لذا قد يؤدي سحب التحديثات الروتيني إلى تغيير النموذج الذي يعمل عليه وكيلك. اكتب muse-glimmer:30b في النصوص البرمجية (scripts)، وملفات الوحدات (unit files)، وإعدادات الوكيل. تحقق من قائمة الوسوم في صفحة النموذج قبل التثبيت، لأن الوسوم المنشورة تتغير.