SSD Nodes Learn 🎉 VPS від $5.50/міс
Посібники Matt ConnorВід Matt Connor

Muse Glimmer 30B на VPS: RAM, диск і CPU

Теги Muse Glimmer займають від 17 до 59 GB. Перевірте потрібні RAM і диск для Linux VPS та дізнайтеся, скільки коштує inference лише на CPU.

Що потрібно Muse Glimmer на VPS

Muse Glimmer працює на звичайному Linux VPS без GPU, а вибраний tag визначає, чи вистачить йому оперативної пам’яті. Meta Superintelligence Labs опублікувала модель 10 August 2026 за ліцензією Apache 2.0: 30 billion параметрів, контекстне вікно 128K і окремий perception encoder на 1.8B параметрів, тому модель може обробляти зображення разом із текстом. Meta позиціонує її передусім для постійно активних локальних агентів, а не для чату, із рівнем reasoning, який можна встановлювати для кожного запиту.

Опубліковані Ollama tags, перевірені 16 August 2026, мають розмір від 17 GB до 59 GB. У цьому й полягає вся проблема підбору конфігурації. Для default tag вказано приблизно 18 GB, тому найменший практичний сервер має мати помітно більше ніж 18 GB вільної RAM. Додатково потрібні disk space для завантаження та memory для контекстного вікна.

Який тег muse-glimmer потрібно завантажити?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama перелічила 11 тегів для цієї моделі, які не є збірками для Apple. У них зберігаються ті самі 30 мільярдів ваг, але з різною числовою точністю. Вказаний розмір — це обсяг завантаження. Приблизно стільки ж пам’яті потрібно до того, як буде додано контекст.

Дві збірки з 4-бітним квантуванням є найменшими: 30b-nvfp4 розміром 17 GB і 30b-q4_K_M розміром 18 GB. Стандартний тег 30b має такий самий розмір, як збірка q4_K_M. Збірки з 8-бітним квантуванням — 30b-q8_0 і 30b-mxfp8 — мають розмір близько 31 GB. 30b-bf16 — це невантована 16-бітна версія розміром 57 GB. Це більше RAM, ніж пропонує більшість орендованих серверів за прийнятну для побічного проєкту ціну.

Теги -dflash відповідають тим самим збіркам, але з підтримкою DFlash. Кожен із них має більший розмір, ніж відповідна звичайна збірка. Ollama описує DFlash як функцію прискорення та демонструє її роботу на Apple Silicon і настільних GPU. На VPS лише з CPU за додатковий розмір доведеться платити реальною оперативною пам’яттю, хоча цю функцію вимірювали на іншому обладнанні. Тому почніть зі звичайного тегу та змінюйте лише один параметр за раз.

Почніть із 4-бітної версії, якщо немає конкретної причини зробити інакше. Перехід із 4-бітної на 8-бітну версію приблизно вдвічі збільшує обсяг даних, який CPU має прочитати для кожного згенерованого токена. Тому пропускна здатність зменшується, а використання пам’яті зростає. Цей компроміс розглянуто в розділі яку фактичну ціну для вас мають квантування q4, q8 і fp16, а для CPU-сервера коротка відповідь така: 4-бітна збірка — єдиний варіант, з якого варто почати.

Чому теги MLX нічого не роблять на сервері Linux

MLX — це масивний фреймворк Apple, а рушій MLX в Ollama — його бекенд для Apple Silicon. Будь-який тег із mlx у назві призначений для цього рушія та відповідного обладнання. На x86 Linux VPS це десятки гігабайт завантаження, які неможливо запустити. Вони лише займатимуть місце на диску. Показники швидкодії в анонсі вимірювали на Mac, тому вони також не описують роботу на вашому сервері. Переглядаючи список тегів на сторінці моделі, спочатку відфільтруйте всі назви з mlx, а потім оцінюйте обсяг того, що залишилося.

Скільки RAM і дискового простору йому насправді потрібно?

Пам’ять займають дві складові, і лише одна з них — розмір tag. Ваги моделі фіксовані для tag, який ви завантажуєте. KV cache — стан для кожного токена, який модель зберігає для діалогу, — збільшується разом із налаштованою довжиною контексту. Власна документація Ollama зазначає, що паралельне обслуговування запитів множить контекст на кількість запитів, які обробляються одночасно. Тому сервер, який відповідає двом агентам одночасно, потребує більше пам’яті, ніж той самий сервер для одного агента.

Не використовуйте значення RAM з будь-якого посібника, зокрема з цього. Завантажте tag, надішліть йому один prompt і, поки модель ще перебуває в пам’яті, виконайте ці дві команди.

ollama ps
free -h

ollama ps показує, що зараз завантажено і як навантаження розподілене між CPU та GPU. free -h показує залишок доступної пам’яті. Ці два результати на вашому сервері точніші за будь-яку опубліковану таблицю, оскільки вже враховують налаштування контексту, вашу квантизацію та все інше, що виконується на сервері.

З дисковим простором усе простіше. Ollama зберігає моделі в /usr/share/ollama/.ollama/models у Linux. У більшості образів VPS цей каталог розташований у root filesystem. Root volume на 40GB не вмістить збірку bf16 розміром 57 GB і також не вмістить поруч дві 8-bit версії tag. Перемістіть сховище на змонтований volume до завантаження будь-яких моделей.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Користувач ollama повинен володіти цим каталогом, оскільки service працює від імені ollama і записує туди blobs від свого імені. Якщо pull завершується помилкою доступу, причина буде в journalctl -u ollama -n 50.

Щодо swap потрібне просте правило: swap не дає змоги запускати більший tag. Під час генерації ваги зчитуються для кожного створеного токена. Тому ваги, що перебувають у swap, знову й знову зчитуються з диска, vmstat 1 показує активні стовпці si та so, а швидкість виведення знижується до кількох секунд на токен. Залиште невеликий swap file як захист від out of memory killer. Обсяг RAM визначайте за tag, який справді плануєте використовувати.

Встановіть Ollama і зафіксуйте іменований тег

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Скрипт встановлення налаштовує сервіс systemd, тому сервер знову запускає його після перезавантаження. Якщо ви не хочете запускати його як системний сервіс, яким керує root, див. запуск Ollama без root у Podman. Потім завантажте явний тег.

ollama pull muse-glimmer:30b
ollama list

Самостійно прочитайте стовпець розміру в ollama list і порівняйте його з поточним списком тегів на сторінці моделі. Опубліковані теги додають, перейменовують і видаляють, а розмір у посібнику є знімком стану на певний день.

Ніколи не записуйте ollama pull muse-glimmer на сервері, від якого ви залежите. Назва моделі без тега розгортається в тег latest, а latest є вказівником, який видавець може перемістити на іншу збірку. Під час звичайного завантаження модель під вашим агентом непомітно замінюється. Вона може мати інші вимоги до пам’яті та іншу поведінку, і в журналах це не буде явно зазначено. Записуйте тег у своїх скриптах, unit-файлах і конфігурації агента. У посібнику із self-hosting LLM з Ollama на VPS описано решту налаштування сервера.

Чи можна запускати Muse Glimmer без GPU?

Так, але реальні обмеження варто описати прямо. Генерація одного токена потребує читання ваг моделі з пам’яті, тому швидкість визначається пропускною здатністю пам’яті, а не кількістю vCPU, заявленою в тарифі. Після кількох ядер додаткові ядра майже не дають приросту. На shared VPS ця пропускна здатність спільно використовується всіма іншими орендарями хоста, тому модель 30B у форматі 4-bit генерує лише кілька токенів за секунду.

Не покладайтеся на чиїсь показники, зокрема й на мої. Виміряйте кількість токенів за секунду на власному сервері і приймайте рішення за отриманим результатом.

У результаті модель має чіткий поділ за сценаріями використання. Інтерактивний чат працює повільно, тому що ви читаєте швидше, ніж сервер генерує текст, а кожна відповідь починається з тривалої затримки. Фонові агентні завдання підходять краще, оскільки процес, який працює без нагляду протягом десяти хвилин, не залежить від низької швидкості. Саме такий сценарій використання Meta описує для цієї моделі.

Якщо вам потрібна інтерактивна швидкість, є два чесні варіанти: GPU або hosted API. Розрахуйте точку беззбитковості між GPU VPS і токенами API до оренди ресурсів, а в матеріалі що насправді дає GPU VPS описано, що саме ви купуєте. Для загального розуміння того, яку модель можна розмістити на певному сервері, почніть зі статті які моделі можна розмістити на власній інфраструктурі, а запуск моделі Qwen подібного розміру на VPS є найближчим порівнянням у цьому класі розмірів.

Чому модель забуває інформацію задовго до 128K токенів?

Тому що стандартне вікно контексту Ollama становить 4096 токенів незалежно від того, який контекст підтримує модель. Станом на August 2026 це значення вказане у власному FAQ Ollama. Тег повідомляє про підтримку 128K, але сервер передає моделі 4096 токенів, доки ви не вкажете інше. Тому довгий журнал взаємодії агента втрачає перші повідомлення, і модель починає поводитися так, ніби має проблеми з пам’яттю.

Збільште значення на сервері для кожного запиту:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

В інтерактивному сеансі /set parameter num_ctx 32768 змінює значення лише для цього сеансу. Під час роботи через API передайте num_ctx у параметрах запиту.

Кожен додатковий токен контексту споживає пам’ять понад ту, яку займають ваги моделі. Якщо запитати повні 128K на сервері, розрахованому лише на зберігання ваг, завантаження завершиться помилкою або система перейде на повільніший режим. Збільшуйте значення поетапно та після кожного кроку запускайте ollama ps. У розділі Як працюють num_ctx і довжина контексту в Ollama наведено відповідні розрахунки.

Рівень міркування: low, medium, high і xhigh

Meta визначає для Muse Glimmer чотири рівні міркування — від low до xhigh — і рекомендує два вищі рівні для складного програмування та завдань агентів. В Ollama це налаштовується параметром think. Використовуйте --think= у командному рядку або передавайте think у тілі API.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

В інтерактивному сеансі цю настройку можна перемикати командами /set think і /set nothink. У документації Ollama зазначено, що більшість моделей приймає або логічне значення, або рівень на кшталт low, medium чи high. Деякі моделі приймають max для найвищого доступного рівня. Точний перелік рядків, які приймає ця модель, наведено на її сторінці. Перевірте його замість того, щоб вгадувати, і спочатку випробуйте потрібне значення вручну, перш ніж підключати його до агента.

На комп’ютері лише з CPU ця настройка суттєво впливає на час виконання. Вищий рівень означає, що перед появою першого слова відповіді буде згенеровано більше thinking tokens. Один thinking token потребує стільки самого часу, скільки й один answer token. Для звичайних завдань залишайте low.

Залиште модель завантаженою для агента, який працює постійно

За замовчуванням Ollama вивантажує неактивну модель через п’ять хвилин. Для агента, який запускається кожні десять хвилин, це означає повторне завантаження повних 18 GB з диска під час кожного запуску. На VPS із мережевим сховищем це завантаження не відбувається швидко. Натомість зафіксуйте модель в оперативній пам’яті.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Від’ємне значення залишає модель у пам’яті, доки її не буде вивантажено іншим способом, а keep_alive в API-запиті перевизначає значення сервера лише для цього виклику. Вартість очевидна: оперативна пам’ять залишається зайнятою, навіть коли нічого не відбувається. Тому цей параметр підходить для сервера, виділеного під агента. У розділі Як залишити модель Ollama завантаженою описано різні варіанти.

Спрямуйте coding agent до нього

Ollama надає OpenAI-сумісний API за адресою http://127.0.0.1:11434/v1, тому більшість інструментів для агентів підключаються через базову URL-адресу та будь-який непорожній API key. На сторінці Ollama Muse Glimmer також описано shortcut для запуску, який однією командою підключає підтримуваний агент до локальної моделі. Там також слід зафіксувати tag.

ollama launch claude --model muse-glimmer:30b

Агенти надсилають великі prompt. Вміст файлів, результат роботи інструментів і transcript, що постійно збільшується, надходять як input tokens. На CPU-сервері саме обробка prompt створює найбільше навантаження ще до початку генерації. Зменште параметр context настільки, наскільки це дозволяє завдання. У матеріалі Підключення coding agent до Ollama описано налаштування на стороні клієнта, у матеріалі Запуск coding agent на VPS — сервер, на якому він працює, а у матеріалі Контроль витрат agent на VPS — наслідки його роботи протягом усього дня.

Введення зображень працює так само. API Ollama приймає зображення в полі images повідомлення. Тому клієнт, який працює лише з текстом, не надсилатиме зображення, незалежно від можливостей perception encoder.

Не відкривайте порт 11434

API Ollama не має автентифікації. Якщо встановити OLLAMA_HOST=0.0.0.0:11434, щоб підключатися до нього з ноутбука, неавтентифікований runner моделей буде доступний у публічному інтернеті. Будь-хто, хто його знайде, зможе завантажувати моделі на ваш диск і читати все, що ваш агент передає через нього. Залиште його прив’язаним до localhost і використовуйте тунель.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

У розділі Захист кінцевої точки API Ollama описано належні варіанти, зокрема reverse proxy, який запитує облікові дані.

Що виходить з ладу і що ви побачите

Завантаження зупиняється на півдорозі. Причина — диск. Виконайте df -h для каталогу моделі. Збірка bf16 розміром 57 GB не вміщується в кореневий том обсягом 40GB. Два теги 8-bit поруч також не вміщуються.

Модель завантажується, а потім процес завершується. Причина — нестача пам’яті. dmesg -T фіксує, який процес вибрав kernel out-of-memory killer. journalctl -u ollama -n 100 показує відповідний запис з боку сервісу. Виправлення — менший тег або менший num_ctx. Збільшення swap не вирішує проблему.

Швидкість роботи становить кілька секунд на токен. Виконайте vmstat 1 і стежте за стовпцями si та so. Постійна активність swap означає, що ваги не вміщуються в RAM, і система читає їх із диска під час роботи.

Тег, який працював минулого тижня, зник. Списки тегів змінюються. Повторно відкрийте сторінку моделі, зафіксуйте актуальний тег і запишіть його назву в місці, яке ви зможете знову перевірити.

Повторно перевірте розміри перед завантаженням

Розміри в таблиці взято зі сторінки тегів моделі 16 August 2026, а опублікований список тегів не є гарантією. Перегляньте поточний список на сторінці моделі, а потім перевірте, що фактично записано на диску:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama зберігає шари моделей як спільні blobs, тому два теги зі спільним шаром не займають удвічі більше дискового простору. Порівняйте дані, які показує du, з опублікованим розміром і плануйте дисковий простір за більшим із цих значень.

FAQ

Скільки RAM потрібно Muse Glimmer на VPS?

Почніть із розміру tag і додайте обсяг пам’яті для context window. Станом на 16 August 2026 стандартний tag має розмір приблизно 18 GB, тому на сервері з 16GB він взагалі не поміститься, а на сервері з 24GB залишиться мало місця для context. Вважайте це початковою оцінкою, а не остаточною відповіддю. Завантажте tag, один раз завантажте модель у пам’ять, потім виконайте ollama ps і free -h на власному сервері та перевірте власні показники. Довший context і паралельні запити додатково збільшують споживання пам’яті поверх обсягу ваг моделі.

Чи можна запускати Muse Glimmer без GPU?

Так. Модель завантажується та відповідає лише на CPU VPS. Швидкість генерації обмежується пропускною здатністю пам’яті, а не кількістю ядер. На shared host ця пропускна здатність розподіляється між користувачами, тому для 4-bit очікуйте невелику швидкість — кілька tokens per second. Цього достатньо для фонової роботи agent, яка виконується без нагляду, але для інтерактивного чату швидкість буде низькою. Виконайте ollama ps під час запиту та перевірте стовпець процесора, щоб підтвердити, де виконується обробка.

Чи придатні MLX tags для Linux VPS?

Ні. Кожен tag, що містить mlx у назві, створено для MLX engine Ollama, тобто його бекенду для Apple Silicon. На x86 Linux server такі tags займають багато місця після завантаження, але запустити їх неможливо. Використовуйте звичайний 30b tag або інший tag без MLX. Не враховуйте тести на обладнанні Apple, наведені для MLX builds.

Чому модель забуває інформацію задовго до 128K tokens?

Тому що стандартне context window в Ollama становить 4096 tokens незалежно від того, який обсяг підтримує модель. Через це server обрізає довгі розмови ще до того, як модель їх побачить. Установіть OLLAMA_CONTEXT_LENGTH на server, /set parameter num_ctx для одного сеансу або передайте num_ctx в options API-запиту. Споживання пам’яті зростає разом із context window, тому збільшуйте його поступово та щоразу перевіряйте ollama ps.

Чи потрібно фіксувати tag, чи можна просто використовувати latest?

Фіксуйте tag. muse-glimmer без tag розгортається в latest. Це вказівник, який publisher у будь-який момент може перемістити на інший build, тому звичайна операція pull може змінити модель, яку запускає ваш agent. Записуйте muse-glimmer:30b у scripts, unit files і конфігурації agent. Перед фіксацією перевірте список tags на сторінці моделі, оскільки опубліковані tags змінюються.