SSD Nodes Learn 🎉 VPS от $5.50/мес
Руководства Matt ConnorАвтор: Matt Connor

Как запустить Meta Muse Glimmer 30B на VPS

Узнайте минимальные требования к RAM и диску для запуска Muse Glimmer 30B на Linux VPS. Рассчитайте стоимость CPU инференса для моделей от 17 до 59 ГБ с учетом контекста.

Требования Muse Glimmer к VPS

Muse Glimmer работает на обычном Linux VPS без GPU, а выбор тега определяет, поместится ли модель в оперативную память. Meta Superintelligence Labs выпустила модель 10 августа 2026 года под лицензией Apache 2.0: 30 миллиардов параметров, контекстное окно 128K и выделенный энкодер восприятия на 1.8 миллиарда параметров для обработки изображений вместе с текстом. Meta позиционирует её для постоянно работающих локальных агентов, а не для чат-ботов, с возможностью настройки глубины рассуждений для каждого запроса.

Опубликованные теги Ollama, актуальные на 16 августа 2026 года, варьируются от 17 ГБ до 59 ГБ. Этот диапазон и определяет всю задачу по подбору ресурсов. Тег по умолчанию занимает около 18 ГБ, поэтому для минимально приемлемой конфигурации сервера требуется явно больше 18 ГБ свободной оперативной памяти. Место на диске для загрузки и память для контекстного окна учитываются дополнительно.

Какой тег muse-glimmer следует использовать?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama содержит 11 тегов для этой модели, не считая сборок для Apple. Они содержат одни и те же веса для 30 миллиардов параметров, но с разной числовой точностью. Указанный размер соответствует объему загружаемых данных, а также примерно тому объему памяти, который потребуется до добавления контекста.

Две 4-битные сборки являются наиболее компактными: 30b-nvfp4 размером 17 ГБ и 30b-q4_K_M размером 18 ГБ. Тег по умолчанию 30b имеет тот же размер, что и сборка q4_K_M. 8-битные сборки, 30b-q8_0 и 30b-mxfp8, занимают около 31 ГБ. 30b-bf16 — это неквантованный 16-битный релиз размером 57 ГБ, что требует больше оперативной памяти, чем доступно на большинстве арендуемых серверов по приемлемой для побочного проекта цене.

Теги -dflash представляют собой те же сборки с поддержкой DFlash, и каждая из них имеет больший размер, чем аналогичная стандартная версия. Ollama описывает DFlash как функцию для ускорения работы, демонстрируя её на Apple Silicon и настольных GPU. На VPS, работающем только на CPU, вы будете расходовать дополнительную память на функцию, предназначенную для другого оборудования, поэтому начните с обычного тега и вносите изменения последовательно.

Начинайте с 4-битной версии, если у вас нет веских причин для иного. Переход с 4-битной на 8-битную версию примерно удваивает количество байтов, которые CPU должен считывать для генерации каждого токена, поэтому пропускная способность падает, а потребление памяти растет. Этот компромисс подробно описан в чем на самом деле обусловлена стоимость квантования q4, q8 и fp16, и для сервера на базе CPU краткий ответ таков: 4-битная сборка — единственная, с которой стоит начинать.

Почему теги MLX не работают на сервере Linux

MLX — это фреймворк для работы с массивами от Apple, а движок MLX в Ollama предназначен для архитектуры Apple Silicon. Любой тег, содержащий mlx в названии, собран именно для этого движка и этого оборудования. На VPS с архитектурой x86 под управлением Linux такие файлы занимают десятки гигабайт, которые вы не сможете запустить, и они будут бесполезно занимать место на диске. Показатели скорости, указанные в анонсе, были получены на Mac и относятся именно к этим тегам, поэтому они не применимы к вашему серверу. При просмотре списка тегов на странице модели сначала отфильтруйте все названия с mlx, а затем выбирайте подходящий вариант из оставшихся по размеру.

Сколько оперативной памяти и дискового пространства на самом деле требуется?

Два фактора потребляют память, и только один из них — размер тега. Веса фиксируются выбранным тегом. KV-кэш, состояние модели для каждого токена, поддерживаемое в ходе диалога, увеличивается вместе с настроенной длиной контекста. В документации Ollama указано, что параллельная обработка запросов умножает контекст на количество активных запросов, поэтому сервер, отвечающий двум агентам одновременно, требует больше памяти, чем тот же сервер при работе с одним агентом.

Не полагайтесь на цифры объема RAM из любых руководств, включая это. Загрузите тег, отправьте один запрос и, пока модель находится в памяти, выполните эти две команды.

ollama ps
free -h

ollama ps показывает, что загружено в данный момент и как распределяется нагрузка между CPU и GPU. free -h показывает оставшиеся ресурсы. Эти два вывода на вашем собственном оборудовании точнее любой опубликованной таблицы, так как они уже учитывают ваши настройки контекста, квантование и всё остальное, что запущено на сервере.

С диском всё проще. Ollama хранит модели в /usr/share/ollama/.ollama/models на Linux, что в большинстве образов VPS находится на корневой файловой системе. Корневой раздел объемом 40GB не вместит сборку bf16 размером 57 GB, и он также не сможет хранить два 8-битных тега одновременно. Перенесите хранилище на смонтированный том, прежде чем что-либо загружать.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Пользователь ollama должен владеть этой директорией, так как служба работает от имени ollama и записывает свои блобы от своего лица. Если загрузка завершается ошибкой из-за прав доступа, причина будет указана в journalctl -u ollama -n 50.

О файле подкачки (swap) стоит сказать прямо: swap не позволяет запустить более крупный тег. Генерация затрагивает веса для каждого создаваемого токена, поэтому веса, находящиеся в swap, постоянно считываются с диска, vmstat 1 показывает активность в столбцах si и so, а скорость вывода падает до секунд на токен. Держите небольшой файл подкачки как страховку от срабатывания OOM-killer. Рассчитывайте объем RAM исходя из тега, который вы действительно хотите использовать.

Установка Ollama и закрепление именованного тега

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Скрипт установки настраивает службу systemd, поэтому сервер автоматически запускается после перезагрузки. Если вы не хотите запускать его как системную службу от имени root, в разделе запуск Ollama без прав root в Podman описан альтернативный путь. После этого загрузите конкретный тег модели.

ollama pull muse-glimmer:30b
ollama list

Самостоятельно проверяйте столбец размера в ollama list и сравнивайте его с актуальным списком тегов на странице модели. Опубликованные теги добавляются, переименовываются и удаляются, поэтому размер, указанный в руководстве, является лишь снимком состояния на конкретный день.

Никогда не используйте ollama pull muse-glimmer на сервере, от которого зависит ваша работа. Простое имя модели разрешается в тег latest, а latest — это указатель, который издатель может перенаправить на другую сборку. В этом случае обычная команда pull незаметно подменит модель, используемую вашим агентом, что приведет к изменению требований к оперативной памяти и поведения системы, причем в логах не будет никаких уведомлений об этом. Указывайте тег в своих скриптах, в файлах юнитов и в конфигурации агента. В разделе Размещение LLM на VPS с помощью Ollama описана остальная часть настройки сервера.

Можно ли запустить Muse Glimmer без GPU?

Да, и стоит прямо сказать об ограничениях. Генерация одного токена означает чтение весов модели из оперативной памяти, поэтому скорость определяется пропускной способностью памяти, а не количеством vCPU, указанным в тарифном плане. После определенного количества ядер добавление новых дает минимальный прирост. На общем VPS эта пропускная способность делится между всеми арендаторами хоста, поэтому модель 30B в 4-битном квантовании будет выдавать лишь несколько токенов в секунду.

Не принимайте на веру чужие цифры, включая мои. Измерьте количество токенов в секунду на своем оборудовании и сделайте выводы на основе полученных данных.

Результат — четкое разделение сценариев использования модели. Интерактивный чат будет некомфортным, так как вы читаете быстрее, чем сервер пишет, а каждый ответ начинается с долгой паузы. Фоновая работа агентов вполне допустима, так как задаче, выполняющейся без присмотра десять минут, не важна низкая скорость. Именно такой сценарий использования Meta описывает для этой модели.

Если вам нужна интерактивная скорость, есть два честных решения: GPU или API от хостинг-провайдера. Рассчитайте точку окупаемости между GPU VPS и API-токенами перед тем, как что-либо арендовать, а в статье что на самом деле дает GPU VPS описано, за что вы платите. Для более широкого вопроса о том, что может потянуть конкретный сервер, начните с какие модели можно разместить самостоятельно, а запуск модели Qwen аналогичного размера на VPS является наиболее близким сравнением в этом классе размеров.

Почему модель «забывает» данные задолго до достижения 128K токенов?

Потому что стандартное окно контекста в Ollama составляет 4096 токенов, независимо от того, какой объем поддерживает сама модель. Это значение по умолчанию указано в FAQ Ollama по состоянию на август 2026 года. Тег модели может указывать на 128K, но сервер передает модели только 4096 токенов, пока вы не зададите иное значение. В результате длинная история переписки с агентом теряет свои начальные фрагменты, и создается впечатление, что у модели амнезия.

Увеличивайте этот параметр на сервере для каждого запроса:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

В рамках интерактивной сессии команда /set parameter num_ctx 32768 изменяет его только для текущего сеанса. При использовании API передавайте num_ctx в параметрах запроса.

Каждый дополнительный токен контекста требует выделения оперативной памяти сверх той, что занята весами модели. Если запросить полный объем 128K на сервере, размер памяти которого рассчитан только на веса, процесс завершится ошибкой или переключится на более медленный режим работы. Увеличивайте значение постепенно и запускайте ollama ps после каждого шага. В статье Как работают num_ctx и длина контекста в Ollama подробно описаны соответствующие расчеты.

Уровень глубины рассуждений: low, medium, high и xhigh

Meta определяет четыре уровня глубины рассуждений для Muse Glimmer — от low до xhigh, рекомендуя два верхних для сложных задач программирования и работы агентов. В Ollama этот параметр управляется через think. Используйте --think= в командной строке или передавайте think в теле запроса API.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

В интерактивном сеансе /set think и /set nothink позволяют переключать этот параметр. Согласно документации Ollama, большинство моделей принимают либо логическое значение, либо уровень (low, medium или high), а некоторые поддерживают max для выбора максимально доступного значения. Точный список поддерживаемых строк для конкретной модели указан на её странице, поэтому ознакомьтесь с ним, прежде чем пробовать значения наугад или интегрировать их в работу агента.

На серверах, использующих только CPU, этот параметр существенно влияет на производительность. Более высокий уровень означает генерацию большего количества токенов «размышления» до появления первого слова ответа, при этом время обработки токена размышления равно времени обработки токена ответа. Для рутинных задач оставляйте значение low.

Удержание модели в памяти для постоянно активного агента

По умолчанию Ollama выгружает неактивную модель через пять минут. Если агент запускается каждые десять минут, это означает полную загрузку 18 ГБ с диска при каждом выполнении. На VPS с сетевым хранилищем такая загрузка происходит медленно. Вместо этого закрепите модель в оперативной памяти.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Отрицательное значение позволяет модели оставаться в памяти, пока её не выгрузят принудительно, а параметр keep_alive в API-запросе переопределяет настройки сервера для конкретного вызова. Цена такого решения очевидна: оперативная память будет занята даже в моменты простоя, поэтому данная настройка подходит для сервера, выделенного под работу агента. В статье Удержание модели Ollama в памяти описаны все возможные варианты конфигурации.

Настройка агента для написания кода

Ollama предоставляет API, совместимый с OpenAI, по адресу http://127.0.0.1:11434/v1, поэтому большинство инструментов для агентов подключаются к нему с использованием базового URL и любого непустого API key. На странице Muse Glimmer для Ollama также описан ярлык запуска, который одной командой связывает поддерживаемый агент с локальной моделью; рекомендуется также закрепить там тег модели.

ollama launch claude --model muse-glimmer:30b

Агенты отправляют большие промпты. Содержимое файлов, вывод инструментов и растущая история диалога — всё это поступает в виде входных токенов, и на сервере без GPU обработка промпта занимает больше всего времени ещё до начала генерации. Старайтесь ограничивать контекст минимально необходимым для задачи объёмом. В настройке агента для работы с Ollama рассматривается клиентская сторона, в запуске агента на VPS описывается подготовка сервера, а в контроле расходов на работу агента на VPS — особенности круглосуточного выполнения задач.

Обработка изображений работает аналогично. API Ollama принимает изображения в поле images сообщения, поэтому текстовый клиент не сможет отправить изображение, независимо от возможностей кодировщика визуальных данных.

Не открывайте порт 11434

API Ollama не имеет встроенной аутентификации. Если вы настроите OLLAMA_HOST=0.0.0.0:11434 так, чтобы обращаться к нему со своего ноутбука, вы выставите неавторизованный инструмент запуска моделей в публичный интернет. Любой, кто обнаружит этот порт, сможет загружать модели на ваш диск и читать всё, что ваш агент передает через этот сервис. Оставьте привязку к localhost и используйте туннелирование.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

В разделе Обеспечение безопасности конечной точки API Ollama рассматриваются надлежащие варианты, включая использование reverse proxy с запросом учетных данных.

Что может пойти не так и как это выглядит

Загрузка прерывается на середине. Проблема с диском. Запустите df -h для директории с моделью. Сборка bf16 размером 57 ГБ не поместится на корневом разделе объемом 40 ГБ, как и два 8-битных тега одновременно.

Модель загружается, а затем процесс завершается. Нехватка оперативной памяти. dmesg -T фиксирует, что OOM-killer ядра выбрал процесс для завершения, а journalctl -u ollama -n 100 показывает это же событие со стороны сервиса. Решение — использовать меньший тег или уменьшить num_ctx. Увеличение swap не поможет.

Скорость работы составляет секунды на токен. Запустите vmstat 1 и следите за столбцами si и so. Постоянная активность swap означает, что веса модели не помещаются в RAM, и система считывает их с диска во время работы.

Тег, который работал на прошлой неделе, исчез. Списки тегов меняются. Перечитайте страницу модели, зафиксируйте текущую версию и сохраните имя тега там, где вы сможете его найти в будущем.

Самостоятельная проверка размеров перед загрузкой

Размеры в таблице были взяты со страницы тегов модели 16 августа 2026 года, и опубликованный список тегов не является гарантией. Ознакомьтесь с актуальным списком на странице модели, а затем проверьте, какой объем данных фактически занял место на вашем диске:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama хранит слои моделей как общие блобы, поэтому два тега, использующие один и тот же слой, не занимают вдвое больше места на диске. Сравните данные, которые выводит du, с опубликованным размером и планируйте дисковое пространство, ориентируясь на большее из этих значений.

FAQ

Сколько оперативной памяти требуется Muse Glimmer на VPS?

Начните с размера тега и добавьте объем контекстного окна. Размер тега по умолчанию составляет около 18 ГБ по состоянию на 16 августа 2026 года, поэтому сервер с 16 ГБ ОЗУ не сможет его запустить, а сервер с 24 ГБ будет работать с минимальным запасом для контекста. Рассматривайте это как отправную точку, а не как окончательный ответ. Загрузите тег, запустите его один раз, затем выполните ollama ps и free -h на своем сервере и изучите полученные показатели. Увеличение длины контекста и параллельные запросы требуют дополнительной памяти сверх весов модели.

Можно ли запустить Muse Glimmer без GPU?

Да. Модель загружается и отвечает на VPS только с CPU. Скорость генерации ограничена пропускной способностью памяти, а не количеством ядер; на виртуальном хостинге эта пропускная способность является общей, поэтому ожидайте низкую скорость генерации токенов в секунду при 4-битном квантовании. Это приемлемо для фоновых задач агента, выполняемых без участия пользователя, но неудобно для интерактивного чата. Запустите ollama ps во время выполнения запроса и проверьте столбец процессора, чтобы убедиться, где именно выполняются вычисления.

Полезны ли теги MLX на Linux VPS?

Нет. Каждый тег, содержащий mlx в названии, собран для движка MLX в Ollama, который является бэкендом для Apple Silicon. На сервере с архитектурой x86 под управлением Linux эти теги представляют собой большой объем данных, которые вы не сможете запустить. Используйте обычный тег 30b или любой другой тег без пометки MLX, и игнорируйте бенчмарки для оборудования Apple, которые сопровождают сборки MLX.

Почему модель «забывает» информацию задолго до достижения 128K токенов?

Потому что контекстное окно по умолчанию в Ollama составляет 4096 токенов, независимо от того, что поддерживает модель, поэтому сервер обрезает длинные диалоги до того, как модель их увидит. Установите OLLAMA_CONTEXT_LENGTH на сервере, или /set parameter num_ctx для одной сессии, или передайте num_ctx в параметрах API-запроса. Потребление памяти растет вместе с этим значением, поэтому увеличивайте его постепенно и каждый раз проверяйте ollama ps.

Стоит ли фиксировать версию тега или использовать latest?

Фиксируйте версию. muse-glimmer без указания тега разрешается в latest — это указатель, который издатель может в любой момент перенаправить на другую сборку, поэтому обычное обновление может изменить модель, на которой работает ваш агент. Указывайте muse-glimmer:30b в скриптах, unit-файлах и конфигурациях агентов. Перед фиксацией версии проверьте список тегов на странице модели, так как опубликованные теги могут меняться.