SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-26

Запуск Meta Muse Glimmer 30B на Linux VPS

Узнайте требования к RAM и дисковому пространству для запуска Muse Glimmer 30B через Ollama. Рассчитайте стоимость CPU инференса для моделей от 17 до 59 ГБ на сервере.

Требования Muse Glimmer к VPS

Muse Glimmer работает на обычном Linux VPS без GPU, а выбор тега определяет, поместится ли модель в оперативную память. Meta Superintelligence Labs выпустила модель 10 августа 2026 года под лицензией Apache 2.0: 30 миллиардов параметров, контекстное окно 128K и выделенный перцептивный энкодер на 1.8B параметров для обработки изображений вместе с текстом. Meta позиционирует её для постоянно работающих локальных агентов, а не для чат-ботов, с возможностью настройки силы рассуждений для каждого запроса.

Опубликованные теги Ollama, актуальные на 16 августа 2026 года, варьируются от 17 ГБ до 59 ГБ. Этот диапазон и определяет всю задачу по подбору ресурсов. Тег по умолчанию занимает около 18 ГБ, поэтому для минимально подходящего сервера требуется явно больше 18 ГБ свободной оперативной памяти. Место на диске для загрузки и память для контекстного окна учитываются сверх этого объёма.

Какой тег muse-glimmer следует загрузить?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama содержит 11 тегов для этой модели, не являющихся сборками для Apple. Они содержат одни и те же веса для 30 миллиардов параметров, сохраненные с разной числовой точностью. Указанный размер соответствует объему загружаемых данных; примерно столько же оперативной памяти потребуется до добавления контекста.

Две 4-битные сборки являются наиболее компактными: 30b-nvfp4 размером 17 ГБ и 30b-q4_K_M размером 18 ГБ. Тег по умолчанию 30b имеет тот же размер, что и сборка q4_K_M. 8-битные сборки, 30b-q8_0 и 30b-mxfp8, занимают около 31 ГБ. 30b-bf16 — это неквантованный 16-битный релиз размером 57 ГБ, что превышает объем RAM большинства арендуемых серверов, доступных по разумной цене для побочных проектов.

Теги -dflash представляют собой те же сборки с поддержкой DFlash, и каждая из них имеет больший размер, чем аналогичная сборка без этого расширения. Ollama описывает DFlash как функцию для повышения скорости, демонстрируя её работу на Apple Silicon и настольных GPU. На VPS, использующем только CPU, вы будете расходовать дополнительную память на функцию, эффективность которой измеряется на другом оборудовании, поэтому начните с обычного тега и вносите изменения последовательно.

Начинайте с 4-битной версии, если у вас нет веских причин для иного. Переход с 4-битной на 8-битную версию примерно удваивает количество байтов, которые CPU должен считывать для генерации каждого токена, поэтому пропускная способность падает, а потребление памяти растет. Этот компромисс подробно описан в том, чего на самом деле стоят квантование q4, q8 и fp16, и для сервера на базе CPU краткий ответ таков: 4-битная сборка — единственный вариант, с которого стоит начинать.

Почему теги MLX не работают на сервере Linux

MLX — это фреймворк Apple для работы с массивами, а движок MLX в Ollama предназначен для архитектуры Apple Silicon. Любой тег, содержащий mlx в названии, собран именно для этого движка и этого оборудования. На VPS с архитектурой x86 под управлением Linux такие файлы занимают десятки гигабайт, которые вы не сможете запустить, и они будут просто занимать место на диске. Показатели скорости из анонса, измеренные на Mac, относятся именно к этим тегам, поэтому они не применимы к вашему серверу. При просмотре списка тегов на странице модели сначала отфильтруйте все названия с mlx, а затем выбирайте подходящий вариант из оставшихся по размеру.

Сколько оперативной памяти и дискового пространства действительно нужно?

Память расходуется на две составляющие, и только одна из них зависит от размера тега. Веса модели фиксированы и определяются выбранным тегом. KV-кэш — состояние, которое модель хранит для каждого токена в ходе диалога — растёт вместе с настроенной длиной контекста. В документации Ollama указано, что параллельная обработка запросов умножает контекст на количество активных запросов, поэтому сервер, отвечающий двум агентам одновременно, требует больше памяти, чем тот же сервер при работе с одним агентом.

Не полагайтесь на цифры объёма RAM из любых руководств, включая это. Загрузите тег, отправьте один запрос и, пока модель находится в памяти, выполните эти две команды.

ollama ps
free -h

ollama ps показывает, что загружено в данный момент и как распределена нагрузка между CPU и GPU. free -h показывает остаток свободных ресурсов. Эти данные с вашего собственного сервера точнее любой опубликованной таблицы, так как они уже учитывают ваши настройки контекста, квантование и всё остальное, что запущено на сервере.

С диском всё проще. Ollama хранит модели в /usr/share/ollama/.ollama/models в Linux, что на большинстве образов VPS соответствует корневой файловой системе. Корневой раздел объёмом 40GB не вместит сборку bf16 размером 57 GB, и он также не сможет хранить два 8-битных тега одновременно. Если вы никогда не проверяли, что именно записывается при выполнении команды pull, где Ollama хранит модели и как их переместить содержит описание этого каталога. Перенесите хранилище на смонтированный том перед тем, как что-либо загружать.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Пользователь ollama должен быть владельцем этого каталога, так как служба работает от имени ollama и записывает свои блобы от своего лица. Если загрузка завершается ошибкой прав доступа, причина будет указана в journalctl -u ollama -n 50.

О файле подкачки (swap) стоит сказать прямо: swap не позволит вам запустить тег большего размера. Генерация затрагивает веса для каждого создаваемого токена, поэтому веса, находящиеся в swap, постоянно считываются с диска. vmstat 1 покажет активность в столбцах si и so, а скорость генерации упадёт до секунд на один токен. Держите небольшой файл подкачки как страховку от срабатывания OOM-killer. Рассчитывайте объём RAM исходя из размера тега, который вы действительно хотите использовать.

Установка Ollama и закрепление именованного тега

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Скрипт установки настраивает службу systemd, поэтому сервер автоматически запускается после перезагрузки. Если вы не хотите запускать его как системную службу от имени root, в разделе запуск Ollama без прав root в Podman описан альтернативный путь. После этого загрузите конкретный тег модели.

ollama pull muse-glimmer:30b
ollama list

Самостоятельно проверяйте столбец размера в ollama list и сравнивайте его с актуальным списком тегов на странице модели. Опубликованные теги добавляются, переименовываются и удаляются, поэтому размер, указанный в руководстве, является лишь снимком состояния на конкретный день.

Никогда не пишите ollama pull muse-glimmer на сервере, от которого зависит ваша работа. Простое имя модели разрешается в тег latest, а latest — это указатель, который издатель может перенаправить на другую сборку. В таком случае обычная команда pull незаметно подменит модель, используемую вашим агентом, что приведет к изменению требований к памяти и поведения системы, причем в логах не будет никаких уведомлений об этом. Указывайте тег в своих скриптах, файлах юнитов и конфигурации агента. В разделе Self-hosting an LLM with Ollama on a VPS описана остальная часть настройки сервера.

Можно ли запустить Muse Glimmer без GPU?

Да, но стоит прямо сказать об ограничениях. Генерация одного токена означает чтение весов модели из оперативной памяти, поэтому скорость определяется пропускной способностью памяти, а не количеством vCPU, заявленных в тарифном плане. После достижения определенного количества ядер добавление новых дает минимальный прирост. На общем VPS эта пропускная способность делится между всеми арендаторами хоста, поэтому модель 30B в 4-битном квантовании будет выдавать небольшое количество токенов в секунду.

Не принимайте на веру чужие цифры, включая мои. Измерьте количество токенов в секунду на своем оборудовании и примите решение на основе полученных данных.

Результатом становится четкое разделение сценариев использования модели. Интерактивный чат будет некомфортным, так как вы читаете быстрее, чем сервер пишет, а каждый ответ начинается с долгой паузы. Фоновая работа агента вполне допустима, так как задаче, которая выполняется без присмотра в течение десяти минут, не важна низкая скорость. Именно такой сценарий использования для этой модели описывает Meta.

Если вам нужна интерактивная скорость, есть два честных варианта: GPU или облачный API. Рассчитайте точку окупаемости между GPU VPS и API-токенами перед арендой чего-либо, а в статье что на самом деле дает GPU VPS описано, за что именно вы платите. Что касается более широкого вопроса о том, что может потянуть конкретный сервер, начните с какие модели можно разместить самостоятельно, а запуск модели Qwen аналогичного размера на VPS является наиболее близким сравнением в этом классе размеров. Если измеренные вами показатели оказались слишком низкими для комфортной работы, в Nemotron 3.5 Lightning на VPS рассматриваются те же вопросы объема RAM и скорости генерации для модели, созданной для скорости, а не для размера.

Почему модель «забывает» информацию задолго до достижения лимита в 128K токенов?

Потому что стандартное окно контекста в Ollama составляет 4096 токенов, независимо от того, какой объем поддерживает сама модель. Это значение по умолчанию указано в FAQ Ollama по состоянию на август 2026 года. Тег модели может указывать на поддержку 128K, но сервер передает модели только 4096 токенов, пока вы не зададите иное значение. В результате длинная история переписки с агентом теряет свои начальные фрагменты, и создается впечатление, что у модели амнезия.

Увеличивайте этот параметр на сервере для каждого запроса:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

В рамках интерактивной сессии команда /set parameter num_ctx 32768 изменяет это значение только для текущего сеанса. При использовании API передавайте num_ctx в параметрах запроса.

Каждый дополнительный токен контекста требует оперативной памяти сверх той, что занята весами модели. Если запросить полный объем 128K на сервере, размер памяти которого рассчитан только на веса, загрузка завершится ошибкой или переключится на более медленный режим работы. Увеличивайте значение постепенно и запускайте ollama ps после каждого шага. В статье Как работают num_ctx и длина контекста в Ollama подробно описаны соответствующие расчеты.

Уровни глубины рассуждения: low, medium, high и xhigh

Meta определяет четыре уровня глубины рассуждения для Muse Glimmer — от low до xhigh, — рекомендуя два верхних для сложных задач программирования и работы агентов. В Ollama это реализуется через параметр think. Используйте --think= в командной строке или передавайте think в теле запроса API.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

В интерактивной сессии переключение осуществляется командами /set think и /set nothink. Согласно документации Ollama, большинство моделей принимают либо логическое значение, либо уровень (low, medium или high), а некоторые поддерживают max для выбора максимально доступного уровня. Точный список поддерживаемых строк указан на странице конкретной модели; ознакомьтесь с ним, прежде чем использовать параметр в агентах, и протестируйте его вручную.

На серверах, использующих только CPU, этот параметр существенно влияет на производительность. Более высокий уровень означает генерацию большего количества токенов «размышления» до появления первого слова ответа, а каждый такой токен требует столько же времени, сколько и токен ответа. Для рутинных задач оставляйте значение low. Длина ответа также требует контроля, поэтому ограничивайте ответ с помощью num_predict, чтобы один длинный вывод не блокировал медленную систему на несколько минут.

Удержание модели в памяти для постоянно активного агента

По умолчанию Ollama выгружает неактивную модель через пять минут. Если агент запускается каждые десять минут, это означает необходимость полной загрузки 18 ГБ с диска при каждом выполнении. На VPS с сетевым хранилищем такая загрузка происходит медленно. Вместо этого закрепите модель в оперативной памяти.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Отрицательное значение позволяет модели оставаться в памяти до тех пор, пока она не будет выгружена принудительно, а параметр keep_alive в API-запросе переопределяет настройки сервера для конкретного вызова. Цена такого решения очевидна: оперативная память остается занятой, даже когда агент бездействует, поэтому данная настройка подходит для сервера, выделенного под работу агента. В статье Удержание модели Ollama в памяти описаны различные варианты реализации.

Настройка агента для написания кода

Ollama предоставляет API, совместимый с OpenAI, по адресу http://127.0.0.1:11434/v1, поэтому большинство инструментов для агентов подключаются к нему с использованием базового URL и любого непустого API-ключа. На странице Muse Glimmer для Ollama также описан ярлык для запуска, который одной командой связывает поддерживаемый агент с локальной моделью; рекомендуется также зафиксировать там тег версии.

ollama launch claude --model muse-glimmer:30b

Агенты отправляют объемные промпты. Содержимое файлов, вывод инструментов и растущая история переписки — всё это поступает в виде входных токенов, и на сервере с CPU обработка промпта становится наиболее ресурсоемким этапом еще до начала генерации. Ограничивайте контекст минимально необходимым для выполнения задачи размером. В настройке агента для работы с Ollama рассматривается клиентская сторона, в запуске агента на VPS — серверная часть, а в контроле расходов на работу агента на VPS — сценарии круглосуточного выполнения.

Обработка изображений работает аналогичным образом. API Ollama принимает изображения в поле images сообщения, поэтому текстовый клиент никогда не отправит изображение, независимо от возможностей энкодера восприятия.

Не открывайте порт 11434

API Ollama не имеет встроенной аутентификации. Если вы настроите OLLAMA_HOST=0.0.0.0:11434 так, чтобы обращаться к нему со своего ноутбука, вы выставите неавторизованный сервис запуска моделей в публичный интернет. Любой, кто обнаружит этот порт, сможет загружать модели на ваш диск и считывать данные, которые ваш агент передает через этот API. Оставьте привязку к localhost и используйте SSH-туннелирование.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

В разделе Обеспечение безопасности конечной точки API Ollama описаны надлежащие способы защиты, включая использование reverse proxy с обязательной аутентификацией.

Что может пойти не так и как это выглядит

Загрузка прерывается на середине. Проблема с диском. Запустите df -h для директории с моделью. Сборка bf16 размером 57 ГБ не поместится на корневой раздел объемом 40 ГБ, как и два 8-битных тега одновременно.

Модель загружается, а затем процесс завершается. Нехватка оперативной памяти. dmesg -T фиксирует, как OOM-killer ядра выбирает процесс для завершения, а journalctl -u ollama -n 100 показывает это же событие со стороны сервиса. Решение — использовать тег меньшего размера или уменьшить num_ctx. Увеличение раздела подкачки (swap) не поможет.

Скорость работы составляет секунды на токен. Запустите vmstat 1 и следите за столбцами si и so. Постоянная активность подкачки означает, что веса модели не помещаются в ОЗУ, и система считывает их с диска во время вычислений.

Тег, который работал на прошлой неделе, исчез. Списки тегов меняются. Перечитайте страницу модели, зафиксируйте текущую версию и запишите имя тега там, где вы сможете его найти.

Проверяйте размеры самостоятельно перед загрузкой

Размеры в таблице были взяты со страницы тегов модели 16 августа 2026 года, а опубликованный список тегов не является гарантией. Ознакомьтесь с актуальным списком на странице модели, а затем проверьте, сколько места фактически занято на вашем диске:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama хранит слои моделей как общие блобы, поэтому два тега, использующие один и тот же слой, не занимают вдвое больше места на диске. Сравните данные, которые выводит du, с опубликованным размером и планируйте дисковое пространство, ориентируясь на большее из этих значений.

FAQ

Сколько оперативной памяти требуется Muse Glimmer на VPS?

Отталкивайтесь от размера тега и прибавляйте объем контекстного окна. Размер тега по умолчанию составляет примерно 18 ГБ на 16 августа 2026 года, поэтому сервер с 16 ГБ ОЗУ не сможет его запустить, а на сервере с 24 ГБ останется крайне мало места для контекста. Рассматривайте это как отправную точку, а не как готовый ответ. Загрузите тег, запустите его один раз, затем выполните ollama ps и free -h на своем сервере и посмотрите на реальные показатели. Увеличение контекста и параллельные запросы требуют дополнительной памяти сверх весов модели.

Можно ли запустить Muse Glimmer без GPU?

Да. Модель загружается и отвечает на VPS только с CPU. Скорость генерации ограничена пропускной способностью памяти, а не количеством ядер. На виртуальном хостинге эта пропускная способность разделяется между пользователями, поэтому при 4-битном квантовании ожидайте низкую скорость генерации токенов в секунду. Это приемлемо для фоновых задач агентов, работающих без участия пользователя, но неудобно для интерактивного чата. Запустите ollama ps во время выполнения запроса и проверьте столбец процессора, чтобы убедиться, где именно выполняются вычисления.

Полезны ли теги MLX на Linux VPS?

Нет. Любой тег, содержащий mlx в названии, собран для движка MLX в Ollama, который является бэкендом для Apple Silicon. На x86 Linux-сервере эти теги представляют собой большой объем данных, который вы не сможете запустить. Используйте обычный тег 30b или любой другой тег без пометки MLX, и игнорируйте бенчмарки для оборудования Apple, которые сопровождают сборки MLX.

Почему модель «забывает» информацию задолго до достижения 128K токенов?

Потому что размер контекстного окна по умолчанию в Ollama составляет 4096 токенов, независимо от того, какой объем поддерживает модель. Сервер обрезает длинные диалоги до того, как модель успевает их обработать. Установите OLLAMA_CONTEXT_LENGTH на сервере, /set parameter num_ctx для одной сессии или передайте num_ctx в параметрах API-запроса. Потребление памяти растет вместе с этим значением, поэтому увеличивайте его постепенно и каждый раз проверяйте ollama ps.

Стоит ли фиксировать версию тега или использовать latest?

Фиксируйте версию. muse-glimmer без указания тега разрешается в latest — это указатель, который издатель может в любой момент перенаправить на другую сборку. В результате обычное обновление может изменить модель, на которой работает ваш агент. Указывайте muse-glimmer:30b в скриптах, unit-файлах и конфигурациях агентов. Перед фиксацией проверяйте список тегов на странице модели, так как опубликованные теги могут меняться.