SSD Nodes Learn 🎉 VPS от $5.50/мес
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-13

Как запустить Nemotron 3.5 Lightning на VPS через Ollama

Узнайте, как развернуть NVIDIA Nemotron 3.5 Lightning на сервере. Мы разберем актуальный тег для команды pull, минимальный объем RAM и реальную производительность на CPU.

Для чего предназначена модель Nemotron 3.5 Lightning

Nemotron 3.5 Lightning — это открытая MoE-модель (mixture-of-experts) от NVIDIA с 30 миллиардами параметров, выпущенная в августе 2026 года. Она разработана для агентов, которые работают часами, а не для разовых сессий в чате. Архитектура MoE означает, что веса разделены на множество экспертных подсетей, и каждый токен обрабатывается только несколькими из них. Согласно документации NVIDIA, модель содержит 30 миллиардов параметров, из которых 3 миллиарда активны для каждого токена. Вы платите объемом памяти, необходимым для хранения всех весов, но получаете высокую скорость работы за счет малого количества активных параметров.

Этот баланс — главная причина рассмотреть данную модель для арендуемого сервера. Агент, выполняющий реальные задачи, отправляет тысячи коротких запросов в течение дня, поэтому пропускная способность на каждый потраченный доллар определяет, целесообразно ли запускать его на собственном оборудовании. Модель, которая тратит 40 секунд на один ответ, подходит для работы в качестве помощника, но не для агента: одна задача может требовать двадцати вызовов, и вы будете ждать завершения каждого из них.

NVIDIA описывает архитектуру как гибридную: чередующиеся слои Mamba-2 и MoE с выборочными слоями внимания. В документации указана максимальная длина контекста до 1M токенов и лицензия OpenMDW-1.1, разрешающая коммерческое использование. Основные языки — английский и языки программирования; также поддерживаются испанский, французский, немецкий, итальянский и японский.

В августе 2026 года Artificial Analysis опубликовала результаты замеров, показавшие скорость генерации почти 670 токенов в секунду на предрелизной конечной точке DeepInfra с использованием весов NVFP4. Это показатели облачного GPU-сервиса. Воспринимайте их как возможности архитектуры, а не как производительность вашего VPS.

Какой тег Ollama подходит для конкретного VPS

Библиотека Ollama публикует несколько сборок одних и тех же весов. Разница между ними заключается в квантовании — количестве бит, используемых для хранения каждого веса, что существенно влияет на размер загружаемого файла.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Теги с названиями latest, 30b и 30b-a3b указывают на один и тот же хеш, что и 30b-a3b-q4_K_M, поэтому по умолчанию загружается четырехбитная сборка размером 25 ГБ с полным контекстом 1M. Версия Q8_0 занимает 35 ГБ, а bf16 — 66 ГБ; обе также поддерживают контекст 1M. Сборки MLX размером 23 ГБ предназначены для Apple silicon и ограничены контекстом 256K, поэтому они не подходят для Linux VPS.

Указанные значения — это размеры загружаемых файлов, а не требования к объёму памяти. NVIDIA не публикует минимальные значения VRAM (видеопамяти) для сборок Ollama, поэтому рассматривайте размер загрузки лишь как нижний порог. Веса должны где-то размещаться: в памяти GPU, если карта их вмещает, или в системной оперативной памяти в противном случае. К этому объёму добавляется KV-кэш (key/value cache, память модели для хранения состояния диалога по токенам). Реальные требования для вашего оборудования определяются не арифметическими расчётами, а командой, приведённой ниже. Если вы ещё не выбрали уровень квантования, в разделе во что обходятся Q4, Q8 и FP16 описаны потери качества на каждом этапе.

Используйте точный тег, никогда не используйте latest

latest — это динамический указатель. Когда библиотека обновляет его, поведение вашего агента меняется при следующем pull, и в ваших записях не будет объяснения причин. Указывайте тег явно.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Скрипт установки создает systemd-сервис, который работает от имени пользователя ollama и хранит модели в /usr/share/ollama/.ollama/models. На большинстве образов VPS этот путь находится в корневой файловой системе, поэтому проверьте наличие свободного места, прежде чем запрашивать 25 ГБ.

df -h /usr/share/ollama

Если процесс pull прерывается и сообщает no space left on device, это означает именно то, что сказано: частичные блобы остаются на диске, пока вы их не удалите. После этого проверьте, что именно было загружено:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show выводит архитектуру, количество параметров, длину контекста и квантование, которые фактически содержит файл. Если какие-либо из этих данных не совпадают с информацией на странице библиотеки, значит, вы загрузили не тот тег, который планировали.

Запуск модели и проверка фактического места выполнения

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Пока модель загружена, откройте второй терминал:

ollama ps

Эта команда позволяет ответить на вопрос об использовании памяти на вашем устройстве. ollama ps выводит загруженную модель, занимаемый ею объем памяти и столбец PROCESSOR. Значение 100% GPU означает, что модель полностью находится в VRAM. Значение 100% CPU означает, что модель отсутствует в видеопамяти, и каждый токен вычисляется процессором с использованием системной оперативной памяти. Разделение, например 65%/35% CPU/GPU, означает, что слои не поместились целиком, и скорость работы определяется долей участия CPU. Не пытайтесь оценить требования «на глаз». Загрузите модель и изучите эту строку.

Если загрузка невозможна, Ollama корректно завершает работу, вместо того чтобы аварийно закрыться:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Достаточно ли быстро работает VPS только с CPU?

VPS общего назначения не имеет GPU, поэтому всю работу выполняет CPU, считывая каждый необходимый вес из системной оперативной памяти. Здесь помогает архитектура MoE, так как для каждого токена задействуется лишь около 3 миллиардов параметров из 30 миллиардов, поэтому объем вычислений на токен значительно меньше, чем у плотной модели 30B. Однако это никак не помогает с памятью. Все 30 миллиардов параметров должны постоянно находиться в оперативной памяти, так как маршрутизатор может выбрать любого эксперта для любого токена.

Таким образом, производительность инференса на CPU для этой модели ограничивается пропускной способностью памяти, а не количеством ядер. Добавление vCPU в тарифный план, где их уже достаточно, почти ничего не меняет. Вам нужно достаточное количество RAM для размещения весов и KV-кэша, а также максимально быстрая память, доступная в рамках тарифа.

Проведите замеры перед тем, как запускать на нем агента, используя метод из измерения количества токенов в секунду для локальной LLM:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

Значение eval rate, выведенное в конце, — это ваша скорость генерации в токенах в секунду. Это единственное число определяет ответ на вопрос, так как именно оно в основном влияет на реальное время выполнения задачи агентом.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Это опубликованные сторонние данные, пересчитанные из минут на задачу, о которых сообщала Artificial Analysis на момент запуска; они были измерены на хостинговых GPU-эндпоинтах, а не на VPS. Nemotron 3.5 Lightning в среднем выполнял задачу за 30 секунд, при этом gpt-oss-120b занимала примерно 204, а Qwen3.6 35B — примерно 210. Используйте эти цифры для понимания масштаба разницы, а не как гарантию производительности вашего оборудования.

Честный совет зависит от того, кто ждет результата. Если агент работает в интерактивном режиме с человеком или выполняет длинные цепочки последовательных вызовов, арендуйте мощности с GPU. Если он запускается по расписанию ночью и никто не следит за процессом, VPS с большим объемом RAM — вполне подходящий вариант. В любом случае настройка будет одинаковой, а в запуске Ollama на VPS описан подбор параметров сервера и сравнение GPU-инстанса с оплатой за токены API-провайдеру. Точка окупаемости зависит от интенсивности использования: за GPU-инстанс вы платите каждый час его существования, тогда как токены API оплачиваются только по факту использования. Поэтому агент, который занят большую часть дня, выгоднее запускать на собственном сервере, а агент, который срабатывает дважды в час, — как правило, нет.

Контекстное окно 1M не является бесплатным

1M токенов — это максимум модели, и Ollama не предоставляет его по умолчанию. Ollama использует гораздо меньшее окно по умолчанию и отбрасывает самые старые токены, как только диалог превышает этот лимит. При этом не создается никаких записей в логах, поэтому для агента это выглядит так, будто модель «забывает» начало собственной задачи.

Устанавливайте размер окна целенаправленно. Для всего сервера отредактируйте сервис:

sudo systemctl edit ollama

Добавьте следующее, а затем выполните sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Для отдельного запроса передавайте num_ctx в объекте options:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Каждое увеличение требует больше памяти, так как KV-кэш растет пропорционально количеству разрешенных токенов. Увеличьте значение, перезапустите сервис, затем снова выполните ollama ps и следите за тем, как растет отображаемый размер. Если после этого изменения столбец PROCESSOR переключается с 100% GPU на разделение (split), значит, KV-кэш вытеснил слои модели из VRAM, и скорость работы значительно упадет. Выбор num_ctx в Ollama подробно описывает этот компромисс. Не устанавливайте значение 1000000 только потому, что это позволяет карточка модели: выделение памяти происходит сразу при запуске, и загрузка просто завершится ошибкой.

Подключение к постоянно работающему агенту

В анонсе Ollama для этой модели описан ярлык, запускающий поддерживаемый агент, который уже настроен на работу с ней:

ollama launch claude --model nemotron-3.5-lightning

В публикации указаны claude, opencode, openclaw и hermes в качестве параметров. Для подкоманды требуется актуальная версия Ollama, поэтому сначала проверьте ollama --version, а если она отсутствует, укажите агенту адрес API вручную. Ollama предоставляет эндпоинт, совместимый с OpenAI, который принимают большинство сред для агентов:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama игнорирует ключ, но большинство клиентов отказываются запускаться без него. Настройка со стороны агента описана в настройке агента для программирования на работу с Ollama и в создании собственного агента OpenClaw.

После того как агент начинает работать в фоновом режиме, важны две настройки сервера. OLLAMA_KEEP_ALIVE управляет временем удержания модели в памяти после последнего запроса; по умолчанию она выгружается через пять минут, поэтому при следующем вызове приходится снова ждать полной загрузки. Для файла размером 25 ГБ без использования GPU эта пауза достаточно велика, чтобы вызвать таймаут. Установите OLLAMA_KEEP_ALIVE=-1, чтобы модель оставалась в оперативной памяти. OLLAMA_HOST=0.0.0.0:11434 делает API доступным с других машин; поскольку в нём отсутствует какая-либо аутентификация, открывайте его только при наличии правила межсетевого экрана или в рамках частной сети.

Режимы сбоев и соответствующие сообщения

Загрузка (pull) завершается немедленно. Error: pull model manifest: file does not exist означает, что данный тег не существует. Имена тегов чувствительны к регистру и должны быть точными, поэтому копируйте их со страницы библиотеки, а не пытайтесь угадать суффикс квантования.

Модель не загружается. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) означает, что тег слишком велик для текущей конфигурации плана. Перейдите на меньшее квантование или уменьшите OLLAMA_CONTEXT_LENGTH, так как кэш KV учитывается в этом требовании.

Нет ответа на порту 11434. curl: (7) Failed to connect to localhost port 11434 означает, что служба не запущена или не прослушивает ожидаемый порт. Ознакомьтесь с systemctl status ollama и journalctl -u ollama -n 50. Если вы также запустили ollama serve вручную, вторая копия завершит работу с ошибкой Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Ответ приходит очень медленно. Проверьте ollama ps, прежде чем менять настройки. Любая доля нагрузки CPU в столбце PROCESSOR на машине с GPU означает, что часть модели вышла за пределы VRAM. В этом случае уменьшите контекст или выберите меньшее квантование. На машине без GPU низкая скорость является ожидаемым результатом, и никакие настройки это не исправят.

Агент забывает инструкции в процессе выполнения задачи. Объем диалога превысил окно контекста, и самые старые токены были удалены без уведомления. Увеличьте OLLAMA_CONTEXT_LENGTH и убедитесь с помощью ollama ps, что модель по-прежнему помещается в память. Если она больше не помещается, единственным решением будет использование более мощного оборудования, а не уменьшение окна контекста.

Место этой модели среди альтернатив

Модель MoE с 30B параметров — это слишком ресурсоёмкое решение для простых задач. Если ваша задача решается плотной моделью 8B, её запуск обойдётся значительно дешевле, а загрузка займёт секунды. Статья Qwen 3 8B и 27B на VPS содержит прямое сравнение для принятия такого решения. Чтобы получить более полное представление о том, какие модели подходят для вашего тарифного плана, начните с какие ИИ-модели можно разместить самостоятельно. Если вы планируете обслуживать несколько агентов одновременно, а не одного, сначала ознакомьтесь с сравнением Ollama и vLLM. Ollama не выполняет пакетную обработку параллельных запросов так, как это делают серверы вывода промышленного уровня, и именно на этом этапе масштабируемость однопользовательской установки заканчивается.

FAQ

Какой тег Nemotron 3.5 Lightning следует загрузить на Linux VPS?

Используйте nemotron-3.5-lightning:30b-a3b-q4_K_M. Его размер составляет 25 ГБ, он поддерживает полный контекст 1M и имеет тот же хеш, на который по состоянию на август 2026 года указывают теги latest, 30b и 30b-a3b. Указывайте имя тега явно вместо загрузки latest, чтобы повторная публикация этого указателя в будущем не изменила поведение вашего агента без вашего ведома. Теги mlx предназначены для архитектуры Apple silicon и не будут работать на Linux.

Сколько оперативной памяти требуется для Nemotron 3.5 Lightning?

NVIDIA не публикует минимальные требования к памяти для сборок Ollama, поэтому лучше измерить потребление, чем оценивать его. Загрузите тег, запустите модель один раз и прочитайте вывод ollama ps во время её работы: там указан фактический объем занятой памяти и информация о том, была ли модель загружена в GPU или CPU. Размер загружаемого файла, 25 ГБ для стандартного тега, является лишь нижним порогом, так как к нему добавляется KV-кэш, который растет вместе с установленным окном контекста. Если объема памяти недостаточно, Ollama выдаст ошибку model requires more system memory с указанием обоих значений.

Можно ли запустить Nemotron 3.5 Lightning на VPS без GPU?

Да, если на сервере достаточно оперативной памяти для размещения весов модели. Архитектура MoE помогает в этом, так как для вычисления одного токена используется лишь около 3 из 30 миллиардов параметров. Основная проблема — скорость. Без GPU модель ограничена пропускной способностью памяти, поэтому добавление vCPU почти не влияет на результат. Запустите ollama run --verbose с фиксированным промптом, прочитайте строку eval rate и сравните полученное значение с требованиями вашего агента. Для пакетных задач, выполняемых ночью, этого часто достаточно. Для задач, требующих интерактивного ответа, — обычно нет.

Почему Ollama не предоставляет полное окно контекста 1M?

1M — это максимум для модели, а не значение по умолчанию в Ollama. Ollama применяет гораздо меньшее окно и отбрасывает старые токены, как только диалог превышает лимит, не выводя при этом ошибок. В результате агент «забывает» свои инструкции. Установите OLLAMA_CONTEXT_LENGTH в юните systemd или передавайте num_ctx в каждом запросе. Увеличивайте значение постепенно и каждый раз проверяйте ollama ps, так как память под KV-кэш масштабируется вместе с окном и может привести к вытеснению слоев модели из GPU.

Можно ли использовать Nemotron 3.5 Lightning в коммерческих целях?

В карточке модели NVIDIA указана лицензия OpenMDW-1.1, которая допускает коммерческое использование. Это относится к весам, которые вы загружаете и запускаете самостоятельно. Это не касается остального программного обеспечения в вашем стеке, поэтому отдельно проверяйте лицензии агента и всех используемых инструментов, а также ознакомьтесь с актуальной карточкой модели, прежде чем полагаться на нее в договорных обязательствах.