Как запустить Nemotron 3.5 Lightning на VPS через Ollama
Узнайте, как развернуть NVIDIA Nemotron 3.5 Lightning на сервере. Инструкция содержит точный тег для команды pull, требования к объему RAM и оценку производительности CPU.
Назначение Nemotron 3.5 Lightning
Nemotron 3.5 Lightning — это открытая модель NVIDIA типа mixture-of-experts с 30B параметров, выпущенная в августе 2026 года. Она создана для агентов, которые работают часами, а не для разовых сессий чата. Архитектура MoE (mixture-of-experts) означает, что веса разделены на множество экспертных подсетей, и каждый токен проходит только через некоторые из них. Согласно документации NVIDIA, модель содержит 30 миллиардов параметров, из которых 3 миллиарда активны для каждого токена. Вы платите за большой объем памяти, но получаете скорость, соответствующую малому числу активных параметров.
Этот компромисс — главная причина рассмотреть данную модель для арендованного сервера. Агент, выполняющий реальную работу, отправляет тысячи коротких запросов в течение дня, поэтому пропускная способность на каждый потраченный доллар определяет, может ли он работать на вашем оборудовании. Модель, которая тратит 40 секунд на ответ, подходит для помощника, но не для агента: одна задача может требовать двадцати вызовов, и вы будете ждать завершения каждого из них.
NVIDIA описывает архитектуру как гибридную: чередующиеся слои Mamba-2 и MoE с выборочными слоями внимания (attention layers). В документации указана максимальная длина контекста до 1M токенов и лицензия OpenMDW-1.1, разрешающая коммерческое использование. Основные языки — английский и языки программирования; также заявлена поддержка испанского, французского, немецкого, итальянского и японского языков.
В августе 2026 года Artificial Analysis опубликовала результаты замеров, показавшие почти 670 выходных токенов в секунду на предрелизной конечной точке DeepInfra, использующей веса NVFP4. Это показатели облачного GPU-сервиса. Воспринимайте их как возможности архитектуры, а не как производительность вашего VPS.
Какой тег Ollama подходит для конкретного VPS
Библиотека Ollama публикует несколько сборок одних и тех же весов. Разница между ними заключается в квантовании — количестве бит, используемых для хранения каждого веса, что значительно влияет на размер загружаемого файла.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Теги с названиями latest, 30b и 30b-a3b указывают на тот же хеш, что и 30b-a3b-q4_K_M, поэтому по умолчанию загружается 4-битная сборка размером 25 ГБ с полным контекстом 1M. Версия Q8_0 занимает 35 ГБ, а bf16 — 66 ГБ; обе также поддерживают контекст 1M. Сборки MLX размером 23 ГБ предназначены для Apple silicon и ограничены контекстом 256K, поэтому они не подходят для Linux VPS.
Указанные значения — это размеры загружаемых файлов, а не требования к объему памяти. NVIDIA не публикует минимальные значения VRAM (видеопамяти) для сборок Ollama, поэтому рассматривайте размер загрузки лишь как нижний предел. Веса должны где-то размещаться: в памяти GPU, если карта их вмещает, или в системной оперативной памяти в противном случае. Сверх этого добавляется KV-кэш (key/value cache, память модели для каждого токена в диалоге). Реальные требования для вашего оборудования определяются не арифметическими расчетами, а командой, приведенной ниже. Если вы еще не определились с уровнем квантования, в разделе во что обходятся Q4, Q8 и FP16 описаны потери качества на каждом этапе.
Используйте точный тег, никогда не используйте latest
latest — это динамический указатель. Когда библиотека обновляет его, поведение вашего агента меняется при следующем обновлении (pull), и в ваших записях не будет объяснения причин. Указывайте имя тега явно.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MУстановочный скрипт создает systemd-сервис, который работает от имени пользователя ollama и хранит модели в директории /usr/share/ollama/.ollama/models. На большинстве образов VPS этот путь находится в корневой файловой системе, поэтому проверьте наличие свободного места перед тем, как запрашивать 25 ГБ. Если файловая система переполнена, стоит ознакомиться с тем, где Ollama хранит модели и как их переместить, до выполнения pull, а не после того, как диск будет заполнен.
df -h /usr/share/ollamaЕсли процесс pull прерывается и сообщает no space left on device, это означает именно ошибку соединения; частичные данные (blobs) остаются на диске до тех пор, пока вы их не удалите. Затем проверьте, что именно было загружено:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show выводит архитектуру, количество параметров, длину контекста и квантование, которое фактически содержит файл. Если эти данные не совпадают с информацией на странице библиотеки, значит, вы загрузили не тот тег, который планировали.
Запуск модели и проверка фактического места выполнения
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Пока модель загружена, откройте вторую оболочку (shell) и выполните:
ollama psЭта команда позволяет определить объем памяти, используемый на вашей машине. ollama ps выводит загруженную модель, занимаемый ею объем памяти и столбец PROCESSOR. Значение 100% GPU означает, что модель полностью находится в VRAM. Значение 100% CPU означает, что модель не загружена в видеопамять, и каждый токен вычисляется процессором из системной оперативной памяти. Разделение, например 65%/35% CPU/GPU, означает, что слои не поместились целиком, и скорость работы определяется долей участия CPU. Не пытайтесь оценить требования «на глаз». Загрузите модель и изучите эту строку.
Если загрузка невозможна, Ollama корректно завершает работу, не допуская аварийного сбоя:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Достаточно ли быстро работает VPS только с CPU?
VPS общего назначения не имеет GPU, поэтому всю работу выполняет CPU, считывая каждый необходимый вес из системной оперативной памяти. Здесь помогает архитектура MoE, так как для каждого токена задействуется лишь около 3 миллиардов параметров из 30 миллиардов, поэтому объем вычислений на токен значительно меньше, чем у плотной модели 30B. Однако это не ускоряет работу с памятью. Все 30 миллиардов параметров должны оставаться в оперативной памяти, так как маршрутизатор может выбрать любого эксперта для любого токена.
Таким образом, скорость инференса на CPU для этой модели ограничивается пропускной способностью памяти, а не количеством ядер. Добавление vCPU к тарифному плану, в котором их уже достаточно, практически ничего не меняет. Вам необходим достаточный объем RAM для размещения весов и KV-кэша, а также максимально быстрая память, доступная в рамках тарифа.
Проведите измерения перед тем, как запускать на нем агента, используя метод из измерения количества токенов в секунду для локальной LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Значение eval rate, выведенное в конце, — это ваша скорость генерации в токенах в секунду. Это единственное число определяет ответ, так как время выполнения задачи агентом напрямую зависит от него. Умножьте его на ожидаемую длину ответа, и если результат превышает время, которое вы готовы ждать, ограничение вывода через num_predict станет тем рычагом, который позволит ограничить длительность одного вызова без смены оборудования.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Это опубликованные сторонние данные, пересчитанные из времени выполнения задачи в минутах, представленного Artificial Analysis на момент запуска; они были измерены на хостинговых GPU-эндпоинтах, а не на VPS. Nemotron 3.5 Lightning в среднем тратил 30 секунд на задачу, при этом gpt-oss-120b занимала примерно 204, а Qwen3.6 35B — примерно 210. Используйте эти данные для понимания соотношения производительности, а не как гарантию для вашего оборудования.
Честный совет зависит от того, кто ожидает ответа. Если агент работает в интерактивном режиме с пользователем или выполняет длинные цепочки последовательных вызовов, арендуйте мощности GPU. Если он запускается по расписанию ночью и никто не следит за процессом, VPS с большим объемом RAM — вполне подходящий вариант. В любом случае настройка идентична, а руководство по запуску Ollama на VPS охватывает вопросы выбора размера тарифа и сравнения GPU-инстанса с оплатой API-провайдеру за токены. Точка окупаемости зависит от утилизации: за GPU-инстанс вы платите каждый час его существования, тогда как API тарифицируется только по факту использования. Поэтому, если агент загружен большую часть дня, выгоднее собственный сервер, а если агент запускается дважды в час — обычно нет.
Контекстное окно 1M не является бесплатным
1M токенов — это максимум для модели, и Ollama не предоставляет его по умолчанию. Ollama использует гораздо меньшее окно по умолчанию и отбрасывает самые старые токены, как только диалог превышает этот лимит. При этом ничего не записывается в логи, поэтому для агента это выглядит так, будто модель «забывает» начало собственной задачи.
Устанавливайте размер окна намеренно. Для всего сервера отредактируйте службу:
sudo systemctl edit ollamaДобавьте следующее, затем выполните sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Для отдельного запроса отправляйте num_ctx в объекте options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Каждое увеличение требует больше памяти, так как KV-кэш растет вместе с количеством разрешенных токенов. Увеличьте значение, перезапустите службу, затем снова выполните ollama ps и следите за тем, как растет сообщаемый размер. Если после этого изменения столбец PROCESSOR переключается с 100% GPU на split, значит, KV-кэш вытеснил слои модели из VRAM, и скорость работы значительно упадет. Выбор num_ctx в Ollama подробно описывает этот компромисс. Не устанавливайте значение 1000000 только потому, что это позволяет карточка модели, так как выделение памяти происходит заранее, и загрузка просто завершится ошибкой.
Подключение к постоянно работающему агенту
В анонсе модели Ollama описан ярлык, который запускает поддерживаемый агент, уже настроенный на работу с ней:
ollama launch claude --model nemotron-3.5-lightningВ этой позиции в публикации указаны claude, opencode, openclaw и hermes. Для работы подкоманды требуется актуальная версия Ollama, поэтому сначала проверьте ollama --version. Если она отсутствует, укажите агенту адрес API вручную. Ollama предоставляет эндпоинт, совместимый с OpenAI, который принимает большинство инструментов для агентов:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama игнорирует ключ, но большинство клиентов отказываются запускаться, если он не задан. Настройка со стороны агента описана в настройке агента для программирования на работу с Ollama и в создании собственного агента OpenClaw.
После того как агент начинает работать в фоновом режиме, важны две настройки сервера. OLLAMA_KEEP_ALIVE определяет время удержания модели в оперативной памяти после последнего запроса. По умолчанию модель выгружается через пять минут, поэтому следующий вызов потребует повторной полной загрузки. Для файла размером 25 ГБ без использования GPU эта пауза достаточно велика, чтобы вызвать таймаут. Установите OLLAMA_KEEP_ALIVE=-1, чтобы модель оставалась в памяти. OLLAMA_HOST=0.0.0.0:11434 делает API доступным с других машин. Поскольку этот параметр не предусматривает никакой аутентификации, открывайте его только при наличии правила брандмауэра или в рамках частной сети.
Типовые сбои и соответствующие сообщения
Загрузка образа завершается ошибкой. Error: pull model manifest: file does not exist означает, что указанный тег не существует. Имена тегов чувствительны к регистру и должны быть точными, поэтому копируйте их со страницы библиотеки, а не пытайтесь угадать суффикс квантования.
Модель не загружается. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) означает, что тег слишком велик для текущей конфигурации плана. Перейдите на меньшее квантование или уменьшите OLLAMA_CONTEXT_LENGTH, так как кэш KV учитывается в этом ограничении.
Нет ответа на порту 11434. curl: (7) Failed to connect to localhost port 11434 означает, что служба не запущена или не прослушивает ожидаемый порт. Изучите systemctl status ollama и journalctl -u ollama -n 50. Если вы также запустили ollama serve вручную, вторая копия завершит работу с ошибкой Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Ответы приходят очень медленно. Перед внесением изменений проверьте ollama ps. Любая доля использования CPU в столбце PROCESSOR на машине с GPU означает, что часть модели вышла за пределы VRAM. Уменьшите контекст или выберите меньшее квантование. На машине без GPU низкая скорость является ожидаемым результатом, и никакие настройки это не исправят.
Агент «забывает» инструкции в процессе выполнения задачи. Объем диалога превысил окно контекста, и самые старые токены были удалены без уведомления. Увеличьте OLLAMA_CONTEXT_LENGTH и убедитесь с помощью ollama ps, что модель всё ещё помещается в память. Если это не так, единственным решением будет использование более мощного оборудования, а не уменьшение окна контекста.
Место этой модели среди альтернатив
Модель MoE с 30B параметров — это ресурсоемкое решение для простых задач. Если плотная модель 8B уже справляется с вашей задачей, её запуск обойдется значительно дешевле, а загрузка займет секунды. Qwen 3 в версиях 8B и 27B на VPS — это прямое сравнение для принятия такого решения. Для более широкого обзора того, что можно разместить на конкретном тарифном плане, начните с какие модели ИИ можно разместить самостоятельно. Если вы планируете обслуживать несколько агентов одновременно, а не одного, сначала прочитайте сравнение Ollama и vLLM, так как Ollama не выполняет пакетную обработку параллельных запросов так, как это делает сервер для промышленного инференса, и именно на этом этапе масштабируемость однопользовательской установки заканчивается.
FAQ
Какой тег Nemotron 3.5 Lightning следует загрузить на Linux VPS?
Используйте nemotron-3.5-lightning:30b-a3b-q4_K_M. Его размер составляет 25 ГБ, он поддерживает полный максимальный контекст 1M, и это тот же хеш, на который указывают теги latest, 30b и 30b-a3b по состоянию на август 2026 года. Указывайте имя тега явно вместо загрузки latest, чтобы повторная публикация этого указателя в будущем не изменила поведение вашего агента без вашего ведома. Теги mlx предназначены для архитектуры Apple silicon и не будут работать на Linux.
Сколько оперативной памяти требуется для Nemotron 3.5 Lightning?
NVIDIA не публикует минимальные требования к памяти для сборок Ollama, поэтому лучше измерить потребление, чем оценивать его. Загрузите тег, запустите модель один раз и прочитайте ollama ps во время её работы: там будет указан фактический объем занятой памяти и информация о том, размещена ли модель в GPU или CPU. Размер загрузки, 25 ГБ для стандартного тега, является нижним пределом, так как KV-кэш добавляется сверху и растет вместе с установленным вами окном контекста. Если тарифный план слишком мал, Ollama выдаст ошибку model requires more system memory с указанием обоих значений.
Можно ли запустить Nemotron 3.5 Lightning на VPS без GPU?
Да, если на сервере достаточно оперативной памяти для размещения весов. Архитектура MoE помогает в этом, так как для каждого токена вычисляется только около 3 из 30 миллиардов параметров. Основная проблема — скорость. Без GPU модель ограничена пропускной способностью памяти, поэтому добавление vCPU почти не влияет на результат. Запустите ollama run --verbose с фиксированным промптом, прочитайте строку eval rate и сравните это число с требованиями вашего агента. Для пакетных заданий, выполняемых ночью, этого часто достаточно. Для задач, где пользователь ожидает ответа в реальном времени, производительности обычно не хватает.
Почему Ollama не предоставляет полное окно контекста 1M?
1M — это максимум модели, а не значение по умолчанию в Ollama. Ollama применяет гораздо меньшее окно и отбрасывает самые старые токены, как только диалог превышает лимит, не выводя при этом ошибок. Это выглядит так, будто агент «забывает» свои инструкции. Установите OLLAMA_CONTEXT_LENGTH в systemd-юните или передавайте num_ctx при каждом запросе. Увеличивайте значение постепенно и каждый раз проверяйте ollama ps, так как память KV-кэша масштабируется вместе с окном и может вытеснить слои модели из GPU.
Можно ли использовать Nemotron 3.5 Lightning в коммерческих целях бесплатно?
В карточке модели NVIDIA указана лицензия OpenMDW-1.1, которая допускает коммерческое использование. Это относится к весам, которые вы загружаете и запускаете самостоятельно. Это не касается остального программного обеспечения в вашем стеке, поэтому отдельно проверяйте лицензии агента и любых инструментов, которые вы к нему подключаете, а также ознакомьтесь с актуальной карточкой модели, прежде чем полагаться на неё в рамках контрактных обязательств.