Як запустити Nemotron 3.5 Lightning на VPS
Запустіть NVIDIA Nemotron 3.5 Lightning через Ollama: використайте точний tag для завантаження, перевірте потребу в RAM і дізнайтеся, чи достатньо CPU.
Для чого призначено Nemotron 3.5 Lightning
Nemotron 3.5 Lightning — це відкрита модель NVIDIA на 30B параметрів з архітектурою mixture-of-experts, випущена в August 2026. Вона призначена для агентів, які працюють годинами, а не для одного чат-сеансу. MoE (mixture of experts) означає, що ваги розподілено між багатьма експертними підмережами, а кожен токен проходить лише через кілька з них. У model card NVIDIA зазначено 30 billion загальних параметрів і 3 billion активних параметрів на токен. За велику кількість параметрів ви платите обсягом пам’яті. Натомість менша активна кількість дає вищу швидкість.
Саме через цей компроміс на цю модель варто звернути увагу, якщо ви орендуєте сервер. Агент, який виконує реальну роботу, надсилає протягом дня тисячі коротких запитів, тому пропускна здатність на одиницю вартості визначає, чи можна запустити його на власному сервері. Модель, якій потрібно 40 seconds на одну відповідь, може бути придатним помічником, але буде поганим агентом: одне завдання робить двадцять викликів, і кожного з них доводиться чекати.
NVIDIA описує архітектуру як гібридну: чергування шарів Mamba-2 і MoE з окремими attention-шарами. У model card зазначено максимальну довжину контексту до 1M tokens і ліцензію OpenMDW-1.1 зі статусом готовності до комерційного використання. Основні мови — English і code; також зазначено Spanish, French, German, Italian і Japanese.
Artificial Analysis опублікувала результати вимірювань під час запуску в August 2026: майже 670 output tokens per second на попередньо випущеній кінцевій точці DeepInfra, яка обслуговувала ваги NVFP4. Це hosted GPU endpoint. Сприймайте цей показник як можливість архітектури, а не як швидкість, яку забезпечить ваш VPS.
Який тег Ollama відповідає якому VPS
Бібліотека Ollama публікує кілька збірок з однаковими вагами. Вони відрізняються квантуванням — кількістю бітів, у яких зберігається кожна вага. Через це розмір завантаження суттєво змінюється.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Теги latest, 30b і 30b-a3b вказують на той самий digest, що й 30b-a3b-q4_K_M, тому за замовчуванням завантажується чотирибітна збірка розміром 25 GB із повним контекстом 1M. Q8_0 має розмір 35 GB, а bf16 — 66 GB; обидві збірки також підтримують контекст 1M. Збірки MLX розміром 23 GB призначені для Apple silicon і обмежені контекстом 256K, тому на Linux VPS це неправильний вибір.
Це розміри завантажень, а не вимоги до пам’яті. NVIDIA не публікує мінімальний обсяг VRAM (відеопам’яті) для збірок Ollama, тому сприймайте розмір завантаження лише як нижню межу. Ваги мають постійно зберігатися десь: у пам’яті GPU, якщо відеокарта вміщує їх, або в системній RAM в іншому разі. Додатково використовується KV cache (кеш ключів і значень — пам’ять моделі для кожного токена розмови). Фактичне значення для вашого обладнання визначається командою, а не арифметичним розрахунком; її наведено нижче. Якщо ви ще не вибрали рівень квантування, у матеріалі яку ціну мають Q4, Q8 і FP16 описано, від чого доводиться відмовлятися на кожному кроці.
Отримуйте точний тег, ніколи не використовуйте latest
latest — це змінний покажчик. Коли бібліотека повторно публікує його, поведінка вашого агента змінюється під час наступного отримання, і в нотатках не буде пояснення причини. Вказуйте тег явно.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MСкрипт інсталяції налаштовує службу systemd, яка працює від імені користувача ollama і зберігає моделі в /usr/share/ollama/.ollama/models. У більшості образів VPS цей шлях розташований на кореневій файловій системі, тому перевірте вільне місце, перш ніж запитувати 25 GB.
df -h /usr/share/ollamaЯкщо отримання зупиняється посередині та повідомляє no space left on device, це саме й означає, а частково отримані blobs залишаються на диску, доки ви їх не видалите. Потім перевірте, що саме було отримано:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show виводить архітектуру, кількість параметрів, довжину контексту та квантизацію, які фактично містить файл. Якщо будь-яке з цих значень не збігається зі сторінкою бібліотеки, ви отримали не той тег, який мали на увазі.
Запустіть його та перевірте, де саме він працює
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Поки модель завантажена, відкрийте другу оболонку:
ollama psЦя команда відповідає на запитання про використання пам’яті на вашій машині. ollama ps виводить завантажену модель, обсяг пам’яті, який вона займає, і стовпець PROCESSOR. Значення 100% GPU означає, що модель повністю розміщена у VRAM. Значення 100% CPU означає, що модель не використовує VRAM, а кожен токен обчислюється процесором із системної RAM. Розподіл на кшталт 65%/35% CPU/GPU означає, що всі шари не помістилися, і частка обчислень на CPU визначає швидкість. Не оцінюйте вимоги до пам’яті. Завантажте модель і прочитайте цей рядок.
Якщо модель взагалі не вдається завантажити, Ollama коректно відмовляється від запуску, а не завершується аварійно:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Чи достатньо швидкий VPS лише з CPU?
У VPS загального призначення немає GPU, тому всю роботу виконує CPU, який зчитує всі потрібні ваги із системної RAM. MoE допомагає в цьому випадку, оскільки для кожного токена задіюється лише близько 3 мільярдів із 30 мільярдів параметрів. Тому обсяг обчислень на токен значно менший, ніж у щільної моделі 30B. Пам’ять це не зменшує. Усі 30 мільярдів параметрів мають залишатися в пам’яті, оскільки router може вибрати будь-якого експерта для будь-якого токена.
Отже, inference на цій моделі лише на CPU обмежується пропускною здатністю пам’яті, а не кількістю ядер. Додавання vCPU до плану, у якому вже є достатня їх кількість, майже нічого не змінює. Потрібно достатньо RAM для ваг і KV cache, а також найшвидша пам’ять, яку передбачає план.
Перш ніж закріплювати за цією моделлю agent, виміряйте швидкість за методом із розділу вимірювання токенів за секунду для локальної LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Рядок eval rate, надрукований наприкінці, показує швидкість генерації в токенах за секунду. Саме це число визначає відповідь, оскільки wall-clock time agent переважно залежить від нього.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Це опубліковані сторонні показники, перераховані з тривалості виконання окремих завдань, яку Artificial Analysis навів під час запуску. Їх вимірювали на hosted GPU endpoints, а не на VPS. Середній час виконання одного завдання для Nemotron 3.5 Lightning становив приблизно 30 секунд, причому gpt-oss-120b тривало близько 204, а Qwen3.6 35B — близько 210. Використовуйте ці значення, щоб оцінити масштаб різниці, а не як гарантію для вашого обладнання.
Рекомендація залежить від того, хто очікує на результат. Якщо результату очікує людина або agent послідовно виконує довгі ланцюжки викликів, орендуйте GPU capacity. Якщо agent працює за розкладом уночі й ніхто не стежить за його виконанням, великий CPU plan із достатнім обсягом RAM є обґрунтованим варіантом. У будь-якому разі налаштування однакове, а розділ запуск Ollama на VPS пояснює вибір plan і порівнює GPU instance з оплатою API provider за токени. Точка беззбитковості залежить від utilisation: GPU instance тарифікується за кожну годину роботи, тоді як API tokens оплачуються лише під час використання. Тому agent, який працює більшу частину дня, зазвичай виправдовує власний сервер, а agent, який запускається двічі на годину, зазвичай — ні.
Вікно контексту 1M не надається автоматично
1M токенів — це максимальний обсяг контексту моделі, але Ollama не надає його за замовчуванням. Ollama використовує значно менше стандартне вікно контексту та видаляє найстаріші токени, коли розмір розмови його перевищує. У журналі це не фіксується, тому для агента це виглядає так, ніби модель забула початок власного завдання.
Встановіть розмір вікна явно. Щоб застосувати його до всього сервера, відредагуйте service:
sudo systemctl edit ollamaДодайте цей параметр, потім виконайте sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Для окремого запиту натомість передайте num_ctx в об’єкті options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Кожне збільшення споживає більше пам’яті, оскільки розмір KV cache зростає разом із дозволеною кількістю токенів. Збільште значення, перезапустіть сервіс, потім знову виконайте ollama ps і стежте, як зростає повідомлений розмір. Якщо після цієї зміни стовпець PROCESSOR зміниться з 100% GPU на split, KV cache витіснив шари моделі з VRAM, і швидкість роботи суттєво впаде. У матеріалі Вибір num_ctx в Ollama цей компроміс розглянуто докладно. Не встановлюйте 1000000 лише тому, що це значення дозволене в картці моделі: виділення пам’яті відбувається одразу, і завантаження просто завершиться помилкою.
Підключення до агента, який постійно працює
У дописі Ollama про випуск цієї моделі описано скорочену команду, яка запускає сумісного агента, уже налаштованого на роботу з нею:
ollama launch claude --model nemotron-3.5-lightningУ дописі на цій позиції описано claude, opencode, openclaw і hermes. Для цієї підкоманди потрібна актуальна версія Ollama, тому спочатку перевірте ollama --version. Якщо її немає, укажіть агенту API вручну. Ollama надає endpoint, сумісний з OpenAI, який підтримує більшість harness для агентів:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama ігнорує ключ, але більшість клієнтів не запускаються без заданого ключа. Налаштування harness описано в розділах підключення coding agent до Ollama і створення власного агента OpenClaw.
Після запуску агента без нагляду важливі два параметри сервера. OLLAMA_KEEP_ALIVE визначає, як довго модель залишається в пам’яті після останнього запиту. За замовчуванням вона вивантажується через п’ять хвилин, тому під час наступного виклику знову потрібно повністю завантажити модель. Для файлу розміром 25 GB без GPU ця пауза може бути достатньою, щоб спрацював тайм-аут. Установіть OLLAMA_KEEP_ALIVE=-1, щоб модель залишалася в пам’яті. OLLAMA_HOST=0.0.0.0:11434 робить API доступним з інших машин і не забезпечує жодної автентифікації, тому відкривайте його лише за правилом firewall або в приватній мережі.
Режими відмови та повідомлення, які ви побачите
Pull завершується негайно. Error: pull model manifest: file does not exist означає, що такого tag не існує. Назви tag є точними рядками, тому скопіюйте назву зі сторінки library, а не вгадуйте суфікс quantisation.
Model не завантажується. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) означає, що цей tag завеликий для поточного плану. Виберіть меншу quantisation або зменште OLLAMA_CONTEXT_LENGTH, оскільки KV cache враховується в цій вимозі.
На порту 11434 ніхто не відповідає. curl: (7) Failed to connect to localhost port 11434 означає, що сервіс не запущений або не слухає потрібну адресу. Перегляньте systemctl status ollama і journalctl -u ollama -n 50. Якщо ви також запустили ollama serve вручну, друга копія завершиться з Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Сервіс відповідає дуже повільно. Перед будь-якими змінами перевірте ollama ps. Будь-яке значення CPU у стовпці PROCESSOR на машині з GPU означає, що частина model не помістилася у VRAM. Зменште context або виберіть меншу quantisation. На машині без GPU повільна робота є очікуваним результатом, і жодне налаштування це не виправить.
Agent забуває свої інструкції під час виконання завдання. Conversation перевищила context window, і найстаріші tokens було непомітно відкинуто. Збільште OLLAMA_CONTEXT_LENGTH, за допомогою ollama ps переконайтеся, що model усе ще поміщається, а якщо він більше не поміщається, потрібна потужніша машина, а не менше window.
Де ця модель розташована серед альтернатив
30B MoE — велика модель для розміщення, якщо завдання невелике. Якщо щільна модель 8B уже справляється з вашим завданням, її запуск коштуватиме значно дешевше, а завантаження триватиме лічені секунди. Для такого вибору дивіться пряме порівняння Qwen 3 на VPS у варіантах 8B і 27B. Щоб ширше оцінити, які моделі фактично може вмістити певний тарифний план, почніть зі статті які AI-моделі можна розмістити на власній інфраструктурі. Якщо ви плануєте одночасно обслуговувати кількох агентів, а не одного, спочатку прочитайте Ollama у порівнянні з vLLM, оскільки Ollama не обробляє паралельні запити пакетно так, як це робить production-сервер інференсу. Саме на цьому налаштування для одного користувача перестає масштабуватися.
FAQ
Який тег Nemotron 3.5 Lightning слід завантажити на Linux VPS?
Використовуйте nemotron-3.5-lightning:30b-a3b-q4_K_M. Він має розмір 25 GB, містить повне максимальне контекстне вікно 1M і станом на August 2026 вказує на той самий digest, що й теги latest, 30b та 30b-a3b. Вказуйте його явно замість завантаження latest, щоб майбутня повторна публікація цього вказівника непомітно для вас не змінила поведінку агента. Теги mlx призначені для збірок під Apple silicon і не допоможуть у Linux.
Скільки RAM потребує Nemotron 3.5 Lightning?
NVIDIA не публікує мінімальний обсяг пам’яті для збірок Ollama, тому вимірюйте, а не оцінюйте. Завантажте тег, один раз запустіть модель і прочитайте ollama ps, поки вона завантажена: команда виводить фактично зайнятий обсяг і показує, чи модель розміщена на GPU або CPU. Розмір завантаження, 25 GB для стандартного тегу, є лише нижньою межею, оскільки додатково виділяється KV cache, розмір якого зростає відповідно до встановленого контекстного вікна. Якщо план має недостатній обсяг пам’яті, Ollama завершує роботу з model requires more system memory і вказує обидва значення.
Чи можна запустити Nemotron 3.5 Lightning на VPS без GPU?
Так, якщо план має достатньо RAM для розміщення ваг моделі. Архітектура MoE також допомагає, оскільки для кожного токена обчислюється лише близько 3 із 30 billion параметрів. Обмеженням є швидкість. Без GPU модель обмежена пропускною здатністю пам’яті, тому збільшення кількості vCPU майже не впливає на результат. Запустіть ollama run --verbose із фіксованим prompt, прочитайте рядок eval rate і порівняйте це значення з граничним часом відповіді вашого агента. Для пакетного завдання, яке виконується вночі, цього часто достатньо. Для завдань, результату яких очікує людина, зазвичай — ні.
Чому Ollama не надає повне контекстне вікно 1M?
1M — це максимальне значення моделі, а не стандартне значення Ollama. Ollama використовує значно менше вікно та відкидає найстаріші токени, коли розмір розмови перевищує його, не виводячи помилки. Через це здається, що агент забуває власні інструкції. Встановіть OLLAMA_CONTEXT_LENGTH для systemd service або передавайте num_ctx для кожного запиту. Збільшуйте значення поступово та щоразу перевіряйте ollama ps, оскільки обсяг пам’яті для KV cache зростає пропорційно до розміру вікна й може перемістити шари моделі з GPU.
Чи можна безкоштовно використовувати Nemotron 3.5 Lightning у комерційних цілях?
У model card NVIDIA зазначено, що модель поширюється за ліцензією OpenMDW-1.1 і дозволена для комерційного використання. Це стосується ваг моделі, які ви завантажуєте та запускаєте самостійно. Ліцензії іншого програмного забезпечення у вашому стеку вона не охоплює. Тому окремо перевірте ліцензії agent harness і всіх інструментів, які ви до нього підключаєте, а також ознайомтеся з актуальною model card, перш ніж покладатися на це для договірних зобов’язань.