Як запустити Nemotron 3.5 Lightning на VPS
Запустіть NVIDIA Nemotron 3.5 Lightning через Ollama на власному сервері: точний tag для завантаження, вимоги до RAM і швидкість роботи лише на CPU.
Для чого призначений Nemotron 3.5 Lightning
Nemotron 3.5 Lightning — це відкрита модель NVIDIA на 30B параметрів з architecture mixture-of-experts, випущена в August 2026. Вона призначена для агентів, які працюють годинами, а не для одного чат-сеансу. MoE (mixture of experts) означає, що ваги розподілено між багатьма експертними підмережами, і кожен токен проходить лише через кілька з них. У model card NVIDIA вказано 30 billion загальних параметрів і 3 billion активних параметрів на токен. У пам’яті потрібно розмістити більшу кількість параметрів. Натомість швидкість визначається меншою кількістю активних параметрів.
Саме цей компроміс робить модель цікавою для орендованого сервера. Агент, який виконує реальну роботу, надсилає протягом дня тисячі коротких запитів. Тому пропускна здатність на одиницю вартості визначає, чи можна запускати його на власному сервері. Модель, яка формує відповідь за 40 секунд, придатна як асистент, але погано підходить для агента. Одне завдання може потребувати 20 викликів, і кожного з них доведеться чекати.
NVIDIA описує цю архітектуру як гібридну: чергування шарів Mamba-2 і MoE з окремими шарами attention. У model card вказано максимальну довжину контексту до 1M токенів і ліцензію OpenMDW-1.1 зі статусом ready for commercial use. Основні мови — English і code. Також зазначено Spanish, French, German, Italian та Japanese.
Artificial Analysis опублікувала вимірювання під час запуску в August 2026. Вони показали майже 670 output tokens per second на попередньому endpoint DeepInfra, який обслуговував ваги NVFP4. Це hosted GPU endpoint. Сприймайте цей показник як можливість архітектури, а не як результат, якого обов’язково досягне ваш VPS.
Який тег Ollama відповідає якому VPS
Бібліотека Ollama публікує кілька збірок з однаковими вагами. Вони відрізняються квантуванням — кількістю бітів, у яких зберігається кожна вага. Через це розмір завантаження може суттєво відрізнятися.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Теги latest, 30b і 30b-a3b вказують на той самий digest, що й 30b-a3b-q4_K_M. Отже, завантаження за замовчуванням — це чотирибітна збірка обсягом 25 GB із повним контекстом 1M. Q8_0 має розмір 35 GB, а bf16 — 66 GB; обидві збірки також підтримують контекст 1M. Збірки MLX обсягом 23 GB призначені для Apple silicon і обмежені контекстом 256K, тому на Linux VPS вони не підходять.
Це розміри завантаження, а не вимоги до пам’яті. NVIDIA не публікує мінімальний обсяг VRAM (відеопам’яті) для збірок Ollama, тому сприймайте розмір завантаження лише як нижню межу. Ваги мають зберігатися в пам’яті: у пам’яті GPU, якщо відеокарта може їх умістити, або в системній RAM в іншому разі. Додатково використовується KV cache (кеш ключів і значень, тобто пам’ять моделі для контексту розмови на рівні окремих токенів). Фактичне значення для вашого обладнання визначається командою, а не арифметичними розрахунками; команду наведено нижче. Якщо ви ще не вибрали рівень квантування, у матеріалі що саме ви втрачаєте на рівнях Q4, Q8 і FP16 пояснено компроміси кожного варіанта.
Тягніть точний tag, а не latest
latest — це змінний покажчик. Коли бібліотека повторно публікує його, поведінка вашого агента змінюється під час наступного pull, і у ваших нотатках немає пояснення причини. Вказуйте tag явно.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MСкрипт встановлення налаштовує systemd service, який працює від імені користувача ollama і зберігає моделі в /usr/share/ollama/.ollama/models. У більшості образів VPS цей шлях розташований у root filesystem, тому перевірте вільне місце, перш ніж запитувати 25 GB. Якщо у цій файловій системі мало місця, перед pull перегляньте де Ollama зберігає моделі та як їх перемістити, а не після того, як диск буде заповнено.
df -h /usr/share/ollamaЯкщо pull зупиняється на середині та повідомляє no space left on device, це саме означає частково завантажені дані. Часткові blobs залишаються на диску, доки ви їх не видалите. Потім перевірте, що саме було завантажено:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show виводить архітектуру, кількість параметрів, довжину контексту та квантизацію, яку фактично містить файл. Якщо будь-яке з цих значень не збігається зі сторінкою бібліотеки, ви завантажили не той tag, який планували.
Запустіть його та перевірте, де саме він працює
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Поки модель ще завантажена, відкрийте другу оболонку:
ollama psЦя команда показує, скільки пам’яті потрібно саме вашій системі. ollama ps виводить завантажену модель, обсяг пам’яті, який вона займає, і стовпчик PROCESSOR. Значення 100% GPU означає, що модель повністю розміщена у VRAM. Значення 100% CPU означає, що модель повністю розміщена поза VRAM, а всі токени обчислює процесор, використовуючи системну RAM. Значення 65%/35% CPU/GPU означає, що всі шари не помістилися, і частка обчислень на CPU визначає швидкість роботи. Не оцінюйте вимоги приблизно. Завантажте модель і прочитайте цей рядок.
Якщо модель взагалі не вдається завантажити, Ollama коректно відмовляється від запуску, а не аварійно завершує роботу:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Чи достатньо швидкий VPS лише з CPU?
Звичайний VPS не має GPU, тому всю роботу виконує CPU, який зчитує всі потрібні ваги із системної RAM. MoE допомагає в цьому випадку, оскільки для кожного токена задіюється лише близько 3 мільярдів із 30 мільярдів параметрів. Тому обсяг обчислень для одного токена значно менший, ніж у щільної моделі 30B. Пам’ять це не економить. Усі 30 мільярдів параметрів мають залишатися в RAM, оскільки router може вибрати будь-який expert для будь-якого токена.
Отже, інференс цієї моделі лише на CPU обмежується пропускною здатністю пам’яті, а не кількістю ядер. Додавання vCPU до тарифу, у якому їх уже достатньо, майже нічого не змінює. Потрібно достатньо RAM для зберігання ваг і вашого KV cache, а також найшвидша пам’ять, яку пропонує тариф.
Виміряйте швидкість до того, як доручати цьому агенту роботу, використовуючи метод із розділу як виміряти кількість токенів за секунду для локальної LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Рядок eval rate, надрукований наприкінці, показує швидкість генерації в токенах за секунду. Саме це число визначає відповідь, оскільки час роботи агента значною мірою залежить від нього. Помножте його на очікувану довжину відповіді. Якщо результат перевищує час очікування, який для вас прийнятний, обмеження виводу за допомогою num_predict — це спосіб обмежити тривалість одного виклику без зміни апаратного забезпечення.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Це опубліковані сторонні показники, перераховані з хвилин на завдання, які Artificial Analysis навела під час запуску. Їх вимірювали на hosted GPU endpoints, а не на VPS. Середній показник Nemotron 3.5 Lightning становив приблизно 30 секунд на завдання. При цьому gpt-oss-120b займав приблизно 204, а Qwen3.6 35B — приблизно 210. Використовуйте ці дані, щоб оцінити масштаб різниці, а не як гарантію для вашого обладнання.
Коректна рекомендація залежить від того, хто очікує на результат. Якщо результату очікує людина або агент послідовно виконує довгі ланцюжки викликів, орендуйте GPU capacity. Якщо агент працює за розкладом уночі й ніхто за ним не стежить, VPS із великим обсягом RAM — цілком практичний варіант. У будь-якому разі налаштування однакове. Розділ запуск Ollama на VPS описує вибір тарифу та порівняння GPU instance з оплатою API provider за токени. Точка беззбитковості залежить від рівня використання: GPU instance оплачується за кожну годину роботи, тоді як API tokens оплачуються лише під час використання. Тому для агента, який працює більшу частину дня, вигіднішим буде власний сервер, а для агента, який запускається двічі на годину, — зазвичай ні.
Вікно контексту на 1M не є безкоштовним
1M токенів — це максимальний розмір контексту моделі, але Ollama не надає його за замовчуванням. Ollama використовує значно менше вікно за замовчуванням і видаляє найстаріші токени, коли розмір контексту перевищує це значення. У журналі це не фіксується, тому для агента це виглядає так, ніби модель забула початок власного завдання.
Встановіть розмір вікна явно. Щоб застосувати його до всього сервера, відредагуйте сервіс:
sudo systemctl edit ollamaДодайте цей параметр, а потім виконайте sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Щоб задати значення для окремого запиту, натомість передайте num_ctx в об’єкті параметрів:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Кожне збільшення потребує більше пам’яті, оскільки KV-кеш зростає разом із кількістю дозволених токенів. Збільште значення, перезапустіть сервіс, потім знову виконайте ollama ps і стежте, як зростає повідомлений розмір. Якщо після цієї зміни стовпець PROCESSOR зміниться з 100% GPU на split, KV-кеш витіснив шари моделі з VRAM, і швидкість роботи різко знизиться. У матеріалі Вибір num_ctx в Ollama цей компроміс розглянуто докладно. Не встановлюйте 1000000 лише тому, що картка моделі допускає це значення: пам’ять виділяється наперед, і завантаження просто завершиться помилкою.
Підключення до агента, який постійно працює
У дописі Ollama про запуск цієї моделі описано скорочену команду, яка запускає сумісного агента, уже налаштованого на роботу з нею:
ollama launch claude --model nemotron-3.5-lightningУ дописі в цій позиції описано claude, opencode, openclaw і hermes. Для цієї підкоманди потрібна актуальна версія Ollama, тому спочатку перевірте ollama --version. Якщо її немає, самостійно вкажіть агенту адресу API. Ollama надає endpoint, сумісний з OpenAI, який підтримує більшість агентських harness:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama ігнорує ключ, але більшість клієнтів не запускаються без заданого ключа. Налаштування harness описано в розділах підключення coding agent до Ollama і створення власного агента OpenClaw.
Після переходу агента в автономний режим важливі два параметри сервера. OLLAMA_KEEP_ALIVE визначає, як довго модель зберігається в пам’яті після останнього запиту. За замовчуванням вона вивантажується через п’ять хвилин, тому наступний виклик знову потребує повного часу завантаження. Для файлу розміром 25 GB без GPU ця пауза може бути достатньою, щоб перевищити timeout. Установіть OLLAMA_KEEP_ALIVE=-1, щоб модель залишалася в пам’яті. OLLAMA_HOST=0.0.0.0:11434 робить API доступним з інших машин. Автентифікація при цьому відсутня, тому відкривайте endpoint лише за правилом firewall або в приватній мережі.
Режими відмови та повідомлення, які ви побачите
Pull завершується негайно. Error: pull model manifest: file does not exist означає, що такого tag не існує. Назви tag є точними рядками, тому скопіюйте потрібну назву зі сторінки library, а не вгадуйте суфікс quantisation.
Model не завантажується. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) означає, що цей tag завеликий для поточного плану. Виберіть менший рівень quantisation або зменште OLLAMA_CONTEXT_LENGTH, оскільки KV cache враховується в цій вимозі.
На port 11434 ніхто не відповідає. curl: (7) Failed to connect to localhost port 11434 означає, що сервіс не запущений або слухає не там, де очікується. Перегляньте systemctl status ollama і journalctl -u ollama -n 50. Якщо ви також запустили ollama serve вручну, другий процес завершиться з Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Відповідь надходить дуже повільно. Перед будь-якими змінами перевірте ollama ps. Будь-яке значення CPU у стовпці PROCESSOR на машині з GPU означає, що частина model не помістилася у VRAM. Зменште context або виберіть менший рівень quantisation. На машині без GPU повільна робота є очікуваним результатом, і жодне налаштування це не виправить.
Agent забуває свої інструкції посеред виконання завдання. Розмова перевищила context window, тому найстаріші tokens було непомітно відкинуто. Збільште OLLAMA_CONTEXT_LENGTH, перевірте за допомогою ollama ps, що model і далі поміщається в пам’ять. Якщо він більше не поміщається, потрібна потужніша машина, а не менше вікно.
Де ця модель розташована серед альтернатив
Розміщувати 30B MoE заради невеликого завдання недоцільно. Якщо щільна модель 8B уже виконує ваше завдання, її запуск коштуватиме значно дешевше, а завантаження триватиме лічені секунди. Для прямого порівняння див. Qwen 3 на 8B і 27B на VPS. Щоб ширше оцінити, які моделі фактично може запустити певний тарифний план, почніть із матеріалу які AI-моделі можна розмістити на власній інфраструктурі. Якщо ви плануєте одночасно обслуговувати кілька агентів, а не одного, спочатку прочитайте Ollama порівняно з vLLM, оскільки Ollama не обробляє паралельні запити пакетами так, як це робить production-сервер інференсу. Саме на цьому одно користувацьке розгортання перестає масштабуватися.
FAQ
Який тег Nemotron 3.5 Lightning слід завантажити на Linux VPS?
Використовуйте nemotron-3.5-lightning:30b-a3b-q4_K_M. Він має розмір 25 GB, підтримує повне максимальне контекстне вікно 1M і станом на August 2026 має той самий digest, на який вказують теги latest, 30b і 30b-a3b. Вказуйте його явно замість завантаження latest, щоб майбутня повторна публікація цього покажчика непомітно не змінила поведінку вашого агента. Теги mlx призначені для Apple silicon і не допоможуть у Linux.
Скільки RAM потребує Nemotron 3.5 Lightning?
NVIDIA не публікує мінімальний обсяг пам’яті для збірок Ollama, тому вимірюйте, а не оцінюйте. Завантажте тег, один раз запустіть модель і прочитайте ollama ps, поки модель завантажена: цей показник виводить фактично зайнятий обсяг і показує, чи використовуються GPU або CPU. Розмір завантаження для стандартного тегу становить 25 GB. Це мінімальне значення, оскільки додатково виділяється KV cache, розмір якого зростає разом із заданим контекстним вікном. Якщо план має недостатній обсяг, Ollama відмовляється запускати модель із повідомленням model requires more system memory і вказує обидва значення.
Чи можна запускати Nemotron 3.5 Lightning на VPS без GPU?
Так, якщо план має достатньо RAM для зберігання ваг. Архітектура MoE також допомагає, оскільки для кожного токена обчислюється лише близько 3 із 30 billion параметрів. Обмеженням є швидкість. Без GPU модель обмежена пропускною здатністю пам’яті, тому збільшення кількості vCPU майже не впливає на результат. Запустіть ollama run --verbose із фіксованим prompt, прочитайте рядок eval rate і порівняйте це значення з допустимим часом очікування вашого агента. Для batch job, що виконується вночі, цього часто достатньо. Для завдань, на результат яких очікує користувач, зазвичай — ні.
Чому Ollama не надає повне контекстне вікно 1M?
1M — це максимальне значення моделі, а не стандартне значення Ollama. Ollama використовує значно менше вікно та відкидає найстаріші токени, коли розмір розмови його перевищує. При цьому помилка не виводиться, тому здається, що агент забуває власні інструкції. Встановіть OLLAMA_CONTEXT_LENGTH у systemd service або передавайте num_ctx для кожного запиту. Збільшуйте значення поступово й щоразу повторно перевіряйте ollama ps, оскільки обсяг пам’яті KV cache масштабується разом із розміром вікна та може перемістити шари моделі з GPU.
Чи можна безкоштовно використовувати Nemotron 3.5 Lightning у комерційних цілях?
У model card NVIDIA зазначено, що модель поширюється за ліцензією OpenMDW-1.1 і дозволена для комерційного використання. Це стосується завантажених вами ваг, які ви запускаєте самостійно. Ліцензії іншого програмного забезпечення у вашому стеку не охоплюються. Тому окремо перевірте ліцензії agent harness і всіх інструментів, які ви до нього підключаєте. Перед використанням моделі у договірних або інших юридично значущих сценаріях ознайомтеся з актуальною model card.