Jak uruchomić Nemotron 3.5 Lightning na serwerze VPS
Instrukcja uruchomienia modelu NVIDIA Nemotron 3.5 Lightning przez Ollama. Sprawdź wymagania RAM, odpowiedni tag do pobrania oraz wydajność przy pracy na samym procesorze CPU.
Zastosowanie Nemotron 3.5 Lightning
Nemotron 3.5 Lightning to otwarty model typu mixture-of-experts o rozmiarze 30B firmy NVIDIA, wydany w sierpniu 2026 roku. Został zaprojektowany z myślą o agentach działających przez wiele godzin, a nie tylko w ramach pojedynczego okna czatu. Architektura MoE (mixture-of-experts) oznacza, że wagi są podzielone na wiele podsieci eksperckich, a każdy token jest kierowany tylko przez kilka z nich. Karta modelu NVIDIA wskazuje na 30 miliardów parametrów całkowitych, z czego 3 miliardy są aktywne dla każdego tokena. Koszt pamięci wynika z dużej liczby parametrów, natomiast zysk w postaci szybkości wynika z małej liczby parametrów aktywnych.
Ten kompromis jest powodem, dla którego warto rozważyć ten model na wynajmowanym serwerze. Agent wykonujący rzeczywistą pracę wysyła tysiące krótkich zapytań w ciągu dnia, więc przepustowość w przeliczeniu na dolara decyduje o tym, czy może on działać na własnej maszynie. Model, który generuje odpowiedź w 40 sekund, jest użytecznym asystentem, ale słabym agentem, ponieważ jedno zadanie wymaga dwudziestu wywołań, a użytkownik czeka na każde z nich.
NVIDIA opisuje architekturę jako hybrydową: przeplatające się warstwy Mamba-2 i MoE z wybranymi warstwami uwagi (attention layers). Karta modelu określa maksymalną długość kontekstu na 1M tokenów oraz licencję OpenMDW-1.1, oznaczoną jako gotową do użytku komercyjnego. Głównymi językami są angielski i kod programistyczny, wymieniono również hiszpański, francuski, niemiecki, włoski oraz japoński.
Firma Artificial Analysis opublikowała w sierpniu 2026 roku pomiary z premiery, wykazujące blisko 670 tokenów wyjściowych na sekundę w przedpremierowym punkcie końcowym DeepInfra obsługującym wagi NVFP4. Jest to hostowany punkt końcowy GPU. Należy to traktować jako możliwości architektury, a nie jako wydajność, którą osiągnie własny VPS.
Który tag Ollama wybrać dla danego VPS
Biblioteka Ollama udostępnia kilka kompilacji tych samych wag modelu. Różnią się one kwantyzacją, czyli liczbą bitów użytych do zapisu każdej wagi, co znacząco wpływa na rozmiar pobieranego pliku.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Tagi o nazwach latest, 30b oraz 30b-a3b wskazują na ten sam skrót (digest) co 30b-a3b-q4_K_M, zatem domyślnym pobraniem jest 25 GB w wersji czterobitowej z pełnym kontekstem 1M. Wersja Q8_0 zajmuje 35 GB, a wersja bf16 66 GB – obie również z kontekstem 1M. Kompilacje MLX o rozmiarze 23 GB są przeznaczone dla architektury Apple silicon i mają ograniczony kontekst do 256K, dlatego nie są właściwym wyborem dla VPS z systemem Linux.
Podane wartości dotyczą rozmiaru pobieranych plików, a nie wymagań pamięciowych. NVIDIA nie publikuje minimalnych wymagań VRAM (pamięci wideo) dla kompilacji Ollama, więc rozmiar pliku należy traktować jedynie jako wartość minimalną. Wagi muszą być przechowywane w pamięci – w pamięci GPU, jeśli karta je mieści, lub w pamięci RAM systemu w przeciwnym razie. Do tego dochodzi KV cache (pamięć podręczna kluczy/wartości, czyli pamięć modelu dla każdego tokena konwersacji). Rzeczywiste zapotrzebowanie dla danego sprzętu wynika z polecenia, a nie z obliczeń arytmetycznych; szczegóły znajdują się poniżej. Jeśli wybór poziomu kwantyzacji nie został jeszcze dokonany, koszt zasobów dla Q4, Q8 i FP16 wyjaśnia, z czego rezygnuje się na każdym z tych etapów.
Pobieraj konkretny tag, nigdy latest
latest to ruchomy wskaźnik. Gdy biblioteka opublikuje nową wersję, zachowanie agenta zmieni się przy następnym pobraniu, a w notatkach nie będzie wyjaśnienia przyczyny. Należy używać nazwanych tagów.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MSkrypt instalacyjny konfiguruje usługę systemd, która działa jako użytkownik ollama i przechowuje modele w /usr/share/ollama/.ollama/models. Ścieżka ta znajduje się w systemie plików root na większości obrazów VPS, dlatego przed zarezerwowaniem 25 GB należy sprawdzić dostępne miejsce.
df -h /usr/share/ollamaPobieranie, które zatrzymuje się w trakcie i zgłasza no space left on device, oznacza dokładnie ten błąd, a częściowe obiekty (blobs) pozostają na dysku do momentu ich usunięcia. Następnie należy zweryfikować, co zostało pobrane:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show wyświetla architekturę, liczbę parametrów, długość kontekstu oraz kwantyzację, którą faktycznie zawiera plik. Jeśli którykolwiek z tych parametrów nie zgadza się z informacjami na stronie biblioteki, pobrano inny tag niż zamierzano.
Uruchomienie i weryfikacja miejsca wykonania
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Gdy model jest załadowany, w drugim terminalu wykonaj:
ollama psTo polecenie odpowiada na pytanie o wykorzystanie pamięci na danej maszynie. ollama ps wyświetla załadowany model, zajmowany przez niego rozmiar oraz kolumnę PROCESSOR. Wartość 100% GPU oznacza, że cały model znajduje się w VRAM. Wartość 100% CPU oznacza, że model nie znajduje się w VRAM, a każdy token jest obliczany przez procesor z pamięci RAM systemu. Podział, taki jak 65%/35% CPU/GPU, oznacza, że nie wszystkie warstwy zmieściły się w pamięci karty, a udział CPU determinuje szybkość działania. Nie należy szacować zapotrzebowania. Należy załadować model i odczytać tę linię.
Jeśli załadowanie nie jest możliwe, Ollama zgłasza błąd w sposób kontrolowany, zamiast ulec awarii:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Czy VPS oparty wyłącznie na CPU jest wystarczająco szybki?
Standardowy VPS nie posiada GPU, więc procesor wykonuje wszystkie obliczenia i odczytuje każdą wagę z pamięci RAM. Architektura MoE jest tutaj korzystna, ponieważ dla każdego tokena przetwarzane są tylko około 3 miliardy z 30 miliardów parametrów, co znacznie zmniejsza liczbę operacji arytmetycznych w porównaniu z gęstym modelem 30B. Nie wpływa to jednak na zapotrzebowanie na pamięć. Wszystkie 30 miliardów parametrów musi znajdować się w pamięci operacyjnej, ponieważ router może wybrać dowolnego eksperta dla dowolnego tokena.
Wydajność wnioskowania (inference) na samym CPU w tym modelu jest ograniczona przepustowością pamięci, a nie liczbą rdzeni. Dodawanie kolejnych vCPU do planu, który posiada już ich odpowiednią liczbę, niewiele zmienia. Kluczowe jest posiadanie wystarczającej ilości pamięci RAM do przechowywania wag oraz cache KV, a także wybór planu oferującego najszybszą dostępną pamięć.
Przed uruchomieniem agenta należy przeprowadzić pomiary, korzystając z metody opisanej w mierzenie liczby tokenów na sekundę dla lokalnego LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Wartość eval rate wyświetlona na końcu oznacza prędkość generowania w tokenach na sekundę. Ta pojedyncza liczba rozstrzyga kwestię wydajności, ponieważ to ona w głównej mierze determinuje czas rzeczywisty pracy agenta.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Powyższe dane pochodzą od zewnętrznych dostawców i zostały przeliczone z minut na zadanie, raportowanych przez Artificial Analysis w momencie premiery. Pomiary te wykonano na hostowanych punktach końcowych GPU, a nie na VPS. Model Nemotron 3.5 Lightning osiągał średnio 30 sekundy na zadanie, gdzie gpt-oss-120b zajmowało około 204, a Qwen3.6 35B około 210. Należy traktować te liczby jako wskazówkę dotyczącą proporcji, a nie jako gwarancję wydajności własnego sprzętu.
Rzetelna porada zależy od tego, kto oczekuje na wynik. Jeśli na agenta czeka człowiek lub jeśli agent wykonuje długie łańcuchy wywołań, należy wynająć instancję z GPU. Jeśli zadania są uruchamiane według harmonogramu w nocy i nikt ich nie nadzoruje, plan VPS z dużą ilością pamięci RAM jest rozsądnym rozwiązaniem. Konfiguracja w obu przypadkach jest taka sama, a artykuł uruchamianie Ollama na VPS zawiera informacje o doborze planu oraz porównanie instancji GPU z płatnościami za tokeny u dostawcy API. Opłacalność zależy od stopnia wykorzystania: instancja GPU generuje koszty za każdą godzinę działania, podczas gdy API rozlicza się tylko za zużyte tokeny. Agent pracujący przez większość dnia faworyzuje własny serwer, natomiast agent uruchamiany sporadycznie zazwyczaj nie.
Okno kontekstowe 1M nie jest darmowe
1M tokenów to maksymalna wartość dla modelu, której Ollama nie udostępnia domyślnie. Ollama obsługuje znacznie mniejsze domyślne okno i usuwa najstarsze tokeny, gdy konwersacja przekroczy ten limit. W takiej sytuacji nie są generowane żadne logi, więc dla agenta wygląda to tak, jakby model zapominał początek własnego zadania.
Ustaw okno celowo. Dla całego serwera edytuj usługę:
sudo systemctl edit ollamaDodaj poniższy wpis, a następnie wykonaj sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"W przypadku pojedynczego żądania wyślij num_ctx w obiekcie options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Każde zwiększenie kosztuje pamięć, ponieważ pamięć podręczna KV rośnie wraz z liczbą dozwolonych tokenów. Zwiększ wartość, zrestartuj usługę, a następnie ponownie uruchom ollama ps i obserwuj wzrost raportowanego rozmiaru. Jeśli kolumna PROCESSOR zmieni się z 100% GPU na split po tej zmianie, pamięć podręczna KV wypchnęła warstwy modelu z VRAM, co spowoduje drastyczny spadek wydajności. Wybór num_ctx w Ollama szczegółowo omawia ten kompromis. Nie ustawiaj wartości 1000000 tylko dlatego, że karta modelu na to pozwala, ponieważ alokacja następuje z góry i ładowanie po prostu zakończy się niepowodzeniem.
Podłączanie do agenta działającego w trybie ciągłym
Wpis wprowadzający ten model w Ollama dokumentuje skrót, który uruchamia wspieranego agenta, automatycznie wskazując go na dany model:
ollama launch claude --model nemotron-3.5-lightningWpis dokumentuje claude, opencode, openclaw oraz hermes w tej pozycji. Podpolecenie wymaga aktualnej wersji Ollama, więc najpierw sprawdź ollama --version, a jeśli go brakuje, samodzielnie wskaż agentowi adres API. Ollama udostępnia punkt końcowy zgodny z OpenAI, który akceptuje większość środowisk uruchomieniowych dla agentów:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama ignoruje klucz, jednak większość klientów odmawia uruchomienia bez ustawionej wartości. Obsługa tego aspektu po stronie środowiska została opisana w wskazywaniu agenta programistycznego na Ollama oraz w budowaniu własnego agenta OpenClaw.
Gdy agent działa bez nadzoru, istotne stają się dwa ustawienia serwera. OLLAMA_KEEP_ALIVE kontroluje czas utrzymywania modelu w pamięci po ostatnim żądaniu; domyślna konfiguracja zwalnia go po pięciu minutach, co sprawia, że kolejne wywołanie wiąże się z pełnym czasem ładowania. W przypadku pliku o rozmiarze 25 GB bez wsparcia GPU, ta przerwa jest wystarczająco długa, aby spowodować przekroczenie limitu czasu (timeout). Ustaw OLLAMA_KEEP_ALIVE=-1, aby utrzymać model w pamięci operacyjnej. OLLAMA_HOST=0.0.0.0:11434 sprawia, że API staje się dostępne z innych maszyn; funkcja ta nie posiada żadnego mechanizmu uwierzytelniania, dlatego należy ją udostępniać wyłącznie za regułą firewalla lub wewnątrz sieci prywatnej.
Tryby awarii i towarzyszące im komunikaty
Pobieranie kończy się natychmiastowym błędem. Error: pull model manifest: file does not exist oznacza, że dany tag nie istnieje. Nazwy tagów są dokładnymi ciągami znaków, dlatego należy skopiować je bezpośrednio ze strony biblioteki, zamiast zgadywać sufiks kwantyzacji.
Model nie ładuje się. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) oznacza, że tag jest zbyt duży dla bieżącej konfiguracji planu. Należy przejść na mniejszą kwantyzację lub obniżyć OLLAMA_CONTEXT_LENGTH, ponieważ pamięć podręczna KV jest wliczana do tego wymagania.
Brak odpowiedzi na porcie 11434. curl: (7) Failed to connect to localhost port 11434 oznacza, że usługa nie działa lub nie nasłuchuje na oczekiwanym porcie. Należy zapoznać się z systemctl status ollama oraz journalctl -u ollama -n 50. Jeśli dodatkowo uruchomiono ollama serve ręcznie, druga instancja zakończy działanie z błędem Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Odpowiedzi są generowane bardzo wolno. Przed zmianą jakichkolwiek ustawień należy sprawdzić ollama ps. Jakikolwiek udział procesora CPU w kolumnie PROCESSOR na maszynie z GPU oznacza, że część modelu została przeniesiona poza pamięć VRAM. Należy wówczas zmniejszyć kontekst lub wybrać mniejszą kwantyzację. Na maszynie bez GPU wolne działanie jest stanem oczekiwanym i żadne ustawienie go nie naprawi.
Agent zapomina instrukcje w trakcie wykonywania zadania. Konwersacja przekroczyła okno kontekstowe i najstarsze tokeny zostały automatycznie odrzucone. Należy zwiększyć OLLAMA_CONTEXT_LENGTH i potwierdzić za pomocą ollama ps, czy model nadal mieści się w pamięci. Jeśli model przestał się mieścić, rozwiązaniem jest użycie mocniejszej maszyny, a nie zmniejszanie okna kontekstowego.
Pozycjonowanie tego modelu względem alternatyw
Model 30B MoE jest zbyt dużym rozwiązaniem do prostych zadań. Jeśli gęsty model 8B radzi sobie z danym zadaniem, jego uruchomienie będzie znacznie tańsze, a wczytywanie zajmie sekundy. Bezpośrednim porównaniem przy podejmowaniu tej decyzji jest Qwen 3 w wersjach 8B i 27B na VPS. Aby uzyskać szerszy przegląd możliwości sprzętowych, warto zacząć od jakie modele AI można hostować samodzielnie. Jeśli planowana jest obsługa kilku agentów jednocześnie, a nie jednego, należy najpierw przeczytać Ollama w porównaniu z vLLM. Ollama nie przetwarza żądań współbieżnych w trybie wsadowym (batching) tak, jak robią to produkcyjne serwery inferencyjne, co stanowi granicę skalowalności konfiguracji dla pojedynczego użytkownika.
FAQ
Który tag Nemotron 3.5 Lightning należy pobrać na VPS z systemem Linux?
Należy użyć nemotron-3.5-lightning:30b-a3b-q4_K_M. Ma on rozmiar 25 GB, obsługuje pełny kontekst 1M i posiada ten sam skrót (digest), co tagi latest, 30b oraz 30b-a3b według stanu na sierpień 2026. Należy wskazać go bezpośrednio zamiast pobierać latest, aby przyszła aktualizacja tego wskaźnika nie zmieniła zachowania agenta bez wiedzy użytkownika. Tagi mlx to kompilacje dla architektury Apple silicon, które nie zadziałają w systemie Linux.
Ile pamięci RAM wymaga Nemotron 3.5 Lightning?
NVIDIA nie publikuje minimalnych wymagań pamięciowych dla kompilacji Ollama, dlatego należy przeprowadzić pomiar zamiast szacować. Należy pobrać tag, uruchomić model raz i odczytać ollama ps podczas jego załadowania: wyświetla on rozmiar faktycznie zajętej pamięci oraz informację, czy model został załadowany do GPU czy CPU. Rozmiar pobierania, 25 GB dla domyślnego tagu, stanowi wartość minimalną, ponieważ pamięć podręczna KV jest dodawana powyżej i rośnie wraz z ustawionym oknem kontekstowym. Jeśli plan jest zbyt mały, Ollama odrzuci żądanie z błędem model requires more system memory, podając obie wartości.
Czy można uruchomić Nemotron 3.5 Lightning na VPS bez GPU?
Tak, jeśli plan posiada wystarczającą ilość pamięci RAM, aby pomieścić wagi modelu. Architektura MoE jest pomocna, ponieważ dla każdego tokena obliczane jest tylko około 3 z 30 miliardów parametrów. Problemem jest szybkość. Bez GPU model jest ograniczony przepustowością pamięci, więc dodanie vCPU niemal nie wpływa na wynik. Należy uruchomić ollama run --verbose ze stałym promptem, odczytać linię eval rate i ocenić tę wartość pod kątem wymagań czasowych agenta. W przypadku zadań wsadowych wykonywanych w nocy jest to zazwyczaj akceptowalne. W przypadku interakcji wymagających oczekiwania przez użytkownika, zazwyczaj nie jest.
Dlaczego Ollama nie udostępnia pełnego okna kontekstowego 1M?
1M to wartość maksymalna modelu, a nie domyślna wartość Ollama. Ollama stosuje znacznie mniejsze okno i odrzuca najstarsze tokeny, gdy konwersacja je przekroczy, nie wyświetlając przy tym błędu, co objawia się "zapominaniem" instrukcji przez agenta. Należy ustawić OLLAMA_CONTEXT_LENGTH w usłudze systemd lub przekazać num_ctx w każdym żądaniu. Warto zwiększać tę wartość stopniowo i za każdym razem sprawdzać ollama ps, ponieważ pamięć podręczna KV skaluje się wraz z oknem i może spowodować usunięcie warstw modelu z pamięci GPU.
Czy Nemotron 3.5 Lightning można wykorzystywać komercyjnie?
Karta modelu NVIDIA klasyfikuje go na licencji OpenMDW-1.1 i oznacza jako gotowy do użytku komercyjnego. Dotyczy to wag pobieranych i uruchamianych samodzielnie. Nie odnosi się to do pozostałego oprogramowania w stosie technologicznym, dlatego należy oddzielnie sprawdzić licencje agenta oraz wszelkich narzędzi z nim połączonych, a także zapoznać się z aktualną kartą modelu przed podjęciem jakichkolwiek zobowiązań kontraktowych.