Jak uruchomić Nemotron 3.5 Lightning przez Ollama na VPS
Instrukcja uruchomienia modelu NVIDIA Nemotron 3.5 Lightning na serwerze VPS. Sprawdź wymagania RAM, komendę pull dla Ollama oraz wydajność przy pracy na samym procesorze CPU.
Do czego służy Nemotron 3.5 Lightning
Nemotron 3.5 Lightning to otwarty model typu mixture-of-experts o rozmiarze 30B firmy NVIDIA, wydany w sierpniu 2026 roku. Został zaprojektowany z myślą o agentach działających przez wiele godzin, a nie tylko w ramach pojedynczego okna czatu. Architektura MoE (mixture-of-experts) oznacza, że wagi są podzielone na wiele podsieci eksperckich, a każdy token jest kierowany tylko przez kilka z nich. Karta modelu NVIDIA wskazuje na 30 miliardów parametrów całkowitych, z czego 3 miliardy są aktywne dla każdego tokena. Koszt pamięci wynika z dużej liczby parametrów, natomiast zysk w postaci szybkości wynika z małej liczby parametrów aktywnych.
Ten kompromis jest powodem, dla którego warto rozważyć ten model na wynajmowanym serwerze. Agent wykonujący rzeczywistą pracę wysyła tysiące krótkich żądań w ciągu dnia, więc przepustowość w przeliczeniu na dolara decyduje o tym, czy rozwiązanie może działać na własnej infrastrukturze. Model, który generuje odpowiedź w 40 sekund, jest użytecznym asystentem, ale słabym agentem, ponieważ jedno zadanie wymaga dwudziestu wywołań, a użytkownik czeka na każde z nich.
NVIDIA opisuje architekturę jako hybrydową: przeplatające się warstwy Mamba-2 i MoE z wybranymi warstwami atencji. Karta modelu określa maksymalną długość kontekstu na 1M tokenów oraz licencję OpenMDW-1.1, co oznacza gotowość do zastosowań komercyjnych. Głównymi językami są angielski i kod programistyczny, a lista obejmuje również hiszpański, francuski, niemiecki, włoski i japoński.
Firma Artificial Analysis opublikowała w sierpniu 2026 roku pomiary startowe, wykazujące blisko 670 tokenów wyjściowych na sekundę w przedpremierowym punkcie końcowym DeepInfra, obsługującym wagi NVFP4. Jest to hostowany punkt końcowy GPU. Należy to traktować jako możliwości architektury, a nie jako wydajność osiągalną na własnym VPS.
Który tag Ollama wybrać dla VPS
Biblioteka Ollama udostępnia kilka kompilacji tych samych wag. Różnią się one kwantyzacją, czyli liczbą bitów użytych do zapisu każdej wagi, co znacząco wpływa na rozmiar pobieranego pliku.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Tagi o nazwach latest, 30b oraz 30b-a3b wskazują na ten sam skrót (digest), co 30b-a3b-q4_K_M, dlatego domyślnym pobraniem jest 4-bitowa kompilacja 25 GB z pełnym kontekstem 1M. Wersja Q8_0 zajmuje 35 GB, a wersja bf16 66 GB; obie również obsługują kontekst 1M. Kompilacje MLX o rozmiarze 23 GB są przeznaczone dla układów Apple silicon i mają ograniczony kontekst do 256K, dlatego nie są odpowiednim wyborem dla VPS z systemem Linux.
Podane wartości dotyczą rozmiaru pobieranych plików, a nie wymagań dotyczących pamięci. NVIDIA nie publikuje minimalnych wymagań VRAM (pamięci wideo) dla kompilacji Ollama, więc rozmiar pliku należy traktować jedynie jako wartość bazową. Wagi muszą być przechowywane w pamięci – w pamięci GPU, jeśli karta je mieści, lub w pamięci RAM systemu w przeciwnym razie. Do tego dochodzi pamięć KV cache (pamięć podręczna kluczy/wartości, przechowująca kontekst konwersacji dla każdego tokena). Rzeczywiste zapotrzebowanie na zasoby dla danego sprzętu można sprawdzić za pomocą poniższego polecenia, a nie poprzez obliczenia matematyczne. Jeśli poziom kwantyzacji nie został jeszcze wybrany, koszt kwantyzacji Q4, Q8 i FP16 wyjaśnia, z jakimi stratami wiąże się każdy z tych kroków.
Pobieraj konkretny tag, nigdy latest
latest to ruchomy wskaźnik. Gdy biblioteka opublikuje go ponownie, zachowanie agenta zmieni się przy kolejnym pobraniu, a w notatkach nie będzie wyjaśnienia przyczyny. Należy używać nazwanych tagów.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MSkrypt instalacyjny konfiguruje usługę systemd, która działa jako użytkownik ollama i przechowuje modele w /usr/share/ollama/.ollama/models. W większości obrazów VPS ścieżka ta znajduje się w głównym systemie plików, dlatego przed zarezerwowaniem 25 GB należy sprawdzić dostępne miejsce. Jeśli system plików jest zapełniony, warto zapoznać się z gdzie Ollama przechowuje modele i jak je przenieść przed rozpoczęciem pobierania, zamiast robić to po zapełnieniu dysku.
df -h /usr/share/ollamaPobieranie, które zatrzymuje się w połowie i zgłasza no space left on device, oznacza dokładnie ten stan, a częściowe pliki (bloby) pozostają na dysku do momentu ich usunięcia. Następnie należy potwierdzić, co zostało pobrane:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show wyświetla architekturę, liczbę parametrów, długość kontekstu oraz kwantyzację, którą faktycznie posiada plik. Jeśli którykolwiek z tych parametrów jest niezgodny z informacjami na stronie biblioteki, pobrano inny tag niż zamierzano.
Uruchomienie modelu i weryfikacja miejsca jego działania
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Gdy model jest załadowany, w drugim terminalu wykonaj:
ollama psTo polecenie odpowiada na pytanie o wykorzystanie pamięci na danej maszynie. ollama ps wyświetla załadowany model, zajmowany przez niego rozmiar oraz kolumnę PROCESSOR. Wartość 100% GPU oznacza, że cały model znajduje się w VRAM. Wartość 100% CPU oznacza, że model nie jest w niej obecny, a każdy token jest obliczany przez procesor z pamięci RAM systemu. Podział typu 65%/35% CPU/GPU oznacza, że nie wszystkie warstwy zmieściły się w pamięci karty, a udział procesora CPU determinuje prędkość działania. Nie należy szacować wymagań. Należy załadować model i odczytać ten wiersz.
Jeśli załadowanie modelu nie jest możliwe, Ollama zgłasza błąd w sposób kontrolowany, zamiast ulec awarii:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Czy VPS oparty wyłącznie na CPU jest wystarczająco szybki?
Standardowy VPS nie posiada GPU, więc procesor wykonuje całą pracę i odczytuje każdą wagę z pamięci RAM systemu. Technika MoE pomaga w tym przypadku, ponieważ dla każdego tokena przetwarzane są tylko około 3 miliardy z 30 miliardów parametrów, co sprawia, że liczba operacji arytmetycznych na token jest znacznie mniejsza niż w przypadku gęstego modelu 30B. Pamięć RAM nie zyskuje jednak na tym rozwiązaniu. Wszystkie 30 miliardów parametrów musi pozostać w pamięci, ponieważ router może wybrać dowolnego eksperta dla dowolnego tokena.
W związku z tym wnioskowanie na samym CPU w tym modelu jest ograniczone przepustowością pamięci, a nie liczbą rdzeni. Dodawanie kolejnych vCPU do planu, który posiada już ich rozsądną liczbę, niewiele zmienia. Kluczowe jest posiadanie wystarczającej ilości pamięci RAM, aby pomieścić wagi oraz cache KV, a także najszybszej pamięci dostępnej w ramach danego planu.
Należy dokonać pomiaru przed przypisaniem agenta, korzystając z metody opisanej w mierzenie liczby tokenów na sekundę dla lokalnego modelu LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Wartość eval rate wyświetlona na końcu to prędkość generowania wyrażona w tokenach na sekundę. Ta pojedyncza liczba rozstrzyga kwestię wydajności, ponieważ czas oczekiwania użytkownika (wall-clock time) zależy głównie od niej. Należy pomnożyć ją przez oczekiwaną długość odpowiedzi; jeśli wynik jest dłuższy niż czas, jaki użytkownik jest w stanie poświęcić na oczekiwanie, ograniczenie wyjścia za pomocą num_predict jest jedynym sposobem na ograniczenie pojedynczego wywołania bez zmiany sprzętu.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Powyższe dane pochodzą z publikacji zewnętrznych i zostały przeliczone z minut na zadanie, raportowanych przez Artificial Analysis w momencie premiery. Pomiary te wykonano na hostowanych punktach końcowych GPU, a nie na VPS. Model Nemotron 3.5 Lightning osiągał średnio 30 sekund na zadanie, gdzie gpt-oss-120b zajmowało około 204, a Qwen3.6 35B około 210. Należy traktować te dane jako poglądowe, a nie jako gwarancję wydajności własnego sprzętu.
Rzetelna porada zależy od tego, kto oczekuje na wynik. Jeśli na agenta czeka człowiek lub jeśli agent wykonuje długie łańcuchy wywołań jeden po drugim, należy wynająć zasoby GPU. Jeśli zadania uruchamiane są zgodnie z harmonogramem w nocy i nikt ich nie nadzoruje, plan CPU z dużą ilością pamięci RAM jest rozsądnym rozwiązaniem. W obu przypadkach konfiguracja jest taka sama, a uruchamianie Ollama na VPS zawiera informacje o doborze planu oraz porównanie instancji GPU z płatnością za tokeny u dostawcy API. Punkt opłacalności zależy od stopnia wykorzystania: instancja GPU jest rozliczana za każdą godzinę działania, podczas gdy tokeny API są rozliczane tylko w momencie użycia. Agent pracujący przez większość dnia faworyzuje własny serwer, natomiast agent uruchamiany dwa razy na godzinę zazwyczaj nie.
Okno kontekstowe 1M nie jest darmowe
1M tokenów to wartość maksymalna modelu, której Ollama nie udostępnia domyślnie. Ollama obsługuje znacznie mniejsze domyślne okno i usuwa najstarsze tokeny, gdy konwersacja przekroczy ten limit. Zdarzenie to nie jest logowane, więc z perspektywy agenta wygląda to tak, jakby model „zapominał” początek własnego zadania.
Ustaw okno celowo. Dla całego serwera edytuj usługę:
sudo systemctl edit ollamaDodaj poniższy wpis, a następnie wykonaj sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Dla pojedynczego żądania prześlij num_ctx w obiekcie options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Każde zwiększenie kosztuje pamięć, ponieważ cache KV rośnie wraz z liczbą dozwolonych tokenów. Zwiększ wartość, zrestartuj usługę, a następnie ponownie uruchom ollama ps i obserwuj wzrost raportowanego rozmiaru. Jeśli kolumna PROCESSOR zmieni się po tej zmianie z 100% GPU na split, oznacza to, że cache KV wypchnął warstwy modelu z VRAM, co spowoduje drastyczny spadek wydajności. Wybór num_ctx w Ollama szczegółowo omawia ten kompromis. Nie ustawiaj wartości 1000000 tylko dlatego, że karta modelu na to pozwala, ponieważ alokacja następuje z góry i przy braku zasobów ładowanie po prostu zakończy się niepowodzeniem.
Podłączanie do zawsze uruchomionego agenta
Wpis startowy Ollama dla tego modelu dokumentuje skrót, który uruchamia wspieranego agenta, wskazując go bezpośrednio na model:
ollama launch claude --model nemotron-3.5-lightningWpis dokumentuje claude, opencode, openclaw oraz hermes w tej pozycji. Podkomenda wymaga aktualnej wersji Ollama, więc najpierw sprawdź ollama --version, a jeśli jej brakuje, samodzielnie wskaż agentowi API. Ollama udostępnia punkt końcowy kompatybilny z OpenAI, który akceptuje większość środowisk uruchomieniowych agentów:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama ignoruje klucz, ale większość klientów odmawia uruchomienia bez ustawionej wartości. Strona środowiska uruchomieniowego została opisana w wskazywanie agenta programistycznego na Ollama oraz w budowanie własnego agenta OpenClaw.
Dwa ustawienia serwera mają znaczenie, gdy agent działa bez nadzoru. OLLAMA_KEEP_ALIVE kontroluje, jak długo model pozostaje w pamięci po ostatnim żądaniu; wartość domyślna zwalnia go po pięciu minutach, więc kolejne wywołanie ponownie obciąża system czasem ładowania. W przypadku pliku 25 GB bez GPU ta przerwa jest wystarczająco długa, aby spowodować przekroczenie limitu czasu. Ustaw OLLAMA_KEEP_ALIVE=-1, aby utrzymać model w pamięci operacyjnej. OLLAMA_HOST=0.0.0.0:11434 sprawia, że API jest dostępne z innych maszyn; nie posiada ono żadnego uwierzytelniania, więc należy je otwierać wyłącznie za regułą firewalla lub w sieci prywatnej.
Tryby awaryjne i odpowiadające im komunikaty
Pobieranie kończy się natychmiastowym błędem. Error: pull model manifest: file does not exist oznacza, że dany tag nie istnieje. Nazwy tagów są ciągami znaków, które muszą być zgodne co do znaku, dlatego należy skopiować je bezpośrednio ze strony biblioteki, zamiast zgadywać sufiks kwantyzacji.
Model nie ładuje się. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) oznacza, że tag jest zbyt duży dla bieżącej konfiguracji planu. Należy przejść na mniejszą kwantyzację lub obniżyć OLLAMA_CONTEXT_LENGTH, ponieważ pamięć podręczna KV jest wliczana do tego limitu.
Brak odpowiedzi na porcie 11434. curl: (7) Failed to connect to localhost port 11434 oznacza, że usługa nie działa lub nie nasłuchuje na oczekiwanym porcie. Należy zapoznać się z systemctl status ollama oraz journalctl -u ollama -n 50. Jeśli ollama serve zostało uruchomione ręcznie, druga instancja zakończy działanie z błędem Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Odpowiedzi są generowane bardzo wolno. Przed zmianą jakichkolwiek ustawień należy sprawdzić ollama ps. Jakikolwiek udział procesora CPU w kolumnie PROCESSOR na maszynie z GPU oznacza, że część modelu nie mieści się w pamięci VRAM. Należy wówczas zmniejszyć kontekst lub wybrać mniejszą kwantyzację. Na maszynie bez GPU wolne działanie jest stanem oczekiwanym i żadna zmiana ustawień tego nie naprawi.
Agent zapomina instrukcje w trakcie wykonywania zadania. Konwersacja przekroczyła okno kontekstowe, a najstarsze tokeny zostały automatycznie usunięte. Należy zwiększyć OLLAMA_CONTEXT_LENGTH i potwierdzić za pomocą ollama ps, czy model nadal mieści się w pamięci. Jeśli model przestał się mieścić, rozwiązaniem jest użycie mocniejszej maszyny, a nie zmniejszanie okna kontekstowego.
Pozycjonowanie tego modelu względem alternatyw
Model 30B MoE jest dużym rozwiązaniem w kontekście prostych zadań. Jeśli model gęsty 8B radzi sobie z danym zadaniem, jego uruchomienie będzie znacznie tańsze, a wczytywanie zajmie sekundy. Artykuł Qwen 3 w wersjach 8B i 27B na VPS stanowi bezpośrednie porównanie pomocne w podjęciu tej decyzji. Aby uzyskać szerszy przegląd możliwości sprzętowych, należy zacząć od jakie modele AI można hostować samodzielnie. Jeśli planowana jest obsługa kilku agentów jednocześnie, a nie jednego, w pierwszej kolejności należy przeczytać Ollama w porównaniu z vLLM. Ollama nie przetwarza żądań współbieżnych w sposób typowy dla produkcyjnych serwerów inferencyjnych, co stanowi punkt, w którym konfiguracja dla pojedynczego użytkownika przestaje być skalowalna.
FAQ
Który tag Nemotron 3.5 Lightning pobrać na VPS z systemem Linux?
Należy użyć nemotron-3.5-lightning:30b-a3b-q4_K_M. Obraz ma rozmiar 25 GB, obsługuje pełne okno kontekstowe 1M i posiada ten sam skrót (digest), co tagi latest, 30b oraz 30b-a3b według stanu na sierpień 2026. Należy wskazać go jawnie zamiast pobierać latest, aby przyszła aktualizacja tego wskaźnika nie zmieniła zachowania agenta bez wiedzy administratora. Tagi mlx to kompilacje dla architektury Apple silicon, które nie zadziałają w systemie Linux.
Ile pamięci RAM wymaga Nemotron 3.5 Lightning?
NVIDIA nie publikuje minimalnych wymagań pamięciowych dla kompilacji Ollama, dlatego należy przeprowadzić pomiar zamiast szacować. Należy pobrać tag, uruchomić model raz i odczytać ollama ps podczas jego załadowania: polecenie to wyświetla faktycznie zajętą pamięć oraz informację, czy model został załadowany do GPU czy CPU. Rozmiar pobieranego pliku, 25 GB dla domyślnego tagu, stanowi wartość minimalną, ponieważ pamięć podręczna KV jest dodawana powyżej i rośnie wraz z ustawionym oknem kontekstowym. Jeśli plan jest zbyt mały, Ollama odrzuci żądanie z błędem model requires more system memory, podając obie wartości.
Czy można uruchomić Nemotron 3.5 Lightning na VPS bez GPU?
Tak, pod warunkiem, że plan posiada wystarczającą ilość pamięci RAM do załadowania wag. Architektura MoE pomaga, ponieważ dla każdego tokena obliczane jest tylko około 3 z 30 miliardów parametrów. Problemem jest szybkość. Bez GPU model jest ograniczony przepustowością pamięci, więc dodawanie vCPU niemal nie wpływa na wynik. Należy uruchomić ollama run --verbose ze stałym promptem, odczytać linię eval rate i porównać tę wartość z wymaganiami czasowymi agenta. W przypadku zadań wsadowych wykonywanych w nocy jest to zazwyczaj akceptowalne. W przypadku interakcji wymagających odpowiedzi w czasie rzeczywistym, zazwyczaj nie.
Dlaczego Ollama nie zapewnia pełnego okna kontekstowego 1M?
1M to wartość maksymalna modelu, a nie ustawienie domyślne Ollama. Ollama stosuje znacznie mniejsze okno i usuwa najstarsze tokeny, gdy konwersacja je przekroczy, nie wyświetlając przy tym żadnego błędu, co objawia się "zapominaniem" przez agenta własnych instrukcji. Należy ustawić OLLAMA_CONTEXT_LENGTH w usłudze systemd lub przekazać num_ctx w każdym żądaniu. Warto zwiększać tę wartość stopniowo i za każdym razem sprawdzać ollama ps, ponieważ pamięć podręczna KV skaluje się wraz z oknem i może spowodować wypchnięcie warstw modelu z pamięci GPU.
Czy Nemotron 3.5 Lightning można wykorzystywać komercyjnie?
Karta modelu NVIDIA klasyfikuje go na licencji OpenMDW-1.1 i oznacza jako gotowy do użytku komercyjnego. Dotyczy to wag pobieranych i uruchamianych samodzielnie. Nie odnosi się to do pozostałego oprogramowania w stosie technologicznym, dlatego należy oddzielnie sprawdzić licencje agenta oraz wszelkich zintegrowanych narzędzi, a także przeczytać aktualną kartę modelu przed podjęciem jakichkolwiek zobowiązań kontraktowych.