SSD Nodes Learn 🎉 VPS od $5.50/mies.
Przewodniki Matt ConnorAutor: Matt Connor

Jak uruchomić Meta Muse Glimmer 30B na serwerze VPS

Sprawdź wymagania sprzętowe dla Muse Glimmer 30B. Modele zajmują od 17GB do 59GB RAM. Dowiedz się, jak dobrać parametry VPS dla poprawnej inferencji CPU bez dedykowanego GPU.

Wymagania Muse Glimmer na serwerze VPS

Muse Glimmer działa na standardowym serwerze Linux VPS bez GPU, a wybrany tag decyduje o zapotrzebowaniu na pamięć operacyjną. Laboratorium Meta Superintelligence Labs opublikowało model 10 sierpnia 2026 roku na licencji Apache 2.0: 30 miliardów parametrów, okno kontekstowe 128K oraz dedykowany koder percepcji o wielkości 1,8 mld parametrów, umożliwiający analizę obrazów obok tekstu. Meta pozycjonuje model jako rozwiązanie dla stale działających agentów lokalnych, a nie jako narzędzie do czatowania, z siłą wnioskowania definiowaną dla każdego żądania.

Opublikowane tagi Ollama, odczytane 16 sierpnia 2026 roku, mieszczą się w zakresie od 17 GB do 59 GB. Ten zakres stanowi istotę problemu doboru rozmiaru. Domyślny tag zajmuje około 18 GB, dlatego najmniejsza sensowna maszyna musi dysponować wyraźnie większą ilością wolnej pamięci RAM niż 18 GB. Do tego należy doliczyć miejsce na dysku na pobranie modelu oraz pamięć na okno kontekstowe.

Który tag muse-glimmer należy pobrać?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama wyświetla 11 tagów dla tego modelu, które nie są kompilacjami dla Apple. Zawierają one te same 30 miliardów wag zapisanych z różną precyzją numeryczną. Rozmiar, który widzisz, to ilość danych do pobrania oraz przybliżona ilość pamięci, którą musisz zarezerwować przed dodaniem jakiegokolwiek kontekstu.

Dwie kompilacje 4-bitowe są najmniejsze: 30b-nvfp4 o rozmiarze 17 GB oraz 30b-q4_K_M o rozmiarze 18 GB. Domyślny tag 30b ma taki sam rozmiar jak kompilacja q4_K_M. Kompilacje 8-bitowe, 30b-q8_0 oraz 30b-mxfp8, zajmują około 31 GB. 30b-bf16 to nieskompresowane wydanie 16-bitowe o rozmiarze 57 GB, co wymaga więcej pamięci RAM, niż oferuje większość wynajmowanych serwerów w cenie akceptowalnej dla projektów pobocznych.

Tagi -dflash to te same kompilacje z obsługą DFlash, z których każda jest większa od swojego standardowego odpowiednika. Ollama opisuje DFlash jako funkcję zwiększającą szybkość i demonstruje jej działanie na układach Apple Silicon oraz desktopowych procesorach graficznych. Na serwerze VPS opartym wyłącznie na CPU płacisz za ten dodatkowy rozmiar w pamięci operacyjnej za funkcję mierzoną na innym sprzęcie, dlatego zacznij od standardowego tagu i zmieniaj tylko jeden parametr na raz.

Zacznij od wersji 4-bitowej, chyba że masz konkretny powód, by tego nie robić. Przejście z 4-bitów na 8-bitów mniej więcej podwaja liczbę bajtów, które procesor musi odczytać dla każdego generowanego tokena, przez co przepustowość spada, a zużycie pamięci rośnie. Ten kompromis jest przedmiotem artykułu ile faktycznie kosztuje kwantyzacja q4, q8 i fp16, a w przypadku serwera opartego na CPU krótka odpowiedź brzmi: kompilacja 4-bitowa jest jedyną, od której warto zacząć.

Dlaczego tagi MLX nie działają na serwerze z systemem Linux

MLX to framework obliczeniowy firmy Apple, a silnik MLX w Ollama stanowi backend dla architektury Apple Silicon. Każdy tag zawierający w nazwie mlx jest przygotowany dla tego silnika i tego sprzętu. Na serwerze VPS z architekturą x86 i systemem Linux pobranie tych plików oznacza stratę kilkudziesięciu gigabajtów miejsca na dysku, ponieważ nie można ich uruchomić. Wyniki wydajności podane w ogłoszeniu, zmierzone na komputerze Mac, dotyczą właśnie tych tagów i nie odnoszą się do posiadanego serwera. Podczas przeglądania listy tagów na stronie modelu należy najpierw odfiltrować wszystkie nazwy zawierające mlx, a następnie dobrać rozmiar z pozostałych dostępnych opcji.

Ile pamięci RAM i miejsca na dysku faktycznie potrzeba?

Dwa czynniki wpływają na zużycie pamięci, przy czym tylko jeden z nich jest bezpośrednio powiązany z rozmiarem tagu. Wagi modelu są stałe i wynikają z wybranego tagu. Pamięć podręczna KV, czyli stan modelu dla każdego tokena utrzymywany podczas konwersacji, rośnie wraz z długością skonfigurowanego kontekstu. Dokumentacja Ollama wskazuje, że obsługa równoległych żądań mnoży kontekst przez liczbę aktywnych zapytań, więc serwer odpowiadający dwóm agentom jednocześnie wymaga więcej pamięci niż ten sam serwer obsługujący jednego.

Nie należy polegać na wartościach RAM podawanych w poradnikach, w tym w tym dokumencie. Należy pobrać tag, wysłać jedno zapytanie i w czasie, gdy model jest załadowany w pamięci, wykonać poniższe dwa polecenia.

ollama ps
free -h

ollama ps pokazuje, co jest aktualnie załadowane i jak praca jest rozdzielona między CPU a GPU. free -h pokazuje pozostałe zasoby. Te dwa wyniki z własnego serwera są bardziej wiarygodne niż jakakolwiek tabela, ponieważ uwzględniają już ustawienia kontekstu, kwantyzację oraz wszystkie inne procesy działające na serwerze.

Kwestia dysku jest prostsza. Ollama przechowuje modele w /usr/share/ollama/.ollama/models w systemie Linux, co w większości obrazów VPS znajduje się na partycji głównej. Wolumen główny o rozmiarze 40 GB nie pomieści wersji bf16 o rozmiarze 57 GB i nie pozwoli na jednoczesne przechowywanie dwóch tagów 8-bitowych. Przed pobraniem czegokolwiek należy przenieść katalog przechowywania na zamontowany wolumen.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Użytkownik ollama musi być właścicielem tego katalogu, ponieważ usługa działa jako ollama i zapisuje w nim swoje obiekty (blobs) z uprawnieniami tego użytkownika. Jeśli pobieranie nie powiedzie się z powodu braku uprawnień, przyczyna zostanie wyświetlona w journalctl -u ollama -n 50.

W kwestii swap należy stwierdzić jednoznacznie: swap nie pozwala na uruchomienie większego tagu. Generowanie tekstu wymaga odczytu wag dla każdego tworzonego tokena, więc wagi znajdujące się w swap są wielokrotnie odczytywane z dysku. vmstat 1 wykaże wtedy aktywność w kolumnach si oraz so, a szybkość generowania spadnie do poziomu sekund na token. Należy utrzymywać niewielki plik swap jako zabezpieczenie przed mechanizmem OOM (Out of Memory) Killer. Pamięć RAM należy dobrać pod kątem rozmiaru tagu, który faktycznie ma być używany.

Instalacja Ollama i przypięcie nazwanego tagu

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Skrypt instalacyjny konfiguruje usługę systemd, dzięki czemu serwer uruchamia się automatycznie po restarcie. Jeśli uruchomienie jako usługa zarządzana przez root nie jest pożądane, uruchomienie Ollama bez uprawnień roota w Podman opisuje alternatywną ścieżkę. Następnie należy pobrać konkretny tag.

ollama pull muse-glimmer:30b
ollama list

Należy samodzielnie sprawdzić kolumnę rozmiaru w ollama list i porównać ją z aktualną listą tagów na stronie modelu. Opublikowane tagi są dodawane, zmieniane i usuwane, a rozmiar podany w poradniku jest jedynie migawką z danego dnia.

Nigdy nie należy wpisywać ollama pull muse-glimmer na serwerze o znaczeniu krytycznym. Sama nazwa modelu wskazuje na tag latest, a latest jest wskaźnikiem, który wydawca może przekierować na inną kompilację. Rutynowe polecenie pull może podmienić model pod agentem, co zmieni zapotrzebowanie na pamięć oraz zachowanie systemu, a w logach nie pojawi się żadna informacja o tej zmianie. Tag należy wpisywać w skryptach, plikach jednostek oraz konfiguracji agenta. Samodzielne hostowanie LLM z Ollama na VPS zawiera opis pozostałej konfiguracji serwera.

Czy można uruchomić Muse Glimmer bez GPU?

Tak, warto jednak jasno określić ograniczenia wydajnościowe. Generowanie jednego tokena wymaga odczytania wag modelu z pamięci, dlatego prędkość zależy od przepustowości pamięci, a nie od liczby vCPU oferowanych w planie. Powyżej kilku rdzeni, zwiększanie ich liczby przynosi znikome korzyści. Na współdzielonym VPS przepustowość jest dzielona z innymi użytkownikami hosta, więc model 30B w kwantyzacji 4-bit generuje niewielką liczbę tokenów na sekundę.

Nie należy przyjmować żadnych deklarowanych wartości, w tym moich. Zmierz liczbę tokenów na sekundę na własnym serwerze i podejmij decyzję na podstawie uzyskanych wyników.

Rezultatem jest wyraźny podział zastosowań modelu. Interaktywny czat jest uciążliwy, ponieważ użytkownik czyta szybciej, niż serwer generuje tekst, a każda odpowiedź zaczyna się od długiej pauzy. Praca w tle jako agent jest natomiast akceptowalna, ponieważ zadanie wykonywane bez nadzoru przez dziesięć minut nie wymaga wysokiej prędkości. To drugie zastosowanie jest dokładnie tym, które Meta wskazuje dla tego modelu.

Jeśli wymagana jest szybkość interaktywna, istnieją dwa uczciwe rozwiązania: GPU lub hostowane API. Oblicz punkt opłacalności między VPS z GPU a tokenami API przed wynajęciem jakichkolwiek zasobów, a co faktycznie zapewnia VPS z GPU opisuje, za co w rzeczywistości płacisz. W kwestii tego, co może obsłużyć dany serwer, zacznij od jakie modele można hostować samodzielnie, a uruchomienie modelu Qwen o podobnym rozmiarze na VPS stanowi najbliższe porównanie w tej klasie wielkości.

Dlaczego pamięć modelu kończy się znacznie wcześniej niż przy 128K tokenów?

Domyślne okno kontekstowe Ollama wynosi 4096 tokenów, niezależnie od tego, jakie wartości obsługuje dany model. Informacja ta znajduje się w oficjalnym FAQ Ollama według stanu na sierpień 2026. Chociaż tag modelu informuje o 128K, serwer przydziela mu 4096 tokenów, dopóki nie zostanie to jawnie zmienione. W rezultacie długie transkrypcje agenta tracą początkowe fragmenty, a model sprawia wrażenie, jakby cierpiał na amnezję.

Wartość tę należy zwiększyć na serwerze dla każdego żądania:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

W sesji interaktywnej polecenie /set parameter num_ctx 32768 zmienia ten parametr tylko dla bieżącej sesji. W przypadku korzystania z API należy przesłać num_ctx w opcjach żądania.

Każdy dodatkowy token kontekstu zwiększa zużycie pamięci operacyjnej ponad rozmiar wag modelu. Próba wymuszenia pełnych 128K na maszynie o zasobach wystarczających jedynie na wagi modelu spowoduje błąd ładowania lub drastyczny spadek wydajności. Warto zwiększać tę wartość stopniowo, uruchamiając ollama ps po każdej zmianie. Artykuł Jak działają num_ctx i długość kontekstu w Ollama szczegółowo wyjaśnia stosowane obliczenia.

Siła rozumowania: low, medium, high oraz xhigh

Meta dokumentuje cztery poziomy siły rozumowania dla modelu Muse Glimmer, od low do xhigh, zalecając dwa najwyższe dla złożonych zadań programistycznych oraz zadań typu agent. W Ollama parametr ten obsługuje think. Należy użyć --think= w wierszu poleceń lub wysłać think w treści żądania API.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

Podczas sesji interaktywnej przełączanie odbywa się za pomocą /set think oraz /set nothink. Dokumentacja Ollama wskazuje, że większość modeli akceptuje wartość logiczną lub poziom, taki jak low, medium bądź high, a niektóre obsługują max dla najwyższego dostępnego ustawienia. Dokładne ciągi znaków akceptowane przez dany model znajdują się na jego stronie, dlatego należy zapoznać się z dokumentacją zamiast zgadywać i przetestować ustawienie ręcznie przed wdrożeniem w agencie.

Na maszynie wyposażonej wyłącznie w CPU to ustawienie ma istotny wpływ na wydajność. Wyższa siła rozumowania oznacza wygenerowanie większej liczby tokenów myślowych przed wyświetleniem pierwszego słowa odpowiedzi, a czas przetwarzania tokena myślowego jest równy czasowi przetwarzania tokena odpowiedzi. Rutynowe zadania należy pozostawić na ustawieniu low.

Utrzymywanie modelu w pamięci dla agenta działającego w trybie ciągłym

Domyślnie Ollama zwalnia nieaktywny model po pięciu minutach. W przypadku agenta uruchamianego co dziesięć minut oznacza to konieczność każdorazowego wczytywania z dysku danych o rozmiarze 18 GB. Na serwerze VPS z sieciową pamięcią masową operacja ta nie jest szybka. Zamiast tego należy przypiąć model w pamięci RAM.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Wartość ujemna sprawia, że model pozostaje w pamięci do momentu jego ręcznego zwolnienia, a parametr keep_alive w żądaniu API nadpisuje ustawienie domyślne serwera dla pojedynczego wywołania. Koszt jest oczywisty: pamięć RAM pozostaje zajęta nawet podczas bezczynności, dlatego ustawienie to jest przeznaczone dla serwera dedykowanego dla danego agenta. Artykuł Utrzymywanie modelu Ollama w pamięci omawia dostępne warianty.

Wskazanie agenta programistycznego

Ollama udostępnia API zgodne z OpenAI pod adresem http://127.0.0.1:11434/v1, dzięki czemu większość narzędzi dla agentów łączy się przy użyciu adresu bazowego oraz dowolnego, niepustego klucza API. Strona Muse Glimmer dla Ollama dokumentuje również skrót uruchomieniowy, który w jednym poleceniu łączy wspieranego agenta z lokalnym modelem; zaleca się tam również przypięcie odpowiedniego tagu.

ollama launch claude --model muse-glimmer:30b

Agenci wysyłają obszerne prompty. Zawartość plików, dane wyjściowe narzędzi oraz rosnąca historia konwersacji trafiają do systemu jako tokeny wejściowe, a na maszynach opartych na CPU przetwarzanie promptu jest najbardziej obciążającym etapem, jeszcze przed rozpoczęciem generowania odpowiedzi. Należy ograniczać rozmiar kontekstu do minimum wymaganego przez zadanie. Wskazanie agenta programistycznego na Ollama omawia konfigurację po stronie klienta, uruchamianie agenta programistycznego na VPS opisuje serwer, na którym działa agent, a kontrola kosztów agenta na VPS wyjaśnia kwestie związane z całodobową pracą agenta.

Przetwarzanie obrazów działa w ten sam sposób. API Ollama przyjmuje obrazy w polu images wiadomości, dlatego klient obsługujący wyłącznie tekst nigdy nie wyśle obrazu, niezależnie od możliwości enkodera wizyjnego.

Nie otwieraj portu 11434

Interfejs API Ollama nie posiada mechanizmów uwierzytelniania. Ustawienie OLLAMA_HOST=0.0.0.0:11434 w celu uzyskania dostępu z laptopa powoduje wystawienie niechronionego silnika modeli na publiczny dostęp w Internecie. Każdy, kto go odnajdzie, może ładować własne modele na Twój dysk oraz odczytywać dane przesyłane przez agenta. Pozostaw powiązanie z localhost i użyj tunelu.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

Zabezpieczanie punktu końcowego API Ollama omawia właściwe opcje, w tym użycie reverse proxy wymagającego uwierzytelnienia.

Co ulega awarii i co zobaczysz

Pobieranie zatrzymuje się w trakcie. Dysk. Uruchom df -h w katalogu modelu. Kompilacja bf16 o rozmiarze 57 GB nie mieści się na woluminie root o pojemności 40 GB, podobnie jak dwa tagi 8-bitowe obok siebie.

Model ładuje się, a następnie proces kończy działanie. Brak pamięci (OOM). dmesg -T rejestruje wybór procesu przez mechanizm kernel out of memory killer, a journalctl -u ollama -n 100 pokazuje zdarzenie z perspektywy usługi. Rozwiązaniem jest mniejszy tag lub mniejszy num_ctx. Zwiększenie partycji swap nie pomoże.

Działanie trwa sekundy na token. Uruchom vmstat 1 i obserwuj kolumny si oraz so. Stała aktywność swap oznacza, że wagi nie mieszczą się w pamięci RAM, a serwer odczytuje je z dysku podczas pracy.

Tag, który działał w zeszłym tygodniu, zniknął. Listy tagów ulegają zmianom. Przeczytaj ponownie stronę modelu, przypnij aktualną wersję i zapisz nazwę tagu w miejscu, do którego będziesz mieć dostęp w przyszłości.

Sprawdź samodzielnie rozmiary przed pobraniem

Rozmiary w tabeli zostały odczytane ze strony tagów modelu w dniu 16 sierpnia 2026 r., a opublikowana lista tagów nie stanowi gwarancji. Sprawdź aktualną listę na stronie modelu, a następnie zweryfikuj, co faktycznie trafiło na Twój dysk:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama przechowuje warstwy modelu jako współdzielone obiekty typu blob, więc dwa tagi współdzielące warstwę nie zajmują dwukrotnie więcej miejsca na dysku. Porównaj raport du z opublikowanym rozmiarem i zaplanuj przestrzeń dyskową w oparciu o większą z tych wartości.

FAQ

Ile pamięci RAM wymaga Muse Glimmer na serwerze VPS?

Należy zacząć od rozmiaru tagu i dodać okno kontekstowe. Domyślny tag zajmuje około 18 GB według stanu na 16 sierpnia 2026, więc serwer 16GB nie jest w stanie go obsłużyć, a serwer 24GB mieści go z niewielkim zapasem na kontekst. Należy traktować to jako punkt wyjścia, a nie ostateczną odpowiedź. Pobierz tag, załaduj go raz, a następnie uruchom ollama ps oraz free -h na własnej maszynie i odczytaj rzeczywiste wartości. Dłuższy kontekst oraz równoległe żądania zwiększają zużycie pamięci ponad wagę modelu.

Czy mogę uruchomić Muse Glimmer bez GPU?

Tak. Model ładuje się i odpowiada na serwerze VPS korzystającym wyłącznie z CPU. Szybkość generowania jest ograniczona przepustowością pamięci, a nie liczbą rdzeni, a na współdzielonym hoście przepustowość ta jest dzielona, więc należy spodziewać się niewielkiej liczby tokenów na sekundę przy kwantyzacji 4-bit. Jest to użyteczne w przypadku zadań agentowych działających w tle bez nadzoru, ale uciążliwe w interaktywnym czacie. Uruchom ollama ps podczas żądania i sprawdź kolumnę procesora, aby potwierdzić, gdzie wykonywane są obliczenia.

Czy tagi MLX są przydatne na serwerze Linux VPS?

Nie. Każdy tag z mlx w nazwie jest zbudowany dla silnika MLX w Ollama, który jest backendem dla Apple Silicon. Na serwerze x86 z systemem Linux te tagi są dużym plikiem do pobrania, którego nie można uruchomić. Użyj zwykłego tagu 30b lub innego tagu bez oznaczenia MLX i zignoruj benchmarki sprzętu Apple powiązane z kompilacjami MLX.

Dlaczego model zapomina informacje na długo przed osiągnięciem 128K tokenów?

Ponieważ domyślne okno kontekstowe Ollama wynosi 4096 tokenów, niezależnie od tego, co wspiera model, więc serwer ucina długie konwersacje, zanim model je otrzyma. Ustaw OLLAMA_CONTEXT_LENGTH na serwerze, /set parameter num_ctx dla jednej sesji lub wyślij num_ctx w opcjach żądania API. Zużycie pamięci rośnie wraz z tym parametrem, więc zwiększaj go stopniowo i za każdym razem sprawdzaj ollama ps.

Czy należy przypiąć tag, czy używać latest?

Przypnij go. muse-glimmer bez podanego tagu wskazuje na latest, co jest wskaźnikiem, który wydawca może w dowolnym momencie przekierować na inną kompilację, więc rutynowe pobieranie może zmienić model, na którym pracuje agent. W skryptach, plikach jednostek i konfiguracji agenta wpisuj muse-glimmer:30b. Przed przypięciem sprawdź listę tagów na stronie modelu, ponieważ opublikowane tagi ulegają zmianom.