Uruchomienie Meta Muse Glimmer 30B na serwerze VPS
Dowiedz się, ile pamięci RAM i miejsca na dysku wymaga model Muse Glimmer 30B. Analiza kosztów inferencji CPU oraz optymalny dobór tagu Ollama dla stabilnej pracy agenta.
Wymagania Muse Glimmer na serwerze VPS
Muse Glimmer działa na standardowym serwerze Linux VPS bez GPU, a wybór tagu decyduje o zapotrzebowaniu na pamięć operacyjną. Laboratorium Meta Superintelligence Labs opublikowało model 10 sierpnia 2026 roku na licencji Apache 2.0: 30 miliardów parametrów, okno kontekstowe 128K oraz dedykowany koder percepcji o 1,8 miliarda parametrów, umożliwiający analizę obrazów wraz z tekstem. Meta pozycjonuje model jako rozwiązanie dla stale działających agentów lokalnych, a nie jako narzędzie do czatowania, z siłą rozumowania konfigurowaną dla każdego zapytania.
Opublikowane tagi Ollama, odczytane 16 sierpnia 2026 roku, mieszczą się w zakresie od 17 GB do 59 GB. Ten zakres stanowi istotę problemu doboru rozmiaru. Domyślny tag zajmuje około 18 GB, więc najmniejsza sensowna maszyna musi dysponować wyraźnie większą ilością wolnej pamięci RAM niż 18 GB. Do tego należy doliczyć miejsce na dysku na pobranie modelu oraz pamięć wymaganą przez okno kontekstowe.
Który tag muse-glimmer należy pobrać?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama udostępnia 11 tagów dla tego modelu, które nie są kompilacjami dla Apple. Zawierają one te same 30 miliardów wag zapisanych z różną precyzją numeryczną. Rozmiar, który widzisz, to ilość danych do pobrania oraz przybliżona ilość pamięci, którą musisz zarezerwować przed dodaniem jakiegokolwiek kontekstu.
Dwie kompilacje 4-bitowe są najmniejsze: 30b-nvfp4 o rozmiarze 17 GB oraz 30b-q4_K_M o rozmiarze 18 GB. Domyślny tag 30b ma taki sam rozmiar jak kompilacja q4_K_M. Kompilacje 8-bitowe, 30b-q8_0 oraz 30b-mxfp8, zajmują około 31 GB. 30b-bf16 to niekwantyzowane wydanie 16-bitowe o rozmiarze 57 GB, co wymaga większej ilości pamięci RAM, niż oferuje większość wynajmowanych serwerów w cenie akceptowalnej dla projektów pobocznych.
Tagi -dflash to te same kompilacje z obsługą DFlash, z których każda jest większa od swojego standardowego odpowiednika. Ollama opisuje DFlash jako funkcję zwiększającą szybkość i prezentuje jej działanie na układach Apple Silicon oraz desktopowych GPU. Na VPS działającym wyłącznie w oparciu o CPU płacisz za ten dodatkowy rozmiar w pamięci operacyjnej za funkcję mierzoną na innym sprzęcie, dlatego zacznij od standardowego tagu i zmieniaj parametry pojedynczo.
Zacznij od wersji 4-bitowej, chyba że masz konkretny powód, aby tego nie robić. Przejście z 4-bitów na 8-bitów mniej więcej podwaja liczbę bajtów, które procesor musi odczytać dla każdego generowanego tokena, przez co przepustowość spada, a zużycie pamięci rośnie. Ten kompromis jest przedmiotem artykułu ile faktycznie kosztuje kwantyzacja q4, q8 oraz fp16, a w przypadku serwera opartego na CPU krótka odpowiedź brzmi: kompilacja 4-bitowa jest jedyną, od której warto zacząć.
Dlaczego tagi MLX nie działają na serwerze z systemem Linux
MLX to framework do operacji na tablicach stworzony przez Apple, a silnik MLX w Ollama stanowi backend dla architektury Apple Silicon. Każdy tag zawierający mlx w nazwie jest przeznaczony dla tego silnika i tego konkretnego sprzętu. Na serwerze VPS z architekturą x86 i systemem Linux pobranie tych plików oznacza stratę kilkudziesięciu gigabajtów miejsca na dysku, ponieważ nie można ich uruchomić. Wyniki wydajności podane w ogłoszeniu, zmierzone na komputerze Mac, dotyczą właśnie tych tagów i nie odnoszą się do posiadanego serwera. Podczas przeglądania listy tagów na stronie modelu należy najpierw odfiltrować wszystkie nazwy zawierające mlx, a następnie dobrać rozmiar z pozostałych dostępnych opcji.
Ile pamięci RAM i miejsca na dysku faktycznie potrzeba?
Dwa czynniki zużywają pamięć, przy czym tylko jeden z nich zależy od rozmiaru tagu. Wagi są ustalane przez pobrany tag. Pamięć podręczna KV, czyli stan modelu dla każdego tokena utrzymywany podczas konwersacji, rośnie wraz z długością skonfigurowanego kontekstu. Dokumentacja Ollama wskazuje, że obsługa równoległych żądań mnoży kontekst przez liczbę aktywnych zapytań, więc serwer odpowiadający dwóm agentom jednocześnie wymaga więcej pamięci niż ten sam serwer obsługujący jednego.
Nie należy polegać na wartościach RAM podanych w żadnym poradniku, w tym w tym dokumencie. Pobierz tag, wyślij jedno zapytanie i podczas gdy model jest załadowany w pamięci, wykonaj te dwa polecenia.
ollama ps
free -hollama ps pokazuje, co jest aktualnie załadowane i jak praca jest rozdzielona między CPU a GPU. free -h pokazuje, ile pamięci pozostało. Te dwa wyniki z własnego serwera są bardziej miarodajne niż jakakolwiek opublikowana tabela, ponieważ uwzględniają już ustawienia kontekstu, kwantyzację oraz wszystkie inne procesy działające na serwerze.
Miejsce na dysku jest łatwiejsze do oszacowania. Ollama przechowuje modele w /usr/share/ollama/.ollama/models w systemie Linux, co w większości obrazów VPS znajduje się w głównym systemie plików. Wolumen główny o rozmiarze 40 GB nie pomieści wersji bf16 o rozmiarze 57 GB i nie pomieści również dwóch tagów 8-bitowych jednocześnie. Jeśli nigdy nie sprawdzano, co faktycznie zapisuje operacja pull, gdzie Ollama przechowuje modele i jak je przenieść zawiera opis tego katalogu. Przed pobraniem czegokolwiek należy przenieść magazyn na zamontowany wolumen.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaUżytkownik ollama musi być właścicielem tego katalogu, ponieważ usługa działa jako ollama i zapisuje tam swoje obiekty typu blob jako ten użytkownik. Jeśli operacja pull kończy się niepowodzeniem z powodu uprawnień, journalctl -u ollama -n 50 jest miejscem, w którym pojawi się przyczyna.
W kwestii swap należy stwierdzić jednoznacznie: swap nie pozwala na uruchomienie większego tagu. Generowanie wymaga odczytu wag dla każdego tworzonego tokena, więc wagi znajdujące się w swap są wielokrotnie odczytywane z dysku, vmstat 1 pokazuje wtedy aktywność kolumn si oraz so, a szybkość generowania spada do sekund na token. Należy utrzymywać niewielki plik swap jako zabezpieczenie przed mechanizmem out of memory killer. Rozmiar RAM należy dobrać do tagu, który faktycznie ma być używany.
Instalacja Ollama i przypięcie nazwanej etykiety
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaSkrypt instalacyjny konfiguruje usługę systemd, dzięki czemu serwer uruchamia się automatycznie po restarcie. Jeśli wolisz nie uruchamiać go jako usługi systemowej zarządzanej przez root, uruchamianie Ollama bez uprawnień roota w Podman opisuje taką ścieżkę. Następnie pobierz konkretną etykietę (tag).
ollama pull muse-glimmer:30b
ollama listSamodzielnie sprawdź kolumnę rozmiaru w ollama list i porównaj ją z aktualną listą etykiet na stronie modelu. Opublikowane etykiety są dodawane, zmieniane i usuwane, a rozmiar podany w poradniku jest jedynie migawką z danego dnia.
Nigdy nie wpisuj ollama pull muse-glimmer na serwerze, od którego zależy Twoja praca. Sama nazwa modelu wskazuje na etykietę latest, a latest to wskaźnik, który wydawca może skierować na inną kompilację. Rutynowe pobieranie (pull) podmieni wtedy model pod Twoim agentem, co zmieni zapotrzebowanie na pamięć oraz zachowanie systemu, a dzienniki nie odnotują żadnego powiadomienia o tej zmianie. Wpisuj etykietę w swoich skryptach, plikach jednostek oraz konfiguracji agenta. Samodzielne hostowanie LLM z Ollama na VPS opisuje resztę konfiguracji serwera.
Czy można uruchomić Muse Glimmer bez GPU?
Tak, przy czym należy jasno określić ograniczenia. Generowanie jednego tokena wymaga odczytania wag modelu z pamięci, więc prędkość zależy od przepustowości pamięci, a nie od liczby vCPU deklarowanych w planie. Powyżej kilku rdzeni, zwiększanie ich liczby przynosi znikome korzyści. Na współdzielonym VPS przepustowość jest dzielona z innymi użytkownikami hosta, więc model 30B w kwantyzacji 4-bit generuje niewielką liczbę tokenów na sekundę.
Nie należy przyjmować żadnych deklarowanych wartości, w tym moich. Zmierz liczbę tokenów na sekundę na własnej maszynie i podejmij decyzję na podstawie uzyskanych wyników.
Rezultatem jest wyraźny podział zastosowań modelu. Interaktywny czat jest uciążliwy, ponieważ użytkownik czyta szybciej, niż serwer pisze, a każda odpowiedź zaczyna się od długiej pauzy. Praca agentowa w tle przebiega poprawnie, ponieważ zadanie działające bez nadzoru przez dziesięć minut nie wymaga wysokiej prędkości. To drugie zastosowanie jest dokładnie tym, które Meta opisuje dla tego modelu.
Jeśli wymagana jest szybkość interaktywna, istnieją dwa uczciwe rozwiązania: GPU lub hostowane API. Oblicz punkt opłacalności między VPS z GPU a tokenami API przed wynajęciem jakichkolwiek zasobów, a co faktycznie zapewnia VPS z GPU opisuje, co jest przedmiotem zakupu. W kwestii tego, jaki model pomieści dana maszyna, należy zacząć od jakie modele można hostować samodzielnie, a uruchomienie modelu Qwen o podobnym rozmiarze na VPS stanowi najbliższe porównanie w tej klasie wielkości. Jeśli zmierzone wyniki są zbyt wolne do komfortowej pracy, Nemotron 3.5 Lightning na VPS stawia te same pytania dotyczące pamięci RAM i liczby tokenów na sekundę w odniesieniu do modelu zoptymalizowanego pod kątem szybkości, a nie rozmiaru.
Dlaczego model zapomina informacje znacznie wcześniej niż przed osiągnięciem 128K tokenów?
Domyślne okno kontekstowe Ollama wynosi 4096 tokenów, niezależnie od tego, jaką wartość obsługuje dany model. Informacja ta znajduje się w oficjalnym FAQ Ollama według stanu na sierpień 2026. Mimo że tag modelu deklaruje 128K, serwer przydziela mu 4096 tokenów, dopóki nie zostanie to jawnie zmienione. W rezultacie długi zapis konwersacji agenta traci początkowe fragmenty, a model sprawia wrażenie, jakby cierpiał na amnezję.
Wartość tę należy zwiększyć na serwerze dla każdego żądania:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Wewnątrz sesji interaktywnej polecenie /set parameter num_ctx 32768 zmienia ten parametr tylko dla bieżącej sesji. W przypadku korzystania z API należy przesłać num_ctx w opcjach żądania.
Każdy dodatkowy token kontekstu zwiększa zużycie pamięci ponad wymagania samych wag modelu. Żądanie pełnych 128K na maszynie o zasobach wystarczających jedynie na wagi modelu spowoduje błąd ładowania lub wymusi przejście na wolniejszy tryb pracy. Zwiększaj wartość stopniowo i po każdym kroku uruchamiaj ollama ps. Artykuł Jak działają num_ctx i długość kontekstu w Ollama szczegółowo wyjaśnia stosowane obliczenia.
Siła rozumowania: low, medium, high oraz xhigh
Meta dokumentuje cztery poziomy siły rozumowania dla modelu Muse Glimmer, od low do xhigh, zalecając dwa najwyższe dla złożonych zadań programistycznych i zadań typu agent. W Ollama parametr ten obsługiwany jest przez think. Należy użyć --think= w wierszu poleceń lub wysłać think w treści żądania API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Podczas sesji interaktywnej przełączanie odbywa się za pomocą /set think oraz /set nothink. Dokumentacja Ollama wskazuje, że większość modeli akceptuje wartość logiczną lub poziom taki jak low, medium bądź high, a niektóre obsługują max dla najwyższego dostępnego poziomu. Dokładne ciągi znaków akceptowane przez dany model znajdują się na jego stronie, dlatego należy zapoznać się z dokumentacją zamiast zgadywać, a przed wdrożeniem w agencie przetestować ustawienie ręcznie.
Na maszynie działającej wyłącznie w oparciu o CPU to ustawienie ma istotne znaczenie. Wyższa siła oznacza wygenerowanie większej liczby tokenów myślowych przed wyświetleniem pierwszego słowa odpowiedzi, a czas generowania tokena myślowego jest równy czasowi generowania tokena odpowiedzi. Rutynowe zadania należy pozostawić na ustawieniu low. Długość odpowiedzi wymaga równie starannego podejścia, dlatego warto ograniczyć odpowiedź za pomocą num_predict, zamiast pozwalać, aby jedna rozwlekła odpowiedź blokowała wolną maszynę na kilka minut.
Utrzymywanie modelu w pamięci dla agenta działającego w trybie ciągłym
Domyślnie Ollama zwalnia nieaktywny model po pięciu minutach. W przypadku agenta uruchamianego co dziesięć minut oznacza to konieczność każdorazowego wczytywania 18 GB danych z dysku, co na serwerze VPS z sieciową pamięcią masową nie jest operacją szybką. Zamiast tego należy przypiąć model w pamięci RAM.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Wartość ujemna powoduje, że model pozostaje w pamięci do momentu jego ręcznego zwolnienia, a parametr keep_alive w żądaniu API nadpisuje ustawienie domyślne serwera dla pojedynczego wywołania. Koszt tego rozwiązania jest oczywisty: pamięć RAM pozostaje zajęta nawet w czasie bezczynności, dlatego ustawienie to jest przeznaczone dla serwera dedykowanego dla danego agenta. Artykuł Utrzymywanie modelu Ollama w pamięci omawia dostępne warianty konfiguracji.
Skierowanie agenta programistycznego na instancję
Ollama udostępnia API zgodne z OpenAI pod adresem http://127.0.0.1:11434/v1, dzięki czemu większość narzędzi dla agentów łączy się z nim przy użyciu bazowego adresu URL oraz dowolnego, niepustego klucza API. Strona Muse Glimmer dla Ollama dokumentuje również skrót uruchomieniowy, który w jednym poleceniu łączy wspieranego agenta z lokalnym modelem; zaleca się również przypięcie tam odpowiedniego tagu.
ollama launch claude --model muse-glimmer:30bAgenci wysyłają obszerne prompty. Zawartość plików, dane wyjściowe narzędzi oraz rosnąca historia konwersacji trafiają do modelu jako tokeny wejściowe, a na maszynach opartych na CPU przetwarzanie promptu jest najbardziej obciążającym etapem, jeszcze przed rozpoczęciem generowania odpowiedzi. Należy ograniczać rozmiar kontekstu do minimum wymaganego przez zadanie. Skierowanie agenta programistycznego na Ollama omawia konfigurację po stronie klienta, uruchamianie agenta programistycznego na VPS opisuje serwer, na którym działa agent, a kontrola kosztów agenta na VPS wyjaśnia skutki jego całodobowej pracy.
Przetwarzanie obrazów działa w ten sam sposób. API Ollama przyjmuje obrazy w polu images wiadomości, dlatego klient obsługujący wyłącznie tekst nigdy ich nie wyśle, niezależnie od możliwości enkodera wizyjnego.
Nie otwieraj portu 11434
Interfejs API Ollama nie posiada mechanizmów uwierzytelniania. Ustawienie OLLAMA_HOST=0.0.0.0:11434 w celu uzyskania dostępu z laptopa powoduje wystawienie niechronionego silnika modeli na publiczny dostęp w Internecie. Każdy, kto go odnajdzie, może ładować własne modele na Twój dysk oraz odczytywać dane przesyłane przez agenta. Pozostaw usługę powiązaną z localhost i korzystaj z tunelowania.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsZabezpieczanie punktu końcowego API Ollama omawia właściwe metody postępowania, w tym użycie reverse proxy wymagającego uwierzytelnienia.
Co ulega awarii i co zobaczysz
Pobieranie zatrzymuje się w trakcie. Dysk. Uruchom df -h dla katalogu modelu. Kompilacja bf16 o rozmiarze 57 GB nie mieści się na partycji root o pojemności 40 GB, podobnie jak dwa tagi 8-bitowe obok siebie.
Model ładuje się, a następnie proces kończy działanie. Brak pamięci. dmesg -T rejestruje wybór procesu przez mechanizm kernel out of memory killer, a journalctl -u ollama -n 100 pokazuje zdarzenie od strony usługi. Rozwiązaniem jest mniejszy tag lub mniejszy num_ctx. Zwiększenie swap nie pomoże.
Działa z prędkością sekund na token. Uruchom vmstat 1 i obserwuj kolumny si oraz so. Stała aktywność swap oznacza, że wagi nie mieszczą się w pamięci RAM, a serwer odczytuje je z dysku podczas pracy.
Tag, który działał w zeszłym tygodniu, zniknął. Listy tagów ulegają zmianom. Przeczytaj ponownie stronę modelu, przypnij aktualną wersję i zapisz nazwę tagu w miejscu, do którego będziesz mieć dostęp.
Sprawdź samodzielnie rozmiary przed pobraniem
Rozmiary w tabeli zostały odczytane ze strony tagów modelu w dniu 16 sierpnia 2026 r., a opublikowana lista tagów nie stanowi gwarancji. Sprawdź aktualną listę na stronie modelu, a następnie potwierdź, co faktycznie trafiło na dysk:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama przechowuje warstwy modelu jako współdzielone obiekty typu blob, więc dwa tagi współdzielące warstwę nie zajmują dwukrotnie więcej miejsca na dysku. Porównaj dane raportowane przez du z opublikowanym rozmiarem i zaplanuj przestrzeń dyskową w oparciu o większą z tych wartości.
FAQ
Ile pamięci RAM wymaga Muse Glimmer na serwerze VPS?
Należy zacząć od rozmiaru tagu i dodać okno kontekstowe. Domyślny tag zajmuje około 18 GB według stanu na 16 sierpnia 2026, więc serwer 16GB nie obsłuży go w ogóle, a serwer 24GB pomieści go z niewielkim zapasem na kontekst. Należy traktować to jako punkt wyjścia, a nie ostateczną odpowiedź. Pobierz tag, załaduj go raz, a następnie uruchom ollama ps oraz free -h na własnym serwerze i odczytaj własne wartości. Dłuższy kontekst i równoległe żądania zwiększają zużycie pamięci ponad rozmiar wag.
Czy można uruchomić Muse Glimmer bez GPU?
Tak. Ładuje się i odpowiada na serwerze VPS wyposażonym tylko w CPU. Szybkość generowania jest ograniczona przepustowością pamięci, a nie liczbą rdzeni, a na współdzielonym hoście przepustowość ta jest dzielona, więc należy spodziewać się niewielkiej liczby tokenów na sekundę przy kwantyzacji 4-bit. Jest to użyteczne dla zadań agentowych działających w tle bez nadzoru, ale uciążliwe w interaktywnym czacie. Uruchom ollama ps podczas żądania i sprawdź kolumnę procesora, aby potwierdzić, gdzie wykonywane są obliczenia.
Czy tagi MLX są przydatne na serwerze Linux VPS?
Nie. Każdy tag z mlx w nazwie jest zbudowany dla silnika MLX w Ollama, który jest backendem dla Apple Silicon. Na serwerze Linux x86 tagi te są dużym plikiem do pobrania, którego nie można uruchomić. Należy użyć zwykłego tagu 30b lub innego tagu bez MLX i zignorować benchmarki sprzętu Apple, które towarzyszą kompilacjom MLX.
Dlaczego model zapomina informacje na długo przed osiągnięciem 128K tokenów?
Ponieważ domyślne okno kontekstowe Ollama wynosi 4096 tokenów, niezależnie od tego, co obsługuje model, więc serwer ucina długie konwersacje, zanim model je zobaczy. Ustaw OLLAMA_CONTEXT_LENGTH na serwerze, /set parameter num_ctx dla jednej sesji lub wyślij num_ctx w opcjach żądania API. Zużycie pamięci rośnie wraz z tym parametrem, więc zwiększaj go stopniowo i za każdym razem sprawdzaj ollama ps.
Czy należy przypiąć tag, czy używać wersji latest?
Przypnij go. muse-glimmer bez tagu wskazuje na latest, co jest wskaźnikiem, który wydawca może w każdej chwili skierować na inną kompilację, więc rutynowe pobieranie może zmienić model, na którym działa agent. Wpisuj muse-glimmer:30b w skryptach, plikach jednostek i konfiguracji agenta. Przed przypięciem sprawdź listę tagów na stronie modelu, ponieważ opublikowane tagi ulegają zmianom.