Meta Muse Glimmer 30B auf einem VPS betreiben
Muse Glimmer-Tags belegen 17 bis 59 GB. Ermitteln Sie RAM und Speicher für einen Linux-VPS vor dem Download und die Kosten reiner CPU-Inferenz.
Was Muse Glimmer auf einem VPS benötigt
Muse Glimmer läuft auf einem gewöhnlichen Linux-VPS ohne GPU. Der abgerufene Tag bestimmt, ob das Modell in den Arbeitsspeicher passt. Meta Superintelligence Labs hat das Modell am 10. August 2026 unter Apache 2.0 veröffentlicht: 30 Milliarden Parameter, ein Kontextfenster mit 128K und einen dedizierten Wahrnehmungsencoder mit 1.8B Parametern, sodass das Modell Bilder zusammen mit Text verarbeiten kann. Meta positioniert das Modell für dauerhaft laufende lokale Agents und nicht als Chatbot. Die Stärke der Reasoning-Funktion legen Sie pro Anfrage fest.
Die veröffentlichten Ollama-Tags reichten am 16. August 2026 von 17 GB bis 59 GB. Diese Spanne bestimmt die gesamte Dimensionierung. Der Standard-Tag ist mit etwa 18 GB angegeben. Ein sinnvoller kleinster VPS benötigt daher deutlich mehr als 18 GB freien Arbeitsspeicher. Der Speicherplatz für den Download und der Arbeitsspeicher für das Kontextfenster kommen zusätzlich hinzu.
Welchen muse-glimmer-Tag sollten Sie herunterladen?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama listet für dieses Modell 11 Tags, die keine Apple-Builds sind. Sie enthalten dieselben 30 Milliarden Gewichte, die mit unterschiedlichen numerischen Genauigkeiten gespeichert sind. Die angezeigte Größe entspricht dem Download und ungefähr auch dem Speicher, den Sie vor dem Hinzufügen eines Kontexts vorhalten müssen.
Die beiden 4-Bit-Builds sind die kleineren: 30b-nvfp4 mit 17 GB und 30b-q4_K_M mit 18 GB. Der Standard-Tag 30b ist mit derselben Größe wie der q4_K_M-Build aufgeführt. Die 8-Bit-Builds 30b-q8_0 und 30b-mxfp8 liegen bei etwa 31 GB. 30b-bf16 ist die unquantisierte 16-Bit-Version mit 57 GB. Das benötigt mehr RAM, als die meisten gemieteten Server zu einem Preis bieten, den jemand für ein Nebenprojekt bezahlen würde.
Die -dflash-Tags sind dieselben Builds mit DFlash-Unterstützung. Jeder davon ist größer als sein Gegenstück ohne DFlash. Ollama beschreibt DFlash als Geschwindigkeitsfunktion und demonstriert sie auf Apple Silicon sowie auf Desktop-GPUs. Auf einer VPS, die nur eine CPU bietet, würden Sie diese zusätzliche Größe im Arbeitsspeicher für eine Funktion bezahlen, deren Messwerte von anderer Hardware stammen. Beginnen Sie daher mit dem Tag ohne DFlash und ändern Sie jeweils nur eine Sache.
Beginnen Sie mit 4 Bit, sofern kein bestimmter Grund dagegen spricht. Beim Wechsel von 4 Bit auf 8 Bit verdoppelt sich ungefähr die Anzahl der Bytes, die die CPU für jedes erzeugte Token lesen muss. Dadurch sinkt der Durchsatz, während der Speicherbedarf steigt. Dieser Zielkonflikt wird unter welche tatsächlichen Kosten q4-, q8- und fp16-Quantisierung verursacht erläutert. Auf einem CPU-Server lautet die kurze Antwort: Der 4-Bit-Build ist der einzige, mit dem Sie beginnen sollten.
Warum MLX-Tags auf einem Linux-Server keine Wirkung haben
MLX ist Apples Array-Framework. Ollamas MLX-Engine ist das Backend für Apple Silicon. Jeder Tag mit mlx im Namen wurde für diese Engine und diese Hardware erstellt. Auf einem x86-Linux-VPS handelt es sich um mehrere Dutzend Gigabyte an Downloads, die Sie nicht ausführen können. Die Dateien belegen nur Speicherplatz. Die Geschwindigkeitsangaben aus der Ankündigung wurden auf einem Mac gemessen. Sie gelten für diese Tags und beschreiben daher nicht Ihren Server. Wenn Sie die Tag-Liste auf der Modellseite lesen, filtern Sie zuerst alle Namen mit mlx heraus. Ermitteln Sie die benötigte Größe anschließend anhand der verbleibenden Tags.
Wie viel RAM und Speicherplatz wird tatsächlich benötigt?
Zwei Dinge beanspruchen Speicher, und nur eines davon ist die Größe des Tags. Die Gewichte sind durch das abgerufene Tag festgelegt. Der KV-Cache, also der Zustand pro Token, den das Modell für die Unterhaltung speichert, wächst mit der konfigurierten Kontextlänge. Die Ollama-Dokumentation weist darauf hin, dass parallele Anfragen den Kontext mit der Anzahl der gleichzeitig bearbeiteten Anfragen multiplizieren. Ein Server, der gleichzeitig zwei Agents bedient, benötigt daher mehr Speicher als derselbe Server für einen Agent.
Übernehmen Sie keine RAM-Angabe aus irgendeiner Anleitung, auch nicht aus dieser. Rufen Sie das Tag ab, senden Sie ihm eine Eingabeaufforderung, und führen Sie diese beiden Befehle aus, solange das Modell noch geladen ist.
ollama ps
free -hollama ps zeigt, was gerade geladen ist und wie die Arbeit zwischen CPU und GPU verteilt wird. free -h zeigt, wie viel Speicher noch verfügbar ist. Diese beiden Ausgaben auf Ihrem eigenen Server sind aussagekräftiger als jede veröffentlichte Tabelle, weil sie bereits Ihre Kontexteinstellung, Ihre Quantisierung und alle anderen laufenden Serverprozesse berücksichtigen.
Beim Speicherplatz ist die Sache einfacher. Ollama speichert Modelle unter /usr/share/ollama/.ollama/models auf Linux. Bei den meisten VPS-Images liegt dieser Pfad auf dem Root-Dateisystem. Ein Root-Volume mit 40GB kann den bf16-Build mit 57 GB nicht aufnehmen. Auch zwei 8-Bit-Tags passen dort nicht nebeneinander. Wenn Sie noch nie geprüft haben, welche Dateien ein Pull tatsächlich schreibt, beschreibt wo Ollama Modelle speichert und wie Sie sie verschieben dieses Verzeichnis ausführlich. Verschieben Sie den Speicher vor dem ersten Pull auf ein eingebundenes Volume.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaDer Benutzer ollama muss Eigentümer dieses Verzeichnisses sein, weil der Dienst als ollama läuft und seine Blobs dort unter diesem Benutzer schreibt. Wenn ein Pull an fehlenden Berechtigungen scheitert, steht der Grund in journalctl -u ollama -n 50.
Für Swap gilt eine klare Aussage: Swap ermöglicht nicht den Betrieb eines größeren Tags. Bei der Generierung greift das System für jedes erzeugte Token auf die Gewichte zu. Liegen diese Gewichte im Swap, werden sie wiederholt von der Festplatte gelesen, vmstat 1 zeigt ausgelastete Spalten für si und so, und die Ausgabe verlangsamt sich auf mehrere Sekunden pro Token. Lassen Sie eine kleine Swap-Datei als Schutz vor dem Out-of-Memory-Killer eingerichtet. Dimensionieren Sie den RAM für das Tag, das Sie tatsächlich verwenden möchten.
Ollama installieren und ein benanntes Tag festlegen
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaDas Installationsskript richtet einen systemd-Dienst ein. Der Server startet daher nach einem Reboot wieder. Wenn Sie Ollama nicht als von root verwalteten Systemdienst ausführen möchten, beschreibt Ollama rootless unter Podman ausführen diesen Weg. Laden Sie anschließend ein explizites Tag herunter.
ollama pull muse-glimmer:30b
ollama listLesen Sie die Spalte für die Größe in ollama list selbst und vergleichen Sie sie mit der aktuellen Tag-Liste auf der Modellseite. Veröffentlichte Tags werden hinzugefügt, umbenannt und entfernt. Eine Größenangabe in einer Anleitung ist daher eine Momentaufnahme von einem bestimmten Tag.
Verwenden Sie ollama pull muse-glimmer niemals auf einem Server, von dem Sie abhängig sind. Ein Modellname ohne Tag wird in das latest-Tag aufgelöst. latest ist ein Zeiger, den der Herausgeber auf einen anderen Build verschieben kann. Ein routinemäßiger Pull ersetzt dann das Modell unterhalb Ihres Agenten. Dadurch können sich Speicherbedarf und Verhalten ändern, ohne dass dies in Ihren Logs angekündigt wird. Schreiben Sie das Tag in Ihre Skripte, Unit-Dateien und Agent-Konfiguration. Ein LLM mit Ollama auf einem VPS selbst hosten beschreibt die weitere Serverkonfiguration.
Können Sie Muse Glimmer ohne GPU ausführen?
Ja, aber die Leistungsgrenze sollte klar benannt werden. Für die Generierung eines Tokens müssen die Modellgewichte aus dem Speicher gelesen werden. Die Geschwindigkeit hängt daher stärker von der Speicherbandbreite als von der Anzahl der vom Tarif beworbenen vCPUs ab. Nach einigen Kernen bringen zusätzliche Kerne nur noch sehr wenig. Auf einem gemeinsam genutzten VPS wird diese Bandbreite mit allen anderen Mandanten auf dem Host geteilt. Ein 30B-Modell in 4-Bit erzeugt daher nur wenige Tokens pro Sekunde.
Übernehmen Sie dafür keine fremden Angaben, auch nicht meine. Messen Sie die Tokens pro Sekunde auf Ihrem eigenen System und entscheiden Sie anhand der Ergebnisse.
Das führt zu einem deutlichen Unterschied bei den geeigneten Einsatzbereichen des Modells. Interaktiver Chat ist mühsam, weil Sie schneller lesen, als der Server schreibt, und jede Antwort mit einer langen Pause beginnt. Hintergrundaufgaben für Agents funktionieren dagegen gut. Eine Aufgabe, die zehn Minuten unbeaufsichtigt läuft, ist nicht davon abhängig, dass sie schnell ist. Genau diesen zweiten Anwendungsfall beschreibt Meta für dieses Modell.
Wenn Sie interaktive Geschwindigkeit benötigen, gibt es zwei ehrliche Antworten: eine GPU oder eine gehostete API. Ermitteln Sie den Break-even-Point zwischen einem GPU-VPS und API-Tokens, bevor Sie etwas mieten. Was ein GPU-VPS tatsächlich bietet beschreibt, was Sie dafür erwerben. Für die umfassendere Frage, welches Modell auf einen bestimmten Server passt, beginnen Sie mit Welche Modelle Sie selbst hosten können. Ein ähnlich großes Qwen-Modell auf einem VPS ausführen ist der nächstliegende Vergleich in dieser Größenklasse. Wenn die von Ihnen gemessenen Werte zu langsam für den praktischen Einsatz sind, stellt Nemotron 3.5 Lightning auf einem VPS dieselben Fragen zu RAM und Tokens pro Sekunde für ein Modell, das auf Geschwindigkeit statt auf Größe ausgelegt ist.
Warum vergisst es Inhalte lange vor 128K Tokens?
Das Standard-Kontextfenster von Ollama umfasst 4096 Tokens, unabhängig davon, was das Modell unterstützt. Dieser Standardwert steht seit August 2026 in der FAQ von Ollama. Der Tag wirbt mit 128K, aber der Server übergibt dem Modell zunächst 4096 Tokens, bis Sie einen anderen Wert festlegen. Deshalb verliert ein langer Agentenverlauf seine frühen Nachrichten, und das Modell wirkt, als hätte es ein Gedächtnisproblem.
Erhöhen Sie den Wert für jede Anfrage auf dem Server:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"In einer interaktiven Sitzung ändert /set parameter num_ctx 32768 den Wert nur für diese Sitzung. Über die API senden Sie num_ctx in den Anfrageoptionen.
Jeder zusätzliche Kontext-Token benötigt zusätzlich zum Speicherbedarf der Modellgewichte Arbeitsspeicher. Fordern Sie auf einem System, das nur für die Gewichte dimensioniert ist, die vollständigen 128K an, schlägt das Laden fehl oder fällt auf eine langsamere Variante zurück. Erhöhen Sie den Wert schrittweise und führen Sie nach jedem Schritt ollama ps aus. So funktionieren num_ctx und die Kontextlänge in Ollama erläutert die Berechnung.
Rechenintensität: low, medium, high und xhigh
Meta dokumentiert für Muse Glimmer vier Stufen der Rechenintensität, von low bis xhigh, und empfiehlt die beiden höheren Stufen für komplexe Programmier- und Agent-Aufgaben. In Ollama wird dies über den Parameter think gesteuert. Verwenden Sie --think= in der Befehlszeile oder senden Sie think im API-Body.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"In einer interaktiven Sitzung können Sie die Einstellung mit /set think und /set nothink umschalten. Laut der Ollama-Dokumentation akzeptieren die meisten Modelle entweder einen booleschen Wert oder eine Stufe wie low, medium oder high. Einige Modelle akzeptieren außerdem max für die höchste verfügbare Stufe. Welche konkreten Zeichenfolgen dieses Modell akzeptiert, ist auf seiner Modellseite angegeben. Lesen Sie diese daher, statt zu raten, und testen Sie einen Wert manuell, bevor Sie ihn in einen Agent integrieren.
Auf einem Rechner, der ausschließlich eine CPU verwendet, wirkt sich diese Einstellung deutlich aus. Eine höhere Stufe erzeugt mehr Denktokens, bevor das erste Wort der Antwort erscheint. Ein Denktoken benötigt dabei genauso viel Wandzeit wie ein Antworttoken. Lassen Sie Routineaufgaben auf der Einstellung low laufen. Auch die Länge der Antwort sollte begrenzt werden. Verwenden Sie daher die Antwort mit num_predict begrenzen, statt eine ausufernde Antwort einen langsamen Rechner mehrere Minuten zu blockieren.
Das Modell für einen dauerhaft laufenden Agenten geladen halten
Ollama entlädt ein inaktives Modell standardmäßig nach fünf Minuten. Bei einem Agenten, der alle zehn Minuten ausgeführt wird, bedeutet das, dass bei jedem einzelnen Lauf das gesamte 18-GB-Modell von der Festplatte geladen werden muss. Auf einem VPS mit netzwerkgebundenem Speicher dauert dieser Ladevorgang nicht kurz. Halten Sie das Modell stattdessen im Arbeitsspeicher.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Ein negativer Wert hält das Modell resident, bis es explizit entladen wird. keep_alive in einer API-Anfrage überschreibt den Serverstandard für diesen einen Aufruf. Der Preis ist eindeutig: Der Arbeitsspeicher bleibt belegt, solange nichts geschieht. Diese Einstellung eignet sich daher für einen Server, der dem Agenten gewidmet ist. Ein Ollama-Modell geladen halten behandelt die verschiedenen Varianten.
Einen Coding-Agent auf das Modell richten
Ollama stellt unter http://127.0.0.1:11434/v1 eine OpenAI-kompatible API bereit. Die meisten Agent-Tools verbinden sich über eine Base-URL und einen beliebigen nicht leeren API-Key. Die Ollama-Seite zu Muse Glimmer dokumentiert außerdem eine Startabkürzung, mit der sich ein unterstützter Agent in einem Befehl mit einem lokalen Modell verbinden lässt. Dabei sollten Sie auch dort den Tag fest vorgeben.
ollama launch claude --model muse-glimmer:30bAgents senden große Prompts. Dateiinhalte, Tool-Ausgaben und ein wachsendes Transkript werden vollständig als Input-Tokens übertragen. Auf einem CPU-System ist die Verarbeitung des Prompts der belastende Teil, noch bevor die Generierung beginnt. Halten Sie die Context-Einstellung so klein wie für die Aufgabe möglich. Einen Coding-Agent auf Ollama richten behandelt die Client-Seite, Einen Coding-Agent auf einem VPS ausführen behandelt das System, auf dem der Agent läuft, und Agent-Kosten auf einem VPS kontrollieren behandelt den Betrieb über den ganzen Tag.
Die Verarbeitung von Bildeingaben funktioniert auf dieselbe Weise. Die Ollama-API erwartet Bilder im Feld images einer Nachricht. Ein Client, der nur Text unterstützt, sendet daher niemals Bilder, unabhängig davon, wie leistungsfähig der Perception-Encoder ist.
Öffnen Sie Port 11434 nicht
Die Ollama API bietet keine Authentifizierung. Wenn Sie OLLAMA_HOST=0.0.0.0:11434 setzen, damit Sie von Ihrem Laptop darauf zugreifen können, stellen Sie einen nicht authentifizierten Model Runner ins öffentliche Internet. Jeder, der ihn findet, kann Modelle auf Ihre Festplatte laden und alles lesen, was Ihr Agent darüber sendet. Lassen Sie den Dienst an localhost gebunden und verwenden Sie stattdessen einen Tunnel.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API-Endpunkt absichern behandelt die geeigneten Optionen, darunter einen Reverse Proxy, der Anmeldedaten anfordert.
Was ausfällt und was Sie sehen
Der Pull-Vorgang bricht ab. Ursache ist der Speicherplatz. Führen Sie df -h für das Modellverzeichnis aus. Ein 57 GB großer bf16-Build passt nicht auf ein 40GB-Root-Volume. Zwei 8-Bit-Tags nebeneinander passen ebenfalls nicht.
Das Modell wird geladen, anschließend beendet sich der Prozess. Ursache ist Speichermangel. dmesg -T protokolliert, welchen Prozess der Out-of-Memory-Killer des Kernels beendet. journalctl -u ollama -n 100 zeigt dasselbe Ereignis aus Sicht des Dienstes. Verwenden Sie einen kleineren Tag oder einen kleineren num_ctx. Mehr Swap ist keine Lösung.
Die Verarbeitung dauert mehrere Sekunden pro Token. Führen Sie vmstat 1 aus und beobachten Sie die Spalten si und so. Anhaltende Swap-Aktivität bedeutet, dass die Gewichte nicht in den RAM passen. Der Rechner liest sie während der Verarbeitung wieder von der Festplatte ein.
Ein Tag, der letzte Woche funktioniert hat, ist verschwunden. Tag-Listen ändern sich. Lesen Sie die Modellseite erneut, pinnen Sie den aktuellen Tag und notieren Sie den Tagnamen an einer Stelle, die Sie später wiederfinden.
Prüfen Sie die Größen vor dem Pull selbst erneut
Die Größen in der Tabelle wurden am 16 August 2026 von der Tag-Seite des Modells abgelesen. Eine veröffentlichte Tag-Liste ist keine Garantie. Lesen Sie die aktuelle Liste auf der Modellseite und prüfen Sie anschließend, was tatsächlich auf Ihrer Festplatte gespeichert wurde:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama speichert Modell-Layer als gemeinsam verwendete Blobs. Zwei Tags, die einen Layer gemeinsam verwenden, belegen daher nicht doppelt so viel Speicherplatz. Vergleichen Sie die Ausgabe von du mit der veröffentlichten Größe und planen Sie den Speicherplatz anhand des größeren Werts.
FAQ
Wie viel RAM benötigt Muse Glimmer auf einem VPS?
Gehen Sie von der Tag-Größe aus und addieren Sie das Kontextfenster. Der Standard-Tag wird am 16 August 2026 mit etwa 18 GB angegeben. Ein System mit 16GB kann ihn daher überhaupt nicht aufnehmen. Ein System mit 24GB kann ihn mit wenig verbleibendem Speicher für den Kontext aufnehmen. Betrachten Sie das als Ausgangspunkt, nicht als endgültige Antwort. Laden Sie den Tag herunter, laden Sie ihn einmal und führen Sie anschließend ollama ps und free -h auf Ihrem eigenen System aus. Lesen Sie Ihre eigenen Werte ab. Ein längerer Kontext und parallele Anfragen benötigen zusätzlich Speicher über den Speicherbedarf der Gewichte hinaus.
Kann ich Muse Glimmer ohne GPU ausführen?
Ja. Das Modell kann auf einem VPS ausschließlich mit der CPU geladen werden und Antworten erzeugen. Die Generierungsgeschwindigkeit wird eher durch die Speicherbandbreite als durch die Anzahl der Kerne begrenzt. Auf einem gemeinsam genutzten Host wird diese Bandbreite außerdem geteilt. Erwarten Sie daher bei 4-bit nur wenige Tokens pro Sekunde. Das ist für Hintergrundaufgaben eines unbeaufsichtigt laufenden Agents brauchbar, für interaktiven Chat jedoch langsam. Führen Sie während einer Anfrage ollama ps aus und lesen Sie die Prozessorspalte, um zu prüfen, wo die Verarbeitung stattfindet.
Sind die MLX-Tags auf einem Linux-VPS brauchbar?
Nein. Jeder Tag, der mlx im Namen enthält, wurde für Ollamas MLX-Engine erstellt. Dabei handelt es sich um das Backend für Apple Silicon. Auf einem x86-Linux-Server sind diese Tags große Downloads, die Sie nicht ausführen können. Verwenden Sie den einfachen 30b-Tag oder einen anderen Tag ohne MLX. Ignorieren Sie die Benchmarks für Apple-Hardware, die zu den MLX-Builds gehören.
Warum vergisst das Modell Inhalte lange vor 128K Tokens?
Weil Ollamas Standard-Kontextfenster unabhängig von der Modellunterstützung 4096 Tokens umfasst. Der Server kürzt lange Unterhaltungen daher, bevor das Modell sie überhaupt erhält. Setzen Sie OLLAMA_CONTEXT_LENGTH auf dem Server, /set parameter num_ctx für eine Sitzung oder senden Sie num_ctx in den Optionen der API-Anfrage. Der Speicherbedarf steigt dadurch. Erhöhen Sie den Wert daher schrittweise und prüfen Sie jedes Mal ollama ps.
Sollte ich den Tag fest vorgeben oder einfach latest verwenden?
Geben Sie ihn fest vor. muse-glimmer ohne Tag wird zu latest aufgelöst. Dabei handelt es sich um einen Verweis, den der Herausgeber jederzeit auf einen anderen Build umstellen kann. Dadurch kann ein routinemäßiger Pull das von Ihrem Agent ausgeführte Modell ändern. Schreiben Sie muse-glimmer:30b in Skripte, Unit-Dateien und die Agent-Konfiguration. Prüfen Sie die Tag-Liste auf der Modellseite, bevor Sie den Tag festlegen, da sich veröffentlichte Tags ändern.