SSD Nodes Learn 🎉 VPS ab $5.50/Monat
Anleitungen Matt ConnorVon Matt Connor

Muse Glimmer 30B auf einem VPS ausführen

Muse Glimmer-Tags belegen 17 bis 59 GB. Ermitteln Sie RAM und Speicher für Ihren Linux-VPS vor dem Pull und prüfen Sie die CPU-Kosten ohne GPU.

Was Muse Glimmer auf einem VPS benötigt

Muse Glimmer läuft auf einem gewöhnlichen Linux-VPS ohne GPU. Der von Ihnen verwendete Tag entscheidet, ob das Modell in den Arbeitsspeicher passt. Meta Superintelligence Labs hat das Modell am 10. August 2026 unter Apache 2.0 veröffentlicht: Es verfügt über 30 Milliarden Parameter, ein Kontextfenster von 128K und einen dedizierten Wahrnehmungsencoder mit 1.8B Parametern. Dadurch kann es Bilder zusammen mit Text verarbeiten. Meta positioniert es für dauerhaft laufende lokale Agents und nicht primär für Chats. Die Stärke des Reasoning legen Sie für jede Anfrage fest.

Die veröffentlichten Ollama-Tags reichten am 16. August 2026 von 17 GB bis 59 GB. Diese Spanne bestimmt die gesamte Dimensionierung. Der Standard-Tag ist mit etwa 18 GB angegeben. Ein sinnvoller Minimalserver benötigt daher deutlich mehr als 18 GB freien Arbeitsspeicher. Der Speicherplatz für den Download und der Arbeitsspeicher für das Kontextfenster kommen zusätzlich hinzu.

Welches muse-glimmer-Tag sollten Sie abrufen?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama führt für dieses Modell 11 Tags auf, die keine Apple-Builds sind. Sie enthalten dieselben 30 Milliarden Gewichte, die mit unterschiedlichen numerischen Genauigkeiten gespeichert sind. Die angezeigte Größe entspricht dem Download und ungefähr auch dem Speicherbedarf, bevor zusätzlicher Kontext berücksichtigt wird.

Die beiden 4-Bit-Builds sind die kleineren Varianten: 30b-nvfp4 mit 17 GB und 30b-q4_K_M mit 18 GB. Der standardmäßige 30b-Tag wird mit derselben Größe wie der q4_K_M-Build aufgeführt. Die 8-Bit-Builds, 30b-q8_0 und 30b-mxfp8, liegen bei etwa 31 GB. 30b-bf16 ist die unquantisierte 16-Bit-Version mit 57 GB. Dafür wird mehr RAM benötigt, als die meisten gemieteten Server zu einem für ein Nebenprojekt vertretbaren Preis bieten.

Die -dflash-Tags sind dieselben Builds mit DFlash-Unterstützung. Jeder davon wird mit einer größeren Größe als sein Gegenstück ohne DFlash aufgeführt. Ollama beschreibt DFlash als Geschwindigkeitsfunktion und demonstriert sie auf Apple Silicon sowie Desktop-GPUs. Auf einer reinen CPU-VPS würden Sie diese zusätzliche Größe im Arbeitsspeicher für eine Funktion benötigen, deren Messwerte auf anderer Hardware ermittelt wurden. Beginnen Sie daher mit dem Tag ohne DFlash und ändern Sie jeweils nur eine Sache.

Beginnen Sie mit 4 Bit, sofern kein konkreter Grund dagegenspricht. Der Wechsel von 4 Bit zu 8 Bit verdoppelt ungefähr die Byte-Anzahl, die die CPU für jedes erzeugte Token lesen muss. Dadurch sinkt der Durchsatz, während der Speicherbedarf steigt. Dieser Zielkonflikt wird unter was die Quantisierung mit q4, q8 und fp16 tatsächlich kostet erläutert. Auf einem CPU-Server lautet die kurze Antwort: Der 4-Bit-Build ist der einzige sinnvolle Ausgangspunkt.

Warum MLX-Tags auf einem Linux-Server nichts bewirken

MLX ist Apples Array-Framework. Ollamas MLX-Engine ist das Backend für Apple Silicon. Jeder Tag mit mlx im Namen wurde für diese Engine und diese Hardware erstellt. Auf einem x86-Linux-VPS handelt es sich um mehrere zehn Gigabyte an Downloads, die Sie nicht ausführen können. Die Dateien belegen lediglich Speicherplatz. Die in der Ankündigung genannten Geschwindigkeitswerte wurden auf einem Mac gemessen. Sie gelten für diese Tags und beschreiben daher auch Ihren Server nicht. Wenn Sie die Tag-Liste auf der Modellseite prüfen, filtern Sie zuerst alle Namen mit mlx heraus. Ermitteln Sie die benötigte Größe anschließend anhand der verbleibenden Tags.

Wie viel RAM und Speicherplatz wird tatsächlich benötigt?

Zwei Komponenten beanspruchen Speicher, und nur eine davon ist die Größe des Tags. Die Gewichte werden durch das abgerufene Tag festgelegt. Der KV-Cache, also der Zustand pro Token, den das Modell für die Unterhaltung speichert, wächst mit der konfigurierten Kontextlänge. Die Dokumentation von Ollama weist darauf hin, dass parallele Anfragen den Kontext mit der Anzahl der gleichzeitig bearbeiteten Anfragen multiplizieren. Ein Server, der zwei Agenten gleichzeitig beantwortet, benötigt daher mehr Speicher als derselbe Server bei der Beantwortung nur einer Anfrage.

Übernehmen Sie keinen RAM-Wert aus einer Anleitung, auch nicht aus dieser. Rufen Sie das Tag ab, senden Sie ihm eine Eingabeaufforderung und führen Sie diese beiden Befehle aus, solange das Modell noch im Speicher geladen ist.

ollama ps
free -h

ollama ps zeigt, was aktuell geladen ist und wie die Verarbeitung zwischen CPU und GPU aufgeteilt wird. free -h zeigt, wie viel Speicher noch verfügbar ist. Diese beiden Ausgaben von Ihrem eigenen Server sind aussagekräftiger als jede veröffentlichte Tabelle, weil sie bereits Ihre Kontexteinstellung, Ihre Quantisierung und alle anderen auf dem Server laufenden Prozesse berücksichtigen.

Der Speicherplatz ist der einfachere Teil. Ollama speichert Modelle unter /usr/share/ollama/.ollama/models unter Linux. Bei den meisten VPS-Images liegt dieser Pfad auf dem Root-Dateisystem. Ein Root-Volume mit 40GB kann den bf16-Build mit 57 GB nicht aufnehmen. Auch zwei 8-Bit-Tags passen dort nicht nebeneinander. Verschieben Sie den Modellspeicher auf ein eingebundenes Volume, bevor Sie etwas abrufen.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Der Benutzer ollama muss Eigentümer dieses Verzeichnisses sein, weil der Dienst als ollama ausgeführt wird und seine Blobs unter diesem Benutzer schreibt. Wenn ein Pull wegen fehlender Berechtigungen fehlschlägt, steht der Grund in journalctl -u ollama -n 50.

Für Swap gilt eine klare Aussage: Swap ermöglicht nicht die Ausführung eines größeren Tags. Bei der Generierung greift das Modell für jedes erzeugte Token auf die Gewichte zu. Gewichte, die sich im Swap befinden, werden daher wiederholt von der Festplatte gelesen. vmstat 1 zeigt dann stark ausgelastete Spalten si und so, und die Ausgabe verlangsamt sich auf mehrere Sekunden pro Token. Halten Sie eine kleine Swap-Datei als Schutz vor dem Out-of-Memory-Killer bereit. Dimensionieren Sie den RAM für das Tag, das Sie tatsächlich verwenden möchten.

Ollama installieren und ein benanntes Tag festlegen

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Das Installationsskript richtet einen systemd-Dienst ein. Dadurch steht der Server nach einem Reboot wieder zur Verfügung. Wenn Sie Ollama nicht als von root verwalteten Systemdienst ausführen möchten, beschreibt Ollama rootless unter Podman ausführen diesen Weg. Pullen Sie anschließend ein explizites Tag.

ollama pull muse-glimmer:30b
ollama list

Lesen Sie die Größenspalte in ollama list selbst und vergleichen Sie sie mit der aktuellen Tag-Liste auf der Modellseite. Veröffentlichten Tags werden hinzugefügt, sie werden umbenannt und entfernt. Eine in einer Anleitung angegebene Größe ist nur eine Momentaufnahme eines einzelnen Tages.

Schreiben Sie ollama pull muse-glimmer niemals auf einen Server, auf den Sie angewiesen sind. Ein nicht weiter qualifizierter Modellname wird zum latest-Tag aufgelöst. latest ist ein Zeiger, den der Herausgeber auf einen anderen Build verschieben kann. Ein routinemäßiger Pull ersetzt dann das Modell unter Ihrem Agenten. Dadurch können sich Speicherbedarf und Verhalten ändern, ohne dass dies in Ihren Logs angekündigt wird. Schreiben Sie das Tag in Ihre Skripte, Unit-Dateien und Agent-Konfiguration. LLM mit Ollama auf einem VPS selbst hosten beschreibt die restliche Servereinrichtung.

Können Sie Muse Glimmer ohne GPU ausführen?

Ja, aber die Leistungsgrenze sollte klar benannt werden. Für die Generierung eines Tokens müssen die Modellgewichte aus dem Speicher gelesen werden. Die Geschwindigkeit hängt daher stärker von der Speicherbandbreite als von der Anzahl der vom Tarif zugesicherten vCPUs ab. Nach einigen Kernen bringen zusätzliche Kerne nur noch sehr wenig. Auf einem gemeinsam genutzten VPS wird diese Bandbreite mit allen anderen Mandanten auf dem Host geteilt. Ein 30B-Modell mit 4-bit erzeugt deshalb nur wenige Tokens pro Sekunde.

Übernehmen Sie dafür keine fremden Angaben, auch nicht meine. Messen Sie die Tokens pro Sekunde auf Ihrem eigenen System und entscheiden Sie anhand des Ergebnisses.

Das führt zu einer klaren Trennung bei den geeigneten Einsatzbereichen des Modells. Interaktiver Chat ist mühsam, weil Sie schneller lesen, als der Server schreibt, und jede Antwort mit einer langen Wartezeit beginnt. Hintergrundaufgaben für Agents funktionieren gut, weil es bei einer unbeaufsichtigten Aufgabe über zehn Minuten nicht darauf ankommt, dass sie langsam läuft. Genau diesen Anwendungsfall beschreibt Meta für dieses Modell.

Wenn Sie interaktive Geschwindigkeit benötigen, gibt es zwei ehrliche Antworten: eine GPU oder eine gehostete API. Ermitteln Sie den Break-even-Punkt zwischen einem GPU-VPS und API-Tokens, bevor Sie etwas mieten. Was ein GPU-VPS tatsächlich bietet beschreibt, was Sie kaufen. Für die allgemeinere Frage, welches Modell auf einen bestimmten Server passt, beginnen Sie mit Welche Modelle Sie selbst hosten können. Ein ähnlich großes Qwen-Modell auf einem VPS ausführen ist der beste Vergleich in dieser Größenklasse.

Warum vergisst es Inhalte lange vor 128K Tokens?

Das standardmäßige Kontextfenster von Ollama umfasst unabhängig von der Modellunterstützung 4096 Tokens. Dieser Standardwert ist im FAQ von Ollama mit Stand August 2026 dokumentiert. Der Tag weist zwar 128K aus, aber der Server übergibt dem Modell 4096, sofern Sie nichts anderes festlegen. Deshalb verliert ein langes Agentenprotokoll die frühen Dialogabschnitte, und das Modell wirkt, als hätte es sein Gedächtnis verloren.

Erhöhen Sie den Wert auf dem Server für jede Anfrage:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

In einer interaktiven Sitzung ändert /set parameter num_ctx 32768 den Wert nur für diese Sitzung. Über die API senden Sie num_ctx in den Anfrageoptionen.

Jeder zusätzliche Kontext-Token benötigt zusätzlich zu den Gewichten Arbeitsspeicher. Fordern Sie auf einem System, das nur für die Gewichte dimensioniert ist, den vollständigen Kontext von 128K an, schlägt das Laden fehl oder fällt auf eine langsamere Variante zurück. Erhöhen Sie den Wert schrittweise und führen Sie nach jedem Schritt ollama ps aus. Funktionsweise von num_ctx und der Kontextlänge in Ollama erläutert die Berechnung.

Stärke des Schlussfolgerns: low, medium, high und xhigh

Meta dokumentiert vier Stufen der Schlussfolgerungsstärke für Muse Glimmer: von low bis xhigh. Für komplexe Programmier- und Agentenaufgaben werden die beiden höheren Stufen empfohlen. In Ollama wird diese Einstellung über den Parameter think gesteuert. Verwenden Sie --think= in der Befehlszeile oder senden Sie think im API-Body.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

In einer interaktiven Sitzung können Sie die Einstellung mit /set think und /set nothink umschalten. Laut der Ollama-Dokumentation akzeptieren die meisten Modelle entweder einen booleschen Wert oder eine Stufe wie low, medium oder high. Einige Modelle akzeptieren max für die höchste verfügbare Stufe. Welche exakten Zeichenfolgen dieses Modell akzeptiert, steht auf seiner Modellseite. Lesen Sie diese Seite, statt die Werte zu erraten, und testen Sie einen Wert zunächst manuell, bevor Sie ihn in einen Agenten integrieren.

Auf einem System, das nur eine CPU verwendet, wirkt sich diese Einstellung deutlich aus. Eine höhere Stufe erzeugt mehr Denktokens, bevor das erste Wort der Antwort erscheint. Ein Denktoken benötigt genauso viel reale Zeit wie ein Antworttoken. Verwenden Sie für Routineaufgaben die Stufe low.

Das Modell für einen ständig aktiven Agenten geladen halten

Ollama entlädt ein nicht verwendetes Modell standardmäßig nach fünf Minuten. Bei einem Agenten, der alle zehn Minuten ausgeführt wird, bedeutet das, dass bei jedem einzelnen Lauf erneut ein vollständiges Modell mit 18 GB von der Festplatte geladen werden muss. Auf einem VPS mit netzwerkgebundenem Speicher dauert dieser Ladevorgang nicht lange. Halten Sie das Modell stattdessen im Arbeitsspeicher.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Ein negativer Wert hält das Modell resident, bis es durch einen anderen Vorgang entladen wird. keep_alive in einer API-Anforderung überschreibt den Serverstandard für diesen einzelnen Aufruf. Der Preis dafür ist eindeutig: Der Arbeitsspeicher bleibt belegt, solange nichts ausgeführt wird. Diese Einstellung eignet sich daher für einen Server, der für den Agenten reserviert ist. Ein Ollama-Modell geladen halten beschreibt die verschiedenen Varianten.

Einen Coding-Agent auf das Modell ansetzen

Ollama stellt unter http://127.0.0.1:11434/v1 eine mit OpenAI kompatible API bereit. Die meisten Agent-Tools verbinden sich über eine Basis-URL und einen beliebigen nicht leeren API-Schlüssel. Auf der Ollama-Seite zu Muse Glimmer ist außerdem eine Startabkürzung dokumentiert, die einen unterstützten Agent mit einem lokalen Modell in einem Befehl verbindet. Auch dort sollten Sie das Tag fest vorgeben.

ollama launch claude --model muse-glimmer:30b

Agents senden große Prompts. Dateiinhalte, Tool-Ausgaben und ein wachsendes Transkript werden zusammen als Eingabetokens verarbeitet. Auf einem CPU-System ist die Prompt-Verarbeitung der belastende Teil, noch bevor die Generierung beginnt. Setzen Sie die Kontextgröße so niedrig wie es die Aufgabe erlaubt. Einen Coding-Agent mit Ollama verbinden behandelt die Client-Seite. Einen Coding-Agent auf einer VPS betreiben behandelt das System, auf dem er läuft. Agent-Kosten auf einer VPS kontrollieren behandelt den Betrieb über den gesamten Tag.

Die Verarbeitung von Bildeingaben funktioniert auf dieselbe Weise. Die Ollama-API erwartet Bilder im Feld images einer Nachricht. Ein reiner Text-Client sendet daher niemals ein Bild, unabhängig davon, wie leistungsfähig der Perception-Encoder ist.

Port 11434 nicht öffnen

Die Ollama API bietet keine Authentifizierung. Wenn Sie OLLAMA_HOST=0.0.0.0:11434 setzen, um von Ihrem Laptop darauf zuzugreifen, stellen Sie einen nicht authentifizierten Model Runner ins öffentliche Internet. Jeder, der ihn findet, kann Modelle auf Ihre Festplatte laden und alle Daten lesen, die Ihr Agent darüber sendet. Lassen Sie den Dienst an localhost gebunden und verwenden Sie stattdessen einen Tunnel.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

Ollama API-Endpunkt absichern beschreibt die geeigneten Optionen, darunter einen Reverse Proxy, der Anmeldedaten anfordert.

Was fehlschlägt und was Sie sehen

Der Pull-Vorgang bricht teilweise ab. Ursache ist der Speicherplatz. Führen Sie df -h für das Modellverzeichnis aus. Ein 57 GB großes bf16-Build passt nicht auf ein Root-Volume mit 40GB. Zwei 8-Bit-Tags passen dort ebenfalls nicht nebeneinander.

Das Modell wird geladen, anschließend beendet sich der Prozess. Ursache ist ein Speichermangel. dmesg -T protokolliert, wie der Kernel-Out-of-Memory-Killer einen Prozess auswählt. journalctl -u ollama -n 100 zeigt dieselben Ereignisse aus Sicht des Dienstes. Verwenden Sie einen kleineren Tag oder ein kleineres num_ctx. Mehr Swap ist keine Lösung.

Die Verarbeitung dauert mehrere Sekunden pro Token. Führen Sie vmstat 1 aus und beobachten Sie die Spalten si und so. Anhaltende Swap-Aktivität bedeutet, dass die Gewichte nicht in den RAM passen und das System sie während der Verarbeitung wieder von der Festplatte liest.

Ein Tag, der letzte Woche funktioniert hat, ist nicht mehr verfügbar. Tag-Listen ändern sich. Lesen Sie die Modellseite erneut, pinnen Sie den aktuellen Tag und dokumentieren Sie den Tag-Namen an einer Stelle, die Sie wiederfinden.

Prüfen Sie die Größen vor dem Pull-Vorgang selbst erneut

Die Größen in der Tabelle wurden am 16 August 2026 von der Tag-Seite des Modells abgelesen. Eine veröffentlichte Tag-Liste ist keine Garantie. Lesen Sie die aktuelle Liste auf der Modellseite und prüfen Sie anschließend, was tatsächlich auf Ihrer Festplatte gespeichert wurde:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama speichert Modellebenen als gemeinsam verwendete Blobs. Zwei Tags mit einer gemeinsamen Ebene belegen daher nicht doppelt so viel Speicherplatz. Vergleichen Sie die Ausgabe von du mit der veröffentlichten Größe und planen Sie den Speicherplatz anhand des größeren Werts.

FAQ

Wie viel RAM benötigt Muse Glimmer auf einem VPS?

Gehen Sie von der Tag-Größe aus und addieren Sie das Kontextfenster. Der Standard-Tag wird am 16 August 2026 mit etwa 18 GB angegeben. Ein System mit 16GB kann ihn daher überhaupt nicht aufnehmen. Ein System mit 24GB hält ihn mit wenig verbleibendem Speicher für den Kontext. Betrachten Sie das als Ausgangspunkt, nicht als endgültige Antwort. Rufen Sie den Tag ab, laden Sie ihn einmal und führen Sie anschließend ollama ps und free -h auf Ihrem eigenen System aus. Lesen Sie Ihre eigenen Werte ab. Ein längerer Kontext und parallele Anfragen benötigen zusätzlich zu den Gewichten weiteren Speicher.

Kann ich Muse Glimmer ohne GPU ausführen?

Ja. Das Modell wird auf einem VPS ausschließlich mit der CPU geladen und beantwortet Anfragen. Die Generierungsgeschwindigkeit wird eher durch die Speicherbandbreite als durch die Anzahl der CPU-Kerne begrenzt. Auf einem gemeinsam genutzten Host wird diese Bandbreite außerdem geteilt. Erwarten Sie bei 4-bit daher nur wenige Tokens pro Sekunde. Das ist für Hintergrundaufgaben eines unbeaufsichtigten Agenten verwendbar, für interaktiven Chat jedoch langsam. Führen Sie während einer Anfrage ollama ps aus und lesen Sie die Prozessorspalte, um zu bestätigen, wo die Verarbeitung stattfindet.

Sind die MLX-Tags auf einem Linux-VPS sinnvoll?

Nein. Jeder Tag, der mlx im Namen enthält, wurde für Ollamas MLX-Engine erstellt. Dabei handelt es sich um das Backend für Apple Silicon. Auf einem x86-Linux-Server sind diese Tags große Downloads, die Sie nicht ausführen können. Verwenden Sie den einfachen 30b-Tag oder einen anderen Tag ohne MLX. Ignorieren Sie die Benchmarks für Apple-Hardware, die zu den MLX-Builds gehören.

Warum vergisst das Modell Dinge lange vor 128K Tokens?

Ollamas Standard-Kontextfenster umfasst unabhängig von der Modellunterstützung 4096 Tokens. Der Server kürzt daher lange Unterhaltungen, bevor das Modell sie überhaupt sieht. Setzen Sie auf dem Server OLLAMA_CONTEXT_LENGTH, für eine einzelne Sitzung /set parameter num_ctx oder senden Sie num_ctx in den API-Anfrageoptionen. Der Speicherbedarf steigt dadurch ebenfalls. Erhöhen Sie den Wert daher schrittweise und prüfen Sie jedes Mal ollama ps.

Sollte ich den Tag festlegen oder einfach latest verwenden?

Legen Sie ihn fest. muse-glimmer ohne Tag wird zu latest aufgelöst. Dabei handelt es sich um einen Verweis, den der Herausgeber jederzeit auf einen anderen Build verschieben kann. Dadurch kann ein routinemäßiger Pull das von Ihrem Agenten verwendete Modell ändern. Schreiben Sie muse-glimmer:30b in Skripte, Unit-Dateien und die Agent-Konfiguration. Prüfen Sie die Tag-Liste auf der Modellseite, bevor Sie den Tag festlegen, da sich veröffentlichte Tags ändern.