Kebutuhan RAM VPS untuk Menjalankan Muse Glimmer 30B
Tag Muse Glimmer berukuran 17 GB hingga 59 GB. Hitung kebutuhan RAM dan disk VPS Linux sebelum pull, serta biaya inferensi dengan CPU saja.
Kebutuhan Muse Glimmer pada VPS
Muse Glimmer berjalan pada VPS Linux biasa tanpa GPU. Tag yang Anda unduh menentukan apakah model tersebut cukup dimuat di memori. Meta Superintelligence Labs merilis model ini pada 10 August 2026 dengan lisensi Apache 2.0: 30 billion parameter, context window 128K, dan perception encoder khusus dengan 1.8B parameter agar model dapat membaca gambar selain teks. Meta memosisikannya untuk agent lokal yang selalu aktif, bukan untuk chat, dengan tingkat kemampuan penalaran yang dapat Anda tentukan pada setiap request.
Tag Ollama yang dipublikasikan dan dibaca pada 16 August 2026 memiliki ukuran 17 GB hingga 59 GB. Rentang tersebut merupakan inti persoalan sizing. Ukuran tag default tercantum sekitar 18 GB. Jadi, VPS terkecil yang masih masuk akal jelas memerlukan RAM bebas lebih dari 18 GB. Ruang disk untuk mengunduh model dan memori untuk context window diperlukan di luar jumlah tersebut.
Tag muse-glimmer mana yang harus Anda pull?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama mencantumkan 11 tag untuk model ini yang bukan build Apple. Tag tersebut berisi 30 miliar bobot yang sama, tetapi disimpan dengan presisi numerik yang berbeda. Ukuran yang terlihat adalah ukuran yang Anda download. Ukuran tersebut juga kira-kira sama dengan kapasitas memori yang harus tersedia sebelum context ditambahkan.
Dua build 4-bit adalah yang berukuran kecil: 30b-nvfp4 sebesar 17 GB dan 30b-q4_K_M sebesar 18 GB. Tag default 30b tercantum dengan ukuran yang sama seperti build q4_K_M. Build 8-bit, 30b-q8_0 dan 30b-mxfp8, berukuran sekitar 31 GB. 30b-bf16 adalah release 16-bit tanpa kuantisasi, dengan ukuran 57 GB. Ukuran ini melebihi RAM yang ditawarkan sebagian besar server sewaan dengan harga yang wajar untuk proyek sampingan.
Tag -dflash adalah build yang sama dengan dukungan DFlash. Masing-masing tercantum dengan ukuran yang lebih besar daripada pasangan tanpa DFlash. Ollama menjelaskan DFlash sebagai fitur untuk meningkatkan kecepatan dan mendemonstrasikannya pada Apple Silicon serta GPU desktop. Pada VPS yang hanya menggunakan CPU, Anda harus menyediakan ukuran tambahan tersebut dalam memori nyata untuk fitur yang diukur pada perangkat keras lain. Jadi, mulailah dengan tag tanpa DFlash dan ubah satu hal setiap kali.
Mulailah dengan 4-bit, kecuali Anda memiliki alasan khusus untuk tidak menggunakannya. Peralihan dari 4-bit ke 8-bit kira-kira menggandakan jumlah byte yang harus dibaca CPU untuk setiap token yang dihasilkan. Akibatnya, throughput menurun sementara penggunaan memori meningkat. Pertukaran tersebut dibahas dalam biaya nyata kuantisasi q4, q8, dan fp16, dan pada server yang hanya menggunakan CPU, jawaban singkatnya adalah bahwa build 4-bit adalah satu-satunya pilihan yang layak untuk digunakan sebagai awal.
Mengapa tag MLX tidak berfungsi di server Linux
MLX adalah framework array milik Apple, sedangkan engine MLX pada Ollama adalah backend untuk Apple Silicon. Setiap tag yang memuat mlx dalam namanya dibuat untuk engine dan perangkat keras tersebut. Pada VPS Linux x86, tag itu berukuran puluhan gigabyte, tidak dapat dijalankan, dan hanya memenuhi disk. Angka kecepatan dalam pengumuman yang diukur pada Mac juga berlaku untuk tag tersebut. Angka itu tidak menggambarkan kinerja server Anda. Saat membaca daftar tag pada halaman model, keluarkan semua nama yang memuat mlx terlebih dahulu. Setelah itu, tentukan ukurannya dari tag yang tersisa.
Berapa kebutuhan RAM dan disk yang sebenarnya?
Ada dua komponen yang menggunakan memori, dan hanya satu di antaranya yang ditentukan oleh ukuran tag. Bobot model ditetapkan oleh tag yang Anda pull. KV cache, yaitu state per token yang disimpan model untuk percakapan, bertambah sesuai panjang context yang Anda konfigurasi. Dokumentasi Ollama sendiri menyebutkan bahwa melayani request secara paralel akan mengalikan context dengan jumlah request yang sedang diproses. Jadi, server yang menjawab dua agent secara bersamaan membutuhkan lebih banyak memori daripada server yang sama saat hanya menjawab satu agent.
Jangan mengambil angka RAM dari panduan mana pun, termasuk panduan ini. Pull tag tersebut, kirim satu prompt, lalu saat model masih berada di memori jalankan dua perintah berikut.
ollama ps
free -hollama ps menampilkan apa yang sedang dimuat dan pembagian pekerjaan antara CPU dan GPU. free -h menampilkan memori yang masih tersisa. Kedua output tersebut dari server Anda sendiri lebih akurat daripada tabel yang dipublikasikan, karena sudah mencakup pengaturan context, quantisation, dan semua proses lain yang sedang berjalan di server.
Disk adalah bagian yang lebih mudah. Ollama menyimpan model di /usr/share/ollama/.ollama/models pada Linux. Pada sebagian besar image VPS, direktori ini berada di root filesystem. Volume root berukuran 40GB tidak akan menampung build bf16 berukuran 57 GB. Volume tersebut juga tidak akan menampung dua tag 8-bit secara berdampingan. Pindahkan store ke volume yang sudah di-mount sebelum melakukan pull apa pun.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaDirektori tersebut harus dimiliki oleh user ollama, karena service berjalan sebagai ollama dan menulis blob di sana sebagai user tersebut. Jika pull gagal karena masalah permission, journalctl -u ollama -n 50 menampilkan penyebabnya.
Untuk swap, perhatikan satu hal penting: swap tidak memungkinkan Anda menjalankan tag yang lebih besar. Proses generation mengakses bobot untuk setiap token yang dihasilkan. Karena itu, bobot yang berada di swap akan dibaca kembali dari disk berulang kali, vmstat 1 menampilkan kolom si dan so yang sibuk, dan output melambat hingga hitungan detik per token. Pertahankan swap file kecil sebagai perlindungan terhadap out of memory killer. Sediakan RAM sesuai tag yang benar-benar ingin Anda gunakan.
Instal Ollama dan tetapkan tag bernama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaSkrip instalasi menyiapkan service systemd, sehingga server kembali aktif setelah reboot. Jika Anda tidak ingin menjalankannya sebagai service sistem yang dikelola oleh root, menjalankan Ollama tanpa root dengan Podman membahas pendekatan tersebut. Selanjutnya, pull tag yang eksplisit.
ollama pull muse-glimmer:30b
ollama listBaca sendiri kolom ukuran pada ollama list, lalu bandingkan dengan daftar tag saat ini pada halaman model. Tag yang dipublikasikan dapat ditambahkan, diganti nama, atau dihapus. Ukuran dalam panduan hanya merupakan snapshot pada satu hari.
Jangan pernah menulis ollama pull muse-glimmer pada server yang Anda andalkan. Nama model tanpa tag akan mengarah ke tag latest, sedangkan latest adalah pointer yang dapat dipindahkan oleh publisher ke build lain. Pull rutin kemudian mengganti model yang digunakan agent Anda, dengan kebutuhan memori dan perilaku yang berbeda, tanpa pemberitahuan apa pun dalam log. Tulis tag tersebut dalam skrip, file unit, dan konfigurasi agent Anda. Self-hosting LLM dengan Ollama pada VPS membahas konfigurasi server lainnya.
Apakah Muse Glimmer dapat dijalankan tanpa GPU?
Ya, tetapi batas kinerjanya perlu dijelaskan secara langsung. Untuk menghasilkan satu token, sistem harus membaca bobot model dari memori. Karena itu, kecepatan ditentukan oleh bandwidth memori, bukan oleh jumlah vCPU yang tercantum dalam paket. Setelah melewati beberapa core, penambahan core hanya memberikan sedikit peningkatan. Pada VPS bersama, bandwidth tersebut digunakan bersama oleh semua tenant lain pada host. Akibatnya, model 30B dengan presisi 4-bit hanya menghasilkan beberapa token per detik.
Jangan menerima begitu saja angka dari siapa pun, termasuk saya. Ukur token per detik pada server Anda sendiri lalu ambil keputusan berdasarkan hasil yang Anda lihat.
Hasilnya menunjukkan perbedaan nyata dalam jenis pekerjaan yang sesuai untuk model ini. Chat interaktif terasa lambat karena Anda membaca lebih cepat daripada server menulis, dan setiap balasan diawali jeda yang panjang. Pekerjaan agent di latar belakang tetap sesuai karena tugas yang berjalan tanpa pengawasan selama sepuluh menit tidak terpengaruh oleh kecepatan yang rendah. Beban kerja kedua itulah yang dijelaskan Meta untuk model ini.
Jika Anda memerlukan kecepatan interaktif, ada dua jawaban yang jujur: GPU atau API terkelola. Hitung titik impas antara GPU VPS dan token API sebelum menyewa apa pun, dan pahami manfaat sebenarnya dari GPU VPS menjelaskan apa yang Anda beli. Untuk pertanyaan yang lebih luas tentang kapasitas model yang dapat dijalankan pada server tertentu, mulai dari model yang dapat Anda host sendiri, lalu menjalankan model Qwen dengan ukuran serupa pada VPS sebagai perbandingan terdekat dalam kelas ukuran ini.
Mengapa model melupakan hal-hal jauh sebelum 128K token?
Karena ukuran context window default Ollama adalah 4096 token, terlepas dari ukuran yang didukung model. Default tersebut tercantum dalam FAQ Ollama sendiri per Agustus 2026. Tag mengiklankan 128K, tetapi server memberikan 4096 kepada model sampai Anda menentukan nilai lain. Akibatnya, transkrip agent yang panjang kehilangan percakapan awal dan model terlihat seperti mengalami amnesia.
Naikkan nilainya di server untuk setiap request:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Dalam sesi interaktif, /set parameter num_ctx 32768 mengubah nilai tersebut hanya untuk sesi itu. Melalui API, kirim num_ctx dalam opsi request.
Setiap token context tambahan membutuhkan memori di luar memori untuk weights. Jika Anda meminta 128K penuh pada mesin yang kapasitasnya hanya cukup untuk weights, proses pemuatan akan gagal atau beralih ke konfigurasi yang lebih lambat. Naikkan nilainya secara bertahap dan jalankan ollama ps setelah setiap tahap. Cara kerja num_ctx dan panjang context di Ollama menjelaskan perhitungannya.
Kekuatan penalaran: low, medium, high, dan xhigh
Dokumentasi Meta menetapkan empat tingkat kekuatan penalaran untuk Muse Glimmer, dari low hingga xhigh, dan merekomendasikan dua tingkat tertinggi untuk tugas coding dan agen yang kompleks. Di Ollama, pengaturan ini menggunakan parameter think. Gunakan --think= pada command line, atau kirim think dalam body API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Dalam sesi interaktif, /set think dan /set nothink digunakan untuk mengubah pengaturan ini. Dokumentasi Ollama menyatakan bahwa sebagian besar model menerima boolean atau tingkat seperti low, medium, atau high. Beberapa model juga menerima max untuk tingkat tertinggi yang tersedia. String yang diterima model ini secara tepat tercantum pada halaman modelnya. Baca halaman tersebut, jangan menebak, dan uji salah satunya secara manual sebelum menggunakannya dalam agen.
Pada mesin yang hanya menggunakan CPU, pengaturan ini berdampak besar. Kekuatan yang lebih tinggi berarti lebih banyak thinking token dibuat sebelum kata pertama jawaban muncul. Waktu proses setiap thinking token sama dengan waktu proses setiap answer token. Gunakan pengaturan low untuk pekerjaan rutin.
Pertahankan model tetap dimuat untuk agent yang selalu aktif
Secara default, Ollama membongkar model yang menganggur setelah lima menit. Untuk agent yang berjalan setiap sepuluh menit, ini berarti memuat 18 GB penuh dari disk pada setiap eksekusi. Pada VPS dengan penyimpanan terpasang melalui jaringan, proses tersebut tidak berlangsung cepat. Pertahankan model di memori.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Nilai negatif mempertahankan model di memori sampai ada proses yang membongkarnya, sedangkan keep_alive dalam permintaan API mengesampingkan nilai default server untuk satu pemanggilan tersebut. Konsekuensinya jelas: RAM tetap terpakai saat tidak ada aktivitas. Karena itu, gunakan pengaturan ini pada server yang didedikasikan untuk agent. Mempertahankan model Ollama tetap dimuat membahas variasinya.
Arahkan coding agent ke sana
Ollama menyediakan API yang kompatibel dengan OpenAI pada http://127.0.0.1:11434/v1, sehingga sebagian besar alat agent dapat terhubung menggunakan base URL dan API key yang tidak kosong. Halaman Muse Glimmer milik Ollama juga mendokumentasikan pintasan peluncuran yang menghubungkan agent yang didukung ke model lokal dalam satu perintah. Anda juga harus menetapkan tag di sana.
ollama launch claude --model muse-glimmer:30bAgent mengirim prompt berukuran besar. Isi file, output alat, dan transkrip yang terus bertambah semuanya menjadi token input. Pada komputer berbasis CPU, pemrosesan prompt menjadi bagian yang paling membebani sebelum proses generasi dimulai. Atur konteks sekecil yang diizinkan oleh tugas. Mengarahkan coding agent ke Ollama membahas sisi klien, menjalankan coding agent pada VPS membahas server tempat agent berjalan, dan mengendalikan biaya agent pada VPS membahas hal yang terjadi saat agent berjalan sepanjang hari.
Input gambar bekerja dengan cara yang sama. API Ollama menerima gambar pada field images dalam sebuah pesan. Karena itu, klien yang hanya mendukung teks tidak akan pernah mengirim gambar, sehebat apa pun encoder persepsinya.
Jangan membuka port 11434
API Ollama tidak memiliki autentikasi. Mengatur OLLAMA_HOST=0.0.0.0:11434 agar dapat diakses dari laptop Anda akan menempatkan model runner tanpa autentikasi di Internet publik. Siapa pun yang menemukannya dapat memuat model ke disk Anda dan membaca apa pun yang dikirim agent Anda melalui API tersebut. Biarkan API tetap terikat ke localhost, lalu gunakan tunnel.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsMengamankan endpoint API Ollama membahas opsi yang tepat, termasuk reverse proxy yang meminta kredensial.
Hal yang dapat gagal dan hal yang akan Anda lihat
Proses pull berhenti di tengah. Penyebabnya adalah disk. Jalankan df -h pada direktori model. Build bf16 berukuran 57 GB tidak muat pada volume root 40GB. Dua tag 8-bit yang disimpan berdampingan juga tidak muat.
Model berhasil dimuat, lalu proses berhenti. Penyebabnya adalah kehabisan memori. dmesg -T mencatat kernel memilih proses untuk dihentikan oleh out-of-memory killer. journalctl -u ollama -n 100 menampilkan sisi service dari kejadian yang sama. Gunakan tag yang lebih kecil atau num_ctx yang lebih kecil. Menambah swap bukan solusinya.
Proses berjalan dengan kecepatan beberapa detik per token. Jalankan vmstat 1 dan pantau kolom si serta so. Aktivitas swap yang terus berlangsung berarti bobot model tidak muat di RAM. Sistem membaca ulang bobot tersebut dari disk saat proses berjalan.
Tag yang berfungsi minggu lalu sudah tidak tersedia. Daftar tag dapat berubah. Baca kembali halaman model, gunakan tag yang saat ini tersedia, lalu catat nama tag tersebut di tempat yang dapat Anda periksa lagi.
Periksa kembali ukurannya sendiri sebelum menjalankan pull
Ukuran pada tabel dibaca dari halaman tag model pada 16 August 2026. Daftar tag yang dipublikasikan bukan jaminan. Baca daftar terbaru pada halaman model, lalu pastikan ukuran yang benar-benar tersimpan di disk:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama menyimpan layer model sebagai blob bersama. Karena itu, dua tag yang menggunakan layer yang sama tidak membutuhkan ruang disk dua kali lipat. Bandingkan hasil du dengan ukuran yang dipublikasikan, lalu rencanakan kapasitas disk berdasarkan ukuran yang lebih besar.
FAQ
Berapa RAM yang dibutuhkan Muse Glimmer pada VPS?
Mulai dari ukuran tag, lalu tambahkan kebutuhan context window. Tag default tercatat berukuran sekitar 18 GB pada 16 August 2026, sehingga server 16GB sama sekali tidak dapat menampungnya dan server 24GB hanya menyisakan sedikit ruang untuk context. Anggap ini sebagai titik awal, bukan jawaban akhir. Pull tag tersebut, load sekali, lalu jalankan ollama ps dan free -h pada server Anda sendiri untuk membaca angka yang sebenarnya. Context yang lebih panjang dan request paralel sama-sama menambah penggunaan memori di luar bobot model.
Apakah Muse Glimmer dapat dijalankan tanpa GPU?
Ya. Model ini dapat di-load dan memberikan respons hanya dengan CPU pada VPS. Kecepatan generasi dibatasi oleh bandwidth memori, bukan jumlah core. Pada shared host, bandwidth tersebut digunakan bersama. Jadi, perkirakan hanya beberapa token per detik pada 4-bit. Kecepatan ini masih dapat digunakan untuk pekerjaan agent di latar belakang yang berjalan tanpa pengawasan, tetapi tidak nyaman untuk chat interaktif. Jalankan ollama ps selama request berlangsung, lalu baca kolom processor untuk memastikan tempat pekerjaan tersebut dijalankan.
Apakah tag MLX berguna pada VPS Linux?
Tidak. Setiap tag yang namanya mengandung mlx dibuat untuk engine MLX milik Ollama, yaitu backend Apple Silicon-nya. Pada server Linux x86, tag tersebut hanya merupakan unduhan besar yang tidak dapat Anda jalankan. Gunakan tag biasa 30b, atau tag non-MLX lainnya. Abaikan benchmark perangkat keras Apple yang terkait dengan build MLX tersebut.
Mengapa model melupakan sesuatu jauh sebelum 128K token?
Karena context window default Ollama adalah 4096 token, terlepas dari kapasitas yang didukung model. Akibatnya, server memotong percakapan panjang sebelum model menerimanya. Atur OLLAMA_CONTEXT_LENGTH pada server, atau /set parameter num_ctx untuk satu session, atau kirim num_ctx dalam opsi request API. Penggunaan memori akan meningkat seiring pengaturan tersebut. Karena itu, naikkan nilainya secara bertahap dan periksa ollama ps setiap kali.
Sebaiknya saya menetapkan tag tertentu atau cukup menggunakan latest?
Tetapkan tag tertentu. muse-glimmer tanpa tag akan diarahkan ke latest. Nilai tersebut adalah pointer yang dapat dipindahkan publisher ke build lain kapan saja. Akibatnya, pull rutin dapat mengubah model yang dijalankan agent Anda. Tulis muse-glimmer:30b dalam script, unit file, dan konfigurasi agent. Periksa daftar tag pada halaman model sebelum menetapkannya, karena tag yang dipublikasikan dapat berubah.