Cara Menjalankan Meta Muse Glimmer 30B di VPS Linux
Pelajari spesifikasi RAM dan disk yang dibutuhkan untuk menjalankan model Meta Muse Glimmer 30B. Ketahui estimasi biaya inferensi CPU untuk ukuran tag 17GB hingga 59GB.
Kebutuhan Muse Glimmer pada VPS
Muse Glimmer berjalan pada VPS Linux standar tanpa GPU, dan tag yang Anda tarik menentukan apakah model tersebut muat di dalam memori. Meta Superintelligence Labs merilis model ini pada 10 Agustus 2026 di bawah lisensi Apache 2.0: 30 miliar parameter, jendela konteks 128K, dan encoder persepsi 1,8B parameter khusus agar dapat membaca gambar bersamaan dengan teks. Meta memposisikan model ini untuk agen lokal yang selalu aktif, bukan untuk percakapan, dengan kekuatan penalaran yang Anda atur per permintaan.
Tag Ollama yang dipublikasikan, dibaca pada 16 Agustus 2026, berkisar dari 17 GB hingga 59 GB. Rentang tersebut adalah inti dari masalah penentuan ukuran. Tag default tercatat sekitar 18 GB, sehingga server terkecil yang masuk akal jelas harus memiliki lebih dari 18 GB RAM kosong. Ruang disk untuk pengunduhan dan memori untuk jendela konteks merupakan kebutuhan tambahan di luar kapasitas tersebut.
Tag muse-glimmer mana yang harus Anda tarik?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama mencantumkan 11 tag untuk model ini yang bukan merupakan build Apple. Tag tersebut menyimpan bobot 30 miliar yang sama namun dengan presisi numerik yang berbeda. Ukuran yang Anda lihat adalah ukuran unduhan, dan itu juga merupakan perkiraan jumlah memori yang harus tersedia sebelum konteks apa pun ditambahkan.
Dua build 4-bit adalah yang berukuran kecil: 30b-nvfp4 sebesar 17 GB dan 30b-q4_K_M sebesar 18 GB. Tag default 30b tercantum dengan ukuran yang sama dengan build q4_K_M. Build 8-bit, 30b-q8_0 dan 30b-mxfp8, berada di kisaran 31 GB. 30b-bf16 adalah rilis 16-bit tanpa kuantisasi sebesar 57 GB, yang membutuhkan RAM lebih besar daripada yang ditawarkan kebanyakan server sewaan dengan harga yang masuk akal untuk proyek sampingan.
Tag -dflash adalah build yang sama dengan dukungan DFlash, dan masing-masing tercantum dengan ukuran yang lebih besar daripada versi standarnya. Ollama mendeskripsikan DFlash sebagai fitur kecepatan dan mendemonstrasikannya pada Apple Silicon serta GPU desktop. Pada VPS yang hanya menggunakan CPU, Anda akan membayar ukuran ekstra tersebut dalam bentuk memori nyata untuk fitur yang diukur pada perangkat keras lain, jadi mulailah dengan tag standar dan ubah satu hal pada satu waktu.
Mulailah dari 4-bit kecuali Anda memiliki alasan khusus untuk tidak melakukannya. Beralih dari 4-bit ke 8-bit kira-kira melipatgandakan jumlah byte yang harus dibaca CPU untuk setiap token yang dihasilkan, sehingga throughput menurun sementara penggunaan memori meningkat. Pertukaran tersebut adalah subjek dari apa biaya sebenarnya dari kuantisasi q4, q8, dan fp16, dan pada server CPU, jawaban singkatnya adalah build 4-bit merupakan satu-satunya yang layak untuk dicoba terlebih dahulu.
Mengapa tag MLX tidak berfungsi pada server Linux
MLX adalah kerangka kerja array milik Apple, dan mesin MLX pada Ollama merupakan backend untuk Apple Silicon. Tag apa pun yang mengandung mlx pada namanya dibuat khusus untuk mesin dan perangkat keras tersebut. Pada VPS Linux x86, tag ini hanyalah unduhan berukuran puluhan gigabyte yang tidak dapat Anda jalankan dan hanya akan memakan ruang penyimpanan tanpa fungsi apa pun. Angka kecepatan dalam pengumuman yang diukur pada Mac merujuk pada tag tersebut, sehingga tidak mencerminkan performa server Anda. Saat membaca daftar tag pada halaman model, saring terlebih dahulu semua nama yang mengandung mlx, kemudian pilih ukuran dari sisa daftar yang ada.
Berapa banyak RAM dan disk yang sebenarnya dibutuhkan?
Dua hal mengonsumsi memori, dan hanya satu di antaranya yang merupakan ukuran tag. Bobot ditentukan oleh tag yang Anda tarik. KV cache, yaitu status per token yang disimpan model untuk percakapan, akan bertambah seiring dengan panjang konteks yang Anda konfigurasikan. Dokumentasi resmi Ollama mencatat bahwa melayani permintaan paralel akan melipatgandakan konteks sesuai jumlah permintaan yang sedang diproses, sehingga server yang menjawab dua agen sekaligus membutuhkan memori lebih besar daripada server yang menjawab satu agen.
Jangan berpatokan pada angka RAM dari panduan mana pun, termasuk panduan ini. Tarik tag tersebut, kirim satu prompt, dan saat model masih dimuat di memori, jalankan dua perintah berikut.
ollama ps
free -hollama ps menunjukkan apa yang sedang dimuat saat ini dan bagaimana beban kerja dibagi antara CPU dan GPU. free -h menunjukkan sisa memori yang tersedia. Kedua output tersebut di server Anda sendiri jauh lebih akurat daripada tabel publik mana pun, karena output tersebut sudah mencakup pengaturan konteks, kuantisasi, dan semua proses lain yang sedang dijalankan server.
Disk adalah bagian yang lebih mudah. Ollama menyimpan model di /usr/share/ollama/.ollama/models pada Linux, yang biasanya berada di sistem berkas root pada sebagian besar image VPS. Volume root sebesar 40GB tidak akan cukup untuk menampung build bf16 sebesar 57 GB, dan juga tidak akan cukup untuk menampung dua tag 8-bit secara berdampingan. Jika Anda belum pernah melihat apa yang sebenarnya ditulis saat proses pull, lokasi penyimpanan model Ollama dan cara memindahkannya menjelaskan direktori tersebut. Pindahkan penyimpanan ke volume yang di-mount sebelum Anda menarik model apa pun.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaUser ollama harus menjadi pemilik direktori tersebut, karena service berjalan sebagai ollama dan menulis blob di sana dengan hak akses user tersebut. Jika proses pull gagal karena masalah izin, journalctl -u ollama -n 50 adalah tempat di mana penyebabnya muncul.
Mengenai swap, satu pernyataan yang jelas: swap tidak memungkinkan Anda menjalankan tag yang lebih besar. Proses generasi mengakses bobot untuk setiap token yang dihasilkan, sehingga bobot yang berada di swap akan dibaca berulang kali dari disk. vmstat 1 akan menunjukkan kolom si dan so yang sibuk, dan output akan melambat hingga hitungan detik per token. Gunakan file swap kecil sebagai cadangan untuk mencegah out of memory killer. Sesuaikan ukuran RAM dengan tag yang benar-benar ingin Anda gunakan.
Menginstal Ollama dan menyematkan tag bernama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaSkrip instalasi menyiapkan service systemd, sehingga server akan aktif kembali setelah reboot. Jika Anda lebih memilih untuk tidak menjalankannya sebagai service sistem yang dikelola root, menjalankan Ollama tanpa root di bawah Podman membahas jalur tersebut. Setelah itu, tarik (pull) tag secara eksplisit.
ollama pull muse-glimmer:30b
ollama listBaca sendiri kolom ukuran di ollama list dan bandingkan dengan daftar tag saat ini di halaman model. Tag yang dipublikasikan dapat ditambahkan, diganti namanya, dan dihapus, sehingga ukuran dalam panduan hanyalah snapshot dari satu hari tertentu.
Jangan pernah menulis ollama pull muse-glimmer pada server yang Anda andalkan. Nama model mentah akan merujuk ke tag latest, dan latest adalah penunjuk yang dapat dipindahkan oleh penerbit ke build yang berbeda. Proses pull rutin kemudian akan mengganti model di bawah agen Anda, dengan kebutuhan memori dan perilaku yang berbeda, dan tidak ada catatan di log Anda yang memberitahukannya. Tuliskan tag tersebut di dalam skrip, file unit, dan konfigurasi agen Anda. Self-hosting LLM dengan Ollama di VPS membahas sisa pengaturan server lainnya.
Bisakah Anda menjalankan Muse Glimmer tanpa GPU?
Bisa, dan perlu ditegaskan mengenai batas kemampuannya. Menghasilkan satu token berarti membaca bobot model dari memori, sehingga kecepatan ditentukan oleh bandwidth memori, bukan oleh jumlah vCPU yang ditawarkan paket hosting Anda. Setelah melewati beberapa core, penambahan core tidak memberikan peningkatan yang berarti. Pada VPS bersama, bandwidth tersebut dibagi dengan setiap penyewa lain di host yang sama, sehingga model 30B pada 4-bit hanya menghasilkan sedikit token per detik.
Jangan terima angka dari siapa pun, termasuk angka saya. Ukur token per detik pada server Anda sendiri dan tentukan berdasarkan apa yang Anda lihat.
Hasilnya adalah perbedaan nyata dalam kegunaan model tersebut. Obrolan interaktif akan terasa lambat karena Anda membaca lebih cepat daripada server menulis, dan setiap balasan dimulai dengan jeda yang lama. Pekerjaan agen di latar belakang tidak masalah, karena tugas yang berjalan tanpa pengawasan selama sepuluh menit tidak terpengaruh oleh kecepatan yang lambat. Beban kerja kedua itulah yang tepat seperti yang dijelaskan Meta untuk model ini.
Jika Anda membutuhkan kecepatan interaktif, dua jawaban jujur adalah menggunakan GPU atau API yang di-host. Hitung titik impas antara VPS GPU dan token API sebelum Anda menyewa apa pun, dan apa yang sebenarnya Anda dapatkan dari VPS GPU menjelaskan apa yang Anda beli. Untuk pertanyaan yang lebih luas tentang kapasitas server tertentu, mulailah dari model mana yang bisa Anda self-host, dan menjalankan model Qwen dengan ukuran serupa di VPS adalah perbandingan terdekat dalam kelas ukuran ini. Jika angka yang Anda ukur ternyata terlalu lambat untuk digunakan, Nemotron 3.5 Lightning di VPS mengajukan pertanyaan RAM dan token per detik yang sama untuk model yang dibangun demi kecepatan, bukan ukuran.
Mengapa model melupakan informasi jauh sebelum mencapai 128K token?
Karena jendela konteks default Ollama adalah 4096 token, terlepas dari berapa banyak yang didukung oleh model tersebut. Default ini tercantum dalam FAQ resmi Ollama per Agustus 2026. Tag model mengiklankan 128K, namun server hanya memberikan 4096 token kepada model kecuali Anda menentukan sebaliknya. Akibatnya, transkrip agen yang panjang akan kehilangan bagian awal percakapan dan model tampak mengalami amnesia.
Tingkatkan nilai tersebut pada server untuk setiap permintaan:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Di dalam sesi interaktif, /set parameter num_ctx 32768 mengubah nilai tersebut hanya untuk sesi yang sedang berjalan. Melalui API, kirimkan num_ctx dalam opsi permintaan.
Setiap tambahan token konteks memakan memori di luar bobot model. Jika Anda meminta 128K penuh pada server yang kapasitas memorinya hanya cukup untuk bobot model, proses akan gagal atau beralih ke metode yang lebih lambat. Tingkatkan nilai secara bertahap dan jalankan ollama ps setelah setiap perubahan. Cara kerja num_ctx dan panjang konteks di Ollama menjelaskan perhitungan rincinya.
Kekuatan penalaran: low, medium, high, dan xhigh
Meta mendokumentasikan empat tingkat kekuatan penalaran untuk Muse Glimmer, mulai dari low hingga xhigh, dan merekomendasikan dua tingkat tertinggi untuk tugas pengodean yang kompleks dan tugas agen. Di Ollama, hal ini diatur melalui parameter think. Gunakan --think= pada baris perintah, atau kirim think di dalam body API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Di dalam sesi interaktif, /set think dan /set nothink dapat digunakan untuk mengubahnya. Dokumentasi Ollama menyatakan bahwa sebagian besar model menerima nilai boolean atau tingkat seperti low, medium, atau high, dan beberapa model menerima max untuk tingkat tertinggi yang tersedia. String spesifik apa yang diterima oleh model ini tercantum pada halaman modelnya, jadi bacalah halaman tersebut alih-alih menebak, dan cobalah secara manual sebelum Anda mengintegrasikannya ke dalam agen.
Pada mesin yang hanya menggunakan CPU, pengaturan ini sangat berpengaruh. Kekuatan yang lebih tinggi berarti lebih banyak token pemikiran yang dihasilkan sebelum kata pertama jawaban muncul, dan token pemikiran memakan waktu proses yang sama dengan token jawaban. Gunakan pengaturan low untuk pekerjaan rutin. Panjang jawaban juga memerlukan perhatian yang sama, jadi batasi balasan dengan num_predict alih-alih membiarkan satu respons yang bertele-tele menahan mesin yang lambat selama beberapa menit.
Menjaga model tetap dimuat untuk agen yang selalu aktif
Ollama secara default akan membongkar model yang tidak aktif setelah lima menit. Untuk agen yang berjalan setiap sepuluh menit, ini berarti Anda harus menanggung beban pemuatan sebesar 18 GB dari disk pada setiap eksekusi. Pada VPS dengan penyimpanan berbasis jaringan, proses pemuatan tersebut tidaklah cepat. Sebagai gantinya, kunci model tersebut di dalam memori.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Nilai negatif akan menjaga model tetap berada di memori sampai ada proses lain yang membongkarnya, dan keep_alive dalam permintaan API akan menimpa pengaturan default server untuk panggilan tersebut. Konsekuensinya jelas: RAM akan tetap terpakai meskipun tidak ada aktivitas, jadi pengaturan ini ditujukan untuk server yang didedikasikan bagi agen tersebut. Menjaga model Ollama tetap dimuat membahas variasi pengaturan ini.
Mengarahkan coding agent ke sana
Ollama menyediakan API yang kompatibel dengan OpenAI di http://127.0.0.1:11434/v1, sehingga sebagian besar alat agen dapat terhubung dengan URL dasar dan API key apa pun yang tidak kosong. Halaman Muse Glimmer milik Ollama juga mendokumentasikan pintasan peluncuran yang menghubungkan agen yang didukung ke model lokal dalam satu perintah, dan Anda sebaiknya juga melakukan pin pada tag di sana.
ollama launch claude --model muse-glimmer:30bAgen mengirimkan prompt yang besar. Isi file, output alat, dan transkrip yang terus bertambah semuanya masuk sebagai token input, dan pada mesin berbasis CPU, pemrosesan prompt adalah bagian yang memberatkan bahkan sebelum pembuatan teks dimulai. Jaga agar pengaturan konteks sekecil yang diizinkan oleh tugas tersebut. Mengarahkan coding agent ke Ollama membahas sisi klien, menjalankan coding agent di VPS membahas mesin tempat agen tersebut berada, dan mengendalikan biaya agen di VPS membahas apa yang terjadi ketika agen berjalan sepanjang hari.
Input gambar bekerja dengan cara yang sama. API Ollama menerima gambar pada field images dari sebuah pesan, sehingga klien yang hanya berbasis teks tidak akan pernah mengirimkannya, terlepas dari seberapa mumpuni encoder persepsinya.
Jangan membuka port 11434
API Ollama tidak memiliki autentikasi. Mengatur OLLAMA_HOST=0.0.0.0:11434 agar Anda dapat mengaksesnya dari laptop Anda akan menempatkan pemroses model tanpa autentikasi di internet publik, di mana siapa pun yang menemukannya dapat memuat model ke disk Anda dan membaca apa pun yang dikirimkan agen Anda melaluinya. Biarkan tetap terikat pada localhost dan gunakan tunnel sebagai gantinya.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsMengamankan endpoint API Ollama membahas opsi yang tepat, termasuk reverse proxy yang meminta kredensial.
Apa yang rusak, dan apa yang akan Anda lihat
Proses pull terhenti di tengah jalan. Disk. Jalankan df -h pada direktori model. Build bf16 sebesar 57 GB tidak akan muat pada volume root 40GB, begitu pula dua tag 8-bit yang diletakkan berdampingan.
Model berhasil dimuat lalu proses mati. Kehabisan memori (Out of memory). dmesg -T mencatat kernel out of memory killer yang memilih suatu proses, dan journalctl -u ollama -n 100 menunjukkan sisi layanan dari peristiwa yang sama. Solusinya adalah menggunakan tag yang lebih kecil atau num_ctx yang lebih kecil. Menambah swap bukan solusinya.
Proses berjalan dengan kecepatan detik per token. Jalankan vmstat 1 dan perhatikan kolom si dan so. Aktivitas swap yang konstan berarti bobot model tidak muat di RAM dan sistem membacanya kembali dari disk saat bekerja.
Tag yang berfungsi minggu lalu kini hilang. Daftar tag dapat berubah. Baca kembali halaman model, kunci (pin) versi yang sedang digunakan, dan catat nama tag di tempat yang mudah Anda temukan kembali.
Periksa kembali ukuran secara mandiri sebelum melakukan pull
Ukuran dalam tabel dibaca dari halaman tag model pada 16 Agustus 2026, dan daftar tag yang dipublikasikan bukanlah sebuah jaminan. Baca daftar terkini pada halaman model, kemudian konfirmasikan apa yang sebenarnya tersimpan di disk Anda:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama menyimpan layer model sebagai blob bersama, sehingga dua tag yang berbagi layer yang sama tidak akan memakan ruang disk dua kali lipat. Bandingkan apa yang dilaporkan du dengan ukuran yang dipublikasikan, lalu rencanakan kapasitas disk Anda berdasarkan nilai yang lebih besar di antara keduanya.
FAQ
Berapa banyak RAM yang dibutuhkan Muse Glimmer pada VPS?
Mulailah dari ukuran tag dan tambahkan jendela konteks. Tag default tercatat sekitar 18 GB pada 16 Agustus 2026, jadi server 16GB tidak akan mampu menampungnya sama sekali dan server 24GB hanya mampu menampungnya dengan ruang yang sangat terbatas untuk konteks. Anggap itu sebagai titik awal, bukan jawaban akhir. Tarik tag tersebut, muat sekali, lalu jalankan ollama ps dan free -h pada server Anda sendiri dan baca angka Anda sendiri. Konteks yang lebih panjang dan permintaan paralel keduanya menambah penggunaan memori di luar bobot model.
Bisakah saya menjalankan Muse Glimmer tanpa GPU?
Bisa. Model ini dapat dimuat dan menjawab pada VPS yang hanya menggunakan CPU. Kecepatan generasi dibatasi oleh bandwidth memori, bukan oleh jumlah core, dan pada shared host bandwidth tersebut digunakan bersama, jadi perkirakan jumlah token per detik yang kecil pada 4-bit. Hal ini dapat digunakan untuk pekerjaan agen latar belakang yang berjalan tanpa pengawasan, namun akan terasa lambat untuk obrolan interaktif. Jalankan ollama ps selama permintaan berlangsung dan baca kolom prosesor untuk mengonfirmasi di mana pekerjaan tersebut dijalankan.
Apakah tag MLX berguna di VPS Linux?
Tidak. Setiap tag dengan mlx pada namanya dibuat untuk engine MLX Ollama, yang merupakan backend untuk Apple Silicon. Pada server Linux x86, tag tersebut hanyalah unduhan besar yang tidak dapat Anda jalankan. Gunakan tag 30b biasa, atau salah satu tag non-MLX lainnya, dan abaikan tolok ukur perangkat keras Apple yang menyertai build MLX.
Mengapa model melupakan banyak hal jauh sebelum mencapai 128K token?
Karena jendela konteks default Ollama adalah 4096 token, terlepas dari apa yang didukung oleh model tersebut, sehingga server memotong percakapan panjang sebelum model sempat melihatnya. Atur OLLAMA_CONTEXT_LENGTH pada server, atau /set parameter num_ctx untuk satu sesi, atau kirim num_ctx dalam opsi permintaan API. Penggunaan memori akan meningkat seiring dengan hal ini, jadi naikkan secara bertahap dan periksa ollama ps setiap kali.
Haruskah saya melakukan pin pada tag atau cukup gunakan latest?
Lakukan pin. muse-glimmer tanpa tag akan merujuk ke latest, yang merupakan penunjuk yang dapat diubah oleh penerbit ke build yang berbeda kapan saja, sehingga proses pull rutin dapat mengubah model yang dijalankan agen Anda. Tulis muse-glimmer:30b dalam skrip, file unit, dan konfigurasi agen. Periksa daftar tag di halaman model sebelum Anda melakukan pin, karena tag yang dipublikasikan dapat berubah.