Cara Jalankan Meta Muse Glimmer 30B pada VPS Linux
Ketahui spesifikasi RAM dan storan yang diperlukan untuk menjalankan model Muse Glimmer 30B. Kami analisis saiz tag 17GB hingga 59GB serta kos inferens CPU tanpa GPU.
Keperluan Muse Glimmer pada VPS
Muse Glimmer berjalan pada VPS Linux biasa tanpa GPU, dan tag yang anda tarik menentukan sama ada ia muat dalam memori. Meta Superintelligence Labs menerbitkan model ini pada 10 Ogos 2026 di bawah lesen Apache 2.0: 30 bilion parameter, tetingkap konteks 128K, dan pengekod persepsi 1.8B parameter khusus supaya ia boleh membaca imej di samping teks. Meta menyasarkannya untuk ejen tempatan yang sentiasa aktif dan bukannya untuk sembang, dengan kekuatan penaakulan yang anda tetapkan bagi setiap permintaan.
Tag Ollama yang diterbitkan, dibaca pada 16 Ogos 2026, berjulat daripada 17 GB hingga 59 GB. Julat tersebut merupakan keseluruhan masalah penentuan saiz. Tag lalai disenaraikan pada kira-kira 18 GB, jadi pelayan terkecil yang munasabah jelas mempunyai lebih daripada 18 GB RAM percuma. Ruang cakera untuk muat turun dan memori untuk tetingkap konteks adalah keperluan tambahan di atas jumlah tersebut.
Tag muse-glimmer yang manakah perlu anda tarik?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama menyenaraikan 11 tag untuk model ini yang bukan binaan Apple. Tag-tag tersebut menyimpan 30 bilion pemberat yang sama pada ketepatan numerik yang berbeza. Saiz yang anda lihat adalah saiz muat turun, dan ia juga merupakan anggaran saiz yang perlu dimuatkan ke dalam memori sebelum sebarang konteks ditambah.
Dua binaan 4-bit adalah yang bersaiz kecil: 30b-nvfp4 pada 17 GB dan 30b-q4_K_M pada 18 GB. Tag lalai 30b disenaraikan dengan saiz yang sama seperti binaan q4_K_M. Binaan 8-bit, 30b-q8_0 dan 30b-mxfp8, berada sekitar 31 GB. 30b-bf16 ialah keluaran 16-bit tanpa kuantisasi pada 57 GB, yang memerlukan lebih banyak RAM berbanding kebanyakan pelayan sewaan pada harga yang munasabah untuk projek sampingan.
Tag -dflash adalah binaan yang sama dengan sokongan DFlash, dan setiap satunya disenaraikan dengan saiz yang lebih besar daripada pasangan asalnya. Ollama menyifatkan DFlash sebagai ciri kelajuan dan menunjukkannya pada Apple Silicon serta GPU desktop. Pada VPS yang hanya menggunakan CPU, anda akan membayar saiz tambahan tersebut dalam memori sebenar untuk ciri yang diukur pada perkakasan lain, jadi mulakan dengan tag biasa dan ubah satu perkara pada satu masa.
Mulakan pada 4-bit melainkan anda mempunyai sebab khusus untuk tidak berbuat demikian. Peralihan daripada 4-bit kepada 8-bit secara kasarnya menggandakan bait yang perlu dibaca oleh CPU bagi setiap token yang dijana, jadi daya pemprosesan (throughput) akan menurun manakala penggunaan memori meningkat. Pertukaran tersebut merupakan subjek bagi apa yang sebenarnya dikorbankan oleh kuantisasi q4, q8 dan fp16, dan pada pelayan berasaskan CPU, jawapan ringkasnya ialah binaan 4-bit adalah satu-satunya binaan yang berbaloi untuk dimulakan.
Mengapa tag MLX tidak berfungsi pada pelayan Linux
MLX ialah rangka kerja tatasusunan Apple, dan enjin MLX Ollama merupakan backend untuk Apple Silicon. Sebarang tag yang mengandungi mlx pada namanya dibina khusus untuk enjin dan perkakasan tersebut. Pada VPS Linux x86, tag ini melibatkan muat turun bersaiz puluhan gigabait yang tidak boleh dijalankan, dan ia hanya akan memenuhi ruang cakera anda tanpa sebarang fungsi. Angka kelajuan dalam pengumuman yang diukur pada Mac adalah khusus untuk tag tersebut, jadi ia tidak menggambarkan prestasi pelayan anda. Apabila anda membaca senarai tag pada halaman model, tapis keluar setiap nama mlx terlebih dahulu, kemudian tentukan saiz daripada pilihan yang tinggal.
Berapakah jumlah RAM dan cakera yang sebenarnya diperlukan?
Dua perkara menggunakan memori, dan hanya satu daripadanya ialah saiz tag. Berat model ditetapkan oleh tag yang anda tarik. KV cache, iaitu keadaan setiap token yang disimpan oleh model untuk perbualan, akan bertambah mengikut panjang konteks yang anda konfigurasikan. Dokumentasi Ollama sendiri menyatakan bahawa melayani permintaan selari akan mendarabkan konteks dengan bilangan permintaan yang sedang diproses, jadi pelayan yang menjawab dua ejen serentak memerlukan lebih banyak memori berbanding pelayan yang sama menjawab satu ejen.
Jangan ambil angka RAM daripada mana-mana panduan, termasuk panduan ini. Tarik tag tersebut, hantar satu prompt, dan semasa model masih dalam memori, jalankan dua arahan ini.
ollama ps
free -hollama ps menunjukkan perkara yang dimuatkan sekarang dan bagaimana beban kerja dibahagikan antara CPU dan GPU. free -h menunjukkan baki memori yang tinggal. Kedua-dua output pada pelayan anda sendiri adalah lebih tepat daripada mana-mana jadual yang diterbitkan, kerana ia sudah merangkumi tetapan konteks anda, kuantisasi anda dan segala perkara lain yang sedang dijalankan oleh pelayan.
Cakera adalah bahagian yang lebih mudah. Ollama menyimpan model di bawah /usr/share/ollama/.ollama/models pada Linux, yang terletak pada sistem fail root dalam kebanyakan imej VPS. Volum root bersaiz 40GB tidak akan memuatkan binaan bf16 pada 57 GB, dan ia juga tidak akan memuatkan dua tag 8-bit secara serentak. Jika anda belum pernah melihat perkara yang ditulis oleh proses pull, tempat Ollama menyimpan model dan cara memindahkannya menerangkan direktori tersebut. Pindahkan storan ke volum yang dipasang (mounted volume) sebelum anda menarik apa-apa.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaPengguna ollama mesti memiliki direktori tersebut, kerana perkhidmatan ini berjalan sebagai ollama dan menulis blob-nya di sana sebagai pengguna tersebut. Jika proses pull gagal disebabkan kebenaran (permissions), journalctl -u ollama -n 50 ialah tempat punca masalah itu dipaparkan.
Swap memerlukan satu kenyataan jelas: swap tidak membolehkan anda menjalankan tag yang lebih besar. Penjanaan (generation) menyentuh berat model bagi setiap token yang dihasilkan, jadi berat yang berada dalam swap akan dibaca semula daripada cakera berulang kali, vmstat 1 akan menunjukkan lajur si dan so sibuk, dan output akan menjadi perlahan kepada beberapa saat bagi setiap token. Kekalkan fail swap yang kecil sebagai insurans terhadap pembunuh memori (out of memory killer). Tetapkan saiz RAM mengikut tag yang anda benar-benar mahukan.
Memasang Ollama dan menetapkan tag dinamakan
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaSkrip pemasangan menyediakan servis systemd, supaya pelayan kembali berjalan selepas but semula. Jika anda tidak mahu menjalankannya sebagai servis sistem yang diuruskan oleh root, menjalankan Ollama tanpa root di bawah Podman meliputi laluan tersebut. Kemudian, tarik tag yang eksplisit.
ollama pull muse-glimmer:30b
ollama listBaca sendiri lajur saiz dalam ollama list dan bandingkannya dengan senarai tag semasa pada halaman model. Tag yang diterbitkan ditambah, dinamakan semula dan dibuang, manakala saiz dalam panduan hanyalah gambaran pada satu hari tertentu.
Jangan sekali-kali menulis ollama pull muse-glimmer pada pelayan yang anda bergantung kepadanya. Nama model kosong akan merujuk kepada tag latest, dan latest ialah penunjuk yang boleh dialihkan oleh penerbit ke binaan yang berbeza. Tarikan rutin kemudiannya menukar model di bawah ejen anda, dengan keperluan memori dan kelakuan yang berbeza, dan tiada apa-apa dalam log anda yang memaklumkannya. Tulis tag tersebut dalam skrip anda, dalam fail unit anda dan dalam konfigurasi ejen anda. Self-hosting LLM dengan Ollama pada VPS meliputi baki persediaan pelayan.
Bolehkah anda menjalankan Muse Glimmer tanpa GPU?
Ya, dan perlu ditegaskan tentang had prestasinya. Menjana satu token bermakna membaca pemberat model daripada memori, jadi kelajuan ditentukan oleh lebar jalur memori dan bukannya bilangan vCPU yang diiklankan oleh pelan tersebut. Melebihi beberapa teras, penambahan teras tidak memberikan banyak kelebihan. Pada VPS kongsi, lebar jalur tersebut dikongsi dengan semua penyewa lain pada hos yang sama, jadi model 30B pada 4-bit hanya menghasilkan bilangan token yang kecil sesaat.
Jangan terima angka sesiapa pun untuk perkara ini, termasuk angka saya. Ukur token sesaat pada pelayan anda sendiri dan buat keputusan berdasarkan apa yang anda lihat.
Hasilnya ialah perbezaan ketara dalam kegunaan model ini. Sembang interaktif adalah perlahan kerana anda membaca lebih pantas daripada pelayan menulis dan setiap balasan bermula dengan jeda yang lama. Kerja ejen latar belakang adalah memuaskan kerana tugasan yang berjalan tanpa pengawasan selama sepuluh minit tidak terjejas oleh kelajuan yang perlahan. Beban kerja kedua itulah yang sebenarnya diterangkan oleh Meta untuk model ini.
Jika anda memerlukan kelajuan interaktif, dua jawapan jujur ialah GPU atau API yang dihoskan. Kira titik pulang modal antara VPS GPU dan token API sebelum anda menyewa apa-apa, dan apa yang sebenarnya diberikan oleh VPS GPU menerangkan perkara yang anda beli. Untuk soalan yang lebih luas tentang kapasiti sesebuah pelayan, mulakan di model yang boleh anda hos sendiri, dan menjalankan model Qwen bersaiz serupa pada VPS ialah perbandingan paling hampir dalam kelas saiz ini. Jika angka yang anda ukur terlalu perlahan untuk digunakan, Nemotron 3.5 Lightning pada VPS mengemukakan soalan RAM dan token sesaat yang sama bagi model yang dibina untuk kelajuan berbanding saiz.
Mengapa ia melupakan perkara jauh sebelum mencapai 128K token?
Ini kerana tetingkap konteks lalai Ollama ialah 4096 token, tidak kira apa yang disokong oleh model tersebut. Nilai lalai ini dinyatakan dalam FAQ Ollama sendiri setakat Ogos 2026. Tag tersebut mengiklankan 128K, namun pelayan hanya memberikan 4096 kepada model sehingga anda menetapkan sebaliknya. Oleh itu, transkrip ejen yang panjang akan kehilangan bahagian awal dan model kelihatan seolah-olah mengalami amnesia.
Tingkatkan nilai tersebut pada pelayan bagi setiap permintaan:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Di dalam sesi interaktif, /set parameter num_ctx 32768 mengubahnya untuk sesi itu sahaja. Melalui API, hantar num_ctx dalam pilihan permintaan.
Setiap token konteks tambahan menggunakan memori di samping berat model. Jika anda meminta 128K penuh pada mesin yang saiznya hanya cukup untuk berat model, bebanan akan gagal atau beralih kepada proses yang lebih perlahan. Tingkatkan nilai tersebut secara berperingkat dan jalankan ollama ps selepas setiap peringkat. Bagaimana num_ctx dan panjang konteks berfungsi dalam Ollama menerangkan pengiraan tersebut secara terperinci.
Kekuatan penaakulan: low, medium, high dan xhigh
Meta mendokumentasikan empat tahap kekuatan penaakulan untuk Muse Glimmer, daripada low sehingga xhigh, dan mengesyorkan dua tahap tertinggi untuk tugasan pengekodan dan ejen yang kompleks. Dalam Ollama, ini bergantung pada parameter think. Gunakan --think= pada baris perintah, atau hantar think dalam badan API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Di dalam sesi interaktif, /set think dan /set nothink menogol tetapan ini. Dokumentasi Ollama menyatakan kebanyakan model menerima sama ada boolean atau tahap seperti low, medium atau high, dan sesetengahnya menerima max untuk tahap tertinggi yang tersedia. Rentetan tepat yang diterima oleh model ini terdapat pada halaman modelnya, jadi bacalah halaman tersebut daripada meneka, dan cuba satu secara manual sebelum anda menyambungkannya ke dalam ejen.
Pada mesin yang hanya menggunakan CPU, pelaras ini sangat memberi kesan. Kekuatan yang lebih tinggi bermakna lebih banyak token pemikiran dijana sebelum perkataan pertama jawapan muncul, dan token pemikiran memakan masa jam dinding yang sama seperti token jawapan. Kekalkan kerja rutin pada tetapan low. Panjang jawapan juga memerlukan perhatian yang sama, jadi hadkan balasan dengan num_predict daripada membiarkan satu respons yang meleret-leret melambatkan mesin selama beberapa minit.
Pastikan model kekal dimuatkan untuk ejen yang sentiasa aktif
Ollama akan memunggah model yang melahu selepas lima minit secara lalai. Bagi ejen yang berjalan setiap sepuluh minit, ini bermakna anda perlu menanggung beban pemuatan penuh sebanyak 18 GB daripada cakera pada setiap pelaksanaan. Pada VPS dengan storan yang disambungkan melalui rangkaian, proses pemuatan ini tidak pantas. Sebaliknya, kekalkan model tersebut di dalam memori.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Nilai negatif akan memastikan model kekal dalam memori sehingga sesuatu proses memunggahnya, dan keep_alive dalam permintaan API akan mengatasi tetapan lalai pelayan untuk panggilan tersebut sahaja. Kosnya jelas: RAM akan terus diduduki walaupun tiada aktiviti berlaku, jadi tetapan ini sesuai untuk pelayan yang dikhaskan untuk ejen tersebut. Memastikan model Ollama kekal dimuatkan merangkumi pelbagai variasi kaedah ini.
Menghalakan ejen pengekodan kepadanya
Ollama menyediakan API yang serasi dengan OpenAI pada http://127.0.0.1:11434/v1, jadi kebanyakan alat ejen boleh disambungkan menggunakan URL asas dan sebarang kunci API yang tidak kosong. Halaman Muse Glimmer Ollama juga mendokumentasikan pintasan pelancaran yang menghubungkan ejen yang disokong kepada model tempatan dalam satu arahan, dan anda juga harus menyematkan tag di sana.
ollama launch claude --model muse-glimmer:30bEjen menghantar prompt yang besar. Kandungan fail, output alat dan transkrip yang semakin panjang semuanya tiba sebagai token input, dan pada kotak CPU, pemprosesan prompt adalah bahagian yang membebankan sebelum penjanaan bermula. Pastikan tetapan konteks sekecil yang dibenarkan oleh tugasan. Menghalakan ejen pengekodan ke Ollama merangkumi bahagian klien, menjalankan ejen pengekodan pada VPS merangkumi kotak tempat ia berada, dan mengawal kos ejen pada VPS merangkumi perkara yang berlaku apabila ia berjalan sepanjang hari.
Input imej berfungsi dengan cara yang sama. API Ollama mengambil imej pada medan images dalam sesuatu mesej, jadi klien teks sahaja tidak akan menghantar imej, tidak kira betapa berkebolehan pengekod persepsi tersebut.
Jangan buka port 11434
API Ollama tidak mempunyai pengesahan. Menetapkan OLLAMA_HOST=0.0.0.0:11434 supaya anda boleh mencapainya dari komputer riba anda akan mendedahkan pelari model tanpa pengesahan kepada internet awam. Sesiapa sahaja yang menemuinya boleh memuatkan model ke dalam cakera anda dan membaca apa sahaja yang dihantar oleh ejen anda melaluinya. Kekalkan ia terikat pada localhost dan gunakan tunnel sebagai gantinya.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsMengamankan endpoint API Ollama merangkumi pilihan yang betul, termasuk penggunaan reverse proxy yang memerlukan kelayakan.
Apa yang rosak, dan apa yang akan anda lihat
Proses pull terhenti di tengah jalan. Cakera. Jalankan df -h pada direktori model. Binaan bf16 bersaiz 57 GB tidak muat pada volum root 40GB, begitu juga dengan dua tag 8-bit yang diletakkan bersebelahan.
Model dimuatkan kemudian proses mati. Kehabisan memori. dmesg -T merekodkan kernel out of memory killer memilih sesuatu proses, dan journalctl -u ollama -n 100 menunjukkan bahagian servis bagi peristiwa yang sama. Penyelesaiannya ialah tag yang lebih kecil atau num_ctx yang lebih kecil. Ia bukan tentang menambah swap.
Ia berjalan pada kadar saat per token. Jalankan vmstat 1 dan perhatikan kolum si dan so. Aktiviti swap yang berterusan bermakna pemberat (weights) tidak muat dalam RAM dan sistem sedang membacanya semula daripada cakera semasa ia berfungsi.
Tag yang berfungsi minggu lepas telah tiada. Senarai tag berubah. Baca semula halaman model, pin apa sahaja yang terkini, dan rekodkan nama tag di tempat yang anda akan rujuk semula.
Semak semula saiz sendiri sebelum anda melakukan pull
Saiz dalam carta dibaca daripada halaman tag model pada 16 Ogos 2026, dan senarai tag yang diterbitkan bukanlah satu janji. Baca senarai semasa pada halaman model, kemudian sahkan apa yang sebenarnya telah dimuatkan ke dalam cakera anda:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama menyimpan layer model sebagai blob yang dikongsi, jadi dua tag yang berkongsi layer yang sama tidak akan menggunakan ruang cakera dua kali ganda. Bandingkan apa yang dilaporkan oleh du dengan saiz yang diterbitkan dan rancang penggunaan cakera anda berdasarkan nilai yang lebih besar antara kedua-duanya.
FAQ
Berapakah RAM yang diperlukan oleh Muse Glimmer pada VPS?
Mulakan dengan saiz tag dan tambahkan tetingkap konteks. Tag lalai disenaraikan pada kira-kira 18 GB pada 16 Ogos 2026, jadi pelayan 16GB tidak mampu menampungnya langsung dan pelayan 24GB hanya mampu menampungnya dengan ruang yang sangat terhad untuk konteks. Anggap ini sebagai titik permulaan, bukan jawapan muktamad. Muat turun tag tersebut, muatkan sekali, kemudian jalankan ollama ps dan free -h pada pelayan anda sendiri dan baca angka anda sendiri. Konteks yang lebih panjang dan permintaan selari kedua-duanya menambah penggunaan memori di samping berat model.
Bolehkah saya menjalankan Muse Glimmer tanpa GPU?
Boleh. Ia dimuatkan dan menjawab pada VPS yang hanya menggunakan CPU. Kelajuan penjanaan dihadkan oleh lebar jalur memori dan bukannya bilangan teras, dan pada hos kongsi, lebar jalur tersebut dikongsi, jadi jangkakan bilangan token sesaat yang rendah pada 4-bit. Ini boleh digunakan untuk kerja ejen latar belakang yang berjalan tanpa pengawasan, tetapi sangat perlahan untuk sembang interaktif. Jalankan ollama ps semasa permintaan sedang diproses dan baca lajur pemproses untuk mengesahkan di mana kerja tersebut sedang dijalankan.
Adakah tag MLX berguna pada VPS Linux?
Tidak. Setiap tag dengan mlx pada namanya dibina untuk enjin MLX Ollama, iaitu backend untuk Apple Silicon. Pada pelayan Linux x86, tag tersebut merupakan muat turun besar yang tidak boleh anda jalankan. Gunakan tag 30b biasa, atau salah satu tag bukan MLX yang lain, dan abaikan penanda aras perkakasan Apple yang disertakan dengan binaan MLX.
Mengapakah model melupakan perkara jauh sebelum mencapai 128K token?
Kerana tetingkap konteks lalai Ollama ialah 4096 token tidak kira apa yang disokong oleh model, jadi pelayan akan memotong perbualan panjang sebelum model sempat melihatnya. Tetapkan OLLAMA_CONTEXT_LENGTH pada pelayan, atau /set parameter num_ctx untuk satu sesi, atau hantar num_ctx dalam pilihan permintaan API. Penggunaan memori akan meningkat bersamanya, jadi tingkatkan secara berperingkat dan semak ollama ps setiap kali.
Patutkah saya menetapkan (pin) tag atau hanya menggunakan latest?
Tetapkan (pin) tag tersebut. muse-glimmer tanpa tag akan merujuk kepada latest, iaitu penunjuk yang boleh diubah oleh penerbit kepada binaan berbeza pada bila-bila masa, jadi arahan pull rutin boleh menukar model yang dijalankan oleh ejen anda. Tulis muse-glimmer:30b dalam skrip, fail unit dan konfigurasi ejen. Semak senarai tag pada halaman model sebelum anda menetapkannya, kerana tag yang diterbitkan boleh berubah.