SSD Nodes Learn 🎉 VPS dari $5.50/bln
Panduan Matt ConnorOleh Matt Connor

Cara Jalankan Meta Muse Glimmer 30B pada VPS Linux

Ketahui spesifikasi RAM dan storan yang diperlukan untuk menjalankan model Muse Glimmer 30B. Kami analisis saiz tag 17GB hingga 59GB serta kos inferens CPU tanpa GPU.

Keperluan Muse Glimmer pada VPS

Muse Glimmer berjalan pada VPS Linux biasa tanpa GPU, dan tag yang anda tarik menentukan sama ada ia muat dalam memori. Meta Superintelligence Labs menerbitkan model ini pada 10 Ogos 2026 di bawah lesen Apache 2.0: 30 bilion parameter, tetingkap konteks 128K, dan pengekod persepsi 1.8B parameter khusus supaya ia boleh membaca imej di samping teks. Meta menyasarkannya untuk ejen tempatan yang sentiasa aktif dan bukannya untuk sembang, dengan kekuatan penaakulan yang anda tetapkan bagi setiap permintaan.

Tag Ollama yang diterbitkan, dibaca pada 16 Ogos 2026, berjulat daripada 17 GB hingga 59 GB. Julat tersebut merupakan keseluruhan masalah penentuan saiz. Tag lalai disenaraikan pada kira-kira 18 GB, jadi pelayan terkecil yang munasabah jelas mempunyai lebih daripada 18 GB RAM percuma. Ruang cakera untuk muat turun dan memori untuk tetingkap konteks adalah keperluan tambahan di atas jumlah tersebut.

Tag muse-glimmer yang manakah perlu anda tarik?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama menyenaraikan 11 tag untuk model ini yang bukan binaan Apple. Tag-tag tersebut menyimpan 30 bilion pemberat (weights) yang sama pada ketepatan numerik yang berbeza. Saiz yang anda lihat adalah saiz muat turun, dan ia juga merupakan anggaran jumlah memori yang perlu anda sediakan sebelum sebarang konteks ditambah.

Dua binaan 4-bit adalah yang bersaiz kecil: 30b-nvfp4 pada 17 GB dan 30b-q4_K_M pada 18 GB. Tag lalai 30b disenaraikan dengan saiz yang sama seperti binaan q4_K_M. Binaan 8-bit, 30b-q8_0 dan 30b-mxfp8, berada pada sekitar 31 GB. 30b-bf16 ialah keluaran 16-bit tanpa kuantisasi pada 57 GB, yang memerlukan lebih banyak RAM berbanding kebanyakan pelayan sewaan pada harga yang munasabah untuk projek sampingan.

Tag -dflash adalah binaan yang sama dengan sokongan DFlash, dan setiap satunya disenaraikan dengan saiz yang lebih besar daripada pasangan asalnya. Ollama menyifatkan DFlash sebagai ciri kelajuan dan menunjukkannya pada Apple Silicon serta GPU desktop. Pada VPS yang hanya menggunakan CPU, anda akan membayar saiz tambahan tersebut dalam bentuk memori sebenar untuk ciri yang diukur pada perkakasan lain, jadi mulakan dengan tag biasa dan ubah satu perkara pada satu masa.

Mulakan pada 4-bit kecuali anda mempunyai sebab khusus untuk tidak berbuat demikian. Peralihan daripada 4-bit kepada 8-bit secara kasarnya menggandakan bait yang perlu dibaca oleh CPU bagi setiap token yang dijana, jadi daya pemprosesan (throughput) akan menurun manakala penggunaan memori meningkat. Pertukaran tersebut adalah subjek bagi kos sebenar kuantisasi q4, q8 dan fp16, dan pada pelayan CPU, jawapan ringkasnya ialah binaan 4-bit adalah satu-satunya binaan yang berbaloi untuk dimulakan.

Mengapa tag MLX tidak berfungsi pada pelayan Linux

MLX ialah kerangka kerja tatasusunan (array framework) milik Apple, dan enjin MLX Ollama merupakan backend untuk Apple Silicon. Sebarang tag yang mengandungi mlx pada namanya dibina khusus untuk enjin dan perkakasan tersebut. Pada VPS Linux x86, ia merupakan muat turun bersaiz puluhan gigabait yang tidak boleh dijalankan, dan ia hanya akan memakan ruang cakera anda tanpa melakukan apa-apa. Angka kelajuan dalam pengumuman yang diukur pada Mac adalah khusus untuk tag tersebut, jadi ia tidak menggambarkan prestasi pelayan anda. Apabila anda membaca senarai tag pada halaman model, tapis keluar setiap nama mlx terlebih dahulu, kemudian pilih saiz daripada baki pilihan yang ada.

Berapakah jumlah RAM dan storan yang sebenarnya diperlukan?

Dua perkara menggunakan memori, dan hanya satu daripadanya ialah saiz tag. Berat model ditetapkan oleh tag yang anda tarik. KV cache, iaitu keadaan per token yang disimpan oleh model untuk perbualan, akan bertambah mengikut panjang konteks yang anda konfigurasikan. Dokumentasi Ollama sendiri menyatakan bahawa melayani permintaan selari akan mendarabkan konteks dengan bilangan permintaan yang sedang diproses, jadi pelayan yang menjawab dua ejen serentak memerlukan lebih banyak memori berbanding pelayan yang menjawab satu ejen.

Jangan ambil angka RAM daripada mana-mana panduan, termasuk panduan ini. Tarik tag tersebut, hantar satu prompt, dan semasa model masih dimuatkan dalam memori, jalankan dua arahan ini.

ollama ps
free -h

ollama ps menunjukkan apa yang dimuatkan sekarang dan bagaimana beban kerja dibahagikan antara CPU dan GPU. free -h menunjukkan baki memori yang tinggal. Kedua-dua output pada pelayan anda sendiri adalah lebih tepat daripada mana-mana jadual yang diterbitkan, kerana ia sudah merangkumi tetapan konteks anda, kuantisasi anda dan segala proses lain yang dijalankan oleh pelayan.

Storan adalah bahagian yang lebih mudah. Ollama menyimpan model di bawah /usr/share/ollama/.ollama/models pada Linux, yang terletak pada sistem fail root dalam kebanyakan imej VPS. Volum root bersaiz 40GB tidak akan memuatkan binaan bf16 pada 57 GB, dan ia juga tidak akan memuatkan dua tag 8-bit secara serentak. Pindahkan storan ke volum yang dipasang (mounted volume) sebelum anda menarik apa-apa.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Pengguna ollama mesti memiliki direktori tersebut, kerana perkhidmatan ini berjalan sebagai ollama dan menulis blobnya di sana sebagai pengguna tersebut. Jika proses menarik (pull) gagal disebabkan kebenaran (permissions), journalctl -u ollama -n 50 adalah tempat di mana puncanya dipaparkan.

Swap memerlukan satu kenyataan jelas: swap tidak membolehkan anda menjalankan tag yang lebih besar. Penjanaan (generation) menyentuh berat model bagi setiap token yang dihasilkan, jadi berat yang berada dalam swap akan dibaca semula daripada cakera berulang kali, vmstat 1 akan menunjukkan lajur si dan so sibuk, dan output akan menjadi perlahan sehingga mengambil masa beberapa saat bagi setiap token. Kekalkan fail swap yang kecil sebagai perlindungan terhadap pembunuh memori (out of memory killer). Tetapkan saiz RAM mengikut tag yang anda benar-benar mahukan.

Memasang Ollama dan menetapkan tag bernama

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Skrip pemasangan menyediakan servis systemd, supaya pelayan berjalan semula selepas but semula (reboot). Jika anda tidak mahu menjalankannya sebagai servis sistem yang diuruskan oleh root, menjalankan Ollama tanpa root di bawah Podman meliputi kaedah tersebut. Kemudian, tarik (pull) tag yang eksplisit.

ollama pull muse-glimmer:30b
ollama list

Baca sendiri lajur saiz dalam ollama list dan bandingkan dengan senarai tag semasa pada halaman model. Tag yang diterbitkan akan ditambah, dinamakan semula dan dibuang, manakala saiz dalam panduan hanyalah gambaran pada satu hari tertentu.

Jangan sekali-kali menulis ollama pull muse-glimmer pada pelayan yang anda harapkan. Nama model kosong akan diselesaikan kepada tag latest, dan latest ialah penunjuk yang boleh dialihkan oleh penerbit ke binaan (build) yang berbeza. Tarikan rutin kemudiannya akan menukar model di bawah ejen anda, dengan keperluan memori dan kelakuan yang berbeza, dan tiada apa-apa dalam log anda yang memaklumkannya. Tulis tag tersebut dalam skrip anda, dalam fail unit anda dan dalam konfigurasi ejen anda. Self-hosting LLM dengan Ollama pada VPS meliputi baki penyediaan pelayan.

Bolehkah anda menjalankan Muse Glimmer tanpa GPU?

Ya, dan perlu ditegaskan tentang had prestasinya. Menjana satu token bermakna membaca pemberat model daripada memori, jadi kelajuan ditentukan oleh lebar jalur memori (memory bandwidth) dan bukannya oleh bilangan vCPU yang diiklankan dalam pelan anda. Melebihi beberapa teras, penambahan teras tidak memberikan banyak kelebihan. Pada VPS kongsi, lebar jalur tersebut dikongsi dengan setiap penyewa lain pada hos yang sama, jadi model 30B pada 4-bit hanya menghasilkan bilangan token yang kecil sesaat.

Jangan terima angka sesiapa pun untuk perkara ini, termasuk angka saya. Ukur token sesaat pada pelayan anda sendiri dan buat keputusan berdasarkan apa yang anda lihat.

Hasilnya ialah perbezaan ketara dalam kegunaan model ini. Sembang interaktif adalah perlahan kerana anda membaca lebih pantas daripada kelajuan pelayan menulis, dan setiap balasan bermula dengan jeda yang lama. Kerja ejen di latar belakang adalah memadai, kerana tugasan yang berjalan tanpa pengawasan selama sepuluh minit tidak terjejas oleh kelajuan yang perlahan. Beban kerja kedua itulah yang sebenarnya diterangkan oleh Meta untuk model ini.

Jika anda memerlukan kelajuan interaktif, dua jawapan jujur ialah GPU atau API yang dihoskan. Kira titik pulang modal antara VPS GPU dan token API sebelum anda menyewa apa-apa, dan apa yang sebenarnya diberikan oleh VPS GPU kepada anda menerangkan perkara yang anda beli. Untuk soalan yang lebih luas tentang kapasiti sesuatu pelayan, mulakan di model yang boleh anda hos sendiri, dan menjalankan model Qwen dengan saiz yang serupa pada VPS adalah perbandingan yang paling hampir dalam kelas saiz ini.

Mengapa ia melupakan perkara jauh sebelum 128K token?

Ini kerana tetingkap konteks lalai Ollama adalah 4096 token, tidak kira apa yang disokong oleh model tersebut. Nilai lalai itu dinyatakan dalam FAQ Ollama sendiri setakat Ogos 2026. Tag tersebut mengiklankan 128K, namun pelayan hanya memberikan 4096 kepada model melainkan anda menetapkan sebaliknya. Akibatnya, transkrip ejen yang panjang akan kehilangan bahagian awal perbualan dan model kelihatan seperti mengalami amnesia.

Tingkatkan nilai tersebut pada pelayan untuk setiap permintaan:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Di dalam sesi interaktif, /set parameter num_ctx 32768 mengubahnya untuk sesi itu sahaja. Melalui API, hantar num_ctx dalam pilihan permintaan.

Setiap token konteks tambahan memerlukan memori selain daripada berat model (weights). Jika anda meminta 128K penuh pada mesin yang saiznya hanya cukup untuk berat model, bebanan akan gagal atau beralih kepada proses yang lebih perlahan. Tingkatkan nilai tersebut secara berperingkat dan jalankan ollama ps selepas setiap peringkat. Bagaimana num_ctx dan panjang konteks berfungsi dalam Ollama menerangkan pengiraan tersebut.

Kekuatan penaakulan: low, medium, high dan xhigh

Meta mendokumentasikan empat tahap kekuatan penaakulan untuk Muse Glimmer, daripada low hingga xhigh, dan mengesyorkan dua tahap tertinggi untuk tugasan pengekodan dan ejen yang kompleks. Dalam Ollama, fungsi ini dikawal oleh parameter think. Gunakan --think= pada baris perintah, atau hantar think dalam badan API.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

Di dalam sesi interaktif, /set think dan /set nothink menukar tetapan ini. Dokumentasi Ollama menyatakan kebanyakan model menerima sama ada nilai boolean atau tahap seperti low, medium atau high, dan sesetengahnya menerima max untuk tahap tertinggi yang tersedia. Rentetan tepat yang diterima oleh model ini terdapat pada halaman modelnya, jadi bacalah halaman tersebut daripada meneka, dan cuba satu tetapan secara manual sebelum anda menyambungkannya ke dalam ejen.

Pada mesin yang hanya menggunakan CPU, tetapan ini mempunyai kesan yang ketara. Kekuatan yang lebih tinggi bermakna lebih banyak token pemikiran dijana sebelum perkataan pertama jawapan muncul, dan token pemikiran mengambil masa jam dinding yang sama seperti token jawapan. Kekalkan kerja rutin pada tetapan low.

Pastikan model dimuatkan untuk ejen yang sentiasa aktif

Ollama akan memunggah model yang melahu selepas lima minit secara lalai. Bagi ejen yang berjalan setiap sepuluh minit, ini bermakna anda perlu menanggung beban muatan penuh 18 GB daripada cakera pada setiap pelaksanaan, dan pada VPS dengan storan rangkaian, proses muatan tersebut tidak pantas. Sebaliknya, kekalkan model dalam memori.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Nilai negatif akan mengekalkan model dalam memori sehingga sesuatu proses memunggahnya, dan keep_alive dalam permintaan API akan mengatasi tetapan lalai pelayan bagi panggilan tersebut. Kosnya jelas: RAM akan terus diduduki walaupun tiada aktiviti berlaku, jadi tetapan ini sesuai untuk mesin yang dikhaskan bagi ejen tersebut. Mengekalkan model Ollama yang dimuatkan merangkumi variasi bagi kaedah ini.

Menghalakan ejen pengekodan kepadanya

Ollama menyediakan API yang serasi dengan OpenAI pada http://127.0.0.1:11434/v1, jadi kebanyakan alat ejen bersambung menggunakan URL asas dan sebarang kunci API yang tidak kosong. Halaman Muse Glimmer Ollama juga mendokumentasikan pintasan pelancaran yang menghubungkan ejen yang disokong kepada model tempatan dalam satu arahan, dan anda juga harus menyematkan tag di sana.

ollama launch claude --model muse-glimmer:30b

Ejen menghantar prompt yang besar. Kandungan fail, output alat dan transkrip yang semakin berkembang semuanya tiba sebagai token input, dan pada kotak CPU, pemprosesan prompt adalah bahagian yang membebankan sebelum penjanaan bermula. Pastikan tetapan konteks sekecil yang dibenarkan oleh tugasan tersebut. Menghalakan ejen pengekodan ke Ollama merangkumi bahagian klien, menjalankan ejen pengekodan pada VPS merangkumi kotak tempat ia berada, dan mengawal kos ejen pada VPS merangkumi perkara yang berlaku apabila ia berjalan sepanjang hari.

Input imej berfungsi dengan cara yang sama. API Ollama mengambil imej pada medan images sesuatu mesej, jadi klien teks sahaja tidak akan menghantarnya, tidak kira betapa berkebolehan pengekod persepsi tersebut.

Jangan buka port 11434

API Ollama tidak mempunyai pengesahan. Menetapkan OLLAMA_HOST=0.0.0.0:11434 supaya anda boleh mencapainya dari komputer riba anda akan mendedahkan pelari model tanpa pengesahan kepada internet awam. Sesiapa sahaja yang menemuinya boleh memuatkan model ke dalam cakera anda dan membaca apa sahaja yang dihantar oleh ejen anda melaluinya. Kekalkan ia terikat pada localhost dan gunakan tunnel sebaliknya.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

Mengamankan endpoint API Ollama merangkumi pilihan yang betul, termasuk reverse proxy yang memerlukan kelayakan.

Apa yang rosak, dan apa yang akan anda lihat

Proses pull terhenti di tengah jalan. Cakera. Jalankan df -h pada direktori model. Binaan bf16 bersaiz 57 GB tidak muat pada root volume 40GB, begitu juga dengan dua tag 8-bit yang diletakkan bersebelahan.

Model dimuatkan kemudian proses terhenti. Kehabisan memori. dmesg -T merekodkan kernel out of memory killer memilih sesuatu proses, dan journalctl -u ollama -n 100 menunjukkan bahagian servis bagi peristiwa yang sama. Penyelesaiannya adalah menggunakan tag yang lebih kecil atau num_ctx yang lebih kecil. Menambah swap bukanlah penyelesaiannya.

Ia berjalan pada kadar saat per token. Jalankan vmstat 1 dan perhatikan lajur si dan so. Aktiviti swap yang berterusan bermakna pemberat (weights) tidak muat di dalam RAM dan sistem sedang membacanya semula daripada cakera semasa ia berfungsi.

Tag yang berfungsi minggu lepas telah tiada. Senarai tag sentiasa berubah. Baca semula halaman model, pin apa sahaja yang terkini, dan rekodkan nama tag di tempat yang anda akan rujuk semula.

Semak semula saiz sendiri sebelum anda melakukan pull

Saiz dalam carta dibaca daripada halaman tag model pada 16 Ogos 2026, dan senarai tag yang diterbitkan bukanlah satu janji. Baca senarai semasa pada halaman model, kemudian sahkan apa yang sebenarnya telah disimpan pada cakera anda:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama menyimpan layer model sebagai blob berkongsi, jadi dua tag yang berkongsi layer yang sama tidak akan menggunakan ruang cakera dua kali ganda. Bandingkan apa yang dilaporkan oleh du dengan saiz yang diterbitkan dan rancang penggunaan cakera anda berdasarkan nilai yang lebih besar antara kedua-duanya.

FAQ

Berapakah RAM yang diperlukan oleh Muse Glimmer pada VPS?

Mulakan daripada saiz tag dan tambahkan tetingkap konteks. Tag lalai disenaraikan pada kira-kira 18 GB pada 16 Ogos 2026, jadi pelayan 16GB tidak dapat memuatkannya sama sekali dan pelayan 24GB memuatkannya dengan ruang yang sangat terhad untuk konteks. Anggap itu sebagai titik permulaan, bukan jawapan muktamad. Muat turun tag tersebut, muatkan sekali, kemudian jalankan ollama ps dan free -h pada pelayan anda sendiri dan baca angka anda sendiri. Konteks yang lebih panjang dan permintaan selari kedua-duanya menambah penggunaan memori selain daripada berat model (weights).

Bolehkah saya menjalankan Muse Glimmer tanpa GPU?

Boleh. Ia memuat dan menjawab pada VPS yang hanya menggunakan CPU. Kelajuan penjanaan dihadkan oleh lebar jalur memori dan bukannya bilangan teras, dan pada hos kongsi, lebar jalur tersebut dikongsi, jadi jangkakan bilangan token sesaat yang kecil pada 4-bit. Ini boleh digunakan untuk kerja ejen latar belakang yang berjalan tanpa pengawasan, tetapi menyukarkan untuk sembang interaktif. Jalankan ollama ps semasa permintaan dan baca lajur pemproses untuk mengesahkan di mana kerja tersebut sedang dijalankan.

Adakah tag MLX berguna pada VPS Linux?

Tidak. Setiap tag dengan mlx pada namanya dibina untuk enjin MLX Ollama, iaitu backend untuk Apple Silicon. Pada pelayan Linux x86, tag tersebut merupakan muat turun besar yang tidak boleh anda jalankan. Gunakan tag 30b biasa, atau salah satu tag bukan MLX yang lain, dan abaikan penanda aras perkakasan Apple yang disertakan dengan binaan MLX.

Mengapakah model melupakan perkara jauh sebelum mencapai 128K token?

Kerana tetingkap konteks lalai Ollama ialah 4096 token tidak kira apa yang disokong oleh model, jadi pelayan memotong perbualan panjang sebelum model sempat melihatnya. Tetapkan OLLAMA_CONTEXT_LENGTH pada pelayan, atau /set parameter num_ctx untuk satu sesi, atau hantar num_ctx dalam pilihan permintaan API. Penggunaan memori meningkat bersamanya, jadi tingkatkan secara berperingkat dan semak ollama ps setiap kali.

Patutkah saya menyematkan (pin) tag atau hanya gunakan latest?

Sematkannya. muse-glimmer tanpa tag akan merujuk kepada latest, iaitu penunjuk yang boleh diubah oleh penerbit kepada binaan berbeza pada bila-bila masa, jadi proses muat turun rutin boleh menukar model yang dijalankan oleh ejen anda. Tulis muse-glimmer:30b dalam skrip, fail unit dan konfigurasi ejen. Semak senarai tag pada halaman model sebelum anda menyematkannya, kerana tag yang diterbitkan boleh berubah.