Chạy Meta Muse Glimmer 30B trên VPS cần bao nhiêu RAM?
Tính RAM và disk cho các tag Muse Glimmer 30B từ 17GB đến 59GB trên Linux VPS, rồi biết chi phí inference chỉ dùng CPU trước khi pull model.
Muse Glimmer cần gì trên VPS
Muse Glimmer chạy trên một Linux VPS thông thường, không cần GPU. Tag bạn pull quyết định model có vừa trong memory hay không. Meta Superintelligence Labs công bố model này vào ngày 10 August 2026 theo giấy phép Apache 2.0. Model có 30 billion parameters, context window 128K và một perception encoder riêng với 1.8B parameters để đọc hình ảnh cùng với văn bản. Meta định hướng model cho các local agent luôn chạy thay vì chat, với mức độ reasoning do bạn đặt trong từng request.
Các tag Ollama được công bố và kiểm tra vào ngày 16 August 2026 có dung lượng từ 17 GB đến 59 GB. Đây là toàn bộ bài toán sizing. Tag mặc định được liệt kê ở mức khoảng 18 GB. Vì vậy, một VPS nhỏ nhất vẫn phải có rõ ràng nhiều hơn 18 GB RAM trống. Dung lượng disk cho file download và memory cho context window phải được cộng thêm.
Bạn nên pull tag glimmer nào?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama liệt kê 11 tag cho model này không phải bản build dành cho Apple. Các tag này chứa cùng 30 tỷ weight, được lưu ở những mức precision khác nhau. Kích thước hiển thị là dung lượng bạn phải download, đồng thời cũng gần bằng lượng memory cần giữ trước khi cộng thêm context.
Hai bản build 4-bit là các bản nhỏ: 30b-nvfp4 ở mức 17 GB và 30b-q4_K_M ở mức 18 GB. Tag mặc định 30b được liệt kê với kích thước bằng bản build q4_K_M. Hai bản build 8-bit, 30b-q8_0 và 30b-mxfp8, có kích thước gần 31 GB. 30b-bf16 là bản release 16-bit chưa quantise, có kích thước 57 GB. Mức này cần nhiều RAM hơn phần lớn các server thuê có thể cung cấp với mức giá hợp lý cho một side project.
Các tag -dflash là những bản build tương tự nhưng có hỗ trợ DFlash, và mỗi bản đều lớn hơn bản không có DFlash tương ứng. Ollama mô tả DFlash là một tính năng tăng tốc, đồng thời minh họa tính năng này trên Apple Silicon và desktop GPU. Trên VPS chỉ có CPU, bạn sẽ phải dùng thêm lượng memory đó cho một tính năng được đo trên phần cứng khác. Vì vậy, hãy bắt đầu với tag không có DFlash và chỉ thay đổi một yếu tố mỗi lần.
Hãy bắt đầu với bản 4-bit trừ khi bạn có lý do cụ thể để không dùng nó. Chuyển từ 4-bit sang 8-bit gần như tăng gấp đôi số byte CPU phải đọc cho mỗi token được tạo, nên throughput giảm trong khi mức sử dụng memory tăng. Trade-off này được giải thích trong chi phí thực tế của quantisation q4, q8 và fp16, và trên máy chỉ có CPU, câu trả lời ngắn gọn là bản build 4-bit là lựa chọn duy nhất đáng dùng để bắt đầu.
Vì sao các tag MLX không làm gì trên Linux server
MLX là framework mảng của Apple, còn MLX engine của Ollama là backend dành cho Apple Silicon. Mọi tag có mlx trong tên đều được build cho engine và phần cứng đó. Trên một x86 Linux VPS, đó là hàng chục gigabyte dữ liệu tải xuống mà bạn không thể chạy, và chúng chỉ nằm trên disk mà không làm gì cả. Các số liệu tốc độ trong thông báo, được đo trên máy Mac, cũng thuộc về các tag đó nên không mô tả server của bạn. Khi đọc danh sách tag trên trang model, trước tiên hãy lọc bỏ mọi tên mlx, sau đó tính dung lượng dựa trên phần còn lại.
Cần bao nhiêu RAM và dung lượng disk?
Có hai thành phần chiếm memory, và chỉ một trong số đó là kích thước tag. Dung lượng weights được cố định theo tag bạn pull. KV cache, tức state theo từng token mà model giữ cho cuộc hội thoại, tăng theo context length bạn cấu hình. Tài liệu của Ollama lưu ý rằng việc phục vụ các request song song sẽ nhân context với số request đang được xử lý. Vì vậy, một máy trả lời đồng thời cho hai agent cần nhiều memory hơn cùng máy đó khi chỉ trả lời một agent.
Không nên lấy con số RAM từ bất kỳ guide nào, kể cả guide này. Hãy pull tag, gửi cho model một prompt, rồi chạy hai command sau khi model vẫn còn resident.
ollama ps
free -hollama ps cho biết hiện đang load những gì và workload được chia giữa CPU và GPU ra sao. free -h cho biết còn lại bao nhiêu tài nguyên. Hai output này trên chính máy của bạn đáng tin hơn mọi bảng được công bố, vì chúng đã bao gồm context setting, quantisation và toàn bộ phần còn lại mà server đang chạy.
Disk là phần dễ tính hơn. Trên Linux, Ollama lưu model trong /usr/share/ollama/.ollama/models. Trên hầu hết image VPS, thư mục này nằm trên root filesystem. Một root volume 40GB sẽ không chứa được bản build bf16 có dung lượng 57 GB. Nó cũng không chứa được hai tag 8-bit đặt cạnh nhau. Nếu bạn chưa từng kiểm tra một lần pull thực sự ghi những gì, bài Ollama lưu model ở đâu và cách di chuyển chúng sẽ hướng dẫn qua thư mục đó. Hãy di chuyển store sang một volume đã mount trước khi pull bất kỳ thứ gì.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaUser ollama phải sở hữu thư mục đó, vì service chạy dưới user ollama và service tự ghi các blob vào đó. Nếu pull lỗi do permission, nguyên nhân sẽ xuất hiện trong journalctl -u ollama -n 50.
Cần nói rõ về swap: swap không giúp bạn chạy một tag lớn hơn. Mỗi token được tạo ra đều cần truy cập weights, nên các weights nằm trong swap sẽ liên tục được đọc lại từ disk. vmstat 1 sẽ cho thấy các cột si và so hoạt động liên tục, còn tốc độ output giảm xuống chỉ còn vài giây mỗi token. Hãy giữ một swap file nhỏ để phòng OOM killer. Cấp đủ RAM cho tag bạn thực sự muốn chạy.
Cài đặt Ollama và cố định tag có tên
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaScript cài đặt sẽ thiết lập một service systemd, vì vậy server sẽ tự khởi động lại service sau khi reboot. Nếu bạn không muốn chạy Ollama dưới dạng system service do root quản lý, hãy xem chạy Ollama rootless bằng Podman. Sau đó, pull một tag cụ thể.
ollama pull muse-glimmer:30b
ollama listTự đọc cột kích thước trong ollama list và so sánh với danh sách tag hiện tại trên trang model. Các tag đã publish có thể được thêm, đổi tên hoặc xóa. Kích thước trong một hướng dẫn chỉ là ảnh chụp tại một thời điểm.
Không bao giờ ghi ollama pull muse-glimmer trên server mà bạn phụ thuộc vào. Tên model không kèm tag sẽ trỏ đến tag latest, còn latest là một pointer mà publisher có thể chuyển sang build khác. Một lần pull thông thường sau đó có thể thay model đang chạy bên dưới agent của bạn, với nhu cầu bộ nhớ và hành vi khác, nhưng log không thông báo việc này. Hãy ghi tag trong script, unit file và cấu hình agent. Tự host LLM bằng Ollama trên VPS trình bày các bước còn lại để thiết lập server.
Bạn có thể chạy Muse Glimmer mà không cần GPU không?
Có, nhưng cần nói rõ giới hạn. Việc sinh một token cần đọc trọng số của model từ memory, nên tốc độ phụ thuộc vào memory bandwidth chứ không phải số vCPU mà gói dịch vụ quảng cáo. Sau một số core nhất định, thêm core gần như không giúp nhiều. Trên shared VPS, bandwidth này được chia sẻ với mọi tenant khác trên host, vì vậy model 30B ở 4-bit chỉ tạo được một số token nhỏ mỗi giây.
Đừng tin bất kỳ con số nào về việc này, kể cả con số của tôi. Đo số token mỗi giây trên chính máy của bạn rồi quyết định dựa trên kết quả thực tế.
Kết quả là model này phù hợp rõ rệt với hai kiểu workload khác nhau. Chat tương tác rất khó chịu, vì bạn đọc nhanh hơn tốc độ server ghi và mỗi câu trả lời đều bắt đầu bằng một khoảng chờ dài. Tác vụ agent chạy nền thì phù hợp, vì một task chạy unattended trong mười phút không quan tâm nó chậm. Đây chính là workload mà Meta mô tả cho model này.
Nếu cần tốc độ tương tác, có hai câu trả lời thực tế: GPU hoặc hosted API. Tính điểm hòa vốn giữa GPU VPS và token API trước khi thuê bất kỳ thứ gì, và GPU VPS thực sự cung cấp cho bạn những gì giải thích rõ thứ bạn đang mua. Để trả lời câu hỏi rộng hơn về việc một máy cụ thể có thể chạy được model nào, hãy bắt đầu với những model bạn có thể tự host, còn chạy một model Qwen có kích thước tương tự trên VPS là phép so sánh gần nhất trong phân khúc kích thước này. Nếu các số đo cho thấy tốc độ quá chậm để sử dụng, Nemotron 3.5 Lightning trên VPS đặt ra cùng các câu hỏi về RAM và số token mỗi giây đối với một model được xây dựng để ưu tiên tốc độ thay vì kích thước.
Vì sao model quên thông tin từ rất lâu trước khi đạt 128K token?
Vì context window mặc định của Ollama là 4096 token, bất kể model hỗ trợ bao nhiêu. Tính đến tháng 8 năm 2026, FAQ của Ollama vẫn ghi giá trị mặc định này. Tag quảng cáo 128K, nhưng server chỉ cấp cho model 4096 token cho đến khi bạn thay đổi. Vì vậy, transcript dài của agent sẽ mất các lượt trao đổi đầu tiên và model trông như bị mất trí nhớ.
Tăng giá trị này trên server cho mọi request:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Trong một interactive session, /set parameter num_ctx 32768 chỉ thay đổi giá trị cho session đó. Với API, gửi num_ctx trong request options.
Mỗi token context bổ sung đều tiêu tốn thêm memory ngoài phần weights. Nếu yêu cầu đủ 128K trên máy chỉ được sizing cho phần weights, quá trình load sẽ fail hoặc chuyển sang một chế độ chậm hơn. Hãy tăng theo từng bước và chạy ollama ps sau mỗi bước. Cách num_ctx và độ dài context hoạt động trong Ollama trình bày phần tính toán chi tiết.
Mức độ suy luận: low, medium, high và xhigh
Meta định nghĩa 4 mức độ suy luận cho Muse Glimmer, từ low đến xhigh, và khuyến nghị 2 mức cao hơn cho các tác vụ coding phức tạp và agent. Trong Ollama, thiết lập này dùng tham số think. Dùng --think= trên command line hoặc gửi think trong phần body của API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Trong một interactive session, /set think và /set nothink dùng để bật hoặc tắt thiết lập này. Tài liệu Ollama cho biết hầu hết model chấp nhận giá trị boolean hoặc một mức như low, medium hay high; một số model chấp nhận max cho mức cao nhất hiện có. Các chuỗi chính xác mà model này chấp nhận được ghi trên trang của model. Hãy đọc trang đó thay vì đoán, rồi thử thủ công một giá trị trước khi tích hợp vào agent.
Trên máy chỉ có CPU, thiết lập này ảnh hưởng rõ đến thời gian xử lý. Mức cao hơn khiến model tạo nhiều thinking token hơn trước khi hiển thị từ đầu tiên của câu trả lời. Mỗi thinking token tiêu tốn thời gian thực tương đương một answer token. Hãy để các tác vụ thường ngày ở mức low. Độ dài câu trả lời cũng cần được kiểm soát tương tự, vì vậy hãy giới hạn câu trả lời bằng num_predict thay vì để một câu trả lời dài dòng giữ một máy chậm bận trong vài phút.
Giữ model đã load cho agent luôn chạy
Theo mặc định, Ollama unload model khi không hoạt động trong 5 phút. Với agent chạy mỗi 10 phút, điều đó có nghĩa là phải load đầy đủ 18 GB từ disk ở mỗi lần chạy. Trên VPS dùng network attached storage, quá trình này không nhanh. Thay vào đó, hãy giữ model trong memory.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Giá trị âm sẽ giữ model resident cho đến khi có thao tác unload. keep_alive trong API request sẽ ghi đè giá trị mặc định của server cho riêng lần gọi đó. Cái giá phải trả là rõ ràng: RAM vẫn bị chiếm dụng khi không có tác vụ nào chạy. Vì vậy, chỉ nên dùng thiết lập này trên máy dành riêng cho agent. Giữ model Ollama đã load trình bày các biến thể.
Trỏ coding agent vào đó
Ollama cung cấp API tương thích với OpenAI tại http://127.0.0.1:11434/v1, vì vậy hầu hết công cụ agent chỉ cần kết nối bằng base URL và một API key không rỗng. Trang Muse Glimmer của Ollama cũng có tài liệu về shortcut khởi chạy để kết nối một agent được hỗ trợ với model local chỉ bằng một lệnh. Bạn cũng nên cố định tag tại đó.
ollama launch claude --model muse-glimmer:30bAgent gửi các prompt lớn. Nội dung file, output của tool và transcript ngày càng dài đều được gửi dưới dạng input token. Trên máy chỉ có CPU, xử lý prompt là phần gây chậm trước cả khi quá trình sinh nội dung bắt đầu. Đặt context ở mức nhỏ nhất phù hợp với tác vụ. Trỏ coding agent vào Ollama trình bày phần client, chạy coding agent trên VPS trình bày máy chủ nơi agent chạy, còn kiểm soát chi phí của agent trên VPS trình bày những gì xảy ra khi agent chạy cả ngày.
Image input hoạt động tương tự. Ollama API nhận image trong field images của message. Vì vậy, một client chỉ hỗ trợ text sẽ không bao giờ gửi image, dù perception encoder có khả năng đến đâu.
Không mở cổng 11434
Ollama API không có cơ chế xác thực. Cấu hình OLLAMA_HOST=0.0.0.0:11434 để truy cập từ laptop sẽ đưa một model runner không có xác thực lên Internet công khai. Bất kỳ ai tìm thấy endpoint này đều có thể tải model vào disk của bạn và đọc mọi dữ liệu agent gửi qua đó. Hãy để service bind vào localhost và dùng tunnel thay thế.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsBảo vệ Ollama API endpoint trình bày các tùy chọn phù hợp, bao gồm reverse proxy yêu cầu thông tin xác thực.
Những gì sẽ hỏng và những gì bạn sẽ thấy
Pull dừng giữa chừng. Nguyên nhân là disk. Chạy df -h trên thư mục model. Bản build bf16 57 GB không vừa trên root volume 40GB, và hai tag 8-bit đặt cùng lúc cũng không vừa.
Model load xong rồi process chết. Nguyên nhân là hết memory. dmesg -T ghi lại việc kernel out of memory killer chọn một process, còn journalctl -u ollama -n 100 hiển thị cùng sự kiện từ phía service. Cách khắc phục là dùng tag nhỏ hơn hoặc num_ctx nhỏ hơn. Tăng swap không giải quyết được vấn đề này.
Chạy với tốc độ vài giây cho mỗi token. Chạy vmstat 1 và theo dõi các cột si và so. Hoạt động swap liên tục cho biết weights không vừa trong RAM. Box phải đọc chúng lại từ disk trong lúc xử lý.
Một tag chạy được tuần trước nhưng hiện đã biến mất. Danh sách tag có thể thay đổi. Đọc lại trang model, pin tag hiện tại và ghi tên tag ở nơi bạn có thể tìm lại.
Kiểm tra lại kích thước trước khi pull
Kích thước trong bảng được lấy từ trang tag của model vào ngày 16 August 2026. Danh sách tag đã công bố không phải là cam kết cố định. Đọc danh sách hiện tại trên trang model, rồi xác nhận dữ liệu thực tế đã được ghi xuống disk:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama lưu các layer của model dưới dạng blob dùng chung, nên hai tag dùng chung một layer sẽ không chiếm gấp đôi disk. So sánh kết quả du báo cáo với kích thước đã công bố và dự trù disk theo giá trị lớn hơn.
FAQ
Muse Glimmer cần bao nhiêu RAM trên VPS?
Bắt đầu từ dung lượng của tag rồi cộng thêm context window. Tag mặc định hiện được liệt kê ở mức khoảng 18 GB vào ngày 16 August 2026, vì vậy máy 16GB hoàn toàn không đủ chỗ chứa, còn máy 24GB chỉ còn lại rất ít chỗ cho context. Hãy xem đây là điểm bắt đầu, không phải câu trả lời cuối cùng. Pull tag, load tag một lần, rồi chạy ollama ps và free -h trên máy của bạn để đọc số liệu thực tế. Context dài hơn và các request chạy song song đều làm tăng mức dùng memory ngoài phần weights.
Có thể chạy Muse Glimmer mà không cần GPU không?
Có. Model load và trả lời chỉ bằng CPU trên VPS. Tốc độ generation bị giới hạn chủ yếu bởi memory bandwidth, không phải số core. Trên host dùng chung, bandwidth đó còn bị chia sẻ, vì vậy ở chế độ 4-bit, bạn chỉ nên kỳ vọng vài token mỗi giây. Mức này đủ dùng cho background agent chạy unattended, nhưng sẽ chậm và khó chịu khi chat tương tác. Chạy ollama ps trong lúc có request rồi đọc cột processor để xác nhận phần xử lý đang chạy ở đâu.
Các tag MLX có dùng được trên Linux VPS không?
Không. Mọi tag có mlx trong tên đều được build cho MLX engine của Ollama, tức backend dành cho Apple Silicon. Trên server Linux x86, các tag này chỉ là những file tải xuống rất lớn mà bạn không thể chạy. Hãy dùng tag 30b thông thường hoặc một tag khác không phải MLX, đồng thời bỏ qua các benchmark phần cứng Apple đi kèm bản build MLX.
Vì sao model quên thông tin từ lâu trước khi đạt 128K token?
Vì context window mặc định của Ollama là 4096 token, bất kể model hỗ trợ bao nhiêu token. Do đó, server sẽ truncate các cuộc hội thoại dài trước khi model nhìn thấy chúng. Đặt OLLAMA_CONTEXT_LENGTH trên server, hoặc dùng /set parameter num_ctx cho một session, hoặc gửi num_ctx trong options của API request. Mức dùng memory sẽ tăng theo giá trị này, vì vậy hãy tăng từng bước và kiểm tra ollama ps sau mỗi lần thay đổi.
Nên pin tag hay cứ dùng latest?
Hãy pin tag. muse-glimmer không có tag sẽ resolve thành latest. Đây là một pointer mà publisher có thể chuyển sang build khác bất kỳ lúc nào, vì vậy một lần pull thông thường có thể làm thay đổi model mà agent của bạn chạy. Ghi muse-glimmer:30b trong script, unit file và agent config. Kiểm tra danh sách tag trên trang model trước khi pin, vì các tag đã publish có thể thay đổi.