Meta Muse Glimmer 30B VPS 실행 및 하드웨어 요구 사항
Muse Glimmer 30B 모델을 Linux VPS에서 실행하기 위한 RAM과 디스크 용량을 정리했습니다. 17GB에서 59GB에 달하는 태그별 메모리 점유율을 확인하고, CPU 추론 시 필요한 서버 사양과 최적의 태그 선택 기준을 상세히 안내합니다.
VPS에서 Muse Glimmer를 실행하기 위한 요구 사항
Muse Glimmer는 GPU가 없는 일반적인 Linux VPS에서 실행되며, 메모리 적합 여부는 가져오는 태그에 따라 결정됩니다. Meta Superintelligence Labs는 2026년 8월 10일에 Apache 2.0 라이선스로 이 모델을 공개했습니다. 이 모델은 300억 개의 파라미터, 128K 컨텍스트 윈도우, 그리고 텍스트와 함께 이미지를 읽을 수 있는 18억 파라미터 규모의 전용 인식 인코더를 갖추고 있습니다. Meta는 이 모델을 일반적인 채팅용이 아닌 상시 가동되는 로컬 에이전트용으로 설계했으며, 추론 강도는 요청별로 설정할 수 있습니다.
2026년 8월 16일 기준으로 확인된 Ollama 태그는 17 GB에서 59 GB 사이의 크기를 가집니다. 이 범위가 전체적인 용량 산정의 핵심입니다. 기본 태그의 크기는 약 18 GB로 명시되어 있으므로, 가장 작은 규모의 서버라도 18 GB 이상의 여유 RAM을 확보해야 합니다. 다운로드를 위한 디스크 공간과 컨텍스트 윈도우를 위한 메모리는 이와 별도로 추가 확보해야 합니다.
어떤 muse-glimmer 태그를 가져와야 합니까?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama는 Apple 빌드가 아닌 이 모델에 대해 11개의 태그를 나열합니다. 이 태그들은 서로 다른 수치 정밀도로 저장된 동일한 300억 개의 가중치를 포함합니다. 표시되는 크기는 다운로드할 용량이며, 컨텍스트가 추가되기 전 메모리에 상주시켜야 하는 대략적인 크기이기도 합니다.
두 가지 4비트 빌드는 작은 크기의 빌드로, 30b-nvfp4은 17 GB, 30b-q4_K_M는 18 GB입니다. 기본 30b 태그는 q4_K_M 빌드와 동일한 크기로 나열됩니다. 8비트 빌드인 30b-q8_0와 30b-mxfp8은 31 GB 근처입니다. 30b-bf16은 57 GB 크기의 양자화되지 않은 16비트 릴리스이며, 이는 대부분의 임대 서버가 제공하는 RAM보다 크고 사이드 프로젝트에 지불하기에는 비용이 너무 높습니다.
-dflash 태그는 DFlash를 지원하는 동일한 빌드이며, 각각 일반 버전보다 더 크게 나열됩니다. Ollama는 DFlash를 속도 향상 기능으로 설명하며 Apple Silicon 및 데스크톱 GPU에서 이를 시연합니다. CPU 전용 VPS에서는 다른 하드웨어에서 측정된 기능을 위해 실제 메모리에서 추가적인 용량을 지불해야 하므로, 일반 태그로 시작하여 한 번에 하나씩 변경하십시오.
특별한 이유가 없다면 4비트에서 시작하십시오. 4비트에서 8비트로 이동하면 CPU가 토큰을 생성할 때마다 읽어야 하는 바이트 수가 거의 두 배로 늘어나므로, 메모리 사용량은 증가하고 처리량은 감소합니다. 이러한 트레이드오프는 q4, q8 및 fp16 양자화의 실제 비용에서 다루며, CPU 서버의 경우 짧은 답변은 4비트 빌드부터 시작하는 것이 유일한 방법이라는 것입니다.
Linux 서버에서 MLX 태그가 작동하지 않는 이유
MLX는 Apple의 배열 프레임워크이며, Ollama의 MLX 엔진은 Apple Silicon을 위한 백엔드입니다. 이름에 mlx가 포함된 모든 태그는 해당 엔진과 하드웨어를 위해 빌드되었습니다. x86 기반의 Linux VPS에서 이러한 태그를 다운로드하면 수십 기가바이트의 실행 불가능한 파일만 디스크를 차지하게 됩니다. 발표 자료에 기재된 속도 수치는 Mac에서 측정된 결과이므로 서버의 성능과는 무관합니다. 모델 페이지에서 태그 목록을 확인할 때는 먼저 mlx이 포함된 이름을 모두 제외한 뒤, 남은 항목 중에서 크기를 선택하십시오.
실제 필요한 RAM과 디스크 용량은 얼마입니까?
메모리를 점유하는 요소는 두 가지이며, 그중 하나만이 태그 크기입니다. 가중치는 선택한 태그에 의해 고정됩니다. 대화 상태를 유지하기 위해 모델이 사용하는 KV 캐시는 설정한 컨텍스트 길이에 따라 증가합니다. Ollama 공식 문서에 따르면 병렬 요청을 처리할 경우 컨텍스트가 처리 중인 요청 수만큼 곱해지므로, 두 에이전트의 요청을 동시에 처리하는 서버는 한 에이전트만 처리하는 서버보다 더 많은 메모리가 필요합니다.
이 가이드를 포함하여 어떤 문서에 나온 RAM 수치도 그대로 믿지 마십시오. 태그를 내려받고 프롬프트를 하나 보낸 뒤, 모델이 메모리에 상주하는 상태에서 다음 두 명령어를 실행하십시오.
ollama ps
free -hollama ps은 현재 로드된 항목과 CPU 및 GPU 간의 작업 분담 현황을 보여줍니다. free -h는 남은 자원을 보여줍니다. 이 두 출력값은 사용자의 컨텍스트 설정, 양자화 방식, 그리고 서버에서 실행 중인 다른 모든 프로세스를 이미 반영하고 있으므로 어떤 표보다 정확합니다.
디스크 용량은 비교적 계산하기 쉽습니다. Ollama는 Linux에서 모델을 /usr/share/ollama/.ollama/models 경로에 저장하며, 대부분의 VPS 이미지에서는 이 경로가 루트 파일시스템에 위치합니다. 40GB 크기의 루트 볼륨은 57 GB인 bf16 빌드를 담을 수 없으며, 8비트 태그 두 개를 나란히 저장하는 것도 불가능합니다. 모델을 내려받기 전에 저장소를 마운트된 볼륨으로 옮기십시오.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama서비스가 ollama 계정으로 실행되어 해당 위치에 블롭(blob)을 직접 작성하므로, ollama 사용자가 해당 디렉터리의 소유권을 가져야 합니다. 권한 문제로 모델 내려받기가 실패한다면 journalctl -u ollama -n 50에서 그 이유를 확인할 수 있습니다.
스왑(swap)에 대해서는 명확히 해둘 점이 있습니다. 스왑은 더 큰 태그를 실행할 수 있게 해주지 않습니다. 생성 과정에서는 토큰을 생성할 때마다 가중치를 참조해야 하므로, 스왑에 있는 가중치를 디스크에서 반복적으로 읽어오게 됩니다. 이때 vmstat 1을 보면 si와 so 열이 바쁘게 움직이며, 출력 속도는 토큰당 수 초 단위로 느려집니다. OOM(Out of Memory) 킬러에 대비한 보험으로 작은 스왑 파일만 유지하십시오. RAM 크기는 실제로 사용하려는 태그에 맞춰 설정해야 합니다.
Ollama 설치 및 명명된 태그 고정
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama설치 스크립트는 systemd 서비스를 설정하므로 서버가 재부팅되어도 서비스가 자동으로 다시 시작됩니다. root가 관리하는 시스템 서비스로 실행하고 싶지 않다면 Podman에서 root 권한 없이 Ollama 실행하기 문서를 참조하십시오. 그 후 명시적인 태그를 사용하여 모델을 pull 하십시오.
ollama pull muse-glimmer:30b
ollama listollama list의 크기 열을 직접 확인하고 모델 페이지의 현재 태그 목록과 비교하십시오. 게시된 태그는 추가, 이름 변경, 삭제될 수 있으며 가이드에 기재된 크기는 특정 시점의 스냅샷일 뿐입니다.
운영 중인 서버에서 절대로 ollama pull muse-glimmer를 사용하지 마십시오. 모델 이름만 단독으로 쓰면 latest 태그로 해석되며, latest은 게시자가 언제든 다른 빌드로 변경할 수 있는 포인터입니다. 정기적으로 pull을 수행하면 에이전트가 사용하는 모델이 예고 없이 교체될 수 있으며, 이 경우 메모리 요구 사항이나 동작 방식이 달라질 수 있습니다. 로그에는 이러한 변경 사항이 기록되지 않습니다. 스크립트, unit 파일, 에이전트 설정에는 반드시 태그를 명시하십시오. VPS에서 Ollama로 LLM 직접 호스팅하기 문서에서 나머지 서버 설정 방법을 확인할 수 있습니다.
GPU 없이 Muse Glimmer를 실행할 수 있습니까?
네, 가능합니다. 하지만 성능의 한계에 대해서는 분명히 말씀드려야 합니다. 토큰 하나를 생성하려면 메모리에서 모델 가중치를 읽어와야 하므로, 속도는 플랜에서 광고하는 vCPU 개수가 아니라 메모리 대역폭에 의해 결정됩니다. 코어 수가 일정 수준을 넘어가면 코어를 더 늘려도 성능 향상은 거의 없습니다. 공유 VPS 환경에서는 해당 대역폭을 호스트의 다른 모든 사용자와 나누어 쓰기 때문에, 4-bit 양자화된 30B 모델을 실행하면 초당 생성되는 토큰 수가 매우 적습니다.
제 수치를 포함하여 그 누구의 수치도 그대로 받아들이지 마십시오. 직접 서버에서 초당 토큰 생성 속도를 측정하고 결과를 보고 판단하십시오.
이 결과로 인해 모델의 용도가 극명하게 갈립니다. 서버가 작성하는 속도보다 사용자가 읽는 속도가 더 빠르고 모든 응답 시작 시 긴 지연 시간이 발생하므로, 대화형 채팅 용도로는 적합하지 않습니다. 반면, 백그라운드 에이전트 작업은 10분 동안 사람이 보지 않아도 상관없으므로 느린 속도가 문제가 되지 않습니다. Meta가 이 모델을 설명할 때 언급한 용도가 바로 이러한 후자의 작업 방식입니다.
대화형 속도가 필요하다면 GPU를 사용하거나 호스팅된 API를 사용하는 것이 정직한 두 가지 해결책입니다. 서버를 임대하기 전에 GPU VPS와 API 토큰 사용 비용의 손익분기점을 계산해 보시고, GPU VPS가 실제로 제공하는 것을 통해 무엇을 구매하는 것인지 확인하십시오. 특정 서버에서 어떤 모델을 수용할 수 있는지에 대한 더 넓은 질문은 직접 호스팅 가능한 모델에서 시작하시고, 비슷한 크기의 Qwen 모델을 VPS에서 실행하기를 통해 이 체급의 모델과 가장 가까운 비교 사례를 확인하십시오.
왜 128K 토큰에 도달하기 훨씬 전에 내용을 잊어버립니까?
Ollama의 기본 컨텍스트 윈도우는 모델이 지원하는 사양과 관계없이 4096 토큰으로 설정되어 있기 때문입니다. 이 기본값은 2026년 8월 기준 Ollama 공식 FAQ에 명시되어 있습니다. 모델 태그는 128K를 지원한다고 광고하지만, 서버는 사용자가 별도로 지정하지 않는 한 4096 토큰만 모델에 전달합니다. 따라서 긴 에이전트 대화 기록은 앞부분이 잘려 나가게 되며, 모델은 마치 기억상실증에 걸린 것처럼 동작합니다.
모든 요청에 대해 서버 측에서 컨텍스트 길이를 높이십시오:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"대화형 세션 내에서는 /set parameter num_ctx 32768를 사용하여 해당 세션에만 설정을 변경할 수 있습니다. API를 사용하는 경우 요청 옵션에 num_ctx을 포함하여 전송하십시오.
컨텍스트 토큰이 추가될 때마다 모델 가중치 외에 추가적인 메모리가 소모됩니다. 모델 가중치만 겨우 올릴 수 있는 사양의 서버에서 128K 전체를 요청하면 로드가 실패하거나 더 느린 방식으로 동작하게 됩니다. 컨텍스트 길이를 단계별로 높이면서 매 단계마다 ollama ps를 실행하여 확인하십시오. Ollama에서 num_ctx와 컨텍스트 길이가 작동하는 방식에서 관련 계산법을 자세히 다룹니다.
추론 강도: low, medium, high 및 xhigh
Meta는 Muse Glimmer에 대해 low부터 xhigh까지 4단계의 추론 강도를 정의하며, 복잡한 코딩 및 에이전트 작업에는 상위 2단계를 권장합니다. Ollama에서는 이 설정이 think 매개변수를 통해 제어됩니다. 명령줄에서는 --think=을 사용하거나, API 본문에 think을 전송하십시오.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"대화형 세션 내에서는 /set think 및 /set nothink로 이를 전환할 수 있습니다. Ollama 문서에 따르면 대부분의 모델은 불리언 값이나 low, medium, high와 같은 단계를 허용하며, 일부 모델은 사용 가능한 최고 수준을 위해 max을 허용합니다. 해당 모델이 정확히 어떤 문자열을 허용하는지는 모델 페이지에 명시되어 있으므로, 추측하지 말고 해당 페이지를 확인하십시오. 또한 에이전트에 적용하기 전에 수동으로 먼저 테스트해 보십시오.
CPU 전용 환경에서는 이 설정의 영향이 큽니다. 추론 강도가 높을수록 답변의 첫 단어가 출력되기 전에 더 많은 사고 토큰이 생성되며, 사고 토큰은 답변 토큰과 동일한 처리 시간을 소모합니다. 일상적인 작업은 low 설정으로 유지하십시오.
상시 가동 에이전트를 위해 모델을 메모리에 유지하기
Ollama는 기본적으로 5분이 지나면 유휴 상태인 모델을 메모리에서 해제합니다. 10분마다 실행되는 에이전트의 경우, 매번 실행할 때마다 18 GB에 달하는 데이터를 디스크에서 불러와야 합니다. 네트워크 연결형 스토리지를 사용하는 VPS 환경에서는 이 로딩 과정이 매우 느립니다. 대신 모델을 메모리에 고정하십시오.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"음수 값을 설정하면 다른 프로세스가 강제로 해제하기 전까지 모델이 메모리에 상주합니다. API 요청 시 keep_alive을 사용하면 해당 호출에 한해 서버의 기본 설정을 덮어쓸 수 있습니다. 이 설정은 명확한 비용을 수반합니다. 아무런 작업이 없는 동안에도 RAM을 계속 점유하므로, 에이전트 전용으로 운영하는 서버에 적합한 설정입니다. Ollama 모델을 메모리에 유지하는 방법에서 다양한 설정 방식을 다룹니다.
코딩 에이전트 연결하기
Ollama는 http://127.0.0.1:11434/v1에서 OpenAI 호환 API를 제공하므로, 대부분의 에이전트 도구는 기본 URL과 비어 있지 않은 API 키를 입력하여 연결할 수 있습니다. Ollama의 Muse Glimmer 페이지에는 지원되는 에이전트를 로컬 모델에 한 번의 명령어로 연결하는 실행 단축키도 문서화되어 있으며, 해당 페이지에서 태그를 고정하는 것이 좋습니다.
ollama launch claude --model muse-glimmer:30b에이전트는 큰 프롬프트를 전송합니다. 파일 내용, 도구 출력, 계속 늘어나는 대화 기록이 모두 입력 토큰으로 전달되는데, CPU 기반 서버에서는 생성 단계가 시작되기도 전에 프롬프트를 처리하는 과정에서 부하가 발생합니다. 컨텍스트 설정은 작업이 허용하는 범위 내에서 최대한 작게 유지하십시오. Ollama에 코딩 에이전트 연결하기에서는 클라이언트 측 설정을, VPS에서 코딩 에이전트 실행하기에서는 에이전트가 구동되는 서버 환경을, VPS에서 에이전트 비용 제어하기에서는 에이전트를 하루 종일 실행할 때 발생하는 비용 관리 방법을 다룹니다.
이미지 입력도 동일한 방식으로 작동합니다. Ollama API는 메시지의 images 필드를 통해 이미지를 수신하므로, 인식 인코더의 성능이 아무리 뛰어나더라도 텍스트 전용 클라이언트는 이미지를 전송할 수 없습니다.
포트 11434를 개방하지 마십시오
Ollama API에는 인증 기능이 없습니다. OLLAMA_HOST=0.0.0.0:11434를 설정하여 노트북에서 접근할 수 있도록 만들면, 인증되지 않은 모델 실행기가 공용 인터넷에 노출됩니다. 이를 발견한 누구든 사용자의 디스크에 모델을 로드하거나 에이전트가 전송하는 모든 데이터를 읽을 수 있습니다. 해당 포트는 localhost에 바인딩된 상태로 두고 터널링을 사용하십시오.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API 엔드포인트 보안 설정에서는 자격 증명을 요구하는 리버스 프록시를 포함하여 올바른 설정 방법을 다룹니다.
무엇이 문제이며, 어떤 현상이 나타나는가
풀(pull) 과정이 중간에 멈춥니다. 디스크 용량 문제입니다. 모델 디렉터리를 대상으로 df -h를 실행하십시오. 9 GB 크기의 bf16 빌드는 40GB 루트 볼륨에 들어가지 않으며, 8-bit 태그 두 개를 나란히 두는 것도 마찬가지입니다.
모델은 로드되지만 프로세스가 종료됩니다. 메모리 부족(OOM) 현상입니다. dmesg -T은 커널의 OOM 킬러가 프로세스를 선택하는 기록을 보여주며, journalctl -u ollama -n 100은 동일한 이벤트의 서비스 측면을 보여줍니다. 해결책은 더 작은 태그를 사용하거나 더 작은 num_ctx을 사용하는 것입니다. 스왑을 늘리는 것은 해결책이 아닙니다.
토큰당 수 초가 걸릴 정도로 느립니다. vmstat 1를 실행하고 si 및 so 열을 확인하십시오. 스왑 활동이 지속된다면 가중치가 RAM에 모두 들어가지 않아 작업 중에 디스크에서 데이터를 계속 읽어오고 있다는 뜻입니다.
지난주까지 잘 작동하던 태그가 사라졌습니다. 태그 목록은 변경될 수 있습니다. 모델 페이지를 다시 읽고, 현재 버전을 고정(pin)한 뒤 나중에 다시 확인할 수 있도록 태그 이름을 기록해 두십시오.
풀하기 전에 직접 크기를 다시 확인하십시오
차트에 기재된 크기는 2026년 8월 16일 모델 태그 페이지에서 읽은 것이며, 게시된 태그 목록이 항상 유지된다는 보장은 없습니다. 모델 페이지에서 현재 목록을 읽고, 실제로 디스크에 저장된 크기를 확인하십시오:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama는 모델 레이어를 공유 블록으로 저장하므로, 레이어를 공유하는 태그 두 개가 디스크 공간을 두 배로 차지하지는 않습니다. du이 보고하는 내용과 게시된 크기를 비교하고, 둘 중 더 큰 값을 기준으로 디스크 용량을 계획하십시오.
FAQ
Muse Glimmer는 VPS에서 어느 정도의 RAM이 필요한가요?
태그 크기에서 시작하여 컨텍스트 윈도우를 더해야 합니다. 기본 태그는 2026년 8월 16일 기준으로 약 18 GB이므로, 16GB 서버에서는 아예 실행할 수 없으며 24GB 서버에서도 컨텍스트를 위한 여유 공간이 거의 남지 않습니다. 이를 정답이 아닌 시작점으로 삼으십시오. 태그를 가져와 한 번 로드한 뒤, 직접 서버에서 ollama ps 및 free -h를 실행하여 실제 수치를 확인하십시오. 더 긴 컨텍스트와 병렬 요청은 모두 가중치 외에 추가적인 메모리를 사용합니다.
GPU 없이 Muse Glimmer를 실행할 수 있나요?
네. CPU 전용 VPS에서도 로드 및 응답이 가능합니다. 생성 속도는 코어 수보다는 메모리 대역폭에 의해 제한되며, 공유 호스트에서는 해당 대역폭을 공유하므로 4-bit 환경에서 초당 적은 수의 토큰이 생성될 것으로 예상해야 합니다. 이는 백그라운드에서 자동으로 실행되는 에이전트 작업에는 사용할 수 있으나, 대화형 채팅에는 속도가 매우 느립니다. 요청 중에 ollama ps을 실행하여 프로세서 열을 확인하면 작업이 어디에서 수행되는지 알 수 있습니다.
Linux VPS에서 MLX 태그를 사용할 수 있나요?
아니요. 이름에 mlx가 포함된 모든 태그는 Ollama의 Apple Silicon 백엔드인 MLX 엔진용으로 빌드되었습니다. x86 Linux 서버에서는 해당 태그를 다운로드하더라도 실행할 수 없습니다. 일반 30b 태그나 MLX가 아닌 다른 태그를 사용하고, MLX 빌드와 함께 제공되는 Apple 하드웨어 벤치마크는 무시하십시오.
모델이 왜 128K 토큰에 도달하기 훨씬 전에 내용을 잊어버리나요?
모델이 지원하는 사양과 관계없이 Ollama의 기본 컨텍스트 윈도우가 4096 토큰으로 설정되어 있어, 서버가 긴 대화를 모델이 인식하기 전에 잘라내기 때문입니다. 서버에서 OLLAMA_CONTEXT_LENGTH을 설정하거나, 단일 세션의 경우 /set parameter num_ctx을 사용하거나, API 요청 옵션에 num_ctx을 전달하십시오. 설정값에 따라 메모리 사용량이 증가하므로 단계적으로 값을 올리면서 매번 ollama ps를 확인하십시오.
태그를 고정해야 하나요, 아니면 latest를 사용해야 하나요?
고정하십시오. 태그가 없는 muse-glimmer은 latest로 해석되는데, 이는 게시자가 언제든지 다른 빌드로 변경할 수 있는 포인터이므로 정기적인 pull 작업 시 에이전트가 실행 중인 모델이 바뀔 수 있습니다. 스크립트, 유닛 파일 및 에이전트 설정에는 muse-glimmer:30b를 기입하십시오. 게시된 태그는 변경될 수 있으므로 고정하기 전에 모델 페이지의 태그 목록을 확인하십시오.