VPS에서 Ollama로 Nemotron 3.5 Lightning 실행하기
NVIDIA Nemotron 3.5 Lightning 모델을 VPS에서 구동하는 방법을 안내합니다. Ollama 실행을 위한 최적의 태그와 필요한 최소 RAM 용량, 그리고 CPU 전용 환경에서의 실제 성능 한계를 상세히 분석하여 서버 구축 시 고려해야 할 핵심 사양을 정리했습니다.
Nemotron 3.5 Lightning의 용도
Nemotron 3.5 Lightning은 2026년 8월에 출시된 NVIDIA의 오픈 30B Mixture-of-Experts 모델이며, 단일 채팅 창이 아닌 수 시간 동안 실행되는 에이전트를 위해 설계되었습니다. MoE(Mixture of Experts)는 가중치가 여러 전문가 서브 네트워크로 분할되고, 각 토큰이 그중 일부를 통해서만 라우팅되는 방식을 의미합니다. NVIDIA의 모델 카드에 따르면 총 파라미터는 300억 개이며, 토큰당 30억 개의 파라미터가 활성화됩니다. 메모리에는 많은 수의 파라미터가 점유되지만, 그 대가로 빠른 속도를 얻을 수 있습니다.
이러한 트레이드오프가 바로 임대 서버에서 이 모델을 고려해야 하는 이유입니다. 실제 작업을 수행하는 에이전트는 하루 동안 수천 개의 짧은 요청을 보내므로, 비용 대비 처리량이 해당 모델을 자체 서버에서 운영할 수 있을지를 결정합니다. 응답당 40초가 걸리는 모델은 유용한 어시스턴트가 될 수는 있어도 에이전트로는 부적합합니다. 하나의 작업을 수행하는 데 20번의 호출이 필요하고 매번 응답을 기다려야 하기 때문입니다.
NVIDIA는 이 아키텍처를 하이브리드 방식, 즉 Mamba-2와 MoE 레이어가 교차하고 일부 어텐션 레이어가 선택적으로 포함된 구조로 설명합니다. 모델 카드에 명시된 최대 컨텍스트 길이는 1M 토큰이며, 상업적 사용이 가능한 OpenMDW-1.1 라이선스가 적용되었습니다. 주요 언어는 영어와 코드이며, 스페인어, 프랑스어, 독일어, 이탈리아어, 일본어도 지원 목록에 포함되어 있습니다.
Artificial Analysis는 2026년 8월 출시 측정치를 발표했는데, NVFP4 가중치를 사용하는 사전 출시 DeepInfra 엔드포인트에서 초당 약 670개의 출력 토큰을 기록했습니다. 이는 호스팅된 GPU 엔드포인트에서의 결과입니다. 따라서 이 수치는 귀하의 VPS에서 나올 성능이 아니라 해당 아키텍처가 허용하는 잠재적 성능으로 이해해야 합니다.
어떤 Ollama 태그가 VPS에 적합한가
Ollama 라이브러리는 동일한 가중치에 대해 여러 빌드를 제공합니다. 이들 간의 차이는 양자화(quantisation)이며, 이는 각 가중치를 몇 비트로 저장하는지를 의미합니다. 이 설정에 따라 다운로드 크기가 크게 달라집니다.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]latest, 30b, 30b-a3b 태그는 모두 30b-a3b-q4_K_M와 동일한 다이제스트로 연결됩니다. 따라서 기본 다운로드는 1M 컨텍스트를 지원하는 25 GB 크기의 4비트 빌드입니다. Q8_0은 35 GB이며, bf16은 66 GB이고, 둘 다 1M 컨텍스트를 지원합니다. 23 GB 크기의 MLX 빌드는 Apple 실리콘용이며 컨텍스트가 256K로 제한되므로, Linux VPS에서는 적합하지 않습니다.
위 수치는 다운로드 크기일 뿐, 메모리 요구 사항이 아닙니다. NVIDIA는 Ollama 빌드에 대한 최소 VRAM(비디오 RAM) 수치를 공식적으로 제공하지 않으므로, 다운로드 크기를 최소 하한선으로만 간주하십시오. 가중치는 GPU 메모리에 적재되거나, GPU가 부족할 경우 시스템 RAM에 상주해야 합니다. 여기에 KV 캐시(key/value cache, 모델이 대화 중 토큰별로 사용하는 메모리)가 추가로 필요합니다. 하드웨어에 필요한 실제 메모리 수치는 산술 계산이 아닌 아래 명령어를 통해 확인해야 합니다. 아직 양자화 수준을 결정하지 못했다면, Q4, Q8, FP16의 비용 차이에서 각 단계별로 포기해야 하는 성능을 확인할 수 있습니다.
latest 태그 대신 정확한 태그를 사용하십시오
latest은 계속 변하는 포인터입니다. 라이브러리가 이 태그를 다시 게시하면, 아무런 기록 없이도 다음 pull 시점에 에이전트의 동작이 바뀔 수 있습니다. 반드시 태그명을 명시하십시오.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M설치 스크립트는 ollama 사용자로 실행되고 모델을 /usr/share/ollama/.ollama/models 경로에 저장하는 systemd 서비스를 설정합니다. 대부분의 VPS 이미지에서 이 경로는 루트 파일 시스템에 위치하므로, 25 GB를 요청하기 전에 여유 공간을 확인하십시오. 해당 파일 시스템의 용량이 부족하다면, 디스크가 가득 찬 뒤에 조치하기보다 pull을 수행하기 전에 Ollama의 모델 저장 위치와 이동 방법을 읽어보는 것이 좋습니다.
df -h /usr/share/ollamapull이 중간에 멈추고 no space left on device 오류가 발생한다면, 이는 말 그대로 데이터가 완전히 전송되지 않았음을 의미하며, 불완전한 blob 파일은 삭제하기 전까지 디스크에 남아 있습니다. 이후 다음 명령어로 실제 저장된 내용을 확인하십시오:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show은 아키텍처, 파라미터 수, 컨텍스트 길이, 그리고 파일에 실제로 적용된 양자화(quantisation) 정보를 출력합니다. 이 중 하나라도 라이브러리 페이지의 정보와 다르다면, 의도했던 것과 다른 태그를 pull한 것입니다.
서비스를 실행하고 실제 실행 위치 확인하기
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"모델이 로드된 상태에서 두 번째 셸을 엽니다.
ollama ps이 명령은 사용자의 장비에서 메모리 문제를 해결해 줍니다. ollama ps는 로드된 모델, 메모리 점유 크기, 그리고 PROCESSOR 열을 출력합니다. 100% GPU는 모델 전체가 VRAM에 있음을 의미합니다. 100% CPU는 VRAM에 로드된 부분이 없으며, 모든 토큰이 시스템 RAM을 사용하여 프로세서에서 계산됨을 의미합니다. 65%/35% CPU/GPU과 같이 분할된 경우 레이어 전체가 VRAM에 들어가지 않았으며, CPU 점유율이 속도를 결정한다는 뜻입니다. 요구 사항을 추측하지 마십시오. 직접 로드하여 이 줄을 확인하십시오.
모델을 전혀 로드할 수 없는 경우, Ollama는 충돌하는 대신 정상적으로 거부 메시지를 출력합니다.
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)CPU 전용 VPS로 충분히 빠른가?
범용 VPS에는 GPU가 없으므로 CPU가 모든 작업을 수행하며, 필요한 모든 가중치를 시스템 RAM에서 읽어와야 합니다. MoE(Mixture of Experts) 구조는 이 과정에서 도움이 됩니다. 30B 모델이라 하더라도 토큰당 약 30억 개의 파라미터만 사용하므로, 밀집(dense) 30B 모델보다 토큰당 연산량이 훨씬 적기 때문입니다. 하지만 메모리 문제는 해결되지 않습니다. 라우터가 어떤 토큰에 대해 어떤 전문가(expert)를 선택할지 알 수 없으므로, 300억 개의 파라미터 전체가 메모리에 상주해야 합니다.
따라서 이 모델의 CPU 전용 추론 성능은 코어 수보다는 메모리 대역폭에 의해 제한됩니다. 이미 적절한 수의 vCPU를 갖춘 플랜에서 vCPU를 추가하는 것은 성능 향상에 거의 도움이 되지 않습니다. 필요한 것은 가중치와 KV 캐시를 모두 담을 수 있는 충분한 RAM과, 해당 플랜에서 제공하는 가장 빠른 메모리 속도입니다.
에이전트를 배포하기 전에 로컬 LLM의 초당 토큰 수 측정에서 설명한 방법을 사용하여 성능을 측정하십시오.
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."마지막에 출력되는 eval rate 줄이 초당 토큰 단위의 생성 속도입니다. 에이전트의 실제 작업 시간은 이 수치에 의해 결정되므로, 이 단일 지표가 판단의 기준이 됩니다. 예상되는 응답 길이에 이 수치를 곱해 보십시오. 만약 기다리기 힘든 긴 시간이 나온다면, 하드웨어를 변경하지 않고도 단일 호출의 범위를 제한할 수 있는 방법은 num_predict로 출력 제한하기뿐입니다.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]위 수치는 Artificial Analysis가 출시 시점에 보고한 작업당 분 단위 시간을 변환한 타사 데이터이며, VPS가 아닌 호스팅된 GPU 엔드포인트에서 측정되었습니다. Nemotron 3.5 Lightning은 작업당 평균 약 30초가 소요되었으며, gpt-oss-120b은 약 204초, Qwen3.6 35B은 약 210초가 소요되었습니다. 이 수치는 하드웨어 성능을 보장하는 지표가 아니라 성능 차이를 가늠하는 용도로만 사용하십시오.
솔직한 조언을 드리자면, 누가 기다리는지에 따라 결정이 달라집니다. 사람이 에이전트를 기다려야 하거나 에이전트가 연속적으로 긴 호출 체인을 실행해야 한다면 GPU 인스턴스를 대여하십시오. 반면 야간에 스케줄에 따라 실행되며 아무도 지켜보지 않는 작업이라면, 대용량 RAM을 갖춘 CPU 플랜도 합리적인 선택입니다. 어떤 경우든 설정 방식은 동일하며, VPS에서 Ollama 실행하기에서 플랜 규모 산정 방법과 GPU 인스턴스 사용이 API 제공업체에 토큰당 비용을 지불하는 것과 어떻게 다른지 다룹니다. 손익분기점은 활용도에 달려 있습니다. GPU 인스턴스는 존재하는 매 시간 비용이 청구되지만, API는 사용한 토큰만큼만 비용이 발생합니다. 따라서 하루 종일 바쁘게 돌아가는 에이전트라면 직접 서버를 운영하는 것이 유리하고, 한 시간에 두 번 정도 실행되는 에이전트라면 API를 사용하는 것이 보통 더 경제적입니다.
1M 컨텍스트 윈도우는 무료가 아닙니다
1M 토큰은 모델의 최대치이며, Ollama가 기본값으로 제공하지는 않습니다. Ollama는 훨씬 작은 기본 윈도우를 사용하며 대화가 이 길이를 넘어서면 가장 오래된 토큰부터 삭제합니다. 이 과정에서 별도의 로그가 남지 않으므로, 에이전트 입장에서는 모델이 작업의 시작 부분을 잊어버린 것처럼 보입니다.
윈도우를 의도적으로 설정하십시오. 서버 전체에 적용하려면 서비스를 편집하십시오:
sudo systemctl edit ollama다음 내용을 추가한 뒤 sudo systemctl restart ollama을 실행하십시오:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"요청별로 설정하려면 options 객체 안에 num_ctx를 대신 전달하십시오:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'허용하는 토큰 수에 따라 KV 캐시가 커지므로 값을 높일 때마다 메모리 사용량이 증가합니다. 값을 높이고 재시작한 뒤 ollama ps을 다시 실행하여 보고되는 크기가 증가하는지 확인하십시오. 변경 후 PROCESSOR 열이 100% GPU에서 split으로 바뀐다면, KV 캐시가 모델 레이어를 VRAM 밖으로 밀어낸 것이며 속도가 급격히 떨어질 것입니다. Ollama에서 num_ctx 선택하기에서 이 절충안을 자세히 다룹니다. 모델 카드에서 허용한다고 해서 무작정 1000000으로 설정하지 마십시오. 할당이 사전에 이루어지므로 로드 자체가 실패할 수 있습니다.
상시 실행 에이전트에 연결하기
이 모델에 대한 Ollama의 출시 게시물은 지원되는 에이전트를 시작하고 해당 모델을 즉시 가리키도록 하는 단축 명령을 설명합니다.
ollama launch claude --model nemotron-3.5-lightning해당 게시물은 이 위치에 claude, opencode, openclaw 및 hermes을 사용할 수 있다고 설명합니다. 이 하위 명령을 사용하려면 최신 버전의 Ollama가 필요하므로 먼저 ollama --version을 확인하십시오. 만약 명령이 없다면 직접 에이전트를 API에 연결해야 합니다. Ollama는 대부분의 에이전트 도구가 수용하는 OpenAI 호환 엔드포인트를 제공합니다.
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama는 API 키를 무시하지만, 대부분의 클라이언트는 키가 설정되지 않으면 시작을 거부합니다. 이와 관련된 에이전트 설정은 코딩 에이전트를 Ollama에 연결하기 및 나만의 OpenClaw 에이전트 빌드하기에서 다룹니다.
에이전트가 무인 상태로 실행될 때는 두 가지 서버 설정이 중요합니다. OLLAMA_KEEP_ALIVE은 마지막 요청 이후 모델이 메모리에 유지되는 시간을 제어합니다. 기본값은 5분 후에 모델을 언로드하므로, 다음 호출 시 전체 로드 시간을 다시 기다려야 합니다. GPU가 없는 환경에서 25 GB 크기의 파일을 로드할 때 이 지연 시간은 타임아웃을 유발할 만큼 깁니다. 모델을 메모리에 상주시키려면 OLLAMA_KEEP_ALIVE=-1를 설정하십시오. OLLAMA_HOST=0.0.0.0:11434은 다른 머신에서 API에 접근할 수 있게 합니다. 이 설정은 어떠한 인증도 수행하지 않으므로, 반드시 방화벽 규칙이나 사설 네트워크 내부에서만 개방하십시오.
실패 유형 및 표시되는 문자열
풀(pull) 작업이 즉시 실패합니다. Error: pull model manifest: file does not exist은 해당 태그가 존재하지 않음을 의미합니다. 태그 이름은 정확한 문자열이어야 하므로, 양자화 접미사를 추측하지 말고 라이브러리 페이지에서 복사하십시오.
모델이 로드되지 않습니다. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)는 설정된 플랜에 비해 태그가 너무 크다는 의미입니다. 더 작은 양자화 버전을 선택하거나 OLLAMA_CONTEXT_LENGTH을 낮추십시오. KV 캐시도 해당 요구 사항에 포함되기 때문입니다.
포트 11434에서 아무런 응답이 없습니다. curl: (7) Failed to connect to localhost port 11434는 서비스가 실행 중이지 않거나 예상한 위치에서 수신 대기 중이 아님을 의미합니다. systemctl status ollama와 journalctl -u ollama -n 50을 읽어보십시오. 만약 ollama serve을 수동으로 시작했다면, 두 번째 복사본은 Error: listen tcp 127.0.0.1:11434: bind: address already in use과 함께 종료됩니다.
응답은 하지만 매우 느립니다. 설정을 변경하기 전에 ollama ps를 확인하십시오. GPU 장비에서 PROCESSOR 열에 CPU 점유율이 나타난다면 모델의 일부가 VRAM 밖으로 밀려난 것이므로, 컨텍스트를 낮추거나 더 작은 양자화 버전을 사용하십시오. GPU가 없는 장비라면 느린 것은 정상이며 어떤 설정으로도 해결할 수 없습니다.
에이전트가 작업 도중 지시 사항을 잊어버립니다. 대화 내용이 컨텍스트 윈도우를 초과하여 가장 오래된 토큰이 자동으로 삭제된 것입니다. OLLAMA_CONTEXT_LENGTH을 높이고, ollama ps를 통해 모델이 여전히 수용 가능한지 확인하십시오. 만약 수용할 수 없다면, 윈도우를 줄이는 대신 더 큰 사양의 장비를 사용하는 것이 해결책입니다.
대안과 비교한 이 모델의 위치
30B MoE 모델은 소규모 작업에 호스팅하기에는 규모가 큽니다. 만약 8B dense 모델로도 충분히 작업을 처리할 수 있다면, 실행 비용이 훨씬 저렴하고 로딩도 수 초 내에 완료됩니다. VPS에서 Qwen 3 8B 및 27B 사용하기 문서는 이러한 결정을 내릴 때 직접적인 비교 기준이 됩니다. 특정 플랜에서 실제로 어떤 모델을 구동할 수 있는지 더 넓은 범위에서 확인하려면 직접 호스팅 가능한 AI 모델부터 살펴보십시오. 단일 에이전트가 아닌 여러 에이전트를 동시에 서비스할 계획이라면 먼저 Ollama와 vLLM 비교를 읽어보십시오. Ollama는 프로덕션 추론 서버처럼 동시 요청을 배치(batch) 처리하지 않으며, 바로 이 지점이 단일 사용자 설정의 확장성이 한계에 부딪히는 부분입니다.
FAQ
Linux VPS에서는 어떤 Nemotron 3.5 Lightning 태그를 가져와야 합니까?
nemotron-3.5-lightning:30b-a3b-q4_K_M을 사용하십시오. 이 태그는 25 GB이며, 최대 1M 컨텍스트를 모두 지원합니다. 또한 2026년 8월 기준으로 latest, 30b, 30b-a3b 태그가 가리키는 것과 동일한 다이제스트를 가집니다. latest을 가져오는 대신 명시적으로 이름을 지정하십시오. 그래야 나중에 해당 포인터가 다시 게시되더라도 사용자가 인지하지 못한 채 에이전트의 동작이 변경되는 일을 방지할 수 있습니다. mlx 태그는 Apple Silicon용 빌드이므로 Linux 환경에서는 사용할 수 없습니다.
Nemotron 3.5 Lightning을 실행하려면 RAM이 얼마나 필요합니까?
NVIDIA는 Ollama 빌드에 대한 최소 메모리 사양을 공개하지 않으므로, 추측하기보다 직접 측정해야 합니다. 태그를 가져와 모델을 한 번 실행한 뒤, 모델이 로드된 상태에서 ollama ps를 확인하십시오. 이 명령은 실제로 점유된 크기와 모델이 GPU에 로드되었는지 CPU에 로드되었는지를 출력합니다. 기본 태그의 다운로드 크기인 25 GB는 최소 기준일 뿐입니다. KV 캐시가 추가로 필요하며, 설정한 컨텍스트 윈도우 크기에 따라 메모리 사용량은 증가합니다. 플랜의 메모리가 너무 작으면 Ollama는 model requires more system memory 오류를 반환하며 두 수치를 모두 표시합니다.
GPU가 없는 VPS에서 Nemotron 3.5 Lightning을 실행할 수 있습니까?
네, 가중치를 담을 수 있는 충분한 RAM이 있다면 가능합니다. MoE 설계 덕분에 300억 개의 파라미터 중 토큰당 약 3개 정도만 계산되므로 유리합니다. 문제는 속도입니다. GPU가 없으면 모델은 메모리 대역폭의 제한을 받으므로, vCPU를 추가해도 성능 향상은 거의 없습니다. 고정된 프롬프트로 ollama run --verbose을 실행한 뒤 eval rate 라인을 읽고, 해당 수치가 에이전트의 응답 시간 요구사항을 충족하는지 판단하십시오. 밤새 수행하는 배치 작업에는 적합할 수 있으나, 사람이 직접 기다려야 하는 작업에는 보통 적합하지 않습니다.
왜 Ollama는 1M 컨텍스트 윈도우를 모두 제공하지 않습니까?
1M은 모델의 최대치일 뿐 Ollama의 기본값이 아닙니다. Ollama는 훨씬 작은 윈도우를 적용하며, 대화가 이를 초과하면 오류 메시지 없이 가장 오래된 토큰부터 삭제합니다. 이로 인해 에이전트가 자신의 지시사항을 잊어버리는 것처럼 보일 수 있습니다. systemd 서비스에 OLLAMA_CONTEXT_LENGTH을 설정하거나 요청 시마다 num_ctx를 전달하십시오. 윈도우 크기를 단계적으로 높이면서 매번 ollama ps를 확인하십시오. KV 캐시 메모리는 윈도우 크기에 비례하여 확장되므로, 이로 인해 모델 레이어가 GPU에서 밀려날 수 있습니다.
Nemotron 3.5 Lightning은 상업적으로 무료로 사용할 수 있습니까?
NVIDIA의 모델 카드에 따르면 이 모델은 OpenMDW-1.1 라이선스를 따르며 상업적 사용이 가능합니다. 이는 사용자가 직접 다운로드하여 실행하는 가중치에 적용됩니다. 하지만 스택 내의 다른 소프트웨어에 대해서는 보장하지 않으므로, 에이전트 하니스 및 연결된 도구의 라이선스를 별도로 확인하십시오. 계약과 관련된 용도로 사용하기 전에 최신 모델 카드를 반드시 읽어보시기 바랍니다.