SSD Nodes Learn 🎉 VPS $5.50/월부터
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-08-13

VPS에서 Nemotron 3.5 Lightning 실행하기

Ollama를 사용하여 NVIDIA Nemotron 3.5 Lightning을 개인 서버에서 구동하는 방법을 안내합니다. 최적의 실행을 위한 필수 태그와 권장 RAM 용량, 그리고 CPU 전용 환경에서의 실제 성능 한계와 처리량 데이터를 상세히 정리했습니다.

Nemotron 3.5 Lightning의 용도

Nemotron 3.5 Lightning은 2026년 8월에 출시된 NVIDIA의 오픈 30B Mixture-of-Experts 모델로, 단일 채팅 창이 아닌 수 시간 동안 실행되는 에이전트를 위해 설계되었습니다. MoE(Mixture of Experts)는 가중치가 여러 전문가 서브 네트워크로 분할되어 각 토큰이 그중 일부를 통해서만 처리되는 방식을 의미합니다. NVIDIA의 모델 카드에 따르면 총 300억 개의 파라미터 중 토큰당 30억 개가 활성화됩니다. 메모리에는 큰 수치를 할당하지만, 속도는 작은 수치만큼의 성능을 얻을 수 있습니다.

이러한 트레이드오프가 바로 임대 서버에서 이 모델을 고려해야 하는 이유입니다. 실제 작업을 수행하는 에이전트는 하루 동안 수천 개의 짧은 요청을 보내므로, 달러당 처리량(throughput)이 해당 에이전트를 자체 서버에서 운영할 수 있을지를 결정합니다. 응답당 40초가 걸리는 모델은 유용한 어시스턴트가 될 수는 있어도 에이전트로는 부적합합니다. 하나의 작업이 20번의 호출을 발생시키고 매번 응답을 기다려야 하기 때문입니다.

NVIDIA는 이 아키텍처를 하이브리드 방식이라고 설명합니다. Mamba-2와 MoE 레이어를 교차 배치하고 일부 어텐션 레이어를 선택적으로 사용합니다. 모델 카드에 명시된 최대 컨텍스트 길이는 1M 토큰이며, 상업적 이용이 가능한 OpenMDW-1.1 라이선스가 적용되었습니다. 주요 언어는 영어와 프로그래밍 코드이며, 스페인어, 프랑스어, 독일어, 이탈리아어, 일본어도 지원 목록에 포함되어 있습니다.

Artificial Analysis가 2026년 8월에 발표한 출시 측정 결과에 따르면, NVFP4 가중치를 사용하는 사전 출시 DeepInfra 엔드포인트에서 초당 약 670개의 출력 토큰을 기록했습니다. 이는 호스팅된 GPU 엔드포인트에서의 결과입니다. 따라서 이 수치는 아키텍처가 허용하는 최대 성능으로 이해해야 하며, 사용자의 VPS에서 동일한 성능이 보장되는 것은 아닙니다.

어떤 Ollama 태그가 VPS에 적합한가

Ollama 라이브러리는 동일한 가중치에 대해 여러 빌드를 게시합니다. 이들 사이의 차이점은 양자화(quantisation)이며, 이는 각 가중치를 몇 비트로 저장하는지를 의미합니다. 이 설정에 따라 다운로드 크기가 크게 달라집니다.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

latest, 30b, 30b-a3b 태그는 모두 30b-a3b-q4_K_M와 동일한 다이제스트를 가리킵니다. 따라서 기본 다운로드는 1M 컨텍스트를 지원하는 25 GB 4비트 빌드입니다. Q8_0은 35 GB이며, bf16은 66 GB이고, 둘 다 1M 컨텍스트를 지원합니다. 23 GB인 MLX 빌드는 Apple 실리콘용이며 컨텍스트가 256K로 제한되므로, Linux VPS에는 적합하지 않습니다.

위 수치는 다운로드 크기일 뿐 메모리 요구 사항이 아닙니다. NVIDIA는 Ollama 빌드에 대한 최소 VRAM(비디오 RAM) 수치를 공식적으로 발표하지 않으므로, 다운로드 크기를 최소 하한선으로만 간주하십시오. 가중치는 GPU 메모리에 적재되거나, GPU 용량이 부족할 경우 시스템 RAM에 상주해야 합니다. 여기에 KV 캐시(key/value cache, 모델이 대화 중 토큰별로 사용하는 메모리)가 추가로 필요합니다. 하드웨어에 필요한 실제 메모리 수치는 산술 계산이 아닌 아래 명령어를 통해 확인해야 합니다. 아직 양자화 수준을 결정하지 못했다면, Q4, Q8, FP16의 비용 차이에서 각 단계별로 포기해야 하는 성능을 확인할 수 있습니다.

정확한 태그를 사용하십시오. latest는 절대 금지입니다.

latest은 계속 변하는 포인터입니다. 라이브러리에서 이를 다시 게시하면, 아무런 기록도 남지 않은 상태에서 다음 pull 시점에 에이전트의 동작이 바뀝니다. 반드시 태그 이름을 명시하십시오.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

설치 스크립트는 ollama 사용자로 실행되는 systemd 서비스를 설정하며, 모델을 /usr/share/ollama/.ollama/models 경로에 저장합니다. 대부분의 VPS 이미지에서 이 경로는 루트 파일시스템에 위치하므로, 25 GB를 요청하기 전에 디스크 여유 공간을 확인하십시오.

df -h /usr/share/ollama

pull 도중 중단되며 no space left on device 오류가 발생하는 것은 말 그대로의 의미입니다. 삭제하기 전까지는 부분적으로 다운로드된 blob이 디스크에 남아 있습니다. 삭제 후 다음 명령으로 실제 저장된 내용을 확인하십시오.

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show은 아키텍처, 파라미터 수, 컨텍스트 길이, 그리고 파일에 적용된 양자화 정보를 출력합니다. 이 중 하나라도 라이브러리 페이지의 정보와 일치하지 않는다면, 의도했던 것과 다른 태그를 pull한 것입니다.

서비스를 실행하고 실제 구동 위치 확인하기

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

모델이 로드된 상태에서 두 번째 셸을 엽니다:

ollama ps

이 명령은 해당 장비의 메모리 문제를 해결해 줍니다. ollama ps는 로드된 모델, 메모리 점유 크기, 그리고 PROCESSOR 열을 출력합니다. 100% GPU는 모델 전체가 VRAM에 있음을 의미합니다. 100% CPU는 VRAM에 로드된 부분이 없으며, 모든 토큰이 시스템 RAM을 사용하여 프로세서에서 계산됨을 의미합니다. 65%/35% CPU/GPU과 같이 분할된 경우 레이어 전체가 VRAM에 들어가지 않았으며, CPU 점유율이 속도를 결정한다는 뜻입니다. 요구 사항을 추측하지 마십시오. 직접 로드하여 이 줄을 확인하십시오.

모델을 전혀 로드할 수 없는 경우, Ollama는 충돌하는 대신 깔끔하게 거부 메시지를 출력합니다:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

CPU 전용 VPS로 충분히 빠른가?

범용 VPS에는 GPU가 없으므로 CPU가 모든 작업을 수행하며, 필요한 모든 가중치를 시스템 RAM에서 읽어옵니다. MoE(Mixture of Experts) 방식은 토큰당 약 300억 개의 파라미터 중 30억 개 정도만 사용하므로, 300억 개의 파라미터를 모두 사용하는 밀집(dense) 모델보다 토큰당 연산량이 훨씬 적어 이 상황에서 유리합니다. 하지만 메모리 문제는 해결되지 않습니다. 라우터가 어떤 토큰에 대해 어떤 전문가(expert)를 선택할지 알 수 없으므로 300억 개의 파라미터가 모두 메모리에 상주해야 합니다.

따라서 이 모델의 CPU 전용 추론 속도는 코어 수보다는 메모리 대역폭에 의해 제한됩니다. 이미 적절한 수의 vCPU를 갖춘 플랜에 vCPU를 추가해도 성능 변화는 거의 없습니다. 필요한 것은 가중치와 KV 캐시를 담을 충분한 RAM과 해당 플랜에서 제공하는 가장 빠른 메모리입니다.

에이전트를 배포하기 전에 로컬 LLM의 초당 토큰 수 측정에 설명된 방법을 사용하여 성능을 측정하십시오.

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

마지막에 출력되는 eval rate 줄이 초당 토큰 단위의 생성 속도입니다. 에이전트의 실제 작업 시간은 이 수치에 의해 결정되므로, 이 단일 지표가 판단의 기준이 됩니다.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

위 수치는 출시 당시 Artificial Analysis가 보고한 작업당 소요 시간을 변환한 타사 데이터이며, VPS가 아닌 호스팅된 GPU 엔드포인트에서 측정되었습니다. Nemotron 3.5 Lightning은 작업당 평균 30초가 소요되었으며, gpt-oss-120b은 약 204초, Qwen3.6 35B은 약 210초가 걸렸습니다. 이 수치는 하드웨어 성능을 보장하는 것이 아니라 성능 격차를 파악하는 용도로만 사용하십시오.

누가 기다리는지에 따라 권장 사항이 달라집니다. 사람이 에이전트를 기다리거나 에이전트가 긴 호출 체인을 연속으로 실행해야 한다면 GPU 인스턴스를 대여하십시오. 야간에 예약된 일정대로 실행되며 아무도 지켜보지 않는다면 RAM이 큰 CPU 플랜도 합리적인 선택입니다. 어떤 경우든 설정 방식은 동일하며, VPS에서 Ollama 실행하기에서 플랜 규모 산정 방법과 GPU 인스턴스와 API 제공업체 비용을 비교하는 방법을 다룹니다. 손익분기점은 활용도에 달려 있습니다. GPU 인스턴스는 존재하는 매 시간 비용이 청구되지만, API는 토큰을 사용할 때만 비용이 발생합니다. 따라서 하루 종일 바쁜 에이전트는 직접 서버를 운영하는 것이 유리하고, 한 시간에 두 번 정도 실행되는 에이전트는 API가 더 경제적입니다.

1M 컨텍스트 윈도우는 무료가 아닙니다

1M 토큰은 모델의 최대치이며, Ollama가 이를 기본값으로 제공하지는 않습니다. Ollama는 훨씬 작은 기본 윈도우를 사용하며 대화가 이 길이를 초과하면 가장 오래된 토큰부터 삭제합니다. 이 과정에서 로그가 남지 않으므로, 에이전트 입장에서는 모델이 자신의 작업 초기 내용을 잊어버린 것처럼 보입니다.

윈도우를 의도적으로 설정하십시오. 서버 전체에 적용하려면 서비스를 편집하십시오:

sudo systemctl edit ollama

다음 내용을 추가한 뒤 sudo systemctl restart ollama을 실행하십시오:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

요청별로 설정하려면 options 객체에 num_ctx를 대신 전달하십시오:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

허용하는 토큰 수에 따라 KV 캐시가 커지므로 값을 높일 때마다 메모리 사용량이 증가합니다. 값을 높이고 재시작한 뒤 ollama ps을 다시 실행하여 보고되는 크기가 증가하는지 확인하십시오. 변경 후 PROCESSOR 열이 100% GPU에서 분할(split) 상태로 바뀐다면, KV 캐시가 모델 레이어를 VRAM 밖으로 밀어낸 것이며 속도가 급격히 저하될 것입니다. Ollama에서 num_ctx 선택하기에서 이 절충안을 자세히 다룹니다. 모델 카드에서 허용한다고 해서 무작정 1000000으로 설정하지 마십시오. 할당이 즉시 이루어지므로 로드 자체가 실패할 수 있습니다.

상시 가동 에이전트에 연결하기

Ollama의 해당 모델 출시 게시물은 지원되는 에이전트를 시작할 때 모델을 바로 지정하는 단축 명령을 안내합니다.

ollama launch claude --model nemotron-3.5-lightning

해당 게시물은 해당 위치에 claude, opencode, openclawhermes을 사용할 수 있다고 명시합니다. 하위 명령을 사용하려면 최신 버전의 Ollama가 필요하므로 먼저 ollama --version을 확인하십시오. 만약 명령어가 없다면 에이전트가 API를 직접 가리키도록 설정해야 합니다. Ollama는 대부분의 에이전트 도구가 지원하는 OpenAI 호환 엔드포인트를 제공합니다.

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama는 API 키를 확인하지 않지만, 대부분의 클라이언트는 키가 설정되지 않으면 실행을 거부합니다. 에이전트 측 설정 방법은 코딩 에이전트를 Ollama에 연결하기나만의 OpenClaw 에이전트 빌드하기에서 다룹니다.

에이전트가 무인 상태로 실행될 때는 두 가지 서버 설정이 중요합니다. OLLAMA_KEEP_ALIVE은 마지막 요청 이후 모델이 메모리에 유지되는 시간을 제어합니다. 기본값은 5분 뒤 모델을 메모리에서 해제하므로, 다음 요청 시 전체 로드 시간을 다시 기다려야 합니다. GPU가 없는 환경에서 25 GB 크기의 파일을 로드할 때 발생하는 지연 시간은 타임아웃을 유발할 만큼 깁니다. 모델을 상주시키려면 OLLAMA_KEEP_ALIVE=-1를 설정하십시오. OLLAMA_HOST=0.0.0.0:11434은 다른 기기에서 API에 접근할 수 있게 합니다. 이 설정은 어떠한 인증도 거치지 않으므로, 반드시 방화벽 규칙이나 사설 네트워크 내부에서만 개방하십시오.

실패 유형 및 표시되는 문자열

풀(pull) 작업이 즉시 실패합니다. Error: pull model manifest: file does not exist은 해당 태그가 존재하지 않음을 의미합니다. 태그 이름은 정확한 문자열이어야 하므로, 양자화 접미사를 추측하지 말고 라이브러리 페이지에서 복사하십시오.

모델이 로드되지 않습니다. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)는 현재 구성된 플랜에 비해 태그가 너무 큼을 의미합니다. 더 작은 양자화 버전을 선택하거나 OLLAMA_CONTEXT_LENGTH을 낮추십시오. KV 캐시도 해당 요구 사항에 포함되기 때문입니다.

포트 11434에서 응답이 없습니다. curl: (7) Failed to connect to localhost port 11434는 서비스가 실행 중이지 않거나 예상한 위치에서 리스닝하고 있지 않음을 의미합니다. systemctl status ollamajournalctl -u ollama -n 50을 읽어보십시오. 만약 ollama serve을 수동으로 시작했다면, 두 번째 복사본은 Error: listen tcp 127.0.0.1:11434: bind: address already in use과 함께 종료됩니다.

응답이 매우 느립니다. 설정을 변경하기 전에 ollama ps를 확인하십시오. GPU 장비의 PROCESSOR 열에 CPU 점유율이 표시된다면 모델의 일부가 VRAM에서 넘쳐흐른 것이므로, 컨텍스트를 낮추거나 더 작은 양자화 버전을 사용하십시오. GPU가 없는 장비라면 느린 것은 정상적인 결과이며, 설정으로 해결할 수 없습니다.

에이전트가 작업 도중 지시 사항을 잊어버립니다. 대화가 컨텍스트 윈도우를 초과하여 가장 오래된 토큰이 자동으로 삭제된 것입니다. OLLAMA_CONTEXT_LENGTH을 높이고, ollama ps를 통해 모델이 여전히 수용 가능한지 확인하십시오. 만약 수용할 수 없다면, 윈도우 크기를 줄이는 대신 더 큰 사양의 장비를 사용하는 것이 해결책입니다.

대안과 비교한 이 모델의 위치

30B MoE 모델은 작은 작업에 사용하기에는 호스팅 비용이 큽니다. 8B dense 모델로도 충분히 작업을 처리할 수 있다면, 실행 비용이 훨씬 저렴하고 로딩도 수 초 내에 완료됩니다. 이 결정에 대한 직접적인 비교는 8B 및 27B 규모의 Qwen 3 VPS 운영을 참고하십시오. 특정 플랜에서 실제로 구동 가능한 모델에 대한 더 넓은 조사는 직접 호스팅 가능한 AI 모델에서 시작하십시오. 한 번에 하나의 에이전트가 아닌 여러 에이전트를 동시에 서비스할 계획이라면 Ollama와 vLLM 비교를 먼저 읽어보십시오. Ollama는 프로덕션 추론 서버처럼 동시 요청을 배치(batch) 처리하지 않으며, 바로 이 지점이 단일 사용자 설정의 확장성이 한계에 부딪히는 부분입니다.

FAQ

Linux VPS에서 어떤 Nemotron 3.5 Lightning 태그를 받아야 합니까?

nemotron-3.5-lightning:30b-a3b-q4_K_M을 사용하십시오. 이 태그는 25 GB이며, 최대 1M 컨텍스트를 모두 지원합니다. 또한 2026년 8월 기준으로 latest, 30b, 30b-a3b 태그가 가리키는 것과 동일한 다이제스트를 가집니다. latest을 받아오는 대신 명시적으로 이름을 지정하십시오. 그래야 나중에 해당 포인터가 다시 게시되더라도 사용자가 인지하지 못한 채 에이전트의 동작이 변경되는 일을 방지할 수 있습니다. mlx 태그는 Apple Silicon용 빌드이므로 Linux에서는 사용할 수 없습니다.

Nemotron 3.5 Lightning을 실행하려면 RAM이 얼마나 필요합니까?

NVIDIA는 Ollama 빌드에 대한 최소 메모리 수치를 공식적으로 발표하지 않았으므로, 추측하기보다 직접 측정해야 합니다. 태그를 받아 모델을 한 번 실행한 뒤, 모델이 로드된 상태에서 ollama ps를 확인하십시오. 이 명령은 실제로 점유된 크기와 모델이 GPU에 올라갔는지 CPU에 올라갔는지를 출력합니다. 기본 태그의 다운로드 크기인 25 GB는 최소 기준일 뿐입니다. 여기에 KV 캐시가 추가되며, 설정한 컨텍스트 윈도우 크기에 따라 메모리 사용량은 더 늘어납니다. 플랜의 메모리가 부족하면 Ollama는 model requires more system memory 오류를 반환하며 필요한 메모리 양과 현재 메모리 양을 모두 알려줍니다.

GPU가 없는 VPS에서 Nemotron 3.5 Lightning을 실행할 수 있습니까?

네, 플랜의 RAM이 모델 가중치를 담을 만큼 충분하다면 가능합니다. MoE 설계 덕분에 300억 개의 파라미터 중 토큰당 약 3개 정도만 계산되므로 유리합니다. 문제는 속도입니다. GPU가 없으면 모델은 메모리 대역폭의 제한을 받으므로, vCPU를 추가해도 성능 향상은 거의 없습니다. 고정된 프롬프트로 ollama run --verbose을 실행하고 eval rate 라인을 읽어 에이전트의 응답 시간 요구사항과 비교해 보십시오. 밤새 수행하는 배치 작업이라면 보통 괜찮지만, 사람이 기다려야 하는 작업이라면 대개 적합하지 않습니다.

왜 Ollama는 1M 컨텍스트 윈도우를 모두 제공하지 않습니까?

1M은 모델의 최대치일 뿐 Ollama의 기본값이 아닙니다. Ollama는 훨씬 작은 윈도우를 적용하며, 대화가 이를 초과하면 오류 메시지 없이 가장 오래된 토큰부터 삭제합니다. 이 때문에 에이전트가 자신의 지시사항을 잊어버리는 것처럼 보일 수 있습니다. systemd 서비스에 OLLAMA_CONTEXT_LENGTH을 설정하거나, 요청마다 num_ctx를 전달하십시오. 윈도우 크기를 단계적으로 높이면서 매번 ollama ps를 확인하십시오. KV 캐시 메모리는 윈도우 크기에 비례하여 증가하므로, 모델 레이어가 GPU에서 밀려날 수 있습니다.

Nemotron 3.5 Lightning은 상업적으로 무료로 사용할 수 있습니까?

NVIDIA의 모델 카드는 이 모델을 OpenMDW-1.1 라이선스로 분류하며 상업적 사용이 가능하다고 명시합니다. 이는 사용자가 직접 다운로드하여 실행하는 가중치에 적용됩니다. 스택 내의 다른 소프트웨어에 대해서는 언급하지 않으므로, 에이전트 하니스 및 연결된 도구의 라이선스를 별도로 확인하십시오. 계약과 관련된 용도로 사용하기 전에는 반드시 최신 모델 카드를 읽어보시기 바랍니다.