VPS 用 Ollama 執行 Nemotron 3.5 Lightning
了解在自己的 VPS 以 Ollama 執行 NVIDIA Nemotron 3.5 Lightning 的正確 tag、所需 RAM,以及僅用 CPU 是否足夠快,避免下載錯誤版本。
Nemotron 3.5 Lightning 的用途
Nemotron 3.5 Lightning 是 NVIDIA 開放的 30B 混合專家模型,於 August 2026 發布,主要用於執行數小時的代理程式,而不是只服務單一聊天視窗。MoE(mixture of experts)表示權重分割成許多專家子網路,每個 token 只會經過其中少數幾個子網路。NVIDIA 的模型卡列出 30 billion 個總參數,以及每個 token 會啟用 3 billion 個參數。記憶體需求取決於較大的總參數量,速度則受益於較小的啟用參數量。
這項取捨正是租用伺服器時值得考慮此模型的原因。執行實際工作的代理程式每天會傳送數千個簡短請求,因此每美元可取得的吞吐量,會決定它是否適合部署在自己的主機上。每次回覆需要 40 秒的模型可以作為實用的助理,卻不適合作為代理程式,因為單一工作可能需要 20 次呼叫,而每次都必須等待。
NVIDIA 將此架構描述為混合架構:交錯使用 Mamba-2 與 MoE 層,並搭配選定的 attention 層。模型卡列出的最大上下文長度最高可達 1M tokens,採用 OpenMDW-1.1 授權,並標示為可供商業使用。主要支援語言為 English 與 code,另外也列出 Spanish、French、German、Italian 和 Japanese。
Artificial Analysis 在 August 2026 發布的啟動測試顯示,每秒輸出接近 670 個 tokens。測試使用的是提供 NVFP4 權重的預發布 DeepInfra endpoint。這是代管的 GPU endpoint。應將此數據理解為架構所能達到的效能,而不是 VPS 實際會達到的效能。
哪個 Ollama tag 適合哪種 VPS
Ollama library 會針對相同的 weights 發布數個 build。各版本的差異在於 quantisation,也就是每個 weight 儲存時使用的 bit 數量,而這會大幅改變下載大小。
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]標示為 latest、30b 和 30b-a3b 的 tag 都會解析到與 30b-a3b-q4_K_M 相同的 digest,因此預設下載的是 25 GB、4-bit 的 build,並提供完整的 1M context。Q8_0 為 35 GB,bf16 為 66 GB,兩者也都支援 1M context。大小為 23 GB 的 MLX build 適用於 Apple silicon,context 上限為 256K,因此不適合 Linux VPS。
這些是下載大小,不是記憶體需求。NVIDIA 沒有針對 Ollama build 公布最低 VRAM(video RAM)數值,因此只能將下載大小視為下限,不能作為其他用途。Weights 必須常駐於某處;若顯示卡容量足夠,就會放在 GPU memory,否則會放在 system RAM。此外還要加上 KV cache(key/value cache,即模型針對對話內容以每個 token 儲存的記憶體)。硬體所需的實際數值必須透過指令取得,而不是自行計算,相關指令如下。如果你尚未決定 quantisation level,請參閱 Q4、Q8 和 FP16 各自需要付出哪些代價,了解每個階段會犧牲什麼。
拉取明確的 tag,切勿使用 latest
latest 是會變動的指標。程式庫重新發布該指標後,您的 agent 下一次拉取時,行為就會改變,而筆記中沒有任何資訊可說明原因。請指定 tag。
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M安裝指令碼會建立一個以 ollama 使用者身分執行的 systemd 服務,並將模型存放在 /usr/share/ollama/.ollama/models。在大多數 VPS 映像檔中,該路徑位於 root 檔案系統,因此在要求 25 GB 空間前,請先確認是否有足夠容量。如果該檔案系統空間不足,建議在拉取前先閱讀Ollama 儲存模型的位置及移動方式,不要等磁碟已被填滿後才處理。
df -h /usr/share/ollama拉取作業中途停止並回報 no space left on device,表示的就是這個狀況;部分 blob 會留在磁碟上,直到您將其刪除。接著確認已下載的內容:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show 會列出架構、參數數量、內容長度,以及檔案實際採用的量化格式。如果其中任何一項與程式庫頁面不一致,表示您拉取的 tag 不是原本指定的 tag。
啟動服務,並確認實際執行位置
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"模型仍載入時,請在第二個 shell 中執行:
ollama ps這個指令可回答該模型在您機器上的記憶體需求。ollama ps 會顯示已載入的模型、其占用的記憶體大小,以及 PROCESSOR 欄位。100% GPU 表示模型全部位於 VRAM。100% CPU 表示模型完全未使用 VRAM,所有 token 都由處理器使用系統 RAM 計算。像 65%/35% CPU/GPU 這樣的分配表示所有層無法全部容納,CPU 所占的比例會影響速度。不要估算需求。直接載入模型,讀取這一行。
如果模型完全無法載入,Ollama 會正常拒絕,而不是當機:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)CPU-only VPS 夠快嗎?
一般用途的 VPS 沒有 GPU,因此所有工作都由 CPU 執行,並從系統 RAM 讀取所需的每個權重。MoE 在這裡有所幫助,因為每個 token 只會處理約 30 billion 個參數中的 3 billion 個,所以每個 token 所需的運算量遠小於 dense 30B 模型。記憶體用量則完全不會減少。所有 30 billion 個參數都必須常駐記憶體,因為 router 可能為任何 token 選取任一個 expert。
因此,在這個模型上進行 CPU-only 推論時,限制因素是記憶體頻寬,而不是核心數量。對於 vCPU 數量已經合理的方案,繼續增加 vCPU 幾乎不會改善效能。你需要的是足以容納權重與 KV cache 的 RAM,以及方案所提供的最快記憶體。
在決定讓 agent 使用前,先按照 測量本機 LLM 的每秒 token 數 中的方法進行測量:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."最後列出的 eval rate 行,就是你的每秒 token 生成速度。這個數值足以決定答案,因為 agent 的實際耗時主要由它決定。將這個數值乘以預期的回覆長度;如果結果超過你願意等待的時間,使用 num_predict 限制輸出就是在不變更硬體的情況下,限制單次呼叫耗時的唯一調整方式。
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]這些是已發布的第三方數據,根據 Artificial Analysis 在發布時回報的每項工作所需分鐘數換算而來,測試環境是代管的 GPU endpoint,而不是 VPS。Nemotron 3.5 Lightning 平均每項工作約需 30 秒,其中 gpt-oss-120b 約需 204 秒,Qwen3.6 35B 約需 210 秒。請將這些數據用於了解差距的幅度,不要將其視為你的硬體效能保證。
實際建議取決於等待結果的人。如果有人正在等待 agent,或 agent 會連續執行很長的呼叫鏈,請租用 GPU capacity。如果 agent 按照排程在夜間執行,且沒有人等待結果,配備大量 RAM 的 CPU 方案是合理選擇。無論採用哪種方案,設定方式都相同;在 VPS 上執行 Ollama 會說明方案規模,以及 GPU instance 與按 token 支付 API provider 費用之間的比較。損益平衡取決於使用率:GPU instance 只要存在就會按小時計費,而 API token 只在使用時產生費用。因此,整天大多時間都在忙碌的 agent 適合使用自有伺服器;每小時只執行兩次的 agent 通常不適合。
1M context window is not free
1M tokens is the model's maximum, and Ollama does not hand it to you by default. Ollama 服務的預設視窗小得多;對話超過該大小後,會捨棄最舊的 tokens。發生這種情況時不會記錄任何日誌,因此對 agent 而言,看起來就像模型忘記了任務開頭的內容。
請明確設定 context window。若要套用到整台伺服器,請編輯服務:
sudo systemctl edit ollama加入以下內容,然後執行 sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"若只套用到單一請求,請改在 options 物件中傳送 num_ctx:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'每次增加都會消耗更多記憶體,因為 KV cache 會隨允許的 tokens 數量增加。提高數值並重新啟動後,再次執行 ollama ps,監看回報的大小是否上升。若變更後 PROCESSOR 欄位從 100% GPU 變成 split,表示 KV cache 將模型層推出 VRAM,速度會大幅下降。選擇 Ollama 的 num_ctx 詳細說明了這項取捨。不要只因為 model card 允許 1000000 就設定該值,因為記憶體會在載入時一次配置,配置失敗就無法載入模型。
將模型接入常駐代理程式
Ollama 的模型發布文章說明了一個捷徑,可啟動已設定為使用該模型的支援代理程式:
ollama launch claude --model nemotron-3.5-lightning文章在該位置說明了 claude、opencode、openclaw 和 hermes。此子命令需要最新版 Ollama,因此請先檢查 ollama --version。如果該項不存在,請自行將代理程式指向 API。Ollama 提供與 OpenAI 相容的端點,大多數代理程式框架都能接受:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama 會忽略該金鑰,但大多數用戶端若未設定金鑰就不會啟動。代理程式框架端的設定請參閱將程式代理程式指向 Ollama及建立自己的 OpenClaw 代理程式。
代理程式無人值守執行後,有兩項伺服器設定很重要。OLLAMA_KEEP_ALIVE 控制模型在最後一次請求後繼續留在記憶體中的時間;預設值會在五分鐘後卸載模型,因此下一次呼叫又必須等待完整的載入時間。對於 25 GB 的檔案,在沒有 GPU 的情況下,這段等待時間可能長到觸發逾時。設定 OLLAMA_KEEP_ALIVE=-1,讓模型持續保留在記憶體中。OLLAMA_HOST=0.0.0.0:11434 會讓其他機器也能連線至 API,而且完全沒有任何驗證機制,因此只能在防火牆規則或私有網路後方開放。
常見失敗模式與對應訊息
拉取映像檔立即失敗。 Error: pull model manifest: file does not exist 表示該標籤不存在。標籤名稱必須完全相符,因此請從 library 頁面複製標籤,不要自行猜測量化後綴。
模型無法載入。 Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) 表示目前設定下,該標籤超出此方案的容量。請改用較小的量化版本,或降低 OLLAMA_CONTEXT_LENGTH,因為 KV cache 也會計入這項需求。
11434 埠沒有回應。 curl: (7) Failed to connect to localhost port 11434 表示服務未執行,或未監聽預期的位置。請查看 systemctl status ollama 與 journalctl -u ollama -n 50。如果你也手動啟動了 ollama serve,第二個執行個體會以 Error: listen tcp 127.0.0.1:11434: bind: address already in use 結束。
服務有回應,但速度非常慢。 先檢查 ollama ps,再進行其他變更。在 GPU 機器上,只要 PROCESSOR 欄位出現任何 CPU 使用量,就表示部分模型已移出 VRAM。請降低 context,或改用較小的量化版本。在沒有 GPU 的機器上,速度慢是預期結果,無法透過設定修正。
代理程式執行任務到一半忘記指示。 對話已超過 context window,最舊的 tokens 會在無提示的情況下遭到捨棄。請提高 OLLAMA_CONTEXT_LENGTH,再以 ollama ps 確認模型仍可容納。如果已無法容納,應改用更大容量的機器,而不是縮小視窗。
這個模型與其他替代方案的比較
對小型工作而言,託管 30B MoE 是很大的負擔。如果密集型 8B 模型已能處理你的工作,執行成本會低得多,載入時間也只需幾秒;這項取捨可直接參考 在 VPS 上執行 8B 與 27B 的 Qwen 3。若要更廣泛了解特定方案實際能容納哪些模型,請先參閱 你可以自行託管哪些 AI 模型。如果你打算同時提供多個代理程式,而不是只服務一個代理程式,請先閱讀 Ollama 與 vLLM 的比較,因為 Ollama 不會像正式環境的推論伺服器那樣批次處理並行請求;這也是單一使用者設定開始無法擴展的地方。
FAQ
在 Linux VPS 上應該拉取哪個 Nemotron 3.5 Lightning 標籤?
請使用 nemotron-3.5-lightning:30b-a3b-q4_K_M。此標籤大小為 25 GB,包含完整的 1M 最大上下文,且截至 August 2026,與 latest、30b 和 30b-a3b 標籤指向相同的 digest。請明確指定此標籤,不要拉取 latest,以免該指標日後重新發布後,在未察覺的情況下改變 agent 的行為。mlx 標籤是 Apple silicon 建置版本,在 Linux 上無法派上用場。
Nemotron 3.5 Lightning 需要多少 RAM?
NVIDIA 未公布 Ollama 建置版本的最低記憶體需求,因此請實際測量,不要估算。拉取該標籤、執行模型一次,並在模型載入期間讀取 ollama ps:它會顯示實際佔用的大小,以及模型是在 GPU 或 CPU 上執行。預設標籤的下載大小為 25 GB,這只是下限,因為還會額外配置 KV cache,且其大小會隨設定的上下文視窗增加。如果方案過小,Ollama 會以 model requires more system memory 拒絕執行,並列出這兩個數值。
沒有 GPU 的 VPS 可以執行 Nemotron 3.5 Lightning 嗎?
可以,前提是方案具備足夠 RAM 來容納模型權重。MoE 架構也有幫助,因為每個 token 只會計算約 30 billion 個參數中的 3 個。限制在於速度。沒有 GPU 時,模型效能受記憶體頻寬限制,因此增加 vCPU 幾乎不會改善結果。使用固定提示執行 ollama run --verbose,讀取 eval rate 行,再根據 agent 的期限要求評估該數值。對於夜間執行的批次工作,通常可以接受。對於需要人員等待結果的工作,通常不適合。
Ollama 為什麼不提供完整的 1M 上下文視窗?
1M 是模型的最大值,不是 Ollama 的預設值。Ollama 使用小得多的視窗;對話超過此大小後,它會捨棄最早的 token,且不會輸出錯誤,因此看起來就像 agent 忘記了自己的指示。請在 systemd 服務上設定 OLLAMA_CONTEXT_LENGTH,或在每次請求中傳入 num_ctx。請分階段提高數值,並在每次調整後重新檢查 ollama ps,因為 KV cache 記憶體會隨視窗大小增加,可能使部分模型層移出 GPU。
Nemotron 3.5 Lightning 可以免費用於商業用途嗎?
NVIDIA 的 model card 將此模型置於 OpenMDW-1.1 授權條款下,並標示為可用於商業用途。這涵蓋您自行下載並執行的模型權重,但不涵蓋技術堆疊中的其他軟體。因此,請另外檢查 agent harness 及所連接工具的授權條款;若要將此模型用於任何具契約性質的用途,請先閱讀目前版本的 model card。