SSD Nodes Learn Hosting plans →
指南 Matt Connor作者: Matt Connor · 已更新 2026-09-01

VPS 用 Ollama 執行 Nemotron 3.5 Lightning

了解在自己的 VPS 以 Ollama 執行 NVIDIA Nemotron 3.5 Lightning 的正確 tag、所需 RAM,以及僅用 CPU 是否足夠快,避免下載錯誤版本。

Nemotron 3.5 Lightning 的用途

Nemotron 3.5 Lightning 是 NVIDIA 開放的 30B 混合專家模型,於 August 2026 發布,主要用於執行數小時的代理程式,而不是只服務單一聊天視窗。MoE(mixture of experts)表示權重分割成許多專家子網路,每個 token 只會經過其中少數幾個子網路。NVIDIA 的模型卡列出 30 billion 個總參數,以及每個 token 會啟用 3 billion 個參數。記憶體需求取決於較大的總參數量,速度則受益於較小的啟用參數量。

這項取捨正是租用伺服器時值得考慮此模型的原因。執行實際工作的代理程式每天會傳送數千個簡短請求,因此每美元可取得的吞吐量,會決定它是否適合部署在自己的主機上。每次回覆需要 40 秒的模型可以作為實用的助理,卻不適合作為代理程式,因為單一工作可能需要 20 次呼叫,而每次都必須等待。

NVIDIA 將此架構描述為混合架構:交錯使用 Mamba-2 與 MoE 層,並搭配選定的 attention 層。模型卡列出的最大上下文長度最高可達 1M tokens,採用 OpenMDW-1.1 授權,並標示為可供商業使用。主要支援語言為 English 與 code,另外也列出 Spanish、French、German、Italian 和 Japanese。

Artificial Analysis 在 August 2026 發布的啟動測試顯示,每秒輸出接近 670 個 tokens。測試使用的是提供 NVFP4 權重的預發布 DeepInfra endpoint。這是代管的 GPU endpoint。應將此數據理解為架構所能達到的效能,而不是 VPS 實際會達到的效能。

哪個 Ollama tag 適合哪種 VPS

Ollama library 會針對相同的 weights 發布數個 build。各版本的差異在於 quantisation,也就是每個 weight 儲存時使用的 bit 數量,而這會大幅改變下載大小。

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

標示為 latest、30b 和 30b-a3b 的 tag 都會解析到與 30b-a3b-q4_K_M 相同的 digest,因此預設下載的是 25 GB、4-bit 的 build,並提供完整的 1M context。Q8_0 為 35 GB,bf16 為 66 GB,兩者也都支援 1M context。大小為 23 GB 的 MLX build 適用於 Apple silicon,context 上限為 256K,因此不適合 Linux VPS。

這些是下載大小,不是記憶體需求。NVIDIA 沒有針對 Ollama build 公布最低 VRAM(video RAM)數值,因此只能將下載大小視為下限,不能作為其他用途。Weights 必須常駐於某處;若顯示卡容量足夠,就會放在 GPU memory,否則會放在 system RAM。此外還要加上 KV cache(key/value cache,即模型針對對話內容以每個 token 儲存的記憶體)。硬體所需的實際數值必須透過指令取得,而不是自行計算,相關指令如下。如果你尚未決定 quantisation level,請參閱 Q4、Q8 和 FP16 各自需要付出哪些代價,了解每個階段會犧牲什麼。

拉取明確的 tag,切勿使用 latest

latest 是會變動的指標。程式庫重新發布該指標後,您的 agent 下一次拉取時,行為就會改變,而筆記中沒有任何資訊可說明原因。請指定 tag。

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

安裝指令碼會建立一個以 ollama 使用者身分執行的 systemd 服務,並將模型存放在 /usr/share/ollama/.ollama/models。在大多數 VPS 映像檔中,該路徑位於 root 檔案系統,因此在要求 25 GB 空間前,請先確認是否有足夠容量。如果該檔案系統空間不足,建議在拉取前先閱讀Ollama 儲存模型的位置及移動方式,不要等磁碟已被填滿後才處理。

df -h /usr/share/ollama

拉取作業中途停止並回報 no space left on device,表示的就是這個狀況;部分 blob 會留在磁碟上,直到您將其刪除。接著確認已下載的內容:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show 會列出架構、參數數量、內容長度,以及檔案實際採用的量化格式。如果其中任何一項與程式庫頁面不一致,表示您拉取的 tag 不是原本指定的 tag。

啟動服務,並確認實際執行位置

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

模型仍載入時,請在第二個 shell 中執行:

ollama ps

這個指令可回答該模型在您機器上的記憶體需求。ollama ps 會顯示已載入的模型、其占用的記憶體大小,以及 PROCESSOR 欄位。100% GPU 表示模型全部位於 VRAM。100% CPU 表示模型完全未使用 VRAM,所有 token 都由處理器使用系統 RAM 計算。像 65%/35% CPU/GPU 這樣的分配表示所有層無法全部容納,CPU 所占的比例會影響速度。不要估算需求。直接載入模型,讀取這一行。

如果模型完全無法載入,Ollama 會正常拒絕,而不是當機:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

CPU-only VPS 夠快嗎?

一般用途的 VPS 沒有 GPU,因此所有工作都由 CPU 執行,並從系統 RAM 讀取所需的每個權重。MoE 在這裡有所幫助,因為每個 token 只會處理約 30 billion 個參數中的 3 billion 個,所以每個 token 所需的運算量遠小於 dense 30B 模型。記憶體用量則完全不會減少。所有 30 billion 個參數都必須常駐記憶體,因為 router 可能為任何 token 選取任一個 expert。

因此,在這個模型上進行 CPU-only 推論時,限制因素是記憶體頻寬,而不是核心數量。對於 vCPU 數量已經合理的方案,繼續增加 vCPU 幾乎不會改善效能。你需要的是足以容納權重與 KV cache 的 RAM,以及方案所提供的最快記憶體。

在決定讓 agent 使用前,先按照 測量本機 LLM 的每秒 token 數 中的方法進行測量:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

最後列出的 eval rate 行,就是你的每秒 token 生成速度。這個數值足以決定答案,因為 agent 的實際耗時主要由它決定。將這個數值乘以預期的回覆長度;如果結果超過你願意等待的時間,使用 num_predict 限制輸出就是在不變更硬體的情況下,限制單次呼叫耗時的唯一調整方式。

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

這些是已發布的第三方數據,根據 Artificial Analysis 在發布時回報的每項工作所需分鐘數換算而來,測試環境是代管的 GPU endpoint,而不是 VPS。Nemotron 3.5 Lightning 平均每項工作約需 30 秒,其中 gpt-oss-120b 約需 204 秒,Qwen3.6 35B 約需 210 秒。請將這些數據用於了解差距的幅度,不要將其視為你的硬體效能保證。

實際建議取決於等待結果的人。如果有人正在等待 agent,或 agent 會連續執行很長的呼叫鏈,請租用 GPU capacity。如果 agent 按照排程在夜間執行,且沒有人等待結果,配備大量 RAM 的 CPU 方案是合理選擇。無論採用哪種方案,設定方式都相同;在 VPS 上執行 Ollama 會說明方案規模,以及 GPU instance 與按 token 支付 API provider 費用之間的比較。損益平衡取決於使用率:GPU instance 只要存在就會按小時計費,而 API token 只在使用時產生費用。因此,整天大多時間都在忙碌的 agent 適合使用自有伺服器;每小時只執行兩次的 agent 通常不適合。

1M context window is not free

1M tokens is the model's maximum, and Ollama does not hand it to you by default. Ollama 服務的預設視窗小得多;對話超過該大小後,會捨棄最舊的 tokens。發生這種情況時不會記錄任何日誌,因此對 agent 而言,看起來就像模型忘記了任務開頭的內容。

請明確設定 context window。若要套用到整台伺服器,請編輯服務:

sudo systemctl edit ollama

加入以下內容,然後執行 sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

若只套用到單一請求,請改在 options 物件中傳送 num_ctx:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

每次增加都會消耗更多記憶體,因為 KV cache 會隨允許的 tokens 數量增加。提高數值並重新啟動後,再次執行 ollama ps,監看回報的大小是否上升。若變更後 PROCESSOR 欄位從 100% GPU 變成 split,表示 KV cache 將模型層推出 VRAM,速度會大幅下降。選擇 Ollama 的 num_ctx 詳細說明了這項取捨。不要只因為 model card 允許 1000000 就設定該值,因為記憶體會在載入時一次配置,配置失敗就無法載入模型。

將模型接入常駐代理程式

Ollama 的模型發布文章說明了一個捷徑,可啟動已設定為使用該模型的支援代理程式:

ollama launch claude --model nemotron-3.5-lightning

文章在該位置說明了 claude、opencode、openclaw 和 hermes。此子命令需要最新版 Ollama,因此請先檢查 ollama --version。如果該項不存在,請自行將代理程式指向 API。Ollama 提供與 OpenAI 相容的端點,大多數代理程式框架都能接受:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama 會忽略該金鑰,但大多數用戶端若未設定金鑰就不會啟動。代理程式框架端的設定請參閱將程式代理程式指向 Ollama及建立自己的 OpenClaw 代理程式。

代理程式無人值守執行後,有兩項伺服器設定很重要。OLLAMA_KEEP_ALIVE 控制模型在最後一次請求後繼續留在記憶體中的時間;預設值會在五分鐘後卸載模型,因此下一次呼叫又必須等待完整的載入時間。對於 25 GB 的檔案,在沒有 GPU 的情況下,這段等待時間可能長到觸發逾時。設定 OLLAMA_KEEP_ALIVE=-1,讓模型持續保留在記憶體中。OLLAMA_HOST=0.0.0.0:11434 會讓其他機器也能連線至 API,而且完全沒有任何驗證機制,因此只能在防火牆規則或私有網路後方開放。

常見失敗模式與對應訊息

拉取映像檔立即失敗。 Error: pull model manifest: file does not exist 表示該標籤不存在。標籤名稱必須完全相符,因此請從 library 頁面複製標籤,不要自行猜測量化後綴。

模型無法載入。 Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) 表示目前設定下,該標籤超出此方案的容量。請改用較小的量化版本,或降低 OLLAMA_CONTEXT_LENGTH,因為 KV cache 也會計入這項需求。

11434 埠沒有回應。 curl: (7) Failed to connect to localhost port 11434 表示服務未執行,或未監聽預期的位置。請查看 systemctl status ollama 與 journalctl -u ollama -n 50。如果你也手動啟動了 ollama serve,第二個執行個體會以 Error: listen tcp 127.0.0.1:11434: bind: address already in use 結束。

服務有回應,但速度非常慢。 先檢查 ollama ps,再進行其他變更。在 GPU 機器上,只要 PROCESSOR 欄位出現任何 CPU 使用量,就表示部分模型已移出 VRAM。請降低 context,或改用較小的量化版本。在沒有 GPU 的機器上,速度慢是預期結果,無法透過設定修正。

代理程式執行任務到一半忘記指示。 對話已超過 context window,最舊的 tokens 會在無提示的情況下遭到捨棄。請提高 OLLAMA_CONTEXT_LENGTH,再以 ollama ps 確認模型仍可容納。如果已無法容納,應改用更大容量的機器,而不是縮小視窗。

這個模型與其他替代方案的比較

對小型工作而言,託管 30B MoE 是很大的負擔。如果密集型 8B 模型已能處理你的工作,執行成本會低得多,載入時間也只需幾秒;這項取捨可直接參考 在 VPS 上執行 8B 與 27B 的 Qwen 3。若要更廣泛了解特定方案實際能容納哪些模型,請先參閱 你可以自行託管哪些 AI 模型。如果你打算同時提供多個代理程式,而不是只服務一個代理程式,請先閱讀 Ollama 與 vLLM 的比較,因為 Ollama 不會像正式環境的推論伺服器那樣批次處理並行請求;這也是單一使用者設定開始無法擴展的地方。

FAQ

在 Linux VPS 上應該拉取哪個 Nemotron 3.5 Lightning 標籤?

請使用 nemotron-3.5-lightning:30b-a3b-q4_K_M。此標籤大小為 25 GB,包含完整的 1M 最大上下文,且截至 August 2026,與 latest、30b 和 30b-a3b 標籤指向相同的 digest。請明確指定此標籤,不要拉取 latest,以免該指標日後重新發布後,在未察覺的情況下改變 agent 的行為。mlx 標籤是 Apple silicon 建置版本,在 Linux 上無法派上用場。

Nemotron 3.5 Lightning 需要多少 RAM?

NVIDIA 未公布 Ollama 建置版本的最低記憶體需求,因此請實際測量,不要估算。拉取該標籤、執行模型一次,並在模型載入期間讀取 ollama ps:它會顯示實際佔用的大小,以及模型是在 GPU 或 CPU 上執行。預設標籤的下載大小為 25 GB,這只是下限,因為還會額外配置 KV cache,且其大小會隨設定的上下文視窗增加。如果方案過小,Ollama 會以 model requires more system memory 拒絕執行,並列出這兩個數值。

沒有 GPU 的 VPS 可以執行 Nemotron 3.5 Lightning 嗎?

可以,前提是方案具備足夠 RAM 來容納模型權重。MoE 架構也有幫助,因為每個 token 只會計算約 30 billion 個參數中的 3 個。限制在於速度。沒有 GPU 時,模型效能受記憶體頻寬限制,因此增加 vCPU 幾乎不會改善結果。使用固定提示執行 ollama run --verbose,讀取 eval rate 行,再根據 agent 的期限要求評估該數值。對於夜間執行的批次工作,通常可以接受。對於需要人員等待結果的工作,通常不適合。

Ollama 為什麼不提供完整的 1M 上下文視窗?

1M 是模型的最大值,不是 Ollama 的預設值。Ollama 使用小得多的視窗;對話超過此大小後,它會捨棄最早的 token,且不會輸出錯誤,因此看起來就像 agent 忘記了自己的指示。請在 systemd 服務上設定 OLLAMA_CONTEXT_LENGTH,或在每次請求中傳入 num_ctx。請分階段提高數值,並在每次調整後重新檢查 ollama ps,因為 KV cache 記憶體會隨視窗大小增加,可能使部分模型層移出 GPU。

Nemotron 3.5 Lightning 可以免費用於商業用途嗎?

NVIDIA 的 model card 將此模型置於 OpenMDW-1.1 授權條款下,並標示為可用於商業用途。這涵蓋您自行下載並執行的模型權重,但不涵蓋技術堆疊中的其他軟體。因此,請另外檢查 agent harness 及所連接工具的授權條款;若要將此模型用於任何具契約性質的用途,請先閱讀目前版本的 model card。