SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-29

Cara Jalankan Nemotron 3.5 Lightning di VPS dengan Ollama

Ketahui cara menjalankan Nemotron 3.5 Lightning menggunakan Ollama pada pelayan anda. Kami sertakan tag pull yang tepat, keperluan RAM minimum, dan prestasi CPU sahaja.

Kegunaan Nemotron 3.5 Lightning

Nemotron 3.5 Lightning ialah model mixture-of-experts 30B terbuka daripada NVIDIA yang dikeluarkan pada Ogos 2026. Ia dibina untuk ejen yang berjalan selama berjam-jam, bukannya untuk satu tetingkap sembang sahaja. MoE (mixture of experts) bermaksud pemberat dibahagikan kepada banyak sub-rangkaian pakar, dan setiap token dihalakan melalui hanya beberapa daripadanya. Kad model NVIDIA menyatakan jumlah parameter sebanyak 30 bilion dengan 3 bilion aktif bagi setiap token. Anda membayar untuk jumlah yang besar dalam memori, namun mendapat kelajuan berdasarkan jumlah yang kecil.

Pertukaran ini adalah sebab untuk mempertimbangkan model ini bagi pelayan yang anda sewa. Ejen yang melakukan kerja sebenar menghantar beribu-ribu permintaan pendek sepanjang hari, jadi throughput bagi setiap dolar menentukan sama ada ia boleh dijalankan pada pelayan anda sendiri. Model yang mengambil masa 40 saat bagi setiap balasan adalah pembantu yang boleh digunakan tetapi ejen yang lemah, kerana satu tugasan memerlukan dua puluh panggilan dan anda perlu menunggu setiap satu daripadanya.

NVIDIA menyifatkan seni bina ini sebagai hibrid: lapisan Mamba-2 dan MoE yang diselang-seli dengan lapisan perhatian terpilih. Kad model menyatakan panjang konteks maksimum sehingga 1M token dan lesen OpenMDW-1.1, yang ditandakan sedia untuk kegunaan komersial. Bahasa utama ialah bahasa Inggeris dan kod, dengan bahasa Sepanyol, Perancis, Jerman, Itali dan Jepun turut disenaraikan.

Artificial Analysis menerbitkan ukuran pelancaran pada Ogos 2026 yang menunjukkan hampir 670 token output sesaat, pada endpoint DeepInfra pra-keluaran yang menggunakan pemberat NVFP4. Itu adalah endpoint GPU yang dihoskan. Anggap ia sebagai keupayaan seni bina tersebut, bukan sebagai prestasi yang akan dicapai oleh VPS anda.

Tag Ollama yang manakah sesuai untuk VPS anda

Pustaka Ollama menerbitkan beberapa binaan bagi pemberat (weights) yang sama. Perbezaannya terletak pada kuantisasi, iaitu bilangan bit yang digunakan untuk menyimpan setiap pemberat, dan ini mengubah saiz muat turun dengan ketara.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Tag yang dinamakan latest, 30b dan 30b-a3b semuanya merujuk kepada digest yang sama seperti 30b-a3b-q4_K_M, jadi muat turun lalai ialah binaan empat-bit 25 GB dengan konteks penuh 1M. Q8_0 ialah 35 GB dan bf16 ialah 66 GB, kedua-duanya juga pada 1M. Binaan MLX pada 23 GB adalah untuk Apple silicon dan dihadkan pada konteks 256K, jadi ia merupakan pilihan yang salah pada VPS Linux.

Itu adalah saiz muat turun, bukan keperluan memori. NVIDIA tidak menerbitkan angka VRAM (video RAM) minimum untuk binaan Ollama, jadi anggap saiz muat turun itu sebagai nilai lantai sahaja. Pemberat perlu berada di suatu tempat, sama ada dalam memori GPU jika kad tersebut mampu menampungnya, atau dalam RAM sistem jika tidak, dan KV cache (key/value cache, iaitu memori per-token model bagi perbualan) akan ditambah di atasnya. Angka sebenar untuk perkakasan anda diperoleh daripada arahan, bukan daripada pengiraan, dan ia dinyatakan di bawah. Jika anda belum menetapkan tahap kuantisasi, kos bagi setiap Q4, Q8 dan FP16 merangkumi perkara yang dikorbankan pada setiap peringkat.

Tarik tag yang tepat, jangan gunakan latest

latest ialah penunjuk yang berubah-ubah. Apabila pustaka menerbitkan semula tag tersebut, kelakuan ejen anda akan berubah pada tarikan seterusnya tanpa sebarang nota untuk menjelaskan puncanya. Namakan tag tersebut.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Skrip pemasangan menyediakan servis systemd yang berjalan sebagai pengguna ollama dan menyimpan model di bawah /usr/share/ollama/.ollama/models. Laluan tersebut berada pada sistem fail root bagi kebanyakan imej VPS, jadi semak ruang yang ada sebelum anda meminta 25 GB. Jika sistem fail tersebut hampir penuh, tempat Ollama menyimpan model dan cara untuk memindahkannya wajar dibaca sebelum proses penarikan dilakukan, bukannya selepas cakera penuh.

df -h /usr/share/ollama

Proses penarikan yang terhenti di tengah jalan dan melaporkan no space left on device bermaksud tepat seperti yang dinyatakan, dan blob separa akan kekal pada cakera sehingga anda memadamkannya. Kemudian, sahkan apa yang telah dimuat turun:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show mencetak seni bina, bilangan parameter, panjang konteks dan kuantisasi yang sebenarnya dibawa oleh fail tersebut. Jika mana-mana maklumat ini tidak sepadan dengan halaman pustaka, anda telah menarik tag yang salah daripada yang sepatutnya.

Hidangkan ia, dan semak di mana ia sebenarnya dijalankan

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Semasa model masih dimuatkan, dalam shell kedua:

ollama ps

Ini ialah arahan yang menjawab soalan memori untuk mesin anda. ollama ps mencetak model yang dimuatkan, saiz yang didudukinya dalam memori, dan lajur PROCESSOR. 100% GPU bermakna kesemuanya berada dalam VRAM. 100% CPU bermakna tiada bahagian daripadanya berada di sana, dan setiap token dikira oleh pemproses daripada RAM sistem. Pembahagian seperti 65%/35% CPU/GPU bermakna lapisan-lapisan tersebut tidak semuanya muat, dan bahagian CPU menentukan kelajuan anda. Jangan menganggarkan keperluan tersebut. Muatkan ia dan baca baris ini.

Jika ia tidak dapat dimuatkan langsung, Ollama akan menolak dengan bersih dan bukannya terhenti secara tiba-tiba:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Adakah VPS berasaskan CPU sahaja cukup pantas?

VPS kegunaan am tidak mempunyai GPU, jadi CPU melakukan semua kerja dan membaca setiap pemberat (weight) yang diperlukan daripada RAM sistem. MoE membantu dalam hal ini, kerana hanya kira-kira 3 bilion daripada 30 bilion parameter disentuh bagi setiap token, jadi pengiraan aritmetik bagi setiap token adalah jauh lebih kecil berbanding model 30B padat (dense). Memori tidak dibantu sama sekali. Kesemua 30 bilion parameter mesti kekal dalam memori, kerana penghala (router) boleh memilih mana-mana pakar untuk mana-mana token.

Oleh itu, inferens berasaskan CPU sahaja pada model ini dihadkan oleh lebar jalur memori (memory bandwidth) dan bukannya bilangan teras. Menambah vCPU pada pelan yang sudah mempunyai bilangan teras yang mencukupi tidak membawa banyak perubahan. Apa yang anda perlukan ialah RAM yang cukup untuk menampung pemberat serta KV cache anda, dan memori terpantas yang ditawarkan oleh pelan tersebut.

Ukur prestasinya sebelum anda menugaskan ejen kepadanya, menggunakan kaedah dalam mengukur token sesaat untuk LLM tempatan:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

Baris eval rate yang dicetak pada penghujung ialah kelajuan penjanaan anda dalam unit token sesaat. Nombor tunggal itu menentukan jawapannya, kerana masa jam dinding (wall-clock time) ejen didominasi olehnya. Darabkan nombor tersebut dengan panjang balasan yang anda jangkakan, dan jika jawapannya lebih lama daripada masa yang anda sanggup tunggu, mengehadkan output dengan num_predict ialah satu-satunya cara untuk mengehadkan panggilan tunggal tanpa menukar perkakasan.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Angka-angka tersebut adalah angka pihak ketiga yang diterbitkan, ditukar daripada minit bagi setiap tugasan yang dilaporkan oleh Artificial Analysis semasa pelancaran, dan ia diukur pada titik akhir GPU yang dihoskan dan bukannya pada VPS. Nemotron 3.5 Lightning mencatatkan purata kira-kira 30 saat bagi setiap tugasan, di mana gpt-oss-120b mengambil masa kira-kira 204 dan Qwen3.6 35B kira-kira 210. Gunakan angka ini untuk melihat jurang perbezaan, bukan sebagai janji tentang prestasi perkakasan anda.

Panduan jujurnya bergantung kepada siapa yang menunggu. Jika seseorang sedang menunggu ejen tersebut, atau ejen membuat rantaian panggilan yang panjang secara berturut-turut, sewa kapasiti GPU. Jika ia berjalan mengikut jadual pada waktu malam dan tiada siapa yang memerhatikannya, pelan CPU dengan RAM yang besar adalah pilihan yang munasabah. Walau apa pun, persediaannya adalah sama, dan menjalankan Ollama pada VPS merangkumi saiz pelan dan perbandingan antara instans GPU dengan membayar penyedia API bagi setiap token. Titik pulang modal adalah persoalan tentang penggunaan: instans GPU mengenakan bayaran setiap jam ia wujud, manakala token API hanya dikenakan bayaran apabila digunakan, jadi ejen yang sibuk sepanjang hari lebih menguntungkan jika menggunakan pelayan sendiri, manakala ejen yang hanya berjalan dua kali sejam biasanya tidak.

Tetingkap konteks 1M tidak percuma

1M token ialah maksimum model, dan Ollama tidak memberikannya kepada anda secara lalai. Ollama menyediakan tetingkap lalai yang jauh lebih kecil dan membuang token paling lama sebaik sahaja perbualan melebihi had tersebut. Tiada apa-apa yang direkodkan apabila perkara ini berlaku, jadi bagi ejen, ia kelihatan seperti model melupakan permulaan tugasnya sendiri.

Tetapkan tetingkap tersebut secara sengaja. Untuk keseluruhan pelayan, sunting servis tersebut:

sudo systemctl edit ollama

Tambahkan ini, kemudian jalankan sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Bagi setiap permintaan, hantar num_ctx dalam objek options sebaliknya:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Setiap peningkatan menggunakan memori, kerana KV cache berkembang mengikut bilangan token yang anda benarkan. Tingkatkan nilai tersebut, mulakan semula, kemudian jalankan ollama ps sekali lagi dan perhatikan saiz yang dilaporkan meningkat. Jika lajur PROCESSOR bertukar daripada 100% GPU kepada split selepas perubahan itu, KV cache telah menolak lapisan model keluar daripada VRAM dan kelajuan anda akan merosot dengan ketara. Memilih num_ctx dalam Ollama membincangkan pertukaran tersebut secara terperinci. Jangan tetapkan 1000000 hanya kerana kad model membenarkannya, kerana peruntukan berlaku di peringkat awal dan bebanan akan terus gagal.

Menyambungkannya ke ejen yang sentiasa aktif

Catatan pelancaran Ollama untuk model ini mendokumentasikan jalan pintas yang memulakan ejen disokong yang sudah dihalakan kepadanya:

ollama launch claude --model nemotron-3.5-lightning

Catatan tersebut mendokumentasikan claude, opencode, openclaw dan hermes pada kedudukan tersebut. Subperintah ini memerlukan Ollama versi terkini, jadi semak ollama --version dahulu, dan jika ia tiada, halakan ejen ke API tersebut sendiri. Ollama mendedahkan endpoint yang serasi dengan OpenAI, yang diterima oleh kebanyakan harness ejen:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama mengabaikan kunci tersebut, tetapi kebanyakan klien enggan bermula tanpa kunci yang ditetapkan. Bahagian harness bagi perkara ini diliputi dalam menghalakan ejen pengekodan ke Ollama dan dalam membina ejen OpenClaw anda sendiri.

Dua tetapan pelayan adalah penting sebaik sahaja ejen berjalan tanpa pengawasan. OLLAMA_KEEP_ALIVE mengawal berapa lama model kekal dalam memori selepas permintaan terakhir, dan tetapan lalai akan memunggahnya selepas lima minit, jadi panggilan seterusnya akan menanggung masa muat penuh sekali lagi. Pada fail 25 GB tanpa GPU, jeda tersebut cukup lama untuk menyebabkan tamat masa (timeout). Tetapkan OLLAMA_KEEP_ALIVE=-1 untuk memastikan ia kekal dalam memori. OLLAMA_HOST=0.0.0.0:11434 menjadikan API boleh dicapai dari mesin lain, dan ia tidak membawa sebarang bentuk pengesahan, jadi bukanya hanya di sebalik peraturan firewall atau rangkaian peribadi.

Mod kegagalan, berserta rentetan yang akan anda lihat

Proses pull gagal serta-merta. Error: pull model manifest: file does not exist bermaksud tag tersebut tidak wujud. Nama tag adalah rentetan yang tepat, jadi salin daripada halaman pustaka dan jangan meneka akhiran kuantisasi.

Model tidak mahu dimuatkan. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) bermaksud tag tersebut terlalu besar untuk pelan ini seperti yang dikonfigurasikan. Tukar kepada kuantisasi yang lebih kecil, atau rendahkan OLLAMA_CONTEXT_LENGTH, kerana cache KV dikira dalam keperluan tersebut.

Tiada respons pada port 11434. curl: (7) Failed to connect to localhost port 11434 bermaksud servis tidak berjalan, atau tidak mendengar pada tempat yang anda jangkakan. Baca systemctl status ollama dan journalctl -u ollama -n 50. Jika anda juga memulakan ollama serve secara manual, salinan kedua akan keluar dengan Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Ia memberi respons, tetapi sangat perlahan. Semak ollama ps sebelum mengubah apa-apa. Sebarang bahagian CPU dalam lajur PROCESSOR pada mesin GPU bermaksud sebahagian daripada model telah melimpah keluar daripada VRAM, jadi rendahkan konteks atau gunakan kuantisasi yang lebih kecil. Pada mesin tanpa GPU, perlahan adalah hasil yang dijangkakan dan tiada tetapan yang dapat membaikinya.

Ejen melupakan arahannya di pertengahan tugasan. Perbualan telah melepasi tetingkap konteks dan token yang paling lama telah dibuang secara senyap. Tingkatkan OLLAMA_CONTEXT_LENGTH, sahkan dengan ollama ps bahawa model masih muat, dan jika ia tidak lagi muat, penyelesaiannya ialah mesin yang lebih besar dan bukannya tetingkap yang lebih kecil.

Kedudukan model ini berbanding alternatif lain

Model MoE 30B adalah beban yang besar untuk dihoskan bagi tugasan kecil. Jika model dense 8B sudah mampu mengendalikan tugasan anda, kos untuk menjalankannya jauh lebih rendah dan ia dimuatkan dalam beberapa saat. Qwen 3 pada 8B dan 27B di VPS merupakan perbandingan terus untuk keputusan tersebut. Untuk tinjauan yang lebih luas tentang kapasiti pelan tertentu, mulakan daripada model AI yang boleh anda hoskan sendiri. Jika anda bercadang untuk menyediakan beberapa ejen serentak dan bukannya satu, baca Ollama berbanding vLLM terlebih dahulu. Ini kerana Ollama tidak melakukan batch pada permintaan serentak seperti pelayan inferens pengeluaran, dan di situlah had penskalaan bagi persediaan pengguna tunggal.

FAQ

Tag Nemotron 3.5 Lightning yang manakah perlu saya tarik pada VPS Linux?

Gunakan nemotron-3.5-lightning:30b-a3b-q4_K_M. Saiznya ialah 25 GB, ia membawa konteks maksimum 1M penuh, dan ia merupakan digest yang sama dengan yang ditunjuk oleh tag latest, 30b dan 30b-a3b setakat Ogos 2026. Namakannya secara eksplisit dan bukannya menarik latest, supaya penerbitan semula pointer tersebut pada masa hadapan tidak mengubah kelakuan ejen anda tanpa disedari. Tag mlx adalah binaan untuk Apple silicon dan tidak akan berfungsi pada Linux.

Berapakah RAM yang diperlukan oleh Nemotron 3.5 Lightning?

NVIDIA tidak menerbitkan angka memori minimum untuk binaan Ollama, jadi lakukan pengukuran dan bukannya anggaran. Tarik tag tersebut, jalankan model sekali, dan baca ollama ps semasa ia dimuatkan: ia mencetak saiz yang sebenarnya digunakan dan sama ada ia dimuatkan pada GPU atau CPU. Saiz muat turun, 25 GB untuk tag lalai, adalah nilai minimum, kerana cache KV ditambah di atasnya dan berkembang mengikut tetingkap konteks yang anda tetapkan. Jika pelan terlalu kecil, Ollama akan menolak dengan model requires more system memory dan menamakan kedua-dua angka tersebut.

Bolehkah saya menjalankan Nemotron 3.5 Lightning pada VPS tanpa GPU?

Boleh, jika pelan tersebut mempunyai RAM yang mencukupi untuk menampung pemberat (weights), dan reka bentuk MoE membantu kerana hanya kira-kira 3 daripada 30 bilion parameter dikira bagi setiap token. Kelajuan adalah kekurangannya. Tanpa GPU, model dihadkan oleh lebar jalur memori, jadi menambah vCPU hampir tidak mengubah hasil. Jalankan ollama run --verbose dengan prompt tetap, baca baris eval rate, dan nilaikan angka tersebut berbanding tempoh masa yang diperlukan oleh ejen anda. Untuk kerja kelompok (batch job) semalaman, ia biasanya memadai. Untuk sebarang perkara yang memerlukan respons segera daripada pengguna, ia biasanya tidak mencukupi.

Mengapakah Ollama tidak memberikan saya tetingkap konteks 1M penuh?

1M adalah maksimum model, bukan lalai Ollama. Ollama menggunakan tetingkap yang jauh lebih kecil dan membuang token paling lama sebaik sahaja perbualan melebihi had tersebut, tanpa ralat dicetak, yang menyebabkan ejen kelihatan seolah-olah melupakan arahannya sendiri. Tetapkan OLLAMA_CONTEXT_LENGTH pada servis systemd, atau hantar num_ctx bagi setiap permintaan. Tingkatkan nilainya secara berperingkat dan periksa semula ollama ps setiap kali, kerana memori cache KV berskala mengikut tetingkap dan boleh menyebabkan lapisan model ditolak keluar dari GPU.

Adakah Nemotron 3.5 Lightning percuma untuk kegunaan komersial?

Kad model NVIDIA meletakkan model ini di bawah lesen OpenMDW-1.1 dan menandakannya sedia untuk kegunaan komersial. Ini meliputi pemberat yang anda muat turun dan jalankan sendiri. Ia tidak menyatakan apa-apa tentang perisian lain dalam tindanan (stack) anda, jadi semak lesen ejen harness dan sebarang alatan yang anda sambungkan kepadanya secara berasingan, serta baca kad model semasa sebelum anda bergantung padanya untuk sebarang urusan kontrak.