SSD Nodes Learn 🎉 VPS dari $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Cara Jalankan Nemotron 3.5 Lightning di VPS dengan Ollama

Ketahui cara memasang NVIDIA Nemotron 3.5 Lightning menggunakan Ollama. Dapatkan panduan tag model, keperluan RAM minimum, dan prestasi CPU berbanding GPU untuk pelayan anda.

Kegunaan Nemotron 3.5 Lightning

Nemotron 3.5 Lightning ialah model mixture-of-experts 30B terbuka daripada NVIDIA yang dikeluarkan pada Ogos 2026, dan ia dibina untuk ejen yang berjalan selama berjam-jam dan bukannya untuk satu tetingkap sembang. MoE (mixture of experts) bermaksud pemberat dipecahkan kepada banyak sub-rangkaian pakar, dan setiap token dihalakan melalui hanya beberapa daripadanya. Kad model NVIDIA memberikan jumlah 30 bilion parameter dengan 3 bilion aktif bagi setiap token. Anda membayar untuk jumlah yang besar dalam memori. Anda mendapat jumlah yang kecil sebagai kelajuan.

Pertukaran itu adalah sebab untuk melihat model ini bagi pelayan yang anda sewa. Ejen yang melakukan kerja sebenar menghantar beribu-ribu permintaan pendek sepanjang hari, jadi throughput bagi setiap dolar menentukan sama ada ia boleh hidup di dalam kotak anda sendiri. Model yang mengambil masa 40 saat bagi setiap balasan ialah pembantu yang boleh digunakan tetapi ejen yang lemah, kerana satu tugas membuat dua puluh panggilan dan anda menunggu setiap satu daripadanya.

NVIDIA menyifatkan seni bina ini sebagai hibrid: lapisan Mamba-2 dan MoE yang diselang-seli dengan lapisan perhatian terpilih. Kad model memberikan panjang konteks maksimum sehingga 1M token dan lesen OpenMDW-1.1, yang ditandakan sedia untuk kegunaan komersial. Bahasa utama ialah bahasa Inggeris dan kod, dengan bahasa Sepanyol, Perancis, Jerman, Itali dan Jepun turut disenaraikan.

Artificial Analysis menerbitkan ukuran pelancaran pada Ogos 2026 yang menunjukkan hampir 670 token output sesaat, pada endpoint DeepInfra pra-keluaran yang menyediakan pemberat NVFP4. Itu ialah endpoint GPU yang dihoskan. Baca ia sebagai apa yang dibenarkan oleh seni bina, bukan sebagai apa yang akan dilakukan oleh VPS anda.

Tag Ollama yang manakah sesuai untuk VPS anda

Pustaka Ollama menerbitkan beberapa binaan bagi pemberat (weights) yang sama. Perbezaan antara binaan tersebut ialah kuantisasi, iaitu bilangan bit yang digunakan untuk menyimpan setiap pemberat, dan ini mengubah saiz muat turun dengan ketara.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Tag yang dinamakan latest, 30b dan 30b-a3b semuanya merujuk kepada digest yang sama seperti 30b-a3b-q4_K_M, jadi muat turun lalai ialah binaan empat-bit 25 GB dengan konteks penuh 1M. Q8_0 ialah 35 GB dan bf16 ialah 66 GB, kedua-duanya juga pada 1M. Binaan MLX pada 23 GB adalah untuk cip Apple silicon dan dihadkan pada konteks 256K, jadi ia merupakan pilihan yang salah pada VPS Linux.

Itu adalah saiz muat turun, bukan keperluan memori. NVIDIA tidak menerbitkan angka VRAM (video RAM) minimum untuk binaan Ollama, jadi anggap saiz muat turun itu sebagai lantai minimum sahaja. Pemberat perlu berada di suatu tempat, sama ada dalam memori GPU jika kad tersebut mampu menampungnya, atau dalam RAM sistem jika tidak, dan KV cache (cache kunci/nilai, iaitu memori per-token model bagi perbualan) akan ditambah di atasnya. Angka sebenar untuk perkakasan anda diperoleh daripada arahan, bukan daripada pengiraan aritmetik, dan ia dinyatakan di bawah. Jika anda belum menetapkan tahap kuantisasi, kos bagi setiap Q4, Q8 dan FP16 merangkumi perkara yang dikorbankan pada setiap peringkat.

Tarik tag yang tepat, jangan gunakan latest

latest ialah penunjuk yang berubah-ubah. Apabila pustaka menerbitkan semula tag ini, kelakuan ejen anda akan berubah pada tarikan seterusnya tanpa sebarang nota untuk menjelaskan puncanya. Namakan tag tersebut.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Skrip pemasangan menyediakan servis systemd yang berjalan sebagai pengguna ollama dan menyimpan model di bawah /usr/share/ollama/.ollama/models. Laluan tersebut berada pada sistem fail root bagi kebanyakan imej VPS, jadi semak ruang storan sebelum anda meminta 25 GB.

df -h /usr/share/ollama

Proses tarik yang terhenti di tengah jalan dan melaporkan no space left on device bermaksud tepat seperti yang dinyatakan, dan blob separa akan kekal pada cakera sehingga anda memadamkannya. Kemudian, sahkan apa yang telah dimuat turun:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show mencetak seni bina, bilangan parameter, panjang konteks dan kuantisasi yang dibawa oleh fail tersebut. Jika mana-mana maklumat ini tidak sepadan dengan halaman pustaka, anda telah menarik tag yang salah daripada yang sepatutnya.

Hidangkan model tersebut, dan semak di mana ia sebenarnya dijalankan

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Semasa model masih dimuatkan, buka shell kedua:

ollama ps

Ini adalah perintah yang menjawab persoalan memori bagi mesin anda. ollama ps memaparkan model yang dimuatkan, saiz yang digunakan dalam memori, dan lajur PROCESSOR. 100% GPU bermaksud keseluruhan model berada dalam VRAM. 100% CPU bermaksud tiada bahagian model yang berada dalam VRAM, dan setiap token dikira oleh pemproses menggunakan RAM sistem. Pembahagian seperti 65%/35% CPU/GPU bermaksud tidak semua lapisan dimuatkan, dan bahagian CPU akan menentukan kelajuan anda. Jangan buat anggaran keperluan. Muatkan model tersebut dan baca baris ini.

Jika model tidak dapat dimuatkan sama sekali, Ollama akan menolak dengan cara yang kemas dan bukannya terhenti secara tiba-tiba:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Adakah VPS yang hanya menggunakan CPU cukup pantas?

VPS kegunaan am tidak mempunyai GPU, jadi CPU melakukan semua kerja dan membaca setiap pemberat (weight) yang diperlukan daripada RAM sistem. MoE membantu dalam hal ini, kerana hanya kira-kira 3 bilion daripada 30 bilion parameter disentuh bagi setiap token, jadi pengiraan aritmetik bagi setiap token adalah jauh lebih kecil berbanding model 30B padat (dense). Memori tidak dibantu sama sekali. Kesemua 30 bilion parameter mesti kekal dalam memori, kerana penghala (router) boleh memilih mana-mana pakar untuk mana-mana token.

Oleh itu, inferens berasaskan CPU sahaja pada model ini dihadkan oleh lebar jalur memori (memory bandwidth) dan bukannya oleh bilangan teras. Menambah vCPU pada pelan yang sudah mempunyai bilangan teras yang munasabah tidak membawa banyak perubahan. Apa yang anda perlukan ialah RAM yang mencukupi untuk menyimpan pemberat serta KV cache anda, dan memori terpantas yang ditawarkan oleh pelan tersebut.

Ukur kelajuannya sebelum anda menetapkan ejen kepadanya, menggunakan kaedah dalam mengukur token sesaat untuk LLM tempatan:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

Baris eval rate yang dicetak pada penghujung adalah kelajuan penjanaan anda dalam token sesaat. Nombor tunggal itu menentukan jawapannya, kerana masa jam dinding (wall-clock time) sesuatu ejen didominasi olehnya.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Itu adalah angka pihak ketiga yang diterbitkan, ditukar daripada minit bagi setiap tugasan yang dilaporkan oleh Artificial Analysis semasa pelancaran, dan ia diukur pada endpoint GPU yang dihoskan dan bukannya pada VPS. Nemotron 3.5 Lightning mencatatkan purata kira-kira 30 saat bagi setiap tugasan, di mana gpt-oss-120b mengambil masa kira-kira 204 dan Qwen3.6 35B kira-kira 210. Gunakan angka tersebut untuk melihat perbezaan jurang, bukan sebagai janji tentang perkakasan anda.

Panduan jujur terbahagi kepada siapa yang menunggu. Jika seseorang sedang menunggu ejen tersebut, atau ejen membuat rantaian panggilan yang panjang secara berturut-turut, sewa kapasiti GPU. Jika ia berjalan mengikut jadual pada waktu malam dan tiada siapa yang memerhati, pelan CPU dengan RAM yang besar adalah tempat yang munasabah. Walau apa pun, persediaannya adalah sama, dan menjalankan Ollama pada VPS merangkumi saiz pelan dan perbandingan antara instans GPU dengan pembayaran kepada penyedia API bagi setiap token. Titik pulang modal adalah persoalan tentang penggunaan: instans GPU mengenakan bayaran setiap jam ia wujud, manakala token API hanya dikenakan bayaran apabila digunakan, jadi ejen yang sibuk sepanjang hari lebih menguntungkan jika menggunakan pelayan sendiri, manakala ejen yang aktif dua kali sejam biasanya tidak.

Tetingkap konteks 1M tidak percuma

1M token ialah maksimum model, dan Ollama tidak memberikannya kepada anda secara lalai. Ollama menyediakan tetingkap lalai yang jauh lebih kecil dan membuang token paling lama sebaik sahaja perbualan melebihinya. Tiada apa-apa yang direkodkan apabila perkara itu berlaku, jadi bagi ejen, ia kelihatan seperti model melupakan permulaan tugasnya sendiri.

Tetapkan tetingkap tersebut secara sengaja. Untuk keseluruhan pelayan, sunting servis tersebut:

sudo systemctl edit ollama

Tambah baris ini, kemudian jalankan sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Bagi setiap permintaan, hantar num_ctx dalam objek options sebaliknya:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Setiap peningkatan memerlukan memori, kerana cache KV berkembang mengikut bilangan token yang anda benarkan. Tingkatkan nilai tersebut, mulakan semula, kemudian jalankan ollama ps sekali lagi dan perhatikan saiz yang dilaporkan meningkat. Jika lajur PROCESSOR bertukar daripada 100% GPU kepada split selepas perubahan itu, cache KV telah menolak lapisan model keluar daripada VRAM dan kelajuan anda akan jatuh dengan mendadak. Memilih num_ctx dalam Ollama membincangkan pertukaran tersebut secara terperinci. Jangan tetapkan 1000000 hanya kerana kad model membenarkannya, kerana peruntukan berlaku di peringkat awal dan bebanan akan terus gagal.

Menyambungkannya ke ejen yang sentiasa aktif

Catatan pelancaran Ollama untuk model ini mendokumentasikan jalan pintas yang memulakan ejen disokong yang sudah dihalakan kepadanya:

ollama launch claude --model nemotron-3.5-lightning

Catatan tersebut mendokumentasikan claude, opencode, openclaw dan hermes pada kedudukan tersebut. Subperintah ini memerlukan Ollama versi terkini, jadi semak ollama --version dahulu, dan jika ia tiada, halakan ejen tersebut ke API secara manual. Ollama mendedahkan endpoint yang serasi dengan OpenAI, yang diterima oleh kebanyakan harness ejen:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama mengabaikan kunci tersebut, tetapi kebanyakan klien enggan bermula tanpa kunci yang ditetapkan. Bahagian harness bagi perkara ini diliputi dalam menghalakan ejen pengekodan ke Ollama dan dalam membina ejen OpenClaw anda sendiri.

Dua tetapan pelayan adalah penting sebaik sahaja ejen berjalan tanpa pengawasan. OLLAMA_KEEP_ALIVE mengawal berapa lama model kekal dalam memori selepas permintaan terakhir, dan tetapan lalai akan memunggahnya selepas lima minit, jadi panggilan seterusnya akan menanggung masa pemuatan penuh sekali lagi. Pada fail 25 GB tanpa GPU, jeda tersebut cukup lama untuk menyebabkan tamat masa (timeout). Tetapkan OLLAMA_KEEP_ALIVE=-1 untuk mengekalkannya dalam memori (resident). OLLAMA_HOST=0.0.0.0:11434 menjadikan API boleh dicapai dari mesin lain, dan ia tidak membawa sebarang bentuk pengesahan, jadi bukanya hanya di sebalik peraturan firewall atau rangkaian peribadi.

Mod kegagalan, berserta rentetan yang akan anda lihat

Proses pull gagal serta-merta. Error: pull model manifest: file does not exist bermaksud tag tersebut tidak wujud. Nama tag adalah rentetan yang tepat, jadi salin daripada halaman pustaka dan jangan meneka akhiran kuantisasi.

Model tidak mahu dimuatkan. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) bermaksud tag tersebut terlalu besar untuk pelan ini mengikut konfigurasi semasa. Tukar kepada kuantisasi yang lebih kecil, atau rendahkan OLLAMA_CONTEXT_LENGTH, kerana KV cache dikira di dalam keperluan tersebut.

Tiada respons pada port 11434. curl: (7) Failed to connect to localhost port 11434 bermaksud servis tidak berjalan, atau tidak mendengar pada lokasi yang anda jangkakan. Baca systemctl status ollama dan journalctl -u ollama -n 50. Jika anda juga memulakan ollama serve secara manual, salinan kedua akan keluar dengan Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Ia memberi respons, tetapi sangat perlahan. Semak ollama ps sebelum mengubah apa-apa. Sebarang bahagian CPU dalam lajur PROCESSOR pada mesin GPU bermaksud sebahagian daripada model telah melimpah keluar dari VRAM, jadi rendahkan konteks atau gunakan kuantisasi yang lebih kecil. Pada mesin tanpa GPU, kelajuan perlahan adalah hasil yang dijangkakan dan tiada tetapan yang boleh membaikinya.

Ejen melupakan arahannya di pertengahan tugasan. Perbualan telah melepasi tetingkap konteks dan token paling lama telah dibuang secara senyap. Tingkatkan OLLAMA_CONTEXT_LENGTH, sahkan dengan ollama ps bahawa model masih muat, dan jika ia tidak lagi muat, penyelesaiannya adalah mesin yang lebih besar dan bukannya tetingkap yang lebih kecil.

Kedudukan model ini berbanding alternatif lain

Model 30B MoE adalah beban yang besar untuk dihoskan bagi tugasan kecil. Jika model 8B dense sudah mampu mengendalikan tugasan anda, kos untuk menjalankannya jauh lebih rendah dan ia dimuatkan dalam beberapa saat. Qwen 3 pada 8B dan 27B di VPS merupakan perbandingan terus untuk keputusan tersebut. Bagi tinjauan yang lebih luas tentang kapasiti pelan tertentu, mulakan daripada model AI yang boleh anda hoskan sendiri. Jika anda merancang untuk menyediakan beberapa ejen serentak dan bukannya satu, baca Ollama berbanding vLLM terlebih dahulu. Ini kerana Ollama tidak melakukan batch pada permintaan serentak seperti pelayan inferens pengeluaran, dan di situlah had penskalaan bagi persediaan pengguna tunggal.

FAQ

Tag Nemotron 3.5 Lightning yang manakah perlu saya tarik pada VPS Linux?

Gunakan nemotron-3.5-lightning:30b-a3b-q4_K_M. Saiznya ialah 25 GB, ia membawa kapasiti konteks maksimum 1M penuh, dan ia merupakan digest yang sama dengan yang ditunjuk oleh tag latest, 30b dan 30b-a3b setakat Ogos 2026. Namakannya secara eksplisit dan jangan tarik latest, supaya penerbitan semula penunjuk tersebut pada masa hadapan tidak mengubah kelakuan ejen anda tanpa disedari. Tag mlx adalah binaan untuk Apple silicon dan tidak akan berfungsi pada Linux.

Berapakah RAM yang diperlukan oleh Nemotron 3.5 Lightning?

NVIDIA tidak menerbitkan angka memori minimum untuk binaan Ollama, jadi lakukan pengukuran dan bukannya anggaran. Tarik tag tersebut, jalankan model sekali, dan baca ollama ps semasa ia dimuatkan: ia memaparkan saiz yang sebenarnya digunakan dan sama ada ia dimuatkan pada GPU atau CPU. Saiz muat turun, 25 GB untuk tag lalai, merupakan nilai lantai, kerana KV cache ditambah di atasnya dan berkembang mengikut tetingkap konteks yang anda tetapkan. Jika pelan terlalu kecil, Ollama akan menolak dengan model requires more system memory dan menamakan kedua-dua angka tersebut.

Bolehkah saya menjalankan Nemotron 3.5 Lightning pada VPS tanpa GPU?

Boleh, jika pelan tersebut mempunyai RAM yang mencukupi untuk menampung berat (weights) model, dan reka bentuk MoE membantu kerana hanya kira-kira 3 daripada 30 bilion parameter dikira bagi setiap token. Kelajuan adalah kekurangannya. Tanpa GPU, model dihadkan oleh lebar jalur memori, jadi menambah vCPU hampir tidak mengubah hasil. Jalankan ollama run --verbose dengan prompt tetap, baca baris eval rate, dan nilaikan angka tersebut berbanding tempoh masa yang diperlukan oleh ejen anda. Untuk kerja kelompok (batch job) semalaman, ia biasanya memadai. Untuk sebarang perkara yang memerlukan respons segera daripada pengguna, ia biasanya tidak mencukupi.

Mengapakah Ollama tidak memberikan saya tetingkap konteks 1M penuh?

1M adalah maksimum model, bukan lalai Ollama. Ollama menggunakan tetingkap yang jauh lebih kecil dan membuang token paling lama sebaik sahaja perbualan melebihi had tersebut, tanpa sebarang ralat dicetak, yang menyebabkan ejen kelihatan seolah-olah melupakan arahannya sendiri. Tetapkan OLLAMA_CONTEXT_LENGTH pada servis systemd, atau hantar num_ctx bagi setiap permintaan. Tingkatkan nilainya secara berperingkat dan semak semula ollama ps setiap kali, kerana memori KV cache berskala mengikut tetingkap tersebut dan boleh menyebabkan lapisan model ditolak keluar daripada GPU.

Adakah Nemotron 3.5 Lightning percuma untuk kegunaan komersial?

Kad model NVIDIA meletakkan model ini di bawah lesen OpenMDW-1.1 dan menandakannya sedia untuk kegunaan komersial. Ini meliputi berat model yang anda muat turun dan jalankan sendiri. Ia tidak menyatakan apa-apa mengenai perisian lain dalam tindanan (stack) anda, jadi semak lesen ejen harness dan sebarang alat yang anda sambungkan kepadanya secara berasingan, serta baca kad model semasa sebelum anda bergantung padanya untuk sebarang urusan kontrak.