Jalankan Nemotron 3.5 Lightning di VPS dengan Ollama
Pelajari tag Ollama yang tepat untuk Nemotron 3.5 Lightning, kebutuhan RAM server, serta apakah kinerja CPU-only cukup cepat untuk agent Anda.
Kegunaan Nemotron 3.5 Lightning
Nemotron 3.5 Lightning adalah model mixture-of-experts terbuka 30B dari NVIDIA yang dirilis pada Agustus 2026. Model ini dibuat untuk agent yang berjalan selama berjam-jam, bukan hanya untuk satu jendela chat. MoE (mixture of experts) berarti bobot model dibagi menjadi banyak subjaringan expert, lalu setiap token diarahkan hanya melalui beberapa subjaringan tersebut. Model card NVIDIA mencantumkan total 30 miliar parameter, dengan 3 miliar parameter aktif untuk setiap token. Anda membayar kebutuhan memori untuk jumlah parameter yang besar. Sebagai gantinya, Anda memperoleh kecepatan dari jumlah parameter aktif yang lebih kecil.
Pertukaran ini menjadi alasan untuk mempertimbangkan model ini pada server yang Anda sewa. Agent yang benar-benar menjalankan tugas mengirim ribuan permintaan singkat sepanjang hari. Karena itu, throughput per dolar menentukan apakah agent tersebut layak dijalankan pada server Anda sendiri. Model yang memerlukan 40 detik untuk setiap balasan masih dapat digunakan sebagai asisten, tetapi buruk untuk agent. Satu tugas dapat membuat dua puluh panggilan, dan Anda harus menunggu setiap panggilan tersebut.
NVIDIA menjelaskan arsitektur ini sebagai arsitektur hybrid: layer Mamba-2 dan MoE yang disusun berselang-seling, dengan beberapa layer attention. Model card mencantumkan panjang context maksimum hingga 1M token dan lisensi OpenMDW-1.1 yang ditandai siap untuk penggunaan komersial. Bahasa utama model ini adalah bahasa Inggris dan code. Bahasa Spanyol, Prancis, Jerman, Italia, dan Jepang juga tercantum.
Artificial Analysis menerbitkan hasil pengukuran saat peluncuran pada Agustus 2026, yang menunjukkan hampir 670 token output per detik pada endpoint DeepInfra pra-rilis yang melayani bobot NVFP4. Itu adalah endpoint GPU yang di-host. Gunakan angka tersebut sebagai gambaran kemampuan arsitektur, bukan sebagai hasil yang akan dicapai VPS Anda.
Tag Ollama yang sesuai untuk setiap VPS
Library Ollama menyediakan beberapa build dari weights yang sama. Perbedaannya terletak pada quantisation, yaitu jumlah bit yang digunakan untuk menyimpan setiap weight. Hal ini sangat memengaruhi ukuran download.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Tag bernama latest, 30b, dan 30b-a3b semuanya mengarah ke digest yang sama dengan 30b-a3b-q4_K_M. Dengan demikian, download default adalah build empat-bit berukuran 25 GB dengan context penuh 1M. Q8_0 berukuran 35 GB, sedangkan bf16 berukuran 66 GB. Keduanya juga menggunakan context 1M. Build MLX berukuran 23 GB ditujukan untuk Apple silicon dan dibatasi hingga context 256K, sehingga bukan pilihan yang tepat pada VPS Linux.
Ukuran tersebut adalah ukuran download, bukan kebutuhan memory. NVIDIA tidak menerbitkan angka minimum VRAM (video RAM) untuk build Ollama. Karena itu, anggap ukuran download sebagai batas bawah saja. Weights harus berada di suatu tempat: di memory GPU jika kapasitas kartu mencukup, atau di system RAM jika tidak. KV cache (key/value cache, yaitu memory model per token untuk menyimpan percakapan) juga ditambahkan di atasnya. Angka sebenarnya untuk hardware Anda diperoleh dari sebuah command, bukan dari perhitungan, dan command tersebut tersedia di bawah. Jika Anda belum menentukan tingkat quantisation, biaya Q4, Q8, dan FP16 menjelaskan hal yang dikorbankan pada setiap tingkat.
Tarik tag yang tepat, jangan pernah menggunakan latest
latest adalah penunjuk yang dapat berubah. Saat library menerbitkan ulang tag tersebut, perilaku agent Anda berubah pada pull berikutnya tanpa ada catatan yang menjelaskan alasannya. Tentukan tag secara eksplisit.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MSkrip instalasi menyiapkan service systemd yang berjalan sebagai pengguna ollama dan menyimpan model di /usr/share/ollama/.ollama/models. Pada sebagian besar image VPS, path tersebut berada di root filesystem. Karena itu, periksa ruang yang tersedia sebelum meminta 25 GB. Jika filesystem tersebut hampir penuh, baca lokasi penyimpanan model Ollama dan cara memindahkannya sebelum melakukan pull, bukan setelah pull memenuhi disk.
df -h /usr/share/ollamaPull yang berhenti di tengah proses dan melaporkan no space left on device memang menunjukkan kondisi tersebut. Blob parsial tetap tersimpan di disk sampai Anda menghapusnya. Kemudian, pastikan hasil pull:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show menampilkan arsitektur, jumlah parameter, panjang context, dan quantisation yang benar-benar dibawa file tersebut. Jika salah satunya berbeda dari halaman library, berarti Anda melakukan pull terhadap tag yang berbeda dari yang dimaksud.
Jalankan, lalu periksa lokasi eksekusinya
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Saat model masih dimuat, buka shell kedua:
ollama psPerintah ini menjawab pertanyaan tentang penggunaan memori pada mesin Anda. ollama ps menampilkan model yang dimuat, ukuran model dalam memori, dan kolom PROCESSOR. 100% GPU berarti seluruh model berada di VRAM. 100% CPU berarti tidak ada bagian model yang berada di VRAM, dan setiap token dihitung oleh prosesor menggunakan RAM sistem. Pembagian seperti 65%/35% CPU/GPU berarti semua layer tidak muat, sehingga porsi pemrosesan oleh CPU menentukan kecepatan. Jangan memperkirakan kebutuhan memori. Muat model, lalu baca baris ini.
Jika model sama sekali tidak dapat dimuat, Ollama menolak permintaan dengan baik dan tidak mengalami crash:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Apakah VPS yang hanya menggunakan CPU cukup cepat?
VPS tujuan umum tidak memiliki GPU, sehingga CPU mengerjakan seluruh proses dan membaca setiap weight yang diperlukan dari RAM sistem. MoE membantu dalam hal ini karena hanya sekitar 3 miliar dari 30 miliar parameter yang diproses untuk setiap token. Dengan demikian, perhitungan per token jauh lebih sedikit dibandingkan model dense 30B. Namun, kebutuhan memori tidak berkurang sama sekali. Seluruh 30 miliar parameter harus tetap berada di memori karena router dapat memilih expert mana pun untuk setiap token.
Dengan demikian, inferensi model ini yang hanya menggunakan CPU lebih dibatasi oleh bandwidth memori daripada jumlah core. Menambahkan vCPU ke paket yang sudah memiliki jumlah vCPU yang memadai hanya sedikit mengubah kinerja. Anda memerlukan RAM yang cukup untuk menampung weight dan KV cache, serta memori tercepat yang disediakan oleh paket tersebut.
Ukur kinerjanya sebelum menggunakannya untuk agent, dengan metode pada mengukur token per detik untuk LLM lokal:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Baris eval rate yang tercetak di bagian akhir menunjukkan kecepatan generasi dalam token per detik. Angka ini menentukan jawabannya karena waktu wall-clock agent terutama ditentukan oleh angka tersebut. Kalikan angka itu dengan panjang respons yang Anda perkirakan. Jika hasilnya lebih lama daripada waktu tunggu yang dapat Anda terima, membatasi output dengan num_predict adalah cara untuk membatasi durasi satu pemanggilan tanpa mengubah hardware.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Itu adalah angka pihak ketiga yang dipublikasikan dan dikonversi dari durasi per tugas dalam menit yang dilaporkan Artificial Analysis saat peluncuran. Pengukuran dilakukan pada endpoint GPU ter-hosting, bukan pada VPS. Rata-rata Nemotron 3.5 Lightning adalah sekitar 30 detik per tugas. Tugas gpt-oss-120b memerlukan sekitar 204, sedangkan Qwen3.6 35B memerlukan sekitar 210. Gunakan angka tersebut untuk melihat perbedaan kinerjanya, bukan sebagai jaminan untuk hardware Anda.
Panduan yang tepat bergantung pada siapa yang menunggu. Jika seseorang menunggu respons agent, atau agent menjalankan rangkaian pemanggilan panjang secara berurutan, sewa kapasitas GPU. Jika agent berjalan terjadwal pada malam hari dan tidak ada orang yang menunggu, paket CPU dengan RAM besar merupakan pilihan yang wajar. Bagaimanapun, konfigurasinya sama, dan menjalankan Ollama pada VPS menjelaskan pemilihan ukuran paket serta perbandingan instance GPU dengan biaya API provider per token. Titik impas bergantung pada utilisasi. Instance GPU ditagihkan untuk setiap jam saat instance tersedia, sedangkan token API hanya ditagihkan saat digunakan. Karena itu, agent yang aktif hampir sepanjang hari lebih sesuai dijalankan pada server yang Anda miliki, sedangkan agent yang berjalan dua kali per jam biasanya tidak.
Jendela konteks 1M tidak tersedia secara otomatis
1M token adalah maksimum model, dan Ollama tidak memberikannya secara default. Ollama menggunakan jendela default yang jauh lebih kecil dan membuang token paling lama setelah percakapan melewati batas tersebut. Tidak ada log yang dibuat saat hal itu terjadi. Akibatnya, bagi agent, model terlihat melupakan awal tugasnya sendiri.
Tetapkan ukuran jendela secara sengaja. Untuk seluruh server, edit service:
sudo systemctl edit ollamaTambahkan konfigurasi ini, lalu jalankan sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Untuk setiap request, kirim num_ctx di dalam object options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Setiap peningkatan membutuhkan lebih banyak memori karena KV cache bertambah sesuai jumlah token yang diizinkan. Naikkan nilainya, restart service, lalu jalankan kembali ollama ps dan pantau ukuran yang dilaporkan. Jika kolom PROCESSOR berubah dari 100% GPU menjadi split setelah perubahan tersebut, KV cache telah mendorong layer model keluar dari VRAM sehingga kecepatan akan turun drastis. Memilih num_ctx di Ollama menjelaskan trade-off tersebut secara terperinci. Jangan menetapkan 1000000 hanya karena model card mengizinkannya. Alokasi dilakukan sejak awal, sehingga proses pemuatan akan langsung gagal.
Menghubungkannya ke agent yang selalu aktif
Posting peluncuran model dari Ollama mendokumentasikan pintasan untuk menjalankan agent yang didukung dan langsung mengarahkannya ke model tersebut:
ollama launch claude --model nemotron-3.5-lightningPosting tersebut mendokumentasikan claude, opencode, openclaw, dan hermes pada posisi itu. Subcommand tersebut memerlukan Ollama versi terbaru, jadi periksa ollama --version terlebih dahulu. Jika tidak tersedia, arahkan agent ke API secara manual. Ollama menyediakan endpoint yang kompatibel dengan OpenAI dan dapat diterima oleh sebagian besar harness agent:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama mengabaikan key tersebut, tetapi sebagian besar client menolak untuk berjalan jika belum ada key. Konfigurasi pada sisi harness dibahas dalam mengarahkan coding agent ke Ollama dan membangun agent OpenClaw sendiri.
Dua pengaturan server penting setelah agent berjalan tanpa pengawasan. OLLAMA_KEEP_ALIVE mengatur berapa lama model tetap berada di memori setelah permintaan terakhir. Nilai default mengeluarkan model dari memori setelah lima menit, sehingga pemanggilan berikutnya kembali memerlukan waktu pemuatan penuh. Pada file berukuran 25 GB tanpa GPU, jeda tersebut cukup lama untuk menyebabkan timeout. Atur OLLAMA_KEEP_ALIVE=-1 agar model tetap berada di memori. OLLAMA_HOST=0.0.0.0:11434 membuat API dapat diakses dari mesin lain dan tidak memiliki autentikasi sama sekali, jadi buka akses tersebut hanya di balik aturan firewall atau jaringan privat.
Mode kegagalan dan string yang akan Anda lihat
Pull langsung gagal. Error: pull model manifest: file does not exist berarti tag tersebut tidak ada. Nama tag merupakan string yang harus sama persis. Salin salah satunya dari halaman library, jangan menebak-nebak sufiks quantisation.
Model tidak dapat dimuat. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) berarti tag tersebut terlalu besar untuk plan yang dikonfigurasi. Gunakan quantisation yang lebih kecil, atau turunkan OLLAMA_CONTEXT_LENGTH, karena KV cache ikut diperhitungkan dalam kebutuhan tersebut.
Tidak ada respons pada port 11434. curl: (7) Failed to connect to localhost port 11434 berarti service tidak berjalan atau tidak listening pada alamat yang diharapkan. Baca systemctl status ollama dan journalctl -u ollama -n 50. Jika Anda juga menjalankan ollama serve secara manual, salinan kedua akan keluar dengan Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Service merespons, tetapi sangat lambat. Periksa ollama ps sebelum mengubah apa pun. Setiap penggunaan CPU pada kolom PROCESSOR di mesin dengan GPU berarti sebagian model tidak lagi berada di VRAM. Turunkan context atau gunakan quantisation yang lebih kecil. Pada mesin tanpa GPU, kinerja lambat merupakan hasil yang diharapkan dan tidak ada pengaturan yang dapat memperbaikinya.
Agent melupakan instruksinya di tengah tugas. Percakapan telah melewati context window, sehingga token paling lama dibuang secara diam-diam. Naikkan OLLAMA_CONTEXT_LENGTH, lalu pastikan dengan ollama ps bahwa model masih dapat dimuat. Jika tidak, solusinya adalah menggunakan mesin yang lebih besar, bukan memperkecil window.
Posisi model ini dibandingkan dengan alternatif
MoE 30B membutuhkan sumber daya besar untuk di-host meskipun hanya digunakan untuk tugas sederhana. Jika model dense 8B sudah dapat menangani tugas Anda, biaya menjalankan dan memuatnya akan jauh lebih rendah, dan Qwen 3 pada 8B dan 27B di VPS merupakan perbandingan langsung untuk keputusan tersebut. Untuk survei yang lebih luas mengenai model yang benar-benar dapat ditampung oleh suatu paket, mulai dari model AI yang dapat Anda self-host. Jika Anda berencana melayani beberapa agen secara bersamaan, bukan hanya satu agen, baca Ollama dibandingkan dengan vLLM terlebih dahulu. Ollama tidak melakukan batching pada permintaan konkuren seperti server inferensi produksi, dan pada titik inilah setup pengguna tunggal berhenti dapat diskalakan.
FAQ
Tag Nemotron 3.5 Lightning mana yang harus saya pull pada VPS Linux?
Gunakan nemotron-3.5-lightning:30b-a3b-q4_K_M. Ukurannya 25 GB, mencakup konteks maksimum penuh sebesar 1M, dan menggunakan digest yang sama dengan tag latest, 30b, dan 30b-a3b per Agustus 2026. Gunakan nama ini secara eksplisit, bukan melakukan pull terhadap latest, agar penerbitan ulang pointer tersebut pada masa mendatang tidak mengubah perilaku agent Anda tanpa sepengetahuan Anda. Tag mlx adalah build untuk Apple silicon dan tidak membantu pada Linux.
Berapa RAM yang diperlukan Nemotron 3.5 Lightning?
NVIDIA tidak menerbitkan angka minimum memori untuk build Ollama, jadi lakukan pengukuran, bukan perkiraan. Pull tag tersebut, jalankan model satu kali, lalu baca ollama ps saat model masih dimuat. Perintah itu menampilkan ukuran yang benar-benar digunakan serta menunjukkan apakah model dijalankan pada GPU atau CPU. Ukuran download, yaitu 25 GB untuk tag default, adalah batas minimum karena KV cache ditambahkan di atasnya dan bertambah sesuai ukuran context window yang Anda tetapkan. Jika plan terlalu kecil, Ollama menolak dengan model requires more system memory dan menampilkan kedua angka tersebut.
Apakah Nemotron 3.5 Lightning dapat dijalankan pada VPS tanpa GPU?
Ya, jika plan memiliki RAM yang cukup untuk memuat weights. Desain MoE juga membantu karena hanya sekitar 3 dari 30 miliar parameter yang dihitung untuk setiap token. Kendalanya adalah kecepatan. Tanpa GPU, model dibatasi oleh bandwidth memori, sehingga penambahan vCPU hampir tidak meningkatkan hasil. Jalankan ollama run --verbose dengan prompt tetap, baca baris eval rate, lalu bandingkan angka tersebut dengan batas waktu agent Anda. Untuk batch job yang berjalan semalaman, konfigurasi ini sering kali memadai. Untuk proses yang harus ditunggu langsung oleh pengguna, biasanya tidak memadai.
Mengapa Ollama tidak memberikan context window penuh sebesar 1M?
1M adalah batas maksimum model, bukan default Ollama. Ollama menerapkan window yang jauh lebih kecil dan membuang token paling lama setelah percakapan melampaui batas tersebut, tanpa menampilkan error. Akibatnya, agent terlihat seperti melupakan instruksinya sendiri. Tetapkan OLLAMA_CONTEXT_LENGTH pada service systemd, atau teruskan num_ctx untuk setiap request. Tingkatkan nilainya secara bertahap dan periksa kembali ollama ps setiap kali, karena penggunaan memori KV cache meningkat seiring ukuran window dan dapat memindahkan layer model keluar dari GPU.
Apakah Nemotron 3.5 Lightning gratis untuk digunakan secara komersial?
Model card NVIDIA menempatkan model ini di bawah lisensi OpenMDW-1.1 dan menandainya siap untuk penggunaan komersial. Ketentuan tersebut berlaku untuk weights yang Anda download dan jalankan sendiri. Ketentuan itu tidak mencakup software lain dalam stack Anda. Karena itu, periksa lisensi agent harness dan setiap tool yang Anda hubungkan secara terpisah, serta baca model card terbaru sebelum mengandalkannya untuk keperluan kontraktual.