Cara Menjalankan Nemotron 3.5 Lightning di VPS
Jalankan NVIDIA Nemotron 3.5 Lightning dengan Ollama di server sendiri. Temukan tag pull yang tepat, kebutuhan RAM, dan apakah mode CPU-only cukup cepat.
Kegunaan Nemotron 3.5 Lightning
Nemotron 3.5 Lightning adalah model mixture-of-experts terbuka 30B dari NVIDIA yang dirilis pada August 2026. Model ini dibuat untuk agent yang berjalan selama berjam-jam, bukan hanya untuk satu jendela chat. MoE (mixture of experts) berarti bobot model dibagi menjadi banyak subnetwork expert, lalu setiap token hanya diarahkan melalui beberapa subnetwork tersebut. Model card NVIDIA menyebutkan total 30 billion parameter, dengan 3 billion parameter aktif untuk setiap token. Anda membayar kebutuhan memori untuk jumlah parameter yang besar. Sebagai gantinya, Anda memperoleh kecepatan dari jumlah parameter yang lebih kecil.
Pertukaran tersebut menjadi alasan untuk mempertimbangkan model ini pada server sewaan. Agent yang mengerjakan tugas nyata mengirim ribuan permintaan singkat sepanjang hari. Karena itu, throughput per dollar menentukan apakah model tersebut layak dijalankan pada server Anda sendiri. Model yang memerlukan 40 detik untuk setiap jawaban dapat menjadi asisten yang berguna, tetapi buruk sebagai agent. Satu tugas dapat membuat 20 panggilan, dan Anda harus menunggu setiap panggilan tersebut.
NVIDIA menjelaskan arsitektur ini sebagai arsitektur hybrid: layer Mamba-2 dan MoE yang diselang-seling, dengan beberapa layer attention. Model card menyebutkan panjang context maksimum hingga 1M token dan lisensi OpenMDW-1.1 yang ditandai siap untuk penggunaan komersial. Bahasa utama yang didukung adalah English dan code. Spanish, French, German, Italian, dan Japanese juga tercantum.
Artificial Analysis menerbitkan pengukuran saat peluncuran pada August 2026 yang menunjukkan hampir 670 output token per detik, menggunakan endpoint DeepInfra prarilis yang menyediakan bobot NVFP4. Itu adalah endpoint GPU yang di-host. Anggap angka tersebut sebagai kemampuan yang dimungkinkan oleh arsitekturnya, bukan sebagai performa yang akan dicapai VPS Anda.
Tag Ollama yang sesuai untuk setiap VPS
Library Ollama menyediakan beberapa build dari bobot yang sama. Perbedaannya terletak pada kuantisasi, yaitu jumlah bit yang digunakan untuk menyimpan setiap bobot. Hal ini sangat memengaruhi ukuran unduhan.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Tag yang bernama latest, 30b, dan 30b-a3b semuanya mengarah ke digest yang sama dengan 30b-a3b-q4_K_M, sehingga unduhan default adalah build empat-bit berukuran 25 GB dengan context 1M penuh. Q8_0 berukuran 35 GB dan bf16 berukuran 66 GB. Keduanya juga menggunakan context 1M. Build MLX berukuran 23 GB ditujukan untuk Apple silicon dan dibatasi hingga context 256K, sehingga bukan pilihan yang tepat untuk VPS Linux.
Ukuran tersebut adalah ukuran unduhan, bukan kebutuhan memori. NVIDIA tidak menerbitkan angka minimum VRAM (video RAM) untuk build Ollama. Karena itu, anggap ukuran unduhan hanya sebagai batas bawah, bukan sebagai kebutuhan keseluruhan. Bobot harus berada di suatu tempat: di memori GPU jika kartu grafis mampu menampungnya, atau di RAM sistem jika tidak. KV cache (key/value cache, yaitu memori model per token untuk menyimpan percakapan) ditambahkan di atas kebutuhan tersebut. Angka sebenarnya untuk hardware Anda diperoleh dari sebuah perintah, bukan dari perhitungan, dan perintah tersebut tersedia di bawah. Jika Anda belum menentukan tingkat kuantisasi, biaya Q4, Q8, dan FP16 menjelaskan hal yang dikorbankan pada setiap tingkat.
Ambil tag yang tepat, jangan gunakan latest
latest adalah penunjuk yang dapat berubah. Saat penerbit library menerbitkan ulang tag tersebut, perilaku agent Anda berubah pada pull berikutnya tanpa penjelasan apa pun dalam catatan Anda. Gunakan nama tag secara eksplisit.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MSkrip instalasi menyiapkan service systemd yang berjalan sebagai pengguna ollama dan menyimpan model di /usr/share/ollama/.ollama/models. Pada sebagian besar image VPS, path tersebut berada di filesystem root. Karena itu, periksa ruang yang tersedia sebelum meminta 25 GB.
df -h /usr/share/ollamaPull yang berhenti di tengah proses dan melaporkan no space left on device memang menunjukkan kondisi tersebut. Blob parsial tetap tersimpan di disk sampai Anda menghapusnya. Selanjutnya, pastikan hasil yang tersimpan:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show menampilkan arsitektur, jumlah parameter, panjang konteks, dan kuantisasi yang benar-benar terdapat dalam file. Jika salah satu nilai tersebut berbeda dari halaman library, berarti Anda mengambil tag yang berbeda dari yang dimaksud.
Jalankan layanan dan periksa lokasi eksekusinya
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Saat model masih dimuat, buka shell kedua:
ollama psPerintah ini menjawab pertanyaan tentang penggunaan memori pada mesin Anda. ollama ps menampilkan model yang dimuat, ukuran memorinya, dan kolom PROCESSOR. 100% GPU berarti seluruh model berada di VRAM. 100% CPU berarti tidak ada bagian model yang berada di VRAM, dan setiap token dihitung oleh prosesor menggunakan RAM sistem. Pembagian seperti 65%/35% CPU/GPU berarti semua layer tidak muat, sehingga porsi yang diproses CPU menentukan kecepatan Anda. Jangan memperkirakan kebutuhannya. Muat model tersebut, lalu baca baris ini.
Jika model sama sekali tidak dapat dimuat, Ollama menolaknya dengan baik dan tidak mengalami crash:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Apakah VPS yang hanya menggunakan CPU cukup cepat?
VPS tujuan umum tidak memiliki GPU, sehingga CPU menangani seluruh pekerjaan dan membaca setiap weight yang diperlukan dari RAM sistem. MoE membantu dalam hal ini karena hanya sekitar 3 miliar dari 30 miliar parameter yang diproses untuk setiap token. Karena itu, perhitungan per token jauh lebih kecil dibandingkan model dense 30B. Namun, kebutuhan memori tidak berkurang sama sekali. Seluruh 30 miliar parameter harus tetap berada di memori karena router dapat memilih expert mana pun untuk setiap token.
Dengan demikian, inferensi yang hanya menggunakan CPU pada model ini dibatasi oleh bandwidth memori, bukan jumlah core. Menambahkan vCPU ke paket yang sudah memiliki jumlah vCPU yang memadai hanya menghasilkan sedikit perubahan. Anda memerlukan RAM yang cukup untuk menampung weight dan cache KV, serta memori dengan kecepatan tertinggi yang disediakan oleh paket tersebut.
Ukur kinerjanya sebelum menetapkan agent untuk menggunakannya, dengan metode pada mengukur token per detik untuk LLM lokal:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Baris eval rate yang dicetak di bagian akhir menunjukkan kecepatan generasi Anda dalam token per detik. Angka tunggal ini menentukan jawabannya karena waktu berjalan agent terutama ditentukan oleh angka tersebut.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Angka tersebut merupakan angka pihak ketiga yang dipublikasikan, dikonversi dari menit per tugas yang dilaporkan Artificial Analysis saat peluncuran. Pengukurannya dilakukan pada endpoint GPU yang di-host, bukan pada VPS. Nemotron 3.5 Lightning rata-rata memerlukan sekitar 30 detik per tugas. Dari jumlah tersebut, gpt-oss-120b memerlukan sekitar 204 detik, sedangkan Qwen3.6 35B memerlukan sekitar 210 detik. Gunakan angka tersebut untuk melihat gambaran perbedaannya, bukan sebagai jaminan untuk hardware Anda.
Panduan yang realistis bergantung pada siapa yang menunggu. Jika seseorang menunggu agent, atau agent menjalankan rangkaian pemanggilan yang panjang secara berurutan, sewa kapasitas GPU. Jika agent berjalan sesuai jadwal pada malam hari dan tidak ada yang memantaunya, paket CPU dengan RAM besar merupakan pilihan yang wajar. Bagaimanapun, pengaturannya sama. Menjalankan Ollama pada VPS membahas penentuan ukuran paket dan perbandingan instance GPU dengan pembayaran kepada penyedia API berdasarkan token. Titik impas bergantung pada utilisasi: instance GPU ditagihkan untuk setiap jam selama instance tersebut tersedia, sedangkan token API hanya ditagihkan saat digunakan. Karena itu, agent yang aktif hampir sepanjang hari lebih cocok dijalankan pada server yang Anda miliki, sementara agent yang berjalan dua kali per jam biasanya tidak.
Jendela konteks 1M tidak tersedia secara gratis
1M token adalah maksimum model, dan Ollama tidak memberikannya secara default. Ollama menggunakan jendela default yang jauh lebih kecil dan membuang token paling lama setelah percakapan melampaui batas tersebut. Tidak ada apa pun yang dicatat saat hal itu terjadi, sehingga bagi agent, kondisi ini terlihat seperti model melupakan awal tugasnya sendiri.
Tetapkan ukuran jendela secara eksplisit. Untuk seluruh server, edit service:
sudo systemctl edit ollamaTambahkan konfigurasi ini, lalu jalankan sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Untuk setiap request, kirim num_ctx sebagai gantinya di dalam objek options:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Setiap peningkatan membutuhkan lebih banyak memori karena cache KV bertambah seiring jumlah token yang diizinkan. Naikkan nilainya, restart, lalu jalankan kembali ollama ps dan pantau ukuran yang dilaporkan. Jika kolom PROCESSOR berubah dari 100% GPU menjadi split setelah perubahan tersebut, cache KV telah mendorong layer model keluar dari VRAM dan kecepatan Anda akan turun drastis. Memilih num_ctx di Ollama membahas kompromi tersebut secara terperinci. Jangan menetapkan 1000000 hanya karena model card mengizinkannya, karena alokasi dilakukan sejak awal dan proses pemuatan akan langsung gagal.
Menghubungkannya ke agent yang selalu aktif
Tulisan peluncuran Ollama untuk model ini mendokumentasikan pintasan yang menjalankan agent yang didukung dan langsung mengarahkannya ke model tersebut:
ollama launch claude --model nemotron-3.5-lightningTulisan tersebut mendokumentasikan claude, opencode, openclaw, dan hermes pada posisi itu. Subperintah ini memerlukan Ollama versi terbaru, jadi periksa ollama --version terlebih dahulu. Jika tidak tersedia, arahkan agent ke API secara manual. Ollama menyediakan endpoint yang kompatibel dengan OpenAI dan dapat diterima oleh sebagian besar harness agent:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama mengabaikan key tersebut, tetapi sebagian besar client tidak mau berjalan jika key belum diatur. Konfigurasi pada sisi harness ini dibahas dalam mengarahkan coding agent ke Ollama dan membangun agent OpenClaw sendiri.
Dua pengaturan server penting setelah agent berjalan tanpa pengawasan. OLLAMA_KEEP_ALIVE mengontrol berapa lama model tetap berada di memori setelah permintaan terakhir. Nilai default mengeluarkan model dari memori setelah lima menit, sehingga pemanggilan berikutnya kembali memerlukan waktu pemuatan penuh. Pada file berukuran 25 GB tanpa GPU, jeda tersebut cukup lama untuk menyebabkan timeout. Atur OLLAMA_KEEP_ALIVE=-1 agar model tetap berada di memori. OLLAMA_HOST=0.0.0.0:11434 membuat API dapat diakses dari mesin lain dan tidak menyediakan autentikasi apa pun. Karena itu, buka akses tersebut hanya di balik aturan firewall atau jaringan privat.
Mode kegagalan dan string yang akan Anda lihat
Pull langsung gagal. Error: pull model manifest: file does not exist berarti tag tersebut tidak ada. Nama tag adalah string yang harus sama persis. Salin salah satu dari halaman library, jangan menebak akhiran quantisation.
Model tidak dapat dimuat. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) berarti tag tersebut terlalu besar untuk paket ini dengan konfigurasi saat ini. Gunakan quantisation yang lebih kecil, atau turunkan OLLAMA_CONTEXT_LENGTH, karena KV cache turut dihitung dalam kebutuhan tersebut.
Tidak ada respons pada port 11434. curl: (7) Failed to connect to localhost port 11434 berarti service tidak berjalan atau tidak listening pada alamat yang diharapkan. Baca systemctl status ollama dan journalctl -u ollama -n 50. Jika Anda juga menjalankan ollama serve secara manual, proses kedua akan berhenti dengan Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Ada respons, tetapi sangat lambat. Periksa ollama ps sebelum mengubah apa pun. Jika ada penggunaan CPU pada kolom PROCESSOR di mesin dengan GPU, sebagian model tidak tertampung dalam VRAM. Turunkan context atau gunakan quantisation yang lebih kecil. Pada mesin tanpa GPU, kinerja lambat adalah hasil yang diharapkan dan tidak ada pengaturan yang dapat memperbaikinya.
Agent melupakan instruksinya di tengah tugas. Percakapan telah melewati context window dan token paling lama dibuang secara diam-diam. Naikkan OLLAMA_CONTEXT_LENGTH, lalu pastikan dengan ollama ps bahwa model masih dapat dimuat. Jika tidak lagi dapat dimuat, solusinya adalah menggunakan mesin yang lebih besar, bukan window yang lebih kecil.
Posisi model ini dibandingkan dengan alternatifnya
MoE 30B merupakan model besar untuk di-host pada tugas kecil. Jika model dense 8B sudah dapat menangani tugas Anda, biaya operasionalnya akan jauh lebih rendah dan model dapat dimuat dalam hitungan detik. Untuk perbandingan langsung dalam menentukan pilihan tersebut, lihat Qwen 3 pada 8B dan 27B di VPS. Untuk survei yang lebih luas tentang model yang benar-benar dapat ditampung oleh suatu paket, mulai dari model AI yang dapat Anda self-host. Jika Anda berencana melayani beberapa agent sekaligus, bukan hanya satu, baca Ollama dibandingkan dengan vLLM terlebih dahulu. Ollama tidak melakukan batching pada request bersamaan seperti yang dilakukan server inference produksi. Pada titik inilah setup satu pengguna mulai tidak dapat diskalakan.
FAQ
Tag Nemotron 3.5 Lightning mana yang harus saya pull pada VPS Linux?
Gunakan nemotron-3.5-lightning:30b-a3b-q4_K_M. Ukurannya 25 GB, mendukung context maksimum penuh sebesar 1M, dan menggunakan digest yang sama dengan tag latest, 30b, dan 30b-a3b per August 2026. Tentukan nama tag ini secara eksplisit, bukan dengan melakukan pull latest, agar republish pointer tersebut pada masa mendatang tidak mengubah perilaku agent tanpa Anda sadari. Tag mlx adalah build untuk Apple silicon dan tidak berguna pada Linux.
Berapa RAM yang dibutuhkan Nemotron 3.5 Lightning?
NVIDIA tidak menerbitkan angka minimum memori untuk build Ollama, jadi lakukan pengukuran dan jangan membuat perkiraan. Pull tag tersebut, jalankan model sekali, lalu baca ollama ps saat model masih dimuat. Perintah itu menampilkan ukuran yang benar-benar digunakan serta menunjukkan apakah model berjalan pada GPU atau CPU. Ukuran download untuk tag default, yaitu 25 GB, hanya merupakan batas bawah karena KV cache ditambahkan di atasnya dan bertambah sesuai context window yang Anda tetapkan. Jika plan terlalu kecil, Ollama menolak menjalankan model dengan model requires more system memory dan menampilkan kedua angka tersebut.
Apakah Nemotron 3.5 Lightning dapat dijalankan pada VPS tanpa GPU?
Ya, jika plan memiliki RAM yang cukup untuk memuat weights. Desain MoE juga membantu karena hanya sekitar 3 dari 30 miliar parameter yang dihitung untuk setiap token. Kendalanya adalah kecepatan. Tanpa GPU, model dibatasi oleh bandwidth memori, sehingga penambahan vCPU hampir tidak meningkatkan hasil. Jalankan ollama run --verbose dengan prompt tetap, baca baris eval rate, lalu bandingkan angka tersebut dengan batas waktu agent Anda. Untuk batch job yang berjalan semalaman, konfigurasi ini sering kali memadai. Untuk proses yang harus ditunggu langsung oleh pengguna, biasanya tidak memadai.
Mengapa Ollama tidak memberikan context window penuh sebesar 1M?
1M adalah batas maksimum model, bukan nilai default Ollama. Ollama menerapkan window yang jauh lebih kecil dan membuang token paling lama setelah percakapan melampaui batas tersebut. Ollama tidak mencetak error, sehingga agent tampak melupakan instruksinya sendiri. Tetapkan OLLAMA_CONTEXT_LENGTH pada service systemd, atau teruskan num_ctx untuk setiap request. Naikkan nilainya secara bertahap dan periksa kembali ollama ps setiap kali, karena penggunaan memori KV cache bertambah sesuai ukuran window dan dapat memindahkan layer model dari GPU.
Apakah Nemotron 3.5 Lightning gratis untuk digunakan secara komersial?
Model card NVIDIA menempatkan model ini di bawah lisensi OpenMDW-1.1 dan menandainya siap untuk penggunaan komersial. Ketentuan tersebut berlaku untuk weights yang Anda download dan jalankan sendiri. Ketentuan itu tidak mencakup software lain dalam stack Anda. Karena itu, periksa lisensi agent harness dan setiap tool yang Anda hubungkan secara terpisah, serta baca model card terbaru sebelum mengandalkannya untuk keperluan kontraktual.