Nemotron 3.5 Lightning VPS üzerinde nasıl çalıştırılır?
NVIDIA Nemotron 3.5 Lightning modelini Ollama ile kendi sunucunuzda çalıştırmak için gerekli olan vRAM miktarı, doğru komut satırı parametreleri ve CPU kullanımı hakkındaki detaylar.
Nemotron 3.5 Lightning ne işe yarar
Nemotron 3.5 Lightning, NVIDIA'nın Ağustos 2026'da yayınladığı, 30B parametreli açık kaynaklı bir mixture-of-experts modelidir ve tek bir sohbet penceresinden ziyade saatlerce çalışan aracılar (agent) için tasarlanmıştır. MoE (mixture of experts), ağırlıkların birçok uzman alt ağa bölündüğü ve her bir token'ın yalnızca birkaçından geçirildiği anlamına gelir. NVIDIA'nın model kartı, token başına 3 milyarı aktif olmak üzere toplam 30 milyar parametre belirtmektedir. Bellekteki büyük sayı için ödeme yaparsınız; hız olarak ise küçük sayının karşılığını alırsınız.
Bu takas, kiraladığınız bir sunucuda bu modele bakmanızın temel nedenidir. Gerçek işler yapan bir aracı, gün boyunca binlerce kısa istek gönderir; bu nedenle dolar başına verimlilik, modelin kendi sunucunuzda barındırılıp barındırılamayacağını belirler. Yanıt başına 40 saniye süren bir model, kullanılabilir bir yardımcıdır ancak zayıf bir aracıdır; çünkü tek bir görev yirmi çağrı gerektirir ve her biri için beklemeniz gerekir.
NVIDIA, mimariyi hibrit olarak tanımlar: seçili attention katmanlarıyla iç içe geçmiş Mamba-2 ve MoE katmanları. Model kartı, 1M token'a kadar maksimum bağlam uzunluğu ve ticari kullanıma uygun olduğu belirtilen OpenMDW-1.1 lisansı sunar. Birincil diller İngilizce ve kodlama olup; İspanyolca, Fransızca, Almanca, İtalyanca ve Japonca da desteklenen diller arasındadır.
Artificial Analysis, Ağustos 2026'da yayınladığı lansman ölçümlerinde, NVFP4 ağırlıklarını sunan bir DeepInfra uç noktasında saniyede yaklaşık 670 çıktı token'ı elde edildiğini göstermiştir. Bu, barındırılan bir GPU uç noktasıdır. Bunu VPS sunucunuzun yapabilecekleri olarak değil, mimarinin izin verdiği kapasite olarak değerlendirin.
Hangi Ollama etiketi hangi VPS için uygundur
Ollama kütüphanesi, aynı ağırlıkların birkaç farklı derlemesini yayınlar. Bunlar arasındaki fark, ağırlıkların kaç bit ile saklandığını belirleyen niceleme (quantisation) seviyesidir; bu durum indirme boyutunu önemli ölçüde değiştirir.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]latest, 30b ve 30b-a3b olarak adlandırılan etiketlerin tümü 30b-a3b-q4_K_M ile aynı özete (digest) karşılık gelir. Bu nedenle varsayılan indirme, 1M bağlam (context) kapasitesine sahip 25 GB boyutundaki dört bitlik derlemedir. Q8_0 sürümü 35 GB, bf16 sürümü ise 66 GB boyutundadır ve her ikisi de 1M bağlam desteği sunar. 23 GB boyutundaki MLX derlemeleri Apple silikon işlemciler içindir ve 256K bağlam ile sınırlıdır; bu nedenle Linux VPS üzerinde kullanılması hatalı bir tercihtir.
Bunlar indirme boyutlarıdır, bellek gereksinimi değildir. NVIDIA, Ollama derlemeleri için minimum VRAM (video RAM) değeri yayınlamaz; bu yüzden indirme boyutunu yalnızca bir alt sınır olarak kabul edin. Ağırlıklar bir yerde barınmak zorundadır; kart kapasitesi yetiyorsa GPU belleğinde, yetmiyorsa sistem RAM'inde tutulurlar. KV önbelleği (key/value cache, modelin her bir token için tuttuğu konuşma belleği) ise bunun üzerine eklenir. Donanımınız için gerçek değer aritmetik hesaplamalarla değil, aşağıda belirtilen komutla elde edilir. Henüz bir niceleme seviyesine karar vermediyseniz, Q4, Q8 ve FP16 seviyelerinin maliyeti başlıklı bölüm, her adımda nelerin feda edildiğini açıklar.
Tam etiketi çekin, asla latest kullanmayın
latest değişken bir işaretçidir. Kütüphane bu etiketi yeniden yayınladığında, ajanınızın davranışı bir sonraki çekme işleminde değişir ve notlarınızda bunun nedenini açıklayan hiçbir bilgi bulunmaz. Etiketi mutlaka belirtin.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MKurulum betiği, ollama kullanıcısı olarak çalışan ve modelleri /usr/share/ollama/.ollama/models altında tutan bir systemd servisi oluşturur. Bu yol çoğu VPS imajında kök dosya sistemindedir, bu nedenle 25 GB talep etmeden önce disk alanını kontrol edin. Eğer dosya sistemi darsa, Ollama'nın modelleri nerede sakladığı ve bunların nasıl taşınacağı hakkındaki bilgileri, disk dolmadan önce okumak faydalı olacaktır.
df -h /usr/share/ollamaYarıda kesilen ve no space left on device hatası veren bir çekme işlemi tam olarak bunu ifade eder; kısmi blob dosyaları siz onları silene kadar diskte kalır. Ardından nelerin yüklendiğini doğrulayın:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show; mimariyi, parametre sayısını, bağlam uzunluğunu ve dosyanın gerçekte taşıdığı nicemleme (quantization) değerini yazdırır. Bunlardan herhangi biri kütüphane sayfasındaki bilgilerle uyuşmuyorsa, hedeflediğinizden farklı bir etiket çekmişsiniz demektir.
Servis edin ve gerçekte nerede çalıştığını kontrol edin
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Model yüklü durumdayken, ikinci bir kabuk (shell) üzerinde şunları çalıştırın:
ollama psBu komut, makineniz için bellek sorusunu yanıtlar. ollama ps yüklü modeli, bellekte kapladığı boyutu ve bir PROCESSOR sütununu yazdırır. 100% GPU, modelin tamamının VRAM üzerinde olduğunu ifade eder. 100% CPU, hiçbir kısmının VRAM'de olmadığını ve her bir token'ın işlemci tarafından sistem RAM'i kullanılarak hesaplandığını belirtir. 65%/35% CPU/GPU gibi bir bölünme, katmanların tamamının sığmadığı ve CPU payının hızınızı belirlediği anlamına gelir. Gereksinimi tahmin etmeyin. Modeli yükleyin ve bu satırı okuyun.
Eğer model hiç yüklenemiyorsa, Ollama çökmek yerine temiz bir şekilde reddeder:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Sadece CPU içeren bir VPS yeterince hızlı mıdır?
Genel amaçlı bir VPS'te GPU bulunmaz; bu nedenle tüm iş yükü CPU üzerindedir ve sistem RAM'i üzerinden her ağırlık verisi okunur. MoE (Mixture of Experts) yapısı burada yardımcı olur; çünkü 30 milyar parametrelik modelde her token için yalnızca yaklaşık 3 milyar parametre işlenir. Bu sayede token başına düşen aritmetik işlem, yoğun (dense) bir 30B modele kıyasla çok daha azdır. Ancak bellek tarafında bir iyileşme sağlanmaz. Yönlendirici (router) her token için herhangi bir uzmanı seçebileceğinden, 30 milyar parametrenin tamamının bellekte tutulması gerekir.
Bu modelde sadece CPU ile çıkarım (inference) yapmak, çekirdek sayısından ziyade bellek bant genişliği ile sınırlıdır. Zaten makul sayıda vCPU içeren bir plana ek vCPU eklemek çok az fark yaratır. İhtiyacınız olan şey, ağırlıkları ve KV cache verisini tutacak kadar RAM ve planın sunduğu en hızlı bellek erişimidir.
Bir ajanı devreye almadan önce, yerel bir LLM için saniyedeki token sayısını ölçme yöntemini kullanarak hızı ölçün:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Çıktının sonunda yazdırılan eval rate satırı, saniyedeki token cinsinden üretim hızınızdır. Bir ajanın toplam işlem süresi bu değer tarafından belirlendiği için, tek başına bu sayı karar vermeniz için yeterlidir. Bu değeri beklediğiniz yanıt uzunluğu ile çarpın; eğer sonuç beklemek istediğiniz süreden uzunsa, num_predict ile çıktı sınırlaması, donanımı değiştirmeden tek bir çağrıyı kısıtlamanın tek yoludur.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Bunlar, Artificial Analysis tarafından lansman sırasında bildirilen görev başına dakika verilerinden dönüştürülmüş üçüncü taraf rakamlardır ve bir VPS üzerinde değil, barındırılan GPU uç noktalarında ölçülmüştür. Nemotron 3.5 Lightning görev başına ortalama 30 saniye sürmüştür; burada gpt-oss-120b yaklaşık 204 saniye, Qwen3.6 35B ise yaklaşık 210 saniye sürmüştür. Bu verileri donanımınız için bir taahhüt olarak değil, performans farkının genel eğilimini anlamak için kullanın.
Dürüst bir tavsiye, bekleyen tarafın kim olduğuna göre değişir. Eğer bir insan ajanı bekliyorsa veya ajan arka arkaya uzun çağrı zincirleri oluşturuyorsa, GPU kapasitesi kiralayın. Eğer ajan gece boyunca bir zamanlamaya göre çalışıyorsa ve kimse izlemiyorsa, yüksek RAM'li bir CPU planı makul bir tercihtir. Her iki durumda da kurulum aynıdır ve Ollama'yı bir VPS üzerinde çalıştırma rehberi, plan boyutlandırmasını ve bir GPU örneği ile token başına ödeme yapan bir API sağlayıcısı kullanmanın karşılaştırmasını kapsar. Başabaş noktası bir kullanım yoğunluğu meselesidir: Bir GPU örneği var olduğu her saat için ücretlendirilirken, API tokenları yalnızca kullanıldığında ücretlendirilir. Bu nedenle günün büyük kısmında meşgul olan bir ajan için kendi sunucunuzu yönetmek, saatte iki kez çalışan bir ajan için ise API kullanmak genellikle daha avantajlıdır.
1M bağlam penceresi ücretsiz değildir
1M token, modelin maksimum kapasitesidir ve Ollama bunu varsayılan olarak size sunmaz. Ollama çok daha küçük bir varsayılan pencere ile hizmet verir ve bir konuşma bu sınırı aştığında en eski token'ları siler. Bu gerçekleştiğinde hiçbir kayıt tutulmaz; bu nedenle bir aracı (agent) için model kendi görevinin başlangıcını unutmuş gibi görünür.
Pencereyi bilinçli olarak ayarlayın. Tüm sunucu için servisi düzenleyin:
sudo systemctl edit ollamaBunu ekleyin, ardından sudo systemctl restart ollama komutunu çalıştırın:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"İstek bazında, bunun yerine options nesnesi içinde num_ctx gönderin:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Her artış bellek maliyeti getirir, çünkü KV önbelleği izin verdiğiniz token sayısı ile birlikte büyür. Değeri yükseltin, yeniden başlatın, ardından ollama ps komutunu tekrar çalıştırın ve bildirilen boyutun arttığını izleyin. Bu değişiklikten sonra PROCESSOR sütunu 100% GPU değerinden bölünmüş (split) bir yapıya geçerse, KV önbelleği model katmanlarını VRAM dışına itmiş demektir ve hızınız ciddi oranda düşecektir. Ollama'da num_ctx seçimi bu dengeyi detaylıca ele alır. Model kartı izin veriyor diye 1000000 değerini ayarlamayın, çünkü bellek tahsisi en başta yapılır ve yükleme işlemi doğrudan başarısız olur.
Sürekli çalışan bir aracıya bağlama
Ollama'nın bu model için yayınladığı duyuru yazısı, desteklenen bir aracıya doğrudan bu modeli işaret eden bir kısayolu belgelemektedir:
ollama launch claude --model nemotron-3.5-lightningYazı, bu konumda claude, opencode, openclaw ve hermes seçeneklerini belgelemektedir. Alt komut güncel bir Ollama sürümü gerektirir, bu nedenle önce ollama --version komutunu kontrol edin; eğer eksikse aracıya API adresini kendiniz tanımlayın. Ollama, çoğu aracı altyapısının kabul ettiği OpenAI uyumlu bir uç nokta sunar:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama anahtarı göz ardı eder ancak çoğu istemci bir anahtar tanımlanmadan başlamayı reddeder. Bu sürecin aracı tarafı kodlama aracısını Ollama'ya yönlendirme ve kendi OpenClaw aracınızı oluşturma bölümlerinde ele alınmıştır.
Aracı gözetimsiz çalışmaya başladığında iki sunucu ayarı önem kazanır. OLLAMA_KEEP_ALIVE, bir modelin son istekten sonra ne kadar süre bellekte kalacağını kontrol eder; varsayılan ayar beş dakika sonra modeli bellekten atar, bu da bir sonraki çağrıda tam yükleme süresinin tekrar harcanmasına neden olur. GPU olmayan bir sistemde 25 GB boyutundaki bir dosyada bu bekleme süresi, zaman aşımını tetikleyecek kadar uzundur. Modeli bellekte tutmak için OLLAMA_KEEP_ALIVE=-1 ayarını yapılandırın. OLLAMA_HOST=0.0.0.0:11434, API'nin diğer makinelerden erişilebilir olmasını sağlar; bu ayar herhangi bir kimlik doğrulama içermediğinden, yalnızca bir güvenlik duvarı kuralı veya özel bir ağ arkasında etkinleştirin.
Hata modları ve karşılaşacağınız dizgeler
Çekme işlemi hemen başarısız oluyor. Error: pull model manifest: file does not exist, ilgili etiketin mevcut olmadığı anlamına gelir. Etiket isimleri tam eşleşme gerektiren dizgelerdir; bu nedenle bir nicemleme sonekini tahmin etmek yerine kütüphane sayfasından kopyalayın.
Model yüklenmiyor. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB), etiketin mevcut yapılandırmadaki plan için çok büyük olduğu anlamına gelir. Daha küçük bir nicemlemeye geçin veya OLLAMA_CONTEXT_LENGTH değerini düşürün; çünkü KV önbelleği bu gereksinimin içinde hesaplanır.
11434 numaralı portta yanıt yok. curl: (7) Failed to connect to localhost port 11434, servisin çalışmadığını veya beklediğiniz yerde dinleme yapmadığını gösterir. systemctl status ollama ve journalctl -u ollama -n 50 bölümlerini okuyun. Eğer ollama serve servisini manuel olarak başlattıysanız, ikinci kopya Error: listen tcp 127.0.0.1:11434: bind: address already in use hatasıyla kapanacaktır.
Yanıt veriyor ancak çok yavaş. Herhangi bir değişiklik yapmadan önce ollama ps değerini kontrol edin. GPU olan bir makinede PROCESSOR sütununda herhangi bir CPU payı görülmesi, modelin bir kısmının VRAM dışına taştığı anlamına gelir; bu durumda bağlamı düşürün veya daha küçük bir nicemleme kullanın. GPU olmayan bir makinede yavaşlık beklenen bir sonuçtur ve hiçbir ayar bunu düzeltemez.
Ajan, bir görev sırasında talimatlarını unutuyor. Konuşma bağlam penceresini aştı ve en eski belirteçler sessizce atıldı. OLLAMA_CONTEXT_LENGTH değerini yükseltin, modelin hala sığıp sığmadığını ollama ps ile doğrulayın; eğer sığmıyorsa çözüm, pencereyi küçültmek yerine daha büyük bir makineye geçmektir.
Bu modelin alternatifler karşısındaki konumu
30B MoE, küçük bir iş için barındırılması oldukça büyük bir modeldir. Eğer 8B yoğun (dense) bir model görevinizi halledebiliyorsa, çalıştırma maliyeti çok daha düşük olacak ve saniyeler içinde yüklenecektir; VPS üzerinde 8B ve 27B Qwen 3 bu karar için doğrudan bir karşılaştırma sunar. Belirli bir planın gerçekte neleri barındırabileceğine dair daha geniş bir inceleme için self-host edebileceğiniz yapay zeka modelleri ile başlayın. Eğer tek bir ajan yerine aynı anda birden fazla ajana hizmet vermeyi planlıyorsanız, önce Ollama ve vLLM karşılaştırması konusunu okuyun; çünkü Ollama, eş zamanlı istekleri bir üretim (production) çıkarım sunucusunun yaptığı gibi gruplandırmaz (batching) ve tek kullanıcılı bir kurulumun ölçeklenemediği nokta tam olarak burasıdır.
FAQ
Linux VPS üzerinde hangi Nemotron 3.5 Lightning etiketini çekmeliyim?
nemotron-3.5-lightning:30b-a3b-q4_K_M etiketini kullanın. Bu etiket 25 GB boyutundadır, tam 1M maksimum bağlam (context) kapasitesini destekler ve Ağustos 2026 itibarıyla latest, 30b ve 30b-a3b etiketlerinin işaret ettiği aynı özet (digest) değerine sahiptir. latest etiketini çekmek yerine doğrudan bu ismi kullanın; böylece bu işaretçinin gelecekte yeniden yayınlanması durumunda, siz fark etmeden temsilcinizin (agent) davranışının değişmesini engellemiş olursunuz. mlx etiketleri Apple silicon sürümleridir ve Linux üzerinde çalışmazlar.
Nemotron 3.5 Lightning ne kadar RAM gerektirir?
NVIDIA, Ollama sürümleri için minimum bellek değeri yayınlamamaktadır; bu nedenle tahmin etmek yerine ölçüm yapın. Etiketi çekin, modeli bir kez çalıştırın ve yüklendiği sırada ollama ps çıktısını okuyun: bu komut, bellekte fiilen kaplanan boyutu ve modelin GPU'ya mı yoksa CPU'ya mı yerleştiğini gösterir. Varsayılan etiket için 25 GB olan indirme boyutu bir alt sınırdır; çünkü KV önbelleği (cache) bunun üzerine eklenir ve belirlediğiniz bağlam penceresiyle birlikte büyür. Eğer planınız çok küçükse, Ollama model requires more system memory hatası verir ve her iki değeri de belirtir.
Nemotron 3.5 Lightning'i GPU'su olmayan bir VPS üzerinde çalıştırabilir miyim?
Evet, eğer planınız ağırlıkları tutacak kadar RAM'e sahipse. MoE tasarımı burada avantaj sağlar çünkü 30 milyar parametrenin her token için sadece yaklaşık 3 tanesi hesaplanır. Buradaki sorun hızdır. GPU olmadığında model bellek bant genişliği ile sınırlanır, bu yüzden vCPU eklemek sonucu pek değiştirmez. ollama run --verbose komutunu sabit bir istemle (prompt) çalıştırın, eval rate satırını okuyun ve bu sayıyı temsilcinizin yanıt süresi hedefiyle karşılaştırın. Gece boyunca sürecek toplu işler için genellikle uygundur. Bir kullanıcının beklediği etkileşimli işler için ise genellikle yeterli değildir.
Ollama neden bana tam 1M bağlam penceresini vermiyor?
1M modelin maksimum kapasitesidir, Ollama'nın varsayılan değeri değildir. Ollama çok daha küçük bir pencere uygular ve bir konuşma bu sınırı aştığında en eski token'ları hata vermeden siler; bu durum temsilcinin kendi talimatlarını unutması gibi görünür. OLLAMA_CONTEXT_LENGTH ayarını systemd servisi üzerinde yapılandırın veya her istek için num_ctx parametresini geçin. Değeri kademeli olarak artırın ve her seferinde ollama ps çıktısını kontrol edin; çünkü KV önbelleği bellek kullanımı pencere boyutuyla ölçeklenir ve model katmanlarını GPU'dan dışarı itebilir.
Nemotron 3.5 Lightning ticari kullanım için ücretsiz mi?
NVIDIA'nın model kartı, modeli OpenMDW-1.1 lisansı altına yerleştirir ve ticari kullanıma uygun olduğunu belirtir. Bu, indirip kendi başınıza çalıştırdığınız ağırlıkları kapsar. Yığınınızdaki diğer yazılımlar hakkında bir şey belirtmez; bu nedenle temsilci arayüzünüzün ve bağladığınız diğer araçların lisanslarını ayrı ayrı kontrol edin ve buna dayalı sözleşmesel bir iş yapmadan önce güncel model kartını okuyun.