Nemotron 3.5 Lightning VPS üzerinde nasıl çalıştırılır?
NVIDIA Nemotron 3.5 Lightning modelini Ollama ile kendi sunucunuzda çalıştırmanın yollarını öğrenin. Gereken RAM miktarı, doğru komut satırı ve CPU performans analizi burada.
Nemotron 3.5 Lightning ne işe yarar
Nemotron 3.5 Lightning, NVIDIA tarafından Ağustos 2026'da yayınlanan, açık kaynaklı 30B mixture-of-experts modelidir ve tek bir sohbet penceresinden ziyade saatlerce çalışan aracılar için tasarlanmıştır. MoE (mixture of experts), ağırlıkların birçok uzman alt ağa bölündüğü ve her bir token'ın bunlardan sadece birkaçından geçirildiği anlamına gelir. NVIDIA'nın model kartı, toplam 30 milyar parametre ve token başına 3 milyar aktif parametre belirtmektedir. Bellekteki büyük sayı için ödeme yapar, hız olarak ise küçük sayının performansını alırsınız.
Bu takas, kiraladığınız bir sunucuda bu modeli değerlendirmenizin temel nedenidir. Gerçek işler yapan bir aracı, gün boyunca binlerce kısa istek gönderir; dolayısıyla dolar başına düşen iş hacmi (throughput), modelin kendi sunucunuzda barındırılıp barındırılamayacağını belirler. Yanıt başına 40 saniye harcayan bir model, kullanılabilir bir yardımcıdır ancak zayıf bir aracıdır; çünkü tek bir görev yirmi çağrı gerektirir ve her biri için beklemeniz gerekir.
NVIDIA mimariyi hibrit olarak tanımlar: seçili dikkat (attention) katmanlarıyla iç içe geçmiş Mamba-2 ve MoE katmanları. Model kartı, 1M token'a kadar maksimum bağlam uzunluğu ve ticari kullanıma uygun olduğu belirtilen OpenMDW-1.1 lisansı sunar. Birincil diller İngilizce ve kodlama olup, İspanyolca, Fransızca, Almanca, İtalyanca ve Japonca da desteklenen diller arasındadır.
Artificial Analysis, Ağustos 2026'da yayınlanan lansman ölçümlerinde, NVFP4 ağırlıklarını sunan yayın öncesi bir DeepInfra uç noktasında saniyede yaklaşık 670 çıktı token'ı elde edildiğini göstermiştir. Bu, barındırılan bir GPU uç noktasıdır. Bunu, VPS sunucunuzun yapabilecekleri olarak değil, mimarinin izin verdiği kapasite olarak değerlendirin.
Hangi Ollama etiketi hangi VPS için uygundur
Ollama kütüphanesi, aynı ağırlıkların birkaç farklı sürümünü yayınlar. Sürümler arasındaki fark, ağırlıkların kaç bit ile saklandığını belirleyen niceleme (quantisation) yöntemidir; bu durum indirme boyutunu önemli ölçüde değiştirir.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]latest, 30b ve 30b-a3b olarak adlandırılan etiketlerin tümü 30b-a3b-q4_K_M ile aynı özeti (digest) işaret eder. Bu nedenle varsayılan indirme, 1M bağlam (context) kapasitesine sahip 25 GB boyutundaki dört bitlik sürümdür. Q8_0 sürümü 35 GB, bf16 sürümü ise 66 GB boyutundadır ve her ikisi de 1M bağlam desteği sunar. 23 GB boyutundaki MLX sürümleri Apple silikon çipler içindir ve 256K bağlam ile sınırlıdır; bu nedenle Linux VPS üzerinde kullanılması uygun değildir.
Belirtilen değerler indirme boyutlarıdır, bellek gereksinimleri değildir. NVIDIA, Ollama sürümleri için minimum VRAM (video RAM) değeri yayınlamaz; bu yüzden indirme boyutunu yalnızca alt sınır olarak kabul edin. Ağırlıklar bir yerde barındırılmalıdır; eğer kart kapasitesi yetiyorsa GPU belleğinde, yetmiyorsa sistem RAM'inde tutulur. KV önbelleği (key/value cache, modelin her bir token için tuttuğu konuşma belleği) ise bunun üzerine eklenir. Donanımınız için gerçek değer, aritmetik hesaplamalarla değil, aşağıdaki komut çalıştırılarak elde edilir. Henüz bir niceleme seviyesine karar vermediyseniz, Q4, Q8 ve FP16 seviyelerinin maliyeti başlıklı bölüm, her adımda nelerin değiştiğini açıklar.
Tam etiketi çekin, asla latest kullanmayın
latest hareketli bir işaretçidir. Kütüphane bu etiketi yeniden yayınladığında, notlarınızda hiçbir açıklama olmaksızın bir sonraki çekme işleminde aracınızın davranışı değişir. Etiketi mutlaka belirtin.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MKurulum betiği, ollama kullanıcısı olarak çalışan ve modelleri /usr/share/ollama/.ollama/models altında tutan bir systemd servisi oluşturur. Bu yol çoğu VPS imajında kök dosya sisteminde yer alır; bu nedenle 25 GB talep etmeden önce disk alanını kontrol edin.
df -h /usr/share/ollamaYarıda kesilen ve no space left on device hatası veren bir çekme işlemi tam olarak bunu ifade eder; kısmi blob dosyaları siz onları silene kadar diskte kalır. Ardından nelerin yüklendiğini doğrulayın:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show mimariyi, parametre sayısını, bağlam uzunluğunu ve dosyanın gerçekte taşıdığı kuantizasyonu yazdırır. Bunlardan herhangi biri kütüphane sayfasıyla uyuşmuyorsa, amaçladığınızdan farklı bir etiket çekmişsiniz demektir.
Servisi çalıştırın ve nerede çalıştığını kontrol edin
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Model yüklü durumdayken, ikinci bir terminal penceresinde şu komutu çalıştırın:
ollama psBu komut, makinenizdeki bellek kullanımına dair soruyu yanıtlar. ollama ps komutu, yüklü modeli, bellekte kapladığı boyutu ve bir PROCESSOR sütununu görüntüler. 100% GPU değeri, modelin tamamının VRAM üzerinde olduğunu belirtir. 100% CPU değeri, modelin VRAM'de olmadığını ve her bir token'ın sistem RAM'i üzerinden işlemci tarafından hesaplandığını gösterir. 65%/35% CPU/GPU gibi bir bölünme, katmanların tamamının sığmadığı ve hızınızın CPU payı tarafından belirlendiği anlamına gelir. Gereksinimi tahmin etmeye çalışmayın. Modeli yükleyin ve bu satırı okuyun.
Model hiç yüklenemezse, Ollama çökmek yerine işlemi temiz bir şekilde reddeder:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Sadece CPU içeren bir VPS yeterince hızlı mıdır?
Genel amaçlı bir VPS'te GPU bulunmaz; bu nedenle tüm iş yükü CPU tarafından gerçekleştirilir ve ihtiyaç duyulan her ağırlık sistem RAM'inden okunur. MoE (Mixture of Experts) mimarisi burada yardımcı olur; çünkü 30 milyar parametrenin sadece yaklaşık 3 milyarı her bir token için işlenir. Bu sayede token başına düşen aritmetik işlem yükü, yoğun (dense) bir 30B modele kıyasla çok daha düşüktür. Ancak bellek tarafında bir iyileşme sağlanmaz. Yönlendirici (router) her token için herhangi bir uzmanı seçebileceğinden, 30 milyar parametrenin tamamının bellekte tutulması gerekir.
Dolayısıyla, bu modelde sadece CPU ile çıkarım (inference) yapmak, çekirdek sayısından ziyade bellek bant genişliği ile sınırlıdır. Makul sayıda vCPU'ya sahip bir plana ek vCPU eklemek çok az fark yaratır. İhtiyacınız olan şey, ağırlıkları ve KV önbelleğinizi tutacak kadar RAM ve planın size sunduğu en hızlı bellektir.
Bir ajanı bu sisteme dahil etmeden önce, yerel bir LLM için saniyedeki token sayısını ölçme yöntemini kullanarak ölçüm yapın:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."Sonda yazdırılan eval rate satırı, saniyedeki token cinsinden üretim hızınızdır. Bir ajanın toplam işlem süresi (wall-clock time) büyük ölçüde bu değere bağlı olduğundan, kararınızı bu tek sayı belirler.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Bunlar, Artificial Analysis tarafından lansman sırasında bildirilen görev başına dakika verilerinden dönüştürülmüş, üçüncü taraf yayınlanmış rakamlardır ve bir VPS üzerinde değil, barındırılan GPU uç noktalarında ölçülmüştür. Nemotron 3.5 Lightning görev başına ortalama 30 saniye sürmüştür; burada gpt-oss-120b yaklaşık 204 saniye, Qwen3.6 35B ise yaklaşık 210 saniye sürmüştür. Bu verileri donanımınız için bir taahhüt olarak değil, performans farkının boyutunu anlamak için kullanın.
Dürüst bir tavsiye, bekleyen tarafın kim olduğuna göre değişir. Eğer bir insan ajanı bekliyorsa veya ajan arka arkaya uzun çağrı zincirleri oluşturuyorsa, GPU kapasitesi kiralayın. Eğer ajan gece boyunca bir zamanlamaya göre çalışıyorsa ve onu izleyen kimse yoksa, yüksek RAM'li bir CPU planı makul bir tercihtir. Her iki durumda da kurulum aynıdır ve VPS üzerinde Ollama çalıştırma rehberi, plan boyutlandırmasını ve bir GPU örneğinin token başına ödeme yapılan bir API sağlayıcısı ile nasıl kıyaslandığını ele alır. Başabaş noktası kullanım oranına bağlıdır: Bir GPU örneği var olduğu her saat için ücretlendirilirken, API tokenları yalnızca kullanıldığında ücretlendirilir. Bu nedenle, günün büyük kısmında meşgul olan bir ajan için kendi sunucunuzu kullanmak avantajlıyken, saatte iki kez çalışan bir ajan için genellikle API daha uygundur.
1M bağlam penceresi ücretsiz değildir
1M token, modelin maksimum kapasitesidir ve Ollama bunu varsayılan olarak size sunmaz. Ollama çok daha küçük bir varsayılan pencere ile çalışır ve bir konuşma bu sınırı aştığında en eski token'ları siler. Bu gerçekleştiğinde herhangi bir kayıt tutulmaz; bu nedenle bir aracı (agent) için durum, modelin kendi görevinin başlangıcını unutması gibi görünür.
Pencere boyutunu bilinçli olarak ayarlayın. Tüm sunucu için servisi düzenleyin:
sudo systemctl edit ollamaBunu ekleyin, ardından sudo systemctl restart ollama komutunu çalıştırın:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"İstek bazında ise, options nesnesi içinde num_ctx gönderin:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Her artış bellek maliyeti doğurur, çünkü KV cache izin verdiğiniz token sayısı ile birlikte büyür. Değeri yükseltin, yeniden başlatın, ardından ollama ps komutunu tekrar çalıştırın ve bildirilen boyutun yükselişini izleyin. Bu değişiklikten sonra PROCESSOR sütunu 100% GPU değerinden bölünmüş (split) bir yapıya geçerse, KV cache model katmanlarını VRAM dışına itmiş demektir ve hızınız ciddi oranda düşecektir. Ollama'da num_ctx seçimi bu dengeyi detaylıca ele alır. Model kartı izin veriyor diye 1000000 değerini ayarlamayın; çünkü bellek tahsisi en başta yapılır ve yükleme başarısız olur.
Sürekli çalışan bir aracıya bağlama
Ollama'nın bu model için yayınladığı tanıtım yazısı, desteklenen bir aracıya doğrudan bu modeli işaret ederek başlatan bir kısayolu belgelemektedir:
ollama launch claude --model nemotron-3.5-lightningYazı, bu konumda claude, opencode, openclaw ve hermes seçeneklerini belgelemektedir. Alt komut güncel bir Ollama sürümü gerektirir, bu nedenle önce ollama --version ile sürümü kontrol edin; eğer eksikse aracıya API adresini kendiniz tanımlayın. Ollama, çoğu aracı altyapısının kabul ettiği OpenAI uyumlu bir uç nokta sunar:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama anahtarı görmezden gelir ancak çoğu istemci bir anahtar tanımlanmadan çalışmayı reddeder. Bu sürecin aracı tarafı kodlama aracısını Ollama'ya yönlendirme ve kendi OpenClaw aracınızı oluşturma bölümlerinde ele alınmıştır.
Aracı gözetimsiz çalışmaya başladığında iki sunucu ayarı önem kazanır. OLLAMA_KEEP_ALIVE, bir modelin son istekten sonra bellekte ne kadar süre kalacağını kontrol eder; varsayılan ayar modeli beş dakika sonra bellekten atar, bu da bir sonraki çağrıda tam yükleme süresinin tekrar beklenmesine neden olur. GPU olmayan bir sistemde 25 GB boyutundaki bir dosya için bu bekleme süresi, zaman aşımını tetikleyecek kadar uzundur. Modeli bellekte tutmak için OLLAMA_KEEP_ALIVE=-1 değerini ayarlayın. OLLAMA_HOST=0.0.0.0:11434, API'nin diğer makinelerden erişilebilir olmasını sağlar; herhangi bir kimlik doğrulama mekanizması içermediğinden, bu ayarı yalnızca bir güvenlik duvarı kuralı veya özel bir ağ arkasında etkinleştirin.
Hata modları ve karşılaşacağınız dizgeler
Çekme işlemi (pull) hemen başarısız oluyor. Error: pull model manifest: file does not exist, ilgili etiketin mevcut olmadığı anlamına gelir. Etiket isimleri tam dizgelerdir; bu yüzden tahmin yürüterek bir nicemleme (quantisation) soneki eklemek yerine kütüphane sayfasından kopyalayın.
Model yüklenmiyor. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB), etiketin mevcut yapılandırmadaki plan için çok büyük olduğu anlamına gelir. Daha küçük bir nicemlemeye geçin veya OLLAMA_CONTEXT_LENGTH değerini düşürün; çünkü KV önbelleği bu gereksinimin içinde hesaplanır.
11434 numaralı portta yanıt yok. curl: (7) Failed to connect to localhost port 11434, servisin çalışmadığını veya beklediğiniz yerde dinleme yapmadığını gösterir. systemctl status ollama ve journalctl -u ollama -n 50 bölümlerini okuyun. Eğer ollama serve servisini manuel olarak başlattıysanız, ikinci kopya Error: listen tcp 127.0.0.1:11434: bind: address already in use hatasıyla kapanacaktır.
Yanıt veriyor ancak çok yavaş. Herhangi bir ayarı değiştirmeden önce ollama ps değerini kontrol edin. GPU olan bir makinede PROCESSOR sütununda herhangi bir CPU payı görünmesi, modelin bir kısmının VRAM dışına taştığı anlamına gelir; bu durumda bağlamı (context) düşürün veya daha küçük bir nicemleme kullanın. GPU olmayan bir makinede yavaşlık beklenen bir sonuçtur ve hiçbir ayar bunu düzeltemez.
Ajan, bir görev sırasında talimatlarını unutuyor. Konuşma, bağlam penceresini (context window) aştı ve en eski belirteçler (tokens) sessizce atıldı. OLLAMA_CONTEXT_LENGTH değerini yükseltin, modelin hala sığıp sığmadığını ollama ps ile doğrulayın; eğer artık sığmıyorsa, çözüm daha küçük bir pencere değil, daha büyük bir makinedir.
Bu modelin alternatifler karşısındaki konumu
30B MoE, küçük bir iş için barındırılması oldukça büyük bir modeldir. Eğer 8B yoğun (dense) bir model görevinizi zaten yerine getiriyorsa, çalıştırması çok daha düşük maliyetli olacak ve saniyeler içinde yüklenecektir; VPS üzerinde 8B ve 27B Qwen 3 bu karar için doğrudan bir karşılaştırmadır. Belirli bir planın gerçekte neleri barındırabileceğine dair daha geniş bir inceleme için kendi sunucunuzda barındırabileceğiniz yapay zeka modelleri ile başlayın. Eğer tek bir ajan yerine aynı anda birden fazla ajana hizmet vermeyi planlıyorsanız, önce Ollama ve vLLM karşılaştırması konusunu okuyun; çünkü Ollama, eşzamanlı istekleri bir üretim (production) çıkarım sunucusunun yaptığı şekilde gruplamaz (batching). Tek kullanıcılı bir kurulumun ölçeklenemediği nokta tam olarak burasıdır.
FAQ
Linux VPS üzerinde hangi Nemotron 3.5 Lightning etiketini çekmeliyim?
nemotron-3.5-lightning:30b-a3b-q4_K_M etiketini kullanın. Bu etiket 25 GB boyutundadır, 1M maksimum bağlam kapasitesinin tamamını destekler ve Ağustos 2026 itibarıyla latest, 30b ve 30b-a3b etiketlerinin işaret ettiği aynı özet (digest) değerine sahiptir. latest etiketini çekmek yerine doğrudan bu ismi kullanın; böylece bu işaretçinin gelecekte yeniden yayınlanması durumunda, siz fark etmeden temsilcinizin (agent) davranışının değişmesini engellemiş olursunuz. mlx etiketleri Apple silicon sürümleridir ve Linux üzerinde çalışmazlar.
Nemotron 3.5 Lightning ne kadar RAM gerektirir?
NVIDIA, Ollama sürümleri için minimum bir bellek değeri yayınlamamıştır, bu yüzden tahmin etmek yerine ölçüm yapın. Etiketi çekin, modeli bir kez çalıştırın ve yüklü olduğu sırada ollama ps dosyasını okuyun: bu dosya, bellekte fiilen kaplanan boyutu ve modelin GPU'ya mı yoksa CPU'ya mı yerleştiğini gösterir. Varsayılan etiket için 25 GB olan indirme boyutu bir alt sınırdır; çünkü KV önbelleği (cache) bunun üzerine eklenir ve belirlediğiniz bağlam penceresiyle birlikte büyür. Eğer planınız çok küçükse, Ollama model requires more system memory hatası verir ve her iki değeri de belirtir.
Nemotron 3.5 Lightning'i GPU'su olmayan bir VPS üzerinde çalıştırabilir miyim?
Evet, eğer planınız ağırlıkları tutacak kadar RAM'e sahipse çalıştırabilirsiniz. MoE (Mixture of Experts) tasarımı burada avantaj sağlar çünkü 30 milyar parametrenin her token için yalnızca yaklaşık 3 tanesi hesaplanır. Buradaki sorun hızdır. GPU olmadığında model bellek bant genişliği ile sınırlanır, bu yüzden vCPU eklemek sonuçları neredeyse hiç hızlandırmaz. ollama run --verbose komutunu sabit bir istemle çalıştırın, eval rate satırını okuyun ve bu sayıyı temsilcinizin yanıt süresi beklentisiyle karşılaştırın. Gece boyunca sürecek toplu işler için genellikle yeterlidir. Ancak bir kullanıcının beklediği etkileşimli işler için genellikle uygun değildir.
Ollama neden bana 1M bağlam penceresinin tamamını vermiyor?
1M modelin maksimum kapasitesidir, Ollama'nın varsayılan değeri değildir. Ollama çok daha küçük bir pencere uygular ve bir konuşma bu sınırı aştığında en eski token'ları hata vermeden siler; bu durum temsilcinin kendi talimatlarını unutması gibi algılanır. OLLAMA_CONTEXT_LENGTH ayarını systemd servisi üzerinde yapın veya her istek için num_ctx parametresini geçin. Pencere boyutunu kademeli olarak artırın ve her seferinde ollama ps değerini tekrar kontrol edin; çünkü KV önbellek belleği pencere boyutuyla ölçeklenir ve model katmanlarını GPU'dan dışarı itebilir.
Nemotron 3.5 Lightning ticari kullanım için ücretsiz mi?
NVIDIA'nın model kartı, modeli OpenMDW-1.1 lisansı altına alır ve ticari kullanıma uygun olduğunu belirtir. Bu, indirip kendi başınıza çalıştırdığınız ağırlıkları kapsar. Yığınınızdaki diğer yazılımlar hakkında bir şey belirtmez, bu yüzden temsilci altyapınızın ve bağladığınız diğer araçların lisanslarını ayrı ayrı kontrol edin ve buna dayalı herhangi bir sözleşmesel iş yapmadan önce güncel model kartını okuyun.