SSD Nodes Learn Hosting plans →
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-08-31

VPS-ல் Nemotron 3.5 Lightning இயக்குவது எப்படி

Ollama-வில் NVIDIA Nemotron 3.5 Lightning-ஐ VPS-ல் இயக்குங்கள்: பயன்படுத்த வேண்டிய exact tag, தேவையான RAM அளவு, CPU-only இயக்கம் வேகமாக உள்ளதா என்பதைக் காணலாம்.

Nemotron 3.5 Lightning எதற்காகப் பயன்படுத்தப்படுகிறது

Nemotron 3.5 Lightning என்பது NVIDIA வெளியிட்ட open 30B mixture-of-experts model ஆகும். இது August 2026-ல் வெளியிடப்பட்டது. ஒரே chat window-க்காக அல்லாமல், பல மணி நேரம் தொடர்ந்து இயங்கும் agents-க்காக இது உருவாக்கப்பட்டுள்ளது. MoE (mixture of experts) என்பது weights பல expert sub-networks-ஆகப் பிரிக்கப்பட்டு, ஒவ்வொரு token-உம் அவற்றில் சில sub-networks வழியாக மட்டுமே route செய்யப்படுவதைக் குறிக்கும். NVIDIA-ன் model card-ன் படி, இதில் மொத்தம் 30 billion parameters உள்ளன; ஒவ்வொரு token-க்கும் 3 billion parameters செயல்படும். Memory-யில் அதிக எண்ணிக்கைக்கான செலவை நீங்கள் ஏற்க வேண்டும். அதற்குப் பதிலாக, வேகத்தில் குறைந்த எண்ணிக்கையின் பயனைப் பெறுகிறீர்கள்.

நீங்கள் rent செய்யும் server-ல் இந்த model-ஐ பரிசீலிப்பதற்கான காரணம் இந்த trade-off ஆகும். உண்மையான பணிகளைச் செய்யும் agent, ஒரு நாளில் ஆயிரக்கணக்கான சிறிய requests-ஐ அனுப்பும். எனவே, ஒரு dollar-க்கு கிடைக்கும் throughput, அதை உங்கள் சொந்த box-ல் இயக்க முடியுமா என்பதைத் தீர்மானிக்கும். ஒரு reply உருவாக 40 seconds ஆகும் model, பயன்படுத்தக்கூடிய assistant ஆக இருக்கலாம். ஆனால் அது agent-க்கு பொருத்தமற்றது. காரணம், ஒரு task 20 calls-ஐ உருவாக்கக்கூடும்; அவை ஒவ்வொன்றிற்கும் நீங்கள் காத்திருக்க வேண்டும்.

Architecture hybrid ஆக இருப்பதாக NVIDIA குறிப்பிடுகிறது. இதில் interleaved Mamba-2 மற்றும் MoE layers உடன் select attention layers பயன்படுத்தப்படுகின்றன. Model card-ன் படி, maximum context length 1M tokens வரை உள்ளது. OpenMDW-1.1 license கீழ் இது வழங்கப்படுகிறது; commercial use-க்கு தயாராக இருப்பதாகக் குறிக்கப்பட்டுள்ளது. Primary languages ஆக English மற்றும் code குறிப்பிடப்பட்டுள்ளன. Spanish, French, German, Italian மற்றும் Japanese ஆகியவையும் பட்டியலிடப்பட்டுள்ளன.

August 2026-ல் Artificial Analysis வெளியிட்ட launch measurements, NVFP4 weights-ஐ வழங்கிய pre-release DeepInfra endpoint-ல், output வேகம் nearly 670 tokens per second எனக் காட்டின. அது hosted GPU endpoint-ல் பெறப்பட்ட அளவீடு. இதை architecture வழங்கக்கூடிய திறனாகப் புரிந்துகொள்ள வேண்டும்; உங்கள் VPS வழங்கும் செயல்திறனாக அல்ல.

எந்த Ollama tag எந்த VPS-க்கு பொருந்தும்

Ollama library ஒரே weights-க்கான பல builds-ஐ வெளியிடுகிறது. இவற்றுக்கிடையிலான முக்கிய வேறுபாடு quantisation ஆகும். அதாவது ஒவ்வொரு weight-உம் எத்தனை bits-ல் சேமிக்கப்படுகிறது என்பதே இது. இதனால் download size பெரிதும் மாறுகிறது.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

latest, 30b மற்றும் 30b-a3b என்ற பெயர்களைக் கொண்ட tags அனைத்தும் 30b-a3b-q4_K_M-க்கு சமமான digest-ஐச் சுட்டுகின்றன. எனவே default download என்பது 25 GB அளவுடைய four-bit build ஆகும்; இதில் முழு 1M context உள்ளது. Q8_0 build 35 GB, bf16 build 66 GB. இவ்விரண்டிலும் 1M context உள்ளது. 23 GB அளவுடைய MLX builds Apple silicon-க்காக உருவாக்கப்பட்டவை. இவை 256K context வரை மட்டுமே ஆதரிக்கும். எனவே Linux VPS-ல் இவை சரியான தேர்வு அல்ல.

இவை download sizes; memory requirement அல்ல. Ollama builds-க்கு NVIDIA குறைந்தபட்ச VRAM (video RAM) அளவை வெளியிடவில்லை. எனவே download size-ஐ குறைந்தபட்ச அடிப்படை அளவாக மட்டுமே கருதவும். இதற்கு மேல் எந்த உறுதியான முடிவையும் அதிலிருந்து எடுக்கக்கூடாது. Weights ஏதேனும் ஒரு memory-ல் resident ஆக இருக்க வேண்டும். GPU card அவற்றைத் தாங்கினால் GPU memory-ல் இருக்கும்; இல்லையெனில் system RAM-ல் இருக்கும். இதற்கு மேலாக KV cache (key/value cache, model உரையாடலின் ஒவ்வொரு token-க்காக வைத்திருக்கும் memory) சேர்க்கப்படும். உங்கள் hardware-க்கான உண்மையான அளவு arithmetic மூலம் அல்ல, ஒரு command மூலம் கிடைக்கும். அந்த command கீழே உள்ளது. இன்னும் quantisation level-ஐத் தேர்வு செய்யவில்லை என்றால், Q4, Q8 மற்றும் FP16 ஒவ்வொன்றிலும் நீங்கள் செலுத்தும் memory மற்றும் quality விலை என்ற பகுதி ஒவ்வொரு நிலைமாற்றத்திலும் எதை விட்டுக்கொடுக்க வேண்டும் என்பதை விளக்குகிறது.

exact tag-ஐ மட்டும் pull செய்யுங்கள்; latest-ஐ ஒருபோதும் பயன்படுத்த வேண்டாம்

latest என்பது தொடர்ந்து மாறக்கூடிய pointer ஆகும். Library அதை மீண்டும் publish செய்தால், உங்கள் notes-ல் காரணத்தை விளக்கும் பதிவு எதுவும் இல்லாமலேயே அடுத்த pull-இல் agent-ன் நடத்தை மாறிவிடும். Tag-ஐ தெளிவாகக் குறிப்பிடுங்கள்.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Install script, ollama user ஆக இயங்கும் systemd service-ஐ அமைத்து, models-ஐ /usr/share/ollama/.ollama/models கீழ் வைத்திருக்கும். பெரும்பாலான VPS images-ல் அந்த path root filesystem-ல் இருக்கும். எனவே 25 GB கேட்பதற்கு முன் போதிய இடம் உள்ளதா என்பதைச் சரிபார்க்கவும். அந்த filesystem-ல் இடம் குறைவாக இருந்தால், pull செய்வதற்கு முன்பே Ollama models-ஐ எங்கு சேமிக்கிறது, அவற்றை எவ்வாறு நகர்த்துவது என்பதைப் படிப்பது நல்லது; disk நிரம்பிய பிறகு படிப்பதைவிட இது பயனுள்ளதாக இருக்கும்.

df -h /usr/share/ollama

Pull பாதியிலேயே நின்று no space left on device எனக் காட்டினால், அதன் பொருள் அதுவே. Partial blobs-ஐ நீங்கள் delete செய்யும் வரை அவை disk-ல் இருக்கும். அதன் பிறகு எது சேமிக்கப்பட்டது என்பதை உறுதிப்படுத்துங்கள்:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show file-ல் உண்மையில் உள்ள architecture, parameter count, context length மற்றும் quantisation ஆகியவற்றை அச்சிடும். இவற்றில் ஏதேனும் library page-ல் உள்ள தகவலுடன் பொருந்தவில்லை என்றால், நீங்கள் நினைத்த tag-க்கு பதிலாக வேறு tag-ஐ pull செய்துள்ளீர்கள்.

அதை இயக்கி, அது உண்மையில் எங்கு இயங்கியது என்பதைச் சரிபார்க்கவும்

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Model இன்னும் loaded நிலையில் இருக்கும்போது, மற்றொரு shell-ல்:

ollama ps

இந்த command உங்கள் machine-க்கான memory தொடர்பான கேள்விக்கு பதிலளிக்கும். ollama ps loaded model, அது memory-ல் பயன்படுத்தும் அளவு, மற்றும் PROCESSOR column-ஐ காட்டும். 100% GPU என்றால் model முழுவதும் VRAM-ல் உள்ளது. 100% CPU என்றால் model-ன் எந்தப் பகுதியும் VRAM-ல் இல்லை; ஒவ்வொரு token-உம் system RAM-இலிருந்து processor மூலம் கணக்கிடப்படுகிறது. 65%/35% CPU/GPU போன்ற split என்றால், அனைத்து layers-உம் memory-ல் பொருந்தவில்லை என்று பொருள்; CPU share உங்கள் speed-ஐ நிர்ணயிக்கும். Requirement-ஐ ஊகிக்க வேண்டாம். அதை load செய்து, இந்த line-ஐப் படிக்கவும்.

அது முழுமையாக load ஆக முடியாவிட்டால், crash ஆகாமல் Ollama முறையாக மறுக்கும்:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

CPU மட்டும் உள்ள VPS போதுமான வேகத்தில் உள்ளதா?

பொதுப் பயன்பாட்டுக்கான VPS-ல் GPU இருக்காது. எனவே அனைத்து பணிகளையும் CPU செய்யும்; தேவையான ஒவ்வொரு weight-ஐயும் system RAM-லிருந்து படிக்கும். இங்கு MoE உதவுகிறது. காரணம், 30 billion parameters-ல் சுமார் 3 billion parameters மட்டுமே ஒவ்வொரு token-க்கும் பயன்படுத்தப்படுகின்றன. ஆகவே ஒவ்வொரு token-க்கும் தேவையான கணக்கீடு, dense 30B model-ஐவிட மிகவும் குறைவு. ஆனால் memory தேவையில் எந்தக் குறைவும் ஏற்படாது. 30 billion parameters அனைத்தும் memory-யில் resident நிலையில் இருக்க வேண்டும். காரணம், எந்த token-க்கும் router எந்த expert-ஐ வேண்டுமானாலும் தேர்ந்தெடுக்கலாம்.

எனவே இந்த model-ன் CPU-only inference, core count-ஐவிட memory bandwidth-ஆல் கட்டுப்படுத்தப்படுகிறது. ஏற்கனவே போதுமான vCPUs உள்ள plan-க்கு மேலும் vCPUs சேர்ப்பதால் வேகம் பெரிதாக மாறாது. Weights மற்றும் உங்கள் KV cache-ஐ வைத்திருக்கப் போதுமான RAM தேவை. அந்த plan வழங்கும் மிக வேகமான memory-யும் தேவை.

ஒரு agent-ஐ இதற்கு ஒதுக்கும் முன், local LLM-க்கான tokens per second-ஐ அளவிடுதல் என்ற முறையைப் பயன்படுத்தி வேகத்தை அளவிடவும்:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

இறுதியில் அச்சிடப்படும் eval rate line, ஒரு second-க்கு உருவாக்கப்படும் tokens-ன் வேகத்தைக் காட்டும். இந்த ஒரு எண்ணே கேள்விக்கான முடிவை நிர்ணயிக்கிறது. காரணம், agent-ன் wall-clock time பெரும்பாலும் இதனால் தீர்மானிக்கப்படுகிறது. நீங்கள் எதிர்பார்க்கும் reply-யின் நீளத்தால் இதைப் பெருக்கவும். காத்திருக்க விரும்பும் நேரத்தைவிட முடிவு அதிகமாக இருந்தால், num_predict மூலம் output-ஐ வரையறுத்தல் என்பது hardware-ஐ மாற்றாமல் ஒரு call-ன் அதிகபட்ச அளவை கட்டுப்படுத்தும் ஒரே நேரடி வழியாகும்.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

இவை வெளியிடப்பட்ட third-party அளவீடுகள். Launch நேரத்தில் Artificial Analysis தெரிவித்த per-task minutes-லிருந்து இவை மாற்றப்பட்டவை. மேலும், இவை VPS-ல் அல்லாமல் hosted GPU endpoints-ல் அளவிடப்பட்டவை. Nemotron 3.5 Lightning ஒவ்வொரு task-க்கும் சராசரியாக 30 seconds எடுத்தது. இதில் gpt-oss-120b சுமார் 204 எடுத்தது; Qwen3.6 35B சுமார் 210 எடுத்தது. இவற்றை உங்கள் hardware-க்கான உறுதிமொழியாக அல்லாமல், வேக வித்தியாசத்தின் அளவைப் புரிந்துகொள்ள மட்டும் பயன்படுத்தவும்.

யார் காத்திருக்கிறார்கள் என்பதன் அடிப்படையில் நடைமுறை ஆலோசனை மாறும். ஒருவர் agent-ன் முடிவுக்காகக் காத்திருந்தால், அல்லது agent தொடர்ச்சியாக நீண்ட call chains-ஐ இயக்கினால், GPU capacity-ஐ rent செய்யவும். அது இரவு நேரத்தில் schedule அடிப்படையில் இயங்கி, யாரும் கண்காணிக்கவில்லை என்றால், அதிக RAM கொண்ட CPU plan நியாயமான தேர்வாகும். இரு சூழல்களிலும் setup ஒன்றே. VPS-ல் Ollama-ஐ இயக்குதல் என்ற பகுதி plan sizing மற்றும் GPU instance-ஐப் பயன்படுத்துவதற்கும் API provider-க்கு token ஒன்றுக்கு பணம் செலுத்துவதற்கும் இடையிலான ஒப்பீட்டை விளக்குகிறது. Break-even என்பது utilisation பற்றிய கேள்வி. GPU instance இயங்கும் ஒவ்வொரு மணிநேரத்திற்கும் கட்டணம் வசூலிக்கும். API tokens பயன்படுத்தும் நேரத்தில் மட்டும் கட்டணம் வசூலிக்கும். எனவே agent நாள் முழுவதும் பெரும்பாலான நேரம் busy-ஆக இருந்தால், நீங்கள் own செய்யும் server சாதகமாக இருக்கும். அது ஒரு மணிநேரத்திற்கு இரண்டு முறை மட்டுமே இயங்கினால், பொதுவாக அது சாதகமாக இருக்காது.

1M context window இலவசம் அல்ல

1M tokens என்பது model-ன் அதிகபட்ச அளவு. Ollama அதை இயல்பாக உங்களுக்கு வழங்காது. Ollama மிகவும் சிறிய default window-ஐ பயன்படுத்துகிறது. ஒரு conversation அதன் வரம்பை மீறும்போது, பழைய tokens-ஐ நீக்குகிறது. இது நடக்கும் போது எந்த log-மும் எழுதப்படாது. எனவே, model தனது task-ன் தொடக்கத்தை மறந்துவிட்டது போல agent-க்கு தோன்றும்.

Window அளவை திட்டமிட்டு அமைக்கவும். முழு server-க்கும் இதை அமைக்க, service-ஐ edit செய்யவும்:

sudo systemctl edit ollama

இந்த setting-ஐ சேர்த்த பிறகு, sudo systemctl restart ollama-ஐ இயக்கவும்:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

ஒவ்வொரு request-க்கும், அதற்கு பதிலாக options object-ல் num_ctx-ஐ அனுப்பவும்:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

நீங்கள் அனுமதிக்கும் tokens எண்ணிக்கை அதிகரிக்கும்போது KV cache பெரிதாகும். எனவே ஒவ்வொரு அதிகரிப்பும் memory-ஐ அதிகமாக பயன்படுத்தும். Value-ஐ உயர்த்தி, restart செய்து, பின்னர் ollama ps-ஐ மீண்டும் இயக்கவும். Report செய்யப்படும் அளவு அதிகரிப்பதை monitor செய்யவும். அந்த மாற்றத்திற்குப் பிறகு PROCESSOR column, 100% GPU-இலிருந்து split நிலைக்கு மாறினால், KV cache model layers-ஐ VRAM-க்கு வெளியே தள்ளியுள்ளது. இதனால் speed குறிப்பிடத்தக்க அளவில் குறையும். Ollama-ல் num_ctx தேர்வு செய்தல் இந்த trade-off-ஐ விரிவாக விளக்குகிறது. Model card இதை அனுமதிக்கிறது என்பதற்காக மட்டும் 1000000-ஐ அமைக்க வேண்டாம். Allocation முன்கூட்டியே நடைபெறும். எனவே load முழுமையாக fail ஆகிவிடும்.

எப்போதும் இயங்கும் agent-உடன் இணைத்தல்

இந்த model-க்கு ஏற்கனவே சுட்டிக்காட்டப்பட்ட supported agent-ஐ தொடங்கும் shortcut-ஐ Ollama-வின் launch post ஆவணப்படுத்துகிறது:

ollama launch claude --model nemotron-3.5-lightning

அந்த இடத்தில் claude, opencode, openclaw மற்றும் hermes ஆகியவற்றை அந்த post ஆவணப்படுத்துகிறது. இந்த subcommand-க்கு சமீபத்திய Ollama தேவை. எனவே முதலில் ollama --version-ஐச் சரிபார்க்கவும். அது இல்லையெனில், agent-ஐ API-க்கு நீங்களே சுட்டிக்காட்டவும். Ollama, OpenAI-compatible endpoint-ஐ வழங்குகிறது. பெரும்பாலான agent harnesses இதை ஏற்றுக்கொள்கின்றன:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama இந்த key-ஐப் புறக்கணிக்கும். ஆனால் பெரும்பாலான clients, key அமைக்கப்படாமல் தொடங்காது. இதற்கான harness பகுதி coding agent-ஐ Ollama-க்கு சுட்டிக்காட்டுதல் மற்றும் உங்கள் சொந்த OpenClaw agent-ஐ உருவாக்குதல் ஆகிய பகுதிகளில் விளக்கப்பட்டுள்ளது.

Agent unattended நிலையில் இயங்கும்போது, இரண்டு server settings முக்கியமானவை. OLLAMA_KEEP_ALIVE, கடைசி request-க்கு பிறகு model memory-ல் எவ்வளவு நேரம் இருக்க வேண்டும் என்பதைக் கட்டுப்படுத்துகிறது. Default அமைப்பு அதை ஐந்து நிமிடங்களுக்குப் பிறகு memory-யிலிருந்து unload செய்கிறது. எனவே அடுத்த call-ல் முழு load time மீண்டும் ஏற்படும். 25 GB file-ஐ GPU இல்லாமல் பயன்படுத்தும்போது, அந்த இடைநிறுத்தம் timeout ஏற்படுவதற்குப் போதுமான அளவு நீளமாக இருக்கும். Model memory-ல் தொடர்ந்து இருக்க OLLAMA_KEEP_ALIVE=-1-ஐ அமைக்கவும். OLLAMA_HOST=0.0.0.0:11434, மற்ற machines-லிருந்தும் API-ஐ அணுகக்கூடியதாக மாற்றுகிறது. இதற்கு எந்த authentication-மும் இல்லை. எனவே firewall rule அல்லது private network-ன் பின்னால் மட்டுமே இதைத் திறக்கவும்.

நீங்கள் காணும் strings உடன் தோல்வி நிலைகள்

Pull உடனடியாக தோல்வியடைகிறது. Error: pull model manifest: file does not exist என்றால் அந்த tag இல்லை என்று பொருள். Tag names துல்லியமான strings ஆகும். எனவே quantisation suffix-ஐ ஊகிக்காமல், library page-இலிருந்து ஒன்றை copy செய்யவும்.

Model load ஆகவில்லை. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) என்றால், தற்போதைய plan configuration-க்கு அந்த tag மிகவும் பெரியது என்று பொருள். சிறிய quantisation-க்கு மாறவும் அல்லது OLLAMA_CONTEXT_LENGTH-ஐக் குறைக்கவும். KV cache-ம் அந்தத் தேவையில் கணக்கிடப்படுகிறது.

11434 port-ல் எந்தப் பதிலும் இல்லை. curl: (7) Failed to connect to localhost port 11434 என்றால் service இயங்கவில்லை அல்லது நீங்கள் எதிர்பார்க்கும் இடத்தில் listening செய்யவில்லை என்று பொருள். systemctl status ollama மற்றும் journalctl -u ollama -n 50-ஐப் பார்க்கவும். ollama serve-ஐ கைமுறையாகத் தொடங்கியிருந்தால், இரண்டாவது copy Error: listen tcp 127.0.0.1:11434: bind: address already in use உடன் வெளியேறும்.

பதில் வருகிறது, ஆனால் மிகவும் மெதுவாக உள்ளது. வேறு எதையும் மாற்றுவதற்கு முன் ollama ps-ஐச் சரிபார்க்கவும். GPU machine-ல் PROCESSOR column-ல் ஏதேனும் CPU share இருந்தால், model-ன் ஒரு பகுதி VRAM-க்கு வெளியே பயன்படுத்தப்படுகிறது என்று பொருள். எனவே context-ஐக் குறைக்கவும் அல்லது சிறிய quantisation-ஐத் தேர்ந்தெடுக்கவும். GPU இல்லாத machine-ல் மெதுவாக இருப்பது எதிர்பார்க்கப்படும் விளைவு. எந்த setting-ம் அதைச் சரிசெய்யாது.

Task-ன் நடுவில் agent தனது instructions-ஐ மறந்துவிடுகிறது. Conversation context window-ஐத் தாண்டியதால், பழைய tokens அமைதியாக நீக்கப்பட்டுள்ளன. OLLAMA_CONTEXT_LENGTH-ஐ அதிகரிக்கவும். Model இன்னும் பொருந்துகிறதா என்பதை ollama ps மூலம் உறுதிப்படுத்தவும். இனி பொருந்தவில்லை என்றால், தீர்வு சிறிய window அல்ல; பெரிய machine தேவை.

இந்த model, பிற விருப்பங்களுடன் ஒப்பிடும்போது

சிறிய பணிக்காக 30B MoE model-ஐ host செய்வது அதிக வளங்களைத் தேவைப்படுத்தும். Dense 8B model ஏற்கனவே உங்கள் பணியைச் செய்யக்கூடியதாக இருந்தால், அதை இயக்குவதற்கான செலவு மிகவும் குறைவாக இருக்கும்; மேலும் அது சில seconds-களிலேயே load ஆகும். அந்தத் தேர்வுக்கான நேரடி ஒப்பீட்டைப் பார்க்க VPS-ல் 8B மற்றும் 27B Qwen 3 படிக்கவும். குறிப்பிட்ட plan உண்மையில் எந்த அளவிலான models-ஐ இயக்க முடியும் என்பதை விரிவாக மதிப்பிட, முதலில் self-host செய்யக்கூடிய AI models எவை என்பதைப் பார்க்கவும். ஒரே agent-க்கு பதிலாக ஒரே நேரத்தில் பல agents-ஐ serve செய்யத் திட்டமிட்டால், முதலில் vLLM உடன் ஒப்பிடும்போது Ollama படிக்கவும். Production inference server செய்வது போல Ollama concurrent requests-ஐ batch செய்யாது. இதனால் single-user setup-ன் scaling வரம்பு விரைவாக வெளிப்படும்.

FAQ

Linux VPS-ல் எந்த Nemotron 3.5 Lightning tag-ஐ pull செய்ய வேண்டும்?

nemotron-3.5-lightning:30b-a3b-q4_K_M-ஐ பயன்படுத்தவும். இதன் அளவு 25 GB. இது முழுமையான 1M maximum context-ஐ கொண்டுள்ளது. August 2026 நிலவரப்படி, latest, 30b மற்றும் 30b-a3b tags சுட்டும் அதே digest-ஐ இது கொண்டுள்ளது. latest-ஐ pull செய்வதற்குப் பதிலாக இதன் பெயரை வெளிப்படையாகக் குறிப்பிடவும். இல்லையெனில், எதிர்காலத்தில் அந்த pointer மீண்டும் publish செய்யப்பட்டால், நீங்கள் கவனிக்காமல் உங்கள் agent-ன் செயல்பாடு மாறக்கூடும். mlx tags Apple silicon builds ஆகும். அவை Linux-ல் உங்களுக்கு உதவாது.

Nemotron 3.5 Lightning-க்கு எவ்வளவு RAM தேவை?

Ollama builds-க்கு NVIDIA குறைந்தபட்ச memory அளவை வெளியிடவில்லை. எனவே, மதிப்பிடுவதற்குப் பதிலாக அளவிடவும். tag-ஐ pull செய்து, model-ஐ ஒருமுறை இயக்கவும். அது loaded நிலையில் இருக்கும் போது ollama ps-ஐப் படிக்கவும். அது உண்மையில் பயன்படுத்தப்படும் அளவையும், model GPU-ல் உள்ளதா அல்லது CPU-ல் உள்ளதா என்பதையும் காட்டும். Default tag-க்கான download size 25 GB என்றாலும், அது குறைந்தபட்ச அளவு மட்டுமே. KV cache அதற்கு மேலாக சேர்க்கப்படும். நீங்கள் அமைக்கும் context window-க்கு ஏற்ப அது பெரிதாகும். Plan போதுமானதாக இல்லாவிட்டால், Ollama model requires more system memory மூலம் மறுத்து, இரண்டு அளவுகளையும் குறிப்பிடும்.

GPU இல்லாத VPS-ல் Nemotron 3.5 Lightning-ஐ இயக்க முடியுமா?

முடியும். Weights-ஐ வைத்திருக்க போதுமான RAM plan-ல் இருந்தால் இது சாத்தியம். MoE design-ம் உதவுகிறது. ஏனெனில் ஒவ்வொரு token-க்கும் 30 billion parameters-ல் சுமார் 3 மட்டுமே கணக்கிடப்படுகின்றன. சிக்கல் வேகம். GPU இல்லாதபோது model memory bandwidth-ஆல் கட்டுப்படுத்தப்படும். எனவே vCPU-களை அதிகரித்தாலும் முடிவில் சிறிய மாற்றமே ஏற்படும். நிலையான prompt-ஐப் பயன்படுத்தி ollama run --verbose-ஐ இயக்கவும். eval rate line-ஐப் படித்து, அந்த எண்ணை உங்கள் agent-ன் deadline-உடன் ஒப்பிடவும். Overnight batch job-க்கு இது பெரும்பாலும் போதுமானது. ஒருவர் காத்திருக்கும் எந்தச் செயலுக்கும் இது பொதுவாக போதாது.

Ollama முழுமையான 1M context window-ஐ ஏன் வழங்கவில்லை?

1M என்பது model-ன் maximum அளவு; அது Ollama-ன் default அல்ல. Ollama மிகவும் சிறிய window-ஐப் பயன்படுத்தும். Conversation அந்த அளவைத் தாண்டியதும், error எதையும் காட்டாமல் பழைய tokens-ஐ நீக்கும். இதனால் agent தனது சொந்த instructions-ஐ மறந்துவிட்டது போல் தோன்றும். systemd service-ல் OLLAMA_CONTEXT_LENGTH-ஐ அமைக்கவும். அல்லது ஒவ்வொரு request-க்கும் num_ctx-ஐ அனுப்பவும். இதை படிப்படியாக உயர்த்தி, ஒவ்வொரு முறையும் ollama ps-ஐ மீண்டும் சரிபார்க்கவும். ஏனெனில் window பெரிதாகும்போது KV cache memory-யும் அதிகரிக்கும். இதனால் model layers GPU-லிருந்து வெளியேறக்கூடும்.

Nemotron 3.5 Lightning-ஐ வணிகப் பயன்பாட்டுக்கு இலவசமாகப் பயன்படுத்த முடியுமா?

NVIDIA-ன் model card, இந்த model-ஐ OpenMDW-1.1 license-ன் கீழ் வழங்குகிறது. மேலும், இது commercial use-க்கு தயாராக இருப்பதாகக் குறிப்பிடுகிறது. நீங்கள் download செய்து இயக்கும் weights-க்கு இது பொருந்தும். ஆனால் உங்கள் stack-ல் உள்ள பிற software-களைப் பற்றி இது எதுவும் கூறாது. எனவே agent harness மற்றும் அதனுடன் இணைக்கும் tools ஆகியவற்றின் licences-ஐ தனித்தனியாகச் சரிபார்க்கவும். ஒப்பந்தம் சார்ந்த பயன்பாட்டுக்கு இதை நம்புவதற்கு முன், தற்போதைய model card-ஐப் படிக்கவும்.