VPS-ல் Nemotron 3.5 Lightning-ஐ இயக்குவது எப்படி?
Ollama மூலம் Nemotron 3.5 Lightning-ஐ உங்கள் VPS-ல் இயக்குவதற்கான வழிமுறைகள். தேவையான RAM அளவு, சரியான tag, மற்றும் CPU-only முறையில் இதன் வேகம் எப்படி இருக்கும் என்பதை அறியுங்கள்.
Nemotron 3.5 Lightning-ன் பயன்பாடு
Nemotron 3.5 Lightning என்பது NVIDIA-வின் 30B mixture-of-experts (MoE) திறந்தநிலை மாதிரியாகும். இது ஆகஸ்ட் 2026-ல் வெளியிடப்பட்டது. ஒருமுறை மட்டும் உரையாடும் window-களுக்காக அல்லாமல், பல மணிநேரம் இயங்கும் ஏஜெண்டுகளுக்காக இது உருவாக்கப்பட்டுள்ளது. MoE என்பது மாதிரியின் எடைகள் (weights) பல நிபுணர் துணை-நெட்வொர்க்குகளாகப் பிரிக்கப்பட்டிருப்பதைக் குறிக்கிறது. ஒவ்வொரு token-ம் அவற்றில் சிலவற்றின் வழியாக மட்டுமே செல்லும். NVIDIA-வின் model card-ன் படி, இதில் மொத்தம் 30 பில்லியன் அளவுருக்கள் (parameters) உள்ளன, ஆனால் ஒரு token-க்கு 3 பில்லியன் மட்டுமே செயல்படுகின்றன. நீங்கள் நினைவகத்தில் (memory) அதிக எண்ணிக்கையிலான அளவுருக்களுக்குச் செலவிடுகிறீர்கள், ஆனால் வேகத்தில் குறைந்த எண்ணிக்கையிலான செயல்திறனைப் பெறுகிறீர்கள்.
நீங்கள் வாடகைக்கு எடுக்கும் server-ல் இந்த மாதிரியைப் பயன்படுத்துவதற்கு இந்தச் சமநிலையே முக்கியக் காரணம். உண்மையான வேலைகளைச் செய்யும் ஒரு ஏஜெண்ட், நாள் முழுவதும் ஆயிரக்கணக்கான சிறிய கோரிக்கைகளை அனுப்பும். எனவே, உங்கள் சொந்த server-ல் அதை இயக்க முடியுமா என்பது, ஒரு டாலருக்கு எவ்வளவு throughput கிடைக்கிறது என்பதைப் பொறுத்தே அமையும். ஒரு பதிலுக்கு 40 வினாடிகள் எடுக்கும் மாதிரி, ஒரு உதவியாளராகச் செயல்படலாம், ஆனால் ஏஜெண்டாகச் செயல்பட முடியாது. ஏனெனில், ஒரு பணியைச் செய்ய இருபது அழைப்புகள் தேவைப்படும்போது, ஒவ்வொன்றிற்கும் நீங்கள் காத்திருக்க வேண்டியிருக்கும்.
NVIDIA இந்த கட்டமைப்பை ஒரு கலப்பின (hybrid) முறையாக விவரிக்கிறது: Mamba-2 மற்றும் MoE அடுக்குகள், தேர்ந்தெடுக்கப்பட்ட attention அடுக்குகளுடன் ஒன்றிணைக்கப்பட்டுள்ளன. Model card-ன் படி, அதிகபட்ச context length 1M tokens வரை இருக்கும். இது OpenMDW-1.1 உரிமத்தின் கீழ் வணிக ரீதியான பயன்பாட்டிற்குத் தயாராக உள்ளது. ஆங்கிலம் மற்றும் நிரலாக்க மொழிகள் (code) முதன்மை மொழிகளாக உள்ளன; ஸ்பானிஷ், பிரஞ்சு, ஜெர்மன், இத்தாலியன் மற்றும் ஜப்பானிய மொழிகளும் இதில் அடங்கும்.
Artificial Analysis ஆகஸ்ட் 2026-ல் வெளியிட்ட அளவீடுகளின்படி, NVFP4 weights-ஐப் பயன்படுத்தும் DeepInfra endpoint-ல் வினாடிக்கு சுமார் 670 output tokens கிடைத்தன. இது ஒரு hosted GPU endpoint ஆகும். இதை உங்கள் VPS-ல் கிடைக்கும் வேகமாகக் கருதாமல், இந்த கட்டமைப்பு அனுமதிக்கக்கூடிய அதிகபட்ச வேகமாகக் கருத வேண்டும்.
எந்த Ollama tag எந்த VPS-க்கு பொருத்தமானது
Ollama library ஒரே மாதிரியான weights-க்கு பல builds-களை வெளியிடுகிறது. அவற்றுக்கிடையேயான மாற்றம் quantisation ஆகும்; அதாவது ஒவ்வொரு weight-ம் எத்தனை bits-ல் சேமிக்கப்படுகிறது என்பதுதான் அது. இது download அளவை பெருமளவு மாற்றுகிறது.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]latest, 30b மற்றும் 30b-a3b என பெயரிடப்பட்ட tags அனைத்தும் 30b-a3b-q4_K_M என்பதன் அதே digest-க்கு இணையாகின்றன. எனவே, இயல்பான download என்பது 1M context கொண்ட 25 GB அளவுள்ள four-bit build ஆகும். Q8_0 என்பது 35 GB மற்றும் bf16 என்பது 66 GB ஆகும்; இவை இரண்டுமே 1M context-ல் உள்ளன. 23 GB அளவுள்ள MLX builds Apple silicon-க்காக உருவாக்கப்பட்டவை மற்றும் அவை 256K context-ல் மட்டுமே இயங்கும், எனவே Linux VPS-க்கு இவை தவறான தேர்வாகும்.
இவை download அளவுகள் மட்டுமே, memory தேவை அல்ல. Ollama builds-க்கு NVIDIA குறைந்தபட்ச VRAM (video RAM) அளவை வெளியிடுவதில்லை, எனவே download அளவை ஒரு அடிப்படை அளவீடாக மட்டுமே கருதவும். Weights ஏதேனும் ஓரிடத்தில் இருக்க வேண்டும்; GPU-வில் இடமிருந்தால் அங்கும், இல்லையெனில் system RAM-லும் இருக்க வேண்டும். இதனுடன் KV cache (key/value cache, அதாவது உரையாடலின் ஒவ்வொரு token-க்கும் model பயன்படுத்தும் memory) கூடுதலாகச் சேரும். உங்கள் hardware-க்கான சரியான அளவு கணக்கீட்டின் மூலம் அல்லாமல், கீழே உள்ள கட்டளையின் மூலம் கிடைக்கும். நீங்கள் இன்னும் quantisation அளவைத் தீர்மானிக்கவில்லை என்றால், Q4, Q8 மற்றும் FP16 ஆகியவற்றின் செலவு என்ன என்ற பகுதி ஒவ்வொரு நிலையிலும் நீங்கள் எதை இழக்கிறீர்கள் என்பதை விளக்குகிறது.
சரியான tag-ஐ மட்டும் பயன்படுத்தவும், latest-ஐ தவிர்க்கவும்
latest என்பது மாறிக்கொண்டே இருக்கும் ஒரு pointer ஆகும். அந்த library-ஐ மீண்டும் வெளியிடும்போது, உங்கள் agent-ன் செயல்பாடு அடுத்த pull-ன் போது தானாகவே மாறும். இதற்கான காரணம் உங்கள் குறிப்புகளில் இருக்காது. எனவே, tag-ன் பெயரை நேரடியாகக் குறிப்பிடவும்.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_Mஇந்த install script, ollama user-ஆக இயங்கும் ஒரு systemd service-ஐ உருவாக்குகிறது. இது model-களை /usr/share/ollama/.ollama/models பாதையில் சேமிக்கிறது. பெரும்பாலான VPS images-ல் இந்த பாதை root filesystem-ல் இருப்பதால், 25 GB இடத்தைக் கோருவதற்கு முன்பு போதிய அளவு disk space உள்ளதா எனச் சரிபார்க்கவும்.
df -h /usr/share/ollamaஒரு pull பாதியிலேயே நின்று no space left on device என்று காட்டினால், அது அந்தப் பிழையைத்தான் குறிக்கிறது. நீங்கள் அவற்றை நீக்கும் வரை, அந்தப் பகுதியளவு blobs disk-ல் அப்படியே இருக்கும். அதன் பிறகு, எவை பதிவிறக்கம் செய்யப்பட்டுள்ளன என்பதை உறுதிப்படுத்தவும்:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show கட்டளையானது architecture, parameter count, context length மற்றும் அந்த file-ல் உள்ள quantisation ஆகியவற்றைத் திரையில் காட்டும். இதில் ஏதேனும் ஒன்று library பக்கத்தில் உள்ள விவரங்களுடன் பொருந்தவில்லை என்றால், நீங்கள் எதிர்பார்த்த tag-க்கு பதிலாக வேறொன்றைப் பதிவிறக்கம் செய்துள்ளீர்கள் என்று அர்த்தம்.
சேவையைத் தொடங்கி, அது எங்கு இயங்குகிறது என்பதைச் சரிபார்த்தல்
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"மாதிரி (model) ஏற்றப்பட்டிருக்கும்போது, மற்றொரு shell-ஐத் திறக்கவும்:
ollama psஉங்கள் கணினியின் நினைவகத் தேவையைத் தீர்மானிக்கும் கட்டளை இதுவாகும். ollama ps, ஏற்றப்பட்ட மாதிரியையும், அது எடுத்துக்கொள்ளும் நினைவக அளவையும், ஒரு PROCESSOR நிரலையும் காட்டும். 100% GPU என்பது, மாதிரி முழுமையாக VRAM-ல் உள்ளது என்று பொருள். 100% CPU என்பது, மாதிரி VRAM-ல் இல்லை என்றும், ஒவ்வொரு token-ம் system RAM-ஐப் பயன்படுத்தி processor-ஆல் கணக்கிடப்படுகிறது என்றும் பொருள். 65%/35% CPU/GPU போன்ற பிரிவினை இருந்தால், அனைத்து அடுக்குகளும் (layers) பொருந்தவில்லை என்று பொருள்; CPU-வின் பங்களிப்பே உங்கள் வேகத்தைத் தீர்மானிக்கும். தேவையை ஊகிக்க வேண்டாம். மாதிரியை ஏற்றிவிட்டு, இந்த வரியைப் படித்துப் பார்க்கவும்.
மாதிரியை ஏற்ற முடியாவிட்டால், Ollama செயலிழக்காமல் (crash) முறையாக மறுத்துவிடும்:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)CPU-மட்டும் கொண்ட VPS போதுமான வேகத்தில் இருக்குமா?
பொதுவான பயன்பாட்டிற்கான VPS-ல் GPU இருக்காது. எனவே, CPU அனைத்து வேலைகளையும் செய்து, தனக்குத் தேவையான ஒவ்வொரு weight-ஐயும் system RAM-லிருந்து படிக்க வேண்டும். இதில் MoE (Mixture of Experts) உதவுகிறது; ஏனெனில் 30 billion parameters கொண்ட மாதிரியில், ஒரு token-க்கு சுமார் 3 billion parameters மட்டுமே கையாளப்படுகின்றன. இதனால், dense 30B மாதிரியை விட ஒரு token-க்கான கணக்கீட்டுச் சுமை மிகக் குறைவு. ஆனால், memory பயன்பாட்டில் எந்த மாற்றமும் இல்லை. அனைத்து 30 billion parameters-ம் RAM-ல் இருக்க வேண்டும், ஏனெனில் router எந்த token-க்கும் எந்த expert-ஐ வேண்டுமானாலும் தேர்ந்தெடுக்கலாம்.
எனவே, இந்த மாதிரியில் CPU-மட்டும் கொண்ட inference, core-களின் எண்ணிக்கையை விட memory bandwidth-ஆலேயே கட்டுப்படுத்தப்படுகிறது. ஏற்கனவே போதுமான vCPU-கள் உள்ள ஒரு திட்டத்தில், கூடுதல் vCPU-களைச் சேர்ப்பதால் பெரிய முன்னேற்றம் இருக்காது. உங்களுக்குத் தேவையானது, weights மற்றும் KV cache-ஐத் தக்கவைக்கப் போதுமான RAM மற்றும் அந்தத் திட்டத்தில் கிடைக்கும் அதிவேக memory மட்டுமே.
ஒரு agent-ஐ அதில் அமர்த்தும் முன், local LLM-க்கான tokens per second-ஐ அளவிடுதல் என்ற முறையில் அதன் வேகத்தை அளவிடவும்:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."முடிவில் காட்டப்படும் eval rate வரிதான் உங்கள் generation வேகம் (tokens per second). இந்த ஒரே எண் உங்கள் முடிவைத் தீர்மானிக்கும், ஏனெனில் ஒரு agent-ன் ஒட்டுமொத்த செயல்பாட்டு நேரம் இதையே சார்ந்துள்ளது.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]இவை மூன்றாம் தரப்பு வெளியீட்டுத் தரவுகள். இவை Artificial Analysis நிறுவனம் வெளியீட்டின் போது குறிப்பிட்ட per-task நிமிடங்களிலிருந்து மாற்றப்பட்டவை. இவை VPS-ல் அல்லாமல், hosted GPU endpoints-ல் அளவிடப்பட்டவை. Nemotron 3.5 Lightning ஒரு task-க்கு சராசரியாக 30 வினாடிகளை எடுத்துக்கொண்டது. இதில் gpt-oss-120b சுமார் 204 வினாடிகளையும், Qwen3.6 35B சுமார் 210 வினாடிகளையும் எடுத்துக்கொண்டன. இவற்றை உங்கள் வன்பொருளுக்கான உத்தரவாதமாக எடுத்துக்கொள்ளாமல், செயல்திறன் இடைவெளியைப் புரிந்துகொள்ளப் பயன்படுத்தவும்.
யார் காத்திருக்கிறார்கள் என்பதைப் பொறுத்தே இதற்கான சரியான ஆலோசனை அமையும். ஒரு நபர் agent-க்காகக் காத்திருக்கிறார் என்றாலோ அல்லது agent தொடர்ச்சியாகப் பல அழைப்புகளை (chains of calls) மேற்கொள்கிறது என்றாலோ, GPU வசதியுள்ள server-ஐ வாடகைக்கு எடுக்கவும். அது இரவு நேரங்களில் தானாக இயங்குகிறது மற்றும் யாரும் அதைக் கவனிக்கவில்லை என்றால், அதிக RAM கொண்ட CPU திட்டம் போதுமானது. எதுவாக இருந்தாலும், அமைப்பு முறை ஒன்றுதான். VPS-ல் Ollama-வை இயக்குதல் என்ற பகுதி, திட்டத்தின் அளவைத் தீர்மானிப்பது மற்றும் GPU instance-ஐப் பயன்படுத்துவதற்கும் API provider-க்கு token அடிப்படையில் பணம் செலுத்துவதற்கும் உள்ள வேறுபாடுகளை விளக்குகிறது. லாபகரமான பயன்பாடு என்பது பயன்பாட்டு அளவைப் பொறுத்தது: GPU instance நீங்கள் வைத்திருக்கும் ஒவ்வொரு மணிநேரத்திற்கும் கட்டணம் வசூலிக்கும், ஆனால் API tokens நீங்கள் பயன்படுத்தும் போது மட்டுமே கட்டணம் வசூலிக்கும். எனவே, நாள் முழுவதும் பிஸியாக இருக்கும் agent-க்கு சொந்த server சிறந்தது; ஒரு மணிநேரத்திற்கு இரண்டு முறை மட்டும் இயங்கும் agent-க்கு API சிறந்தது.
1M context window என்பது இலவசமானது அல்ல
1M tokens என்பது இந்த model-ன் அதிகபட்ச கொள்ளளவு ஆகும், ஆனால் Ollama இதை இயல்பாகவே உங்களுக்கு வழங்குவதில்லை. Ollama மிகச்சிறிய default window-வையே வழங்குகிறது, உரையாடல் அந்த அளவைத் தாண்டும்போது பழைய tokens-ஐ நீக்கிவிடுகிறது. இது நடக்கும்போது எந்தப் பதிவும் (log) செய்யப்படுவதில்லை, எனவே ஒரு agent-க்கு, model தனது பணியின் தொடக்கத்தை மறந்துவிட்டது போலத் தோன்றும்.
Window அளவை நீங்களே தீர்மானிக்கவும். முழு server-க்கும், service-ஐ edit செய்யவும்:
sudo systemctl edit ollamaஇதைச் சேர்த்துவிட்டு, sudo systemctl restart ollama-ஐ இயக்கவும்:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"ஒவ்வொரு request-க்கும், options object-ல் num_ctx-ஐ அனுப்பவும்:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'ஒவ்வொரு அதிகரிப்பும் memory-ஐப் பாதிக்கும், ஏனெனில் நீங்கள் அனுமதிக்கும் tokens-ன் எண்ணிக்கைக்கு ஏற்ப KV cache வளரும். மதிப்பை உயர்த்தி, restart செய்து, மீண்டும் ollama ps-ஐ இயக்கி, காட்டப்படும் அளவைக் கவனிக்கவும். அந்த மாற்றத்திற்குப் பிறகு PROCESSOR column 100% GPU என்பதிலிருந்து split என மாறினால், KV cache model layers-ஐ VRAM-லிருந்து வெளியேற்றிவிட்டது என்று அர்த்தம், இதனால் வேகம் கடுமையாகக் குறையும். Ollama-வில் num_ctx-ஐத் தேர்ந்தெடுத்தல் இந்தச் சமநிலையை விரிவாக விளக்குகிறது. model card அனுமதிக்கிறது என்பதற்காக 1000000 என அமைக்க வேண்டாம், ஏனெனில் இதற்கான ஒதுக்கீடு (allocation) தொடக்கத்திலேயே நடக்கும், அவ்வாறு போதிய memory இல்லையெனில் load தோல்வியடையும்.
எப்போதும் இயங்கும் agent-உடன் இணைத்தல்
இந்த model-க்கான Ollama-வின் வெளியீட்டுப் பதிவு, ஏற்கனவே இதனுடன் இணைக்கப்பட்ட ஒரு ஆதரவு பெற்ற agent-ஐத் தொடங்கும் குறுக்குவழியை விளக்குகிறது:
ollama launch claude --model nemotron-3.5-lightningஅந்த இடத்தில் claude, opencode, openclaw மற்றும் hermes ஆகியவற்றை அந்தப் பதிவு குறிப்பிடுகிறது. இந்த subcommand-க்கு தற்போதைய Ollama பதிப்பு தேவை, எனவே முதலில் ollama --version-ஐச் சரிபார்க்கவும். அது இல்லையென்றால், agent-ஐ நீங்களே API-உடன் இணைக்கவும். Ollama ஒரு OpenAI-இணக்கமான endpoint-ஐ வழங்குகிறது, இதை பெரும்பாலான agent harnesses ஏற்றுக்கொள்கின்றன:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama இந்த key-ஐப் புறக்கணிக்கும், ஆனால் பெரும்பாலான client-கள் ஒரு key அமைக்கப்படாவிட்டால் தொடங்க மறுக்கும். இதற்கான harness அமைப்பு Ollama-வுடன் coding agent-ஐ இணைத்தல் மற்றும் சொந்தமாக OpenClaw agent-ஐ உருவாக்குதல் ஆகியவற்றில் விளக்கப்பட்டுள்ளது.
Agent கவனிக்கப்படாமல் இயங்கும்போது இரண்டு server அமைப்புகள் முக்கியமானவை. OLLAMA_KEEP_ALIVE என்பது கடைசி கோரிக்கைக்குப் பிறகு ஒரு model எவ்வளவு நேரம் memory-ல் இருக்க வேண்டும் என்பதைக் கட்டுப்படுத்துகிறது. இயல்பாக, ஐந்து நிமிடங்களுக்குப் பிறகு அது நீக்கப்படும், எனவே அடுத்த அழைப்பின்போது மீண்டும் முழுமையாக ஏற்றும் நேரம் எடுக்கும். GPU இல்லாத நிலையில் 25 GB கோப்பிற்கு அந்த இடைவெளி timeout-ஐத் தூண்டும் அளவுக்கு நீண்டதாக இருக்கும். அதைத் தொடர்ந்து memory-ல் வைத்திருக்க OLLAMA_KEEP_ALIVE=-1-ஐ அமைக்கவும். OLLAMA_HOST=0.0.0.0:11434 மற்ற கணினிகளிலிருந்து API-ஐ அணுக வழிவகை செய்கிறது. இதில் எந்தவிதமான authentication-உம் இல்லை என்பதால், firewall விதி அல்லது private network-க்கு பின்னால் மட்டுமே இதைத் திறக்கவும்.
தோல்வி நிலைகள் மற்றும் நீங்கள் காணும் செய்திகள்
Pull செயல்பாடு உடனடியாகத் தோல்வியடைகிறது. Error: pull model manifest: file does not exist என்பது அந்த tag இல்லை என்பதைக் குறிக்கிறது. Tag பெயர்கள் துல்லியமானவை, எனவே நீங்களாக ஒரு quantisation suffix-ஐ ஊகிப்பதற்குப் பதிலாக, library பக்கத்திலிருந்து அதை நகலெடுக்கவும்.
Model ஏற்றப்படவில்லை. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) என்பது, தற்போதைய configuration-ன் படி இந்த tag-ன் அளவு இந்தத் திட்டத்திற்கு (plan) மிக அதிகம் என்பதைக் குறிக்கிறது. சிறிய quantisation-க்கு மாறவும் அல்லது OLLAMA_CONTEXT_LENGTH-ஐக் குறைக்கவும், ஏனெனில் KV cache-ம் அந்தத் தேவையின் ஒரு பகுதியாகவே கணக்கிடப்படுகிறது.
Port 11434-ல் எந்தப் பதிலும் இல்லை. curl: (7) Failed to connect to localhost port 11434 என்பது service இயங்கவில்லை அல்லது நீங்கள் எதிர்பார்க்கும் இடத்தில் அது listen செய்யவில்லை என்பதைக் குறிக்கிறது. systemctl status ollama மற்றும் journalctl -u ollama -n 50-ஐப் படிக்கவும். நீங்கள் ollama serve-ஐ கைமுறையாகத் தொடங்கியிருந்தால், இரண்டாவது நகல் Error: listen tcp 127.0.0.1:11434: bind: address already in use பிழையுடன் வெளியேறும்.
பதில் கிடைக்கிறது, ஆனால் மிக மெதுவாக உள்ளது. எதையும் மாற்றுவதற்கு முன் ollama ps-ஐச் சரிபார்க்கவும். GPU உள்ள machine-ல் PROCESSOR நிரலில் CPU share தெரிந்தால், model-ன் ஒரு பகுதி VRAM-லிருந்து வெளியேறியுள்ளது என்று அர்த்தம். எனவே context-ஐக் குறைக்கவும் அல்லது சிறிய quantisation-ஐப் பயன்படுத்தவும். GPU இல்லாத machine-ல், வேகம் குறைவாக இருப்பது இயல்பானது, எந்த அமைப்பாலும் இதைச் சரிசெய்ய முடியாது.
Agent ஒரு பணியின் பாதியில் தனது அறிவுறுத்தல்களை மறந்துவிடுகிறது. உரையாடல் context window-ஐத் தாண்டிவிட்டதால், பழைய tokens தானாகவே நீக்கப்பட்டுவிட்டன. OLLAMA_CONTEXT_LENGTH-ஐ அதிகரிக்கவும், model இன்னும் பொருத்தமாக உள்ளதா என்பதை ollama ps மூலம் உறுதிப்படுத்தவும். அது பொருந்தவில்லை என்றால், window-ஐச் சுருக்குவதற்குப் பதிலாக, அதிக திறன் கொண்ட machine-க்கு மாறுவதே சரியான தீர்வாகும்.
மாற்றுத் தேர்வுகளுடன் ஒப்பிடும்போது இந்த மாதிரியின் நிலை
30B MoE என்பது ஒரு சிறிய பணிக்கு ஹோஸ்ட் செய்வதற்கு மிகப்பெரிய அளவிலான ஒன்றாகும். ஒரு அடர்த்தியான (dense) 8B மாதிரி உங்கள் பணியைச் சிறப்பாகச் செய்யுமானால், அதை இயக்குவதற்கு மிகக் குறைந்த செலவே ஆகும் மற்றும் அது சில நொடிகளில் லோட் ஆகிவிடும். அந்த முடிவை எடுப்பதற்கு Qwen 3 at 8B and 27B on a VPS நேரடி ஒப்பீடாக அமையும். ஒரு குறிப்பிட்ட திட்டத்தில் எதை ஹோஸ்ட் செய்ய முடியும் என்பது குறித்த விரிவான ஆய்வுக்கு, which AI models you can self-host என்பதிலிருந்து தொடங்கவும். நீங்கள் ஒரே நேரத்தில் பல ஏஜெண்டுகளை இயக்கத் திட்டமிட்டிருந்தால், முதலில் Ollama compared with vLLM என்பதைப் படிக்கவும். ஏனெனில், ஒரு production inference server செய்வது போல Ollama ஒரே நேரத்தில் வரும் கோரிக்கைகளை (concurrent requests) batch செய்வதில்லை; அங்கேதான் ஒரு பயனர் மட்டுமே பயன்படுத்தும் அமைப்பு அதன் அளவீட்டு எல்லையை (scaling) அடைகிறது.
FAQ
Linux VPS-ல் நான் எந்த Nemotron 3.5 Lightning tag-ஐ pull செய்ய வேண்டும்?
nemotron-3.5-lightning:30b-a3b-q4_K_M-ஐப் பயன்படுத்தவும். இது 25 GB அளவு கொண்டது, இது முழுமையான 1M அதிகபட்ச context-ஐக் கொண்டுள்ளது, மேலும் ஆகஸ்ட் 2026 நிலவரப்படி latest, 30b மற்றும் 30b-a3b ஆகிய tags எதைக் குறிக்கின்றனவோ அதே digest-ஐ இதுவும் குறிக்கிறது. latest-ஐ pull செய்வதற்குப் பதிலாக, அதன் பெயரைத் தெளிவாகக் குறிப்பிடவும்; அப்போதுதான் அந்த pointer எதிர்காலத்தில் மீண்டும் வெளியிடப்படும்போது, உங்கள் கவனத்திற்கு வராமல் உங்கள் agent-ன் செயல்பாடு மாறாது. mlx tags என்பவை Apple silicon-க்கான builds, இவை Linux-ல் உங்களுக்கு உதவாது.
Nemotron 3.5 Lightning-க்கு எவ்வளவு RAM தேவை?
Ollama builds-க்குத் தேவையான குறைந்தபட்ச நினைவக அளவை NVIDIA வெளியிடுவதில்லை, எனவே மதிப்பீடு செய்வதற்குப் பதிலாக அளந்து பாருங்கள். அந்த tag-ஐ pull செய்து, model-ஐ ஒருமுறை இயக்கி, அது loaded நிலையில் இருக்கும்போது ollama ps-ஐப் படிக்கவும்: இது உண்மையில் ஆக்கிரமிக்கப்பட்டுள்ள அளவையும், அது GPU-ல் உள்ளதா அல்லது CPU-ல் உள்ளதா என்பதையும் காட்டும். பதிவிறக்க அளவு, அதாவது default tag-க்கு 25 GB, என்பது ஒரு அடிப்படை அளவு மட்டுமே; ஏனெனில் KV cache அதன் மேல் சேர்க்கப்பட்டு, நீங்கள் அமைக்கும் context window-க்கு ஏற்ப வளரும். உங்கள் திட்டம் மிகச் சிறியதாக இருந்தால், Ollama model requires more system memory பிழையைக் காட்டி இரண்டு எண்களையும் குறிப்பிடும்.
GPU இல்லாத VPS-ல் என்னால் Nemotron 3.5 Lightning-ஐ இயக்க முடியுமா?
ஆம், உங்கள் திட்டத்தில் weights-ஐச் சேமிக்கப் போதுமான RAM இருந்தால் இயக்கலாம். MoE வடிவமைப்பு இதற்கு உதவுகிறது, ஏனெனில் 30 பில்லியன் parameters-ல் ஒரு token-க்கு சுமார் 3 மட்டுமே கணக்கிடப்படுகின்றன. வேகம் தான் இதில் உள்ள சிக்கல். GPU இல்லையென்றால், model-ன் வேகம் memory bandwidth-ஆல் கட்டுப்படுத்தப்படும், எனவே vCPU-களை அதிகரிப்பதால் முடிவுகளில் பெரிய மாற்றம் இருக்காது. ollama run --verbose-ஐ ஒரு நிலையான prompt-உடன் இயக்கி, eval rate வரியைப் படித்து, உங்கள் agent-ன் காலக்கெடுவுக்கு ஏற்ப அந்த எண்ணை மதிப்பிடவும். இரவு நேரத்தில் நடக்கும் batch job-களுக்கு இது பெரும்பாலும் போதுமானது. ஒரு பயனர் காத்திருக்கும் எந்தவொரு செயலுக்கும் இது பொதுவாகப் போதாது.
Ollama ஏன் எனக்கு முழுமையான 1M context window-ஐத் தருவதில்லை?
1M என்பது model-ன் அதிகபட்ச அளவு, Ollama-வின் default அளவு அல்ல. Ollama மிகச் சிறிய window-ஐயே பயன்படுத்துகிறது; உரையாடல் அந்த அளவைத் தாண்டியவுடன் பழைய tokens-ஐ நீக்கிவிடும். இதற்கு எந்தப் பிழையும் காட்டப்படாது, இதனால் agent தனது சொந்த அறிவுறுத்தல்களை மறந்துவிட்டதாகத் தோன்றும். systemd service-ல் OLLAMA_CONTEXT_LENGTH-ஐ அமைக்கவும் அல்லது ஒவ்வொரு கோரிக்கைக்கும் num_ctx-ஐ அனுப்பவும். படிப்படியாக இதை உயர்த்தி ஒவ்வொரு முறையும் ollama ps-ஐச் சரிபார்க்கவும், ஏனெனில் KV cache நினைவகம் window-க்கு ஏற்ப அதிகரித்து, model layers-ஐ GPU-விலிருந்து வெளியேற்றக்கூடும்.
Nemotron 3.5 Lightning-ஐ வணிக ரீதியாகப் பயன்படுத்துவது இலவசமா?
NVIDIA-வின் model card, இந்த model-ஐ OpenMDW-1.1 உரிமத்தின் கீழ் வகைப்படுத்துகிறது மற்றும் இது வணிக பயன்பாட்டிற்குத் தயார் என்று குறிப்பிடுகிறது. இது நீங்கள் பதிவிறக்கம் செய்து இயக்கும் weights-க்கு மட்டுமே பொருந்தும். உங்கள் stack-ல் உள்ள பிற மென்பொருள்களைப் பற்றி இது எதையும் கூறவில்லை, எனவே agent harness மற்றும் நீங்கள் இணைக்கும் பிற கருவிகளின் உரிமங்களைச் தனித்தனியாகச் சரிபார்க்கவும். ஒப்பந்தம் சார்ந்த எதற்கும் இதைப் பயன்படுத்துவதற்கு முன்பு தற்போதைய model card-ஐப் படிக்கவும்.